DeepSeek ha aggiornato V4 Flash in silenzio, e i numeri sono assurdi

Nessun blog post, nessun annuncio su X, nessun countdown. Ieri DeepSeek ha aggiornato V4 Flash e l'unico segnale è una riga nel changelog della loro API: "DeepSeek-V4-Flash Update". La parte interessante? Stessa architettura, stessa dimensione del modello. Hanno solo rifatto il post-training.
Cosa è cambiato in pratica
- Il modello si chiama sempre
deepseek-v4-flash, nessuna modifica al modo in cui lo chiamate via API - Supporta nativamente il formato Responses API ed è adattato specificamente per Codex
- I benchmark agent superano quelli di V4-Pro-Preview, che fino a ieri era il modello di punta
I numeri (preview → 0731)
| Benchmark | Preview | 0731 | Delta |
|:-|:-|:-|:-|
| Terminal Bench 2.1 | 56.9 | 82.7 | +25.8 |
| Toolathlon verified | 51.8 | 70.3 | +18.5 |
| DeepSWE | - | 54.4 | - |
| NL2Repo | - | 54.2 | - |
| Cybergym | - | 76.7 | - |
| Agent Last Exam | - | 25.2 | - |
Per contesto, su Terminal Bench 2.1 Flash fa 82.7 contro il 78.4 di GPT-5.6 Terra. Su Toolathlon siamo a 70.3 contro 53.1 di Terra. Poi Terra recupera su DeepSWE (69.6 vs 54.4) e Agent Last Exam (50.4 vs 25.2), quindi non c'è un vincitore netto. Ma un modello che fino a ieri era la versione "economica" che scambia colpi con Terra è una notizia.
Perché "stealth"
DeepSeek ha sempre comunicato in modo minimale. Anche stavolta nel changelog scrivono "significantly enhanced agent capabilities" e basta. Su HN un utente ha commentato: "They're always very understated in their update descriptions. This is actually a HUGE improvement." E ha ragione. Il dettaglio tecnico più interessante è che non hanno toccato architettura o dimensione. DeepSeek-V4-Flash-284B-A13B resta un MoE con 284B di parametri totali e 13B attivi. Hanno solo rifatto il post-training, probabilmente usando dati raccolti da sviluppatori reali tramite le integrazioni con OpenRouter e altri provider.
Cosa manca ancora
- I benchmark sono stati fatti con il loro harness proprietario (DeepSeek Harness minimal mode), non ancora rilasciato. Quindi il confronto non è perfettamente apples-to-apples con altri modelli testati con harness diversi
- DSBench-FullStack e DSBench-Hard sono test set interni, non pubblici
- I pesi della versione 0731 non sono ancora disponibili: per ora è solo API. Chi lo gira in locale ha ancora la versione preview
- V4-Pro resta invariato. Dicono che la versione ufficiale "will follow soon"
Angolo locale
Per chi lo fa girare in proprio, il modello è un 284B-A13B. Su HN c'è chi riporta ~60 token/s su 2 DGX Spark (~8k EUR totali), e chi lo usa quantizzato su MacBook Pro M5 Max 128 GB. Appena escono i pesi della 0731, chi ha già l'hardware si ritrova un upgrade gratuito senza cambiare setup.
Fonti
- DeepSeek API Change Log - DeepSeek, 2026-07-31
- Discussione HN: DeepSeek-V4-Flash Update - 259 punti, 107 commenti, 2026-07-31
- GPT-5.6 Terra benchmark - OpenAI, per confronto Terminal Bench e Toolathlon
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
DeepSeek Chat attiva la Vision Mode: ora puoi caricare immagini (beta)
DeepSeek Vision arriva in beta su Chat: upload immagini, OCR e Q&A visivo. Disponibile su web e app, mentre il supporto API non è ancora documentato.
Leggi articolo

