//Novità4 min di lettura
DeepSeek V4.1 Flash: pesi open MIT, architettura nuova multimodale, e il Pro viene servito a prezzo Flash

Dopo la beta lampo di due giorni dell'8 settembre, DeepSeek ha rilasciato il 10 settembre V4.1 Flash, il primo modello della sua nuova famiglia di architettura. Era un'attesa breve ma intensa: l'avviso della beta non era mai passato dai canali ufficiali, era circolato dai gruppi community ad Hacker News e alla stampa tech cinese, con il model ID che annunciava da solo la scadenza (deepseek-v4.1-flash-expires-on-0910).
Pesi open, subito
Il modello è open weight con licenza MIT su Hugging Face come deepseek-ai/DeepSeek-V4.1-Flash, con technical report completo: niente attesa, niente annuncio "i pesi tra due settimane". In pochi giorni la community ha già prodotto quantizzazioni GGUF, MLX e FP8 (compresa una convertita da antirez), e il modello è arrivato sopra le 240k di download.
L'architettura: tutto ruota attorno alla KV cache
Il titolo del technical report lo dice: "Pushing the Limits of KV Cache Compression". Numeri chiave:
- MoE da 552B di parametri backbone, 8B attivati in prefill e 16B in decode, contesto fino a 1M di token.
- Architettura Causal Encoder-Decoder: la KV cache del decoder viene proiettata dagli hidden state finali dell'encoder invece che dai layer del decoder, e questo comprime drasticamente la cache.
- Attenzione sparsa CSA2 più KV cache in FP4: la footprint scende a 890 byte per token, circa 1/4 di V4 Flash e 437 volte meno di V1.
- Multimodale nativo: vision encoder DeepSeekViT addestrato da zero, immagini e testo insieme fin dal pre-training su 45T token.
Per chi fa vibe coding agentico (input lungo, contesto che cresce a ogni step) è la metrica che conta: meno cache da tenere in vita significa costi più bassi e throughput più alto.
Benchmark (numeri DeepSeek dal model card)
A sforzo di ragionamento massimo:
- DeepSWE v1.1: 74.2%, sopra Opus 5 (74.0) e GPT-5.6 Sol (73.0).
- Terminal-Bench 2.1: 90.6%, primo della comparazione.
- Codeforces rating 3471, il più alto della tabella.
- AutomationBench 54.8% e Agent's Last Exam 31.8%, entrambi primi.
- Su Terminal-Bench 4.0 ferma a 31.2% contro 51.8 di Opus 5: le task più lunghe restano territorio dei modelli grandi.
- HLE: 36.8 (39.1 text-only), in linea con i flash della generazione precedente.
Prezzi
Sull'API il modello si chiama deepseek-flash (i vecchi deepseek-v4-flash e deepseek-v4-flash-vision-exp sono ritirati e instradati sul nuovo). Off-peak:
| | prima (V4 Flash) | dal 10/09 | variazione |
|---|---|---|---|
| Input cache hit | $0.007/M | $0.003/M | -57% |
| Input cache miss | $0.22/M | $0.15/M | -32% |
| Output | $0.66/M | $0.60/M | -9% |
I prezzi di punta restano il doppio (fascia 01-04 e 06-10 UTC, lun-ven). Su OpenCode Go ($10/mese) V4.1 Flash è già nel catalogo con limite mensile di $15 e prezzi speculari al listino DeepSeek.
E per V4 Pro? L'avviso della beta diceva che dal 10 settembre tutte le richieste a deepseek-v4-pro sarebbero state instradate su V4.1 Flash a prezzo Flash. Poi il giro di vita è cambiato: "in risposta alla domanda degli utenti", DeepSeek ha deciso di continuare il servizio API di V4 Pro anche dopo il 14 settembre, billing invariato. Il routing resta documentato, ma per ora il modello vecchio non è stato spento.
Cosa NON c'è
- Nessun confronto diretto dichiarato con GPT-6 Astra o Claude Fable 5.1 nel model card: le tabelle comparano Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e i modelli DeepSeek precedenti.
- L'instradamento Pro→Flash a prezzo Flash è documentato ma rimangono da chiarire i dettagli operativi per chi ha workflow validati su Pro: DeepSeek ha annunciato che ci sarà comunicazione in caso di cambiamenti.
- I benchmark sono numeri del vendor, con harness di valutazione propri (DeepSeek Harness in modalità Minimal, mini-SWE e Claude Code dove richiesto dagli official setup): nessuna verifica indipendente al momento della scrittura.
Chi l'ha già provato su workflow agentici reali: che differita sentite rispetto a V4 Flash 0731, e quanto pesa il reasoning effort controllabile da 1 a 100 sui vostri costi?
Fonti:
- DeepSeek-V4.1-Flash su Hugging Face - model card e technical report, licenza MIT, 2026-09-10
- Change Log - api-docs.deepseek.com, 2026-09-10
- Models & Pricing - api-docs.deepseek.com, verifica 2026-09-13
- OpenCode Go - opencode.ai, verifica 2026-09-13
- DeepSeek launching v4.1 flash cheaper and more capable than v4 pro - news.ycombinator.com, 2026-09-09
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
DeepSeek ha rilasciato il suo harness open source: tutto è un plugin
DeepSeek Harness è il nuovo harness open source di DeepSeek per coding agent: architettura a plugin su Cordis, licenza MIT, modelli e tool intercambiabili.
Leggi articoloGLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 Flash
Z.ai rivela che Ox Alpha era GLM-5.3-Flash: 320B/18B MoE multimodale open source (MIT) con attenzione ibrida, prezzi scontati su OpenRouter fino al 9 settembre.
Leggi articoloCharm Hyper: inferenza per agenti di coding, 100 crediti gratis al mese
Charm lancia Hyper: inferenza ottimizzata per il coding con catalogo solo-coding (DeepSeek V4 Flash da $0.20/1M), API OpenAI e Anthropic compatibile, 100 crediti gratis al mese e zero data retention.
Leggi articolo



