GLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 Flash

Z.ai ha rilasciato ufficialmente GLM-5.3-Flash: se negli ultimi giorni avete provato stealth/ox-alpha su OpenRouter o OpenCode, avete già usato questo modello. Il blog ufficiale conferma infatti che Ox Alpha era una preview anonima di GLM-5.3-Flash, servita su chip cinesi per raccogliere feedback prima del lancio.
È il primo modello nativamente multimodale della serie GLM-5 (testo, immagini e video in ingresso) e i pesi sono open source su Hugging Face con licenza MIT.
L'architettura
- 320B parametri totali, 18B attivi (i predecessori GLM-4.5 fermi a 355B/32B)
- 45 layer invece di 92, quasi dimezzati
- Hybrid attention: linear attention per il contesto locale e sparse attention con IndexPool per quello globale. L'IndexPool comprime 4 vettori indexer in uno, riducendo latenza e memoria nei contesti da 1M di token
- Manifold-Constrained Hyper-Connections (mHC) per l'efficienza di scaling
- 30T token di pre-training multimodale
L'efficienza
Rispetto a GLM-5.3, il modello completo da 743B/40B, Flash riduce il costo computazionale dell'attenzione di 3x e la KV cache di 4.4x. Secondo il blog ha il costo di attenzione più basso tra i modelli confrontati, DeepSeek-V4-Flash e Kimi K3 inclusi.
I benchmark (vendor-run)
Pubblicati da Z.ai con harness documentate, non ancora replicati da terzi:
- DeepSWE v1.1: 63.4 contro 46.2 di GLM-5.2 (+37%)
- AutomationBench v1.0.6: 48.8 contro 26.2 di GLM-5.2 (+86%)
- Z.ai Code Bench v1.0 (max effort): 29.0, vicino a Opus 4.8 (29.5)
- Artificial Analysis Intelligence Index v4.1.1: 57, a $0.045/task (scontato)
Il confronto con DeepSeek V4 Flash Vision Exp
DeepSeek ha rilasciato il 21 agosto 2026 V4 Flash Vision Exp, la variante multimodale di V4 Flash (testo e immagini). Sono entrambi modelli multimodali, quindi il confronto è diretto.
- Parametri: 320B/18B attivi contro 284B/13B attivi
- Input: entrambi testo e immagini; solo GLM-5.3-Flash aggiunge il video
- Prezzo su OpenRouter: $0.075/M input e $0.25/M output (scontato) contro $0.22/M e $0.66/M
- Cache read: $0.015/M contro $0.007/M
- Throughput: 33 tok/s contro 84 tok/s, con latenza P50 di 4.89s contro 1.23s
- Agentic: V4 Flash Vision Exp dichiara un tool call error rate dell'1.44% e un cache hit rate del 91.44%; per GLM-5.3-Flash questi dati non sono stati pubblicati
In sintesi: vince GLM-5.3-Flash sul prezzo (scontato) e sul video; vince V4 Flash Vision Exp su velocità, latenza e trasparenza dei dati agentic.
Cosa non è in questo lancio
- I benchmark sono vendor-run e non ancora replicati indipendentemente
- I pesi sono disponibili ma manca una documentazione completa per l'inferenza locale (quantizzazione, VRAM richiesta)
- La finestra dichiarata è 1M di token, ma i benchmark usano da 164K a 512K a seconda del task
- Manca ancora un confronto diretto su Terminal-Bench 2.1 o SWE-bench Verified con DeepSeek V4 Flash nella stessa harness
- Il prezzo scontato dura fino al 9 settembre 2026: dopo torna a $0.15/M input e $0.50/M output
Dove trovarlo
- Blog ufficiale di Z.ai
- Pesi su Hugging Face (zai-org/GLM-5.3-Flash, licenza MIT)
- Z.ai Coding Plan per l'accesso via API
- Pagina OpenRouter con i prezzi attuali
Se avete provato Ox Alpha in questi giorni, sapete già cosa sa fare. Se non l'avete fatto, ora ha un nome, un prezzo e i pesi per girarlo in locale.
Voi che ne pensate: GLM-5.3-Flash può fare concorrenza a DeepSeek V4 Flash Vision Exp sul fronte del coding a basso costo? E il multimodale nativo fa la differenza nel vostro workflow?
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
Charm Hyper: inferenza per agenti di coding, 100 crediti gratis al mese
Charm lancia Hyper: inferenza ottimizzata per il coding con catalogo solo-coding (DeepSeek V4 Flash da $0.20/1M), API OpenAI e Anthropic compatibile, 100 crediti gratis al mese e zero data retention.
Leggi articoloDeepSeek ha rilasciato il suo harness open source: tutto è un plugin
DeepSeek Harness è il nuovo harness open source di DeepSeek per coding agent: architettura a plugin su Cordis, licenza MIT, modelli e tool intercambiabili.
Leggi articoloGLM-5.3: stesso base di 5.2, post-training su coding e cybersecurity
GLM-5.3 di Z.ai: stesso base 743B del 5.2, post-training su coding agentico e cybersecurity. Benchmark del lancio, quota a punti e pesi in arrivo.
Leggi articolo



