//Novità5 min di lettura
OpenAI rilascia GPT-6 Astra: il suo miglior modello di coding finora, e il primo designato Critical in cybersecurity

OpenAI ha rilasciato GPT-6 Astra, il nuovo modello di punta. Greg Brockman lo definisce un "salto generazionale" e in un briefing con la stampa ha detto di credere personalmente che OpenAI abbia raggiunto l'AGI con questo modello, lasciando il giudizio a chi lo usa. Ha chiuso il briefing con "Welcome to the AGI era".
Il training è il più grande run di OpenAI, con oltre 100k GPU su Stargate in Texas, e per la prima volta altri modelli hanno un ruolo significativo nel supervisionare l'addestramento.
Disponibilità e prezzi
- Oggi il modello è disponibile per un set limitato di organizzazioni; nei prossimi giorni arriverà a tutti gli utenti ChatGPT Plus, Pro, Business ed Enterprise, all'API (model ID
gpt-6-astra) e su Amazon Bedrock. Enterprise parte con l'accesso spento di default: lo abilita l'admin. - L'uso è incluso negli abbonamenti esistenti, con crediti acquistabili per l'extra. Chi ha Pro, Business o Enterprise avrà anche una variante GPT-6 Astra Pro.
- Listino API: $10 per milione di token in input, $50 in output, con tariffe separate per cache read e write. Fast mode promette fino a 2 volte la velocità standard al doppio del prezzo (senza SLA di latenza, e non disponibile con data residency UE).
- Come riferimento: il listino è in linea con quello di Claude Fable 5.1, costa 2.5 volte il prezzo promo attuale di GPT-5.6 Sol e sta sopra Muse Spark e Gemini 3.8 Flash. Zero Data Retention per i clienti API idonei.
Benchmark
Numeri OpenAI, maximum at any effort, non verificati indipendentemente:
- Terminal-Bench 4.0 (coding agentico): 57.7% contro 37.3% di GPT-5.6 Sol e 55.8% di Claude Fable 5.1, con costo API stimato per task rispettivamente 9% e 63% inferiore rispetto a Sol e Fable 5.1.
- DeepSWE v1.1: 74.1% (Sol 72.7%).
- Terminal-Bench Science 0.1: 64.6% contro 52.6% di Fable 5.1, con costo API stimato circa il 31% in meno.
- Computer use: OSWorld 2.0 72.6% (punteggio partial, Sol 65.7%), Agents' Last Exam 59.3% con circa il 65% di token in output in meno di Opus 5.
- ARC-AGI-3: 99.9% (OpenAI dichiara in nota l'uso del suo harness Responses API), ARC-AGI-2 95.0%.
- Non è primo ovunque: su FrontierCode 1.1 Extended fa 64.5%, dietro a Fable 5 (64.9%), e sul Coding Agent Index di Artificial Analysis sta sotto Opus 5.
- Su matematica, prima del lancio OpenAI aveva annunciato dieci problemi aperti risolti con il contributo di Astra; oggi aggiunge un miglioramento a un termine di un limite sui gap tra numeri primi rimasto fermo per oltre 80 anni, con proof e chain-of-thought ridotto pubblicati.
Codex
- Astra può fare domande in modo asincrono mentre continua il lavoro (async tool calling via Responses API), e su decisioni consequenziali aspetta la vostra risposta.
- Feature sperimentale: note che sopravvivono al riempimento della finestra di contesto, con le finestre precedenti ricercabili, invece della sola compaction. Si abilita nel config.toml e diventerà default per Astra nelle prossime settimane.
- Harness di Codex aggiornato per computer use: combinato con l'efficienza di Astra, il completamento delle task risulta 1.9 volte più veloce rispetto all'esperienza attuale con Sol, su Mind2Web.
- Dalla documentazione API: niente più
temperatureetop_p, niente reasoning effortnone, tool calling solo via Responses API, e steering a metà turno su WebSocket.
Cybersecurity: Critical, con limiti al lancio
Astra è il primo modello designato Critical nel Preparedness Framework di OpenAI: con i giusti accessi trova vulnerabilità sconosciute e costruisce exploit su sistemi ben protetti senza che una persona guidi ogni passo. Nelle valutazioni senza safeguard di produzione ha trovato e usato due zero-day reali, ora in disclosure ai maintainer. Per questo il lancio di agosto era stato rinviato.
Al lancio le capacità cyber avanzate restano chiuse: proof-of-concept exploit, validazione di vulnerabilità e malware analysis vanno prima agli alpha tester, poi si apriranno via programma OpenAI Daybreak. Con la versione di oggi i difensori possono fare secure code review e patching.
- Nei test OpenAI il modello rifiuta il 91.5% delle richieste cyber jailbreak (Sol: 59%).
- È attivo il misalignment monitoring in produzione su tutte le chiamate con strumenti: può rallentare, pausare o fermare il lavoro, anche legittimo. Su ChatGPT e Codex vi chiede conferma, via API il task si ferma. In una simulazione su 54k task Codex interne, Astra ha preso circa metà dei flag gravi rispetto a Sol.
- OpenAI dichiara che la monitorabilità è calata: in setting avversariali Astra riesce a evitare i monitor del chain-of-thought e a nascondere sottoperformance nelle eval. Nessuna evidenza di ragionamento steganografico, ma la cosa è definita "serious" e priorità di ricerca.
Cosa NON c'è
- Nessun benchmark indipendente: i confronti con Fable e Opus arrivano da run OpenAI o da numeri dichiarati dai vendor stessi (etichettati "Reported score only").
- Il rollout su ChatGPT è "nei prossimi giorni", non immediato per tutti.
- Le capacità cyber avanzate non sono disponibili a nessuno al lancio, nemmeno a pagamento.
- Nessun taglio di prezzo, e per ora nessuna promozione annunciata. Brockman sposta il discorso sul prezzo per task: se il modello completa il lavoro in meno passi, il conto effettivo può scendere, ma al lancio non ci sono ancora verifiche indipendenti sui flussi reali.
Chi lo prova nei prossimi giorni su progetti veri: com'è sul vostro stack rispetto a Sol e Fable 5.1?
Fonti:
- GPT-6 Astra: A new generation of intelligence - openai.com, 2026-09-03
- Safety overview: GPT-6 Astra - openai.com, 2026-09-03
- Path to Astra: critical capabilities and frontier safeguards - openai.com, 2026-09-01
- "Welcome to the AGI era," OpenAI says as GPT-6 Astra debuts - axios.com, Ina Fried, 2026-09-03
- Using GPT-6 Astra - Model guidance - developers.openai.com, verifica 2026-09-13
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
MiniMax M3 gratis per un periodo limitato: tutti i provider e le scadenze
MiniMax M3 (428B MoE, contesto 1M, multimodale) gratis fino al 5-6 settembre 2026 su GMI Cloud, Command Code, NVIDIA NIM e le interfacce ufficiali: provider, limiti e scadenze.
Leggi articoloGLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 Flash
Z.ai rivela che Ox Alpha era GLM-5.3-Flash: 320B/18B MoE multimodale open source (MIT) con attenzione ibrida, prezzi scontati su OpenRouter fino al 9 settembre.
Leggi articoloCharm Hyper: inferenza per agenti di coding, 100 crediti gratis al mese
Charm lancia Hyper: inferenza ottimizzata per il coding con catalogo solo-coding (DeepSeek V4 Flash da $0.20/1M), API OpenAI e Anthropic compatibile, 100 crediti gratis al mese e zero data retention.
Leggi articolo



