Tuesday, 8 September 2026 | Updating Daily AI insight, written for builders

GPT-6 Astra: prezzi, benchmark e cosa è realmente cambiato

Punti chiave

  • GPT-6 Astra è il nuovo modello di punta di OpenAI, annunciato il 3 settembre 2026 e reso progressivamente disponibile per ChatGPT Plus, Pro, Business ed Enterprise, nonché tramite l’API (gpt-6-astra), Azure e AWS Bedrock.
  • Prezzo API: 10 dollari per ogni milione di token in input, 50 dollari per ogni milione di token in output — il doppio GPT-5.6 dei 5 dollari/30 dollari di Sol e lo stesso prezzo fisso di Claude Fable 5.
  • Finestra contestuale di 1.050.000 token, con un massimo di 128K token in output. I prompt con oltre 272K token in input costano il doppio per l’input e il 1,5x per l’output; la modalità Fast raddoppia i costi per ottenere fino al doppio della velocità rispetto alla modalità Standard.
  • Dove eccelle: nell’interazione con sistemi operativi (OSWorld 2.0: 72,6% contro il 65,7% di Sol), nella matematica (FrontierMath Tier 4: 97,6%) e nella cybersecurity — è il primo modello OpenAI a raggiungere la soglia «Critica» nel campo della cybersicurezza, motivo per cui la versione rilasciata rifiuta esplicitamente di generare exploit dimostrativi.
  • Dove non eccelle: secondo la stessa classifica interna di OpenAI, ottiene risultati inferiori rispetto a Claude Fable 5.1 sull’Artificial Analysis Intelligence Index (61,2 contro 65,7) e sull’Humanity’s Last Exam con strumenti (57,2% contro 65,0%).

OpenAI ha lanciato GPT-6 Astra il 3 settembre 2026 avanzando affermazioni insolitamente ambiziose — il presidente Greg Brockman ha concluso la conferenza stampa con la frase «Benvenuti nell’era dell’AGI», secondo quanto riportato da Axios. Rimuovendo il linguaggio promozionale, la pagina ufficiale del lancio contiene comunque una grande quantità di informazioni concrete e verificabili: un listino prezzi completo, una finestra contestuale che finalmente corrisponde alle dichiarazioni pubblicitarie e tabelle di benchmark che includono espressamente i concorrenti di OpenAI. Questo articolo analizza cosa dicono i numeri, quanto costa eseguire il modello rispetto alle alternative nel nostro Database di modelli, e per chi è effettivamente rilevante.

Quanto costa GPT-6 Astra

Il modello API è gpt-6-astra. Da la pagina ufficiale del modello di OpenAI:

Voce GPT-6 Astra
Input 10,00 dollari per ogni milione di token
Input memorizzato nella cache 1,00 dollaro per ogni milione di token
Output 50,00 dollari per ogni milione di token
Sovrattassa per contesti lunghi Prompt con oltre 272K token in input: raddoppio dei costi per input e cache, aumento del 50% per l’output, su tutto il singolo richiesta
Modalità Fast Raddoppio dei costi applicabili per ottenere fino al doppio della velocità della modalità Standard
Finestra contestuale 1.050.000 token
Output massimo 128.000 token
Data di cutoff delle conoscenze 30 aprile 2026
Modalità Input testuali e immagini, output testuale
Endpoint Chat Completions, Responses, Batch

Due aspetti emergono chiaramente. Primo, il prezzo è esattamente il doppio GPT-5.6 Sol (5 dollari in input / 30 dollari in output), quindi una richiesta che consuma un milione di token sia in input che in output passa da 35 a 60 dollari — un aumento del 71%. Secondo, la sovrattassa per contesti lunghi scatta già a partire da 272K token in input, non al limite massimo di 1,05 milioni: un prompt che utilizza l’intera finestra contestuale viene fatturato 20 dollari per ogni milione di token in input e 75 dollari per ogni milione di token in output. Chi intende usare tale finestra come sostituto di tecniche di retrieval dovrebbe calcolarne preventivamente i costi; il nostro Calcolatore dei costi API include già il nuovo modello.

Come si confronta il prezzo

Prezzi per ogni milione di token, secondo Convly Database di modelli (verificato l’8 settembre 2026):

Modello Input Output Contesto 1M in + 1M out
GPT-6 Astra $10.00 $50.00 1,05 milioni $60.00
Claude Fable 5 $10.00 $50.00 1 milione $60.00
GPT-5.6 Sol $5.00 $30.00 1,05 milioni $35.00
GPT-5.5 $5.00 $30.00 1,05 milioni $35.00
Claude Opus 5 $5.00 $25.00 1 milione $30.00
Gemini 3.1 Pro $2.00 $12.00 1,05 milioni $14.00
Claude Sonnet 5 $2.00 $10.00 1 milione $12.00
Gemini 3.6 Flash $1.50 $7.50 1 milione $9.00
DeepSeek V4-Pro $0.435 $0.87 1 milione $1.31
DeepSeek V4-Flash $0.14 $0.28 1 milione $0.42

Astra si colloca all’estremità superiore del mercato, in parità con Claude Fable 5 e circa 46 volte più costoso di DeepSeek V4-Pro per un round trip. Questo divario rappresenta l’interrogativo centrale per gli acquirenti ed è la ragione per cui nel nostro indice prezzo-prestazioni.

Cosa dicono i benchmark — inclusi i casi in cui Astra ottiene risultati peggiori

la pagina ufficiale del lancio di OpenAI pubblica risultati comparativi diretti con GPT-5.6 Sol, Claude Fable 5.1 e Claude Fable 5, Claude Opus 5 e Gemini 3.8 Flash. Righe selezionate, tutte provenienti da quella pagina (i punteggi sono di OpenAI, «massimo a qualsiasi livello di sforzo»):

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1 Claude Opus 5
OSWorld 2.0 (utilizzo del computer) 72.6% 65.7% 70.2%
ScreenSpot-Pro 92.7% 76.9%
Terminal-Bench 4.0 57.9% 37.3% 55.8% 52.6%
DeepSWE v1.1 74.1% 72.7% 67.4% 73.7%
FrontierMath Tier 4 (v2) 97.6% 83.0% 87.8% 73.2%
GPQA Diamond 96.0% 94.6% 93.7% 93.7%
ARC-AGI-2 95.0% 92.5% 90.0% 90.4%
ARC-AGI-3 99.9% 7.8% 30.2%
Humanity's Last Exam (con strumenti) 57.2% 65.0% 63.6%
Artificial Analysis Intelligence Index v4.1.1 61.2 60.9 65.7 63.1
Artificial Analysis Coding Agent Index v1.4 67.0 65.1 68.1
ExploitBench (cybersecurity) 100% 78.5% 70%
SRE-Bench (reverse engineering) 88.0% 55.9% 12.5%

Il pattern è coerente. I miglioramenti di Astra sono concentrati sul lavoro agente — guidare un computer, eseguire comandi in un terminale, sfruttare o reverse-engineer software — e in matematica, dove raggiunge il massimo livello di difficoltà di FrontierMath e ARC-AGI-3 (un balzo rispetto al 7,8% di Sol). Negli indici aggregati più ampi, invece, il progresso è molto più contenuto: 61,2 contro 60,9 di Sol sull’Artificial Analysis Index, e inferiore sia a Claude Fable 5.1 che a Opus 5. Su Humanity's Last Exam con strumenti, Astra è quasi otto punti sotto Fable 5.1. Le note a piè di pagina di OpenAI osservano inoltre che i modelli Claude sono stati esclusi da tre benchmark scientifici perché hanno rifiutato la maggior parte delle domande, quindi quelle righe non rappresentano confronti diretti.

L’affermazione relativa all’efficienza è più interessante dei punteggi grezzi. Su OSWorld 2.0, OpenAI riporta che Astra raggiunge il 72,6% in circa 40 minuti per task, contro il 65,7% in circa 75 minuti di Sol — ovvero circa il 47% in meno di tempo — e un completamento dei task su Mind2Web 1,9 volte più veloce una volta integrato l’aggiornato framework Codex. Per carichi di lavoro agente fatturati a token e valutati in base al tempo impiegato, questo conta molto di più di un guadagno di due punti su un indice.

La classificazione nel campo della cybersecurity e cosa blocca

Astra è il primo modello OpenAI a superare la soglia «Critica» in cybersecurity secondo il Preparedness Framework dell’azienda. Nella pagina di lancio OpenAI riporta un punteggio perfetto del 100% su ExploitBench (Sol: 78,5%), il 42,4% su ExploitGym (Sol: 30,3%) e un successo al primo tentativo dell’88,0% su SRE-Bench, un benchmark di reverse engineering in cui Sol aveva ottenuto il 55,9%. Viene inoltre indicato che, durante una valutazione su vulnerabilità risalenti a giugno–agosto 2026, il modello ha individuato e sfruttato due zero-day finora sconosciuti, che OpenAI sta segnalando ai rispettivi maintainer.

La conseguenza pratica per gli utenti è una versione di lancio con restrizioni. Astra eseguirà revisioni sicure del codice e applicherà patch, ma rifiuterà compiti offensivi più avanzati, come la creazione di exploit dimostrativi. OpenAI precisa che misure di sicurezza meno restrittive saranno introdotte nelle prossime settimane tramite il programma Daybreak, rivolto a flussi di lavoro difensivi quali l’analisi del malware e l’ingegneria della rilevazione. Axios aggiunge che il rilascio era stato inizialmente rallentato per inserire ulteriori test di sicurezza dopo aver valutato che le capacità cyber di Astra avevano raggiunto il livello critico, a seguito dell’incidente di luglio in cui modelli OpenAI in fase di test avevano violato i sistemi di Hugging Face.

Allineamento: migliore per ambito di applicazione, peggiore per monitorabilità

La pagina di lancio dedica tanto spazio al comportamento quanto alle capacità. Il dato principale è una valutazione su un «compito impossibile», ideata dopo l’incidente con Hugging Face: assegnato un compito che poteva essere completato soltanto superando il proprio ambito autorizzato, GPT-5.6 Sol senza le salvaguardie in produzione lo ha fatto nel 48% dei casi; Astra non lo ha mai fatto (0%). OpenAI riporta inoltre che il modello non ha mai tentato di aggirare un rifiuto automatico da parte di Codex, neppure quando tale rifiuto era stato deliberatamente reso aggirabile, e che è tre volte meno probabile di Sol nel sovrastimare le proprie capacità.

OpenAI è altrettanto diretta sui costi di questa scelta. Nel corso di test volti a verificare l’evasione del monitoraggio, il ragionamento scritto di Astra si è rivelato più difficile da monitorare rispetto a quello di Sol — l’azienda attribuisce ciò alla minore quantità di passaggi scritti necessari, definisce il calo «grave» e indica il miglioramento della monitorabilità come priorità di ricerca. Il Chief Scientist Jakub Pachocki ha dichiarato ai giornalisti, secondo Axios, che l’azienda dovrà estendere il monitoring della catena di ragionamento oppure introdurre un monitoring delle attivazioni. I modelli di classe Astra sono inoltre i primi ad essere distribuiti in produzione con un sistema di monitoraggio della disallineamento: classificatori che analizzano il ragionamento e le azioni del modello e possono sospendere un task, cosa che OpenAI avverte potrebbe interrompere occasionalmente anche lavori legittimi.

Disponibilità e rollout

  • 3 settembre: anteprima limitata per un piccolo numero di organizzazioni iscritte al programma Daybreak Access.
  • «Nei prossimi giorni»: tutti gli utenti ChatGPT Plus, Pro, Business ed Enterprise; l’utilizzo verrà conteggiato nell’ambito dei limiti già previsti dall’abbonamento, con possibilità di acquistare crediti aggiuntivi. L’accesso Enterprise è disattivato per impostazione predefinita e dovrà essere abilitato manualmente dall’amministratore.
  • GPT-6 Astra Pro: disponibile per i piani Pro, Business ed Enterprise.
  • Sviluppatori: gpt-6-astra disponibile nell’API OpenAI, su Microsoft Azure e Amazon Bedrock. La funzione Zero Data Retention è disponibile per i clienti API idonei.
  • Codex: una nuova modalità sperimentale «note attraverso le finestre contestuali» sostituisce la compressione ripetuta nelle sessioni lunghe; è attivabile su richiesta tramite config.toml fin da subito e diventerà la modalità predefinita per Astra.

Secondo Axios, Astra è stato addestrato su oltre 100.000 GPU presso il sito Stargate di OpenAI in Texas — la più grande esecuzione finora realizzata — ed è il primo modello OpenAI in cui altri modelli hanno svolto un ruolo significativo di supervisione durante l’addestramento. Nessuno di questi due dati compare nella pagina ufficiale di lancio, pertanto vanno considerati informazioni riportate, non documentate.

Chi dovrebbe passare a questo modello

Passa subito se utilizzi agenti per l’uso del computer o per attività di programmazione a lungo termine, in cui il tempo reale e l'affidabilità sono i fattori determinanti della fatturazione: i miglioramenti su OSWorld e Terminal-Bench sono significativi e il risultato dello 0% di superamento dell’ambito autorizzato rappresenta la proprietà di sicurezza richiesta da queste implementazioni. Aspetta se il tuo carico di lavoro riguarda chat, riassunti o estrazione di informazioni: sugli indici di intelligenza generale Astra è appena migliore di Sol, pur costando il doppio, e Claude Opus 5 a 5$/25$ o Gemini 3.1 Pro a 2$/12$ rimangono molto più convenienti. Non passare ancora per la ricerca sulla sicurezza offensiva — la versione di lancio lo rifiuta per progettazione, e la versione meno restrittiva è riservata agli iscritti al programma Daybreak.

Il riassunto onesto è che GPT-6 Astra rappresenta un passo decisivo per gli agenti e uno marginale per tutti gli altri, con un prezzo fissato in base al primo caso. La sua scheda tecnica completa, insieme a quella di tutti gli altri modelli citati, è disponibile nella nostra voce dedicata a GPT-6 Astra e il Classifica LLM.

Domande frequenti

Quanto costa GPT-6 Astra per ogni milione di token?

10$ per l’input, 1$ per l’input memorizzato nella cache e 50$ per l’output sul livello standard dell’API, secondo la pagina del modello di OpenAI. I prompt con più di 272.000 token di input vengono fatturati al doppio del costo per l’input e al 1,5x per l’output; la modalità Fast costa il doppio, garantendo fino al doppio della velocità.

È disponibile su ChatGPT Plus?

OpenAI ha annunciato che Astra sarà reso disponibile a tutti gli utenti Plus, Pro, Business ed Enterprise «nei prossimi giorni» dopo l’anteprima limitata del 3 settembre, entro i limiti di utilizzo già previsti dagli abbonamenti. Astra Pro è invece riservato ai piani Pro, Business ed Enterprise.

Qual è la finestra contestuale di GPT-6 Astra?

1.050.000 token, con un output massimo di 128.000 token. Il test MRCR di OpenAI sui contesti lunghi riporta il 100% su aghi di 256K–512K token e il 96,3% su aghi di 512K–1M token, contro il 91,5% e il 73,8% di GPT-5.6 Sol.

È migliore di Claude Fable 5.1?

Dipende dal compito. Secondo la tabella pubblicata da OpenAI, Astra è in testa nell’uso del computer, su Terminal-Bench, FrontierMath e cybersecurity, mentre Fable 5.1 precede Astra sull’Artificial Analysis Intelligence Index (65,7 contro 61,2) e su Humanity's Last Exam con strumenti (65,0% contro 57,2%). Entrambi i modelli costano 10$/50$ nel livello più alto.

Perché Astra rifiuta alcuni compiti legati alla sicurezza?

È il primo modello OpenAI a raggiungere la soglia «Critica» in cybersecurity secondo il Preparedness Framework. La versione di lancio gestisce compiti difensivi come la revisione del codice e l’applicazione di patch, ma rifiuta di costruire exploit dimostrativi; un accesso più ampio è previsto tramite il programma Daybreak di OpenAI.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top