Lancio e disponibilità: GPT-6 Astra è uscito il 3 settembre 2026
OpenAI ha annunciato GPT-6 Astra il 3 settembre 2026. Al lancio l’accesso era limitato ad alcune organizzazioni, con ampliamento promesso nei giorni successivi. Reuters e Microsoft confermano il distribuzione graduale. [1][7][8]
Specifiche: contesto 1,05M e uscita 128K
| Parametro | GPT-6 Astra |
|---|---|
| Finestra di contesto | 1,050,000 tokens |
| Uscita max | 128,000 tokens |
| data limite della conoscenza | Apr 30, 2026 |
| Ingresso | text + images |
| Uscita | text |
| Ragionamento | low / medium / high / xhigh / max |
La documentazione API indica 1.050.000 token di contesto, 128.000 token di uscita massimo e data limite della conoscenza al 30 aprile 2026. Il modello accetta testo e immagini e genera testo. [2][11]
Prezzi API: $10 ingresso, $50 uscita e soglia 272K
| Parametro | Prezzo / MTok |
|---|---|
| Ingresso | $10.00 |
| Ingresso in cache | $1.00 |
| Scrittura in cache | $12.50 |
| Uscita | $50.00 |
| >272K ingresso | 2× ingresso/cache; 1.5× uscita |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Standard costa $10/MTok ingresso, $1/MTok ingresso in cache, $12.50/MTok scrittura in cache e $50/MTok uscita. Oltre 272K token di ingresso, l’intera richiesta usa 2× ingresso/cache e 1,5× uscita. Batch e Flex costano il 50% di Standard, Fast 2×. [2]
Livelli di ragionamento: low, medium, high, xhigh e max
`reasoning.effort` supporta `low`, `medium`, `high`, `xhigh` e `max`. `none` non è supportato; migrando da `none` o `minimal`, OpenAI consiglia di partire da `low`. [2][3]
Migrare da GPT-5.6 non significa solo cambiare model ID
Il model ID è `gpt-6-astra`, ma il chiamate agli strumenti richiede Responses API. OpenAI raccomanda inoltre di rimuovere parametri non supportati come `temperature`, `top_p`, `top_logprobs` e, in Chat Completions, `logprobs`. [3]
- Impostare il model ID su `gpt-6-astra`.
- Usare Responses API per il chiamate agli strumenti.
- Rimuovere `temperature`, `top_p`, `top_logprobs`; in Chat Completions anche `logprobs`.
- Se usavi `none` o `minimal`, iniziare i test da `low`.
- Verificare Fast mode separatamente: non è disponibile con EU data residency.
Uso del computer: Agents’ Last Exam, OSWorld e ScreenSpot-Pro
OpenAI riporta 59,3% su Agents’ Last Exam, 72,6% su OSWorld 2.0 offline partial e 92,7% su ScreenSpot-Pro senza strumenti. Nelle simulazioni OSWorld Astra ha anche ottenuto prestazioni superiori in circa il 47% di tempo in meno per task rispetto a GPT-5.6 Sol. [1]
Lavoro professionale: AutomationBench, BenchCAD e BrowseComp
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
Astra ottiene 41,4% su AutomationBench contro 18,1% di GPT-5.6 Sol e 31,4% di Claude Fable 5.1. BenchCAD raggiunge 95,9% e BrowseComp 91,5%. Sono configurazioni di lancio pubblicate da OpenAI. [1]
Programmazione: Terminal-Bench 4.0, DeepSWE e FrontierCode
Terminal-Bench 4.0: 57,9%; DeepSWE v1.1: 74,1%; FrontierCode 1.1 Extended: 64,5%. Il vantaggio dipende dal benchmark e alcuni concorrenti restano vicini o superiori in test specifici. [1]
Scienza e matematica: risultati molto forti senza dominio totale
Astra ottiene 64,6% su Terminal-Bench Science 0.1, 97,6% su FrontierMath Tier 4 (v2) e 96,0% su GPQA Diamond. Su Humanity’s Last Exam con strumenti è al 57,2%, contro 65,0% di Fable 5.1 e 63,6% di Opus 5. [1]
Contesto lungo: MRCR fino a 1M token
OpenAI MRCR v2 mostra 100,0% tra 256K–512K e 96,3% tra 512K–1M. Per l’uso produttivo va considerato il moltiplicatore di prezzo oltre 272K token di ingresso. [1][2]
ARC-AGI-3: perché il 99,9% richiede contesto metodologico
Il 99,9% su ARC-AGI-3 usa un Provider Adapter che conserva lo stato di ragionamento e supporta compaction. ARC Prize riporta 62,7% con l’harness Standard e 99,9% con l’adapter; Astra usa meno azioni della mediana umana nel 96% dei livelli. [1][5]
Artificial Analysis: programmazione più efficiente, prezzo elevato
Artificial Analysis assegna 61 punti ad Astra `max` nell’Intelligence Index e 67 nel Coding Agent Index. Il test indipendente rileva una forte efficienza dei token nella programmazione, ma un costo per attività più alto rispetto a GPT-5.6 Sol al massimo livello di ragionamento nell’indice generale. [6]
Cybersecurity: primo modello OpenAI a livello Critical
OpenAI classifica Astra come primo proprio modello al livello Critical di cybersecurity. Senza safeguard di produzione ha raggiunto 100% su ExploitBench, 42,4% su ExploitGym e 88,0% su SRE-Bench al primo tentativo; la System Card descrive anche capacità avanzate zero-day. [1][4]
Sicurezza e monitorabilità: comportamento migliore, ragionamento più difficile da osservare
La System Card mostra un doppio risultato: Astra è complessivamente meglio allineato, ma la processo di ragionamento scritto scritta è più difficile da monitorare di quella di GPT-5.6 Sol in test pensati per l’evasione del monitoraggio. OpenAI sottolinea la natura ostile di queste prove. [4]
Resistenza al iniezione di istruzioni e rispetto dei limiti
OpenAI riporta maggiore robustezza al iniezione di istruzioni e migliore rispetto dei limiti autorizzati. In oltre 54.000 task Codex interni simulati, Astra ha ricevuto circa la metà dei flag per comportamenti disallineati più gravi rispetto a GPT-5.6 Sol. [4]
Nuove funzioni API: strumenti asincroni e mid-turn steering
Astra introduce async chiamate agli strumenti, mid-turn steering e modifica del ragionamento tramite `configuration_update` senza riscrivere il prefisso iniziale. Sono funzioni utili per agenti che attendono tool lenti o ricevono nuove istruzioni. [3]
Codex e memoria di lavoro tra finestre di contesto
In Codex OpenAI sta testando note persistenti tra finestre di contesto. Le finestre precedenti restano ricercabili per recuperare requisiti o risultati di test non inclusi in un riepilogo compatto. [1]
Conservazione dati: ZDR e Private Safety Processing
OpenAI dichiara Zero Data Retention per clienti API idonei. Sta inoltre testando Private Safety Processing per rilevare pattern di rischio tra interazioni correlate senza esporre i contenuti sottostanti al personale OpenAI. [1][9]
Distribuzione su ChatGPT, API, Azure e Bedrock
Astra è annunciato per Plus, Pro, Business, Enterprise, API, Microsoft Azure e Amazon Bedrock. Astra Pro è previsto per Pro, Business ed Enterprise, ma al lancio non è stato pubblicato un ID API o prezzo API separato. [1][8]
GPT-6 Astra vs GPT-5.6 Sol e Claude: dove il vantaggio è reale
I vantaggi più evidenti rispetto a GPT-5.6 Sol sono nei task agentici, uso del computer, Terminal-Bench Science e varie valutazioni professionali. Non domina Claude ovunque: Fable 5.1 è superiore su HLE con strumenti e sull’Artificial Analysis Intelligence Index nella tabella OpenAI. [1][6]
Cosa cambia davvero rispetto a GPT-5.6 Sol?
Rispetto a GPT-5.6 Sol cambiano livelli di ragionamento, prezzo per token, tool asincroni, steering in corso di risposta, long context e livello di capacità cyber. Una migrazione produttiva richiede nuovi test di prompt, strumenti, costi e sicurezza. [2][3][4][11]

