Release en beschikbaarheid: GPT-6 Astra verscheen op 3 september 2026
OpenAI kondigde GPT-6 Astra aan op 3 september 2026. Bij de start was toegang beperkt tot enkele organisaties; uitbreiding naar betaalde ChatGPT-plannen en API werd voor de volgende dagen aangekondigd. Reuters en Microsoft bevestigen de gefaseerde uitrol. [1][7][8]
Specificaties: 1,05M context en 128K uitvoer
| Parameter | GPT-6 Astra |
|---|---|
| Contextvenster | 1,050,000 tokens |
| Max. uitvoer | 128,000 tokens |
| kennisgrens | Apr 30, 2026 |
| Invoer | text + images |
| Uitvoer | text |
| Redeneren | low / medium / high / xhigh / max |
De API-documentatie noemt 1.050.000 contexttokens, 128.000 maximale uitvoertokens en een kennisgrens van 30 april 2026. Het model accepteert tekst en afbeeldingen en genereert tekst. [2][11]
API-prijs: $10 invoer, $50 uitvoer en de 272K-grens
| Parameter | Prijs / MTok |
|---|---|
| Invoer | $10.00 |
| Gecachete invoer | $1.00 |
| Cacheschrijving | $12.50 |
| Uitvoer | $50.00 |
| >272K invoer | 2× invoer/cache; 1.5× uitvoer |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Standard kost $10/MTok invoer, $1/MTok gecachete invoer, $12.50/MTok cacheschrijving en $50/MTok uitvoer. Boven 272K invoertokens wordt de hele verzoek gefactureerd tegen 2× invoer/cache en 1,5× uitvoer. Batch en Flex zijn 50% van Standard, Fast 2×. [2]
Redeneerniveaus: low, medium, high, xhigh en max
`reasoning.effort` ondersteunt `low`, `medium`, `high`, `xhigh` en `max`. `none` wordt niet ondersteund; bij migratie vanaf `none` of `minimal` adviseert OpenAI te starten met `low`. [2][3]
Migreren vanaf GPT-5.6 is meer dan een model-ID wijzigen
De model-ID is `gpt-6-astra`, maar toolaanroepen vereist Responses API. OpenAI vraagt ook niet-ondersteunde parameters zoals `temperature`, `top_p`, `top_logprobs` en bij Chat Completions `logprobs` te verwijderen. [3]
- Zet de model-ID op `gpt-6-astra`.
- Gebruik Responses API voor toolaanroepen.
- Verwijder `temperature`, `top_p`, `top_logprobs`; bij Chat Completions ook `logprobs`.
- Als je `none` of `minimal` gebruikte, begin met `low`.
- Controleer Fast mode apart: niet beschikbaar met EU data residency.
Computergebruik: Agents’ Last Exam, OSWorld en ScreenSpot-Pro
OpenAI rapporteert 59,3% op Agents’ Last Exam, 72,6% op OSWorld 2.0 offline partial en 92,7% op ScreenSpot-Pro zonder tools. In OSWorld-simulaties behaalde Astra ook hogere prestaties in ongeveer 47% minder tijd per taak dan GPT-5.6 Sol. [1]
Professioneel werk: AutomationBench, BenchCAD en BrowseComp
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
Astra scoort 41,4% op AutomationBench tegenover 18,1% voor GPT-5.6 Sol en 31,4% voor Claude Fable 5.1. BenchCAD is 95,9% en BrowseComp 91,5%. Dit zijn door OpenAI gepubliceerde introductie-configuraties. [1]
Programmeren: Terminal-Bench 4.0, DeepSWE en FrontierCode
Terminal-Bench 4.0: 57,9%; DeepSWE v1.1: 74,1%; FrontierCode 1.1 Extended: 64,5%. Het verschil varieert per programmeren-evaluatie en sommige concurrenten blijven dichtbij of hoger. [1]
Wetenschap en wiskunde: zeer sterke resultaten zonder volledige dominantie
Astra scoort 64,6% op Terminal-Bench Science 0.1, 97,6% op FrontierMath Tier 4 (v2) en 96,0% op GPQA Diamond. Op Humanity’s Last Exam met tools scoort Astra 57,2%, tegenover 65,0% voor Fable 5.1 en 63,6% voor Opus 5. [1]
Lange context: MRCR tot 1M tokens
OpenAI MRCR v2 toont 100,0% tussen 256K–512K en 96,3% tussen 512K–1M. Voor productie moet de hogere prijs boven 272K invoertokens worden meegerekend. [1][2]
ARC-AGI-3: waarom 99,9% methodologische context nodig heeft
De 99,9% op ARC-AGI-3 gebruikt een Provider Adapter die redeneren state bewaart en compaction ondersteunt. ARC Prize rapporteert 62,7% met de Standard harness en 99,9% met de adapter; Astra gebruikte op 96% van de levels minder acties dan de mediane geteste mens. [1][5]
Artificial Analysis: sterker programmeren, hoge prijs
Artificial Analysis geeft Astra `max` 61 punten op de Intelligence Index en 67 op de Coding Agent Index. De onafhankelijke test ziet grote tokenefficiëntie in programmeren, maar door de hogere tokenprijs zijn de kosten per taak op de algemene index hoger dan bij GPT-5.6 Sol op maximale redeneerinspanning. [6]
Cybersecurity: OpenAI’s eerste Critical-model
OpenAI classificeert Astra als zijn eerste model op Critical-niveau voor cybersecurity. Zonder production beveiligingsmaatregelen scoorde het 100% op ExploitBench, 42,4% op ExploitGym en 88,0% op SRE-Bench in één poging; de System Card beschrijft ook geavanceerde zero-day-capaciteiten. [1][4]
Veiligheid en monitorability: beter gedrag, moeilijker redeneren-toezicht
De System Card laat een dubbel beeld zien: Astra is gemiddeld beter afgestemd, maar de geschreven geschreven redeneerproces is in doelbewuste evasietests moeilijker te monitoren dan die van GPT-5.6 Sol. OpenAI benadrukt dat dit doelbewust vijandig tests waren. [4]
Prompt-injection-robuustheid en taakgrenzen
OpenAI meldt betere prompt-injection-robuustheid en betere naleving van toegestane taakgrenzen. In een simulatie van meer dan 54.000 interne Codex-taken kreeg Astra ongeveer half zoveel flags voor ernstigere misalignment als GPT-5.6 Sol. [4]
Nieuwe API-functies: async tools en mid-turn steering
Astra introduceert async toolaanroepen, mid-turn steering en redeneren-wijzigingen via `configuration_update` zonder de oorspronkelijke promptprefix te herschrijven. Dit is nuttig voor agents die op trage tools wachten of nieuwe instructies krijgen. [3]
Codex en werkgeheugen over contextvensters
In Codex test OpenAI persistente notities over contextvensters heen. Oudere vensters blijven doorzoekbaar zodat eisen of testresultaten kunnen worden teruggevonden die niet in een compacte samenvatting stonden. [1]
Dataretentie: ZDR en Private Safety Processing
OpenAI ondersteunt Zero Data Retention voor in aanmerking komende API-klanten. Private Safety Processing wordt getest om veiligheidspatronen over gerelateerde interacties te detecteren zonder onderliggende klantinhoud aan OpenAI-medewerkers bloot te stellen. [1][9]
Uitrol via ChatGPT, API, Azure en Bedrock
Astra is aangekondigd voor Plus, Pro, Business, Enterprise, API, Microsoft Azure en Amazon Bedrock. Astra Pro komt voor Pro, Business en Enterprise, maar bij de lancering is geen apart publiek API-ID of tarief gepubliceerd. [1][8]
GPT-6 Astra vs GPT-5.6 Sol en Claude: waar het voordeel echt zit
De grootste voordelen tegenover GPT-5.6 Sol zitten in agentic werk, computergebruik, Terminal-Bench Science en diverse professionele tests. Claude wordt niet overal verslagen: Fable 5.1 staat hoger op HLE met tools en op de Artificial Analysis Intelligence Index in OpenAI’s tabel. [1][6]
Wat veranderde echt ten opzichte van GPT-5.6 Sol?
Ten opzichte van GPT-5.6 Sol veranderen redeneren-niveaus, prijs per token, async tools, steering tijdens de response, long-context-prestaties en het cyber-capabilityniveau. Een productiemigratie vereist nieuwe tests van prompts, tools, kosten en veiligheid. [2][3][4][11]

