Sortie et disponibilité : GPT-6 Astra a été lancé le 3 septembre 2026
OpenAI a annoncé GPT-6 Astra le 3 septembre 2026. Au lancement, l’accès était limité à certaines organisations, avec une extension promise dans les jours suivants. Reuters et Microsoft confirment ce déploiement progressif. [1][7][8]
Spécifications : contexte 1,05M et sortie 128K
| Paramètre | GPT-6 Astra |
|---|---|
| Fenêtre de contexte | 1,050,000 tokens |
| Sortie max. | 128,000 tokens |
| Knowledge cutoff | Apr 30, 2026 |
| Entrée | text + images |
| Sortie | text |
| Raisonnement | low / medium / high / xhigh / max |
La documentation API indique 1 050 000 jetons de contexte, 128 000 jetons de sortie maximale et une coupure de connaissances au 30 avril 2026. Le modèle accepte texte et images et génère du texte. [2][11]
Prix API : $10 en entrée, $50 en sortie et seuil de 272K
| Paramètre | Prix / MTok |
|---|---|
| Entrée | $10.00 |
| Entrée en cache | $1.00 |
| Écriture cache | $12.50 |
| Sortie | $50.00 |
| >272K entrée | 2× entrée/cache; 1.5× sortie |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Les tarifs Standard sont $10/MTok en entrée, $1/MTok de cache lu, $12.50/MTok d’écriture du cache et $50/MTok en sortie. Au-delà de 272K jetons d’entrée, toute la requête passe à 2× pour entrée/cache et 1,5× pour la sortie. Batch et Flex coûtent 50% de Standard, Fast 2×. [2]
Niveaux d’effort de raisonnement : low, medium, high, xhigh et max
`reasoning.effort` accepte `low`, `medium`, `high`, `xhigh` et `max`. `none` n’est pas pris en charge; OpenAI recommande de commencer par `low` lors d’une migration depuis `none` ou `minimal`. [2][3]
Migrer depuis GPT-5.6 ne se limite pas à changer l’identifiant du modèle
L’identifiant est `gpt-6-astra`, mais les appels d’outils nécessitent Responses API. OpenAI demande aussi de retirer les paramètres non pris en charge comme `temperature`, `top_p` et `top_logprobs`, ainsi que `logprobs` dans Chat Completions. [3]
- Passer le model ID à `gpt-6-astra`.
- Utiliser Responses API pour les appels d’outils.
- Supprimer `temperature`, `top_p`, `top_logprobs`; dans Chat Completions aussi `logprobs`.
- Si vous utilisiez `none` ou `minimal`, commencer par tester `low`.
- Tester Fast mode séparément : il n’est pas disponible avec EU data residency.
Utilisation de l’ordinateur : Agents’ Last Exam, OSWorld et ScreenSpot-Pro
OpenAI publie 59,3% sur Agents’ Last Exam, 72,6% sur OSWorld 2.0 offline partial et 92,7% sur ScreenSpot-Pro sans outils. Dans des simulations OSWorld, Astra obtient aussi de meilleures performances avec environ 47% de temps en moins par tâche que GPT-5.6 Sol. [1]
Travail professionnel : AutomationBench, BenchCAD et BrowseComp
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
Astra atteint 41,4% sur AutomationBench contre 18,1% pour GPT-5.6 Sol et 31,4% pour Claude Fable 5.1. BenchCAD atteint 95,9% et BrowseComp 91,5%. Ce sont des configurations de lancement publiées par OpenAI. [1]
Code : Terminal-Bench 4.0, DeepSWE et FrontierCode
Sur Terminal-Bench 4.0, Astra obtient 57,9%, sur DeepSWE v1.1 74,1% et sur FrontierCode 1.1 Extended 64,5%. Certains modèles concurrents restent proches ou supérieurs sur des évaluations particulières. [1]
Science et mathématiques : excellents scores sans domination totale
Astra obtient 64,6% sur Terminal-Bench Science 0.1, 97,6% sur FrontierMath Tier 4 (v2) et 96,0% sur GPQA Diamond. Sur Humanity’s Last Exam avec outils, Astra est à 57,2%, contre 65,0% pour Fable 5.1 et 63,6% pour Opus 5. [1]
Long contexte : MRCR jusqu’à 1M de jetons
OpenAI MRCR v2 donne 100,0% entre 256K et 512K et 96,3% entre 512K et 1M. Pour les usages longs en production, il faut intégrer la hausse tarifaire au-delà de 272K jetons d’entrée. [1][2]
ARC-AGI-3 : pourquoi 99,9% exige un contexte méthodologique
Le 99,9% d’ARC-AGI-3 utilise un Provider Adapter qui conserve l’état de raisonnement et la compaction. ARC Prize publie 62,7% avec son harness Standard et 99,9% avec l’adaptateur; Astra utilise moins d’actions que l’humain médian sur 96% des niveaux. [1][5]
Artificial Analysis : code plus efficace, prix élevé
Artificial Analysis attribue 61 points à Astra `max` sur Intelligence Index et 67 sur Coding Agent Index. Le test indépendant montre une forte efficacité en jetons pour le code, mais un coût par tâche supérieur à GPT-5.6 Sol à effort maximal sur l’indice général, en raison du prix des jetons. [6]
Cybersécurité : premier modèle OpenAI au niveau Critical
OpenAI classe Astra comme son premier modèle au niveau Critical en cybersécurité. Sans garde-fous de production, il atteint 100% sur ExploitBench, 42,4% sur ExploitGym et 88,0% sur SRE-Bench en une tentative; la System Card décrit aussi des capacités avancées autour des zero-days. [1][4]
Sécurité et monitorabilité : meilleur alignement, raisonnement plus difficile à surveiller
La System Card montre un résultat double : Astra est mieux aligné globalement, mais sa chaîne de raisonnement écrite est plus difficile à surveiller que celle de GPT-5.6 Sol dans des tests explicitement adversariaux. OpenAI précise que les évaluations générales d’alignement restent meilleures. [4]
Résistance au injection d’instructions et respect du périmètre
OpenAI signale une meilleure résistance au injection d’instructions et un meilleur respect des limites autorisées. Sur plus de 54 000 tâches Codex internes simulées, Astra reçoit environ deux fois moins de signalements de comportements mal alignés de gravité élevée que GPT-5.6 Sol. [4]
Nouvelles fonctions API : outils asynchrones et pilotage en cours de réponse
Astra ajoute async appels d’outils, mid-turn steering et la modification du raisonnement via `configuration_update` sans réécrire le préfixe initial. Ces fonctions sont utiles aux agents qui attendent des outils lents ou reçoivent de nouvelles consignes. [3]
Codex et mémoire de travail entre fenêtres de contexte
Dans Codex, OpenAI teste des notes persistantes entre fenêtres de contexte. Les anciennes fenêtres restent interrogeables pour retrouver des exigences ou résultats de tests non conservés dans une synthèse compacte. [1]
Conservation des données : ZDR et Private Safety Processing
OpenAI annonce Zero Data Retention pour les clients API éligibles. Private Safety Processing est aussi testé pour détecter des schémas de risque entre interactions liées sans exposer le contenu sous-jacent au personnel OpenAI. [1][9]
Déploiement dans ChatGPT, API, Azure et Bedrock
Astra est annoncé pour Plus, Pro, Business, Enterprise, l’API, Microsoft Azure et Amazon Bedrock. Astra Pro est prévu pour Pro, Business et Enterprise, sans identifiant public d’API ni tarif API séparé publié au lancement. [1][8]
GPT-6 Astra vs GPT-5.6 Sol et Claude : où l’avantage est réel
Les écarts les plus nets face à GPT-5.6 Sol concernent les tâches agentiques, utilisation de l’ordinateur, Terminal-Bench Science et plusieurs évaluations professionnelles. Il n’y a pas de domination totale sur Claude : Fable 5.1 est devant sur HLE avec outils et sur l’Artificial Analysis Intelligence Index dans le tableau OpenAI. [1][6]
Qu’est-ce qui change vraiment par rapport à GPT-5.6 Sol ?
Par rapport à GPT-5.6 Sol, Astra change les niveaux de raisonnement, augmente le prix par jeton, ajoute les outils asynchrones et le pilotage en cours de réponse, améliore le long contexte et atteint un niveau cyber bien supérieur. Une migration de production exige donc de nouveaux tests de prompts, outils, coûts et sécurité. [2][3][4][11]

