GPT-6 Astra: Benchmarks, Preis, API & Vergleich 2026 | POLPROG Zum Inhalt springen

GPT-6 Astra ist da: Benchmarks, Preis, 1,05M Kontext, API und Vergleich mit GPT-5.6 Sol und Claude Fable 5.1

OpenAI hat GPT-6 Astra am 3. September 2026 offiziell angekündigt. Die Einführung erfolgt stufenweise: zunächst für eine begrenzte Zahl von Organisationen, danach laut OpenAI in den folgenden Tagen für ChatGPT Plus, Pro, Business und Enterprise sowie über API, Microsoft Azure und Amazon Bedrock. Astra bietet 1.050.000 Kontext-Token, bis zu 128.000 Ausgabe-Token und kostet im Standard-API $10/MTok Eingabe sowie $50/MTok Ausgabe. Dieser Artikel trennt OpenAI-Angaben von unabhängigen Tests und methodischen Einschränkungen.

KI
Veröffentlicht Verfasst von Lesezeit 8 Min. Lesezeit

OpenAI hat GPT-6 Astra am 3. September 2026 offiziell angekündigt. Die Einführung erfolgt stufenweise: zunächst für eine begrenzte Zahl von Organisationen, danach laut OpenAI in den folgenden Tagen für ChatGPT Plus, Pro, Business und Enterprise sowie über API, Microsoft Azure und Amazon Bedrock. Astra bietet 1.050.000 Kontext-Token, bis zu 128.000 Ausgabe-Token und kostet im Standard-API $10/MTok Eingabe sowie $50/MTok Ausgabe. Dieser Artikel trennt OpenAI-Angaben von unabhängigen Tests und methodischen Einschränkungen.

Auf dieser Seite
  1. 1Release und Verfügbarkeit: GPT-6 Astra startete am 3. September 2026
  2. 2Technische Daten: 1,05M Kontext und 128K Ausgabe
  3. 3API-Preis: $10 Eingabe, $50 Ausgabe und die wichtige 272K-Grenze
  4. 4Stufen des Denkaufwands: low, medium, high, xhigh und max
  5. 5Migration von GPT-5.6: mehr als nur eine neue Model-ID
  6. 6Computernutzung: Agents’ Last Exam, OSWorld und ScreenSpot-Pro
  7. 7Professionelle Arbeit: AutomationBench, BenchCAD und BrowseComp
  8. 8Programmierung: Terminal-Bench 4.0, DeepSWE und FrontierCode
  9. 9Wissenschaft und Mathematik: sehr starke, aber nicht dominante Ergebnisse
  10. 10Long Context: MRCR bis 1M Token
  11. 11ARC-AGI-3: warum 99,9% methodischen Kontext brauchen
  12. 12Artificial Analysis: stärkeres Programmierung, hoher Preis
  13. 13Cybersecurity: OpenAIs erstes Modell auf Critical-Niveau
  14. 14Sicherheit und Monitorierbarkeit: besseres Verhalten, schwerer zu überwachendes Reasoning
  15. 15Robustheit gegen eingeschleuste Anweisungen und Einhaltung der Aufgabengrenzen
  16. 16Neue API-Funktionen: asynchrone Tools und Mid-turn Steering
  17. 17Codex und Arbeitsgedächtnis über Kontextfenster hinweg
  18. 18Datenaufbewahrung: ZDR und Private Safety Processing
  19. 19Einführung in ChatGPT, API, Azure und Bedrock
  20. 20GPT-6 Astra vs. GPT-5.6 Sol und Claude: wo der Vorsprung real ist
  21. 21Was hat sich gegenüber GPT-5.6 Sol wirklich geändert?

Release und Verfügbarkeit: GPT-6 Astra startete am 3. September 2026

OpenAI kündigte GPT-6 Astra am 3. September 2026 an. Zum Start war der Zugang auf wenige Organisationen begrenzt; die Ausweitung auf kostenpflichtige ChatGPT-Pläne und die API wurde für die folgenden Tage angekündigt. Reuters und Microsoft bestätigen den gestaffelten Einführung. [1][7][8]

Technische Daten: 1,05M Kontext und 128K Ausgabe

ParameterGPT-6 Astra
Kontextfenster1,050,000 tokens
Max. Ausgabe128,000 tokens
Knowledge CutoffApr 30, 2026
Eingabetext + images
Ausgabetext
Reasoninglow / medium / high / xhigh / max

Die API-Dokumentation nennt 1.050.000 Kontext-Token, maximal 128.000 Ausgabe-Token und einen Knowledge Cutoff vom 30. April 2026. Text und Bilder sind als Eingabe möglich, der Ausgabe ist Text. [2][11]

API-Preis: $10 Eingabe, $50 Ausgabe und die wichtige 272K-Grenze

ParameterPreis / MTok
Eingabe$10.00
Zwischengespeicherte Eingabe$1.00
Cache-Schreibvorgang$12.50
Ausgabe$50.00
>272K Eingabe2× Eingabe/cache; 1.5× Ausgabe
Batch / Flex50% of Standard
Fast2× applicable rates

Standard kostet $10/MTok Eingabe, $1/MTok Zwischengespeicherte Eingabe, $12.50/MTok Cache-Schreibvorgang und $50/MTok Ausgabe. Oberhalb von 272K Eingabe-Token wird der gesamte Anfrage mit 2× Eingabe/Cache und 1,5× Ausgabe abgerechnet. Batch und Flex kosten 50% von Standard, Fast 2×. [2]

Stufen des Denkaufwands: low, medium, high, xhigh und max

`reasoning.effort` unterstützt `low`, `medium`, `high`, `xhigh` und `max`. Astra unterstützt `none` nicht; bei einer Migration von `none` oder `minimal` empfiehlt OpenAI, mit `low` zu beginnen und die Ergebnisse zu vergleichen. [2][3]

Migration von GPT-5.6: mehr als nur eine neue Model-ID

Die Model-ID lautet `gpt-6-astra`, doch Werkzeugaufrufe erfordert mit Astra die Responses API. Außerdem sollen nicht unterstützte Parameter wie `temperature`, `top_p` und `top_logprobs` entfernt werden; bei Chat Completions auch `logprobs`. [3]

  • Model-ID auf `gpt-6-astra` setzen.
  • Für Werkzeugaufrufe die Responses API verwenden.
  • `temperature`, `top_p`, `top_logprobs` entfernen; bei Chat Completions auch `logprobs`.
  • Bei `none` oder `minimal` mit `low` testen.
  • Fast mode separat prüfen: mit EU Data Residency ist er für Astra nicht verfügbar.

Computernutzung: Agents’ Last Exam, OSWorld und ScreenSpot-Pro

OpenAI meldet 59,3% bei Agents’ Last Exam, 72,6% bei OSWorld 2.0 offline partial und 92,7% bei ScreenSpot-Pro ohne Tools. In OSWorld-Simulationen erreichte Astra zudem eine höhere Leistung bei rund 47% weniger Zeit pro Aufgabe als GPT-5.6 Sol. [1]

Professionelle Arbeit: AutomationBench, BenchCAD und BrowseComp

BenchmarkGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Agents' Last Exam59.3%53.6%55.5%
OSWorld 2.0 offline partial72.6%65.7%70.2%
AutomationBench41.4%18.1%31.4%26.9%
BenchCAD95.9%83.3%84.3%82.1%
Terminal-Bench 4.057.9%37.3%55.8%52.3%
DeepSWE v1.174.1%72.7%67.4%73.7%
Terminal-Bench Science 0.164.6%22.4%52.6%30.0%
FrontierMath Tier 4 (v2)97.6%83.0%87.8%73.2%
GPQA Diamond96.0%94.6%93.7%93.7%
HLE with tools57.2%65.0%63.6%

Bei AutomationBench erreicht Astra 41,4% gegenüber 18,1% für GPT-5.6 Sol und 31,4% für Claude Fable 5.1. BenchCAD liegt bei 95,9%, BrowseComp bei 91,5%. Es handelt sich um von OpenAI veröffentlichte Einführung-Konfigurationen. [1]

Programmierung: Terminal-Bench 4.0, DeepSWE und FrontierCode

Terminal-Bench 4.0: 57,9%, DeepSWE v1.1: 74,1%, FrontierCode 1.1 Extended: 64,5%. Der Abstand ist je nach Programmierung-Test unterschiedlich; einzelne Konkurrenzmodelle liegen weiterhin nahe oder darüber. [1]

Wissenschaft und Mathematik: sehr starke, aber nicht dominante Ergebnisse

Astra erzielt 64,6% bei Terminal-Bench Science 0.1, 97,6% bei FrontierMath Tier 4 (v2) und 96,0% bei GPQA Diamond. Bei Humanity’s Last Exam mit Tools liegt Astra jedoch bei 57,2%, Fable 5.1 bei 65,0% und Opus 5 bei 63,6%. [1]

Long Context: MRCR bis 1M Token

OpenAI MRCR v2 zeigt 100,0% für 256K–512K und 96,3% für 512K–1M. Für produktive Long-Context-Einsatzszenarios muss der Preisaufschlag oberhalb von 272K Eingabe-Token berücksichtigt werden. [1][2]

ARC-AGI-3: warum 99,9% methodischen Kontext brauchen

Die 99,9% bei ARC-AGI-3 wurden mit einem Provider Adapter erzielt, der Reasoning-State erhält und Compaction unterstützt. ARC Prize meldet 62,7% im Standard-Harness und 99,9% mit Provider Adapter; Astra benötigte auf 96% der Levels weniger Aktionen als der Median der getesteten Menschen. [1][5]

Artificial Analysis: stärkeres Programmierung, hoher Preis

Artificial Analysis bewertet Astra bei `max` mit 61 Punkten im Intelligence Index und mit 67 im Coding Agent Index. Der unabhängige Test zeigt eine deutliche Token-Effizienz bei der Programmierung, aber wegen der höheren Tokenpreise höhere Kosten pro Aufgabe als bei GPT-5.6 Sol im allgemeinen Intelligence Index bei maximalem Denkaufwand. [6]

Cybersecurity: OpenAIs erstes Modell auf Critical-Niveau

OpenAI stuft Astra als erstes eigenes Modell auf der Critical-Stufe für Cybersecurity ein. Ohne Produktions-Schutzmechanismen erzielte es 100% bei ExploitBench, 42,4% bei ExploitGym und 88,0% bei SRE-Bench im ersten Versuch; die System Card beschreibt zudem fortgeschrittene Zero-Day-Fähigkeiten. [1][4]

Sicherheit und Monitorierbarkeit: besseres Verhalten, schwerer zu überwachendes Reasoning

Die System Card zeigt ein gemischtes Bild: Astra ist insgesamt besser abgestimmt, sein schriftlicher Denkprozess ist in gezielten Tests zur Umgehung der Überwachung aber schwerer zu beobachten als bei GPT-5.6 Sol. OpenAI betont den bewusst feindseligen Charakter dieser Tests. [4]

Robustheit gegen eingeschleuste Anweisungen und Einhaltung der Aufgabengrenzen

OpenAI berichtet höhere Robustheit gegen eingeschleuste Anweisungen und bessere Einhaltung autorisierter Aufgabengrenzen. In einer Simulation mit mehr als 54.000 internen Codex-Aufgaben erhielt Astra etwa halb so viele Markierungen für schwerwiegendere Fehlanpassungen wie GPT-5.6 Sol. [4]

Neue API-Funktionen: asynchrone Tools und Mid-turn Steering

Neu sind async Werkzeugaufrufe, mid-turn steering und Änderungen des Reasoning-Levels über `configuration_update`, ohne den ursprünglichen Prompt-Präfix umzuschreiben. Das ist besonders für lang laufende Agenten mit langsamen Tools relevant. [3]

Codex und Arbeitsgedächtnis über Kontextfenster hinweg

In Codex testet OpenAI persistente Notizen über mehrere Kontextfenster. Frühere Fenster bleiben durchsuchbar, sodass Anforderungen oder Testergebnisse wiedergefunden werden können, auch wenn sie nicht in einer Kompakt-Zusammenfassung stehen. [1]

Datenaufbewahrung: ZDR und Private Safety Processing

Astra unterstützt Zero Data Retention für berechtigte API-Kunden. Zusätzlich testet OpenAI Private Safety Processing, das Safety-Muster über zusammenhängende Interaktionen erkennen soll, ohne zugrunde liegende Kundendaten dem OpenAI-Personal offenzulegen. [1][9]

Einführung in ChatGPT, API, Azure und Bedrock

Astra ist für Plus, Pro, Business und Enterprise sowie API, Microsoft Azure und Amazon Bedrock angekündigt. Astra Pro soll für Pro, Business und Enterprise folgen; ein separates öffentliches API-Modell oder ein eigener API-Preis wurde zum Einführung nicht veröffentlicht. [1][8]

GPT-6 Astra vs. GPT-5.6 Sol und Claude: wo der Vorsprung real ist

Die größten Vorteile gegenüber GPT-5.6 Sol zeigen sich in agentischen Aufgaben, Computernutzung, Terminal-Bench Science und mehreren professionellen Tests. Gegen Claude gibt es keine vollständige Dominanz; Fable 5.1 liegt etwa bei HLE mit Tools und im von OpenAI gezeigten Artificial Analysis Intelligence Index höher. [1][6]

Was hat sich gegenüber GPT-5.6 Sol wirklich geändert?

Astra verändert gegenüber GPT-5.6 Sol nicht nur die Qualität: andere Stufen des Denkaufwands, höhere Tokenpreise, asynchrone Tools, Mid-turn Steering, stärkere Long-Context-Leistung und ein deutlich höheres Cyber-Capability-Niveau. Eine Migration braucht deshalb neue Tests für Prompting, Tools, Kosten und Sicherheit. [2][3][4][11]

GPT-6 Astra ist vor allem bei agentischen Aufgaben, Computernutzung, Programmierung und langem Kontext ein deutlicher Fortschritt. Die Daten rechtfertigen jedoch keine pauschale Aussage, dass Astra in jedem Einsatzszenario das beste Modell ist. ARC Prize und Artificial Analysis zeigen, wie stark Harness, Token-Effizienz und Kosten die Interpretation beeinflussen. Für Produktion sollten Aufgabenerfolg, Wiederholungen, Latenz, Tokenverbrauch, Tool-Zuverlässigkeit und Gesamtkosten gemessen werden, besonders oberhalb von 272K Eingabe-Token.

AI GPT-6 GPT-6 Astra OpenAI Benchmarks Coding AI Agents Computer Use Cybersecurity API

Häufig gestellte Fragen

Ist GPT-6 Astra wirklich erschienen?

Ja. OpenAI kündigte GPT-6 Astra am 3. September 2026 an; der Einführung erfolgt stufenweise. [1][7]

Wie lautet die API Model-ID?

gpt-6-astra. [2][3]

Wie groß ist das Kontextfenster?

1.050.000 Token. [2]

Wie groß ist der maximale Ausgabe?

128.000 Token. [2]

Wie lautet der Knowledge Cutoff?

30. April 2026. [2]

Was kostet GPT-6 Astra in der API?

Standard: $10/MTok Eingabe, $1/MTok Zwischengespeicherte Eingabe, $12.50/MTok Cache-Schreibvorgang und $50/MTok Ausgabe. [2]

Wird sehr langer Kontext teurer?

Ja. Oberhalb von 272K Eingabe-Token wird der gesamte Anfrage mit 2× Eingabe/Cache und 1,5× Ausgabe abgerechnet. [2]

Unterstützt Astra den Wert none bei reasoning.effort?

Nein. Verfügbar sind low, medium, high, xhigh und max. [2][3]

Kann ich Chat Completions nutzen?

Ja, aber Werkzeugaufrufe mit Astra erfordert die Responses API. [3]

Sind 99,9% ARC-AGI-3 direkt vergleichbar?

Nicht ohne Kontext. Der Wert nutzt den Provider Adapter; ARC Prize meldet 62,7% im Standard-Harness. [5]

Ist Astra besser als Claude Fable 5.1?

In vielen agentischen und Programmierung-Tests ja, aber nicht in allen. Bei HLE mit Tools liegt Fable 5.1 höher. [1]

Was bedeutet Critical bei Cybersecurity?

Es ist eine Stufe im OpenAI Preparedness Framework für fortgeschrittene Fähigkeiten zur Entdeckung und Entwicklung von Exploits gegen gehärtete Systeme. [4]

Unterstützt Astra Zero Data Retention?

Ja, für berechtigte API-Kunden. [1][9]

Was ist GPT-6 Astra Pro?

OpenAI hat eine Pro-Variante für Pro, Business und Enterprise angekündigt, aber kein separates öffentliches API-ID oder Preismodell veröffentlicht. [1]

Sollte ich von GPT-5.6 Sol migrieren?

Ein POC ist für agentische Aufgaben, Programmierung, Computernutzung und Long Context sinnvoll; Kosten, Werkzeugaufrufe, Reasoning und Sicherheit sollten neu getestet werden. [2][3][4]

Quellen und Referenzen

  1. OpenAI, GPT-6 Astra: A new generation of intelligence12345678910111213141516
  2. OpenAI API, GPT-6 Astra model12345678910111213
  3. OpenAI API, Model guidance: GPT-6 Astra12345678
  4. OpenAI Deployment Safety Hub, GPT-6 Astra System Card123456
  5. ARC Prize, OpenAI's GPT-6 Astra on ARC-AGI-312
  6. Artificial Analysis, Benchmarking GPT-6 Astra12
  7. Reuters, OpenAI launches new Astra model amid growing scrutiny over agents' safety12
  8. Microsoft Azure, GPT-6 Astra: Frontier intelligence for work, now available in Microsoft Foundry12
  9. OpenAI, Offering Zero Data Retention for frontier models12
  10. OpenAI, The Hugging Face incident and the road aheadweiterführendes Material
  11. OpenAI API, Models12

War das hilfreich?

Neue Artikel per E-Mail erhalten

Eine kurze E-Mail pro neuem Wissens-Artikel. Kein Spam, Abmeldung mit einem Klick.

Wir nutzen Ihre E-Mail nur, um neue Artikel zu versenden. Keine Weitergabe an Dritte.

Zurück zu Wissen