Premiera i dostępność: GPT-6 Astra wyszedł 3 września 2026
OpenAI ogłosiło GPT-6 Astra 3 września 2026. Na starcie model został udostępniony ograniczonej grupie organizacji, a szersze wdrożenie do płatnych planów ChatGPT oraz API zapowiedziano na kolejne dni. Reuters i Microsoft potwierdziły etapowy charakter wdrożenia. [1][7][8]
Specyfikacja techniczna: 1,05M kontekstu i 128K wyjścia
| Parametr | GPT-6 Astra |
|---|---|
| Okno kontekstu | 1,050,000 tokens |
| Maks. wyjście | 128,000 tokens |
| Granica wiedzy | Apr 30, 2026 |
| Wejście | text + images |
| Wyjście | text |
| Poziom rozumowania | low / medium / high / xhigh / max |
Dokumentacja API podaje 1 050 000 tokenów kontekstu, 128 000 maksymalnych tokenów wyjścia oraz granicę wiedzy na 30 kwietnia 2026. Model przyjmuje tekst i obrazy, a generuje tekst. [2][11]
Cena API: $10 wejścia, $50 wyjścia i ważny próg 272K
| Parametr | Cena / MTok |
|---|---|
| Wejście | $10.00 |
| Odczyt z pamięci podręcznej | $1.00 |
| Zapis do pamięci podręcznej | $12.50 |
| Wyjście | $50.00 |
| >272K wejścia | 2× wejścia/pamięci podręcznej; 1.5× output |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Standardowe stawki OpenAI API wynoszą $10/MTok wejścia, $1/MTok odczytu z pamięci podręcznej, $12.50/MTok zapisu do pamięci podręcznej oraz $50/MTok wyjścia. Jeśli prompt przekracza 272K tokenów wejściowych, całe żądanie jest liczone po 2× stawce wejścia i pamięci podręcznej oraz 1,5× stawce wyjścia. Batch i Flex kosztują 50% stawek Standard, a Fast 2×. [2]
Poziomy rozumowania: low, medium, high, xhigh i max
`reasoning.effort` obsługuje `low`, `medium`, `high`, `xhigh` i `max`. Astra nie obsługuje poziomu `none`; przy migracji z konfiguracji `none` lub `minimal` OpenAI zaleca zacząć od `low` i przeprowadzić własne porównanie. [2][3]
Migracja z GPT-5.6: to nie jest tylko zmiana model ID
Model ID to `gpt-6-astra`, ale migracja wymaga sprawdzenia integracji. Wywoływanie narzędzi dla Astry wymaga Responses API, mimo że sam model obsługuje również Chat Completions. OpenAI zaleca usunięcie nieobsługiwanych parametrów, m.in. `temperature`, `top_p` i `top_logprobs`, a w Chat Completions także `logprobs`. [3]
- Zmień model ID na `gpt-6-astra`.
- Dla wywoływania narzędzi przejdź na Responses API.
- Usuń `temperature`, `top_p`, `top_logprobs`; w Chat Completions także `logprobs`.
- Jeśli używałeś `none` lub `minimal`, zacznij testy od `low`.
- Sprawdź Fast mode osobno — nie jest dostępny dla Astra z EU data residency.
Obsługa komputera: Agents’ Last Exam, OSWorld i ScreenSpot-Pro
W tabeli premierowej Astra uzyskuje 59,3% na Agents’ Last Exam, 72,6% na OSWorld 2.0 offline partial oraz 92,7% na ScreenSpot-Pro bez narzędzi. OpenAI podaje też, że w symulacjach OSWorld Astra osiągała wyższy wynik w około 47% krótszym czasie na zadanie niż GPT-5.6 Sol. [1]
Praca profesjonalna: AutomationBench, BenchCAD i BrowseComp
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
W AutomationBench Astra ma 41,4% wobec 18,1% dla GPT-5.6 Sol i 31,4% dla Claude Fable 5.1. W BenchCAD osiąga 95,9%, a w BrowseComp 91,5%. To wyniki z konfiguracji opisanych przez OpenAI i nie należy ich traktować jako gwarancji jakości dla każdego procesu biznesowego. [1]
Kodowanie: Terminal-Bench 4.0, DeepSWE i FrontierCode
W Terminal-Bench 4.0 Astra osiąga 57,9%, w DeepSWE v1.1 74,1%, a w FrontierCode 1.1 Extended 64,5%. Różnice względem konkurencji nie są jednak jednostronne: w części benchmarków kodowych inne modele nadal pozostają bardzo blisko albo wyżej. [1]
Nauka i matematyka: bardzo mocne wyniki, ale bez pełnej dominacji
Astra ma 64,6% na Terminal-Bench Science 0.1, 97,6% na FrontierMath Tier 4 (v2) i 96,0% na GPQA Diamond. Jednocześnie na Humanity’s Last Exam z narzędziami OpenAI raportuje 57,2%, podczas gdy w tej samej tabeli Claude Fable 5.1 ma 65,0% i Claude Opus 5 63,6%. [1]
Długi kontekst: MRCR do 1M tokenów
W OpenAI MRCR v2 Astra uzyskuje 100,0% w zakresie 256K–512K oraz 96,3% przy 512K–1M. To mocny sygnał dla pracy z bardzo długimi materiałami, ale koszt takiego użycia trzeba liczyć z uwzględnieniem podwyższonych stawek po przekroczeniu 272K tokenów wejściowych. [1][2]
ARC-AGI-3: dlaczego 99,9% wymaga kontekstu metodologicznego
OpenAI pokazuje 99,9% na ARC-AGI-3, ale wynik korzysta z Provider Adapter zachowującego stan rozumowania i wspierającego kompakcję. ARC Prize podaje dla tego samego modelu 62,7% przy standardowym harnessie oraz 99,9% z adapterem dostawcy. Organizacja informuje również, że Astra użyła mniej akcji niż mediana testowanych ludzi na 96% poziomów. [1][5]
Niezależne testy Artificial Analysis: mocne kodowanie, wysoka cena
Artificial Analysis ocenia Astrę na 61 punktów w Intelligence Index przy `max` i 67 punktów w Coding Agent Index. Niezależny test wskazuje na wyraźnie lepszą efektywność tokenową w kodowaniu, ale w ogólnym Intelligence Index wzrost ceny za token sprawia, że Astra jest droższa na zadanie od GPT-5.6 Sol przy maksymalnym poziomie wysiłku. [6]
Cyberbezpieczeństwo: pierwszy model OpenAI na poziomie Critical
OpenAI klasyfikuje Astrę jako pierwszy swój model osiągający poziom Critical dla cyberbezpieczeństwa w Preparedness Framework. Bez produkcyjnych zabezpieczeń model uzyskał 100% na ExploitBench, 42,4% na ExploitGym oraz 88,0% na SRE-Bench w jednym podejściu; karta systemowa opisuje również zdolność do odkrywania i rozwijania exploitów zero-day w zaawansowanych testach. [1][4]
Bezpieczeństwo i monitorowalność: poprawa zachowania, trudniejsze śledzenie rozumowania
Karta systemowa pokazuje jednocześnie lepsze zachowanie Astry i nowy problem: pisemny tok rozumowania modelu jest trudniejszy do monitorowania niż w GPT-5.6 Sol w testach, w których model miał próbować unikać nadzoru. OpenAI podkreśla, że były to celowo wrogie warunki testowe i że ogólne testy zgodności wypadają lepiej niż dla Sol. [4]
Odporność na wstrzykiwanie instrukcji i respektowanie granic zadania
OpenAI raportuje większą odporność Astry na wstrzykiwanie instrukcji oraz mniejszą skłonność do działań wykraczających poza autoryzowany zakres. W symulacji ponad 54 tys. wewnętrznych zadań Codex model otrzymał około połowę mniej oznaczeń zachowań o wyższym poziomie niezgodności niż GPT-5.6 Sol. [4]
Nowe możliwości API: asynchroniczne narzędzia i sterowanie w trakcie odpowiedzi
Astra wprowadza asynchroniczne wywoływanie narzędzi, sterowanie w trakcie odpowiedzi oraz zmianę poziomu rozumowania w trakcie rozmowy przez `configuration_update` bez przepisywania początkowego prefiksu. To ważne dla agentów, które czekają na wolne narzędzia albo muszą reagować na nowe wymagania użytkownika bez restartowania całego zadania. [3]
Codex i pamięć pracy między oknami kontekstu
W Codex OpenAI testuje mechanizm notatek zachowywanych między kolejnymi oknami kontekstu. Starsze fragmenty sesji pozostają przeszukiwalne, dzięki czemu model może odzyskać wcześniejsze wymagania lub wyniki testów, nawet jeśli nie trafiły do skróconego podsumowania. Funkcja jest eksperymentalna i ma stać się domyślna dla Astry później. [1]
Retencja danych: ZDR i Private Safety Processing
OpenAI deklaruje obsługę Zero Data Retention dla uprawnionych klientów API. Firma testuje również Private Safety Processing, które ma umożliwiać analizę sygnałów bezpieczeństwa między powiązanymi interakcjami bez udostępniania treści personelowi OpenAI; rozwiązanie pozostaje w fazie testów z wczesnymi klientami. [1][9]
Wdrożenie: ChatGPT, API, Azure i Bedrock
OpenAI zapowiedziało Astrę dla ChatGPT Plus, Pro, Business i Enterprise, API, Microsoft Azure i Amazon Bedrock. Użytkownicy Pro, Business i Enterprise mają także otrzymać GPT-6 Astra Pro, ale dokumenty premierowe nie podają osobnego publicznego model ID ani cennika API dla wariantu Pro. Administratorzy Enterprise muszą włączyć Astrę w workspace, bo przy premierze jest domyślnie wyłączona. [1][8]
GPT-6 Astra vs GPT-5.6 Sol i Claude: gdzie naprawdę widać przewagę
Największe przewagi Astry nad GPT-5.6 Sol w danych premierowych widać w zadaniach agentowych, obsłudze komputera, Terminal-Bench Science i części zadań profesjonalnych. Nie ma jednak pełnej dominacji nad Claude: Fable 5.1 wygrywa np. w HLE z narzędziami, a w tabeli OpenAI ma też wyższy wynik Artificial Analysis Intelligence Index. Porównanie powinno więc dotyczyć konkretnego procesu, nie marki modelu. [1][6]
Co naprawdę zmieniło się względem GPT-5.6 Sol?
Względem GPT-5.6 Sol zmienia się nie tylko jakość. Astra ma inne poziomy rozumowania, wyższą cenę za token, nowe możliwości asynchronicznych narzędzi i sterowania w trakcie odpowiedzi, mocniejszy długi kontekst oraz znacznie wyższy poziom zdolności cybernetycznych. Migracja produkcyjna powinna obejmować ponowne testy promptów, narzędzi, kosztów i zasad bezpieczeństwa, a nie tylko podmianę nazwy modelu. [2][3][4][11]

