Реліз і доступність: GPT-6 Astra вийшов 3 вересня 2026 року
OpenAI оголосила GPT-6 Astra 3 вересня 2026 року. На старті доступ був обмежений частиною організацій, а ширше розгортання мало відбутися в наступні дні. Reuters і Microsoft підтверджують поетапний розгортання. [1][7][8]
Технічні характеристики: 1,05M контексту та 128K виходу
| Параметр | GPT-6 Astra |
|---|---|
| Вікно контексту | 1,050,000 tokens |
| Макс. вихід | 128,000 tokens |
| межа знань | Apr 30, 2026 |
| Вхід | text + images |
| Вихід | text |
| Міркування | low / medium / high / xhigh / max |
Документація API вказує 1 050 000 токенів контексту, 128 000 максимального виходу та межа знань 30 квітня 2026 року. Модель приймає текст і зображення та повертає текст. [2][11]
Ціна API: $10 вхід, $50 вихід і межа 272K
| Параметр | Ціна / MTok |
|---|---|
| Вхід | $10.00 |
| Кешований вхід | $1.00 |
| Запис у кеш | $12.50 |
| Вихід | $50.00 |
| >272K вхід | 2× вхід/cache; 1.5× вихід |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Standard коштує $10/MTok входу, $1/MTok кешований вхід, $12.50/MTok запис у кеш і $50/MTok виходу. Понад 272K вхідних токенів весь запит тарифікується як 2× вхід/cache і 1,5× вихід. Batch і Flex — 50% Standard, Fast — 2×. [2]
Рівні міркування: low, medium, high, xhigh і max
`reasoning.effort` підтримує `low`, `medium`, `high`, `xhigh` і `max`. `none` не підтримується; при міграції з `none` або `minimal` OpenAI радить почати з `low`. [2][3]
Міграція з GPT-5.6 — це більше, ніж зміна model ID
Model ID — `gpt-6-astra`, але виклик інструментів потребує Responses API. OpenAI також радить прибрати непідтримувані параметри `temperature`, `top_p`, `top_logprobs` і для Chat Completions — `logprobs`. [3]
- Змініть model ID на `gpt-6-astra`.
- Для виклик інструментів використовуйте Responses API.
- Приберіть `temperature`, `top_p`, `top_logprobs`; у Chat Completions також `logprobs`.
- Якщо використовували `none` або `minimal`, почніть тестування з `low`.
- Fast mode перевіряйте окремо: він недоступний для Astra з EU data residency.
Керування комп’ютером: Agents’ Last Exam, OSWorld і ScreenSpot-Pro
OpenAI повідомляє 59,3% на Agents’ Last Exam, 72,6% на OSWorld 2.0 offline partial і 92,7% на ScreenSpot-Pro без інструментів. У симуляціях OSWorld Astra також показала вищий результат приблизно за на 47% менший час на задачу, ніж GPT-5.6 Sol. [1]
Професійна робота: AutomationBench, BenchCAD і BrowseComp
| Бенчмарк | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
Astra має 41,4% на AutomationBench проти 18,1% у GPT-5.6 Sol і 31,4% у Claude Fable 5.1. BenchCAD — 95,9%, BrowseComp — 91,5%. Це запуск-конфігурації, опубліковані OpenAI. [1]
Програмування: Terminal-Bench 4.0, DeepSWE і FrontierCode
Terminal-Bench 4.0: 57,9%, DeepSWE v1.1: 74,1%, FrontierCode 1.1 Extended: 64,5%. Різниця залежить від бенчмарка, і деякі конкуренти залишаються близько або вище. [1]
Наука й математика: дуже сильні результати без повного домінування
Astra показує 64,6% на Terminal-Bench Science 0.1, 97,6% на FrontierMath Tier 4 (v2) і 96,0% на GPQA Diamond. На Humanity’s Last Exam з інструментами Astra має 57,2%, Fable 5.1 — 65,0%, а Opus 5 — 63,6%. [1]
Довгий контекст: MRCR до 1M токенів
OpenAI MRCR v2 показує 100,0% у діапазоні 256K–512K і 96,3% у 512K–1M. У продакшені потрібно враховувати вищу ціну понад 272K вхідних токенів. [1][2]
ARC-AGI-3: чому 99,9% потребує методологічного контексту
Результат 99,9% на ARC-AGI-3 використовує Provider Adapter, який зберігає міркування state і підтримує compaction. ARC Prize повідомляє 62,7% зі Standard harness і 99,9% з adapter; Astra використала менше дій, ніж медіанний учасник-людина, на 96% рівнів. [1][5]
Artificial Analysis: сильніше програмування, висока ціна
Artificial Analysis оцінює Astra `max` у 61 бал на Intelligence Index і 67 на Coding Agent Index. Незалежний тест показує значну ефективність токенів у програмуванні, але через вищу ціну токенів — вищу вартість задачі, ніж у GPT-5.6 Sol, на загальному індексі при максимальному рівні міркування. [6]
Кібербезпека: перша модель OpenAI на рівні Critical
OpenAI класифікує Astra як свою першу модель на рівні Critical для кібербезпеки. Без production захисні механізми вона отримала 100% на ExploitBench, 42,4% на ExploitGym і 88,0% на SRE-Bench з першої спроби; System Card також описує просунуті zero-day можливості. [1][4]
Безпека та моніторинг: краща поведінка, складніший нагляд за міркування
System Card показує подвійний результат: Astra загалом краще узгоджена, але її письмову письмовий процес міркування складніше моніторити, ніж у GPT-5.6 Sol, у тестах, спрямованих на ухилення від нагляду. OpenAI підкреслює навмисно ворожий характер цих тестів. [4]
Стійкість до впровадження шкідливих інструкцій і дотримання меж задачі
OpenAI повідомляє кращу стійкість до впровадження шкідливих інструкцій і краще дотримання дозволених меж. У симуляції понад 54 000 внутрішніх задач Codex Astra отримала приблизно вдвічі менше flag за серйозніший misalignment, ніж GPT-5.6 Sol. [4]
Нові можливості API: асинхронні інструменти та mid-turn steering
Astra додає async виклик інструментів, mid-turn steering і зміну міркування через `configuration_update` без переписування початкового prompt prefix. Це корисно для агентів, які чекають повільні інструменти або отримують нові інструкції. [3]
Codex і робоча пам’ять між вікнами контексту
У Codex OpenAI тестує постійні нотатки між вікнами контексту. Старі вікна залишаються доступними для пошуку, щоб відновити вимоги або результати тестів, яких немає в стислому підсумку. [1]
Зберігання даних: ZDR і Private Safety Processing
OpenAI заявляє Zero Data Retention для відповідних API-клієнтів. Також тестується Private Safety Processing для виявлення ризиків між пов’язаними взаємодіями без розкриття змісту персоналу OpenAI. [1][9]
Розгортання в ChatGPT, API, Azure і Bedrock
Astra оголошена для Plus, Pro, Business, Enterprise, API, Microsoft Azure і Amazon Bedrock. Astra Pro має бути доступна для Pro, Business і Enterprise, але на старті не опубліковано окремого публічного API ID чи ціни. [1][8]
GPT-6 Astra vs GPT-5.6 Sol і Claude: де перевага реальна
Найбільші переваги над GPT-5.6 Sol видно в агентних задачах, керування комп’ютером, Terminal-Bench Science і кількох професійних тестах. Claude не програє всюди: Fable 5.1 вище на HLE з інструментами та на Artificial Analysis Intelligence Index у таблиці OpenAI. [1][6]
Що насправді змінилося порівняно з GPT-5.6 Sol?
Порівняно з GPT-5.6 Sol змінюються міркування-рівні, ціна за токен, async-інструменти, steering під час відповіді, long-context результати та кіберрівень. Продакшен-міграція потребує нових тестів промптів, інструментів, витрат і безпеки. [2][3][4][11]

