Lanzamiento y disponibilidad: GPT-6 Astra salió el 3 de septiembre de 2026
OpenAI anunció GPT-6 Astra el 3 de septiembre de 2026. Al inicio estuvo limitado a determinadas organizaciones y la ampliación a planes de pago y API se prometió para los días siguientes. Reuters y Microsoft confirman el despliegue gradual. [1][7][8]
Especificaciones: 1,05M de contexto y 128K de salida
| Parámetro | GPT-6 Astra |
|---|---|
| Ventana de contexto | 1,050,000 tokens |
| Salida máx. | 128,000 tokens |
| fecha límite del conocimiento | Apr 30, 2026 |
| Entrada | text + images |
| Salida | text |
| Razonamiento | low / medium / high / xhigh / max |
La documentación API indica 1.050.000 tokens de contexto, 128.000 de salida máxima y fecha límite del conocimiento del 30 de abril de 2026. Acepta texto e imágenes y genera texto. [2][11]
Precio API: $10 entrada, $50 salida y el umbral de 272K
| Parámetro | Precio / MTok |
|---|---|
| Entrada | $10.00 |
| Entrada en caché | $1.00 |
| Escritura caché | $12.50 |
| Salida | $50.00 |
| >272K entrada | 2× entrada/cache; 1.5× salida |
| Batch / Flex | 50% of Standard |
| Fast | 2× applicable rates |
Standard cuesta $10/MTok de entrada, $1/MTok de entrada en caché, $12.50/MTok de escritura en caché y $50/MTok de salida. Por encima de 272K tokens de entrada, toda la solicitud se factura a 2× entrada/caché y 1,5× salida. Batch y Flex cuestan 50% de Standard; Fast, 2×. [2]
Niveles de esfuerzo de razonamiento: low, medium, high, xhigh y max
`reasoning.effort` admite `low`, `medium`, `high`, `xhigh` y `max`. `none` no está disponible; para migrar desde `none` o `minimal`, OpenAI recomienda comenzar con `low`. [2][3]
Migrar desde GPT-5.6 es más que cambiar el model ID
El model ID es `gpt-6-astra`, pero el uso de herramientas requiere Responses API. OpenAI también pide eliminar parámetros no compatibles como `temperature`, `top_p`, `top_logprobs` y, en Chat Completions, `logprobs`. [3]
- Cambiar el model ID a `gpt-6-astra`.
- Usar Responses API para invocación de herramientas.
- Eliminar `temperature`, `top_p`, `top_logprobs`; en Chat Completions también `logprobs`.
- Si usabas `none` o `minimal`, empezar a probar con `low`.
- Revisar Fast mode por separado: no está disponible con EU data residency.
Uso del ordenador: Agents’ Last Exam, OSWorld y ScreenSpot-Pro
OpenAI informa 59,3% en Agents’ Last Exam, 72,6% en OSWorld 2.0 offline partial y 92,7% en ScreenSpot-Pro sin herramientas. En simulaciones OSWorld también logró más rendimiento con aproximadamente 47% menos tiempo por tarea que GPT-5.6 Sol. [1]
Trabajo profesional: AutomationBench, BenchCAD y BrowseComp
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59.3% | 53.6% | — | 55.5% |
| OSWorld 2.0 offline partial | 72.6% | 65.7% | — | 70.2% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| HLE with tools | 57.2% | — | 65.0% | 63.6% |
Astra logra 41,4% en AutomationBench frente a 18,1% de GPT-5.6 Sol y 31,4% de Claude Fable 5.1. BenchCAD llega a 95,9% y BrowseComp a 91,5%. Son configuraciones de lanzamiento publicadas por OpenAI. [1]
Programación: Terminal-Bench 4.0, DeepSWE y FrontierCode
En Terminal-Bench 4.0 alcanza 57,9%, en DeepSWE v1.1 74,1% y en FrontierCode 1.1 Extended 64,5%. La ventaja varía por benchmark y algunos modelos rivales siguen muy cerca o por encima en pruebas concretas. [1]
Ciencia y matemáticas: resultados muy altos sin dominio total
Astra obtiene 64,6% en Terminal-Bench Science 0.1, 97,6% en FrontierMath Tier 4 (v2) y 96,0% en GPQA Diamond. En Humanity’s Last Exam con herramientas obtiene 57,2%, por debajo de Fable 5.1 con 65,0% y Opus 5 con 63,6%. [1]
Contexto largo: MRCR hasta 1M tokens
En OpenAI MRCR v2 alcanza 100,0% entre 256K–512K y 96,3% entre 512K–1M. Para producción hay que sumar el multiplicador de precio una vez superados 272K tokens de entrada. [1][2]
ARC-AGI-3: por qué el 99,9% necesita contexto metodológico
El 99,9% de ARC-AGI-3 usa Provider Adapter, que conserva el estado de razonamiento y admite compaction. ARC Prize publica 62,7% con su harness Standard y 99,9% con el adaptador; Astra utilizó menos acciones que la mediana humana en 96% de los niveles. [1][5]
Artificial Analysis: mejor programación, precio alto
Artificial Analysis puntúa Astra `max` con 61 en Intelligence Index y 67 en Coding Agent Index. Sus pruebas muestran un fuerte aumento de eficiencia de tokens en programación, pero el mayor precio por token hace que el coste por tarea sea superior al de GPT-5.6 Sol en el índice general a esfuerzo máximo. [6]
Ciberseguridad: primer modelo OpenAI en nivel Critical
OpenAI clasifica Astra como su primer modelo en nivel Critical de ciberseguridad. Sin salvaguardas de producción logró 100% en ExploitBench, 42,4% en ExploitGym y 88,0% en SRE-Bench al primer intento; la System Card describe además capacidades avanzadas de zero-day. [1][4]
Seguridad y monitorización: mejor comportamiento, razonamiento más difícil de vigilar
La System Card muestra dos aspectos: Astra está mejor alineado en general, pero su proceso de razonamiento escrito escrita es más difícil de monitorizar que la de GPT-5.6 Sol en pruebas diseñadas para intentar evadir la supervisión. OpenAI recalca que eran condiciones adversarias. [4]
Resistencia a inyección de instrucciones y respeto del alcance
OpenAI informa mejor resistencia a inyección de instrucciones y mayor respeto por los límites autorizados. En una simulación de más de 54.000 tareas internas de Codex, Astra recibió aproximadamente la mitad de alertas por conductas desalineadas graves que GPT-5.6 Sol. [4]
Nuevas funciones API: herramientas asíncronas y mid-turn steering
Astra incorpora async invocación de herramientas, mid-turn steering y cambios de razonamiento mediante `configuration_update` sin reescribir el prefijo original. Son funciones útiles para agentes que esperan herramientas lentas o reciben nuevas instrucciones. [3]
Codex y memoria entre ventanas de contexto
En Codex, OpenAI prueba notas persistentes entre ventanas de contexto. Las ventanas anteriores siguen siendo buscables para recuperar requisitos o resultados de pruebas que no quedaron en un resumen compacto. [1]
Retención de datos: ZDR y Private Safety Processing
OpenAI declara Zero Data Retention para clientes API elegibles. También prueba Private Safety Processing para detectar patrones de seguridad entre interacciones relacionadas sin exponer el contenido subyacente al personal de OpenAI. [1][9]
Despliegue en ChatGPT, API, Azure y Bedrock
Astra está anunciado para Plus, Pro, Business, Enterprise, API, Microsoft Azure y Amazon Bedrock. Astra Pro llegará a Pro, Business y Enterprise, pero el lanzamiento no publica un ID de API ni precio API separados para esa variante. [1][8]
GPT-6 Astra vs GPT-5.6 Sol y Claude: dónde está la ventaja real
Las mayores ventajas frente a GPT-5.6 Sol aparecen en tareas agentivas, uso del ordenador, Terminal-Bench Science y varias pruebas profesionales. No domina a Claude en todo: Fable 5.1 supera a Astra en HLE con herramientas y en el Artificial Analysis Intelligence Index mostrado por OpenAI. [1][6]
¿Qué cambió realmente respecto a GPT-5.6 Sol?
Respecto a GPT-5.6 Sol cambian los niveles de razonamiento, el precio por token, las herramientas asíncronas, el steering durante la respuesta, el rendimiento de contexto largo y el nivel de capacidad cyber. Una migración de producción requiere volver a probar prompts, herramientas, costes y seguridad. [2][3][4][11]

