El 24 de julio de 2026, Anthropic lanzó Claude Opus 5, un nuevo modelo de su gama Opus, destinado principalmente a programación agéntica compleja, procesos largos de varias etapas y trabajo enterprise exigente.[1]
El nombre oficial del modelo es Claude Opus 5, no “Claude Opus 5.0”. El identificador usado en la API es:
claude-opus-5
Opus 5 no sustituye a Claude Fable 5 como el modelo público más capaz de Anthropic. El fabricante lo presenta más bien como un modelo que se acerca a las capacidades de Fable 5 con menor precio y una latencia moderada, no la más lenta de la oferta.[2]
La noticia más importante para los usuarios de Opus 4.8 es que el precio base no ha subido:
- 5 USD por millón de tokens de entrada,
- 25 USD por millón de tokens de salida.[3]
Al mismo tiempo, Opus 5 incorpora razonamiento adaptativo activado por defecto, un nuevo nivel máximo de esfuerzo max, contexto de hasta un millón de tokens, un máximo estándar de 128.000 tokens de salida y nuevos mecanismos para agentes de larga duración.[2][4]
Conclusión rápida: Claude Opus 5 es sobre todo una gran actualización para equipos que delegan tareas completas al modelo, no solo fragmentos de código. Sin embargo, no todas las aplicaciones se beneficiarán de la migración, porque Sonnet 5 sigue siendo mucho más barato y Fable 5 mantiene la primera posición de la gama por capacidad máxima.
La información y la documentación se verificaron el 24 de julio de 2026.
TL;DR
| Pregunta | Respuesta |
|---|---|
| ¿Cuándo se lanzó? | 24 de julio de 2026 |
| ¿Cuál es el nombre oficial? | Claude Opus 5 |
| ¿Cuál es el identificador de API? | claude-opus-5 |
| ¿Cuánto cuesta? | 5 USD / MTok de entrada y 25 USD / MTok de salida |
| ¿Ha subido el precio respecto a Opus 4.8? | No |
| ¿Qué tamaño tiene el contexto? | 1 millón de tokens |
| ¿Cuál es la salida estándar máxima? | 128.000 tokens |
| ¿El razonamiento está activado por defecto? | Sí |
| ¿Qué niveles de effort admite? | low, medium, high, xhigh, max |
| ¿Sustituye a Fable 5 como modelo más capaz? | No |
| ¿Desaparece Opus 4.8? | No, sigue disponible |
| ¿Dónde está disponible? | Claude, Claude Code, API, AWS, Google Cloud y Microsoft Foundry |
| ¿Existe Fast mode? | Sí, como research preview |
| ¿Todos los benchmarks son independientes? | No, la mayoría de resultados del lanzamiento proceden de Anthropic o sus socios |
1. ¿Qué es Claude Opus 5?
Anthropic describe Opus 5 como un modelo para:
- programación agéntica compleja,
- trabajo con repositorios grandes,
- ciclos largos de uso de herramientas,
- resolución de problemas de varias etapas,
- análisis de documentos y datos,
- trabajo de oficina,
- coordinación de varios agentes,
- creación y mejora de interfaces y materiales visuales.[4]
Opus 5 se sitúa entre Sonnet 5 y Fable 5:
Sonnet 5
Modelo más rápido y barato para trabajo a gran escala
Opus 5
Modelo para tareas agénticas y enterprise difíciles
Fable 5
Máxima capacidad pública disponible de Anthropic
Anthropic recomienda empezar por Opus 5 cuando una aplicación realiza programación agéntica compleja o trabajo enterprise. Fable 5 debe elegirse cuando se necesita la máxima capacidad disponible, independientemente del coste superior.[2]
2. Especificaciones técnicas principales
| Parámetro | Claude Opus 5 |
|---|---|
| ID de API | claude-opus-5 |
| Contexto | 1.000.000 tokens |
| Salida estándar máxima | 128.000 tokens |
| Razonamiento | Adaptativo, activado por defecto |
| Niveles de effort | low, medium, high, xhigh, max |
| Precio de entrada | 5 USD / MTok |
| Precio de salida | 25 USD / MTok |
| Precio de Batch API | 2,50 USD / MTok de entrada, 12,50 USD / MTok de salida |
| Fast mode | 10 USD / MTok de entrada, 50 USD / MTok de salida |
| Reliable knowledge cutoff | mayo de 2026 |
| Training data cutoff | mayo de 2026 |
| Imagen como entrada | sí |
| Texto como salida | sí |
Los datos de contexto, precios y fechas límite proceden del resumen oficial de modelos y de la documentación de precios de Anthropic.[2][3]
Un millón de tokens es el valor por defecto
En Opus 5, el contexto de un millón de tokens es tanto el valor por defecto como el máximo. No existe una variante separada con un contexto menor.[4]
Esto no significa que toda la información de un prompt muy largo se utilice con la misma precisión. La capacidad máxima no garantiza recuperación perfecta, razonamiento sin errores ni memoria absoluta de cada detalle.
Salida estándar de hasta 128.000 tokens
Las llamadas estándar a Messages API pueden generar hasta 128.000 tokens. Anthropic también documenta una salida experimental de hasta 300.000 tokens en Message Batches API usando el header beta correspondiente.[5]
Está pensado, entre otros, para:
- documentación muy larga,
- extracciones extensas de datos,
- grandes esqueletos de código,
- borradores de longitud similar a un libro,
- procesos de razonamiento prolongados.
Generar una respuesta tan grande puede tardar más de una hora y no está disponible en Messages API síncrona estándar.[5]
3. Thinking está activado por defecto
Es uno de los cambios de migración más importantes.
En Opus 4.8, una petición sin el campo thinking se ejecutaba sin razonamiento adicional. En Opus 5, la misma petición inicia razonamiento adaptativo. El modelo decide cuándo y durante cuánto tiempo analizar el problema.[4]
Ejemplo básico:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=16_000,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Analiza la arquitectura del proyecto y propone un plan de migración."
}
],
)
print(response.content)
No es necesario añadir:
thinking={"type": "adaptive"}
porque ya es el comportamiento predeterminado. La configuración explícita sigue siendo compatible.
Cinco niveles de effort
Opus 5 admite:
low
medium
high
xhigh
max
max es el nivel más alto de test-time compute y no requiere header beta.[4]
Un effort superior puede mejorar la calidad en tareas difíciles, pero normalmente implica:
- más consumo de tokens,
- mayor coste,
- mayor latencia,
- más operaciones con herramientas,
- más trabajo realizado por subagentes.
Por eso no debe configurarse max automáticamente en todas las solicitudes.
4. ¿Cuándo puede desactivarse thinking?
Opus 5 permite desactivar thinking solo con:
low,medium,high.
La combinación:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "xhigh"}
}
o:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "max"}
}
devuelve un error HTTP 400.[4]
Es un cambio incompatible con Opus 4.8.
Anthropic también advierte que, con thinking desactivado, Opus 5 puede ocasionalmente:
- escribir una llamada de herramienta como texto normal en lugar de un bloque
tool_use, - incluir marcadores XML internos en la respuesta visible.
Anthropic recomienda mantener thinking activado y controlar el coste mediante un nivel de effort inferior, salvo que la integración necesite otro comportamiento.[4]
5. ¿Qué ha mejorado realmente respecto a Opus 4.8?
Según la documentación de Anthropic, las mejoras principales afectan a:
- razonamiento profundo,
- programación agéntica,
- tareas de larga duración,
- escalado de calidad con effort,
- code review y detección de errores,
- análisis visual,
- trabajo con contexto largo,
- documentos, hojas de cálculo y presentaciones,
- coordinación multiagente.[4]
Tareas más largas y menos trabajo sin terminar
Anthropic afirma que Opus 5 mantiene mejor el objetivo en ciclos largos de herramientas y completa con mayor frecuencia:
- funciones repartidas entre varios archivos,
- grandes refactorizaciones,
- tareas end-to-end,
- trabajos que requieren pruebas y verificación.
El fabricante destaca una reducción de placeholders y fragmentos incompletos.[4]
Verificación automática
Opus 5 comprueba sus propios resultados con mayor frecuencia. La guía de migración incluso recomienda eliminar instrucciones repetidas como:
Asegúrate de verificar tu trabajo al final.
Usa un subagente separado para revisarlo.
Mantenerlas puede provocar verificación excesiva, más llamadas a herramientas y costes innecesarios.[4]
Mayor delegación a subagentes
En entornos multiagente, el modelo divide y delega tareas con más frecuencia. Puede ser útil, pero requiere:
- límites de presupuesto,
- seguimiento del número de llamadas,
- control de permisos de herramientas,
- protección frente a edición simultánea de los mismos archivos.
6. Benchmarks: ¿qué anunció Anthropic?
En el lanzamiento, Anthropic anunció que Opus 5 alcanzaba sus mejores resultados en programación y knowledge work, entre otros en Frontier-Bench y GDPval-AA.[1]
Hay que mantener el contexto correcto:
- algunas evaluaciones son internas,
- el fabricante o un socio eligió la configuración y el harness,
- los resultados pueden depender del effort,
- el coste por tarea depende de los tokens usados,
- no todos los benchmarks tienen conjuntos públicos y fácilmente reproducibles,
- no son certificaciones independientes de calidad.
Frontier-Bench v0.1
Anthropic afirma que Opus 5:
- ocupa el primer puesto en Frontier-Bench v0.1,
- logra más del doble que Opus 4.8,
- con menor coste por tarea.[1]
En una nota, Anthropic explica que se trata de una ejecución interna con el harness mini-SWE-agent, backend GKE y promedio de cinco intentos por tarea. Cuando el safety classifier rechazaba una petición, Opus 4.8 se usaba como fallback.[1]
Esta limitación metodológica debe acompañar al resultado.
CursorBench 3.2
Con effort max, Opus 5 habría quedado a 0,5 puntos porcentuales del mejor resultado de Fable 5, aproximadamente a la mitad del coste por tarea.[1]
Es un dato útil para valorar precio-calidad, pero procede de pruebas publicadas por Anthropic y su socio, no de una entidad neutral.
ARC-AGI 3
Anthropic informa de un resultado aproximadamente tres veces superior al siguiente modelo de la tabla.[1]
Eso no equivale a “tres veces más inteligente”. El benchmark mide un tipo concreto de resolución de problemas nuevos, no inteligencia general.
Zapier AutomationBench
Según Anthropic, el pass rate de Opus 5 fue aproximadamente 1,5 veces superior al siguiente modelo con un coste similar por tarea. Incluso el nivel de effort más bajo habría superado a los demás modelos en número de tareas completadas.[1]
OSWorld 2.0
En el benchmark de uso de ordenador, Opus 5 habría conseguido la mejor relación rendimiento-coste y superado el mejor resultado de Fable 5 por algo más de un tercio de su coste.[1]
Investigación científica
Anthropic informa de mejoras respecto a Opus 4.8 en todas sus evaluaciones de life sciences, entre ellas:
- 10,2 puntos porcentuales en una prueba interna de inferencia de estructuras moleculares a partir de datos espectroscópicos,
- 7,7 puntos en tareas que predicen el efecto funcional de cambios en secuencias de proteínas.[1]
Son resultados internos del fabricante, no validación clínica o científica independiente.
7. Opus 5 vs Opus 4.8
| Característica | Opus 4.8 | Opus 5 |
|---|---|---|
| Precio base | 5 / 25 USD por MTok | 5 / 25 USD por MTok |
| Contexto | hasta 1M tokens | 1M por defecto |
| Salida máxima | 128k | 128k |
| Thinking sin configuración | desactivado | activado adaptativamente |
| Effort máximo | rango inferior | max |
| Longitud mínima de prompt cache | 1.024 tokens | 512 tokens |
| Cambios de herramientas durante la conversación | sin función nueva | beta |
| Fallback automático según tipo de rechazo | sin modo nuevo | beta |
| Precio de Fast mode | 10 / 50 USD | 10 / 50 USD |
| Estado | sigue activo | Opus más reciente |
Opus 4.8 no se ha retirado. Según el calendario oficial, ambos modelos siguen activos y Opus 5 no se retirará antes del 24 de julio de 2027.[6]
¿Cuándo conviene quedarse con Opus 4.8?
Puede tener sentido si:
- el prompt y el agente actuales están muy ajustados,
- el equipo no ha completado pruebas de regresión,
- la aplicación supone que thinking está desactivado sin configuración explícita,
- el proceso necesita un estilo estable y conocido,
- los clasificadores de Opus 5 bloquean un flujo legítimo de ciberseguridad,
- la migración no mejora la calidad de forma medible.
8. Opus 5 vs Sonnet 5
| Característica | Sonnet 5 | Opus 5 |
|---|---|---|
| Perfil | velocidad e inteligencia a gran escala | tareas agénticas y enterprise difíciles |
| Precio estándar | 3 / 15 USD por MTok | 5 / 25 USD por MTok |
| Precio promocional de Sonnet | 2 / 10 USD hasta el 31 de agosto de 2026 | sin promoción equivalente |
| Contexto | 1M | 1M |
| Salida máxima | 128k | 128k |
| Thinking | adaptativo | adaptativo |
| Latencia según Anthropic | rápida | moderada |
| Effort máximo | inferior a la escala completa de Opus | max |
Sonnet 5 será mejor para:
- tráfico alto,
- tareas cortas y frecuentes,
- automatización donde manda el coste,
- generación estándar de código,
- clasificación y extracción,
- aplicaciones que necesitan menos latencia.
Opus 5 tiene más sentido cuando una tarea incorrecta o incompleta cuesta más que los tokens adicionales.
9. Opus 5 vs Fable 5
| Característica | Opus 5 | Fable 5 |
|---|---|---|
| Posición | agentic coding difícil y enterprise | máxima capacidad pública |
| Precio | 5 / 25 USD | 10 / 50 USD |
| Contexto | 1M | 1M |
| Salida máxima | 128k | 128k |
| Latencia según Anthropic | moderada | más lenta |
| Thinking | adaptativo | siempre activado |
| Requisito de retención de datos | sin requisito especial para acceso ordinario | 30 días en la API |
| Protecciones cyber | menos restrictivas | clasificadores mucho más fuertes |
Anthropic presenta Opus 5 como un modelo que se acerca a Fable 5 a la mitad de precio.[1]
No significa que siempre lo iguale. La documentación oficial sigue describiendo Fable 5 como el modelo ampliamente disponible más capaz de Anthropic.[2]
¿Dónde puede ser más práctico Opus 5?
- programación diaria,
- code review,
- grandes refactorizaciones,
- workflows enterprise,
- análisis de documentos,
- trabajo legítimo de ciberseguridad con menos rechazos,
- casos donde Fable resulta demasiado caro.
10. Novedades para agentes y API
Cambiar herramientas durante una conversación
En beta, se pueden añadir o quitar herramientas entre turnos sin invalidar prompt cache.[4]
Header necesario:
mid-conversation-tool-changes-2026-07-01
Puede servir cuando un agente:
- empieza con herramientas analíticas,
- recibe después acceso al repositorio,
- termina usando solo pruebas y despliegue.
Permite limitar privilegios en vez de exponer todas las herramientas desde el inicio.
Fallbacks automáticos
El parámetro fallbacks incorpora un modo "default", en el que Anthropic elige un modelo alternativo según la categoría de rechazo.[4]
La función está en beta y exige:
server-side-fallback-2026-07-01
En aplicaciones de Anthropic, algunas peticiones cyber bloqueadas pueden enviarse a Opus 4.8. Un mecanismo similar puede habilitarse en la API.[1]
Prompts más cortos pueden usar cache
La longitud mínima baja de:
1.024 tokens en Opus 4.8
a
512 tokens en Opus 5
Puede reducir el coste de system prompts repetidos e instrucciones agénticas medianas.[4]
11. Fast mode
Opus 5 ofrece Fast mode como research preview.
Anthropic afirma que el modelo funciona aproximadamente 2,5 veces más rápido que en modo estándar.[1]
Precio:
- 10 USD por millón de tokens de entrada,
- 50 USD por millón de tokens de salida.[3]
Es el doble del precio base.
Fast mode está disponible mediante Claude API y usage credits en Claude Code. La documentación indica que actualmente no está disponible mediante Amazon Bedrock, Google Cloud ni Microsoft Foundry.[4]
Solo merece la pena cuando una menor latencia tiene valor empresarial real, por ejemplo:
- pair programming interactivo,
- respuesta a incidentes,
- code review bajo demanda,
- análisis urgente,
- agente con humano en el circuito.
12. Seguridad y limitaciones de ciberseguridad
Anthropic afirma que Opus 5 no amplía la frontera en las capacidades dual-use de mayor riesgo y queda por detrás de Mythos 5 en biología y ciberseguridad ofensiva.[1]
Anthropic no entrenó Opus 5 directamente en tareas cyber. Aun así, mejoró en detección de vulnerabilidades como consecuencia de mejoras generales.
Según Anthropic:
- Opus 5 se acerca a Mythos 5 identificando vulnerabilidades,
- sigue siendo mucho más débil creando exploits funcionales,
- usa clasificadores similares a Opus 4.8,
- incorpora protecciones más fuertes para un rango reducido de tareas cyber.[1]
¿Qué puede bloquearse?
Anthropic menciona:
- escaneo binario de vulnerabilidades,
- algunas pruebas de penetración,
- generación de exploits.
Al mismo tiempo, debe seguir permitiendo usos beneficiosos, como localizar vulnerabilidades en código fuente.[1]
Anthropic estima que los clasificadores de Opus 5 intervendrán aproximadamente un 85 % menos que las protecciones de Fable 5. Es una previsión de Anthropic, no una medición independiente.[1]
Organizaciones e investigadores verificados pueden acceder a una variante menos restringida mediante Cyber Verification Program.
13. ¿Qué dice Anthropic sobre alignment?
En la auditoría automática de comportamiento de Anthropic, Opus 5 obtuvo 2,3 en comportamiento desalineado general. Anthropic lo presenta como el valor más bajo de sus modelos recientes.[1]
Según Anthropic, el modelo:
- sigue mejor Claude Constitution,
- actúa de forma engañosa con menos frecuencia,
- es más difícil de inducir a abusos,
- realiza menos acciones de riesgo difíciles de revertir.
Es una auditoría del fabricante. El resultado no significa que el modelo sea infalible, totalmente seguro o resistente a cualquier prompt injection.
14. Limitaciones de Claude Opus 5
No conoce todo lo posterior a mayo de 2026
Reliable knowledge cutoff y training data cutoff son mayo de 2026.[2]
Para información posterior necesita:
- búsqueda web,
- bases de datos actuales,
- herramientas,
- documentos proporcionados en contexto.
Un millón de tokens no garantiza memoria perfecta
Un contexto grande no elimina:
- detalles omitidos,
- interpretaciones erróneas,
- instrucciones contradictorias,
- degradación en contextos mal organizados,
- distracción por documentos irrelevantes.
Thinking por defecto hace el coste menos predecible
El mismo prompt puede usar distintos tokens según el problema y el effort. Una aplicación debe medir:
- tokens de entrada,
- tokens de salida,
- cache hits,
- tiempo de respuesta,
- llamadas a herramientas,
- coste total de la tarea.
Las respuestas más largas pueden exigir ajustes de prompt
La documentación advierte que las respuestas y documentos pueden ser más largos que en Opus 4.8. El modelo también informa con mayor frecuencia de su progreso.[4]
Para resultados breves hay que definir límites de formato claros.
Benchmark no es producción
Un buen resultado no garantiza:
- corrección en un framework privado,
- conocimiento de APIs internas,
- cumplimiento de estándares de empresa,
- ausencia de regresiones,
- coste estable,
- buen funcionamiento con un agent harness concreto.
15. ¿Cómo migrar de forma segura desde Opus 4.8?
Paso 1: no cambiar sin pruebas
Prepara tareas reales:
- corrección de errores,
- refactorización,
- code review,
- creación de tests,
- análisis de documentos,
- uso de herramientas,
- una tarea de largo horizonte.
Paso 2: actualizar el identificador
Sustituye:
model = "claude-opus-4-8"
por:
model = "claude-opus-5"
Paso 3: revisar thinking
Si la integración anterior no enviaba thinking, el modelo migrado empezará a usar razonamiento adaptativo.
Si thinking debe permanecer desactivado, no configures effort por encima de high.
Paso 4: aumentar max_tokens en tareas difíciles
Thinking y respuesta comparten el mismo límite. Un valor demasiado bajo puede interrumpir el trabajo antes que en Opus 4.8.[4]
Paso 5: eliminar instrucciones de verificación redundantes
Comprueba si el prompt exige revisiones repetidas que Opus 5 ya realiza por sí mismo.
Paso 6: medir el coste de la tarea completa
Compara:
coste de una tarea terminada
tiempo hasta un resultado correcto
número de iteraciones
número de tool calls
número de correcciones manuales
No compares solo el precio por millón de tokens.
Paso 7: mantener un fallback
Opus 4.8 sigue activo y puede servir como:
- fallback ante un rechazo del clasificador,
- protección frente a regresiones,
- modelo estable para prompts existentes,
- alternativa para determinados workflows cyber.
16. ¿Merece la pena cambiar a Claude Opus 5?
Sí, cuando:
- el agente trabaja en muchos archivos,
- el modelo debe actuar durante mucho tiempo sin supervisión continua,
- importan code review y errores sutiles,
- realizas grandes refactorizaciones,
- el modelo usa muchas herramientas y subagentes,
- creas documentos, hojas o presentaciones,
- Opus 4.8 suele terminar solo parte de las tareas,
- Fable 5 es demasiado caro.
No necesariamente, cuando:
- las tareas son cortas y repetitivas,
- Sonnet 5 ya ofrece calidad suficiente,
- la latencia importa más que la precisión máxima,
- no se han realizado pruebas de regresión,
- la aplicación requiere thinking desactivado con effort máximo,
- los workflows cyber son bloqueados,
- la mejora no compensa los tokens adicionales.
17. Veredicto
Claude Opus 5 no es simplemente “Opus 4.8 con un número nuevo”.
Los cambios principales afectan a la forma de trabajar:
- thinking está activado por defecto,
- existe effort
max, - el modelo verifica más sus resultados,
- gestiona mejor tareas largas y de varios archivos,
- coordina más subagentes,
- añade herramientas dinámicas y fallbacks automáticos,
- mantiene el precio de Opus 4.8.
Según la información del fabricante, Opus 5 puede ofrecer una buena relación capacidad-coste para programación difícil y trabajo enterprise. No es la mejor opción sin condiciones:
- Sonnet 5 sigue siendo más económico,
- Fable 5 sigue siendo el modelo ampliamente disponible más capaz de Anthropic,
- la mayoría de benchmarks del lanzamiento proceden de Anthropic o socios,
- toda migración necesita pruebas internas de calidad, coste y seguridad.
La estrategia más sensata es routing:
Sonnet 5
para tareas rápidas y de gran volumen
Opus 5
para procesos difíciles, agénticos y de varias etapas
Fable 5
para los casos más complejos donde la máxima capacidad justifica el coste
18. Checklist antes del despliegue
API
- ID cambiado a
claude-opus-5. - Versión del SDK verificada.
-
max_tokensrevisado. - Thinking por defecto considerado.
- Thinking no desactivado con
xhighomax. - Gestión de HTTP 400 probada.
- Fallback añadido.
- Prompt cache medido.
- Región y proveedor cloud verificados.
Calidad
- Conjunto de evaluación interno preparado.
- Opus 5 comparado con Opus 4.8.
- Opus 5 comparado con Sonnet 5.
- Se mide la tarea correcta, no solo el estilo.
- Repositorios grandes probados.
- Code review probado.
- Frontend e imágenes probados.
- Documentos largos probados.
- Repetibilidad probada en varias ejecuciones.
Coste
- Tokens de entrada medidos.
- Tokens de salida y thinking medidos.
- Cache hits medidos.
- Tool calls contadas.
- Coste total por tarea medido.
- Modo estándar comparado con Fast mode.
-
low,medium,high,xhighymaxcomparados. - Límites de presupuesto para subagentes definidos.
Seguridad
- Permisos de herramientas revisados.
- Operaciones destructivas limitadas.
- Cambios de producción sujetos a aprobación.
- Prompt injection probada.
- Clasificadores cyber probados.
- Logging y auditoría del agente verificados.
- La autoverificación del modelo no se considera auditoría independiente.

