Muse Spark 1.2 y Muse Code: benchmarks, precios y comparación con Claude Opus 5, GPT-5.6, Kimi K3 y Grok 4.5 Skip to content

Muse Spark 1.2 y Muse Code: benchmarks, precios y comparación con Claude Opus 5, GPT-5.6, Kimi K3 y Grok 4.5

El 5 de agosto de 2026, Meta presentó Muse Spark 1.2 y Muse Code, un agente de programación para terminal disponible en beta. Muse Spark 1.2 es una actualización centrada principalmente en programación, depuración compleja, comprensión de grandes bases de código y ejecución de tareas de ingeniería de software de varios pasos de principio a fin.

Publicado Escrito por Tiempo de lectura 24 min de lectura
X LinkedIn

El 5 de agosto de 2026, Meta presentó Muse Spark 1.2 y Muse Code, un agente de programación para terminal disponible en beta. Muse Spark 1.2 es una actualización centrada principalmente en programación, depuración compleja, comprensión de grandes bases de código y ejecución de tareas de ingeniería de software de varios pasos de principio a fin.

En esta página
  1. 1TL;DR
  2. 21. ¿Qué publicó exactamente Meta?
  3. 32. Muse Code no es solo un wrapper sencillo sobre el modelo
  4. 43. El modelo y el agente se entrenaron juntos
  5. 54. Self-improvement usando Muse Spark 1.1
  6. 65. Terminal-Bench 2.1 oficial
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Comprobación independiente: Artificial Analysis
  10. 109. Comparación actual de Artificial Analysis
  11. 1110. GDPval-AA v2: la mayor mejora frente a Spark 1.1
  12. 1211. Terminal-Bench según Artificial Analysis
  13. 1312. Alucinaciones: el dato mejora, pero hay que leer la otra mitad de la tabla
  14. 1413. El scientific reasoning no mejoró de forma uniforme
  15. 1514. Precio de la API: uno de los mayores puntos fuertes de Muse Spark 1.2
  16. 1615. Coste por tarea según la medición de lanzamiento de Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Optimización de kernels: más de 1.000 tool calls y hasta 24 horas de trabajo
  23. 2322. Contexto largo: 1 millón de tokens
  24. 2423. ¿Por qué el AA actual es 57 si algunos artículos del lanzamiento muestran 54?
  25. 2524. Standard tier frente a Contributor tier: diferencia importante de privacidad
  26. 2625. ¿Es Muse Spark 1.2 el mejor modelo para programación?
  27. 2726. ¿Qué modelo elegir?
  28. 2827. Cómo hacer un POC justo
  29. 2928. Cómo comparar agentes, no solo modelos
  30. 3029. Checklist de producción para Muse Spark 1.2
  31. 3130. Veredicto de POLPROG

El modelo no se publicó con pesos abiertos. Artificial Analysis clasifica Muse Spark 1.2 como modelo proprietary y el número de parámetros no se ha revelado públicamente.[3]

La parte más interesante del lanzamiento no es solo el nombre del modelo. Meta entrenó Muse Spark 1.2 junto con Muse Code y lo optimizó para un entorno agentic real: planificación, compaction del contexto, subagentes, uso de herramientas y tareas largas que abarcan repositorios completos.[1]

Los resultados son sólidos, pero requieren una interpretación cuidadosa.

En la evaluación oficial de Meta:

  • Muse Spark 1.2 + Muse Code obtiene 82,9% en Terminal-Bench 2.1,
  • 59,3% en DeepSWE 1.1,
  • 70,6% en Meta Internal Coding Bench.[1][2]

Eso no significa que Muse Spark 1.2 sea el mejor modelo de programación del mercado. En las mismas tablas, Claude Opus 5 + Claude Code ocupa el primer puesto en las tres comparaciones. Además, Meta reconoce que no es una comparación perfecta modelo a modelo: cada modelo se ejecutó con un agente distinto y la configuración de prueba pudo estar mejor adaptada a Muse Code que a las herramientas de la competencia.[2]

Artificial Analysis ofrece una visión más independiente. En la ficha actual del modelo revisada el 7 de agosto, Muse Spark 1.2 con xhigh obtiene 57 puntos en Artificial Analysis Intelligence Index v4.1.1. Como referencia, Claude Opus 5 tiene 61, GPT-5.6 Sol 59, Kimi K3 57 y GPT-5.6 Terra 55.[3][7][8][9][10]

Conclusión breve: Muse Spark 1.2 no supera de forma general a Opus 5 ni a GPT-5.6 Sol, pero es excepcionalmente competitivo en precio. Su perfil más fuerte es la programación agentic, sobre todo junto con Muse Code y cuando el coste de sesiones largas importa.

Todos los datos de este artículo se verificaron con materiales de Meta, la metodología oficial de evaluación, Artificial Analysis y cobertura de prensa independiente. Estado a 7 de agosto de 2026.

TL;DR

Pregunta Respuesta verificada
¿Cuándo se lanzó Muse Spark 1.2? 5 de agosto de 2026
¿Quién creó el modelo? Meta
¿Qué es Muse Code? Agente de programación para terminal en beta
¿Muse Spark 1.2 tiene pesos abiertos? No, el modelo es proprietary
¿Conocemos el número de parámetros? No, Meta no lo ha publicado
Contexto 1 millón de tokens
Modalidades texto e imagen como entrada, texto como salida
Precio estándar input 1,25 USD / 1 M de tokens
Precio cached input 0,15 USD / 1 M de tokens
Precio output 4,25 USD / 1 M de tokens
Terminal-Bench 2.1 según Meta 82,9%
DeepSWE 1.1 según Meta 59,3%
Meta Internal Coding Bench 70,6%
AA Intelligence Index v4.1.1 actual 57
AA Index en el artículo del día del lanzamiento 54
¿Los resultados de Meta son independientes? No, parte son evaluaciones del fabricante
¿Artificial Analysis es independiente de Meta? Sí, aunque Meta dio acceso previo al lanzamiento para benchmarking
Punto más fuerte programación agentic y relación capacidades/precio
Principal limitación no gana todos los benchmarks y algunos tests usan agent harness distintos

1. ¿Qué publicó exactamente Meta?

El lanzamiento incluye dos productos relacionados:

Muse Spark 1.2
modelo

Muse Code
agente de programación para terminal

Meta describe Muse Spark 1.2 como una actualización de Muse Spark 1.1 enfocada en coding. Aumentó el compute empleado durante el entrenamiento en tareas de programación y amplió la variedad de entornos de entrenamiento.[1]

Muse Code es un agente capaz de:

  • planificar cambios en el repositorio,
  • escribir código,
  • ejecutar herramientas,
  • validar resultados,
  • coordinar varios subagentes de larga duración,
  • mantener el progreso durante sesiones largas.[1]

Meta documenta la instalación del cliente oficial en macOS o Linux así:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 está disponible tanto mediante Muse Code como a través de Meta Model API. Meta describe la disponibilidad actual como ampliamente ampliada a nivel global.[1]

2. Muse Code no es solo un wrapper sencillo sobre el modelo

En agentes de programación, el benchmark del modelo y el benchmark del producto no son lo mismo.

Muse Code añade su propia capa de ejecución.

Async Background Agents

El agente principal puede utilizar subagentes especializados que siguen trabajando en segundo plano. No se crean únicamente para un paso y pueden permanecer activos durante toda la sesión.[1]

Esto busca reducir:

  • la recopilación repetida de la misma información,
  • la latencia,
  • la necesidad de dirigir manualmente al agente,
  • el análisis repetido del repositorio.

Append-only event log

Muse Code guarda localmente un historial de:

  • llamadas al modelo,
  • uso de herramientas,
  • aprobaciones,
  • ediciones.[1]

Meta describe el runtime como replay-exact y restart-safe. Tras un fallo, el agente puede continuar a partir del registro en vez de empezar la tarea desde cero.

Es una función importante para tareas de programación de varias horas.

Skills integrados

La versión inicial incluye, entre otros:

/plan
/grill
/goal

/plan prepara un plan con etapa de aprobación, /grill revisa críticamente ese plan y /goal mantiene el trabajo orientado a un objetivo definido.[1]

3. El modelo y el agente se entrenaron juntos

Es uno de los datos más importantes para interpretar los benchmarks.

Meta no se limitó a conectar un modelo nuevo a un CLI existente. La empresa declara haber realizado co-training de Muse Spark 1.2 y Muse Code.[1]

El entrenamiento incluyó, entre otras cosas:

  • trajectories procedentes del agent harness,
  • optimizaciones para trabajo orientado a objetivos,
  • compaction,
  • subagentes,
  • el conjunto integrado de herramientas de Muse Code.[1]

También se entrenó el modelo con tareas de largo horizonte:

  • generación de repositorios completos,
  • grandes proyectos end-to-end,
  • auto-research,
  • secuenciación del trabajo mediante planning,
  • mantenimiento del rumbo con goal conditioning,
  • compresión del contexto.[1]

Esto explica por qué la unidad de comparación adecuada a veces es:

Muse Spark 1.2 + Muse Code

y no únicamente:

Muse Spark 1.2

4. Self-improvement usando Muse Spark 1.1

Meta utilizó Muse Spark 1.1 para construir datos de entrenamiento de la versión 1.2.

Según la descripción oficial, el modelo anterior:

  1. generaba entornos de programación difíciles,
  2. preparaba plantillas de instrucciones complejas,
  3. evaluaba soluciones candidatas,
  4. ayudaba a crear un dataset escalable para Muse Spark 1.2.[1]

Meta llama a este proceso self-improvement loop.

No significa que el modelo “se entrenara solo”. Sigue siendo un pipeline de entrenamiento controlado por Meta, en el que el modelo anterior fue uno de los componentes utilizados para generar y evaluar datos.

5. Terminal-Bench 2.1 oficial

Terminal-Bench 2.1 evalúa agentes que realizan tareas en un entorno de terminal.

Meta usó las 89 tareas de la versión oficial 2.1. Cada intento se ejecutó en un sandbox Daytona aislado y un executable verifier evaluó el estado final del contenedor. La puntuación es la media pass@1 de cinco intentos.[2]

Resultados publicados por Meta

Modelo + agente Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7%
Muse Spark 1.2 + Muse Code xhigh 82,9%
GPT-5.6 Terra + Codex max 81,8%
Grok 4.5 + Grok Build high 81,6%
Gemini 3.6 Flash + Antigravity CLI high 78,9%
Muse Spark 1.1 + mini-swe-agent xhigh 76,2% [1][2]

Muse Spark 1.2 mejora el resultado de su predecesor en 6,7 puntos porcentuales.

A la vez:

  • queda 3,8 pp por detrás de Opus 5,
  • supera a GPT-5.6 Terra en 1,1 pp,
  • supera a Grok 4.5 en 1,3 pp.

La principal advertencia

No es un benchmark puro de los modelos por sí solos.

Los sistemas comparados son:

modelo
+
agente
+
herramientas
+
system prompt
+
runtime

Meta usa:

  • Muse Code para Spark 1.2,
  • Claude Code para Opus 5,
  • Codex para GPT-5.6,
  • Grok Build para Grok 4.5,
  • Antigravity CLI para Gemini.[2]

Meta reconoce que la configuración y los system prompts podrían no haber estado optimizados para los modelos cerrados de la competencia.[2]

Por tanto, la conclusión correcta es:

En la configuración de Meta, Muse Spark 1.2 + Muse Code obtuvo 82,9%.

No:

Muse Spark 1.2 es siempre mejor que GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 contiene 113 tareas de 91 repositorios en cinco lenguajes:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Cada tarea cuenta con un verifier funcional preparado manualmente y tests de regresión.

Durante rollout y grading, el acceso externo a Internet está bloqueado. El endpoint del modelo permanece disponible.[2]

Resultados de Meta

Modelo + agente DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0%
GPT-5.6 Terra + Codex 64,8%
Muse Spark 1.2 + Muse Code 59,3%
Grok 4.5 + Grok Build 56,6%
Muse Spark 1.1 + mini-swe-agent 53,0%
Gemini 3.6 Flash + Antigravity CLI 40,0% [1][2]

Muse Spark 1.2 mejora a 1.1 en 6,3 pp.

Aquí, sin embargo, la distancia con los líderes es mayor:

Opus 5       65,0%
GPT-5.6      64,8%
Muse 1.2     59,3%

Es un resultado sólido, pero no el primer puesto.

Limitación metodológica adicional

El leaderboard oficial de DeepSWE utiliza mini-swe-agent para todos los modelos.

La evaluación de Meta utilizó un producto agent distinto para cada modelo. La empresa indica expresamente que el resultado no es harness-identical con el leaderboard oficial.[2]

Es una información importante que debe acompañar al 59,3%.

7. Meta Internal Coding Bench

Meta Internal Coding Bench contiene 440 tareas procedentes del codebase interno de Meta y pull requests reales.[2]

Incluye:

  • corrección de errores,
  • nuevas funciones,
  • refactoring,
  • cleanup,
  • otras tareas de software engineering.

Internet está desactivado. Las soluciones se compilan y verifican con tests unitarios. Meta ejecuta dos intentos por tarea.[2]

Resultados

Modelo Meta Internal Coding Bench
Claude Opus 5 79,4%
Muse Spark 1.2 70,6%
Muse Spark 1.1 68,3%
GPT-5.6 Terra 65,4%
Gemini 3.6 Flash 63,9% [1][2]

Muse Spark 1.2 mejora al predecesor en 2,3 pp.

¿Por qué este benchmark tiene menos valor externo?

No porque tenga que ser incorrecto.

El problema es la reproducibilidad.

El dataset:

  • es interno,
  • procede del codebase privado de Meta,
  • no es un benchmark público que equipos externos puedan reproducir por su cuenta.

Por eso el resultado debe tratarse como una señal adicional del fabricante, no como una prueba independiente de superioridad.

8. Comprobación independiente: Artificial Analysis

Artificial Analysis recibió acceso a Muse Spark 1.2 antes de su lanzamiento público y ejecutó su propio conjunto de pruebas.[4]

Es importante porque permite separar:

benchmark del fabricante

de:

benchmark de una organización independiente

Cambio importante de puntuación tras el lanzamiento

El artículo de Artificial Analysis del 5 de agosto indicaba:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

La ficha actual del modelo, tras la actualización del índice a v4.1.1, muestra:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Por eso no debe copiarse el 54 en un ranking actual sin indicar la fecha.

Los benchmarks cambian con:

  • versiones del índice,
  • grading,
  • conjuntos de evaluación,
  • correcciones metodológicas.

Un artículo de producción debe indicar siempre el snapshot.

9. Comparación actual de Artificial Analysis

Fichas revisadas el 7 de agosto de 2026:

Modelo AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* La puntuación de Grok 4.5 procede del informe publicado por Artificial Analysis sobre ese modelo. Debe tratarse como un snapshot de la versión correspondiente del benchmark, no como una posición permanente.

¿Qué se deduce?

Muse Spark 1.2:

  • actualmente no alcanza a Opus 5 en el índice general,
  • queda 2 puntos por detrás de GPT-5.6 Sol,
  • empata con Kimi K3 en la ficha actual de AA,
  • supera a GPT-5.6 Terra en el índice general,
  • está por encima del resultado de lanzamiento de Grok 4.5.

Pero Artificial Analysis Intelligence Index no es un benchmark exclusivo de programación.

La versión v4.1.1 combina nueve evaluaciones, entre ellas:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Por eso el 57 debe interpretarse como una señal más amplia de inteligencia y capacidades agentic.

10. GDPval-AA v2: la mayor mejora frente a Spark 1.1

En el snapshot de lanzamiento de Artificial Analysis, GDPval-AA v2 pasó de:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

lo que supone +260 puntos Elo.[4]

GDPval-AA v2 evalúa tareas realistas de trabajo de conocimiento.

Contiene 220 tareas de:

  • 44 profesiones,
  • 9 grandes sectores de la economía estadounidense.[2]

Los modelos crean, entre otros:

  • documentos,
  • hojas de cálculo,
  • presentaciones,
  • diagramas,
  • informes.

Artificial Analysis utiliza su propio agentic harness Stirrup con acceso a shell y navegación web, y compara los resultados por pares mediante un juez LLM.[2]

Snapshot del 5 de agosto

Artificial Analysis indicaba:

Modelo GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

Es una de las mejores señales de que 1.2 mejoró más allá de la generación de código.

El ranking de GDPval se actualiza, por lo que estas cifras no deben mezclarse con snapshots posteriores.

11. Terminal-Bench según Artificial Analysis

Meta informa:

82,9%

para Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis informó en el lanzamiento, con su propio harness:

80%

frente a:

78%

para Muse Spark 1.1.[4]

No son resultados contradictorios.

Provienen de:

  • harness distintos,
  • configuraciones de agentes distintas,
  • procedimientos de ejecución distintos.

Es un buen ejemplo de por qué nunca debe publicarse un benchmark sin su metodología.

12. Alucinaciones: el dato mejora, pero hay que leer la otra mitad de la tabla

Artificial Analysis observó en el snapshot de lanzamiento una mejora de AA-Omniscience:

18 -> 22

y una reducción del hallucination rate:

38% -> 28%

[4]

A primera vista parece inequívocamente positivo.

Pero al mismo tiempo:

attempt rate: 82% -> 67%
accuracy:     41% -> 38%

[4]

El modelo renunciaba con más frecuencia a responder cuando no estaba seguro.

AA-Omniscience no penaliza la abstención. Por tanto, la menor tasa de alucinaciones se debe en parte a una mayor disposición a no responder.

Interpretación correcta:

Muse Spark 1.2 presentó con menos frecuencia una respuesta incorrecta como segura, pero también intentó responder menos veces.

Interpretación incorrecta:

Muse Spark 1.2 se volvió 10 puntos porcentuales más preciso.

Los datos no sostienen esa conclusión.

13. El scientific reasoning no mejoró de forma uniforme

En las mediciones de lanzamiento de Artificial Analysis:

Benchmark Spark 1.1 Spark 1.2 Cambio
CritPt 15% 18% +3 pp
SciCode 58% 56% -2 pp
Humanity's Last Exam 45% 44% -1 pp [4]

Es importante porque muestra la naturaleza de la actualización.

Muse Spark 1.2 no es simplemente:

Spark 1.1
+ unos puntos en todo

Las mayores mejoras del lanzamiento se concentraron en:

  • programación agentic,
  • uso de herramientas,
  • tareas profesionales agentic.

14. Precio de la API: uno de los mayores puntos fuertes de Muse Spark 1.2

Tarifas estándar de Meta:

Tokens Precio por 1 M
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Los precios de input/output son iguales a Muse Spark 1.1.

Comparación de precios públicos de API

Modelo Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

Es una comparación de precio por token, no de coste por tarea completada.

Un modelo más barato por millón de tokens puede:

  • generar más tokens,
  • realizar más tool calls,
  • necesitar más iteraciones,
  • cometer un error que exija reparación manual.

La métrica de negocio más útil es:

coste por tarea correctamente completada

y no solo:

precio por 1M de tokens

15. Coste por tarea según la medición de lanzamiento de Artificial Analysis

En el snapshot del 5 de agosto, Artificial Analysis informó del coste medio ponderado de una tarea del Intelligence Index:

Modelo / configuración Coste por tarea
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

Es un resultado de coste muy bueno para Muse Spark 1.2.

Frente a Spark 1.1, sin embargo, el coste aumentó de:

0,29 USD
a
0,40 USD

Artificial Analysis lo relaciona con un mayor uso de tokens:

  • alrededor de 53% más input tokens,
  • alrededor de 36% más output tokens,

sobre todo en GDPval-AA v2.[4]

Es decir, la versión 1.2 es:

mejor
pero
más intensiva en tokens

El precio unitario de la API no cambió, pero el agente hace más trabajo.

16. Muse Spark 1.2 vs Claude Opus 5

¿Dónde gana Opus 5?

En los datos de Meta:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7% 82,9%
DeepSWE 1.1 65,0% 59,3%
Meta Internal Coding Bench 79,4% 70,6% [1]

En el Artificial Analysis Intelligence Index actual:

Opus 5:     61
Muse 1.2:   57

[3][7]

Los datos disponibles no permiten llamar a Muse Spark 1.2 mejor modelo en términos generales.

¿Dónde tiene ventaja Muse?

Principalmente en el precio:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

En agentes que realizan miles de operaciones, la diferencia puede ser significativa.

Conclusión

Opus 5 es mejor elección cuando:

  • importa más la máxima tasa de éxito que el coste de tokens,
  • la tarea es difícil y el coste del error es alto,
  • el equipo ya trabaja con Claude Code.

Muse Spark 1.2 tiene más sentido cuando:

  • el volumen de tareas es alto,
  • el agente trabaja mucho tiempo sobre un repositorio,
  • el coste de tokens es decisivo,
  • unos pocos puntos de benchmark no justifican una API mucho más cara.

17. Muse Spark 1.2 vs GPT-5.6 Terra

Es una de las comparaciones más interesantes.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9%
Terra + Codex:         81,8%

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3%
Terra + Codex:         64,8%

Meta Internal Coding Bench

Muse 1.2:  70,6%
Terra:     65,4%

[1]

El líder cambia según el benchmark.

Artificial Analysis

Índice general actual:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Precio

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Eso no implica una victoria automática de Muse. Terra es claramente mejor en DeepSWE dentro de la comparación de Meta.

La interpretación más honesta es:

Muse Spark 1.2 es extremadamente competitivo frente a GPT-5.6 Terra en precio y ciertas tareas agentic, pero el ganador depende del tipo de tarea y del harness.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol sigue siendo más fuerte en el índice general de Artificial Analysis:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol cuesta:

5 USD / 1M input
30 USD / 1M output

frente a:

1,25 USD / 1M input
4,25 USD / 1M output

para Muse.[3][8]

Es una diferencia grande para:

  • reasoning traces largos,
  • subagentes,
  • debugging iterativo,
  • refactoring de todo el repositorio,
  • ejecuciones de agentes durante horas.

Si los 2 puntos extra en el índice general no se traducen en una mayor tasa de finalización correcta sobre tareas reales, el modelo más caro no tiene por qué ser más rentable.

19. Muse Spark 1.2 vs Kimi K3

La ficha actual de Artificial Analysis muestra:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

No significa que tengan capacidades idénticas.

Diferencia principal

Kimi K3:

  • tiene pesos disponibles públicamente,
  • puede self-hostearse,
  • posee 2,8 billones de parámetros totales y 104.000 millones activos,
  • utiliza su propia Kimi K3 License.[10]

Muse Spark 1.2:

  • es proprietary,
  • funciona mediante Meta Model API,
  • no tiene un número de parámetros público.[3]

Precios de las API oficiales

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Si el self-hosting no es un requisito, Muse es bastante más barato en precio nominal de API.

Si una organización necesita:

  • infraestructura propia,
  • control sobre los pesos,
  • modificaciones personalizadas del modelo,

Kimi K3 ofrece algo que Muse Spark 1.2 no proporciona actualmente.

20. Muse Spark 1.2 vs Grok 4.5

En Terminal-Bench de Meta:

Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build:      81,6%

En DeepSWE:

Muse Spark 1.2: 59,3%
Grok 4.5:        56,6%

[1]

En Artificial Analysis Intelligence Index del lanzamiento, Grok 4.5 tenía 54, un nivel comparable al snapshot inicial de Muse 1.2 antes de la actualización del índice.[4][11]

Artificial Analysis también señalaba Grok 4.5 high como uno de los pocos modelos con menor coste por tarea en el mismo grupo de calidad:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

Otro ejemplo de que en 2026 la relación precio-calidad ya no sigue una regla simple:

modelo más caro
=
modelo más rentable

21. Optimización de kernels: más de 1.000 tool calls y hasta 24 horas de trabajo

Meta realizó un experimento de largo horizonte interesante.

Muse Code y los modelos debían optimizar iterativamente GPU kernels mediante:

  • más de 1.000 tool calls,
  • hasta 24 horas,
  • escritura de código,
  • compilación,
  • profiling,
  • optimizaciones sucesivas.[1]

Se probaron KDA y MLA sobre NVIDIA Hopper.

KDA

La base era una implementación FLA en Triton. Los modelos no podían importar directamente librerías externas de kernels como FLA.[1]

En el gráfico de speedup final frente al baseline, Meta mostró, entre otros:

Modelo Speedup vs baseline
Claude Opus 5 +74,0%
GPT-5.6 Sol +71,2%
Claude Opus 4.8 +69,6%
Muse Spark 1.2 +68,7%
GPT-5.6 Terra +65,1%
Gemini 3.6 Flash +62,5% [1]

Muse Spark 1.2 no ganó este experimento.

Es relevante porque el material oficial de Meta no presenta su propio modelo como líder en todo.

¿Qué no demuestra este experimento?

No demuestra que:

  • Opus 5 siempre optimice el código un 74%,
  • Muse siempre consiga +68,7%,
  • los resultados se transfieran a cualquier kernel o GPU.

Es un estudio de caso de una tarea, baseline, harness y hardware concretos.

22. Contexto largo: 1 millón de tokens

Artificial Analysis confirma para Muse Spark 1.2:

1M token context window

y:

  • text input,
  • image input,
  • text output.[3]

Un millón de tokens puede importar en:

  • repositorios grandes,
  • monorepos,
  • documentación,
  • historial largo del agente,
  • análisis de muchos archivos.

No significa que convenga volcar todo el repositorio en un prompt.

La capacidad máxima no garantiza:

  • encontrar todas las dependencias,
  • priorizar correctamente,
  • resistir texto malicioso dentro del repositorio,
  • mantener la misma calidad al principio y al final del contexto.

Por eso Muse Code también utiliza context compaction, en lugar de depender únicamente de prompts cada vez más grandes.[1]

23. ¿Por qué el AA actual es 57 si algunos artículos del lanzamiento muestran 54?

No es un error que deba ocultarse.

Artificial Analysis publicó 54 el 5 de agosto.[4]

La ficha actual de Muse Spark 1.2 revisada el 7 de agosto muestra 57 e indica que Artificial Analysis Intelligence Index está en la versión v4.1.1.[3]

Al citar benchmarks conviene conservar:

modelo
+
effort
+
versión del benchmark
+
fecha

Por ejemplo:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
estado: 7 de agosto de 2026

Es mucho mejor que escribir:

Muse Spark 1.2 tiene 57 puntos

sin contexto.

24. Standard tier frente a Contributor tier: diferencia importante de privacidad

El precio estándar de Muse Spark 1.2 es:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta también ofrece un Contributor tier con un descuento importante.

Cobertura independiente de prensa sobre la oferta oficial indica que el precio inferior está ligado al consentimiento para que la actividad del usuario pueda utilizarse para mejorar productos de Meta.[6]

En un entorno empresarial, es una diferencia importante.

Antes de usar Contributor tier para código:

  • privado,
  • sujeto a NDA,
  • que contenga secretos comerciales,
  • propiedad de un cliente,

hay que revisar las condiciones exactas de tratamiento de datos aplicables a la cuenta y al endpoint.

No debe elegirse un endpoint más barato basándose únicamente en el precio.

25. ¿Es Muse Spark 1.2 el mejor modelo para programación?

Según los datos verificados: no hay base para afirmarlo.

No lidera todos los benchmarks de Meta

Opus 5 lidera:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra también supera a Muse en DeepSWE.

Sin embargo, Muse es excepcionalmente fuerte en precio

Muse Spark 1.2 tiene un precio de output muy inferior a:

La descripción más defendible

Muse Spark 1.2 es uno de los modelos más interesantes de 2026 por su relación entre capacidades de agentic coding y precio. Opus 5 sigue siendo más fuerte en las comparaciones de calidad disponibles y la elección final debería salir de un POC propio.

26. ¿Qué modelo elegir?

Elige Muse Spark 1.2 si:

  • el coste de sesiones largas importa mucho,
  • trabajas con repositorios grandes,
  • quieres utilizar Muse Code,
  • el agente debe trabajar mucho tiempo sin dirección manual,
  • necesitas subagentes persistentes,
  • el precio nominal de output debe ser bajo,
  • un rendimiento cercano a frontier es suficiente.

Elige Claude Opus 5 si:

  • la máxima tasa de éxito es prioritaria,
  • el coste de un error supera al coste de tokens,
  • ya usas Claude Code,
  • las tareas son especialmente difíciles,
  • tu POC confirma una mayor completion rate.

Elige GPT-5.6 Terra si:

  • utilizas el ecosistema Codex,
  • las tareas similares a DeepSWE son centrales,
  • necesitas un modelo de coding fuerte más barato que Sol,
  • las herramientas de OpenAI ya forman parte del pipeline.

Elige GPT-5.6 Sol si:

  • necesitas una capacidad general superior a Muse,
  • el coste de API es menos importante,
  • el workload requiere reasoning más amplio que el coding.

Elige Kimi K3 si:

  • necesitas pesos abiertos,
  • planeas self-hosting,
  • necesitas modificar el modelo,
  • aceptas un precio más alto en la API oficial.

Considera Grok 4.5 si:

  • tus pruebas internas muestran una alta eficacia agentic,
  • el coste por tarea completada es la métrica clave,
  • utilizas Grok Build o un harness compatible.

27. Cómo hacer un POC justo

No pruebes modelos con cinco prompts.

Prepara al menos:

50-200 tareas reales

de tu propio repositorio.

Categorías

  • bug fix,
  • nueva función,
  • refactoring,
  • tests,
  • code review,
  • migración de dependencias,
  • optimización de rendimiento,
  • análisis de logs,
  • frontend desde screenshot,
  • cambio a nivel de repositorio,
  • documentación técnica.

Para cada tarea mide

éxito / fallo
tiempo
coste
número de tokens
número de tool calls
intervenciones manuales
regresiones

Métrica principal

No:

¿qué modelo escribió la respuesta más bonita?

Sino:

¿qué modelo entregó con mayor frecuencia un resultado correcto y listo para merge,
con un coste y tiempo aceptables?

28. Cómo comparar agentes, no solo modelos

En:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build,

el modelo no trabaja aislado.

El agente decide:

  • qué archivos leer,
  • cuándo ejecutar tests,
  • cuándo usar grep,
  • si usar un subagente,
  • cómo gestionar el contexto,
  • cuántas iteraciones hacer,
  • cuándo terminar.

Por eso conviene realizar dos pruebas.

Prueba A: modelo en un harness común

mismo agente
mismas herramientas
mismo system prompt
mismos límites

Ayuda a comparar el modelo subyacente.

Prueba B: producto end-to-end

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Ayuda a responder la pregunta práctica:

¿Qué solución es mejor para el equipo?

Ambas pruebas miden cosas distintas.

29. Checklist de producción para Muse Spark 1.2

Benchmarks

  • Se registra la versión del benchmark.
  • Se registra la fecha de la puntuación.
  • Se registra el reasoning effort.
  • Se registra el nombre del agente.
  • Meta Terminal-Bench no se mezcla con el resultado de AA.
  • Meta Internal Coding Bench no se trata como benchmark independiente.
  • Los resultados se verifican en el repositorio propio.

Coste

  • Se mide el input real.
  • Se mide el cached input.
  • Se mide el output.
  • Se mide el coste del reasoning.
  • Se mide el número de tool calls.
  • El coste se calcula por tarea completada.
  • Se comparan al menos tres modelos.
  • Se define un límite de gasto por agente.

Repositorio

  • El agente tiene los permisos mínimos necesarios.
  • Los secretos no están en archivos fácilmente accesibles.
  • El acceso a producción requiere aprobación.
  • El merge requiere review.
  • Los tests se ejecutan automáticamente.
  • El agente no puede saltarse branch protection.
  • Se registran cambios y tool calls.

Datos

  • Se verifican las condiciones de Standard tier.
  • Se verifican las condiciones de Contributor tier.
  • El código del cliente no va al endpoint equivocado.
  • La política de la empresa permite el servicio elegido.
  • Se definen reglas de retención de prompts y logs.
  • Los datos personales están correctamente protegidos.

Calidad

  • El agente ejecuta tests tras cada cambio.
  • Se revisa el diff final.
  • Se miden regresiones.
  • Las tareas largas tienen checkpoints.
  • Se prueba la recuperación tras fallos.
  • Se prueban monorepos grandes.
  • Se prueban tareas de varias horas.

30. Veredicto de POLPROG

Muse Spark 1.2 es un lanzamiento más importante de lo que sugiere el número 1.2.

Meta construyó el modelo y Muse Code como un sistema conectado, centrando el entrenamiento en:

  • repositorios grandes,
  • tareas largas,
  • herramientas,
  • subagentes,
  • planificación,
  • verificación automática.

Los resultados confirman una mejora real frente a Muse Spark 1.1.

Datos más sólidos

Terminal-Bench 2.1
76,2% -> 82,9% en la evaluación de Meta

DeepSWE 1.1
53,0% -> 59,3% en la evaluación de Meta

GDPval-AA v2
1371 -> 1631 Elo en el snapshot de lanzamiento de Artificial Analysis

[1][4]

Pero todavía no lidera en todo

Opus 5 supera a Muse Spark 1.2 en los tres benchmarks de coding mostrados por Meta.

En el snapshot actual de Artificial Analysis:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Entonces, ¿por qué es interesante Muse Spark 1.2?

Porque cuesta:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

Esto hace menos útil la pregunta:

¿Qué modelo tiene el benchmark más alto?

Una pregunta mejor es:

¿Qué modelo ofrece el mayor número de tareas correctamente completadas por cada 100 USD de presupuesto?

En muchos equipos la respuesta puede no coincidir con el modelo que ocupa el primer puesto en una tabla concreta.

Muse Spark 1.2 parece actualmente un candidato muy fuerte para programación agentic a gran escala y con coste controlado.

No es un ganador absoluto.

Pero merece claramente estar en un POC junto con:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 es un lanzamiento más importante de lo que sugiere el número 1.2. Los resultados confirman una mejora real frente a Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Preguntas frecuentes

¿Cuándo salió Muse Spark 1.2?

Meta presentó Muse Spark 1.2 y Muse Code el 5 de agosto de 2026.

¿Muse Spark 1.2 es open source?

No. Artificial Analysis lo clasifica como modelo proprietary y los pesos no están disponibles públicamente.

¿Cuántos parámetros tiene Muse Spark 1.2?

Meta no ha publicado el número de parámetros.

¿Cuál es el contexto?

1 millón de tokens.

¿Admite imágenes?

Sí. Artificial Analysis confirma text + image input y text output.

¿Cuánto cuesta la API?

El precio estándar es 1,25 USD por millón de input tokens, 0,15 USD por millón de cached input tokens y 4,25 USD por millón de output tokens.

¿Muse Spark 1.2 es mejor que Claude Opus 5?

No según los benchmarks generales disponibles ni las comparaciones de Meta. Opus 5 lidera los tres benchmarks de coding mostrados por Meta y tiene un Artificial Analysis Intelligence Index actual más alto.

¿Muse Spark 1.2 es mejor que GPT-5.6 Terra?

Depende de la tarea. Muse lidera Terminal-Bench de Meta y Meta Internal Coding Bench, mientras Terra lidera DeepSWE 1.1. El AA Intelligence Index general actual es superior para Muse.

¿Muse Spark 1.2 es mejor que Kimi K3?

El Artificial Analysis Intelligence Index actual da 57 a ambos. Kimi K3 tiene pesos abiertos y Muse es proprietary. Sus perfiles y costes son diferentes.

¿Por qué se puede encontrar un 54 en Internet mientras aquí aparece 57?

54 procede del artículo de Artificial Analysis del día del lanzamiento. La ficha actual, tras el paso a v4.1.1, muestra 57. En benchmarks hay que indicar siempre versión y fecha.

¿El 82,9% de Terminal-Bench es un resultado independiente?

No. Es un resultado publicado por Meta para Muse Spark 1.2 + Muse Code según la metodología de Meta.

¿Artificial Analysis mide Terminal-Bench de otra forma?

Sí. En el snapshot de lanzamiento de AA, Muse Spark 1.2 obtuvo 80%. Parte de la diferencia viene de usar un harness distinto.

¿Muse Code puede continuar después de un fallo?

Meta describe un append-only event log local que hace al runtime restart-safe y permite reconstruir el estado de trabajo.

¿Muse Spark 1.2 está disponible globalmente?

Meta afirma en el anuncio que Muse Spark 1.2 está disponible mediante Muse Code y Meta Model API con acceso global ampliado.

¿Merece la pena migrar desde Muse Spark 1.1?

Los datos de Meta y Artificial Analysis muestran una mejora clara en agentic coding y GDPval. Aun así, la migración debe comprobarse con workloads propios, porque 1.2 consume más tokens en algunas tareas. ---

Fuentes y notas

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

¿Te ha resultado útil?

Recibe nuevos artículos por email

Un correo breve por cada nuevo artículo de la base de conocimiento. Sin spam, te das de baja con un clic.

Solo usamos tu email para enviar nuevos artículos. Sin compartir con terceros.

Volver a la base de conocimiento