El modelo no se publicó con pesos abiertos. Artificial Analysis clasifica Muse Spark 1.2 como modelo proprietary y el número de parámetros no se ha revelado públicamente.[3]
La parte más interesante del lanzamiento no es solo el nombre del modelo. Meta entrenó Muse Spark 1.2 junto con Muse Code y lo optimizó para un entorno agentic real: planificación, compaction del contexto, subagentes, uso de herramientas y tareas largas que abarcan repositorios completos.[1]
Los resultados son sólidos, pero requieren una interpretación cuidadosa.
En la evaluación oficial de Meta:
- Muse Spark 1.2 + Muse Code obtiene 82,9% en Terminal-Bench 2.1,
- 59,3% en DeepSWE 1.1,
- 70,6% en Meta Internal Coding Bench.[1][2]
Eso no significa que Muse Spark 1.2 sea el mejor modelo de programación del mercado. En las mismas tablas, Claude Opus 5 + Claude Code ocupa el primer puesto en las tres comparaciones. Además, Meta reconoce que no es una comparación perfecta modelo a modelo: cada modelo se ejecutó con un agente distinto y la configuración de prueba pudo estar mejor adaptada a Muse Code que a las herramientas de la competencia.[2]
Artificial Analysis ofrece una visión más independiente. En la ficha actual del modelo revisada el 7 de agosto, Muse Spark 1.2 con xhigh obtiene 57 puntos en Artificial Analysis Intelligence Index v4.1.1. Como referencia, Claude Opus 5 tiene 61, GPT-5.6 Sol 59, Kimi K3 57 y GPT-5.6 Terra 55.[3][7][8][9][10]
Conclusión breve: Muse Spark 1.2 no supera de forma general a Opus 5 ni a GPT-5.6 Sol, pero es excepcionalmente competitivo en precio. Su perfil más fuerte es la programación agentic, sobre todo junto con Muse Code y cuando el coste de sesiones largas importa.
Todos los datos de este artículo se verificaron con materiales de Meta, la metodología oficial de evaluación, Artificial Analysis y cobertura de prensa independiente. Estado a 7 de agosto de 2026.
TL;DR
| Pregunta | Respuesta verificada |
|---|---|
| ¿Cuándo se lanzó Muse Spark 1.2? | 5 de agosto de 2026 |
| ¿Quién creó el modelo? | Meta |
| ¿Qué es Muse Code? | Agente de programación para terminal en beta |
| ¿Muse Spark 1.2 tiene pesos abiertos? | No, el modelo es proprietary |
| ¿Conocemos el número de parámetros? | No, Meta no lo ha publicado |
| Contexto | 1 millón de tokens |
| Modalidades | texto e imagen como entrada, texto como salida |
| Precio estándar input | 1,25 USD / 1 M de tokens |
| Precio cached input | 0,15 USD / 1 M de tokens |
| Precio output | 4,25 USD / 1 M de tokens |
| Terminal-Bench 2.1 según Meta | 82,9% |
| DeepSWE 1.1 según Meta | 59,3% |
| Meta Internal Coding Bench | 70,6% |
| AA Intelligence Index v4.1.1 actual | 57 |
| AA Index en el artículo del día del lanzamiento | 54 |
| ¿Los resultados de Meta son independientes? | No, parte son evaluaciones del fabricante |
| ¿Artificial Analysis es independiente de Meta? | Sí, aunque Meta dio acceso previo al lanzamiento para benchmarking |
| Punto más fuerte | programación agentic y relación capacidades/precio |
| Principal limitación | no gana todos los benchmarks y algunos tests usan agent harness distintos |
1. ¿Qué publicó exactamente Meta?
El lanzamiento incluye dos productos relacionados:
Muse Spark 1.2
modelo
Muse Code
agente de programación para terminal
Meta describe Muse Spark 1.2 como una actualización de Muse Spark 1.1 enfocada en coding. Aumentó el compute empleado durante el entrenamiento en tareas de programación y amplió la variedad de entornos de entrenamiento.[1]
Muse Code es un agente capaz de:
- planificar cambios en el repositorio,
- escribir código,
- ejecutar herramientas,
- validar resultados,
- coordinar varios subagentes de larga duración,
- mantener el progreso durante sesiones largas.[1]
Meta documenta la instalación del cliente oficial en macOS o Linux así:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 está disponible tanto mediante Muse Code como a través de Meta Model API. Meta describe la disponibilidad actual como ampliamente ampliada a nivel global.[1]
2. Muse Code no es solo un wrapper sencillo sobre el modelo
En agentes de programación, el benchmark del modelo y el benchmark del producto no son lo mismo.
Muse Code añade su propia capa de ejecución.
Async Background Agents
El agente principal puede utilizar subagentes especializados que siguen trabajando en segundo plano. No se crean únicamente para un paso y pueden permanecer activos durante toda la sesión.[1]
Esto busca reducir:
- la recopilación repetida de la misma información,
- la latencia,
- la necesidad de dirigir manualmente al agente,
- el análisis repetido del repositorio.
Append-only event log
Muse Code guarda localmente un historial de:
- llamadas al modelo,
- uso de herramientas,
- aprobaciones,
- ediciones.[1]
Meta describe el runtime como replay-exact y restart-safe. Tras un fallo, el agente puede continuar a partir del registro en vez de empezar la tarea desde cero.
Es una función importante para tareas de programación de varias horas.
Skills integrados
La versión inicial incluye, entre otros:
/plan
/grill
/goal
/plan prepara un plan con etapa de aprobación, /grill revisa críticamente ese plan y /goal mantiene el trabajo orientado a un objetivo definido.[1]
3. El modelo y el agente se entrenaron juntos
Es uno de los datos más importantes para interpretar los benchmarks.
Meta no se limitó a conectar un modelo nuevo a un CLI existente. La empresa declara haber realizado co-training de Muse Spark 1.2 y Muse Code.[1]
El entrenamiento incluyó, entre otras cosas:
- trajectories procedentes del agent harness,
- optimizaciones para trabajo orientado a objetivos,
- compaction,
- subagentes,
- el conjunto integrado de herramientas de Muse Code.[1]
También se entrenó el modelo con tareas de largo horizonte:
- generación de repositorios completos,
- grandes proyectos end-to-end,
- auto-research,
- secuenciación del trabajo mediante planning,
- mantenimiento del rumbo con goal conditioning,
- compresión del contexto.[1]
Esto explica por qué la unidad de comparación adecuada a veces es:
Muse Spark 1.2 + Muse Code
y no únicamente:
Muse Spark 1.2
4. Self-improvement usando Muse Spark 1.1
Meta utilizó Muse Spark 1.1 para construir datos de entrenamiento de la versión 1.2.
Según la descripción oficial, el modelo anterior:
- generaba entornos de programación difíciles,
- preparaba plantillas de instrucciones complejas,
- evaluaba soluciones candidatas,
- ayudaba a crear un dataset escalable para Muse Spark 1.2.[1]
Meta llama a este proceso self-improvement loop.
No significa que el modelo “se entrenara solo”. Sigue siendo un pipeline de entrenamiento controlado por Meta, en el que el modelo anterior fue uno de los componentes utilizados para generar y evaluar datos.
5. Terminal-Bench 2.1 oficial
Terminal-Bench 2.1 evalúa agentes que realizan tareas en un entorno de terminal.
Meta usó las 89 tareas de la versión oficial 2.1. Cada intento se ejecutó en un sandbox Daytona aislado y un executable verifier evaluó el estado final del contenedor. La puntuación es la media pass@1 de cinco intentos.[2]
Resultados publicados por Meta
| Modelo + agente | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7% | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9% | |
| GPT-5.6 Terra + Codex | max | 81,8% | |
| Grok 4.5 + Grok Build | high | 81,6% | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9% | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2% | [1][2] |
Muse Spark 1.2 mejora el resultado de su predecesor en 6,7 puntos porcentuales.
A la vez:
- queda 3,8 pp por detrás de Opus 5,
- supera a GPT-5.6 Terra en 1,1 pp,
- supera a Grok 4.5 en 1,3 pp.
La principal advertencia
No es un benchmark puro de los modelos por sí solos.
Los sistemas comparados son:
modelo
+
agente
+
herramientas
+
system prompt
+
runtime
Meta usa:
- Muse Code para Spark 1.2,
- Claude Code para Opus 5,
- Codex para GPT-5.6,
- Grok Build para Grok 4.5,
- Antigravity CLI para Gemini.[2]
Meta reconoce que la configuración y los system prompts podrían no haber estado optimizados para los modelos cerrados de la competencia.[2]
Por tanto, la conclusión correcta es:
En la configuración de Meta, Muse Spark 1.2 + Muse Code obtuvo 82,9%.
No:
Muse Spark 1.2 es siempre mejor que GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 contiene 113 tareas de 91 repositorios en cinco lenguajes:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Cada tarea cuenta con un verifier funcional preparado manualmente y tests de regresión.
Durante rollout y grading, el acceso externo a Internet está bloqueado. El endpoint del modelo permanece disponible.[2]
Resultados de Meta
| Modelo + agente | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0% | |
| GPT-5.6 Terra + Codex | 64,8% | |
| Muse Spark 1.2 + Muse Code | 59,3% | |
| Grok 4.5 + Grok Build | 56,6% | |
| Muse Spark 1.1 + mini-swe-agent | 53,0% | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0% | [1][2] |
Muse Spark 1.2 mejora a 1.1 en 6,3 pp.
Aquí, sin embargo, la distancia con los líderes es mayor:
Opus 5 65,0%
GPT-5.6 64,8%
Muse 1.2 59,3%
Es un resultado sólido, pero no el primer puesto.
Limitación metodológica adicional
El leaderboard oficial de DeepSWE utiliza mini-swe-agent para todos los modelos.
La evaluación de Meta utilizó un producto agent distinto para cada modelo. La empresa indica expresamente que el resultado no es harness-identical con el leaderboard oficial.[2]
Es una información importante que debe acompañar al 59,3%.
7. Meta Internal Coding Bench
Meta Internal Coding Bench contiene 440 tareas procedentes del codebase interno de Meta y pull requests reales.[2]
Incluye:
- corrección de errores,
- nuevas funciones,
- refactoring,
- cleanup,
- otras tareas de software engineering.
Internet está desactivado. Las soluciones se compilan y verifican con tests unitarios. Meta ejecuta dos intentos por tarea.[2]
Resultados
| Modelo | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4% | |
| Muse Spark 1.2 | 70,6% | |
| Muse Spark 1.1 | 68,3% | |
| GPT-5.6 Terra | 65,4% | |
| Gemini 3.6 Flash | 63,9% | [1][2] |
Muse Spark 1.2 mejora al predecesor en 2,3 pp.
¿Por qué este benchmark tiene menos valor externo?
No porque tenga que ser incorrecto.
El problema es la reproducibilidad.
El dataset:
- es interno,
- procede del codebase privado de Meta,
- no es un benchmark público que equipos externos puedan reproducir por su cuenta.
Por eso el resultado debe tratarse como una señal adicional del fabricante, no como una prueba independiente de superioridad.
8. Comprobación independiente: Artificial Analysis
Artificial Analysis recibió acceso a Muse Spark 1.2 antes de su lanzamiento público y ejecutó su propio conjunto de pruebas.[4]
Es importante porque permite separar:
benchmark del fabricante
de:
benchmark de una organización independiente
Cambio importante de puntuación tras el lanzamiento
El artículo de Artificial Analysis del 5 de agosto indicaba:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
La ficha actual del modelo, tras la actualización del índice a v4.1.1, muestra:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Por eso no debe copiarse el 54 en un ranking actual sin indicar la fecha.
Los benchmarks cambian con:
- versiones del índice,
- grading,
- conjuntos de evaluación,
- correcciones metodológicas.
Un artículo de producción debe indicar siempre el snapshot.
9. Comparación actual de Artificial Analysis
Fichas revisadas el 7 de agosto de 2026:
| Modelo | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* La puntuación de Grok 4.5 procede del informe publicado por Artificial Analysis sobre ese modelo. Debe tratarse como un snapshot de la versión correspondiente del benchmark, no como una posición permanente.
¿Qué se deduce?
Muse Spark 1.2:
- actualmente no alcanza a Opus 5 en el índice general,
- queda 2 puntos por detrás de GPT-5.6 Sol,
- empata con Kimi K3 en la ficha actual de AA,
- supera a GPT-5.6 Terra en el índice general,
- está por encima del resultado de lanzamiento de Grok 4.5.
Pero Artificial Analysis Intelligence Index no es un benchmark exclusivo de programación.
La versión v4.1.1 combina nueve evaluaciones, entre ellas:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Por eso el 57 debe interpretarse como una señal más amplia de inteligencia y capacidades agentic.
10. GDPval-AA v2: la mayor mejora frente a Spark 1.1
En el snapshot de lanzamiento de Artificial Analysis, GDPval-AA v2 pasó de:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
lo que supone +260 puntos Elo.[4]
GDPval-AA v2 evalúa tareas realistas de trabajo de conocimiento.
Contiene 220 tareas de:
- 44 profesiones,
- 9 grandes sectores de la economía estadounidense.[2]
Los modelos crean, entre otros:
- documentos,
- hojas de cálculo,
- presentaciones,
- diagramas,
- informes.
Artificial Analysis utiliza su propio agentic harness Stirrup con acceso a shell y navegación web, y compara los resultados por pares mediante un juez LLM.[2]
Snapshot del 5 de agosto
Artificial Analysis indicaba:
| Modelo | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
Es una de las mejores señales de que 1.2 mejoró más allá de la generación de código.
El ranking de GDPval se actualiza, por lo que estas cifras no deben mezclarse con snapshots posteriores.
11. Terminal-Bench según Artificial Analysis
Meta informa:
82,9%
para Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis informó en el lanzamiento, con su propio harness:
80%
frente a:
78%
para Muse Spark 1.1.[4]
No son resultados contradictorios.
Provienen de:
- harness distintos,
- configuraciones de agentes distintas,
- procedimientos de ejecución distintos.
Es un buen ejemplo de por qué nunca debe publicarse un benchmark sin su metodología.
12. Alucinaciones: el dato mejora, pero hay que leer la otra mitad de la tabla
Artificial Analysis observó en el snapshot de lanzamiento una mejora de AA-Omniscience:
18 -> 22
y una reducción del hallucination rate:
38% -> 28%
A primera vista parece inequívocamente positivo.
Pero al mismo tiempo:
attempt rate: 82% -> 67%
accuracy: 41% -> 38%
El modelo renunciaba con más frecuencia a responder cuando no estaba seguro.
AA-Omniscience no penaliza la abstención. Por tanto, la menor tasa de alucinaciones se debe en parte a una mayor disposición a no responder.
Interpretación correcta:
Muse Spark 1.2 presentó con menos frecuencia una respuesta incorrecta como segura, pero también intentó responder menos veces.
Interpretación incorrecta:
Muse Spark 1.2 se volvió 10 puntos porcentuales más preciso.
Los datos no sostienen esa conclusión.
13. El scientific reasoning no mejoró de forma uniforme
En las mediciones de lanzamiento de Artificial Analysis:
| Benchmark | Spark 1.1 | Spark 1.2 | Cambio | |
|---|---|---|---|---|
| CritPt | 15% | 18% | +3 pp | |
| SciCode | 58% | 56% | -2 pp | |
| Humanity's Last Exam | 45% | 44% | -1 pp | [4] |
Es importante porque muestra la naturaleza de la actualización.
Muse Spark 1.2 no es simplemente:
Spark 1.1
+ unos puntos en todo
Las mayores mejoras del lanzamiento se concentraron en:
- programación agentic,
- uso de herramientas,
- tareas profesionales agentic.
14. Precio de la API: uno de los mayores puntos fuertes de Muse Spark 1.2
Tarifas estándar de Meta:
| Tokens | Precio por 1 M | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Los precios de input/output son iguales a Muse Spark 1.1.
Comparación de precios públicos de API
| Modelo | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
Es una comparación de precio por token, no de coste por tarea completada.
Un modelo más barato por millón de tokens puede:
- generar más tokens,
- realizar más tool calls,
- necesitar más iteraciones,
- cometer un error que exija reparación manual.
La métrica de negocio más útil es:
coste por tarea correctamente completada
y no solo:
precio por 1M de tokens
15. Coste por tarea según la medición de lanzamiento de Artificial Analysis
En el snapshot del 5 de agosto, Artificial Analysis informó del coste medio ponderado de una tarea del Intelligence Index:
| Modelo / configuración | Coste por tarea | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
Es un resultado de coste muy bueno para Muse Spark 1.2.
Frente a Spark 1.1, sin embargo, el coste aumentó de:
0,29 USD
a
0,40 USD
Artificial Analysis lo relaciona con un mayor uso de tokens:
- alrededor de 53% más input tokens,
- alrededor de 36% más output tokens,
sobre todo en GDPval-AA v2.[4]
Es decir, la versión 1.2 es:
mejor
pero
más intensiva en tokens
El precio unitario de la API no cambió, pero el agente hace más trabajo.
16. Muse Spark 1.2 vs Claude Opus 5
¿Dónde gana Opus 5?
En los datos de Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7% | 82,9% | |
| DeepSWE 1.1 | 65,0% | 59,3% | |
| Meta Internal Coding Bench | 79,4% | 70,6% | [1] |
En el Artificial Analysis Intelligence Index actual:
Opus 5: 61
Muse 1.2: 57
Los datos disponibles no permiten llamar a Muse Spark 1.2 mejor modelo en términos generales.
¿Dónde tiene ventaja Muse?
Principalmente en el precio:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
En agentes que realizan miles de operaciones, la diferencia puede ser significativa.
Conclusión
Opus 5 es mejor elección cuando:
- importa más la máxima tasa de éxito que el coste de tokens,
- la tarea es difícil y el coste del error es alto,
- el equipo ya trabaja con Claude Code.
Muse Spark 1.2 tiene más sentido cuando:
- el volumen de tareas es alto,
- el agente trabaja mucho tiempo sobre un repositorio,
- el coste de tokens es decisivo,
- unos pocos puntos de benchmark no justifican una API mucho más cara.
17. Muse Spark 1.2 vs GPT-5.6 Terra
Es una de las comparaciones más interesantes.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9%
Terra + Codex: 81,8%
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3%
Terra + Codex: 64,8%
Meta Internal Coding Bench
Muse 1.2: 70,6%
Terra: 65,4%
El líder cambia según el benchmark.
Artificial Analysis
Índice general actual:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Precio
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Eso no implica una victoria automática de Muse. Terra es claramente mejor en DeepSWE dentro de la comparación de Meta.
La interpretación más honesta es:
Muse Spark 1.2 es extremadamente competitivo frente a GPT-5.6 Terra en precio y ciertas tareas agentic, pero el ganador depende del tipo de tarea y del harness.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol sigue siendo más fuerte en el índice general de Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol cuesta:
5 USD / 1M input
30 USD / 1M output
frente a:
1,25 USD / 1M input
4,25 USD / 1M output
Es una diferencia grande para:
- reasoning traces largos,
- subagentes,
- debugging iterativo,
- refactoring de todo el repositorio,
- ejecuciones de agentes durante horas.
Si los 2 puntos extra en el índice general no se traducen en una mayor tasa de finalización correcta sobre tareas reales, el modelo más caro no tiene por qué ser más rentable.
19. Muse Spark 1.2 vs Kimi K3
La ficha actual de Artificial Analysis muestra:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
No significa que tengan capacidades idénticas.
Diferencia principal
Kimi K3:
- tiene pesos disponibles públicamente,
- puede self-hostearse,
- posee 2,8 billones de parámetros totales y 104.000 millones activos,
- utiliza su propia Kimi K3 License.[10]
Muse Spark 1.2:
- es proprietary,
- funciona mediante Meta Model API,
- no tiene un número de parámetros público.[3]
Precios de las API oficiales
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Si el self-hosting no es un requisito, Muse es bastante más barato en precio nominal de API.
Si una organización necesita:
- infraestructura propia,
- control sobre los pesos,
- modificaciones personalizadas del modelo,
Kimi K3 ofrece algo que Muse Spark 1.2 no proporciona actualmente.
20. Muse Spark 1.2 vs Grok 4.5
En Terminal-Bench de Meta:
Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build: 81,6%
En DeepSWE:
Muse Spark 1.2: 59,3%
Grok 4.5: 56,6%
En Artificial Analysis Intelligence Index del lanzamiento, Grok 4.5 tenía 54, un nivel comparable al snapshot inicial de Muse 1.2 antes de la actualización del índice.[4][11]
Artificial Analysis también señalaba Grok 4.5 high como uno de los pocos modelos con menor coste por tarea en el mismo grupo de calidad:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
Otro ejemplo de que en 2026 la relación precio-calidad ya no sigue una regla simple:
modelo más caro
=
modelo más rentable
21. Optimización de kernels: más de 1.000 tool calls y hasta 24 horas de trabajo
Meta realizó un experimento de largo horizonte interesante.
Muse Code y los modelos debían optimizar iterativamente GPU kernels mediante:
- más de 1.000 tool calls,
- hasta 24 horas,
- escritura de código,
- compilación,
- profiling,
- optimizaciones sucesivas.[1]
Se probaron KDA y MLA sobre NVIDIA Hopper.
KDA
La base era una implementación FLA en Triton. Los modelos no podían importar directamente librerías externas de kernels como FLA.[1]
En el gráfico de speedup final frente al baseline, Meta mostró, entre otros:
| Modelo | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0% | |
| GPT-5.6 Sol | +71,2% | |
| Claude Opus 4.8 | +69,6% | |
| Muse Spark 1.2 | +68,7% | |
| GPT-5.6 Terra | +65,1% | |
| Gemini 3.6 Flash | +62,5% | [1] |
Muse Spark 1.2 no ganó este experimento.
Es relevante porque el material oficial de Meta no presenta su propio modelo como líder en todo.
¿Qué no demuestra este experimento?
No demuestra que:
- Opus 5 siempre optimice el código un 74%,
- Muse siempre consiga +68,7%,
- los resultados se transfieran a cualquier kernel o GPU.
Es un estudio de caso de una tarea, baseline, harness y hardware concretos.
22. Contexto largo: 1 millón de tokens
Artificial Analysis confirma para Muse Spark 1.2:
1M token context window
y:
- text input,
- image input,
- text output.[3]
Un millón de tokens puede importar en:
- repositorios grandes,
- monorepos,
- documentación,
- historial largo del agente,
- análisis de muchos archivos.
No significa que convenga volcar todo el repositorio en un prompt.
La capacidad máxima no garantiza:
- encontrar todas las dependencias,
- priorizar correctamente,
- resistir texto malicioso dentro del repositorio,
- mantener la misma calidad al principio y al final del contexto.
Por eso Muse Code también utiliza context compaction, en lugar de depender únicamente de prompts cada vez más grandes.[1]
23. ¿Por qué el AA actual es 57 si algunos artículos del lanzamiento muestran 54?
No es un error que deba ocultarse.
Artificial Analysis publicó 54 el 5 de agosto.[4]
La ficha actual de Muse Spark 1.2 revisada el 7 de agosto muestra 57 e indica que Artificial Analysis Intelligence Index está en la versión v4.1.1.[3]
Al citar benchmarks conviene conservar:
modelo
+
effort
+
versión del benchmark
+
fecha
Por ejemplo:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
estado: 7 de agosto de 2026
Es mucho mejor que escribir:
Muse Spark 1.2 tiene 57 puntos
sin contexto.
24. Standard tier frente a Contributor tier: diferencia importante de privacidad
El precio estándar de Muse Spark 1.2 es:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta también ofrece un Contributor tier con un descuento importante.
Cobertura independiente de prensa sobre la oferta oficial indica que el precio inferior está ligado al consentimiento para que la actividad del usuario pueda utilizarse para mejorar productos de Meta.[6]
En un entorno empresarial, es una diferencia importante.
Antes de usar Contributor tier para código:
- privado,
- sujeto a NDA,
- que contenga secretos comerciales,
- propiedad de un cliente,
hay que revisar las condiciones exactas de tratamiento de datos aplicables a la cuenta y al endpoint.
No debe elegirse un endpoint más barato basándose únicamente en el precio.
25. ¿Es Muse Spark 1.2 el mejor modelo para programación?
Según los datos verificados: no hay base para afirmarlo.
No lidera todos los benchmarks de Meta
Opus 5 lidera:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra también supera a Muse en DeepSWE.
Sin embargo, Muse es excepcionalmente fuerte en precio
Muse Spark 1.2 tiene un precio de output muy inferior a:
La descripción más defendible
Muse Spark 1.2 es uno de los modelos más interesantes de 2026 por su relación entre capacidades de agentic coding y precio. Opus 5 sigue siendo más fuerte en las comparaciones de calidad disponibles y la elección final debería salir de un POC propio.
26. ¿Qué modelo elegir?
Elige Muse Spark 1.2 si:
- el coste de sesiones largas importa mucho,
- trabajas con repositorios grandes,
- quieres utilizar Muse Code,
- el agente debe trabajar mucho tiempo sin dirección manual,
- necesitas subagentes persistentes,
- el precio nominal de output debe ser bajo,
- un rendimiento cercano a frontier es suficiente.
Elige Claude Opus 5 si:
- la máxima tasa de éxito es prioritaria,
- el coste de un error supera al coste de tokens,
- ya usas Claude Code,
- las tareas son especialmente difíciles,
- tu POC confirma una mayor completion rate.
Elige GPT-5.6 Terra si:
- utilizas el ecosistema Codex,
- las tareas similares a DeepSWE son centrales,
- necesitas un modelo de coding fuerte más barato que Sol,
- las herramientas de OpenAI ya forman parte del pipeline.
Elige GPT-5.6 Sol si:
- necesitas una capacidad general superior a Muse,
- el coste de API es menos importante,
- el workload requiere reasoning más amplio que el coding.
Elige Kimi K3 si:
- necesitas pesos abiertos,
- planeas self-hosting,
- necesitas modificar el modelo,
- aceptas un precio más alto en la API oficial.
Considera Grok 4.5 si:
- tus pruebas internas muestran una alta eficacia agentic,
- el coste por tarea completada es la métrica clave,
- utilizas Grok Build o un harness compatible.
27. Cómo hacer un POC justo
No pruebes modelos con cinco prompts.
Prepara al menos:
50-200 tareas reales
de tu propio repositorio.
Categorías
- bug fix,
- nueva función,
- refactoring,
- tests,
- code review,
- migración de dependencias,
- optimización de rendimiento,
- análisis de logs,
- frontend desde screenshot,
- cambio a nivel de repositorio,
- documentación técnica.
Para cada tarea mide
éxito / fallo
tiempo
coste
número de tokens
número de tool calls
intervenciones manuales
regresiones
Métrica principal
No:
¿qué modelo escribió la respuesta más bonita?
Sino:
¿qué modelo entregó con mayor frecuencia un resultado correcto y listo para merge,
con un coste y tiempo aceptables?
28. Cómo comparar agentes, no solo modelos
En:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build,
el modelo no trabaja aislado.
El agente decide:
- qué archivos leer,
- cuándo ejecutar tests,
- cuándo usar grep,
- si usar un subagente,
- cómo gestionar el contexto,
- cuántas iteraciones hacer,
- cuándo terminar.
Por eso conviene realizar dos pruebas.
Prueba A: modelo en un harness común
mismo agente
mismas herramientas
mismo system prompt
mismos límites
Ayuda a comparar el modelo subyacente.
Prueba B: producto end-to-end
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Ayuda a responder la pregunta práctica:
¿Qué solución es mejor para el equipo?
Ambas pruebas miden cosas distintas.
29. Checklist de producción para Muse Spark 1.2
Benchmarks
- Se registra la versión del benchmark.
- Se registra la fecha de la puntuación.
- Se registra el reasoning effort.
- Se registra el nombre del agente.
- Meta Terminal-Bench no se mezcla con el resultado de AA.
- Meta Internal Coding Bench no se trata como benchmark independiente.
- Los resultados se verifican en el repositorio propio.
Coste
- Se mide el input real.
- Se mide el cached input.
- Se mide el output.
- Se mide el coste del reasoning.
- Se mide el número de tool calls.
- El coste se calcula por tarea completada.
- Se comparan al menos tres modelos.
- Se define un límite de gasto por agente.
Repositorio
- El agente tiene los permisos mínimos necesarios.
- Los secretos no están en archivos fácilmente accesibles.
- El acceso a producción requiere aprobación.
- El merge requiere review.
- Los tests se ejecutan automáticamente.
- El agente no puede saltarse branch protection.
- Se registran cambios y tool calls.
Datos
- Se verifican las condiciones de Standard tier.
- Se verifican las condiciones de Contributor tier.
- El código del cliente no va al endpoint equivocado.
- La política de la empresa permite el servicio elegido.
- Se definen reglas de retención de prompts y logs.
- Los datos personales están correctamente protegidos.
Calidad
- El agente ejecuta tests tras cada cambio.
- Se revisa el diff final.
- Se miden regresiones.
- Las tareas largas tienen checkpoints.
- Se prueba la recuperación tras fallos.
- Se prueban monorepos grandes.
- Se prueban tareas de varias horas.
30. Veredicto de POLPROG
Muse Spark 1.2 es un lanzamiento más importante de lo que sugiere el número 1.2.
Meta construyó el modelo y Muse Code como un sistema conectado, centrando el entrenamiento en:
- repositorios grandes,
- tareas largas,
- herramientas,
- subagentes,
- planificación,
- verificación automática.
Los resultados confirman una mejora real frente a Muse Spark 1.1.
Datos más sólidos
Terminal-Bench 2.1
76,2% -> 82,9% en la evaluación de Meta
DeepSWE 1.1
53,0% -> 59,3% en la evaluación de Meta
GDPval-AA v2
1371 -> 1631 Elo en el snapshot de lanzamiento de Artificial Analysis
Pero todavía no lidera en todo
Opus 5 supera a Muse Spark 1.2 en los tres benchmarks de coding mostrados por Meta.
En el snapshot actual de Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Entonces, ¿por qué es interesante Muse Spark 1.2?
Porque cuesta:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Esto hace menos útil la pregunta:
¿Qué modelo tiene el benchmark más alto?
Una pregunta mejor es:
¿Qué modelo ofrece el mayor número de tareas correctamente completadas por cada 100 USD de presupuesto?
En muchos equipos la respuesta puede no coincidir con el modelo que ocupa el primer puesto en una tabla concreta.
Muse Spark 1.2 parece actualmente un candidato muy fuerte para programación agentic a gran escala y con coste controlado.
No es un ganador absoluto.
Pero merece claramente estar en un POC junto con:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

