Muse Spark 1.2 et Muse Code : benchmarks, prix et comparaison avec Claude Opus 5, GPT-5.6, Kimi K3 et Grok 4.5 Skip to content

Muse Spark 1.2 et Muse Code : benchmarks, prix et comparaison avec Claude Opus 5, GPT-5.6, Kimi K3 et Grok 4.5

Le 5 août 2026, Meta a présenté Muse Spark 1.2 et Muse Code, un agent de programmation en terminal disponible en bêta. Muse Spark 1.2 est une mise à jour centrée surtout sur le développement, le débogage complexe, la compréhension de grandes bases de code et l'exécution de tâches logicielles multiétapes de bout en bout.

Publié Rédigé par Temps de lecture 24 min de lecture
X LinkedIn

Le 5 août 2026, Meta a présenté Muse Spark 1.2 et Muse Code, un agent de programmation en terminal disponible en bêta. Muse Spark 1.2 est une mise à jour centrée surtout sur le développement, le débogage complexe, la compréhension de grandes bases de code et l'exécution de tâches logicielles multiétapes de bout en bout.

Sur cette page
  1. 1TL;DR
  2. 21. Qu'a exactement publié Meta ?
  3. 32. Muse Code n'est pas un simple wrapper autour du modèle
  4. 43. Le modèle et l'agent ont été entraînés ensemble
  5. 54. Self-improvement avec Muse Spark 1.1
  6. 65. Terminal-Bench 2.1 officiel
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Vérification indépendante : Artificial Analysis
  10. 109. Comparaison actuelle Artificial Analysis
  11. 1110. GDPval-AA v2 : la plus forte progression face à Spark 1.1
  12. 1211. Terminal-Bench selon Artificial Analysis
  13. 1312. Hallucinations : le score s'améliore, mais il faut lire l'autre moitié du tableau
  14. 1413. Le scientific reasoning ne progresse pas partout
  15. 1514. Prix API : l'un des grands atouts de Muse Spark 1.2
  16. 1615. Coût par tâche selon la mesure de lancement Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Optimisation de kernels : plus de 1 000 tool calls et jusqu'à 24 heures de travail
  23. 2322. Contexte long : 1 million de tokens
  24. 2423. Pourquoi le score AA actuel est-il 57 alors que certains articles affichent 54 ?
  25. 2524. Standard tier vs Contributor tier : différence importante pour la confidentialité
  26. 2625. Muse Spark 1.2 est-il le meilleur modèle pour programmer ?
  27. 2726. Quel modèle choisir ?
  28. 2827. Comment réaliser un POC équitable ?
  29. 2928. Comment comparer les agents, et pas seulement les modèles ?
  30. 3029. Checklist de production Muse Spark 1.2
  31. 3130. Verdict POLPROG

Le modèle n'a pas été publié avec des poids ouverts. Artificial Analysis classe Muse Spark 1.2 comme modèle proprietary, et le nombre de paramètres n'a pas été rendu public.[3]

La partie la plus intéressante de cette sortie ne réside cependant pas dans le nom du modèle. Meta a entraîné Muse Spark 1.2 avec Muse Code et l'a optimisé pour un environnement agentique réel : planification, compaction du contexte, sous-agents, utilisation d'outils et tâches longues portant sur des dépôts complets.[1]

Les résultats sont solides, mais ils doivent être interprétés avec prudence.

Dans l'évaluation officielle de Meta :

  • Muse Spark 1.2 + Muse Code atteint 82,9 % sur Terminal-Bench 2.1,
  • 59,3 % sur DeepSWE 1.1,
  • 70,6 % sur Meta Internal Coding Bench.[1][2]

Cela ne signifie pas que Muse Spark 1.2 soit le meilleur modèle de programmation du marché. Dans les mêmes tableaux, Claude Opus 5 + Claude Code est premier dans les trois comparaisons. Meta précise en outre que la comparaison n'est pas parfaitement modèle contre modèle : chaque modèle fonctionne avec un agent différent, et la configuration de test a pu être mieux adaptée à Muse Code qu'aux outils concurrents.[2]

Artificial Analysis fournit une vue plus indépendante. Sur la fiche actuelle du modèle vérifiée le 7 août, Muse Spark 1.2 en xhigh obtient 57 points dans Artificial Analysis Intelligence Index v4.1.1. À titre de comparaison, Claude Opus 5 obtient 61, GPT-5.6 Sol 59, Kimi K3 57 et GPT-5.6 Terra 55.[3][7][8][9][10]

Conclusion courte : Muse Spark 1.2 ne bat pas systématiquement Opus 5 ou GPT-5.6 Sol, mais il est exceptionnellement compétitif en prix. Il paraît surtout fort pour la programmation agentique, notamment avec Muse Code et lorsque le coût des longues sessions compte beaucoup.

Toutes les données de cet article ont été vérifiées à partir des documents de Meta, de la méthodologie officielle d'évaluation, d'Artificial Analysis et de sources de presse indépendantes. État au 7 août 2026.

TL;DR

Question Réponse vérifiée
Quand Muse Spark 1.2 a-t-il été publié ? 5 août 2026
Qui a créé le modèle ? Meta
Qu'est-ce que Muse Code ? Un agent de programmation en terminal en bêta
Muse Spark 1.2 a-t-il des poids ouverts ? Non, le modèle est proprietary
Connaît-on le nombre de paramètres ? Non, Meta ne l'a pas publié
Contexte 1 million de tokens
Modalités texte et image en entrée, texte en sortie
Prix standard input 1,25 USD / 1 M de tokens
Prix cached input 0,15 USD / 1 M de tokens
Prix output 4,25 USD / 1 M de tokens
Terminal-Bench 2.1 selon Meta 82,9 %
DeepSWE 1.1 selon Meta 59,3 %
Meta Internal Coding Bench 70,6 %
AA Intelligence Index v4.1.1 actuel 57
AA Index dans l'article du jour du lancement 54
Les résultats Meta sont-ils indépendants ? Non, une partie correspond à des évaluations du fournisseur
Artificial Analysis est-il indépendant de Meta ? Oui, même si Meta a fourni un accès avant le lancement pour les benchmarks
Plus grande force programmation agentique et rapport capacités/prix
Limitation principale ne gagne pas tous les benchmarks et certains tests utilisent des agent harness différents

1. Qu'a exactement publié Meta ?

Le lancement comprend deux produits liés :

Muse Spark 1.2
modèle

Muse Code
agent de programmation en terminal

Meta décrit Muse Spark 1.2 comme une mise à jour de Muse Spark 1.1 axée sur le code. L'entreprise a augmenté le compute consacré aux tâches de programmation pendant l'entraînement et diversifié les environnements d'entraînement.[1]

Muse Code est un agent capable de :

  • planifier des changements dans un dépôt,
  • écrire du code,
  • exécuter des outils,
  • valider les résultats,
  • coordonner plusieurs sous-agents longue durée,
  • maintenir la progression pendant de longues sessions.[1]

Meta décrit l'installation du client officiel sous macOS ou Linux ainsi :

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 est disponible via Muse Code et Meta Model API. Meta décrit l'accès actuel comme largement étendu au niveau mondial.[1]

2. Muse Code n'est pas un simple wrapper autour du modèle

Pour les agents de programmation, le benchmark d'un modèle et celui d'un produit ne mesurent pas exactement la même chose.

Muse Code ajoute sa propre couche d'exécution.

Async Background Agents

L'agent principal peut utiliser des sous-agents spécialisés qui continuent à travailler en arrière-plan. Ils ne sont pas créés uniquement pour une étape et peuvent rester actifs pendant toute la session.[1]

L'objectif est de réduire :

  • la collecte répétée des mêmes informations,
  • la latence,
  • le besoin de pilotage manuel,
  • la répétition de l'analyse du dépôt.

Append-only event log

Muse Code conserve localement un historique de :

  • appels du modèle,
  • utilisation des outils,
  • approbations,
  • modifications.[1]

Meta décrit le runtime comme replay-exact et restart-safe. Après un échec, l'agent peut reprendre depuis le journal au lieu de recommencer la tâche.

C'est important pour les tâches de programmation de plusieurs heures.

Skills intégrés

La première version comprend notamment :

/plan
/grill
/goal

/plan prépare un plan soumis à approbation, /grill critique le plan et /goal maintient le travail orienté vers un objectif défini.[1]

3. Le modèle et l'agent ont été entraînés ensemble

C'est l'un des éléments les plus importants pour interpréter les benchmarks.

Meta ne s'est pas contentée de connecter un nouveau modèle à un CLI existant. L'entreprise déclare avoir co-entraîné Muse Spark 1.2 et Muse Code.[1]

L'entraînement comprenait notamment :

  • des trajectories issues de l'agent harness,
  • des optimisations pour le travail basé sur les objectifs,
  • la compaction,
  • les sous-agents,
  • l'ensemble intégré d'outils Muse Code.[1]

Le modèle a également été entraîné sur des tâches longue durée :

  • génération de dépôts complets,
  • grands projets end-to-end,
  • auto-research,
  • séquençage du travail par planning,
  • maintien de la direction par goal conditioning,
  • compression du contexte.[1]

Cela explique pourquoi l'unité de comparaison pertinente est parfois :

Muse Spark 1.2 + Muse Code

et pas uniquement :

Muse Spark 1.2

4. Self-improvement avec Muse Spark 1.1

Meta a utilisé Muse Spark 1.1 pour produire des données d'entraînement pour la version 1.2.

Selon la description officielle, l'ancien modèle :

  1. générait des environnements de programmation difficiles,
  2. créait des modèles d'instructions complexes,
  3. évaluait des solutions candidates,
  4. aidait à construire un dataset scalable pour Muse Spark 1.2.[1]

Meta qualifie ce processus de self-improvement loop.

Cela ne signifie pas que le modèle « s'est entraîné lui-même ». Il s'agit toujours d'un pipeline contrôlé conçu par Meta, dans lequel le modèle précédent constituait un composant de génération et d'évaluation des données.

5. Terminal-Bench 2.1 officiel

Terminal-Bench 2.1 évalue des agents qui exécutent des tâches dans un environnement terminal.

Meta a utilisé les 89 tâches de la version officielle 2.1. Chaque essai a eu lieu dans une sandbox Daytona isolée, et un executable verifier a évalué l'état final du conteneur. Le résultat correspond à la moyenne pass@1 sur cinq essais.[2]

Résultats publiés par Meta

Modèle + agent Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7 %
Muse Spark 1.2 + Muse Code xhigh 82,9 %
GPT-5.6 Terra + Codex max 81,8 %
Grok 4.5 + Grok Build high 81,6 %
Gemini 3.6 Flash + Antigravity CLI high 78,9 %
Muse Spark 1.1 + mini-swe-agent xhigh 76,2 % [1][2]

Muse Spark 1.2 améliore son prédécesseur de 6,7 points de pourcentage.

Dans le même temps :

  • il reste 3,8 pp derrière Opus 5,
  • devance GPT-5.6 Terra de 1,1 pp,
  • devance Grok 4.5 de 1,3 pp.

Réserve méthodologique essentielle

Il ne s'agit pas d'un benchmark pur des modèles seuls.

Les systèmes comparés sont :

modèle
+
agent
+
outils
+
system prompt
+
runtime

Meta utilise :

  • Muse Code pour Spark 1.2,
  • Claude Code pour Opus 5,
  • Codex pour GPT-5.6,
  • Grok Build pour Grok 4.5,
  • Antigravity CLI pour Gemini.[2]

Meta indique elle-même que la configuration et les system prompts n'étaient peut-être pas optimisés pour les modèles concurrents fermés.[2]

La conclusion correcte est donc :

Dans la configuration Meta, Muse Spark 1.2 + Muse Code a obtenu 82,9 %.

Et non :

Muse Spark 1.2 est toujours meilleur que GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 contient 113 tâches issues de 91 dépôts dans cinq langages :

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Chaque tâche dispose d'un verifier fonctionnel préparé manuellement et de tests de régression.

Pendant rollout et grading, Internet externe est bloqué. L'endpoint du modèle reste accessible.[2]

Résultats Meta

Modèle + agent DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0 %
GPT-5.6 Terra + Codex 64,8 %
Muse Spark 1.2 + Muse Code 59,3 %
Grok 4.5 + Grok Build 56,6 %
Muse Spark 1.1 + mini-swe-agent 53,0 %
Gemini 3.6 Flash + Antigravity CLI 40,0 % [1][2]

Muse Spark 1.2 progresse de 6,3 pp par rapport à 1.1.

Mais l'écart avec les leaders est ici plus important :

Opus 5       65,0 %
GPT-5.6      64,8 %
Muse 1.2     59,3 %

C'est un bon score, mais pas la première place.

Réserve méthodologique supplémentaire

Le leaderboard officiel DeepSWE utilise mini-swe-agent pour chaque modèle.

Meta utilise au contraire un produit agent différent pour chaque modèle. L'entreprise précise elle-même que le résultat n'est pas harness-identical au leaderboard officiel.[2]

Cette information doit accompagner le score de 59,3 %.

7. Meta Internal Coding Bench

Meta Internal Coding Bench contient 440 tâches issues du code interne de Meta et de véritables pull requests.[2]

Il couvre :

  • corrections de bugs,
  • nouvelles fonctionnalités,
  • refactoring,
  • cleanup,
  • autres tâches de software engineering.

Internet est désactivé. Les solutions sont compilées et vérifiées par des tests unitaires. Meta effectue deux essais par tâche.[2]

Résultats

Modèle Meta Internal Coding Bench
Claude Opus 5 79,4 %
Muse Spark 1.2 70,6 %
Muse Spark 1.1 68,3 %
GPT-5.6 Terra 65,4 %
Gemini 3.6 Flash 63,9 % [1][2]

Muse Spark 1.2 progresse de 2,3 pp par rapport au prédécesseur.

Pourquoi ce benchmark a-t-il moins de valeur externe ?

Pas parce qu'il est forcément incorrect.

Le problème est la reproductibilité.

Le dataset :

  • est interne,
  • provient du code privé de Meta,
  • n'est pas un benchmark public qu'une équipe externe peut reproduire.

Ce score doit donc être considéré comme un signal supplémentaire du fournisseur, pas comme une preuve indépendante de supériorité.

8. Vérification indépendante : Artificial Analysis

Artificial Analysis a obtenu un accès à Muse Spark 1.2 avant la sortie publique et a exécuté sa propre suite de tests.[4]

Cela permet de distinguer :

benchmark fournisseur

de :

benchmark d'une organisation indépendante

Changement important du score après le lancement

L'article Artificial Analysis du 5 août indiquait :

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

La fiche actuelle du modèle, après passage de l'index à v4.1.1, indique :

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Il ne faut donc pas recopier 54 dans un classement actuel sans préciser la date.

Les benchmarks évoluent avec :

  • les versions d'index,
  • le grading,
  • les ensembles d'évaluation,
  • les corrections méthodologiques.

Un article de production doit toujours préciser le snapshot.

9. Comparaison actuelle Artificial Analysis

Fiches vérifiées le 7 août 2026 :

Modèle AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* Le score de Grok 4.5 provient du rapport publié par Artificial Analysis sur ce modèle. Ces valeurs doivent être comprises comme des snapshots des versions correspondantes du benchmark, et non comme des positions permanentes.

Qu'en déduire ?

Muse Spark 1.2 :

  • ne rattrape pas actuellement Opus 5 sur l'index général,
  • reste 2 points derrière GPT-5.6 Sol,
  • est au niveau de Kimi K3 sur la fiche AA actuelle,
  • devance GPT-5.6 Terra sur l'index général,
  • se situe au-dessus du score de lancement de Grok 4.5.

Mais Artificial Analysis Intelligence Index n'est pas un benchmark uniquement consacré au code.

La version actuelle v4.1.1 combine neuf évaluations, notamment :

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Le score de 57 doit donc être lu comme un signal plus large de capacités intellectuelles et agentiques.

10. GDPval-AA v2 : la plus forte progression face à Spark 1.1

Dans le snapshot de lancement Artificial Analysis, GDPval-AA v2 passe de :

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

soit +260 points Elo.[4]

GDPval-AA v2 teste des tâches réalistes de travail intellectuel.

Il contient 220 tâches issues de :

  • 44 professions,
  • 9 grands secteurs de l'économie américaine.[2]

Les modèles produisent notamment :

  • documents,
  • feuilles de calcul,
  • présentations,
  • diagrammes,
  • rapports.

Artificial Analysis utilise son propre agentic harness Stirrup avec accès shell et navigation web, puis compare les résultats par paires avec un juge LLM.[2]

Snapshot du 5 août

Artificial Analysis indiquait :

Modèle GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

C'est l'un des meilleurs éléments montrant que 1.2 ne s'est pas amélioré seulement en génération de code.

Le classement GDPval évolue, il ne faut donc pas mélanger ces valeurs avec des snapshots plus récents.

11. Terminal-Bench selon Artificial Analysis

Meta rapporte :

82,9 %

pour Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis rapportait au lancement dans son propre harness :

80 %

contre :

78 %

pour Muse Spark 1.1.[4]

Ces résultats ne sont pas contradictoires.

Ils viennent de :

  • harness différents,
  • configurations d'agents différentes,
  • procédures d'exécution différentes.

C'est un bon exemple de la nécessité de publier la méthodologie avec le score.

12. Hallucinations : le score s'améliore, mais il faut lire l'autre moitié du tableau

Artificial Analysis relevait au lancement une amélioration de AA-Omniscience :

18 -> 22

et une baisse du hallucination rate :

38 % -> 28 %

[4]

À première vue, c'est clairement positif.

Mais simultanément :

attempt rate: 82 % -> 67 %
accuracy:     41 % -> 38 %

[4]

Le modèle renonçait plus souvent à répondre lorsqu'il n'était pas sûr.

AA-Omniscience ne pénalise pas l'abstention. La baisse des hallucinations provient donc en partie d'une plus forte tendance à s'abstenir.

Interprétation correcte :

Muse Spark 1.2 présentait moins souvent une réponse fausse avec assurance, mais tentait également moins souvent de répondre.

Interprétation incorrecte :

Muse Spark 1.2 est devenu 10 points de pourcentage plus précis.

Les données ne permettent pas cette conclusion.

13. Le scientific reasoning ne progresse pas partout

Dans les mesures de lancement Artificial Analysis :

Benchmark Spark 1.1 Spark 1.2 Évolution
CritPt 15 % 18 % +3 pp
SciCode 58 % 56 % -2 pp
Humanity's Last Exam 45 % 44 % -1 pp [4]

Cela montre la nature de la mise à jour.

Muse Spark 1.2 n'est pas simplement :

Spark 1.1
+ quelques pourcents partout

Les gains les plus importants au lancement se concentraient sur :

  • programmation agentique,
  • utilisation d'outils,
  • tâches professionnelles agentiques.

14. Prix API : l'un des grands atouts de Muse Spark 1.2

Tarifs standard Meta :

Tokens Prix par 1 M
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Les prix input/output sont identiques à Muse Spark 1.1.

Comparaison des tarifs API publics

Modèle Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

Il s'agit d'une comparaison du prix des tokens, pas du coût d'une tâche terminée.

Un modèle moins cher au million de tokens peut :

  • générer davantage de tokens,
  • effectuer plus de tool calls,
  • nécessiter davantage d'itérations,
  • produire une erreur exigeant une correction manuelle.

La bonne métrique business est donc :

coût par tâche correctement terminée

et pas seulement :

prix par 1M de tokens

15. Coût par tâche selon la mesure de lancement Artificial Analysis

Dans le snapshot du 5 août, Artificial Analysis rapportait un coût moyen pondéré par tâche Intelligence Index :

Modèle / configuration Coût par tâche
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

C'est un excellent résultat coût pour Muse Spark 1.2.

Face à Spark 1.1, le coût passe toutefois de :

0,29 USD
à
0,40 USD

Artificial Analysis l'explique par une consommation plus élevée :

  • environ 53 % de tokens input en plus,
  • environ 36 % de tokens output en plus,

notamment dans GDPval-AA v2.[4]

Autrement dit, 1.2 est :

meilleur
mais
plus gourmand en tokens

Le prix unitaire de l'API n'a pas changé, mais l'agent effectue davantage de travail.

16. Muse Spark 1.2 vs Claude Opus 5

Où Opus 5 gagne-t-il ?

Dans les données Meta :

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7 % 82,9 %
DeepSWE 1.1 65,0 % 59,3 %
Meta Internal Coding Bench 79,4 % 70,6 % [1]

Dans Artificial Analysis Intelligence Index actuel :

Opus 5:     61
Muse 1.2:   57

[3][7]

Les données disponibles ne permettent pas de déclarer Muse Spark 1.2 meilleur au niveau général.

Où Muse a-t-il un avantage ?

Principalement sur le prix des tokens :

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

Pour des agents exécutant des milliers d'opérations, la différence peut être importante.

Conclusion

Opus 5 convient mieux lorsque :

  • le taux de réussite maximal compte plus que le coût des tokens,
  • la tâche est difficile et une erreur coûte cher,
  • l'équipe travaille déjà avec Claude Code.

Muse Spark 1.2 est plus pertinent lorsque :

  • le volume de tâches est élevé,
  • l'agent travaille longtemps sur un dépôt,
  • le coût des tokens est déterminant,
  • quelques points de benchmark ne justifient pas une API beaucoup plus chère.

17. Muse Spark 1.2 vs GPT-5.6 Terra

C'est l'une des comparaisons les plus intéressantes.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9 %
Terra + Codex:         81,8 %

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3 %
Terra + Codex:         64,8 %

Meta Internal Coding Bench

Muse 1.2:  70,6 %
Terra:     65,4 %

[1]

Le leader change selon le benchmark.

Artificial Analysis

Index global actuel :

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Prix

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Cela ne signifie pas que Muse gagne automatiquement. Terra est nettement plus fort sur DeepSWE dans le comparatif Meta.

L'interprétation la plus juste est :

Muse Spark 1.2 est extrêmement compétitif face à GPT-5.6 Terra en prix et sur certaines tâches agentiques, mais le résultat dépend du type de tâche et du harness.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol reste plus fort dans l'index global d'Artificial Analysis :

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol coûte :

5 USD / 1M input
30 USD / 1M output

contre :

1,25 USD / 1M input
4,25 USD / 1M output

pour Muse.[3][8]

L'écart est important pour :

  • longs reasoning traces,
  • sous-agents,
  • débogage itératif,
  • refactoring à l'échelle du dépôt,
  • sessions agent de plusieurs heures.

Si les 2 points supplémentaires de l'index général ne se traduisent pas par un meilleur taux de réussite sur les tâches réelles de l'entreprise, le modèle plus cher n'est pas nécessairement plus rentable.

19. Muse Spark 1.2 vs Kimi K3

La fiche actuelle Artificial Analysis indique :

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

Cela ne signifie pas que leurs capacités sont identiques.

Différence principale

Kimi K3 :

  • a des poids publiquement disponibles,
  • peut être self-hosted,
  • possède 2,8 billions de paramètres au total et 104 milliards actifs,
  • utilise sa propre Kimi K3 License.[10]

Muse Spark 1.2 :

  • est proprietary,
  • fonctionne via Meta Model API,
  • n'a pas de nombre de paramètres public.[3]

Prix des API officielles

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Si le self-hosting n'est pas requis, Muse est nettement moins cher dans son tarif API nominal.

Si une organisation a besoin :

  • de sa propre infrastructure,
  • du contrôle des poids,
  • de modifications personnalisées du modèle,

Kimi K3 offre une possibilité que Muse Spark 1.2 ne fournit pas actuellement.

20. Muse Spark 1.2 vs Grok 4.5

Dans Terminal-Bench Meta :

Muse Spark 1.2 + Muse Code: 82,9 %
Grok 4.5 + Grok Build:      81,6 %

Dans DeepSWE :

Muse Spark 1.2: 59,3 %
Grok 4.5:        56,6 %

[1]

Dans Artificial Analysis Intelligence Index au moment du lancement, Grok 4.5 avait 54, soit un niveau comparable au snapshot initial de Muse 1.2 avant la mise à jour de l'index.[4][11]

Artificial Analysis indiquait aussi Grok 4.5 high comme l'un des rares modèles moins chers par tâche dans le même cluster de qualité :

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

Encore un exemple montrant qu'en 2026 le rapport qualité-prix ne suit plus la règle simple :

modèle le plus cher
=
modèle le plus rentable

21. Optimisation de kernels : plus de 1 000 tool calls et jusqu'à 24 heures de travail

Meta a mené un test long-horizon intéressant.

Muse Code et les modèles devaient optimiser itérativement des GPU kernels via :

  • plus de 1 000 tool calls,
  • jusqu'à 24 heures,
  • écriture de code,
  • compilation,
  • profiling,
  • optimisations successives.[1]

Le test couvrait KDA et MLA sur NVIDIA Hopper.

KDA

La base était une implémentation FLA en Triton. Les modèles ne pouvaient pas importer directement des bibliothèques kernel externes telles que FLA.[1]

Dans le graphique de speedup final face au baseline, Meta affichait notamment :

Modèle Speedup vs baseline
Claude Opus 5 +74,0 %
GPT-5.6 Sol +71,2 %
Claude Opus 4.8 +69,6 %
Muse Spark 1.2 +68,7 %
GPT-5.6 Terra +65,1 %
Gemini 3.6 Flash +62,5 % [1]

Muse Spark 1.2 n'a pas gagné cette expérience.

C'est important, car le document officiel de Meta ne présente pas son propre modèle comme leader partout.

Ce que cette expérience ne prouve pas

Elle ne prouve pas que :

  • Opus 5 optimise toujours le code de 74 %,
  • Muse fournit toujours +68,7 %,
  • les résultats se transfèrent à n'importe quel kernel ou GPU.

Il s'agit d'une étude de cas avec une tâche, un baseline, un harness et un matériel précis.

22. Contexte long : 1 million de tokens

Artificial Analysis confirme pour Muse Spark 1.2 :

1M token context window

avec :

  • text input,
  • image input,
  • text output.[3]

Un million de tokens peut être utile pour :

  • grands dépôts,
  • monorepos,
  • documentation,
  • longues histoires d'agent,
  • analyse multi-fichiers.

Cela ne veut pas dire qu'il faut mettre tout un dépôt dans un prompt.

La capacité maximale ne garantit pas :

  • de retrouver toutes les dépendances,
  • de bien prioriser,
  • de résister à du texte malveillant dans le dépôt,
  • une qualité identique au début et à la fin du contexte.

Muse Code utilise donc aussi context compaction, au lieu de compter uniquement sur des prompts toujours plus grands.[1]

23. Pourquoi le score AA actuel est-il 57 alors que certains articles affichent 54 ?

Ce n'est pas une erreur à masquer.

Artificial Analysis a publié 54 le 5 août.[4]

La fiche Muse Spark 1.2 vérifiée le 7 août affiche 57 et indique que la version actuelle de Artificial Analysis Intelligence Index est v4.1.1.[3]

Lorsqu'on cite un benchmark, il faut conserver :

modèle
+
effort
+
version du benchmark
+
date

Par exemple :

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
état : 7 août 2026

C'est bien préférable à :

Muse Spark 1.2 obtient 57

sans contexte.

24. Standard tier vs Contributor tier : différence importante pour la confidentialité

Le tarif standard de Muse Spark 1.2 est :

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta propose également un Contributor tier fortement remisé.

Des articles de presse indépendants décrivant l'offre officielle indiquent que le prix plus bas est lié à l'acceptation que l'activité de l'utilisateur puisse être utilisée pour améliorer les produits Meta.[6]

Pour un environnement d'entreprise, c'est une différence importante.

Avant d'utiliser Contributor tier pour du code :

  • privé,
  • sous NDA,
  • contenant des secrets commerciaux,
  • appartenant à un client,

il faut vérifier précisément les conditions de traitement des données applicables au compte et à l'endpoint.

Il ne faut pas choisir un endpoint moins cher uniquement selon son prix.

25. Muse Spark 1.2 est-il le meilleur modèle pour programmer ?

À partir des données vérifiées : rien ne permet de l'affirmer.

Il ne mène pas tous les benchmarks Meta

Opus 5 mène :

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra est également devant Muse dans DeepSWE.

Mais Muse est exceptionnellement compétitif en prix

Muse Spark 1.2 coûte beaucoup moins cher en output que :

Formulation la plus défendable

Muse Spark 1.2 est l'un des modèles les plus intéressants de 2026 en termes de rapport capacités agentic coding/prix. Opus 5 reste plus fort dans les comparaisons de qualité disponibles, et le choix final doit venir d'un POC interne.

26. Quel modèle choisir ?

Choisir Muse Spark 1.2 si :

  • le coût des longues sessions est très important,
  • vous travaillez avec de grands dépôts,
  • vous souhaitez Muse Code,
  • l'agent doit travailler longtemps sans pilotage manuel,
  • vous avez besoin de sous-agents persistants,
  • le prix nominal de l'output doit rester bas,
  • une performance proche du frontier suffit au workflow.

Choisir Claude Opus 5 si :

  • le taux de réussite maximal est prioritaire,
  • le coût d'une erreur dépasse le coût des tokens,
  • vous utilisez déjà Claude Code,
  • les tâches sont particulièrement difficiles,
  • votre POC confirme un meilleur completion rate.

Choisir GPT-5.6 Terra si :

  • vous utilisez l'écosystème Codex,
  • les tâches de type DeepSWE sont centrales,
  • vous voulez un bon modèle de code moins cher que Sol,
  • les outils OpenAI font déjà partie du pipeline.

Choisir GPT-5.6 Sol si :

  • vous avez besoin de capacités générales supérieures à Muse,
  • le coût API est moins important,
  • le workload exige du reasoning plus large que le seul code.

Choisir Kimi K3 si :

  • vous avez besoin de poids ouverts,
  • vous prévoyez le self-hosting,
  • vous voulez modifier le modèle,
  • le prix plus élevé de l'API officielle est acceptable.

Envisager Grok 4.5 si :

  • vos tests internes montrent une forte efficacité agentique,
  • le coût par tâche terminée est la métrique principale,
  • vous utilisez Grok Build ou un harness compatible.

27. Comment réaliser un POC équitable ?

Ne testez pas les modèles avec cinq prompts.

Préparez au minimum :

50-200 tâches réelles

issues de votre propre dépôt.

Catégories

  • bug fix,
  • nouvelle fonctionnalité,
  • refactoring,
  • tests,
  • code review,
  • migration de dépendances,
  • optimisation des performances,
  • analyse de logs,
  • frontend depuis un screenshot,
  • changement à l'échelle du dépôt,
  • documentation technique.

Pour chaque tâche, mesurer

succès / échec
temps
coût
nombre de tokens
nombre de tool calls
interventions manuelles
régressions

Métrique principale

Pas :

quel modèle a écrit la plus belle réponse ?

Mais :

quel modèle a le plus souvent livré un résultat correct, prêt à merger,
avec un coût et un délai acceptables ?

28. Comment comparer les agents, et pas seulement les modèles ?

Avec :

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build,

le modèle ne travaille pas isolément.

L'agent décide :

  • quels fichiers lire,
  • quand lancer les tests,
  • quand utiliser grep,
  • s'il faut employer un sous-agent,
  • comment gérer le contexte,
  • combien d'itérations effectuer,
  • quand arrêter le travail.

Il est donc utile de faire deux tests.

Test A : modèle dans un harness commun

même agent
mêmes outils
même system prompt
mêmes limites

Cela aide à comparer les modèles eux-mêmes.

Test B : produit end-to-end

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Cela répond à la question pratique :

Quelle solution convient le mieux à l'équipe ?

Ces deux tests mesurent des choses différentes.

29. Checklist de production Muse Spark 1.2

Benchmarks

  • La version du benchmark est enregistrée.
  • La date du score est enregistrée.
  • Le reasoning effort est enregistré.
  • Le nom de l'agent est enregistré.
  • Meta Terminal-Bench n'est pas mélangé au résultat AA.
  • Meta Internal Coding Bench n'est pas traité comme un test indépendant.
  • Les résultats ont été vérifiés sur le dépôt interne.

Coût

  • L'input réel est mesuré.
  • Le cached input est mesuré.
  • L'output est mesuré.
  • Le coût du reasoning est mesuré.
  • Le nombre de tool calls est mesuré.
  • Le coût est calculé par tâche terminée.
  • Au moins trois modèles sont comparés.
  • Une limite de dépense par agent est définie.

Dépôt

  • L'agent possède uniquement les droits nécessaires.
  • Les secrets ne sont pas dans des fichiers facilement accessibles.
  • L'accès production requiert une approbation.
  • Le merge requiert une review.
  • Les tests s'exécutent automatiquement.
  • L'agent ne peut pas contourner branch protection.
  • Les changements et tool calls sont journalisés.

Données

  • Les conditions du Standard tier sont vérifiées.
  • Les conditions du Contributor tier sont vérifiées.
  • Le code client ne part pas vers le mauvais endpoint.
  • La politique de l'entreprise autorise le service choisi.
  • Les règles de rétention des prompts et logs sont définies.
  • Les données personnelles sont correctement protégées.

Qualité

  • L'agent exécute les tests après modification.
  • Le diff final est vérifié.
  • Les régressions sont mesurées.
  • Les longues tâches ont des checkpoints.
  • La reprise après erreur est testée.
  • Les grands monorepos sont testés.
  • Les tâches de plusieurs heures sont testées.

30. Verdict POLPROG

Muse Spark 1.2 est une sortie plus importante que ce que suggère le numéro 1.2.

Meta a construit le modèle et Muse Code comme un système lié, avec un entraînement axé sur :

  • grands dépôts,
  • tâches longues,
  • outils,
  • sous-agents,
  • planification,
  • vérification automatique.

Les résultats confirment une amélioration réelle par rapport à Muse Spark 1.1.

Faits les plus solides

Terminal-Bench 2.1
76,2 % -> 82,9 % dans l'évaluation Meta

DeepSWE 1.1
53,0 % -> 59,3 % dans l'évaluation Meta

GDPval-AA v2
1371 -> 1631 Elo dans le snapshot de lancement Artificial Analysis

[1][4]

Mais il n'est toujours pas leader partout

Opus 5 bat Muse Spark 1.2 dans les trois benchmarks coding présentés par Meta.

Dans le snapshot actuel Artificial Analysis :

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Alors pourquoi Muse Spark 1.2 est-il intéressant ?

Parce qu'il coûte :

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

La question suivante devient donc moins utile :

Quel modèle a le meilleur benchmark ?

Une meilleure question est :

Quel modèle fournit le plus grand nombre de tâches correctement terminées pour 100 USD de budget ?

Pour beaucoup d'équipes, la réponse peut différer du modèle classé premier dans un tableau.

Muse Spark 1.2 apparaît actuellement comme un candidat très solide pour la programmation agentique à grande échelle avec un coût contrôlé.

Ce n'est pas un vainqueur absolu.

Mais il mérite clairement une place dans un POC avec :

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 est une sortie plus importante que ce que suggère le numéro 1.2. Les résultats confirment une amélioration réelle par rapport à Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Questions fréquentes

Quand Muse Spark 1.2 est-il sorti ?

Meta a présenté Muse Spark 1.2 et Muse Code le 5 août 2026.

Muse Spark 1.2 est-il open source ?

Non. Artificial Analysis le classe comme modèle proprietary, et les poids ne sont pas publiquement disponibles.

Combien de paramètres possède Muse Spark 1.2 ?

Meta n'a pas publié le nombre de paramètres.

Quelle est la taille du contexte ?

1 million de tokens.

Prend-il en charge les images ?

Oui. Artificial Analysis confirme text + image input et text output.

Combien coûte l'API ?

Le tarif standard est de 1,25 USD par million de tokens input, 0,15 USD par million de cached input et 4,25 USD par million de tokens output.

Muse Spark 1.2 est-il meilleur que Claude Opus 5 ?

Pas selon les benchmarks généraux disponibles ni les comparatifs Meta. Opus 5 mène les trois benchmarks coding présentés par Meta et possède un Artificial Analysis Intelligence Index actuel plus élevé.

Muse Spark 1.2 est-il meilleur que GPT-5.6 Terra ?

Cela dépend de la tâche. Muse mène Terminal-Bench Meta et Meta Internal Coding Bench, tandis que Terra mène DeepSWE 1.1. L'AA Intelligence Index général actuel est plus élevé pour Muse.

Muse Spark 1.2 est-il meilleur que Kimi K3 ?

L'Artificial Analysis Intelligence Index actuel donne 57 aux deux modèles. Kimi K3 possède des poids ouverts, Muse est proprietary. Leurs profils et coûts diffèrent.

Pourquoi trouve-t-on 54 en ligne alors que l'article indique 57 ?

54 vient de l'article Artificial Analysis du jour du lancement. La fiche actuelle après passage à v4.1.1 indique 57. Il faut toujours préciser la version et la date du benchmark.

82,9 % sur Terminal-Bench est-il un résultat indépendant ?

Non. C'est un résultat publié par Meta pour Muse Spark 1.2 + Muse Code selon la méthodologie Meta.

Artificial Analysis mesure-t-il Terminal-Bench différemment ?

Oui. Dans le snapshot de lancement AA, Muse Spark 1.2 a obtenu 80 %. La différence vient notamment d'un harness différent.

Muse Code peut-il reprendre après une panne ?

Meta décrit un append-only event log local rendant le runtime restart-safe et capable de reconstruire l'état de travail.

Muse Spark 1.2 est-il disponible mondialement ?

Meta indique dans l'annonce que Muse Spark 1.2 est disponible via Muse Code et Meta Model API avec un accès mondial élargi.

Faut-il migrer depuis Muse Spark 1.1 ?

Les données Meta et Artificial Analysis montrent une amélioration nette en agentic coding et GDPval. La migration doit toutefois être validée sur le workload interne, car 1.2 utilise davantage de tokens sur certaines tâches. ---

Sources et notes

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

Cela vous a-t-il été utile ?

Recevez les nouveaux articles par e-mail

Un court e-mail par nouvel article d'apprentissage. Pas de spam, désinscription en un clic.

Nous utilisons uniquement votre e-mail pour envoyer de nouveaux articles. Aucun partage avec des tiers.

Retour à l'apprentissage