Muse Spark 1.2 en Muse Code: benchmarks, prijzen en vergelijking met Claude Opus 5, GPT-5.6, Kimi K3 en Grok 4.5 Skip to content

Muse Spark 1.2 en Muse Code: benchmarks, prijzen en vergelijking met Claude Opus 5, GPT-5.6, Kimi K3 en Grok 4.5

Op 5 augustus 2026 introduceerde Meta Muse Spark 1.2 en Muse Code, een terminalgebaseerde programmeeragent in bèta. Muse Spark 1.2 is een update die vooral is gericht op programmeren, complexe debugging, het begrijpen van grote codebases en het end-to-end uitvoeren van meerstaps software-engineeringtaken.

Gepubliceerd Geschreven door Leestijd 24 min lezen
X LinkedIn

Op 5 augustus 2026 introduceerde Meta Muse Spark 1.2 en Muse Code, een terminalgebaseerde programmeeragent in bèta. Muse Spark 1.2 is een update die vooral is gericht op programmeren, complexe debugging, het begrijpen van grote codebases en het end-to-end uitvoeren van meerstaps software-engineeringtaken.

Op deze pagina
  1. 1TL;DR
  2. 21. Wat heeft Meta precies uitgebracht?
  3. 32. Muse Code is niet alleen een simpele wrapper om het model
  4. 43. Model en agent zijn samen getraind
  5. 54. Self-improvement met Muse Spark 1.1
  6. 65. Officiële Terminal-Bench 2.1
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Onafhankelijke controle: Artificial Analysis
  10. 109. Huidige vergelijking bij Artificial Analysis
  11. 1110. GDPval-AA v2: grootste verbetering ten opzichte van Spark 1.1
  12. 1211. Terminal-Bench volgens Artificial Analysis
  13. 1312. Hallucinaties: de score lijkt beter, maar lees ook de andere helft van de tabel
  14. 1413. Scientific reasoning verbeterde niet overal
  15. 1514. API-prijs: een van Muse Spark 1.2's grootste sterke punten
  16. 1615. Kosten per taak volgens Artificial Analysis' launchmeting
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Kerneloptimalisatie: meer dan 1.000 tool calls en tot 24 uur werk
  23. 2322. Lange context: 1 miljoen tokens
  24. 2423. Waarom is de huidige AA-score 57 terwijl launchartikelen 54 kunnen tonen?
  25. 2524. Standard tier vs Contributor tier: belangrijk privacyverschil
  26. 2625. Is Muse Spark 1.2 het beste model voor programmeren?
  27. 2726. Welk model kiezen?
  28. 2827. Een eerlijke POC uitvoeren
  29. 2928. Agents vergelijken, niet alleen modellen
  30. 3029. Productiechecklist Muse Spark 1.2
  31. 3130. POLPROG-oordeel

Het model is niet uitgebracht met open gewichten. Artificial Analysis classificeert Muse Spark 1.2 als een proprietary model en het aantal parameters is niet publiek bekendgemaakt.[3]

Het interessantste deel van de release is echter niet alleen de modelnaam. Meta trainde Muse Spark 1.2 samen met Muse Code en optimaliseerde het model voor een echte agentische omgeving: planning, context compaction, subagents, toolgebruik en langdurige taken die volledige repositories omvatten.[1]

De resultaten zijn sterk, maar moeten voorzichtig worden geïnterpreteerd.

In Meta's officiële evaluatie:

  • haalt Muse Spark 1.2 + Muse Code 82,9% in Terminal-Bench 2.1,
  • 59,3% in DeepSWE 1.1,
  • 70,6% in Meta Internal Coding Bench.[1][2]

Dat betekent niet dat Muse Spark 1.2 het beste programmeermodel op de markt is. In dezelfde tabellen staat Claude Opus 5 + Claude Code in alle drie de vergelijkingen op de eerste plaats. Meta vermeldt bovendien zelf dat dit geen perfecte model-tot-modelvergelijking is: elk model draaide met een andere agent en de testconfiguratie kan beter op Muse Code zijn afgestemd dan op concurrerende tools.[2]

Artificial Analysis biedt een onafhankelijker beeld. Op de actuele modelkaart, gecontroleerd op 7 augustus, behaalt Muse Spark 1.2 met xhigh 57 punten in Artificial Analysis Intelligence Index v4.1.1. Ter vergelijking: Claude Opus 5 scoort 61, GPT-5.6 Sol 59, Kimi K3 57 en GPT-5.6 Terra 55.[3][7][8][9][10]

Korte conclusie: Muse Spark 1.2 verslaat Opus 5 of GPT-5.6 Sol niet zonder voorbehoud, maar is uitzonderlijk competitief geprijsd. Het profiel is het sterkst voor agentisch programmeren, vooral samen met Muse Code en wanneer de kosten van lange sessies zwaar wegen.

Alle gegevens in dit artikel zijn geverifieerd aan de hand van Meta-materiaal, de officiële evaluatiemethodologie, Artificial Analysis en onafhankelijke persbronnen. Stand op 7 augustus 2026.

TL;DR

Vraag Geverifieerd antwoord
Wanneer werd Muse Spark 1.2 uitgebracht? 5 augustus 2026
Wie heeft het model gemaakt? Meta
Wat is Muse Code? Terminalgebaseerde programmeeragent in bèta
Heeft Muse Spark 1.2 open gewichten? Nee, het model is proprietary
Kennen we het aantal parameters? Nee, Meta heeft dit niet openbaar gemaakt
Context 1 miljoen tokens
Modaliteiten tekst en afbeelding als input, tekst als output
Standaardprijs input 1,25 USD / 1M tokens
Prijs cached input 0,15 USD / 1M tokens
Prijs output 4,25 USD / 1M tokens
Terminal-Bench 2.1 volgens Meta 82,9%
DeepSWE 1.1 volgens Meta 59,3%
Meta Internal Coding Bench 70,6%
Huidige AA Intelligence Index v4.1.1 57
AA Index in het artikel op de lanceringsdag 54
Zijn Meta's resultaten onafhankelijk? Nee, een deel zijn vendor-evaluaties
Is Artificial Analysis onafhankelijk van Meta? Ja, al gaf Meta pre-release toegang voor benchmarks
Sterkste punt agentisch programmeren en capability-to-price-verhouding
Belangrijkste beperking wint niet alle benchmarks en sommige tests gebruiken verschillende agent harnesses

1. Wat heeft Meta precies uitgebracht?

De release omvat twee samenhangende producten:

Muse Spark 1.2
model

Muse Code
terminalgebaseerde programmeeragent

Meta beschrijft Muse Spark 1.2 als een codinggerichte update van Muse Spark 1.1. Er is meer compute gebruikt tijdens training op programmeertaken en de diversiteit van trainingsomgevingen is uitgebreid.[1]

Muse Code is een agent die kan:

  • veranderingen in een repository plannen,
  • code schrijven,
  • tools uitvoeren,
  • resultaten valideren,
  • meerdere langlopende subagents coördineren,
  • voortgang vasthouden tijdens lange sessies.[1]

Meta beschrijft installatie van de officiële client op macOS of Linux als volgt:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 is beschikbaar via zowel Muse Code als Meta Model API. Meta omschrijft de huidige beschikbaarheid als breed wereldwijd uitgebreid.[1]

2. Muse Code is niet alleen een simpele wrapper om het model

Bij programmeeragents zijn een modelbenchmark en een productbenchmark niet hetzelfde.

Muse Code voegt een eigen uitvoeringslaag toe.

Async Background Agents

De hoofdagent kan gespecialiseerde subagents gebruiken die op de achtergrond blijven werken. Ze worden niet alleen voor één stap aangemaakt en kunnen tijdens de hele sessie actief blijven.[1]

Dit moet verminderen:

  • herhaald verzamelen van dezelfde informatie,
  • latency,
  • noodzaak tot handmatige sturing,
  • herhaalde repositoryanalyse.

Append-only event log

Muse Code bewaart lokaal een geschiedenis van:

  • modelcalls,
  • toolgebruik,
  • goedkeuringen,
  • edits.[1]

Meta beschrijft de runtime als replay-exact en restart-safe. Na een storing kan de agent vanuit het log verdergaan in plaats van de taak opnieuw te beginnen.

Dat is relevant voor programmeertaken die uren duren.

Ingebouwde skills

De eerste versie bevat onder andere:

/plan
/grill
/goal

/plan maakt een plan met een goedkeuringsstap, /grill beoordeelt het plan kritisch en /goal houdt het werk gericht op een vastgesteld doel.[1]

3. Model en agent zijn samen getraind

Dit is een van de belangrijkste feiten voor de interpretatie van benchmarks.

Meta heeft niet simpelweg een nieuw model aan een bestaande CLI gekoppeld. Het bedrijf zegt Muse Spark 1.2 en Muse Code samen te hebben getraind.[1]

De training omvatte onder meer:

  • trajectories uit de agent harness,
  • optimalisaties voor doelgericht werk,
  • compaction,
  • subagents,
  • de geïntegreerde Muse Code-toolset.[1]

Het model werd ook getraind op long-horizon-taken:

  • volledige repositories genereren,
  • grote end-to-end-projecten,
  • auto-research,
  • werk sequencen via planning,
  • koers vasthouden via goal conditioning,
  • contextcompressie.[1]

Dit helpt verklaren waarom de juiste vergelijkingseenheid soms is:

Muse Spark 1.2 + Muse Code

en niet alleen:

Muse Spark 1.2

4. Self-improvement met Muse Spark 1.1

Meta gebruikte Muse Spark 1.1 om trainingsdata voor versie 1.2 te bouwen.

Volgens de officiële beschrijving:

  1. genereerde het vorige model moeilijke programmeeromgevingen,
  2. maakte het sjablonen voor complexe instructies,
  3. beoordeelde het kandidaatoplossingen,
  4. hielp het een schaalbare dataset voor Muse Spark 1.2 te bouwen.[1]

Meta noemt dit proces een self-improvement loop.

Dat betekent niet dat het model “zichzelf heeft getraind”. Het bleef een gecontroleerde trainingspipeline van Meta, waarin het eerdere model één van de onderdelen was voor het genereren en beoordelen van data.

5. Officiële Terminal-Bench 2.1

Terminal-Bench 2.1 beoordeelt agents die taken uitvoeren in een terminalomgeving.

Meta gebruikte alle 89 taken uit de officiële 2.1-release. Elke run vond plaats in een geïsoleerde Daytona-sandbox en een executable verifier beoordeelde de uiteindelijke containerstatus. De score is het gemiddelde pass@1 over vijf pogingen.[2]

Door Meta gepubliceerde resultaten

Model + agent Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7%
Muse Spark 1.2 + Muse Code xhigh 82,9%
GPT-5.6 Terra + Codex max 81,8%
Grok 4.5 + Grok Build high 81,6%
Gemini 3.6 Flash + Antigravity CLI high 78,9%
Muse Spark 1.1 + mini-swe-agent xhigh 76,2% [1][2]

Muse Spark 1.2 verbetert het resultaat van zijn voorganger met 6,7 procentpunt.

Tegelijkertijd:

  • ligt het 3,8 pp achter Opus 5,
  • 1,1 pp voor GPT-5.6 Terra,
  • 1,3 pp voor Grok 4.5.

Belangrijkste kanttekening

Dit is geen zuivere benchmark van alleen de modellen.

De vergeleken systemen zijn:

model
+
agent
+
tools
+
system prompt
+
runtime

Meta gebruikt:

  • Muse Code voor Spark 1.2,
  • Claude Code voor Opus 5,
  • Codex voor GPT-5.6,
  • Grok Build voor Grok 4.5,
  • Antigravity CLI voor Gemini.[2]

Meta merkt zelf op dat de configuratie en system prompts mogelijk niet optimaal waren afgestemd op de gesloten modellen van concurrenten.[2]

De juiste conclusie is daarom:

In Meta's configuratie behaalde Muse Spark 1.2 + Muse Code 82,9%.

Niet:

Muse Spark 1.2 is altijd beter dan GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 bevat 113 taken uit 91 repositories in vijf talen:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Elke taak heeft een handmatig gemaakte functionele verifier en regressietests.

Tijdens rollout en grading is extern internet geblokkeerd. De modelendpoint blijft beschikbaar.[2]

Meta-resultaten

Model + agent DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0%
GPT-5.6 Terra + Codex 64,8%
Muse Spark 1.2 + Muse Code 59,3%
Grok 4.5 + Grok Build 56,6%
Muse Spark 1.1 + mini-swe-agent 53,0%
Gemini 3.6 Flash + Antigravity CLI 40,0% [1][2]

Muse Spark 1.2 verbetert 1.1 met 6,3 pp.

Hier is de afstand tot de leiders echter groter:

Opus 5       65,0%
GPT-5.6      64,8%
Muse 1.2     59,3%

Het is een sterke score, maar geen eerste plaats.

Extra methodologische beperking

Het officiële DeepSWE-leaderboard gebruikt mini-swe-agent voor elk model.

Meta gebruikte in zijn evaluatie juist een apart agentproduct per model. Het bedrijf schrijft zelf dat het resultaat niet harness-identical is met het officiële leaderboard.[2]

Dat is een belangrijke kwalificatie die naast de 59,3% hoort te staan.

7. Meta Internal Coding Bench

Meta Internal Coding Bench bevat 440 taken uit Meta's interne codebase en echte pull requests.[2]

Het omvat:

  • bugfixes,
  • nieuwe functies,
  • refactoring,
  • cleanup,
  • andere software-engineeringtaken.

Internet is uitgeschakeld. Oplossingen worden gecompileerd en met unit tests gecontroleerd. Meta voert twee pogingen per taak uit.[2]

Resultaten

Model Meta Internal Coding Bench
Claude Opus 5 79,4%
Muse Spark 1.2 70,6%
Muse Spark 1.1 68,3%
GPT-5.6 Terra 65,4%
Gemini 3.6 Flash 63,9% [1][2]

Muse Spark 1.2 verbetert zijn voorganger met 2,3 pp.

Waarom heeft deze benchmark minder externe waarde?

Niet omdat hij per se fout moet zijn.

Het probleem is reproduceerbaarheid.

De dataset:

  • is intern,
  • komt uit Meta's private codebase,
  • is geen publieke benchmark die externe teams zelf kunnen reproduceren.

Daarom moet het resultaat als extra vendorsignaal worden gezien, niet als onafhankelijk bewijs van superioriteit.

8. Onafhankelijke controle: Artificial Analysis

Artificial Analysis kreeg vóór de publieke release toegang tot Muse Spark 1.2 en voerde een eigen testset uit.[4]

Dat is belangrijk omdat het onderscheid mogelijk maakt tussen:

vendorbenchmark

en:

benchmark van een onafhankelijke organisatie

Belangrijke scorewijziging na de release

Artificial Analysis meldde in het artikel van 5 augustus:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

De actuele modelkaart, nadat de index naar v4.1.1 is gegaan, toont:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

De waarde 54 moet daarom niet zonder datum in een actuele ranking worden overgenomen.

Benchmarks veranderen door:

  • indexversies,
  • grading,
  • evaluatiesets,
  • methodologische fixes.

Een productieartikel moet altijd het snapshot noemen.

9. Huidige vergelijking bij Artificial Analysis

Modelkaarten gecontroleerd op 7 augustus 2026:

Model AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* De Grok 4.5-score komt uit Artificial Analysis' gepubliceerde rapport over dat model. De waarden zijn snapshots van de betreffende benchmarkversies, geen permanente ranglijstposities.

Wat betekent dit?

Muse Spark 1.2:

  • haalt Opus 5 momenteel niet in op de algemene index,
  • blijft 2 punten achter GPT-5.6 Sol,
  • staat gelijk met Kimi K3 op de huidige AA-kaart,
  • staat voor GPT-5.6 Terra in de algemene index,
  • ligt boven de launchscore van Grok 4.5.

Maar Artificial Analysis Intelligence Index is geen benchmark uitsluitend voor programmeren.

De huidige v4.1.1 combineert negen evaluaties, waaronder:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

De score 57 moet daarom worden gelezen als een breder signaal van intelligentie en agentische capaciteit.

10. GDPval-AA v2: grootste verbetering ten opzichte van Spark 1.1

In het launchesnapshot van Artificial Analysis steeg GDPval-AA v2 van:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

oftewel +260 Elo-punten.[4]

GDPval-AA v2 test realistische kenniswerktaken.

Het bevat 220 taken uit:

  • 44 beroepen,
  • 9 grote sectoren van de Amerikaanse economie.[2]

Modellen maken onder andere:

  • documenten,
  • spreadsheets,
  • presentaties,
  • diagrammen,
  • rapporten.

Artificial Analysis gebruikt zijn eigen agentic harness Stirrup met shell- en webtoegang; resultaten worden paarsgewijs vergeleken door een LLM-judge.[2]

Snapshot van 5 augustus

Artificial Analysis rapporteerde:

Model GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

Dit is een van de sterkste aanwijzingen dat 1.2 niet alleen in codegeneratie is verbeterd.

De GDPval-ranking wordt bijgewerkt, dus deze cijfers moeten niet met latere snapshots worden vermengd.

11. Terminal-Bench volgens Artificial Analysis

Meta rapporteert:

82,9%

voor Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis rapporteerde bij de release in zijn eigen harness:

80%

tegenover:

78%

voor Muse Spark 1.1.[4]

Deze resultaten spreken elkaar niet tegen.

Ze komen uit:

  • verschillende harnesses,
  • verschillende agentconfiguraties,
  • verschillende uitvoeringsprocedures.

Dit is een goed voorbeeld van waarom een benchmarkscore nooit zonder methodologie moet worden gepubliceerd.

12. Hallucinaties: de score lijkt beter, maar lees ook de andere helft van de tabel

Artificial Analysis zag in het launchesnapshot een verbetering in AA-Omniscience:

18 -> 22

en een daling van de hallucination rate:

38% -> 28%

[4]

Op het eerste gezicht lijkt dat ondubbelzinnig positief.

Tegelijkertijd:

attempt rate: 82% -> 67%
accuracy:     41% -> 38%

[4]

Het model koos vaker ervoor niet te antwoorden wanneer het onzeker was.

AA-Omniscience bestraft abstention niet. De lagere hallucination rate komt dus deels voort uit een grotere bereidheid om geen antwoord te geven.

Correcte interpretatie:

Muse Spark 1.2 presenteerde minder vaak een fout antwoord alsof het zeker was, maar probeerde ook minder vaak te antwoorden.

Onjuiste interpretatie:

Muse Spark 1.2 werd 10 procentpunt nauwkeuriger.

Dat wordt niet door de data ondersteund.

13. Scientific reasoning verbeterde niet overal

In Artificial Analysis' launchmetingen:

Benchmark Spark 1.1 Spark 1.2 Verandering
CritPt 15% 18% +3 pp
SciCode 58% 56% -2 pp
Humanity's Last Exam 45% 44% -1 pp [4]

Dat laat het karakter van de update zien.

Muse Spark 1.2 is niet simpelweg:

Spark 1.1
+ een paar procent overal

De grootste launchverbeteringen zaten in:

  • agentisch programmeren,
  • toolgebruik,
  • professionele agentische taken.

14. API-prijs: een van Muse Spark 1.2's grootste sterke punten

Meta's standaardprijzen:

Tokens Prijs per 1M
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Input/output-prijzen zijn gelijk aan Muse Spark 1.1.

Vergelijking van publieke API-prijzen

Model Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

Dit vergelijkt tokenprijzen, niet de kosten van een voltooide taak.

Een goedkoper model per miljoen tokens kan:

  • meer tokens genereren,
  • meer tool calls doen,
  • meer iteraties nodig hebben,
  • een fout maken die handmatige reparatie vereist.

De nuttigere bedrijfsmetriek is daarom:

kosten per correct voltooide taak

en niet alleen:

prijs per 1M tokens

15. Kosten per taak volgens Artificial Analysis' launchmeting

In het snapshot van 5 augustus rapporteerde Artificial Analysis de gewogen gemiddelde kosten van een Intelligence Index-taak:

Model / configuratie Taakkosten
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

Dat is een zeer sterk kostenresultaat voor Muse Spark 1.2.

Vergeleken met Spark 1.1 stegen de kosten echter van:

0,29 USD
naar
0,40 USD

Artificial Analysis koppelt dit aan meer tokengebruik:

  • ongeveer 53% meer inputtokens,
  • ongeveer 36% meer outputtokens,

vooral in GDPval-AA v2.[4]

Versie 1.2 is dus:

beter
maar
tokenintensiever

De API-prijs per token bleef hetzelfde, maar de agent doet meer werk.

16. Muse Spark 1.2 vs Claude Opus 5

Waar wint Opus 5?

In Meta's data:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7% 82,9%
DeepSWE 1.1 65,0% 59,3%
Meta Internal Coding Bench 79,4% 70,6% [1]

In de huidige Artificial Analysis Intelligence Index:

Opus 5:     61
Muse 1.2:   57

[3][7]

Op basis van de beschikbare gegevens is er geen grond om Muse Spark 1.2 in het algemeen het betere model te noemen.

Waar heeft Muse voordeel?

Vooral bij tokenprijzen:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

Bij agents die duizenden operaties uitvoeren kan dat verschil groot zijn.

Conclusie

Opus 5 is beter wanneer:

  • maximale slaagkans belangrijker is dan tokenkosten,
  • de taak moeilijk is en een fout duur zou zijn,
  • het team al Claude Code gebruikt.

Muse Spark 1.2 past beter wanneer:

  • het taakvolume hoog is,
  • de agent lang op een repository werkt,
  • tokenkosten zwaar wegen,
  • enkele benchmarkpunten geen veel duurdere API rechtvaardigen.

17. Muse Spark 1.2 vs GPT-5.6 Terra

Dit is een van de interessantste vergelijkingen.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9%
Terra + Codex:         81,8%

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3%
Terra + Codex:         64,8%

Meta Internal Coding Bench

Muse 1.2:  70,6%
Terra:     65,4%

[1]

De leider wisselt per benchmark.

Artificial Analysis

Huidige algemene index:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Prijs

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Dit betekent niet dat Muse automatisch wint. Terra is in Meta's DeepSWE-vergelijking duidelijk sterker.

De eerlijkste interpretatie is:

Muse Spark 1.2 is uitzonderlijk competitief met GPT-5.6 Terra qua prijs en sommige agentische taken, maar de winnaar hangt af van taaktype en harness.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol blijft sterker in de bredere Artificial Analysis-index:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol kost:

5 USD / 1M input
30 USD / 1M output

tegenover:

1,25 USD / 1M input
4,25 USD / 1M output

voor Muse.[3][8]

Dat is een groot verschil voor:

  • lange reasoning traces,
  • subagents,
  • iteratieve debugging,
  • repositorybrede refactoring,
  • agentruns van meerdere uren.

Als de extra 2 punten in de algemene index niet leiden tot een hoger correct voltooiingspercentage op echte bedrijfstaken, hoeft het duurdere model niet economischer te zijn.

19. Muse Spark 1.2 vs Kimi K3

De huidige Artificial Analysis-kaart toont:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

Dat betekent geen identieke mogelijkheden.

Belangrijkste verschil

Kimi K3:

  • heeft publiek beschikbare gewichten,
  • kan self-hosted worden,
  • heeft 2,8 biljoen totale parameters en 104 miljard actieve parameters,
  • gebruikt zijn eigen Kimi K3 License.[10]

Muse Spark 1.2:

  • is proprietary,
  • draait via Meta Model API,
  • heeft geen publiek bekendgemaakte parametercount.[3]

Prijzen officiële API's

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Als self-hosting geen vereiste is, is Muse in nominale API-prijs veel goedkoper.

Als een organisatie nodig heeft:

  • eigen infrastructuur,
  • controle over de modelgewichten,
  • eigen modelaanpassingen,

dan biedt Kimi K3 iets wat Muse Spark 1.2 momenteel niet biedt.

20. Muse Spark 1.2 vs Grok 4.5

In Meta's Terminal-Bench:

Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build:      81,6%

In DeepSWE:

Muse Spark 1.2: 59,3%
Grok 4.5:        56,6%

[1]

In de launchversie van Artificial Analysis Intelligence Index had Grok 4.5 54, vergelijkbaar met het launchsnapshot van Muse 1.2 vóór de indexupdate.[4][11]

Artificial Analysis noemde Grok 4.5 high ook als een van de weinige modellen met lagere taakkosten in dezelfde kwaliteitscluster:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

Dat is nog een voorbeeld dat prijs-kwaliteit in 2026 niet meer volgens een simpele regel werkt:

duurste model
=
meest economische model

21. Kerneloptimalisatie: meer dan 1.000 tool calls en tot 24 uur werk

Meta voerde een interessante long-horizon-test uit.

Muse Code en de modellen moesten GPU-kernels iteratief optimaliseren via:

  • meer dan 1.000 tool calls,
  • tot 24 uur,
  • code schrijven,
  • compileren,
  • profiling,
  • herhaalde optimalisatie.[1]

KDA en MLA werden getest op NVIDIA Hopper.

KDA

De baseline was een FLA-implementatie in Triton. Modellen mochten externe kernellibraries zoals FLA niet rechtstreeks importeren.[1]

In de grafiek met uiteindelijke speedup versus baseline rapporteerde Meta onder andere:

Model Speedup vs baseline
Claude Opus 5 +74,0%
GPT-5.6 Sol +71,2%
Claude Opus 4.8 +69,6%
Muse Spark 1.2 +68,7%
GPT-5.6 Terra +65,1%
Gemini 3.6 Flash +62,5% [1]

Muse Spark 1.2 won dit experiment niet.

Dat is belangrijk omdat Meta's eigen materiaal het eigen model niet in elke categorie als leider presenteert.

Wat bewijst dit experiment niet?

Het bewijst niet dat:

  • Opus 5 code altijd met 74% optimaliseert,
  • Muse altijd +68,7% speedup levert,
  • de resultaten op elke kernel of GPU overdraagbaar zijn.

Het is een casestudy voor een specifieke taak, baseline, harness en hardwareconfiguratie.

22. Lange context: 1 miljoen tokens

Artificial Analysis bevestigt voor Muse Spark 1.2:

1M token context window

en:

  • text input,
  • image input,
  • text output.[3]

Een miljoen tokens kan relevant zijn voor:

  • grote repositories,
  • monorepos,
  • documentatie,
  • lange agentgeschiedenis,
  • analyse van veel bestanden.

Het betekent niet dat je een volledige repository in één prompt moet stoppen.

Maximale capaciteit garandeert niet:

  • dat elke dependency wordt gevonden,
  • correcte prioritering,
  • weerstand tegen kwaadaardige tekst in een repository,
  • identieke kwaliteit aan begin en einde van de context.

Muse Code gebruikt daarom ook context compaction, in plaats van alleen steeds grotere prompts.[1]

23. Waarom is de huidige AA-score 57 terwijl launchartikelen 54 kunnen tonen?

Dit is geen fout die verborgen moet worden.

Artificial Analysis publiceerde op 5 augustus een score van 54.[4]

De huidige Muse Spark 1.2-kaart gecontroleerd op 7 augustus toont 57 en noemt v4.1.1 als huidige versie van Artificial Analysis Intelligence Index.[3]

Bij het citeren van benchmarks moet je bewaren:

model
+
effort
+
benchmarkversie
+
datum

Bijvoorbeeld:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stand: 7 augustus 2026

Dat is veel beter dan:

Muse Spark 1.2 scoort 57

zonder context.

24. Standard tier vs Contributor tier: belangrijk privacyverschil

De standaardprijs van Muse Spark 1.2 is:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta biedt ook een sterk afgeprijsde Contributor tier.

Onafhankelijke persberichten over het officiële aanbod melden dat de lagere prijs samenhangt met toestemming om gebruikersactiviteit te gebruiken voor het verbeteren van Meta-producten.[6]

Voor bedrijfsgebruik is dat een belangrijk verschil.

Voordat Contributor tier wordt gebruikt voor code die:

  • privé is,
  • onder NDA valt,
  • bedrijfsgeheimen bevat,
  • eigendom is van een klant,

moeten de exacte voorwaarden voor gegevensverwerking voor het account en endpoint worden gecontroleerd.

Kies een goedkoper endpoint niet alleen op basis van prijs.

25. Is Muse Spark 1.2 het beste model voor programmeren?

Op basis van geverifieerde data: daar is geen basis voor.

Het leidt niet alle Meta-benchmarks

Opus 5 leidt in:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra ligt in DeepSWE ook voor Muse.

Maar Muse is uitzonderlijk sterk qua prijs

Muse Spark 1.2 heeft een veel lagere outputprijs dan:

Meest verdedigbare formulering

Muse Spark 1.2 is een van de interessantste modellen van 2026 voor agentic-coding-capability per dollar. Opus 5 blijft sterker in de beschikbare kwaliteitsvergelijkingen en de uiteindelijke keuze moet uit een eigen POC komen.

26. Welk model kiezen?

Kies Muse Spark 1.2 als:

  • de kosten van lange sessies zwaar wegen,
  • je met grote repositories werkt,
  • je Muse Code wilt gebruiken,
  • de agent lang zonder handmatige sturing moet werken,
  • je persistente subagents nodig hebt,
  • de nominale outputprijs laag moet blijven,
  • bijna-frontier prestaties voldoende zijn.

Kies Claude Opus 5 als:

  • maximale slagingskans prioriteit heeft,
  • de kosten van een fout hoger zijn dan tokenkosten,
  • je Claude Code al gebruikt,
  • taken uitzonderlijk moeilijk zijn,
  • je eigen POC een hogere completion rate bevestigt.

Kies GPT-5.6 Terra als:

  • je het Codex-ecosysteem gebruikt,
  • DeepSWE-achtige taken centraal staan,
  • je een sterk codingmodel onder de prijs van Sol wilt,
  • OpenAI-tools al in de pipeline zitten.

Kies GPT-5.6 Sol als:

  • je hogere algemene capability dan Muse nodig hebt,
  • API-kosten minder belangrijk zijn,
  • de workload bredere reasoning dan alleen coding gebruikt.

Kies Kimi K3 als:

  • je open gewichten nodig hebt,
  • je self-hosting plant,
  • je eigen modelmodificaties nodig hebt,
  • een hogere officiële API-prijs acceptabel is.

Overweeg Grok 4.5 als:

  • eigen tests sterke agentische prestaties tonen,
  • kosten per voltooide taak de belangrijkste metriek zijn,
  • je Grok Build of een compatibele harness gebruikt.

27. Een eerlijke POC uitvoeren

Test modellen niet met vijf prompts.

Bereid minimaal voor:

50-200 echte taken

uit je eigen repository.

Categorieën

  • bugfix,
  • nieuwe functie,
  • refactoring,
  • tests,
  • code review,
  • dependency-migratie,
  • performance-optimalisatie,
  • loganalyse,
  • frontend vanaf screenshot,
  • repositorybrede wijziging,
  • technische documentatie.

Meet per taak

succes / mislukking
tijd
kosten
tokenaantal
aantal tool calls
handmatige interventies
regressies

Belangrijkste metriek

Niet:

welk model schreef het mooiste antwoord?

Maar:

welk model leverde het vaakst een correct, merge-ready resultaat
tegen acceptabele kosten en tijd?

28. Agents vergelijken, niet alleen modellen

Bij:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build,

werkt het model niet geïsoleerd.

De agent bepaalt:

  • welke bestanden gelezen worden,
  • wanneer tests draaien,
  • wanneer grep gebruikt wordt,
  • of een subagent wordt ingezet,
  • hoe context wordt beheerd,
  • hoeveel iteraties worden uitgevoerd,
  • wanneer het werk stopt.

Daarom zijn twee tests nuttig.

Test A: model in een gedeelde harness

dezelfde agent
dezelfde tools
dezelfde system prompt
dezelfde limieten

Dit helpt het onderliggende model te vergelijken.

Test B: end-to-end-product

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Dit beantwoordt de praktische vraag:

Welke oplossing is het beste voor het team?

De twee tests meten verschillende dingen.

29. Productiechecklist Muse Spark 1.2

Benchmarks

  • Benchmarkversie wordt opgeslagen.
  • Datum van de score wordt opgeslagen.
  • Reasoning effort wordt opgeslagen.
  • Agentnaam wordt opgeslagen.
  • Meta Terminal-Bench wordt niet gemengd met het AA-resultaat.
  • Meta Internal Coding Bench wordt niet als onafhankelijke test behandeld.
  • Resultaten worden op de eigen repository getest.

Kosten

  • Werkelijk inputgebruik wordt gemeten.
  • Cached input wordt gemeten.
  • Output wordt gemeten.
  • Reasoningkosten worden gemeten.
  • Aantal tool calls wordt gemeten.
  • Kosten worden per voltooide taak berekend.
  • Minstens drie modellen worden vergeleken.
  • Een bestedingslimiet per agent is ingesteld.

Repository

  • De agent heeft minimale benodigde rechten.
  • Secrets staan niet in makkelijk toegankelijke bestanden.
  • Productietoegang vereist goedkeuring.
  • Merge vereist review.
  • Tests draaien automatisch.
  • De agent kan branch protection niet omzeilen.
  • Wijzigingen en tool calls worden gelogd.

Data

  • Voorwaarden van Standard tier zijn gecontroleerd.
  • Voorwaarden van Contributor tier zijn gecontroleerd.
  • Klantcode gaat niet naar de verkeerde endpoint.
  • Bedrijfsbeleid staat de gekozen dienst toe.
  • Regels voor prompt- en logretentie zijn vastgesteld.
  • Persoonsgegevens zijn goed beschermd.

Kwaliteit

  • De agent draait tests na wijzigingen.
  • De definitieve diff wordt gecontroleerd.
  • Regressies worden gemeten.
  • Lange taken hebben checkpoints.
  • Herstel na storing wordt getest.
  • Grote monorepos worden getest.
  • Taken van meerdere uren worden getest.

30. POLPROG-oordeel

Muse Spark 1.2 is een belangrijkere release dan het versienummer 1.2 doet vermoeden.

Meta bouwde het model en Muse Code als een gekoppeld systeem, met training gericht op:

  • grote repositories,
  • langdurige taken,
  • tools,
  • subagents,
  • planning,
  • automatische verificatie.

De resultaten bevestigen een echte verbetering ten opzichte van Muse Spark 1.1.

Sterkste feiten

Terminal-Bench 2.1
76,2% -> 82,9% in Meta's evaluatie

DeepSWE 1.1
53,0% -> 59,3% in Meta's evaluatie

GDPval-AA v2
1371 -> 1631 Elo in Artificial Analysis' launchsnapshot

[1][4]

Maar nog steeds niet overal leider

Opus 5 verslaat Muse Spark 1.2 op alle drie de codingbenchmarks die Meta toont.

In het huidige Artificial Analysis-snapshot:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Waarom is Muse Spark 1.2 dan interessant?

Omdat het kost:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

Daardoor wordt deze vraag minder nuttig:

Welk model heeft de hoogste benchmarkscore?

Een betere vraag is:

Welk model levert per 100 USD budget het hoogste aantal correct voltooide taken?

Voor veel teams kan het antwoord anders zijn dan het model dat in één tabel bovenaan staat.

Muse Spark 1.2 ziet er momenteel uit als een zeer sterke kandidaat voor grootschalig agentisch programmeren met beheersbare kosten.

Het is geen onvoorwaardelijke winnaar.

Maar het hoort duidelijk in een POC naast:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 is een belangrijkere release dan het versienummer 1.2 doet vermoeden. De resultaten bevestigen een echte verbetering ten opzichte van Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Veelgestelde vragen

Wanneer kwam Muse Spark 1.2 uit?

Meta introduceerde Muse Spark 1.2 en Muse Code op 5 augustus 2026.

Is Muse Spark 1.2 open source?

Nee. Artificial Analysis classificeert het als proprietary model en de gewichten zijn niet publiek beschikbaar.

Hoeveel parameters heeft Muse Spark 1.2?

Meta heeft het aantal parameters niet publiek bekendgemaakt.

Hoe groot is de context?

1 miljoen tokens.

Ondersteunt het afbeeldingen?

Ja. Artificial Analysis bevestigt text + image input en text output.

Wat kost de API?

Standaard kost het 1,25 USD per miljoen inputtokens, 0,15 USD per miljoen cached inputtokens en 4,25 USD per miljoen outputtokens.

Is Muse Spark 1.2 beter dan Claude Opus 5?

Niet volgens de beschikbare algemene benchmarks en Meta's vergelijkingen. Opus 5 leidt de drie codingbenchmarks die Meta toont en heeft een hogere huidige Artificial Analysis Intelligence Index.

Is Muse Spark 1.2 beter dan GPT-5.6 Terra?

Dat hangt van de taak af. Muse leidt Meta Terminal-Bench en Meta Internal Coding Bench, terwijl Terra DeepSWE 1.1 leidt. De huidige algemene AA Intelligence Index is hoger voor Muse.

Is Muse Spark 1.2 beter dan Kimi K3?

De huidige Artificial Analysis Intelligence Index geeft beide modellen 57. Kimi K3 heeft open gewichten, Muse is proprietary. Hun profielen en kosten verschillen.

Waarom zie je online 54 terwijl hier 57 staat?

54 komt uit Artificial Analysis' artikel op de lanceringsdag. De huidige modelkaart na de overgang naar v4.1.1 toont 57. Benchmarkversie en datum moeten altijd worden genoemd.

Is 82,9% op Terminal-Bench een onafhankelijk resultaat?

Nee. Het is een door Meta gepubliceerd resultaat voor Muse Spark 1.2 + Muse Code volgens Meta's methodologie.

Meet Artificial Analysis Terminal-Bench anders?

Ja. In AA's launchsnapshot scoorde Muse Spark 1.2 80%. Het verschil komt onder andere door een andere harness.

Kan Muse Code na een storing verdergaan?

Meta beschrijft een lokale append-only event log waarmee de runtime restart-safe is en de werkstatus kan reconstrueren.

Is Muse Spark 1.2 wereldwijd beschikbaar?

Meta schrijft in de aankondiging dat Muse Spark 1.2 via Muse Code en Meta Model API beschikbaar is met uitgebreid wereldwijde toegang.

Is migreren vanaf Muse Spark 1.1 de moeite waard?

Data van Meta en Artificial Analysis laat duidelijke verbetering zien in agentic coding en GDPval. Migratie moet toch op de eigen workload worden gevalideerd, omdat 1.2 bij sommige taken meer tokens gebruikt. ---

Bronnen en voetnoten

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

Was dit nuttig?

Ontvang nieuwe artikelen per e-mail

Eén korte e-mail per nieuw blogartikel. Geen spam, uitschrijven in één klik.

We gebruiken je e-mail alleen om nieuwe artikelen te sturen. Geen delen met derden.

Terug naar de blog