Het model is niet uitgebracht met open gewichten. Artificial Analysis classificeert Muse Spark 1.2 als een proprietary model en het aantal parameters is niet publiek bekendgemaakt.[3]
Het interessantste deel van de release is echter niet alleen de modelnaam. Meta trainde Muse Spark 1.2 samen met Muse Code en optimaliseerde het model voor een echte agentische omgeving: planning, context compaction, subagents, toolgebruik en langdurige taken die volledige repositories omvatten.[1]
De resultaten zijn sterk, maar moeten voorzichtig worden geïnterpreteerd.
In Meta's officiële evaluatie:
- haalt Muse Spark 1.2 + Muse Code 82,9% in Terminal-Bench 2.1,
- 59,3% in DeepSWE 1.1,
- 70,6% in Meta Internal Coding Bench.[1][2]
Dat betekent niet dat Muse Spark 1.2 het beste programmeermodel op de markt is. In dezelfde tabellen staat Claude Opus 5 + Claude Code in alle drie de vergelijkingen op de eerste plaats. Meta vermeldt bovendien zelf dat dit geen perfecte model-tot-modelvergelijking is: elk model draaide met een andere agent en de testconfiguratie kan beter op Muse Code zijn afgestemd dan op concurrerende tools.[2]
Artificial Analysis biedt een onafhankelijker beeld. Op de actuele modelkaart, gecontroleerd op 7 augustus, behaalt Muse Spark 1.2 met xhigh 57 punten in Artificial Analysis Intelligence Index v4.1.1. Ter vergelijking: Claude Opus 5 scoort 61, GPT-5.6 Sol 59, Kimi K3 57 en GPT-5.6 Terra 55.[3][7][8][9][10]
Korte conclusie: Muse Spark 1.2 verslaat Opus 5 of GPT-5.6 Sol niet zonder voorbehoud, maar is uitzonderlijk competitief geprijsd. Het profiel is het sterkst voor agentisch programmeren, vooral samen met Muse Code en wanneer de kosten van lange sessies zwaar wegen.
Alle gegevens in dit artikel zijn geverifieerd aan de hand van Meta-materiaal, de officiële evaluatiemethodologie, Artificial Analysis en onafhankelijke persbronnen. Stand op 7 augustus 2026.
TL;DR
| Vraag | Geverifieerd antwoord |
|---|---|
| Wanneer werd Muse Spark 1.2 uitgebracht? | 5 augustus 2026 |
| Wie heeft het model gemaakt? | Meta |
| Wat is Muse Code? | Terminalgebaseerde programmeeragent in bèta |
| Heeft Muse Spark 1.2 open gewichten? | Nee, het model is proprietary |
| Kennen we het aantal parameters? | Nee, Meta heeft dit niet openbaar gemaakt |
| Context | 1 miljoen tokens |
| Modaliteiten | tekst en afbeelding als input, tekst als output |
| Standaardprijs input | 1,25 USD / 1M tokens |
| Prijs cached input | 0,15 USD / 1M tokens |
| Prijs output | 4,25 USD / 1M tokens |
| Terminal-Bench 2.1 volgens Meta | 82,9% |
| DeepSWE 1.1 volgens Meta | 59,3% |
| Meta Internal Coding Bench | 70,6% |
| Huidige AA Intelligence Index v4.1.1 | 57 |
| AA Index in het artikel op de lanceringsdag | 54 |
| Zijn Meta's resultaten onafhankelijk? | Nee, een deel zijn vendor-evaluaties |
| Is Artificial Analysis onafhankelijk van Meta? | Ja, al gaf Meta pre-release toegang voor benchmarks |
| Sterkste punt | agentisch programmeren en capability-to-price-verhouding |
| Belangrijkste beperking | wint niet alle benchmarks en sommige tests gebruiken verschillende agent harnesses |
1. Wat heeft Meta precies uitgebracht?
De release omvat twee samenhangende producten:
Muse Spark 1.2
model
Muse Code
terminalgebaseerde programmeeragent
Meta beschrijft Muse Spark 1.2 als een codinggerichte update van Muse Spark 1.1. Er is meer compute gebruikt tijdens training op programmeertaken en de diversiteit van trainingsomgevingen is uitgebreid.[1]
Muse Code is een agent die kan:
- veranderingen in een repository plannen,
- code schrijven,
- tools uitvoeren,
- resultaten valideren,
- meerdere langlopende subagents coördineren,
- voortgang vasthouden tijdens lange sessies.[1]
Meta beschrijft installatie van de officiële client op macOS of Linux als volgt:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 is beschikbaar via zowel Muse Code als Meta Model API. Meta omschrijft de huidige beschikbaarheid als breed wereldwijd uitgebreid.[1]
2. Muse Code is niet alleen een simpele wrapper om het model
Bij programmeeragents zijn een modelbenchmark en een productbenchmark niet hetzelfde.
Muse Code voegt een eigen uitvoeringslaag toe.
Async Background Agents
De hoofdagent kan gespecialiseerde subagents gebruiken die op de achtergrond blijven werken. Ze worden niet alleen voor één stap aangemaakt en kunnen tijdens de hele sessie actief blijven.[1]
Dit moet verminderen:
- herhaald verzamelen van dezelfde informatie,
- latency,
- noodzaak tot handmatige sturing,
- herhaalde repositoryanalyse.
Append-only event log
Muse Code bewaart lokaal een geschiedenis van:
- modelcalls,
- toolgebruik,
- goedkeuringen,
- edits.[1]
Meta beschrijft de runtime als replay-exact en restart-safe. Na een storing kan de agent vanuit het log verdergaan in plaats van de taak opnieuw te beginnen.
Dat is relevant voor programmeertaken die uren duren.
Ingebouwde skills
De eerste versie bevat onder andere:
/plan
/grill
/goal
/plan maakt een plan met een goedkeuringsstap, /grill beoordeelt het plan kritisch en /goal houdt het werk gericht op een vastgesteld doel.[1]
3. Model en agent zijn samen getraind
Dit is een van de belangrijkste feiten voor de interpretatie van benchmarks.
Meta heeft niet simpelweg een nieuw model aan een bestaande CLI gekoppeld. Het bedrijf zegt Muse Spark 1.2 en Muse Code samen te hebben getraind.[1]
De training omvatte onder meer:
- trajectories uit de agent harness,
- optimalisaties voor doelgericht werk,
- compaction,
- subagents,
- de geïntegreerde Muse Code-toolset.[1]
Het model werd ook getraind op long-horizon-taken:
- volledige repositories genereren,
- grote end-to-end-projecten,
- auto-research,
- werk sequencen via planning,
- koers vasthouden via goal conditioning,
- contextcompressie.[1]
Dit helpt verklaren waarom de juiste vergelijkingseenheid soms is:
Muse Spark 1.2 + Muse Code
en niet alleen:
Muse Spark 1.2
4. Self-improvement met Muse Spark 1.1
Meta gebruikte Muse Spark 1.1 om trainingsdata voor versie 1.2 te bouwen.
Volgens de officiële beschrijving:
- genereerde het vorige model moeilijke programmeeromgevingen,
- maakte het sjablonen voor complexe instructies,
- beoordeelde het kandidaatoplossingen,
- hielp het een schaalbare dataset voor Muse Spark 1.2 te bouwen.[1]
Meta noemt dit proces een self-improvement loop.
Dat betekent niet dat het model “zichzelf heeft getraind”. Het bleef een gecontroleerde trainingspipeline van Meta, waarin het eerdere model één van de onderdelen was voor het genereren en beoordelen van data.
5. Officiële Terminal-Bench 2.1
Terminal-Bench 2.1 beoordeelt agents die taken uitvoeren in een terminalomgeving.
Meta gebruikte alle 89 taken uit de officiële 2.1-release. Elke run vond plaats in een geïsoleerde Daytona-sandbox en een executable verifier beoordeelde de uiteindelijke containerstatus. De score is het gemiddelde pass@1 over vijf pogingen.[2]
Door Meta gepubliceerde resultaten
| Model + agent | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7% | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9% | |
| GPT-5.6 Terra + Codex | max | 81,8% | |
| Grok 4.5 + Grok Build | high | 81,6% | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9% | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2% | [1][2] |
Muse Spark 1.2 verbetert het resultaat van zijn voorganger met 6,7 procentpunt.
Tegelijkertijd:
- ligt het 3,8 pp achter Opus 5,
- 1,1 pp voor GPT-5.6 Terra,
- 1,3 pp voor Grok 4.5.
Belangrijkste kanttekening
Dit is geen zuivere benchmark van alleen de modellen.
De vergeleken systemen zijn:
model
+
agent
+
tools
+
system prompt
+
runtime
Meta gebruikt:
- Muse Code voor Spark 1.2,
- Claude Code voor Opus 5,
- Codex voor GPT-5.6,
- Grok Build voor Grok 4.5,
- Antigravity CLI voor Gemini.[2]
Meta merkt zelf op dat de configuratie en system prompts mogelijk niet optimaal waren afgestemd op de gesloten modellen van concurrenten.[2]
De juiste conclusie is daarom:
In Meta's configuratie behaalde Muse Spark 1.2 + Muse Code 82,9%.
Niet:
Muse Spark 1.2 is altijd beter dan GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 bevat 113 taken uit 91 repositories in vijf talen:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Elke taak heeft een handmatig gemaakte functionele verifier en regressietests.
Tijdens rollout en grading is extern internet geblokkeerd. De modelendpoint blijft beschikbaar.[2]
Meta-resultaten
| Model + agent | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0% | |
| GPT-5.6 Terra + Codex | 64,8% | |
| Muse Spark 1.2 + Muse Code | 59,3% | |
| Grok 4.5 + Grok Build | 56,6% | |
| Muse Spark 1.1 + mini-swe-agent | 53,0% | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0% | [1][2] |
Muse Spark 1.2 verbetert 1.1 met 6,3 pp.
Hier is de afstand tot de leiders echter groter:
Opus 5 65,0%
GPT-5.6 64,8%
Muse 1.2 59,3%
Het is een sterke score, maar geen eerste plaats.
Extra methodologische beperking
Het officiële DeepSWE-leaderboard gebruikt mini-swe-agent voor elk model.
Meta gebruikte in zijn evaluatie juist een apart agentproduct per model. Het bedrijf schrijft zelf dat het resultaat niet harness-identical is met het officiële leaderboard.[2]
Dat is een belangrijke kwalificatie die naast de 59,3% hoort te staan.
7. Meta Internal Coding Bench
Meta Internal Coding Bench bevat 440 taken uit Meta's interne codebase en echte pull requests.[2]
Het omvat:
- bugfixes,
- nieuwe functies,
- refactoring,
- cleanup,
- andere software-engineeringtaken.
Internet is uitgeschakeld. Oplossingen worden gecompileerd en met unit tests gecontroleerd. Meta voert twee pogingen per taak uit.[2]
Resultaten
| Model | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4% | |
| Muse Spark 1.2 | 70,6% | |
| Muse Spark 1.1 | 68,3% | |
| GPT-5.6 Terra | 65,4% | |
| Gemini 3.6 Flash | 63,9% | [1][2] |
Muse Spark 1.2 verbetert zijn voorganger met 2,3 pp.
Waarom heeft deze benchmark minder externe waarde?
Niet omdat hij per se fout moet zijn.
Het probleem is reproduceerbaarheid.
De dataset:
- is intern,
- komt uit Meta's private codebase,
- is geen publieke benchmark die externe teams zelf kunnen reproduceren.
Daarom moet het resultaat als extra vendorsignaal worden gezien, niet als onafhankelijk bewijs van superioriteit.
8. Onafhankelijke controle: Artificial Analysis
Artificial Analysis kreeg vóór de publieke release toegang tot Muse Spark 1.2 en voerde een eigen testset uit.[4]
Dat is belangrijk omdat het onderscheid mogelijk maakt tussen:
vendorbenchmark
en:
benchmark van een onafhankelijke organisatie
Belangrijke scorewijziging na de release
Artificial Analysis meldde in het artikel van 5 augustus:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
De actuele modelkaart, nadat de index naar v4.1.1 is gegaan, toont:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
De waarde 54 moet daarom niet zonder datum in een actuele ranking worden overgenomen.
Benchmarks veranderen door:
- indexversies,
- grading,
- evaluatiesets,
- methodologische fixes.
Een productieartikel moet altijd het snapshot noemen.
9. Huidige vergelijking bij Artificial Analysis
Modelkaarten gecontroleerd op 7 augustus 2026:
| Model | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* De Grok 4.5-score komt uit Artificial Analysis' gepubliceerde rapport over dat model. De waarden zijn snapshots van de betreffende benchmarkversies, geen permanente ranglijstposities.
Wat betekent dit?
Muse Spark 1.2:
- haalt Opus 5 momenteel niet in op de algemene index,
- blijft 2 punten achter GPT-5.6 Sol,
- staat gelijk met Kimi K3 op de huidige AA-kaart,
- staat voor GPT-5.6 Terra in de algemene index,
- ligt boven de launchscore van Grok 4.5.
Maar Artificial Analysis Intelligence Index is geen benchmark uitsluitend voor programmeren.
De huidige v4.1.1 combineert negen evaluaties, waaronder:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
De score 57 moet daarom worden gelezen als een breder signaal van intelligentie en agentische capaciteit.
10. GDPval-AA v2: grootste verbetering ten opzichte van Spark 1.1
In het launchesnapshot van Artificial Analysis steeg GDPval-AA v2 van:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
oftewel +260 Elo-punten.[4]
GDPval-AA v2 test realistische kenniswerktaken.
Het bevat 220 taken uit:
- 44 beroepen,
- 9 grote sectoren van de Amerikaanse economie.[2]
Modellen maken onder andere:
- documenten,
- spreadsheets,
- presentaties,
- diagrammen,
- rapporten.
Artificial Analysis gebruikt zijn eigen agentic harness Stirrup met shell- en webtoegang; resultaten worden paarsgewijs vergeleken door een LLM-judge.[2]
Snapshot van 5 augustus
Artificial Analysis rapporteerde:
| Model | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
Dit is een van de sterkste aanwijzingen dat 1.2 niet alleen in codegeneratie is verbeterd.
De GDPval-ranking wordt bijgewerkt, dus deze cijfers moeten niet met latere snapshots worden vermengd.
11. Terminal-Bench volgens Artificial Analysis
Meta rapporteert:
82,9%
voor Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis rapporteerde bij de release in zijn eigen harness:
80%
tegenover:
78%
voor Muse Spark 1.1.[4]
Deze resultaten spreken elkaar niet tegen.
Ze komen uit:
- verschillende harnesses,
- verschillende agentconfiguraties,
- verschillende uitvoeringsprocedures.
Dit is een goed voorbeeld van waarom een benchmarkscore nooit zonder methodologie moet worden gepubliceerd.
12. Hallucinaties: de score lijkt beter, maar lees ook de andere helft van de tabel
Artificial Analysis zag in het launchesnapshot een verbetering in AA-Omniscience:
18 -> 22
en een daling van de hallucination rate:
38% -> 28%
Op het eerste gezicht lijkt dat ondubbelzinnig positief.
Tegelijkertijd:
attempt rate: 82% -> 67%
accuracy: 41% -> 38%
Het model koos vaker ervoor niet te antwoorden wanneer het onzeker was.
AA-Omniscience bestraft abstention niet. De lagere hallucination rate komt dus deels voort uit een grotere bereidheid om geen antwoord te geven.
Correcte interpretatie:
Muse Spark 1.2 presenteerde minder vaak een fout antwoord alsof het zeker was, maar probeerde ook minder vaak te antwoorden.
Onjuiste interpretatie:
Muse Spark 1.2 werd 10 procentpunt nauwkeuriger.
Dat wordt niet door de data ondersteund.
13. Scientific reasoning verbeterde niet overal
In Artificial Analysis' launchmetingen:
| Benchmark | Spark 1.1 | Spark 1.2 | Verandering | |
|---|---|---|---|---|
| CritPt | 15% | 18% | +3 pp | |
| SciCode | 58% | 56% | -2 pp | |
| Humanity's Last Exam | 45% | 44% | -1 pp | [4] |
Dat laat het karakter van de update zien.
Muse Spark 1.2 is niet simpelweg:
Spark 1.1
+ een paar procent overal
De grootste launchverbeteringen zaten in:
- agentisch programmeren,
- toolgebruik,
- professionele agentische taken.
14. API-prijs: een van Muse Spark 1.2's grootste sterke punten
Meta's standaardprijzen:
| Tokens | Prijs per 1M | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Input/output-prijzen zijn gelijk aan Muse Spark 1.1.
Vergelijking van publieke API-prijzen
| Model | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
Dit vergelijkt tokenprijzen, niet de kosten van een voltooide taak.
Een goedkoper model per miljoen tokens kan:
- meer tokens genereren,
- meer tool calls doen,
- meer iteraties nodig hebben,
- een fout maken die handmatige reparatie vereist.
De nuttigere bedrijfsmetriek is daarom:
kosten per correct voltooide taak
en niet alleen:
prijs per 1M tokens
15. Kosten per taak volgens Artificial Analysis' launchmeting
In het snapshot van 5 augustus rapporteerde Artificial Analysis de gewogen gemiddelde kosten van een Intelligence Index-taak:
| Model / configuratie | Taakkosten | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
Dat is een zeer sterk kostenresultaat voor Muse Spark 1.2.
Vergeleken met Spark 1.1 stegen de kosten echter van:
0,29 USD
naar
0,40 USD
Artificial Analysis koppelt dit aan meer tokengebruik:
- ongeveer 53% meer inputtokens,
- ongeveer 36% meer outputtokens,
vooral in GDPval-AA v2.[4]
Versie 1.2 is dus:
beter
maar
tokenintensiever
De API-prijs per token bleef hetzelfde, maar de agent doet meer werk.
16. Muse Spark 1.2 vs Claude Opus 5
Waar wint Opus 5?
In Meta's data:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7% | 82,9% | |
| DeepSWE 1.1 | 65,0% | 59,3% | |
| Meta Internal Coding Bench | 79,4% | 70,6% | [1] |
In de huidige Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
Op basis van de beschikbare gegevens is er geen grond om Muse Spark 1.2 in het algemeen het betere model te noemen.
Waar heeft Muse voordeel?
Vooral bij tokenprijzen:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
Bij agents die duizenden operaties uitvoeren kan dat verschil groot zijn.
Conclusie
Opus 5 is beter wanneer:
- maximale slaagkans belangrijker is dan tokenkosten,
- de taak moeilijk is en een fout duur zou zijn,
- het team al Claude Code gebruikt.
Muse Spark 1.2 past beter wanneer:
- het taakvolume hoog is,
- de agent lang op een repository werkt,
- tokenkosten zwaar wegen,
- enkele benchmarkpunten geen veel duurdere API rechtvaardigen.
17. Muse Spark 1.2 vs GPT-5.6 Terra
Dit is een van de interessantste vergelijkingen.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9%
Terra + Codex: 81,8%
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3%
Terra + Codex: 64,8%
Meta Internal Coding Bench
Muse 1.2: 70,6%
Terra: 65,4%
De leider wisselt per benchmark.
Artificial Analysis
Huidige algemene index:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Prijs
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Dit betekent niet dat Muse automatisch wint. Terra is in Meta's DeepSWE-vergelijking duidelijk sterker.
De eerlijkste interpretatie is:
Muse Spark 1.2 is uitzonderlijk competitief met GPT-5.6 Terra qua prijs en sommige agentische taken, maar de winnaar hangt af van taaktype en harness.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol blijft sterker in de bredere Artificial Analysis-index:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol kost:
5 USD / 1M input
30 USD / 1M output
tegenover:
1,25 USD / 1M input
4,25 USD / 1M output
Dat is een groot verschil voor:
- lange reasoning traces,
- subagents,
- iteratieve debugging,
- repositorybrede refactoring,
- agentruns van meerdere uren.
Als de extra 2 punten in de algemene index niet leiden tot een hoger correct voltooiingspercentage op echte bedrijfstaken, hoeft het duurdere model niet economischer te zijn.
19. Muse Spark 1.2 vs Kimi K3
De huidige Artificial Analysis-kaart toont:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
Dat betekent geen identieke mogelijkheden.
Belangrijkste verschil
Kimi K3:
- heeft publiek beschikbare gewichten,
- kan self-hosted worden,
- heeft 2,8 biljoen totale parameters en 104 miljard actieve parameters,
- gebruikt zijn eigen Kimi K3 License.[10]
Muse Spark 1.2:
- is proprietary,
- draait via Meta Model API,
- heeft geen publiek bekendgemaakte parametercount.[3]
Prijzen officiële API's
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Als self-hosting geen vereiste is, is Muse in nominale API-prijs veel goedkoper.
Als een organisatie nodig heeft:
- eigen infrastructuur,
- controle over de modelgewichten,
- eigen modelaanpassingen,
dan biedt Kimi K3 iets wat Muse Spark 1.2 momenteel niet biedt.
20. Muse Spark 1.2 vs Grok 4.5
In Meta's Terminal-Bench:
Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build: 81,6%
In DeepSWE:
Muse Spark 1.2: 59,3%
Grok 4.5: 56,6%
In de launchversie van Artificial Analysis Intelligence Index had Grok 4.5 54, vergelijkbaar met het launchsnapshot van Muse 1.2 vóór de indexupdate.[4][11]
Artificial Analysis noemde Grok 4.5 high ook als een van de weinige modellen met lagere taakkosten in dezelfde kwaliteitscluster:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
Dat is nog een voorbeeld dat prijs-kwaliteit in 2026 niet meer volgens een simpele regel werkt:
duurste model
=
meest economische model
21. Kerneloptimalisatie: meer dan 1.000 tool calls en tot 24 uur werk
Meta voerde een interessante long-horizon-test uit.
Muse Code en de modellen moesten GPU-kernels iteratief optimaliseren via:
- meer dan 1.000 tool calls,
- tot 24 uur,
- code schrijven,
- compileren,
- profiling,
- herhaalde optimalisatie.[1]
KDA en MLA werden getest op NVIDIA Hopper.
KDA
De baseline was een FLA-implementatie in Triton. Modellen mochten externe kernellibraries zoals FLA niet rechtstreeks importeren.[1]
In de grafiek met uiteindelijke speedup versus baseline rapporteerde Meta onder andere:
| Model | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0% | |
| GPT-5.6 Sol | +71,2% | |
| Claude Opus 4.8 | +69,6% | |
| Muse Spark 1.2 | +68,7% | |
| GPT-5.6 Terra | +65,1% | |
| Gemini 3.6 Flash | +62,5% | [1] |
Muse Spark 1.2 won dit experiment niet.
Dat is belangrijk omdat Meta's eigen materiaal het eigen model niet in elke categorie als leider presenteert.
Wat bewijst dit experiment niet?
Het bewijst niet dat:
- Opus 5 code altijd met 74% optimaliseert,
- Muse altijd +68,7% speedup levert,
- de resultaten op elke kernel of GPU overdraagbaar zijn.
Het is een casestudy voor een specifieke taak, baseline, harness en hardwareconfiguratie.
22. Lange context: 1 miljoen tokens
Artificial Analysis bevestigt voor Muse Spark 1.2:
1M token context window
en:
- text input,
- image input,
- text output.[3]
Een miljoen tokens kan relevant zijn voor:
- grote repositories,
- monorepos,
- documentatie,
- lange agentgeschiedenis,
- analyse van veel bestanden.
Het betekent niet dat je een volledige repository in één prompt moet stoppen.
Maximale capaciteit garandeert niet:
- dat elke dependency wordt gevonden,
- correcte prioritering,
- weerstand tegen kwaadaardige tekst in een repository,
- identieke kwaliteit aan begin en einde van de context.
Muse Code gebruikt daarom ook context compaction, in plaats van alleen steeds grotere prompts.[1]
23. Waarom is de huidige AA-score 57 terwijl launchartikelen 54 kunnen tonen?
Dit is geen fout die verborgen moet worden.
Artificial Analysis publiceerde op 5 augustus een score van 54.[4]
De huidige Muse Spark 1.2-kaart gecontroleerd op 7 augustus toont 57 en noemt v4.1.1 als huidige versie van Artificial Analysis Intelligence Index.[3]
Bij het citeren van benchmarks moet je bewaren:
model
+
effort
+
benchmarkversie
+
datum
Bijvoorbeeld:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stand: 7 augustus 2026
Dat is veel beter dan:
Muse Spark 1.2 scoort 57
zonder context.
24. Standard tier vs Contributor tier: belangrijk privacyverschil
De standaardprijs van Muse Spark 1.2 is:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta biedt ook een sterk afgeprijsde Contributor tier.
Onafhankelijke persberichten over het officiële aanbod melden dat de lagere prijs samenhangt met toestemming om gebruikersactiviteit te gebruiken voor het verbeteren van Meta-producten.[6]
Voor bedrijfsgebruik is dat een belangrijk verschil.
Voordat Contributor tier wordt gebruikt voor code die:
- privé is,
- onder NDA valt,
- bedrijfsgeheimen bevat,
- eigendom is van een klant,
moeten de exacte voorwaarden voor gegevensverwerking voor het account en endpoint worden gecontroleerd.
Kies een goedkoper endpoint niet alleen op basis van prijs.
25. Is Muse Spark 1.2 het beste model voor programmeren?
Op basis van geverifieerde data: daar is geen basis voor.
Het leidt niet alle Meta-benchmarks
Opus 5 leidt in:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra ligt in DeepSWE ook voor Muse.
Maar Muse is uitzonderlijk sterk qua prijs
Muse Spark 1.2 heeft een veel lagere outputprijs dan:
Meest verdedigbare formulering
Muse Spark 1.2 is een van de interessantste modellen van 2026 voor agentic-coding-capability per dollar. Opus 5 blijft sterker in de beschikbare kwaliteitsvergelijkingen en de uiteindelijke keuze moet uit een eigen POC komen.
26. Welk model kiezen?
Kies Muse Spark 1.2 als:
- de kosten van lange sessies zwaar wegen,
- je met grote repositories werkt,
- je Muse Code wilt gebruiken,
- de agent lang zonder handmatige sturing moet werken,
- je persistente subagents nodig hebt,
- de nominale outputprijs laag moet blijven,
- bijna-frontier prestaties voldoende zijn.
Kies Claude Opus 5 als:
- maximale slagingskans prioriteit heeft,
- de kosten van een fout hoger zijn dan tokenkosten,
- je Claude Code al gebruikt,
- taken uitzonderlijk moeilijk zijn,
- je eigen POC een hogere completion rate bevestigt.
Kies GPT-5.6 Terra als:
- je het Codex-ecosysteem gebruikt,
- DeepSWE-achtige taken centraal staan,
- je een sterk codingmodel onder de prijs van Sol wilt,
- OpenAI-tools al in de pipeline zitten.
Kies GPT-5.6 Sol als:
- je hogere algemene capability dan Muse nodig hebt,
- API-kosten minder belangrijk zijn,
- de workload bredere reasoning dan alleen coding gebruikt.
Kies Kimi K3 als:
- je open gewichten nodig hebt,
- je self-hosting plant,
- je eigen modelmodificaties nodig hebt,
- een hogere officiële API-prijs acceptabel is.
Overweeg Grok 4.5 als:
- eigen tests sterke agentische prestaties tonen,
- kosten per voltooide taak de belangrijkste metriek zijn,
- je Grok Build of een compatibele harness gebruikt.
27. Een eerlijke POC uitvoeren
Test modellen niet met vijf prompts.
Bereid minimaal voor:
50-200 echte taken
uit je eigen repository.
Categorieën
- bugfix,
- nieuwe functie,
- refactoring,
- tests,
- code review,
- dependency-migratie,
- performance-optimalisatie,
- loganalyse,
- frontend vanaf screenshot,
- repositorybrede wijziging,
- technische documentatie.
Meet per taak
succes / mislukking
tijd
kosten
tokenaantal
aantal tool calls
handmatige interventies
regressies
Belangrijkste metriek
Niet:
welk model schreef het mooiste antwoord?
Maar:
welk model leverde het vaakst een correct, merge-ready resultaat
tegen acceptabele kosten en tijd?
28. Agents vergelijken, niet alleen modellen
Bij:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build,
werkt het model niet geïsoleerd.
De agent bepaalt:
- welke bestanden gelezen worden,
- wanneer tests draaien,
- wanneer grep gebruikt wordt,
- of een subagent wordt ingezet,
- hoe context wordt beheerd,
- hoeveel iteraties worden uitgevoerd,
- wanneer het werk stopt.
Daarom zijn twee tests nuttig.
Test A: model in een gedeelde harness
dezelfde agent
dezelfde tools
dezelfde system prompt
dezelfde limieten
Dit helpt het onderliggende model te vergelijken.
Test B: end-to-end-product
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Dit beantwoordt de praktische vraag:
Welke oplossing is het beste voor het team?
De twee tests meten verschillende dingen.
29. Productiechecklist Muse Spark 1.2
Benchmarks
- Benchmarkversie wordt opgeslagen.
- Datum van de score wordt opgeslagen.
- Reasoning effort wordt opgeslagen.
- Agentnaam wordt opgeslagen.
- Meta Terminal-Bench wordt niet gemengd met het AA-resultaat.
- Meta Internal Coding Bench wordt niet als onafhankelijke test behandeld.
- Resultaten worden op de eigen repository getest.
Kosten
- Werkelijk inputgebruik wordt gemeten.
- Cached input wordt gemeten.
- Output wordt gemeten.
- Reasoningkosten worden gemeten.
- Aantal tool calls wordt gemeten.
- Kosten worden per voltooide taak berekend.
- Minstens drie modellen worden vergeleken.
- Een bestedingslimiet per agent is ingesteld.
Repository
- De agent heeft minimale benodigde rechten.
- Secrets staan niet in makkelijk toegankelijke bestanden.
- Productietoegang vereist goedkeuring.
- Merge vereist review.
- Tests draaien automatisch.
- De agent kan branch protection niet omzeilen.
- Wijzigingen en tool calls worden gelogd.
Data
- Voorwaarden van Standard tier zijn gecontroleerd.
- Voorwaarden van Contributor tier zijn gecontroleerd.
- Klantcode gaat niet naar de verkeerde endpoint.
- Bedrijfsbeleid staat de gekozen dienst toe.
- Regels voor prompt- en logretentie zijn vastgesteld.
- Persoonsgegevens zijn goed beschermd.
Kwaliteit
- De agent draait tests na wijzigingen.
- De definitieve diff wordt gecontroleerd.
- Regressies worden gemeten.
- Lange taken hebben checkpoints.
- Herstel na storing wordt getest.
- Grote monorepos worden getest.
- Taken van meerdere uren worden getest.
30. POLPROG-oordeel
Muse Spark 1.2 is een belangrijkere release dan het versienummer 1.2 doet vermoeden.
Meta bouwde het model en Muse Code als een gekoppeld systeem, met training gericht op:
- grote repositories,
- langdurige taken,
- tools,
- subagents,
- planning,
- automatische verificatie.
De resultaten bevestigen een echte verbetering ten opzichte van Muse Spark 1.1.
Sterkste feiten
Terminal-Bench 2.1
76,2% -> 82,9% in Meta's evaluatie
DeepSWE 1.1
53,0% -> 59,3% in Meta's evaluatie
GDPval-AA v2
1371 -> 1631 Elo in Artificial Analysis' launchsnapshot
Maar nog steeds niet overal leider
Opus 5 verslaat Muse Spark 1.2 op alle drie de codingbenchmarks die Meta toont.
In het huidige Artificial Analysis-snapshot:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Waarom is Muse Spark 1.2 dan interessant?
Omdat het kost:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Daardoor wordt deze vraag minder nuttig:
Welk model heeft de hoogste benchmarkscore?
Een betere vraag is:
Welk model levert per 100 USD budget het hoogste aantal correct voltooide taken?
Voor veel teams kan het antwoord anders zijn dan het model dat in één tabel bovenaan staat.
Muse Spark 1.2 ziet er momenteel uit als een zeer sterke kandidaat voor grootschalig agentisch programmeren met beheersbare kosten.
Het is geen onvoorwaardelijke winnaar.
Maar het hoort duidelijk in een POC naast:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

