Muse Spark 1.2 a Muse Code: benchmarky, ceny a srovnání s Claude Opus 5, GPT-5.6, Kimi K3 a Grok 4.5 Skip to content

Muse Spark 1.2 a Muse Code: benchmarky, ceny a srovnání s Claude Opus 5, GPT-5.6, Kimi K3 a Grok 4.5

Dne 5. srpna 2026 Meta představila Muse Spark 1.2 a Muse Code, terminálového programovacího agenta dostupného v beta verzi. Muse Spark 1.2 je aktualizace zaměřená především na programování, složité ladění, porozumění rozsáhlým codebase a dokončování vícekrokových softwarových úloh od začátku do konce.

Publikováno Autor Čas čtení 24 min čtení
X LinkedIn

Dne 5. srpna 2026 Meta představila Muse Spark 1.2 a Muse Code, terminálového programovacího agenta dostupného v beta verzi. Muse Spark 1.2 je aktualizace zaměřená především na programování, složité ladění, porozumění rozsáhlým codebase a dokončování vícekrokových softwarových úloh od začátku do konce.

Na této stránce
  1. 1TL;DR
  2. 21. Co přesně Meta vydala?
  3. 32. Muse Code není jen jednoduchý wrapper nad modelem
  4. 43. Model a agent byly trénovány společně
  5. 54. Self-improvement s využitím Muse Spark 1.1
  6. 65. Oficiální Terminal-Bench 2.1
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Nezávislá kontrola: Artificial Analysis
  10. 109. Aktuální srovnání Artificial Analysis
  11. 1110. GDPval-AA v2: největší zlepšení oproti Spark 1.1
  12. 1211. Terminal-Bench podle Artificial Analysis
  13. 1312. Halucinace: číslo vypadá lépe, ale je třeba číst i druhou polovinu tabulky
  14. 1413. Scientific reasoning se nezlepšil rovnoměrně
  15. 1514. Cena API: jedna z největších výhod Muse Spark 1.2
  16. 1615. Cena za úlohu podle launch měření Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Optimalizace kernelů: více než 1 000 tool calls a až 24 hodin práce
  23. 2322. Dlouhý kontext: 1 milion tokenů
  24. 2423. Proč je aktuální AA skóre 57, když launch články mohou uvádět 54?
  25. 2524. Standard tier vs Contributor tier: důležitý rozdíl pro soukromí
  26. 2625. Je Muse Spark 1.2 nejlepší model pro programování?
  27. 2726. Který model vybrat?
  28. 2827. Jak udělat férový POC
  29. 2928. Jak porovnávat agenty, nejen modely
  30. 3029. Produkční checklist Muse Spark 1.2
  31. 3130. Verdikt POLPROG

Model nebyl vydán s otevřenými vahami. Artificial Analysis klasifikuje Muse Spark 1.2 jako proprietary model a počet parametrů nebyl veřejně zveřejněn.[3]

Nejzajímavější část vydání však nespočívá jen v názvu modelu. Meta trénovala Muse Spark 1.2 společně s Muse Code a optimalizovala ho pro skutečné agentní prostředí: plánování, context compaction, subagenty, používání nástrojů a dlouhé úlohy pokrývající celé repozitáře.[1]

Výsledky jsou silné, ale vyžadují opatrnou interpretaci.

V oficiální evaluaci Meta:

  • Muse Spark 1.2 + Muse Code dosahuje 82,9 % v Terminal-Bench 2.1,
  • 59,3 % v DeepSWE 1.1,
  • 70,6 % v Meta Internal Coding Bench.[1][2]

To však neznamená, že Muse Spark 1.2 je nejlepší programovací model na trhu. Ve stejných tabulkách je Claude Opus 5 + Claude Code první ve všech třech srovnáních. Meta navíc sama upozorňuje, že nejde o dokonale čisté model-to-model srovnání: každý model běžel s jiným agentem a testovací konfigurace mohla být lépe přizpůsobena Muse Code než konkurenčním nástrojům.[2]

Nezávislejší pohled přináší Artificial Analysis. Na aktuální kartě modelu kontrolované 7. srpna dosahuje Muse Spark 1.2 s xhigh 57 bodů v Artificial Analysis Intelligence Index v4.1.1. Pro srovnání Claude Opus 5 má 61, GPT-5.6 Sol 59, Kimi K3 57 a GPT-5.6 Terra 55.[3][7][8][9][10]

Stručný závěr: Muse Spark 1.2 bezvýhradně neporáží Opus 5 ani GPT-5.6 Sol, ale cenově je mimořádně konkurenceschopný. Nejsilněji působí jako model pro agentní programování, zejména ve spojení s Muse Code a tam, kde záleží na nákladech dlouhých relací.

Všechna data v článku byla ověřena podle materiálů Meta, oficiální metodiky evaluace, Artificial Analysis a nezávislého tisku. Stav k 7. srpnu 2026.

TL;DR

Otázka Ověřená odpověď
Kdy byl Muse Spark 1.2 vydán? 5. srpna 2026
Kdo vytvořil model? Meta
Co je Muse Code? Terminálový programovací agent v beta verzi
Má Muse Spark 1.2 otevřené váhy? Ne, model je proprietary
Známe počet parametrů? Ne, Meta jej veřejně neuvedla
Kontext 1 milion tokenů
Modality text a obraz na vstupu, text na výstupu
Standardní cena input 1,25 USD / 1 mil. tokenů
Cena cached input 0,15 USD / 1 mil. tokenů
Cena output 4,25 USD / 1 mil. tokenů
Terminal-Bench 2.1 podle Meta 82,9 %
DeepSWE 1.1 podle Meta 59,3 %
Meta Internal Coding Bench 70,6 %
Aktuální AA Intelligence Index v4.1.1 57
AA Index v článku z dne vydání 54
Jsou výsledky Meta nezávislé? Ne, část tvoří evaluace výrobce
Je Artificial Analysis nezávislá na Meta? Ano, i když Meta poskytla přístup před vydáním pro benchmarky
Nejsilnější oblast agentní programování a poměr schopností k ceně
Hlavní omezení nevyhrává všechny benchmarky a část testů používá různé agent harnessy

1. Co přesně Meta vydala?

Vydání zahrnuje dva propojené produkty:

Muse Spark 1.2
model

Muse Code
terminálový programovací agent

Meta popisuje Muse Spark 1.2 jako aktualizaci Muse Spark 1.1 zaměřenou na coding. Zvýšila compute použitý při tréninku na programovacích úlohách a rozšířila rozmanitost tréninkových prostředí.[1]

Muse Code je agent, který umí:

  • plánovat změny v repozitáři,
  • psát kód,
  • spouštět nástroje,
  • validovat výsledky,
  • koordinovat několik dlouhodobě běžících subagentů,
  • udržovat postup během dlouhých relací.[1]

Instalaci oficiálního klienta na macOS nebo Linux Meta popisuje takto:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 je dostupný jak přes Muse Code, tak přes Meta Model API. Meta popisuje současnou dostupnost jako široce rozšířenou globálně.[1]

2. Muse Code není jen jednoduchý wrapper nad modelem

U programovacích agentů není benchmark modelu a benchmark produktu totéž.

Muse Code přidává vlastní exekuční vrstvu.

Async Background Agents

Hlavní agent může využívat specializované subagenty, kteří pokračují v práci na pozadí. Nevznikají jen pro jeden krok a mohou zůstat aktivní během celé relace.[1]

Cílem je omezit:

  • opakované sbírání stejných informací,
  • latenci,
  • potřebu manuálního řízení,
  • opakovanou analýzu repozitáře.

Append-only event log

Muse Code lokálně ukládá historii:

  • volání modelu,
  • použití nástrojů,
  • schválení,
  • editací.[1]

Meta popisuje runtime jako replay-exact a restart-safe. Po selhání může agent pokračovat z logu místo toho, aby začal úlohu od začátku.

To je důležité u programovacích úloh trvajících několik hodin.

Vestavěné skills

První verze obsahuje mimo jiné:

/plan
/grill
/goal

/plan připraví plán s fází schválení, /grill plán kriticky prověří a /goal udržuje práci směrem k definovanému cíli.[1]

3. Model a agent byly trénovány společně

Jde o jednu z nejdůležitějších informací pro interpretaci benchmarků.

Meta pouze nepřipojila nový model k existujícímu CLI. Firma uvádí co-training Muse Spark 1.2 a Muse Code.[1]

Trénink zahrnoval mimo jiné:

  • trajectories z agent harnessu,
  • optimalizace pro práci s cíli,
  • compaction,
  • subagenty,
  • integrovanou sadu nástrojů Muse Code.[1]

Model byl navíc trénován na long-horizon úlohách:

  • generování celých repozitářů,
  • velkých end-to-end projektech,
  • auto-research,
  • sekvencování práce přes planning,
  • udržování směru přes goal conditioning,
  • kompresi kontextu.[1]

To pomáhá vysvětlit, proč je někdy správnou jednotkou srovnání:

Muse Spark 1.2 + Muse Code

a nikoli pouze:

Muse Spark 1.2

4. Self-improvement s využitím Muse Spark 1.1

Meta využila Muse Spark 1.1 k tvorbě tréninkových dat pro verzi 1.2.

Podle oficiálního popisu předchozí model:

  1. generoval obtížná programovací prostředí,
  2. připravoval šablony komplexních instrukcí,
  3. hodnotil kandidátní řešení,
  4. pomáhal vytvářet škálovatelný dataset pro Muse Spark 1.2.[1]

Meta tento proces označuje jako self-improvement loop.

Neznamená to, že se model „sám vytrénoval“. Stále šlo o kontrolovaný tréninkový pipeline navržený Meta, kde byl dřívější model jedním z prvků generování a hodnocení dat.

5. Oficiální Terminal-Bench 2.1

Terminal-Bench 2.1 hodnotí agenty provádějící úlohy v terminálovém prostředí.

Meta použila všech 89 úloh z oficiální verze 2.1. Každý běh probíhal v izolovaném Daytona sandboxu a executable verifier hodnotil konečný stav kontejneru. Výsledek je průměr pass@1 z pěti pokusů.[2]

Výsledky zveřejněné Meta

Model + agent Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7 %
Muse Spark 1.2 + Muse Code xhigh 82,9 %
GPT-5.6 Terra + Codex max 81,8 %
Grok 4.5 + Grok Build high 81,6 %
Gemini 3.6 Flash + Antigravity CLI high 78,9 %
Muse Spark 1.1 + mini-swe-agent xhigh 76,2 % [1][2]

Muse Spark 1.2 zlepšuje výsledek předchůdce o 6,7 procentního bodu.

Současně:

  • zaostává za Opus 5 o 3,8 pp,
  • překonává GPT-5.6 Terra o 1,1 pp,
  • překonává Grok 4.5 o 1,3 pp.

Nejdůležitější výhrada

Nejde o čistý benchmark samotných modelů.

Porovnávané systémy jsou:

model
+
agent
+
nástroje
+
system prompt
+
runtime

Meta používá:

  • Muse Code pro Spark 1.2,
  • Claude Code pro Opus 5,
  • Codex pro GPT-5.6,
  • Grok Build pro Grok 4.5,
  • Antigravity CLI pro Gemini.[2]

Meta sama uvádí, že konfigurace a system prompts nemusely být optimálně naladěné pro uzavřené konkurenční modely.[2]

Správný závěr tedy zní:

V konfiguraci Meta dosáhl Muse Spark 1.2 + Muse Code 82,9 %.

Nikoli:

Muse Spark 1.2 je obecně lepší než GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 obsahuje 113 úloh z 91 repozitářů v pěti jazycích:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Každá úloha má ručně připravený funkční verifier a regresní testy.

Během rollout a grading je externí internet blokován. Endpoint modelu zůstává dostupný.[2]

Výsledky Meta

Model + agent DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0 %
GPT-5.6 Terra + Codex 64,8 %
Muse Spark 1.2 + Muse Code 59,3 %
Grok 4.5 + Grok Build 56,6 %
Muse Spark 1.1 + mini-swe-agent 53,0 %
Gemini 3.6 Flash + Antigravity CLI 40,0 % [1][2]

Muse Spark 1.2 zlepšuje 1.1 o 6,3 pp.

Zde je však odstup od lídrů větší:

Opus 5       65,0 %
GPT-5.6      64,8 %
Muse 1.2     59,3 %

Je to silný výsledek, ale ne první místo.

Další metodické omezení

Oficiální leaderboard DeepSWE používá mini-swe-agent pro každý model.

Meta ve své evaluaci naopak použila jiný agentní produkt pro každý model. Firma sama píše, že výsledek není harness-identical s oficiálním leaderboardem.[2]

Tuto informaci je důležité uvádět vedle 59,3 %.

7. Meta Internal Coding Bench

Meta Internal Coding Bench obsahuje 440 úloh z interní codebase Meta a skutečných pull requestů.[2]

Zahrnuje:

  • opravy chyb,
  • nové funkce,
  • refactoring,
  • cleanup,
  • další software-engineering úlohy.

Internet je vypnutý. Řešení se kompilují a kontrolují unit testy. Meta provádí dva pokusy na úlohu.[2]

Výsledky

Model Meta Internal Coding Bench
Claude Opus 5 79,4 %
Muse Spark 1.2 70,6 %
Muse Spark 1.1 68,3 %
GPT-5.6 Terra 65,4 %
Gemini 3.6 Flash 63,9 % [1][2]

Muse Spark 1.2 zlepšuje předchůdce o 2,3 pp.

Proč má tento benchmark menší externí hodnotu?

Ne proto, že musí být chybný.

Problémem je reprodukovatelnost.

Dataset:

  • je interní,
  • pochází z privátní codebase Meta,
  • není veřejným benchmarkem, který lze nezávisle reprodukovat.

Výsledek je proto vhodné chápat jako další signál výrobce, nikoli jako nezávislý důkaz převahy.

8. Nezávislá kontrola: Artificial Analysis

Artificial Analysis dostala od Meta přístup k Muse Spark 1.2 před veřejným vydáním a provedla vlastní sadu testů.[4]

To je významné, protože umožňuje oddělit:

benchmark výrobce

od:

benchmark nezávislé organizace

Důležitá změna skóre po vydání

Článek Artificial Analysis z 5. srpna uváděl:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

Aktuální karta modelu po přechodu indexu na v4.1.1 ukazuje:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Číslo 54 by se proto nemělo kopírovat do aktuálního žebříčku bez uvedení data.

Benchmarky se mění kvůli:

  • verzím indexu,
  • gradingu,
  • evaluačním sadám,
  • metodickým opravám.

Produkční článek by měl vždy uvádět snapshot.

9. Aktuální srovnání Artificial Analysis

Karty modelů kontrolované 7. srpna 2026:

Model AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* Hodnota Grok 4.5 pochází z publikované analýzy Artificial Analysis tohoto modelu. Jde o snapshoty odpovídajících verzí benchmarku, nikoli trvalé pozice v pořadí.

Co z toho vyplývá?

Muse Spark 1.2:

  • aktuálně nedosahuje Opus 5 v celkovém indexu,
  • zůstává 2 body za GPT-5.6 Sol,
  • je na stejné úrovni jako Kimi K3 na aktuální kartě AA,
  • předstihuje GPT-5.6 Terra v celkovém indexu,
  • je nad výsledkem Grok 4.5 z doby jeho uvedení.

Ale Artificial Analysis Intelligence Index není čistě programovací benchmark.

Aktuální v4.1.1 kombinuje devět evaluací, mimo jiné:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Skóre 57 je proto vhodné číst jako širší signál inteligence a agentních schopností.

10. GDPval-AA v2: největší zlepšení oproti Spark 1.1

V launch snapshotu Artificial Analysis vzrostl GDPval-AA v2 z:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

tedy o 260 Elo bodů.[4]

GDPval-AA v2 testuje realistické úlohy znalostní práce.

Obsahuje 220 úloh z:

  • 44 povolání,
  • 9 hlavních odvětví americké ekonomiky.[2]

Modely vytvářejí mimo jiné:

  • dokumenty,
  • tabulky,
  • prezentace,
  • diagramy,
  • reporty.

Artificial Analysis používá vlastní agentic harness Stirrup s přístupem k shellu a webu a výsledky porovnává párově pomocí LLM soudce.[2]

Snapshot z 5. srpna

Artificial Analysis uváděla:

Model GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

Jde o jeden z nejsilnějších signálů, že verze 1.2 se zlepšila nejen v generování kódu.

GDPval ranking se aktualizuje, proto tyto hodnoty nemají být míchány s pozdějšími snapshoty.

11. Terminal-Bench podle Artificial Analysis

Meta uvádí:

82,9 %

pro Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis ve svém harnessu při vydání uváděla:

80 %

oproti:

78 %

pro Muse Spark 1.1.[4]

Tyto výsledky si neodporují.

Vznikly v:

  • různých harnessech,
  • různých konfiguracích agentů,
  • různých exekučních postupech.

Je to dobrý příklad, proč se benchmark nemá publikovat bez metodiky.

12. Halucinace: číslo vypadá lépe, ale je třeba číst i druhou polovinu tabulky

Artificial Analysis zaznamenala v launch snapshotu zlepšení AA-Omniscience:

18 -> 22

a pokles hallucination rate:

38 % -> 28 %

[4]

Na první pohled to vypadá jednoznačně pozitivně.

Současně ale:

attempt rate: 82 % -> 67 %
accuracy:     41 % -> 38 %

[4]

Model častěji odmítal odpovědět, pokud si nebyl jistý.

AA-Omniscience abstention netrestá. Nižší hallucination rate tedy částečně vyplývá z větší ochoty neodpovědět.

Správná interpretace:

Muse Spark 1.2 méně často prezentoval chybnou odpověď jako jistou, ale zároveň se méně často pokoušel odpovědět.

Nesprávná interpretace:

Muse Spark 1.2 se stal o 10 procentních bodů přesnějším.

Data to nepotvrzují.

13. Scientific reasoning se nezlepšil rovnoměrně

V měřeních Artificial Analysis při vydání:

Benchmark Spark 1.1 Spark 1.2 Změna
CritPt 15 % 18 % +3 pp
SciCode 58 % 56 % -2 pp
Humanity's Last Exam 45 % 44 % -1 pp [4]

To ukazuje charakter aktualizace.

Muse Spark 1.2 není jednoduše:

Spark 1.1
+ několik procent všude

Největší zisky při vydání byly soustředěny na:

  • agentní programování,
  • používání nástrojů,
  • profesionální agentní úlohy.

14. Cena API: jedna z největších výhod Muse Spark 1.2

Standardní ceník Meta:

Tokeny Cena za 1 mil.
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Cena input/output je stejná jako u Muse Spark 1.1.

Srovnání veřejných cen API

Model Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

Jde o porovnání ceny tokenu, nikoli ceny dokončené úlohy.

Levnější model za milion tokenů může:

  • vygenerovat více tokenů,
  • provést více tool calls,
  • potřebovat více iterací,
  • udělat chybu vyžadující ruční opravu.

Lepší business metrika proto je:

cena za správně dokončenou úlohu

a ne pouze:

cena za 1M tokenů

15. Cena za úlohu podle launch měření Artificial Analysis

Ve snapshotu z 5. srpna uváděla Artificial Analysis váženou průměrnou cenu jedné úlohy Intelligence Index:

Model / konfigurace Cena úlohy
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

To je pro Muse Spark 1.2 velmi dobrý nákladový výsledek.

Oproti Spark 1.1 však cena vzrostla z:

0,29 USD
na
0,40 USD

Artificial Analysis to spojuje s vyšší spotřebou tokenů:

  • přibližně o 53 % více input tokenů,
  • přibližně o 36 % více output tokenů,

zejména v GDPval-AA v2.[4]

Verze 1.2 je tedy:

lepší
ale
tokenově náročnější

Jednotková cena API se nezměnila, ale agent vykonává více práce.

16. Muse Spark 1.2 vs Claude Opus 5

Kde vítězí Opus 5?

V datech Meta:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7 % 82,9 %
DeepSWE 1.1 65,0 % 59,3 %
Meta Internal Coding Bench 79,4 % 70,6 % [1]

V aktuálním Artificial Analysis Intelligence Index:

Opus 5:     61
Muse 1.2:   57

[3][7]

Dostupná data nedávají základ označit Muse Spark 1.2 obecně za lepší model.

Kde má výhodu Muse?

Především v ceně tokenů:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

U agentů provádějících tisíce operací může být rozdíl významný.

Závěr

Opus 5 je vhodnější, když:

  • maximální úspěšnost je důležitější než cena tokenů,
  • úloha je obtížná a chyba drahá,
  • tým už používá Claude Code.

Muse Spark 1.2 dává větší smysl, když:

  • je vysoký objem úloh,
  • agent dlouho pracuje nad repozitářem,
  • náklady na tokeny jsou zásadní,
  • několik benchmarkových bodů neospravedlňuje mnohem dražší API.

17. Muse Spark 1.2 vs GPT-5.6 Terra

Jde o jedno z nejzajímavějších srovnání.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9 %
Terra + Codex:         81,8 %

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3 %
Terra + Codex:         64,8 %

Meta Internal Coding Bench

Muse 1.2:  70,6 %
Terra:     65,4 %

[1]

Lídr se mění podle benchmarku.

Artificial Analysis

Aktuální celkový index:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Cena

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Neznamená to automatickou výhru Muse. Terra je v DeepSWE v porovnání Meta jasně silnější.

Nejférovější interpretace:

Muse Spark 1.2 je vůči GPT-5.6 Terra mimořádně konkurenceschopný cenou a v části agentních úloh, ale výsledek závisí na typu úlohy a harnessu.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol zůstává silnější v širším indexu Artificial Analysis:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol stojí:

5 USD / 1M input
30 USD / 1M output

oproti:

1,25 USD / 1M input
4,25 USD / 1M output

u Muse.[3][8]

To je velký rozdíl pro:

  • dlouhé reasoning traces,
  • subagenty,
  • iterativní debugging,
  • repo-wide refactoring,
  • několikahodinové agent runs.

Pokud se dodatečné 2 body v celkovém indexu nepřenesou do vyšší míry správně dokončených úloh v reálné firmě, dražší model nemusí být ekonomičtější.

19. Muse Spark 1.2 vs Kimi K3

Aktuální karta Artificial Analysis ukazuje:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

To neznamená stejné schopnosti.

Hlavní rozdíl

Kimi K3:

  • má veřejně dostupné váhy,
  • lze self-hostovat,
  • má 2,8 bilionu celkových parametrů a 104 miliard aktivních,
  • používá vlastní Kimi K3 License.[10]

Muse Spark 1.2:

  • je proprietary,
  • běží přes Meta Model API,
  • nemá veřejně známý počet parametrů.[3]

Ceny oficiálních API

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Pokud self-hosting není požadavkem, Muse je v nominální ceně API výrazně levnější.

Pokud organizace potřebuje:

  • vlastní infrastrukturu,
  • kontrolu nad vahami,
  • vlastní úpravy modelu,

Kimi K3 nabízí možnost, kterou Muse Spark 1.2 nyní nemá.

20. Muse Spark 1.2 vs Grok 4.5

V Meta Terminal-Bench:

Muse Spark 1.2 + Muse Code: 82,9 %
Grok 4.5 + Grok Build:      81,6 %

V DeepSWE:

Muse Spark 1.2: 59,3 %
Grok 4.5:        56,6 %

[1]

V Artificial Analysis Intelligence Index při uvedení měl Grok 4.5 skóre 54, tedy podobné jako launch snapshot Muse 1.2 před aktualizací indexu.[4][11]

Artificial Analysis také uváděla Grok 4.5 high jako jeden z mála modelů s nižší cenou za úlohu ve stejném kvalitativním clusteru:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

Je to další příklad, že poměr cena-výkon v roce 2026 už nefunguje podle jednoduchého pravidla:

nejdražší model
=
nejvýhodnější model

21. Optimalizace kernelů: více než 1 000 tool calls a až 24 hodin práce

Meta provedla zajímavý long-horizon experiment.

Muse Code a modely měly iterativně optimalizovat GPU kernels pomocí:

  • více než 1 000 tool calls,
  • až 24 hodin,
  • psaní kódu,
  • kompilace,
  • profilování,
  • opakovaných optimalizací.[1]

Testovaly se KDA a MLA na NVIDIA Hopper.

KDA

Baseline byla FLA implementace v Tritonu. Modely nesměly přímo importovat externí kernel knihovny jako FLA.[1]

V grafu konečného speedupu oproti baseline Meta ukázala mimo jiné:

Model Speedup vs baseline
Claude Opus 5 +74,0 %
GPT-5.6 Sol +71,2 %
Claude Opus 4.8 +69,6 %
Muse Spark 1.2 +68,7 %
GPT-5.6 Terra +65,1 %
Gemini 3.6 Flash +62,5 % [1]

Muse Spark 1.2 tento experiment nevyhrál.

To je důležité, protože oficiální materiál Meta nepředstavuje vlastní model jako lídra v každé kategorii.

Co tento experiment nedokazuje?

Nedokazuje, že:

  • Opus 5 vždy optimalizuje kód o 74 %,
  • Muse vždy přinese +68,7 %,
  • výsledky platí pro každý kernel nebo GPU.

Jde o case study konkrétní úlohy, baseline, harnessu a hardwaru.

22. Dlouhý kontext: 1 milion tokenů

Artificial Analysis potvrzuje pro Muse Spark 1.2:

1M token context window

a:

  • text input,
  • image input,
  • text output.[3]

Milion tokenů může být důležitý pro:

  • velké repozitáře,
  • monorepa,
  • dokumentaci,
  • dlouhou historii agenta,
  • analýzu mnoha souborů.

Neznamená to, že by se měl celý repozitář vložit do jednoho promptu.

Maximální kapacita nezaručuje:

  • nalezení všech závislostí,
  • správné prioritizování,
  • odolnost proti škodlivému textu v repozitáři,
  • stejnou kvalitu na začátku a konci kontextu.

Muse Code proto používá také context compaction, nikoli jen stále větší prompty.[1]

23. Proč je aktuální AA skóre 57, když launch články mohou uvádět 54?

Nejde o chybu, kterou by bylo třeba skrývat.

Artificial Analysis publikovala 5. srpna skóre 54.[4]

Aktuální karta Muse Spark 1.2 kontrolovaná 7. srpna ukazuje 57 a uvádí jako současnou verzi Artificial Analysis Intelligence Index v4.1.1.[3]

Při citování benchmarků je proto vhodné uchovávat:

model
+
effort
+
verzi benchmarku
+
datum

Například:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stav: 7. srpna 2026

Je to výrazně lepší než napsat:

Muse Spark 1.2 má 57 bodů

bez kontextu.

24. Standard tier vs Contributor tier: důležitý rozdíl pro soukromí

Standardní cena Muse Spark 1.2 je:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta nabízí také výrazně zlevněný Contributor tier.

Nezávislé tiskové zprávy popisující oficiální nabídku uvádějí, že nižší cena je spojena se souhlasem, aby aktivita uživatele mohla být využita ke zlepšování produktů Meta.[6]

Pro podnikové použití je to důležitý rozdíl.

Před použitím Contributor tier pro kód, který je:

  • soukromý,
  • pod NDA,
  • obsahuje obchodní tajemství,
  • patří klientovi,

je nutné ověřit přesné podmínky zpracování dat platné pro účet a endpoint.

Levnější endpoint se nemá volit pouze podle ceny.

25. Je Muse Spark 1.2 nejlepší model pro programování?

Podle ověřených dat: není důvod to tvrdit.

Nevede všechny benchmarky Meta

Opus 5 vede v:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra je před Muse také v DeepSWE.

Cenově je ale Muse mimořádně silný

Muse Spark 1.2 má mnohem nižší cenu outputu než:

Nejlépe obhajitelné tvrzení

Muse Spark 1.2 je jeden z nejzajímavějších modelů roku 2026 z hlediska poměru agentic-coding schopností k ceně. Opus 5 zůstává silnější v dostupných kvalitativních srovnáních a konečná volba by měla vycházet z vlastního POC.

26. Který model vybrat?

Vyberte Muse Spark 1.2, pokud:

  • náklady dlouhých relací jsou velmi důležité,
  • pracujete s velkými repozitáři,
  • chcete používat Muse Code,
  • agent má dlouho pracovat bez manuálního vedení,
  • potřebujete persistent subagenty,
  • nominální cena outputu musí být nízká,
  • výkon blízko frontier stačí pro daný workflow.

Vyberte Claude Opus 5, pokud:

  • maximální úspěšnost je prioritou,
  • cena chyby převyšuje cenu tokenů,
  • používáte Claude Code,
  • úlohy jsou výjimečně obtížné,
  • váš POC potvrzuje vyšší completion rate.

Vyberte GPT-5.6 Terra, pokud:

  • používáte ekosystém Codex,
  • DeepSWE-like úlohy jsou zásadní,
  • potřebujete silný coding model levnější než Sol,
  • nástroje OpenAI jsou součástí pipeline.

Vyberte GPT-5.6 Sol, pokud:

  • potřebujete vyšší obecné schopnosti než Muse,
  • cena API je méně důležitá,
  • workload zahrnuje širší reasoning než samotný coding.

Vyberte Kimi K3, pokud:

  • potřebujete otevřené váhy,
  • plánujete self-hosting,
  • potřebujete vlastní modifikace modelu,
  • můžete akceptovat vyšší cenu oficiálního API.

Zvažte Grok 4.5, pokud:

  • vlastní testy ukazují silné agentní výsledky,
  • cena za dokončenou úlohu je klíčová metrika,
  • používáte Grok Build nebo kompatibilní harness.

27. Jak udělat férový POC

Netestujte modely na pěti promptech.

Připravte alespoň:

50-200 reálných úloh

z vlastního repozitáře.

Kategorie

  • bug fix,
  • nová funkce,
  • refactoring,
  • testy,
  • code review,
  • migrace dependency,
  • performance optimization,
  • analýza logů,
  • frontend ze screenshotu,
  • repo-wide změna,
  • technická dokumentace.

U každé úlohy měřte

úspěch / neúspěch
čas
cenu
počet tokenů
počet tool calls
ruční zásahy
regrese

Nejdůležitější metrika

Ne:

který model napsal hezčí odpověď?

Ale:

který model nejčastěji dodal správný, merge-ready výsledek
za přijatelnou cenu a čas?

28. Jak porovnávat agenty, nejen modely

U:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build

model nepracuje izolovaně.

Agent rozhoduje:

  • které soubory číst,
  • kdy spustit testy,
  • kdy použít grep,
  • zda použít subagenta,
  • jak spravovat kontext,
  • kolik iterací provést,
  • kdy práci ukončit.

Proto je vhodné provést dva testy.

Test A: model ve společném harnessu

stejný agent
stejné nástroje
stejný system prompt
stejné limity

Pomáhá porovnat samotné modely.

Test B: end-to-end produkt

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Pomáhá odpovědět na praktickou otázku:

Které řešení je nejlepší pro tým?

Oba testy měří něco jiného.

29. Produkční checklist Muse Spark 1.2

Benchmarky

  • Je uložena verze benchmarku.
  • Je uloženo datum skóre.
  • Je uložen reasoning effort.
  • Je uložen název agenta.
  • Meta Terminal-Bench se nemíchá s výsledkem AA.
  • Meta Internal Coding Bench se nepovažuje za nezávislý benchmark.
  • Výsledky jsou ověřeny na vlastním repozitáři.

Náklady

  • Měří se skutečný input.
  • Měří se cached input.
  • Měří se output.
  • Měří se cena reasoning.
  • Měří se počet tool calls.
  • Cena se počítá za dokončenou úlohu.
  • Porovnávají se nejméně tři modely.
  • Je nastaven limit výdajů na agenta.

Repozitář

  • Agent má minimální potřebná oprávnění.
  • Secrets nejsou ve snadno dostupných souborech.
  • Přístup do produkce vyžaduje schválení.
  • Merge vyžaduje review.
  • Testy se spouštějí automaticky.
  • Agent nemůže obejít branch protection.
  • Změny a tool calls se logují.

Data

  • Ověřeny podmínky Standard tier.
  • Ověřeny podmínky Contributor tier.
  • Kód klienta nejde na špatný endpoint.
  • Firemní politika dovoluje zvolenou službu.
  • Jsou nastaveny zásady retence promptů a logů.
  • Osobní údaje jsou správně chráněny.

Kvalita

  • Agent po změnách spouští testy.
  • Kontroluje se finální diff.
  • Měří se regrese.
  • Dlouhé úlohy mají checkpointy.
  • Testuje se obnovení po chybě.
  • Testují se velká monorepa.
  • Testují se několikahodinové úlohy.

30. Verdikt POLPROG

Muse Spark 1.2 je významnější vydání, než naznačuje číslo 1.2.

Meta vytvořila model a Muse Code jako propojený systém a zaměřila trénink na:

  • velké repozitáře,
  • dlouhé úlohy,
  • nástroje,
  • subagenty,
  • plánování,
  • automatickou verifikaci.

Výsledky potvrzují skutečné zlepšení oproti Muse Spark 1.1.

Nejsilnější fakta

Terminal-Bench 2.1
76,2 % -> 82,9 % v evaluaci Meta

DeepSWE 1.1
53,0 % -> 59,3 % v evaluaci Meta

GDPval-AA v2
1371 -> 1631 Elo v launch snapshotu Artificial Analysis

[1][4]

Stále ale není lídrem všeho

Opus 5 překonává Muse Spark 1.2 ve všech třech coding benchmarkech zobrazených Meta.

V aktuálním snapshotu Artificial Analysis:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Proč je tedy Muse Spark 1.2 zajímavý?

Protože stojí:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

Tím se stává méně užitečnou otázka:

Který model má nejvyšší benchmark?

Lepší otázka je:

Který model dodá největší počet správně dokončených úloh za 100 USD rozpočtu?

Pro mnoho týmů může být odpověď jiná než model na prvním místě jedné tabulky.

Muse Spark 1.2 nyní působí jako velmi silný kandidát pro agentní programování ve velkém měřítku s kontrolovanými náklady.

Není bezvýhradným vítězem.

Rozhodně ale patří do POC spolu s:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 je významnější vydání, než naznačuje číslo 1.2. Výsledky potvrzují skutečné zlepšení oproti Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Často kladené otázky

Kdy byl Muse Spark 1.2 vydán?

Meta představila Muse Spark 1.2 a Muse Code 5. srpna 2026.

Je Muse Spark 1.2 open source?

Ne. Artificial Analysis ho klasifikuje jako proprietary model a váhy nejsou veřejně dostupné.

Kolik parametrů má Muse Spark 1.2?

Meta počet parametrů veřejně neuvedla.

Jak velký je kontext?

1 milion tokenů.

Podporuje obrázky?

Ano. Artificial Analysis potvrzuje text + image input a text output.

Kolik stojí API?

Standardně 1,25 USD za milion input tokenů, 0,15 USD za milion cached input tokenů a 4,25 USD za milion output tokenů.

Je Muse Spark 1.2 lepší než Claude Opus 5?

Ne podle dostupných obecných benchmarků a srovnání Meta. Opus 5 vede ve třech coding benchmarkech Meta a má vyšší aktuální Artificial Analysis Intelligence Index.

Je Muse Spark 1.2 lepší než GPT-5.6 Terra?

Záleží na úloze. Muse vede v Meta Terminal-Bench a Meta Internal Coding Bench, Terra v DeepSWE 1.1. Aktuální celkový AA Intelligence Index je vyšší pro Muse.

Je Muse Spark 1.2 lepší než Kimi K3?

Aktuální Artificial Analysis Intelligence Index dává oběma modelům 57. Kimi K3 má otevřené váhy, Muse je proprietary. Jejich profil i cena se liší.

Proč lze na internetu najít 54, zatímco zde je 57?

54 pochází z článku Artificial Analysis z dne vydání. Aktuální karta po přechodu na v4.1.1 ukazuje 57. U benchmarků je potřeba vždy uvádět verzi a datum.

Je 82,9 % v Terminal-Bench nezávislý výsledek?

Ne. Jde o výsledek zveřejněný Meta pro Muse Spark 1.2 + Muse Code podle metodiky Meta.

Měří Artificial Analysis Terminal-Bench jinak?

Ano. V launch snapshotu AA dosáhl Muse Spark 1.2 80 %. Rozdíl vychází mimo jiné z jiného harnessu.

Umí Muse Code pokračovat po selhání?

Meta popisuje lokální append-only event log, díky kterému je runtime restart-safe a umí rekonstruovat stav práce.

Je Muse Spark 1.2 globálně dostupný?

Meta v oznámení uvádí dostupnost Muse Spark 1.2 přes Muse Code a Meta Model API s rozšířeným globálním přístupem.

Vyplatí se migrovat z Muse Spark 1.1?

Data Meta a Artificial Analysis ukazují jasné zlepšení v agentic coding a GDPval. Migraci je ale potřeba ověřit na vlastních workloadech, protože 1.2 u některých úloh spotřebuje více tokenů. ---

Zdroje a poznámky

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

Bylo to užitečné?

Odebírejte nové články e-mailem

Jeden krátký e-mail na každý nový článek znalostní báze. Žádný spam, odhlášení jedním kliknutím.

Váš e-mail používáme pouze k zasílání nových článků. Žádné sdílení s třetími stranami.

Zpět do znalostní báze