Model nebyl vydán s otevřenými vahami. Artificial Analysis klasifikuje Muse Spark 1.2 jako proprietary model a počet parametrů nebyl veřejně zveřejněn.[3]
Nejzajímavější část vydání však nespočívá jen v názvu modelu. Meta trénovala Muse Spark 1.2 společně s Muse Code a optimalizovala ho pro skutečné agentní prostředí: plánování, context compaction, subagenty, používání nástrojů a dlouhé úlohy pokrývající celé repozitáře.[1]
Výsledky jsou silné, ale vyžadují opatrnou interpretaci.
V oficiální evaluaci Meta:
- Muse Spark 1.2 + Muse Code dosahuje 82,9 % v Terminal-Bench 2.1,
- 59,3 % v DeepSWE 1.1,
- 70,6 % v Meta Internal Coding Bench.[1][2]
To však neznamená, že Muse Spark 1.2 je nejlepší programovací model na trhu. Ve stejných tabulkách je Claude Opus 5 + Claude Code první ve všech třech srovnáních. Meta navíc sama upozorňuje, že nejde o dokonale čisté model-to-model srovnání: každý model běžel s jiným agentem a testovací konfigurace mohla být lépe přizpůsobena Muse Code než konkurenčním nástrojům.[2]
Nezávislejší pohled přináší Artificial Analysis. Na aktuální kartě modelu kontrolované 7. srpna dosahuje Muse Spark 1.2 s xhigh 57 bodů v Artificial Analysis Intelligence Index v4.1.1. Pro srovnání Claude Opus 5 má 61, GPT-5.6 Sol 59, Kimi K3 57 a GPT-5.6 Terra 55.[3][7][8][9][10]
Stručný závěr: Muse Spark 1.2 bezvýhradně neporáží Opus 5 ani GPT-5.6 Sol, ale cenově je mimořádně konkurenceschopný. Nejsilněji působí jako model pro agentní programování, zejména ve spojení s Muse Code a tam, kde záleží na nákladech dlouhých relací.
Všechna data v článku byla ověřena podle materiálů Meta, oficiální metodiky evaluace, Artificial Analysis a nezávislého tisku. Stav k 7. srpnu 2026.
TL;DR
| Otázka | Ověřená odpověď |
|---|---|
| Kdy byl Muse Spark 1.2 vydán? | 5. srpna 2026 |
| Kdo vytvořil model? | Meta |
| Co je Muse Code? | Terminálový programovací agent v beta verzi |
| Má Muse Spark 1.2 otevřené váhy? | Ne, model je proprietary |
| Známe počet parametrů? | Ne, Meta jej veřejně neuvedla |
| Kontext | 1 milion tokenů |
| Modality | text a obraz na vstupu, text na výstupu |
| Standardní cena input | 1,25 USD / 1 mil. tokenů |
| Cena cached input | 0,15 USD / 1 mil. tokenů |
| Cena output | 4,25 USD / 1 mil. tokenů |
| Terminal-Bench 2.1 podle Meta | 82,9 % |
| DeepSWE 1.1 podle Meta | 59,3 % |
| Meta Internal Coding Bench | 70,6 % |
| Aktuální AA Intelligence Index v4.1.1 | 57 |
| AA Index v článku z dne vydání | 54 |
| Jsou výsledky Meta nezávislé? | Ne, část tvoří evaluace výrobce |
| Je Artificial Analysis nezávislá na Meta? | Ano, i když Meta poskytla přístup před vydáním pro benchmarky |
| Nejsilnější oblast | agentní programování a poměr schopností k ceně |
| Hlavní omezení | nevyhrává všechny benchmarky a část testů používá různé agent harnessy |
1. Co přesně Meta vydala?
Vydání zahrnuje dva propojené produkty:
Muse Spark 1.2
model
Muse Code
terminálový programovací agent
Meta popisuje Muse Spark 1.2 jako aktualizaci Muse Spark 1.1 zaměřenou na coding. Zvýšila compute použitý při tréninku na programovacích úlohách a rozšířila rozmanitost tréninkových prostředí.[1]
Muse Code je agent, který umí:
- plánovat změny v repozitáři,
- psát kód,
- spouštět nástroje,
- validovat výsledky,
- koordinovat několik dlouhodobě běžících subagentů,
- udržovat postup během dlouhých relací.[1]
Instalaci oficiálního klienta na macOS nebo Linux Meta popisuje takto:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 je dostupný jak přes Muse Code, tak přes Meta Model API. Meta popisuje současnou dostupnost jako široce rozšířenou globálně.[1]
2. Muse Code není jen jednoduchý wrapper nad modelem
U programovacích agentů není benchmark modelu a benchmark produktu totéž.
Muse Code přidává vlastní exekuční vrstvu.
Async Background Agents
Hlavní agent může využívat specializované subagenty, kteří pokračují v práci na pozadí. Nevznikají jen pro jeden krok a mohou zůstat aktivní během celé relace.[1]
Cílem je omezit:
- opakované sbírání stejných informací,
- latenci,
- potřebu manuálního řízení,
- opakovanou analýzu repozitáře.
Append-only event log
Muse Code lokálně ukládá historii:
- volání modelu,
- použití nástrojů,
- schválení,
- editací.[1]
Meta popisuje runtime jako replay-exact a restart-safe. Po selhání může agent pokračovat z logu místo toho, aby začal úlohu od začátku.
To je důležité u programovacích úloh trvajících několik hodin.
Vestavěné skills
První verze obsahuje mimo jiné:
/plan
/grill
/goal
/plan připraví plán s fází schválení, /grill plán kriticky prověří a /goal udržuje práci směrem k definovanému cíli.[1]
3. Model a agent byly trénovány společně
Jde o jednu z nejdůležitějších informací pro interpretaci benchmarků.
Meta pouze nepřipojila nový model k existujícímu CLI. Firma uvádí co-training Muse Spark 1.2 a Muse Code.[1]
Trénink zahrnoval mimo jiné:
- trajectories z agent harnessu,
- optimalizace pro práci s cíli,
- compaction,
- subagenty,
- integrovanou sadu nástrojů Muse Code.[1]
Model byl navíc trénován na long-horizon úlohách:
- generování celých repozitářů,
- velkých end-to-end projektech,
- auto-research,
- sekvencování práce přes planning,
- udržování směru přes goal conditioning,
- kompresi kontextu.[1]
To pomáhá vysvětlit, proč je někdy správnou jednotkou srovnání:
Muse Spark 1.2 + Muse Code
a nikoli pouze:
Muse Spark 1.2
4. Self-improvement s využitím Muse Spark 1.1
Meta využila Muse Spark 1.1 k tvorbě tréninkových dat pro verzi 1.2.
Podle oficiálního popisu předchozí model:
- generoval obtížná programovací prostředí,
- připravoval šablony komplexních instrukcí,
- hodnotil kandidátní řešení,
- pomáhal vytvářet škálovatelný dataset pro Muse Spark 1.2.[1]
Meta tento proces označuje jako self-improvement loop.
Neznamená to, že se model „sám vytrénoval“. Stále šlo o kontrolovaný tréninkový pipeline navržený Meta, kde byl dřívější model jedním z prvků generování a hodnocení dat.
5. Oficiální Terminal-Bench 2.1
Terminal-Bench 2.1 hodnotí agenty provádějící úlohy v terminálovém prostředí.
Meta použila všech 89 úloh z oficiální verze 2.1. Každý běh probíhal v izolovaném Daytona sandboxu a executable verifier hodnotil konečný stav kontejneru. Výsledek je průměr pass@1 z pěti pokusů.[2]
Výsledky zveřejněné Meta
| Model + agent | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7 % | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9 % | |
| GPT-5.6 Terra + Codex | max | 81,8 % | |
| Grok 4.5 + Grok Build | high | 81,6 % | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9 % | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2 % | [1][2] |
Muse Spark 1.2 zlepšuje výsledek předchůdce o 6,7 procentního bodu.
Současně:
- zaostává za Opus 5 o 3,8 pp,
- překonává GPT-5.6 Terra o 1,1 pp,
- překonává Grok 4.5 o 1,3 pp.
Nejdůležitější výhrada
Nejde o čistý benchmark samotných modelů.
Porovnávané systémy jsou:
model
+
agent
+
nástroje
+
system prompt
+
runtime
Meta používá:
- Muse Code pro Spark 1.2,
- Claude Code pro Opus 5,
- Codex pro GPT-5.6,
- Grok Build pro Grok 4.5,
- Antigravity CLI pro Gemini.[2]
Meta sama uvádí, že konfigurace a system prompts nemusely být optimálně naladěné pro uzavřené konkurenční modely.[2]
Správný závěr tedy zní:
V konfiguraci Meta dosáhl Muse Spark 1.2 + Muse Code 82,9 %.
Nikoli:
Muse Spark 1.2 je obecně lepší než GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 obsahuje 113 úloh z 91 repozitářů v pěti jazycích:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Každá úloha má ručně připravený funkční verifier a regresní testy.
Během rollout a grading je externí internet blokován. Endpoint modelu zůstává dostupný.[2]
Výsledky Meta
| Model + agent | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0 % | |
| GPT-5.6 Terra + Codex | 64,8 % | |
| Muse Spark 1.2 + Muse Code | 59,3 % | |
| Grok 4.5 + Grok Build | 56,6 % | |
| Muse Spark 1.1 + mini-swe-agent | 53,0 % | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0 % | [1][2] |
Muse Spark 1.2 zlepšuje 1.1 o 6,3 pp.
Zde je však odstup od lídrů větší:
Opus 5 65,0 %
GPT-5.6 64,8 %
Muse 1.2 59,3 %
Je to silný výsledek, ale ne první místo.
Další metodické omezení
Oficiální leaderboard DeepSWE používá mini-swe-agent pro každý model.
Meta ve své evaluaci naopak použila jiný agentní produkt pro každý model. Firma sama píše, že výsledek není harness-identical s oficiálním leaderboardem.[2]
Tuto informaci je důležité uvádět vedle 59,3 %.
7. Meta Internal Coding Bench
Meta Internal Coding Bench obsahuje 440 úloh z interní codebase Meta a skutečných pull requestů.[2]
Zahrnuje:
- opravy chyb,
- nové funkce,
- refactoring,
- cleanup,
- další software-engineering úlohy.
Internet je vypnutý. Řešení se kompilují a kontrolují unit testy. Meta provádí dva pokusy na úlohu.[2]
Výsledky
| Model | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4 % | |
| Muse Spark 1.2 | 70,6 % | |
| Muse Spark 1.1 | 68,3 % | |
| GPT-5.6 Terra | 65,4 % | |
| Gemini 3.6 Flash | 63,9 % | [1][2] |
Muse Spark 1.2 zlepšuje předchůdce o 2,3 pp.
Proč má tento benchmark menší externí hodnotu?
Ne proto, že musí být chybný.
Problémem je reprodukovatelnost.
Dataset:
- je interní,
- pochází z privátní codebase Meta,
- není veřejným benchmarkem, který lze nezávisle reprodukovat.
Výsledek je proto vhodné chápat jako další signál výrobce, nikoli jako nezávislý důkaz převahy.
8. Nezávislá kontrola: Artificial Analysis
Artificial Analysis dostala od Meta přístup k Muse Spark 1.2 před veřejným vydáním a provedla vlastní sadu testů.[4]
To je významné, protože umožňuje oddělit:
benchmark výrobce
od:
benchmark nezávislé organizace
Důležitá změna skóre po vydání
Článek Artificial Analysis z 5. srpna uváděl:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
Aktuální karta modelu po přechodu indexu na v4.1.1 ukazuje:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Číslo 54 by se proto nemělo kopírovat do aktuálního žebříčku bez uvedení data.
Benchmarky se mění kvůli:
- verzím indexu,
- gradingu,
- evaluačním sadám,
- metodickým opravám.
Produkční článek by měl vždy uvádět snapshot.
9. Aktuální srovnání Artificial Analysis
Karty modelů kontrolované 7. srpna 2026:
| Model | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* Hodnota Grok 4.5 pochází z publikované analýzy Artificial Analysis tohoto modelu. Jde o snapshoty odpovídajících verzí benchmarku, nikoli trvalé pozice v pořadí.
Co z toho vyplývá?
Muse Spark 1.2:
- aktuálně nedosahuje Opus 5 v celkovém indexu,
- zůstává 2 body za GPT-5.6 Sol,
- je na stejné úrovni jako Kimi K3 na aktuální kartě AA,
- předstihuje GPT-5.6 Terra v celkovém indexu,
- je nad výsledkem Grok 4.5 z doby jeho uvedení.
Ale Artificial Analysis Intelligence Index není čistě programovací benchmark.
Aktuální v4.1.1 kombinuje devět evaluací, mimo jiné:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Skóre 57 je proto vhodné číst jako širší signál inteligence a agentních schopností.
10. GDPval-AA v2: největší zlepšení oproti Spark 1.1
V launch snapshotu Artificial Analysis vzrostl GDPval-AA v2 z:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
tedy o 260 Elo bodů.[4]
GDPval-AA v2 testuje realistické úlohy znalostní práce.
Obsahuje 220 úloh z:
- 44 povolání,
- 9 hlavních odvětví americké ekonomiky.[2]
Modely vytvářejí mimo jiné:
- dokumenty,
- tabulky,
- prezentace,
- diagramy,
- reporty.
Artificial Analysis používá vlastní agentic harness Stirrup s přístupem k shellu a webu a výsledky porovnává párově pomocí LLM soudce.[2]
Snapshot z 5. srpna
Artificial Analysis uváděla:
| Model | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
Jde o jeden z nejsilnějších signálů, že verze 1.2 se zlepšila nejen v generování kódu.
GDPval ranking se aktualizuje, proto tyto hodnoty nemají být míchány s pozdějšími snapshoty.
11. Terminal-Bench podle Artificial Analysis
Meta uvádí:
82,9 %
pro Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis ve svém harnessu při vydání uváděla:
80 %
oproti:
78 %
pro Muse Spark 1.1.[4]
Tyto výsledky si neodporují.
Vznikly v:
- různých harnessech,
- různých konfiguracích agentů,
- různých exekučních postupech.
Je to dobrý příklad, proč se benchmark nemá publikovat bez metodiky.
12. Halucinace: číslo vypadá lépe, ale je třeba číst i druhou polovinu tabulky
Artificial Analysis zaznamenala v launch snapshotu zlepšení AA-Omniscience:
18 -> 22
a pokles hallucination rate:
38 % -> 28 %
Na první pohled to vypadá jednoznačně pozitivně.
Současně ale:
attempt rate: 82 % -> 67 %
accuracy: 41 % -> 38 %
Model častěji odmítal odpovědět, pokud si nebyl jistý.
AA-Omniscience abstention netrestá. Nižší hallucination rate tedy částečně vyplývá z větší ochoty neodpovědět.
Správná interpretace:
Muse Spark 1.2 méně často prezentoval chybnou odpověď jako jistou, ale zároveň se méně často pokoušel odpovědět.
Nesprávná interpretace:
Muse Spark 1.2 se stal o 10 procentních bodů přesnějším.
Data to nepotvrzují.
13. Scientific reasoning se nezlepšil rovnoměrně
V měřeních Artificial Analysis při vydání:
| Benchmark | Spark 1.1 | Spark 1.2 | Změna | |
|---|---|---|---|---|
| CritPt | 15 % | 18 % | +3 pp | |
| SciCode | 58 % | 56 % | -2 pp | |
| Humanity's Last Exam | 45 % | 44 % | -1 pp | [4] |
To ukazuje charakter aktualizace.
Muse Spark 1.2 není jednoduše:
Spark 1.1
+ několik procent všude
Největší zisky při vydání byly soustředěny na:
- agentní programování,
- používání nástrojů,
- profesionální agentní úlohy.
14. Cena API: jedna z největších výhod Muse Spark 1.2
Standardní ceník Meta:
| Tokeny | Cena za 1 mil. | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Cena input/output je stejná jako u Muse Spark 1.1.
Srovnání veřejných cen API
| Model | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
Jde o porovnání ceny tokenu, nikoli ceny dokončené úlohy.
Levnější model za milion tokenů může:
- vygenerovat více tokenů,
- provést více tool calls,
- potřebovat více iterací,
- udělat chybu vyžadující ruční opravu.
Lepší business metrika proto je:
cena za správně dokončenou úlohu
a ne pouze:
cena za 1M tokenů
15. Cena za úlohu podle launch měření Artificial Analysis
Ve snapshotu z 5. srpna uváděla Artificial Analysis váženou průměrnou cenu jedné úlohy Intelligence Index:
| Model / konfigurace | Cena úlohy | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
To je pro Muse Spark 1.2 velmi dobrý nákladový výsledek.
Oproti Spark 1.1 však cena vzrostla z:
0,29 USD
na
0,40 USD
Artificial Analysis to spojuje s vyšší spotřebou tokenů:
- přibližně o 53 % více input tokenů,
- přibližně o 36 % více output tokenů,
zejména v GDPval-AA v2.[4]
Verze 1.2 je tedy:
lepší
ale
tokenově náročnější
Jednotková cena API se nezměnila, ale agent vykonává více práce.
16. Muse Spark 1.2 vs Claude Opus 5
Kde vítězí Opus 5?
V datech Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7 % | 82,9 % | |
| DeepSWE 1.1 | 65,0 % | 59,3 % | |
| Meta Internal Coding Bench | 79,4 % | 70,6 % | [1] |
V aktuálním Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
Dostupná data nedávají základ označit Muse Spark 1.2 obecně za lepší model.
Kde má výhodu Muse?
Především v ceně tokenů:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
U agentů provádějících tisíce operací může být rozdíl významný.
Závěr
Opus 5 je vhodnější, když:
- maximální úspěšnost je důležitější než cena tokenů,
- úloha je obtížná a chyba drahá,
- tým už používá Claude Code.
Muse Spark 1.2 dává větší smysl, když:
- je vysoký objem úloh,
- agent dlouho pracuje nad repozitářem,
- náklady na tokeny jsou zásadní,
- několik benchmarkových bodů neospravedlňuje mnohem dražší API.
17. Muse Spark 1.2 vs GPT-5.6 Terra
Jde o jedno z nejzajímavějších srovnání.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9 %
Terra + Codex: 81,8 %
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3 %
Terra + Codex: 64,8 %
Meta Internal Coding Bench
Muse 1.2: 70,6 %
Terra: 65,4 %
Lídr se mění podle benchmarku.
Artificial Analysis
Aktuální celkový index:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Cena
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Neznamená to automatickou výhru Muse. Terra je v DeepSWE v porovnání Meta jasně silnější.
Nejférovější interpretace:
Muse Spark 1.2 je vůči GPT-5.6 Terra mimořádně konkurenceschopný cenou a v části agentních úloh, ale výsledek závisí na typu úlohy a harnessu.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol zůstává silnější v širším indexu Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol stojí:
5 USD / 1M input
30 USD / 1M output
oproti:
1,25 USD / 1M input
4,25 USD / 1M output
To je velký rozdíl pro:
- dlouhé reasoning traces,
- subagenty,
- iterativní debugging,
- repo-wide refactoring,
- několikahodinové agent runs.
Pokud se dodatečné 2 body v celkovém indexu nepřenesou do vyšší míry správně dokončených úloh v reálné firmě, dražší model nemusí být ekonomičtější.
19. Muse Spark 1.2 vs Kimi K3
Aktuální karta Artificial Analysis ukazuje:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
To neznamená stejné schopnosti.
Hlavní rozdíl
Kimi K3:
- má veřejně dostupné váhy,
- lze self-hostovat,
- má 2,8 bilionu celkových parametrů a 104 miliard aktivních,
- používá vlastní Kimi K3 License.[10]
Muse Spark 1.2:
- je proprietary,
- běží přes Meta Model API,
- nemá veřejně známý počet parametrů.[3]
Ceny oficiálních API
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Pokud self-hosting není požadavkem, Muse je v nominální ceně API výrazně levnější.
Pokud organizace potřebuje:
- vlastní infrastrukturu,
- kontrolu nad vahami,
- vlastní úpravy modelu,
Kimi K3 nabízí možnost, kterou Muse Spark 1.2 nyní nemá.
20. Muse Spark 1.2 vs Grok 4.5
V Meta Terminal-Bench:
Muse Spark 1.2 + Muse Code: 82,9 %
Grok 4.5 + Grok Build: 81,6 %
V DeepSWE:
Muse Spark 1.2: 59,3 %
Grok 4.5: 56,6 %
V Artificial Analysis Intelligence Index při uvedení měl Grok 4.5 skóre 54, tedy podobné jako launch snapshot Muse 1.2 před aktualizací indexu.[4][11]
Artificial Analysis také uváděla Grok 4.5 high jako jeden z mála modelů s nižší cenou za úlohu ve stejném kvalitativním clusteru:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
Je to další příklad, že poměr cena-výkon v roce 2026 už nefunguje podle jednoduchého pravidla:
nejdražší model
=
nejvýhodnější model
21. Optimalizace kernelů: více než 1 000 tool calls a až 24 hodin práce
Meta provedla zajímavý long-horizon experiment.
Muse Code a modely měly iterativně optimalizovat GPU kernels pomocí:
- více než 1 000 tool calls,
- až 24 hodin,
- psaní kódu,
- kompilace,
- profilování,
- opakovaných optimalizací.[1]
Testovaly se KDA a MLA na NVIDIA Hopper.
KDA
Baseline byla FLA implementace v Tritonu. Modely nesměly přímo importovat externí kernel knihovny jako FLA.[1]
V grafu konečného speedupu oproti baseline Meta ukázala mimo jiné:
| Model | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0 % | |
| GPT-5.6 Sol | +71,2 % | |
| Claude Opus 4.8 | +69,6 % | |
| Muse Spark 1.2 | +68,7 % | |
| GPT-5.6 Terra | +65,1 % | |
| Gemini 3.6 Flash | +62,5 % | [1] |
Muse Spark 1.2 tento experiment nevyhrál.
To je důležité, protože oficiální materiál Meta nepředstavuje vlastní model jako lídra v každé kategorii.
Co tento experiment nedokazuje?
Nedokazuje, že:
- Opus 5 vždy optimalizuje kód o 74 %,
- Muse vždy přinese +68,7 %,
- výsledky platí pro každý kernel nebo GPU.
Jde o case study konkrétní úlohy, baseline, harnessu a hardwaru.
22. Dlouhý kontext: 1 milion tokenů
Artificial Analysis potvrzuje pro Muse Spark 1.2:
1M token context window
a:
- text input,
- image input,
- text output.[3]
Milion tokenů může být důležitý pro:
- velké repozitáře,
- monorepa,
- dokumentaci,
- dlouhou historii agenta,
- analýzu mnoha souborů.
Neznamená to, že by se měl celý repozitář vložit do jednoho promptu.
Maximální kapacita nezaručuje:
- nalezení všech závislostí,
- správné prioritizování,
- odolnost proti škodlivému textu v repozitáři,
- stejnou kvalitu na začátku a konci kontextu.
Muse Code proto používá také context compaction, nikoli jen stále větší prompty.[1]
23. Proč je aktuální AA skóre 57, když launch články mohou uvádět 54?
Nejde o chybu, kterou by bylo třeba skrývat.
Artificial Analysis publikovala 5. srpna skóre 54.[4]
Aktuální karta Muse Spark 1.2 kontrolovaná 7. srpna ukazuje 57 a uvádí jako současnou verzi Artificial Analysis Intelligence Index v4.1.1.[3]
Při citování benchmarků je proto vhodné uchovávat:
model
+
effort
+
verzi benchmarku
+
datum
Například:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stav: 7. srpna 2026
Je to výrazně lepší než napsat:
Muse Spark 1.2 má 57 bodů
bez kontextu.
24. Standard tier vs Contributor tier: důležitý rozdíl pro soukromí
Standardní cena Muse Spark 1.2 je:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta nabízí také výrazně zlevněný Contributor tier.
Nezávislé tiskové zprávy popisující oficiální nabídku uvádějí, že nižší cena je spojena se souhlasem, aby aktivita uživatele mohla být využita ke zlepšování produktů Meta.[6]
Pro podnikové použití je to důležitý rozdíl.
Před použitím Contributor tier pro kód, který je:
- soukromý,
- pod NDA,
- obsahuje obchodní tajemství,
- patří klientovi,
je nutné ověřit přesné podmínky zpracování dat platné pro účet a endpoint.
Levnější endpoint se nemá volit pouze podle ceny.
25. Je Muse Spark 1.2 nejlepší model pro programování?
Podle ověřených dat: není důvod to tvrdit.
Nevede všechny benchmarky Meta
Opus 5 vede v:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra je před Muse také v DeepSWE.
Cenově je ale Muse mimořádně silný
Muse Spark 1.2 má mnohem nižší cenu outputu než:
Nejlépe obhajitelné tvrzení
Muse Spark 1.2 je jeden z nejzajímavějších modelů roku 2026 z hlediska poměru agentic-coding schopností k ceně. Opus 5 zůstává silnější v dostupných kvalitativních srovnáních a konečná volba by měla vycházet z vlastního POC.
26. Který model vybrat?
Vyberte Muse Spark 1.2, pokud:
- náklady dlouhých relací jsou velmi důležité,
- pracujete s velkými repozitáři,
- chcete používat Muse Code,
- agent má dlouho pracovat bez manuálního vedení,
- potřebujete persistent subagenty,
- nominální cena outputu musí být nízká,
- výkon blízko frontier stačí pro daný workflow.
Vyberte Claude Opus 5, pokud:
- maximální úspěšnost je prioritou,
- cena chyby převyšuje cenu tokenů,
- používáte Claude Code,
- úlohy jsou výjimečně obtížné,
- váš POC potvrzuje vyšší completion rate.
Vyberte GPT-5.6 Terra, pokud:
- používáte ekosystém Codex,
- DeepSWE-like úlohy jsou zásadní,
- potřebujete silný coding model levnější než Sol,
- nástroje OpenAI jsou součástí pipeline.
Vyberte GPT-5.6 Sol, pokud:
- potřebujete vyšší obecné schopnosti než Muse,
- cena API je méně důležitá,
- workload zahrnuje širší reasoning než samotný coding.
Vyberte Kimi K3, pokud:
- potřebujete otevřené váhy,
- plánujete self-hosting,
- potřebujete vlastní modifikace modelu,
- můžete akceptovat vyšší cenu oficiálního API.
Zvažte Grok 4.5, pokud:
- vlastní testy ukazují silné agentní výsledky,
- cena za dokončenou úlohu je klíčová metrika,
- používáte Grok Build nebo kompatibilní harness.
27. Jak udělat férový POC
Netestujte modely na pěti promptech.
Připravte alespoň:
50-200 reálných úloh
z vlastního repozitáře.
Kategorie
- bug fix,
- nová funkce,
- refactoring,
- testy,
- code review,
- migrace dependency,
- performance optimization,
- analýza logů,
- frontend ze screenshotu,
- repo-wide změna,
- technická dokumentace.
U každé úlohy měřte
úspěch / neúspěch
čas
cenu
počet tokenů
počet tool calls
ruční zásahy
regrese
Nejdůležitější metrika
Ne:
který model napsal hezčí odpověď?
Ale:
který model nejčastěji dodal správný, merge-ready výsledek
za přijatelnou cenu a čas?
28. Jak porovnávat agenty, nejen modely
U:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build
model nepracuje izolovaně.
Agent rozhoduje:
- které soubory číst,
- kdy spustit testy,
- kdy použít grep,
- zda použít subagenta,
- jak spravovat kontext,
- kolik iterací provést,
- kdy práci ukončit.
Proto je vhodné provést dva testy.
Test A: model ve společném harnessu
stejný agent
stejné nástroje
stejný system prompt
stejné limity
Pomáhá porovnat samotné modely.
Test B: end-to-end produkt
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Pomáhá odpovědět na praktickou otázku:
Které řešení je nejlepší pro tým?
Oba testy měří něco jiného.
29. Produkční checklist Muse Spark 1.2
Benchmarky
- Je uložena verze benchmarku.
- Je uloženo datum skóre.
- Je uložen reasoning effort.
- Je uložen název agenta.
- Meta Terminal-Bench se nemíchá s výsledkem AA.
- Meta Internal Coding Bench se nepovažuje za nezávislý benchmark.
- Výsledky jsou ověřeny na vlastním repozitáři.
Náklady
- Měří se skutečný input.
- Měří se cached input.
- Měří se output.
- Měří se cena reasoning.
- Měří se počet tool calls.
- Cena se počítá za dokončenou úlohu.
- Porovnávají se nejméně tři modely.
- Je nastaven limit výdajů na agenta.
Repozitář
- Agent má minimální potřebná oprávnění.
- Secrets nejsou ve snadno dostupných souborech.
- Přístup do produkce vyžaduje schválení.
- Merge vyžaduje review.
- Testy se spouštějí automaticky.
- Agent nemůže obejít branch protection.
- Změny a tool calls se logují.
Data
- Ověřeny podmínky Standard tier.
- Ověřeny podmínky Contributor tier.
- Kód klienta nejde na špatný endpoint.
- Firemní politika dovoluje zvolenou službu.
- Jsou nastaveny zásady retence promptů a logů.
- Osobní údaje jsou správně chráněny.
Kvalita
- Agent po změnách spouští testy.
- Kontroluje se finální diff.
- Měří se regrese.
- Dlouhé úlohy mají checkpointy.
- Testuje se obnovení po chybě.
- Testují se velká monorepa.
- Testují se několikahodinové úlohy.
30. Verdikt POLPROG
Muse Spark 1.2 je významnější vydání, než naznačuje číslo 1.2.
Meta vytvořila model a Muse Code jako propojený systém a zaměřila trénink na:
- velké repozitáře,
- dlouhé úlohy,
- nástroje,
- subagenty,
- plánování,
- automatickou verifikaci.
Výsledky potvrzují skutečné zlepšení oproti Muse Spark 1.1.
Nejsilnější fakta
Terminal-Bench 2.1
76,2 % -> 82,9 % v evaluaci Meta
DeepSWE 1.1
53,0 % -> 59,3 % v evaluaci Meta
GDPval-AA v2
1371 -> 1631 Elo v launch snapshotu Artificial Analysis
Stále ale není lídrem všeho
Opus 5 překonává Muse Spark 1.2 ve všech třech coding benchmarkech zobrazených Meta.
V aktuálním snapshotu Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Proč je tedy Muse Spark 1.2 zajímavý?
Protože stojí:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Tím se stává méně užitečnou otázka:
Který model má nejvyšší benchmark?
Lepší otázka je:
Který model dodá největší počet správně dokončených úloh za 100 USD rozpočtu?
Pro mnoho týmů může být odpověď jiná než model na prvním místě jedné tabulky.
Muse Spark 1.2 nyní působí jako velmi silný kandidát pro agentní programování ve velkém měřítku s kontrolovanými náklady.
Není bezvýhradným vítězem.
Rozhodně ale patří do POC spolu s:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

