Model nebol vydaný s otvorenými váhami. Artificial Analysis klasifikuje Muse Spark 1.2 ako proprietary model a počet parametrov nebol verejne zverejnený.[3]
Najzaujímavejšia časť vydania však nespočíva iba v názve modelu. Meta trénovala Muse Spark 1.2 spolu s Muse Code a optimalizovala ho pre skutočné agentné prostredie: plánovanie, context compaction, subagentov, používanie nástrojov a dlhé úlohy pokrývajúce celé repozitáre.[1]
Výsledky sú silné, no vyžadujú opatrnú interpretáciu.
V oficiálnej evaluácii Meta:
- Muse Spark 1.2 + Muse Code dosahuje 82,9 % v Terminal-Bench 2.1,
- 59,3 % v DeepSWE 1.1,
- 70,6 % v Meta Internal Coding Bench.[1][2]
To však neznamená, že Muse Spark 1.2 je najlepší programovací model na trhu. V rovnakých tabuľkách je Claude Opus 5 + Claude Code prvý vo všetkých troch porovnaniach. Meta navyše sama upozorňuje, že nejde o dokonale čisté model-to-model porovnanie: každý model bežal s iným agentom a testovacia konfigurácia mohla byť lepšie prispôsobená Muse Code než konkurenčným nástrojom.[2]
Nezávislejší pohľad prináša Artificial Analysis. Na aktuálnej karte modelu kontrolovanej 7. augusta dosahuje Muse Spark 1.2 s xhigh 57 bodov v Artificial Analysis Intelligence Index v4.1.1. Na porovnanie Claude Opus 5 má 61, GPT-5.6 Sol 59, Kimi K3 57 a GPT-5.6 Terra 55.[3][7][8][9][10]
Stručný záver: Muse Spark 1.2 bezvýhradne neporáža Opus 5 ani GPT-5.6 Sol, no cenovo je mimoriadne konkurencieschopný. Najsilnejšie pôsobí ako model pre agentné programovanie, najmä v spojení s Muse Code a tam, kde záleží na nákladoch dlhých relácií.
Všetky dáta v článku boli overené podľa materiálov Meta, oficiálnej metodiky evaluácie, Artificial Analysis a nezávislých tlačových zdrojov. Stav k 7. augustu 2026.
TL;DR
| Otázka | Overená odpoveď |
|---|---|
| Kedy bol Muse Spark 1.2 vydaný? | 5. augusta 2026 |
| Kto vytvoril model? | Meta |
| Čo je Muse Code? | Terminálový programovací agent v beta verzii |
| Má Muse Spark 1.2 otvorené váhy? | Nie, model je proprietary |
| Poznáme počet parametrov? | Nie, Meta ho verejne neuviedla |
| Kontext | 1 milión tokenov |
| Modality | text a obraz na vstupe, text na výstupe |
| Štandardná cena input | 1,25 USD / 1 mil. tokenov |
| Cena cached input | 0,15 USD / 1 mil. tokenov |
| Cena output | 4,25 USD / 1 mil. tokenov |
| Terminal-Bench 2.1 podľa Meta | 82,9 % |
| DeepSWE 1.1 podľa Meta | 59,3 % |
| Meta Internal Coding Bench | 70,6 % |
| Aktuálny AA Intelligence Index v4.1.1 | 57 |
| AA Index v článku z dňa vydania | 54 |
| Sú výsledky Meta nezávislé? | Nie, časť tvoria evaluácie výrobcu |
| Je Artificial Analysis nezávislá od Meta? | Áno, hoci Meta poskytla prístup pred vydaním na benchmarky |
| Najsilnejšia oblasť | agentné programovanie a pomer schopností k cene |
| Hlavné obmedzenie | nevyhráva všetky benchmarky a časť testov používa rozdielne agent harnessy |
1. Čo presne Meta vydala?
Vydanie zahŕňa dva prepojené produkty:
Muse Spark 1.2
model
Muse Code
terminálový programovací agent
Meta opisuje Muse Spark 1.2 ako aktualizáciu Muse Spark 1.1 zameranú na coding. Zvýšila compute použitý pri tréningu na programovacích úlohách a rozšírila rozmanitosť tréningových prostredí.[1]
Muse Code je agent, ktorý dokáže:
- plánovať zmeny v repozitári,
- písať kód,
- spúšťať nástroje,
- validovať výsledky,
- koordinovať viacero dlhodobo bežiacich subagentov,
- udržiavať progres počas dlhých relácií.[1]
Inštaláciu oficiálneho klienta na macOS alebo Linux Meta popisuje takto:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 je dostupný cez Muse Code aj Meta Model API. Meta opisuje súčasnú dostupnosť ako široko rozšírenú globálne.[1]
2. Muse Code nie je iba jednoduchý wrapper nad modelom
Pri programovacích agentoch benchmark modelu a benchmark produktu nie sú to isté.
Muse Code pridáva vlastnú exekučnú vrstvu.
Async Background Agents
Hlavný agent môže využívať špecializovaných subagentov, ktorí pokračujú v práci na pozadí. Nevznikajú iba pre jeden krok a môžu zostať aktívni počas celej relácie.[1]
Cieľom je obmedziť:
- opakované zhromažďovanie rovnakých informácií,
- latenciu,
- potrebu manuálneho riadenia,
- opakovanú analýzu repozitára.
Append-only event log
Muse Code lokálne ukladá históriu:
- volaní modelu,
- použitia nástrojov,
- schválení,
- úprav.[1]
Meta opisuje runtime ako replay-exact a restart-safe. Po zlyhaní môže agent pokračovať z logu namiesto toho, aby začal úlohu od začiatku.
To je dôležité pri programovacích úlohách trvajúcich niekoľko hodín.
Vstavané skills
Prvá verzia obsahuje okrem iného:
/plan
/grill
/goal
/plan pripraví plán s fázou schválenia, /grill plán kriticky preverí a /goal udržiava prácu smerom k definovanému cieľu.[1]
3. Model a agent boli trénované spoločne
Ide o jednu z najdôležitejších informácií pre interpretáciu benchmarkov.
Meta iba nepripojila nový model k existujúcemu CLI. Firma uvádza co-training Muse Spark 1.2 a Muse Code.[1]
Tréning zahŕňal okrem iného:
- trajectories z agent harnessu,
- optimalizácie pre prácu s cieľmi,
- compaction,
- subagentov,
- integrovanú sadu nástrojov Muse Code.[1]
Model bol navyše trénovaný na long-horizon úlohách:
- generovanie celých repozitárov,
- veľké end-to-end projekty,
- auto-research,
- sekvencovanie práce cez planning,
- udržiavanie smeru cez goal conditioning,
- kompresia kontextu.[1]
To pomáha vysvetliť, prečo je niekedy správnou jednotkou porovnania:
Muse Spark 1.2 + Muse Code
a nie iba:
Muse Spark 1.2
4. Self-improvement s využitím Muse Spark 1.1
Meta využila Muse Spark 1.1 na tvorbu tréningových dát pre verziu 1.2.
Podľa oficiálneho popisu predchádzajúci model:
- generoval náročné programovacie prostredia,
- pripravoval šablóny komplexných inštrukcií,
- hodnotil kandidátske riešenia,
- pomáhal vytvárať škálovateľný dataset pre Muse Spark 1.2.[1]
Meta tento proces označuje ako self-improvement loop.
Neznamená to, že sa model „sám vytrénoval“. Stále išlo o kontrolovaný tréningový pipeline navrhnutý Meta, kde bol skorší model jedným z prvkov generovania a hodnotenia dát.
5. Oficiálny Terminal-Bench 2.1
Terminal-Bench 2.1 hodnotí agentov vykonávajúcich úlohy v terminálovom prostredí.
Meta použila všetkých 89 úloh z oficiálnej verzie 2.1. Každý beh prebiehal v izolovanom Daytona sandboxe a executable verifier hodnotil konečný stav kontajnera. Výsledok je priemer pass@1 z piatich pokusov.[2]
Výsledky zverejnené Meta
| Model + agent | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7 % | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9 % | |
| GPT-5.6 Terra + Codex | max | 81,8 % | |
| Grok 4.5 + Grok Build | high | 81,6 % | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9 % | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2 % | [1][2] |
Muse Spark 1.2 zlepšuje výsledok predchodcu o 6,7 percentuálneho bodu.
Súčasne:
- zaostáva za Opus 5 o 3,8 pp,
- prekonáva GPT-5.6 Terra o 1,1 pp,
- prekonáva Grok 4.5 o 1,3 pp.
Najdôležitejšia výhrada
Nejde o čistý benchmark samotných modelov.
Porovnávané systémy sú:
model
+
agent
+
nástroje
+
system prompt
+
runtime
Meta používa:
- Muse Code pre Spark 1.2,
- Claude Code pre Opus 5,
- Codex pre GPT-5.6,
- Grok Build pre Grok 4.5,
- Antigravity CLI pre Gemini.[2]
Meta sama uvádza, že konfigurácia a system prompts nemuseli byť optimálne naladené pre uzavreté konkurenčné modely.[2]
Správny záver teda znie:
V konfigurácii Meta dosiahol Muse Spark 1.2 + Muse Code 82,9 %.
Nie:
Muse Spark 1.2 je všeobecne lepší než GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 obsahuje 113 úloh z 91 repozitárov v piatich jazykoch:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Každá úloha má ručne pripravený funkčný verifier a regresné testy.
Počas rollout a grading je externý internet zablokovaný. Endpoint modelu zostáva dostupný.[2]
Výsledky Meta
| Model + agent | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0 % | |
| GPT-5.6 Terra + Codex | 64,8 % | |
| Muse Spark 1.2 + Muse Code | 59,3 % | |
| Grok 4.5 + Grok Build | 56,6 % | |
| Muse Spark 1.1 + mini-swe-agent | 53,0 % | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0 % | [1][2] |
Muse Spark 1.2 zlepšuje 1.1 o 6,3 pp.
Tu je však odstup od lídrov väčší:
Opus 5 65,0 %
GPT-5.6 64,8 %
Muse 1.2 59,3 %
Je to silný výsledok, ale nie prvé miesto.
Ďalšie metodické obmedzenie
Oficiálny leaderboard DeepSWE používa mini-swe-agent pre každý model.
Meta vo svojej evaluácii naopak použila iný agentný produkt pre každý model. Firma sama píše, že výsledok nie je harness-identical s oficiálnym leaderboardom.[2]
Túto informáciu je dôležité uvádzať vedľa 59,3 %.
7. Meta Internal Coding Bench
Meta Internal Coding Bench obsahuje 440 úloh z internej codebase Meta a skutočných pull requestov.[2]
Zahŕňa:
- opravy chýb,
- nové funkcie,
- refactoring,
- cleanup,
- ďalšie software-engineering úlohy.
Internet je vypnutý. Riešenia sa kompilujú a kontrolujú unit testami. Meta vykonáva dva pokusy na úlohu.[2]
Výsledky
| Model | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4 % | |
| Muse Spark 1.2 | 70,6 % | |
| Muse Spark 1.1 | 68,3 % | |
| GPT-5.6 Terra | 65,4 % | |
| Gemini 3.6 Flash | 63,9 % | [1][2] |
Muse Spark 1.2 zlepšuje predchodcu o 2,3 pp.
Prečo má tento benchmark menšiu externú hodnotu?
Nie preto, že musí byť chybný.
Problémom je reprodukovateľnosť.
Dataset:
- je interný,
- pochádza z privátnej codebase Meta,
- nie je verejným benchmarkom, ktorý možno nezávisle reprodukovať.
Výsledok je preto vhodné chápať ako ďalší signál výrobcu, nie ako nezávislý dôkaz prevahy.
8. Nezávislá kontrola: Artificial Analysis
Artificial Analysis dostala od Meta prístup k Muse Spark 1.2 pred verejným vydaním a vykonala vlastnú sadu testov.[4]
To je významné, pretože umožňuje oddeliť:
benchmark výrobcu
od:
benchmark nezávislej organizácie
Dôležitá zmena skóre po vydaní
Článok Artificial Analysis z 5. augusta uvádzal:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
Aktuálna karta modelu po prechode indexu na v4.1.1 ukazuje:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Číslo 54 by sa preto nemalo kopírovať do aktuálneho rebríčka bez uvedenia dátumu.
Benchmarky sa menia v dôsledku:
- verzií indexu,
- gradingu,
- evaluačných sád,
- metodických opráv.
Produkčný článok by mal vždy uvádzať snapshot.
9. Aktuálne porovnanie Artificial Analysis
Karty modelov kontrolované 7. augusta 2026:
| Model | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* Hodnota Grok 4.5 pochádza z publikovanej analýzy Artificial Analysis tohto modelu. Ide o snapshoty príslušných verzií benchmarku, nie trvalé pozície v rebríčku.
Čo z toho vyplýva?
Muse Spark 1.2:
- aktuálne nedosahuje Opus 5 v celkovom indexe,
- zostáva 2 body za GPT-5.6 Sol,
- je na rovnakej úrovni ako Kimi K3 na aktuálnej karte AA,
- prekonáva GPT-5.6 Terra v celkovom indexe,
- je nad výsledkom Grok 4.5 z obdobia vydania.
Ale Artificial Analysis Intelligence Index nie je čisto programovací benchmark.
Aktuálna v4.1.1 kombinuje deväť evaluácií, okrem iného:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Skóre 57 je preto vhodné čítať ako širší signál inteligencie a agentných schopností.
10. GDPval-AA v2: najväčšie zlepšenie oproti Spark 1.1
V launch snapshote Artificial Analysis vzrástol GDPval-AA v2 z:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
teda o 260 Elo bodov.[4]
GDPval-AA v2 testuje realistické úlohy znalostnej práce.
Obsahuje 220 úloh z:
- 44 povolaní,
- 9 hlavných odvetví americkej ekonomiky.[2]
Modely vytvárajú napríklad:
- dokumenty,
- tabuľky,
- prezentácie,
- diagramy,
- reporty.
Artificial Analysis používa vlastný agentic harness Stirrup s prístupom k shellu a webu a výsledky porovnáva párovo pomocou LLM sudcu.[2]
Snapshot z 5. augusta
Artificial Analysis uvádzala:
| Model | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
Ide o jeden z najsilnejších signálov, že verzia 1.2 sa zlepšila nielen v generovaní kódu.
GDPval ranking sa aktualizuje, preto tieto hodnoty nemajú byť miešané s neskoršími snapshotmi.
11. Terminal-Bench podľa Artificial Analysis
Meta uvádza:
82,9 %
pre Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis vo vlastnom harness pri vydaní uvádzala:
80 %
oproti:
78 %
pre Muse Spark 1.1.[4]
Tieto výsledky si neodporujú.
Vznikli v:
- rôznych harnessoch,
- rôznych konfiguráciách agentov,
- rôznych exekučných postupoch.
Je to dobrý príklad, prečo sa benchmark nemá publikovať bez metodiky.
12. Halucinácie: číslo vyzerá lepšie, ale treba čítať aj druhú polovicu tabuľky
Artificial Analysis zaznamenala v launch snapshote zlepšenie AA-Omniscience:
18 -> 22
a pokles hallucination rate:
38 % -> 28 %
Na prvý pohľad to vyzerá jednoznačne pozitívne.
Súčasne však:
attempt rate: 82 % -> 67 %
accuracy: 41 % -> 38 %
Model častejšie odmietal odpovedať, keď si nebol istý.
AA-Omniscience abstention netrestá. Nižší hallucination rate teda čiastočne vyplýva z väčšej ochoty neodpovedať.
Správna interpretácia:
Muse Spark 1.2 menej často prezentoval chybnú odpoveď ako istú, ale zároveň sa menej často pokúšal odpovedať.
Nesprávna interpretácia:
Muse Spark 1.2 sa stal o 10 percentuálnych bodov presnejším.
Dáta to nepotvrdzujú.
13. Scientific reasoning sa nezlepšil rovnomerne
V meraniach Artificial Analysis pri vydaní:
| Benchmark | Spark 1.1 | Spark 1.2 | Zmena | |
|---|---|---|---|---|
| CritPt | 15 % | 18 % | +3 pp | |
| SciCode | 58 % | 56 % | -2 pp | |
| Humanity's Last Exam | 45 % | 44 % | -1 pp | [4] |
To ukazuje charakter aktualizácie.
Muse Spark 1.2 nie je jednoducho:
Spark 1.1
+ niekoľko percent všade
Najväčšie zisky pri vydaní sa sústredili na:
- agentné programovanie,
- používanie nástrojov,
- profesionálne agentné úlohy.
14. Cena API: jedna z najväčších výhod Muse Spark 1.2
Štandardný cenník Meta:
| Tokeny | Cena za 1 mil. | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Cena input/output je rovnaká ako pri Muse Spark 1.1.
Porovnanie verejných cien API
| Model | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
Ide o porovnanie ceny tokenu, nie ceny dokončenej úlohy.
Lacnejší model za milión tokenov môže:
- vygenerovať viac tokenov,
- vykonať viac tool calls,
- potrebovať viac iterácií,
- urobiť chybu vyžadujúcu ručnú opravu.
Lepšia business metrika preto je:
cena za správne dokončenú úlohu
a nie iba:
cena za 1M tokenov
15. Cena za úlohu podľa launch merania Artificial Analysis
V snapshote z 5. augusta uvádzala Artificial Analysis váženú priemernú cenu jednej úlohy Intelligence Index:
| Model / konfigurácia | Cena úlohy | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
To je pre Muse Spark 1.2 veľmi dobrý nákladový výsledok.
Oproti Spark 1.1 však cena vzrástla z:
0,29 USD
na
0,40 USD
Artificial Analysis to spája s vyššou spotrebou tokenov:
- približne o 53 % viac input tokenov,
- približne o 36 % viac output tokenov,
najmä v GDPval-AA v2.[4]
Verzia 1.2 je teda:
lepšia
ale
tokenovo náročnejšia
Jednotková cena API sa nezmenila, no agent vykonáva viac práce.
16. Muse Spark 1.2 vs Claude Opus 5
Kde víťazí Opus 5?
V dátach Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7 % | 82,9 % | |
| DeepSWE 1.1 | 65,0 % | 59,3 % | |
| Meta Internal Coding Bench | 79,4 % | 70,6 % | [1] |
V aktuálnom Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
Dostupné dáta nedávajú základ označiť Muse Spark 1.2 všeobecne za lepší model.
Kde má výhodu Muse?
Predovšetkým v cene tokenov:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
Pri agentoch vykonávajúcich tisíce operácií môže byť rozdiel výrazný.
Záver
Opus 5 je vhodnejší, keď:
- maximálna úspešnosť je dôležitejšia než cena tokenov,
- úloha je náročná a chyba drahá,
- tím už používa Claude Code.
Muse Spark 1.2 dáva väčší zmysel, keď:
- je vysoký objem úloh,
- agent dlho pracuje nad repozitárom,
- náklady na tokeny sú zásadné,
- niekoľko benchmarkových bodov neospravedlňuje oveľa drahšie API.
17. Muse Spark 1.2 vs GPT-5.6 Terra
Ide o jedno z najzaujímavejších porovnaní.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9 %
Terra + Codex: 81,8 %
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3 %
Terra + Codex: 64,8 %
Meta Internal Coding Bench
Muse 1.2: 70,6 %
Terra: 65,4 %
Líder sa mení podľa benchmarku.
Artificial Analysis
Aktuálny celkový index:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Cena
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Neznamená to automatickú výhru Muse. Terra je v DeepSWE v porovnaní Meta jasne silnejšia.
Najférovšia interpretácia:
Muse Spark 1.2 je voči GPT-5.6 Terra mimoriadne konkurencieschopný cenou a v časti agentných úloh, no výsledok závisí od typu úlohy a harnessu.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol zostáva silnejší v širšom indexe Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol stojí:
5 USD / 1M input
30 USD / 1M output
oproti:
1,25 USD / 1M input
4,25 USD / 1M output
To je veľký rozdiel pre:
- dlhé reasoning traces,
- subagentov,
- iteratívny debugging,
- repo-wide refactoring,
- niekoľkohodinové agent runs.
Ak sa dodatočné 2 body v celkovom indexe nepremietnu do vyššej miery správne dokončených úloh v reálnej firme, drahší model nemusí byť ekonomickejší.
19. Muse Spark 1.2 vs Kimi K3
Aktuálna karta Artificial Analysis ukazuje:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
To neznamená rovnaké schopnosti.
Hlavný rozdiel
Kimi K3:
- má verejne dostupné váhy,
- dá sa self-hostovať,
- má 2,8 bilióna celkových parametrov a 104 miliárd aktívnych,
- používa vlastnú Kimi K3 License.[10]
Muse Spark 1.2:
- je proprietary,
- beží cez Meta Model API,
- nemá verejne známy počet parametrov.[3]
Ceny oficiálnych API
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Ak self-hosting nie je požiadavkou, Muse je v nominálnej cene API výrazne lacnejší.
Ak organizácia potrebuje:
- vlastnú infraštruktúru,
- kontrolu nad váhami,
- vlastné úpravy modelu,
Kimi K3 ponúka možnosť, ktorú Muse Spark 1.2 zatiaľ nemá.
20. Muse Spark 1.2 vs Grok 4.5
V Meta Terminal-Bench:
Muse Spark 1.2 + Muse Code: 82,9 %
Grok 4.5 + Grok Build: 81,6 %
V DeepSWE:
Muse Spark 1.2: 59,3 %
Grok 4.5: 56,6 %
V Artificial Analysis Intelligence Index pri uvedení mal Grok 4.5 skóre 54, teda podobné launch snapshotu Muse 1.2 pred aktualizáciou indexu.[4][11]
Artificial Analysis tiež uvádzala Grok 4.5 high ako jeden z mála modelov s nižšou cenou za úlohu v rovnakom kvalitatívnom clusteri:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
Je to ďalší príklad, že pomer cena-výkon v roku 2026 už nefunguje podľa jednoduchého pravidla:
najdrahší model
=
najvýhodnejší model
21. Optimalizácia kernelov: viac ako 1 000 tool calls a až 24 hodín práce
Meta vykonala zaujímavý long-horizon experiment.
Muse Code a modely mali iteratívne optimalizovať GPU kernels pomocou:
- viac ako 1 000 tool calls,
- až 24 hodín,
- písania kódu,
- kompilácie,
- profilovania,
- opakovaných optimalizácií.[1]
Testovali sa KDA a MLA na NVIDIA Hopper.
KDA
Baseline bola FLA implementácia v Tritone. Modely nesmeli priamo importovať externé kernel knižnice ako FLA.[1]
V grafe konečného speedupu oproti baseline Meta ukázala okrem iného:
| Model | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0 % | |
| GPT-5.6 Sol | +71,2 % | |
| Claude Opus 4.8 | +69,6 % | |
| Muse Spark 1.2 | +68,7 % | |
| GPT-5.6 Terra | +65,1 % | |
| Gemini 3.6 Flash | +62,5 % | [1] |
Muse Spark 1.2 tento experiment nevyhral.
Je to dôležité, pretože oficiálny materiál Meta nepredstavuje vlastný model ako lídra v každej kategórii.
Čo tento experiment nedokazuje?
Nedokazuje, že:
- Opus 5 vždy optimalizuje kód o 74 %,
- Muse vždy prinesie +68,7 %,
- výsledky platia pre každý kernel alebo GPU.
Ide o case study konkrétnej úlohy, baseline, harnessu a hardvéru.
22. Dlhý kontext: 1 milión tokenov
Artificial Analysis potvrdzuje pre Muse Spark 1.2:
1M token context window
a:
- text input,
- image input,
- text output.[3]
Milión tokenov môže byť dôležitý pre:
- veľké repozitáre,
- monorepá,
- dokumentáciu,
- dlhú históriu agenta,
- analýzu mnohých súborov.
Neznamená to, že by sa mal celý repozitár vložiť do jedného promptu.
Maximálna kapacita nezaručuje:
- nájdenie všetkých závislostí,
- správne prioritizovanie,
- odolnosť voči škodlivému textu v repozitári,
- rovnakú kvalitu na začiatku a konci kontextu.
Muse Code preto používa aj context compaction, nie iba stále väčšie prompty.[1]
23. Prečo je aktuálne AA skóre 57, keď launch články môžu uvádzať 54?
Nejde o chybu, ktorú by bolo treba skrývať.
Artificial Analysis publikovala 5. augusta skóre 54.[4]
Aktuálna karta Muse Spark 1.2 kontrolovaná 7. augusta ukazuje 57 a uvádza ako súčasnú verziu Artificial Analysis Intelligence Index v4.1.1.[3]
Pri citovaní benchmarkov je preto vhodné uchovávať:
model
+
effort
+
verziu benchmarku
+
dátum
Napríklad:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stav: 7. augusta 2026
Je to výrazne lepšie než napísať:
Muse Spark 1.2 má 57 bodov
bez kontextu.
24. Standard tier vs Contributor tier: dôležitý rozdiel pre súkromie
Štandardná cena Muse Spark 1.2 je:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta ponúka aj výrazne zľavnený Contributor tier.
Nezávislé tlačové správy opisujúce oficiálnu ponuku uvádzajú, že nižšia cena je spojená so súhlasom, aby aktivita používateľa mohla byť využitá na zlepšovanie produktov Meta.[6]
Pre podnikové použitie je to dôležitý rozdiel.
Pred použitím Contributor tier pre kód, ktorý je:
- súkromný,
- pod NDA,
- obsahuje obchodné tajomstvá,
- patrí klientovi,
je nutné overiť presné podmienky spracovania dát platné pre účet a endpoint.
Lacnejší endpoint sa nemá voliť iba podľa ceny.
25. Je Muse Spark 1.2 najlepší model pre programovanie?
Podľa overených dát: nie je dôvod to tvrdiť.
Nevedie všetky benchmarky Meta
Opus 5 vedie v:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra je pred Muse aj v DeepSWE.
Cenovo je však Muse mimoriadne silný
Muse Spark 1.2 má výrazne nižšiu cenu outputu než:
Najlepšie obhájiteľné tvrdenie
Muse Spark 1.2 je jeden z najzaujímavejších modelov roku 2026 z hľadiska pomeru agentic-coding schopností k cene. Opus 5 zostáva silnejší v dostupných kvalitativných porovnaniach a konečný výber by mal vychádzať z vlastného POC.
26. Ktorý model vybrať?
Vyberte Muse Spark 1.2, ak:
- náklady dlhých relácií sú veľmi dôležité,
- pracujete s veľkými repozitármi,
- chcete používať Muse Code,
- agent má dlho pracovať bez manuálneho vedenia,
- potrebujete persistent subagentov,
- nominálna cena outputu musí byť nízka,
- výkon blízko frontier stačí pre daný workflow.
Vyberte Claude Opus 5, ak:
- maximálna úspešnosť je prioritou,
- cena chyby prevyšuje cenu tokenov,
- používate Claude Code,
- úlohy sú mimoriadne náročné,
- váš POC potvrdzuje vyššiu completion rate.
Vyberte GPT-5.6 Terra, ak:
- používate ekosystém Codex,
- DeepSWE-like úlohy sú zásadné,
- potrebujete silný coding model lacnejší než Sol,
- nástroje OpenAI sú súčasťou pipeline.
Vyberte GPT-5.6 Sol, ak:
- potrebujete vyššie všeobecné schopnosti než Muse,
- cena API je menej dôležitá,
- workload zahŕňa širší reasoning než samotný coding.
Vyberte Kimi K3, ak:
- potrebujete otvorené váhy,
- plánujete self-hosting,
- potrebujete vlastné modifikácie modelu,
- môžete akceptovať vyššiu cenu oficiálneho API.
Zvážte Grok 4.5, ak:
- vlastné testy ukazujú silné agentné výsledky,
- cena za dokončenú úlohu je kľúčová metrika,
- používate Grok Build alebo kompatibilný harness.
27. Ako urobiť férový POC
Netestujte modely na piatich promptoch.
Pripravte aspoň:
50-200 reálnych úloh
z vlastného repozitára.
Kategórie
- bug fix,
- nová funkcia,
- refactoring,
- testy,
- code review,
- migrácia dependency,
- performance optimization,
- analýza logov,
- frontend zo screenshotu,
- repo-wide zmena,
- technická dokumentácia.
Pri každej úlohe merajte
úspech / neúspech
čas
cenu
počet tokenov
počet tool calls
ručné zásahy
regresie
Najdôležitejšia metrika
Nie:
ktorý model napísal krajšiu odpoveď?
Ale:
ktorý model najčastejšie dodal správny, merge-ready výsledok
za prijateľnú cenu a čas?
28. Ako porovnávať agentov, nielen modely
Pri:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build
model nepracuje izolovane.
Agent rozhoduje:
- ktoré súbory čítať,
- kedy spustiť testy,
- kedy použiť grep,
- či použiť subagenta,
- ako spravovať kontext,
- koľko iterácií vykonať,
- kedy prácu ukončiť.
Preto je vhodné vykonať dva testy.
Test A: model v spoločnom harnessu
rovnaký agent
rovnaké nástroje
rovnaký system prompt
rovnaké limity
Pomáha porovnať samotné modely.
Test B: end-to-end produkt
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Pomáha odpovedať na praktickú otázku:
Ktoré riešenie je najlepšie pre tím?
Oba testy merajú niečo iné.
29. Produkčný checklist Muse Spark 1.2
Benchmarky
- Je uložená verzia benchmarku.
- Je uložený dátum skóre.
- Je uložený reasoning effort.
- Je uložený názov agenta.
- Meta Terminal-Bench sa nemieša s výsledkom AA.
- Meta Internal Coding Bench sa nepovažuje za nezávislý benchmark.
- Výsledky sú overené na vlastnom repozitári.
Náklady
- Meria sa skutočný input.
- Meria sa cached input.
- Meria sa output.
- Meria sa cena reasoning.
- Meria sa počet tool calls.
- Cena sa počíta za dokončenú úlohu.
- Porovnávajú sa najmenej tri modely.
- Je nastavený limit výdavkov na agenta.
Repozitár
- Agent má minimálne potrebné oprávnenia.
- Secrets nie sú v ľahko dostupných súboroch.
- Prístup do produkcie vyžaduje schválenie.
- Merge vyžaduje review.
- Testy sa spúšťajú automaticky.
- Agent nemôže obísť branch protection.
- Zmeny a tool calls sa logujú.
Dáta
- Overené podmienky Standard tier.
- Overené podmienky Contributor tier.
- Kód klienta nejde na nesprávny endpoint.
- Firemná politika povoľuje zvolenú službu.
- Sú nastavené zásady retencie promptov a logov.
- Osobné údaje sú správne chránené.
Kvalita
- Agent po zmenách spúšťa testy.
- Kontroluje sa finálny diff.
- Merajú sa regresie.
- Dlhé úlohy majú checkpointy.
- Testuje sa obnovenie po chybe.
- Testujú sa veľké monorepá.
- Testujú sa niekoľkohodinové úlohy.
30. Verdikt POLPROG
Muse Spark 1.2 je významnejšie vydanie, než naznačuje číslo 1.2.
Meta vytvorila model a Muse Code ako prepojený systém a zamerala tréning na:
- veľké repozitáre,
- dlhé úlohy,
- nástroje,
- subagentov,
- plánovanie,
- automatickú verifikáciu.
Výsledky potvrdzujú skutočné zlepšenie oproti Muse Spark 1.1.
Najsilnejšie fakty
Terminal-Bench 2.1
76,2 % -> 82,9 % v evaluácii Meta
DeepSWE 1.1
53,0 % -> 59,3 % v evaluácii Meta
GDPval-AA v2
1371 -> 1631 Elo v launch snapshote Artificial Analysis
Stále však nie je lídrom všetkého
Opus 5 prekonáva Muse Spark 1.2 vo všetkých troch coding benchmarkoch zobrazených Meta.
V aktuálnom snapshote Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Prečo je teda Muse Spark 1.2 zaujímavý?
Pretože stojí:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Tým sa stáva menej užitočnou otázka:
Ktorý model má najvyšší benchmark?
Lepšia otázka je:
Ktorý model dodá najväčší počet správne dokončených úloh za 100 USD rozpočtu?
Pre mnohé tímy môže byť odpoveď iná než model na prvom mieste jednej tabuľky.
Muse Spark 1.2 teraz pôsobí ako veľmi silný kandidát pre agentné programovanie vo veľkom meradle s kontrolovanými nákladmi.
Nie je bezvýhradným víťazom.
Rozhodne však patrí do POC spolu s:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

