Muse Spark 1.2 a Muse Code: benchmarky, ceny a porovnanie s Claude Opus 5, GPT-5.6, Kimi K3 a Grok 4.5 Skip to content

Muse Spark 1.2 a Muse Code: benchmarky, ceny a porovnanie s Claude Opus 5, GPT-5.6, Kimi K3 a Grok 4.5

Dňa 5. augusta 2026 Meta predstavila Muse Spark 1.2 a Muse Code, terminálového programovacieho agenta dostupného v beta verzii. Muse Spark 1.2 je aktualizácia zameraná najmä na programovanie, komplexné ladenie, porozumenie veľkým codebase a dokončovanie viacstupňových softvérových úloh od začiatku do konca.

Publikované Autor Čas čítania 24 min čítania
X LinkedIn

Dňa 5. augusta 2026 Meta predstavila Muse Spark 1.2 a Muse Code, terminálového programovacieho agenta dostupného v beta verzii. Muse Spark 1.2 je aktualizácia zameraná najmä na programovanie, komplexné ladenie, porozumenie veľkým codebase a dokončovanie viacstupňových softvérových úloh od začiatku do konca.

Na tejto stránke
  1. 1TL;DR
  2. 21. Čo presne Meta vydala?
  3. 32. Muse Code nie je iba jednoduchý wrapper nad modelom
  4. 43. Model a agent boli trénované spoločne
  5. 54. Self-improvement s využitím Muse Spark 1.1
  6. 65. Oficiálny Terminal-Bench 2.1
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Nezávislá kontrola: Artificial Analysis
  10. 109. Aktuálne porovnanie Artificial Analysis
  11. 1110. GDPval-AA v2: najväčšie zlepšenie oproti Spark 1.1
  12. 1211. Terminal-Bench podľa Artificial Analysis
  13. 1312. Halucinácie: číslo vyzerá lepšie, ale treba čítať aj druhú polovicu tabuľky
  14. 1413. Scientific reasoning sa nezlepšil rovnomerne
  15. 1514. Cena API: jedna z najväčších výhod Muse Spark 1.2
  16. 1615. Cena za úlohu podľa launch merania Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Optimalizácia kernelov: viac ako 1 000 tool calls a až 24 hodín práce
  23. 2322. Dlhý kontext: 1 milión tokenov
  24. 2423. Prečo je aktuálne AA skóre 57, keď launch články môžu uvádzať 54?
  25. 2524. Standard tier vs Contributor tier: dôležitý rozdiel pre súkromie
  26. 2625. Je Muse Spark 1.2 najlepší model pre programovanie?
  27. 2726. Ktorý model vybrať?
  28. 2827. Ako urobiť férový POC
  29. 2928. Ako porovnávať agentov, nielen modely
  30. 3029. Produkčný checklist Muse Spark 1.2
  31. 3130. Verdikt POLPROG

Model nebol vydaný s otvorenými váhami. Artificial Analysis klasifikuje Muse Spark 1.2 ako proprietary model a počet parametrov nebol verejne zverejnený.[3]

Najzaujímavejšia časť vydania však nespočíva iba v názve modelu. Meta trénovala Muse Spark 1.2 spolu s Muse Code a optimalizovala ho pre skutočné agentné prostredie: plánovanie, context compaction, subagentov, používanie nástrojov a dlhé úlohy pokrývajúce celé repozitáre.[1]

Výsledky sú silné, no vyžadujú opatrnú interpretáciu.

V oficiálnej evaluácii Meta:

  • Muse Spark 1.2 + Muse Code dosahuje 82,9 % v Terminal-Bench 2.1,
  • 59,3 % v DeepSWE 1.1,
  • 70,6 % v Meta Internal Coding Bench.[1][2]

To však neznamená, že Muse Spark 1.2 je najlepší programovací model na trhu. V rovnakých tabuľkách je Claude Opus 5 + Claude Code prvý vo všetkých troch porovnaniach. Meta navyše sama upozorňuje, že nejde o dokonale čisté model-to-model porovnanie: každý model bežal s iným agentom a testovacia konfigurácia mohla byť lepšie prispôsobená Muse Code než konkurenčným nástrojom.[2]

Nezávislejší pohľad prináša Artificial Analysis. Na aktuálnej karte modelu kontrolovanej 7. augusta dosahuje Muse Spark 1.2 s xhigh 57 bodov v Artificial Analysis Intelligence Index v4.1.1. Na porovnanie Claude Opus 5 má 61, GPT-5.6 Sol 59, Kimi K3 57 a GPT-5.6 Terra 55.[3][7][8][9][10]

Stručný záver: Muse Spark 1.2 bezvýhradne neporáža Opus 5 ani GPT-5.6 Sol, no cenovo je mimoriadne konkurencieschopný. Najsilnejšie pôsobí ako model pre agentné programovanie, najmä v spojení s Muse Code a tam, kde záleží na nákladoch dlhých relácií.

Všetky dáta v článku boli overené podľa materiálov Meta, oficiálnej metodiky evaluácie, Artificial Analysis a nezávislých tlačových zdrojov. Stav k 7. augustu 2026.

TL;DR

Otázka Overená odpoveď
Kedy bol Muse Spark 1.2 vydaný? 5. augusta 2026
Kto vytvoril model? Meta
Čo je Muse Code? Terminálový programovací agent v beta verzii
Má Muse Spark 1.2 otvorené váhy? Nie, model je proprietary
Poznáme počet parametrov? Nie, Meta ho verejne neuviedla
Kontext 1 milión tokenov
Modality text a obraz na vstupe, text na výstupe
Štandardná cena input 1,25 USD / 1 mil. tokenov
Cena cached input 0,15 USD / 1 mil. tokenov
Cena output 4,25 USD / 1 mil. tokenov
Terminal-Bench 2.1 podľa Meta 82,9 %
DeepSWE 1.1 podľa Meta 59,3 %
Meta Internal Coding Bench 70,6 %
Aktuálny AA Intelligence Index v4.1.1 57
AA Index v článku z dňa vydania 54
Sú výsledky Meta nezávislé? Nie, časť tvoria evaluácie výrobcu
Je Artificial Analysis nezávislá od Meta? Áno, hoci Meta poskytla prístup pred vydaním na benchmarky
Najsilnejšia oblasť agentné programovanie a pomer schopností k cene
Hlavné obmedzenie nevyhráva všetky benchmarky a časť testov používa rozdielne agent harnessy

1. Čo presne Meta vydala?

Vydanie zahŕňa dva prepojené produkty:

Muse Spark 1.2
model

Muse Code
terminálový programovací agent

Meta opisuje Muse Spark 1.2 ako aktualizáciu Muse Spark 1.1 zameranú na coding. Zvýšila compute použitý pri tréningu na programovacích úlohách a rozšírila rozmanitosť tréningových prostredí.[1]

Muse Code je agent, ktorý dokáže:

  • plánovať zmeny v repozitári,
  • písať kód,
  • spúšťať nástroje,
  • validovať výsledky,
  • koordinovať viacero dlhodobo bežiacich subagentov,
  • udržiavať progres počas dlhých relácií.[1]

Inštaláciu oficiálneho klienta na macOS alebo Linux Meta popisuje takto:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 je dostupný cez Muse Code aj Meta Model API. Meta opisuje súčasnú dostupnosť ako široko rozšírenú globálne.[1]

2. Muse Code nie je iba jednoduchý wrapper nad modelom

Pri programovacích agentoch benchmark modelu a benchmark produktu nie sú to isté.

Muse Code pridáva vlastnú exekučnú vrstvu.

Async Background Agents

Hlavný agent môže využívať špecializovaných subagentov, ktorí pokračujú v práci na pozadí. Nevznikajú iba pre jeden krok a môžu zostať aktívni počas celej relácie.[1]

Cieľom je obmedziť:

  • opakované zhromažďovanie rovnakých informácií,
  • latenciu,
  • potrebu manuálneho riadenia,
  • opakovanú analýzu repozitára.

Append-only event log

Muse Code lokálne ukladá históriu:

  • volaní modelu,
  • použitia nástrojov,
  • schválení,
  • úprav.[1]

Meta opisuje runtime ako replay-exact a restart-safe. Po zlyhaní môže agent pokračovať z logu namiesto toho, aby začal úlohu od začiatku.

To je dôležité pri programovacích úlohách trvajúcich niekoľko hodín.

Vstavané skills

Prvá verzia obsahuje okrem iného:

/plan
/grill
/goal

/plan pripraví plán s fázou schválenia, /grill plán kriticky preverí a /goal udržiava prácu smerom k definovanému cieľu.[1]

3. Model a agent boli trénované spoločne

Ide o jednu z najdôležitejších informácií pre interpretáciu benchmarkov.

Meta iba nepripojila nový model k existujúcemu CLI. Firma uvádza co-training Muse Spark 1.2 a Muse Code.[1]

Tréning zahŕňal okrem iného:

  • trajectories z agent harnessu,
  • optimalizácie pre prácu s cieľmi,
  • compaction,
  • subagentov,
  • integrovanú sadu nástrojov Muse Code.[1]

Model bol navyše trénovaný na long-horizon úlohách:

  • generovanie celých repozitárov,
  • veľké end-to-end projekty,
  • auto-research,
  • sekvencovanie práce cez planning,
  • udržiavanie smeru cez goal conditioning,
  • kompresia kontextu.[1]

To pomáha vysvetliť, prečo je niekedy správnou jednotkou porovnania:

Muse Spark 1.2 + Muse Code

a nie iba:

Muse Spark 1.2

4. Self-improvement s využitím Muse Spark 1.1

Meta využila Muse Spark 1.1 na tvorbu tréningových dát pre verziu 1.2.

Podľa oficiálneho popisu predchádzajúci model:

  1. generoval náročné programovacie prostredia,
  2. pripravoval šablóny komplexných inštrukcií,
  3. hodnotil kandidátske riešenia,
  4. pomáhal vytvárať škálovateľný dataset pre Muse Spark 1.2.[1]

Meta tento proces označuje ako self-improvement loop.

Neznamená to, že sa model „sám vytrénoval“. Stále išlo o kontrolovaný tréningový pipeline navrhnutý Meta, kde bol skorší model jedným z prvkov generovania a hodnotenia dát.

5. Oficiálny Terminal-Bench 2.1

Terminal-Bench 2.1 hodnotí agentov vykonávajúcich úlohy v terminálovom prostredí.

Meta použila všetkých 89 úloh z oficiálnej verzie 2.1. Každý beh prebiehal v izolovanom Daytona sandboxe a executable verifier hodnotil konečný stav kontajnera. Výsledok je priemer pass@1 z piatich pokusov.[2]

Výsledky zverejnené Meta

Model + agent Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7 %
Muse Spark 1.2 + Muse Code xhigh 82,9 %
GPT-5.6 Terra + Codex max 81,8 %
Grok 4.5 + Grok Build high 81,6 %
Gemini 3.6 Flash + Antigravity CLI high 78,9 %
Muse Spark 1.1 + mini-swe-agent xhigh 76,2 % [1][2]

Muse Spark 1.2 zlepšuje výsledok predchodcu o 6,7 percentuálneho bodu.

Súčasne:

  • zaostáva za Opus 5 o 3,8 pp,
  • prekonáva GPT-5.6 Terra o 1,1 pp,
  • prekonáva Grok 4.5 o 1,3 pp.

Najdôležitejšia výhrada

Nejde o čistý benchmark samotných modelov.

Porovnávané systémy sú:

model
+
agent
+
nástroje
+
system prompt
+
runtime

Meta používa:

  • Muse Code pre Spark 1.2,
  • Claude Code pre Opus 5,
  • Codex pre GPT-5.6,
  • Grok Build pre Grok 4.5,
  • Antigravity CLI pre Gemini.[2]

Meta sama uvádza, že konfigurácia a system prompts nemuseli byť optimálne naladené pre uzavreté konkurenčné modely.[2]

Správny záver teda znie:

V konfigurácii Meta dosiahol Muse Spark 1.2 + Muse Code 82,9 %.

Nie:

Muse Spark 1.2 je všeobecne lepší než GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 obsahuje 113 úloh z 91 repozitárov v piatich jazykoch:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Každá úloha má ručne pripravený funkčný verifier a regresné testy.

Počas rollout a grading je externý internet zablokovaný. Endpoint modelu zostáva dostupný.[2]

Výsledky Meta

Model + agent DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0 %
GPT-5.6 Terra + Codex 64,8 %
Muse Spark 1.2 + Muse Code 59,3 %
Grok 4.5 + Grok Build 56,6 %
Muse Spark 1.1 + mini-swe-agent 53,0 %
Gemini 3.6 Flash + Antigravity CLI 40,0 % [1][2]

Muse Spark 1.2 zlepšuje 1.1 o 6,3 pp.

Tu je však odstup od lídrov väčší:

Opus 5       65,0 %
GPT-5.6      64,8 %
Muse 1.2     59,3 %

Je to silný výsledok, ale nie prvé miesto.

Ďalšie metodické obmedzenie

Oficiálny leaderboard DeepSWE používa mini-swe-agent pre každý model.

Meta vo svojej evaluácii naopak použila iný agentný produkt pre každý model. Firma sama píše, že výsledok nie je harness-identical s oficiálnym leaderboardom.[2]

Túto informáciu je dôležité uvádzať vedľa 59,3 %.

7. Meta Internal Coding Bench

Meta Internal Coding Bench obsahuje 440 úloh z internej codebase Meta a skutočných pull requestov.[2]

Zahŕňa:

  • opravy chýb,
  • nové funkcie,
  • refactoring,
  • cleanup,
  • ďalšie software-engineering úlohy.

Internet je vypnutý. Riešenia sa kompilujú a kontrolujú unit testami. Meta vykonáva dva pokusy na úlohu.[2]

Výsledky

Model Meta Internal Coding Bench
Claude Opus 5 79,4 %
Muse Spark 1.2 70,6 %
Muse Spark 1.1 68,3 %
GPT-5.6 Terra 65,4 %
Gemini 3.6 Flash 63,9 % [1][2]

Muse Spark 1.2 zlepšuje predchodcu o 2,3 pp.

Prečo má tento benchmark menšiu externú hodnotu?

Nie preto, že musí byť chybný.

Problémom je reprodukovateľnosť.

Dataset:

  • je interný,
  • pochádza z privátnej codebase Meta,
  • nie je verejným benchmarkom, ktorý možno nezávisle reprodukovať.

Výsledok je preto vhodné chápať ako ďalší signál výrobcu, nie ako nezávislý dôkaz prevahy.

8. Nezávislá kontrola: Artificial Analysis

Artificial Analysis dostala od Meta prístup k Muse Spark 1.2 pred verejným vydaním a vykonala vlastnú sadu testov.[4]

To je významné, pretože umožňuje oddeliť:

benchmark výrobcu

od:

benchmark nezávislej organizácie

Dôležitá zmena skóre po vydaní

Článok Artificial Analysis z 5. augusta uvádzal:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

Aktuálna karta modelu po prechode indexu na v4.1.1 ukazuje:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Číslo 54 by sa preto nemalo kopírovať do aktuálneho rebríčka bez uvedenia dátumu.

Benchmarky sa menia v dôsledku:

  • verzií indexu,
  • gradingu,
  • evaluačných sád,
  • metodických opráv.

Produkčný článok by mal vždy uvádzať snapshot.

9. Aktuálne porovnanie Artificial Analysis

Karty modelov kontrolované 7. augusta 2026:

Model AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* Hodnota Grok 4.5 pochádza z publikovanej analýzy Artificial Analysis tohto modelu. Ide o snapshoty príslušných verzií benchmarku, nie trvalé pozície v rebríčku.

Čo z toho vyplýva?

Muse Spark 1.2:

  • aktuálne nedosahuje Opus 5 v celkovom indexe,
  • zostáva 2 body za GPT-5.6 Sol,
  • je na rovnakej úrovni ako Kimi K3 na aktuálnej karte AA,
  • prekonáva GPT-5.6 Terra v celkovom indexe,
  • je nad výsledkom Grok 4.5 z obdobia vydania.

Ale Artificial Analysis Intelligence Index nie je čisto programovací benchmark.

Aktuálna v4.1.1 kombinuje deväť evaluácií, okrem iného:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Skóre 57 je preto vhodné čítať ako širší signál inteligencie a agentných schopností.

10. GDPval-AA v2: najväčšie zlepšenie oproti Spark 1.1

V launch snapshote Artificial Analysis vzrástol GDPval-AA v2 z:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

teda o 260 Elo bodov.[4]

GDPval-AA v2 testuje realistické úlohy znalostnej práce.

Obsahuje 220 úloh z:

  • 44 povolaní,
  • 9 hlavných odvetví americkej ekonomiky.[2]

Modely vytvárajú napríklad:

  • dokumenty,
  • tabuľky,
  • prezentácie,
  • diagramy,
  • reporty.

Artificial Analysis používa vlastný agentic harness Stirrup s prístupom k shellu a webu a výsledky porovnáva párovo pomocou LLM sudcu.[2]

Snapshot z 5. augusta

Artificial Analysis uvádzala:

Model GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

Ide o jeden z najsilnejších signálov, že verzia 1.2 sa zlepšila nielen v generovaní kódu.

GDPval ranking sa aktualizuje, preto tieto hodnoty nemajú byť miešané s neskoršími snapshotmi.

11. Terminal-Bench podľa Artificial Analysis

Meta uvádza:

82,9 %

pre Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis vo vlastnom harness pri vydaní uvádzala:

80 %

oproti:

78 %

pre Muse Spark 1.1.[4]

Tieto výsledky si neodporujú.

Vznikli v:

  • rôznych harnessoch,
  • rôznych konfiguráciách agentov,
  • rôznych exekučných postupoch.

Je to dobrý príklad, prečo sa benchmark nemá publikovať bez metodiky.

12. Halucinácie: číslo vyzerá lepšie, ale treba čítať aj druhú polovicu tabuľky

Artificial Analysis zaznamenala v launch snapshote zlepšenie AA-Omniscience:

18 -> 22

a pokles hallucination rate:

38 % -> 28 %

[4]

Na prvý pohľad to vyzerá jednoznačne pozitívne.

Súčasne však:

attempt rate: 82 % -> 67 %
accuracy:     41 % -> 38 %

[4]

Model častejšie odmietal odpovedať, keď si nebol istý.

AA-Omniscience abstention netrestá. Nižší hallucination rate teda čiastočne vyplýva z väčšej ochoty neodpovedať.

Správna interpretácia:

Muse Spark 1.2 menej často prezentoval chybnú odpoveď ako istú, ale zároveň sa menej často pokúšal odpovedať.

Nesprávna interpretácia:

Muse Spark 1.2 sa stal o 10 percentuálnych bodov presnejším.

Dáta to nepotvrdzujú.

13. Scientific reasoning sa nezlepšil rovnomerne

V meraniach Artificial Analysis pri vydaní:

Benchmark Spark 1.1 Spark 1.2 Zmena
CritPt 15 % 18 % +3 pp
SciCode 58 % 56 % -2 pp
Humanity's Last Exam 45 % 44 % -1 pp [4]

To ukazuje charakter aktualizácie.

Muse Spark 1.2 nie je jednoducho:

Spark 1.1
+ niekoľko percent všade

Najväčšie zisky pri vydaní sa sústredili na:

  • agentné programovanie,
  • používanie nástrojov,
  • profesionálne agentné úlohy.

14. Cena API: jedna z najväčších výhod Muse Spark 1.2

Štandardný cenník Meta:

Tokeny Cena za 1 mil.
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Cena input/output je rovnaká ako pri Muse Spark 1.1.

Porovnanie verejných cien API

Model Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

Ide o porovnanie ceny tokenu, nie ceny dokončenej úlohy.

Lacnejší model za milión tokenov môže:

  • vygenerovať viac tokenov,
  • vykonať viac tool calls,
  • potrebovať viac iterácií,
  • urobiť chybu vyžadujúcu ručnú opravu.

Lepšia business metrika preto je:

cena za správne dokončenú úlohu

a nie iba:

cena za 1M tokenov

15. Cena za úlohu podľa launch merania Artificial Analysis

V snapshote z 5. augusta uvádzala Artificial Analysis váženú priemernú cenu jednej úlohy Intelligence Index:

Model / konfigurácia Cena úlohy
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

To je pre Muse Spark 1.2 veľmi dobrý nákladový výsledok.

Oproti Spark 1.1 však cena vzrástla z:

0,29 USD
na
0,40 USD

Artificial Analysis to spája s vyššou spotrebou tokenov:

  • približne o 53 % viac input tokenov,
  • približne o 36 % viac output tokenov,

najmä v GDPval-AA v2.[4]

Verzia 1.2 je teda:

lepšia
ale
tokenovo náročnejšia

Jednotková cena API sa nezmenila, no agent vykonáva viac práce.

16. Muse Spark 1.2 vs Claude Opus 5

Kde víťazí Opus 5?

V dátach Meta:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7 % 82,9 %
DeepSWE 1.1 65,0 % 59,3 %
Meta Internal Coding Bench 79,4 % 70,6 % [1]

V aktuálnom Artificial Analysis Intelligence Index:

Opus 5:     61
Muse 1.2:   57

[3][7]

Dostupné dáta nedávajú základ označiť Muse Spark 1.2 všeobecne za lepší model.

Kde má výhodu Muse?

Predovšetkým v cene tokenov:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

Pri agentoch vykonávajúcich tisíce operácií môže byť rozdiel výrazný.

Záver

Opus 5 je vhodnejší, keď:

  • maximálna úspešnosť je dôležitejšia než cena tokenov,
  • úloha je náročná a chyba drahá,
  • tím už používa Claude Code.

Muse Spark 1.2 dáva väčší zmysel, keď:

  • je vysoký objem úloh,
  • agent dlho pracuje nad repozitárom,
  • náklady na tokeny sú zásadné,
  • niekoľko benchmarkových bodov neospravedlňuje oveľa drahšie API.

17. Muse Spark 1.2 vs GPT-5.6 Terra

Ide o jedno z najzaujímavejších porovnaní.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9 %
Terra + Codex:         81,8 %

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3 %
Terra + Codex:         64,8 %

Meta Internal Coding Bench

Muse 1.2:  70,6 %
Terra:     65,4 %

[1]

Líder sa mení podľa benchmarku.

Artificial Analysis

Aktuálny celkový index:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Cena

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Neznamená to automatickú výhru Muse. Terra je v DeepSWE v porovnaní Meta jasne silnejšia.

Najférovšia interpretácia:

Muse Spark 1.2 je voči GPT-5.6 Terra mimoriadne konkurencieschopný cenou a v časti agentných úloh, no výsledok závisí od typu úlohy a harnessu.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol zostáva silnejší v širšom indexe Artificial Analysis:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol stojí:

5 USD / 1M input
30 USD / 1M output

oproti:

1,25 USD / 1M input
4,25 USD / 1M output

pri Muse.[3][8]

To je veľký rozdiel pre:

  • dlhé reasoning traces,
  • subagentov,
  • iteratívny debugging,
  • repo-wide refactoring,
  • niekoľkohodinové agent runs.

Ak sa dodatočné 2 body v celkovom indexe nepremietnu do vyššej miery správne dokončených úloh v reálnej firme, drahší model nemusí byť ekonomickejší.

19. Muse Spark 1.2 vs Kimi K3

Aktuálna karta Artificial Analysis ukazuje:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

To neznamená rovnaké schopnosti.

Hlavný rozdiel

Kimi K3:

  • má verejne dostupné váhy,
  • dá sa self-hostovať,
  • má 2,8 bilióna celkových parametrov a 104 miliárd aktívnych,
  • používa vlastnú Kimi K3 License.[10]

Muse Spark 1.2:

  • je proprietary,
  • beží cez Meta Model API,
  • nemá verejne známy počet parametrov.[3]

Ceny oficiálnych API

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Ak self-hosting nie je požiadavkou, Muse je v nominálnej cene API výrazne lacnejší.

Ak organizácia potrebuje:

  • vlastnú infraštruktúru,
  • kontrolu nad váhami,
  • vlastné úpravy modelu,

Kimi K3 ponúka možnosť, ktorú Muse Spark 1.2 zatiaľ nemá.

20. Muse Spark 1.2 vs Grok 4.5

V Meta Terminal-Bench:

Muse Spark 1.2 + Muse Code: 82,9 %
Grok 4.5 + Grok Build:      81,6 %

V DeepSWE:

Muse Spark 1.2: 59,3 %
Grok 4.5:        56,6 %

[1]

V Artificial Analysis Intelligence Index pri uvedení mal Grok 4.5 skóre 54, teda podobné launch snapshotu Muse 1.2 pred aktualizáciou indexu.[4][11]

Artificial Analysis tiež uvádzala Grok 4.5 high ako jeden z mála modelov s nižšou cenou za úlohu v rovnakom kvalitatívnom clusteri:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

Je to ďalší príklad, že pomer cena-výkon v roku 2026 už nefunguje podľa jednoduchého pravidla:

najdrahší model
=
najvýhodnejší model

21. Optimalizácia kernelov: viac ako 1 000 tool calls a až 24 hodín práce

Meta vykonala zaujímavý long-horizon experiment.

Muse Code a modely mali iteratívne optimalizovať GPU kernels pomocou:

  • viac ako 1 000 tool calls,
  • až 24 hodín,
  • písania kódu,
  • kompilácie,
  • profilovania,
  • opakovaných optimalizácií.[1]

Testovali sa KDA a MLA na NVIDIA Hopper.

KDA

Baseline bola FLA implementácia v Tritone. Modely nesmeli priamo importovať externé kernel knižnice ako FLA.[1]

V grafe konečného speedupu oproti baseline Meta ukázala okrem iného:

Model Speedup vs baseline
Claude Opus 5 +74,0 %
GPT-5.6 Sol +71,2 %
Claude Opus 4.8 +69,6 %
Muse Spark 1.2 +68,7 %
GPT-5.6 Terra +65,1 %
Gemini 3.6 Flash +62,5 % [1]

Muse Spark 1.2 tento experiment nevyhral.

Je to dôležité, pretože oficiálny materiál Meta nepredstavuje vlastný model ako lídra v každej kategórii.

Čo tento experiment nedokazuje?

Nedokazuje, že:

  • Opus 5 vždy optimalizuje kód o 74 %,
  • Muse vždy prinesie +68,7 %,
  • výsledky platia pre každý kernel alebo GPU.

Ide o case study konkrétnej úlohy, baseline, harnessu a hardvéru.

22. Dlhý kontext: 1 milión tokenov

Artificial Analysis potvrdzuje pre Muse Spark 1.2:

1M token context window

a:

  • text input,
  • image input,
  • text output.[3]

Milión tokenov môže byť dôležitý pre:

  • veľké repozitáre,
  • monorepá,
  • dokumentáciu,
  • dlhú históriu agenta,
  • analýzu mnohých súborov.

Neznamená to, že by sa mal celý repozitár vložiť do jedného promptu.

Maximálna kapacita nezaručuje:

  • nájdenie všetkých závislostí,
  • správne prioritizovanie,
  • odolnosť voči škodlivému textu v repozitári,
  • rovnakú kvalitu na začiatku a konci kontextu.

Muse Code preto používa aj context compaction, nie iba stále väčšie prompty.[1]

23. Prečo je aktuálne AA skóre 57, keď launch články môžu uvádzať 54?

Nejde o chybu, ktorú by bolo treba skrývať.

Artificial Analysis publikovala 5. augusta skóre 54.[4]

Aktuálna karta Muse Spark 1.2 kontrolovaná 7. augusta ukazuje 57 a uvádza ako súčasnú verziu Artificial Analysis Intelligence Index v4.1.1.[3]

Pri citovaní benchmarkov je preto vhodné uchovávať:

model
+
effort
+
verziu benchmarku
+
dátum

Napríklad:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stav: 7. augusta 2026

Je to výrazne lepšie než napísať:

Muse Spark 1.2 má 57 bodov

bez kontextu.

24. Standard tier vs Contributor tier: dôležitý rozdiel pre súkromie

Štandardná cena Muse Spark 1.2 je:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta ponúka aj výrazne zľavnený Contributor tier.

Nezávislé tlačové správy opisujúce oficiálnu ponuku uvádzajú, že nižšia cena je spojená so súhlasom, aby aktivita používateľa mohla byť využitá na zlepšovanie produktov Meta.[6]

Pre podnikové použitie je to dôležitý rozdiel.

Pred použitím Contributor tier pre kód, ktorý je:

  • súkromný,
  • pod NDA,
  • obsahuje obchodné tajomstvá,
  • patrí klientovi,

je nutné overiť presné podmienky spracovania dát platné pre účet a endpoint.

Lacnejší endpoint sa nemá voliť iba podľa ceny.

25. Je Muse Spark 1.2 najlepší model pre programovanie?

Podľa overených dát: nie je dôvod to tvrdiť.

Nevedie všetky benchmarky Meta

Opus 5 vedie v:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra je pred Muse aj v DeepSWE.

Cenovo je však Muse mimoriadne silný

Muse Spark 1.2 má výrazne nižšiu cenu outputu než:

Najlepšie obhájiteľné tvrdenie

Muse Spark 1.2 je jeden z najzaujímavejších modelov roku 2026 z hľadiska pomeru agentic-coding schopností k cene. Opus 5 zostáva silnejší v dostupných kvalitativných porovnaniach a konečný výber by mal vychádzať z vlastného POC.

26. Ktorý model vybrať?

Vyberte Muse Spark 1.2, ak:

  • náklady dlhých relácií sú veľmi dôležité,
  • pracujete s veľkými repozitármi,
  • chcete používať Muse Code,
  • agent má dlho pracovať bez manuálneho vedenia,
  • potrebujete persistent subagentov,
  • nominálna cena outputu musí byť nízka,
  • výkon blízko frontier stačí pre daný workflow.

Vyberte Claude Opus 5, ak:

  • maximálna úspešnosť je prioritou,
  • cena chyby prevyšuje cenu tokenov,
  • používate Claude Code,
  • úlohy sú mimoriadne náročné,
  • váš POC potvrdzuje vyššiu completion rate.

Vyberte GPT-5.6 Terra, ak:

  • používate ekosystém Codex,
  • DeepSWE-like úlohy sú zásadné,
  • potrebujete silný coding model lacnejší než Sol,
  • nástroje OpenAI sú súčasťou pipeline.

Vyberte GPT-5.6 Sol, ak:

  • potrebujete vyššie všeobecné schopnosti než Muse,
  • cena API je menej dôležitá,
  • workload zahŕňa širší reasoning než samotný coding.

Vyberte Kimi K3, ak:

  • potrebujete otvorené váhy,
  • plánujete self-hosting,
  • potrebujete vlastné modifikácie modelu,
  • môžete akceptovať vyššiu cenu oficiálneho API.

Zvážte Grok 4.5, ak:

  • vlastné testy ukazujú silné agentné výsledky,
  • cena za dokončenú úlohu je kľúčová metrika,
  • používate Grok Build alebo kompatibilný harness.

27. Ako urobiť férový POC

Netestujte modely na piatich promptoch.

Pripravte aspoň:

50-200 reálnych úloh

z vlastného repozitára.

Kategórie

  • bug fix,
  • nová funkcia,
  • refactoring,
  • testy,
  • code review,
  • migrácia dependency,
  • performance optimization,
  • analýza logov,
  • frontend zo screenshotu,
  • repo-wide zmena,
  • technická dokumentácia.

Pri každej úlohe merajte

úspech / neúspech
čas
cenu
počet tokenov
počet tool calls
ručné zásahy
regresie

Najdôležitejšia metrika

Nie:

ktorý model napísal krajšiu odpoveď?

Ale:

ktorý model najčastejšie dodal správny, merge-ready výsledok
za prijateľnú cenu a čas?

28. Ako porovnávať agentov, nielen modely

Pri:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build

model nepracuje izolovane.

Agent rozhoduje:

  • ktoré súbory čítať,
  • kedy spustiť testy,
  • kedy použiť grep,
  • či použiť subagenta,
  • ako spravovať kontext,
  • koľko iterácií vykonať,
  • kedy prácu ukončiť.

Preto je vhodné vykonať dva testy.

Test A: model v spoločnom harnessu

rovnaký agent
rovnaké nástroje
rovnaký system prompt
rovnaké limity

Pomáha porovnať samotné modely.

Test B: end-to-end produkt

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Pomáha odpovedať na praktickú otázku:

Ktoré riešenie je najlepšie pre tím?

Oba testy merajú niečo iné.

29. Produkčný checklist Muse Spark 1.2

Benchmarky

  • Je uložená verzia benchmarku.
  • Je uložený dátum skóre.
  • Je uložený reasoning effort.
  • Je uložený názov agenta.
  • Meta Terminal-Bench sa nemieša s výsledkom AA.
  • Meta Internal Coding Bench sa nepovažuje za nezávislý benchmark.
  • Výsledky sú overené na vlastnom repozitári.

Náklady

  • Meria sa skutočný input.
  • Meria sa cached input.
  • Meria sa output.
  • Meria sa cena reasoning.
  • Meria sa počet tool calls.
  • Cena sa počíta za dokončenú úlohu.
  • Porovnávajú sa najmenej tri modely.
  • Je nastavený limit výdavkov na agenta.

Repozitár

  • Agent má minimálne potrebné oprávnenia.
  • Secrets nie sú v ľahko dostupných súboroch.
  • Prístup do produkcie vyžaduje schválenie.
  • Merge vyžaduje review.
  • Testy sa spúšťajú automaticky.
  • Agent nemôže obísť branch protection.
  • Zmeny a tool calls sa logujú.

Dáta

  • Overené podmienky Standard tier.
  • Overené podmienky Contributor tier.
  • Kód klienta nejde na nesprávny endpoint.
  • Firemná politika povoľuje zvolenú službu.
  • Sú nastavené zásady retencie promptov a logov.
  • Osobné údaje sú správne chránené.

Kvalita

  • Agent po zmenách spúšťa testy.
  • Kontroluje sa finálny diff.
  • Merajú sa regresie.
  • Dlhé úlohy majú checkpointy.
  • Testuje sa obnovenie po chybe.
  • Testujú sa veľké monorepá.
  • Testujú sa niekoľkohodinové úlohy.

30. Verdikt POLPROG

Muse Spark 1.2 je významnejšie vydanie, než naznačuje číslo 1.2.

Meta vytvorila model a Muse Code ako prepojený systém a zamerala tréning na:

  • veľké repozitáre,
  • dlhé úlohy,
  • nástroje,
  • subagentov,
  • plánovanie,
  • automatickú verifikáciu.

Výsledky potvrdzujú skutočné zlepšenie oproti Muse Spark 1.1.

Najsilnejšie fakty

Terminal-Bench 2.1
76,2 % -> 82,9 % v evaluácii Meta

DeepSWE 1.1
53,0 % -> 59,3 % v evaluácii Meta

GDPval-AA v2
1371 -> 1631 Elo v launch snapshote Artificial Analysis

[1][4]

Stále však nie je lídrom všetkého

Opus 5 prekonáva Muse Spark 1.2 vo všetkých troch coding benchmarkoch zobrazených Meta.

V aktuálnom snapshote Artificial Analysis:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Prečo je teda Muse Spark 1.2 zaujímavý?

Pretože stojí:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

Tým sa stáva menej užitočnou otázka:

Ktorý model má najvyšší benchmark?

Lepšia otázka je:

Ktorý model dodá najväčší počet správne dokončených úloh za 100 USD rozpočtu?

Pre mnohé tímy môže byť odpoveď iná než model na prvom mieste jednej tabuľky.

Muse Spark 1.2 teraz pôsobí ako veľmi silný kandidát pre agentné programovanie vo veľkom meradle s kontrolovanými nákladmi.

Nie je bezvýhradným víťazom.

Rozhodne však patrí do POC spolu s:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 je významnejšie vydanie, než naznačuje číslo 1.2. Výsledky potvrdzujú skutočné zlepšenie oproti Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Často kladené otázky

Kedy bol Muse Spark 1.2 vydaný?

Meta predstavila Muse Spark 1.2 a Muse Code 5. augusta 2026.

Je Muse Spark 1.2 open source?

Nie. Artificial Analysis ho klasifikuje ako proprietary model a váhy nie sú verejne dostupné.

Koľko parametrov má Muse Spark 1.2?

Meta počet parametrov verejne neuviedla.

Aký veľký je kontext?

1 milión tokenov.

Podporuje obrázky?

Áno. Artificial Analysis potvrdzuje text + image input a text output.

Koľko stojí API?

Štandardne 1,25 USD za milión input tokenov, 0,15 USD za milión cached input tokenov a 4,25 USD za milión output tokenov.

Je Muse Spark 1.2 lepší než Claude Opus 5?

Nie podľa dostupných všeobecných benchmarkov a porovnaní Meta. Opus 5 vedie v troch coding benchmarkoch Meta a má vyšší aktuálny Artificial Analysis Intelligence Index.

Je Muse Spark 1.2 lepší než GPT-5.6 Terra?

Závisí od úlohy. Muse vedie v Meta Terminal-Bench a Meta Internal Coding Bench, Terra v DeepSWE 1.1. Aktuálny celkový AA Intelligence Index je vyšší pre Muse.

Je Muse Spark 1.2 lepší než Kimi K3?

Aktuálny Artificial Analysis Intelligence Index dáva obom modelom 57. Kimi K3 má otvorené váhy, Muse je proprietary. Ich profil aj cena sa líšia.

Prečo možno na internete nájsť 54, zatiaľ čo tu je 57?

54 pochádza z článku Artificial Analysis z dňa vydania. Aktuálna karta po prechode na v4.1.1 ukazuje 57. Pri benchmarkoch treba vždy uvádzať verziu a dátum.

Je 82,9 % v Terminal-Bench nezávislý výsledok?

Nie. Ide o výsledok zverejnený Meta pre Muse Spark 1.2 + Muse Code podľa metodiky Meta.

Meria Artificial Analysis Terminal-Bench inak?

Áno. V launch snapshote AA dosiahol Muse Spark 1.2 80 %. Rozdiel vychádza okrem iného z iného harnessu.

Dokáže Muse Code pokračovať po zlyhaní?

Meta opisuje lokálny append-only event log, vďaka ktorému je runtime restart-safe a dokáže rekonštruovať stav práce.

Je Muse Spark 1.2 globálne dostupný?

Meta v oznámení uvádza dostupnosť Muse Spark 1.2 cez Muse Code a Meta Model API s rozšíreným globálnym prístupom.

Oplatí sa migrovať z Muse Spark 1.1?

Dáta Meta a Artificial Analysis ukazujú jasné zlepšenie v agentic coding a GDPval. Migráciu však treba overiť na vlastných workloadoch, pretože 1.2 pri niektorých úlohách spotrebuje viac tokenov. ---

Zdroje a poznámky

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

Bolo to užitočné?

Získavajte nové články e-mailom

Jeden krátky e-mail na každý nový článok Vzdelávania. Žiadny spam, odhlásenie jedným kliknutím.

Váš e-mail používame len na zasielanie nových článkov. Žiadne zdieľanie s tretími stranami.

Späť na Vzdelávanie