Muse Spark 1.2 i Muse Code: benchmarki, ceny i porównanie z Claude Opus 5, GPT-5.6, Kimi K3 i Grok 4.5 Skip to content

Muse Spark 1.2 i Muse Code: benchmarki, ceny i porównanie z Claude Opus 5, GPT-5.6, Kimi K3 i Grok 4.5

5 sierpnia 2026 roku Meta zaprezentowała Muse Spark 1.2 oraz Muse Code, terminalowego agenta programistycznego dostępnego w wersji beta. Muse Spark 1.2 jest aktualizacją skupioną przede wszystkim na programowaniu, złożonym debugowaniu, rozumieniu dużych baz kodu i realizowaniu wieloetapowych zadań programistycznych od początku do końca.

Opublikowano Autor Czas czytania 24 min czytania
X LinkedIn

5 sierpnia 2026 roku Meta zaprezentowała Muse Spark 1.2 oraz Muse Code, terminalowego agenta programistycznego dostępnego w wersji beta. Muse Spark 1.2 jest aktualizacją skupioną przede wszystkim na programowaniu, złożonym debugowaniu, rozumieniu dużych baz kodu i realizowaniu wieloetapowych zadań programistycznych od początku do końca.

Na tej stronie
  1. 1TL;DR
  2. 21. Co dokładnie wydała Meta?
  3. 32. Muse Code nie jest tylko prostym wrapperem na model
  4. 43. Model i agent były trenowane razem
  5. 54. Self-improvement z wykorzystaniem Muse Spark 1.1
  6. 65. Oficjalny Terminal-Bench 2.1
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Independent check: Artificial Analysis
  10. 109. Aktualne porównanie Artificial Analysis
  11. 1110. GDPval-AA v2: największa poprawa względem Spark 1.1
  12. 1211. Terminal-Bench według Artificial Analysis
  13. 1312. Hallucynacje: wynik wygląda lepiej, ale trzeba przeczytać drugą połowę tabeli
  14. 1413. Scientific reasoning nie poprawił się równomiernie
  15. 1514. Cena API: jeden z największych atutów Muse Spark 1.2
  16. 1615. Koszt zadania według premierowego pomiaru Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Kernel optimization: ponad 1000 tool calls i nawet 24 godziny pracy
  23. 2322. Długi kontekst: 1 milion tokenów
  24. 2423. Dlaczego aktualny wynik AA to 57, a w artykułach premierowych można zobaczyć 54?
  25. 2524. Standard tier a Contributor tier: ważna różnica dla prywatności
  26. 2625. Czy Muse Spark 1.2 jest najlepszym modelem do programowania?
  27. 2726. Który model wybrać?
  28. 2827. Jak zrobić uczciwy POC?
  29. 2928. Jak porównywać agentów, a nie tylko modele?
  30. 3029. Produkcyjna checklista Muse Spark 1.2
  31. 3130. Werdykt POLPROG

Model nie został wydany z otwartymi wagami. Artificial Analysis klasyfikuje Muse Spark 1.2 jako model proprietary, a liczba parametrów nie została publicznie ujawniona.[3]

Najbardziej interesująca część premiery nie polega jednak na samej nazwie modelu. Meta trenowała Muse Spark 1.2 razem z Muse Code i zoptymalizowała model pod rzeczywiste środowisko agentowe: planowanie, kompresję kontekstu, subagentów, korzystanie z narzędzi oraz długie zadania obejmujące całe repozytoria.[1]

Wyniki są mocne, ale wymagają ostrożnej interpretacji.

W oficjalnym teście Meta:

  • Muse Spark 1.2 + Muse Code osiąga 82,9% w Terminal-Bench 2.1,
  • 59,3% w DeepSWE 1.1,
  • 70,6% w Meta Internal Coding Bench.[1][2]

Nie oznacza to jednak, że Muse Spark 1.2 jest najlepszym modelem programistycznym na rynku. W tych samych tabelach Claude Opus 5 + Claude Code zajmuje pierwsze miejsce we wszystkich trzech zestawieniach. Dodatkowo Meta sama zaznacza, że porównanie nie jest idealnie model-do-modelu: każdy model był uruchamiany z innym agentem, a konfiguracja testowa mogła być lepiej dopasowana do Muse Code niż do narzędzi konkurencji.[2]

Niezależny obraz daje Artificial Analysis. W aktualnej karcie modelu z 7 sierpnia Muse Spark 1.2 przy xhigh osiąga 57 punktów w Artificial Analysis Intelligence Index v4.1.1. Dla porównania Claude Opus 5 ma 61, GPT-5.6 Sol 59, Kimi K3 57, a GPT-5.6 Terra 55.[3][7][8][9][10]

Najkrótszy wniosek: Muse Spark 1.2 nie pokonuje bezwarunkowo Opus 5 ani GPT-5.6 Sol, ale jest wyjątkowo konkurencyjny cenowo. Najmocniej wygląda jako model do agentowego programowania, szczególnie gdy pracuje z Muse Code i gdy koszt długich sesji ma duże znaczenie.

Wszystkie dane w artykule zostały zweryfikowane na podstawie materiałów Meta, oficjalnej metodologii ewaluacji, Artificial Analysis oraz niezależnych informacji prasowych. Stan na 7 sierpnia 2026 roku.

TL;DR

Pytanie Zweryfikowana odpowiedź
Kiedy wydano Muse Spark 1.2? 5 sierpnia 2026
Kto stworzył model? Meta
Czym jest Muse Code? Terminalowy agent programistyczny w wersji beta
Czy Muse Spark 1.2 ma otwarte wagi? Nie, model jest proprietary
Czy znamy liczbę parametrów? Nie, Meta jej publicznie nie podała
Kontekst 1 mln tokenów
Modalności tekst i obraz na wejściu, tekst na wyjściu
Cena standardowa input 1,25 USD / 1 mln tokenów
Cena cached input 0,15 USD / 1 mln tokenów
Cena output 4,25 USD / 1 mln tokenów
Terminal-Bench 2.1 wg Meta 82,9%
DeepSWE 1.1 wg Meta 59,3%
Meta Internal Coding Bench 70,6%
Aktualny AA Intelligence Index v4.1.1 57
AA Index w artykule z dnia premiery 54
Czy wyniki Meta są niezależne? Nie, część to ewaluacje producenta
Czy Artificial Analysis jest niezależne od Meta? Tak, choć Meta udostępniła model AA przed premierą do benchmarków
Najmocniejsza cecha agentowe programowanie i relacja możliwości do ceny
Najważniejsze ograniczenie nie wygrywa wszystkich benchmarków i część testów używa różnych agent harnessów

1. Co dokładnie wydała Meta?

Premiera obejmuje dwa powiązane produkty:

Muse Spark 1.2
model

Muse Code
terminalowy agent programistyczny

Meta opisuje Muse Spark 1.2 jako aktualizację Muse Spark 1.1 skupioną na kodowaniu. Zwiększono ilość compute wykorzystanego podczas treningu na zadaniach programistycznych oraz rozszerzono różnorodność środowisk treningowych.[1]

Muse Code jest natomiast agentem, który potrafi:

  • planować zmiany w repozytorium,
  • pisać kod,
  • uruchamiać narzędzia,
  • walidować wyniki,
  • koordynować kilka długotrwałych subagentów,
  • utrzymywać postęp przez długie sesje.[1]

Instalacja oficjalnego klienta na macOS lub Linux została opisana przez Meta następująco:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 jest dostępny zarówno przez Muse Code, jak i Meta Model API. Meta określa obecną dostępność jako rozszerzoną globalnie.[1]

2. Muse Code nie jest tylko prostym wrapperem na model

W przypadku agentów programistycznych benchmark modelu i benchmark produktu nie są tym samym.

Muse Code dodaje własną warstwę wykonawczą.

Async Background Agents

Agent główny może korzystać z wyspecjalizowanych subagentów działających w tle. Nie są one tworzone wyłącznie na pojedynczy krok, lecz mogą pozostawać aktywne przez całą sesję.[1]

Ma to ograniczać:

  • wielokrotne zbieranie tych samych informacji,
  • opóźnienia,
  • konieczność ręcznego kierowania agentem,
  • powtarzanie analizy repozytorium.

Append-only event log

Muse Code zapisuje lokalnie historię:

  • wywołań modelu,
  • użycia narzędzi,
  • zatwierdzeń,
  • edycji.[1]

Meta opisuje runtime jako replay-exact i restart-safe. Po awarii agent może wznowić działanie na podstawie dziennika zamiast rozpoczynać zadanie od początku.

To istotna funkcja przy wielogodzinnych zadaniach programistycznych.

Wbudowane skills

W premierowej wersji dostępne są między innymi:

/plan
/grill
/goal

/plan przygotowuje plan z etapem zatwierdzenia, /grill ma krytycznie sprawdzać plan, a /goal prowadzić pracę w kierunku określonego celu.[1]

3. Model i agent były trenowane razem

To jedna z najważniejszych informacji dla interpretacji benchmarków.

Meta nie tylko podłączyła nowy model do istniejącego CLI. Firma deklaruje co-training Muse Spark 1.2 i Muse Code.[1]

Trening obejmował między innymi:

  • trajectories z agent harness,
  • optymalizacje pod pracę z celami,
  • compaction,
  • subagentów,
  • zintegrowany zestaw narzędzi Muse Code.[1]

Model trenowano również na zadaniach długiego horyzontu:

  • generowaniu całych repozytoriów,
  • dużych projektach end-to-end,
  • auto-research,
  • sekwencjonowaniu pracy przez planning,
  • utrzymywaniu kierunku przez goal conditioning,
  • kompresji kontekstu.[1]

To pomaga wyjaśnić, dlaczego właściwą jednostką porównania jest czasami:

Muse Spark 1.2 + Muse Code

a nie wyłącznie:

Muse Spark 1.2

4. Self-improvement z wykorzystaniem Muse Spark 1.1

Meta wykorzystała Muse Spark 1.1 do budowania danych treningowych dla wersji 1.2.

Według oficjalnego opisu wcześniejszy model:

  1. generował trudne środowiska programistyczne,
  2. przygotowywał szablony złożonych instrukcji,
  3. oceniał rozwiązania kandydackie,
  4. pomagał tworzyć skalowalny dataset dla Muse Spark 1.2.[1]

Meta określa ten proces jako self-improvement loop.

Nie oznacza to, że model „sam się wytrenował”. Nadal mamy do czynienia z kontrolowanym pipeline'em treningowym przygotowanym przez Meta, w którym wcześniejszy model był jednym z elementów generowania i oceny danych.

5. Oficjalny Terminal-Bench 2.1

Terminal-Bench 2.1 bada agentów wykonujących zadania w środowisku terminalowym.

Meta użyła wszystkich 89 zadań oficjalnego wydania 2.1. Każda próba odbywała się w izolowanym sandboxie Daytona, a końcowy stan kontenera oceniał executable verifier. Wynik jest średnią pass@1 z pięciu prób.[2]

Wyniki opublikowane przez Meta

Model + agent Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7%
Muse Spark 1.2 + Muse Code xhigh 82,9%
GPT-5.6 Terra + Codex max 81,8%
Grok 4.5 + Grok Build high 81,6%
Gemini 3.6 Flash + Antigravity CLI high 78,9%
Muse Spark 1.1 + mini-swe-agent xhigh 76,2% [1][2]

Muse Spark 1.2 poprawia wynik poprzednika o 6,7 punktu procentowego.

Jednocześnie:

  • przegrywa z Opus 5 o 3,8 pp,
  • wyprzedza GPT-5.6 Terra o 1,1 pp,
  • wyprzedza Grok 4.5 o 1,3 pp.

Najważniejsze zastrzeżenie

To nie jest czysty benchmark samych modeli.

Porównywane zestawy to:

model
+
agent
+
narzędzia
+
system prompt
+
runtime

Meta używa:

  • Muse Code dla Spark 1.2,
  • Claude Code dla Opus 5,
  • Codex dla GPT-5.6,
  • Grok Build dla Grok 4.5,
  • Antigravity CLI dla Gemini.[2]

Sama Meta zaznacza, że konfiguracja i system prompts mogły nie być optymalnie dostrojone pod zamknięte modele konkurencji.[2]

Dlatego prawidłowy wniosek brzmi:

W konfiguracji Meta, Muse Spark 1.2 + Muse Code osiągnął 82,9%.

Nie:

Muse Spark 1.2 jest bezwarunkowo lepszy od GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 zawiera 113 zadań z 91 repozytoriów i obejmuje pięć języków:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Każde zadanie posiada ręcznie przygotowany verifier funkcjonalny i testy regresji.

Podczas rollout i grading zewnętrzny internet jest zablokowany. Dostępny pozostaje endpoint modelu.[2]

Wyniki Meta

Model + agent DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0%
GPT-5.6 Terra + Codex 64,8%
Muse Spark 1.2 + Muse Code 59,3%
Grok 4.5 + Grok Build 56,6%
Muse Spark 1.1 + mini-swe-agent 53,0%
Gemini 3.6 Flash + Antigravity CLI 40,0% [1][2]

Muse Spark 1.2 poprawia wynik 1.1 o 6,3 pp.

Tutaj dystans do liderów jest jednak większy:

Opus 5       65,0%
GPT-5.6      64,8%
Muse 1.2     59,3%

To mocny rezultat, ale nie pierwsze miejsce.

Dodatkowe ograniczenie metodologiczne

Oficjalny leaderboard DeepSWE używa mini-swe-agent dla każdego modelu.

Meta w swojej ewaluacji użyła natomiast osobnego produktu agenta dla każdego modelu. Firma sama pisze, że wynik nie jest harness-identical z oficjalnym leaderboardem.[2]

To bardzo ważna informacja, która powinna pojawiać się obok wyniku 59,3%.

7. Meta Internal Coding Bench

Meta Internal Coding Bench zawiera 440 zadań pochodzących z wewnętrznego codebase Meta i rzeczywistych pull requestów.[2]

Obejmuje:

  • naprawy błędów,
  • nowe funkcje,
  • refaktoryzację,
  • cleanup,
  • inne zadania software engineering.

Internet jest wyłączony. Rozwiązania są kompilowane i sprawdzane testami jednostkowymi. Meta wykonuje dwie próby na zadanie.[2]

Wyniki

Model Meta Internal Coding Bench
Claude Opus 5 79,4%
Muse Spark 1.2 70,6%
Muse Spark 1.1 68,3%
GPT-5.6 Terra 65,4%
Gemini 3.6 Flash 63,9% [1][2]

Muse Spark 1.2 poprawia wynik poprzednika o 2,3 pp.

Dlaczego ten benchmark ma mniejszą wartość zewnętrzną?

Nie dlatego, że musi być błędny.

Problemem jest reprodukowalność.

Dataset:

  • jest wewnętrzny,
  • pochodzi z prywatnego codebase Meta,
  • nie jest publicznym benchmarkiem możliwym do samodzielnego odtworzenia.

Dlatego ten wynik należy traktować jako dodatkowy sygnał od producenta, nie jako niezależny dowód przewagi nad konkurencją.

8. Independent check: Artificial Analysis

Artificial Analysis otrzymało od Meta dostęp do Muse Spark 1.2 przed publiczną premierą i wykonało własny zestaw testów.[4]

To istotne, ponieważ pozwala oddzielić:

benchmark producenta

od:

benchmark niezależnej organizacji

Ważna zmiana wyniku po premierze

Artykuł Artificial Analysis opublikowany 5 sierpnia podawał:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

Aktualna karta modelu, po przejściu indeksu na v4.1.1, pokazuje:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Nie należy więc kopiować liczby 54 do aktualnego rankingu bez daty.

Benchmarki żyją. Zmieniają się:

  • wersje indeksu,
  • grading,
  • zestawy ewaluacji,
  • poprawki metodologiczne.

W artykule produkcyjnym należy zawsze wskazać snapshot.

9. Aktualne porównanie Artificial Analysis

Stan kart modeli sprawdzony 7 sierpnia 2026:

Model AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* Wynik Grok 4.5 pochodzi z opublikowanego zestawienia Artificial Analysis dotyczącego tego modelu. Wartości należy traktować jako stan odpowiednich wersji benchmarku, a nie wieczne pozycje w rankingu.

Co z tego wynika?

Muse Spark 1.2:

  • nie dogania obecnie Opus 5 w ogólnym indeksie,
  • pozostaje 2 punkty za GPT-5.6 Sol,
  • jest na poziomie Kimi K3 w aktualnej karcie AA,
  • wyprzedza GPT-5.6 Terra w ogólnym indeksie,
  • znajduje się powyżej premierowego wyniku Grok 4.5.

Ale Artificial Analysis Intelligence Index nie jest benchmarkiem wyłącznie programistycznym.

Aktualna wersja v4.1.1 łączy dziewięć ewaluacji, między innymi:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Dlatego wynik 57 należy czytać jako szerszy sygnał inteligencji i zdolności agentowych.

10. GDPval-AA v2: największa poprawa względem Spark 1.1

W snapshotcie Artificial Analysis z dnia premiery wynik GDPval-AA v2 wzrósł:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

czyli o 260 punktów Elo.[4]

GDPval-AA v2 sprawdza realistyczne zadania pracy wiedzy.

Zawiera 220 zadań z:

  • 44 zawodów,
  • 9 głównych branż amerykańskiej gospodarki.[2]

Modele tworzą między innymi:

  • dokumenty,
  • arkusze kalkulacyjne,
  • prezentacje,
  • diagramy,
  • raporty.

Artificial Analysis używa własnego agentic harness Stirrup z dostępem do shell i przeglądania internetu, a rezultaty są porównywane parami przez sędziego LLM.[2]

Snapshot z 5 sierpnia

Artificial Analysis podawało wtedy:

Model GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

To jeden z najmocniejszych argumentów za tym, że 1.2 poprawił się nie tylko w generowaniu kodu.

Jednocześnie ranking GDPval jest aktualizowany, więc tych liczb nie należy mieszać z późniejszymi snapshotami leaderboardu.

11. Terminal-Bench według Artificial Analysis

Meta raportuje:

82,9%

dla Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis w swoim harnessie raportowało podczas premiery:

80%

względem:

78%

dla Muse Spark 1.1.[4]

Te wyniki nie są sprzeczne.

Są wynikiem:

  • różnych harnessów,
  • różnych konfiguracji agentów,
  • różnych procedur wykonania.

To dobry przykład, dlaczego wyniku benchmarku nie wolno publikować bez metodologii.

12. Hallucynacje: wynik wygląda lepiej, ale trzeba przeczytać drugą połowę tabeli

Artificial Analysis odnotowało w premierowym snapshotcie poprawę AA-Omniscience:

18 -> 22

oraz spadek hallucination rate:

38% -> 28%

[4]

Na pierwszy rzut oka wygląda to jednoznacznie dobrze.

Jednak jednocześnie:

attempt rate: 82% -> 67%
accuracy:     41% -> 38%

[4]

Model częściej rezygnował z odpowiedzi, gdy nie był pewny.

AA-Omniscience nie karze za odmowę odpowiedzi. Dlatego niższy hallucination rate częściowo wynika z większej skłonności do abstention.

Prawidłowa interpretacja:

Muse Spark 1.2 rzadziej podawał błędną odpowiedź jako pewną, ale też rzadziej podejmował próbę odpowiedzi.

Nieprawidłowa:

Muse Spark 1.2 stał się o 10 pp dokładniejszy.

Takiego wniosku nie potwierdzają dane.

13. Scientific reasoning nie poprawił się równomiernie

W premierowych pomiarach Artificial Analysis:

Benchmark Spark 1.1 Spark 1.2 Zmiana
CritPt 15% 18% +3 pp
SciCode 58% 56% -2 pp
Humanity's Last Exam 45% 44% -1 pp [4]

To ważne, ponieważ pokazuje charakter aktualizacji.

Muse Spark 1.2 nie jest po prostu:

Spark 1.1
+ kilka procent do wszystkiego

Największe zyski w dniu premiery były skoncentrowane na:

  • agentowym programowaniu,
  • pracy z narzędziami,
  • profesjonalnych zadaniach agentowych.

14. Cena API: jeden z największych atutów Muse Spark 1.2

Standardowy cennik Meta dla Muse Spark 1.2:

Tokeny Cena za 1 mln
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Cena input/output jest taka sama jak przy Muse Spark 1.1.

Porównanie publicznych cen API

Model Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

To porównanie ceny tokena, nie kosztu ukończenia zadania.

Model tańszy za milion tokenów może:

  • generować więcej tokenów,
  • wykonywać więcej tool calls,
  • potrzebować więcej iteracji,
  • popełnić błąd wymagający ręcznej naprawy.

Dlatego właściwa metryka biznesowa to:

koszt poprawnie ukończonego zadania

a nie tylko:

cena 1M tokenów

15. Koszt zadania według premierowego pomiaru Artificial Analysis

W snapshotcie z 5 sierpnia Artificial Analysis raportowało średni ważony koszt jednego zadania Intelligence Index:

Model / konfiguracja Koszt zadania
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

To bardzo dobry wynik kosztowy dla Muse Spark 1.2.

Względem Spark 1.1 koszt wzrósł jednak z:

0,29 USD
do
0,40 USD

Artificial Analysis wiąże to z większym użyciem tokenów:

  • około 53% więcej input tokens,
  • około 36% więcej output tokens,

szczególnie w GDPval-AA v2.[4]

Czyli wersja 1.2 jest:

lepsza
ale
bardziej tokenochłonna

Cena jednostkowa API się nie zmieniła, lecz agent wykonuje więcej pracy.

16. Muse Spark 1.2 vs Claude Opus 5

Gdzie Opus 5 wygrywa?

W danych Meta:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7% 82,9%
DeepSWE 1.1 65,0% 59,3%
Meta Internal Coding Bench 79,4% 70,6% [1]

W aktualnym Artificial Analysis Intelligence Index:

Opus 5:     61
Muse 1.2:   57

[3][7]

Na podstawie dostępnych danych nie ma podstaw, by nazywać Muse Spark 1.2 lepszym modelem ogólnie.

Gdzie Muse ma przewagę?

Przede wszystkim w cenie tokenów:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

W agentach wykonujących tysiące operacji ta różnica może być znacząca.

Wniosek

Opus 5 jest lepszym wyborem, gdy:

  • maksymalna skuteczność jest ważniejsza od kosztu,
  • zadanie jest trudne i koszt błędu wysoki,
  • zespół już pracuje w Claude Code.

Muse Spark 1.2 ma więcej sensu, gdy:

  • liczba zadań jest duża,
  • agent długo pracuje nad repozytorium,
  • koszt tokenów ma duże znaczenie,
  • różnica kilku punktów benchmarku nie uzasadnia wielokrotnie droższego API.

17. Muse Spark 1.2 vs GPT-5.6 Terra

To jedno z najbardziej interesujących porównań.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9%
Terra + Codex:         81,8%

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3%
Terra + Codex:         64,8%

Meta Internal Coding Bench

Muse 1.2:  70,6%
Terra:     65,4%

[1]

W zależności od benchmarku lider się zmienia.

Artificial Analysis

Aktualny ogólny index:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Cena

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Nie oznacza to automatycznej przewagi Muse. Terra w DeepSWE jest wyraźnie mocniejsza w zestawieniu Meta.

Najbardziej uczciwa interpretacja:

Muse Spark 1.2 jest niezwykle konkurencyjny wobec GPT-5.6 Terra pod względem ceny i części zadań agentowych, ale wynik zależy od rodzaju zadania i harnessu.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol pozostaje mocniejszy w szerszym indeksie Artificial Analysis:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol kosztuje jednak:

5 USD / 1M input
30 USD / 1M output

wobec:

1,25 USD / 1M input
4,25 USD / 1M output

dla Muse.[3][8]

To duża różnica dla:

  • długich reasoning traces,
  • subagentów,
  • iteracyjnego debugowania,
  • repo-wide refactoring,
  • wielogodzinnych agent runs.

Jeśli dodatkowe 2 punkty ogólnego indeksu nie przekładają się na większy odsetek poprawnie ukończonych zadań w danej firmie, droższy model nie musi być bardziej opłacalny.

19. Muse Spark 1.2 vs Kimi K3

Aktualna karta Artificial Analysis pokazuje:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

To nie oznacza identycznych możliwości.

Najważniejsza różnica

Kimi K3:

  • ma publicznie dostępne wagi,
  • może być self-hosted,
  • ma 2,8 bln wszystkich parametrów i 104 mld aktywnych,
  • korzysta z własnej Kimi K3 License.[10]

Muse Spark 1.2:

  • jest modelem proprietary,
  • działa przez Meta Model API,
  • Meta nie ujawniła liczby parametrów.[3]

Cena oficjalnych API

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Jeżeli self-hosting nie jest wymaganiem, Muse jest znacznie tańszy w nominalnym cenniku API.

Jeżeli organizacja potrzebuje:

  • własnej infrastruktury,
  • kontroli nad wagami,
  • własnych modyfikacji modelu,

Kimi K3 oferuje możliwość, której Muse Spark 1.2 obecnie nie zapewnia.

20. Muse Spark 1.2 vs Grok 4.5

W Terminal-Bench Meta:

Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build:      81,6%

W DeepSWE:

Muse Spark 1.2: 59,3%
Grok 4.5:        56,6%

[1]

W premierowym Artificial Analysis Intelligence Index Grok 4.5 miał 54, czyli poziom porównywalny z premierowym snapshotem Muse 1.2 przed aktualizacją indeksu.[4][11]

Artificial Analysis wskazywało także Grok 4.5 high jako jeden z nielicznych modeli o niższym koszcie zadania w tym samym klastrze jakości:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

To kolejny przykład, że relacja cena-jakość w 2026 roku nie jest już prostym podziałem:

najdroższy model
=
najbardziej opłacalny model

21. Kernel optimization: ponad 1000 tool calls i nawet 24 godziny pracy

Meta przeprowadziła interesujący test długiego horyzontu.

Muse Code i modele miały iteracyjnie optymalizować GPU kernels przez:

  • ponad 1000 wywołań narzędzi,
  • nawet 24 godziny,
  • pisanie kodu,
  • kompilowanie,
  • profilowanie,
  • kolejne optymalizacje.[1]

Testowano KDA i MLA na NVIDIA Hopper.

KDA

Bazą była implementacja FLA w Triton. Modele nie mogły bezpośrednio importować zewnętrznych bibliotek kernelowych takich jak FLA.[1]

Na wykresie końcowego speedupu względem baseline Meta pokazała między innymi:

Model Speedup vs baseline
Claude Opus 5 +74,0%
GPT-5.6 Sol +71,2%
Claude Opus 4.8 +69,6%
Muse Spark 1.2 +68,7%
GPT-5.6 Terra +65,1%
Gemini 3.6 Flash +62,5% [1]

Muse Spark 1.2 nie wygrał tego eksperymentu.

To ważne, bo pokazuje, że oficjalny materiał Meta nie przedstawia własnego modelu jako lidera w każdej kategorii.

Czego ten eksperyment nie dowodzi?

Nie dowodzi, że:

  • Opus 5 zawsze optymalizuje kod o 74%,
  • Muse zawsze daje 68,7% przyspieszenia,
  • wyniki przeniosą się na dowolny kernel lub GPU.

To studium konkretnego zadania, baseline'u, harnessa i sprzętu.

22. Długi kontekst: 1 milion tokenów

Artificial Analysis potwierdza dla Muse Spark 1.2:

1M token context window

oraz:

  • text input,
  • image input,
  • text output.[3]

Milion tokenów ma znaczenie w przypadku:

  • dużych repozytoriów,
  • monorepo,
  • dokumentacji,
  • długiej historii agentowej,
  • analizy wielu plików.

Nie oznacza jednak, że należy wrzucić całe repozytorium do promptu.

Maksymalna pojemność nie gwarantuje:

  • odnalezienia każdej zależności,
  • prawidłowego priorytetyzowania,
  • odporności na złośliwy tekst w repozytorium,
  • identycznej jakości na początku i końcu kontekstu.

Muse Code korzysta dlatego również z context compaction, a nie wyłącznie z coraz większego promptu.[1]

23. Dlaczego aktualny wynik AA to 57, a w artykułach premierowych można zobaczyć 54?

To nie jest błąd do ukrycia.

5 sierpnia Artificial Analysis opublikowało wynik 54.[4]

Aktualna karta Muse Spark 1.2 z 7 sierpnia pokazuje 57 i informuje, że obecny Artificial Analysis Intelligence Index ma wersję v4.1.1.[3]

W praktyce oznacza to, że podczas cytowania benchmarków trzeba przechowywać:

model
+
effort
+
wersję benchmarku
+
datę

Na przykład:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stan: 7 sierpnia 2026

To znacznie lepsze niż napisanie:

Muse Spark 1.2 ma 57 punktów

bez żadnego kontekstu.

24. Standard tier a Contributor tier: ważna różnica dla prywatności

Standardowy Muse Spark 1.2 ma cennik:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta oferuje również mocno przeceniony Contributor tier.

Niezależne informacje prasowe opisujące oficjalną ofertę wskazują, że niższa cena wiąże się ze zgodą na wykorzystywanie aktywności użytkownika do ulepszania produktów Meta.[6]

W środowisku firmowym jest to istotna różnica.

Przed użyciem Contributor tier dla kodu:

  • prywatnego,
  • objętego NDA,
  • zawierającego tajemnice przedsiębiorstwa,
  • należącego do klienta,

należy sprawdzić dokładne warunki przetwarzania danych obowiązujące na koncie i endpointcie.

Nie należy wybierać tańszego endpointu tylko na podstawie ceny.

25. Czy Muse Spark 1.2 jest najlepszym modelem do programowania?

Na podstawie zweryfikowanych danych: nie ma podstaw do takiego stwierdzenia.

Nie jest liderem we wszystkich testach Meta

Opus 5 prowadzi w:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra także wyprzedza Muse w DeepSWE.

Jest jednak wyjątkowo mocny cenowo

Muse Spark 1.2 kosztuje znacznie mniej za output niż:

Najlepszy opis

Najbardziej defensywny wniosek brzmi:

Muse Spark 1.2 jest jednym z najbardziej interesujących modeli 2026 roku pod względem relacji agentic coding do ceny, ale Opus 5 pozostaje mocniejszy w dostępnych porównaniach jakości, a końcowy wybór powinien wynikać z własnego POC.

26. Który model wybrać?

Wybierz Muse Spark 1.2, jeśli:

  • koszt długich sesji jest bardzo ważny,
  • pracujesz z dużymi repozytoriami,
  • chcesz używać Muse Code,
  • agent ma długo pracować bez ręcznego sterowania,
  • potrzebujesz persistent subagents,
  • nominalna cena output musi być niska,
  • wynik blisko frontier wystarcza do danego workflow.

Wybierz Claude Opus 5, jeśli:

  • priorytetem jest maksymalna skuteczność,
  • koszt błędu przewyższa koszt tokenów,
  • używasz Claude Code,
  • zadania są wyjątkowo trudne,
  • własny POC potwierdza wyższy completion rate.

Wybierz GPT-5.6 Terra, jeśli:

  • korzystasz z ekosystemu Codex,
  • DeepSWE-podobne zadania są kluczowe,
  • potrzebujesz mocnego coding modelu przy cenie niższej niż Sol,
  • narzędzia OpenAI są już częścią pipeline'u.

Wybierz GPT-5.6 Sol, jeśli:

  • potrzebujesz wyższej ogólnej jakości niż Muse,
  • koszt API jest mniej istotny,
  • workload wykorzystuje szersze reasoning poza samym codingiem.

Wybierz Kimi K3, jeśli:

  • potrzebujesz otwartych wag,
  • planujesz self-hosting,
  • potrzebujesz własnych modyfikacji modelu,
  • możesz zaakceptować większy koszt oficjalnego API.

Rozważ Grok 4.5, jeśli:

  • twoje testy pokazują wysoką skuteczność w agentic workflows,
  • koszt ukończonego zadania jest kluczowy,
  • korzystasz z Grok Build lub kompatybilnego harnessa.

27. Jak zrobić uczciwy POC?

Nie testuj modeli na pięciu promptach.

Przygotuj minimum:

50-200 rzeczywistych zadań

z własnego repozytorium.

Kategorie

  • bug fix,
  • nowa funkcja,
  • refactoring,
  • testy,
  • code review,
  • migracja dependency,
  • performance optimization,
  • analiza logów,
  • frontend ze screenshotu,
  • repo-wide change,
  • dokumentacja techniczna.

Dla każdego zadania mierz

success / failure
czas
koszt
liczbę tokenów
liczbę tool calls
liczbę ręcznych interwencji
liczbę regresji

Najważniejsza metryka

Nie:

który model napisał ładniejszą odpowiedź?

Tylko:

który model najczęściej dostarczył poprawny merge-ready rezultat
przy akceptowalnym koszcie i czasie?

28. Jak porównywać agentów, a nie tylko modele?

W przypadku:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build,

model nie działa w próżni.

Agent decyduje:

  • jakie pliki przeczytać,
  • kiedy uruchomić test,
  • kiedy wykonać grep,
  • czy użyć subagenta,
  • jak zarządzać kontekstem,
  • ile razy iterować,
  • kiedy zakończyć pracę.

Dlatego warto przeprowadzić dwa testy.

Test A: model w wspólnym harnessie

ten sam agent
te same narzędzia
ten sam system prompt
te same limity

Pomaga porównać sam model.

Test B: produkt end-to-end

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Pomaga odpowiedzieć na praktyczne pytanie:

Które rozwiązanie jest najlepsze dla zespołu?

Oba testy mierzą coś innego.

29. Produkcyjna checklista Muse Spark 1.2

Benchmarki

  • Zapisano wersję benchmarku.
  • Zapisano datę wyniku.
  • Zapisano reasoning effort.
  • Zapisano nazwę agenta.
  • Nie mieszano Meta Terminal-Bench z wynikiem AA.
  • Nie traktuje się Meta Internal Coding Bench jako niezależnego testu.
  • Sprawdzono wyniki na własnym repozytorium.

Koszt

  • Mierzony jest rzeczywisty input.
  • Mierzony jest cached input.
  • Mierzony jest output.
  • Mierzony jest koszt reasoning.
  • Mierzona jest liczba tool calls.
  • Koszt liczony jest per ukończone zadanie.
  • Porównano co najmniej trzy modele.
  • Ustalono limit kosztu pojedynczego agenta.

Repozytorium

  • Agent ma minimalny zakres uprawnień.
  • Sekrety nie znajdują się w łatwo dostępnych plikach.
  • Produkcja nie jest dostępna bez approval.
  • Merge wymaga review.
  • Testy uruchamiają się automatycznie.
  • Agent nie może ominąć branch protection.
  • Logowane są zmiany i tool calls.

Dane

  • Zweryfikowano warunki Standard tier.
  • Zweryfikowano warunki Contributor tier.
  • Kod klienta nie trafia do niewłaściwego endpointu.
  • Polityka firmy dopuszcza wybraną usługę.
  • Ustalono zasady retencji promptów i logów.
  • Dane osobowe są odpowiednio chronione.

Jakość

  • Agent wykonuje testy po zmianie.
  • Weryfikowany jest finalny diff.
  • Mierzone są regresje.
  • Długie zadania mają checkpointy.
  • Sprawdzono zachowanie po awarii.
  • Sprawdzono duże monorepo.
  • Sprawdzono zadania wielogodzinne.

30. Werdykt POLPROG

Muse Spark 1.2 jest istotniejszą premierą, niż sugerowałby numer 1.2.

Meta zbudowała model i Muse Code jako powiązany system, skupiając trening na:

  • dużych repozytoriach,
  • długich zadaniach,
  • narzędziach,
  • subagentach,
  • planowaniu,
  • automatycznej weryfikacji.

Wyniki potwierdzają realną poprawę nad Muse Spark 1.1.

Najmocniejsze fakty

Terminal-Bench 2.1
76,2% -> 82,9% w ewaluacji Meta

DeepSWE 1.1
53,0% -> 59,3% w ewaluacji Meta

GDPval-AA v2
1371 -> 1631 Elo w premierowym pomiarze Artificial Analysis

[1][4]

Ale liderem wszystkiego nadal nie jest

Opus 5 wygrywa z Muse Spark 1.2 we wszystkich trzech pokazanych przez Meta benchmarkach codingowych.

W aktualnym Artificial Analysis:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Dlaczego więc Muse Spark 1.2 jest ciekawy?

Ponieważ kosztuje:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

To sprawia, że przestaje być rozsądne pytanie:

Który model ma najwyższy benchmark?

Lepsze pytanie brzmi:

Który model daje najwyższy odsetek poprawnie ukończonych zadań za 100 USD budżetu?

W wielu zespołach odpowiedź może być inna niż model zajmujący pierwsze miejsce na jednej tabeli.

Muse Spark 1.2 wygląda obecnie jak bardzo mocny kandydat do agentowego programowania o dużej skali i kontrolowanym koszcie.

Nie jest bezwarunkowym zwycięzcą.

Jest modelem, który zdecydowanie warto umieścić w POC obok:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 jest istotniejszą premierą, niż sugerowałby numer 1.2. Wyniki potwierdzają realną poprawę nad Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Najczęściej zadawane pytania

Kiedy wyszedł Muse Spark 1.2?

Meta zaprezentowała Muse Spark 1.2 i Muse Code 5 sierpnia 2026 roku.

Czy Muse Spark 1.2 jest open source?

Nie. Artificial Analysis klasyfikuje go jako proprietary model, a jego wagi nie są publicznie dostępne.

Ile parametrów ma Muse Spark 1.2?

Meta nie ujawniła publicznie liczby parametrów.

Jaki ma kontekst?

1 milion tokenów.

Czy obsługuje obrazy?

Tak. Artificial Analysis potwierdza text + image input oraz text output.

Ile kosztuje API?

Standardowo 1,25 USD za milion input tokens, 0,15 USD za milion cached input tokens i 4,25 USD za milion output tokens.

Czy Muse Spark 1.2 jest lepszy od Claude Opus 5?

Nie według dostępnych benchmarków ogólnych i zestawień Meta. Opus 5 prowadzi w trzech pokazanych przez Meta benchmarkach codingowych oraz ma wyższy aktualny Artificial Analysis Intelligence Index.

Czy Muse Spark 1.2 jest lepszy od GPT-5.6 Terra?

To zależy od zadania. Muse prowadzi w Terminal-Bench Meta i Meta Internal Coding Bench, natomiast Terra prowadzi w DeepSWE 1.1. Aktualny ogólny AA Intelligence Index jest wyższy dla Muse.

Czy Muse Spark 1.2 jest lepszy od Kimi K3?

Aktualny Artificial Analysis Intelligence Index daje obu modelom wynik 57. Kimi K3 posiada otwarte wagi, a Muse jest proprietary. Ich profile i koszty są inne.

Dlaczego w internecie można znaleźć wynik 54, a tutaj jest 57?

54 pochodzi z artykułu Artificial Analysis z dnia premiery. Aktualna karta modelu po zmianach w indeksie v4.1.1 pokazuje 57. Przy benchmarkach trzeba zawsze podawać wersję i datę.

Czy 82,9% w Terminal-Bench jest niezależnym wynikiem?

Nie. To wynik opublikowany przez Meta dla Muse Spark 1.2 + Muse Code w metodologii Meta.

Czy Artificial Analysis mierzy Terminal-Bench inaczej?

Tak. W premierowym pomiarze AA Muse Spark 1.2 osiągnął 80%. Różnica wynika między innymi z innego harnessa.

Czy Muse Code działa po awarii?

Meta opisuje lokalny append-only event log, dzięki któremu runtime ma być restart-safe i może odtworzyć stan pracy.

Czy można używać Muse Spark 1.2 globalnie?

Meta w ogłoszeniu premiery informuje o dostępności Muse Spark 1.2 w Muse Code i Meta Model API z rozszerzonym globalnym dostępem.

Czy warto migrować z Muse Spark 1.1?

Dane Meta i Artificial Analysis pokazują wyraźną poprawę w agentic coding i GDPval. Migrację należy jednak potwierdzić na własnym zbiorze zadań, ponieważ 1.2 zużywa więcej tokenów na część workloadów. ---

Źródła i przypisy

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

Czy ten artykuł był pomocny?

Nowe artykuły na e-mail

Jeden krótki e-mail przy każdym nowym artykule. Bez spamu, wypisujesz się jednym kliknięciem.

Wykorzystujemy e-mail wyłącznie do wysyłki nowych artykułów. Bez udostępniania stronom trzecim.

Wróć do bazy wiedzy