Model nie został wydany z otwartymi wagami. Artificial Analysis klasyfikuje Muse Spark 1.2 jako model proprietary, a liczba parametrów nie została publicznie ujawniona.[3]
Najbardziej interesująca część premiery nie polega jednak na samej nazwie modelu. Meta trenowała Muse Spark 1.2 razem z Muse Code i zoptymalizowała model pod rzeczywiste środowisko agentowe: planowanie, kompresję kontekstu, subagentów, korzystanie z narzędzi oraz długie zadania obejmujące całe repozytoria.[1]
Wyniki są mocne, ale wymagają ostrożnej interpretacji.
W oficjalnym teście Meta:
- Muse Spark 1.2 + Muse Code osiąga 82,9% w Terminal-Bench 2.1,
- 59,3% w DeepSWE 1.1,
- 70,6% w Meta Internal Coding Bench.[1][2]
Nie oznacza to jednak, że Muse Spark 1.2 jest najlepszym modelem programistycznym na rynku. W tych samych tabelach Claude Opus 5 + Claude Code zajmuje pierwsze miejsce we wszystkich trzech zestawieniach. Dodatkowo Meta sama zaznacza, że porównanie nie jest idealnie model-do-modelu: każdy model był uruchamiany z innym agentem, a konfiguracja testowa mogła być lepiej dopasowana do Muse Code niż do narzędzi konkurencji.[2]
Niezależny obraz daje Artificial Analysis. W aktualnej karcie modelu z 7 sierpnia Muse Spark 1.2 przy xhigh osiąga 57 punktów w Artificial Analysis Intelligence Index v4.1.1. Dla porównania Claude Opus 5 ma 61, GPT-5.6 Sol 59, Kimi K3 57, a GPT-5.6 Terra 55.[3][7][8][9][10]
Najkrótszy wniosek: Muse Spark 1.2 nie pokonuje bezwarunkowo Opus 5 ani GPT-5.6 Sol, ale jest wyjątkowo konkurencyjny cenowo. Najmocniej wygląda jako model do agentowego programowania, szczególnie gdy pracuje z Muse Code i gdy koszt długich sesji ma duże znaczenie.
Wszystkie dane w artykule zostały zweryfikowane na podstawie materiałów Meta, oficjalnej metodologii ewaluacji, Artificial Analysis oraz niezależnych informacji prasowych. Stan na 7 sierpnia 2026 roku.
TL;DR
| Pytanie | Zweryfikowana odpowiedź |
|---|---|
| Kiedy wydano Muse Spark 1.2? | 5 sierpnia 2026 |
| Kto stworzył model? | Meta |
| Czym jest Muse Code? | Terminalowy agent programistyczny w wersji beta |
| Czy Muse Spark 1.2 ma otwarte wagi? | Nie, model jest proprietary |
| Czy znamy liczbę parametrów? | Nie, Meta jej publicznie nie podała |
| Kontekst | 1 mln tokenów |
| Modalności | tekst i obraz na wejściu, tekst na wyjściu |
| Cena standardowa input | 1,25 USD / 1 mln tokenów |
| Cena cached input | 0,15 USD / 1 mln tokenów |
| Cena output | 4,25 USD / 1 mln tokenów |
| Terminal-Bench 2.1 wg Meta | 82,9% |
| DeepSWE 1.1 wg Meta | 59,3% |
| Meta Internal Coding Bench | 70,6% |
| Aktualny AA Intelligence Index v4.1.1 | 57 |
| AA Index w artykule z dnia premiery | 54 |
| Czy wyniki Meta są niezależne? | Nie, część to ewaluacje producenta |
| Czy Artificial Analysis jest niezależne od Meta? | Tak, choć Meta udostępniła model AA przed premierą do benchmarków |
| Najmocniejsza cecha | agentowe programowanie i relacja możliwości do ceny |
| Najważniejsze ograniczenie | nie wygrywa wszystkich benchmarków i część testów używa różnych agent harnessów |
1. Co dokładnie wydała Meta?
Premiera obejmuje dwa powiązane produkty:
Muse Spark 1.2
model
Muse Code
terminalowy agent programistyczny
Meta opisuje Muse Spark 1.2 jako aktualizację Muse Spark 1.1 skupioną na kodowaniu. Zwiększono ilość compute wykorzystanego podczas treningu na zadaniach programistycznych oraz rozszerzono różnorodność środowisk treningowych.[1]
Muse Code jest natomiast agentem, który potrafi:
- planować zmiany w repozytorium,
- pisać kod,
- uruchamiać narzędzia,
- walidować wyniki,
- koordynować kilka długotrwałych subagentów,
- utrzymywać postęp przez długie sesje.[1]
Instalacja oficjalnego klienta na macOS lub Linux została opisana przez Meta następująco:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 jest dostępny zarówno przez Muse Code, jak i Meta Model API. Meta określa obecną dostępność jako rozszerzoną globalnie.[1]
2. Muse Code nie jest tylko prostym wrapperem na model
W przypadku agentów programistycznych benchmark modelu i benchmark produktu nie są tym samym.
Muse Code dodaje własną warstwę wykonawczą.
Async Background Agents
Agent główny może korzystać z wyspecjalizowanych subagentów działających w tle. Nie są one tworzone wyłącznie na pojedynczy krok, lecz mogą pozostawać aktywne przez całą sesję.[1]
Ma to ograniczać:
- wielokrotne zbieranie tych samych informacji,
- opóźnienia,
- konieczność ręcznego kierowania agentem,
- powtarzanie analizy repozytorium.
Append-only event log
Muse Code zapisuje lokalnie historię:
- wywołań modelu,
- użycia narzędzi,
- zatwierdzeń,
- edycji.[1]
Meta opisuje runtime jako replay-exact i restart-safe. Po awarii agent może wznowić działanie na podstawie dziennika zamiast rozpoczynać zadanie od początku.
To istotna funkcja przy wielogodzinnych zadaniach programistycznych.
Wbudowane skills
W premierowej wersji dostępne są między innymi:
/plan
/grill
/goal
/plan przygotowuje plan z etapem zatwierdzenia, /grill ma krytycznie sprawdzać plan, a /goal prowadzić pracę w kierunku określonego celu.[1]
3. Model i agent były trenowane razem
To jedna z najważniejszych informacji dla interpretacji benchmarków.
Meta nie tylko podłączyła nowy model do istniejącego CLI. Firma deklaruje co-training Muse Spark 1.2 i Muse Code.[1]
Trening obejmował między innymi:
- trajectories z agent harness,
- optymalizacje pod pracę z celami,
- compaction,
- subagentów,
- zintegrowany zestaw narzędzi Muse Code.[1]
Model trenowano również na zadaniach długiego horyzontu:
- generowaniu całych repozytoriów,
- dużych projektach end-to-end,
- auto-research,
- sekwencjonowaniu pracy przez planning,
- utrzymywaniu kierunku przez goal conditioning,
- kompresji kontekstu.[1]
To pomaga wyjaśnić, dlaczego właściwą jednostką porównania jest czasami:
Muse Spark 1.2 + Muse Code
a nie wyłącznie:
Muse Spark 1.2
4. Self-improvement z wykorzystaniem Muse Spark 1.1
Meta wykorzystała Muse Spark 1.1 do budowania danych treningowych dla wersji 1.2.
Według oficjalnego opisu wcześniejszy model:
- generował trudne środowiska programistyczne,
- przygotowywał szablony złożonych instrukcji,
- oceniał rozwiązania kandydackie,
- pomagał tworzyć skalowalny dataset dla Muse Spark 1.2.[1]
Meta określa ten proces jako self-improvement loop.
Nie oznacza to, że model „sam się wytrenował”. Nadal mamy do czynienia z kontrolowanym pipeline'em treningowym przygotowanym przez Meta, w którym wcześniejszy model był jednym z elementów generowania i oceny danych.
5. Oficjalny Terminal-Bench 2.1
Terminal-Bench 2.1 bada agentów wykonujących zadania w środowisku terminalowym.
Meta użyła wszystkich 89 zadań oficjalnego wydania 2.1. Każda próba odbywała się w izolowanym sandboxie Daytona, a końcowy stan kontenera oceniał executable verifier. Wynik jest średnią pass@1 z pięciu prób.[2]
Wyniki opublikowane przez Meta
| Model + agent | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7% | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9% | |
| GPT-5.6 Terra + Codex | max | 81,8% | |
| Grok 4.5 + Grok Build | high | 81,6% | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9% | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2% | [1][2] |
Muse Spark 1.2 poprawia wynik poprzednika o 6,7 punktu procentowego.
Jednocześnie:
- przegrywa z Opus 5 o 3,8 pp,
- wyprzedza GPT-5.6 Terra o 1,1 pp,
- wyprzedza Grok 4.5 o 1,3 pp.
Najważniejsze zastrzeżenie
To nie jest czysty benchmark samych modeli.
Porównywane zestawy to:
model
+
agent
+
narzędzia
+
system prompt
+
runtime
Meta używa:
- Muse Code dla Spark 1.2,
- Claude Code dla Opus 5,
- Codex dla GPT-5.6,
- Grok Build dla Grok 4.5,
- Antigravity CLI dla Gemini.[2]
Sama Meta zaznacza, że konfiguracja i system prompts mogły nie być optymalnie dostrojone pod zamknięte modele konkurencji.[2]
Dlatego prawidłowy wniosek brzmi:
W konfiguracji Meta, Muse Spark 1.2 + Muse Code osiągnął 82,9%.
Nie:
Muse Spark 1.2 jest bezwarunkowo lepszy od GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 zawiera 113 zadań z 91 repozytoriów i obejmuje pięć języków:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Każde zadanie posiada ręcznie przygotowany verifier funkcjonalny i testy regresji.
Podczas rollout i grading zewnętrzny internet jest zablokowany. Dostępny pozostaje endpoint modelu.[2]
Wyniki Meta
| Model + agent | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0% | |
| GPT-5.6 Terra + Codex | 64,8% | |
| Muse Spark 1.2 + Muse Code | 59,3% | |
| Grok 4.5 + Grok Build | 56,6% | |
| Muse Spark 1.1 + mini-swe-agent | 53,0% | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0% | [1][2] |
Muse Spark 1.2 poprawia wynik 1.1 o 6,3 pp.
Tutaj dystans do liderów jest jednak większy:
Opus 5 65,0%
GPT-5.6 64,8%
Muse 1.2 59,3%
To mocny rezultat, ale nie pierwsze miejsce.
Dodatkowe ograniczenie metodologiczne
Oficjalny leaderboard DeepSWE używa mini-swe-agent dla każdego modelu.
Meta w swojej ewaluacji użyła natomiast osobnego produktu agenta dla każdego modelu. Firma sama pisze, że wynik nie jest harness-identical z oficjalnym leaderboardem.[2]
To bardzo ważna informacja, która powinna pojawiać się obok wyniku 59,3%.
7. Meta Internal Coding Bench
Meta Internal Coding Bench zawiera 440 zadań pochodzących z wewnętrznego codebase Meta i rzeczywistych pull requestów.[2]
Obejmuje:
- naprawy błędów,
- nowe funkcje,
- refaktoryzację,
- cleanup,
- inne zadania software engineering.
Internet jest wyłączony. Rozwiązania są kompilowane i sprawdzane testami jednostkowymi. Meta wykonuje dwie próby na zadanie.[2]
Wyniki
| Model | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4% | |
| Muse Spark 1.2 | 70,6% | |
| Muse Spark 1.1 | 68,3% | |
| GPT-5.6 Terra | 65,4% | |
| Gemini 3.6 Flash | 63,9% | [1][2] |
Muse Spark 1.2 poprawia wynik poprzednika o 2,3 pp.
Dlaczego ten benchmark ma mniejszą wartość zewnętrzną?
Nie dlatego, że musi być błędny.
Problemem jest reprodukowalność.
Dataset:
- jest wewnętrzny,
- pochodzi z prywatnego codebase Meta,
- nie jest publicznym benchmarkiem możliwym do samodzielnego odtworzenia.
Dlatego ten wynik należy traktować jako dodatkowy sygnał od producenta, nie jako niezależny dowód przewagi nad konkurencją.
8. Independent check: Artificial Analysis
Artificial Analysis otrzymało od Meta dostęp do Muse Spark 1.2 przed publiczną premierą i wykonało własny zestaw testów.[4]
To istotne, ponieważ pozwala oddzielić:
benchmark producenta
od:
benchmark niezależnej organizacji
Ważna zmiana wyniku po premierze
Artykuł Artificial Analysis opublikowany 5 sierpnia podawał:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
Aktualna karta modelu, po przejściu indeksu na v4.1.1, pokazuje:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Nie należy więc kopiować liczby 54 do aktualnego rankingu bez daty.
Benchmarki żyją. Zmieniają się:
- wersje indeksu,
- grading,
- zestawy ewaluacji,
- poprawki metodologiczne.
W artykule produkcyjnym należy zawsze wskazać snapshot.
9. Aktualne porównanie Artificial Analysis
Stan kart modeli sprawdzony 7 sierpnia 2026:
| Model | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* Wynik Grok 4.5 pochodzi z opublikowanego zestawienia Artificial Analysis dotyczącego tego modelu. Wartości należy traktować jako stan odpowiednich wersji benchmarku, a nie wieczne pozycje w rankingu.
Co z tego wynika?
Muse Spark 1.2:
- nie dogania obecnie Opus 5 w ogólnym indeksie,
- pozostaje 2 punkty za GPT-5.6 Sol,
- jest na poziomie Kimi K3 w aktualnej karcie AA,
- wyprzedza GPT-5.6 Terra w ogólnym indeksie,
- znajduje się powyżej premierowego wyniku Grok 4.5.
Ale Artificial Analysis Intelligence Index nie jest benchmarkiem wyłącznie programistycznym.
Aktualna wersja v4.1.1 łączy dziewięć ewaluacji, między innymi:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Dlatego wynik 57 należy czytać jako szerszy sygnał inteligencji i zdolności agentowych.
10. GDPval-AA v2: największa poprawa względem Spark 1.1
W snapshotcie Artificial Analysis z dnia premiery wynik GDPval-AA v2 wzrósł:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
czyli o 260 punktów Elo.[4]
GDPval-AA v2 sprawdza realistyczne zadania pracy wiedzy.
Zawiera 220 zadań z:
- 44 zawodów,
- 9 głównych branż amerykańskiej gospodarki.[2]
Modele tworzą między innymi:
- dokumenty,
- arkusze kalkulacyjne,
- prezentacje,
- diagramy,
- raporty.
Artificial Analysis używa własnego agentic harness Stirrup z dostępem do shell i przeglądania internetu, a rezultaty są porównywane parami przez sędziego LLM.[2]
Snapshot z 5 sierpnia
Artificial Analysis podawało wtedy:
| Model | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
To jeden z najmocniejszych argumentów za tym, że 1.2 poprawił się nie tylko w generowaniu kodu.
Jednocześnie ranking GDPval jest aktualizowany, więc tych liczb nie należy mieszać z późniejszymi snapshotami leaderboardu.
11. Terminal-Bench według Artificial Analysis
Meta raportuje:
82,9%
dla Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis w swoim harnessie raportowało podczas premiery:
80%
względem:
78%
dla Muse Spark 1.1.[4]
Te wyniki nie są sprzeczne.
Są wynikiem:
- różnych harnessów,
- różnych konfiguracji agentów,
- różnych procedur wykonania.
To dobry przykład, dlaczego wyniku benchmarku nie wolno publikować bez metodologii.
12. Hallucynacje: wynik wygląda lepiej, ale trzeba przeczytać drugą połowę tabeli
Artificial Analysis odnotowało w premierowym snapshotcie poprawę AA-Omniscience:
18 -> 22
oraz spadek hallucination rate:
38% -> 28%
Na pierwszy rzut oka wygląda to jednoznacznie dobrze.
Jednak jednocześnie:
attempt rate: 82% -> 67%
accuracy: 41% -> 38%
Model częściej rezygnował z odpowiedzi, gdy nie był pewny.
AA-Omniscience nie karze za odmowę odpowiedzi. Dlatego niższy hallucination rate częściowo wynika z większej skłonności do abstention.
Prawidłowa interpretacja:
Muse Spark 1.2 rzadziej podawał błędną odpowiedź jako pewną, ale też rzadziej podejmował próbę odpowiedzi.
Nieprawidłowa:
Muse Spark 1.2 stał się o 10 pp dokładniejszy.
Takiego wniosku nie potwierdzają dane.
13. Scientific reasoning nie poprawił się równomiernie
W premierowych pomiarach Artificial Analysis:
| Benchmark | Spark 1.1 | Spark 1.2 | Zmiana | |
|---|---|---|---|---|
| CritPt | 15% | 18% | +3 pp | |
| SciCode | 58% | 56% | -2 pp | |
| Humanity's Last Exam | 45% | 44% | -1 pp | [4] |
To ważne, ponieważ pokazuje charakter aktualizacji.
Muse Spark 1.2 nie jest po prostu:
Spark 1.1
+ kilka procent do wszystkiego
Największe zyski w dniu premiery były skoncentrowane na:
- agentowym programowaniu,
- pracy z narzędziami,
- profesjonalnych zadaniach agentowych.
14. Cena API: jeden z największych atutów Muse Spark 1.2
Standardowy cennik Meta dla Muse Spark 1.2:
| Tokeny | Cena za 1 mln | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Cena input/output jest taka sama jak przy Muse Spark 1.1.
Porównanie publicznych cen API
| Model | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
To porównanie ceny tokena, nie kosztu ukończenia zadania.
Model tańszy za milion tokenów może:
- generować więcej tokenów,
- wykonywać więcej tool calls,
- potrzebować więcej iteracji,
- popełnić błąd wymagający ręcznej naprawy.
Dlatego właściwa metryka biznesowa to:
koszt poprawnie ukończonego zadania
a nie tylko:
cena 1M tokenów
15. Koszt zadania według premierowego pomiaru Artificial Analysis
W snapshotcie z 5 sierpnia Artificial Analysis raportowało średni ważony koszt jednego zadania Intelligence Index:
| Model / konfiguracja | Koszt zadania | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
To bardzo dobry wynik kosztowy dla Muse Spark 1.2.
Względem Spark 1.1 koszt wzrósł jednak z:
0,29 USD
do
0,40 USD
Artificial Analysis wiąże to z większym użyciem tokenów:
- około 53% więcej input tokens,
- około 36% więcej output tokens,
szczególnie w GDPval-AA v2.[4]
Czyli wersja 1.2 jest:
lepsza
ale
bardziej tokenochłonna
Cena jednostkowa API się nie zmieniła, lecz agent wykonuje więcej pracy.
16. Muse Spark 1.2 vs Claude Opus 5
Gdzie Opus 5 wygrywa?
W danych Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7% | 82,9% | |
| DeepSWE 1.1 | 65,0% | 59,3% | |
| Meta Internal Coding Bench | 79,4% | 70,6% | [1] |
W aktualnym Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
Na podstawie dostępnych danych nie ma podstaw, by nazywać Muse Spark 1.2 lepszym modelem ogólnie.
Gdzie Muse ma przewagę?
Przede wszystkim w cenie tokenów:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
W agentach wykonujących tysiące operacji ta różnica może być znacząca.
Wniosek
Opus 5 jest lepszym wyborem, gdy:
- maksymalna skuteczność jest ważniejsza od kosztu,
- zadanie jest trudne i koszt błędu wysoki,
- zespół już pracuje w Claude Code.
Muse Spark 1.2 ma więcej sensu, gdy:
- liczba zadań jest duża,
- agent długo pracuje nad repozytorium,
- koszt tokenów ma duże znaczenie,
- różnica kilku punktów benchmarku nie uzasadnia wielokrotnie droższego API.
17. Muse Spark 1.2 vs GPT-5.6 Terra
To jedno z najbardziej interesujących porównań.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9%
Terra + Codex: 81,8%
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3%
Terra + Codex: 64,8%
Meta Internal Coding Bench
Muse 1.2: 70,6%
Terra: 65,4%
W zależności od benchmarku lider się zmienia.
Artificial Analysis
Aktualny ogólny index:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Cena
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Nie oznacza to automatycznej przewagi Muse. Terra w DeepSWE jest wyraźnie mocniejsza w zestawieniu Meta.
Najbardziej uczciwa interpretacja:
Muse Spark 1.2 jest niezwykle konkurencyjny wobec GPT-5.6 Terra pod względem ceny i części zadań agentowych, ale wynik zależy od rodzaju zadania i harnessu.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol pozostaje mocniejszy w szerszym indeksie Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol kosztuje jednak:
5 USD / 1M input
30 USD / 1M output
wobec:
1,25 USD / 1M input
4,25 USD / 1M output
To duża różnica dla:
- długich reasoning traces,
- subagentów,
- iteracyjnego debugowania,
- repo-wide refactoring,
- wielogodzinnych agent runs.
Jeśli dodatkowe 2 punkty ogólnego indeksu nie przekładają się na większy odsetek poprawnie ukończonych zadań w danej firmie, droższy model nie musi być bardziej opłacalny.
19. Muse Spark 1.2 vs Kimi K3
Aktualna karta Artificial Analysis pokazuje:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
To nie oznacza identycznych możliwości.
Najważniejsza różnica
Kimi K3:
- ma publicznie dostępne wagi,
- może być self-hosted,
- ma 2,8 bln wszystkich parametrów i 104 mld aktywnych,
- korzysta z własnej Kimi K3 License.[10]
Muse Spark 1.2:
- jest modelem proprietary,
- działa przez Meta Model API,
- Meta nie ujawniła liczby parametrów.[3]
Cena oficjalnych API
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Jeżeli self-hosting nie jest wymaganiem, Muse jest znacznie tańszy w nominalnym cenniku API.
Jeżeli organizacja potrzebuje:
- własnej infrastruktury,
- kontroli nad wagami,
- własnych modyfikacji modelu,
Kimi K3 oferuje możliwość, której Muse Spark 1.2 obecnie nie zapewnia.
20. Muse Spark 1.2 vs Grok 4.5
W Terminal-Bench Meta:
Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build: 81,6%
W DeepSWE:
Muse Spark 1.2: 59,3%
Grok 4.5: 56,6%
W premierowym Artificial Analysis Intelligence Index Grok 4.5 miał 54, czyli poziom porównywalny z premierowym snapshotem Muse 1.2 przed aktualizacją indeksu.[4][11]
Artificial Analysis wskazywało także Grok 4.5 high jako jeden z nielicznych modeli o niższym koszcie zadania w tym samym klastrze jakości:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
To kolejny przykład, że relacja cena-jakość w 2026 roku nie jest już prostym podziałem:
najdroższy model
=
najbardziej opłacalny model
21. Kernel optimization: ponad 1000 tool calls i nawet 24 godziny pracy
Meta przeprowadziła interesujący test długiego horyzontu.
Muse Code i modele miały iteracyjnie optymalizować GPU kernels przez:
- ponad 1000 wywołań narzędzi,
- nawet 24 godziny,
- pisanie kodu,
- kompilowanie,
- profilowanie,
- kolejne optymalizacje.[1]
Testowano KDA i MLA na NVIDIA Hopper.
KDA
Bazą była implementacja FLA w Triton. Modele nie mogły bezpośrednio importować zewnętrznych bibliotek kernelowych takich jak FLA.[1]
Na wykresie końcowego speedupu względem baseline Meta pokazała między innymi:
| Model | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0% | |
| GPT-5.6 Sol | +71,2% | |
| Claude Opus 4.8 | +69,6% | |
| Muse Spark 1.2 | +68,7% | |
| GPT-5.6 Terra | +65,1% | |
| Gemini 3.6 Flash | +62,5% | [1] |
Muse Spark 1.2 nie wygrał tego eksperymentu.
To ważne, bo pokazuje, że oficjalny materiał Meta nie przedstawia własnego modelu jako lidera w każdej kategorii.
Czego ten eksperyment nie dowodzi?
Nie dowodzi, że:
- Opus 5 zawsze optymalizuje kod o 74%,
- Muse zawsze daje 68,7% przyspieszenia,
- wyniki przeniosą się na dowolny kernel lub GPU.
To studium konkretnego zadania, baseline'u, harnessa i sprzętu.
22. Długi kontekst: 1 milion tokenów
Artificial Analysis potwierdza dla Muse Spark 1.2:
1M token context window
oraz:
- text input,
- image input,
- text output.[3]
Milion tokenów ma znaczenie w przypadku:
- dużych repozytoriów,
- monorepo,
- dokumentacji,
- długiej historii agentowej,
- analizy wielu plików.
Nie oznacza jednak, że należy wrzucić całe repozytorium do promptu.
Maksymalna pojemność nie gwarantuje:
- odnalezienia każdej zależności,
- prawidłowego priorytetyzowania,
- odporności na złośliwy tekst w repozytorium,
- identycznej jakości na początku i końcu kontekstu.
Muse Code korzysta dlatego również z context compaction, a nie wyłącznie z coraz większego promptu.[1]
23. Dlaczego aktualny wynik AA to 57, a w artykułach premierowych można zobaczyć 54?
To nie jest błąd do ukrycia.
5 sierpnia Artificial Analysis opublikowało wynik 54.[4]
Aktualna karta Muse Spark 1.2 z 7 sierpnia pokazuje 57 i informuje, że obecny Artificial Analysis Intelligence Index ma wersję v4.1.1.[3]
W praktyce oznacza to, że podczas cytowania benchmarków trzeba przechowywać:
model
+
effort
+
wersję benchmarku
+
datę
Na przykład:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stan: 7 sierpnia 2026
To znacznie lepsze niż napisanie:
Muse Spark 1.2 ma 57 punktów
bez żadnego kontekstu.
24. Standard tier a Contributor tier: ważna różnica dla prywatności
Standardowy Muse Spark 1.2 ma cennik:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta oferuje również mocno przeceniony Contributor tier.
Niezależne informacje prasowe opisujące oficjalną ofertę wskazują, że niższa cena wiąże się ze zgodą na wykorzystywanie aktywności użytkownika do ulepszania produktów Meta.[6]
W środowisku firmowym jest to istotna różnica.
Przed użyciem Contributor tier dla kodu:
- prywatnego,
- objętego NDA,
- zawierającego tajemnice przedsiębiorstwa,
- należącego do klienta,
należy sprawdzić dokładne warunki przetwarzania danych obowiązujące na koncie i endpointcie.
Nie należy wybierać tańszego endpointu tylko na podstawie ceny.
25. Czy Muse Spark 1.2 jest najlepszym modelem do programowania?
Na podstawie zweryfikowanych danych: nie ma podstaw do takiego stwierdzenia.
Nie jest liderem we wszystkich testach Meta
Opus 5 prowadzi w:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra także wyprzedza Muse w DeepSWE.
Jest jednak wyjątkowo mocny cenowo
Muse Spark 1.2 kosztuje znacznie mniej za output niż:
Najlepszy opis
Najbardziej defensywny wniosek brzmi:
Muse Spark 1.2 jest jednym z najbardziej interesujących modeli 2026 roku pod względem relacji agentic coding do ceny, ale Opus 5 pozostaje mocniejszy w dostępnych porównaniach jakości, a końcowy wybór powinien wynikać z własnego POC.
26. Który model wybrać?
Wybierz Muse Spark 1.2, jeśli:
- koszt długich sesji jest bardzo ważny,
- pracujesz z dużymi repozytoriami,
- chcesz używać Muse Code,
- agent ma długo pracować bez ręcznego sterowania,
- potrzebujesz persistent subagents,
- nominalna cena output musi być niska,
- wynik blisko frontier wystarcza do danego workflow.
Wybierz Claude Opus 5, jeśli:
- priorytetem jest maksymalna skuteczność,
- koszt błędu przewyższa koszt tokenów,
- używasz Claude Code,
- zadania są wyjątkowo trudne,
- własny POC potwierdza wyższy completion rate.
Wybierz GPT-5.6 Terra, jeśli:
- korzystasz z ekosystemu Codex,
- DeepSWE-podobne zadania są kluczowe,
- potrzebujesz mocnego coding modelu przy cenie niższej niż Sol,
- narzędzia OpenAI są już częścią pipeline'u.
Wybierz GPT-5.6 Sol, jeśli:
- potrzebujesz wyższej ogólnej jakości niż Muse,
- koszt API jest mniej istotny,
- workload wykorzystuje szersze reasoning poza samym codingiem.
Wybierz Kimi K3, jeśli:
- potrzebujesz otwartych wag,
- planujesz self-hosting,
- potrzebujesz własnych modyfikacji modelu,
- możesz zaakceptować większy koszt oficjalnego API.
Rozważ Grok 4.5, jeśli:
- twoje testy pokazują wysoką skuteczność w agentic workflows,
- koszt ukończonego zadania jest kluczowy,
- korzystasz z Grok Build lub kompatybilnego harnessa.
27. Jak zrobić uczciwy POC?
Nie testuj modeli na pięciu promptach.
Przygotuj minimum:
50-200 rzeczywistych zadań
z własnego repozytorium.
Kategorie
- bug fix,
- nowa funkcja,
- refactoring,
- testy,
- code review,
- migracja dependency,
- performance optimization,
- analiza logów,
- frontend ze screenshotu,
- repo-wide change,
- dokumentacja techniczna.
Dla każdego zadania mierz
success / failure
czas
koszt
liczbę tokenów
liczbę tool calls
liczbę ręcznych interwencji
liczbę regresji
Najważniejsza metryka
Nie:
który model napisał ładniejszą odpowiedź?
Tylko:
który model najczęściej dostarczył poprawny merge-ready rezultat
przy akceptowalnym koszcie i czasie?
28. Jak porównywać agentów, a nie tylko modele?
W przypadku:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build,
model nie działa w próżni.
Agent decyduje:
- jakie pliki przeczytać,
- kiedy uruchomić test,
- kiedy wykonać grep,
- czy użyć subagenta,
- jak zarządzać kontekstem,
- ile razy iterować,
- kiedy zakończyć pracę.
Dlatego warto przeprowadzić dwa testy.
Test A: model w wspólnym harnessie
ten sam agent
te same narzędzia
ten sam system prompt
te same limity
Pomaga porównać sam model.
Test B: produkt end-to-end
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Pomaga odpowiedzieć na praktyczne pytanie:
Które rozwiązanie jest najlepsze dla zespołu?
Oba testy mierzą coś innego.
29. Produkcyjna checklista Muse Spark 1.2
Benchmarki
- Zapisano wersję benchmarku.
- Zapisano datę wyniku.
- Zapisano reasoning effort.
- Zapisano nazwę agenta.
- Nie mieszano Meta Terminal-Bench z wynikiem AA.
- Nie traktuje się Meta Internal Coding Bench jako niezależnego testu.
- Sprawdzono wyniki na własnym repozytorium.
Koszt
- Mierzony jest rzeczywisty input.
- Mierzony jest cached input.
- Mierzony jest output.
- Mierzony jest koszt reasoning.
- Mierzona jest liczba tool calls.
- Koszt liczony jest per ukończone zadanie.
- Porównano co najmniej trzy modele.
- Ustalono limit kosztu pojedynczego agenta.
Repozytorium
- Agent ma minimalny zakres uprawnień.
- Sekrety nie znajdują się w łatwo dostępnych plikach.
- Produkcja nie jest dostępna bez approval.
- Merge wymaga review.
- Testy uruchamiają się automatycznie.
- Agent nie może ominąć branch protection.
- Logowane są zmiany i tool calls.
Dane
- Zweryfikowano warunki Standard tier.
- Zweryfikowano warunki Contributor tier.
- Kod klienta nie trafia do niewłaściwego endpointu.
- Polityka firmy dopuszcza wybraną usługę.
- Ustalono zasady retencji promptów i logów.
- Dane osobowe są odpowiednio chronione.
Jakość
- Agent wykonuje testy po zmianie.
- Weryfikowany jest finalny diff.
- Mierzone są regresje.
- Długie zadania mają checkpointy.
- Sprawdzono zachowanie po awarii.
- Sprawdzono duże monorepo.
- Sprawdzono zadania wielogodzinne.
30. Werdykt POLPROG
Muse Spark 1.2 jest istotniejszą premierą, niż sugerowałby numer 1.2.
Meta zbudowała model i Muse Code jako powiązany system, skupiając trening na:
- dużych repozytoriach,
- długich zadaniach,
- narzędziach,
- subagentach,
- planowaniu,
- automatycznej weryfikacji.
Wyniki potwierdzają realną poprawę nad Muse Spark 1.1.
Najmocniejsze fakty
Terminal-Bench 2.1
76,2% -> 82,9% w ewaluacji Meta
DeepSWE 1.1
53,0% -> 59,3% w ewaluacji Meta
GDPval-AA v2
1371 -> 1631 Elo w premierowym pomiarze Artificial Analysis
Ale liderem wszystkiego nadal nie jest
Opus 5 wygrywa z Muse Spark 1.2 we wszystkich trzech pokazanych przez Meta benchmarkach codingowych.
W aktualnym Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Dlaczego więc Muse Spark 1.2 jest ciekawy?
Ponieważ kosztuje:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
To sprawia, że przestaje być rozsądne pytanie:
Który model ma najwyższy benchmark?
Lepsze pytanie brzmi:
Który model daje najwyższy odsetek poprawnie ukończonych zadań za 100 USD budżetu?
W wielu zespołach odpowiedź może być inna niż model zajmujący pierwsze miejsce na jednej tabeli.
Muse Spark 1.2 wygląda obecnie jak bardzo mocny kandydat do agentowego programowania o dużej skali i kontrolowanym koszcie.
Nie jest bezwarunkowym zwycięzcą.
Jest modelem, który zdecydowanie warto umieścić w POC obok:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

