Модель не була випущена з відкритими вагами. Artificial Analysis класифікує Muse Spark 1.2 як proprietary model, а кількість параметрів публічно не розкривалася.[3]
Найцікавіша частина релізу полягає не лише в назві моделі. Meta тренувала Muse Spark 1.2 разом із Muse Code та оптимізувала модель для реального agentic environment: planning, context compaction, subagents, tool use і довгих задач, що охоплюють цілі repositories.[1]
Результати сильні, але їх потрібно трактувати обережно.
В офіційній оцінці Meta:
- Muse Spark 1.2 + Muse Code отримує 82,9% у Terminal-Bench 2.1,
- 59,3% у DeepSWE 1.1,
- 70,6% у Meta Internal Coding Bench.[1][2]
Це не означає, що Muse Spark 1.2 є найкращою моделлю для програмування на ринку. У тих самих таблицях Claude Opus 5 + Claude Code посідає перше місце в усіх трьох порівняннях. Meta також прямо зазначає, що це не ідеальне model-to-model порівняння: кожна модель запускалася з іншим agent, а test setup міг бути краще налаштований під Muse Code, ніж під інструменти конкурентів.[2]
Більш незалежну картину дає Artificial Analysis. На актуальній картці моделі, перевіреній 7 серпня, Muse Spark 1.2 з xhigh отримує 57 балів в Artificial Analysis Intelligence Index v4.1.1. Для порівняння Claude Opus 5 має 61, GPT-5.6 Sol 59, Kimi K3 57, а GPT-5.6 Terra 55.[3][7][8][9][10]
Короткий висновок: Muse Spark 1.2 не перемагає Opus 5 або GPT-5.6 Sol безумовно, але є надзвичайно конкурентним за ціною. Найсильніше він виглядає в agentic coding, особливо разом із Muse Code і там, де вартість довгих сесій має велике значення.
Усі дані в цій статті перевірено за матеріалами Meta, офіційною методологією оцінювання, Artificial Analysis та незалежними публікаціями преси. Станом на 7 серпня 2026 року.
TL;DR
| Питання | Перевірена відповідь |
|---|---|
| Коли вийшов Muse Spark 1.2? | 5 серпня 2026 |
| Хто створив модель? | Meta |
| Що таке Muse Code? | Термінальний coding agent у beta |
| Чи має Muse Spark 1.2 відкриті ваги? | Ні, модель proprietary |
| Чи відома кількість параметрів? | Ні, Meta її публічно не розкрила |
| Context | 1 млн tokens |
| Modalities | текст і зображення на input, текст на output |
| Стандартна ціна input | 1,25 USD / 1 млн tokens |
| Ціна cached input | 0,15 USD / 1 млн tokens |
| Ціна output | 4,25 USD / 1 млн tokens |
| Terminal-Bench 2.1 за Meta | 82,9% |
| DeepSWE 1.1 за Meta | 59,3% |
| Meta Internal Coding Bench | 70,6% |
| Поточний AA Intelligence Index v4.1.1 | 57 |
| AA Index у статті дня запуску | 54 |
| Чи результати Meta незалежні? | Ні, частина - evaluation виробника |
| Чи Artificial Analysis незалежна від Meta? | Так, хоча Meta дала доступ до моделі до релізу для benchmark testing |
| Найсильніша риса | agentic coding і співвідношення capabilities до ціни |
| Головне обмеження | не виграє всі бенчмарки, а частина тестів використовує різні agent harnesses |
1. Що саме випустила Meta?
Реліз включає два пов'язані продукти:
Muse Spark 1.2
model
Muse Code
terminal coding agent
Meta описує Muse Spark 1.2 як coding-focused update до Muse Spark 1.1. Компанія збільшила compute під час training на задачах програмування та розширила різноманітність training environments.[1]
Muse Code - це agent, який може:
- планувати зміни в repository,
- писати код,
- запускати tools,
- перевіряти результати,
- координувати кілька довготривалих subagents,
- зберігати прогрес у довгих sessions.[1]
Встановлення офіційного client на macOS або Linux Meta описує так:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 доступний як через Muse Code, так і через Meta Model API. Meta описує поточну доступність як широко розширену глобально.[1]
2. Muse Code - не просто wrapper навколо моделі
Для coding agents benchmark моделі та benchmark продукту - не одне й те саме.
Muse Code додає власний execution layer.
Async Background Agents
Головний agent може використовувати спеціалізованих subagents, які продовжують працювати у background. Вони створюються не лише для одного кроку й можуть залишатися активними протягом усієї session.[1]
Це має зменшувати:
- повторне збирання однакової інформації,
- latency,
- необхідність ручного керування,
- повторний аналіз repository.
Append-only event log
Muse Code локально зберігає історію:
- model calls,
- tool usage,
- approvals,
- edits.[1]
Meta описує runtime як replay-exact і restart-safe. Після збою agent може продовжити роботу з log замість того, щоб починати задачу спочатку.
Це важлива функція для coding tasks, які тривають кілька годин.
Вбудовані skills
У першій версії доступні, зокрема:
/plan
/grill
/goal
/plan готує план з етапом approval, /grill критично перевіряє план, а /goal утримує роботу в напрямку визначеної мети.[1]
3. Модель і agent тренувалися разом
Це один із найважливіших фактів для правильного читання benchmark results.
Meta не просто під'єднала нову модель до наявного CLI. Компанія заявляє про co-training Muse Spark 1.2 і Muse Code.[1]
Training включав, серед іншого:
- trajectories з agent harness,
- оптимізації для goal-oriented work,
- compaction,
- subagents,
- інтегрований Muse Code toolset.[1]
Модель також тренували на long-horizon tasks:
- генерації цілих repositories,
- великих end-to-end projects,
- auto-research,
- sequencing роботи через planning,
- утриманні напрямку через goal conditioning,
- context compression.[1]
Це допомагає зрозуміти, чому правильною одиницею порівняння іноді є:
Muse Spark 1.2 + Muse Code
а не лише:
Muse Spark 1.2
4. Self-improvement з використанням Muse Spark 1.1
Meta використала Muse Spark 1.1 для побудови training data для версії 1.2.
За офіційним описом попередня модель:
- генерувала складні coding environments,
- готувала templates складних instructions,
- оцінювала candidate solutions,
- допомагала створювати scalable dataset для Muse Spark 1.2.[1]
Meta називає цей процес self-improvement loop.
Це не означає, що модель «сама себе натренувала». Це все ще контрольований training pipeline, створений Meta, де попередня модель була одним із компонентів генерації та оцінки data.
5. Офіційний Terminal-Bench 2.1
Terminal-Bench 2.1 оцінює agents, які виконують задачі в terminal environment.
Meta використала всі 89 tasks з офіційного release 2.1. Кожен run проходив в ізольованому Daytona sandbox, а executable verifier оцінював фінальний стан container. Результат - середній pass@1 за п'ять спроб.[2]
Результати, опубліковані Meta
| Model + agent | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7% | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9% | |
| GPT-5.6 Terra + Codex | max | 81,8% | |
| Grok 4.5 + Grok Build | high | 81,6% | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9% | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2% | [1][2] |
Muse Spark 1.2 покращує результат попередника на 6,7 percentage points.
Водночас:
- відстає від Opus 5 на 3,8 pp,
- випереджає GPT-5.6 Terra на 1,1 pp,
- випереджає Grok 4.5 на 1,3 pp.
Головне застереження
Це не чистий benchmark лише underlying models.
Порівнюються системи:
model
+
agent
+
tools
+
system prompt
+
runtime
Meta використовує:
- Muse Code для Spark 1.2,
- Claude Code для Opus 5,
- Codex для GPT-5.6,
- Grok Build для Grok 4.5,
- Antigravity CLI для Gemini.[2]
Meta сама зазначає, що configuration і system prompts могли бути не оптимально налаштовані під закриті competing models.[2]
Тому правильний висновок:
У конфігурації Meta Muse Spark 1.2 + Muse Code отримав 82,9%.
А не:
Muse Spark 1.2 завжди кращий за GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 містить 113 tasks із 91 repository п'ятьма мовами:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Кожна задача має вручну підготовлений functional verifier і regression tests.
Під час rollout і grading зовнішній Internet access заблокований. Model endpoint залишається доступним.[2]
Результати Meta
| Model + agent | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0% | |
| GPT-5.6 Terra + Codex | 64,8% | |
| Muse Spark 1.2 + Muse Code | 59,3% | |
| Grok 4.5 + Grok Build | 56,6% | |
| Muse Spark 1.1 + mini-swe-agent | 53,0% | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0% | [1][2] |
Muse Spark 1.2 покращує 1.1 на 6,3 pp.
Проте тут відрив від leaders більший:
Opus 5 65,0%
GPT-5.6 64,8%
Muse 1.2 59,3%
Це сильний результат, але не перше місце.
Додаткове methodological caveat
Офіційний DeepSWE leaderboard використовує mini-swe-agent для кожної моделі.
Meta у своїй evaluation натомість використовувала окремий agent product для кожної моделі. Компанія прямо пише, що результат не є harness-identical до офіційного leaderboard.[2]
Це важливе уточнення, яке має бути поруч із 59,3%.
7. Meta Internal Coding Bench
Meta Internal Coding Bench містить 440 tasks, що походять із внутрішньої codebase Meta та реальних pull requests.[2]
Він охоплює:
- bug fixes,
- нові features,
- refactoring,
- cleanup,
- інші software-engineering tasks.
Internet вимкнений. Solutions компілюються й перевіряються unit tests. Meta виконує дві спроби на кожну задачу.[2]
Результати
| Model | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4% | |
| Muse Spark 1.2 | 70,6% | |
| Muse Spark 1.1 | 68,3% | |
| GPT-5.6 Terra | 65,4% | |
| Gemini 3.6 Flash | 63,9% | [1][2] |
Muse Spark 1.2 покращує результат попередника на 2,3 pp.
Чому цей benchmark має меншу зовнішню цінність?
Не тому, що він обов'язково неправильний.
Проблема - reproducibility.
Dataset:
- внутрішній,
- походить із приватної codebase Meta,
- не є публічним benchmark, який зовнішня команда може незалежно відтворити.
Тому результат треба трактувати як додатковий сигнал від vendor, а не як незалежний доказ переваги.
8. Незалежна перевірка: Artificial Analysis
Artificial Analysis отримала доступ до Muse Spark 1.2 від Meta до public release та провела власний набір тестів.[4]
Це важливо, бо дозволяє відокремити:
vendor benchmark
від:
benchmark незалежної організації
Важлива зміна score після запуску
Стаття Artificial Analysis від 5 серпня повідомляла:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
Поточна model card після переходу index на v4.1.1 показує:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Тому 54 не слід переносити в актуальний ranking без дати.
Benchmarks еволюціонують через:
- index versions,
- grading,
- evaluation sets,
- methodology fixes.
Production article має завжди вказувати snapshot.
9. Поточне порівняння Artificial Analysis
Model cards, перевірені 7 серпня 2026:
| Model | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* Score Grok 4.5 походить із опублікованого звіту Artificial Analysis про цю модель. Значення слід трактувати як snapshots відповідних версій benchmark, а не постійні місця в ranking.
Що це означає?
Muse Spark 1.2:
- поки не наздоганяє Opus 5 у загальному index,
- відстає від GPT-5.6 Sol на 2 бали,
- має той самий score, що й Kimi K3, на поточній AA card,
- випереджає GPT-5.6 Terra в загальному index,
- перебуває вище launch-era score Grok 4.5.
Але Artificial Analysis Intelligence Index - це не coding-only benchmark.
Поточна v4.1.1 об'єднує дев'ять evaluations, зокрема:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Тому score 57 треба читати як ширший сигнал intelligence та agentic capabilities.
10. GDPval-AA v2: найбільше покращення порівняно зі Spark 1.1
У launch snapshot Artificial Analysis GDPval-AA v2 зріс із:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
тобто на 260 Elo points.[4]
GDPval-AA v2 тестує реалістичні knowledge-work tasks.
Він містить 220 tasks із:
- 44 occupations,
- 9 major sectors економіки США.[2]
Models створюють, серед іншого:
- documents,
- spreadsheets,
- presentations,
- diagrams,
- reports.
Artificial Analysis використовує власний agentic harness Stirrup із доступом до shell і web browsing, а outputs порівнюються попарно за допомогою LLM judge.[2]
Snapshot від 5 серпня
Artificial Analysis повідомляла:
| Model | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
Це один із найсильніших доказів того, що 1.2 покращився не лише в code generation.
GDPval ranking оновлюється, тому ці цифри не слід змішувати з пізнішими leaderboard snapshots.
11. Terminal-Bench за Artificial Analysis
Meta повідомляє:
82,9%
для Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis у власному harness на момент запуску повідомляла:
80%
порівняно з:
78%
для Muse Spark 1.1.[4]
Ці результати не суперечать один одному.
Вони отримані з:
- різних harnesses,
- різних agent configurations,
- різних execution procedures.
Це хороший приклад того, чому benchmark score не слід публікувати без methodology.
12. Hallucinations: число виглядає краще, але треба читати другу половину таблиці
Artificial Analysis у launch snapshot зафіксувала покращення AA-Omniscience:
18 -> 22
і зниження hallucination rate:
38% -> 28%
На перший погляд це однозначно позитивно.
Однак одночасно:
attempt rate: 82% -> 67%
accuracy: 41% -> 38%
Модель частіше відмовлялася відповідати, коли була невпевнена.
AA-Omniscience не штрафує abstention. Тому нижчий hallucination rate частково є наслідком більшої схильності не відповідати.
Правильне трактування:
Muse Spark 1.2 рідше подавав неправильну відповідь як упевнену, але також рідше намагався відповісти.
Неправильне трактування:
Muse Spark 1.2 став на 10 percentage points точнішим.
Data цього не підтверджує.
13. Scientific reasoning не покращився рівномірно
У launch measurements Artificial Analysis:
| Benchmark | Spark 1.1 | Spark 1.2 | Зміна | |
|---|---|---|---|---|
| CritPt | 15% | 18% | +3 pp | |
| SciCode | 58% | 56% | -2 pp | |
| Humanity's Last Exam | 45% | 44% | -1 pp | [4] |
Це показує характер оновлення.
Muse Spark 1.2 - не просто:
Spark 1.1
+ кілька відсотків усюди
Найбільші launch gains були зосереджені на:
- agentic coding,
- tool use,
- professional agentic tasks.
14. Ціна API: одна з найбільших переваг Muse Spark 1.2
Стандартний pricing Meta:
| Tokens | Ціна за 1 млн | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Ціна input/output така сама, як у Muse Spark 1.1.
Порівняння публічних API prices
| Model | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
Це порівняння ціни tokens, а не вартості завершеної задачі.
Дешевша model за мільйон tokens може:
- генерувати більше tokens,
- робити більше tool calls,
- потребувати більше iterations,
- допустити помилку, яку потрібно виправляти вручну.
Тому корисніша business metric:
вартість правильно завершеної задачі
а не лише:
ціна за 1M tokens
15. Вартість task за launch-вимірюванням Artificial Analysis
У snapshot від 5 серпня Artificial Analysis повідомляла weighted average cost однієї задачі Intelligence Index:
| Model / configuration | Вартість task | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
Це дуже сильний cost result для Muse Spark 1.2.
Порівняно зі Spark 1.1, однак, вартість зросла з:
0,29 USD
до
0,40 USD
Artificial Analysis пов'язує це з більшим token usage:
- приблизно на 53% більше input tokens,
- приблизно на 36% більше output tokens,
особливо в GDPval-AA v2.[4]
Тобто версія 1.2:
краща
але
більш token-intensive
Unit price API не змінився, але agent виконує більше роботи.
16. Muse Spark 1.2 vs Claude Opus 5
Де перемагає Opus 5?
У даних Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7% | 82,9% | |
| DeepSWE 1.1 | 65,0% | 59,3% | |
| Meta Internal Coding Bench | 79,4% | 70,6% | [1] |
У поточному Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
Доступні дані не дають підстав називати Muse Spark 1.2 кращою моделлю загалом.
Де Muse має перевагу?
Передусім у token pricing:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
Для agents, що виконують тисячі operations, ця різниця може бути значною.
Висновок
Opus 5 краще обирати, коли:
- максимальна success rate важливіша за token cost,
- задача складна й помилка коштує дорого,
- команда вже використовує Claude Code.
Muse Spark 1.2 має більше сенсу, коли:
- обсяг tasks великий,
- agent довго працює над repository,
- token cost дуже важливий,
- кілька benchmark points не виправдовують значно дорожче API.
17. Muse Spark 1.2 vs GPT-5.6 Terra
Це одне з найцікавіших порівнянь.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9%
Terra + Codex: 81,8%
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3%
Terra + Codex: 64,8%
Meta Internal Coding Bench
Muse 1.2: 70,6%
Terra: 65,4%
Leader змінюється залежно від benchmark.
Artificial Analysis
Поточний overall index:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Ціна
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Це не означає автоматичну перемогу Muse. Terra помітно сильніша в DeepSWE у порівнянні Meta.
Найчесніше трактування:
Muse Spark 1.2 надзвичайно конкурентний із GPT-5.6 Terra за ціною та в частині agentic tasks, але результат залежить від типу задачі та harness.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol залишається сильнішим у ширшому index Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol коштує:
5 USD / 1M input
30 USD / 1M output
проти:
1,25 USD / 1M input
4,25 USD / 1M output
Це велика різниця для:
- довгих reasoning traces,
- subagents,
- iterative debugging,
- repo-wide refactoring,
- багатогодинних agent runs.
Якщо додаткові 2 бали overall index не перетворюються на вищий correct-completion rate у реальних задачах компанії, дорожча model не обов'язково буде економічнішою.
19. Muse Spark 1.2 vs Kimi K3
Поточна картка Artificial Analysis показує:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
Це не означає однакові capabilities.
Головна різниця
Kimi K3:
- має публічно доступні ваги,
- може бути self-hosted,
- має 2,8 трлн total parameters і 104 млрд active parameters,
- використовує власну Kimi K3 License.[10]
Muse Spark 1.2:
- proprietary,
- працює через Meta Model API,
- не має публічно розкритої кількості parameters.[3]
Ціни офіційних API
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Якщо self-hosting не потрібен, Muse значно дешевший за nominal API pricing.
Якщо організації потрібні:
- власна infrastructure,
- контроль model weights,
- custom model modifications,
Kimi K3 пропонує те, чого Muse Spark 1.2 зараз не дає.
20. Muse Spark 1.2 vs Grok 4.5
У Meta Terminal-Bench:
Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build: 81,6%
У DeepSWE:
Muse Spark 1.2: 59,3%
Grok 4.5: 56,6%
У launch-era Artificial Analysis Intelligence Index Grok 4.5 мав 54, тобто приблизно той самий рівень, що й launch snapshot Muse 1.2 до оновлення index.[4][11]
Artificial Analysis також показувала Grok 4.5 high як одну з небагатьох models із нижчою вартістю task у тому самому quality cluster:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
Це ще один приклад, що співвідношення price-quality у 2026 році вже не працює за простим правилом:
найдорожча модель
=
найвигідніша модель
21. Kernel optimization: понад 1 000 tool calls і до 24 годин роботи
Meta провела цікавий long-horizon test.
Muse Code і models мали ітеративно оптимізувати GPU kernels через:
- понад 1 000 tool calls,
- до 24 годин,
- написання коду,
- compilation,
- profiling,
- повторні optimizations.[1]
Тестували KDA та MLA на NVIDIA Hopper.
KDA
Baseline була FLA implementation у Triton. Models не могли напряму імпортувати external kernel libraries на кшталт FLA.[1]
У графіку final speedup vs baseline Meta показала, зокрема:
| Model | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0% | |
| GPT-5.6 Sol | +71,2% | |
| Claude Opus 4.8 | +69,6% | |
| Muse Spark 1.2 | +68,7% | |
| GPT-5.6 Terra | +65,1% | |
| Gemini 3.6 Flash | +62,5% | [1] |
Muse Spark 1.2 не виграв цей експеримент.
Це важливо, бо офіційний матеріал Meta не подає власну model як leader у кожній категорії.
Чого цей експеримент не доводить?
Він не доводить, що:
- Opus 5 завжди оптимізує код на 74%,
- Muse завжди дає +68,7% speedup,
- результати переносяться на будь-який kernel або GPU.
Це case study конкретної задачі, baseline, harness і hardware setup.
22. Довгий контекст: 1 мільйон tokens
Artificial Analysis підтверджує для Muse Spark 1.2:
1M token context window
а також:
- text input,
- image input,
- text output.[3]
Мільйон tokens може мати значення для:
- великих repositories,
- monorepos,
- documentation,
- довгої agent history,
- multi-file analysis.
Це не означає, що весь repository треба вставляти в один prompt.
Maximum capacity не гарантує:
- знаходження кожної dependency,
- правильної prioritization,
- resistance до malicious text у repository,
- однакової якості на початку та в кінці context.
Тому Muse Code також використовує context compaction, а не покладається лише на дедалі більші prompts.[1]
23. Чому поточний AA score - 57, а в launch articles можна побачити 54?
Це не помилка, яку треба приховувати.
Artificial Analysis опублікувала score 54 5 серпня.[4]
Поточна Muse Spark 1.2 card, перевірена 7 серпня, показує 57 і вказує v4.1.1 як актуальну версію Artificial Analysis Intelligence Index.[3]
На практиці при цитуванні benchmark потрібно зберігати:
model
+
effort
+
benchmark version
+
date
Наприклад:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
стан: 7 серпня 2026
Це набагато краще, ніж написати:
Muse Spark 1.2 має 57 балів
без контексту.
24. Standard tier vs Contributor tier: важлива різниця для privacy
Стандартний pricing Muse Spark 1.2:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta також пропонує суттєво дешевший Contributor tier.
Незалежні публікації преси, що описують офіційну пропозицію, повідомляють, що нижча ціна пов'язана зі згодою використовувати user activity для покращення продуктів Meta.[6]
Для enterprise use це важлива різниця.
Перед використанням Contributor tier для code, який:
- приватний,
- під NDA,
- містить trade secrets,
- належить client,
потрібно перевірити точні data-processing terms для конкретного account і endpoint.
Не слід обирати дешевший endpoint лише через ціну.
25. Чи Muse Spark 1.2 - найкраща модель для програмування?
За перевіреними даними: підстав для такого твердження немає.
Вона не лідирує в усіх benchmark Meta
Opus 5 лідирує в:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra також випереджає Muse в DeepSWE.
Але Muse надзвичайно сильний за ціною
Muse Spark 1.2 має значно нижчу output price, ніж:
Найбільш обґрунтоване формулювання
Muse Spark 1.2 - одна з найцікавіших моделей 2026 року за співвідношенням agentic-coding capabilities до ціни. Opus 5 залишається сильнішим у доступних quality comparisons, а фінальний вибір має базуватися на власному POC.
26. Яку модель обрати?
Обирайте Muse Spark 1.2, якщо:
- вартість довгих sessions дуже важлива,
- ви працюєте з великими repositories,
- хочете використовувати Muse Code,
- agent має довго працювати без ручного steering,
- потрібні persistent subagents,
- nominal output price має бути низькою,
- near-frontier performance достатньо для workflow.
Обирайте Claude Opus 5, якщо:
- максимальна success rate - пріоритет,
- ціна помилки вища за token cost,
- ви вже використовуєте Claude Code,
- tasks надзвичайно складні,
- ваш POC підтверджує вищу completion rate.
Обирайте GPT-5.6 Terra, якщо:
- ви використовуєте екосистему Codex,
- DeepSWE-like tasks є ключовими,
- потрібна сильна coding model дешевша за Sol,
- OpenAI tools уже є частиною pipeline.
Обирайте GPT-5.6 Sol, якщо:
- потрібні вищі general capabilities, ніж у Muse,
- API cost менш важливий,
- workload використовує ширший reasoning, ніж тільки coding.
Обирайте Kimi K3, якщо:
- потрібні open weights,
- планується self-hosting,
- потрібні custom model modifications,
- вища ціна офіційного API прийнятна.
Розгляньте Grok 4.5, якщо:
- власні тести показують сильні agentic results,
- cost per completed task - головна метрика,
- ви використовуєте Grok Build або compatible harness.
27. Як зробити чесний POC
Не тестуйте models на п'яти prompts.
Підготуйте щонайменше:
50-200 реальних tasks
із власного repository.
Категорії
- bug fix,
- new feature,
- refactoring,
- tests,
- code review,
- dependency migration,
- performance optimization,
- log analysis,
- frontend зі screenshot,
- repo-wide change,
- technical documentation.
Для кожної task вимірюйте
success / failure
time
cost
token count
tool-call count
manual interventions
regressions
Найважливіша метрика
Не:
яка модель написала найкрасивішу відповідь?
А:
яка модель найчастіше дала правильний, merge-ready результат
за прийнятних cost і time?
28. Як порівнювати agents, а не лише models
Для:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build
модель не працює ізольовано.
Agent вирішує:
- які files читати,
- коли запускати tests,
- коли використовувати grep,
- чи використовувати subagent,
- як керувати context,
- скільки iterations робити,
- коли завершити роботу.
Тому корисно провести два тести.
Test A: модель у спільному harness
той самий agent
ті самі tools
той самий system prompt
ті самі limits
Це допомагає порівняти underlying models.
Test B: end-to-end product
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Це відповідає на практичне питання:
Яке рішення найкраще для команди?
Ці два тести вимірюють різні речі.
29. Production checklist для Muse Spark 1.2
Benchmarks
- Збережено benchmark version.
- Збережено дату score.
- Збережено reasoning effort.
- Збережено назву agent.
- Meta Terminal-Bench не змішується з AA result.
- Meta Internal Coding Bench не трактується як незалежний benchmark.
- Results перевірено на власному repository.
Cost
- Вимірюється реальний input.
- Вимірюється cached input.
- Вимірюється output.
- Вимірюється reasoning cost.
- Вимірюється tool-call count.
- Cost рахується per completed task.
- Порівнюється щонайменше три models.
- Встановлено spending limit на agent.
Repository
- Agent має мінімально необхідні permissions.
- Secrets не знаходяться в легко доступних files.
- Production access потребує approval.
- Merge потребує review.
- Tests запускаються автоматично.
- Agent не може обійти branch protection.
- Changes і tool calls логуються.
Data
- Перевірено terms Standard tier.
- Перевірено terms Contributor tier.
- Client code не йде на неправильний endpoint.
- Company policy дозволяє вибраний service.
- Визначено правила retention prompts і logs.
- Personal data належно захищені.
Quality
- Agent запускає tests після змін.
- Final diff перевіряється.
- Regressions вимірюються.
- Long tasks мають checkpoints.
- Recovery після failure протестовано.
- Large monorepos протестовано.
- Multi-hour tasks протестовано.
30. Вердикт POLPROG
Muse Spark 1.2 - важливіший реліз, ніж може здатися з номера 1.2.
Meta побудувала model і Muse Code як пов'язану систему, зосередивши training на:
- великих repositories,
- long-running tasks,
- tools,
- subagents,
- planning,
- automated verification.
Результати підтверджують реальне покращення порівняно з Muse Spark 1.1.
Найсильніші факти
Terminal-Bench 2.1
76,2% -> 82,9% в evaluation Meta
DeepSWE 1.1
53,0% -> 59,3% в evaluation Meta
GDPval-AA v2
1371 -> 1631 Elo в launch snapshot Artificial Analysis
Але модель усе ще не leader у всьому
Opus 5 перемагає Muse Spark 1.2 у всіх трьох coding benchmarks, показаних Meta.
У поточному snapshot Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Чому тоді Muse Spark 1.2 цікавий?
Тому що він коштує:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Через це менш корисним стає питання:
Яка модель має найвищий benchmark score?
Краще питання:
Яка модель дає найбільшу кількість правильно завершених tasks на 100 USD budget?
Для багатьох teams відповідь може відрізнятися від model, яка посідає перше місце в одній таблиці.
Muse Spark 1.2 зараз виглядає як дуже сильний кандидат для масштабного agentic coding із контрольованою вартістю.
Це не безумовний переможець.
Але модель явно варто включити в POC поруч із:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

