Il modello non è stato pubblicato con pesi aperti. Artificial Analysis classifica Muse Spark 1.2 come modello proprietary e il numero di parametri non è stato reso pubblico.[3]
La parte più interessante del lancio non è però solo il nome del modello. Meta ha addestrato Muse Spark 1.2 insieme a Muse Code e lo ha ottimizzato per un vero ambiente agentic: pianificazione, context compaction, subagenti, uso di strumenti e attività di lunga durata che coinvolgono repository interi.[1]
I risultati sono forti, ma richiedono un'interpretazione prudente.
Nella valutazione ufficiale Meta:
- Muse Spark 1.2 + Muse Code raggiunge 82,9% in Terminal-Bench 2.1,
- 59,3% in DeepSWE 1.1,
- 70,6% in Meta Internal Coding Bench.[1][2]
Questo non significa che Muse Spark 1.2 sia il miglior modello di programmazione sul mercato. Nelle stesse tabelle, Claude Opus 5 + Claude Code è primo in tutti e tre i confronti. Meta stessa segnala inoltre che il confronto non è un perfetto model-to-model: ogni modello è stato eseguito con un agente diverso e la configurazione di test potrebbe essere stata più adatta a Muse Code che agli strumenti concorrenti.[2]
Artificial Analysis offre una prospettiva più indipendente. Nella scheda attuale verificata il 7 agosto, Muse Spark 1.2 con xhigh ottiene 57 punti nell'Artificial Analysis Intelligence Index v4.1.1. Per confronto, Claude Opus 5 ha 61, GPT-5.6 Sol 59, Kimi K3 57 e GPT-5.6 Terra 55.[3][7][8][9][10]
Conclusione breve: Muse Spark 1.2 non supera in modo assoluto Opus 5 o GPT-5.6 Sol, ma è eccezionalmente competitivo sul prezzo. Il suo profilo migliore è la programmazione agentic, soprattutto con Muse Code e quando il costo delle sessioni lunghe conta molto.
Tutti i dati dell'articolo sono stati verificati sui materiali Meta, sulla metodologia ufficiale di valutazione, su Artificial Analysis e su fonti di stampa indipendenti. Stato al 7 agosto 2026.
TL;DR
| Domanda | Risposta verificata |
|---|---|
| Quando è uscito Muse Spark 1.2? | 5 agosto 2026 |
| Chi ha creato il modello? | Meta |
| Cos'è Muse Code? | Agente di programmazione da terminale in beta |
| Muse Spark 1.2 ha pesi aperti? | No, il modello è proprietary |
| Conosciamo il numero di parametri? | No, Meta non lo ha pubblicato |
| Contesto | 1 milione di token |
| Modalità | testo e immagine in input, testo in output |
| Prezzo standard input | 1,25 USD / 1M token |
| Prezzo cached input | 0,15 USD / 1M token |
| Prezzo output | 4,25 USD / 1M token |
| Terminal-Bench 2.1 secondo Meta | 82,9% |
| DeepSWE 1.1 secondo Meta | 59,3% |
| Meta Internal Coding Bench | 70,6% |
| AA Intelligence Index v4.1.1 attuale | 57 |
| AA Index nell'articolo del giorno del lancio | 54 |
| I risultati Meta sono indipendenti? | No, parte sono valutazioni del produttore |
| Artificial Analysis è indipendente da Meta? | Sì, anche se Meta ha fornito accesso pre-lancio per i benchmark |
| Punto di forza principale | programmazione agentic e rapporto capacità/prezzo |
| Limite principale | non vince tutti i benchmark e alcuni test usano agent harness differenti |
1. Cosa ha pubblicato esattamente Meta?
Il lancio comprende due prodotti collegati:
Muse Spark 1.2
modello
Muse Code
agente di programmazione da terminale
Meta descrive Muse Spark 1.2 come un aggiornamento di Muse Spark 1.1 focalizzato sul coding. È stato aumentato il compute usato durante il training su task di programmazione e ampliata la varietà degli ambienti di training.[1]
Muse Code è un agente in grado di:
- pianificare modifiche al repository,
- scrivere codice,
- eseguire strumenti,
- validare i risultati,
- coordinare più subagenti di lunga durata,
- mantenere il progresso durante sessioni lunghe.[1]
Meta descrive così l'installazione del client ufficiale su macOS o Linux:
curl -fsSL https://dev.meta.ai/install.sh | bash
Muse Spark 1.2 è disponibile sia attraverso Muse Code sia tramite Meta Model API. Meta descrive la disponibilità attuale come ampiamente estesa a livello globale.[1]
2. Muse Code non è solo un semplice wrapper del modello
Per i coding agent, il benchmark del modello e quello del prodotto non sono la stessa cosa.
Muse Code aggiunge un proprio livello di esecuzione.
Async Background Agents
L'agente principale può utilizzare subagenti specializzati che continuano a lavorare in background. Non vengono creati solo per un singolo passo e possono rimanere attivi per tutta la sessione.[1]
Questo dovrebbe ridurre:
- la raccolta ripetuta delle stesse informazioni,
- la latenza,
- la necessità di guidare manualmente l'agente,
- l'analisi ripetuta del repository.
Append-only event log
Muse Code salva localmente una cronologia di:
- chiamate al modello,
- utilizzo degli strumenti,
- approvazioni,
- modifiche.[1]
Meta descrive il runtime come replay-exact e restart-safe. Dopo un errore, l'agente può riprendere dal log invece di ricominciare il task da zero.
È una funzione importante per attività di programmazione di molte ore.
Skill integrate
La versione iniziale include, tra le altre:
/plan
/grill
/goal
/plan prepara un piano con passaggio di approvazione, /grill verifica criticamente il piano e /goal mantiene il lavoro orientato a un obiettivo definito.[1]
3. Modello e agente sono stati addestrati insieme
È uno dei punti più importanti per interpretare i benchmark.
Meta non ha semplicemente collegato un nuovo modello a una CLI esistente. L'azienda dichiara il co-training di Muse Spark 1.2 e Muse Code.[1]
Il training includeva, tra l'altro:
- trajectories dall'agent harness,
- ottimizzazioni per il lavoro basato su obiettivi,
- compaction,
- subagenti,
- il set integrato di strumenti Muse Code.[1]
Il modello è stato inoltre addestrato su attività long-horizon:
- generazione di repository completi,
- grandi progetti end-to-end,
- auto-research,
- sequenziamento del lavoro tramite planning,
- mantenimento della direzione tramite goal conditioning,
- compressione del contesto.[1]
Questo aiuta a capire perché l'unità di confronto corretta talvolta è:
Muse Spark 1.2 + Muse Code
e non solo:
Muse Spark 1.2
4. Self-improvement con Muse Spark 1.1
Meta ha usato Muse Spark 1.1 per costruire dati di training per la versione 1.2.
Secondo la descrizione ufficiale, il modello precedente:
- generava ambienti di programmazione difficili,
- preparava template di istruzioni complesse,
- valutava soluzioni candidate,
- aiutava a creare un dataset scalabile per Muse Spark 1.2.[1]
Meta definisce il processo self-improvement loop.
Non significa che il modello “si sia addestrato da solo”. Si tratta ancora di una pipeline controllata e progettata da Meta, in cui il modello precedente era uno dei componenti per generare e valutare i dati.
5. Terminal-Bench 2.1 ufficiale
Terminal-Bench 2.1 valuta agenti che eseguono task in un ambiente terminale.
Meta ha usato tutti gli 89 task della release ufficiale 2.1. Ogni tentativo si è svolto in una sandbox Daytona isolata e un executable verifier ha valutato lo stato finale del container. Il punteggio è la media pass@1 su cinque tentativi.[2]
Risultati pubblicati da Meta
| Modello + agente | Effort | Terminal-Bench 2.1 | |
|---|---|---|---|
| Claude Opus 5 + Claude Code | max | 86,7% | |
| Muse Spark 1.2 + Muse Code | xhigh | 82,9% | |
| GPT-5.6 Terra + Codex | max | 81,8% | |
| Grok 4.5 + Grok Build | high | 81,6% | |
| Gemini 3.6 Flash + Antigravity CLI | high | 78,9% | |
| Muse Spark 1.1 + mini-swe-agent | xhigh | 76,2% | [1][2] |
Muse Spark 1.2 migliora il risultato del predecessore di 6,7 punti percentuali.
Allo stesso tempo:
- è 3,8 pp dietro Opus 5,
- 1,1 pp davanti a GPT-5.6 Terra,
- 1,3 pp davanti a Grok 4.5.
La principale riserva
Non è un benchmark puro dei soli modelli.
I sistemi confrontati sono:
modello
+
agente
+
strumenti
+
system prompt
+
runtime
Meta usa:
- Muse Code per Spark 1.2,
- Claude Code per Opus 5,
- Codex per GPT-5.6,
- Grok Build per Grok 4.5,
- Antigravity CLI per Gemini.[2]
Meta stessa osserva che configurazione e system prompts potrebbero non essere stati ottimizzati per i modelli chiusi concorrenti.[2]
La conclusione corretta è quindi:
Nella configurazione Meta, Muse Spark 1.2 + Muse Code ha ottenuto 82,9%.
Non:
Muse Spark 1.2 è sempre migliore di GPT-5.6 Terra.
6. DeepSWE 1.1
DeepSWE v1.1 contiene 113 task da 91 repository in cinque linguaggi:
- TypeScript,
- Go,
- Python,
- JavaScript,
- Rust.[2]
Ogni task ha un verifier funzionale preparato manualmente e test di regressione.
Durante rollout e grading l'accesso a Internet esterno è bloccato. L'endpoint del modello resta disponibile.[2]
Risultati Meta
| Modello + agente | DeepSWE 1.1 | |
|---|---|---|
| Claude Opus 5 + Claude Code | 65,0% | |
| GPT-5.6 Terra + Codex | 64,8% | |
| Muse Spark 1.2 + Muse Code | 59,3% | |
| Grok 4.5 + Grok Build | 56,6% | |
| Muse Spark 1.1 + mini-swe-agent | 53,0% | |
| Gemini 3.6 Flash + Antigravity CLI | 40,0% | [1][2] |
Muse Spark 1.2 migliora la 1.1 di 6,3 pp.
Qui però la distanza dai leader è maggiore:
Opus 5 65,0%
GPT-5.6 64,8%
Muse 1.2 59,3%
È un risultato forte, ma non il primo posto.
Ulteriore limitazione metodologica
La leaderboard ufficiale DeepSWE usa mini-swe-agent per ogni modello.
La valutazione di Meta ha usato invece un diverso prodotto agente per ogni modello. L'azienda scrive esplicitamente che il risultato non è harness-identical con la leaderboard ufficiale.[2]
È un'informazione importante da riportare insieme al 59,3%.
7. Meta Internal Coding Bench
Meta Internal Coding Bench contiene 440 task provenienti dal codebase interno Meta e da pull request reali.[2]
Comprende:
- bug fix,
- nuove funzionalità,
- refactoring,
- cleanup,
- altri task di software engineering.
Internet è disabilitato. Le soluzioni vengono compilate e verificate con unit test. Meta esegue due tentativi per task.[2]
Risultati
| Modello | Meta Internal Coding Bench | |
|---|---|---|
| Claude Opus 5 | 79,4% | |
| Muse Spark 1.2 | 70,6% | |
| Muse Spark 1.1 | 68,3% | |
| GPT-5.6 Terra | 65,4% | |
| Gemini 3.6 Flash | 63,9% | [1][2] |
Muse Spark 1.2 migliora il predecessore di 2,3 pp.
Perché questo benchmark ha meno valore esterno?
Non perché debba essere sbagliato.
Il problema è la riproducibilità.
Il dataset:
- è interno,
- proviene dal codebase privato Meta,
- non è un benchmark pubblico riproducibile da team esterni.
Il risultato va quindi trattato come un segnale aggiuntivo del produttore, non come prova indipendente di superiorità.
8. Controllo indipendente: Artificial Analysis
Artificial Analysis ha ricevuto da Meta accesso a Muse Spark 1.2 prima del lancio pubblico e ha eseguito il proprio set di test.[4]
È importante perché consente di separare:
benchmark del produttore
da:
benchmark di un'organizzazione indipendente
Importante cambiamento del punteggio dopo il lancio
L'articolo Artificial Analysis del 5 agosto riportava:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54
La scheda attuale del modello, dopo il passaggio dell'indice a v4.1.1, mostra:
Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57
Non bisogna quindi copiare 54 in una classifica attuale senza indicare la data.
I benchmark cambiano attraverso:
- versioni dell'indice,
- grading,
- set di valutazione,
- correzioni metodologiche.
Un articolo di produzione dovrebbe sempre indicare lo snapshot.
9. Confronto attuale Artificial Analysis
Schede verificate il 7 agosto 2026:
| Modello | AA Intelligence Index | |
|---|---|---|
| Claude Opus 5, max | 61 | |
| GPT-5.6 Sol, max | 59 | |
| Muse Spark 1.2, xhigh | 57 | |
| Kimi K3, max | 57 | |
| GPT-5.6 Terra, max | 55 | |
| Grok 4.5, high | 54* | [3][7][8][9][10][11] |
\* Il punteggio di Grok 4.5 proviene dal report pubblicato da Artificial Analysis su quel modello. I valori vanno trattati come snapshot delle relative versioni del benchmark, non come posizioni permanenti.
Cosa ne deriva?
Muse Spark 1.2:
- non raggiunge attualmente Opus 5 nell'indice generale,
- resta 2 punti dietro GPT-5.6 Sol,
- è allo stesso livello di Kimi K3 nella scheda AA attuale,
- supera GPT-5.6 Terra nell'indice generale,
- è sopra il risultato di lancio di Grok 4.5.
Ma Artificial Analysis Intelligence Index non è un benchmark esclusivamente di coding.
La versione v4.1.1 combina nove valutazioni, tra cui:
- GDPval-AA v2,
- τ³-Banking,
- Terminal-Bench v2.1,
- SciCode,
- Humanity's Last Exam,
- GPQA Diamond,
- CritPt,
- AA-Omniscience,
- AA-LCR.[3]
Il 57 va quindi letto come segnale più ampio di intelligenza e capacità agentic.
10. GDPval-AA v2: il miglior incremento rispetto a Spark 1.1
Nello snapshot di lancio Artificial Analysis, GDPval-AA v2 è salito da:
Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo
cioè +260 punti Elo.[4]
GDPval-AA v2 misura task realistici di knowledge work.
Contiene 220 task provenienti da:
- 44 professioni,
- 9 principali settori dell'economia statunitense.[2]
I modelli producono, tra l'altro:
- documenti,
- fogli di calcolo,
- presentazioni,
- diagrammi,
- report.
Artificial Analysis usa il proprio agentic harness Stirrup con accesso a shell e web browsing e confronta i risultati a coppie mediante un giudice LLM.[2]
Snapshot del 5 agosto
Artificial Analysis riportava:
| Modello | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 | 1852 | |
| GPT-5.6 Sol | 1730 | |
| Kimi K3 | 1685 | |
| Muse Spark 1.2 | 1631 | |
| Claude Opus 4.8 | 1588 | [4] |
È una delle prove più forti che 1.2 sia migliorato oltre la sola generazione di codice.
La classifica GDPval viene aggiornata, quindi queste cifre non vanno mescolate con snapshot successivi.
11. Terminal-Bench secondo Artificial Analysis
Meta riporta:
82,9%
per Muse Spark 1.2 + Muse Code.[1]
Artificial Analysis nel proprio harness riportava al lancio:
80%
contro:
78%
per Muse Spark 1.1.[4]
I risultati non sono in contraddizione.
Derivano da:
- harness differenti,
- configurazioni agenti differenti,
- procedure di esecuzione differenti.
È un buon esempio del perché un punteggio benchmark non dovrebbe essere pubblicato senza metodologia.
12. Hallucination: il dato sembra migliore, ma va letta l'altra metà della tabella
Artificial Analysis ha rilevato nello snapshot di lancio un miglioramento di AA-Omniscience:
18 -> 22
e un calo dell'hallucination rate:
38% -> 28%
A prima vista sembra chiaramente positivo.
Tuttavia contemporaneamente:
attempt rate: 82% -> 67%
accuracy: 41% -> 38%
Il modello rinunciava più spesso a rispondere quando non era sicuro.
AA-Omniscience non penalizza l'astensione. Il minor hallucination rate deriva quindi in parte da una maggiore propensione a non rispondere.
Interpretazione corretta:
Muse Spark 1.2 presentava meno spesso una risposta errata come certa, ma tentava anche meno spesso di rispondere.
Interpretazione errata:
Muse Spark 1.2 è diventato 10 punti percentuali più accurato.
I dati non supportano questa conclusione.
13. Il scientific reasoning non è migliorato in modo uniforme
Nelle misurazioni di lancio Artificial Analysis:
| Benchmark | Spark 1.1 | Spark 1.2 | Variazione | |
|---|---|---|---|---|
| CritPt | 15% | 18% | +3 pp | |
| SciCode | 58% | 56% | -2 pp | |
| Humanity's Last Exam | 45% | 44% | -1 pp | [4] |
È importante perché mostra la natura dell'aggiornamento.
Muse Spark 1.2 non è semplicemente:
Spark 1.1
+ qualche punto ovunque
I maggiori miglioramenti del lancio erano concentrati su:
- programmazione agentic,
- uso di strumenti,
- task professionali agentic.
14. Prezzo API: uno dei maggiori punti di forza di Muse Spark 1.2
Listino standard Meta:
| Token | Prezzo per 1M | |
|---|---|---|
| Cached input | 0,15 USD | |
| Input | 1,25 USD | |
| Output | 4,25 USD | [3][5][6] |
Il prezzo input/output è uguale a Muse Spark 1.1.
Confronto dei prezzi API pubblici
| Modello | Input / 1M | Output / 1M | |
|---|---|---|---|
| Muse Spark 1.2 | 1,25 USD | 4,25 USD | |
| GPT-5.6 Terra | 2,50 USD | 15,00 USD | |
| Kimi K3 | 3,00 USD | 15,00 USD | |
| Claude Opus 5 | 5,00 USD | 25,00 USD | |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | [3][7][8][9][10] |
È un confronto del prezzo per token, non del costo per task completato.
Un modello più economico per milione di token può:
- generare più token,
- fare più tool calls,
- richiedere più iterazioni,
- commettere un errore che richiede correzione manuale.
La metrica business più utile è quindi:
costo per task correttamente completato
non solo:
prezzo per 1M token
15. Costo per task secondo lo snapshot di lancio Artificial Analysis
Nel snapshot del 5 agosto, Artificial Analysis riportava il costo medio ponderato di un task dell'Intelligence Index:
| Modello / configurazione | Costo task | |
|---|---|---|
| Grok 4.5 high | 0,37 USD | |
| GPT-5.6 Sol medium | 0,39 USD | |
| Muse Spark 1.2 xhigh | 0,40 USD | |
| GPT-5.6 Terra max | 0,51 USD | |
| Kimi K3 max | 0,86 USD | |
| GPT-5.5 xhigh | 1,18 USD | [4] |
È un risultato costo molto buono per Muse Spark 1.2.
Rispetto a Spark 1.1, però, il costo è aumentato da:
0,29 USD
a
0,40 USD
Artificial Analysis lo collega a un maggiore uso di token:
- circa 53% di input token in più,
- circa 36% di output token in più,
soprattutto in GDPval-AA v2.[4]
Quindi la 1.2 è:
migliore
ma
più intensiva in token
Il prezzo unitario API non è cambiato, ma l'agente svolge più lavoro.
16. Muse Spark 1.2 vs Claude Opus 5
Dove vince Opus 5?
Nei dati Meta:
| Benchmark | Opus 5 | Muse 1.2 | |
|---|---|---|---|
| Terminal-Bench 2.1 | 86,7% | 82,9% | |
| DeepSWE 1.1 | 65,0% | 59,3% | |
| Meta Internal Coding Bench | 79,4% | 70,6% | [1] |
Nell'attuale Artificial Analysis Intelligence Index:
Opus 5: 61
Muse 1.2: 57
I dati disponibili non permettono di definire Muse Spark 1.2 il modello migliore in generale.
Dove Muse ha un vantaggio?
Soprattutto nel prezzo dei token:
Muse Spark 1.2
1,25 / 4,25 USD
Claude Opus 5
5 / 25 USD
Per agenti che svolgono migliaia di operazioni, la differenza può essere significativa.
Conclusione
Opus 5 è preferibile quando:
- la massima probabilità di successo conta più del costo token,
- il task è difficile e il costo dell'errore è alto,
- il team usa già Claude Code.
Muse Spark 1.2 ha più senso quando:
- il volume di task è elevato,
- l'agente lavora a lungo su un repository,
- il costo dei token è molto importante,
- pochi punti di benchmark non giustificano un'API molto più costosa.
17. Muse Spark 1.2 vs GPT-5.6 Terra
È uno dei confronti più interessanti.
Meta Terminal-Bench
Muse 1.2 + Muse Code: 82,9%
Terra + Codex: 81,8%
Meta DeepSWE
Muse 1.2 + Muse Code: 59,3%
Terra + Codex: 64,8%
Meta Internal Coding Bench
Muse 1.2: 70,6%
Terra: 65,4%
Il leader cambia a seconda del benchmark.
Artificial Analysis
Indice generale attuale:
Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max: 55
Prezzo
Muse:
1,25 / 4,25 USD
Terra:
2,50 / 15 USD
Non significa che Muse vinca automaticamente. Terra è chiaramente più forte in DeepSWE nel confronto Meta.
L'interpretazione più corretta è:
Muse Spark 1.2 è eccezionalmente competitivo rispetto a GPT-5.6 Terra per prezzo e alcuni task agentic, ma il risultato dipende dal tipo di task e dall'harness.
18. Muse Spark 1.2 vs GPT-5.6 Sol
GPT-5.6 Sol resta più forte nell'indice più ampio di Artificial Analysis:
GPT-5.6 Sol max: 59
Muse Spark 1.2: 57
Sol costa:
5 USD / 1M input
30 USD / 1M output
contro:
1,25 USD / 1M input
4,25 USD / 1M output
È una differenza grande per:
- reasoning trace lunghi,
- subagenti,
- debugging iterativo,
- refactoring repository-wide,
- agent run di più ore.
Se i 2 punti extra nell'indice generale non si traducono in una maggiore percentuale di completamento corretto nei task reali dell'azienda, il modello più costoso potrebbe non essere più conveniente.
19. Muse Spark 1.2 vs Kimi K3
La scheda attuale Artificial Analysis mostra:
Muse Spark 1.2 xhigh: 57
Kimi K3 max: 57
Non significa capacità identiche.
Differenza principale
Kimi K3:
- ha pesi pubblicamente disponibili,
- può essere self-hosted,
- ha 2,8 trilioni di parametri totali e 104 miliardi attivi,
- usa la propria Kimi K3 License.[10]
Muse Spark 1.2:
- è proprietary,
- funziona tramite Meta Model API,
- non ha un numero di parametri pubblico.[3]
Prezzi API ufficiali
Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input
Kimi K3:
3 USD input
15 USD output
0,30 USD cached input
Se il self-hosting non è necessario, Muse è molto più economico nel prezzo nominale API.
Se un'organizzazione necessita di:
- infrastruttura propria,
- controllo sui pesi,
- modifiche personalizzate del modello,
Kimi K3 offre qualcosa che Muse Spark 1.2 attualmente non offre.
20. Muse Spark 1.2 vs Grok 4.5
Nel Terminal-Bench Meta:
Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build: 81,6%
Nel DeepSWE:
Muse Spark 1.2: 59,3%
Grok 4.5: 56,6%
Nell'Artificial Analysis Intelligence Index al lancio, Grok 4.5 aveva 54, paragonabile allo snapshot di lancio di Muse 1.2 prima dell'aggiornamento dell'indice.[4][11]
Artificial Analysis indicava anche Grok 4.5 high come uno dei pochi modelli con costo per task più basso nello stesso cluster di qualità:
Grok 4.5 high: 0,37 USD
Muse 1.2 xhigh: 0,40 USD
È un altro esempio del fatto che nel 2026 il rapporto prezzo-qualità non segue più una semplice regola:
modello più costoso
=
modello più conveniente
21. Ottimizzazione kernel: oltre 1.000 tool call e fino a 24 ore di lavoro
Meta ha svolto un interessante test long-horizon.
Muse Code e i modelli dovevano ottimizzare iterativamente GPU kernel tramite:
- oltre 1.000 tool call,
- fino a 24 ore,
- scrittura di codice,
- compilazione,
- profiling,
- ottimizzazioni successive.[1]
Sono stati testati KDA e MLA su NVIDIA Hopper.
KDA
La baseline era un'implementazione FLA in Triton. I modelli non potevano importare direttamente librerie kernel esterne come FLA.[1]
Nel grafico del speedup finale rispetto alla baseline, Meta mostrava, tra gli altri:
| Modello | Speedup vs baseline | |
|---|---|---|
| Claude Opus 5 | +74,0% | |
| GPT-5.6 Sol | +71,2% | |
| Claude Opus 4.8 | +69,6% | |
| Muse Spark 1.2 | +68,7% | |
| GPT-5.6 Terra | +65,1% | |
| Gemini 3.6 Flash | +62,5% | [1] |
Muse Spark 1.2 non ha vinto questo esperimento.
È importante perché il materiale ufficiale Meta non presenta il proprio modello come leader in ogni categoria.
Cosa non dimostra l'esperimento?
Non dimostra che:
- Opus 5 ottimizzi sempre il codice del 74%,
- Muse fornisca sempre +68,7%,
- i risultati si trasferiscano a qualunque kernel o GPU.
È un case study per un task, baseline, harness e hardware specifici.
22. Contesto lungo: 1 milione di token
Artificial Analysis conferma per Muse Spark 1.2:
1M token context window
e:
- text input,
- image input,
- text output.[3]
Un milione di token può essere utile per:
- grandi repository,
- monorepo,
- documentazione,
- lunga cronologia agentica,
- analisi di molti file.
Non significa che convenga inserire un repository intero nel prompt.
La capacità massima non garantisce:
- di trovare ogni dipendenza,
- una corretta prioritizzazione,
- resistenza a testo malevolo nel repository,
- qualità identica all'inizio e alla fine del contesto.
Muse Code usa quindi anche context compaction, invece di affidarsi solo a prompt sempre più grandi.[1]
23. Perché il punteggio AA attuale è 57 mentre negli articoli di lancio si trova 54?
Non è un errore da nascondere.
Artificial Analysis ha pubblicato 54 il 5 agosto.[4]
La scheda attuale di Muse Spark 1.2 verificata il 7 agosto mostra 57 e indica v4.1.1 come versione corrente di Artificial Analysis Intelligence Index.[3]
Quando si citano benchmark occorre conservare:
modello
+
effort
+
versione del benchmark
+
data
Per esempio:
Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stato: 7 agosto 2026
È molto meglio che scrivere:
Muse Spark 1.2 ha 57 punti
senza contesto.
24. Standard tier vs Contributor tier: differenza importante per la privacy
Il listino standard Muse Spark 1.2 è:
input: 1,25 USD / 1M
cached input: 0,15 USD / 1M
output: 4,25 USD / 1M
Meta offre anche un Contributor tier fortemente scontato.
La stampa indipendente che descrive l'offerta ufficiale indica che il prezzo inferiore è legato al consenso all'uso dell'attività dell'utente per migliorare i prodotti Meta.[6]
In ambiente aziendale è una differenza importante.
Prima di usare Contributor tier per codice:
- privato,
- soggetto a NDA,
- contenente segreti commerciali,
- appartenente a un cliente,
bisogna verificare le esatte condizioni di trattamento dei dati applicabili all'account e all'endpoint.
Non va scelto l'endpoint più economico basandosi solo sul prezzo.
25. Muse Spark 1.2 è il miglior modello per programmare?
In base ai dati verificati: non ci sono basi per affermarlo.
Non guida tutti i benchmark Meta
Opus 5 è primo in:
- Terminal-Bench 2.1,
- DeepSWE 1.1,
- Meta Internal Coding Bench.[1]
GPT-5.6 Terra supera Muse anche in DeepSWE.
Ma Muse è eccezionalmente forte sul prezzo
Muse Spark 1.2 ha un prezzo output molto più basso di:
Descrizione più difendibile
Muse Spark 1.2 è uno dei modelli più interessanti del 2026 per rapporto tra capacità di agentic coding e prezzo. Opus 5 resta più forte nei confronti di qualità disponibili e la scelta finale dovrebbe derivare da un POC interno.
26. Quale modello scegliere?
Scegli Muse Spark 1.2 se:
- il costo delle sessioni lunghe è molto importante,
- lavori con grandi repository,
- vuoi usare Muse Code,
- l'agente deve lavorare a lungo senza guida manuale,
- servono subagenti persistenti,
- il prezzo nominale dell'output deve rimanere basso,
- prestazioni vicine al frontier sono sufficienti.
Scegli Claude Opus 5 se:
- la massima percentuale di successo è prioritaria,
- il costo dell'errore supera il costo dei token,
- usi già Claude Code,
- i task sono particolarmente difficili,
- il tuo POC conferma una completion rate più alta.
Scegli GPT-5.6 Terra se:
- usi l'ecosistema Codex,
- i task simili a DeepSWE sono centrali,
- serve un forte coding model meno caro di Sol,
- gli strumenti OpenAI sono già nel pipeline.
Scegli GPT-5.6 Sol se:
- serve una capacità generale superiore a Muse,
- il costo API è meno importante,
- il workload richiede reasoning più ampio del solo coding.
Scegli Kimi K3 se:
- servono pesi aperti,
- pianifichi self-hosting,
- servono modifiche personalizzate del modello,
- puoi accettare un prezzo API ufficiale maggiore.
Considera Grok 4.5 se:
- i test interni mostrano forte efficacia agentic,
- il costo per task completato è la metrica principale,
- usi Grok Build o un harness compatibile.
27. Come fare un POC corretto
Non testare i modelli con cinque prompt.
Prepara almeno:
50-200 task reali
dal tuo repository.
Categorie
- bug fix,
- nuova funzione,
- refactoring,
- test,
- code review,
- migrazione dipendenze,
- performance optimization,
- analisi log,
- frontend da screenshot,
- modifica repository-wide,
- documentazione tecnica.
Per ogni task misura
successo / fallimento
tempo
costo
numero di token
numero di tool call
interventi manuali
regressioni
Metrica più importante
Non:
quale modello ha scritto la risposta più bella?
Ma:
quale modello ha consegnato più spesso un risultato corretto e merge-ready
con costo e tempo accettabili?
28. Come confrontare gli agenti, non solo i modelli
Per:
- Muse Code,
- Claude Code,
- Codex,
- Grok Build,
il modello non lavora in isolamento.
L'agente decide:
- quali file leggere,
- quando eseguire i test,
- quando usare grep,
- se usare un subagente,
- come gestire il contesto,
- quante iterazioni fare,
- quando terminare.
Conviene quindi fare due test.
Test A: modello nello stesso harness
stesso agente
stessi strumenti
stesso system prompt
stessi limiti
Aiuta a confrontare il modello sottostante.
Test B: prodotto end-to-end
Muse + Muse Code
Opus + Claude Code
GPT + Codex
Risponde alla domanda pratica:
Quale soluzione è migliore per il team?
I due test misurano cose diverse.
29. Checklist produzione Muse Spark 1.2
Benchmark
- La versione del benchmark è registrata.
- La data del punteggio è registrata.
- Il reasoning effort è registrato.
- Il nome dell'agente è registrato.
- Meta Terminal-Bench non viene mescolato con il risultato AA.
- Meta Internal Coding Bench non viene trattato come test indipendente.
- I risultati sono verificati sul repository interno.
Costi
- Viene misurato l'input reale.
- Viene misurato il cached input.
- Viene misurato l'output.
- Viene misurato il costo del reasoning.
- Viene misurato il numero di tool call.
- Il costo viene calcolato per task completato.
- Sono confrontati almeno tre modelli.
- È definito un limite di spesa per agente.
Repository
- L'agente ha solo i permessi minimi necessari.
- I secret non sono in file facilmente accessibili.
- L'accesso alla produzione richiede approvazione.
- Il merge richiede review.
- I test vengono eseguiti automaticamente.
- L'agente non può aggirare branch protection.
- Modifiche e tool call sono loggati.
Dati
- Sono verificati i termini Standard tier.
- Sono verificati i termini Contributor tier.
- Il codice cliente non va all'endpoint sbagliato.
- La policy aziendale consente il servizio scelto.
- Sono definite regole di retention per prompt e log.
- I dati personali sono protetti correttamente.
Qualità
- L'agente esegue test dopo le modifiche.
- Il diff finale viene verificato.
- Le regressioni vengono misurate.
- I task lunghi hanno checkpoint.
- Viene testato il recupero dopo un errore.
- Vengono testati grandi monorepo.
- Vengono testati task di più ore.
30. Verdetto POLPROG
Muse Spark 1.2 è una release più importante di quanto suggerisca il numero 1.2.
Meta ha costruito modello e Muse Code come sistema collegato, concentrando il training su:
- grandi repository,
- task lunghi,
- strumenti,
- subagenti,
- pianificazione,
- verifica automatica.
I risultati confermano un miglioramento reale rispetto a Muse Spark 1.1.
I dati più forti
Terminal-Bench 2.1
76,2% -> 82,9% nella valutazione Meta
DeepSWE 1.1
53,0% -> 59,3% nella valutazione Meta
GDPval-AA v2
1371 -> 1631 Elo nello snapshot di lancio Artificial Analysis
Ma non è ancora leader ovunque
Opus 5 supera Muse Spark 1.2 in tutti e tre i benchmark coding mostrati da Meta.
Nello snapshot attuale Artificial Analysis:
Opus 5 61
GPT-5.6 Sol 59
Muse 1.2 57
Kimi K3 57
Terra 55
Perché allora Muse Spark 1.2 è interessante?
Perché costa:
1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input
Questo rende meno utile la domanda:
Quale modello ha il benchmark più alto?
La domanda migliore è:
Quale modello produce il maggior numero di task correttamente completati per 100 USD di budget?
Per molti team la risposta può essere diversa dal modello al primo posto in una singola tabella.
Muse Spark 1.2 appare oggi come un candidato molto forte per programmazione agentic su larga scala con costo controllato.
Non è un vincitore assoluto.
Ma merita chiaramente un posto in un POC insieme a:
- Claude Opus 5,
- GPT-5.6 Terra,
- GPT-5.6 Sol,
- Kimi K3,
- Grok 4.5.

