Muse Spark 1.2 e Muse Code: benchmark, prezzi e confronto con Claude Opus 5, GPT-5.6, Kimi K3 e Grok 4.5 Skip to content

Muse Spark 1.2 e Muse Code: benchmark, prezzi e confronto con Claude Opus 5, GPT-5.6, Kimi K3 e Grok 4.5

Il 5 agosto 2026 Meta ha presentato Muse Spark 1.2 e Muse Code, un agente di programmazione da terminale disponibile in beta. Muse Spark 1.2 è un aggiornamento focalizzato soprattutto su programmazione, debugging complesso, comprensione di grandi codebase e completamento end-to-end di attività software multi-step.

Pubblicato Scritto da Tempo di lettura 24 min di lettura
X LinkedIn

Il 5 agosto 2026 Meta ha presentato Muse Spark 1.2 e Muse Code, un agente di programmazione da terminale disponibile in beta. Muse Spark 1.2 è un aggiornamento focalizzato soprattutto su programmazione, debugging complesso, comprensione di grandi codebase e completamento end-to-end di attività software multi-step.

In questa pagina
  1. 1TL;DR
  2. 21. Cosa ha pubblicato esattamente Meta?
  3. 32. Muse Code non è solo un semplice wrapper del modello
  4. 43. Modello e agente sono stati addestrati insieme
  5. 54. Self-improvement con Muse Spark 1.1
  6. 65. Terminal-Bench 2.1 ufficiale
  7. 76. DeepSWE 1.1
  8. 87. Meta Internal Coding Bench
  9. 98. Controllo indipendente: Artificial Analysis
  10. 109. Confronto attuale Artificial Analysis
  11. 1110. GDPval-AA v2: il miglior incremento rispetto a Spark 1.1
  12. 1211. Terminal-Bench secondo Artificial Analysis
  13. 1312. Hallucination: il dato sembra migliore, ma va letta l'altra metà della tabella
  14. 1413. Il scientific reasoning non è migliorato in modo uniforme
  15. 1514. Prezzo API: uno dei maggiori punti di forza di Muse Spark 1.2
  16. 1615. Costo per task secondo lo snapshot di lancio Artificial Analysis
  17. 1716. Muse Spark 1.2 vs Claude Opus 5
  18. 1817. Muse Spark 1.2 vs GPT-5.6 Terra
  19. 1918. Muse Spark 1.2 vs GPT-5.6 Sol
  20. 2019. Muse Spark 1.2 vs Kimi K3
  21. 2120. Muse Spark 1.2 vs Grok 4.5
  22. 2221. Ottimizzazione kernel: oltre 1.000 tool call e fino a 24 ore di lavoro
  23. 2322. Contesto lungo: 1 milione di token
  24. 2423. Perché il punteggio AA attuale è 57 mentre negli articoli di lancio si trova 54?
  25. 2524. Standard tier vs Contributor tier: differenza importante per la privacy
  26. 2625. Muse Spark 1.2 è il miglior modello per programmare?
  27. 2726. Quale modello scegliere?
  28. 2827. Come fare un POC corretto
  29. 2928. Come confrontare gli agenti, non solo i modelli
  30. 3029. Checklist produzione Muse Spark 1.2
  31. 3130. Verdetto POLPROG

Il modello non è stato pubblicato con pesi aperti. Artificial Analysis classifica Muse Spark 1.2 come modello proprietary e il numero di parametri non è stato reso pubblico.[3]

La parte più interessante del lancio non è però solo il nome del modello. Meta ha addestrato Muse Spark 1.2 insieme a Muse Code e lo ha ottimizzato per un vero ambiente agentic: pianificazione, context compaction, subagenti, uso di strumenti e attività di lunga durata che coinvolgono repository interi.[1]

I risultati sono forti, ma richiedono un'interpretazione prudente.

Nella valutazione ufficiale Meta:

  • Muse Spark 1.2 + Muse Code raggiunge 82,9% in Terminal-Bench 2.1,
  • 59,3% in DeepSWE 1.1,
  • 70,6% in Meta Internal Coding Bench.[1][2]

Questo non significa che Muse Spark 1.2 sia il miglior modello di programmazione sul mercato. Nelle stesse tabelle, Claude Opus 5 + Claude Code è primo in tutti e tre i confronti. Meta stessa segnala inoltre che il confronto non è un perfetto model-to-model: ogni modello è stato eseguito con un agente diverso e la configurazione di test potrebbe essere stata più adatta a Muse Code che agli strumenti concorrenti.[2]

Artificial Analysis offre una prospettiva più indipendente. Nella scheda attuale verificata il 7 agosto, Muse Spark 1.2 con xhigh ottiene 57 punti nell'Artificial Analysis Intelligence Index v4.1.1. Per confronto, Claude Opus 5 ha 61, GPT-5.6 Sol 59, Kimi K3 57 e GPT-5.6 Terra 55.[3][7][8][9][10]

Conclusione breve: Muse Spark 1.2 non supera in modo assoluto Opus 5 o GPT-5.6 Sol, ma è eccezionalmente competitivo sul prezzo. Il suo profilo migliore è la programmazione agentic, soprattutto con Muse Code e quando il costo delle sessioni lunghe conta molto.

Tutti i dati dell'articolo sono stati verificati sui materiali Meta, sulla metodologia ufficiale di valutazione, su Artificial Analysis e su fonti di stampa indipendenti. Stato al 7 agosto 2026.

TL;DR

Domanda Risposta verificata
Quando è uscito Muse Spark 1.2? 5 agosto 2026
Chi ha creato il modello? Meta
Cos'è Muse Code? Agente di programmazione da terminale in beta
Muse Spark 1.2 ha pesi aperti? No, il modello è proprietary
Conosciamo il numero di parametri? No, Meta non lo ha pubblicato
Contesto 1 milione di token
Modalità testo e immagine in input, testo in output
Prezzo standard input 1,25 USD / 1M token
Prezzo cached input 0,15 USD / 1M token
Prezzo output 4,25 USD / 1M token
Terminal-Bench 2.1 secondo Meta 82,9%
DeepSWE 1.1 secondo Meta 59,3%
Meta Internal Coding Bench 70,6%
AA Intelligence Index v4.1.1 attuale 57
AA Index nell'articolo del giorno del lancio 54
I risultati Meta sono indipendenti? No, parte sono valutazioni del produttore
Artificial Analysis è indipendente da Meta? Sì, anche se Meta ha fornito accesso pre-lancio per i benchmark
Punto di forza principale programmazione agentic e rapporto capacità/prezzo
Limite principale non vince tutti i benchmark e alcuni test usano agent harness differenti

1. Cosa ha pubblicato esattamente Meta?

Il lancio comprende due prodotti collegati:

Muse Spark 1.2
modello

Muse Code
agente di programmazione da terminale

Meta descrive Muse Spark 1.2 come un aggiornamento di Muse Spark 1.1 focalizzato sul coding. È stato aumentato il compute usato durante il training su task di programmazione e ampliata la varietà degli ambienti di training.[1]

Muse Code è un agente in grado di:

  • pianificare modifiche al repository,
  • scrivere codice,
  • eseguire strumenti,
  • validare i risultati,
  • coordinare più subagenti di lunga durata,
  • mantenere il progresso durante sessioni lunghe.[1]

Meta descrive così l'installazione del client ufficiale su macOS o Linux:

curl -fsSL https://dev.meta.ai/install.sh | bash

Muse Spark 1.2 è disponibile sia attraverso Muse Code sia tramite Meta Model API. Meta descrive la disponibilità attuale come ampiamente estesa a livello globale.[1]

2. Muse Code non è solo un semplice wrapper del modello

Per i coding agent, il benchmark del modello e quello del prodotto non sono la stessa cosa.

Muse Code aggiunge un proprio livello di esecuzione.

Async Background Agents

L'agente principale può utilizzare subagenti specializzati che continuano a lavorare in background. Non vengono creati solo per un singolo passo e possono rimanere attivi per tutta la sessione.[1]

Questo dovrebbe ridurre:

  • la raccolta ripetuta delle stesse informazioni,
  • la latenza,
  • la necessità di guidare manualmente l'agente,
  • l'analisi ripetuta del repository.

Append-only event log

Muse Code salva localmente una cronologia di:

  • chiamate al modello,
  • utilizzo degli strumenti,
  • approvazioni,
  • modifiche.[1]

Meta descrive il runtime come replay-exact e restart-safe. Dopo un errore, l'agente può riprendere dal log invece di ricominciare il task da zero.

È una funzione importante per attività di programmazione di molte ore.

Skill integrate

La versione iniziale include, tra le altre:

/plan
/grill
/goal

/plan prepara un piano con passaggio di approvazione, /grill verifica criticamente il piano e /goal mantiene il lavoro orientato a un obiettivo definito.[1]

3. Modello e agente sono stati addestrati insieme

È uno dei punti più importanti per interpretare i benchmark.

Meta non ha semplicemente collegato un nuovo modello a una CLI esistente. L'azienda dichiara il co-training di Muse Spark 1.2 e Muse Code.[1]

Il training includeva, tra l'altro:

  • trajectories dall'agent harness,
  • ottimizzazioni per il lavoro basato su obiettivi,
  • compaction,
  • subagenti,
  • il set integrato di strumenti Muse Code.[1]

Il modello è stato inoltre addestrato su attività long-horizon:

  • generazione di repository completi,
  • grandi progetti end-to-end,
  • auto-research,
  • sequenziamento del lavoro tramite planning,
  • mantenimento della direzione tramite goal conditioning,
  • compressione del contesto.[1]

Questo aiuta a capire perché l'unità di confronto corretta talvolta è:

Muse Spark 1.2 + Muse Code

e non solo:

Muse Spark 1.2

4. Self-improvement con Muse Spark 1.1

Meta ha usato Muse Spark 1.1 per costruire dati di training per la versione 1.2.

Secondo la descrizione ufficiale, il modello precedente:

  1. generava ambienti di programmazione difficili,
  2. preparava template di istruzioni complesse,
  3. valutava soluzioni candidate,
  4. aiutava a creare un dataset scalabile per Muse Spark 1.2.[1]

Meta definisce il processo self-improvement loop.

Non significa che il modello “si sia addestrato da solo”. Si tratta ancora di una pipeline controllata e progettata da Meta, in cui il modello precedente era uno dei componenti per generare e valutare i dati.

5. Terminal-Bench 2.1 ufficiale

Terminal-Bench 2.1 valuta agenti che eseguono task in un ambiente terminale.

Meta ha usato tutti gli 89 task della release ufficiale 2.1. Ogni tentativo si è svolto in una sandbox Daytona isolata e un executable verifier ha valutato lo stato finale del container. Il punteggio è la media pass@1 su cinque tentativi.[2]

Risultati pubblicati da Meta

Modello + agente Effort Terminal-Bench 2.1
Claude Opus 5 + Claude Code max 86,7%
Muse Spark 1.2 + Muse Code xhigh 82,9%
GPT-5.6 Terra + Codex max 81,8%
Grok 4.5 + Grok Build high 81,6%
Gemini 3.6 Flash + Antigravity CLI high 78,9%
Muse Spark 1.1 + mini-swe-agent xhigh 76,2% [1][2]

Muse Spark 1.2 migliora il risultato del predecessore di 6,7 punti percentuali.

Allo stesso tempo:

  • è 3,8 pp dietro Opus 5,
  • 1,1 pp davanti a GPT-5.6 Terra,
  • 1,3 pp davanti a Grok 4.5.

La principale riserva

Non è un benchmark puro dei soli modelli.

I sistemi confrontati sono:

modello
+
agente
+
strumenti
+
system prompt
+
runtime

Meta usa:

  • Muse Code per Spark 1.2,
  • Claude Code per Opus 5,
  • Codex per GPT-5.6,
  • Grok Build per Grok 4.5,
  • Antigravity CLI per Gemini.[2]

Meta stessa osserva che configurazione e system prompts potrebbero non essere stati ottimizzati per i modelli chiusi concorrenti.[2]

La conclusione corretta è quindi:

Nella configurazione Meta, Muse Spark 1.2 + Muse Code ha ottenuto 82,9%.

Non:

Muse Spark 1.2 è sempre migliore di GPT-5.6 Terra.

6. DeepSWE 1.1

DeepSWE v1.1 contiene 113 task da 91 repository in cinque linguaggi:

  • TypeScript,
  • Go,
  • Python,
  • JavaScript,
  • Rust.[2]

Ogni task ha un verifier funzionale preparato manualmente e test di regressione.

Durante rollout e grading l'accesso a Internet esterno è bloccato. L'endpoint del modello resta disponibile.[2]

Risultati Meta

Modello + agente DeepSWE 1.1
Claude Opus 5 + Claude Code 65,0%
GPT-5.6 Terra + Codex 64,8%
Muse Spark 1.2 + Muse Code 59,3%
Grok 4.5 + Grok Build 56,6%
Muse Spark 1.1 + mini-swe-agent 53,0%
Gemini 3.6 Flash + Antigravity CLI 40,0% [1][2]

Muse Spark 1.2 migliora la 1.1 di 6,3 pp.

Qui però la distanza dai leader è maggiore:

Opus 5       65,0%
GPT-5.6      64,8%
Muse 1.2     59,3%

È un risultato forte, ma non il primo posto.

Ulteriore limitazione metodologica

La leaderboard ufficiale DeepSWE usa mini-swe-agent per ogni modello.

La valutazione di Meta ha usato invece un diverso prodotto agente per ogni modello. L'azienda scrive esplicitamente che il risultato non è harness-identical con la leaderboard ufficiale.[2]

È un'informazione importante da riportare insieme al 59,3%.

7. Meta Internal Coding Bench

Meta Internal Coding Bench contiene 440 task provenienti dal codebase interno Meta e da pull request reali.[2]

Comprende:

  • bug fix,
  • nuove funzionalità,
  • refactoring,
  • cleanup,
  • altri task di software engineering.

Internet è disabilitato. Le soluzioni vengono compilate e verificate con unit test. Meta esegue due tentativi per task.[2]

Risultati

Modello Meta Internal Coding Bench
Claude Opus 5 79,4%
Muse Spark 1.2 70,6%
Muse Spark 1.1 68,3%
GPT-5.6 Terra 65,4%
Gemini 3.6 Flash 63,9% [1][2]

Muse Spark 1.2 migliora il predecessore di 2,3 pp.

Perché questo benchmark ha meno valore esterno?

Non perché debba essere sbagliato.

Il problema è la riproducibilità.

Il dataset:

  • è interno,
  • proviene dal codebase privato Meta,
  • non è un benchmark pubblico riproducibile da team esterni.

Il risultato va quindi trattato come un segnale aggiuntivo del produttore, non come prova indipendente di superiorità.

8. Controllo indipendente: Artificial Analysis

Artificial Analysis ha ricevuto da Meta accesso a Muse Spark 1.2 prima del lancio pubblico e ha eseguito il proprio set di test.[4]

È importante perché consente di separare:

benchmark del produttore

da:

benchmark di un'organizzazione indipendente

Importante cambiamento del punteggio dopo il lancio

L'articolo Artificial Analysis del 5 agosto riportava:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 54

La scheda attuale del modello, dopo il passaggio dell'indice a v4.1.1, mostra:

Muse Spark 1.2 xhigh
Artificial Analysis Intelligence Index: 57

[3][4]

Non bisogna quindi copiare 54 in una classifica attuale senza indicare la data.

I benchmark cambiano attraverso:

  • versioni dell'indice,
  • grading,
  • set di valutazione,
  • correzioni metodologiche.

Un articolo di produzione dovrebbe sempre indicare lo snapshot.

9. Confronto attuale Artificial Analysis

Schede verificate il 7 agosto 2026:

Modello AA Intelligence Index
Claude Opus 5, max 61
GPT-5.6 Sol, max 59
Muse Spark 1.2, xhigh 57
Kimi K3, max 57
GPT-5.6 Terra, max 55
Grok 4.5, high 54* [3][7][8][9][10][11]

\* Il punteggio di Grok 4.5 proviene dal report pubblicato da Artificial Analysis su quel modello. I valori vanno trattati come snapshot delle relative versioni del benchmark, non come posizioni permanenti.

Cosa ne deriva?

Muse Spark 1.2:

  • non raggiunge attualmente Opus 5 nell'indice generale,
  • resta 2 punti dietro GPT-5.6 Sol,
  • è allo stesso livello di Kimi K3 nella scheda AA attuale,
  • supera GPT-5.6 Terra nell'indice generale,
  • è sopra il risultato di lancio di Grok 4.5.

Ma Artificial Analysis Intelligence Index non è un benchmark esclusivamente di coding.

La versione v4.1.1 combina nove valutazioni, tra cui:

  • GDPval-AA v2,
  • τ³-Banking,
  • Terminal-Bench v2.1,
  • SciCode,
  • Humanity's Last Exam,
  • GPQA Diamond,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.[3]

Il 57 va quindi letto come segnale più ampio di intelligenza e capacità agentic.

10. GDPval-AA v2: il miglior incremento rispetto a Spark 1.1

Nello snapshot di lancio Artificial Analysis, GDPval-AA v2 è salito da:

Muse Spark 1.1: 1371 Elo
Muse Spark 1.2: 1631 Elo

cioè +260 punti Elo.[4]

GDPval-AA v2 misura task realistici di knowledge work.

Contiene 220 task provenienti da:

  • 44 professioni,
  • 9 principali settori dell'economia statunitense.[2]

I modelli producono, tra l'altro:

  • documenti,
  • fogli di calcolo,
  • presentazioni,
  • diagrammi,
  • report.

Artificial Analysis usa il proprio agentic harness Stirrup con accesso a shell e web browsing e confronta i risultati a coppie mediante un giudice LLM.[2]

Snapshot del 5 agosto

Artificial Analysis riportava:

Modello GDPval-AA v2 Elo
Claude Opus 5 1852
GPT-5.6 Sol 1730
Kimi K3 1685
Muse Spark 1.2 1631
Claude Opus 4.8 1588 [4]

È una delle prove più forti che 1.2 sia migliorato oltre la sola generazione di codice.

La classifica GDPval viene aggiornata, quindi queste cifre non vanno mescolate con snapshot successivi.

11. Terminal-Bench secondo Artificial Analysis

Meta riporta:

82,9%

per Muse Spark 1.2 + Muse Code.[1]

Artificial Analysis nel proprio harness riportava al lancio:

80%

contro:

78%

per Muse Spark 1.1.[4]

I risultati non sono in contraddizione.

Derivano da:

  • harness differenti,
  • configurazioni agenti differenti,
  • procedure di esecuzione differenti.

È un buon esempio del perché un punteggio benchmark non dovrebbe essere pubblicato senza metodologia.

12. Hallucination: il dato sembra migliore, ma va letta l'altra metà della tabella

Artificial Analysis ha rilevato nello snapshot di lancio un miglioramento di AA-Omniscience:

18 -> 22

e un calo dell'hallucination rate:

38% -> 28%

[4]

A prima vista sembra chiaramente positivo.

Tuttavia contemporaneamente:

attempt rate: 82% -> 67%
accuracy:     41% -> 38%

[4]

Il modello rinunciava più spesso a rispondere quando non era sicuro.

AA-Omniscience non penalizza l'astensione. Il minor hallucination rate deriva quindi in parte da una maggiore propensione a non rispondere.

Interpretazione corretta:

Muse Spark 1.2 presentava meno spesso una risposta errata come certa, ma tentava anche meno spesso di rispondere.

Interpretazione errata:

Muse Spark 1.2 è diventato 10 punti percentuali più accurato.

I dati non supportano questa conclusione.

13. Il scientific reasoning non è migliorato in modo uniforme

Nelle misurazioni di lancio Artificial Analysis:

Benchmark Spark 1.1 Spark 1.2 Variazione
CritPt 15% 18% +3 pp
SciCode 58% 56% -2 pp
Humanity's Last Exam 45% 44% -1 pp [4]

È importante perché mostra la natura dell'aggiornamento.

Muse Spark 1.2 non è semplicemente:

Spark 1.1
+ qualche punto ovunque

I maggiori miglioramenti del lancio erano concentrati su:

  • programmazione agentic,
  • uso di strumenti,
  • task professionali agentic.

14. Prezzo API: uno dei maggiori punti di forza di Muse Spark 1.2

Listino standard Meta:

Token Prezzo per 1M
Cached input 0,15 USD
Input 1,25 USD
Output 4,25 USD [3][5][6]

Il prezzo input/output è uguale a Muse Spark 1.1.

Confronto dei prezzi API pubblici

Modello Input / 1M Output / 1M
Muse Spark 1.2 1,25 USD 4,25 USD
GPT-5.6 Terra 2,50 USD 15,00 USD
Kimi K3 3,00 USD 15,00 USD
Claude Opus 5 5,00 USD 25,00 USD
GPT-5.6 Sol 5,00 USD 30,00 USD [3][7][8][9][10]

È un confronto del prezzo per token, non del costo per task completato.

Un modello più economico per milione di token può:

  • generare più token,
  • fare più tool calls,
  • richiedere più iterazioni,
  • commettere un errore che richiede correzione manuale.

La metrica business più utile è quindi:

costo per task correttamente completato

non solo:

prezzo per 1M token

15. Costo per task secondo lo snapshot di lancio Artificial Analysis

Nel snapshot del 5 agosto, Artificial Analysis riportava il costo medio ponderato di un task dell'Intelligence Index:

Modello / configurazione Costo task
Grok 4.5 high 0,37 USD
GPT-5.6 Sol medium 0,39 USD
Muse Spark 1.2 xhigh 0,40 USD
GPT-5.6 Terra max 0,51 USD
Kimi K3 max 0,86 USD
GPT-5.5 xhigh 1,18 USD [4]

È un risultato costo molto buono per Muse Spark 1.2.

Rispetto a Spark 1.1, però, il costo è aumentato da:

0,29 USD
a
0,40 USD

Artificial Analysis lo collega a un maggiore uso di token:

  • circa 53% di input token in più,
  • circa 36% di output token in più,

soprattutto in GDPval-AA v2.[4]

Quindi la 1.2 è:

migliore
ma
più intensiva in token

Il prezzo unitario API non è cambiato, ma l'agente svolge più lavoro.

16. Muse Spark 1.2 vs Claude Opus 5

Dove vince Opus 5?

Nei dati Meta:

Benchmark Opus 5 Muse 1.2
Terminal-Bench 2.1 86,7% 82,9%
DeepSWE 1.1 65,0% 59,3%
Meta Internal Coding Bench 79,4% 70,6% [1]

Nell'attuale Artificial Analysis Intelligence Index:

Opus 5:     61
Muse 1.2:   57

[3][7]

I dati disponibili non permettono di definire Muse Spark 1.2 il modello migliore in generale.

Dove Muse ha un vantaggio?

Soprattutto nel prezzo dei token:

Muse Spark 1.2
1,25 / 4,25 USD

Claude Opus 5
5 / 25 USD

[3][7]

Per agenti che svolgono migliaia di operazioni, la differenza può essere significativa.

Conclusione

Opus 5 è preferibile quando:

  • la massima probabilità di successo conta più del costo token,
  • il task è difficile e il costo dell'errore è alto,
  • il team usa già Claude Code.

Muse Spark 1.2 ha più senso quando:

  • il volume di task è elevato,
  • l'agente lavora a lungo su un repository,
  • il costo dei token è molto importante,
  • pochi punti di benchmark non giustificano un'API molto più costosa.

17. Muse Spark 1.2 vs GPT-5.6 Terra

È uno dei confronti più interessanti.

Meta Terminal-Bench

Muse 1.2 + Muse Code: 82,9%
Terra + Codex:         81,8%

Meta DeepSWE

Muse 1.2 + Muse Code: 59,3%
Terra + Codex:         64,8%

Meta Internal Coding Bench

Muse 1.2:  70,6%
Terra:     65,4%

[1]

Il leader cambia a seconda del benchmark.

Artificial Analysis

Indice generale attuale:

Muse Spark 1.2 xhigh: 57
GPT-5.6 Terra max:    55

[3][9]

Prezzo

Muse:
1,25 / 4,25 USD

Terra:
2,50 / 15 USD

[3][9]

Non significa che Muse vinca automaticamente. Terra è chiaramente più forte in DeepSWE nel confronto Meta.

L'interpretazione più corretta è:

Muse Spark 1.2 è eccezionalmente competitivo rispetto a GPT-5.6 Terra per prezzo e alcuni task agentic, ma il risultato dipende dal tipo di task e dall'harness.

18. Muse Spark 1.2 vs GPT-5.6 Sol

GPT-5.6 Sol resta più forte nell'indice più ampio di Artificial Analysis:

GPT-5.6 Sol max: 59
Muse Spark 1.2:  57

[3][8]

Sol costa:

5 USD / 1M input
30 USD / 1M output

contro:

1,25 USD / 1M input
4,25 USD / 1M output

per Muse.[3][8]

È una differenza grande per:

  • reasoning trace lunghi,
  • subagenti,
  • debugging iterativo,
  • refactoring repository-wide,
  • agent run di più ore.

Se i 2 punti extra nell'indice generale non si traducono in una maggiore percentuale di completamento corretto nei task reali dell'azienda, il modello più costoso potrebbe non essere più conveniente.

19. Muse Spark 1.2 vs Kimi K3

La scheda attuale Artificial Analysis mostra:

Muse Spark 1.2 xhigh: 57
Kimi K3 max:          57

[3][10]

Non significa capacità identiche.

Differenza principale

Kimi K3:

  • ha pesi pubblicamente disponibili,
  • può essere self-hosted,
  • ha 2,8 trilioni di parametri totali e 104 miliardi attivi,
  • usa la propria Kimi K3 License.[10]

Muse Spark 1.2:

  • è proprietary,
  • funziona tramite Meta Model API,
  • non ha un numero di parametri pubblico.[3]

Prezzi API ufficiali

Muse:
1,25 USD input
4,25 USD output
0,15 USD cached input

Kimi K3:
3 USD input
15 USD output
0,30 USD cached input

[3][10]

Se il self-hosting non è necessario, Muse è molto più economico nel prezzo nominale API.

Se un'organizzazione necessita di:

  • infrastruttura propria,
  • controllo sui pesi,
  • modifiche personalizzate del modello,

Kimi K3 offre qualcosa che Muse Spark 1.2 attualmente non offre.

20. Muse Spark 1.2 vs Grok 4.5

Nel Terminal-Bench Meta:

Muse Spark 1.2 + Muse Code: 82,9%
Grok 4.5 + Grok Build:      81,6%

Nel DeepSWE:

Muse Spark 1.2: 59,3%
Grok 4.5:        56,6%

[1]

Nell'Artificial Analysis Intelligence Index al lancio, Grok 4.5 aveva 54, paragonabile allo snapshot di lancio di Muse 1.2 prima dell'aggiornamento dell'indice.[4][11]

Artificial Analysis indicava anche Grok 4.5 high come uno dei pochi modelli con costo per task più basso nello stesso cluster di qualità:

Grok 4.5 high:  0,37 USD
Muse 1.2 xhigh: 0,40 USD

[4]

È un altro esempio del fatto che nel 2026 il rapporto prezzo-qualità non segue più una semplice regola:

modello più costoso
=
modello più conveniente

21. Ottimizzazione kernel: oltre 1.000 tool call e fino a 24 ore di lavoro

Meta ha svolto un interessante test long-horizon.

Muse Code e i modelli dovevano ottimizzare iterativamente GPU kernel tramite:

  • oltre 1.000 tool call,
  • fino a 24 ore,
  • scrittura di codice,
  • compilazione,
  • profiling,
  • ottimizzazioni successive.[1]

Sono stati testati KDA e MLA su NVIDIA Hopper.

KDA

La baseline era un'implementazione FLA in Triton. I modelli non potevano importare direttamente librerie kernel esterne come FLA.[1]

Nel grafico del speedup finale rispetto alla baseline, Meta mostrava, tra gli altri:

Modello Speedup vs baseline
Claude Opus 5 +74,0%
GPT-5.6 Sol +71,2%
Claude Opus 4.8 +69,6%
Muse Spark 1.2 +68,7%
GPT-5.6 Terra +65,1%
Gemini 3.6 Flash +62,5% [1]

Muse Spark 1.2 non ha vinto questo esperimento.

È importante perché il materiale ufficiale Meta non presenta il proprio modello come leader in ogni categoria.

Cosa non dimostra l'esperimento?

Non dimostra che:

  • Opus 5 ottimizzi sempre il codice del 74%,
  • Muse fornisca sempre +68,7%,
  • i risultati si trasferiscano a qualunque kernel o GPU.

È un case study per un task, baseline, harness e hardware specifici.

22. Contesto lungo: 1 milione di token

Artificial Analysis conferma per Muse Spark 1.2:

1M token context window

e:

  • text input,
  • image input,
  • text output.[3]

Un milione di token può essere utile per:

  • grandi repository,
  • monorepo,
  • documentazione,
  • lunga cronologia agentica,
  • analisi di molti file.

Non significa che convenga inserire un repository intero nel prompt.

La capacità massima non garantisce:

  • di trovare ogni dipendenza,
  • una corretta prioritizzazione,
  • resistenza a testo malevolo nel repository,
  • qualità identica all'inizio e alla fine del contesto.

Muse Code usa quindi anche context compaction, invece di affidarsi solo a prompt sempre più grandi.[1]

23. Perché il punteggio AA attuale è 57 mentre negli articoli di lancio si trova 54?

Non è un errore da nascondere.

Artificial Analysis ha pubblicato 54 il 5 agosto.[4]

La scheda attuale di Muse Spark 1.2 verificata il 7 agosto mostra 57 e indica v4.1.1 come versione corrente di Artificial Analysis Intelligence Index.[3]

Quando si citano benchmark occorre conservare:

modello
+
effort
+
versione del benchmark
+
data

Per esempio:

Muse Spark 1.2 (xhigh)
AA Intelligence Index v4.1.1
57
stato: 7 agosto 2026

È molto meglio che scrivere:

Muse Spark 1.2 ha 57 punti

senza contesto.

24. Standard tier vs Contributor tier: differenza importante per la privacy

Il listino standard Muse Spark 1.2 è:

input:        1,25 USD / 1M
cached input: 0,15 USD / 1M
output:       4,25 USD / 1M

[3][5][6]

Meta offre anche un Contributor tier fortemente scontato.

La stampa indipendente che descrive l'offerta ufficiale indica che il prezzo inferiore è legato al consenso all'uso dell'attività dell'utente per migliorare i prodotti Meta.[6]

In ambiente aziendale è una differenza importante.

Prima di usare Contributor tier per codice:

  • privato,
  • soggetto a NDA,
  • contenente segreti commerciali,
  • appartenente a un cliente,

bisogna verificare le esatte condizioni di trattamento dei dati applicabili all'account e all'endpoint.

Non va scelto l'endpoint più economico basandosi solo sul prezzo.

25. Muse Spark 1.2 è il miglior modello per programmare?

In base ai dati verificati: non ci sono basi per affermarlo.

Non guida tutti i benchmark Meta

Opus 5 è primo in:

  • Terminal-Bench 2.1,
  • DeepSWE 1.1,
  • Meta Internal Coding Bench.[1]

GPT-5.6 Terra supera Muse anche in DeepSWE.

Ma Muse è eccezionalmente forte sul prezzo

Muse Spark 1.2 ha un prezzo output molto più basso di:

Descrizione più difendibile

Muse Spark 1.2 è uno dei modelli più interessanti del 2026 per rapporto tra capacità di agentic coding e prezzo. Opus 5 resta più forte nei confronti di qualità disponibili e la scelta finale dovrebbe derivare da un POC interno.

26. Quale modello scegliere?

Scegli Muse Spark 1.2 se:

  • il costo delle sessioni lunghe è molto importante,
  • lavori con grandi repository,
  • vuoi usare Muse Code,
  • l'agente deve lavorare a lungo senza guida manuale,
  • servono subagenti persistenti,
  • il prezzo nominale dell'output deve rimanere basso,
  • prestazioni vicine al frontier sono sufficienti.

Scegli Claude Opus 5 se:

  • la massima percentuale di successo è prioritaria,
  • il costo dell'errore supera il costo dei token,
  • usi già Claude Code,
  • i task sono particolarmente difficili,
  • il tuo POC conferma una completion rate più alta.

Scegli GPT-5.6 Terra se:

  • usi l'ecosistema Codex,
  • i task simili a DeepSWE sono centrali,
  • serve un forte coding model meno caro di Sol,
  • gli strumenti OpenAI sono già nel pipeline.

Scegli GPT-5.6 Sol se:

  • serve una capacità generale superiore a Muse,
  • il costo API è meno importante,
  • il workload richiede reasoning più ampio del solo coding.

Scegli Kimi K3 se:

  • servono pesi aperti,
  • pianifichi self-hosting,
  • servono modifiche personalizzate del modello,
  • puoi accettare un prezzo API ufficiale maggiore.

Considera Grok 4.5 se:

  • i test interni mostrano forte efficacia agentic,
  • il costo per task completato è la metrica principale,
  • usi Grok Build o un harness compatibile.

27. Come fare un POC corretto

Non testare i modelli con cinque prompt.

Prepara almeno:

50-200 task reali

dal tuo repository.

Categorie

  • bug fix,
  • nuova funzione,
  • refactoring,
  • test,
  • code review,
  • migrazione dipendenze,
  • performance optimization,
  • analisi log,
  • frontend da screenshot,
  • modifica repository-wide,
  • documentazione tecnica.

Per ogni task misura

successo / fallimento
tempo
costo
numero di token
numero di tool call
interventi manuali
regressioni

Metrica più importante

Non:

quale modello ha scritto la risposta più bella?

Ma:

quale modello ha consegnato più spesso un risultato corretto e merge-ready
con costo e tempo accettabili?

28. Come confrontare gli agenti, non solo i modelli

Per:

  • Muse Code,
  • Claude Code,
  • Codex,
  • Grok Build,

il modello non lavora in isolamento.

L'agente decide:

  • quali file leggere,
  • quando eseguire i test,
  • quando usare grep,
  • se usare un subagente,
  • come gestire il contesto,
  • quante iterazioni fare,
  • quando terminare.

Conviene quindi fare due test.

Test A: modello nello stesso harness

stesso agente
stessi strumenti
stesso system prompt
stessi limiti

Aiuta a confrontare il modello sottostante.

Test B: prodotto end-to-end

Muse + Muse Code
Opus + Claude Code
GPT + Codex

Risponde alla domanda pratica:

Quale soluzione è migliore per il team?

I due test misurano cose diverse.

29. Checklist produzione Muse Spark 1.2

Benchmark

  • La versione del benchmark è registrata.
  • La data del punteggio è registrata.
  • Il reasoning effort è registrato.
  • Il nome dell'agente è registrato.
  • Meta Terminal-Bench non viene mescolato con il risultato AA.
  • Meta Internal Coding Bench non viene trattato come test indipendente.
  • I risultati sono verificati sul repository interno.

Costi

  • Viene misurato l'input reale.
  • Viene misurato il cached input.
  • Viene misurato l'output.
  • Viene misurato il costo del reasoning.
  • Viene misurato il numero di tool call.
  • Il costo viene calcolato per task completato.
  • Sono confrontati almeno tre modelli.
  • È definito un limite di spesa per agente.

Repository

  • L'agente ha solo i permessi minimi necessari.
  • I secret non sono in file facilmente accessibili.
  • L'accesso alla produzione richiede approvazione.
  • Il merge richiede review.
  • I test vengono eseguiti automaticamente.
  • L'agente non può aggirare branch protection.
  • Modifiche e tool call sono loggati.

Dati

  • Sono verificati i termini Standard tier.
  • Sono verificati i termini Contributor tier.
  • Il codice cliente non va all'endpoint sbagliato.
  • La policy aziendale consente il servizio scelto.
  • Sono definite regole di retention per prompt e log.
  • I dati personali sono protetti correttamente.

Qualità

  • L'agente esegue test dopo le modifiche.
  • Il diff finale viene verificato.
  • Le regressioni vengono misurate.
  • I task lunghi hanno checkpoint.
  • Viene testato il recupero dopo un errore.
  • Vengono testati grandi monorepo.
  • Vengono testati task di più ore.

30. Verdetto POLPROG

Muse Spark 1.2 è una release più importante di quanto suggerisca il numero 1.2.

Meta ha costruito modello e Muse Code come sistema collegato, concentrando il training su:

  • grandi repository,
  • task lunghi,
  • strumenti,
  • subagenti,
  • pianificazione,
  • verifica automatica.

I risultati confermano un miglioramento reale rispetto a Muse Spark 1.1.

I dati più forti

Terminal-Bench 2.1
76,2% -> 82,9% nella valutazione Meta

DeepSWE 1.1
53,0% -> 59,3% nella valutazione Meta

GDPval-AA v2
1371 -> 1631 Elo nello snapshot di lancio Artificial Analysis

[1][4]

Ma non è ancora leader ovunque

Opus 5 supera Muse Spark 1.2 in tutti e tre i benchmark coding mostrati da Meta.

Nello snapshot attuale Artificial Analysis:

Opus 5      61
GPT-5.6 Sol 59
Muse 1.2    57
Kimi K3     57
Terra       55

[3][7][8][9][10]

Perché allora Muse Spark 1.2 è interessante?

Perché costa:

1,25 USD / 1M input
4,25 USD / 1M output
0,15 USD / 1M cached input

[3]

Questo rende meno utile la domanda:

Quale modello ha il benchmark più alto?

La domanda migliore è:

Quale modello produce il maggior numero di task correttamente completati per 100 USD di budget?

Per molti team la risposta può essere diversa dal modello al primo posto in una singola tabella.

Muse Spark 1.2 appare oggi come un candidato molto forte per programmazione agentic su larga scala con costo controllato.

Non è un vincitore assoluto.

Ma merita chiaramente un posto in un POC insieme a:

  • Claude Opus 5,
  • GPT-5.6 Terra,
  • GPT-5.6 Sol,
  • Kimi K3,
  • Grok 4.5.

Muse Spark 1.2 è una release più importante di quanto suggerisca il numero 1.2. I risultati confermano un miglioramento reale rispetto a Muse Spark 1.1.

AI AI Coding Muse Spark 1.2 Muse Code Meta Claude Opus 5 GPT-5.6 Kimi K3 Grok 4.5 LLM

Domande frequenti

Quando è uscito Muse Spark 1.2?

Meta ha presentato Muse Spark 1.2 e Muse Code il 5 agosto 2026.

Muse Spark 1.2 è open source?

No. Artificial Analysis lo classifica come modello proprietary e i pesi non sono pubblicamente disponibili.

Quanti parametri ha Muse Spark 1.2?

Meta non ha pubblicato il numero di parametri.

Quanto è grande il contesto?

1 milione di token.

Supporta immagini?

Sì. Artificial Analysis conferma text + image input e text output.

Quanto costa l'API?

Il prezzo standard è 1,25 USD per milione di input token, 0,15 USD per milione di cached input token e 4,25 USD per milione di output token.

Muse Spark 1.2 è migliore di Claude Opus 5?

Non secondo i benchmark generali disponibili e i confronti Meta. Opus 5 guida i tre benchmark coding mostrati da Meta e ha un Artificial Analysis Intelligence Index attuale più alto.

Muse Spark 1.2 è migliore di GPT-5.6 Terra?

Dipende dal task. Muse guida Meta Terminal-Bench e Meta Internal Coding Bench, mentre Terra guida DeepSWE 1.1. L'attuale AA Intelligence Index generale è più alto per Muse.

Muse Spark 1.2 è migliore di Kimi K3?

L'attuale Artificial Analysis Intelligence Index assegna 57 a entrambi. Kimi K3 ha pesi aperti, Muse è proprietary. Profilo e costi sono differenti.

Perché online si trova 54 mentre qui è riportato 57?

54 proviene dall'articolo Artificial Analysis del giorno del lancio. La scheda attuale, dopo il passaggio a v4.1.1, mostra 57. Nei benchmark vanno sempre specificati versione e data.

82,9% in Terminal-Bench è un risultato indipendente?

No. È un risultato pubblicato da Meta per Muse Spark 1.2 + Muse Code secondo la metodologia Meta.

Artificial Analysis misura Terminal-Bench in modo diverso?

Sì. Nello snapshot di lancio AA, Muse Spark 1.2 ha ottenuto 80%. La differenza deriva anche da un harness diverso.

Muse Code può riprendere dopo un errore?

Meta descrive un append-only event log locale che rende il runtime restart-safe e permette di ricostruire lo stato di lavoro.

Muse Spark 1.2 è disponibile globalmente?

Meta afferma nell'annuncio che Muse Spark 1.2 è disponibile tramite Muse Code e Meta Model API con accesso globale ampliato.

Conviene migrare da Muse Spark 1.1?

I dati Meta e Artificial Analysis mostrano un chiaro miglioramento in agentic coding e GDPval. La migrazione va comunque verificata sul workload interno, perché 1.2 usa più token in alcuni task. ---

Fonti e note

  1. Meta AI Research, Introducing Muse Code and Muse Spark 1.212345678910111213141516171819202122232425
  2. Meta AI Research, Muse Spark 1.2 & Muse Code Evaluation Methodology123456789101112131415
  3. Artificial Analysis, Muse Spark 1.2 (xhigh) - Intelligence, Performance & Price Analysis12345678910111213141516171819202122
  4. Artificial Analysis, Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task1234567891011121314
  5. Reuters, Meta launches new AI coding tool powered by Muse Spark 1.212
  6. Business Insider, Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent123
  7. Artificial Analysis, Claude Opus 5 (max)1234567
  8. Artificial Analysis, GPT-5.6 Sol (max)1234567
  9. Artificial Analysis, GPT-5.6 Terra (max)1234567
  10. Artificial Analysis, Kimi K312345678
  11. Artificial Analysis, Grok 4.5 brings SpaceXAI to the intelligence frontier12

È stato utile?

Ricevi i nuovi articoli via e-mail

Una breve e-mail per ogni nuovo articolo di Formazione. Niente spam, disiscriviti con un clic.

Usiamo la tua e-mail solo per inviare nuovi articoli. Nessuna condivisione con terze parti.

Torna alla Formazione