Tencent Hy4 preview: 770B parametri, 49B attivi e contesto 1M. Benchmark, prezzo e confronto con Kimi K3, GLM-5.3 e Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parametri, 49B attivi e contesto 1M. Benchmark, prezzo e confronto con Kimi K3, GLM-5.3 e Claude Opus 5

Analisi verificata di Tencent Hy4 preview: architettura MoE 770B/49B, contesto 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmark, blind test interno, prezzo API, self-hosting, FP8, vLLM/SGLang e limiti preview.

Pubblicato Scritto da Tempo di lettura 16 min di lettura

Analisi verificata di Tencent Hy4 preview: architettura MoE 770B/49B, contesto 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmark, blind test interno, prezzo API, self-hosting, FP8, vLLM/SGLang e limiti preview.

In questa pagina
  1. 1TL;DR
  2. 2Cosa ha pubblicato Tencent?
  3. 3770B non significa 770B attivi per token
  4. 4Organizzazione degli esperti
  5. 5Hy4 vs Hy3: salto di scala
  6. 6Contesto da 1M token
  7. 7Gated DeepSeek Sparse Attention
  8. 8Cosa fa IndexCache?
  9. 9Layer MTP nativo
  10. 10I pesi sono realmente pubblici
  11. 11Apache 2.0
  12. 12Self-hosting ufficiale
  13. 13API compatibile OpenAI
  14. 14Il reasoning può essere ridotto
  15. 15Limiti ufficiali della preview
  16. 16Benchmark: prima il caveat
  17. 17Risultati selezionati
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: il salto più grande
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas e tool use
  24. 24Hy4 vs Kimi K3 e GLM-5.3: blind test interno
  25. 25Claude Opus 5 e GPT-5.6 Sol
  26. 26Prezzo API
  27. 27Self-hosting vs API
  28. 28Hy4 si è davvero “auto-ottimizzato”?
  29. 29Cosa significa +31,8% throughput?
  30. 30Vantaggi principali
  31. 31Rischi e incognite
  32. 32Come benchmarkarlo in azienda?
  33. 33Checklist di deployment
  34. 34Conviene migrare da Hy3?
  35. 35Verdetto POLPROG

Il 28 agosto 2026 Tencent ha pubblicato e reso open source Hy4 preview, il nuovo modello flagship Mixture-of-Experts della famiglia Tencent Hy, precedentemente nota soprattutto come Hunyuan.[1][6]

Specifiche principali:

770B parametri totali
49B parametri attivi per token
78 layer
256 routed experts + 1 shared expert
top-8 routed experts attivi per token
contesto 1M
Apache License 2.0

[2]

Tencent ha rilasciato sia i pesi completi sia Hy4 preview-FP8. Il repository completo su Hugging Face pesa circa 1,56 TB.[2][3]

Il modello è pensato per software engineering, lavoro d’ufficio, analisi finanziaria, game development, ricerca scientifica e agenti con tool use.[1][2]

Tre aspetti sono particolarmente importanti.

Primo: i pesi sono sotto Apache 2.0, quindi il modello può essere self-hosted e usato commercialmente nel rispetto della licenza.[2][4]

Secondo: Tencent pubblica benchmark vendor-reported molto forti, tra cui 82,9% su SWE-bench Multilingual, 85,4% su Terminal-Bench 2.1 e 83,7% su MCP-Atlas.[2][9]

Terzo: Tencent afferma che Hy4 abbia partecipato all’ottimizzazione del proprio processo di sviluppo e della propria infrastruttura inference. Un ciclo separato di ottimizzazione avrebbe aumentato l’end-to-end throughput del 31,8% rispetto a un baseline interno Tencent.[1]

Questo non significa che il modello si sia addestrato completamente da solo. Tencent descrive un early-stage recursive self-improvement loop applicato al processo R&D.

Stato delle informazioni: 31 agosto 2026.

TL;DR

DomandaRisposta verificata
ModelloTencent Hy4 preview
Release28 agosto 2026
TipoMixture-of-Experts
Parametri totali770B
Parametri attivi49B per token
Layer78
Routed experts256
Shared experts1
Routed experts attivitop-8
Contesto1M nella model card, 1.048.576 su OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
Ottimizzazione sparse attentionIndexCache
MTP1 layer nativo, 10B total / 0,7B active
LicenzaApache 2.0
Pesi completicirca 1,56 TB
Variante quantizzataHy4 preview-FP8
Self-hostingvLLM e SGLang
Recipe ufficialetensor parallel size 8
API input$0.834 / 1M token
API output$2.501 / 1M token
Cache hit$0.042 / 1M token
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
StatoPreview
Limiti notireasoning troppo lungo e over-verification
Caveat principalemanca ancora una vasta replica indipendente dell’intera tabella di lancio

Cosa ha pubblicato Tencent?

Tencent ha reso disponibili:

Hy4 preview
Hy4 preview-FP8

su Hugging Face, ModelScope, GitCode e CNB.[2]

Il modello è disponibile anche tramite WorkBuddy, CodeBuddy, Tencent Cloud TokenHub e OpenRouter.[1][7]

Reuters ha confermato il lancio del 28 agosto e i principali use case dichiarati: software engineering, ricerca e analisi finanziaria.[6]

770B non significa 770B attivi per token

Hy4 usa una architettura Mixture-of-Experts.

Il backbone contiene:

770B total

ma per ogni token vengono attivati circa:

49B

parametri.[2]

È circa il 6,4% del backbone.

MoE riduce il calcolo effettivo per token, ma non elimina la necessità di memorizzare e distribuire un modello enorme.

Organizzazione degli esperti

Il backbone ha 78 layer.[2]

Il primo usa un FFN dense.

Gli altri 77 contengono:

256 routed experts
1 shared expert

Per ogni token sono attivati:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: salto di scala

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

In termini approssimativi:

  • 2,61× più parametri totali,
  • 2,33× più parametri attivi,
  • almeno 3,9× più contesto dichiarato.

Tencent afferma di aver aumentato insieme model size, context length, training data e post-training.[2]

Contesto da 1M token

La model card dichiara:

Context Length: 1M

[2]

OpenRouter mostra:

1,048,576 token context
64,000 max completion tokens

[7]

È interessante per grandi codebase, lunghe sessioni agentiche, multi-document analysis, research e repo-level refactoring.

Ma context window dichiarato e qualità effettiva del retrieval non sono equivalenti.

Gated DeepSeek Sparse Attention

Hy4 usa Gated DeepSeek Sparse Attention.[2]

Sparse attention riduce il costo delle sequenze molto lunghe selezionando posizioni rilevanti invece di usare full quadratic attention ovunque.

Tencent lo combina con:

IndexCache

Cosa fa IndexCache?

IndexCache riutilizza sparse indices tra più layer.[8]

Il paper relativo mostra, sui modelli DSA testati, una riduzione del lavoro dell’indexer e speedup di prefill/decode con piccolo impatto sulla qualità.[8]

Questi risultati riguardano IndexCache, non un benchmark diretto dell’intero Hy4.

Layer MTP nativo

Oltre al backbone, Hy4 include un layer Multi-Token Prediction.[2]

Tencent specifica:

10B total
0.7B active

Serve allo speculative decoding ed è attivato nei recipe ufficiali vLLM e SGLang.[2]

I pesi sono realmente pubblici

Hugging Face mostra:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

È disponibile anche:

tencent/Hy4-preview-FP8

[11]

Questo consente self-hosting, fine-tuning, analisi dei pesi e stack di inference personalizzati.

Apache 2.0

La model card e il repository ufficiale indicano:

Apache License 2.0

[2][4]

È una licenza permissiva che consente uso, modifica e redistribuzione, anche commerciale, nel rispetto dei suoi termini.

Self-hosting ufficiale

Tencent raccomanda:

vLLM
SGLang

[2]

Il recipe vLLM usa:

vllm/vllm-openai:hy4-preview

e:

--tensor-parallel-size 8

[2]

SGLang usa --tp-size 8.

Non significa che qualunque otto GPU siano sufficienti. Contano memoria, precision, KV cache, contesto e concurrency.

API compatibile OpenAI

Una volta servito con vLLM o SGLang, Hy4 può essere chiamato tramite endpoint OpenAI-compatible.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent raccomanda temperature=0.9 e top_p=1.0.[2]

Il reasoning può essere ridotto

Di default Hy4 usa un livello alto di reasoning per task difficili.[2]

Per risposte più dirette:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

Questo è utile perché il reasoning troppo lungo è uno dei limiti ufficiali.

Limiti ufficiali della preview

Tencent riconosce:[2][6]

  1. il modello può impiegare più tempo del necessario su task complessi,
  2. tende a over-verify il proprio lavoro.

Negli agenti questo può aumentare tool calls, latency e costo.

Benchmark: prima il caveat

Tencent ha pubblicato un benchmark appendix nella model card.[2]

Al 31 agosto non esiste ancora una vasta replica indipendente dell’intera tabella con configurazione identica.

Perciò definiamo questi dati:

Tencent-reported

Risultati selezionati

Trascrizione della tabella Tencent:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High senza tools43,4%

Tutti sono vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent riporta:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Sono +7,1 punti.

Per confrontarlo con altri risultati bisogna verificare la specifica variante di benchmark e harness.

SWE-bench Pro: 65,7%

Tencent riporta:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Sono +7,8 punti e un forte segnale di miglioramento software-engineering rispetto a Hy3.

DeepSWE: il salto più grande

La trascrizione indica:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Proprio perché il salto è enorme, una replica indipendente è particolarmente importante.

Terminal-Bench 2.1: 85,4%

Tencent riporta:

Hy4 preview: 85.4%

[9][10]

È un ottimo risultato per coding agents, ma il chart Tencent mostra anche competitor con risultati simili o superiori. Non dimostra una vittoria universale.

GPQA Diamond: 92,3%

Risultato Tencent-reported:

92.3%

[9][10]

Supporta il posizionamento scientifico del modello.[1]

Non garantisce affidabilità nella ricerca reale.

MCP-Atlas e tool use

Tencent riporta:

MCP-Atlas: 83.7%

[9][10]

OpenRouter conferma supporto per tools, tool_choice e structured outputs via JSON Schema.[7]

Hy4 vs Kimi K3 e GLM-5.3: blind test interno

Tencent ha condotto:[1][2]

163 esperti Tencent
203 task di engineering
scala 0–4

Medie:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Contro Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Contro GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

È un vantaggio ristretto in un workload interno Tencent, non prova universale.

Claude Opus 5 e GPT-5.6 Sol

Tencent include anche modelli frontier chiusi nel benchmark appendix.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

I valori doppi rappresentano configurazioni/varianti diverse nel chart Tencent e non vanno fusi in un ranking unico.

Prezzo API

Tencent pubblica:[1]

Input:      $0.834 / 1M token
Output:     $2.501 / 1M token
Cache hit:  $0.042 / 1M token

OpenRouter mostra gli stessi prezzi.[7][13]

Il prezzo per token non equivale al costo per task: reasoning più lungo e più tool calls possono cambiare l’economia reale.

Self-hosting vs API

API

Utile per partire rapidamente, gestire domanda variabile ed evitare un grande cluster GPU.

Self-hosting

Utile per data residency, controllo dell’inference, carichi grandi e stabili.

Con circa 1,56 TB di pesi completi, non è un modello tipico da singola workstation.[3]

Hy4 si è davvero “auto-ottimizzato”?

Tencent dice che il modello ha partecipato all’ottimizzazione automatizzata di training methods, data strategies, evaluation frameworks e low-level operators.[1]

Avrebbe proposto approcci, eseguito esperimenti e iterato sui risultati.

Tencent lo definisce:

early-stage recursive self-improvement loop

Non equivale a dire che Hy4 si sia addestrato completamente da solo.

Cosa significa +31,8% throughput?

Tencent afferma che Hy4 abbia analizzato bottleneck e iterato su operator fusion e communication optimization.[1]

Risultato dichiarato:

+31.8% end-to-end throughput
vs baseline interno Tencent

Non significa 31,8% più veloce di Kimi, Claude o GPT.

Vantaggi principali

  • Apache 2.0.
  • Contesto 1M.
  • 49B attivi su 770B totali.
  • Forte profilo coding/agent secondo Tencent.
  • Recipe ufficiali vLLM/SGLang.
  • FP8.
  • Prezzo API competitivo.

Rischi e incognite

  • Status preview.
  • Benchmark soprattutto vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Infrastruttura self-hosting pesante.
  • Qualità reale del contesto 1M da misurare.
  • Data governance dipende dal provider quando si usa l’API.

Come benchmarkarlo in azienda?

Confrontare su task identici:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Misurare:

  • task completion,
  • test pass rate,
  • qualità del diff,
  • tool calls,
  • retry,
  • token,
  • latency,
  • costo per task,
  • regressioni,
  • modifiche fuori scope,
  • long-context quality.

Metrica chiave:

cost per successful task

Checklist di deployment

Qualità

  • Test su task interni.
  • Separare benchmark Tencent e risultati indipendenti.
  • Confrontare high reasoning e no_think.
  • Misurare over-verification.
  • Testare allucinazioni.
  • Validare tool calling.
  • Validare structured outputs.
  • Testare sessioni agentiche lunghe.

Long context

  • Testare 32K, 128K, 256K e oltre.
  • Misurare retrieval accuracy.
  • Misurare time-to-first-token.
  • Misurare KV-cache footprint.
  • Non assumere che 1M context = 1M memoria perfetta.
  • Testare repo-level coding.
  • Testare cross-document reasoning.
  • Testare prompt injection in contesti lunghi.

Self-hosting

  • Verificare requisiti GPU.
  • Partire da FP8 ufficiale.
  • Testare vLLM.
  • Testare SGLang.
  • Misurare throughput con concurrency reale.
  • Misurare P50/P95/P99.
  • Pianificare storage.
  • Verificare Apache 2.0 con legal.

API

  • Verificare prezzo attuale.
  • Verificare cache semantics e TTL.
  • Verificare data retention.
  • Verificare regione di processing.
  • Definire limiti di costo.
  • Monitorare usage per agent.
  • Mantenere fallback model.
  • Misurare cost per successful task.

Conviene migrare da Hy3?

Per utenti Hy3, Hy4 merita un POC.

Sulla carta:

295B → 770B total
21B → 49B active
256K → 1M context

oltre a grandi miglioramenti vendor-reported in coding e agents.[2][5][9]

Ma Hy4 può reasonare più a lungo, richiede più infrastruttura ed è ancora preview.

Verdetto POLPROG

Hy4 preview è una delle release open-weight più importanti di fine agosto 2026.

Conta la combinazione:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
prezzo API aggressivo
profilo coding/agent forte

Tre livelli di evidenza vanno separati.

Fatti tecnici

Architettura, licenza, pesi, contesto, deployment e prezzo sono ben documentati.[1][2][3][7]

Benchmark

Impressionanti, ma al lancio soprattutto Tencent-reported.[2][9][10]

Self-improvement

Parte reale del workflow R&D descritto, ma non self-training completamente autonomo.[1]

Conclusione ragionevole al 31 agosto:

Hy4 preview deve entrare nella shortlist per coding agents, research agents, workflow long-context e infrastruttura AI self-hosted.

Non ci sono ancora basi per dire:

Hy4 è il miglior modello al mondo.

Ci sono basi per dire:

Tencent ha portato Hy4 nel ristretto gruppo di modelli open-weight che non si possono ignorare in uno stack AI di produzione.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Domande frequenti

Data di release

28 agosto 2026.

Open source?

Tencent lo definisce open source e pubblica pesi/codice sotto Apache 2.0.

Parametri

770B total, 49B attivi per token nel backbone.

MTP incluso nei 770B?

No secondo model card: aggiunge 10B total / 0,7B active.

Contesto

1M nella model card, 1.048.576 su OpenRouter.

Max output

64K su OpenRouter.

Self-hosting

Sì.

Framework ufficiali

vLLM e SGLang.

FP8?

Sì.

Dimensione pesi completi

Circa 1,56 TB.

Licenza

Apache 2.0.

Prezzo API

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

Ha battuto Kimi K3?

Nel blind test interno Tencent: 2.99/4 vs 2.94/4. Non è prova indipendente universale.

GLM-5.3?

2.99 vs 2.92 nello stesso test.

Claude Opus 5?

Non c’è base per una superiorità generale.

Benchmark indipendenti?

Non ancora una replica ampia dell’intera tabella Tencent.

Limiti noti

Reasoning troppo lungo e over-verification.

Hy4 si è migliorato da solo?

Tencent descrive sperimentazione automatizzata assistita dal modello, non training autonomo completo.

+31,8% throughput

Miglioramento rispetto al baseline interno inference di Tencent, non rispetto ai competitor.

Fonti e note

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 agosto 2026, consultato il 31 agosto 2026.123456789101112
  2. Tencent, Hy4 preview — model card ufficiale su Hugging Face, consultato il 31 agosto 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, consultato il 31 agosto 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — repository GitHub ufficiale, consultato il 31 agosto 2026.12
  5. Tencent, Hy3 Now Available Globally, 5 agosto 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 agosto 2026.123
  7. OpenRouter, Tencent: Hy4 preview, stato verificato il 31 agosto 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, marzo 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 agosto 2026. Valori trascritti dalla tabella Tencent, non replica indipendente.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, consultato il 31 agosto 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, consultato il 31 agosto 2026.
  12. Tencent, Hy3 preview launch, 24 aprile 2026.
  13. OpenRouter, Tencent models, consultato il 31 agosto 2026.

È stato utile?

Ricevi i nuovi articoli via e-mail

Una breve e-mail per ogni nuovo articolo di Formazione. Niente spam, disiscriviti con un clic.

Usiamo la tua e-mail solo per inviare nuovi articoli. Nessuna condivisione con terze parti.

Torna alla Formazione