Il 28 agosto 2026 Tencent ha pubblicato e reso open source Hy4 preview, il nuovo modello flagship Mixture-of-Experts della famiglia Tencent Hy, precedentemente nota soprattutto come Hunyuan.[1][6]
Specifiche principali:
770B parametri totali
49B parametri attivi per token
78 layer
256 routed experts + 1 shared expert
top-8 routed experts attivi per token
contesto 1M
Apache License 2.0
Tencent ha rilasciato sia i pesi completi sia Hy4 preview-FP8. Il repository completo su Hugging Face pesa circa 1,56 TB.[2][3]
Il modello è pensato per software engineering, lavoro d’ufficio, analisi finanziaria, game development, ricerca scientifica e agenti con tool use.[1][2]
Tre aspetti sono particolarmente importanti.
Primo: i pesi sono sotto Apache 2.0, quindi il modello può essere self-hosted e usato commercialmente nel rispetto della licenza.[2][4]
Secondo: Tencent pubblica benchmark vendor-reported molto forti, tra cui 82,9% su SWE-bench Multilingual, 85,4% su Terminal-Bench 2.1 e 83,7% su MCP-Atlas.[2][9]
Terzo: Tencent afferma che Hy4 abbia partecipato all’ottimizzazione del proprio processo di sviluppo e della propria infrastruttura inference. Un ciclo separato di ottimizzazione avrebbe aumentato l’end-to-end throughput del 31,8% rispetto a un baseline interno Tencent.[1]
Questo non significa che il modello si sia addestrato completamente da solo. Tencent descrive un early-stage recursive self-improvement loop applicato al processo R&D.
Stato delle informazioni: 31 agosto 2026.
TL;DR
| Domanda | Risposta verificata |
|---|---|
| Modello | Tencent Hy4 preview |
| Release | 28 agosto 2026 |
| Tipo | Mixture-of-Experts |
| Parametri totali | 770B |
| Parametri attivi | 49B per token |
| Layer | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Routed experts attivi | top-8 |
| Contesto | 1M nella model card, 1.048.576 su OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Ottimizzazione sparse attention | IndexCache |
| MTP | 1 layer nativo, 10B total / 0,7B active |
| Licenza | Apache 2.0 |
| Pesi completi | circa 1,56 TB |
| Variante quantizzata | Hy4 preview-FP8 |
| Self-hosting | vLLM e SGLang |
| Recipe ufficiale | tensor parallel size 8 |
| API input | $0.834 / 1M token |
| API output | $2.501 / 1M token |
| Cache hit | $0.042 / 1M token |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Stato | Preview |
| Limiti noti | reasoning troppo lungo e over-verification |
| Caveat principale | manca ancora una vasta replica indipendente dell’intera tabella di lancio |
Cosa ha pubblicato Tencent?
Tencent ha reso disponibili:
Hy4 preview
Hy4 preview-FP8
su Hugging Face, ModelScope, GitCode e CNB.[2]
Il modello è disponibile anche tramite WorkBuddy, CodeBuddy, Tencent Cloud TokenHub e OpenRouter.[1][7]
Reuters ha confermato il lancio del 28 agosto e i principali use case dichiarati: software engineering, ricerca e analisi finanziaria.[6]
770B non significa 770B attivi per token
Hy4 usa una architettura Mixture-of-Experts.
Il backbone contiene:
770B total
ma per ogni token vengono attivati circa:
49B
parametri.[2]
È circa il 6,4% del backbone.
MoE riduce il calcolo effettivo per token, ma non elimina la necessità di memorizzare e distribuire un modello enorme.
Organizzazione degli esperti
Il backbone ha 78 layer.[2]
Il primo usa un FFN dense.
Gli altri 77 contengono:
256 routed experts
1 shared expert
Per ogni token sono attivati:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: salto di scala
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
In termini approssimativi:
- 2,61× più parametri totali,
- 2,33× più parametri attivi,
- almeno 3,9× più contesto dichiarato.
Tencent afferma di aver aumentato insieme model size, context length, training data e post-training.[2]
Contesto da 1M token
La model card dichiara:
Context Length: 1M
OpenRouter mostra:
1,048,576 token context
64,000 max completion tokens
È interessante per grandi codebase, lunghe sessioni agentiche, multi-document analysis, research e repo-level refactoring.
Ma context window dichiarato e qualità effettiva del retrieval non sono equivalenti.
Gated DeepSeek Sparse Attention
Hy4 usa Gated DeepSeek Sparse Attention.[2]
Sparse attention riduce il costo delle sequenze molto lunghe selezionando posizioni rilevanti invece di usare full quadratic attention ovunque.
Tencent lo combina con:
IndexCache
Cosa fa IndexCache?
IndexCache riutilizza sparse indices tra più layer.[8]
Il paper relativo mostra, sui modelli DSA testati, una riduzione del lavoro dell’indexer e speedup di prefill/decode con piccolo impatto sulla qualità.[8]
Questi risultati riguardano IndexCache, non un benchmark diretto dell’intero Hy4.
Layer MTP nativo
Oltre al backbone, Hy4 include un layer Multi-Token Prediction.[2]
Tencent specifica:
10B total
0.7B active
Serve allo speculative decoding ed è attivato nei recipe ufficiali vLLM e SGLang.[2]
I pesi sono realmente pubblici
Hugging Face mostra:
tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0
È disponibile anche:
tencent/Hy4-preview-FP8
Questo consente self-hosting, fine-tuning, analisi dei pesi e stack di inference personalizzati.
Apache 2.0
La model card e il repository ufficiale indicano:
Apache License 2.0
È una licenza permissiva che consente uso, modifica e redistribuzione, anche commerciale, nel rispetto dei suoi termini.
Self-hosting ufficiale
Tencent raccomanda:
vLLM
SGLang
Il recipe vLLM usa:
vllm/vllm-openai:hy4-preview
e:
--tensor-parallel-size 8
SGLang usa --tp-size 8.
Non significa che qualunque otto GPU siano sufficienti. Contano memoria, precision, KV cache, contesto e concurrency.
API compatibile OpenAI
Una volta servito con vLLM o SGLang, Hy4 può essere chiamato tramite endpoint OpenAI-compatible.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent raccomanda temperature=0.9 e top_p=1.0.[2]
Il reasoning può essere ridotto
Di default Hy4 usa un livello alto di reasoning per task difficili.[2]
Per risposte più dirette:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
Questo è utile perché il reasoning troppo lungo è uno dei limiti ufficiali.
Limiti ufficiali della preview
- il modello può impiegare più tempo del necessario su task complessi,
- tende a over-verify il proprio lavoro.
Negli agenti questo può aumentare tool calls, latency e costo.
Benchmark: prima il caveat
Tencent ha pubblicato un benchmark appendix nella model card.[2]
Al 31 agosto non esiste ancora una vasta replica indipendente dell’intera tabella con configurazione identica.
Perciò definiamo questi dati:
Tencent-reported
Risultati selezionati
Trascrizione della tabella Tencent:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High senza tools | 43,4% |
Tutti sono vendor-reported.
SWE-bench Multilingual: 82,9%
Tencent riporta:
Hy4 preview: 82.9%
Hy3: 75.8%
Sono +7,1 punti.
Per confrontarlo con altri risultati bisogna verificare la specifica variante di benchmark e harness.
SWE-bench Pro: 65,7%
Tencent riporta:
Hy4 preview: 65.7%
Hy3: 57.9%
Sono +7,8 punti e un forte segnale di miglioramento software-engineering rispetto a Hy3.
DeepSWE: il salto più grande
La trascrizione indica:
Hy3: 28.0%
Hy4 preview: 64.3%
Proprio perché il salto è enorme, una replica indipendente è particolarmente importante.
Terminal-Bench 2.1: 85,4%
Tencent riporta:
Hy4 preview: 85.4%
È un ottimo risultato per coding agents, ma il chart Tencent mostra anche competitor con risultati simili o superiori. Non dimostra una vittoria universale.
GPQA Diamond: 92,3%
Risultato Tencent-reported:
92.3%
Supporta il posizionamento scientifico del modello.[1]
Non garantisce affidabilità nella ricerca reale.
MCP-Atlas e tool use
Tencent riporta:
MCP-Atlas: 83.7%
OpenRouter conferma supporto per tools, tool_choice e structured outputs via JSON Schema.[7]
Hy4 vs Kimi K3 e GLM-5.3: blind test interno
163 esperti Tencent
203 task di engineering
scala 0–4
Medie:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Contro Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Contro GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
È un vantaggio ristretto in un workload interno Tencent, non prova universale.
Claude Opus 5 e GPT-5.6 Sol
Tencent include anche modelli frontier chiusi nel benchmark appendix.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
I valori doppi rappresentano configurazioni/varianti diverse nel chart Tencent e non vanno fusi in un ranking unico.
Prezzo API
Tencent pubblica:[1]
Input: $0.834 / 1M token
Output: $2.501 / 1M token
Cache hit: $0.042 / 1M token
OpenRouter mostra gli stessi prezzi.[7][13]
Il prezzo per token non equivale al costo per task: reasoning più lungo e più tool calls possono cambiare l’economia reale.
Self-hosting vs API
API
Utile per partire rapidamente, gestire domanda variabile ed evitare un grande cluster GPU.
Self-hosting
Utile per data residency, controllo dell’inference, carichi grandi e stabili.
Con circa 1,56 TB di pesi completi, non è un modello tipico da singola workstation.[3]
Hy4 si è davvero “auto-ottimizzato”?
Tencent dice che il modello ha partecipato all’ottimizzazione automatizzata di training methods, data strategies, evaluation frameworks e low-level operators.[1]
Avrebbe proposto approcci, eseguito esperimenti e iterato sui risultati.
Tencent lo definisce:
early-stage recursive self-improvement loop
Non equivale a dire che Hy4 si sia addestrato completamente da solo.
Cosa significa +31,8% throughput?
Tencent afferma che Hy4 abbia analizzato bottleneck e iterato su operator fusion e communication optimization.[1]
Risultato dichiarato:
+31.8% end-to-end throughput
vs baseline interno Tencent
Non significa 31,8% più veloce di Kimi, Claude o GPT.
Vantaggi principali
- Apache 2.0.
- Contesto 1M.
- 49B attivi su 770B totali.
- Forte profilo coding/agent secondo Tencent.
- Recipe ufficiali vLLM/SGLang.
- FP8.
- Prezzo API competitivo.
Rischi e incognite
- Status preview.
- Benchmark soprattutto vendor-reported.
- Over-reasoning.
- Over-verification.
- Infrastruttura self-hosting pesante.
- Qualità reale del contesto 1M da misurare.
- Data governance dipende dal provider quando si usa l’API.
Come benchmarkarlo in azienda?
Confrontare su task identici:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Misurare:
- task completion,
- test pass rate,
- qualità del diff,
- tool calls,
- retry,
- token,
- latency,
- costo per task,
- regressioni,
- modifiche fuori scope,
- long-context quality.
Metrica chiave:
cost per successful task
Checklist di deployment
Qualità
- Test su task interni.
- Separare benchmark Tencent e risultati indipendenti.
- Confrontare high reasoning e
no_think. - Misurare over-verification.
- Testare allucinazioni.
- Validare tool calling.
- Validare structured outputs.
- Testare sessioni agentiche lunghe.
Long context
- Testare 32K, 128K, 256K e oltre.
- Misurare retrieval accuracy.
- Misurare time-to-first-token.
- Misurare KV-cache footprint.
- Non assumere che 1M context = 1M memoria perfetta.
- Testare repo-level coding.
- Testare cross-document reasoning.
- Testare prompt injection in contesti lunghi.
Self-hosting
- Verificare requisiti GPU.
- Partire da FP8 ufficiale.
- Testare vLLM.
- Testare SGLang.
- Misurare throughput con concurrency reale.
- Misurare P50/P95/P99.
- Pianificare storage.
- Verificare Apache 2.0 con legal.
API
- Verificare prezzo attuale.
- Verificare cache semantics e TTL.
- Verificare data retention.
- Verificare regione di processing.
- Definire limiti di costo.
- Monitorare usage per agent.
- Mantenere fallback model.
- Misurare cost per successful task.
Conviene migrare da Hy3?
Per utenti Hy3, Hy4 merita un POC.
Sulla carta:
295B → 770B total
21B → 49B active
256K → 1M context
oltre a grandi miglioramenti vendor-reported in coding e agents.[2][5][9]
Ma Hy4 può reasonare più a lungo, richiede più infrastruttura ed è ancora preview.
Verdetto POLPROG
Hy4 preview è una delle release open-weight più importanti di fine agosto 2026.
Conta la combinazione:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
prezzo API aggressivo
profilo coding/agent forte
Tre livelli di evidenza vanno separati.
Fatti tecnici
Architettura, licenza, pesi, contesto, deployment e prezzo sono ben documentati.[1][2][3][7]
Benchmark
Impressionanti, ma al lancio soprattutto Tencent-reported.[2][9][10]
Self-improvement
Parte reale del workflow R&D descritto, ma non self-training completamente autonomo.[1]
Conclusione ragionevole al 31 agosto:
Hy4 preview deve entrare nella shortlist per coding agents, research agents, workflow long-context e infrastruttura AI self-hosted.
Non ci sono ancora basi per dire:
Hy4 è il miglior modello al mondo.
Ci sono basi per dire:
Tencent ha portato Hy4 nel ristretto gruppo di modelli open-weight che non si possono ignorare in uno stack AI di produzione.

