Op 28 augustus 2026 publiceerde en open-sourcete Tencent Hy4 preview, het nieuwe Mixture-of-Experts-flagship van de Tencent Hy-familie, eerder vooral bekend als Hunyuan.[1][6]
Belangrijkste specificaties:
770B totale parameters
49B actieve parameters per token
78 lagen
256 routed experts + 1 shared expert
top-8 routed experts per token
1M context
Apache License 2.0
Tencent bracht volledige gewichten en Hy4 preview-FP8 uit. De volledige Hugging Face-repository is ongeveer 1,56 TB.[2][3]
Het model is gericht op software engineering, kantoorwerk, financiële analyse, game development, wetenschappelijk onderzoek en tool-using agents.[1][2]
Drie punten zijn essentieel.
Ten eerste staan de weights onder Apache 2.0, zodat self-hosting en commercieel gebruik mogelijk zijn binnen de voorwaarden van de licentie.[2][4]
Ten tweede rapporteert Tencent sterke vendor-reported scores, zoals 82,9% op SWE-bench Multilingual, 85,4% op Terminal-Bench 2.1 en 83,7% op MCP-Atlas.[2][9]
Ten derde zegt Tencent dat Hy4 betrokken was bij optimalisatie van zijn eigen ontwikkel- en inferenceproces. Een afzonderlijke optimalisatieronde zou de end-to-end throughput met 31,8% tegenover een interne Tencent-baseline hebben verhoogd.[1]
Dat is niet hetzelfde als volledig autonoom zelftrainen. Tencent beschrijft een vroege engineeringloop voor recursive self-improvement.
Informatiestatus: 31 augustus 2026.
TL;DR
| Vraag | Geverifieerd antwoord |
|---|---|
| Model | Tencent Hy4 preview |
| Release | 28 augustus 2026 |
| Type | Mixture-of-Experts |
| Totale parameters | 770B |
| Actieve parameters | 49B per token |
| Lagen | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Actieve routed experts | top-8 |
| Context | 1M in model card, 1.048.576 op OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Sparse-attention-optimalisatie | IndexCache |
| MTP | 1 native laag, 10B total / 0,7B active |
| Licentie | Apache 2.0 |
| Volledige weights | ca. 1,56 TB |
| Quantized variant | Hy4 preview-FP8 |
| Self-hosting | vLLM en SGLang |
| Officiële recipe | tensor parallel size 8 |
| API input | $0.834 / 1M tokens |
| API output | $2.501 / 1M tokens |
| Cache hit | $0.042 / 1M tokens |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Status | Preview |
| Bekende beperkingen | te lang reasoning en over-verification |
| Belangrijkste caveat | nog geen brede onafhankelijke replicatie van de volledige launch-tabel |
Wat bracht Tencent uit?
Tencent publiceerde:
Hy4 preview
Hy4 preview-FP8
op Hugging Face, ModelScope, GitCode en CNB.[2]
Het model is ook beschikbaar via WorkBuddy, CodeBuddy, Tencent Cloud TokenHub en OpenRouter.[1][7]
Reuters bevestigde de release van 28 augustus en de genoemde use cases software engineering, research en financial analysis.[6]
770B betekent niet 770B actief per token
Hy4 gebruikt Mixture-of-Experts.
De backbone heeft:
770B total
maar activeert per token ongeveer:
49B
parameters.[2]
Dat is ongeveer 6,4% van de backbone.
MoE verlaagt de actieve compute per token, maar de volledige weights moeten nog steeds worden opgeslagen en verdeeld.
Opbouw van de experts
De backbone heeft 78 lagen.[2]
De eerste gebruikt een dense FFN.
De overige 77 bevatten:
256 routed experts
1 shared expert
Per token worden geactiveerd:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: grote schaalstap
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Dat is ongeveer:
- 2,61× meer totale parameters,
- 2,33× meer actieve parameters,
- minstens 3,9× langere opgegeven context.
Tencent zegt model size, context, trainingsdata en post-training tegelijk te hebben opgeschaald.[2]
1M-tokencontext
De model card vermeldt:
Context Length: 1M
OpenRouter rapporteert:
1,048,576 tokens
64,000 max completion tokens
Dit is aantrekkelijk voor grote codebases, lange agentsessies, multi-document workflows en research.
Maar maximale contextlengte is niet hetzelfde als effectieve contextkwaliteit.
Gated DeepSeek Sparse Attention
Hy4 gebruikt Gated DeepSeek Sparse Attention.[2]
Sparse attention probeert lange sequenties goedkoper te verwerken door relevante posities te selecteren.
Tencent combineert dit met:
IndexCache
Wat doet IndexCache?
IndexCache hergebruikt sparse indices tussen lagen.[8]
Het paper rapporteert op geteste DSA-modellen minder indexerwerk en prefill/decode-speedups met kleine kwaliteitsimpact.[8]
Dat zijn IndexCache-resultaten, geen directe volledige Hy4-benchmarkresultaten.
Native MTP-laag
Naast de backbone bevat Hy4 één Multi-Token Prediction-laag.[2]
Tencent geeft:
10B total
0.7B active
Deze wordt gebruikt voor speculative decoding en is ingeschakeld in de officiële vLLM- en SGLang-recipes.[2]
De weights zijn werkelijk publiek
Hugging Face toont:
tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0
Daarnaast is er:
tencent/Hy4-preview-FP8
Daarmee zijn self-hosting, fine-tuning, weight-analyse en eigen inference stacks mogelijk.
Apache 2.0
Model card en officieel repository vermelden:
Apache License 2.0
Dat is een permissieve licentie voor gebruik, aanpassing en distributie, ook commercieel, onder de licentievoorwaarden.
Officiële self-hosting
Tencent adviseert:
vLLM
SGLang
De vLLM-recipe gebruikt:
vllm/vllm-openai:hy4-preview
met:
--tensor-parallel-size 8
SGLang gebruikt --tp-size 8.
Dat betekent niet dat willekeurige acht GPU's voldoende zijn. Memory, precision, KV cache, context en concurrency zijn bepalend.
OpenAI-compatible API
Na deployment via vLLM of SGLang kan Hy4 via een OpenAI-compatible endpoint worden aangeroepen.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent adviseert temperature=0.9 en top_p=1.0.[2]
Reasoning kan worden beperkt
Standaard gebruikt Hy4 een hoge reasoningmodus voor moeilijke taken.[2]
Voor directere antwoorden:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
Dat is relevant omdat overlang reasoning een officiële beperking is.
Officiële previewbeperkingen
- soms langer redeneren dan nodig,
- neiging tot over-verification.
In agents kan dat meer tool calls, latency en kosten opleveren.
Benchmarks: eerst de caveat
Tencent publiceerde een benchmark appendix in de model card.[2]
Op 31 augustus ontbreekt nog brede onafhankelijke replicatie van de volledige tabel onder identieke instellingen.
Daarom labelen we de scores als:
Tencent-reported
Geselecteerde resultaten
Transcriptie van Tencent's tabel:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High zonder tools | 43,4% |
Alle waarden zijn vendor-reported.
SWE-bench Multilingual: 82,9%
Tencent rapporteert:
Hy4 preview: 82.9%
Hy3: 75.8%
Dat is +7,1 procentpunt.
Controleer altijd benchmarkvariant en harness voor externe vergelijkingen.
SWE-bench Pro: 65,7%
Tencent rapporteert:
Hy4 preview: 65.7%
Hy3: 57.9%
Dat is +7,8 punt en een sterke aanwijzing voor meer software-engineeringcapaciteit.
DeepSWE: grootste generatiesprong
De transcriptie toont:
Hy3: 28.0%
Hy4 preview: 64.3%
Juist zo'n grote sprong vraagt om onafhankelijke replicatie.
Terminal-Bench 2.1: 85,4%
Tencent rapporteert:
Hy4 preview: 85.4%
Sterk voor coding agents, maar Tencent toont zelf ook concurrenten met vergelijkbare of hogere waarden. Geen universele overwinning.
GPQA Diamond: 92,3%
Tencent-reported:
92.3%
Dit past bij de positionering voor scientific reasoning.[1]
Een benchmark garandeert geen betrouwbaarheid in echt onderzoek.
MCP-Atlas en tool use
Tencent rapporteert:
MCP-Atlas: 83.7%
OpenRouter ondersteunt tools, tool_choice en structured outputs via JSON Schema voor Hy4.[7]
Hy4 vs Kimi K3 en GLM-5.3: interne blindtest
163 Tencent-experts
203 engineeringtaken
schaal 0–4
Gemiddelden:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Tegen Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Tegen GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
Een kleine voorsprong in Tencent's interne workload, geen universeel onafhankelijk bewijs.
Claude Opus 5 en GPT-5.6 Sol
Tencent neemt ook gesloten frontiermodellen op in de appendix.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Dubbele waarden zijn verschillende instellingen/varianten in Tencent's chart en horen niet in één simpel rankingcijfer.
API-prijs
Tencent publiceert:[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter toont dezelfde tarieven.[7][13]
Prijs per token is niet gelijk aan kosten per taak. Lang reasoning en extra tool calls kunnen de werkelijke kosten veranderen.
Self-hosting vs API
API
Goed voor snelle adoptie, variabele vraag en als een groot GPU-cluster ongewenst is.
Self-hosting
Interessant voor data residency, inferencecontrole en grote stabiele workloads.
Met ongeveer 1,56 TB volledige weights is dit geen typisch model voor één workstation.[3]
Heeft Hy4 zichzelf echt “geoptimaliseerd”?
Tencent zegt dat Hy4 deelnam aan automatische optimalisatie van training methods, data strategies, evaluation frameworks en low-level operators.[1]
Het model zou voorstellen hebben gedaan, experimenten hebben uitgevoerd en resultaten hebben gebruikt voor iteratie.
Tencent noemt dit:
early-stage recursive self-improvement loop
Dat is niet hetzelfde als volledig autonoom zelftrainen.
Wat betekent +31,8% throughput?
Tencent zegt dat Hy4 bottlenecks analyseerde en iteraties uitvoerde rond operator fusion en communication optimization.[1]
Resultaat:
+31.8% end-to-end throughput
vs interne Tencent-baseline
Niet 31,8% sneller dan Kimi, Claude of GPT.
Grootste voordelen
- Apache 2.0.
- 1M context.
- 49B actief uit 770B totaal.
- Sterk coding/agentprofiel volgens Tencent.
- Officiële vLLM/SGLang-recipes.
- FP8.
- Competitieve API-prijs.
Risico's en onzekerheden
- Previewstatus.
- Benchmarks vooral vendor-reported.
- Over-reasoning.
- Over-verification.
- Zware self-hostinginfrastructuur.
- Werkelijke kwaliteit van 1M context moet worden getest.
- Data governance verschilt per API-provider.
Hoe benchmark je dit in een bedrijf?
Vergelijk op identieke taken:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Meet:
- task completion,
- test pass rate,
- diffkwaliteit,
- tool calls,
- retries,
- tokens,
- latency,
- kosten per taak,
- regressies,
- out-of-scope wijzigingen,
- long-context quality.
Belangrijkste metric:
cost per successful task
Deploymentchecklist
Kwaliteit
- Test interne taken.
- Scheid Tencent-benchmarks van onafhankelijke resultaten.
- Vergelijk high reasoning en
no_think. - Meet over-verification.
- Test hallucinaties.
- Valideer tool calling.
- Valideer structured outputs.
- Test lange agentsessies.
Long context
- Test 32K, 128K, 256K en groter.
- Meet retrieval accuracy.
- Meet time-to-first-token.
- Meet KV-cache footprint.
- Neem niet aan dat 1M context = 1M perfect geheugen.
- Test repo-level coding.
- Test cross-document reasoning.
- Test prompt injection in lange context.
Self-hosting
- Verifieer GPU-eisen.
- Begin met officiële FP8.
- Test vLLM.
- Test SGLang.
- Meet throughput bij echte concurrency.
- Meet P50/P95/P99.
- Plan storage.
- Laat Apache 2.0 juridisch beoordelen.
API
- Controleer actuele prijs.
- Controleer cache semantics en TTL.
- Controleer data retention.
- Controleer processing region.
- Stel kostenlimieten in.
- Monitor usage per agent.
- Houd fallback model.
- Meet cost per successful task.
Is migreren vanaf Hy3 zinvol?
Voor Hy3-gebruikers verdient Hy4 een POC.
Op papier:
295B → 770B total
21B → 49B active
256K → 1M context
plus grote vendor-reported verbeteringen in coding en agent-evals.[2][5][9]
Maar Hy4 kan langer reasonen, vraagt meer infrastructuur en is nog preview.
POLPROG-oordeel
Hy4 preview is een van de belangrijkste open-weight releases van eind augustus 2026.
Belangrijk is de combinatie:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agressieve API-prijs
sterk coding/agentprofiel
Drie bewijsniveaus moeten apart blijven.
Technische feiten
Architectuur, licentie, weights, context, deployment en prijs zijn goed gedocumenteerd.[1][2][3][7]
Benchmarks
Indrukwekkend, maar bij launch vooral Tencent-reported.[2][9][10]
Self-improvement
Een reëel onderdeel van het beschreven R&D-proces, geen volledig autonoom self-training.[1]
Redelijke conclusie op 31 augustus:
Hy4 preview hoort op de shortlist voor coding agents, research agents, long-context workflows en self-hosted AI-infrastructuur.
Nog niet gerechtvaardigd:
Hy4 is het beste model ter wereld.
Wel gerechtvaardigd:
Tencent heeft Hy4 in de kleine groep open-weight modellen gebracht die niet langer genegeerd kunnen worden in een productie-AI-stack.

