Tencent Hy4 preview: 770B parameters, 49B actief en 1M context. Benchmarks, prijs en vergelijking met Kimi K3, GLM-5.3 en Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parameters, 49B actief en 1M context. Benchmarks, prijs en vergelijking met Kimi K3, GLM-5.3 en Claude Opus 5

Geverifieerde analyse van Tencent Hy4 preview: 770B/49B MoE, 1M context, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, interne blindtest, API-prijs, self-hosting, FP8, vLLM/SGLang en previewbeperkingen.

Gepubliceerd Geschreven door Leestijd 16 min lezen

Geverifieerde analyse van Tencent Hy4 preview: 770B/49B MoE, 1M context, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, interne blindtest, API-prijs, self-hosting, FP8, vLLM/SGLang en previewbeperkingen.

Op deze pagina
  1. 1TL;DR
  2. 2Wat bracht Tencent uit?
  3. 3770B betekent niet 770B actief per token
  4. 4Opbouw van de experts
  5. 5Hy4 vs Hy3: grote schaalstap
  6. 61M-tokencontext
  7. 7Gated DeepSeek Sparse Attention
  8. 8Wat doet IndexCache?
  9. 9Native MTP-laag
  10. 10De weights zijn werkelijk publiek
  11. 11Apache 2.0
  12. 12Officiële self-hosting
  13. 13OpenAI-compatible API
  14. 14Reasoning kan worden beperkt
  15. 15Officiële previewbeperkingen
  16. 16Benchmarks: eerst de caveat
  17. 17Geselecteerde resultaten
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: grootste generatiesprong
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas en tool use
  24. 24Hy4 vs Kimi K3 en GLM-5.3: interne blindtest
  25. 25Claude Opus 5 en GPT-5.6 Sol
  26. 26API-prijs
  27. 27Self-hosting vs API
  28. 28Heeft Hy4 zichzelf echt “geoptimaliseerd”?
  29. 29Wat betekent +31,8% throughput?
  30. 30Grootste voordelen
  31. 31Risico's en onzekerheden
  32. 32Hoe benchmark je dit in een bedrijf?
  33. 33Deploymentchecklist
  34. 34Is migreren vanaf Hy3 zinvol?
  35. 35POLPROG-oordeel

Op 28 augustus 2026 publiceerde en open-sourcete Tencent Hy4 preview, het nieuwe Mixture-of-Experts-flagship van de Tencent Hy-familie, eerder vooral bekend als Hunyuan.[1][6]

Belangrijkste specificaties:

770B totale parameters
49B actieve parameters per token
78 lagen
256 routed experts + 1 shared expert
top-8 routed experts per token
1M context
Apache License 2.0

[2]

Tencent bracht volledige gewichten en Hy4 preview-FP8 uit. De volledige Hugging Face-repository is ongeveer 1,56 TB.[2][3]

Het model is gericht op software engineering, kantoorwerk, financiële analyse, game development, wetenschappelijk onderzoek en tool-using agents.[1][2]

Drie punten zijn essentieel.

Ten eerste staan de weights onder Apache 2.0, zodat self-hosting en commercieel gebruik mogelijk zijn binnen de voorwaarden van de licentie.[2][4]

Ten tweede rapporteert Tencent sterke vendor-reported scores, zoals 82,9% op SWE-bench Multilingual, 85,4% op Terminal-Bench 2.1 en 83,7% op MCP-Atlas.[2][9]

Ten derde zegt Tencent dat Hy4 betrokken was bij optimalisatie van zijn eigen ontwikkel- en inferenceproces. Een afzonderlijke optimalisatieronde zou de end-to-end throughput met 31,8% tegenover een interne Tencent-baseline hebben verhoogd.[1]

Dat is niet hetzelfde als volledig autonoom zelftrainen. Tencent beschrijft een vroege engineeringloop voor recursive self-improvement.

Informatiestatus: 31 augustus 2026.

TL;DR

VraagGeverifieerd antwoord
ModelTencent Hy4 preview
Release28 augustus 2026
TypeMixture-of-Experts
Totale parameters770B
Actieve parameters49B per token
Lagen78
Routed experts256
Shared experts1
Actieve routed expertstop-8
Context1M in model card, 1.048.576 op OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
Sparse-attention-optimalisatieIndexCache
MTP1 native laag, 10B total / 0,7B active
LicentieApache 2.0
Volledige weightsca. 1,56 TB
Quantized variantHy4 preview-FP8
Self-hostingvLLM en SGLang
Officiële recipetensor parallel size 8
API input$0.834 / 1M tokens
API output$2.501 / 1M tokens
Cache hit$0.042 / 1M tokens
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
StatusPreview
Bekende beperkingente lang reasoning en over-verification
Belangrijkste caveatnog geen brede onafhankelijke replicatie van de volledige launch-tabel

Wat bracht Tencent uit?

Tencent publiceerde:

Hy4 preview
Hy4 preview-FP8

op Hugging Face, ModelScope, GitCode en CNB.[2]

Het model is ook beschikbaar via WorkBuddy, CodeBuddy, Tencent Cloud TokenHub en OpenRouter.[1][7]

Reuters bevestigde de release van 28 augustus en de genoemde use cases software engineering, research en financial analysis.[6]

770B betekent niet 770B actief per token

Hy4 gebruikt Mixture-of-Experts.

De backbone heeft:

770B total

maar activeert per token ongeveer:

49B

parameters.[2]

Dat is ongeveer 6,4% van de backbone.

MoE verlaagt de actieve compute per token, maar de volledige weights moeten nog steeds worden opgeslagen en verdeeld.

Opbouw van de experts

De backbone heeft 78 lagen.[2]

De eerste gebruikt een dense FFN.

De overige 77 bevatten:

256 routed experts
1 shared expert

Per token worden geactiveerd:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: grote schaalstap

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Dat is ongeveer:

  • 2,61× meer totale parameters,
  • 2,33× meer actieve parameters,
  • minstens 3,9× langere opgegeven context.

Tencent zegt model size, context, trainingsdata en post-training tegelijk te hebben opgeschaald.[2]

1M-tokencontext

De model card vermeldt:

Context Length: 1M

[2]

OpenRouter rapporteert:

1,048,576 tokens
64,000 max completion tokens

[7]

Dit is aantrekkelijk voor grote codebases, lange agentsessies, multi-document workflows en research.

Maar maximale contextlengte is niet hetzelfde als effectieve contextkwaliteit.

Gated DeepSeek Sparse Attention

Hy4 gebruikt Gated DeepSeek Sparse Attention.[2]

Sparse attention probeert lange sequenties goedkoper te verwerken door relevante posities te selecteren.

Tencent combineert dit met:

IndexCache

Wat doet IndexCache?

IndexCache hergebruikt sparse indices tussen lagen.[8]

Het paper rapporteert op geteste DSA-modellen minder indexerwerk en prefill/decode-speedups met kleine kwaliteitsimpact.[8]

Dat zijn IndexCache-resultaten, geen directe volledige Hy4-benchmarkresultaten.

Native MTP-laag

Naast de backbone bevat Hy4 één Multi-Token Prediction-laag.[2]

Tencent geeft:

10B total
0.7B active

Deze wordt gebruikt voor speculative decoding en is ingeschakeld in de officiële vLLM- en SGLang-recipes.[2]

De weights zijn werkelijk publiek

Hugging Face toont:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

Daarnaast is er:

tencent/Hy4-preview-FP8

[11]

Daarmee zijn self-hosting, fine-tuning, weight-analyse en eigen inference stacks mogelijk.

Apache 2.0

Model card en officieel repository vermelden:

Apache License 2.0

[2][4]

Dat is een permissieve licentie voor gebruik, aanpassing en distributie, ook commercieel, onder de licentievoorwaarden.

Officiële self-hosting

Tencent adviseert:

vLLM
SGLang

[2]

De vLLM-recipe gebruikt:

vllm/vllm-openai:hy4-preview

met:

--tensor-parallel-size 8

[2]

SGLang gebruikt --tp-size 8.

Dat betekent niet dat willekeurige acht GPU's voldoende zijn. Memory, precision, KV cache, context en concurrency zijn bepalend.

OpenAI-compatible API

Na deployment via vLLM of SGLang kan Hy4 via een OpenAI-compatible endpoint worden aangeroepen.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent adviseert temperature=0.9 en top_p=1.0.[2]

Reasoning kan worden beperkt

Standaard gebruikt Hy4 een hoge reasoningmodus voor moeilijke taken.[2]

Voor directere antwoorden:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

Dat is relevant omdat overlang reasoning een officiële beperking is.

Officiële previewbeperkingen

Tencent noemt:[2][6]

  1. soms langer redeneren dan nodig,
  2. neiging tot over-verification.

In agents kan dat meer tool calls, latency en kosten opleveren.

Benchmarks: eerst de caveat

Tencent publiceerde een benchmark appendix in de model card.[2]

Op 31 augustus ontbreekt nog brede onafhankelijke replicatie van de volledige tabel onder identieke instellingen.

Daarom labelen we de scores als:

Tencent-reported

Geselecteerde resultaten

Transcriptie van Tencent's tabel:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High zonder tools43,4%

Alle waarden zijn vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent rapporteert:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Dat is +7,1 procentpunt.

Controleer altijd benchmarkvariant en harness voor externe vergelijkingen.

SWE-bench Pro: 65,7%

Tencent rapporteert:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Dat is +7,8 punt en een sterke aanwijzing voor meer software-engineeringcapaciteit.

DeepSWE: grootste generatiesprong

De transcriptie toont:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Juist zo'n grote sprong vraagt om onafhankelijke replicatie.

Terminal-Bench 2.1: 85,4%

Tencent rapporteert:

Hy4 preview: 85.4%

[9][10]

Sterk voor coding agents, maar Tencent toont zelf ook concurrenten met vergelijkbare of hogere waarden. Geen universele overwinning.

GPQA Diamond: 92,3%

Tencent-reported:

92.3%

[9][10]

Dit past bij de positionering voor scientific reasoning.[1]

Een benchmark garandeert geen betrouwbaarheid in echt onderzoek.

MCP-Atlas en tool use

Tencent rapporteert:

MCP-Atlas: 83.7%

[9][10]

OpenRouter ondersteunt tools, tool_choice en structured outputs via JSON Schema voor Hy4.[7]

Hy4 vs Kimi K3 en GLM-5.3: interne blindtest

Tencent testte:[1][2]

163 Tencent-experts
203 engineeringtaken
schaal 0–4

Gemiddelden:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Tegen Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Tegen GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

Een kleine voorsprong in Tencent's interne workload, geen universeel onafhankelijk bewijs.

Claude Opus 5 en GPT-5.6 Sol

Tencent neemt ook gesloten frontiermodellen op in de appendix.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Dubbele waarden zijn verschillende instellingen/varianten in Tencent's chart en horen niet in één simpel rankingcijfer.

API-prijs

Tencent publiceert:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter toont dezelfde tarieven.[7][13]

Prijs per token is niet gelijk aan kosten per taak. Lang reasoning en extra tool calls kunnen de werkelijke kosten veranderen.

Self-hosting vs API

API

Goed voor snelle adoptie, variabele vraag en als een groot GPU-cluster ongewenst is.

Self-hosting

Interessant voor data residency, inferencecontrole en grote stabiele workloads.

Met ongeveer 1,56 TB volledige weights is dit geen typisch model voor één workstation.[3]

Heeft Hy4 zichzelf echt “geoptimaliseerd”?

Tencent zegt dat Hy4 deelnam aan automatische optimalisatie van training methods, data strategies, evaluation frameworks en low-level operators.[1]

Het model zou voorstellen hebben gedaan, experimenten hebben uitgevoerd en resultaten hebben gebruikt voor iteratie.

Tencent noemt dit:

early-stage recursive self-improvement loop

Dat is niet hetzelfde als volledig autonoom zelftrainen.

Wat betekent +31,8% throughput?

Tencent zegt dat Hy4 bottlenecks analyseerde en iteraties uitvoerde rond operator fusion en communication optimization.[1]

Resultaat:

+31.8% end-to-end throughput
vs interne Tencent-baseline

Niet 31,8% sneller dan Kimi, Claude of GPT.

Grootste voordelen

  • Apache 2.0.
  • 1M context.
  • 49B actief uit 770B totaal.
  • Sterk coding/agentprofiel volgens Tencent.
  • Officiële vLLM/SGLang-recipes.
  • FP8.
  • Competitieve API-prijs.

Risico's en onzekerheden

  • Previewstatus.
  • Benchmarks vooral vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Zware self-hostinginfrastructuur.
  • Werkelijke kwaliteit van 1M context moet worden getest.
  • Data governance verschilt per API-provider.

Hoe benchmark je dit in een bedrijf?

Vergelijk op identieke taken:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Meet:

  • task completion,
  • test pass rate,
  • diffkwaliteit,
  • tool calls,
  • retries,
  • tokens,
  • latency,
  • kosten per taak,
  • regressies,
  • out-of-scope wijzigingen,
  • long-context quality.

Belangrijkste metric:

cost per successful task

Deploymentchecklist

Kwaliteit

  • Test interne taken.
  • Scheid Tencent-benchmarks van onafhankelijke resultaten.
  • Vergelijk high reasoning en no_think.
  • Meet over-verification.
  • Test hallucinaties.
  • Valideer tool calling.
  • Valideer structured outputs.
  • Test lange agentsessies.

Long context

  • Test 32K, 128K, 256K en groter.
  • Meet retrieval accuracy.
  • Meet time-to-first-token.
  • Meet KV-cache footprint.
  • Neem niet aan dat 1M context = 1M perfect geheugen.
  • Test repo-level coding.
  • Test cross-document reasoning.
  • Test prompt injection in lange context.

Self-hosting

  • Verifieer GPU-eisen.
  • Begin met officiële FP8.
  • Test vLLM.
  • Test SGLang.
  • Meet throughput bij echte concurrency.
  • Meet P50/P95/P99.
  • Plan storage.
  • Laat Apache 2.0 juridisch beoordelen.

API

  • Controleer actuele prijs.
  • Controleer cache semantics en TTL.
  • Controleer data retention.
  • Controleer processing region.
  • Stel kostenlimieten in.
  • Monitor usage per agent.
  • Houd fallback model.
  • Meet cost per successful task.

Is migreren vanaf Hy3 zinvol?

Voor Hy3-gebruikers verdient Hy4 een POC.

Op papier:

295B → 770B total
21B → 49B active
256K → 1M context

plus grote vendor-reported verbeteringen in coding en agent-evals.[2][5][9]

Maar Hy4 kan langer reasonen, vraagt meer infrastructuur en is nog preview.

POLPROG-oordeel

Hy4 preview is een van de belangrijkste open-weight releases van eind augustus 2026.

Belangrijk is de combinatie:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agressieve API-prijs
sterk coding/agentprofiel

Drie bewijsniveaus moeten apart blijven.

Technische feiten

Architectuur, licentie, weights, context, deployment en prijs zijn goed gedocumenteerd.[1][2][3][7]

Benchmarks

Indrukwekkend, maar bij launch vooral Tencent-reported.[2][9][10]

Self-improvement

Een reëel onderdeel van het beschreven R&D-proces, geen volledig autonoom self-training.[1]

Redelijke conclusie op 31 augustus:

Hy4 preview hoort op de shortlist voor coding agents, research agents, long-context workflows en self-hosted AI-infrastructuur.

Nog niet gerechtvaardigd:

Hy4 is het beste model ter wereld.

Wel gerechtvaardigd:

Tencent heeft Hy4 in de kleine groep open-weight modellen gebracht die niet langer genegeerd kunnen worden in een productie-AI-stack.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Veelgestelde vragen

Releasedatum

28 augustus 2026.

Open source?

Tencent noemt het open source en publiceert weights/code onder Apache 2.0.

Parameters

770B total, 49B actief per token in backbone.

MTP inbegrepen in 770B?

Nee volgens model card: 10B total / 0,7B active extra.

Context

1M in model card, 1.048.576 op OpenRouter.

Max output

64K op OpenRouter.

Self-hosting

Ja.

Officiële frameworks

vLLM en SGLang.

FP8?

Ja.

Grootte weights

Ongeveer 1,56 TB.

Licentie

Apache 2.0.

API-prijs

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

Heeft Hy4 Kimi K3 verslagen?

In Tencent's interne blindtest 2.99/4 vs 2.94/4. Geen onafhankelijk universeel bewijs.

GLM-5.3?

2.99 vs 2.92 in dezelfde test.

Claude Opus 5?

Geen basis voor een algemene superioriteitsclaim.

Onafhankelijke benchmarks?

Nog geen brede replicatie van de volledige Tencent-tabel.

Bekende zwaktes

Te lang reasoning en over-verification.

Heeft Hy4 zichzelf verbeterd?

Tencent beschrijft model-assisted automatische experimenten en pipelineoptimalisatie, geen volledig autonome training.

+31,8% throughput

Verbetering ten opzichte van Tencent's interne inference-baseline, niet ten opzichte van concurrenten.

Bronnen en voetnoten

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 augustus 2026, geraadpleegd op 31 augustus 2026.123456789101112
  2. Tencent, Hy4 preview — officiële Hugging Face model card, geraadpleegd op 31 augustus 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, geraadpleegd op 31 augustus 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — officieel GitHub-repository, geraadpleegd op 31 augustus 2026.12
  5. Tencent, Hy3 Now Available Globally, 5 augustus 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 augustus 2026.123
  7. OpenRouter, Tencent: Hy4 preview, status gecontroleerd op 31 augustus 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, maart 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 augustus 2026. Waarden getranscribeerd uit Tencent's tabel, geen onafhankelijke replicatie.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, geraadpleegd op 31 augustus 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, geraadpleegd op 31 augustus 2026.
  12. Tencent, Hy3 preview launch, 24 april 2026.
  13. OpenRouter, Tencent models, geraadpleegd op 31 augustus 2026.

Was dit nuttig?

Ontvang nieuwe artikelen per e-mail

Eén korte e-mail per nieuw blogartikel. Geen spam, uitschrijven in één klik.

We gebruiken je e-mail alleen om nieuwe artikelen te sturen. Geen delen met derden.

Terug naar de blog