Tencent Hy4 preview: 770B parametrov, 49B aktívnych a kontext 1M. Benchmarky, cena a porovnanie s Kimi K3, GLM-5.3 a Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parametrov, 49B aktívnych a kontext 1M. Benchmarky, cena a porovnanie s Kimi K3, GLM-5.3 a Claude Opus 5

Overená analýza Tencent Hy4 preview: MoE 770B/49B, kontext 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarky, interný blind test, API cena, self-hosting, FP8, vLLM/SGLang a limity preview.

Publikované Autor Čas čítania 16 min čítania

Overená analýza Tencent Hy4 preview: MoE 770B/49B, kontext 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarky, interný blind test, API cena, self-hosting, FP8, vLLM/SGLang a limity preview.

Na tejto stránke
  1. 1TL;DR
  2. 2Čo Tencent vydal?
  3. 3770B neznamená 770B aktívnych na token
  4. 4Ako sú experti usporiadaní?
  5. 5Hy4 vs Hy3: veľký skok
  6. 6Kontext 1M
  7. 7Gated DeepSeek Sparse Attention
  8. 8Čo je IndexCache?
  9. 9Natívna MTP vrstva
  10. 10Váhy sú skutočne verejné
  11. 11Apache 2.0
  12. 12Oficiálny self-hosting
  13. 13OpenAI-compatible API
  14. 14Reasoning možno obmedziť
  15. 15Oficiálne limity preview
  16. 16Benchmarky: hlavný caveat
  17. 17Vybrané výsledky
  18. 18SWE-bench Multilingual: 82,9 %
  19. 19SWE-bench Pro: 65,7 %
  20. 20DeepSWE: najväčší skok
  21. 21Terminal-Bench 2.1: 85,4 %
  22. 22GPQA Diamond: 92,3 %
  23. 23MCP-Atlas a tool use
  24. 24Hy4 vs Kimi K3 a GLM-5.3: interný blind test
  25. 25Claude Opus 5 a GPT-5.6 Sol
  26. 26API cena
  27. 27Self-hosting vs API
  28. 28Naozaj Hy4 „optimalizoval sám seba“?
  29. 29Čo znamená +31,8 % throughput?
  30. 30Hlavné výhody
  31. 31Riziká a neznáme
  32. 32Ako benchmarkovať vo firme?
  33. 33Deployment checklist
  34. 34Oplatí sa prejsť z Hy3?
  35. 35Verdikt POLPROG

Dňa 28. augusta 2026 Tencent vydal a open-sourcoval Hy4 preview, nový flagship Mixture-of-Experts model rodiny Tencent Hy, predtým známej najmä ako Hunyuan.[1][6]

Hlavné parametre:

770B parametrov celkom
49B aktívnych parametrov na token
78 vrstiev
256 routed experts + 1 shared expert
top-8 routed experts na token
kontext 1M
Apache License 2.0

[2]

Tencent zverejnil plné váhy aj Hy4 preview-FP8. Kompletný Hugging Face repository má približne 1,56 TB.[2][3]

Model je určený pre software engineering, kancelárske workflow, finančnú analýzu, game development, vedecký výskum a tool-using agentov.[1][2]

Tri body sú zásadné.

Po prvé, váhy sú pod Apache 2.0, takže je možný self-hosting aj komerčné použitie v súlade s licenciou.[2][4]

Po druhé Tencent uvádza silné vendor-reported benchmarky, napríklad 82,9 % SWE-bench Multilingual, 85,4 % Terminal-Bench 2.1 a 83,7 % MCP-Atlas.[2][9]

Po tretie Tencent tvrdí, že Hy4 pomáhal optimalizovať vlastný vývojový a inference pipeline. Jedna optimalizačná slučka mala zvýšiť end-to-end throughput o 31,8 % oproti internému baseline Tencent.[1]

To neznamená plne autonómny self-training. Tencent opisuje ranú engineeringovú recursive self-improvement slučku.

Stav informácií: 31. augusta 2026.

TL;DR

OtázkaOverená odpoveď
ModelTencent Hy4 preview
Release28. augusta 2026
TypMixture-of-Experts
Parametre celkom770B
Aktívne parametre49B na token
Vrstvy78
Routed experts256
Shared experts1
Aktívne routed expertstop-8
Kontext1M v model card, 1 048 576 na OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
OptimalizáciaIndexCache
MTP1 natívna vrstva, 10B total / 0,7B active
LicenciaApache 2.0
Plné váhycca 1,56 TB
Quantized verziaHy4 preview-FP8
Self-hostingvLLM a SGLang
Oficiálny recipetensor parallel size 8
API input$0.834 / 1M tokenov
API output$2.501 / 1M tokenov
Cache hit$0.042 / 1M tokenov
SWE-bench Multilingual82,9 %, Tencent-reported
SWE-bench Pro65,7 %, Tencent-reported
Terminal-Bench 2.185,4 %, Tencent-reported
GPQA Diamond92,3 %, Tencent-reported
MCP-Atlas83,7 %, Tencent-reported
StavPreview
Limitypríliš dlhý reasoning a over-verification
Caveatchýba široká nezávislá replikácia celej launch tabuľky

Čo Tencent vydal?

Tencent zverejnil:

Hy4 preview
Hy4 preview-FP8

na Hugging Face, ModelScope, GitCode a CNB.[2]

Model je dostupný aj cez WorkBuddy, CodeBuddy, Tencent Cloud TokenHub a OpenRouter.[1][7]

Reuters potvrdil release 28. augusta a zameranie na software engineering, research a financial analysis.[6]

770B neznamená 770B aktívnych na token

Hy4 používa Mixture-of-Experts.

Backbone má:

770B total

ale na token aktivuje približne:

49B

parametrov.[2]

To je asi 6,4 % backbone.

MoE znižuje aktívny compute na token, ale celý model musí byť stále uložený a rozdelený v inference infraštruktúre.

Ako sú experti usporiadaní?

Backbone má 78 vrstiev.[2]

Prvá používa dense FFN.

Ďalších 77 obsahuje:

256 routed experts
1 shared expert

Na token sa aktivuje:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: veľký skok

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Približne:

  • 2,61× viac celkových parametrov,
  • 2,33× viac aktívnych parametrov,
  • minimálne 3,9× dlhší deklarovaný kontext.

Tencent uvádza, že súčasne rozšíril veľkosť, kontext, tréningové dáta a post-training.[2]

Kontext 1M

Model card uvádza:

Context Length: 1M

[2]

OpenRouter:

1,048,576 tokens
64,000 max completion tokens

[7]

Je to zaujímavé pre veľké codebase, dlhé agent sessions, multi-document analysis a research.

Maximálny kontext však nie je to isté ako efektívna kvalita práce s celou dĺžkou.

Gated DeepSeek Sparse Attention

Hy4 používa Gated DeepSeek Sparse Attention.[2]

Sparse attention obmedzuje výpočet pri dlhých sekvenciách výberom relevantných pozícií.

Tencent ho kombinuje s:

IndexCache

Čo je IndexCache?

IndexCache znovu používa sparse indices medzi vrstvami.[8]

Paper ukazuje na testovaných DSA modeloch nižšiu prácu indexera a rýchlejší prefill/decode pri malom dopade na kvalitu.[8]

Ide o výsledky IndexCache, nie priame kompletné benchmarky Hy4.

Natívna MTP vrstva

Hy4 má mimo backbone jednu Multi-Token Prediction vrstvu.[2]

Tencent uvádza:

10B total
0.7B active

Slúži na speculative decoding a oficiálne vLLM/SGLang recipes ju používajú.[2]

Váhy sú skutočne verejné

Hugging Face ukazuje:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

K dispozícii je aj:

tencent/Hy4-preview-FP8

[11]

To umožňuje self-hosting, fine-tuning, analýzu váh a vlastný inference stack.

Apache 2.0

Model card a oficiálne repo uvádzajú:

Apache License 2.0

[2][4]

Ide o permisívnu licenciu umožňujúcu použitie, zmeny a distribúciu vrátane komerčného použitia podľa jej podmienok.

Oficiálny self-hosting

Tencent odporúča:

vLLM
SGLang

[2]

vLLM recipe používa:

vllm/vllm-openai:hy4-preview

a:

--tensor-parallel-size 8

[2]

SGLang používa --tp-size 8.

Neznamená to, že stačí ľubovoľných osem GPU. Rozhoduje memory, precision, KV cache, context a concurrency.

OpenAI-compatible API

Po deploymente cez vLLM/SGLang možno Hy4 volať cez OpenAI-compatible endpoint.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent odporúča temperature=0.9 a top_p=1.0.[2]

Reasoning možno obmedziť

Defaultne Hy4 používa high reasoning pre zložité úlohy.[2]

Pre priamejšie odpovede:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

To je užitočné, pretože príliš dlhý reasoning je oficiálna limitation.

Oficiálne limity preview

Tencent priznáva:[2][6]

  1. model niekedy uvažuje dlhšie, než je potrebné,
  2. má tendenciu k over-verification.

V agentoch to môže znamenať viac tool calls, latency a nákladov.

Benchmarky: hlavný caveat

Tencent vydal benchmark appendix v model card.[2]

K 31. augustu chýba široká nezávislá replikácia celej tabuľky v identickej konfigurácii.

Preto používame označenie:

Tencent-reported

Vybrané výsledky

Transkripcia Tencent tabuľky:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3 %
Terminal-Bench 2.185,4 %
MCP-Atlas83,7 %
SWE-bench Multilingual82,9 %
MathArena Apex 202574,2 %
SWE-bench Pro65,7 %
DeepSWE64,3 %
HLE, High + Tools55,4 %
HLE, High bez tools43,4 %

Všetky sú vendor-reported.

SWE-bench Multilingual: 82,9 %

Tencent:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Rozdiel +7,1 bodu.

Pred porovnaním s inými výsledkami treba skontrolovať variant benchmarku a harness.

SWE-bench Pro: 65,7 %

Tencent:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

+7,8 bodu, teda silný signál zlepšenia software engineering.

DeepSWE: najväčší skok

Transkripcia:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Taký veľký rozdiel si obzvlášť zaslúži nezávislú replikáciu.

Terminal-Bench 2.1: 85,4 %

Tencent uvádza:

Hy4 preview: 85.4%

[9][10]

Silné pre coding agents, ale v tabuľke sú aj konkurenti s podobnými alebo vyššími výsledkami. Nie je to univerzálne víťazstvo.

GPQA Diamond: 92,3 %

Tencent-reported:

92.3%

[9][10]

Podporuje positioning pre scientific reasoning.[1]

Benchmark však nezaručuje spoľahlivosť v reálnom výskume.

MCP-Atlas a tool use

Tencent:

MCP-Atlas: 83.7%

[9][10]

OpenRouter podporuje pre Hy4 tools, tool_choice a structured outputs cez JSON Schema.[7]

Hy4 vs Kimi K3 a GLM-5.3: interný blind test

Tencent testoval:[1][2]

163 Tencent expertov
203 engineering tasks
škála 0–4

Priemer:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Proti Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Proti GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

Je to malý náskok v internom workload Tencent, nie univerzálny nezávislý dôkaz.

Claude Opus 5 a GPT-5.6 Sol

Tencent zahŕňa aj uzavreté frontier modely.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Dvojité hodnoty sú rôzne varianty/settings v grafe Tencent a nemožno ich zlúčiť do jedného jednoduchého rebríčka.

API cena

Tencent uvádza:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter zobrazuje rovnaké ceny.[7][13]

Cena tokenu nie je cena úspešného tasku. Dlhý reasoning a ďalšie tool calls môžu zmeniť ekonomiku.

Self-hosting vs API

API

Vhodné na rýchle nasadenie, premenlivý load a keď nechcete prevádzkovať veľký GPU cluster.

Self-hosting

Vhodné pre data residency, kontrolu inference a veľké stabilné workloady.

Pri cca 1,56 TB full weights nejde o bežný single-workstation model.[3]

Naozaj Hy4 „optimalizoval sám seba“?

Tencent tvrdí, že model pomáhal automaticky optimalizovať training methods, data strategies, evaluation frameworks a low-level operators.[1]

Navrhoval prístupy, spúšťal experimenty a iteroval podľa výsledkov.

Tencent tomu hovorí:

early-stage recursive self-improvement loop

Neznamená to plne autonómny self-training.

Čo znamená +31,8 % throughput?

Tencent hovorí, že Hy4 analyzoval bottlenecks a iteroval nad operator fusion a communication optimization.[1]

Výsledok:

+31.8% end-to-end throughput
vs interný Tencent baseline

Nie 31,8 % rýchlejší než Kimi, Claude alebo GPT.

Hlavné výhody

  • Apache 2.0.
  • Kontext 1M.
  • 49B aktívnych zo 770B total.
  • Silný coding/agent profil podľa Tencent.
  • Oficiálne vLLM/SGLang recipes.
  • FP8.
  • Konkurencieschopná API cena.

Riziká a neznáme

  • Preview status.
  • Benchmarky prevažne vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Náročná self-hosting infraštruktúra.
  • Reálnu kvalitu 1M context treba testovať.
  • Data governance závisí pri API od providera.

Ako benchmarkovať vo firme?

Porovnať na identických taskoch:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Merať:

  • task completion,
  • test pass rate,
  • kvalitu diffu,
  • tool calls,
  • retry,
  • tokeny,
  • latency,
  • cenu za task,
  • regresie,
  • zmeny mimo scope,
  • long-context quality.

Kľúčová metrika:

cost per successful task

Deployment checklist

Kvalita

  • Testovať interné tasky.
  • Oddeliť Tencent benchmarky od nezávislých výsledkov.
  • Porovnať high reasoning a no_think.
  • Merať over-verification.
  • Testovať halucinácie.
  • Validovať tool calling.
  • Validovať structured outputs.
  • Testovať dlhé agent sessions.

Long context

  • Testovať 32K, 128K, 256K a viac.
  • Merať retrieval accuracy.
  • Merať time-to-first-token.
  • Merať KV-cache footprint.
  • Nepovažovať 1M context za 1M perfektnej pamäte.
  • Testovať repo-level coding.
  • Testovať cross-document reasoning.
  • Testovať prompt injection v dlhom kontexte.

Self-hosting

  • Overiť GPU requirements.
  • Začať oficiálnym FP8.
  • Testovať vLLM.
  • Testovať SGLang.
  • Merať throughput pri reálnej concurrency.
  • Merať P50/P95/P99.
  • Naplánovať storage.
  • Nechať právne preveriť Apache 2.0.

API

  • Overiť aktuálnu cenu.
  • Overiť cache semantics a TTL.
  • Overiť data retention.
  • Overiť processing region.
  • Nastaviť cost limits.
  • Monitorovať usage per agent.
  • Mať fallback model.
  • Merať cost per successful task.

Oplatí sa prejsť z Hy3?

Pre používateľov Hy3 je Hy4 jasný POC kandidát.

Na papieri:

295B → 770B total
21B → 49B active
256K → 1M context

plus veľké vendor-reported zlepšenia v coding a agent evals.[2][5][9]

Hy4 však môže reasonovať dlhšie, potrebuje viac infraštruktúry a stále je preview.

Verdikt POLPROG

Hy4 preview je jeden z najdôležitejších open-weight release konca augusta 2026.

Dôležitá je kombinácia:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agresívna API cena
silný coding/agent profil

Tri úrovne dôkazov treba oddeľovať.

Technické fakty

Architektúra, licencia, váhy, kontext, deployment a cena sú dobre zdokumentované.[1][2][3][7]

Benchmarky

Silné, ale pri launchi prevažne Tencent-reported.[2][9][10]

Self-improvement

Reálna súčasť opísaného R&D workflow, nie plne autonómny self-training.[1]

Rozumný záver k 31. augustu:

Hy4 preview patrí na shortlist pre coding agents, research agents, long-context workflow a self-hosted AI infraštruktúru.

Zatiaľ nemožno povedať:

Hy4 je najlepší model na svete.

Možno povedať:

Tencent dostal Hy4 do malej skupiny open-weight modelov, ktoré pri návrhu produkčného AI stacku nemožno ignorovať.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Často kladené otázky

Dátum release
  1. augusta 2026.
Open source?

Tencent ho označuje ako open source a publikuje weights/code pod Apache 2.0.

Parametre

770B total, 49B active na token v backbone.

MTP je v 770B?

Nie podľa model card: pridáva 10B total / 0,7B active.

Kontext

1M v model card, 1 048 576 na OpenRouter.

Max output

64K na OpenRouter.

Self-hosting

Áno.

Oficiálne frameworky

vLLM a SGLang.

FP8?

Áno.

Veľkosť váh

Približne 1,56 TB.

Licencia

Apache 2.0.

API cena

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

Porazil Hy4 Kimi K3?

V internom blind teste Tencent 2.99/4 vs 2.94/4. Nie je to nezávislý univerzálny dôkaz.

GLM-5.3?

2.99 vs 2.92 v rovnakom teste.

Claude Opus 5?

Nie je podklad na všeobecné tvrdenie o prevahe.

Nezávislé benchmarky?

Zatiaľ neexistuje široká replikácia celej Tencent tabuľky.

Známe slabiny

Príliš dlhý reasoning a over-verification.

Hy4 sa zlepšil sám?

Tencent opisuje model-assisted automatizované experimenty a optimalizáciu pipeline, nie plne autonómny training.

+31,8 % throughput

Zlepšenie oproti internému inference baseline Tencent, nie proti competitorom.

Zdroje a poznámky

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28. augusta 2026, prístup 31. augusta 2026.123456789101112
  2. Tencent, Hy4 preview — oficiálny Hugging Face model card, prístup 31. augusta 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, prístup 31. augusta 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — oficiálny GitHub repository, prístup 31. augusta 2026.12
  5. Tencent, Hy3 Now Available Globally, 5. augusta 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28. augusta 2026.123
  7. OpenRouter, Tencent: Hy4 preview, stav overený 31. augusta 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, marec 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28. augusta 2026. Hodnoty prepísané z Tencent tabuľky, nie nezávislá replikácia.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, prístup 31. augusta 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, prístup 31. augusta 2026.
  12. Tencent, Hy3 preview launch, 24. apríla 2026.
  13. OpenRouter, Tencent models, prístup 31. augusta 2026.

Bolo to užitočné?

Získavajte nové články e-mailom

Jeden krátky e-mail na každý nový článok Vzdelávania. Žiadny spam, odhlásenie jedným kliknutím.

Váš e-mail používame len na zasielanie nových článkov. Žiadne zdieľanie s tretími stranami.

Späť na Vzdelávanie