Tencent Hy4 preview: 770B parametrů, 49B aktivních a kontext 1M. Benchmarky, cena a srovnání s Kimi K3, GLM-5.3 a Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parametrů, 49B aktivních a kontext 1M. Benchmarky, cena a srovnání s Kimi K3, GLM-5.3 a Claude Opus 5

Ověřená analýza Tencent Hy4 preview: MoE 770B/49B, kontext 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarky, interní blind test, API cena, self-hosting, FP8, vLLM/SGLang a limity preview.

Publikováno Autor Čas čtení 16 min čtení

Ověřená analýza Tencent Hy4 preview: MoE 770B/49B, kontext 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarky, interní blind test, API cena, self-hosting, FP8, vLLM/SGLang a limity preview.

Na této stránce
  1. 1TL;DR
  2. 2Co Tencent vydal?
  3. 3770B neznamená 770B aktivních na token
  4. 4Jak jsou experti uspořádáni?
  5. 5Hy4 vs Hy3: velký skok
  6. 6Kontext 1M
  7. 7Gated DeepSeek Sparse Attention
  8. 8Co je IndexCache?
  9. 9Nativní MTP vrstva
  10. 10Váhy jsou skutečně veřejné
  11. 11Apache 2.0
  12. 12Oficiální self-hosting
  13. 13OpenAI-compatible API
  14. 14Reasoning lze omezit
  15. 15Oficiální limity preview
  16. 16Benchmarky: hlavní caveat
  17. 17Vybrané výsledky
  18. 18SWE-bench Multilingual: 82,9 %
  19. 19SWE-bench Pro: 65,7 %
  20. 20DeepSWE: největší skok
  21. 21Terminal-Bench 2.1: 85,4 %
  22. 22GPQA Diamond: 92,3 %
  23. 23MCP-Atlas a tool use
  24. 24Hy4 vs Kimi K3 a GLM-5.3: interní blind test
  25. 25Claude Opus 5 a GPT-5.6 Sol
  26. 26API cena
  27. 27Self-hosting vs API
  28. 28Opravdu Hy4 „optimalizoval sám sebe“?
  29. 29Co znamená +31,8 % throughput?
  30. 30Hlavní výhody
  31. 31Rizika a neznámé
  32. 32Jak benchmarkovat ve firmě?
  33. 33Deployment checklist
  34. 34Vyplatí se přejít z Hy3?
  35. 35Verdikt POLPROG

Dne 28. srpna 2026 Tencent vydal a open-sourcoval Hy4 preview, nový flagship Mixture-of-Experts model rodiny Tencent Hy, dříve známé hlavně jako Hunyuan.[1][6]

Hlavní parametry:

770B parametrů celkem
49B aktivních parametrů na token
78 vrstev
256 routed experts + 1 shared expert
top-8 routed experts na token
kontext 1M
Apache License 2.0

[2]

Tencent zveřejnil plné váhy i Hy4 preview-FP8. Kompletní Hugging Face repository má přibližně 1,56 TB.[2][3]

Model je určen pro software engineering, kancelářské workflow, finanční analýzu, game development, vědecký výzkum a tool-using agenty.[1][2]

Tři body jsou zásadní.

Za prvé, váhy jsou pod Apache 2.0, takže je možné self-hosting i komerční použití v souladu s licencí.[2][4]

Za druhé Tencent uvádí silné vendor-reported benchmarky, například 82,9 % SWE-bench Multilingual, 85,4 % Terminal-Bench 2.1 a 83,7 % MCP-Atlas.[2][9]

Za třetí Tencent tvrdí, že Hy4 pomáhal optimalizovat vlastní vývojový a inference pipeline. Jedna optimalizační smyčka měla zvýšit end-to-end throughput o 31,8 % proti internímu baseline Tencent.[1]

To neznamená plně autonomní samotrénování. Tencent popisuje ranou engineeringovou recursive self-improvement smyčku.

Stav informací: 31. srpna 2026.

TL;DR

OtázkaOvěřená odpověď
ModelTencent Hy4 preview
Release28. srpna 2026
TypMixture-of-Experts
Parametry celkem770B
Aktivní parametry49B na token
Vrstvy78
Routed experts256
Shared experts1
Aktivní routed expertstop-8
Kontext1M v model card, 1 048 576 na OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
OptimalizaceIndexCache
MTP1 nativní vrstva, 10B total / 0,7B active
LicenceApache 2.0
Plné váhycca 1,56 TB
Quantized verzeHy4 preview-FP8
Self-hostingvLLM a SGLang
Oficiální recipetensor parallel size 8
API input$0.834 / 1M tokenů
API output$2.501 / 1M tokenů
Cache hit$0.042 / 1M tokenů
SWE-bench Multilingual82,9 %, Tencent-reported
SWE-bench Pro65,7 %, Tencent-reported
Terminal-Bench 2.185,4 %, Tencent-reported
GPQA Diamond92,3 %, Tencent-reported
MCP-Atlas83,7 %, Tencent-reported
StavPreview
Limitypříliš dlouhý reasoning a over-verification
Caveatchybí široká nezávislá replikace celé launch tabulky

Co Tencent vydal?

Tencent zveřejnil:

Hy4 preview
Hy4 preview-FP8

na Hugging Face, ModelScope, GitCode a CNB.[2]

Model je dostupný také přes WorkBuddy, CodeBuddy, Tencent Cloud TokenHub a OpenRouter.[1][7]

Reuters potvrdil vydání 28. srpna a zaměření na software engineering, research a financial analysis.[6]

770B neznamená 770B aktivních na token

Hy4 používá Mixture-of-Experts.

Backbone má:

770B total

ale na token aktivuje asi:

49B

parametrů.[2]

Je to přibližně 6,4 % backbone.

MoE snižuje aktivní compute na token, ale celý model musí být stále uložen a rozmístěn v inference infrastruktuře.

Jak jsou experti uspořádáni?

Backbone má 78 vrstev.[2]

První používá dense FFN.

Dalších 77 obsahuje:

256 routed experts
1 shared expert

Na token se aktivuje:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: velký skok

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Přibližně:

  • 2,61× více celkových parametrů,
  • 2,33× více aktivních parametrů,
  • minimálně 3,9× delší deklarovaný kontext.

Tencent uvádí, že současně rozšířil velikost, kontext, tréninková data a post-training.[2]

Kontext 1M

Model card uvádí:

Context Length: 1M

[2]

OpenRouter:

1,048,576 tokens
64,000 max completion tokens

[7]

To je zajímavé pro velké codebase, dlouhé agent sessions, multi-document analysis a research.

Maximální kontext však není totéž jako efektivní kvalita práce s celou délkou.

Gated DeepSeek Sparse Attention

Hy4 používá Gated DeepSeek Sparse Attention.[2]

Sparse attention omezuje výpočet u dlouhých sekvencí výběrem relevantních pozic.

Tencent jej kombinuje s:

IndexCache

Co je IndexCache?

IndexCache znovu používá sparse indices mezi vrstvami.[8]

Paper ukazuje na testovaných DSA modelech nižší práci indexeru a rychlejší prefill/decode při malém dopadu na kvalitu.[8]

Jde o výsledky IndexCache, nikoli přímé kompletní benchmarky Hy4.

Nativní MTP vrstva

Hy4 má mimo backbone jednu Multi-Token Prediction vrstvu.[2]

Tencent uvádí:

10B total
0.7B active

Slouží ke speculative decoding a oficiální vLLM/SGLang recipes ji používají.[2]

Váhy jsou skutečně veřejné

Hugging Face ukazuje:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

K dispozici je také:

tencent/Hy4-preview-FP8

[11]

To umožňuje self-hosting, fine-tuning, analýzu vah a vlastní inference stack.

Apache 2.0

Model card a oficiální repo uvádí:

Apache License 2.0

[2][4]

Jde o permisivní licenci umožňující použití, změny a distribuci, včetně komerčního použití, podle jejích podmínek.

Oficiální self-hosting

Tencent doporučuje:

vLLM
SGLang

[2]

vLLM recipe používá:

vllm/vllm-openai:hy4-preview

a:

--tensor-parallel-size 8

[2]

SGLang používá --tp-size 8.

Neznamená to, že stačí libovolných osm GPU. Rozhoduje memory, precision, KV cache, context a concurrency.

OpenAI-compatible API

Po deploymentu přes vLLM/SGLang lze Hy4 volat přes OpenAI-compatible endpoint.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent doporučuje temperature=0.9 a top_p=1.0.[2]

Reasoning lze omezit

Defaultně Hy4 používá high reasoning pro složité úlohy.[2]

Pro přímější odpovědi:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

To je užitečné, protože příliš dlouhý reasoning je oficiální limitation.

Oficiální limity preview

Tencent přiznává:[2][6]

  1. model někdy uvažuje déle, než je potřeba,
  2. má tendenci k over-verification.

V agentech to může znamenat více tool calls, latency a nákladů.

Benchmarky: hlavní caveat

Tencent vydal benchmark appendix v model card.[2]

K 31. srpnu chybí široká nezávislá replikace celé tabulky v identické konfiguraci.

Proto používáme označení:

Tencent-reported

Vybrané výsledky

Transkripce Tencent tabulky:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3 %
Terminal-Bench 2.185,4 %
MCP-Atlas83,7 %
SWE-bench Multilingual82,9 %
MathArena Apex 202574,2 %
SWE-bench Pro65,7 %
DeepSWE64,3 %
HLE, High + Tools55,4 %
HLE, High bez tools43,4 %

Všechny jsou vendor-reported.

SWE-bench Multilingual: 82,9 %

Tencent:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Rozdíl +7,1 bodu.

Před porovnáním s jinými výsledky je nutné zkontrolovat variantu benchmarku a harness.

SWE-bench Pro: 65,7 %

Tencent:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

+7,8 bodu, tedy silný signál zlepšení software engineering.

DeepSWE: největší skok

Transkripce:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Tak velký rozdíl si obzvlášť zaslouží nezávislou replikaci.

Terminal-Bench 2.1: 85,4 %

Tencent uvádí:

Hy4 preview: 85.4%

[9][10]

Silné pro coding agents, ale v tabulce jsou i konkurenti s podobnými či vyššími výsledky. Nejde o univerzální vítězství.

GPQA Diamond: 92,3 %

Tencent-reported:

92.3%

[9][10]

Podporuje positioning pro scientific reasoning.[1]

Benchmark ale nezaručuje spolehlivost ve skutečném výzkumu.

MCP-Atlas a tool use

Tencent:

MCP-Atlas: 83.7%

[9][10]

OpenRouter podporuje pro Hy4 tools, tool_choice a structured outputs přes JSON Schema.[7]

Hy4 vs Kimi K3 a GLM-5.3: interní blind test

Tencent testoval:[1][2]

163 Tencent expertů
203 engineering tasks
škála 0–4

Průměr:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Proti Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Proti GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

Je to malý náskok v interním workloadu Tencent, nikoli univerzální nezávislý důkaz.

Claude Opus 5 a GPT-5.6 Sol

Tencent zahrnuje i uzavřené frontier modely.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Dvojité hodnoty odpovídají různým variantám/settings v grafu Tencent a nelze je spojit do jednoho jednoduchého žebříčku.

API cena

Tencent uvádí:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter zobrazuje stejné ceny.[7][13]

Cena tokenu není cena úspěšného tasku. Dlouhé reasoning a další tool calls mohou změnit ekonomiku.

Self-hosting vs API

API

Vhodné pro rychlé nasazení, proměnlivý load a pokud nechcete provozovat velký GPU cluster.

Self-hosting

Vhodné pro data residency, kontrolu inference a velké stabilní workloady.

Při cca 1,56 TB full weights nejde o běžný single-workstation model.[3]

Opravdu Hy4 „optimalizoval sám sebe“?

Tencent tvrdí, že model pomáhal automaticky optimalizovat training methods, data strategies, evaluation frameworks a low-level operators.[1]

Navrhoval přístupy, spouštěl experimenty a iteroval podle výsledků.

Tencent tomu říká:

early-stage recursive self-improvement loop

Neznamená to plně autonomní self-training.

Co znamená +31,8 % throughput?

Tencent říká, že Hy4 analyzoval bottlenecks a iteroval nad operator fusion a communication optimization.[1]

Výsledek:

+31.8% end-to-end throughput
vs interní Tencent baseline

Ne 31,8 % rychlejší než Kimi, Claude nebo GPT.

Hlavní výhody

  • Apache 2.0.
  • Kontext 1M.
  • 49B aktivních z 770B total.
  • Silný coding/agent profil podle Tencent.
  • Oficiální vLLM/SGLang recipes.
  • FP8.
  • Konkurenceschopná API cena.

Rizika a neznámé

  • Preview status.
  • Benchmarky především vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Náročná self-hosting infrastruktura.
  • Skutečnou kvalitu 1M context je nutné testovat.
  • Data governance závisí při API na providerovi.

Jak benchmarkovat ve firmě?

Porovnat na identických taskách:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Měřit:

  • task completion,
  • test pass rate,
  • kvalitu diffu,
  • tool calls,
  • retry,
  • tokeny,
  • latency,
  • cenu za task,
  • regrese,
  • změny mimo scope,
  • long-context quality.

Klíčová metrika:

cost per successful task

Deployment checklist

Kvalita

  • Testovat interní tasky.
  • Oddělit Tencent benchmarky od nezávislých výsledků.
  • Porovnat high reasoning a no_think.
  • Měřit over-verification.
  • Testovat halucinace.
  • Validovat tool calling.
  • Validovat structured outputs.
  • Testovat dlouhé agent sessions.

Long context

  • Testovat 32K, 128K, 256K a více.
  • Měřit retrieval accuracy.
  • Měřit time-to-first-token.
  • Měřit KV-cache footprint.
  • Nepovažovat 1M context za 1M perfektní paměti.
  • Testovat repo-level coding.
  • Testovat cross-document reasoning.
  • Testovat prompt injection v dlouhém kontextu.

Self-hosting

  • Ověřit GPU requirements.
  • Začít oficiálním FP8.
  • Testovat vLLM.
  • Testovat SGLang.
  • Měřit throughput při reálné concurrency.
  • Měřit P50/P95/P99.
  • Naplánovat storage.
  • Nechat právně prověřit Apache 2.0.

API

  • Ověřit aktuální cenu.
  • Ověřit cache semantics a TTL.
  • Ověřit data retention.
  • Ověřit processing region.
  • Nastavit cost limits.
  • Monitorovat usage per agent.
  • Mít fallback model.
  • Měřit cost per successful task.

Vyplatí se přejít z Hy3?

Pro uživatele Hy3 je Hy4 jasný POC kandidát.

Na papíře:

295B → 770B total
21B → 49B active
256K → 1M context

plus velká vendor-reported zlepšení v coding a agent evals.[2][5][9]

Hy4 však může reasonovat déle, potřebuje více infrastruktury a stále je preview.

Verdikt POLPROG

Hy4 preview je jeden z nejdůležitějších open-weight release konce srpna 2026.

Důležitá je kombinace:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agresivní API cena
silný coding/agent profil

Tři úrovně důkazů je nutné oddělit.

Technická fakta

Architektura, licence, váhy, kontext, deployment a cena jsou dobře zdokumentované.[1][2][3][7]

Benchmarky

Silné, ale při launchi převážně Tencent-reported.[2][9][10]

Self-improvement

Reálná součást popsaného R&D workflow, ne plně autonomní self-training.[1]

Rozumný závěr k 31. srpnu:

Hy4 preview patří na shortlist pro coding agents, research agents, long-context workflow a self-hosted AI infrastrukturu.

Zatím nelze říct:

Hy4 je nejlepší model na světě.

Lze říct:

Tencent dostal Hy4 do malé skupiny open-weight modelů, které při návrhu produkčního AI stacku nelze ignorovat.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Často kladené otázky

Datum release
  1. srpna 2026.
Open source?

Tencent jej označuje jako open source a publikuje weights/code pod Apache 2.0.

Parametry

770B total, 49B active na token v backbone.

MTP je v 770B?

Ne podle model card: přidává 10B total / 0,7B active.

Kontext

1M v model card, 1 048 576 na OpenRouter.

Max output

64K na OpenRouter.

Self-hosting

Ano.

Oficiální frameworky

vLLM a SGLang.

FP8?

Ano.

Velikost vah

Přibližně 1,56 TB.

Licence

Apache 2.0.

API cena

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

Porazil Hy4 Kimi K3?

V interním blind testu Tencent 2.99/4 vs 2.94/4. Nejde o nezávislý univerzální důkaz.

GLM-5.3?

2.99 vs 2.92 ve stejném testu.

Claude Opus 5?

Není podklad pro obecné tvrzení o převaze.

Nezávislé benchmarky?

Zatím neexistuje široká replikace celé Tencent tabulky.

Známé slabiny

Příliš dlouhý reasoning a over-verification.

Hy4 se zlepšil sám?

Tencent popisuje model-assisted automatizované experimenty a optimalizaci pipeline, ne plně autonomní training.

+31,8 % throughput

Zlepšení proti internímu inference baseline Tencent, ne proti competitorům.

Zdroje a poznámky

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28. srpna 2026, přístup 31. srpna 2026.123456789101112
  2. Tencent, Hy4 preview — oficiální Hugging Face model card, přístup 31. srpna 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, přístup 31. srpna 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — oficiální GitHub repository, přístup 31. srpna 2026.12
  5. Tencent, Hy3 Now Available Globally, 5. srpna 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28. srpna 2026.123
  7. OpenRouter, Tencent: Hy4 preview, stav ověřen 31. srpna 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, březen 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28. srpna 2026. Hodnoty přepsané z Tencent tabulky, nikoli nezávislá replikace.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, přístup 31. srpna 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, přístup 31. srpna 2026.
  12. Tencent, Hy3 preview launch, 24. dubna 2026.
  13. OpenRouter, Tencent models, přístup 31. srpna 2026.

Bylo to užitečné?

Odebírejte nové články e-mailem

Jeden krátký e-mail na každý nový článek znalostní báze. Žádný spam, odhlášení jedním kliknutím.

Váš e-mail používáme pouze k zasílání nových článků. Žádné sdílení s třetími stranami.

Zpět do znalostní báze