Dne 28. srpna 2026 Tencent vydal a open-sourcoval Hy4 preview, nový flagship Mixture-of-Experts model rodiny Tencent Hy, dříve známé hlavně jako Hunyuan.[1][6]
Hlavní parametry:
770B parametrů celkem
49B aktivních parametrů na token
78 vrstev
256 routed experts + 1 shared expert
top-8 routed experts na token
kontext 1M
Apache License 2.0
Tencent zveřejnil plné váhy i Hy4 preview-FP8. Kompletní Hugging Face repository má přibližně 1,56 TB.[2][3]
Model je určen pro software engineering, kancelářské workflow, finanční analýzu, game development, vědecký výzkum a tool-using agenty.[1][2]
Tři body jsou zásadní.
Za prvé, váhy jsou pod Apache 2.0, takže je možné self-hosting i komerční použití v souladu s licencí.[2][4]
Za druhé Tencent uvádí silné vendor-reported benchmarky, například 82,9 % SWE-bench Multilingual, 85,4 % Terminal-Bench 2.1 a 83,7 % MCP-Atlas.[2][9]
Za třetí Tencent tvrdí, že Hy4 pomáhal optimalizovat vlastní vývojový a inference pipeline. Jedna optimalizační smyčka měla zvýšit end-to-end throughput o 31,8 % proti internímu baseline Tencent.[1]
To neznamená plně autonomní samotrénování. Tencent popisuje ranou engineeringovou recursive self-improvement smyčku.
Stav informací: 31. srpna 2026.
TL;DR
| Otázka | Ověřená odpověď |
|---|---|
| Model | Tencent Hy4 preview |
| Release | 28. srpna 2026 |
| Typ | Mixture-of-Experts |
| Parametry celkem | 770B |
| Aktivní parametry | 49B na token |
| Vrstvy | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Aktivní routed experts | top-8 |
| Kontext | 1M v model card, 1 048 576 na OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Optimalizace | IndexCache |
| MTP | 1 nativní vrstva, 10B total / 0,7B active |
| Licence | Apache 2.0 |
| Plné váhy | cca 1,56 TB |
| Quantized verze | Hy4 preview-FP8 |
| Self-hosting | vLLM a SGLang |
| Oficiální recipe | tensor parallel size 8 |
| API input | $0.834 / 1M tokenů |
| API output | $2.501 / 1M tokenů |
| Cache hit | $0.042 / 1M tokenů |
| SWE-bench Multilingual | 82,9 %, Tencent-reported |
| SWE-bench Pro | 65,7 %, Tencent-reported |
| Terminal-Bench 2.1 | 85,4 %, Tencent-reported |
| GPQA Diamond | 92,3 %, Tencent-reported |
| MCP-Atlas | 83,7 %, Tencent-reported |
| Stav | Preview |
| Limity | příliš dlouhý reasoning a over-verification |
| Caveat | chybí široká nezávislá replikace celé launch tabulky |
Co Tencent vydal?
Tencent zveřejnil:
Hy4 preview
Hy4 preview-FP8
na Hugging Face, ModelScope, GitCode a CNB.[2]
Model je dostupný také přes WorkBuddy, CodeBuddy, Tencent Cloud TokenHub a OpenRouter.[1][7]
Reuters potvrdil vydání 28. srpna a zaměření na software engineering, research a financial analysis.[6]
770B neznamená 770B aktivních na token
Hy4 používá Mixture-of-Experts.
Backbone má:
770B total
ale na token aktivuje asi:
49B
parametrů.[2]
Je to přibližně 6,4 % backbone.
MoE snižuje aktivní compute na token, ale celý model musí být stále uložen a rozmístěn v inference infrastruktuře.
Jak jsou experti uspořádáni?
Backbone má 78 vrstev.[2]
První používá dense FFN.
Dalších 77 obsahuje:
256 routed experts
1 shared expert
Na token se aktivuje:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: velký skok
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Přibližně:
- 2,61× více celkových parametrů,
- 2,33× více aktivních parametrů,
- minimálně 3,9× delší deklarovaný kontext.
Tencent uvádí, že současně rozšířil velikost, kontext, tréninková data a post-training.[2]
Kontext 1M
Model card uvádí:
Context Length: 1M
OpenRouter:
1,048,576 tokens
64,000 max completion tokens
To je zajímavé pro velké codebase, dlouhé agent sessions, multi-document analysis a research.
Maximální kontext však není totéž jako efektivní kvalita práce s celou délkou.
Gated DeepSeek Sparse Attention
Hy4 používá Gated DeepSeek Sparse Attention.[2]
Sparse attention omezuje výpočet u dlouhých sekvencí výběrem relevantních pozic.
Tencent jej kombinuje s:
IndexCache
Co je IndexCache?
IndexCache znovu používá sparse indices mezi vrstvami.[8]
Paper ukazuje na testovaných DSA modelech nižší práci indexeru a rychlejší prefill/decode při malém dopadu na kvalitu.[8]
Jde o výsledky IndexCache, nikoli přímé kompletní benchmarky Hy4.
Nativní MTP vrstva
Hy4 má mimo backbone jednu Multi-Token Prediction vrstvu.[2]
Tencent uvádí:
10B total
0.7B active
Slouží ke speculative decoding a oficiální vLLM/SGLang recipes ji používají.[2]
Váhy jsou skutečně veřejné
Hugging Face ukazuje:
tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0
K dispozici je také:
tencent/Hy4-preview-FP8
To umožňuje self-hosting, fine-tuning, analýzu vah a vlastní inference stack.
Apache 2.0
Model card a oficiální repo uvádí:
Apache License 2.0
Jde o permisivní licenci umožňující použití, změny a distribuci, včetně komerčního použití, podle jejích podmínek.
Oficiální self-hosting
Tencent doporučuje:
vLLM
SGLang
vLLM recipe používá:
vllm/vllm-openai:hy4-preview
a:
--tensor-parallel-size 8
SGLang používá --tp-size 8.
Neznamená to, že stačí libovolných osm GPU. Rozhoduje memory, precision, KV cache, context a concurrency.
OpenAI-compatible API
Po deploymentu přes vLLM/SGLang lze Hy4 volat přes OpenAI-compatible endpoint.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent doporučuje temperature=0.9 a top_p=1.0.[2]
Reasoning lze omezit
Defaultně Hy4 používá high reasoning pro složité úlohy.[2]
Pro přímější odpovědi:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
To je užitečné, protože příliš dlouhý reasoning je oficiální limitation.
Oficiální limity preview
- model někdy uvažuje déle, než je potřeba,
- má tendenci k over-verification.
V agentech to může znamenat více tool calls, latency a nákladů.
Benchmarky: hlavní caveat
Tencent vydal benchmark appendix v model card.[2]
K 31. srpnu chybí široká nezávislá replikace celé tabulky v identické konfiguraci.
Proto používáme označení:
Tencent-reported
Vybrané výsledky
Transkripce Tencent tabulky:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3 % |
| Terminal-Bench 2.1 | 85,4 % |
| MCP-Atlas | 83,7 % |
| SWE-bench Multilingual | 82,9 % |
| MathArena Apex 2025 | 74,2 % |
| SWE-bench Pro | 65,7 % |
| DeepSWE | 64,3 % |
| HLE, High + Tools | 55,4 % |
| HLE, High bez tools | 43,4 % |
Všechny jsou vendor-reported.
SWE-bench Multilingual: 82,9 %
Tencent:
Hy4 preview: 82.9%
Hy3: 75.8%
Rozdíl +7,1 bodu.
Před porovnáním s jinými výsledky je nutné zkontrolovat variantu benchmarku a harness.
SWE-bench Pro: 65,7 %
Tencent:
Hy4 preview: 65.7%
Hy3: 57.9%
+7,8 bodu, tedy silný signál zlepšení software engineering.
DeepSWE: největší skok
Transkripce:
Hy3: 28.0%
Hy4 preview: 64.3%
Tak velký rozdíl si obzvlášť zaslouží nezávislou replikaci.
Terminal-Bench 2.1: 85,4 %
Tencent uvádí:
Hy4 preview: 85.4%
Silné pro coding agents, ale v tabulce jsou i konkurenti s podobnými či vyššími výsledky. Nejde o univerzální vítězství.
GPQA Diamond: 92,3 %
Tencent-reported:
92.3%
Podporuje positioning pro scientific reasoning.[1]
Benchmark ale nezaručuje spolehlivost ve skutečném výzkumu.
MCP-Atlas a tool use
Tencent:
MCP-Atlas: 83.7%
OpenRouter podporuje pro Hy4 tools, tool_choice a structured outputs přes JSON Schema.[7]
Hy4 vs Kimi K3 a GLM-5.3: interní blind test
163 Tencent expertů
203 engineering tasks
škála 0–4
Průměr:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Proti Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Proti GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
Je to malý náskok v interním workloadu Tencent, nikoli univerzální nezávislý důkaz.
Claude Opus 5 a GPT-5.6 Sol
Tencent zahrnuje i uzavřené frontier modely.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Dvojité hodnoty odpovídají různým variantám/settings v grafu Tencent a nelze je spojit do jednoho jednoduchého žebříčku.
API cena
Tencent uvádí:[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter zobrazuje stejné ceny.[7][13]
Cena tokenu není cena úspěšného tasku. Dlouhé reasoning a další tool calls mohou změnit ekonomiku.
Self-hosting vs API
API
Vhodné pro rychlé nasazení, proměnlivý load a pokud nechcete provozovat velký GPU cluster.
Self-hosting
Vhodné pro data residency, kontrolu inference a velké stabilní workloady.
Při cca 1,56 TB full weights nejde o běžný single-workstation model.[3]
Opravdu Hy4 „optimalizoval sám sebe“?
Tencent tvrdí, že model pomáhal automaticky optimalizovat training methods, data strategies, evaluation frameworks a low-level operators.[1]
Navrhoval přístupy, spouštěl experimenty a iteroval podle výsledků.
Tencent tomu říká:
early-stage recursive self-improvement loop
Neznamená to plně autonomní self-training.
Co znamená +31,8 % throughput?
Tencent říká, že Hy4 analyzoval bottlenecks a iteroval nad operator fusion a communication optimization.[1]
Výsledek:
+31.8% end-to-end throughput
vs interní Tencent baseline
Ne 31,8 % rychlejší než Kimi, Claude nebo GPT.
Hlavní výhody
- Apache 2.0.
- Kontext 1M.
- 49B aktivních z 770B total.
- Silný coding/agent profil podle Tencent.
- Oficiální vLLM/SGLang recipes.
- FP8.
- Konkurenceschopná API cena.
Rizika a neznámé
- Preview status.
- Benchmarky především vendor-reported.
- Over-reasoning.
- Over-verification.
- Náročná self-hosting infrastruktura.
- Skutečnou kvalitu 1M context je nutné testovat.
- Data governance závisí při API na providerovi.
Jak benchmarkovat ve firmě?
Porovnat na identických taskách:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Měřit:
- task completion,
- test pass rate,
- kvalitu diffu,
- tool calls,
- retry,
- tokeny,
- latency,
- cenu za task,
- regrese,
- změny mimo scope,
- long-context quality.
Klíčová metrika:
cost per successful task
Deployment checklist
Kvalita
- Testovat interní tasky.
- Oddělit Tencent benchmarky od nezávislých výsledků.
- Porovnat high reasoning a
no_think. - Měřit over-verification.
- Testovat halucinace.
- Validovat tool calling.
- Validovat structured outputs.
- Testovat dlouhé agent sessions.
Long context
- Testovat 32K, 128K, 256K a více.
- Měřit retrieval accuracy.
- Měřit time-to-first-token.
- Měřit KV-cache footprint.
- Nepovažovat 1M context za 1M perfektní paměti.
- Testovat repo-level coding.
- Testovat cross-document reasoning.
- Testovat prompt injection v dlouhém kontextu.
Self-hosting
- Ověřit GPU requirements.
- Začít oficiálním FP8.
- Testovat vLLM.
- Testovat SGLang.
- Měřit throughput při reálné concurrency.
- Měřit P50/P95/P99.
- Naplánovat storage.
- Nechat právně prověřit Apache 2.0.
API
- Ověřit aktuální cenu.
- Ověřit cache semantics a TTL.
- Ověřit data retention.
- Ověřit processing region.
- Nastavit cost limits.
- Monitorovat usage per agent.
- Mít fallback model.
- Měřit cost per successful task.
Vyplatí se přejít z Hy3?
Pro uživatele Hy3 je Hy4 jasný POC kandidát.
Na papíře:
295B → 770B total
21B → 49B active
256K → 1M context
plus velká vendor-reported zlepšení v coding a agent evals.[2][5][9]
Hy4 však může reasonovat déle, potřebuje více infrastruktury a stále je preview.
Verdikt POLPROG
Hy4 preview je jeden z nejdůležitějších open-weight release konce srpna 2026.
Důležitá je kombinace:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agresivní API cena
silný coding/agent profil
Tři úrovně důkazů je nutné oddělit.
Technická fakta
Architektura, licence, váhy, kontext, deployment a cena jsou dobře zdokumentované.[1][2][3][7]
Benchmarky
Silné, ale při launchi převážně Tencent-reported.[2][9][10]
Self-improvement
Reálná součást popsaného R&D workflow, ne plně autonomní self-training.[1]
Rozumný závěr k 31. srpnu:
Hy4 preview patří na shortlist pro coding agents, research agents, long-context workflow a self-hosted AI infrastrukturu.
Zatím nelze říct:
Hy4 je nejlepší model na světě.
Lze říct:
Tencent dostal Hy4 do malé skupiny open-weight modelů, které při návrhu produkčního AI stacku nelze ignorovat.

