Dňa 28. augusta 2026 Tencent vydal a open-sourcoval Hy4 preview, nový flagship Mixture-of-Experts model rodiny Tencent Hy, predtým známej najmä ako Hunyuan.[1][6]
Hlavné parametre:
770B parametrov celkom
49B aktívnych parametrov na token
78 vrstiev
256 routed experts + 1 shared expert
top-8 routed experts na token
kontext 1M
Apache License 2.0
Tencent zverejnil plné váhy aj Hy4 preview-FP8. Kompletný Hugging Face repository má približne 1,56 TB.[2][3]
Model je určený pre software engineering, kancelárske workflow, finančnú analýzu, game development, vedecký výskum a tool-using agentov.[1][2]
Tri body sú zásadné.
Po prvé, váhy sú pod Apache 2.0, takže je možný self-hosting aj komerčné použitie v súlade s licenciou.[2][4]
Po druhé Tencent uvádza silné vendor-reported benchmarky, napríklad 82,9 % SWE-bench Multilingual, 85,4 % Terminal-Bench 2.1 a 83,7 % MCP-Atlas.[2][9]
Po tretie Tencent tvrdí, že Hy4 pomáhal optimalizovať vlastný vývojový a inference pipeline. Jedna optimalizačná slučka mala zvýšiť end-to-end throughput o 31,8 % oproti internému baseline Tencent.[1]
To neznamená plne autonómny self-training. Tencent opisuje ranú engineeringovú recursive self-improvement slučku.
Stav informácií: 31. augusta 2026.
TL;DR
| Otázka | Overená odpoveď |
|---|---|
| Model | Tencent Hy4 preview |
| Release | 28. augusta 2026 |
| Typ | Mixture-of-Experts |
| Parametre celkom | 770B |
| Aktívne parametre | 49B na token |
| Vrstvy | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Aktívne routed experts | top-8 |
| Kontext | 1M v model card, 1 048 576 na OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Optimalizácia | IndexCache |
| MTP | 1 natívna vrstva, 10B total / 0,7B active |
| Licencia | Apache 2.0 |
| Plné váhy | cca 1,56 TB |
| Quantized verzia | Hy4 preview-FP8 |
| Self-hosting | vLLM a SGLang |
| Oficiálny recipe | tensor parallel size 8 |
| API input | $0.834 / 1M tokenov |
| API output | $2.501 / 1M tokenov |
| Cache hit | $0.042 / 1M tokenov |
| SWE-bench Multilingual | 82,9 %, Tencent-reported |
| SWE-bench Pro | 65,7 %, Tencent-reported |
| Terminal-Bench 2.1 | 85,4 %, Tencent-reported |
| GPQA Diamond | 92,3 %, Tencent-reported |
| MCP-Atlas | 83,7 %, Tencent-reported |
| Stav | Preview |
| Limity | príliš dlhý reasoning a over-verification |
| Caveat | chýba široká nezávislá replikácia celej launch tabuľky |
Čo Tencent vydal?
Tencent zverejnil:
Hy4 preview
Hy4 preview-FP8
na Hugging Face, ModelScope, GitCode a CNB.[2]
Model je dostupný aj cez WorkBuddy, CodeBuddy, Tencent Cloud TokenHub a OpenRouter.[1][7]
Reuters potvrdil release 28. augusta a zameranie na software engineering, research a financial analysis.[6]
770B neznamená 770B aktívnych na token
Hy4 používa Mixture-of-Experts.
Backbone má:
770B total
ale na token aktivuje približne:
49B
parametrov.[2]
To je asi 6,4 % backbone.
MoE znižuje aktívny compute na token, ale celý model musí byť stále uložený a rozdelený v inference infraštruktúre.
Ako sú experti usporiadaní?
Backbone má 78 vrstiev.[2]
Prvá používa dense FFN.
Ďalších 77 obsahuje:
256 routed experts
1 shared expert
Na token sa aktivuje:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: veľký skok
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Približne:
- 2,61× viac celkových parametrov,
- 2,33× viac aktívnych parametrov,
- minimálne 3,9× dlhší deklarovaný kontext.
Tencent uvádza, že súčasne rozšíril veľkosť, kontext, tréningové dáta a post-training.[2]
Kontext 1M
Model card uvádza:
Context Length: 1M
OpenRouter:
1,048,576 tokens
64,000 max completion tokens
Je to zaujímavé pre veľké codebase, dlhé agent sessions, multi-document analysis a research.
Maximálny kontext však nie je to isté ako efektívna kvalita práce s celou dĺžkou.
Gated DeepSeek Sparse Attention
Hy4 používa Gated DeepSeek Sparse Attention.[2]
Sparse attention obmedzuje výpočet pri dlhých sekvenciách výberom relevantných pozícií.
Tencent ho kombinuje s:
IndexCache
Čo je IndexCache?
IndexCache znovu používa sparse indices medzi vrstvami.[8]
Paper ukazuje na testovaných DSA modeloch nižšiu prácu indexera a rýchlejší prefill/decode pri malom dopade na kvalitu.[8]
Ide o výsledky IndexCache, nie priame kompletné benchmarky Hy4.
Natívna MTP vrstva
Hy4 má mimo backbone jednu Multi-Token Prediction vrstvu.[2]
Tencent uvádza:
10B total
0.7B active
Slúži na speculative decoding a oficiálne vLLM/SGLang recipes ju používajú.[2]
Váhy sú skutočne verejné
Hugging Face ukazuje:
tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0
K dispozícii je aj:
tencent/Hy4-preview-FP8
To umožňuje self-hosting, fine-tuning, analýzu váh a vlastný inference stack.
Apache 2.0
Model card a oficiálne repo uvádzajú:
Apache License 2.0
Ide o permisívnu licenciu umožňujúcu použitie, zmeny a distribúciu vrátane komerčného použitia podľa jej podmienok.
Oficiálny self-hosting
Tencent odporúča:
vLLM
SGLang
vLLM recipe používa:
vllm/vllm-openai:hy4-preview
a:
--tensor-parallel-size 8
SGLang používa --tp-size 8.
Neznamená to, že stačí ľubovoľných osem GPU. Rozhoduje memory, precision, KV cache, context a concurrency.
OpenAI-compatible API
Po deploymente cez vLLM/SGLang možno Hy4 volať cez OpenAI-compatible endpoint.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent odporúča temperature=0.9 a top_p=1.0.[2]
Reasoning možno obmedziť
Defaultne Hy4 používa high reasoning pre zložité úlohy.[2]
Pre priamejšie odpovede:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
To je užitočné, pretože príliš dlhý reasoning je oficiálna limitation.
Oficiálne limity preview
- model niekedy uvažuje dlhšie, než je potrebné,
- má tendenciu k over-verification.
V agentoch to môže znamenať viac tool calls, latency a nákladov.
Benchmarky: hlavný caveat
Tencent vydal benchmark appendix v model card.[2]
K 31. augustu chýba široká nezávislá replikácia celej tabuľky v identickej konfigurácii.
Preto používame označenie:
Tencent-reported
Vybrané výsledky
Transkripcia Tencent tabuľky:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3 % |
| Terminal-Bench 2.1 | 85,4 % |
| MCP-Atlas | 83,7 % |
| SWE-bench Multilingual | 82,9 % |
| MathArena Apex 2025 | 74,2 % |
| SWE-bench Pro | 65,7 % |
| DeepSWE | 64,3 % |
| HLE, High + Tools | 55,4 % |
| HLE, High bez tools | 43,4 % |
Všetky sú vendor-reported.
SWE-bench Multilingual: 82,9 %
Tencent:
Hy4 preview: 82.9%
Hy3: 75.8%
Rozdiel +7,1 bodu.
Pred porovnaním s inými výsledkami treba skontrolovať variant benchmarku a harness.
SWE-bench Pro: 65,7 %
Tencent:
Hy4 preview: 65.7%
Hy3: 57.9%
+7,8 bodu, teda silný signál zlepšenia software engineering.
DeepSWE: najväčší skok
Transkripcia:
Hy3: 28.0%
Hy4 preview: 64.3%
Taký veľký rozdiel si obzvlášť zaslúži nezávislú replikáciu.
Terminal-Bench 2.1: 85,4 %
Tencent uvádza:
Hy4 preview: 85.4%
Silné pre coding agents, ale v tabuľke sú aj konkurenti s podobnými alebo vyššími výsledkami. Nie je to univerzálne víťazstvo.
GPQA Diamond: 92,3 %
Tencent-reported:
92.3%
Podporuje positioning pre scientific reasoning.[1]
Benchmark však nezaručuje spoľahlivosť v reálnom výskume.
MCP-Atlas a tool use
Tencent:
MCP-Atlas: 83.7%
OpenRouter podporuje pre Hy4 tools, tool_choice a structured outputs cez JSON Schema.[7]
Hy4 vs Kimi K3 a GLM-5.3: interný blind test
163 Tencent expertov
203 engineering tasks
škála 0–4
Priemer:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Proti Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Proti GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
Je to malý náskok v internom workload Tencent, nie univerzálny nezávislý dôkaz.
Claude Opus 5 a GPT-5.6 Sol
Tencent zahŕňa aj uzavreté frontier modely.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Dvojité hodnoty sú rôzne varianty/settings v grafe Tencent a nemožno ich zlúčiť do jedného jednoduchého rebríčka.
API cena
Tencent uvádza:[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter zobrazuje rovnaké ceny.[7][13]
Cena tokenu nie je cena úspešného tasku. Dlhý reasoning a ďalšie tool calls môžu zmeniť ekonomiku.
Self-hosting vs API
API
Vhodné na rýchle nasadenie, premenlivý load a keď nechcete prevádzkovať veľký GPU cluster.
Self-hosting
Vhodné pre data residency, kontrolu inference a veľké stabilné workloady.
Pri cca 1,56 TB full weights nejde o bežný single-workstation model.[3]
Naozaj Hy4 „optimalizoval sám seba“?
Tencent tvrdí, že model pomáhal automaticky optimalizovať training methods, data strategies, evaluation frameworks a low-level operators.[1]
Navrhoval prístupy, spúšťal experimenty a iteroval podľa výsledkov.
Tencent tomu hovorí:
early-stage recursive self-improvement loop
Neznamená to plne autonómny self-training.
Čo znamená +31,8 % throughput?
Tencent hovorí, že Hy4 analyzoval bottlenecks a iteroval nad operator fusion a communication optimization.[1]
Výsledok:
+31.8% end-to-end throughput
vs interný Tencent baseline
Nie 31,8 % rýchlejší než Kimi, Claude alebo GPT.
Hlavné výhody
- Apache 2.0.
- Kontext 1M.
- 49B aktívnych zo 770B total.
- Silný coding/agent profil podľa Tencent.
- Oficiálne vLLM/SGLang recipes.
- FP8.
- Konkurencieschopná API cena.
Riziká a neznáme
- Preview status.
- Benchmarky prevažne vendor-reported.
- Over-reasoning.
- Over-verification.
- Náročná self-hosting infraštruktúra.
- Reálnu kvalitu 1M context treba testovať.
- Data governance závisí pri API od providera.
Ako benchmarkovať vo firme?
Porovnať na identických taskoch:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Merať:
- task completion,
- test pass rate,
- kvalitu diffu,
- tool calls,
- retry,
- tokeny,
- latency,
- cenu za task,
- regresie,
- zmeny mimo scope,
- long-context quality.
Kľúčová metrika:
cost per successful task
Deployment checklist
Kvalita
- Testovať interné tasky.
- Oddeliť Tencent benchmarky od nezávislých výsledkov.
- Porovnať high reasoning a
no_think. - Merať over-verification.
- Testovať halucinácie.
- Validovať tool calling.
- Validovať structured outputs.
- Testovať dlhé agent sessions.
Long context
- Testovať 32K, 128K, 256K a viac.
- Merať retrieval accuracy.
- Merať time-to-first-token.
- Merať KV-cache footprint.
- Nepovažovať 1M context za 1M perfektnej pamäte.
- Testovať repo-level coding.
- Testovať cross-document reasoning.
- Testovať prompt injection v dlhom kontexte.
Self-hosting
- Overiť GPU requirements.
- Začať oficiálnym FP8.
- Testovať vLLM.
- Testovať SGLang.
- Merať throughput pri reálnej concurrency.
- Merať P50/P95/P99.
- Naplánovať storage.
- Nechať právne preveriť Apache 2.0.
API
- Overiť aktuálnu cenu.
- Overiť cache semantics a TTL.
- Overiť data retention.
- Overiť processing region.
- Nastaviť cost limits.
- Monitorovať usage per agent.
- Mať fallback model.
- Merať cost per successful task.
Oplatí sa prejsť z Hy3?
Pre používateľov Hy3 je Hy4 jasný POC kandidát.
Na papieri:
295B → 770B total
21B → 49B active
256K → 1M context
plus veľké vendor-reported zlepšenia v coding a agent evals.[2][5][9]
Hy4 však môže reasonovať dlhšie, potrebuje viac infraštruktúry a stále je preview.
Verdikt POLPROG
Hy4 preview je jeden z najdôležitejších open-weight release konca augusta 2026.
Dôležitá je kombinácia:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agresívna API cena
silný coding/agent profil
Tri úrovne dôkazov treba oddeľovať.
Technické fakty
Architektúra, licencia, váhy, kontext, deployment a cena sú dobre zdokumentované.[1][2][3][7]
Benchmarky
Silné, ale pri launchi prevažne Tencent-reported.[2][9][10]
Self-improvement
Reálna súčasť opísaného R&D workflow, nie plne autonómny self-training.[1]
Rozumný záver k 31. augustu:
Hy4 preview patrí na shortlist pre coding agents, research agents, long-context workflow a self-hosted AI infraštruktúru.
Zatiaľ nemožno povedať:
Hy4 je najlepší model na svete.
Možno povedať:
Tencent dostal Hy4 do malej skupiny open-weight modelov, ktoré pri návrhu produkčného AI stacku nemožno ignorovať.

