28 серпня 2026 року Tencent випустив і відкрив Hy4 preview, нову flagship Mixture-of-Experts модель сімейства Tencent Hy, раніше відомого переважно як Hunyuan.[1][6]
Основні параметри:
770B параметрів загалом
49B активних параметрів на token
78 шарів
256 routed experts + 1 shared expert
top-8 routed experts на token
контекст 1M
Apache License 2.0
Tencent опублікував повні weights і Hy4 preview-FP8. Повний repository на Hugging Face має приблизно 1,56 TB.[2][3]
Модель орієнтована на software engineering, офісні workflow, фінансовий аналіз, game development, наукові дослідження та tool-using agents.[1][2]
Три моменти особливо важливі.
По-перше, weights випущені під Apache 2.0, тому можливі self-hosting і комерційне використання відповідно до умов ліцензії.[2][4]
По-друге, Tencent публікує сильні vendor-reported результати: 82,9% на SWE-bench Multilingual, 85,4% на Terminal-Bench 2.1 і 83,7% на MCP-Atlas.[2][9]
По-третє, Tencent стверджує, що Hy4 брав участь в оптимізації власного development та inference pipeline. Один з оптимізаційних циклів нібито підняв end-to-end throughput на 31,8% відносно внутрішнього baseline Tencent.[1]
Це не означає повністю автономне самонавчання. Tencent описує ранню engineering-oriented recursive self-improvement loop.
Стан інформації: 31 серпня 2026 року.
TL;DR
| Питання | Перевірена відповідь |
|---|---|
| Модель | Tencent Hy4 preview |
| Release | 28 серпня 2026 |
| Тип | Mixture-of-Experts |
| Параметри загалом | 770B |
| Активні параметри | 49B на token |
| Шари | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Активні routed experts | top-8 |
| Контекст | 1M у model card, 1 048 576 на OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Оптимізація | IndexCache |
| MTP | 1 native layer, 10B total / 0,7B active |
| Ліцензія | Apache 2.0 |
| Повні weights | близько 1,56 TB |
| Quantized variant | Hy4 preview-FP8 |
| Self-hosting | vLLM і SGLang |
| Офіційний recipe | tensor parallel size 8 |
| API input | $0.834 / 1M tokens |
| API output | $2.501 / 1M tokens |
| Cache hit | $0.042 / 1M tokens |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Статус | Preview |
| Відомі обмеження | надто довгий reasoning та over-verification |
| Головний caveat | ще немає широкої незалежної реплікації всієї launch-таблиці |
Що саме випустив Tencent?
Tencent опублікував:
Hy4 preview
Hy4 preview-FP8
на Hugging Face, ModelScope, GitCode та CNB.[2]
Модель також доступна через WorkBuddy, CodeBuddy, Tencent Cloud TokenHub і OpenRouter.[1][7]
Reuters підтвердив запуск 28 серпня та позиціонування для software engineering, research і financial analysis.[6]
770B не означає 770B активних на кожен token
Hy4 використовує Mixture-of-Experts.
Backbone має:
770B total
але на token активуються приблизно:
49B
параметрів.[2]
Це близько 6,4% backbone.
MoE зменшує активний compute на token, але повний model все одно потрібно зберігати та розподіляти по inference infrastructure.
Як організовані experts?
Backbone має 78 шарів.[2]
Перший використовує dense FFN.
Наступні 77 містять:
256 routed experts
1 shared expert
На token активуються:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: великий масштабний стрибок
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Це приблизно:
- 2,61× більше загальних параметрів,
- 2,33× більше активних параметрів,
- щонайменше 3,9× довший заявлений контекст.
Tencent каже, що одночасно збільшив model size, context length, training data і post-training.[2]
Контекст 1M
Model card вказує:
Context Length: 1M
OpenRouter повідомляє:
1,048,576 tokens
64,000 max completion tokens
Це корисно для великих codebase, довгих agent sessions, multi-document analysis та research.
Але максимальний context не дорівнює ефективній якості роботи з усією його довжиною.
Gated DeepSeek Sparse Attention
Hy4 використовує Gated DeepSeek Sparse Attention.[2]
Sparse attention зменшує обчислення на довгих послідовностях, вибираючи релевантні позиції.
Tencent поєднує це з:
IndexCache
Що робить IndexCache?
IndexCache повторно використовує sparse indices між шарами.[8]
Paper показує на протестованих DSA models меншу роботу indexer і прискорення prefill/decode з малим впливом на якість.[8]
Це результати IndexCache, а не прямий повний benchmark Hy4.
Native MTP layer
Окрім backbone, Hy4 має одну Multi-Token Prediction layer.[2]
Tencent вказує:
10B total
0.7B active
Вона використовується для speculative decoding і ввімкнена в офіційних vLLM/SGLang recipes.[2]
Weights справді публічні
Hugging Face показує:
tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0
Також доступний:
tencent/Hy4-preview-FP8
Це дає можливість self-hosting, fine-tuning, аналізу weights та власного inference stack.
Apache 2.0
Model card і офіційний repo вказують:
Apache License 2.0
Це permissive license, яка дозволяє використання, модифікацію та distribution, включно з комерційним використанням, за її умов.
Офіційний self-hosting
Tencent рекомендує:
vLLM
SGLang
vLLM recipe використовує:
vllm/vllm-openai:hy4-preview
і:
--tensor-parallel-size 8
SGLang використовує --tp-size 8.
Це не означає, що підійдуть будь-які вісім GPU. Важливі memory, precision, KV cache, context та concurrency.
OpenAI-compatible API
Після deployment через vLLM/SGLang Hy4 можна викликати через OpenAI-compatible endpoint.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent рекомендує temperature=0.9 і top_p=1.0.[2]
Reasoning можна обмежити
За замовчуванням Hy4 використовує high reasoning для складних задач.[2]
Для більш прямих відповідей:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
Це корисно, бо надто довгий reasoning є офіційним limitation.
Офіційні обмеження preview
- модель іноді витрачає більше часу на reasoning, ніж потрібно,
- має тенденцію до over-verification.
Для agents це може означати більше tool calls, latency та cost.
Benchmarks: головний caveat
Tencent опублікував benchmark appendix у model card.[2]
Станом на 31 серпня немає широкої незалежної реплікації всієї таблиці в ідентичній конфігурації.
Тому ми позначаємо значення як:
Tencent-reported
Вибрані результати
Транскрипція таблиці Tencent:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High без tools | 43,4% |
Усі значення vendor-reported.
SWE-bench Multilingual: 82,9%
Tencent:
Hy4 preview: 82.9%
Hy3: 75.8%
Різниця +7,1 пункту.
Для зовнішнього порівняння потрібно перевіряти точну версію benchmark і harness.
SWE-bench Pro: 65,7%
Tencent:
Hy4 preview: 65.7%
Hy3: 57.9%
+7,8 пункту, що є сильним сигналом покращення software engineering.
DeepSWE: найбільший стрибок
Транскрипція:
Hy3: 28.0%
Hy4 preview: 64.3%
Саме такий великий розрив особливо потребує незалежної реплікації.
Terminal-Bench 2.1: 85,4%
Tencent повідомляє:
Hy4 preview: 85.4%
Дуже сильний результат для coding agents, але у таблиці є конкуренти з подібними або вищими значеннями. Це не універсальна перемога.
GPQA Diamond: 92,3%
Tencent-reported:
92.3%
Це підтримує позиціонування для scientific reasoning.[1]
Але benchmark не гарантує надійність у реальному research.
MCP-Atlas і tool use
Tencent:
MCP-Atlas: 83.7%
OpenRouter підтримує для Hy4 tools, tool_choice та structured outputs через JSON Schema.[7]
Hy4 vs Kimi K3 і GLM-5.3: внутрішній blind test
163 Tencent experts
203 engineering tasks
шкала 0–4
Середні:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Проти Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Проти GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
Це невелика перевага у внутрішньому workload Tencent, не універсальний незалежний доказ.
Claude Opus 5 і GPT-5.6 Sol
Tencent включає і закриті frontier models.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Подвійні значення — різні settings/variants у Tencent chart і їх не слід зводити в один простий рейтинг.
API-ціна
Tencent вказує:[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter показує ті самі ціни.[7][13]
Ціна token не дорівнює cost per task. Довгий reasoning і додаткові tool calls можуть змінити реальну економіку.
Self-hosting vs API
API
Добре для швидкого старту, змінного load і якщо не хочете керувати великим GPU cluster.
Self-hosting
Добре для data residency, контролю inference та великих стабільних workloads.
При близько 1,56 TB full weights це не типовий single-workstation model.[3]
Чи справді Hy4 “оптимізував сам себе”?
Tencent каже, що модель допомагала автоматично оптимізувати training methods, data strategies, evaluation frameworks та low-level operators.[1]
Вона нібито пропонувала підходи, запускала experiments та iterated за результатами.
Tencent називає це:
early-stage recursive self-improvement loop
Це не означає повністю автономний self-training.
Що означає +31,8% throughput?
Tencent стверджує, що Hy4 аналізував bottlenecks і iterated над operator fusion та communication optimization.[1]
Результат:
+31.8% end-to-end throughput
vs internal Tencent baseline
Не 31,8% швидше за Kimi, Claude чи GPT.
Головні переваги
- Apache 2.0.
- Context 1M.
- 49B active з 770B total.
- Сильний coding/agent profile за даними Tencent.
- Офіційні vLLM/SGLang recipes.
- FP8.
- Конкурентна API-ціна.
Ризики та невідомі
- Preview status.
- Benchmarks переважно vendor-reported.
- Over-reasoning.
- Over-verification.
- Важка self-hosting infrastructure.
- Реальну якість 1M context треба тестувати.
- Data governance для API залежить від provider.
Як benchmark-ити в компанії?
Порівнювати на ідентичних tasks:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Міряти:
- task completion,
- test pass rate,
- quality of diff,
- tool calls,
- retry,
- tokens,
- latency,
- cost per task,
- regressions,
- out-of-scope changes,
- long-context quality.
Ключова метрика:
cost per successful task
Deployment checklist
Якість
- Тестувати internal tasks.
- Відокремлювати Tencent benchmarks від independent results.
- Порівняти high reasoning і
no_think. - Міряти over-verification.
- Тестувати hallucinations.
- Validate tool calling.
- Validate structured outputs.
- Тестувати довгі agent sessions.
Long context
- Тестувати 32K, 128K, 256K і більше.
- Міряти retrieval accuracy.
- Міряти time-to-first-token.
- Міряти KV-cache footprint.
- Не вважати 1M context 1M ідеальної пам’яті.
- Тестувати repo-level coding.
- Тестувати cross-document reasoning.
- Тестувати prompt injection у довгому context.
Self-hosting
- Перевірити GPU requirements.
- Почати з official FP8.
- Тестувати vLLM.
- Тестувати SGLang.
- Міряти throughput на реальній concurrency.
- Міряти P50/P95/P99.
- Планувати storage.
- Перевірити Apache 2.0 з legal.
API
- Перевірити актуальну ціну.
- Перевірити cache semantics і TTL.
- Перевірити data retention.
- Перевірити processing region.
- Встановити cost limits.
- Monitor usage per agent.
- Мати fallback model.
- Міряти cost per successful task.
Чи варто переходити з Hy3?
Для користувачів Hy3 Hy4 — очевидний POC candidate.
На папері:
295B → 770B total
21B → 49B active
256K → 1M context
плюс великі vendor-reported покращення coding та agent evals.[2][5][9]
Але Hy4 може reason довше, потребує більше infrastructure і все ще preview.
Висновок POLPROG
Hy4 preview — один із найважливіших open-weight releases кінця серпня 2026 року.
Важлива комбінація:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
агресивна API-ціна
сильний coding/agent profile
Три рівні доказів слід розділяти.
Технічні факти
Архітектура, license, weights, context, deployment і price добре задокументовані.[1][2][3][7]
Benchmarks
Сильні, але на launch переважно Tencent-reported.[2][9][10]
Self-improvement
Реальна частина описаного R&D workflow, але не повністю автономний self-training.[1]
Розумний висновок станом на 31 серпня:
Hy4 preview має бути в shortlist для coding agents, research agents, long-context workflows і self-hosted AI infrastructure.
Поки не можна сказати:
Hy4 — найкраща модель світу.
Можна сказати:
Tencent вивів Hy4 у невелику групу open-weight моделей, які вже не можна ігнорувати під час проектування production AI stack.

