Tencent Hy4 preview: 770B параметрів, 49B активних і контекст 1M. Бенчмарки, ціна та порівняння з Kimi K3, GLM-5.3 і Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B параметрів, 49B активних і контекст 1M. Бенчмарки, ціна та порівняння з Kimi K3, GLM-5.3 і Claude Opus 5

Перевірений аналіз Tencent Hy4 preview: MoE 770B/49B, контекст 1M, Gated DSA, IndexCache, MTP, Apache 2.0, бенчмарки, внутрішній blind test, API-ціна, self-hosting, FP8, vLLM/SGLang та обмеження preview.

Опубліковано Автор Час читання 16 хв читання

Перевірений аналіз Tencent Hy4 preview: MoE 770B/49B, контекст 1M, Gated DSA, IndexCache, MTP, Apache 2.0, бенчмарки, внутрішній blind test, API-ціна, self-hosting, FP8, vLLM/SGLang та обмеження preview.

На цій сторінці
  1. 1TL;DR
  2. 2Що саме випустив Tencent?
  3. 3770B не означає 770B активних на кожен token
  4. 4Як організовані experts?
  5. 5Hy4 vs Hy3: великий масштабний стрибок
  6. 6Контекст 1M
  7. 7Gated DeepSeek Sparse Attention
  8. 8Що робить IndexCache?
  9. 9Native MTP layer
  10. 10Weights справді публічні
  11. 11Apache 2.0
  12. 12Офіційний self-hosting
  13. 13OpenAI-compatible API
  14. 14Reasoning можна обмежити
  15. 15Офіційні обмеження preview
  16. 16Benchmarks: головний caveat
  17. 17Вибрані результати
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: найбільший стрибок
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas і tool use
  24. 24Hy4 vs Kimi K3 і GLM-5.3: внутрішній blind test
  25. 25Claude Opus 5 і GPT-5.6 Sol
  26. 26API-ціна
  27. 27Self-hosting vs API
  28. 28Чи справді Hy4 “оптимізував сам себе”?
  29. 29Що означає +31,8% throughput?
  30. 30Головні переваги
  31. 31Ризики та невідомі
  32. 32Як benchmark-ити в компанії?
  33. 33Deployment checklist
  34. 34Чи варто переходити з Hy3?
  35. 35Висновок POLPROG

28 серпня 2026 року Tencent випустив і відкрив Hy4 preview, нову flagship Mixture-of-Experts модель сімейства Tencent Hy, раніше відомого переважно як Hunyuan.[1][6]

Основні параметри:

770B параметрів загалом
49B активних параметрів на token
78 шарів
256 routed experts + 1 shared expert
top-8 routed experts на token
контекст 1M
Apache License 2.0

[2]

Tencent опублікував повні weights і Hy4 preview-FP8. Повний repository на Hugging Face має приблизно 1,56 TB.[2][3]

Модель орієнтована на software engineering, офісні workflow, фінансовий аналіз, game development, наукові дослідження та tool-using agents.[1][2]

Три моменти особливо важливі.

По-перше, weights випущені під Apache 2.0, тому можливі self-hosting і комерційне використання відповідно до умов ліцензії.[2][4]

По-друге, Tencent публікує сильні vendor-reported результати: 82,9% на SWE-bench Multilingual, 85,4% на Terminal-Bench 2.1 і 83,7% на MCP-Atlas.[2][9]

По-третє, Tencent стверджує, що Hy4 брав участь в оптимізації власного development та inference pipeline. Один з оптимізаційних циклів нібито підняв end-to-end throughput на 31,8% відносно внутрішнього baseline Tencent.[1]

Це не означає повністю автономне самонавчання. Tencent описує ранню engineering-oriented recursive self-improvement loop.

Стан інформації: 31 серпня 2026 року.

TL;DR

ПитанняПеревірена відповідь
МодельTencent Hy4 preview
Release28 серпня 2026
ТипMixture-of-Experts
Параметри загалом770B
Активні параметри49B на token
Шари78
Routed experts256
Shared experts1
Активні routed expertstop-8
Контекст1M у model card, 1 048 576 на OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
ОптимізаціяIndexCache
MTP1 native layer, 10B total / 0,7B active
ЛіцензіяApache 2.0
Повні weightsблизько 1,56 TB
Quantized variantHy4 preview-FP8
Self-hostingvLLM і SGLang
Офіційний recipetensor parallel size 8
API input$0.834 / 1M tokens
API output$2.501 / 1M tokens
Cache hit$0.042 / 1M tokens
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
СтатусPreview
Відомі обмеженнянадто довгий reasoning та over-verification
Головний caveatще немає широкої незалежної реплікації всієї launch-таблиці

Що саме випустив Tencent?

Tencent опублікував:

Hy4 preview
Hy4 preview-FP8

на Hugging Face, ModelScope, GitCode та CNB.[2]

Модель також доступна через WorkBuddy, CodeBuddy, Tencent Cloud TokenHub і OpenRouter.[1][7]

Reuters підтвердив запуск 28 серпня та позиціонування для software engineering, research і financial analysis.[6]

770B не означає 770B активних на кожен token

Hy4 використовує Mixture-of-Experts.

Backbone має:

770B total

але на token активуються приблизно:

49B

параметрів.[2]

Це близько 6,4% backbone.

MoE зменшує активний compute на token, але повний model все одно потрібно зберігати та розподіляти по inference infrastructure.

Як організовані experts?

Backbone має 78 шарів.[2]

Перший використовує dense FFN.

Наступні 77 містять:

256 routed experts
1 shared expert

На token активуються:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: великий масштабний стрибок

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Це приблизно:

  • 2,61× більше загальних параметрів,
  • 2,33× більше активних параметрів,
  • щонайменше 3,9× довший заявлений контекст.

Tencent каже, що одночасно збільшив model size, context length, training data і post-training.[2]

Контекст 1M

Model card вказує:

Context Length: 1M

[2]

OpenRouter повідомляє:

1,048,576 tokens
64,000 max completion tokens

[7]

Це корисно для великих codebase, довгих agent sessions, multi-document analysis та research.

Але максимальний context не дорівнює ефективній якості роботи з усією його довжиною.

Gated DeepSeek Sparse Attention

Hy4 використовує Gated DeepSeek Sparse Attention.[2]

Sparse attention зменшує обчислення на довгих послідовностях, вибираючи релевантні позиції.

Tencent поєднує це з:

IndexCache

Що робить IndexCache?

IndexCache повторно використовує sparse indices між шарами.[8]

Paper показує на протестованих DSA models меншу роботу indexer і прискорення prefill/decode з малим впливом на якість.[8]

Це результати IndexCache, а не прямий повний benchmark Hy4.

Native MTP layer

Окрім backbone, Hy4 має одну Multi-Token Prediction layer.[2]

Tencent вказує:

10B total
0.7B active

Вона використовується для speculative decoding і ввімкнена в офіційних vLLM/SGLang recipes.[2]

Weights справді публічні

Hugging Face показує:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

Також доступний:

tencent/Hy4-preview-FP8

[11]

Це дає можливість self-hosting, fine-tuning, аналізу weights та власного inference stack.

Apache 2.0

Model card і офіційний repo вказують:

Apache License 2.0

[2][4]

Це permissive license, яка дозволяє використання, модифікацію та distribution, включно з комерційним використанням, за її умов.

Офіційний self-hosting

Tencent рекомендує:

vLLM
SGLang

[2]

vLLM recipe використовує:

vllm/vllm-openai:hy4-preview

і:

--tensor-parallel-size 8

[2]

SGLang використовує --tp-size 8.

Це не означає, що підійдуть будь-які вісім GPU. Важливі memory, precision, KV cache, context та concurrency.

OpenAI-compatible API

Після deployment через vLLM/SGLang Hy4 можна викликати через OpenAI-compatible endpoint.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent рекомендує temperature=0.9 і top_p=1.0.[2]

Reasoning можна обмежити

За замовчуванням Hy4 використовує high reasoning для складних задач.[2]

Для більш прямих відповідей:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

Це корисно, бо надто довгий reasoning є офіційним limitation.

Офіційні обмеження preview

Tencent визнає:[2][6]

  1. модель іноді витрачає більше часу на reasoning, ніж потрібно,
  2. має тенденцію до over-verification.

Для agents це може означати більше tool calls, latency та cost.

Benchmarks: головний caveat

Tencent опублікував benchmark appendix у model card.[2]

Станом на 31 серпня немає широкої незалежної реплікації всієї таблиці в ідентичній конфігурації.

Тому ми позначаємо значення як:

Tencent-reported

Вибрані результати

Транскрипція таблиці Tencent:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High без tools43,4%

Усі значення vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Різниця +7,1 пункту.

Для зовнішнього порівняння потрібно перевіряти точну версію benchmark і harness.

SWE-bench Pro: 65,7%

Tencent:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

+7,8 пункту, що є сильним сигналом покращення software engineering.

DeepSWE: найбільший стрибок

Транскрипція:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Саме такий великий розрив особливо потребує незалежної реплікації.

Terminal-Bench 2.1: 85,4%

Tencent повідомляє:

Hy4 preview: 85.4%

[9][10]

Дуже сильний результат для coding agents, але у таблиці є конкуренти з подібними або вищими значеннями. Це не універсальна перемога.

GPQA Diamond: 92,3%

Tencent-reported:

92.3%

[9][10]

Це підтримує позиціонування для scientific reasoning.[1]

Але benchmark не гарантує надійність у реальному research.

MCP-Atlas і tool use

Tencent:

MCP-Atlas: 83.7%

[9][10]

OpenRouter підтримує для Hy4 tools, tool_choice та structured outputs через JSON Schema.[7]

Hy4 vs Kimi K3 і GLM-5.3: внутрішній blind test

Tencent тестував:[1][2]

163 Tencent experts
203 engineering tasks
шкала 0–4

Середні:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Проти Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Проти GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

Це невелика перевага у внутрішньому workload Tencent, не універсальний незалежний доказ.

Claude Opus 5 і GPT-5.6 Sol

Tencent включає і закриті frontier models.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Подвійні значення — різні settings/variants у Tencent chart і їх не слід зводити в один простий рейтинг.

API-ціна

Tencent вказує:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter показує ті самі ціни.[7][13]

Ціна token не дорівнює cost per task. Довгий reasoning і додаткові tool calls можуть змінити реальну економіку.

Self-hosting vs API

API

Добре для швидкого старту, змінного load і якщо не хочете керувати великим GPU cluster.

Self-hosting

Добре для data residency, контролю inference та великих стабільних workloads.

При близько 1,56 TB full weights це не типовий single-workstation model.[3]

Чи справді Hy4 “оптимізував сам себе”?

Tencent каже, що модель допомагала автоматично оптимізувати training methods, data strategies, evaluation frameworks та low-level operators.[1]

Вона нібито пропонувала підходи, запускала experiments та iterated за результатами.

Tencent називає це:

early-stage recursive self-improvement loop

Це не означає повністю автономний self-training.

Що означає +31,8% throughput?

Tencent стверджує, що Hy4 аналізував bottlenecks і iterated над operator fusion та communication optimization.[1]

Результат:

+31.8% end-to-end throughput
vs internal Tencent baseline

Не 31,8% швидше за Kimi, Claude чи GPT.

Головні переваги

  • Apache 2.0.
  • Context 1M.
  • 49B active з 770B total.
  • Сильний coding/agent profile за даними Tencent.
  • Офіційні vLLM/SGLang recipes.
  • FP8.
  • Конкурентна API-ціна.

Ризики та невідомі

  • Preview status.
  • Benchmarks переважно vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Важка self-hosting infrastructure.
  • Реальну якість 1M context треба тестувати.
  • Data governance для API залежить від provider.

Як benchmark-ити в компанії?

Порівнювати на ідентичних tasks:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Міряти:

  • task completion,
  • test pass rate,
  • quality of diff,
  • tool calls,
  • retry,
  • tokens,
  • latency,
  • cost per task,
  • regressions,
  • out-of-scope changes,
  • long-context quality.

Ключова метрика:

cost per successful task

Deployment checklist

Якість

  • Тестувати internal tasks.
  • Відокремлювати Tencent benchmarks від independent results.
  • Порівняти high reasoning і no_think.
  • Міряти over-verification.
  • Тестувати hallucinations.
  • Validate tool calling.
  • Validate structured outputs.
  • Тестувати довгі agent sessions.

Long context

  • Тестувати 32K, 128K, 256K і більше.
  • Міряти retrieval accuracy.
  • Міряти time-to-first-token.
  • Міряти KV-cache footprint.
  • Не вважати 1M context 1M ідеальної пам’яті.
  • Тестувати repo-level coding.
  • Тестувати cross-document reasoning.
  • Тестувати prompt injection у довгому context.

Self-hosting

  • Перевірити GPU requirements.
  • Почати з official FP8.
  • Тестувати vLLM.
  • Тестувати SGLang.
  • Міряти throughput на реальній concurrency.
  • Міряти P50/P95/P99.
  • Планувати storage.
  • Перевірити Apache 2.0 з legal.

API

  • Перевірити актуальну ціну.
  • Перевірити cache semantics і TTL.
  • Перевірити data retention.
  • Перевірити processing region.
  • Встановити cost limits.
  • Monitor usage per agent.
  • Мати fallback model.
  • Міряти cost per successful task.

Чи варто переходити з Hy3?

Для користувачів Hy3 Hy4 — очевидний POC candidate.

На папері:

295B → 770B total
21B → 49B active
256K → 1M context

плюс великі vendor-reported покращення coding та agent evals.[2][5][9]

Але Hy4 може reason довше, потребує більше infrastructure і все ще preview.

Висновок POLPROG

Hy4 preview — один із найважливіших open-weight releases кінця серпня 2026 року.

Важлива комбінація:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
агресивна API-ціна
сильний coding/agent profile

Три рівні доказів слід розділяти.

Технічні факти

Архітектура, license, weights, context, deployment і price добре задокументовані.[1][2][3][7]

Benchmarks

Сильні, але на launch переважно Tencent-reported.[2][9][10]

Self-improvement

Реальна частина описаного R&D workflow, але не повністю автономний self-training.[1]

Розумний висновок станом на 31 серпня:

Hy4 preview має бути в shortlist для coding agents, research agents, long-context workflows і self-hosted AI infrastructure.

Поки не можна сказати:

Hy4 — найкраща модель світу.

Можна сказати:

Tencent вивів Hy4 у невелику групу open-weight моделей, які вже не можна ігнорувати під час проектування production AI stack.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Часті запитання

Дата release

28 серпня 2026.

Open source?

Tencent називає модель open source та публікує weights/code під Apache 2.0.

Параметри

770B total, 49B active на token у backbone.

MTP входить у 770B?

Ні за model card: додає 10B total / 0,7B active.

Контекст

1M у model card, 1 048 576 на OpenRouter.

Max output

64K на OpenRouter.

Self-hosting

Так.

Офіційні frameworks

vLLM і SGLang.

FP8?

Так.

Розмір weights

Приблизно 1,56 TB.

License

Apache 2.0.

API price

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

Hy4 переміг Kimi K3?

У внутрішньому blind test Tencent 2.99/4 vs 2.94/4. Це не незалежний універсальний доказ.

GLM-5.3?

2.99 vs 2.92 у тому самому test.

Claude Opus 5?

Немає підстав для загальної заяви про перевагу.

Independent benchmarks?

Ще немає широкої реплікації всієї таблиці Tencent.

Відомі слабкі сторони

Надто довгий reasoning та over-verification.

Hy4 покращив сам себе?

Tencent описує model-assisted автоматизовані experiments та optimization pipeline, а не повністю автономний training.

+31,8% throughput

Покращення проти внутрішнього inference baseline Tencent, не проти competitor models.

Джерела та примітки

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 серпня 2026, доступ 31 серпня 2026.123456789101112
  2. Tencent, Hy4 preview — офіційна Hugging Face model card, доступ 31 серпня 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, доступ 31 серпня 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — офіційний GitHub repository, доступ 31 серпня 2026.12
  5. Tencent, Hy3 Now Available Globally, 5 серпня 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 серпня 2026.123
  7. OpenRouter, Tencent: Hy4 preview, стан перевірено 31 серпня 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, березень 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 серпня 2026. Значення транскрибовані з таблиці Tencent, не незалежна реплікація.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, доступ 31 серпня 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, доступ 31 серпня 2026.
  12. Tencent, Hy3 preview launch, 24 квітня 2026.
  13. OpenRouter, Tencent models, доступ 31 серпня 2026.

Чи було це корисно?

Отримуйте нові статті електронною поштою

Один короткий лист на кожну нову статтю Навчання. Без спаму, відписка в один клік.

Ми використовуємо вашу пошту лише для надсилання нових статей. Без передачі третім сторонам.

Назад до Навчання

Усі статті

Показати все