Tencent Hy4 preview: 770B parametrów, 49B aktywnych i kontekst 1M. Benchmarki, cena i porównanie z Kimi K3, GLM-5.3 i Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parametrów, 49B aktywnych i kontekst 1M. Benchmarki, cena i porównanie z Kimi K3, GLM-5.3 i Claude Opus 5

Zweryfikowana analiza Tencent Hy4 preview: architektura MoE 770B/49B, kontekst 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarki, wewnętrzny blind test, ceny API, self-hosting, FP8, vLLM/SGLang i ograniczenia wersji preview.

Opublikowano Autor Czas czytania 16 min czytania

Zweryfikowana analiza Tencent Hy4 preview: architektura MoE 770B/49B, kontekst 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarki, wewnętrzny blind test, ceny API, self-hosting, FP8, vLLM/SGLang i ograniczenia wersji preview.

Na tej stronie
  1. 1TL;DR
  2. 2Co dokładnie wydał Tencent?
  3. 3770B nie oznacza 770B aktywnych przy każdym tokenie
  4. 4Jak wygląda warstwa ekspertów?
  5. 5Hy4 vs Hy3: skok skali jest ogromny
  6. 61M tokenów kontekstu
  7. 7Gated DeepSeek Sparse Attention
  8. 8Co robi IndexCache?
  9. 9Natywna warstwa MTP
  10. 10Wagi są naprawdę publicznie dostępne
  11. 11Apache 2.0 jest istotniejszy niż marketingowe „open source”
  12. 12Oficjalny self-hosting: vLLM i SGLang
  13. 13OpenAI-compatible API
  14. 14Reasoning mode można ograniczyć
  15. 15Oficjalne ograniczenia preview
  16. 16Benchmarki: najpierw najważniejsze zastrzeżenie
  17. 17Hy4 preview: wybrane wyniki
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: największy skok względem Hy3
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas i agenci narzędziowi
  24. 24Hy4 vs Kimi K3 i GLM-5.3: blind test Tencent
  25. 25A co z Claude Opus 5 i GPT-5.6 Sol?
  26. 26Cena API
  27. 27Self-hosting vs API
  28. 28Czy Hy4 naprawdę „optymalizował sam siebie”?
  29. 2931,8% większy throughput: co dokładnie oznacza?
  30. 30Największe zalety Hy4 preview
  31. 31Największe ryzyka i niewiadome
  32. 32Jak powinien wyglądać uczciwy benchmark w firmie?
  33. 33Checklist przed wdrożeniem Hy4
  34. 34Czy warto przejść z Hy3?
  35. 35Werdykt POLPROG

28 sierpnia 2026 Tencent opublikował i udostępnił w modelu open source Hy4 preview, nowy flagowy model Mixture-of-Experts z rodziny Tencent Hy, wcześniej szerzej znanej jako Hunyuan.[1][6]

Specyfikacja jest duża nawet jak na realia 2026 roku:

770B parametrów łącznie
49B parametrów aktywnych na token
78 warstw
256 routed experts + 1 shared expert
top-8 routed experts aktywnych na token
1M tokenów kontekstu
Apache License 2.0

[2]

Model jest dostępny w pełnej wersji oraz jako Hy4 preview-FP8, a repozytorium pełnych wag na Hugging Face ma około 1,56 TB.[2][3]

Tencent pozycjonuje Hy4 preview nie jako zwykły chatbot, lecz model do realnej pracy: software engineering, dokumentów, analizy finansowej, gier, badań naukowych i agentów korzystających z narzędzi.[1][2]

Najciekawsze są jednak trzy rzeczy.

Po pierwsze, Tencent opublikował wagi na licencji Apache 2.0, a więc model można self-hostować i używać komercyjnie zgodnie z warunkami tej licencji.[2]

Po drugie, model ma bardzo mocne, vendor-reported wyniki w benchmarkach codingowych i agentowych, m.in. 82,9% na SWE-bench Multilingual, 85,4% na Terminal-Bench 2.1 i 83,7% na MCP-Atlas.[2][9]

Po trzecie, Tencent twierdzi, że Hy4 preview brał udział w optymalizacji własnego procesu rozwoju i infrastruktury inference. Model miał pomagać w proponowaniu zmian, uruchamianiu eksperymentów i iteracji, a osobna seria optymalizacji inference przyniosła 31,8% wzrostu end-to-end throughput względem wewnętrznego baseline'u Tencent.[1]

To brzmi jak „AI poprawiające samo siebie”, ale trzeba być precyzyjnym: Tencent opisuje wczesny, inżynierski loop automatyzacji i recursive self-improvement, nie autonomiczny system samodzielnie trenujący kolejne generacje bez ludzi.

Stan informacji: 31 sierpnia 2026 roku.

TL;DR

PytanieZweryfikowana odpowiedź
ModelTencent Hy4 preview
Premiera28 sierpnia 2026
TypMixture-of-Experts
Parametry łącznie770B
Aktywne parametry49B na token
Warstwy78
Routed experts256
Shared experts1
Aktywowane routed expertstop-8
Context1M według model card, 1,048,576 na OpenRouter
Max output na OpenRouter64K
AttentionGated DeepSeek Sparse Attention
Optymalizacja sparse attentionIndexCache
MTP1 natywna warstwa, 10B total / 0,7B active
LicencjaApache 2.0
Pełne wagiokoło 1,56 TB na Hugging Face
Quantized variantHy4 preview-FP8
Self-hostingvLLM i SGLang
Oficjalny recipetensor parallel size 8
API input$0.834 / 1M tokenów
API output$2.501 / 1M tokenów
Cache hit$0.042 / 1M tokenów
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
StatusPreview
Główne ograniczeniazbyt długie reasoning i over-verification
Najważniejszy caveatbrak szerokiej niezależnej replikacji benchmarków z dnia premiery

Co dokładnie wydał Tencent?

Tencent udostępnił:

Hy4 preview
Hy4 preview-FP8

na Hugging Face, ModelScope, GitCode i CNB.[2]

Model można także uruchamiać przez produkty Tencent, m.in. WorkBuddy i CodeBuddy, a API jest dostępne przez Tencent Cloud TokenHub i OpenRouter.[1][7]

Reuters potwierdził premierę 28 sierpnia i wskazał software engineering, research oraz financial analysis jako główne zastosowania komunikowane przez Tencent.[6]

770B nie oznacza 770B aktywnych przy każdym tokenie

Hy4 preview wykorzystuje architekturę Mixture-of-Experts.

Cały backbone ma:

770B total parameters

ale dla pojedynczego tokena aktywowane jest około:

49B parameters

[2]

To około 6,4% wszystkich parametrów backbone'u.

MoE pozwala więc przechowywać dużą pulę wiedzy i specjalizacji bez wykonywania całego modelu przy każdym tokenie.

Nie oznacza to jednak, że model jest „lekki”. Wagi nadal trzeba przechowywać i rozmieścić w pamięci infrastruktury inference.

Jak wygląda warstwa ekspertów?

Backbone składa się z 78 warstw.[2]

Pierwsza ma klasyczny dense FFN.

Pozostałe 77 używają MoE i każda zawiera:

256 routed experts
1 shared expert

Na token wybieranych jest:

top-8 routed experts
+
shared expert

[2]

To jedna z przyczyn, dla których liczba aktywnych parametrów jest znacznie niższa od całkowitej liczby parametrów.

Hy4 vs Hy3: skok skali jest ogromny

Hy3 miał:

295B total
21B active
256K context

[5][12]

Hy4 preview ma:

770B total
49B active
1M context

[2]

Oznacza to w przybliżeniu:

  • 2,61× więcej parametrów łącznie,
  • 2,33× więcej parametrów aktywnych,
  • co najmniej 3,9× dłuższy deklarowany kontekst.

Tencent podkreśla, że zwiększył jednocześnie model size, context length i training data, a także rozbudował post-training.[2]

1M tokenów kontekstu

Model card podaje:

Context Length: 1M

[2]

OpenRouter raportuje dokładnie:

1,048,576 tokens context
64,000 max completion tokens

[7]

Tak długi kontekst ma sens przede wszystkim w:

  • analizie dużych codebase,
  • długich agent sessions,
  • pracy z wieloma dokumentami,
  • research,
  • repo-level refactoring,
  • analizie logów i danych.

Nie oznacza jednak, że każdy token z miliona będzie równie dobrze wykorzystany. Context length i effective context quality to dwie różne rzeczy.

Gated DeepSeek Sparse Attention

Hy4 preview wykorzystuje Gated DeepSeek Sparse Attention, czyli rozwiązanie inspirowane architekturą DeepSeek.[2]

Sparse attention ma zmniejszać koszt pracy na bardzo długich sekwencjach przez wybieranie istotnej części wcześniejszych tokenów zamiast pełnego quadratic attention dla każdego tokena.

Tencent łączy to z dodatkową optymalizacją:

IndexCache

Co robi IndexCache?

IndexCache to technika ponownego użycia sparse indices pomiędzy warstwami.[8]

W klasycznym sparse attention indexer może wybierać top-k istotnych pozycji oddzielnie dla kolejnych warstw.

IndexCache wykorzystuje fakt, że wybory te bywają podobne między sąsiednimi warstwami, więc część warstw może korzystać z indeksów policzonych wcześniej.

W pracy opisującej IndexCache autorzy raportowali na testowanym modelu DSA redukcję części obliczeń indexera oraz przyspieszenia prefill i decode przy niewielkiej degradacji jakości.[8]

Te wyniki dotyczą pracy nad IndexCache, a nie bezpośrednio pełnego benchmarku Hy4.

Natywna warstwa MTP

Poza backbone'em Hy4 ma jedną natywną warstwę MTP, Multi-Token Prediction.[2]

Tencent podaje:

10B total parameters
0.7B activated parameters

dla MTP.

Warstwa jest używana do speculative decoding.

W oficjalnych recipe dla vLLM i SGLang MTP jest rzeczywiście włączane jako mechanizm przyspieszający generowanie.[2]

Wagi są naprawdę publicznie dostępne

To nie jest wyłącznie API opisane jako „open”.

Hugging Face pokazuje:

tencent/Hy4-preview
1.56 TB
131 safetensors shards
Apache-2.0

[3]

Dostępny jest też model:

tencent/Hy4-preview-FP8

[2][11]

To ważne, bo umożliwia:

  • self-hosting,
  • analizę wag,
  • własne inference stacki,
  • fine-tuning,
  • eksperymenty z quantization,
  • deployment bez wysyłania promptów do zewnętrznego API.

Apache 2.0 jest istotniejszy niż marketingowe „open source”

Model card i repozytorium wskazują licencję:

Apache License 2.0

[2][4]

To bardzo liberalna licencja, pozwalająca na użycie, modyfikację i dystrybucję, również komercyjnie, przy zachowaniu jej warunków.

Dla firm jest to prostszy model licencyjny niż wiele niestandardowych „community licenses” stosowanych przy modelach open-weight.

Oficjalny self-hosting: vLLM i SGLang

Tencent podaje dwa główne production serving stacks:

vLLM
SGLang

[2]

Oficjalny recipe vLLM korzysta z obrazu:

vllm/vllm-openai:hy4-preview

i uruchamia wariant FP8 z:

--tensor-parallel-size 8

[2]

SGLang analogicznie ma oficjalny image i --tp-size 8.

To nie jest obietnica, że „wystarczy dowolne osiem GPU”. Wymagania pamięciowe zależą od modelu, precision, KV cache, długości kontekstu, concurrency i konkretnego hardware.

OpenAI-compatible API

Po uruchomieniu vLLM lub SGLang model może być wywoływany przez OpenAI-compatible endpoint.[2]

Przykład:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this repository architecture."}
    ],
    temperature=0.9,
    top_p=1.0,
)

Tencent rekomenduje temperature=0.9 i top_p=1.0.[2]

Reasoning mode można ograniczyć

Model domyślnie korzysta z wysokiego poziomu reasoning dla złożonych zadań.[2]

Dla bezpośredniejszych odpowiedzi model card pokazuje możliwość użycia:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

To istotne, ponieważ jednym z oficjalnie przyznanych problemów preview jest zbyt długie rozumowanie.

Oficjalne ograniczenia preview

Tencent sam wymienia dwa problemy:[2][6]

  1. model potrafi spędzać więcej czasu niż potrzeba na reasoning nad złożonym zadaniem,
  2. ma tendencję do over-verification, czyli nadmiernego sprawdzania własnej pracy.

To ważne w agentach, gdzie każde dodatkowe sprawdzenie może oznaczać kolejne tool calls, latency i koszt tokenów.

Hy4 preview należy więc traktować jako bardzo mocny, ale wciąż wczesny release.

Benchmarki: najpierw najważniejsze zastrzeżenie

Benchmark appendix został opublikowany przez Tencent jako część model card.[2]

Na 31 sierpnia nie ma jeszcze wystarczająco szerokiego zestawu niezależnych, identycznie skonfigurowanych replikacji wszystkich tych wyników.

Dlatego w tym artykule wszystkie liczby z tabeli Tencent oznaczamy jako:

Tencent-reported

Nie jako:

niezależnie potwierdzony wynik

To szczególnie ważne dla benchmarków agentowych, gdzie wynik silnie zależy od harnessu, tools, budgetu, reasoning mode i wersji środowiska.

Hy4 preview: wybrane wyniki

Transkrypcja benchmark appendix Tencent wskazuje m.in.:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High bez tools43,4%

Wszystkie powyższe wartości są vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent raportuje:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

To wzrost o 7,1 punktu procentowego względem poprzedniej generacji w tej konfiguracji.

Benchmark jest interesujący, bo obejmuje software engineering w wielu językach i repozytoriach.

Nie należy jednak porównywać go bezpośrednio z dowolnym wynikiem SWE-bench z internetu bez sprawdzenia wariantu benchmarku i harnessu.

SWE-bench Pro: 65,7%

Tencent raportuje:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Różnica wynosi 7,8 punktu procentowego w zestawieniu Tencent.

To jeden z sygnałów, że Hy4 jest rzeczywistym skokiem względem Hy3 w software engineering, a nie tylko powiększeniem liczby parametrów.

DeepSWE: największy skok względem Hy3

W transkrypcji benchmark appendix:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

To ogromna różnica generacyjna.

Jednocześnie właśnie przy takich skokach najbardziej potrzebna jest niezależna replikacja, bo wynik może zależeć od zmian nie tylko modelu, ale też scaffoldu, tool use i ustawień ewaluacji.

Terminal-Bench 2.1: 85,4%

Tencent raportuje:

Hy4 preview: 85.4%

na Terminal-Bench 2.1.[9][10]

To bardzo mocny wynik dla modelu kierowanego do coding agents.

Jednak w benchmark appendix konkurenci również osiągają bardzo wysokie wartości, więc nie ma podstaw do stwierdzenia, że Hy4 „wygrywa Terminal-Bench” nad wszystkimi modelami.

GPQA Diamond: 92,3%

Vendor-reported wynik:

92.3%

[9][10]

plasuje Hy4 w bardzo mocnym obszarze zaawansowanego scientific reasoning.

Tencent pozycjonuje model także do AI research, molecular dynamics, condensed-matter physics i matematyki.[1]

Benchmark nie dowodzi jednak niezawodności modelu w realnym badaniu naukowym.

MCP-Atlas i agenci narzędziowi

Tencent raportuje:

MCP-Atlas: 83.7%

[9][10]

To istotne, bo Hy4 ma być używany nie tylko do generowania tekstu, ale także do agent workflows i tool calling.

OpenRouter potwierdza obsługę tools, tool_choice i structured outputs przez JSON schema dla swojej integracji modelu.[7]

Hy4 vs Kimi K3 i GLM-5.3: blind test Tencent

Tencent przeprowadził także wewnętrzny blind side-by-side test.[1][2]

Parametry:

163 ekspertów Tencent
203 zadania inżynierskie
skala 0–4

Średnie wyniki:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

W bezpośrednim porównaniu z Kimi K3 Tencent podaje:

51.2% wins
7.9% ties
40.9% losses

A z GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

To niewielka przewaga w wewnętrznym teście Tencent, nie dowód na uniwersalną przewagę Hy4 nad tymi modelami.

A co z Claude Opus 5 i GPT-5.6 Sol?

Tencent umieścił zamknięte modele frontier w swoim benchmark appendix.[9]

W części testów Hy4 jest bardzo blisko, w innych pozostaje za nimi.

Przykładowo transkrypcja tabeli Tencent dla SWE-bench Multilingual wskazuje:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

a na Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Podwójne liczby wynikają z różnych wariantów lub ustawień pokazywanych na wykresie Tencent. Nie należy mieszać ich w jeden ranking.

Najbezpieczniejszy wniosek: Hy4 preview osiąga poziom konkurencyjny w wielu zadaniach, ale nie ma podstaw, by nazwać go jednoznacznie najlepszym modelem ogółem.

Cena API

Tencent podał cenę:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter pokazuje te same stawki input/output i cache read.[7][13]

To agresywna cena jak na model tej klasy.

Jednocześnie koszt tokena nie jest tym samym co koszt wykonania zadania. Model, który generuje więcej tokenów lub wykonuje więcej tool calls, może być droższy end-to-end mimo tańszego cennika.

Self-hosting vs API

API ma sens, gdy:

  • chcesz szybko zacząć,
  • nie chcesz zarządzać dużym klastrem GPU,
  • potrzebujesz elastycznego skalowania,
  • koszt jest zmienny i zależy od użycia.

Self-hosting ma sens, gdy:

  • wymagane jest data residency,
  • potrzebujesz pełnej kontroli nad inference,
  • masz własną infrastrukturę GPU,
  • workload jest wystarczająco duży i stabilny,
  • chcesz kontrolować quantization, routing i serving stack.

Przy pełnych wagach około 1,56 TB nie jest to model do typowego pojedynczego workstation.[3]

Czy Hy4 naprawdę „optymalizował sam siebie”?

Tencent twierdzi, że model po raz pierwszy uczestniczył w automatycznej optymalizacji:[1]

  • training methods,
  • data strategies,
  • evaluation frameworks,
  • low-level operators.

Model miał proponować rozwiązania, uruchamiać eksperymenty i iterować na podstawie rezultatów.

Kod, logi i feedback miały trafiać do kolejnych rund eksploracji.

Tencent opisuje to jako:

early-stage recursive self-improvement loop

Należy jednak unikać clickbaitowego wniosku:

Hy4 sam się wytrenował

Źródło mówi o wspomaganiu i automatyzacji procesu R&D, a nie o całkowicie autonomicznej reprodukcji modelu.

31,8% większy throughput: co dokładnie oznacza?

Tencent podaje, że Hy4 analizował bottlenecki inference system i wykonywał iteracje m.in. nad operator fusion i communication optimization.[1]

Według Tencent:

end-to-end throughput
+31.8%
vs internal baseline

Wartość nie oznacza:

  • 31,8% szybszego modelu od Kimi,
  • 31,8% niższego latency od Claude,
  • 31,8% niższego kosztu API.

To wynik względem baseline'u Tencent w ich własnym systemie inference.

Bez tej informacji procent łatwo byłoby błędnie zinterpretować.

Największe zalety Hy4 preview

Otwarta licencja

Apache 2.0.

Bardzo długi kontekst

1M tokenów.

Duża intelligence density

49B active z 770B total.

Silne vendor-reported coding i agent benchmarks

Szczególnie SWE-bench Multilingual, Terminal-Bench 2.1 i MCP-Atlas.

Oficjalne serving recipe

vLLM i SGLang.

FP8

Mniejszy koszt pamięci niż pełne BF16 wagi.

Konkurencyjna cena API

Poniżej wielu zamkniętych modeli frontier.

Największe ryzyka i niewiadome

Preview

To nadal wczesna wersja.

Benchmark independence

Najmocniejsze liczby pochodzą od Tencent.

Over-reasoning

Oficjalnie przyznane przez producenta.

Over-verification

Może zwiększać latency i koszt w agentach.

Infrastruktura

49B active nie usuwa problemu przechowywania ogromnego modelu.

1M context

Trzeba osobno mierzyć recall, latency, KV cache i jakość na własnych danych.

Data governance

Przy API należy osobno sprawdzić warunki konkretnego providera. Open weights nie oznacza, że hosted API automatycznie spełnia wymagania prywatności organizacji.

Jak powinien wyglądać uczciwy benchmark w firmie?

Nie wystarczy wkleić tabeli producenta.

Porównaj:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

na identycznych zadaniach.

Mierz:

  • task completion rate,
  • test pass rate,
  • poprawność finalnego diffu,
  • liczbę tool calls,
  • liczbę retry,
  • tokeny wejścia i wyjścia,
  • latency,
  • koszt zakończonego zadania,
  • regresje,
  • działania poza zakresem,
  • jakość pracy na długim kontekście.

Najważniejsza metryka to często:

cost per successful task

a nie:

cost per million tokens

Checklist przed wdrożeniem Hy4

Model i jakość

  • Testujemy model na własnych zadaniach.
  • Oddzielamy benchmarki Tencent od niezależnych wyników.
  • Sprawdzamy reasoning mode high i no_think.
  • Mierzymy over-verification.
  • Testujemy halucynacje w naszej domenie.
  • Walidujemy tool calling.
  • Sprawdzamy structured outputs.
  • Testujemy długie sesje agentowe.

Long context

  • Testujemy 32K, 128K, 256K i większe konteksty.
  • Mierzymy retrieval accuracy.
  • Mierzymy time-to-first-token.
  • Mierzymy KV-cache footprint.
  • Nie zakładamy, że 1M context = 1M użytecznej pamięci.
  • Testujemy repo-level coding.
  • Testujemy cross-document reasoning.
  • Kontrolujemy prompt injection w długim kontekście.

Self-hosting

  • Weryfikujemy pełne wymagania GPU.
  • Zaczynamy od oficjalnego FP8.
  • Testujemy vLLM.
  • Testujemy SGLang.
  • Mierzymy throughput przy realnej concurrency.
  • Mierzymy latency P50/P95/P99.
  • Planujemy storage dla wag.
  • Weryfikujemy licencję Apache 2.0 z własnym działem prawnym.

API

  • Weryfikujemy aktualny cennik providera.
  • Sprawdzamy cache semantics i TTL.
  • Sprawdzamy data retention.
  • Sprawdzamy region przetwarzania.
  • Ustalamy limity kosztów.
  • Monitorujemy usage per agent.
  • Mamy fallback model.
  • Mierzymy koszt per successful task.

Czy warto przejść z Hy3?

Jeżeli organizacja już używa Hy3, Hy4 preview jest naturalnym kandydatem do POC.

Na papierze dostajemy:

295B → 770B total
21B → 49B active
256K → 1M context

oraz duże wzrosty w vendor-reported coding/agent evals.[2][5][9]

Ale „upgrade” nie powinien być automatyczny.

Hy4:

  • może reasonować dłużej,
  • ma większe wymagania self-hosting,
  • jest preview,
  • może mieć inne profile latency/cost.

Migracja powinna być oparta o zadania produkcyjne, nie wyłącznie benchmark chart.

Werdykt POLPROG

Hy4 preview jest jedną z najważniejszych premier open-weight końcówki sierpnia 2026.

Nie dlatego, że ma największą liczbę parametrów.

Najciekawsze jest połączenie:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
agresywna cena API
mocny profil coding/agent

Model pokazuje, jak szybko otwarte modele przestają być „tańszą alternatywą” i stają się realnymi kandydatami do workloadów enterprise.

Jednocześnie trzeba oddzielić trzy poziomy dowodów.

Fakty techniczne

Parametry, architektura, licencja, wagi, context, deployment i cena są dobrze udokumentowane przez Tencent, Hugging Face i providerów.[1][2][3][7]

Benchmarki

Są imponujące, ale w większości nadal Tencent-reported na moment premiery.[2][9][10]

„Self-improvement”

Jest realnym elementem opisanego procesu R&D, ale nie należy go przedstawiać jako autonomicznego samowytrenowania modelu.[1]

Najbardziej rozsądny wniosek na 31 sierpnia 2026:

Hy4 preview powinien znaleźć się na krótkiej liście modeli do POC dla zespołów budujących coding agents, research agents, długokontekstowe workflow i własną infrastrukturę AI.

Nie ma jeszcze wystarczających podstaw, by ogłaszać:

Hy4 jest najlepszym modelem świata.

Ale są już wystarczające podstawy, by powiedzieć:

Tencent dołączył Hy4 do ścisłej grupy modeli open-weight, których nie można ignorować przy projektowaniu produkcyjnego stosu AI.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Najczęściej zadawane pytania

Kiedy wydano Hy4 preview?

28 sierpnia 2026.

Czy Hy4 preview jest open source?

Tencent określa go jako open source, a wagi i kod są publicznie dostępne na licencji Apache 2.0.

Ile ma parametrów?

770B total i 49B active na token w backbone.

Czy dodatkowa warstwa MTP wchodzi w 770B?

Model card zaznacza, że tabela 770B dotyczy backbone'u, a MTP ma dodatkowo 10B total / 0,7B active.

Jaki ma context window?

Model card podaje 1M. OpenRouter raportuje 1,048,576 tokenów.

Maksymalny output?

OpenRouter podaje 64K.

Czy można go self-hostować?

Tak.

Jakie frameworki są oficjalnie wspierane?

vLLM i SGLang.

Czy jest FP8?

Tak, Hy4 preview-FP8.

Jak duże są pełne wagi?

Hugging Face pokazuje około 1,56 TB.

Jaka jest licencja?

Apache 2.0.

Ile kosztuje API?

Tencent podaje $0.834/1M input, $2.501/1M output i $0.042/1M cache hits.

Czy Hy4 pokonał Kimi K3?

W wewnętrznym blind teście Tencent miał średnio 2.99/4 wobec 2.94/4 dla Kimi K3. To nie jest niezależny dowód uniwersalnej przewagi.

Czy pokonał GLM-5.3?

W tym samym teście Tencent: 2.99 vs 2.92. Ponownie, to test wewnętrzny.

Czy pokonał Claude Opus 5?

Nie ma podstaw do takiego ogólnego twierdzenia. Wyniki zależą od benchmarku, harnessu i ustawień.

Czy benchmarki są niezależnie potwierdzone?

Na dzień 31 sierpnia nie ma jeszcze szerokiej niezależnej replikacji pełnej tabeli Tencent.

Jakie są znane wady?

Zbyt długie reasoning oraz over-verification.

Czy Hy4 sam siebie ulepszył?

Tencent opisuje jego udział w automatyzacji eksperymentów i optymalizacji pipeline'u, ale nie pełne autonomiczne samowytrenowanie.

Co oznacza +31,8% throughput?

Wzrost względem wewnętrznego baseline'u Tencent po optymalizacji ich inference infrastructure, a nie przewagę 31,8% nad konkurencyjnymi modelami.

Źródła i przypisy

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 sierpnia 2026, dostęp 31 sierpnia 2026.123456789101112
  2. Tencent, Hy4 preview — oficjalny model card na Hugging Face, dostęp 31 sierpnia 2026.123456789101112131415161718192021222324252627282930
  3. Hugging Face, tencent/Hy4-preview — files and versions, dostęp 31 sierpnia 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — oficjalne repozytorium GitHub, dostęp 31 sierpnia 2026.
  5. Tencent, Hy3 Now Available Globally, 5 sierpnia 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 sierpnia 2026.123
  7. OpenRouter, Tencent: Hy4 preview, stan sprawdzony 31 sierpnia 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, marzec 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 sierpnia 2026. Dane benchmarkowe opisane jako transkrypcja tabeli Tencent, nie niezależna replikacja.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, dostęp 31 sierpnia 2026. Zestawienie wartości opartych na benchmark appendix Tencent.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, dostęp 31 sierpnia 2026.
  12. Tencent, Hy3 preview launch, 24 kwietnia 2026.
  13. OpenRouter, Tencent models, dostęp 31 sierpnia 2026.

Czy ten artykuł był pomocny?

Nowe artykuły na e-mail

Jeden krótki e-mail przy każdym nowym artykule. Bez spamu, wypisujesz się jednym kliknięciem.

Wykorzystujemy e-mail wyłącznie do wysyłki nowych artykułów. Bez udostępniania stronom trzecim.

Wróć do bazy wiedzy