Am 28. August 2026 veröffentlichte Tencent Hy4 preview, das neue Mixture-of-Experts-Flaggschiff der Tencent-Hy-Familie, die zuvor international stärker unter dem Namen Hunyuan bekannt war.[1][6]
Die Eckdaten:
770B Parameter insgesamt
49B aktive Parameter pro Token
78 Layer
256 Routed Experts + 1 Shared Expert
Top-8 Routed Experts pro Token
1M Kontext
Apache License 2.0
Tencent veröffentlichte sowohl die vollständigen Gewichte als auch Hy4 preview-FP8. Das vollständige Hugging-Face-Repository ist rund 1,56 TB groß.[2][3]
Hy4 soll nicht nur Chatbot-Aufgaben lösen, sondern Software Engineering, Office-Workflows, Finanzanalyse, Games, wissenschaftliche Forschung und Tool-using Agents.[1][2]
Drei Punkte sind besonders wichtig.
Erstens: Die Gewichte stehen unter Apache 2.0 und können damit im Rahmen dieser Lizenz selbst gehostet und kommerziell eingesetzt werden.[2][4]
Zweitens: Tencent meldet starke Coding- und Agent-Benchmarks, etwa 82,9% auf SWE-bench Multilingual, 85,4% auf Terminal-Bench 2.1 und 83,7% auf MCP-Atlas.[2][9]
Drittens: Tencent sagt, Hy4 habe bei der Optimierung seines eigenen Entwicklungs- und Inference-Stacks mitgearbeitet. Ein separater Optimierungszyklus soll den End-to-End-Throughput gegenüber einem internen Tencent-Baseline-System um 31,8% erhöht haben.[1]
Das ist kein Beleg dafür, dass sich das Modell vollständig autonom selbst trainiert. Tencent beschreibt einen frühen, engineering-orientierten Recursive-Self-Improvement-Loop.
Informationsstand: 31. August 2026.
TL;DR
| Frage | Verifizierte Antwort |
|---|---|
| Modell | Tencent Hy4 preview |
| Release | 28. August 2026 |
| Typ | Mixture-of-Experts |
| Gesamtparameter | 770B |
| Aktive Parameter | 49B pro Token |
| Layer | 78 |
| Routed Experts | 256 |
| Shared Experts | 1 |
| Aktivierte Routed Experts | Top-8 |
| Kontext | 1M im Model Card, 1.048.576 bei OpenRouter |
| Max Output bei OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Sparse-Attention-Optimierung | IndexCache |
| MTP | 1 native Layer, 10B total / 0,7B aktiv |
| Lizenz | Apache 2.0 |
| Volle Gewichte | ca. 1,56 TB auf Hugging Face |
| Quantisierte Variante | Hy4 preview-FP8 |
| Self-Hosting | vLLM und SGLang |
| Offizielles Recipe | Tensor Parallel Size 8 |
| API Input | $0.834 / 1M Tokens |
| API Output | $2.501 / 1M Tokens |
| Cache Hit | $0.042 / 1M Tokens |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Status | Preview |
| Bekannte Schwächen | zu langes Reasoning und Over-Verification |
| Wichtigster Caveat | noch keine breite unabhängige Replikation der Launch-Benchmarks |
Was hat Tencent genau veröffentlicht?
Tencent stellte:
Hy4 preview
Hy4 preview-FP8
auf Hugging Face, ModelScope, GitCode und CNB bereit.[2]
Zusätzlich ist das Modell über WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter erreichbar.[1][7]
Reuters bestätigte den Launch am 28. August und nannte Software Engineering, Forschung und Finanzanalyse als zentrale Einsatzfelder.[6]
770B bedeutet nicht 770B aktive Parameter pro Token
Hy4 nutzt eine Mixture-of-Experts-Architektur.
Der Backbone besitzt:
770B total parameters
aber pro Token werden ungefähr:
49B parameters
aktiviert.[2]
Das sind rund 6,4% des Backbones.
MoE reduziert die tatsächlich ausgeführte Parametermenge pro Token, macht das Modell aber nicht klein. Die vollständigen Gewichte müssen weiterhin gespeichert und auf Inference-Hardware verteilt werden.
Aufbau der Expert-Layer
Der Backbone hat 78 Layer.[2]
Der erste nutzt einen klassischen Dense FFN.
Die übrigen 77 bestehen aus:
256 Routed Experts
1 Shared Expert
Pro Token werden aktiviert:
Top-8 Routed Experts
+
Shared Expert
Hy4 vs Hy3: massiver Skalensprung
Hy3 hatte:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Das entspricht ungefähr:
- 2,61× mehr Gesamtparametern,
- 2,33× mehr aktiven Parametern,
- mindestens 3,9× längerem Kontext.
Tencent sagt, gleichzeitig Modellgröße, Kontext, Trainingsdaten und Post-Training ausgebaut zu haben.[2]
1M-Tokens Kontext
Im Model Card steht:
Context Length: 1M
OpenRouter meldet:
1,048,576 Tokens Kontext
64,000 maximale Completion-Tokens
Das ist interessant für große Codebasen, lange Agent-Sessions, Multi-Document-Analyse, Research und Repo-Level-Refactoring.
Ein großer nomineller Kontext garantiert jedoch nicht automatisch perfekte Retrieval-Qualität über die gesamte Länge.
Gated DeepSeek Sparse Attention
Hy4 verwendet Gated DeepSeek Sparse Attention.[2]
Sparse Attention reduziert bei langen Sequenzen den Aufwand, indem relevante Tokenpositionen selektiert werden, statt überall Full Attention zu berechnen.
Tencent kombiniert dies mit:
IndexCache
Was ist IndexCache?
IndexCache wiederverwendet Sparse-Attention-Indizes zwischen Layern.[8]
Da sich Top-k-Auswahlen benachbarter Layer oft ähneln, können bestimmte Layer bereits berechnete Indizes wiederverwenden.
Die IndexCache-Arbeit berichtet auf den getesteten DSA-Modellen reduzierte Indexer-Arbeit und Speedups für Prefill und Decode bei geringer Qualitätsabweichung.[8]
Diese Zahlen sind Forschungsergebnisse zu IndexCache, keine direkten Hy4-Benchmarkwerte.
Native MTP-Layer
Neben dem Backbone besitzt Hy4 eine native Multi-Token-Prediction-Layer.[2]
Tencent gibt an:
10B total parameters
0.7B active parameters
Die Layer wird für speculative decoding eingesetzt.
Die offiziellen vLLM- und SGLang-Recipes aktivieren diesen Pfad.[2]
Die Gewichte sind wirklich öffentlich
Hugging Face zeigt:
tencent/Hy4-preview
1.56 TB
131 Safetensors-Shards
Apache-2.0
Zusätzlich gibt es:
tencent/Hy4-preview-FP8
Damit sind Self-Hosting, Fine-Tuning, Weight-Analyse und eigene Inference-Stacks möglich.
Apache 2.0 ist entscheidend
Model Card und Repository weisen:
Apache License 2.0
Die Lizenz erlaubt Nutzung, Veränderung und Verteilung, auch kommerziell, unter ihren Bedingungen.
Für Unternehmen ist das meist einfacher als proprietäre Community-Lizenzen mancher Open-Weight-Modelle.
Offizielles Self-Hosting: vLLM und SGLang
Tencent empfiehlt:
vLLM
SGLang
für Production Serving.[2]
Das vLLM-Recipe verwendet:
vllm/vllm-openai:hy4-preview
und für FP8:
--tensor-parallel-size 8
SGLang arbeitet analog mit --tp-size 8.
Das heißt nicht, dass beliebige acht GPUs ausreichen. Speicherbedarf hängt von Hardware, Precision, KV Cache, Kontext und Concurrency ab.
OpenAI-kompatible API
Nach dem Start über vLLM oder SGLang kann Hy4 über einen OpenAI-kompatiblen Endpoint angesprochen werden.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this repository architecture."}
],
temperature=0.9,
top_p=1.0,
)
Tencent empfiehlt temperature=0.9 und top_p=1.0.[2]
Reasoning lässt sich begrenzen
Standardmäßig nutzt Hy4 für komplexe Aufgaben einen hohen Reasoning-Level.[2]
Für direktere Antworten zeigt das Model Card:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
Das ist praktisch, weil überlanges Reasoning zu den offiziell genannten Preview-Problemen gehört.
Offizielle Preview-Limitierungen
Tencent nennt selbst zwei Probleme:[2][6]
- komplexe Aufgaben können länger als nötig durchdacht werden,
- das Modell neigt zu Over-Verification.
Bei Agenten kann das zusätzliche Tool Calls, mehr Latenz und höhere Tokenkosten verursachen.
Benchmarks: zuerst der Caveat
Tencent veröffentlichte einen Benchmark Appendix im Model Card.[2]
Am 31. August gibt es noch keine breite unabhängige Replikation der gesamten Tabelle unter identischen Bedingungen.
Deshalb kennzeichnen wir die Werte als:
Tencent-reported
und nicht als unabhängig bestätigt.
Ausgewählte Hy4-Benchmarks
Eine Transkription des Tencent-Benchmark-Appendix nennt:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High ohne Tools | 43,4% |
Alle Werte sind vendor-reported.
SWE-bench Multilingual: 82,9%
Tencent meldet:
Hy4 preview: 82.9%
Hy3: 75.8%
Das sind 7,1 Prozentpunkte mehr in der veröffentlichten Konfiguration.
Der Wert sollte nicht mit beliebigen anderen SWE-bench-Ergebnissen verglichen werden, ohne Benchmarkvariante und Harness zu prüfen.
SWE-bench Pro: 65,7%
Tencent meldet:
Hy4 preview: 65.7%
Hy3: 57.9%
Das sind 7,8 Prozentpunkte Differenz.
Es ist ein starkes Signal für mehr Software-Engineering-Fähigkeit gegenüber Hy3.
DeepSWE: größter Sprung zu Hy3
Die Transkription zeigt:
Hy3: 28.0%
Hy4 preview: 64.3%
Gerade bei einem derart großen Sprung ist unabhängige Replikation besonders wichtig, weil auch Scaffold, Tools und Evaluationssetup Einfluss haben.
Terminal-Bench 2.1: 85,4%
Tencent meldet:
Hy4 preview: 85.4%
Das ist sehr stark für Coding Agents.
Aber Tencent zeigt selbst Konkurrenzmodelle mit ähnlich hohen oder höheren Werten. Daraus folgt kein universeller „Sieg“ von Hy4.
GPQA Diamond: 92,3%
Der Tencent-reported Wert liegt bei:
92.3%
Das passt zur Positionierung für wissenschaftliches Reasoning.
Tencent nennt insbesondere AI Research, Molecular Dynamics, Condensed-Matter Physics und Mathematik.[1]
MCP-Atlas und Tool Agents
Tencent meldet:
MCP-Atlas: 83.7%
OpenRouter bestätigt für seine Hy4-Integration tools, tool_choice und Structured Outputs via JSON Schema.[7]
Hy4 vs Kimi K3 und GLM-5.3: interner Blindtest
Tencent führte einen eigenen Blindtest durch.[1][2]
Setup:
163 Tencent-Experten
203 Engineering-Aufgaben
Skala 0–4
Durchschnitt:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Gegen Kimi K3:
51.2% Wins
7.9% Ties
40.9% Losses
Gegen GLM-5.3:
46.8% Wins
12.8% Ties
40.4% Losses
Das ist eine knappe Führung in Tencents internem Workload, kein unabhängiger Universalbeweis.
Und Claude Opus 5 sowie GPT-5.6 Sol?
Tencent zeigt auch geschlossene Frontier-Modelle im Benchmark Appendix.[9]
Beispiel SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Doppelte Werte stehen für Varianten/Settings im Tencent-Chart und sollten nicht zu einem einzigen Ranking vermischt werden.
API-Preis
Tencent nennt:[1]
Input: $0.834 / 1M Tokens
Output: $2.501 / 1M Tokens
Cache Hit: $0.042 / 1M Tokens
OpenRouter zeigt dieselben Input-/Output- und Cache-Read-Preise.[7][13]
Tokenpreis ist aber nicht Taskpreis. Längeres Reasoning oder mehr Tool Calls können den End-to-End-Kostenunterschied verändern.
Self-Hosting vs API
API
Gut für schnellen Start, variable Last und wenn kein eigener GPU-Cluster betrieben werden soll.
Self-Hosting
Interessant für Data Residency, volle Inference-Kontrolle, stabile große Lasten und eigene Quantization-/Serving-Strategien.
Mit rund 1,56 TB Full Weights ist Hy4 kein typisches Single-Workstation-Modell.[3]
Hat Hy4 sich wirklich „selbst optimiert“?
Tencent sagt, Hy4 habe an automatisierter Optimierung von Training Methods, Data Strategies, Evaluation Frameworks und Low-Level Operators teilgenommen.[1]
Das Modell habe Ansätze vorgeschlagen, Experimente ausgeführt und anhand der Resultate iteriert.
Tencent beschreibt dies als:
early-stage recursive self-improvement loop
Die Aussage:
Hy4 hat sich selbst trainiert
geht über die Quelle hinaus.
Was bedeutet +31,8% Throughput?
Tencent sagt, Hy4 habe Bottlenecks im eigenen Inference-System analysiert und u.a. Operator Fusion sowie Communication Optimization iteriert.[1]
Gemeldet werden:
+31.8% End-to-End Throughput
vs interner Tencent-Baseline
Das bedeutet nicht 31,8% schneller als Kimi oder Claude.
Größte Stärken
- Apache 2.0.
- 1M Kontext.
- 49B aktive aus 770B Gesamtparametern.
- starke Tencent-reported Coding-/Agent-Werte.
- offizielle vLLM- und SGLang-Recipes.
- FP8-Version.
- wettbewerbsfähiger API-Preis.
Größte Risiken und offene Fragen
- Preview-Status.
- fehlende breite unabhängige Benchmark-Replikation.
- Over-Reasoning.
- Over-Verification.
- hohe Self-Hosting-Infrastruktur.
- 1M Kontext muss auf eigenen Daten geprüft werden.
- Provider-spezifische Data-Governance-Anforderungen bei API-Nutzung.
Wie sollte ein fairer Unternehmensbenchmark aussehen?
Vergleiche:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
auf identischen internen Tasks.
Messen:
- Task Completion,
- Test Pass Rate,
- Diff-Korrektheit,
- Tool Calls,
- Retries,
- Tokenverbrauch,
- Latenz,
- Kosten pro abgeschlossenem Task,
- Regressionen,
- Out-of-Scope-Änderungen,
- Long-Context-Qualität.
Die wichtigste Kennzahl ist oft:
cost per successful task
statt nur Preis pro Million Tokens.
Deployment-Checkliste
Modellqualität
- Eigene Tasks testen.
- Tencent-Benchmarks von unabhängigen Resultaten trennen.
- High Reasoning und
no_thinkvergleichen. - Over-Verification messen.
- Halluzinationen in eigener Domäne testen.
- Tool Calling validieren.
- Structured Outputs validieren.
- Lange Agent-Sessions testen.
Long Context
- 32K, 128K, 256K und größere Kontexte testen.
- Retrieval Accuracy messen.
- Time-to-first-token messen.
- KV-Cache-Footprint messen.
- 1M Kontext nicht mit 1M perfekter Memory gleichsetzen.
- Repo-Level-Coding testen.
- Cross-Document-Reasoning testen.
- Prompt Injection im Long Context testen.
Self-Hosting
- Volle GPU-Anforderungen prüfen.
- Mit offizieller FP8-Version starten.
- vLLM testen.
- SGLang testen.
- Throughput bei realer Concurrency messen.
- P50/P95/P99-Latenz messen.
- Storage für Gewichte planen.
- Apache-2.0-Pflichten juristisch prüfen.
API
- Aktuelle Providerpreise prüfen.
- Cache Semantics und TTL prüfen.
- Data Retention prüfen.
- Processing Region prüfen.
- Kostenlimits setzen.
- Usage pro Agent überwachen.
- Fallback-Modell definieren.
- Cost per Successful Task messen.
Lohnt sich der Wechsel von Hy3?
Für bestehende Hy3-Nutzer ist Hy4 ein logischer POC-Kandidat.
Auf dem Papier:
295B → 770B total
21B → 49B active
256K → 1M context
plus große Tencent-reported Verbesserungen in Coding- und Agent-Evals.[2][5][9]
Eine automatische Migration wäre dennoch falsch.
Hy4 kann länger reasonen, braucht mehr Self-Hosting-Ressourcen und bleibt ein Preview-Release.
POLPROG-Fazit
Hy4 preview ist einer der wichtigsten Open-Weight-Releases Ende August 2026.
Nicht die Zahl 770B allein ist entscheidend, sondern die Kombination:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
aggressiver API-Preis
starkes Coding-/Agent-Profil
Drei Evidenzebenen sollten getrennt bleiben.
Technische Fakten
Architektur, Lizenz, Gewichte, Kontext, Deployment und Preis sind gut dokumentiert.[1][2][3][7]
Benchmarks
Stark, aber am Launch-Tag weitgehend Tencent-reported.[2][9][10]
Self-Improvement
Teil des beschriebenen R&D-Prozesses, aber kein autonomes Selbsttraining.[1]
Der vernünftige Schluss am 31. August 2026:
Hy4 preview gehört auf die Shortlist für Coding Agents, Research Agents, Long-Context-Workflows und selbst gehostete AI-Infrastruktur.
Noch nicht gerechtfertigt ist:
Hy4 ist das beste Modell der Welt.
Gerechtfertigt ist:
Tencent hat Hy4 in die kleine Gruppe von Open-Weight-Modellen gebracht, die bei einem produktiven AI-Stack nicht ignoriert werden sollten.

