Tencent Hy4 preview: 770B Parameter, 49B aktiv und 1M Kontext. Benchmarks, Preis und Vergleich mit Kimi K3, GLM-5.3 und Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B Parameter, 49B aktiv und 1M Kontext. Benchmarks, Preis und Vergleich mit Kimi K3, GLM-5.3 und Claude Opus 5

Verifizierte Analyse von Tencent Hy4 preview: 770B/49B MoE, 1M Kontext, Gated DSA, IndexCache, MTP, Apache 2.0, Benchmarks, interner Blindtest, API-Preise, Self-Hosting, FP8, vLLM/SGLang und Preview-Limits.

Veröffentlicht Verfasst von Lesezeit 16 Min. Lesezeit

Verifizierte Analyse von Tencent Hy4 preview: 770B/49B MoE, 1M Kontext, Gated DSA, IndexCache, MTP, Apache 2.0, Benchmarks, interner Blindtest, API-Preise, Self-Hosting, FP8, vLLM/SGLang und Preview-Limits.

Auf dieser Seite
  1. 1TL;DR
  2. 2Was hat Tencent genau veröffentlicht?
  3. 3770B bedeutet nicht 770B aktive Parameter pro Token
  4. 4Aufbau der Expert-Layer
  5. 5Hy4 vs Hy3: massiver Skalensprung
  6. 61M-Tokens Kontext
  7. 7Gated DeepSeek Sparse Attention
  8. 8Was ist IndexCache?
  9. 9Native MTP-Layer
  10. 10Die Gewichte sind wirklich öffentlich
  11. 11Apache 2.0 ist entscheidend
  12. 12Offizielles Self-Hosting: vLLM und SGLang
  13. 13OpenAI-kompatible API
  14. 14Reasoning lässt sich begrenzen
  15. 15Offizielle Preview-Limitierungen
  16. 16Benchmarks: zuerst der Caveat
  17. 17Ausgewählte Hy4-Benchmarks
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: größter Sprung zu Hy3
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas und Tool Agents
  24. 24Hy4 vs Kimi K3 und GLM-5.3: interner Blindtest
  25. 25Und Claude Opus 5 sowie GPT-5.6 Sol?
  26. 26API-Preis
  27. 27Self-Hosting vs API
  28. 28Hat Hy4 sich wirklich „selbst optimiert“?
  29. 29Was bedeutet +31,8% Throughput?
  30. 30Größte Stärken
  31. 31Größte Risiken und offene Fragen
  32. 32Wie sollte ein fairer Unternehmensbenchmark aussehen?
  33. 33Deployment-Checkliste
  34. 34Lohnt sich der Wechsel von Hy3?
  35. 35POLPROG-Fazit

Am 28. August 2026 veröffentlichte Tencent Hy4 preview, das neue Mixture-of-Experts-Flaggschiff der Tencent-Hy-Familie, die zuvor international stärker unter dem Namen Hunyuan bekannt war.[1][6]

Die Eckdaten:

770B Parameter insgesamt
49B aktive Parameter pro Token
78 Layer
256 Routed Experts + 1 Shared Expert
Top-8 Routed Experts pro Token
1M Kontext
Apache License 2.0

[2]

Tencent veröffentlichte sowohl die vollständigen Gewichte als auch Hy4 preview-FP8. Das vollständige Hugging-Face-Repository ist rund 1,56 TB groß.[2][3]

Hy4 soll nicht nur Chatbot-Aufgaben lösen, sondern Software Engineering, Office-Workflows, Finanzanalyse, Games, wissenschaftliche Forschung und Tool-using Agents.[1][2]

Drei Punkte sind besonders wichtig.

Erstens: Die Gewichte stehen unter Apache 2.0 und können damit im Rahmen dieser Lizenz selbst gehostet und kommerziell eingesetzt werden.[2][4]

Zweitens: Tencent meldet starke Coding- und Agent-Benchmarks, etwa 82,9% auf SWE-bench Multilingual, 85,4% auf Terminal-Bench 2.1 und 83,7% auf MCP-Atlas.[2][9]

Drittens: Tencent sagt, Hy4 habe bei der Optimierung seines eigenen Entwicklungs- und Inference-Stacks mitgearbeitet. Ein separater Optimierungszyklus soll den End-to-End-Throughput gegenüber einem internen Tencent-Baseline-System um 31,8% erhöht haben.[1]

Das ist kein Beleg dafür, dass sich das Modell vollständig autonom selbst trainiert. Tencent beschreibt einen frühen, engineering-orientierten Recursive-Self-Improvement-Loop.

Informationsstand: 31. August 2026.

TL;DR

FrageVerifizierte Antwort
ModellTencent Hy4 preview
Release28. August 2026
TypMixture-of-Experts
Gesamtparameter770B
Aktive Parameter49B pro Token
Layer78
Routed Experts256
Shared Experts1
Aktivierte Routed ExpertsTop-8
Kontext1M im Model Card, 1.048.576 bei OpenRouter
Max Output bei OpenRouter64K
AttentionGated DeepSeek Sparse Attention
Sparse-Attention-OptimierungIndexCache
MTP1 native Layer, 10B total / 0,7B aktiv
LizenzApache 2.0
Volle Gewichteca. 1,56 TB auf Hugging Face
Quantisierte VarianteHy4 preview-FP8
Self-HostingvLLM und SGLang
Offizielles RecipeTensor Parallel Size 8
API Input$0.834 / 1M Tokens
API Output$2.501 / 1M Tokens
Cache Hit$0.042 / 1M Tokens
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
StatusPreview
Bekannte Schwächenzu langes Reasoning und Over-Verification
Wichtigster Caveatnoch keine breite unabhängige Replikation der Launch-Benchmarks

Was hat Tencent genau veröffentlicht?

Tencent stellte:

Hy4 preview
Hy4 preview-FP8

auf Hugging Face, ModelScope, GitCode und CNB bereit.[2]

Zusätzlich ist das Modell über WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter erreichbar.[1][7]

Reuters bestätigte den Launch am 28. August und nannte Software Engineering, Forschung und Finanzanalyse als zentrale Einsatzfelder.[6]

770B bedeutet nicht 770B aktive Parameter pro Token

Hy4 nutzt eine Mixture-of-Experts-Architektur.

Der Backbone besitzt:

770B total parameters

aber pro Token werden ungefähr:

49B parameters

aktiviert.[2]

Das sind rund 6,4% des Backbones.

MoE reduziert die tatsächlich ausgeführte Parametermenge pro Token, macht das Modell aber nicht klein. Die vollständigen Gewichte müssen weiterhin gespeichert und auf Inference-Hardware verteilt werden.

Aufbau der Expert-Layer

Der Backbone hat 78 Layer.[2]

Der erste nutzt einen klassischen Dense FFN.

Die übrigen 77 bestehen aus:

256 Routed Experts
1 Shared Expert

Pro Token werden aktiviert:

Top-8 Routed Experts
+
Shared Expert

[2]

Hy4 vs Hy3: massiver Skalensprung

Hy3 hatte:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Das entspricht ungefähr:

  • 2,61× mehr Gesamtparametern,
  • 2,33× mehr aktiven Parametern,
  • mindestens 3,9× längerem Kontext.

Tencent sagt, gleichzeitig Modellgröße, Kontext, Trainingsdaten und Post-Training ausgebaut zu haben.[2]

1M-Tokens Kontext

Im Model Card steht:

Context Length: 1M

[2]

OpenRouter meldet:

1,048,576 Tokens Kontext
64,000 maximale Completion-Tokens

[7]

Das ist interessant für große Codebasen, lange Agent-Sessions, Multi-Document-Analyse, Research und Repo-Level-Refactoring.

Ein großer nomineller Kontext garantiert jedoch nicht automatisch perfekte Retrieval-Qualität über die gesamte Länge.

Gated DeepSeek Sparse Attention

Hy4 verwendet Gated DeepSeek Sparse Attention.[2]

Sparse Attention reduziert bei langen Sequenzen den Aufwand, indem relevante Tokenpositionen selektiert werden, statt überall Full Attention zu berechnen.

Tencent kombiniert dies mit:

IndexCache

Was ist IndexCache?

IndexCache wiederverwendet Sparse-Attention-Indizes zwischen Layern.[8]

Da sich Top-k-Auswahlen benachbarter Layer oft ähneln, können bestimmte Layer bereits berechnete Indizes wiederverwenden.

Die IndexCache-Arbeit berichtet auf den getesteten DSA-Modellen reduzierte Indexer-Arbeit und Speedups für Prefill und Decode bei geringer Qualitätsabweichung.[8]

Diese Zahlen sind Forschungsergebnisse zu IndexCache, keine direkten Hy4-Benchmarkwerte.

Native MTP-Layer

Neben dem Backbone besitzt Hy4 eine native Multi-Token-Prediction-Layer.[2]

Tencent gibt an:

10B total parameters
0.7B active parameters

Die Layer wird für speculative decoding eingesetzt.

Die offiziellen vLLM- und SGLang-Recipes aktivieren diesen Pfad.[2]

Die Gewichte sind wirklich öffentlich

Hugging Face zeigt:

tencent/Hy4-preview
1.56 TB
131 Safetensors-Shards
Apache-2.0

[3]

Zusätzlich gibt es:

tencent/Hy4-preview-FP8

[11]

Damit sind Self-Hosting, Fine-Tuning, Weight-Analyse und eigene Inference-Stacks möglich.

Apache 2.0 ist entscheidend

Model Card und Repository weisen:

Apache License 2.0

aus.[2][4]

Die Lizenz erlaubt Nutzung, Veränderung und Verteilung, auch kommerziell, unter ihren Bedingungen.

Für Unternehmen ist das meist einfacher als proprietäre Community-Lizenzen mancher Open-Weight-Modelle.

Offizielles Self-Hosting: vLLM und SGLang

Tencent empfiehlt:

vLLM
SGLang

für Production Serving.[2]

Das vLLM-Recipe verwendet:

vllm/vllm-openai:hy4-preview

und für FP8:

--tensor-parallel-size 8

[2]

SGLang arbeitet analog mit --tp-size 8.

Das heißt nicht, dass beliebige acht GPUs ausreichen. Speicherbedarf hängt von Hardware, Precision, KV Cache, Kontext und Concurrency ab.

OpenAI-kompatible API

Nach dem Start über vLLM oder SGLang kann Hy4 über einen OpenAI-kompatiblen Endpoint angesprochen werden.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this repository architecture."}
    ],
    temperature=0.9,
    top_p=1.0,
)

Tencent empfiehlt temperature=0.9 und top_p=1.0.[2]

Reasoning lässt sich begrenzen

Standardmäßig nutzt Hy4 für komplexe Aufgaben einen hohen Reasoning-Level.[2]

Für direktere Antworten zeigt das Model Card:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

Das ist praktisch, weil überlanges Reasoning zu den offiziell genannten Preview-Problemen gehört.

Offizielle Preview-Limitierungen

Tencent nennt selbst zwei Probleme:[2][6]

  1. komplexe Aufgaben können länger als nötig durchdacht werden,
  2. das Modell neigt zu Over-Verification.

Bei Agenten kann das zusätzliche Tool Calls, mehr Latenz und höhere Tokenkosten verursachen.

Benchmarks: zuerst der Caveat

Tencent veröffentlichte einen Benchmark Appendix im Model Card.[2]

Am 31. August gibt es noch keine breite unabhängige Replikation der gesamten Tabelle unter identischen Bedingungen.

Deshalb kennzeichnen wir die Werte als:

Tencent-reported

und nicht als unabhängig bestätigt.

Ausgewählte Hy4-Benchmarks

Eine Transkription des Tencent-Benchmark-Appendix nennt:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High ohne Tools43,4%

Alle Werte sind vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent meldet:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Das sind 7,1 Prozentpunkte mehr in der veröffentlichten Konfiguration.

Der Wert sollte nicht mit beliebigen anderen SWE-bench-Ergebnissen verglichen werden, ohne Benchmarkvariante und Harness zu prüfen.

SWE-bench Pro: 65,7%

Tencent meldet:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Das sind 7,8 Prozentpunkte Differenz.

Es ist ein starkes Signal für mehr Software-Engineering-Fähigkeit gegenüber Hy3.

DeepSWE: größter Sprung zu Hy3

Die Transkription zeigt:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Gerade bei einem derart großen Sprung ist unabhängige Replikation besonders wichtig, weil auch Scaffold, Tools und Evaluationssetup Einfluss haben.

Terminal-Bench 2.1: 85,4%

Tencent meldet:

Hy4 preview: 85.4%

[9][10]

Das ist sehr stark für Coding Agents.

Aber Tencent zeigt selbst Konkurrenzmodelle mit ähnlich hohen oder höheren Werten. Daraus folgt kein universeller „Sieg“ von Hy4.

GPQA Diamond: 92,3%

Der Tencent-reported Wert liegt bei:

92.3%

[9][10]

Das passt zur Positionierung für wissenschaftliches Reasoning.

Tencent nennt insbesondere AI Research, Molecular Dynamics, Condensed-Matter Physics und Mathematik.[1]

MCP-Atlas und Tool Agents

Tencent meldet:

MCP-Atlas: 83.7%

[9][10]

OpenRouter bestätigt für seine Hy4-Integration tools, tool_choice und Structured Outputs via JSON Schema.[7]

Hy4 vs Kimi K3 und GLM-5.3: interner Blindtest

Tencent führte einen eigenen Blindtest durch.[1][2]

Setup:

163 Tencent-Experten
203 Engineering-Aufgaben
Skala 0–4

Durchschnitt:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Gegen Kimi K3:

51.2% Wins
7.9% Ties
40.9% Losses

Gegen GLM-5.3:

46.8% Wins
12.8% Ties
40.4% Losses

[2]

Das ist eine knappe Führung in Tencents internem Workload, kein unabhängiger Universalbeweis.

Und Claude Opus 5 sowie GPT-5.6 Sol?

Tencent zeigt auch geschlossene Frontier-Modelle im Benchmark Appendix.[9]

Beispiel SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Doppelte Werte stehen für Varianten/Settings im Tencent-Chart und sollten nicht zu einem einzigen Ranking vermischt werden.

API-Preis

Tencent nennt:[1]

Input:      $0.834 / 1M Tokens
Output:     $2.501 / 1M Tokens
Cache Hit:  $0.042 / 1M Tokens

OpenRouter zeigt dieselben Input-/Output- und Cache-Read-Preise.[7][13]

Tokenpreis ist aber nicht Taskpreis. Längeres Reasoning oder mehr Tool Calls können den End-to-End-Kostenunterschied verändern.

Self-Hosting vs API

API

Gut für schnellen Start, variable Last und wenn kein eigener GPU-Cluster betrieben werden soll.

Self-Hosting

Interessant für Data Residency, volle Inference-Kontrolle, stabile große Lasten und eigene Quantization-/Serving-Strategien.

Mit rund 1,56 TB Full Weights ist Hy4 kein typisches Single-Workstation-Modell.[3]

Hat Hy4 sich wirklich „selbst optimiert“?

Tencent sagt, Hy4 habe an automatisierter Optimierung von Training Methods, Data Strategies, Evaluation Frameworks und Low-Level Operators teilgenommen.[1]

Das Modell habe Ansätze vorgeschlagen, Experimente ausgeführt und anhand der Resultate iteriert.

Tencent beschreibt dies als:

early-stage recursive self-improvement loop

Die Aussage:

Hy4 hat sich selbst trainiert

geht über die Quelle hinaus.

Was bedeutet +31,8% Throughput?

Tencent sagt, Hy4 habe Bottlenecks im eigenen Inference-System analysiert und u.a. Operator Fusion sowie Communication Optimization iteriert.[1]

Gemeldet werden:

+31.8% End-to-End Throughput
vs interner Tencent-Baseline

Das bedeutet nicht 31,8% schneller als Kimi oder Claude.

Größte Stärken

  • Apache 2.0.
  • 1M Kontext.
  • 49B aktive aus 770B Gesamtparametern.
  • starke Tencent-reported Coding-/Agent-Werte.
  • offizielle vLLM- und SGLang-Recipes.
  • FP8-Version.
  • wettbewerbsfähiger API-Preis.

Größte Risiken und offene Fragen

  • Preview-Status.
  • fehlende breite unabhängige Benchmark-Replikation.
  • Over-Reasoning.
  • Over-Verification.
  • hohe Self-Hosting-Infrastruktur.
  • 1M Kontext muss auf eigenen Daten geprüft werden.
  • Provider-spezifische Data-Governance-Anforderungen bei API-Nutzung.

Wie sollte ein fairer Unternehmensbenchmark aussehen?

Vergleiche:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

auf identischen internen Tasks.

Messen:

  • Task Completion,
  • Test Pass Rate,
  • Diff-Korrektheit,
  • Tool Calls,
  • Retries,
  • Tokenverbrauch,
  • Latenz,
  • Kosten pro abgeschlossenem Task,
  • Regressionen,
  • Out-of-Scope-Änderungen,
  • Long-Context-Qualität.

Die wichtigste Kennzahl ist oft:

cost per successful task

statt nur Preis pro Million Tokens.

Deployment-Checkliste

Modellqualität

  • Eigene Tasks testen.
  • Tencent-Benchmarks von unabhängigen Resultaten trennen.
  • High Reasoning und no_think vergleichen.
  • Over-Verification messen.
  • Halluzinationen in eigener Domäne testen.
  • Tool Calling validieren.
  • Structured Outputs validieren.
  • Lange Agent-Sessions testen.

Long Context

  • 32K, 128K, 256K und größere Kontexte testen.
  • Retrieval Accuracy messen.
  • Time-to-first-token messen.
  • KV-Cache-Footprint messen.
  • 1M Kontext nicht mit 1M perfekter Memory gleichsetzen.
  • Repo-Level-Coding testen.
  • Cross-Document-Reasoning testen.
  • Prompt Injection im Long Context testen.

Self-Hosting

  • Volle GPU-Anforderungen prüfen.
  • Mit offizieller FP8-Version starten.
  • vLLM testen.
  • SGLang testen.
  • Throughput bei realer Concurrency messen.
  • P50/P95/P99-Latenz messen.
  • Storage für Gewichte planen.
  • Apache-2.0-Pflichten juristisch prüfen.

API

  • Aktuelle Providerpreise prüfen.
  • Cache Semantics und TTL prüfen.
  • Data Retention prüfen.
  • Processing Region prüfen.
  • Kostenlimits setzen.
  • Usage pro Agent überwachen.
  • Fallback-Modell definieren.
  • Cost per Successful Task messen.

Lohnt sich der Wechsel von Hy3?

Für bestehende Hy3-Nutzer ist Hy4 ein logischer POC-Kandidat.

Auf dem Papier:

295B → 770B total
21B → 49B active
256K → 1M context

plus große Tencent-reported Verbesserungen in Coding- und Agent-Evals.[2][5][9]

Eine automatische Migration wäre dennoch falsch.

Hy4 kann länger reasonen, braucht mehr Self-Hosting-Ressourcen und bleibt ein Preview-Release.

POLPROG-Fazit

Hy4 preview ist einer der wichtigsten Open-Weight-Releases Ende August 2026.

Nicht die Zahl 770B allein ist entscheidend, sondern die Kombination:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
aggressiver API-Preis
starkes Coding-/Agent-Profil

Drei Evidenzebenen sollten getrennt bleiben.

Technische Fakten

Architektur, Lizenz, Gewichte, Kontext, Deployment und Preis sind gut dokumentiert.[1][2][3][7]

Benchmarks

Stark, aber am Launch-Tag weitgehend Tencent-reported.[2][9][10]

Self-Improvement

Teil des beschriebenen R&D-Prozesses, aber kein autonomes Selbsttraining.[1]

Der vernünftige Schluss am 31. August 2026:

Hy4 preview gehört auf die Shortlist für Coding Agents, Research Agents, Long-Context-Workflows und selbst gehostete AI-Infrastruktur.

Noch nicht gerechtfertigt ist:

Hy4 ist das beste Modell der Welt.

Gerechtfertigt ist:

Tencent hat Hy4 in die kleine Gruppe von Open-Weight-Modellen gebracht, die bei einem produktiven AI-Stack nicht ignoriert werden sollten.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Häufig gestellte Fragen

Release-Datum?
  1. August 2026.
Open Source?

Tencent bezeichnet Hy4 als Open Source; Gewichte und Code stehen unter Apache 2.0.

Parameter?

770B total, 49B aktiv pro Token im Backbone.

Ist MTP in den 770B enthalten?

Nein laut Model Card: MTP kommt mit 10B total / 0,7B aktiv zusätzlich.

Kontext?

1M im Model Card, 1.048.576 bei OpenRouter.

Max Output?

64K bei OpenRouter.

Self-Hosting?

Ja.

Offizielle Frameworks?

vLLM und SGLang.

FP8?

Ja.

Full-Weight-Größe?

Ca. 1,56 TB auf Hugging Face.

Lizenz?

Apache 2.0.

API-Preis?

$0.834/1M Input, $2.501/1M Output, $0.042/1M Cache Hits.

Hat Hy4 Kimi K3 geschlagen?

Im internen Tencent-Blindtest 2.99/4 vs 2.94/4. Kein unabhängiger Universalbeweis.

GLM-5.3?

Im selben internen Test 2.99 vs 2.92.

Claude Opus 5?

Kein belastbarer Grund für eine pauschale Überlegenheitsaussage.

Unabhängig bestätigte Benchmarks?

Noch nicht breit für die komplette Tencent-Tabelle.

Bekannte Schwächen?

Zu langes Reasoning und Over-Verification.

Hat Hy4 sich selbst verbessert?

Tencent beschreibt modellgestützte automatische Experimente und Pipeline-Optimierung, kein voll autonomes Selbsttraining.

+31,8% Throughput?

Verbesserung gegenüber Tencents internem Inference-Baseline, nicht gegenüber Konkurrenzmodellen.

Quellen und Fußnoten

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28. August 2026, abgerufen am 31. August 2026.123456789101112
  2. Tencent, Hy4 preview — offizielles Hugging Face Model Card, abgerufen am 31. August 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, abgerufen am 31. August 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — offizielles GitHub-Repository, abgerufen am 31. August 2026.12
  5. Tencent, Hy3 Now Available Globally, 5. August 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28. August 2026.123
  7. OpenRouter, Tencent: Hy4 preview, Stand geprüft am 31. August 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, März 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28. August 2026. Benchmarkwerte als Transkription der Tencent-Tabelle, nicht als unabhängige Replikation.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, abgerufen am 31. August 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, abgerufen am 31. August 2026.
  12. Tencent, Hy3 preview launch, 24. April 2026.
  13. OpenRouter, Tencent models, abgerufen am 31. August 2026.

War das hilfreich?

Neue Artikel per E-Mail erhalten

Eine kurze E-Mail pro neuem Wissens-Artikel. Kein Spam, Abmeldung mit einem Klick.

Wir nutzen Ihre E-Mail nur, um neue Artikel zu versenden. Keine Weitergabe an Dritte.

Zurück zu Wissen