Le 28 août 2026, Tencent a publié et open-sourcé Hy4 preview, son nouveau modèle phare Mixture-of-Experts de la famille Tencent Hy, anciennement surtout connue sous le nom Hunyuan.[1][6]
Spécifications principales :
770B paramètres au total
49B paramètres actifs par token
78 couches
256 routed experts + 1 shared expert
top-8 routed experts actifs par token
contexte 1M
Apache License 2.0
Tencent propose les poids complets et Hy4 preview-FP8. Le dépôt Hugging Face complet représente environ 1,56 To.[2][3]
Le modèle cible le software engineering, les workflows bureautiques, l’analyse financière, le développement de jeux, la recherche scientifique et les agents utilisant des outils.[1][2]
Trois points sont essentiels.
Premièrement, les poids sont sous Apache 2.0, permettant self-hosting et usage commercial sous les conditions de cette licence.[2][4]
Deuxièmement, Tencent publie des résultats vendor-reported élevés : 82,9% sur SWE-bench Multilingual, 85,4% sur Terminal-Bench 2.1 et 83,7% sur MCP-Atlas.[2][9]
Troisièmement, Tencent affirme que Hy4 preview a participé à l’optimisation de son propre processus de développement et de son infrastructure d’inférence. Un cycle d’optimisation aurait amélioré le throughput end-to-end de 31,8% par rapport au baseline interne Tencent.[1]
Il ne faut pas traduire cela par « le modèle s’est entraîné tout seul ». Tencent décrit une boucle d’automatisation R&D précoce, avec intervention humaine.
État des informations : 31 août 2026.
TL;DR
| Question | Réponse vérifiée |
|---|---|
| Modèle | Tencent Hy4 preview |
| Sortie | 28 août 2026 |
| Type | Mixture-of-Experts |
| Paramètres totaux | 770B |
| Paramètres actifs | 49B par token |
| Couches | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Routed experts activés | top-8 |
| Contexte | 1M dans la model card, 1 048 576 sur OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Optimisation | IndexCache |
| MTP | 1 couche native, 10B total / 0,7B actif |
| Licence | Apache 2.0 |
| Poids complets | env. 1,56 To sur Hugging Face |
| Variante quantifiée | Hy4 preview-FP8 |
| Self-hosting | vLLM et SGLang |
| Recipe officiel | tensor parallel size 8 |
| API input | $0.834 / 1M tokens |
| API output | $2.501 / 1M tokens |
| Cache hit | $0.042 / 1M tokens |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Statut | Preview |
| Limites | reasoning trop long et over-verification |
| Caveat | pas encore de réplication indépendante large de la table de lancement |
Qu’a publié Tencent ?
Tencent a mis à disposition :
Hy4 preview
Hy4 preview-FP8
sur Hugging Face, ModelScope, GitCode et CNB.[2]
Le modèle est aussi accessible via WorkBuddy, CodeBuddy, Tencent Cloud TokenHub et OpenRouter.[1][7]
Reuters a confirmé le lancement du 28 août et les cas d’usage logiciels, scientifiques et financiers.[6]
770B ne signifie pas 770B actifs à chaque token
Hy4 repose sur Mixture-of-Experts.
Le backbone contient :
770B total
mais environ :
49B
sont activés par token.[2]
Cela représente environ 6,4% du backbone.
MoE réduit donc le calcul actif par token, sans supprimer le besoin de stocker les poids complets.
Structure des experts
Le backbone comporte 78 couches.[2]
La première utilise un FFN dense.
Les 77 autres utilisent :
256 routed experts
1 shared expert
Chaque token active :
top-8 routed experts
+
shared expert
Hy4 vs Hy3 : changement d’échelle
Hy3 :
295B total
21B active
256K context
Hy4 preview :
770B total
49B active
1M context
Soit environ :
- 2,61× plus de paramètres totaux,
- 2,33× plus de paramètres actifs,
- au moins 3,9× plus de contexte annoncé.
Tencent dit avoir augmenté simultanément taille du modèle, longueur de contexte, volume des données et post-training.[2]
Contexte 1M
La model card indique :
Context Length: 1M
OpenRouter expose :
1,048,576 tokens
64,000 max completion tokens
Ce contexte est pertinent pour les grands codebases, les longues sessions agentiques, l’analyse multi-document et la recherche.
Mais longueur nominale et qualité effective du contexte ne sont pas la même chose.
Gated DeepSeek Sparse Attention
Hy4 utilise Gated DeepSeek Sparse Attention.[2]
L’objectif est de réduire le coût de l’attention sur les très longues séquences en sélectionnant les positions pertinentes.
Tencent y associe :
IndexCache
IndexCache
IndexCache réutilise des sparse indices entre plusieurs couches.[8]
Le papier associé montre sur ses modèles DSA testés une réduction du travail de l’indexer et des gains de vitesse en prefill/decode avec faible dégradation.[8]
Ces résultats concernent IndexCache, pas directement un benchmark complet de Hy4.
Couche MTP native
Hy4 ajoute une couche Multi-Token Prediction.[2]
Tencent indique :
10B paramètres totaux
0.7B actifs
Elle sert au speculative decoding.
Les recipes officiels vLLM et SGLang l’activent.[2]
Les poids sont réellement publics
Hugging Face affiche :
tencent/Hy4-preview
1.56 TB
131 shards safetensors
Apache-2.0
Une version :
tencent/Hy4-preview-FP8
est également disponible.[11]
Cela permet self-hosting, fine-tuning, analyse des poids et stack d’inférence personnalisée.
Apache 2.0
La model card et le repo officiel indiquent :
Apache License 2.0
C’est une licence permissive autorisant usage, modification et redistribution, y compris commerciale, sous ses conditions.
Self-hosting officiel : vLLM et SGLang
Tencent recommande :
vLLM
SGLang
Le recipe vLLM utilise l’image :
vllm/vllm-openai:hy4-preview
avec :
--tensor-parallel-size 8
SGLang utilise --tp-size 8.
Cela ne garantit pas que huit GPU quelconques suffisent : mémoire, precision, KV cache, contexte et concurrency comptent.
API compatible OpenAI
Une fois le serveur démarré, Hy4 peut être appelé via une API compatible OpenAI.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this repository architecture."}
],
temperature=0.9,
top_p=1.0,
)
Tencent recommande temperature=0.9 et top_p=1.0.[2]
Le reasoning peut être réduit
Par défaut, Hy4 utilise un reasoning élevé pour les tâches complexes.[2]
Pour des réponses directes :
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
C’est utile puisque le reasoning trop long fait partie des limites reconnues.
Limites officielles
- tendance à réfléchir plus longtemps que nécessaire,
- over-verification du travail produit.
Dans un agent, cela peut augmenter tool calls, latence et coût.
Benchmarks : caveat essentiel
Tencent publie un benchmark appendix dans la model card.[2]
Au 31 août, il n’existe pas encore de réplication indépendante large de toute cette table avec configuration identique.
Nous marquons donc les chiffres comme :
Tencent-reported
Résultats sélectionnés
Transcription de la table Tencent :[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High sans tools | 43,4% |
Tous ces chiffres sont vendor-reported.
SWE-bench Multilingual : 82,9%
Tencent indique :
Hy4 preview: 82.9%
Hy3: 75.8%
Soit +7,1 points dans cette configuration.
Il faut vérifier la variante exacte de SWE-bench avant toute comparaison externe.
SWE-bench Pro : 65,7%
Tencent indique :
Hy4 preview: 65.7%
Hy3: 57.9%
Soit +7,8 points.
C’est un signal fort d’amélioration en software engineering.
DeepSWE : plus grand saut générationnel
La transcription donne :
Hy3: 28.0%
Hy4 preview: 64.3%
Un écart aussi grand mérite particulièrement une réplication indépendante.
Terminal-Bench 2.1 : 85,4%
Tencent publie :
Hy4 preview: 85.4%
Très bon score pour un modèle agentique, mais plusieurs concurrents apparaissent également très haut dans la table Tencent. Il n’est donc pas correct de déclarer Hy4 vainqueur universel.
GPQA Diamond : 92,3%
Tencent rapporte :
92.3%
Cela soutient le positionnement scientifique du modèle.[1]
Mais un benchmark ne garantit pas la fiabilité dans une vraie recherche.
MCP-Atlas et tool use
Tencent rapporte :
MCP-Atlas: 83.7%
OpenRouter confirme la prise en charge de tools, tool_choice et structured outputs via JSON Schema.[7]
Hy4 vs Kimi K3 et GLM-5.3 : blind test Tencent
Tencent a conduit une évaluation interne :[1][2]
163 experts Tencent
203 tâches d’ingénierie
échelle 0–4
Scores moyens :
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Contre Kimi K3 :
51.2% wins
7.9% ties
40.9% losses
Contre GLM-5.3 :
46.8% wins
12.8% ties
40.4% losses
C’est une petite avance dans un workload interne Tencent, pas une preuve universelle.
Et Claude Opus 5 / GPT-5.6 Sol ?
Tencent inclut aussi ces modèles fermés dans sa table.[9]
SWE-bench Multilingual :
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1 :
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Les doubles valeurs correspondent à plusieurs réglages/variantes du graphique. Il ne faut pas les fusionner dans un ranking simpliste.
Prix API
Tencent annonce :[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter affiche les mêmes prix.[7][13]
Le prix par token n’est pas le coût par tâche terminée : un modèle qui raisonne plus longtemps peut coûter davantage au final.
Self-hosting vs API
API
Pratique pour démarrer vite, absorber une charge variable et éviter un gros cluster GPU.
Self-hosting
Intéressant pour data residency, contrôle de l’inférence, grande charge stable et personnalisation du serving.
Avec environ 1,56 To de poids, ce n’est pas un modèle typique de workstation unique.[3]
Hy4 s’est-il vraiment « auto-optimisé » ?
Tencent dit que Hy4 a participé à l’optimisation automatisée de méthodes d’entraînement, stratégies de données, frameworks d’évaluation et opérateurs bas niveau.[1]
Le modèle aurait proposé des approches, lancé des expériences et itéré sur les résultats.
Tencent parle d’un :
early-stage recursive self-improvement loop
Cela ne signifie pas que Hy4 s’est entièrement entraîné seul.
Que signifie +31,8% de throughput ?
Tencent indique que Hy4 a analysé des bottlenecks et travaillé sur operator fusion et communication optimization.[1]
Résultat annoncé :
+31.8% end-to-end throughput
vs baseline interne Tencent
Ce n’est pas une avance de 31,8% sur Kimi, Claude ou GPT.
Forces principales
- Apache 2.0.
- Contexte 1M.
- 49B actifs sur 770B total.
- Benchmarks coding/agent élevés selon Tencent.
- Recipes vLLM et SGLang.
- Version FP8.
- Prix API agressif.
Risques et inconnues
- Statut preview.
- Benchmarks surtout vendor-reported.
- Over-reasoning.
- Over-verification.
- Infrastructure self-hosting lourde.
- Qualité réelle du 1M context à mesurer.
- Data governance dépendante du provider pour l’API.
Comment benchmarker en entreprise ?
Comparer sur les mêmes tâches :
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Mesurer :
- task completion,
- test pass rate,
- qualité du diff,
- tool calls,
- retries,
- tokens,
- latence,
- coût par tâche terminée,
- régressions,
- changements hors scope,
- qualité long-context.
La métrique clé est souvent :
cost per successful task
Checklist de déploiement
Qualité
- Tester sur tâches internes.
- Séparer chiffres Tencent et résultats indépendants.
- Comparer high reasoning et
no_think. - Mesurer over-verification.
- Tester hallucinations.
- Valider tool calling.
- Valider structured outputs.
- Tester longues sessions agentiques.
Long context
- Tester 32K, 128K, 256K et plus.
- Mesurer retrieval accuracy.
- Mesurer time-to-first-token.
- Mesurer KV-cache footprint.
- Ne pas confondre 1M annoncé avec 1M de mémoire parfaite.
- Tester repo-level coding.
- Tester cross-document reasoning.
- Tester prompt injection en long contexte.
Self-hosting
- Vérifier besoins GPU réels.
- Commencer par FP8 officiel.
- Tester vLLM.
- Tester SGLang.
- Mesurer throughput à concurrence réelle.
- Mesurer P50/P95/P99.
- Prévoir storage pour les poids.
- Faire valider Apache 2.0 juridiquement.
API
- Vérifier prix actuels.
- Vérifier cache semantics et TTL.
- Vérifier data retention.
- Vérifier région de traitement.
- Définir limites de coût.
- Monitorer usage par agent.
- Prévoir modèle fallback.
- Mesurer cost per successful task.
Faut-il migrer depuis Hy3 ?
Hy4 est un candidat évident au POC pour les utilisateurs de Hy3.
Sur le papier :
295B → 770B total
21B → 49B active
256K → 1M context
avec de fortes hausses vendor-reported en coding/agents.[2][5][9]
Mais Hy4 peut raisonner plus longtemps, demander plus d’infrastructure et reste en preview.
Verdict POLPROG
Hy4 preview est l’une des sorties open-weight majeures de fin août 2026.
La combinaison importante est :
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
prix API agressif
profil coding/agent solide
Trois niveaux de preuve doivent rester séparés.
Faits techniques
Architecture, licence, poids, contexte, deployment et prix sont bien documentés.[1][2][3][7]
Benchmarks
Impressionnants, mais surtout Tencent-reported au lancement.[2][9][10]
Self-improvement
Réel dans le workflow R&D décrit, sans être un entraînement totalement autonome.[1]
Conclusion raisonnable au 31 août 2026 :
Hy4 preview mérite un POC pour les équipes qui construisent coding agents, research agents, workflows long-context et infrastructure AI self-hosted.
Pas assez de preuves pour dire :
Hy4 est le meilleur modèle du monde.
Assez de preuves pour dire :
Tencent a placé Hy4 dans le petit groupe des modèles open-weight qu’une architecture AI de production ne peut plus ignorer.

