Tencent Hy4 preview : 770B paramètres, 49B actifs et contexte 1M. Benchmarks, prix et comparaison avec Kimi K3, GLM-5.3 et Claude Opus 5 Skip to content

Tencent Hy4 preview : 770B paramètres, 49B actifs et contexte 1M. Benchmarks, prix et comparaison avec Kimi K3, GLM-5.3 et Claude Opus 5

Analyse vérifiée de Tencent Hy4 preview : architecture MoE 770B/49B, contexte 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, blind test interne, prix API, self-hosting, FP8, vLLM/SGLang et limites de la preview.

Publié Rédigé par Temps de lecture 16 min de lecture

Analyse vérifiée de Tencent Hy4 preview : architecture MoE 770B/49B, contexte 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, blind test interne, prix API, self-hosting, FP8, vLLM/SGLang et limites de la preview.

Sur cette page
  1. 1TL;DR
  2. 2Qu’a publié Tencent ?
  3. 3770B ne signifie pas 770B actifs à chaque token
  4. 4Structure des experts
  5. 5Hy4 vs Hy3 : changement d’échelle
  6. 6Contexte 1M
  7. 7Gated DeepSeek Sparse Attention
  8. 8IndexCache
  9. 9Couche MTP native
  10. 10Les poids sont réellement publics
  11. 11Apache 2.0
  12. 12Self-hosting officiel : vLLM et SGLang
  13. 13API compatible OpenAI
  14. 14Le reasoning peut être réduit
  15. 15Limites officielles
  16. 16Benchmarks : caveat essentiel
  17. 17Résultats sélectionnés
  18. 18SWE-bench Multilingual : 82,9%
  19. 19SWE-bench Pro : 65,7%
  20. 20DeepSWE : plus grand saut générationnel
  21. 21Terminal-Bench 2.1 : 85,4%
  22. 22GPQA Diamond : 92,3%
  23. 23MCP-Atlas et tool use
  24. 24Hy4 vs Kimi K3 et GLM-5.3 : blind test Tencent
  25. 25Et Claude Opus 5 / GPT-5.6 Sol ?
  26. 26Prix API
  27. 27Self-hosting vs API
  28. 28Hy4 s’est-il vraiment « auto-optimisé » ?
  29. 29Que signifie +31,8% de throughput ?
  30. 30Forces principales
  31. 31Risques et inconnues
  32. 32Comment benchmarker en entreprise ?
  33. 33Checklist de déploiement
  34. 34Faut-il migrer depuis Hy3 ?
  35. 35Verdict POLPROG

Le 28 août 2026, Tencent a publié et open-sourcé Hy4 preview, son nouveau modèle phare Mixture-of-Experts de la famille Tencent Hy, anciennement surtout connue sous le nom Hunyuan.[1][6]

Spécifications principales :

770B paramètres au total
49B paramètres actifs par token
78 couches
256 routed experts + 1 shared expert
top-8 routed experts actifs par token
contexte 1M
Apache License 2.0

[2]

Tencent propose les poids complets et Hy4 preview-FP8. Le dépôt Hugging Face complet représente environ 1,56 To.[2][3]

Le modèle cible le software engineering, les workflows bureautiques, l’analyse financière, le développement de jeux, la recherche scientifique et les agents utilisant des outils.[1][2]

Trois points sont essentiels.

Premièrement, les poids sont sous Apache 2.0, permettant self-hosting et usage commercial sous les conditions de cette licence.[2][4]

Deuxièmement, Tencent publie des résultats vendor-reported élevés : 82,9% sur SWE-bench Multilingual, 85,4% sur Terminal-Bench 2.1 et 83,7% sur MCP-Atlas.[2][9]

Troisièmement, Tencent affirme que Hy4 preview a participé à l’optimisation de son propre processus de développement et de son infrastructure d’inférence. Un cycle d’optimisation aurait amélioré le throughput end-to-end de 31,8% par rapport au baseline interne Tencent.[1]

Il ne faut pas traduire cela par « le modèle s’est entraîné tout seul ». Tencent décrit une boucle d’automatisation R&D précoce, avec intervention humaine.

État des informations : 31 août 2026.

TL;DR

QuestionRéponse vérifiée
ModèleTencent Hy4 preview
Sortie28 août 2026
TypeMixture-of-Experts
Paramètres totaux770B
Paramètres actifs49B par token
Couches78
Routed experts256
Shared experts1
Routed experts activéstop-8
Contexte1M dans la model card, 1 048 576 sur OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
OptimisationIndexCache
MTP1 couche native, 10B total / 0,7B actif
LicenceApache 2.0
Poids completsenv. 1,56 To sur Hugging Face
Variante quantifiéeHy4 preview-FP8
Self-hostingvLLM et SGLang
Recipe officieltensor parallel size 8
API input$0.834 / 1M tokens
API output$2.501 / 1M tokens
Cache hit$0.042 / 1M tokens
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
StatutPreview
Limitesreasoning trop long et over-verification
Caveatpas encore de réplication indépendante large de la table de lancement

Qu’a publié Tencent ?

Tencent a mis à disposition :

Hy4 preview
Hy4 preview-FP8

sur Hugging Face, ModelScope, GitCode et CNB.[2]

Le modèle est aussi accessible via WorkBuddy, CodeBuddy, Tencent Cloud TokenHub et OpenRouter.[1][7]

Reuters a confirmé le lancement du 28 août et les cas d’usage logiciels, scientifiques et financiers.[6]

770B ne signifie pas 770B actifs à chaque token

Hy4 repose sur Mixture-of-Experts.

Le backbone contient :

770B total

mais environ :

49B

sont activés par token.[2]

Cela représente environ 6,4% du backbone.

MoE réduit donc le calcul actif par token, sans supprimer le besoin de stocker les poids complets.

Structure des experts

Le backbone comporte 78 couches.[2]

La première utilise un FFN dense.

Les 77 autres utilisent :

256 routed experts
1 shared expert

Chaque token active :

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3 : changement d’échelle

Hy3 :

295B total
21B active
256K context

[5][12]

Hy4 preview :

770B total
49B active
1M context

[2]

Soit environ :

  • 2,61× plus de paramètres totaux,
  • 2,33× plus de paramètres actifs,
  • au moins 3,9× plus de contexte annoncé.

Tencent dit avoir augmenté simultanément taille du modèle, longueur de contexte, volume des données et post-training.[2]

Contexte 1M

La model card indique :

Context Length: 1M

[2]

OpenRouter expose :

1,048,576 tokens
64,000 max completion tokens

[7]

Ce contexte est pertinent pour les grands codebases, les longues sessions agentiques, l’analyse multi-document et la recherche.

Mais longueur nominale et qualité effective du contexte ne sont pas la même chose.

Gated DeepSeek Sparse Attention

Hy4 utilise Gated DeepSeek Sparse Attention.[2]

L’objectif est de réduire le coût de l’attention sur les très longues séquences en sélectionnant les positions pertinentes.

Tencent y associe :

IndexCache

IndexCache

IndexCache réutilise des sparse indices entre plusieurs couches.[8]

Le papier associé montre sur ses modèles DSA testés une réduction du travail de l’indexer et des gains de vitesse en prefill/decode avec faible dégradation.[8]

Ces résultats concernent IndexCache, pas directement un benchmark complet de Hy4.

Couche MTP native

Hy4 ajoute une couche Multi-Token Prediction.[2]

Tencent indique :

10B paramètres totaux
0.7B actifs

Elle sert au speculative decoding.

Les recipes officiels vLLM et SGLang l’activent.[2]

Les poids sont réellement publics

Hugging Face affiche :

tencent/Hy4-preview
1.56 TB
131 shards safetensors
Apache-2.0

[3]

Une version :

tencent/Hy4-preview-FP8

est également disponible.[11]

Cela permet self-hosting, fine-tuning, analyse des poids et stack d’inférence personnalisée.

Apache 2.0

La model card et le repo officiel indiquent :

Apache License 2.0

[2][4]

C’est une licence permissive autorisant usage, modification et redistribution, y compris commerciale, sous ses conditions.

Self-hosting officiel : vLLM et SGLang

Tencent recommande :

vLLM
SGLang

[2]

Le recipe vLLM utilise l’image :

vllm/vllm-openai:hy4-preview

avec :

--tensor-parallel-size 8

[2]

SGLang utilise --tp-size 8.

Cela ne garantit pas que huit GPU quelconques suffisent : mémoire, precision, KV cache, contexte et concurrency comptent.

API compatible OpenAI

Une fois le serveur démarré, Hy4 peut être appelé via une API compatible OpenAI.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this repository architecture."}
    ],
    temperature=0.9,
    top_p=1.0,
)

Tencent recommande temperature=0.9 et top_p=1.0.[2]

Le reasoning peut être réduit

Par défaut, Hy4 utilise un reasoning élevé pour les tâches complexes.[2]

Pour des réponses directes :

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

C’est utile puisque le reasoning trop long fait partie des limites reconnues.

Limites officielles

Tencent cite :[2][6]

  1. tendance à réfléchir plus longtemps que nécessaire,
  2. over-verification du travail produit.

Dans un agent, cela peut augmenter tool calls, latence et coût.

Benchmarks : caveat essentiel

Tencent publie un benchmark appendix dans la model card.[2]

Au 31 août, il n’existe pas encore de réplication indépendante large de toute cette table avec configuration identique.

Nous marquons donc les chiffres comme :

Tencent-reported

Résultats sélectionnés

Transcription de la table Tencent :[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High sans tools43,4%

Tous ces chiffres sont vendor-reported.

SWE-bench Multilingual : 82,9%

Tencent indique :

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Soit +7,1 points dans cette configuration.

Il faut vérifier la variante exacte de SWE-bench avant toute comparaison externe.

SWE-bench Pro : 65,7%

Tencent indique :

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Soit +7,8 points.

C’est un signal fort d’amélioration en software engineering.

DeepSWE : plus grand saut générationnel

La transcription donne :

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Un écart aussi grand mérite particulièrement une réplication indépendante.

Terminal-Bench 2.1 : 85,4%

Tencent publie :

Hy4 preview: 85.4%

[9][10]

Très bon score pour un modèle agentique, mais plusieurs concurrents apparaissent également très haut dans la table Tencent. Il n’est donc pas correct de déclarer Hy4 vainqueur universel.

GPQA Diamond : 92,3%

Tencent rapporte :

92.3%

[9][10]

Cela soutient le positionnement scientifique du modèle.[1]

Mais un benchmark ne garantit pas la fiabilité dans une vraie recherche.

MCP-Atlas et tool use

Tencent rapporte :

MCP-Atlas: 83.7%

[9][10]

OpenRouter confirme la prise en charge de tools, tool_choice et structured outputs via JSON Schema.[7]

Hy4 vs Kimi K3 et GLM-5.3 : blind test Tencent

Tencent a conduit une évaluation interne :[1][2]

163 experts Tencent
203 tâches d’ingénierie
échelle 0–4

Scores moyens :

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Contre Kimi K3 :

51.2% wins
7.9% ties
40.9% losses

Contre GLM-5.3 :

46.8% wins
12.8% ties
40.4% losses

[2]

C’est une petite avance dans un workload interne Tencent, pas une preuve universelle.

Et Claude Opus 5 / GPT-5.6 Sol ?

Tencent inclut aussi ces modèles fermés dans sa table.[9]

SWE-bench Multilingual :

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1 :

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Les doubles valeurs correspondent à plusieurs réglages/variantes du graphique. Il ne faut pas les fusionner dans un ranking simpliste.

Prix API

Tencent annonce :[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter affiche les mêmes prix.[7][13]

Le prix par token n’est pas le coût par tâche terminée : un modèle qui raisonne plus longtemps peut coûter davantage au final.

Self-hosting vs API

API

Pratique pour démarrer vite, absorber une charge variable et éviter un gros cluster GPU.

Self-hosting

Intéressant pour data residency, contrôle de l’inférence, grande charge stable et personnalisation du serving.

Avec environ 1,56 To de poids, ce n’est pas un modèle typique de workstation unique.[3]

Hy4 s’est-il vraiment « auto-optimisé » ?

Tencent dit que Hy4 a participé à l’optimisation automatisée de méthodes d’entraînement, stratégies de données, frameworks d’évaluation et opérateurs bas niveau.[1]

Le modèle aurait proposé des approches, lancé des expériences et itéré sur les résultats.

Tencent parle d’un :

early-stage recursive self-improvement loop

Cela ne signifie pas que Hy4 s’est entièrement entraîné seul.

Que signifie +31,8% de throughput ?

Tencent indique que Hy4 a analysé des bottlenecks et travaillé sur operator fusion et communication optimization.[1]

Résultat annoncé :

+31.8% end-to-end throughput
vs baseline interne Tencent

Ce n’est pas une avance de 31,8% sur Kimi, Claude ou GPT.

Forces principales

  • Apache 2.0.
  • Contexte 1M.
  • 49B actifs sur 770B total.
  • Benchmarks coding/agent élevés selon Tencent.
  • Recipes vLLM et SGLang.
  • Version FP8.
  • Prix API agressif.

Risques et inconnues

  • Statut preview.
  • Benchmarks surtout vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Infrastructure self-hosting lourde.
  • Qualité réelle du 1M context à mesurer.
  • Data governance dépendante du provider pour l’API.

Comment benchmarker en entreprise ?

Comparer sur les mêmes tâches :

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Mesurer :

  • task completion,
  • test pass rate,
  • qualité du diff,
  • tool calls,
  • retries,
  • tokens,
  • latence,
  • coût par tâche terminée,
  • régressions,
  • changements hors scope,
  • qualité long-context.

La métrique clé est souvent :

cost per successful task

Checklist de déploiement

Qualité

  • Tester sur tâches internes.
  • Séparer chiffres Tencent et résultats indépendants.
  • Comparer high reasoning et no_think.
  • Mesurer over-verification.
  • Tester hallucinations.
  • Valider tool calling.
  • Valider structured outputs.
  • Tester longues sessions agentiques.

Long context

  • Tester 32K, 128K, 256K et plus.
  • Mesurer retrieval accuracy.
  • Mesurer time-to-first-token.
  • Mesurer KV-cache footprint.
  • Ne pas confondre 1M annoncé avec 1M de mémoire parfaite.
  • Tester repo-level coding.
  • Tester cross-document reasoning.
  • Tester prompt injection en long contexte.

Self-hosting

  • Vérifier besoins GPU réels.
  • Commencer par FP8 officiel.
  • Tester vLLM.
  • Tester SGLang.
  • Mesurer throughput à concurrence réelle.
  • Mesurer P50/P95/P99.
  • Prévoir storage pour les poids.
  • Faire valider Apache 2.0 juridiquement.

API

  • Vérifier prix actuels.
  • Vérifier cache semantics et TTL.
  • Vérifier data retention.
  • Vérifier région de traitement.
  • Définir limites de coût.
  • Monitorer usage par agent.
  • Prévoir modèle fallback.
  • Mesurer cost per successful task.

Faut-il migrer depuis Hy3 ?

Hy4 est un candidat évident au POC pour les utilisateurs de Hy3.

Sur le papier :

295B → 770B total
21B → 49B active
256K → 1M context

avec de fortes hausses vendor-reported en coding/agents.[2][5][9]

Mais Hy4 peut raisonner plus longtemps, demander plus d’infrastructure et reste en preview.

Verdict POLPROG

Hy4 preview est l’une des sorties open-weight majeures de fin août 2026.

La combinaison importante est :

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
prix API agressif
profil coding/agent solide

Trois niveaux de preuve doivent rester séparés.

Faits techniques

Architecture, licence, poids, contexte, deployment et prix sont bien documentés.[1][2][3][7]

Benchmarks

Impressionnants, mais surtout Tencent-reported au lancement.[2][9][10]

Self-improvement

Réel dans le workflow R&D décrit, sans être un entraînement totalement autonome.[1]

Conclusion raisonnable au 31 août 2026 :

Hy4 preview mérite un POC pour les équipes qui construisent coding agents, research agents, workflows long-context et infrastructure AI self-hosted.

Pas assez de preuves pour dire :

Hy4 est le meilleur modèle du monde.

Assez de preuves pour dire :

Tencent a placé Hy4 dans le petit groupe des modèles open-weight qu’une architecture AI de production ne peut plus ignorer.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Questions fréquentes

Date de sortie ?

28 août 2026.

Open source ?

Tencent le qualifie d’open source et publie poids/code sous Apache 2.0.

Paramètres ?

770B total, 49B actifs par token dans le backbone.

MTP inclus dans 770B ?

Non selon la model card : 10B total / 0,7B actifs supplémentaires.

Contexte ?

1M dans la model card, 1 048 576 sur OpenRouter.

Max output ?

64K sur OpenRouter.

Self-hosting ?

Oui.

Frameworks officiels ?

vLLM et SGLang.

FP8 ?

Oui.

Taille des poids complets ?

Environ 1,56 To.

Licence ?

Apache 2.0.

Prix API ?

$0.834/1M input, $2.501/1M output, $0.042/1M cache hits.

Hy4 a battu Kimi K3 ?

Dans le blind test interne Tencent : 2.99/4 contre 2.94/4. Ce n’est pas une preuve indépendante universelle.

GLM-5.3 ?

2.99 contre 2.92 dans le même test interne.

Claude Opus 5 ?

Aucune base solide pour une affirmation générale de supériorité.

Benchmarks indépendants ?

Pas encore de réplication large de toute la table Tencent au 31 août.

Faiblesses connues ?

Reasoning trop long et over-verification.

Hy4 s’est amélioré lui-même ?

Tencent décrit de l’expérimentation automatisée assistée par le modèle et de l’optimisation de pipeline, pas un self-training totalement autonome.

+31,8% throughput ?

Gain par rapport au baseline interne d’inférence Tencent, pas par rapport aux concurrents.

Sources et notes

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 août 2026, consulté le 31 août 2026.123456789101112
  2. Tencent, Hy4 preview — model card officiel Hugging Face, consulté le 31 août 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, consulté le 31 août 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — dépôt GitHub officiel, consulté le 31 août 2026.12
  5. Tencent, Hy3 Now Available Globally, 5 août 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 août 2026.123
  7. OpenRouter, Tencent: Hy4 preview, état vérifié le 31 août 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, mars 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 août 2026. Valeurs transcrites depuis la table Tencent, pas une réplication indépendante.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, consulté le 31 août 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, consulté le 31 août 2026.
  12. Tencent, Hy3 preview launch, 24 avril 2026.
  13. OpenRouter, Tencent models, consulté le 31 août 2026.

Cela vous a-t-il été utile ?

Recevez les nouveaux articles par e-mail

Un court e-mail par nouvel article d'apprentissage. Pas de spam, désinscription en un clic.

Nous utilisons uniquement votre e-mail pour envoyer de nouveaux articles. Aucun partage avec des tiers.

Retour à l'apprentissage