La fin du mois d’août 2026 a apporté deux modèles très différents de la même génération Z.ai.
GLM-5.3 est le grand modèle de reasoning textuel destiné aux tâches d’ingénierie long-horizon, aux coding agents et à des capacités de cybersécurité en forte progression. Z.ai l’a annoncé le 14 août, puis a publié les poids sur Hugging Face le 28 août après la période de safety evaluation et de hardening annoncée au lancement.[1][17]
GLM-5.3-Flash est un modèle beaucoup moins cher, nativement multimodal et basé sur un nouveau pre-training. Il possède 320B paramètres au total, 18B actifs par token, un contexte 1M, accepte text/image/video/file et publie ses poids sous licence MIT.[6][8][11]
Avant son lancement officiel, Flash a été testé anonymement comme :
Ox Alpha
sur OpenCode et OpenRouter. Z.ai affirme qu’il est rapidement devenu le modèle le plus utilisé de la semaine et que ce trafic a été servi sur des accélérateurs AI chinois. Cette popularité reste une affirmation du fournisseur.[6][7][19]
Les deux modèles ne sont pas simplement une version grande et une version petite du même réseau.
GLM-5.3 :
env. 753B total selon les métadonnées HF/AA actuelles
env. 40B actifs
text-only
contexte 1M
output max 128K
reasoning toujours activé
licence GLM-5.3 personnalisée
GLM-5.3-Flash :
320B total
18B actifs
multimodal natif
contexte 1M
output max 128K
sparse + linear attention
MIT
Les benchmarks de lancement sont principalement Z.ai-reported. Les évaluations agentiques dépendent du harness, du tooling, du budget de tokens, du contexte et de la configuration d’inférence. Il faut donc distinguer faits techniques, chiffres fournisseur et mesures indépendantes.
État des informations : 31 août 2026.
TL;DR
| Question | Réponse vérifiée |
|---|---|
| GLM-5.3 annoncé | 14 août 2026 |
| Poids GLM-5.3 publics | depuis le 28 août |
| GLM-5.3-Flash | fin août; Artificial Analysis indique le 26 août |
| Taille GLM-5.3 | 753B dans HF/AA, env. 40B actifs |
| Flash | 320B total, 18B actifs |
| GLM-5.3 input | texte |
| Flash input | texte, image, vidéo, fichier selon Z.ai |
| Contexte | 1M pour les deux |
| Output max | 128K pour les deux |
| Reasoning | toujours activé; low, high, max; défaut max |
| Licence GLM-5.3 | GLM-5.3 License personnalisée |
| Licence Flash | MIT |
| API GLM-5.3 | $1.40 input / $0.26 cache / $4.40 output par 1M |
| Flash prix catalogue | $0.15 / $0.03 / $0.50 |
| Promo Flash au 9/09/2026 | $0.075 / $0.015 / $0.25 |
| Terminal-Bench 2.1 | 88.2, Z.ai-reported |
| Terminal-Bench 3.0 | 28.3, Z.ai-reported |
| DeepSWE v1.1 | 66.9, Z.ai-reported |
| CyberGym | 84.5%, Z.ai-reported |
| ExploitBench | 54.4%, Z.ai-reported |
| Ox Alpha | identité pre-release de Flash |
| Artificial Analysis | GLM-5.3 60, Flash 57 |
| Hy4 vs GLM-5.3 | blind test Tencent : 2.99 vs 2.92 |
| Caveat principal | les benchmarks agentiques dépendent fortement du setup |
Que s’est-il passé en août ?
Z.ai a annoncé GLM-5.3 le 14 août 2026.[1]
Le point inhabituel : le base model n’a pas changé par rapport à GLM-5.2. Z.ai indique que tous les gains viennent du post-training.[1][15]
L’API était disponible immédiatement, tandis que les poids devaient arriver après environ deux semaines d’évaluation de sécurité supplémentaire. Hugging Face affichait le 28 août comme date de publication prévue et les poids sont maintenant disponibles.[17][5]
GLM-5.3-Flash suit une autre voie : nouvelle base, nouvelle architecture et multimodalité native.[6][8]
GLM-5.3 n’est pas simplement un Flash plus grand
GLM-5.3
Priorités :
qualité maximale de la famille GLM
coding
long-horizon agents
terminal
cyber reasoning
GLM-5.3-Flash
Priorités :
coût
multimodalité
efficacité d’inférence
visual coding
workflows office
long context
Flash n’est pas une simple distillation de GLM-5.3. Z.ai le présente comme un nouveau base model.[6][8]
Combien de paramètres pour GLM-5.3 ?
L’architecture GLM-5 originale était présentée comme :
744B total
40B actifs
Les métadonnées Hugging Face et Artificial Analysis actuelles donnent pour GLM-5.3 :
753B total
40B actifs
GLM-5.3 partage la base de GLM-5.2.[1][15]
Nous traitons donc l’écart 744B/753B comme une différence de comptage/implémentation et utilisons 753B/40B pour les comparaisons de déploiement actuelles.
Flash : 320B total, 18B actifs
Z.ai indique :
320B total
18B actifs
45 couches
Pour comparaison, GLM-4.5 est présenté avec 355B total, 32B actifs et 92 couches.[6]
Flash réduit fortement le compute actif.
Contexte 1M et output 128K
Les docs Z.ai actuelles donnent pour les deux modèles :
Context Length: 1M
Maximum Output: 128K
C’est utile pour les gros repositories, les sessions agentiques longues, l’analyse multi-fichiers et les workflows documentaires.
Mais 1M de contexte ne signifie pas 1M de mémoire parfaite. Retrieval et instruction retention doivent être testés.
GLM-5.3 est text-only, Flash multimodal
GLM-5.3 :
Input: Text
Output: Text
Flash :
Input:
Text
Image
Video
File
Output:
Text
Flash est donc beaucoup plus adapté aux screenshots, interfaces, documents, PDF, présentations, images et visual coding.
Artificial Analysis standardise actuellement le profil Flash sur texte+image dans ses tests, sans contredire les modalités plus larges documentées par Z.ai.[11]
Sparse + linear attention
Flash combine :
Sparse Attention
+
Linear Attention
Linear attention vise les dépendances locales via state modeling, tandis que sparse attention récupère les informations pertinentes dans le contexte global.
Objectif : réduire le coût d’inférence en long context.
IndexPool
Pour le contexte 1M, Z.ai ajoute :
IndexPool
Quatre key vectors de l’indexer sont compressés en un via weighted pooling.
Z.ai annonce par rapport à GLM-5.3 :
3.01× moins d'attention compute
4.44× moins de KV cache
Ce sont des chiffres fournisseur, pas une réplication indépendante.
Manifold-Constrained Hyper-Connections
Flash utilise aussi :
mHC
Manifold-Constrained Hyper-Connections
L’objectif est d’améliorer le flux d’information et l’efficacité du scaling.
Le résultat recherché est de conserver une grande part de la qualité flagship avec seulement 18B paramètres actifs.
Pre-training multimodal de 30T tokens
Z.ai indique :
30T-token multimodal corpus
C’est une différence majeure : GLM-5.3 garde le base model GLM-5.2 et progresse via post-training, tandis que Flash reçoit un nouveau pre-training multimodal.
Ox Alpha était Flash
Avant le nom officiel :
ox-alpha
était disponible sur OpenCode et OpenRouter.[6][19]
Z.ai confirme que cette identité correspondait à GLM-5.3-Flash.
L’affirmation « modèle le plus populaire de la semaine » reste un chiffre/claim Z.ai.[7]
Pourquoi le test stealth est intéressant
L’anonymat réduit une partie du biais de marque.
Mais ce n’était pas un test scientifique contrôlé. Usage et popularité dépendent aussi du prix, du routing, de la disponibilité, de l’interface et des promotions.
Le signal fiable est donc une vraie adoption utilisateur, pas une preuve de supériorité universelle.
Le saut GLM-5.3 vient du post-training
Z.ai affirme avoir conservé la même base que GLM-5.2.[1][15]
La société a surtout augmenté :
- le nombre d’environnements,
- la diversité des tâches,
- le compute post-training,
- les tâches long-horizon,
- les verifiers,
- le reinforcement learning,
- la génération automatique d’environnements.
Le framework open-source slime relie training, rollout et data generation.[1]
Que signifie « +50% coding » ?
Z.ai communique :
+50% vs GLM-5.2
Ce chiffre vient de son benchmark privé Z.ai Code Bench.
En Max effort :
GLM-5.3: 34.5%
~75K output tokens/task
GLM-5.2: 23.4%
~96K output tokens/task
C’est intéressant, mais ce n’est pas « 50% meilleur sur tous les problèmes de programmation ».
Benchmarks publics coding/agents
Table Z.ai sélectionnée :[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE + Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Tous ces résultats sont Z.ai-reported.
Terminal-Bench 3.0 : énorme progression
GLM-5.2: 4.6
GLM-5.3: 28.3
Le score numérique est plus de six fois supérieur, mais cela ne signifie pas « 6× plus intelligent ».
Le harness Z.ai utilise Claude Code 2.1.207, max effort, grand contexte, jusqu’à 600 tours agent et un timeout long.[3]
DeepSWE : 66.9
GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7
GLM progresse fortement, mais Kimi et GPT restent devant dans cette table.
Terminal-Bench 2.1 : quasi égalité
GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0
Les écarts sont trop faibles pour justifier des superlatifs.
Agents' Last Exam
GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6
Encore une fois, la tête est très serrée.
CyberGym : 84.5%
Z.ai rapporte :
GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%
CyberGym part de source code white-box et vérifie la découverte/validation de vulnérabilités.
Ce benchmark ne mesure pas directement la capacité à compromettre n’importe quel système réel.
ExploitBench : limite plus nette
GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%
Le gain est massif, mais les meilleurs closed models restent nettement devant.
ExploitGym
Tâches terminées 2h/6h selon Z.ai :
GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293
Le temps est normalisé selon le throughput de chaque modèle. La méthodologie doit donc être prise en compte.
2 436 vulnérabilités signalées
Z.ai déclare, après review et déduplication :
2,436 findings
269 projets
1,097 critical + high
Le ledger indique :
53 publics
2,383 sous embargo
107 critical
990 high
1,286 medium
53 low
Il s’agit de données opérationnelles Z.ai, pas d’une base indépendante de CVE.
Les capacités cyber exigent une gouvernance dédiée
Usages défensifs possibles :
- secure code review,
- vulnerability triage,
- reproduction en sandbox,
- augmentation SAST,
- analyse de patch,
- fuzzing,
- threat modeling.
En parallèle : network isolation, logs, approval gates, séparation des secrets et credentials minimaux.
Benchmarks Flash
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| AutomationBench | 48.8 | 26.2 |
| Agents' Last Exam | 26.3 | 20.4 |
| HLE + Tools | 55.3 | 54.7 |
| GDPval-AA v2 | 1773 | 1504 |
Le point majeur est le rapport qualité/prix, pas une égalité automatique avec GLM-5.3.
Flash vs Opus 4.8 sur Z.ai Code Bench
Z.ai indique :
Flash: 29.0
Opus 4.8: 29.5
Comme le benchmark est privé, on ne peut pas en conclure que Flash « égale Claude » partout.
Artificial Analysis : 60 vs 57
Artificial Analysis Intelligence Index v4.1.1 :
GLM-5.3 max: 60
Flash: 57
Mesures API first-party actuelles :
GLM-5.3: ~66.5 tokens/s, ~1.6 s TTFT
Flash: ~45–49 tokens/s, ~1.5 s TTFT
Le nom « Flash » ne signifie donc pas nécessairement le meilleur throughput tokens/s. Son avantage principal est le coût, le compute actif et la multimodalité.
Prix API
Z.ai liste :[9]
GLM-5.3
Input $1.40
Cached $0.26
Output $4.40
Flash catalogue
Input $0.15
Cached $0.03
Output $0.50
Flash promo jusqu’au 9 septembre
Input $0.075
Cached $0.015
Output $0.25
par 1M tokens.
OpenRouter propose également les deux modèles, mais les tarifs provider peuvent différer.[18][19]
« One-tenth the price » est raisonnable
Au tarif catalogue, Flash est environ :
9.3× moins cher en input
8.8× moins cher en output
Dire « environ un dixième » est donc une approximation marketing raisonnable. Le coût par tâche dépend cependant du reasoning, du nombre de tokens et des tool calls.
GLM-5.3 vs Kimi K3
Table Z.ai :[3]
TB 2.1: 88.2 vs 88.3
DeepSWE: 66.9 vs 67.5
TB 3.0: 28.3 vs 17.4
AutomationBench: 48.2 vs 46.7
ExploitBench: 54.4 vs 32.2
Kimi gagne légèrement certains benchmarks coding; GLM est nettement devant dans TB3 et les evals security publiées par Z.ai.
GLM-5.3 vs Hy4
Tencent a réalisé un blind test interne avec 163 experts et 203 tâches.[13][14]
Hy4: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Hy4 contre GLM :
46.8% wins
12.8% ties
40.4% losses
Ce résultat appartient au workload Tencent et ne doit pas être fusionné avec les tables Z.ai.
GLM-5.3 vs GPT-5.6 Sol
Dans Z.ai :[3]
Terminal-Bench 3.0: 28.3 vs 34.6
DeepSWE: 66.9 vs 72.7
ExploitBench: 54.4 vs 76.5
ExploitGym 6h: 130 vs 293
HLE + Tools: 62.5 vs 64.5
GLM est légèrement devant sur CyberGym et AutomationBench.
Conclusion : comparaison mixte, pas victoire générale.
Et Claude Opus 5 ?
Le tableau de lancement Z.ai compare surtout Opus 4.8 et Fable 5, pas Opus 5.[3]
Il serait donc faux d’écrire :
GLM-5.3 > Claude Opus 5
sur cette base.
Open weights et licences
Flash
MIT
GLM-5.3
GLM-5.3 License personnalisée
La licence permet largement usage, modification, distribution, fine-tuning et vente.
Mais les opérateurs de Model as a Service dépassant 10 milliards USD de revenu agrégé sur 12 mois consécutifs doivent passer une security review Z.ai avant usage commercial du modèle ou de ses dérivés.[4]
La formulation précise est donc « open weights sous licence personnalisée », pas « MIT ».
Self-hosting
Les chemins officiels couvrent :
vLLM
SGLang
Transformers
Docker Model Runner
Le repository GLM-5.3 principal représente environ :
756 GB
141 shards safetensors
Flash est plus léger en compute actif, mais reste un gros modèle.
Puces AI chinoises et gain serving 3×
Z.ai affirme que le trafic Flash/Ox Alpha a été servi sur un grand cluster d’accélérateurs AI chinois.[6][7]
Optimisations citées :
Tensor Parallelism
ReplaySSM
W8A8
cache INT8/FP8/BF16
Layer Split
Encode–Prefill–Decode disaggregation
Z.ai annonce 3× le serving end-to-end par rapport à son baseline initial sur le même hardware.[6][7]
C’est un vendor claim à valider indépendamment.
Quel modèle choisir ?
GLM-5.3
Pour qualité coding maximale de la famille, terminal agents, reasoning textuel et security analysis.
Flash
Pour coût, vision, screenshots, documents, video/file input, contexte 1M et licence MIT.
Kimi, Hy4, GPT ou Claude
Si votre propre POC donne un meilleur :
cost per successful task
Checklist de POC
Qualité
- Tester de vraies tâches internes.
- Utiliser le même harness.
- Mesurer test pass rate.
- Mesurer task completion.
- Mesurer les régressions.
- Mesurer les changements hors scope.
- Tester les longues sessions.
- Tester recovery.
- Valider tool calling.
- Valider structured output.
Reasoning
- Comparer
low,high,max. - Le reasoning ne peut pas être désactivé.
- Mesurer reasoning tokens.
- Mesurer output total.
- Mesurer latence end-to-end.
- Ne pas utiliser
maxpar défaut pour chaque tâche simple.
Long context
- Tester 32K.
- Tester 128K.
- Tester 256K.
- Tester 1M.
- Mesurer retrieval accuracy.
- Mesurer instruction loss.
- Tester gros repositories.
- Tester cross-file dependencies.
- Mesurer KV cache et concurrency.
- Ne pas assimiler 1M à une mémoire parfaite.
Multimodalité Flash
- Tester screenshots.
- Tester documents.
- Tester charts.
- Tester workflows type OCR.
- Tester GUI verification.
- Tester vidéo avec données réelles.
Security
- Sandboxer les workflows cyber.
- Limiter le réseau.
- Logger les tool calls.
- Ajouter approval gates.
- Séparer les secrets production.
- Limiter les credentials.
- Valider les patches avant merge.
- Ne pas traiter le modèle comme autorité autonome.
Licence et opérations
- Lire GLM-5.3 License.
- Vérifier la clause MaaS >$10B.
- Vérifier les obligations MIT de Flash.
- Vérifier la politique de données du provider.
- Vérifier processing region.
- Vérifier retention.
- Mesurer cache hit rate.
- Mesurer cost per successful task.
- Définir fallback model.
- Surveiller le prix Flash après promo.
Verdict POLPROG
GLM-5.3 est l’une des sorties coding majeures d’août 2026, non parce qu’il aurait battu tous les autres modèles, mais parce que la même base que GLM-5.2 a fortement progressé grâce au post-training.[1][15]
Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4
Flash suit une autre stratégie :
320B total
18B actifs
multimodal natif
1M context
MIT
API très peu chère
et obtient 57 à l’Artificial Analysis Intelligence Index contre 60 pour GLM-5.3 max.[10][11][12]
Pour de nombreux produits, Flash peut donc être plus intéressant économiquement que le flagship.
La décision raisonnable n’est pas « quel modèle gagne Internet ? », mais :
Quel modèle fournit le meilleur cost per successful task dans notre propre environnement avec la qualité, la sécurité et la latence nécessaires ?

