Ende August 2026 hat Z.ai zwei sehr unterschiedliche Modelle derselben Generation veröffentlicht.
GLM-5.3 ist das große textbasierte Reasoning-Modell für langfristige Engineering-Aufgaben, Coding Agents und zunehmend starke Cybersecurity-Fähigkeiten. Z.ai kündigte es am 14. August an; die öffentlichen Gewichte folgten am 28. August nach der angekündigten Safety-Evaluation und Härtung.[1][17]
GLM-5.3-Flash erschien Ende August als deutlich günstigeres, nativ multimodales Modell mit neuer Basis. Es besitzt 320B Gesamtparameter, 18B aktive Parameter pro Token, 1M Kontext, Text-/Bild-/Video-/Datei-Input und öffentliche Gewichte unter MIT.[6][8][11]
Vor der Veröffentlichung wurde Flash anonym als:
Ox Alpha
auf OpenCode und OpenRouter getestet. Z.ai sagt, Ox Alpha sei in dieser Phase schnell zum meistgenutzten Modell der Woche geworden; diese Popularitätsaussage stammt jedoch vom Hersteller.[6][7][19]
Die Modelle sind nicht einfach große und kleine Varianten derselben Architektur.
GLM-5.3:
ca. 753B total laut aktuellem HF/AA-Metadatenstand
ca. 40B aktiv
Text-Input
1M Kontext
128K maximaler Output
Reasoning immer aktiv
eigene GLM-5.3 License
GLM-5.3-Flash:
320B total
18B aktiv
native Multimodalität
1M Kontext
128K maximaler Output
hybride Sparse + Linear Attention
MIT
Die Launch-Benchmarks sind überwiegend Z.ai-reported. Agentische Ergebnisse hängen stark von Harness, Tooling, Zeitbudget, Context Window und Inference-Settings ab. Deshalb trennen wir technische Fakten, Herstellerwerte und unabhängige Messungen.
Informationsstand: 31. August 2026.
TL;DR
| Frage | Verifizierte Antwort |
|---|---|
| GLM-5.3 angekündigt | 14. August 2026 |
| Öffentliche GLM-5.3-Gewichte | seit 28. August verfügbar |
| GLM-5.3-Flash | Ende August; Artificial Analysis nennt 26. August |
| GLM-5.3 Größe | 753B aktuell in HF/AA, etwa 40B aktiv |
| Flash | 320B total, 18B aktiv |
| GLM-5.3 Input | Text |
| Flash Input | Text, Bild, Video, Datei laut Z.ai |
| Kontext | 1M bei beiden |
| Max Output | 128K bei beiden |
| Reasoning | immer aktiv; low, high, max; Default max |
| GLM-5.3 Lizenz | Custom GLM-5.3 License |
| Flash Lizenz | MIT |
| GLM-5.3 API | $1.40 Input / $0.26 Cache / $4.40 Output pro 1M |
| Flash Listenpreis | $0.15 / $0.03 / $0.50 |
| Flash Promo bis 9.09.2026 | $0.075 / $0.015 / $0.25 |
| Terminal-Bench 2.1 | 88.2, Z.ai-reported |
| Terminal-Bench 3.0 | 28.3, Z.ai-reported |
| DeepSWE v1.1 | 66.9, Z.ai-reported |
| CyberGym | 84.5%, Z.ai-reported |
| ExploitBench | 54.4%, Z.ai-reported |
| Ox Alpha | Pre-Release-Identität von Flash |
| Artificial Analysis | GLM-5.3 60, Flash 57 |
| Hy4 vs GLM-5.3 | Tencent-intern: 2.99 vs 2.92 |
| Haupt-Caveat | Agent-Benchmarks hängen stark von Setup und Budget ab |
Was ist im August passiert?
Z.ai kündigte GLM-5.3 am 14. August an.[1]
Das Besondere: Das Base Model wurde gegenüber GLM-5.2 nicht geändert. Z.ai sagt ausdrücklich, alle Verbesserungen kämen aus dem Post-Training.[1][15]
Zum Launch war die API verfügbar. Die Gewichte sollten etwa zwei Wochen später nach zusätzlicher Sicherheitsprüfung folgen. Hugging Face markierte den 28. August als geplanten Release; heute sind die Gewichte öffentlich verfügbar.[17][5]
Parallel erschien GLM-5.3-Flash mit neuer Basis, neuer Architektur und nativer Multimodalität.[6][8]
GLM-5.3 ist nicht einfach ein größeres Flash
GLM-5.3
Optimiert für:
maximale GLM-Qualität
Coding
Long-Horizon Agents
Terminal-Arbeit
Cyber Reasoning
GLM-5.3-Flash
Optimiert für:
Kosten
Multimodalität
Inference-Effizienz
Visual Coding
Office-Workflows
langen Kontext
Flash ist keine simple Destillation derselben Basis, sondern laut Z.ai ein neu vortrainiertes Modell.[6][8]
Wie viele Parameter hat GLM-5.3?
Die ursprüngliche GLM-5-Architektur wurde als:
744B total
40B active
vorgestellt.[16]
Aktuelle Hugging-Face- und Artificial-Analysis-Metadaten für GLM-5.3 nennen:
753B total
40B active
Da GLM-5.3 dieselbe Basis wie GLM-5.2 nutzt, behandeln wir 744B vs 753B als Zähl-/Implementierungsunterschied und verwenden für aktuelle Deployment-Vergleiche 753B/40B.[1][15]
Flash: 320B total und 18B aktiv
Z.ai gibt an:
320B total
18B active
45 Layer
Zum Vergleich nennt Z.ai GLM-4.5 mit 355B total, 32B aktiv und 92 Layern.[6]
Flash reduziert also aktive Parameter und Layer massiv.
1M Kontext und 128K Output
Die aktuellen Z.ai Docs nennen für beide Modelle:
1M Context
128K Maximum Output
Das eignet sich für große Repositories, lange Agent-Sessions, Multi-File-Analysen und dokumentlastige Workflows.
1M Kontext ist jedoch nicht gleichbedeutend mit perfekter Erinnerung über 1M Token. Retrieval und Instruction Retention müssen praktisch getestet werden.
GLM-5.3 ist Text-only, Flash multimodal
GLM-5.3:
Input: Text
Output: Text
Flash:
Input:
Text
Image
Video
File
Output:
Text
Damit ist Flash besonders interessant für Screenshots, GUI-Analyse, Dokumente, PDFs, Präsentationen und Visual Coding.
Artificial Analysis testet in seinem standardisierten Profil aktuell Text und Bild; das widerspricht nicht der breiteren First-Party-API-Dokumentation von Z.ai.[11]
Hybrid aus Sparse und Linear Attention
Flash kombiniert:
Sparse Attention
+
Linear Attention
Linear Attention adressiert lokale Abhängigkeiten über State Modeling. Sparse Attention holt relevante Information aus dem globalen Kontext.
Ziel ist geringerer Inference-Aufwand bei langen Sequenzen.
IndexPool
Für den 1M-Kontext nutzt Flash:
IndexPool
Vier gecachte Indexer-Key-Vektoren werden über Weighted Pooling zu einem komprimiert.
Z.ai meldet gegenüber GLM-5.3:
3.01× weniger Attention Compute
4.44× weniger KV Cache
Das sind Herstellerangaben, keine unabhängigen Infrastrukturtests.
Manifold-Constrained Hyper-Connections
Flash verwendet außerdem:
mHC
Manifold-Constrained Hyper-Connections
Die Technik soll Scaling-Effizienz und Informationsfluss verbessern.
Praktisch geht es darum, mit nur 18B aktiven Parametern einen großen Teil der Flagship-Qualität zu erhalten.
30T multimodale Pretraining-Token
Z.ai nennt für Flash:
30T-token multimodal corpus
Damit unterscheidet sich Flash fundamental von GLM-5.3: Das Flagship behält die GLM-5.2-Basis, Flash erhält neue Pretraining-Daten und neue Architektur.
Ox Alpha war Flash
Vor dem offiziellen Namen lief das Modell als:
ox-alpha
auf OpenCode und OpenRouter.[6][19]
Z.ai identifiziert Ox Alpha ausdrücklich als GLM-5.3-Flash.
Die Behauptung, es sei das beliebteste Modell der Woche gewesen, ist dagegen als Vendor Claim zu behandeln.[7]
Warum der anonyme Test interessant ist
Ein anonymer Name reduziert Markenbias.
Trotzdem war Ox Alpha kein kontrolliertes wissenschaftliches Experiment. Nutzung kann durch Preis, Promotion, Routing, UI-Platzierung oder Verfügbarkeit beeinflusst werden.
Der sichere Schluss lautet: Ox Alpha erzeugte reale Nachfrage. Mehr nicht.
Der GLM-5.3-Sprung kommt aus Post-Training
Z.ai sagt, die Basis blieb gleich.[1][15]
Skaliert wurden unter anderem:
- Trainingsumgebungen,
- Aufgabenvielfalt,
- Post-Training-Compute,
- Long-Horizon-Agent-Aufgaben,
- automatische Umgebungsentwicklung,
- Verifier,
- Reinforcement Learning.
Das Open-Source-Framework slime verbindet Training, Rollout und Datengenerierung.[1]
Was bedeutet „+50% Coding“?
Z.ai wirbt mit:
+50% vs GLM-5.2
Das bezieht sich auf den privaten Z.ai Code Bench, nicht auf jedes Coding-Problem.
Bei Max effort:
GLM-5.3: 34.5%
~75K Output-Token/Task
GLM-5.2: 23.4%
~96K Output-Token/Task
Es ist ein interessanter Vendor-Benchmark, aber kein unabhängiger Universalwert.
Öffentliche Coding- und Agent-Benchmarks
Aus der Z.ai-Tabelle:[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE + Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Alle Werte sind Z.ai-reported.
Terminal-Bench 3.0: der größte Sprung
GLM-5.2: 4.6
GLM-5.3: 28.3
Der Score ist numerisch mehr als sechsmal so hoch. Das bedeutet nicht „6× intelligenter“.
Z.ai nutzt ein detailliertes Agent-Setup mit Claude Code 2.1.207, Max Effort, großem Kontext, bis zu 600 Agent Turns und langem Timeout.[3]
DeepSWE: 66.9
Z.ai meldet:
GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7
Der Generationssprung ist stark, aber Kimi und GPT liegen in dieser Tabelle höher.
Terminal-Bench 2.1: nahezu Gleichstand
GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0
Diese Abstände sind so klein, dass Superlative kaum sinnvoll sind.
Agents' Last Exam
GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6
Auch hier liegt die Spitze eng zusammen.
CyberGym: 84.5%
Z.ai meldet:
GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%
CyberGym startet mit White-Box-Source-Code und prüft das Auffinden und Validieren von Schwachstellen.
Der Benchmark sagt nicht direkt, wie erfolgreich ein Modell gegen reale Live-Systeme wäre.
ExploitBench: deutliche Grenze
Z.ai meldet:
GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%
GLM verbessert sich enorm, doch die stärksten Closed Models bleiben klar vorn.
ExploitGym
Time-normalized 2h/6h completed tasks laut Z.ai:
GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293
Die Zeit wird über modellabhängigen Throughput normalisiert. Das Setup ist also speziell und darf nicht wie ein gewöhnlicher Pass@1-Wert gelesen werden.
2.436 Vulnerability Findings
Z.ai berichtet nach Review, Screening und Deduplication:
2,436 Findings
269 Projekte
1,097 Critical + High
Das Ledger nennt:
53 öffentlich
2,383 unter Embargo
107 Critical
990 High
1,286 Medium
53 Low
Auch Alter und durchschnittliche Lebensdauer der Schwachstellen stammen von Z.ai. Es handelt sich nicht um ein unabhängig auditiertes globales CVE-Dataset.
Cyber-Fähigkeiten brauchen Governance
Sinnvolle defensive Anwendungen:
- Secure Code Review,
- Vulnerability Triage,
- kontrollierte Reproduktion,
- SAST-Augmentation,
- Patch-Analyse,
- Fuzzing-Unterstützung,
- Threat Modeling.
Notwendig sind gleichzeitig Sandbox, Netzwerkisolation, Logging, Approval Gates und minimale Credentials.
Flash: Coding-Benchmarks
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| AutomationBench | 48.8 | 26.2 |
| Agents' Last Exam | 26.3 | 20.4 |
| HLE + Tools | 55.3 | 54.7 |
| GDPval-AA v2 | 1773 | 1504 |
Der wichtige Punkt ist der starke Qualitäts-/Kosten-Trade-off, nicht Gleichheit mit GLM-5.3.
Privater Code Bench: Flash vs Opus 4.8
Z.ai nennt bei Max effort:
Flash: 29.0
Opus 4.8: 29.5
Weil der Benchmark privat ist, darf daraus kein allgemeines „Flash = Claude“ gemacht werden.
Unabhängigerer Check: Artificial Analysis
Artificial Analysis Intelligence Index v4.1.1:
GLM-5.3 max: 60
Flash: 57
Aktuelle First-Party-Messungen liegen ungefähr bei:
GLM-5.3: ~66.5 Output-Token/s, ~1.6 s TTFT
Flash: ~45–49 Output-Token/s, ~1.5 s TTFT
„Flash“ bedeutet also nicht automatisch mehr Tokens pro Sekunde. Die Kernvorteile sind Preis, aktive Compute-Menge und Multimodalität.
API-Preise
Z.ai listet am 31. August:[9]
GLM-5.3
Input $1.40
Cached $0.26
Output $4.40
Flash Listenpreis
Input $0.15
Cached $0.03
Output $0.50
Flash Promo bis 9. September
Input $0.075
Cached $0.015
Output $0.25
jeweils pro 1M Token.
OpenRouter führt beide Modelle ebenfalls, Provider-Preise können jedoch abweichen.[18][19]
Ist „one-tenth the price“ korrekt?
Gegenüber GLM-5.2/5.3 ist Flash beim Listenpreis etwa:
9.3× günstiger beim Input
8.8× günstiger beim Output
„Etwa ein Zehntel“ ist damit eine vernünftige Marketingrundung. Die Kosten eines vollständigen Tasks hängen zusätzlich von Reasoning, Output-Länge und Tool Calls ab.
GLM-5.3 vs Kimi K3
Z.ai zeigt:
TB 2.1: 88.2 vs 88.3
DeepSWE: 66.9 vs 67.5
TB 3.0: 28.3 vs 17.4
AutomationBench: 48.2 vs 46.7
ExploitBench: 54.4 vs 32.2
Kimi liegt in einigen Coding-Evals knapp vorn, GLM in Terminal-Bench 3.0 und Cyber-Evals deutlich.
GLM-5.3 vs Hy4
Tencent führte einen eigenen Blindtest mit 163 Experten und 203 Engineering-Aufgaben durch.[13][14]
Hy4: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Hy4 gegen GLM:
46.8% Wins
12.8% Ties
40.4% Losses
Das ist ein Tencent-interner Workload, kein universeller Leaderboard.
GLM-5.3 vs GPT-5.6 Sol
Z.ai-Tabelle:[3]
Terminal-Bench 3.0: 28.3 vs 34.6
DeepSWE: 66.9 vs 72.7
ExploitBench: 54.4 vs 76.5
ExploitGym 6h: 130 vs 293
HLE + Tools: 62.5 vs 64.5
GLM liegt knapp höher in CyberGym und AutomationBench.
Das Ergebnis ist gemischt, nicht „GLM schlägt GPT“.
Und Claude Opus 5?
Die Launch-Tabelle von Z.ai vergleicht vor allem Opus 4.8 und Fable 5, nicht Opus 5.[3]
Deshalb gibt es aus dieser Tabelle keine Grundlage für die Aussage:
GLM-5.3 > Claude Opus 5
Cross-Vendor-Zahlen aus unterschiedlichen Setups dürfen nicht wie ein kontrollierter Test behandelt werden.
Open Weights und Lizenzen
Flash
MIT
GLM-5.3
Custom GLM-5.3 License
Die Lizenz erlaubt breite Nutzung, Modifikation, Distribution, Fine-Tuning und Verkauf. Sie enthält aber eine besondere MaaS-Klausel: Betreiber von Model-as-a-Service mit mehr als 10 Milliarden USD aggregiertem Umsatz in zwölf aufeinanderfolgenden Monaten müssen vor kommerzieller Nutzung eine Z.ai Security Review bestehen.[4]
Deshalb ist „Open Weights unter Custom License“ präziser als „MIT-Open-Source“.
Self-Hosting
Offizielle Pfade umfassen:
vLLM
SGLang
Transformers
Docker Model Runner
plus weitere Frameworks.[3][8]
GLM-5.3 belegt im Haupt-HF-Repository rund:
756 GB
141 Safetensors-Shards
Flash ist leichter, bleibt mit 320B Gesamtparametern aber ebenfalls ein ernsthafter Infrastruktur-Workload.
Chinesische AI-Chips und 3× Serving
Z.ai sagt, Ox-Alpha/Flash-Traffic sei auf chinesischen AI-Accelerators gelaufen.[6][7]
Genannte Optimierungen:
Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 Cache
Layer Split
Encode–Prefill–Decode Disaggregation
Z.ai meldet 3× End-to-End Serving Performance gegenüber seinem initialen Baseline auf derselben Hardware.[6][7]
Das ist ein Vendor Claim und sollte vor Beschaffungsentscheidungen unabhängig getestet werden.
Welches Modell wählen?
GLM-5.3
Wenn maximale GLM-Coding-Qualität, Terminal Agents, starkes Text-Reasoning oder Security Analysis Priorität haben.
Flash
Wenn Kosten, Vision, Screenshots, Dokumente, Video/File Input, 1M Kontext und MIT-Lizenz wichtig sind.
Kimi, Hy4, GPT oder Claude
Wenn der eigene kontrollierte POC bessere Werte liefert.
Die wichtigste Kennzahl:
cost per successful task
POC-Checkliste
Qualität
- Reale interne Tasks testen.
- Gleichen Harness verwenden.
- Test Pass Rate messen.
- Task Completion messen.
- Regressionen messen.
- Out-of-Scope-Änderungen messen.
- Lange Sessions testen.
- Recovery testen.
- Tool Calling validieren.
- Structured Output validieren.
Reasoning
-
low,high,maxvergleichen. - Reasoning kann aktuell nicht deaktiviert werden.
- Reasoning Tokens messen.
- Gesamten Output messen.
- End-to-End-Latenz messen.
-
maxnicht blind für einfache Tasks nutzen.
Long Context
- 32K testen.
- 128K testen.
- 256K testen.
- 1M testen.
- Retrieval Accuracy messen.
- Instruction Loss messen.
- Große Repositories testen.
- Cross-File Dependencies testen.
- KV Cache und Concurrency messen.
- 1M nicht mit perfektem Gedächtnis gleichsetzen.
Flash-Multimodalität
- Screenshots testen.
- Dokumente testen.
- Charts testen.
- OCR-artige Workflows testen.
- GUI Verification testen.
- Video mit eigenen Daten testen.
Security
- Cyber-Workflows sandboxen.
- Netzwerkzugriff begrenzen.
- Tool Calls loggen.
- Approval Gates einsetzen.
- Production Secrets trennen.
- Unnötige Credentials vermeiden.
- Patches vor Merge validieren.
- Modell nicht als autonome Security-Autorität behandeln.
Lizenz und Betrieb
- GLM-5.3 License prüfen.
- MaaS-$10B-Klausel prüfen.
- MIT-Pflichten für Flash prüfen.
- Provider-Datenschutz prüfen.
- Processing Region prüfen.
- Retention prüfen.
- Cache Hit Rate messen.
- Cost per Successful Task messen.
- Fallback-Modell definieren.
- Flash-Preis nach Promo überwachen.
POLPROG-Fazit
GLM-5.3 ist eine der interessantesten Coding-Releases im August 2026, nicht weil es jedes andere Modell besiegt hätte.
Entscheidender ist, wie weit dieselbe GLM-5.2-Basis durch Post-Training verschoben wurde.[1][15]
Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4
Flash verfolgt eine andere Strategie:
320B total
18B active
native multimodal
1M context
MIT
sehr niedriger API-Preis
und erreicht unabhängig bei Artificial Analysis 57 gegenüber 60 für GLM-5.3 max.[10][11][12]
Für viele Produkte kann Flash deshalb wirtschaftlich interessanter sein als das Flagship.
Die belastbare Entscheidung lautet nicht „welches Modell gewinnt das Internet?“, sondern:
Welches Modell liefert im eigenen Produkt den niedrigsten Cost per Successful Task bei ausreichender Qualität, Sicherheit und Latenz?

