GLM-5.3 und GLM-5.3-Flash: Benchmarks, Cyber-Fähigkeiten, Ox Alpha, Open Weights und Vergleich mit Kimi K3, Hy4, Claude und GPT-5.6 Sol Skip to content

GLM-5.3 und GLM-5.3-Flash: Benchmarks, Cyber-Fähigkeiten, Ox Alpha, Open Weights und Vergleich mit Kimi K3, Hy4, Claude und GPT-5.6 Sol

Verifizierte Analyse von GLM-5.3 und GLM-5.3-Flash: Architektur, 1M Kontext, 753B/40B und 320B/18B, Multimodalität, Ox Alpha, Coding- und Cyber-Benchmarks, Lizenzen, API-Preise, Self-Hosting und Vergleich mit Kimi K3, Hy4, Claude und GPT-5.6 Sol.

Veröffentlicht Verfasst von Lesezeit 23 Min. Lesezeit

Verifizierte Analyse von GLM-5.3 und GLM-5.3-Flash: Architektur, 1M Kontext, 753B/40B und 320B/18B, Multimodalität, Ox Alpha, Coding- und Cyber-Benchmarks, Lizenzen, API-Preise, Self-Hosting und Vergleich mit Kimi K3, Hy4, Claude und GPT-5.6 Sol.

Auf dieser Seite
  1. 1TL;DR
  2. 2Was ist im August passiert?
  3. 3GLM-5.3 ist nicht einfach ein größeres Flash
  4. 4Wie viele Parameter hat GLM-5.3?
  5. 5Flash: 320B total und 18B aktiv
  6. 61M Kontext und 128K Output
  7. 7GLM-5.3 ist Text-only, Flash multimodal
  8. 8Hybrid aus Sparse und Linear Attention
  9. 9IndexPool
  10. 10Manifold-Constrained Hyper-Connections
  11. 1130T multimodale Pretraining-Token
  12. 12Ox Alpha war Flash
  13. 13Warum der anonyme Test interessant ist
  14. 14Der GLM-5.3-Sprung kommt aus Post-Training
  15. 15Was bedeutet „+50% Coding“?
  16. 16Öffentliche Coding- und Agent-Benchmarks
  17. 17Terminal-Bench 3.0: der größte Sprung
  18. 18DeepSWE: 66.9
  19. 19Terminal-Bench 2.1: nahezu Gleichstand
  20. 20Agents' Last Exam
  21. 21CyberGym: 84.5%
  22. 22ExploitBench: deutliche Grenze
  23. 23ExploitGym
  24. 242.436 Vulnerability Findings
  25. 25Cyber-Fähigkeiten brauchen Governance
  26. 26Flash: Coding-Benchmarks
  27. 27Privater Code Bench: Flash vs Opus 4.8
  28. 28Unabhängigerer Check: Artificial Analysis
  29. 29API-Preise
  30. 30Ist „one-tenth the price“ korrekt?
  31. 31GLM-5.3 vs Kimi K3
  32. 32GLM-5.3 vs Hy4
  33. 33GLM-5.3 vs GPT-5.6 Sol
  34. 34Und Claude Opus 5?
  35. 35Open Weights und Lizenzen
  36. 36Self-Hosting
  37. 37Chinesische AI-Chips und 3× Serving
  38. 38Welches Modell wählen?
  39. 39POC-Checkliste
  40. 40POLPROG-Fazit

Ende August 2026 hat Z.ai zwei sehr unterschiedliche Modelle derselben Generation veröffentlicht.

GLM-5.3 ist das große textbasierte Reasoning-Modell für langfristige Engineering-Aufgaben, Coding Agents und zunehmend starke Cybersecurity-Fähigkeiten. Z.ai kündigte es am 14. August an; die öffentlichen Gewichte folgten am 28. August nach der angekündigten Safety-Evaluation und Härtung.[1][17]

GLM-5.3-Flash erschien Ende August als deutlich günstigeres, nativ multimodales Modell mit neuer Basis. Es besitzt 320B Gesamtparameter, 18B aktive Parameter pro Token, 1M Kontext, Text-/Bild-/Video-/Datei-Input und öffentliche Gewichte unter MIT.[6][8][11]

Vor der Veröffentlichung wurde Flash anonym als:

Ox Alpha

auf OpenCode und OpenRouter getestet. Z.ai sagt, Ox Alpha sei in dieser Phase schnell zum meistgenutzten Modell der Woche geworden; diese Popularitätsaussage stammt jedoch vom Hersteller.[6][7][19]

Die Modelle sind nicht einfach große und kleine Varianten derselben Architektur.

GLM-5.3:

ca. 753B total laut aktuellem HF/AA-Metadatenstand
ca. 40B aktiv
Text-Input
1M Kontext
128K maximaler Output
Reasoning immer aktiv
eigene GLM-5.3 License

GLM-5.3-Flash:

320B total
18B aktiv
native Multimodalität
1M Kontext
128K maximaler Output
hybride Sparse + Linear Attention
MIT

[2][6][10][11]

Die Launch-Benchmarks sind überwiegend Z.ai-reported. Agentische Ergebnisse hängen stark von Harness, Tooling, Zeitbudget, Context Window und Inference-Settings ab. Deshalb trennen wir technische Fakten, Herstellerwerte und unabhängige Messungen.

Informationsstand: 31. August 2026.

TL;DR

FrageVerifizierte Antwort
GLM-5.3 angekündigt14. August 2026
Öffentliche GLM-5.3-Gewichteseit 28. August verfügbar
GLM-5.3-FlashEnde August; Artificial Analysis nennt 26. August
GLM-5.3 Größe753B aktuell in HF/AA, etwa 40B aktiv
Flash320B total, 18B aktiv
GLM-5.3 InputText
Flash InputText, Bild, Video, Datei laut Z.ai
Kontext1M bei beiden
Max Output128K bei beiden
Reasoningimmer aktiv; low, high, max; Default max
GLM-5.3 LizenzCustom GLM-5.3 License
Flash LizenzMIT
GLM-5.3 API$1.40 Input / $0.26 Cache / $4.40 Output pro 1M
Flash Listenpreis$0.15 / $0.03 / $0.50
Flash Promo bis 9.09.2026$0.075 / $0.015 / $0.25
Terminal-Bench 2.188.2, Z.ai-reported
Terminal-Bench 3.028.3, Z.ai-reported
DeepSWE v1.166.9, Z.ai-reported
CyberGym84.5%, Z.ai-reported
ExploitBench54.4%, Z.ai-reported
Ox AlphaPre-Release-Identität von Flash
Artificial AnalysisGLM-5.3 60, Flash 57
Hy4 vs GLM-5.3Tencent-intern: 2.99 vs 2.92
Haupt-CaveatAgent-Benchmarks hängen stark von Setup und Budget ab

Was ist im August passiert?

Z.ai kündigte GLM-5.3 am 14. August an.[1]

Das Besondere: Das Base Model wurde gegenüber GLM-5.2 nicht geändert. Z.ai sagt ausdrücklich, alle Verbesserungen kämen aus dem Post-Training.[1][15]

Zum Launch war die API verfügbar. Die Gewichte sollten etwa zwei Wochen später nach zusätzlicher Sicherheitsprüfung folgen. Hugging Face markierte den 28. August als geplanten Release; heute sind die Gewichte öffentlich verfügbar.[17][5]

Parallel erschien GLM-5.3-Flash mit neuer Basis, neuer Architektur und nativer Multimodalität.[6][8]

GLM-5.3 ist nicht einfach ein größeres Flash

GLM-5.3

Optimiert für:

maximale GLM-Qualität
Coding
Long-Horizon Agents
Terminal-Arbeit
Cyber Reasoning

GLM-5.3-Flash

Optimiert für:

Kosten
Multimodalität
Inference-Effizienz
Visual Coding
Office-Workflows
langen Kontext

Flash ist keine simple Destillation derselben Basis, sondern laut Z.ai ein neu vortrainiertes Modell.[6][8]

Wie viele Parameter hat GLM-5.3?

Die ursprüngliche GLM-5-Architektur wurde als:

744B total
40B active

vorgestellt.[16]

Aktuelle Hugging-Face- und Artificial-Analysis-Metadaten für GLM-5.3 nennen:

753B total
40B active

[5][10]

Da GLM-5.3 dieselbe Basis wie GLM-5.2 nutzt, behandeln wir 744B vs 753B als Zähl-/Implementierungsunterschied und verwenden für aktuelle Deployment-Vergleiche 753B/40B.[1][15]

Flash: 320B total und 18B aktiv

Z.ai gibt an:

320B total
18B active
45 Layer

[6][8]

Zum Vergleich nennt Z.ai GLM-4.5 mit 355B total, 32B aktiv und 92 Layern.[6]

Flash reduziert also aktive Parameter und Layer massiv.

1M Kontext und 128K Output

Die aktuellen Z.ai Docs nennen für beide Modelle:

1M Context
128K Maximum Output

[2][6]

Das eignet sich für große Repositories, lange Agent-Sessions, Multi-File-Analysen und dokumentlastige Workflows.

1M Kontext ist jedoch nicht gleichbedeutend mit perfekter Erinnerung über 1M Token. Retrieval und Instruction Retention müssen praktisch getestet werden.

GLM-5.3 ist Text-only, Flash multimodal

GLM-5.3:

Input: Text
Output: Text

[2]

Flash:

Input:
Text
Image
Video
File

Output:
Text

[6]

Damit ist Flash besonders interessant für Screenshots, GUI-Analyse, Dokumente, PDFs, Präsentationen und Visual Coding.

Artificial Analysis testet in seinem standardisierten Profil aktuell Text und Bild; das widerspricht nicht der breiteren First-Party-API-Dokumentation von Z.ai.[11]

Hybrid aus Sparse und Linear Attention

Flash kombiniert:

Sparse Attention
+
Linear Attention

[6][8]

Linear Attention adressiert lokale Abhängigkeiten über State Modeling. Sparse Attention holt relevante Information aus dem globalen Kontext.

Ziel ist geringerer Inference-Aufwand bei langen Sequenzen.

IndexPool

Für den 1M-Kontext nutzt Flash:

IndexPool

[6]

Vier gecachte Indexer-Key-Vektoren werden über Weighted Pooling zu einem komprimiert.

Z.ai meldet gegenüber GLM-5.3:

3.01× weniger Attention Compute
4.44× weniger KV Cache

[6]

Das sind Herstellerangaben, keine unabhängigen Infrastrukturtests.

Manifold-Constrained Hyper-Connections

Flash verwendet außerdem:

mHC
Manifold-Constrained Hyper-Connections

[6][8]

Die Technik soll Scaling-Effizienz und Informationsfluss verbessern.

Praktisch geht es darum, mit nur 18B aktiven Parametern einen großen Teil der Flagship-Qualität zu erhalten.

30T multimodale Pretraining-Token

Z.ai nennt für Flash:

30T-token multimodal corpus

[6][8]

Damit unterscheidet sich Flash fundamental von GLM-5.3: Das Flagship behält die GLM-5.2-Basis, Flash erhält neue Pretraining-Daten und neue Architektur.

Ox Alpha war Flash

Vor dem offiziellen Namen lief das Modell als:

ox-alpha

auf OpenCode und OpenRouter.[6][19]

Z.ai identifiziert Ox Alpha ausdrücklich als GLM-5.3-Flash.

Die Behauptung, es sei das beliebteste Modell der Woche gewesen, ist dagegen als Vendor Claim zu behandeln.[7]

Warum der anonyme Test interessant ist

Ein anonymer Name reduziert Markenbias.

Trotzdem war Ox Alpha kein kontrolliertes wissenschaftliches Experiment. Nutzung kann durch Preis, Promotion, Routing, UI-Platzierung oder Verfügbarkeit beeinflusst werden.

Der sichere Schluss lautet: Ox Alpha erzeugte reale Nachfrage. Mehr nicht.

Der GLM-5.3-Sprung kommt aus Post-Training

Z.ai sagt, die Basis blieb gleich.[1][15]

Skaliert wurden unter anderem:

  • Trainingsumgebungen,
  • Aufgabenvielfalt,
  • Post-Training-Compute,
  • Long-Horizon-Agent-Aufgaben,
  • automatische Umgebungsentwicklung,
  • Verifier,
  • Reinforcement Learning.

Das Open-Source-Framework slime verbindet Training, Rollout und Datengenerierung.[1]

Was bedeutet „+50% Coding“?

Z.ai wirbt mit:

+50% vs GLM-5.2

[1][2]

Das bezieht sich auf den privaten Z.ai Code Bench, nicht auf jedes Coding-Problem.

Bei Max effort:

GLM-5.3: 34.5%
~75K Output-Token/Task

GLM-5.2: 23.4%
~96K Output-Token/Task

[1]

Es ist ein interessanter Vendor-Benchmark, aber kein unabhängiger Universalwert.

Öffentliche Coding- und Agent-Benchmarks

Aus der Z.ai-Tabelle:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.558.069.772.7
Toolathlon Verified73.059.976.576.274.774.9
AutomationBench48.226.246.741.046.245.8
Agents' Last Exam28.523.827.625.723.828.6
HLE + Tools62.554.759.857.963.964.5
GDPval-AA v2176915081682158817431730

Alle Werte sind Z.ai-reported.

Terminal-Bench 3.0: der größte Sprung

GLM-5.2: 4.6
GLM-5.3: 28.3

[1][3]

Der Score ist numerisch mehr als sechsmal so hoch. Das bedeutet nicht „6× intelligenter“.

Z.ai nutzt ein detailliertes Agent-Setup mit Claude Code 2.1.207, Max Effort, großem Kontext, bis zu 600 Agent Turns und langem Timeout.[3]

DeepSWE: 66.9

Z.ai meldet:

GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7

[3]

Der Generationssprung ist stark, aber Kimi und GPT liegen in dieser Tabelle höher.

Terminal-Bench 2.1: nahezu Gleichstand

GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0

[3]

Diese Abstände sind so klein, dass Superlative kaum sinnvoll sind.

Agents' Last Exam

GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6

[3]

Auch hier liegt die Spitze eng zusammen.

CyberGym: 84.5%

Z.ai meldet:

GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%

[1][3]

CyberGym startet mit White-Box-Source-Code und prüft das Auffinden und Validieren von Schwachstellen.

Der Benchmark sagt nicht direkt, wie erfolgreich ein Modell gegen reale Live-Systeme wäre.

ExploitBench: deutliche Grenze

Z.ai meldet:

GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%

[1][3]

GLM verbessert sich enorm, doch die stärksten Closed Models bleiben klar vorn.

ExploitGym

Time-normalized 2h/6h completed tasks laut Z.ai:

GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293

[3]

Die Zeit wird über modellabhängigen Throughput normalisiert. Das Setup ist also speziell und darf nicht wie ein gewöhnlicher Pass@1-Wert gelesen werden.

2.436 Vulnerability Findings

Z.ai berichtet nach Review, Screening und Deduplication:

2,436 Findings
269 Projekte
1,097 Critical + High

[1][2]

Das Ledger nennt:

53 öffentlich
2,383 unter Embargo
107 Critical
990 High
1,286 Medium
53 Low

[1]

Auch Alter und durchschnittliche Lebensdauer der Schwachstellen stammen von Z.ai. Es handelt sich nicht um ein unabhängig auditiertes globales CVE-Dataset.

Cyber-Fähigkeiten brauchen Governance

Sinnvolle defensive Anwendungen:

  • Secure Code Review,
  • Vulnerability Triage,
  • kontrollierte Reproduktion,
  • SAST-Augmentation,
  • Patch-Analyse,
  • Fuzzing-Unterstützung,
  • Threat Modeling.

Notwendig sind gleichzeitig Sandbox, Netzwerkisolation, Logging, Approval Gates und minimale Credentials.

Flash: Coding-Benchmarks

Z.ai meldet:[7][8]

BenchmarkFlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
AutomationBench48.826.2
Agents' Last Exam26.320.4
HLE + Tools55.354.7
GDPval-AA v217731504

Der wichtige Punkt ist der starke Qualitäts-/Kosten-Trade-off, nicht Gleichheit mit GLM-5.3.

Privater Code Bench: Flash vs Opus 4.8

Z.ai nennt bei Max effort:

Flash: 29.0
Opus 4.8: 29.5

[6]

Weil der Benchmark privat ist, darf daraus kein allgemeines „Flash = Claude“ gemacht werden.

Unabhängigerer Check: Artificial Analysis

Artificial Analysis Intelligence Index v4.1.1:

GLM-5.3 max: 60
Flash: 57

[10][11][12]

Aktuelle First-Party-Messungen liegen ungefähr bei:

GLM-5.3: ~66.5 Output-Token/s, ~1.6 s TTFT
Flash: ~45–49 Output-Token/s, ~1.5 s TTFT

[10][11][20]

„Flash“ bedeutet also nicht automatisch mehr Tokens pro Sekunde. Die Kernvorteile sind Preis, aktive Compute-Menge und Multimodalität.

API-Preise

Z.ai listet am 31. August:[9]

GLM-5.3

Input $1.40
Cached $0.26
Output $4.40

Flash Listenpreis

Input $0.15
Cached $0.03
Output $0.50

Flash Promo bis 9. September

Input $0.075
Cached $0.015
Output $0.25

jeweils pro 1M Token.

OpenRouter führt beide Modelle ebenfalls, Provider-Preise können jedoch abweichen.[18][19]

Ist „one-tenth the price“ korrekt?

Gegenüber GLM-5.2/5.3 ist Flash beim Listenpreis etwa:

9.3× günstiger beim Input
8.8× günstiger beim Output

[9]

„Etwa ein Zehntel“ ist damit eine vernünftige Marketingrundung. Die Kosten eines vollständigen Tasks hängen zusätzlich von Reasoning, Output-Länge und Tool Calls ab.

GLM-5.3 vs Kimi K3

Z.ai zeigt:

TB 2.1: 88.2 vs 88.3
DeepSWE: 66.9 vs 67.5
TB 3.0: 28.3 vs 17.4
AutomationBench: 48.2 vs 46.7
ExploitBench: 54.4 vs 32.2

[3]

Kimi liegt in einigen Coding-Evals knapp vorn, GLM in Terminal-Bench 3.0 und Cyber-Evals deutlich.

GLM-5.3 vs Hy4

Tencent führte einen eigenen Blindtest mit 163 Experten und 203 Engineering-Aufgaben durch.[13][14]

Hy4: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

Hy4 gegen GLM:

46.8% Wins
12.8% Ties
40.4% Losses

[14]

Das ist ein Tencent-interner Workload, kein universeller Leaderboard.

GLM-5.3 vs GPT-5.6 Sol

Z.ai-Tabelle:[3]

Terminal-Bench 3.0: 28.3 vs 34.6
DeepSWE: 66.9 vs 72.7
ExploitBench: 54.4 vs 76.5
ExploitGym 6h: 130 vs 293
HLE + Tools: 62.5 vs 64.5

GLM liegt knapp höher in CyberGym und AutomationBench.

Das Ergebnis ist gemischt, nicht „GLM schlägt GPT“.

Und Claude Opus 5?

Die Launch-Tabelle von Z.ai vergleicht vor allem Opus 4.8 und Fable 5, nicht Opus 5.[3]

Deshalb gibt es aus dieser Tabelle keine Grundlage für die Aussage:

GLM-5.3 > Claude Opus 5

Cross-Vendor-Zahlen aus unterschiedlichen Setups dürfen nicht wie ein kontrollierter Test behandelt werden.

Open Weights und Lizenzen

Flash

MIT

[8][11]

GLM-5.3

Custom GLM-5.3 License

[4]

Die Lizenz erlaubt breite Nutzung, Modifikation, Distribution, Fine-Tuning und Verkauf. Sie enthält aber eine besondere MaaS-Klausel: Betreiber von Model-as-a-Service mit mehr als 10 Milliarden USD aggregiertem Umsatz in zwölf aufeinanderfolgenden Monaten müssen vor kommerzieller Nutzung eine Z.ai Security Review bestehen.[4]

Deshalb ist „Open Weights unter Custom License“ präziser als „MIT-Open-Source“.

Self-Hosting

Offizielle Pfade umfassen:

vLLM
SGLang
Transformers
Docker Model Runner

plus weitere Frameworks.[3][8]

GLM-5.3 belegt im Haupt-HF-Repository rund:

756 GB
141 Safetensors-Shards

[5]

Flash ist leichter, bleibt mit 320B Gesamtparametern aber ebenfalls ein ernsthafter Infrastruktur-Workload.

Chinesische AI-Chips und 3× Serving

Z.ai sagt, Ox-Alpha/Flash-Traffic sei auf chinesischen AI-Accelerators gelaufen.[6][7]

Genannte Optimierungen:

Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 Cache
Layer Split
Encode–Prefill–Decode Disaggregation

Z.ai meldet 3× End-to-End Serving Performance gegenüber seinem initialen Baseline auf derselben Hardware.[6][7]

Das ist ein Vendor Claim und sollte vor Beschaffungsentscheidungen unabhängig getestet werden.

Welches Modell wählen?

GLM-5.3

Wenn maximale GLM-Coding-Qualität, Terminal Agents, starkes Text-Reasoning oder Security Analysis Priorität haben.

Flash

Wenn Kosten, Vision, Screenshots, Dokumente, Video/File Input, 1M Kontext und MIT-Lizenz wichtig sind.

Kimi, Hy4, GPT oder Claude

Wenn der eigene kontrollierte POC bessere Werte liefert.

Die wichtigste Kennzahl:

cost per successful task

POC-Checkliste

Qualität

  • Reale interne Tasks testen.
  • Gleichen Harness verwenden.
  • Test Pass Rate messen.
  • Task Completion messen.
  • Regressionen messen.
  • Out-of-Scope-Änderungen messen.
  • Lange Sessions testen.
  • Recovery testen.
  • Tool Calling validieren.
  • Structured Output validieren.

Reasoning

  • low, high, max vergleichen.
  • Reasoning kann aktuell nicht deaktiviert werden.
  • Reasoning Tokens messen.
  • Gesamten Output messen.
  • End-to-End-Latenz messen.
  • max nicht blind für einfache Tasks nutzen.

Long Context

  • 32K testen.
  • 128K testen.
  • 256K testen.
  • 1M testen.
  • Retrieval Accuracy messen.
  • Instruction Loss messen.
  • Große Repositories testen.
  • Cross-File Dependencies testen.
  • KV Cache und Concurrency messen.
  • 1M nicht mit perfektem Gedächtnis gleichsetzen.

Flash-Multimodalität

  • Screenshots testen.
  • Dokumente testen.
  • Charts testen.
  • OCR-artige Workflows testen.
  • GUI Verification testen.
  • Video mit eigenen Daten testen.

Security

  • Cyber-Workflows sandboxen.
  • Netzwerkzugriff begrenzen.
  • Tool Calls loggen.
  • Approval Gates einsetzen.
  • Production Secrets trennen.
  • Unnötige Credentials vermeiden.
  • Patches vor Merge validieren.
  • Modell nicht als autonome Security-Autorität behandeln.

Lizenz und Betrieb

  • GLM-5.3 License prüfen.
  • MaaS-$10B-Klausel prüfen.
  • MIT-Pflichten für Flash prüfen.
  • Provider-Datenschutz prüfen.
  • Processing Region prüfen.
  • Retention prüfen.
  • Cache Hit Rate messen.
  • Cost per Successful Task messen.
  • Fallback-Modell definieren.
  • Flash-Preis nach Promo überwachen.

POLPROG-Fazit

GLM-5.3 ist eine der interessantesten Coding-Releases im August 2026, nicht weil es jedes andere Modell besiegt hätte.

Entscheidender ist, wie weit dieselbe GLM-5.2-Basis durch Post-Training verschoben wurde.[1][15]

Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4

[1][3]

Flash verfolgt eine andere Strategie:

320B total
18B active
native multimodal
1M context
MIT
sehr niedriger API-Preis

und erreicht unabhängig bei Artificial Analysis 57 gegenüber 60 für GLM-5.3 max.[10][11][12]

Für viele Produkte kann Flash deshalb wirtschaftlich interessanter sein als das Flagship.

Die belastbare Entscheidung lautet nicht „welches Modell gewinnt das Internet?“, sondern:

Welches Modell liefert im eigenen Produkt den niedrigsten Cost per Successful Task bei ausreichender Qualität, Sicherheit und Latenz?

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Häufig gestellte Fragen

Wann wurde GLM-5.3 veröffentlicht?

Am 14. August angekündigt; öffentliche Gewichte seit 28. August 2026.

Ist GLM-5.3 Open Source?

Präzise: öffentliche Gewichte unter eigener GLM-5.3 License mit breiten Rechten und zusätzlicher MaaS-Klausel.

Ist Flash Open Source?

Die öffentlichen Gewichte stehen unter MIT.

Parameter von GLM-5.3?

Aktuelle HF/AA-Metadaten: ca. 753B total / 40B aktiv; ursprüngliche GLM-5-Angabe: 744B/40B.

Flash?

320B total / 18B aktiv.

Kontext?

1M bei beiden.

Max Output?

128K.

Vision?

GLM-5.3 Text-only; Flash multimodal.

Reasoning abschaltbar?

Nein, aktuell nicht.

Reasoning Levels?

low, high, max.

Was ist Ox Alpha?

Die anonyme Pre-Release-Identität von GLM-5.3-Flash.

Besser als Kimi K3?

Nicht in allen Benchmarks.

Besser als Hy4?

Tencent gab Hy4 im eigenen Blindtest 2.99 und GLM-5.3 2.92.

Besser als GPT-5.6 Sol?

Nicht generell. GPT liegt in mehreren schwierigen Z.ai-Evals höher.

Besser als Claude Opus 5?

Aus der Z.ai-Launch-Tabelle nicht belegbar.

Ist 84.5% CyberGym ein Beweis für das beste Security-Modell?

Nein. In tieferen Exploitation-Evals liegen starke Closed Models höher.

GLM-5.3 Preis?

$1.40 Input, $0.26 Cache, $4.40 Output pro 1M Token.

Flash Preis?

Liste $0.15 / $0.03 / $0.50; Promo bis 9. September: $0.075 / $0.015 / $0.25.

Self-Hosting?

Ja, aber mit erheblichen Hardwareanforderungen.

Produktionsentscheidung?

Eigener POC mit Qualität, Latenz, Tokens, Tool Calls und Cost per Successful Task.

Quellen und Fußnoten

  1. Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, 14. August 2026, abgerufen 31. August 2026.123456789101112131415
  2. Z.ai Developer Docs, GLM-5.3 — Overview, abgerufen 31. August 2026.12345
  3. Z.ai / Hugging Face, GLM-5.3 — offizielles Model Card, abgerufen 31. August 2026.1234567891011121314
  4. Z.ai / Hugging Face, GLM-5.3 License, abgerufen 31. August 2026.12
  5. Hugging Face, zai-org/GLM-5.3 — files and versions, abgerufen 31. August 2026.123
  6. Z.ai Developer Docs, GLM-5.3-Flash — Overview, abgerufen 31. August 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, August 2026, abgerufen 31. August 2026.12345
  8. Z.ai / Hugging Face, GLM-5.3-Flash — offizielles Model Card, abgerufen 31. August 2026.12345678910
  9. Z.ai Developer Docs, Pricing, abgerufen 31. August 2026.12
  10. Artificial Analysis, GLM-5.3 (max), Stand 31. August 2026.12345
  11. Artificial Analysis, GLM-5.3-Flash, Stand 31. August 2026.1234567
  12. Artificial Analysis, GLM-5.3-Flash vs GLM-5.3 (max), Stand 31. August 2026.12
  13. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28. August 2026.
  14. Tencent / Hugging Face, Hy4 preview — offizielles Model Card, abgerufen 31. August 2026.12
  15. Z.ai, GLM-5.2: Built for Long-Horizon Tasks, 16. Juni 2026.1234
  16. GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, arXiv:2602.15763, 2026.
  17. Hugging Face, zai-org/GLM-5.3, Release-Marker geprüft 31. August 2026.12
  18. OpenRouter, Z.ai: GLM 5.3, Stand 31. August 2026.
  19. OpenRouter, Z.ai: GLM 5.3 Flash, Stand 31. August 2026.123
  20. Artificial Analysis, GLM-5.3-Flash API Provider Benchmarking, Stand 31. August 2026.

War das hilfreich?

Neue Artikel per E-Mail erhalten

Eine kurze E-Mail pro neuem Wissens-Artikel. Kein Spam, Abmeldung mit einem Klick.

Wir nutzen Ihre E-Mail nur, um neue Artikel zu versenden. Keine Weitergabe an Dritte.

Zurück zu Wissen