GLM-5.3 en GLM-5.3-Flash: benchmarks, cybercapaciteiten, Ox Alpha, open weights en vergelijking met Kimi K3, Hy4, Claude en GPT-5.6 Sol Skip to content

GLM-5.3 en GLM-5.3-Flash: benchmarks, cybercapaciteiten, Ox Alpha, open weights en vergelijking met Kimi K3, Hy4, Claude en GPT-5.6 Sol

Geverifieerde analyse van GLM-5.3 en GLM-5.3-Flash: architectuur, 1M context, 753B/40B en 320B/18B, multimodaliteit, Ox Alpha, coding- en cyberbenchmarks, licenties, API-prijzen, self-hosting en vergelijking met Kimi K3, Hy4, Claude en GPT-5.6 Sol.

Gepubliceerd Geschreven door Leestijd 23 min lezen

Geverifieerde analyse van GLM-5.3 en GLM-5.3-Flash: architectuur, 1M context, 753B/40B en 320B/18B, multimodaliteit, Ox Alpha, coding- en cyberbenchmarks, licenties, API-prijzen, self-hosting en vergelijking met Kimi K3, Hy4, Claude en GPT-5.6 Sol.

Op deze pagina
  1. 1TL;DR
  2. 2Wat gebeurde er in augustus?
  3. 3GLM-5.3 is niet simpelweg een grotere Flash
  4. 4Hoeveel parameters heeft GLM-5.3?
  5. 5Flash: 320B total, 18B actief
  6. 61M context en 128K output
  7. 7Text-only versus multimodaal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T multimodale pretrainingtokens
  12. 12Ox Alpha was Flash
  13. 13Waarom is de stealthtest interessant?
  14. 14De sprong komt uit post-training
  15. 15Wat betekent +50% coding?
  16. 16Publieke benchmarks
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym
  22. 22ExploitBench
  23. 23ExploitGym
  24. 242.436 vulnerability findings
  25. 25Cybercapaciteit vraagt governance
  26. 26Flash-benchmarks
  27. 27Flash vs Opus 4.8 op private Code Bench
  28. 28Artificial Analysis: 60 vs 57
  29. 29API-prijzen
  30. 30“One-tenth the price”
  31. 31GLM-5.3 vs Kimi K3
  32. 32GLM-5.3 vs Hy4
  33. 33GLM-5.3 vs GPT-5.6 Sol
  34. 34En Claude Opus 5?
  35. 35Open weights en licenties
  36. 36Self-hosting
  37. 37Chinese AI-chips en 3× serving
  38. 38Welk model kiezen?
  39. 39POC-checklist
  40. 40POLPROG-oordeel

Eind augustus 2026 bracht Z.ai twee zeer verschillende modellen uit dezelfde generatie.

GLM-5.3 is het grote text-only reasoningmodel voor long-horizon engineering, coding agents en sterk verbeterde cybersecuritycapaciteiten. Z.ai kondigde het model op 14 augustus aan; de publieke weights kwamen op 28 augustus beschikbaar na de aangekondigde safety evaluation en hardening.[1][17]

GLM-5.3-Flash is veel goedkoper, native multimodaal en op een nieuwe basis getraind. Het model heeft 320B totale parameters, 18B actief per token, 1M context, text/image/video/file input en publieke weights onder MIT.[6][8][11]

Voor de officiële release werd Flash anoniem getest als:

Ox Alpha

op OpenCode en OpenRouter. Z.ai zegt dat het snel het populairste model van de week werd en op Chinese AI-accelerators werd geserveerd; die populariteitsclaim is vendor-reported.[6][7][19]

De twee modellen zijn niet simpelweg een grote en kleine versie van hetzelfde netwerk.

GLM-5.3:

~753B total volgens actuele HF/AA metadata
~40B actief
text-only
1M context
128K max output
reasoning altijd aan
custom GLM-5.3 License

Flash:

320B total
18B actief
native multimodal
1M context
128K max output
sparse + linear attention
MIT

[2][6][10][11]

Launchbenchmarks zijn voornamelijk Z.ai-reported. Bij agents hebben harness, tools, context, timeout en inferencebudget grote invloed.

Informatiestatus: 31 augustus 2026.

TL;DR

VraagGeverifieerd antwoord
GLM-5.3 aangekondigd14 augustus 2026
Publieke weightsvanaf 28 augustus
Flasheind augustus; Artificial Analysis: 26 augustus
GLM-5.3753B total in HF/AA, ~40B actief
Flash320B total, 18B actief
GLM-5.3 inputtext
Flash inputtext, image, video, file
Context1M beide
Max output128K beide
Reasoningaltijd aan; low, high, max; default max
GLM-5.3 licentiecustom GLM-5.3 License
Flash licentieMIT
GLM-5.3 API$1.40 input / $0.26 cached / $4.40 output per 1M
Flash list$0.15 / $0.03 / $0.50
Flash promo t/m 9 september$0.075 / $0.015 / $0.25
Terminal-Bench 2.188.2, Z.ai-reported
Terminal-Bench 3.028.3
DeepSWE66.9
CyberGym84.5%
ExploitBench54.4%
Ox Alphapre-release-identiteit van Flash
Artificial AnalysisGLM-5.3 60, Flash 57
Hy4 vs GLMTencent intern 2.99 vs 2.92
Caveatagentbenchmarks zijn setup-afhankelijk

Wat gebeurde er in augustus?

Z.ai kondigde GLM-5.3 op 14 augustus aan.[1]

Opvallend: dezelfde base model als GLM-5.2. Volgens Z.ai komt alle winst uit post-training.[1][15]

De API was meteen beschikbaar; weights volgden na extra safety checks. Hugging Face markeerde 28 augustus als releasepunt en de weights zijn nu publiek.[17][5]

Flash gebruikt daarentegen een nieuwe basis, nieuwe architectuur en native multimodaliteit.[6][8]

GLM-5.3 is niet simpelweg een grotere Flash

GLM-5.3 richt zich op maximale codingkwaliteit, terminalwerk, long-horizon agents en cyber reasoning.

Flash richt zich op lagere kosten, multimodaliteit, inference-efficiency, visual coding, office workflows en lang context.

Volgens Z.ai is Flash vanaf een nieuwe base getraind.[6][8]

Hoeveel parameters heeft GLM-5.3?

De oorspronkelijke GLM-5-architectuur werd beschreven als:

744B total
40B active

[16]

Actuele HF/Artificial Analysis metadata:

753B total
40B active

[5][10]

Omdat GLM-5.3 dezelfde basis als GLM-5.2 gebruikt, behandelen we 744B vs 753B als tel-/implementatieverschil en gebruiken we 753B/40B voor actuele deployments.[1][15]

Flash: 320B total, 18B actief

Z.ai:

320B total
18B active
45 layers

[6][8]

Ter vergelijking: GLM-4.5 355B total, 32B active en 92 layers.[6]

1M context en 128K output

Z.ai docs geven beide modellen:

1M context
128K maximum output

[2][6]

Dat helpt bij grote repositories en lange agentsessies. Maar 1M context is geen perfecte 1M-token memory; retrieval moet praktisch worden getest.

Text-only versus multimodaal

GLM-5.3:

Input: Text
Output: Text

[2]

Flash:

Input: Text, Image, Video, File
Output: Text

[6]

Flash is dus geschikter voor screenshots, GUI's, documenten, PDF's, slides en visual coding. Artificial Analysis standaardiseert zijn eigen profiel momenteel op text+image.[11]

Sparse + linear attention

Flash combineert sparse attention en linear attention.[6][8]

Linear attention verwerkt meer lokale dependencies via state modeling; sparse attention haalt relevante globale context op.

Doel: lagere inferencekosten bij lange context.

IndexPool

Flash introduceert:

IndexPool

[6]

Vier gecachte indexer-key-vectors worden naar één vector gepoold.

Z.ai claimt versus GLM-5.3:

3.01× minder attention compute
4.44× minder KV cache

[6]

Vendor-reported, niet onafhankelijk gerepliceerd.

mHC

Flash gebruikt:

Manifold-Constrained Hyper-Connections

[6][8]

Dit moet information flow en scaling efficiency verbeteren zodat 18B actieve parameters veel capaciteit behouden.

30T multimodale pretrainingtokens

Z.ai noemt:

30T-token multimodal corpus

[6][8]

GLM-5.3 behoudt de GLM-5.2-basis en verbetert via post-training; Flash krijgt nieuwe pretraining.

Ox Alpha was Flash

Voor de officiële naam draaide:

ox-alpha

op OpenCode en OpenRouter.[6][19]

Z.ai bevestigt dat dit GLM-5.3-Flash was. “Populairste model van de week” blijft een vendor claim.[7]

Waarom is de stealthtest interessant?

Een anonieme naam vermindert merkbias.

Maar gebruik hangt ook af van prijs, promotie, routing, UI en beschikbaarheid. Het is dus een adoption-signal, geen gecontroleerde kwaliteitstest.

De sprong komt uit post-training

GLM-5.3 houdt dezelfde base als GLM-5.2.[1][15]

Z.ai schaalde environments, task diversity, post-training compute, long-horizon tasks, verifiers, reinforcement learning en automatische environment generation.

Het open-source framework slime verbindt training, rollout en data generation.[1]

Wat betekent +50% coding?

Z.ai claimt:

+50% vs GLM-5.2

[1][2]

Dit verwijst naar private Z.ai Code Bench.

Max effort:

GLM-5.3: 34.5%, ~75K output tokens
GLM-5.2: 23.4%, ~96K output tokens

[1]

Niet 50% beter op iedere programmeertaak.

Publieke benchmarks

Z.ai:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
AutomationBench48.226.246.741.046.245.8
Agents' Last Exam28.523.827.625.723.828.6
HLE + Tools62.554.759.857.963.964.5
GDPval-AA v2176915081682158817431730

Allemaal Z.ai-reported.

Terminal-Bench 3.0

4.6 → 28.3

van GLM-5.2 naar 5.3.[1][3]

Dat is geen “6× intelligenter”. De harness gebruikt onder andere Claude Code 2.1.207, max effort, grote context en tot 600 agent turns.[3]

DeepSWE

GLM-5.3 66.9
Kimi K3 67.5
GPT-5.6 Sol 72.7

[3]

Grote verbetering, maar geen eerste plaats.

Terminal-Bench 2.1

GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0

[3]

Vrijwel gelijk.

Agents' Last Exam

GLM 28.5
GPT 28.6
Kimi 27.6

[3]

Opnieuw kleine verschillen.

CyberGym

GLM-5.3 84.5%
GPT-5.6 Sol 83.6%
Fable 5 83.8%
Kimi K3 80.0%
GLM-5.2 77.2%

[1][3]

CyberGym start met white-box source code. Het is geen directe simulatie van willekeurige live attacks.

ExploitBench

GLM-5.3 54.4%
GLM-5.2 24.4%
Kimi K3 32.2%
Opus 4.8 40.0%
Fable 5 78.0%
GPT-5.6 Sol 76.5%

[1][3]

GLM springt sterk, closed frontier blijft hoger.

ExploitGym

2h/6h completed tasks:

GLM 105 / 130
Kimi 36 / 70
Fable 181 / 247
GPT 216 / 293

[3]

Z.ai normaliseert tijd op model-throughput. Het is dus een specifieke methodologie.

2.436 vulnerability findings

Z.ai rapporteert:

2,436 findings
269 projecten
1,097 critical + high

[1][2]

Ledger:

53 publiek
2,383 embargo
107 critical
990 high
1,286 medium
53 low

[1]

Dit zijn vendor operational data, geen onafhankelijk CVE-register.

Cybercapaciteit vraagt governance

Defensieve toepassingen: secure code review, triage, controlled reproduction, SAST augmentation, patch analysis, fuzzing en threat modeling.

Gebruik sandboxing, network isolation, logging, approval gates en minimale credentials.

Flash-benchmarks

Z.ai:[7][8]

BenchmarkFlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
AutomationBench48.826.2
Agents' Last Exam26.320.4
HLE + Tools55.354.7
GDPval-AA v217731504

De kern is de kwaliteit/prijs-verhouding.

Flash vs Opus 4.8 op private Code Bench

Flash 29.0
Opus 4.8 29.5

[6]

Private vendorbenchmark, dus geen bewijs van algemene gelijkwaardigheid.

Artificial Analysis: 60 vs 57

GLM-5.3 max 60
Flash 57

[10][11][12]

First-party API-metingen:

GLM ~66.5 tokens/s, ~1.6s TTFT
Flash ~45–49 tokens/s, ~1.5s TTFT

[10][11][20]

Flash betekent dus niet automatisch hogere tokens/s; voordeel zit vooral in kosten, active compute en multimodaliteit.

API-prijzen

Z.ai:[9]

GLM-5.3:
$1.40 input
$0.26 cached
$4.40 output

Flash list:
$0.15 / $0.03 / $0.50

Flash promo t/m 9 september:
$0.075 / $0.015 / $0.25

per 1M tokens.

OpenRouter biedt beide modellen ook aan en kan andere pricing/routing hebben.[18][19]

“One-tenth the price”

Flash is op list price ongeveer:

9.3× goedkoper input
8.8× goedkoper output

[9]

“Ongeveer een tiende” is dus redelijk. End-to-end task cost hangt ook af van reasoning en tool calls.

GLM-5.3 vs Kimi K3

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
AutomationBench 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

[3]

Geen universele winnaar.

GLM-5.3 vs Hy4

Tencent: 163 experts, 203 engineeringtasks.[13][14]

Hy4 2.99
Kimi 2.94
GLM 2.92

Hy4 vs GLM:

46.8% wins
12.8% ties
40.4% losses

[14]

Tencent-interne evaluatie, geen universele ranglijst.

GLM-5.3 vs GPT-5.6 Sol

Z.ai:[3]

TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym 6h 130 vs 293
HLE+Tools 62.5 vs 64.5

GLM is iets hoger op CyberGym en AutomationBench. Gemengd beeld.

En Claude Opus 5?

De launchtabel vergelijkt vooral Opus 4.8 en Fable 5, niet Opus 5.[3]

Dus er is geen basis voor:

GLM-5.3 > Claude Opus 5

Open weights en licenties

Flash:

MIT

[8][11]

GLM-5.3:

custom GLM-5.3 License

[4]

De licentie geeft brede commerciële rechten, maar MaaS-operators met meer dan $10B aggregate revenue in 12 opeenvolgende maanden moeten vóór commercieel gebruik een Z.ai security review passeren.[4]

Self-hosting

Officiële routes:

vLLM
SGLang
Transformers
Docker Model Runner

en andere frameworks.[3][8]

GLM-5.3 repo:

~756 GB
141 safetensors shards

[5]

Flash is compute-efficiënter maar nog steeds groot.

Chinese AI-chips en 3× serving

Z.ai zegt dat Flash/Ox Alpha op Chinese accelerators draaide.[6][7]

Technieken:

Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 cache
Layer Split
Encode–Prefill–Decode disaggregation

Vendor claim:

3× end-to-end serving
vs initial baseline op dezelfde hardware

[6][7]

Onafhankelijke validatie blijft nodig.

Welk model kiezen?

GLM-5.3 voor maximale GLM-codingkwaliteit, terminal agents, text reasoning en security analysis.

Flash voor kosten, vision, screenshots, documenten, video/file, 1M context en MIT.

Andere modellen wanneer de eigen POC een betere:

cost per successful task

oplevert.

POC-checklist

Kwaliteit

  • Echte interne taken.
  • Zelfde harness.
  • Test pass rate.
  • Task completion.
  • Regressies.
  • Out-of-scope changes.
  • Lange sessies.
  • Recovery.
  • Tool calling.
  • Structured output.

Reasoning

  • low, high, max vergelijken.
  • Reasoning kan niet uit.
  • Reasoning tokens meten.
  • Total output meten.
  • End-to-end latency meten.
  • max niet overal gebruiken.

Long context

  • 32K testen.
  • 128K testen.
  • 256K testen.
  • 1M testen.
  • Retrieval accuracy.
  • Instruction loss.
  • Grote repos.
  • Cross-file dependencies.
  • KV cache/concurrency.
  • 1M is geen perfect geheugen.

Flash multimodal

  • Screenshots.
  • Documenten.
  • Charts.
  • OCR-like workflows.
  • GUI verification.
  • Video.

Security

  • Sandbox cyber.
  • Network beperken.
  • Tool calls loggen.
  • Approval gates.
  • Production secrets scheiden.
  • Credentials minimaliseren.
  • Patches valideren.
  • Model niet als autonome securityautoriteit gebruiken.

Licentie en operations

  • GLM-5.3 License lezen.
  • MaaS >$10B-clausule controleren.
  • MIT Flash controleren.
  • Provider data policy.
  • Processing region.
  • Retention.
  • Cache hit rate.
  • Cost per successful task.
  • Fallback model.
  • Flashprijs na promo monitoren.

POLPROG-oordeel

GLM-5.3 is vooral interessant omdat dezelfde GLM-5.2-basis via post-training veel verder is gebracht.[1][15]

Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4

[1][3]

Flash kiest:

320B total
18B active
multimodal
1M context
MIT
lage API-prijs

en scoort onafhankelijk 57 bij Artificial Analysis versus 60 voor GLM-5.3 max.[10][11][12]

Voor veel producten kan Flash daardoor interessanter zijn dan het flagship.

De juiste vraag is:

welk model levert de beste cost per successful task met voldoende kwaliteit, veiligheid en latency?

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Veelgestelde vragen

Releasedatum GLM-5.3?

14 augustus aangekondigd, weights vanaf 28 augustus.

Open source?

Nauwkeuriger: open weights onder custom GLM-5.3 License.

Flash?

Publieke weights onder MIT.

Parameters GLM-5.3?

~753B/40B actueel; originele GLM-5-headline 744B/40B.

Flash?

320B/18B.

Context?

1M.

Max output?

128K.

Vision?

GLM text-only; Flash multimodal.

Reasoning uitzetten?

Nee.

Levels?

low, high, max.

Ox Alpha?

Anonieme pre-release-identiteit van Flash.

Beter dan Kimi?

Niet overal.

Beter dan Hy4?

Tencent gaf Hy4 2.99 en GLM 2.92.

Beter dan GPT-5.6 Sol?

Niet algemeen.

Beter dan Opus 5?

Niet bewezen door Z.ai-launchdata.

84.5% CyberGym = beste security model?

Nee.

GLM-prijs?

$1.40 / $0.26 / $4.40.

Flash-prijs?

$0.15 / $0.03 / $0.50; promo $0.075 / $0.015 / $0.25.

Self-hosting?

Ja, met forse hardware.

Productiekeuze?

Eigen POC met kwaliteit, latency, tokens, tools en cost per successful task.

Bronnen en voetnoten

  1. Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, 14 augustus 2026, geraadpleegd 31 augustus 2026.123456789101112131415
  2. Z.ai Developer Docs, GLM-5.3 — Overview, geraadpleegd 31 augustus 2026.12345
  3. Z.ai / Hugging Face, GLM-5.3 — officiële model card, geraadpleegd 31 augustus 2026.1234567891011121314
  4. Z.ai / Hugging Face, GLM-5.3 License, geraadpleegd 31 augustus 2026.12
  5. Hugging Face, zai-org/GLM-5.3 — files and versions, geraadpleegd 31 augustus 2026.123
  6. Z.ai Developer Docs, GLM-5.3-Flash — Overview, geraadpleegd 31 augustus 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, augustus 2026, geraadpleegd 31 augustus 2026.12345
  8. Z.ai / Hugging Face, GLM-5.3-Flash — officiële model card, geraadpleegd 31 augustus 2026.12345678910
  9. Z.ai Developer Docs, Pricing, geraadpleegd 31 augustus 2026.12
  10. Artificial Analysis, GLM-5.3 (max), status 31 augustus 2026.12345
  11. Artificial Analysis, GLM-5.3-Flash, status 31 augustus 2026.1234567
  12. Artificial Analysis, GLM-5.3-Flash vs GLM-5.3, status 31 augustus 2026.12
  13. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 augustus 2026.
  14. Tencent / Hugging Face, Hy4 preview — officiële model card, geraadpleegd 31 augustus 2026.12
  15. Z.ai, GLM-5.2: Built for Long-Horizon Tasks, 16 juni 2026.1234
  16. GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, arXiv:2602.15763, 2026.
  17. Hugging Face, zai-org/GLM-5.3, release marker gecontroleerd 31 augustus 2026.12
  18. OpenRouter, Z.ai: GLM 5.3, status 31 augustus 2026.
  19. OpenRouter, Z.ai: GLM 5.3 Flash, status 31 augustus 2026.123
  20. Artificial Analysis, GLM-5.3-Flash API Provider Benchmarking, status 31 augustus 2026.

Was dit nuttig?

Ontvang nieuwe artikelen per e-mail

Eén korte e-mail per nieuw blogartikel. Geen spam, uitschrijven in één klik.

We gebruiken je e-mail alleen om nieuwe artikelen te sturen. Geen delen met derden.

Terug naar de blog