GLM-5.3 a GLM-5.3-Flash: benchmarky, cyber schopnosti, Ox Alpha, open weights a porovnanie s Kimi K3, Hy4, Claude a GPT-5.6 Sol Skip to content

GLM-5.3 a GLM-5.3-Flash: benchmarky, cyber schopnosti, Ox Alpha, open weights a porovnanie s Kimi K3, Hy4, Claude a GPT-5.6 Sol

Overená analýza GLM-5.3 a GLM-5.3-Flash: architektúra, 1M kontext, 753B/40B a 320B/18B, multimodalita, Ox Alpha, coding a cyber benchmarky, licencie, API ceny, self-hosting a porovnanie s Kimi K3, Hy4, Claude a GPT-5.6 Sol.

Publikované Autor Čas čítania 23 min čítania

Overená analýza GLM-5.3 a GLM-5.3-Flash: architektúra, 1M kontext, 753B/40B a 320B/18B, multimodalita, Ox Alpha, coding a cyber benchmarky, licencie, API ceny, self-hosting a porovnanie s Kimi K3, Hy4, Claude a GPT-5.6 Sol.

Na tejto stránke
  1. 1TL;DR
  2. 2Čo sa stalo v auguste?
  3. 3GLM-5.3 nie je len väčší Flash
  4. 4Parametre GLM-5.3
  5. 5Flash 320B/18B
  6. 61M kontext, 128K output
  7. 7Text-only vs multimodal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T multimodal corpus
  12. 12Ox Alpha
  13. 13Zmysel stealth testu
  14. 14Post-training leap
  15. 15+50% coding
  16. 16Verejné benchmarky
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym
  22. 22ExploitBench
  23. 23ExploitGym
  24. 242 436 nálezov
  25. 25Cyber governance
  26. 26Flash benchmarky
  27. 27Flash vs Opus 4.8 private benchmark
  28. 28Artificial Analysis: 60 vs 57
  29. 29API ceny
  30. 30One-tenth price
  31. 31GLM vs Kimi K3
  32. 32GLM vs Hy4
  33. 33GLM vs GPT-5.6 Sol
  34. 34Claude Opus 5?
  35. 35Licencie
  36. 36Self-hosting
  37. 37Čínske AI čipy a 3× serving
  38. 38Čo vybrať?
  39. 39POC checklist
  40. 40Verdikt POLPROG

Koniec augusta 2026 priniesol dva veľmi odlišné modely Z.ai.

GLM-5.3 je veľký text-only reasoning model pre long-horizon engineering, coding agents a rýchlo rastúce cybersecurity schopnosti. Z.ai ho oznámila 14. augusta a verejné váhy sa na Hugging Face objavili 28. augusta po oznámenom safety evaluation/hardening období.[1][17]

GLM-5.3-Flash je výrazne lacnejší, natívne multimodálny model s novým pre-trainingom. Má 320B parametrov celkom, 18B aktívnych na token, kontext 1M, vstup text/image/video/file a verejné váhy pod MIT.[6][8][11]

Pred premiérou bol Flash anonymne testovaný ako:

Ox Alpha

na OpenCode a OpenRouter. Z.ai tvrdí, že sa stal najpopulárnejším modelom týždňa a prevádzka bežala na čínskych AI akcelerátoroch. Popularita je vendor claim.[6][7][19]

GLM-5.3 a Flash nie sú len veľká a malá verzia tej istej siete.

GLM-5.3:

~753B total podľa aktuálnych HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning vždy zapnutý
custom GLM-5.3 License

Flash:

320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT

[2][6][10][11]

Launch benchmarky sú prevažne Z.ai-reported. Agentické výsledky výrazne ovplyvňuje harness, tooling, context, timeout a inference budget.

Stav informácií: 31. augusta 2026.

TL;DR

OtázkaOverená odpoveď
GLM-5.3 oznámený14. augusta
Váhyverejné od 28. augusta
Flashkoniec augusta; AA: 26. augusta
GLM-5.3753B total, ~40B active
Flash320B/18B
GLM inputtext
Flash inputtext, image, video, file
Context1M oba
Max output128K oba
Reasoningvždy on; low, high, max; default max
GLM licenciacustom
Flash licenciaMIT
GLM API$1.40 / $0.26 / $4.40
Flash list$0.15 / $0.03 / $0.50
Flash promo$0.075 / $0.015 / $0.25 do 9. septembra
Terminal-Bench 2.188.2
Terminal-Bench 3.028.3
DeepSWE66.9
CyberGym84.5%
ExploitBench54.4%
Ox Alphapre-release Flash
Artificial Analysis60 vs 57
Hy4 vs GLMTencent 2.99 vs 2.92
Caveatagent benchmark závisí od setupu

Čo sa stalo v auguste?

Z.ai oznámila GLM-5.3 14. augusta.[1]

Model používa rovnaký base model ako GLM-5.2 a Z.ai hovorí, že všetky zisky pochádzajú z post-trainingu.[1][15]

API bolo dostupné okamžite; váhy nasledovali po dodatočnom safety hodnotení. Hugging Face uvádzal 28. augusta a dnes sú verejné.[17][5]

Flash má novú bázu, architektúru a multimodalitu.[6][8]

GLM-5.3 nie je len väčší Flash

GLM-5.3 cieli na maximálnu coding kvalitu, terminal tasks, long-horizon agents a cyber reasoning.

Flash na cenu, multimodalitu, inference efficiency, visual coding, office workflow a long context.

Flash je podľa Z.ai novo predtrénovaný model.[6][8]

Parametre GLM-5.3

Pôvodný GLM-5:

744B total
40B active

[16]

Aktuálne HF/AA metadata:

753B total
40B active

[5][10]

Keďže GLM-5.3 používa rovnakú bázu ako 5.2, 744B vs 753B berieme ako rozdiel v počítaní/metadata; pre aktuálny deployment používame 753B/40B.[1][15]

Flash 320B/18B

320B total
18B active
45 layers

[6][8]

Z.ai pre porovnanie uvádza GLM-4.5 355B/32B/92 layers.[6]

1M kontext, 128K output

Oficiálne docs:

1M context
128K max output

u oboch.[2][6]

Veľký kontext je užitočný, ale neznamená perfektnú pamäť.

Text-only vs multimodal

GLM-5.3:

Text → Text

[2]

Flash:

Text/Image/Video/File → Text

[6]

Flash je vhodný pre screenshots, GUI, dokumenty a visual coding. Artificial Analysis štandardizuje text+image vo svojom profile.[11]

Sparse + linear attention

Flash kombinuje sparse a linear attention.[6][8]

Cieľom je lacnejší long-context inference pri zachovaní lokálnych aj globálnych väzieb.

IndexPool

IndexPool komprimuje štyri cached indexer key vectors do jedného.[6]

Z.ai uvádza:

3.01× nižší attention compute
4.44× nižší KV cache

oproti GLM-5.3.[6]

Vendor claim.

mHC

Flash používa Manifold-Constrained Hyper-Connections.[6][8]

Technika má zlepšiť scaling a information flow pri nižšom active compute.

30T multimodal corpus

Z.ai uvádza 30T-token multimodal pretraining corpus.[6][8]

Flash teda dostal nový pre-training, kým GLM-5.3 zostáva na GLM-5.2 base.

Ox Alpha

ox-alpha bol anonymný pre-release Flash na OpenCode/OpenRouter.[6][19]

Z.ai jeho identitu potvrdzuje. Tvrdenie o popularite týždňa je vendor claim.[7]

Zmysel stealth testu

Anonymita znižuje brand bias, ale usage ovplyvňuje cena, promotion, routing a UI. Nie je to kontrolovaný benchmark.

Post-training leap

Rovnaká base GLM-5.2, viac environments, tasks, compute, verifiers, RL a long-horizon training.[1][15]

Framework slime prepája training, rollout a data generation.[1]

+50% coding

Z.ai claimuje +50% na private Z.ai Code Bench.[1][2]

GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K

[1]

Nie je to univerzálny 50% improvement.

Verejné benchmarky

Z.ai:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal 2.188.281.088.385.088.088.8
Terminal 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
Automation48.226.246.741.046.245.8
ALE28.523.827.625.723.828.6
HLE+Tools62.554.759.857.963.964.5
GDPval-AA176915081682158817431730

Z.ai-reported.

Terminal-Bench 3.0

4.6 → 28.3

[1][3]

Veľký skok, nie 6× inteligencia. Setup používa Claude Code, max effort, veľký context a až 600 agent turns.[3]

DeepSWE

GLM 66.9
Kimi 67.5
GPT 72.7

[3]

GLM výrazne rastie, ale nevedie.

Terminal-Bench 2.1

GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0

[3]

Prakticky tesná skupina.

Agents' Last Exam

GLM 28.5
GPT 28.6
Kimi 27.6

[3]

Opäť malý rozdiel.

CyberGym

GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%

[1][3]

White-box benchmark, nie priama simulácia ľubovoľného live attack.

ExploitBench

GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%

[1][3]

GLM skok veľký, closed frontier ďalej vedie.

ExploitGym

GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293

pre 2h/6h.[3]

Čas je normalizovaný podľa throughputu modelu.

2 436 nálezov

Z.ai uvádza:

2,436 findings
269 projektov
1,097 critical + high

[1][2]

Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]

Vendor operational data.

Cyber governance

Defenzívne môže pomôcť s code review, triage, patch analysis, fuzzing a threat modeling.

Nutný sandbox, network isolation, logging, approval gates a minimálne credentials.

Flash benchmarky

Z.ai:[7][8]

BenchmarkFlashGLM-5.2
Terminal 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
Automation48.826.2
ALE26.320.4
HLE+Tools55.354.7
GDPval-AA17731504

Hlavná výhoda: price/performance.

Flash vs Opus 4.8 private benchmark

Flash 29.0
Opus 4.8 29.5

[6]

Súkromný Z.ai benchmark nie je dôkaz všeobecnej parity.

Artificial Analysis: 60 vs 57

GLM-5.3 max 60
Flash 57

[10][11][12]

Aktuálne:

GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT

[10][11][20]

Flash teda neznamená najvyšší output speed; výhodou je cena a compute.

API ceny

Z.ai:[9]

GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25

Promo do 9. septembra. OpenRouter ponúka oba modely s možnými odlišnosťami provider pricing.[18][19]

One-tenth price

Flash je listovo asi 9.3× lacnejší na input a 8.8× na output.[9]

Marketing „zhruba desatina“ je rozumný, task cost závisí od reasoning a tools.

GLM vs Kimi K3

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

[3]

Žiadny univerzálny víťaz.

GLM vs Hy4

Tencent: 163 expertov, 203 tasks.[13][14]

Hy4 2.99
Kimi 2.94
GLM 2.92

Hy4 vs GLM 46.8% wins / 12.8 ties / 40.4 losses.[14]

Interný Tencent workload.

GLM vs GPT-5.6 Sol

TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5

[3]

GLM vedie tesne CyberGym a AutomationBench. Zmiešaný obraz.

Claude Opus 5?

Z.ai launch table obsahuje najmä Opus 4.8 a Fable 5, nie Opus 5.[3]

Nemožno z nej tvrdiť GLM-5.3 > Claude Opus 5.

Licencie

Flash je MIT.[8][11]

GLM-5.3 má custom license.[4]

Umožňuje široké komerčné použitie, ale MaaS subjekt s viac než $10B agregovaného revenue za 12 po sebe idúcich mesiacov musí pred komerčným použitím prejsť Z.ai security review.[4]

Self-hosting

Podpora zahŕňa vLLM, SGLang, Transformers a Docker Model Runner.[3][8]

GLM repo má približne:

756 GB
141 safetensors shards

[5]

Čínske AI čipy a 3× serving

Z.ai hovorí, že Flash/Ox Alpha bežal na čínskych accelerators.[6][7]

Uvádza Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split a EPD disaggregation a claimuje 3× end-to-end serving performance oproti počiatočnému baseline na rovnakom hardware.[6][7]

Vendor claim.

Čo vybrať?

GLM-5.3 pre maximálny GLM coding, terminal agents, text reasoning a security.

Flash pre cenu, vision, dokumenty, video/file, 1M context a MIT.

Ostatné modely, ak vlastný POC dá lepší:

cost per successful task

POC checklist

Kvalita

  • Reálne tasky.
  • Rovnaký harness.
  • Test pass rate.
  • Task completion.
  • Regresie.
  • Out-of-scope changes.
  • Dlhé sessions.
  • Recovery.
  • Tool calling.
  • Structured output.

Reasoning

  • low, high, max.
  • Reasoning nemožno vypnúť.
  • Reasoning tokens.
  • Total output.
  • Latency.
  • max nie vždy.

Long context

  • 32K.
  • 128K.
  • 256K.
  • 1M.
  • Retrieval accuracy.
  • Instruction loss.
  • Veľké repo.
  • Cross-file dependencies.
  • KV cache/concurrency.
  • 1M nie je perfektná pamäť.

Flash multimodal

  • Screenshots.
  • Dokumenty.
  • Charts.
  • OCR-like workflow.
  • GUI verification.
  • Video.

Security

  • Sandbox.
  • Network limit.
  • Tool logs.
  • Approval gates.
  • Oddeliť secrets.
  • Minimum credentials.
  • Validovať patch.
  • Model nie je autonómna security autorita.

Licencia a prevádzka

  • GLM license.
  • MaaS >$10B.
  • MIT Flash.
  • Data policy.
  • Processing region.
  • Retention.
  • Cache hit.
  • Cost per successful task.
  • Fallback.
  • Cena po promo.

Verdikt POLPROG

GLM-5.3 je významný najmä post-training skok rovnakej base ako GLM-5.2.[1][15]

TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4

[1][3]

Flash ponúka 320B/18B, multimodalitu, 1M context, MIT a veľmi nízku cenu. Artificial Analysis mu dáva 57 oproti 60 GLM-5.3 max.[10][11][12]

Pre veľa produktov môže byť Flash praktickejší.

Rozhodovať by mal vlastný cost per successful task, nie jeden leaderboard.

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Často kladené otázky

Release GLM-5.3?
  1. augusta oznámený, váhy od 28.
Open source?

Presnejšie open weights pod custom licenciou.

Flash?

MIT.

Parametre?

GLM ~753B/40B; Flash 320B/18B.

Context?

1M.

Output?

128K.

Vision?

GLM text-only; Flash multimodal.

Reasoning off?

Nie.

Levels?

low, high, max.

Ox Alpha?

Pre-release Flash.

Lepší než Kimi?

Nie vo všetkom.

Lepší než Hy4?

Tencent dal Hy4 2.99, GLM 2.92.

Lepší než GPT?

Nie všeobecne.

Opus 5?

Z.ai launch table to nepreukazuje.

CyberGym 84.5% = najlepší security?

Nie.

GLM cena?

$1.40/$0.26/$4.40.

Flash?

$0.15/$0.03/$0.50, promo polovica.

Self-hosting?

Áno, hardware náročný.

Produkcia?

Vlastný POC.

Zdroje a poznámky

  1. Z.ai, GLM-5.3, 14. augusta 2026.123456789101112131415
  2. Z.ai Docs, GLM-5.3, prístup 31. augusta 2026.12345
  3. Hugging Face, GLM-5.3 model card, prístup 31. augusta 2026.1234567891011121314
  4. GLM-5.3 License, prístup 31. augusta 2026.12
  5. GLM-5.3 files, prístup 31. augusta 2026.123
  6. Z.ai Docs, GLM-5.3-Flash, prístup 31. augusta 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash, august 2026.12345
  8. Hugging Face, GLM-5.3-Flash model card, prístup 31. augusta 2026.12345678910
  9. Z.ai Pricing, prístup 31. augusta 2026.12
  10. Artificial Analysis, GLM-5.3, stav 31. augusta 2026.12345
  11. Artificial Analysis, Flash, stav 31. augusta 2026.1234567
  12. Artificial Analysis comparison, stav 31. augusta 2026.12
  13. Tencent Hy4 launch, 28. augusta 2026.
  14. Tencent Hy4 model card, prístup 31. augusta 2026.12
  15. Z.ai, GLM-5.2, 16. júna 2026.1234
  16. GLM-5 technical report, 2026.
  17. Hugging Face, GLM-5.3, release marker overený 31. augusta 2026.12
  18. OpenRouter, GLM 5.3, stav 31. augusta 2026.
  19. OpenRouter, GLM 5.3 Flash, stav 31. augusta 2026.123
  20. Artificial Analysis, Flash provider benchmarks, stav 31. augusta 2026.

Bolo to užitočné?

Získavajte nové články e-mailom

Jeden krátky e-mail na každý nový článok Vzdelávania. Žiadny spam, odhlásenie jedným kliknutím.

Váš e-mail používame len na zasielanie nových článkov. Žiadne zdieľanie s tretími stranami.

Späť na Vzdelávanie