GLM-5.3 a GLM-5.3-Flash: benchmarky, cyber schopnosti, Ox Alpha, open weights a srovnání s Kimi K3, Hy4, Claude a GPT-5.6 Sol Skip to content

GLM-5.3 a GLM-5.3-Flash: benchmarky, cyber schopnosti, Ox Alpha, open weights a srovnání s Kimi K3, Hy4, Claude a GPT-5.6 Sol

Ověřená analýza GLM-5.3 a GLM-5.3-Flash: architektura, 1M kontext, 753B/40B a 320B/18B, multimodalita, Ox Alpha, coding a cyber benchmarky, licence, API ceny, self-hosting a srovnání s Kimi K3, Hy4, Claude a GPT-5.6 Sol.

Publikováno Autor Čas čtení 23 min čtení

Ověřená analýza GLM-5.3 a GLM-5.3-Flash: architektura, 1M kontext, 753B/40B a 320B/18B, multimodalita, Ox Alpha, coding a cyber benchmarky, licence, API ceny, self-hosting a srovnání s Kimi K3, Hy4, Claude a GPT-5.6 Sol.

Na této stránce
  1. 1TL;DR
  2. 2Co se stalo v srpnu?
  3. 3GLM-5.3 není jen větší Flash
  4. 4Parametry GLM-5.3
  5. 5Flash 320B/18B
  6. 61M kontext, 128K output
  7. 7Text-only vs multimodal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T multimodal corpus
  12. 12Ox Alpha
  13. 13Smysl stealth testu
  14. 14Post-training leap
  15. 15+50% coding
  16. 16Veřejné benchmarky
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym
  22. 22ExploitBench
  23. 23ExploitGym
  24. 242 436 nálezů
  25. 25Cyber governance
  26. 26Flash benchmarky
  27. 27Flash vs Opus 4.8 private benchmark
  28. 28Artificial Analysis: 60 vs 57
  29. 29API ceny
  30. 30One-tenth price
  31. 31GLM vs Kimi K3
  32. 32GLM vs Hy4
  33. 33GLM vs GPT-5.6 Sol
  34. 34Claude Opus 5?
  35. 35Licence
  36. 36Self-hosting
  37. 37Čínské AI čipy a 3× serving
  38. 38Co vybrat?
  39. 39POC checklist
  40. 40Verdikt POLPROG

Konec srpna 2026 přinesl dva velmi odlišné modely Z.ai.

GLM-5.3 je velký text-only reasoning model pro long-horizon engineering, coding agents a rychle rostoucí cybersecurity schopnosti. Z.ai jej oznámila 14. srpna a veřejné váhy se na Hugging Face objevily 28. srpna po oznámeném safety evaluation/hardening období.[1][17]

GLM-5.3-Flash je výrazně levnější, nativně multimodální model s novým pre-trainingem. Má 320B parametrů celkem, 18B aktivních na token, kontext 1M, vstup text/image/video/file a veřejné váhy pod MIT.[6][8][11]

Před premiérou byl Flash anonymně testován jako:

Ox Alpha

na OpenCode a OpenRouter. Z.ai tvrdí, že se stal nejpopulárnějším modelem týdne a provoz běžel na čínských AI akcelerátorech. Popularita je vendor claim.[6][7][19]

GLM-5.3 a Flash nejsou jen velká a malá verze stejné sítě.

GLM-5.3:

~753B total podle aktuálních HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning vždy zapnutý
custom GLM-5.3 License

Flash:

320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT

[2][6][10][11]

Launch benchmarky jsou hlavně Z.ai-reported. Agentické výsledky zásadně ovlivňuje harness, tooling, context, timeout a inference budget.

Stav informací: 31. srpna 2026.

TL;DR

OtázkaOvěřená odpověď
GLM-5.3 oznámen14. srpna
Váhyveřejné od 28. srpna
Flashkonec srpna; AA: 26. srpna
GLM-5.3753B total, ~40B active
Flash320B/18B
GLM inputtext
Flash inputtext, image, video, file
Context1M oba
Max output128K oba
Reasoningvždy on; low, high, max; default max
GLM licencecustom
Flash licenceMIT
GLM API$1.40 / $0.26 / $4.40
Flash list$0.15 / $0.03 / $0.50
Flash promo$0.075 / $0.015 / $0.25 do 9. září
Terminal-Bench 2.188.2
Terminal-Bench 3.028.3
DeepSWE66.9
CyberGym84.5%
ExploitBench54.4%
Ox Alphapre-release Flash
Artificial Analysis60 vs 57
Hy4 vs GLMTencent 2.99 vs 2.92
Caveatagent benchmark závisí na setupu

Co se stalo v srpnu?

Z.ai oznámila GLM-5.3 14. srpna.[1]

Model používá stejný base model jako GLM-5.2 a Z.ai říká, že všechny zisky pocházejí z post-trainingu.[1][15]

API bylo dostupné okamžitě; váhy následovaly po bezpečnostním hodnocení. Hugging Face uváděl 28. srpna a dnes jsou veřejné.[17][5]

Flash má novou bázi, architekturu a multimodalitu.[6][8]

GLM-5.3 není jen větší Flash

GLM-5.3 míří na maximální coding kvalitu, terminal tasks, long-horizon agents a cyber reasoning.

Flash na cenu, multimodalitu, inference efficiency, visual coding, office workflow a long context.

Flash je podle Z.ai nově předtrénovaný model.[6][8]

Parametry GLM-5.3

Původní GLM-5:

744B total
40B active

[16]

Aktuální HF/AA metadata:

753B total
40B active

[5][10]

Protože GLM-5.3 používá stejnou bázi jako 5.2, jde zřejmě o rozdíl v počítání/metadata; pro aktuální deployment používáme 753B/40B.[1][15]

Flash 320B/18B

320B total
18B active
45 layers

[6][8]

Z.ai pro srovnání uvádí GLM-4.5 355B/32B/92 layers.[6]

1M kontext, 128K output

Oficiální docs:

1M context
128K max output

u obou.[2][6]

Velký kontext je užitečný, ale neznamená perfektní paměť.

Text-only vs multimodal

GLM-5.3:

Text → Text

[2]

Flash:

Text/Image/Video/File → Text

[6]

Flash je vhodný pro screenshots, GUI, dokumenty a visual coding. Artificial Analysis standardizuje text+image ve svém profilu.[11]

Sparse + linear attention

Flash kombinuje sparse a linear attention.[6][8]

Cílem je levnější long-context inference při zachování lokálních i globálních závislostí.

IndexPool

IndexPool komprimuje čtyři cached indexer key vectors do jednoho.[6]

Z.ai uvádí:

3.01× nižší attention compute
4.44× nižší KV cache

proti GLM-5.3.[6]

Vendor claim.

mHC

Flash používá Manifold-Constrained Hyper-Connections.[6][8]

Technika má zlepšit scaling a information flow při nižším aktivním compute.

30T multimodal corpus

Z.ai uvádí 30T-token multimodal pretraining corpus.[6][8]

Flash tedy dostal nový pre-training, zatímco GLM-5.3 zůstává na GLM-5.2 base.

Ox Alpha

ox-alpha byl anonymní pre-release Flash na OpenCode/OpenRouter.[6][19]

Z.ai jeho identitu potvrzuje. Tvrzení o popularitě týdne je vendor claim.[7]

Smysl stealth testu

Anonymita snižuje brand bias, ale usage ovlivňuje cena, promotion, routing a UI. Není to kontrolovaný benchmark.

Post-training leap

Stejná base GLM-5.2, více environments, tasks, compute, verifiers, RL a long-horizon training.[1][15]

Framework slime propojuje training, rollout a data generation.[1]

+50% coding

Z.ai claimuje +50% na private Z.ai Code Bench.[1][2]

GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K

[1]

Nejde o univerzální 50% improvement.

Veřejné benchmarky

Z.ai:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal 2.188.281.088.385.088.088.8
Terminal 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
Automation48.226.246.741.046.245.8
ALE28.523.827.625.723.828.6
HLE+Tools62.554.759.857.963.964.5
GDPval-AA176915081682158817431730

Z.ai-reported.

Terminal-Bench 3.0

4.6 → 28.3

[1][3]

Velký skok, ne 6× inteligence. Setup používá Claude Code, max effort, velký context a až 600 agent turns.[3]

DeepSWE

GLM 66.9
Kimi 67.5
GPT 72.7

[3]

GLM výrazně roste, ale nevede.

Terminal-Bench 2.1

GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0

[3]

Prakticky těsná skupina.

Agents' Last Exam

GLM 28.5
GPT 28.6
Kimi 27.6

[3]

Opět malý rozdíl.

CyberGym

GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%

[1][3]

White-box benchmark, ne přímá simulace libovolného live attack.

ExploitBench

GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%

[1][3]

GLM skok velký, closed frontier dál vede.

ExploitGym

GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293

pro 2h/6h.[3]

Čas je normalizován podle throughputu modelu.

2 436 nálezů

Z.ai uvádí:

2,436 findings
269 projektů
1,097 critical + high

[1][2]

Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]

Vendor operational data.

Cyber governance

Defenzivně může pomoci s code review, triage, patch analysis, fuzzing a threat modeling.

Nutný sandbox, network isolation, logging, approval gates a minimální credentials.

Flash benchmarky

Z.ai:[7][8]

BenchmarkFlashGLM-5.2
Terminal 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
Automation48.826.2
ALE26.320.4
HLE+Tools55.354.7
GDPval-AA17731504

Hlavní výhoda: price/performance.

Flash vs Opus 4.8 private benchmark

Flash 29.0
Opus 4.8 29.5

[6]

Soukromý benchmark Z.ai není důkaz obecné parity.

Artificial Analysis: 60 vs 57

GLM-5.3 max 60
Flash 57

[10][11][12]

Aktuálně:

GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT

[10][11][20]

Flash tedy neznamená nejvyšší output speed; výhodou je cena a compute.

API ceny

Z.ai:[9]

GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25

Promo do 9. září. OpenRouter nabízí oba modely s možnými odlišnostmi provider pricing.[18][19]

One-tenth price

Flash je listově asi 9.3× levnější na input a 8.8× na output.[9]

Marketing „zhruba desetina“ je rozumný, task cost závisí na reasoning a tools.

GLM vs Kimi K3

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

[3]

Žádný univerzální vítěz.

GLM vs Hy4

Tencent: 163 expertů, 203 tasks.[13][14]

Hy4 2.99
Kimi 2.94
GLM 2.92

Hy4 vs GLM 46.8% wins / 12.8 ties / 40.4 losses.[14]

Interní Tencent workload.

GLM vs GPT-5.6 Sol

TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5

[3]

GLM vede těsně CyberGym a AutomationBench. Smíšený obraz.

Claude Opus 5?

Z.ai launch table obsahuje především Opus 4.8 a Fable 5, ne Opus 5.[3]

Nelze z ní tvrdit GLM-5.3 > Claude Opus 5.

Licence

Flash je MIT.[8][11]

GLM-5.3 má custom license.[4]

Umožňuje široké komerční použití, ale MaaS subjekt s více než $10B agregovaného revenue za 12 po sobě jdoucích měsíců musí před komerčním použitím projít Z.ai security review.[4]

Self-hosting

Podpora zahrnuje vLLM, SGLang, Transformers a Docker Model Runner.[3][8]

GLM repo má přibližně:

756 GB
141 safetensors shards

[5]

Čínské AI čipy a 3× serving

Z.ai říká, že Flash/Ox Alpha běžel na čínských accelerators.[6][7]

Uvádí Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split a EPD disaggregation a claimuje 3× end-to-end serving performance proti počátečnímu baseline na stejné hardware.[6][7]

Vendor claim.

Co vybrat?

GLM-5.3 pro maximální GLM coding, terminal agents, text reasoning a security.

Flash pro cenu, vision, dokumenty, video/file, 1M context a MIT.

Ostatní modely, pokud vlastní POC dá lepší:

cost per successful task

POC checklist

Kvalita

  • Reálné tasky.
  • Stejný harness.
  • Test pass rate.
  • Task completion.
  • Regrese.
  • Out-of-scope changes.
  • Dlouhé sessions.
  • Recovery.
  • Tool calling.
  • Structured output.

Reasoning

  • low, high, max.
  • Reasoning nelze vypnout.
  • Reasoning tokens.
  • Total output.
  • Latency.
  • max ne vždy.

Long context

  • 32K.
  • 128K.
  • 256K.
  • 1M.
  • Retrieval accuracy.
  • Instruction loss.
  • Velké repo.
  • Cross-file dependencies.
  • KV cache/concurrency.
  • 1M není perfektní paměť.

Flash multimodal

  • Screenshots.
  • Dokumenty.
  • Charts.
  • OCR-like workflow.
  • GUI verification.
  • Video.

Security

  • Sandbox.
  • Network limit.
  • Tool logs.
  • Approval gates.
  • Oddělit secrets.
  • Minimum credentials.
  • Validovat patch.
  • Model není autonomní security autorita.

Licence a provoz

  • GLM license.
  • MaaS >$10B.
  • MIT Flash.
  • Data policy.
  • Processing region.
  • Retention.
  • Cache hit.
  • Cost per successful task.
  • Fallback.
  • Cena po promo.

Verdikt POLPROG

GLM-5.3 je významný hlavně post-training skok stejné base jako GLM-5.2.[1][15]

TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4

[1][3]

Flash nabízí 320B/18B, multimodalitu, 1M context, MIT a velmi nízkou cenu. Artificial Analysis mu dává 57 proti 60 GLM-5.3 max.[10][11][12]

Pro mnoho produktů může být Flash praktičtější.

Rozhodovat by měl vlastní cost per successful task, ne jeden leaderboard.

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Často kladené otázky

Release GLM-5.3?
  1. srpna oznámen, váhy od 28.
Open source?

Přesněji open weights pod custom licencí.

Flash?

MIT.

Parametry?

GLM ~753B/40B; Flash 320B/18B.

Context?

1M.

Output?

128K.

Vision?

GLM text-only; Flash multimodal.

Reasoning off?

Ne.

Levels?

low, high, max.

Ox Alpha?

Pre-release Flash.

Lepší než Kimi?

Ne ve všem.

Lepší než Hy4?

Tencent dal Hy4 2.99, GLM 2.92.

Lepší než GPT?

Ne obecně.

Opus 5?

Z.ai launch table to neprokazuje.

CyberGym 84.5% = nejlepší security?

Ne.

GLM cena?

$1.40/$0.26/$4.40.

Flash?

$0.15/$0.03/$0.50, promo polovina.

Self-hosting?

Ano, hardware náročný.

Produkce?

Vlastní POC.

Zdroje a poznámky

  1. Z.ai, GLM-5.3, 14. srpna 2026.123456789101112131415
  2. Z.ai Docs, GLM-5.3, přístup 31. srpna 2026.12345
  3. Hugging Face, GLM-5.3 model card, přístup 31. srpna 2026.1234567891011121314
  4. GLM-5.3 License, přístup 31. srpna 2026.12
  5. GLM-5.3 files, přístup 31. srpna 2026.123
  6. Z.ai Docs, GLM-5.3-Flash, přístup 31. srpna 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash, srpen 2026.12345
  8. Hugging Face, GLM-5.3-Flash model card, přístup 31. srpna 2026.12345678910
  9. Z.ai Pricing, přístup 31. srpna 2026.12
  10. Artificial Analysis, GLM-5.3, stav 31. srpna 2026.12345
  11. Artificial Analysis, Flash, stav 31. srpna 2026.1234567
  12. Artificial Analysis comparison, stav 31. srpna 2026.12
  13. Tencent Hy4 launch, 28. srpna 2026.
  14. Tencent Hy4 model card, přístup 31. srpna 2026.12
  15. Z.ai, GLM-5.2, 16. června 2026.1234
  16. GLM-5 technical report, 2026.
  17. Hugging Face, GLM-5.3, release marker ověřen 31. srpna 2026.12
  18. OpenRouter, GLM 5.3, stav 31. srpna 2026.
  19. OpenRouter, GLM 5.3 Flash, stav 31. srpna 2026.123
  20. Artificial Analysis, Flash provider benchmarks, stav 31. srpna 2026.

Bylo to užitečné?

Odebírejte nové články e-mailem

Jeden krátký e-mail na každý nový článek znalostní báze. Žádný spam, odhlášení jedním kliknutím.

Váš e-mail používáme pouze k zasílání nových článků. Žádné sdílení s třetími stranami.

Zpět do znalostní báze