Konec srpna 2026 přinesl dva velmi odlišné modely Z.ai.
GLM-5.3 je velký text-only reasoning model pro long-horizon engineering, coding agents a rychle rostoucí cybersecurity schopnosti. Z.ai jej oznámila 14. srpna a veřejné váhy se na Hugging Face objevily 28. srpna po oznámeném safety evaluation/hardening období.[1][17]
GLM-5.3-Flash je výrazně levnější, nativně multimodální model s novým pre-trainingem. Má 320B parametrů celkem, 18B aktivních na token, kontext 1M, vstup text/image/video/file a veřejné váhy pod MIT.[6][8][11]
Před premiérou byl Flash anonymně testován jako:
Ox Alpha
na OpenCode a OpenRouter. Z.ai tvrdí, že se stal nejpopulárnějším modelem týdne a provoz běžel na čínských AI akcelerátorech. Popularita je vendor claim.[6][7][19]
GLM-5.3 a Flash nejsou jen velká a malá verze stejné sítě.
GLM-5.3:
~753B total podle aktuálních HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning vždy zapnutý
custom GLM-5.3 License
Flash:
320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT
Launch benchmarky jsou hlavně Z.ai-reported. Agentické výsledky zásadně ovlivňuje harness, tooling, context, timeout a inference budget.
Stav informací: 31. srpna 2026.
TL;DR
| Otázka | Ověřená odpověď |
|---|---|
| GLM-5.3 oznámen | 14. srpna |
| Váhy | veřejné od 28. srpna |
| Flash | konec srpna; AA: 26. srpna |
| GLM-5.3 | 753B total, ~40B active |
| Flash | 320B/18B |
| GLM input | text |
| Flash input | text, image, video, file |
| Context | 1M oba |
| Max output | 128K oba |
| Reasoning | vždy on; low, high, max; default max |
| GLM licence | custom |
| Flash licence | MIT |
| GLM API | $1.40 / $0.26 / $4.40 |
| Flash list | $0.15 / $0.03 / $0.50 |
| Flash promo | $0.075 / $0.015 / $0.25 do 9. září |
| Terminal-Bench 2.1 | 88.2 |
| Terminal-Bench 3.0 | 28.3 |
| DeepSWE | 66.9 |
| CyberGym | 84.5% |
| ExploitBench | 54.4% |
| Ox Alpha | pre-release Flash |
| Artificial Analysis | 60 vs 57 |
| Hy4 vs GLM | Tencent 2.99 vs 2.92 |
| Caveat | agent benchmark závisí na setupu |
Co se stalo v srpnu?
Z.ai oznámila GLM-5.3 14. srpna.[1]
Model používá stejný base model jako GLM-5.2 a Z.ai říká, že všechny zisky pocházejí z post-trainingu.[1][15]
API bylo dostupné okamžitě; váhy následovaly po bezpečnostním hodnocení. Hugging Face uváděl 28. srpna a dnes jsou veřejné.[17][5]
Flash má novou bázi, architekturu a multimodalitu.[6][8]
GLM-5.3 není jen větší Flash
GLM-5.3 míří na maximální coding kvalitu, terminal tasks, long-horizon agents a cyber reasoning.
Flash na cenu, multimodalitu, inference efficiency, visual coding, office workflow a long context.
Flash je podle Z.ai nově předtrénovaný model.[6][8]
Parametry GLM-5.3
Původní GLM-5:
744B total
40B active
Aktuální HF/AA metadata:
753B total
40B active
Protože GLM-5.3 používá stejnou bázi jako 5.2, jde zřejmě o rozdíl v počítání/metadata; pro aktuální deployment používáme 753B/40B.[1][15]
Flash 320B/18B
320B total
18B active
45 layers
Z.ai pro srovnání uvádí GLM-4.5 355B/32B/92 layers.[6]
1M kontext, 128K output
Oficiální docs:
1M context
128K max output
Velký kontext je užitečný, ale neznamená perfektní paměť.
Text-only vs multimodal
GLM-5.3:
Text → Text
Flash:
Text/Image/Video/File → Text
Flash je vhodný pro screenshots, GUI, dokumenty a visual coding. Artificial Analysis standardizuje text+image ve svém profilu.[11]
Sparse + linear attention
Flash kombinuje sparse a linear attention.[6][8]
Cílem je levnější long-context inference při zachování lokálních i globálních závislostí.
IndexPool
IndexPool komprimuje čtyři cached indexer key vectors do jednoho.[6]
Z.ai uvádí:
3.01× nižší attention compute
4.44× nižší KV cache
proti GLM-5.3.[6]
Vendor claim.
mHC
Flash používá Manifold-Constrained Hyper-Connections.[6][8]
Technika má zlepšit scaling a information flow při nižším aktivním compute.
30T multimodal corpus
Z.ai uvádí 30T-token multimodal pretraining corpus.[6][8]
Flash tedy dostal nový pre-training, zatímco GLM-5.3 zůstává na GLM-5.2 base.
Ox Alpha
ox-alpha byl anonymní pre-release Flash na OpenCode/OpenRouter.[6][19]
Z.ai jeho identitu potvrzuje. Tvrzení o popularitě týdne je vendor claim.[7]
Smysl stealth testu
Anonymita snižuje brand bias, ale usage ovlivňuje cena, promotion, routing a UI. Není to kontrolovaný benchmark.
Post-training leap
Stejná base GLM-5.2, více environments, tasks, compute, verifiers, RL a long-horizon training.[1][15]
Framework slime propojuje training, rollout a data generation.[1]
+50% coding
Z.ai claimuje +50% na private Z.ai Code Bench.[1][2]
GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K
Nejde o univerzální 50% improvement.
Veřejné benchmarky
Z.ai:[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| Automation | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| ALE | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE+Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Z.ai-reported.
Terminal-Bench 3.0
4.6 → 28.3
Velký skok, ne 6× inteligence. Setup používá Claude Code, max effort, velký context a až 600 agent turns.[3]
DeepSWE
GLM 66.9
Kimi 67.5
GPT 72.7
GLM výrazně roste, ale nevede.
Terminal-Bench 2.1
GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0
Prakticky těsná skupina.
Agents' Last Exam
GLM 28.5
GPT 28.6
Kimi 27.6
Opět malý rozdíl.
CyberGym
GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%
White-box benchmark, ne přímá simulace libovolného live attack.
ExploitBench
GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%
GLM skok velký, closed frontier dál vede.
ExploitGym
GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293
pro 2h/6h.[3]
Čas je normalizován podle throughputu modelu.
2 436 nálezů
Z.ai uvádí:
2,436 findings
269 projektů
1,097 critical + high
Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]
Vendor operational data.
Cyber governance
Defenzivně může pomoci s code review, triage, patch analysis, fuzzing a threat modeling.
Nutný sandbox, network isolation, logging, approval gates a minimální credentials.
Flash benchmarky
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| Automation | 48.8 | 26.2 |
| ALE | 26.3 | 20.4 |
| HLE+Tools | 55.3 | 54.7 |
| GDPval-AA | 1773 | 1504 |
Hlavní výhoda: price/performance.
Flash vs Opus 4.8 private benchmark
Flash 29.0
Opus 4.8 29.5
Soukromý benchmark Z.ai není důkaz obecné parity.
Artificial Analysis: 60 vs 57
GLM-5.3 max 60
Flash 57
Aktuálně:
GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT
Flash tedy neznamená nejvyšší output speed; výhodou je cena a compute.
API ceny
Z.ai:[9]
GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25
Promo do 9. září. OpenRouter nabízí oba modely s možnými odlišnostmi provider pricing.[18][19]
One-tenth price
Flash je listově asi 9.3× levnější na input a 8.8× na output.[9]
Marketing „zhruba desetina“ je rozumný, task cost závisí na reasoning a tools.
GLM vs Kimi K3
TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2
Žádný univerzální vítěz.
GLM vs Hy4
Tencent: 163 expertů, 203 tasks.[13][14]
Hy4 2.99
Kimi 2.94
GLM 2.92
Hy4 vs GLM 46.8% wins / 12.8 ties / 40.4 losses.[14]
Interní Tencent workload.
GLM vs GPT-5.6 Sol
TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5
GLM vede těsně CyberGym a AutomationBench. Smíšený obraz.
Claude Opus 5?
Z.ai launch table obsahuje především Opus 4.8 a Fable 5, ne Opus 5.[3]
Nelze z ní tvrdit GLM-5.3 > Claude Opus 5.
Licence
GLM-5.3 má custom license.[4]
Umožňuje široké komerční použití, ale MaaS subjekt s více než $10B agregovaného revenue za 12 po sobě jdoucích měsíců musí před komerčním použitím projít Z.ai security review.[4]
Self-hosting
Podpora zahrnuje vLLM, SGLang, Transformers a Docker Model Runner.[3][8]
GLM repo má přibližně:
756 GB
141 safetensors shards
Čínské AI čipy a 3× serving
Z.ai říká, že Flash/Ox Alpha běžel na čínských accelerators.[6][7]
Uvádí Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split a EPD disaggregation a claimuje 3× end-to-end serving performance proti počátečnímu baseline na stejné hardware.[6][7]
Vendor claim.
Co vybrat?
GLM-5.3 pro maximální GLM coding, terminal agents, text reasoning a security.
Flash pro cenu, vision, dokumenty, video/file, 1M context a MIT.
Ostatní modely, pokud vlastní POC dá lepší:
cost per successful task
POC checklist
Kvalita
- Reálné tasky.
- Stejný harness.
- Test pass rate.
- Task completion.
- Regrese.
- Out-of-scope changes.
- Dlouhé sessions.
- Recovery.
- Tool calling.
- Structured output.
Reasoning
-
low,high,max. - Reasoning nelze vypnout.
- Reasoning tokens.
- Total output.
- Latency.
-
maxne vždy.
Long context
- 32K.
- 128K.
- 256K.
- 1M.
- Retrieval accuracy.
- Instruction loss.
- Velké repo.
- Cross-file dependencies.
- KV cache/concurrency.
- 1M není perfektní paměť.
Flash multimodal
- Screenshots.
- Dokumenty.
- Charts.
- OCR-like workflow.
- GUI verification.
- Video.
Security
- Sandbox.
- Network limit.
- Tool logs.
- Approval gates.
- Oddělit secrets.
- Minimum credentials.
- Validovat patch.
- Model není autonomní security autorita.
Licence a provoz
- GLM license.
- MaaS >$10B.
- MIT Flash.
- Data policy.
- Processing region.
- Retention.
- Cache hit.
- Cost per successful task.
- Fallback.
- Cena po promo.
Verdikt POLPROG
GLM-5.3 je významný hlavně post-training skok stejné base jako GLM-5.2.[1][15]
TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4
Flash nabízí 320B/18B, multimodalitu, 1M context, MIT a velmi nízkou cenu. Artificial Analysis mu dává 57 proti 60 GLM-5.3 max.[10][11][12]
Pro mnoho produktů může být Flash praktičtější.
Rozhodovat by měl vlastní cost per successful task, ne jeden leaderboard.

