Koniec augusta 2026 priniesol dva veľmi odlišné modely Z.ai.
GLM-5.3 je veľký text-only reasoning model pre long-horizon engineering, coding agents a rýchlo rastúce cybersecurity schopnosti. Z.ai ho oznámila 14. augusta a verejné váhy sa na Hugging Face objavili 28. augusta po oznámenom safety evaluation/hardening období.[1][17]
GLM-5.3-Flash je výrazne lacnejší, natívne multimodálny model s novým pre-trainingom. Má 320B parametrov celkom, 18B aktívnych na token, kontext 1M, vstup text/image/video/file a verejné váhy pod MIT.[6][8][11]
Pred premiérou bol Flash anonymne testovaný ako:
Ox Alpha
na OpenCode a OpenRouter. Z.ai tvrdí, že sa stal najpopulárnejším modelom týždňa a prevádzka bežala na čínskych AI akcelerátoroch. Popularita je vendor claim.[6][7][19]
GLM-5.3 a Flash nie sú len veľká a malá verzia tej istej siete.
GLM-5.3:
~753B total podľa aktuálnych HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning vždy zapnutý
custom GLM-5.3 License
Flash:
320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT
Launch benchmarky sú prevažne Z.ai-reported. Agentické výsledky výrazne ovplyvňuje harness, tooling, context, timeout a inference budget.
Stav informácií: 31. augusta 2026.
TL;DR
| Otázka | Overená odpoveď |
|---|---|
| GLM-5.3 oznámený | 14. augusta |
| Váhy | verejné od 28. augusta |
| Flash | koniec augusta; AA: 26. augusta |
| GLM-5.3 | 753B total, ~40B active |
| Flash | 320B/18B |
| GLM input | text |
| Flash input | text, image, video, file |
| Context | 1M oba |
| Max output | 128K oba |
| Reasoning | vždy on; low, high, max; default max |
| GLM licencia | custom |
| Flash licencia | MIT |
| GLM API | $1.40 / $0.26 / $4.40 |
| Flash list | $0.15 / $0.03 / $0.50 |
| Flash promo | $0.075 / $0.015 / $0.25 do 9. septembra |
| Terminal-Bench 2.1 | 88.2 |
| Terminal-Bench 3.0 | 28.3 |
| DeepSWE | 66.9 |
| CyberGym | 84.5% |
| ExploitBench | 54.4% |
| Ox Alpha | pre-release Flash |
| Artificial Analysis | 60 vs 57 |
| Hy4 vs GLM | Tencent 2.99 vs 2.92 |
| Caveat | agent benchmark závisí od setupu |
Čo sa stalo v auguste?
Z.ai oznámila GLM-5.3 14. augusta.[1]
Model používa rovnaký base model ako GLM-5.2 a Z.ai hovorí, že všetky zisky pochádzajú z post-trainingu.[1][15]
API bolo dostupné okamžite; váhy nasledovali po dodatočnom safety hodnotení. Hugging Face uvádzal 28. augusta a dnes sú verejné.[17][5]
Flash má novú bázu, architektúru a multimodalitu.[6][8]
GLM-5.3 nie je len väčší Flash
GLM-5.3 cieli na maximálnu coding kvalitu, terminal tasks, long-horizon agents a cyber reasoning.
Flash na cenu, multimodalitu, inference efficiency, visual coding, office workflow a long context.
Flash je podľa Z.ai novo predtrénovaný model.[6][8]
Parametre GLM-5.3
Pôvodný GLM-5:
744B total
40B active
Aktuálne HF/AA metadata:
753B total
40B active
Keďže GLM-5.3 používa rovnakú bázu ako 5.2, 744B vs 753B berieme ako rozdiel v počítaní/metadata; pre aktuálny deployment používame 753B/40B.[1][15]
Flash 320B/18B
320B total
18B active
45 layers
Z.ai pre porovnanie uvádza GLM-4.5 355B/32B/92 layers.[6]
1M kontext, 128K output
Oficiálne docs:
1M context
128K max output
Veľký kontext je užitočný, ale neznamená perfektnú pamäť.
Text-only vs multimodal
GLM-5.3:
Text → Text
Flash:
Text/Image/Video/File → Text
Flash je vhodný pre screenshots, GUI, dokumenty a visual coding. Artificial Analysis štandardizuje text+image vo svojom profile.[11]
Sparse + linear attention
Flash kombinuje sparse a linear attention.[6][8]
Cieľom je lacnejší long-context inference pri zachovaní lokálnych aj globálnych väzieb.
IndexPool
IndexPool komprimuje štyri cached indexer key vectors do jedného.[6]
Z.ai uvádza:
3.01× nižší attention compute
4.44× nižší KV cache
oproti GLM-5.3.[6]
Vendor claim.
mHC
Flash používa Manifold-Constrained Hyper-Connections.[6][8]
Technika má zlepšiť scaling a information flow pri nižšom active compute.
30T multimodal corpus
Z.ai uvádza 30T-token multimodal pretraining corpus.[6][8]
Flash teda dostal nový pre-training, kým GLM-5.3 zostáva na GLM-5.2 base.
Ox Alpha
ox-alpha bol anonymný pre-release Flash na OpenCode/OpenRouter.[6][19]
Z.ai jeho identitu potvrdzuje. Tvrdenie o popularite týždňa je vendor claim.[7]
Zmysel stealth testu
Anonymita znižuje brand bias, ale usage ovplyvňuje cena, promotion, routing a UI. Nie je to kontrolovaný benchmark.
Post-training leap
Rovnaká base GLM-5.2, viac environments, tasks, compute, verifiers, RL a long-horizon training.[1][15]
Framework slime prepája training, rollout a data generation.[1]
+50% coding
Z.ai claimuje +50% na private Z.ai Code Bench.[1][2]
GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K
Nie je to univerzálny 50% improvement.
Verejné benchmarky
Z.ai:[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| Automation | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| ALE | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE+Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Z.ai-reported.
Terminal-Bench 3.0
4.6 → 28.3
Veľký skok, nie 6× inteligencia. Setup používa Claude Code, max effort, veľký context a až 600 agent turns.[3]
DeepSWE
GLM 66.9
Kimi 67.5
GPT 72.7
GLM výrazne rastie, ale nevedie.
Terminal-Bench 2.1
GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0
Prakticky tesná skupina.
Agents' Last Exam
GLM 28.5
GPT 28.6
Kimi 27.6
Opäť malý rozdiel.
CyberGym
GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%
White-box benchmark, nie priama simulácia ľubovoľného live attack.
ExploitBench
GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%
GLM skok veľký, closed frontier ďalej vedie.
ExploitGym
GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293
pre 2h/6h.[3]
Čas je normalizovaný podľa throughputu modelu.
2 436 nálezov
Z.ai uvádza:
2,436 findings
269 projektov
1,097 critical + high
Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]
Vendor operational data.
Cyber governance
Defenzívne môže pomôcť s code review, triage, patch analysis, fuzzing a threat modeling.
Nutný sandbox, network isolation, logging, approval gates a minimálne credentials.
Flash benchmarky
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| Automation | 48.8 | 26.2 |
| ALE | 26.3 | 20.4 |
| HLE+Tools | 55.3 | 54.7 |
| GDPval-AA | 1773 | 1504 |
Hlavná výhoda: price/performance.
Flash vs Opus 4.8 private benchmark
Flash 29.0
Opus 4.8 29.5
Súkromný Z.ai benchmark nie je dôkaz všeobecnej parity.
Artificial Analysis: 60 vs 57
GLM-5.3 max 60
Flash 57
Aktuálne:
GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT
Flash teda neznamená najvyšší output speed; výhodou je cena a compute.
API ceny
Z.ai:[9]
GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25
Promo do 9. septembra. OpenRouter ponúka oba modely s možnými odlišnosťami provider pricing.[18][19]
One-tenth price
Flash je listovo asi 9.3× lacnejší na input a 8.8× na output.[9]
Marketing „zhruba desatina“ je rozumný, task cost závisí od reasoning a tools.
GLM vs Kimi K3
TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2
Žiadny univerzálny víťaz.
GLM vs Hy4
Tencent: 163 expertov, 203 tasks.[13][14]
Hy4 2.99
Kimi 2.94
GLM 2.92
Hy4 vs GLM 46.8% wins / 12.8 ties / 40.4 losses.[14]
Interný Tencent workload.
GLM vs GPT-5.6 Sol
TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5
GLM vedie tesne CyberGym a AutomationBench. Zmiešaný obraz.
Claude Opus 5?
Z.ai launch table obsahuje najmä Opus 4.8 a Fable 5, nie Opus 5.[3]
Nemožno z nej tvrdiť GLM-5.3 > Claude Opus 5.
Licencie
GLM-5.3 má custom license.[4]
Umožňuje široké komerčné použitie, ale MaaS subjekt s viac než $10B agregovaného revenue za 12 po sebe idúcich mesiacov musí pred komerčným použitím prejsť Z.ai security review.[4]
Self-hosting
Podpora zahŕňa vLLM, SGLang, Transformers a Docker Model Runner.[3][8]
GLM repo má približne:
756 GB
141 safetensors shards
Čínske AI čipy a 3× serving
Z.ai hovorí, že Flash/Ox Alpha bežal na čínskych accelerators.[6][7]
Uvádza Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split a EPD disaggregation a claimuje 3× end-to-end serving performance oproti počiatočnému baseline na rovnakom hardware.[6][7]
Vendor claim.
Čo vybrať?
GLM-5.3 pre maximálny GLM coding, terminal agents, text reasoning a security.
Flash pre cenu, vision, dokumenty, video/file, 1M context a MIT.
Ostatné modely, ak vlastný POC dá lepší:
cost per successful task
POC checklist
Kvalita
- Reálne tasky.
- Rovnaký harness.
- Test pass rate.
- Task completion.
- Regresie.
- Out-of-scope changes.
- Dlhé sessions.
- Recovery.
- Tool calling.
- Structured output.
Reasoning
-
low,high,max. - Reasoning nemožno vypnúť.
- Reasoning tokens.
- Total output.
- Latency.
-
maxnie vždy.
Long context
- 32K.
- 128K.
- 256K.
- 1M.
- Retrieval accuracy.
- Instruction loss.
- Veľké repo.
- Cross-file dependencies.
- KV cache/concurrency.
- 1M nie je perfektná pamäť.
Flash multimodal
- Screenshots.
- Dokumenty.
- Charts.
- OCR-like workflow.
- GUI verification.
- Video.
Security
- Sandbox.
- Network limit.
- Tool logs.
- Approval gates.
- Oddeliť secrets.
- Minimum credentials.
- Validovať patch.
- Model nie je autonómna security autorita.
Licencia a prevádzka
- GLM license.
- MaaS >$10B.
- MIT Flash.
- Data policy.
- Processing region.
- Retention.
- Cache hit.
- Cost per successful task.
- Fallback.
- Cena po promo.
Verdikt POLPROG
GLM-5.3 je významný najmä post-training skok rovnakej base ako GLM-5.2.[1][15]
TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4
Flash ponúka 320B/18B, multimodalitu, 1M context, MIT a veľmi nízku cenu. Artificial Analysis mu dáva 57 oproti 60 GLM-5.3 max.[10][11][12]
Pre veľa produktov môže byť Flash praktickejší.
Rozhodovať by mal vlastný cost per successful task, nie jeden leaderboard.

