Кінець серпня 2026 року приніс дві дуже різні моделі Z.ai одного покоління.
GLM-5.3 — великий text-only reasoning model для long-horizon engineering, coding agents і швидко зростаючих cybersecurity capabilities. Z.ai оголосила його 14 серпня, а публічні weights з’явилися на Hugging Face 28 серпня після анонсованого періоду safety evaluation та hardening.[1][17]
GLM-5.3-Flash — значно дешевша, нативно multimodal модель з новою base. Вона має 320B параметрів загалом, 18B active на token, контекст 1M, input text/image/video/file і публічні weights під MIT.[6][8][11]
До офіційної прем’єри Flash анонімно тестувався як:
Ox Alpha
на OpenCode та OpenRouter. Z.ai стверджує, що він швидко став найпопулярнішою моделлю тижня і працював на китайських AI accelerators. Твердження про популярність є vendor-reported.[6][7][19]
GLM-5.3 та Flash — не просто велика й мала версії однієї мережі.
GLM-5.3:
~753B total за актуальними HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning завжди enabled
custom GLM-5.3 License
Flash:
320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT
Launch benchmarks переважно Z.ai-reported. Для agentic evals результат сильно залежить від harness, tools, context, timeout і inference budget.
Стан інформації: 31 серпня 2026 року.
TL;DR
| Питання | Перевірена відповідь |
|---|---|
| GLM-5.3 announced | 14 серпня 2026 |
| Public weights | з 28 серпня |
| Flash | кінець серпня; Artificial Analysis: 26 серпня |
| GLM-5.3 | 753B total, ~40B active |
| Flash | 320B total, 18B active |
| GLM input | text |
| Flash input | text, image, video, file |
| Context | 1M обидва |
| Max output | 128K обидва |
| Reasoning | завжди enabled; low, high, max; default max |
| GLM license | custom GLM-5.3 License |
| Flash license | MIT |
| GLM API | $1.40 / $0.26 / $4.40 |
| Flash list | $0.15 / $0.03 / $0.50 |
| Flash promo | $0.075 / $0.015 / $0.25 до 9 вересня |
| Terminal-Bench 2.1 | 88.2, Z.ai-reported |
| Terminal-Bench 3.0 | 28.3 |
| DeepSWE | 66.9 |
| CyberGym | 84.5% |
| ExploitBench | 54.4% |
| Ox Alpha | pre-release Flash |
| Artificial Analysis | 60 vs 57 |
| Hy4 vs GLM | Tencent 2.99 vs 2.92 |
| Caveat | agent benchmarks залежать від setup |
Що сталося в серпні?
Z.ai оголосила GLM-5.3 14 серпня.[1]
Модель використовує той самий base model, що GLM-5.2, і Z.ai прямо каже, що всі gains отримані через post-training.[1][15]
API стала доступною відразу, weights — після додаткового safety review. Hugging Face позначав 28 серпня, і зараз ваги публічні.[17][5]
Flash має нову base, нову architecture і native multimodality.[6][8]
GLM-5.3 не є просто більшим Flash
GLM-5.3 фокусується на максимальній GLM coding quality, terminal tasks, long-horizon agents і cyber reasoning.
Flash — на cost, multimodality, inference efficiency, visual coding, office workflows і long context.
За Z.ai, Flash пройшов новий pre-training, а не просто distillation flagship.[6][8]
Скільки параметрів у GLM-5.3?
Original GLM-5 architecture:
744B total
40B active
Актуальні Hugging Face / Artificial Analysis metadata:
753B total
40B active
Оскільки GLM-5.3 має ту саму base, що 5.2, ми трактуємо 744B vs 753B як різницю counting/implementation metadata і використовуємо 753B/40B для current deployment.[1][15]
Flash: 320B total, 18B active
Z.ai:
320B total
18B active
45 layers
Для порівняння GLM-4.5: 355B total, 32B active, 92 layers.[6]
1M context і 128K output
Official docs:
1M context
128K maximum output
Це корисно для великих repo, довгих agent sessions та multi-file analysis.
Але 1M context не означає 1M perfect memory.
Text-only проти multimodal
GLM-5.3:
Text → Text
Flash:
Text/Image/Video/File → Text
Flash краще підходить для screenshots, GUI, documents, PDF, presentations і visual coding. Artificial Analysis стандартизує text+image у власному профілі.[11]
Sparse + linear attention
Flash поєднує sparse і linear attention.[6][8]
Мета — дешевше обробляти long context, зберігаючи локальні й глобальні dependencies.
IndexPool
IndexPool стискає чотири cached indexer key vectors в один.[6]
Z.ai повідомляє:
3.01× lower attention compute
4.44× lower KV cache
порівняно з GLM-5.3.[6]
Це vendor claim.
mHC
Flash використовує Manifold-Constrained Hyper-Connections.[6][8]
Техніка має покращувати scaling та information flow при нижчому active compute.
30T multimodal corpus
Z.ai вказує 30T-token multimodal pretraining corpus.[6][8]
Flash отримав новий pre-training, тоді як GLM-5.3 зберіг GLM-5.2 base.
Ox Alpha
ox-alpha був анонімним pre-release Flash на OpenCode/OpenRouter.[6][19]
Z.ai підтверджує identity. Claim про “most popular model of the week” залишається vendor statement.[7]
Чому stealth test цікавий?
Анонімність зменшує brand bias.
Але usage залежить також від price, promotion, routing, availability і UI. Це adoption signal, не controlled benchmark.
Post-training leap
Same GLM-5.2 base, але більше environments, tasks, compute, verifiers, RL і long-horizon training.[1][15]
Open-source framework slime поєднує training, rollout та data generation.[1]
+50% coding
Z.ai claim:
+50% vs GLM-5.2
на private Z.ai Code Bench.[1][2]
GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K
Це не 50% improvement на кожній coding task.
Public benchmarks
Z.ai:[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| Automation | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| ALE | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE+Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Усі Z.ai-reported.
Terminal-Bench 3.0
4.6 → 28.3
Великий стрибок, але не “6× smarter”. Setup використовує Claude Code, max effort, великий context і до 600 agent turns.[3]
DeepSWE
GLM 66.9
Kimi 67.5
GPT 72.7
GLM сильно прогресує, але не лідирує.
Terminal-Bench 2.1
GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0
Практично дуже тісна група.
Agents' Last Exam
GLM 28.5
GPT 28.6
Kimi 27.6
Знову мінімальні розриви.
CyberGym
GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%
White-box benchmark, а не пряма симуляція довільних live attacks.
ExploitBench
GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%
GLM робить великий стрибок, але closed frontier попереду.
ExploitGym
GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293
для 2h/6h.[3]
Час нормалізується за model throughput, тож methodology специфічна.
2 436 vulnerability findings
Z.ai вказує:
2,436 findings
269 projects
1,097 critical + high
Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]
Це vendor operational data, не незалежний CVE database.
Cyber governance
Defensive use cases: secure code review, vulnerability triage, patch analysis, fuzzing, threat modeling.
Потрібні sandbox, network isolation, logs, approval gates, separated secrets і minimum credentials.
Flash benchmarks
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| Automation | 48.8 | 26.2 |
| ALE | 26.3 | 20.4 |
| HLE+Tools | 55.3 | 54.7 |
| GDPval-AA | 1773 | 1504 |
Ключова перевага — price/performance.
Flash vs Opus 4.8 private benchmark
Flash 29.0
Opus 4.8 29.5
Private Z.ai benchmark не доводить загальну parity з Claude.
Artificial Analysis: 60 vs 57
GLM-5.3 max 60
Flash 57
Current first-party API measurements:
GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT
Тому “Flash” не означає highest tokens/s; advantage — cost, active compute і multimodality.
API pricing
Z.ai:[9]
GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25
Promo до 9 вересня. OpenRouter також пропонує обидві моделі, але provider pricing/routing може відрізнятися.[18][19]
One-tenth price
Flash за list price приблизно 9.3× дешевший input і 8.8× output.[9]
Marketing “about one-tenth” reasonable; task cost залежить від reasoning і tools.
GLM vs Kimi K3
TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2
Немає universal winner.
GLM vs Hy4
Tencent: 163 experts, 203 engineering tasks.[13][14]
Hy4 2.99
Kimi 2.94
GLM 2.92
Hy4 vs GLM: 46.8% wins / 12.8 ties / 40.4 losses.[14]
Це internal Tencent workload.
GLM vs GPT-5.6 Sol
TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5
GLM трохи вище в CyberGym та AutomationBench. Mixed picture.
Claude Opus 5?
Z.ai launch table переважно включає Opus 4.8 і Fable 5, а не Opus 5.[3]
Тому вона не доводить GLM-5.3 > Claude Opus 5.
Licenses
Flash:
MIT
GLM-5.3:
custom GLM-5.3 License
Ліцензія дає широкі commercial rights, але MaaS entity з понад $10B aggregate revenue за будь-які 12 consecutive months має пройти Z.ai security review до commercial use.[4]
Self-hosting
Підтримуються vLLM, SGLang, Transformers, Docker Model Runner та інші frameworks.[3][8]
GLM repo:
~756 GB
141 safetensors shards
Flash менший по active compute, але hardware requirements все одно високі.
Chinese AI chips і 3× serving
Z.ai каже, що Flash/Ox Alpha працював на Chinese AI accelerators.[6][7]
Згадані Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split, EPD disaggregation.
Vendor claim:
3× end-to-end serving
vs initial baseline on same hardware
Потрібна independent validation.
Що обрати?
GLM-5.3 для maximum GLM coding, terminal agents, text reasoning і security.
Flash для cost, vision, documents, video/file, 1M context і MIT.
Інші models, якщо internal POC дає кращий:
cost per successful task
POC checklist
Quality
- Реальні internal tasks.
- Same harness.
- Test pass rate.
- Task completion.
- Regressions.
- Out-of-scope changes.
- Long sessions.
- Recovery.
- Tool calling.
- Structured output.
Reasoning
-
low,high,max. - Reasoning cannot be disabled.
- Reasoning tokens.
- Total output.
- Latency.
- Не використовувати
maxвсюди.
Long context
- 32K.
- 128K.
- 256K.
- 1M.
- Retrieval accuracy.
- Instruction loss.
- Large repo.
- Cross-file dependencies.
- KV cache/concurrency.
- 1M не є perfect memory.
Flash multimodal
- Screenshots.
- Documents.
- Charts.
- OCR-like workflow.
- GUI verification.
- Video.
Security
- Sandbox.
- Network limits.
- Tool logs.
- Approval gates.
- Separate secrets.
- Minimum credentials.
- Validate patches.
- Model не є autonomous security authority.
License & operations
- GLM license.
- MaaS >$10B.
- MIT Flash.
- Data policy.
- Processing region.
- Retention.
- Cache hit.
- Cost per successful task.
- Fallback.
- Price after promo.
Висновок POLPROG
GLM-5.3 важливий передусім як великий post-training leap тієї самої base, що GLM-5.2.[1][15]
TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4
Flash пропонує 320B/18B, multimodality, 1M context, MIT і низьку API price. Artificial Analysis оцінює його в 57 проти 60 GLM-5.3 max.[10][11][12]
Для багатьох продуктів Flash може бути практичнішим за flagship.
Вирішувати має власний cost per successful task, а не один leaderboard.

