GLM-5.3 і GLM-5.3-Flash: бенчмарки, cyber capabilities, Ox Alpha, open weights і порівняння з Kimi K3, Hy4, Claude та GPT-5.6 Sol Skip to content

GLM-5.3 і GLM-5.3-Flash: бенчмарки, cyber capabilities, Ox Alpha, open weights і порівняння з Kimi K3, Hy4, Claude та GPT-5.6 Sol

Перевірений аналіз GLM-5.3 і GLM-5.3-Flash: архітектура, контекст 1M, 753B/40B та 320B/18B, мультимодальність, Ox Alpha, coding і cyber benchmarks, ліцензії, API pricing, self-hosting та порівняння з Kimi K3, Hy4, Claude і GPT-5.6 Sol.

Опубліковано Автор Час читання 23 хв читання

Перевірений аналіз GLM-5.3 і GLM-5.3-Flash: архітектура, контекст 1M, 753B/40B та 320B/18B, мультимодальність, Ox Alpha, coding і cyber benchmarks, ліцензії, API pricing, self-hosting та порівняння з Kimi K3, Hy4, Claude і GPT-5.6 Sol.

На цій сторінці
  1. 1TL;DR
  2. 2Що сталося в серпні?
  3. 3GLM-5.3 не є просто більшим Flash
  4. 4Скільки параметрів у GLM-5.3?
  5. 5Flash: 320B total, 18B active
  6. 61M context і 128K output
  7. 7Text-only проти multimodal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T multimodal corpus
  12. 12Ox Alpha
  13. 13Чому stealth test цікавий?
  14. 14Post-training leap
  15. 15+50% coding
  16. 16Public benchmarks
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym
  22. 22ExploitBench
  23. 23ExploitGym
  24. 242 436 vulnerability findings
  25. 25Cyber governance
  26. 26Flash benchmarks
  27. 27Flash vs Opus 4.8 private benchmark
  28. 28Artificial Analysis: 60 vs 57
  29. 29API pricing
  30. 30One-tenth price
  31. 31GLM vs Kimi K3
  32. 32GLM vs Hy4
  33. 33GLM vs GPT-5.6 Sol
  34. 34Claude Opus 5?
  35. 35Licenses
  36. 36Self-hosting
  37. 37Chinese AI chips і 3× serving
  38. 38Що обрати?
  39. 39POC checklist
  40. 40Висновок POLPROG

Кінець серпня 2026 року приніс дві дуже різні моделі Z.ai одного покоління.

GLM-5.3 — великий text-only reasoning model для long-horizon engineering, coding agents і швидко зростаючих cybersecurity capabilities. Z.ai оголосила його 14 серпня, а публічні weights з’явилися на Hugging Face 28 серпня після анонсованого періоду safety evaluation та hardening.[1][17]

GLM-5.3-Flash — значно дешевша, нативно multimodal модель з новою base. Вона має 320B параметрів загалом, 18B active на token, контекст 1M, input text/image/video/file і публічні weights під MIT.[6][8][11]

До офіційної прем’єри Flash анонімно тестувався як:

Ox Alpha

на OpenCode та OpenRouter. Z.ai стверджує, що він швидко став найпопулярнішою моделлю тижня і працював на китайських AI accelerators. Твердження про популярність є vendor-reported.[6][7][19]

GLM-5.3 та Flash — не просто велика й мала версії однієї мережі.

GLM-5.3:

~753B total за актуальними HF/AA metadata
~40B active
text-only
1M context
128K max output
reasoning завжди enabled
custom GLM-5.3 License

Flash:

320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT

[2][6][10][11]

Launch benchmarks переважно Z.ai-reported. Для agentic evals результат сильно залежить від harness, tools, context, timeout і inference budget.

Стан інформації: 31 серпня 2026 року.

TL;DR

ПитанняПеревірена відповідь
GLM-5.3 announced14 серпня 2026
Public weightsз 28 серпня
Flashкінець серпня; Artificial Analysis: 26 серпня
GLM-5.3753B total, ~40B active
Flash320B total, 18B active
GLM inputtext
Flash inputtext, image, video, file
Context1M обидва
Max output128K обидва
Reasoningзавжди enabled; low, high, max; default max
GLM licensecustom GLM-5.3 License
Flash licenseMIT
GLM API$1.40 / $0.26 / $4.40
Flash list$0.15 / $0.03 / $0.50
Flash promo$0.075 / $0.015 / $0.25 до 9 вересня
Terminal-Bench 2.188.2, Z.ai-reported
Terminal-Bench 3.028.3
DeepSWE66.9
CyberGym84.5%
ExploitBench54.4%
Ox Alphapre-release Flash
Artificial Analysis60 vs 57
Hy4 vs GLMTencent 2.99 vs 2.92
Caveatagent benchmarks залежать від setup

Що сталося в серпні?

Z.ai оголосила GLM-5.3 14 серпня.[1]

Модель використовує той самий base model, що GLM-5.2, і Z.ai прямо каже, що всі gains отримані через post-training.[1][15]

API стала доступною відразу, weights — після додаткового safety review. Hugging Face позначав 28 серпня, і зараз ваги публічні.[17][5]

Flash має нову base, нову architecture і native multimodality.[6][8]

GLM-5.3 не є просто більшим Flash

GLM-5.3 фокусується на максимальній GLM coding quality, terminal tasks, long-horizon agents і cyber reasoning.

Flash — на cost, multimodality, inference efficiency, visual coding, office workflows і long context.

За Z.ai, Flash пройшов новий pre-training, а не просто distillation flagship.[6][8]

Скільки параметрів у GLM-5.3?

Original GLM-5 architecture:

744B total
40B active

[16]

Актуальні Hugging Face / Artificial Analysis metadata:

753B total
40B active

[5][10]

Оскільки GLM-5.3 має ту саму base, що 5.2, ми трактуємо 744B vs 753B як різницю counting/implementation metadata і використовуємо 753B/40B для current deployment.[1][15]

Flash: 320B total, 18B active

Z.ai:

320B total
18B active
45 layers

[6][8]

Для порівняння GLM-4.5: 355B total, 32B active, 92 layers.[6]

1M context і 128K output

Official docs:

1M context
128K maximum output

для обох.[2][6]

Це корисно для великих repo, довгих agent sessions та multi-file analysis.

Але 1M context не означає 1M perfect memory.

Text-only проти multimodal

GLM-5.3:

Text → Text

[2]

Flash:

Text/Image/Video/File → Text

[6]

Flash краще підходить для screenshots, GUI, documents, PDF, presentations і visual coding. Artificial Analysis стандартизує text+image у власному профілі.[11]

Sparse + linear attention

Flash поєднує sparse і linear attention.[6][8]

Мета — дешевше обробляти long context, зберігаючи локальні й глобальні dependencies.

IndexPool

IndexPool стискає чотири cached indexer key vectors в один.[6]

Z.ai повідомляє:

3.01× lower attention compute
4.44× lower KV cache

порівняно з GLM-5.3.[6]

Це vendor claim.

mHC

Flash використовує Manifold-Constrained Hyper-Connections.[6][8]

Техніка має покращувати scaling та information flow при нижчому active compute.

30T multimodal corpus

Z.ai вказує 30T-token multimodal pretraining corpus.[6][8]

Flash отримав новий pre-training, тоді як GLM-5.3 зберіг GLM-5.2 base.

Ox Alpha

ox-alpha був анонімним pre-release Flash на OpenCode/OpenRouter.[6][19]

Z.ai підтверджує identity. Claim про “most popular model of the week” залишається vendor statement.[7]

Чому stealth test цікавий?

Анонімність зменшує brand bias.

Але usage залежить також від price, promotion, routing, availability і UI. Це adoption signal, не controlled benchmark.

Post-training leap

Same GLM-5.2 base, але більше environments, tasks, compute, verifiers, RL і long-horizon training.[1][15]

Open-source framework slime поєднує training, rollout та data generation.[1]

+50% coding

Z.ai claim:

+50% vs GLM-5.2

на private Z.ai Code Bench.[1][2]

GLM-5.3 34.5%, ~75K output tokens
GLM-5.2 23.4%, ~96K

[1]

Це не 50% improvement на кожній coding task.

Public benchmarks

Z.ai:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal 2.188.281.088.385.088.088.8
Terminal 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
Automation48.226.246.741.046.245.8
ALE28.523.827.625.723.828.6
HLE+Tools62.554.759.857.963.964.5
GDPval-AA176915081682158817431730

Усі Z.ai-reported.

Terminal-Bench 3.0

4.6 → 28.3

[1][3]

Великий стрибок, але не “6× smarter”. Setup використовує Claude Code, max effort, великий context і до 600 agent turns.[3]

DeepSWE

GLM 66.9
Kimi 67.5
GPT 72.7

[3]

GLM сильно прогресує, але не лідирує.

Terminal-Bench 2.1

GLM 88.2
Kimi 88.3
GPT 88.8
Fable 88.0

[3]

Практично дуже тісна група.

Agents' Last Exam

GLM 28.5
GPT 28.6
Kimi 27.6

[3]

Знову мінімальні розриви.

CyberGym

GLM 84.5%
GPT 83.6%
Fable 83.8%
Kimi 80.0%
GLM-5.2 77.2%

[1][3]

White-box benchmark, а не пряма симуляція довільних live attacks.

ExploitBench

GLM 54.4%
GLM-5.2 24.4%
Kimi 32.2%
Opus 40.0%
Fable 78.0%
GPT 76.5%

[1][3]

GLM робить великий стрибок, але closed frontier попереду.

ExploitGym

GLM 105/130
Kimi 36/70
Fable 181/247
GPT 216/293

для 2h/6h.[3]

Час нормалізується за model throughput, тож methodology специфічна.

2 436 vulnerability findings

Z.ai вказує:

2,436 findings
269 projects
1,097 critical + high

[1][2]

Ledger: 53 public, 2,383 embargo, 107 critical, 990 high, 1,286 medium, 53 low.[1]

Це vendor operational data, не незалежний CVE database.

Cyber governance

Defensive use cases: secure code review, vulnerability triage, patch analysis, fuzzing, threat modeling.

Потрібні sandbox, network isolation, logs, approval gates, separated secrets і minimum credentials.

Flash benchmarks

Z.ai:[7][8]

BenchmarkFlashGLM-5.2
Terminal 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
Automation48.826.2
ALE26.320.4
HLE+Tools55.354.7
GDPval-AA17731504

Ключова перевага — price/performance.

Flash vs Opus 4.8 private benchmark

Flash 29.0
Opus 4.8 29.5

[6]

Private Z.ai benchmark не доводить загальну parity з Claude.

Artificial Analysis: 60 vs 57

GLM-5.3 max 60
Flash 57

[10][11][12]

Current first-party API measurements:

GLM ~66.5 token/s, ~1.6s TTFT
Flash ~45–49 token/s, ~1.5s TTFT

[10][11][20]

Тому “Flash” не означає highest tokens/s; advantage — cost, active compute і multimodality.

API pricing

Z.ai:[9]

GLM: $1.40 input / $0.26 cache / $4.40 output
Flash list: $0.15 / $0.03 / $0.50
Flash promo: $0.075 / $0.015 / $0.25

Promo до 9 вересня. OpenRouter також пропонує обидві моделі, але provider pricing/routing може відрізнятися.[18][19]

One-tenth price

Flash за list price приблизно 9.3× дешевший input і 8.8× output.[9]

Marketing “about one-tenth” reasonable; task cost залежить від reasoning і tools.

GLM vs Kimi K3

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
Automation 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

[3]

Немає universal winner.

GLM vs Hy4

Tencent: 163 experts, 203 engineering tasks.[13][14]

Hy4 2.99
Kimi 2.94
GLM 2.92

Hy4 vs GLM: 46.8% wins / 12.8 ties / 40.4 losses.[14]

Це internal Tencent workload.

GLM vs GPT-5.6 Sol

TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym6h 130 vs 293
HLE+Tools 62.5 vs 64.5

[3]

GLM трохи вище в CyberGym та AutomationBench. Mixed picture.

Claude Opus 5?

Z.ai launch table переважно включає Opus 4.8 і Fable 5, а не Opus 5.[3]

Тому вона не доводить GLM-5.3 > Claude Opus 5.

Licenses

Flash:

MIT

[8][11]

GLM-5.3:

custom GLM-5.3 License

[4]

Ліцензія дає широкі commercial rights, але MaaS entity з понад $10B aggregate revenue за будь-які 12 consecutive months має пройти Z.ai security review до commercial use.[4]

Self-hosting

Підтримуються vLLM, SGLang, Transformers, Docker Model Runner та інші frameworks.[3][8]

GLM repo:

~756 GB
141 safetensors shards

[5]

Flash менший по active compute, але hardware requirements все одно високі.

Chinese AI chips і 3× serving

Z.ai каже, що Flash/Ox Alpha працював на Chinese AI accelerators.[6][7]

Згадані Tensor Parallelism, ReplaySSM, W8A8, hybrid cache, Layer Split, EPD disaggregation.

Vendor claim:

3× end-to-end serving
vs initial baseline on same hardware

[6][7]

Потрібна independent validation.

Що обрати?

GLM-5.3 для maximum GLM coding, terminal agents, text reasoning і security.

Flash для cost, vision, documents, video/file, 1M context і MIT.

Інші models, якщо internal POC дає кращий:

cost per successful task

POC checklist

Quality

  • Реальні internal tasks.
  • Same harness.
  • Test pass rate.
  • Task completion.
  • Regressions.
  • Out-of-scope changes.
  • Long sessions.
  • Recovery.
  • Tool calling.
  • Structured output.

Reasoning

  • low, high, max.
  • Reasoning cannot be disabled.
  • Reasoning tokens.
  • Total output.
  • Latency.
  • Не використовувати max всюди.

Long context

  • 32K.
  • 128K.
  • 256K.
  • 1M.
  • Retrieval accuracy.
  • Instruction loss.
  • Large repo.
  • Cross-file dependencies.
  • KV cache/concurrency.
  • 1M не є perfect memory.

Flash multimodal

  • Screenshots.
  • Documents.
  • Charts.
  • OCR-like workflow.
  • GUI verification.
  • Video.

Security

  • Sandbox.
  • Network limits.
  • Tool logs.
  • Approval gates.
  • Separate secrets.
  • Minimum credentials.
  • Validate patches.
  • Model не є autonomous security authority.

License & operations

  • GLM license.
  • MaaS >$10B.
  • MIT Flash.
  • Data policy.
  • Processing region.
  • Retention.
  • Cache hit.
  • Cost per successful task.
  • Fallback.
  • Price after promo.

Висновок POLPROG

GLM-5.3 важливий передусім як великий post-training leap тієї самої base, що GLM-5.2.[1][15]

TB3.0 4.6 → 28.3
DeepSWE 46.2 → 66.9
ExploitBench 24.4 → 54.4

[1][3]

Flash пропонує 320B/18B, multimodality, 1M context, MIT і низьку API price. Artificial Analysis оцінює його в 57 проти 60 GLM-5.3 max.[10][11][12]

Для багатьох продуктів Flash може бути практичнішим за flagship.

Вирішувати має власний cost per successful task, а не один leaderboard.

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Часті запитання

Коли GLM-5.3?

14 серпня announcement, weights з 28.

Open source?

Точніше open weights під custom license.

Flash?

MIT.

Parameters?

GLM ~753B/40B; Flash 320B/18B.

Context?

1M.

Output?

128K.

Vision?

GLM text-only; Flash multimodal.

Reasoning off?

Ні.

Levels?

low, high, max.

Ox Alpha?

Pre-release Flash.

Кращий за Kimi?

Не у всьому.

Кращий за Hy4?

Tencent: Hy4 2.99, GLM 2.92.

Кращий за GPT?

Не загалом.

Opus 5?

Launch table цього не доводить.

CyberGym 84.5% = best security?

Ні.

GLM price?

$1.40/$0.26/$4.40.

Flash?

$0.15/$0.03/$0.50, promo half price.

Self-hosting?

Так, hardware intensive.

Production?

Own POC.

Джерела та примітки

  1. Z.ai, GLM-5.3, 14 серпня 2026.123456789101112131415
  2. Z.ai Docs, GLM-5.3, доступ 31 серпня 2026.12345
  3. Hugging Face, GLM-5.3 model card, доступ 31 серпня 2026.1234567891011121314
  4. GLM-5.3 License, доступ 31 серпня 2026.12
  5. GLM-5.3 files, доступ 31 серпня 2026.123
  6. Z.ai Docs, GLM-5.3-Flash, доступ 31 серпня 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash, серпень 2026.12345
  8. Hugging Face, GLM-5.3-Flash model card, доступ 31 серпня 2026.12345678910
  9. Z.ai Pricing, доступ 31 серпня 2026.12
  10. Artificial Analysis, GLM-5.3, стан 31 серпня 2026.12345
  11. Artificial Analysis, Flash, стан 31 серпня 2026.1234567
  12. Artificial Analysis comparison, стан 31 серпня 2026.12
  13. Tencent Hy4 launch, 28 серпня 2026.
  14. Tencent Hy4 model card, доступ 31 серпня 2026.12
  15. Z.ai, GLM-5.2, 16 червня 2026.1234
  16. GLM-5 technical report, 2026.
  17. Hugging Face, GLM-5.3, release marker перевірено 31 серпня 2026.12
  18. OpenRouter, GLM 5.3, стан 31 серпня 2026.
  19. OpenRouter, GLM 5.3 Flash, стан 31 серпня 2026.123
  20. Artificial Analysis, Flash provider benchmarks, стан 31 серпня 2026.

Чи було це корисно?

Отримуйте нові статті електронною поштою

Один короткий лист на кожну нову статтю Навчання. Без спаму, відписка в один клік.

Ми використовуємо вашу пошту лише для надсилання нових статей. Без передачі третім сторонам.

Назад до Навчання

Усі статті

Показати все