GLM-5.3 e GLM-5.3-Flash: benchmark, capacità cyber, Ox Alpha, open weights e confronto con Kimi K3, Hy4, Claude e GPT-5.6 Sol Skip to content

GLM-5.3 e GLM-5.3-Flash: benchmark, capacità cyber, Ox Alpha, open weights e confronto con Kimi K3, Hy4, Claude e GPT-5.6 Sol

Analisi verificata di GLM-5.3 e GLM-5.3-Flash: architettura, contesto 1M, 753B/40B e 320B/18B, multimodalità, Ox Alpha, benchmark coding e cyber, licenze, prezzi API, self-hosting e confronto con Kimi K3, Hy4, Claude e GPT-5.6 Sol.

Pubblicato Scritto da Tempo di lettura 23 min di lettura

Analisi verificata di GLM-5.3 e GLM-5.3-Flash: architettura, contesto 1M, 753B/40B e 320B/18B, multimodalità, Ox Alpha, benchmark coding e cyber, licenze, prezzi API, self-hosting e confronto con Kimi K3, Hy4, Claude e GPT-5.6 Sol.

In questa pagina
  1. 1TL;DR
  2. 2Cosa è successo ad agosto?
  3. 3GLM-5.3 non è semplicemente un Flash più grande
  4. 4Quanti parametri ha GLM-5.3?
  5. 5Flash: 320B total, 18B attivi
  6. 61M context e 128K output
  7. 7Text-only contro multimodal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T token multimodali
  12. 12Ox Alpha era Flash
  13. 13Perché il test stealth è interessante?
  14. 14Il salto viene dal post-training
  15. 15Cosa significa +50% coding?
  16. 16Benchmark pubblici
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym: 84.5%
  22. 22ExploitBench
  23. 23ExploitGym
  24. 242.436 vulnerabilità
  25. 25Cyber capability richiede governance
  26. 26Benchmark Flash
  27. 27Flash vs Opus 4.8 nel benchmark privato
  28. 28Artificial Analysis: 60 vs 57
  29. 29Prezzi API
  30. 30"One-tenth the price"
  31. 31GLM-5.3 vs Kimi K3
  32. 32GLM-5.3 vs Hy4
  33. 33GLM-5.3 vs GPT-5.6 Sol
  34. 34E Claude Opus 5?
  35. 35Open weights e licenze
  36. 36Self-hosting
  37. 37Chip AI cinesi e 3× serving
  38. 38Quale modello scegliere?
  39. 39Checklist POC
  40. 40Verdetto POLPROG

La fine di agosto 2026 ha portato due modelli Z.ai molto diversi.

GLM-5.3 è il grande modello text-only con reasoning orientato a long-horizon engineering, coding agents e cybersecurity. Z.ai lo ha annunciato il 14 agosto; i pesi pubblici sono arrivati su Hugging Face il 28 agosto dopo il periodo di safety evaluation e hardening annunciato al lancio.[1][17]

GLM-5.3-Flash è invece un modello molto più economico, nativamente multimodale e basato su un nuovo pre-training. Ha 320B parametri totali, 18B attivi per token, contesto 1M, input text/image/video/file e pesi pubblici con licenza MIT.[6][8][11]

Prima del lancio ufficiale Flash è stato testato anonimamente come:

Ox Alpha

su OpenCode e OpenRouter. Z.ai afferma che sia diventato rapidamente il modello più popolare della settimana e che il traffico sia stato servito su acceleratori AI cinesi; questa popolarità è una dichiarazione vendor.[6][7][19]

GLM-5.3 e Flash non sono semplicemente una variante grande e una piccola dello stesso modello.

GLM-5.3:

~753B total secondo metadata HF/AA attuali
~40B active
text-only
1M context
128K max output
reasoning sempre attivo
custom GLM-5.3 License

Flash:

320B total
18B active
native multimodal
1M context
128K max output
sparse + linear attention
MIT

[2][6][10][11]

I benchmark di lancio sono soprattutto Z.ai-reported e i risultati agentici dipendono fortemente da harness, tools, budget e configurazione inference.

Stato delle informazioni: 31 agosto 2026.

TL;DR

DomandaRisposta verificata
GLM-5.3 annunciato14 agosto 2026
Pesi GLM-5.3pubblici dal 28 agosto
Flashfine agosto; Artificial Analysis: 26 agosto
GLM-5.3753B total in HF/AA, ~40B active
Flash320B total, 18B active
GLM-5.3 inputtext
Flash inputtext, image, video, file
Context1M entrambi
Max output128K entrambi
Reasoningsempre attivo; low, high, max; default max
Licenza GLM-5.3custom GLM-5.3 License
Licenza FlashMIT
API GLM-5.3$1.40 input / $0.26 cached / $4.40 output per 1M
Flash list$0.15 / $0.03 / $0.50
Flash promo fino 9/09$0.075 / $0.015 / $0.25
Terminal-Bench 2.188.2, Z.ai-reported
Terminal-Bench 3.028.3, Z.ai-reported
DeepSWE66.9, Z.ai-reported
CyberGym84.5%, Z.ai-reported
ExploitBench54.4%, Z.ai-reported
Ox Alphaidentità pre-release di Flash
Artificial AnalysisGLM-5.3 60, Flash 57
Hy4 vs GLMTencent interno 2.99 vs 2.92
Caveatbenchmark agent dipendono dal setup

Cosa è successo ad agosto?

Z.ai ha annunciato GLM-5.3 il 14 agosto.[1]

Il punto particolare è che usa lo stesso base model di GLM-5.2: secondo Z.ai tutti i guadagni derivano dal post-training.[1][15]

L'API era disponibile subito, mentre i pesi sarebbero arrivati dopo ulteriori controlli safety. Hugging Face segnava il 28 agosto e oggi i pesi sono pubblici.[17][5]

Flash segue una strada diversa con nuova base, nuova architettura e multimodalità nativa.[6][8]

GLM-5.3 non è semplicemente un Flash più grande

GLM-5.3 privilegia massima qualità coding, long-horizon agents, terminal e cyber reasoning.

Flash privilegia costo, multimodalità, inference efficiency, visual coding, office workflows e long context.

Z.ai dice che Flash parte da una nuova base, non da una semplice distillation del flagship.[6][8]

Quanti parametri ha GLM-5.3?

L'architettura GLM-5 originale era descritta come:

744B total
40B active

[16]

Metadata attuali Hugging Face e Artificial Analysis:

753B total
40B active

[5][10]

Dato che GLM-5.3 condivide la base di GLM-5.2, trattiamo 744B vs 753B come differenza di conteggio/implementazione e usiamo 753B/40B per deployment attuali.[1][15]

Flash: 320B total, 18B attivi

Z.ai specifica:

320B total
18B active
45 layers

[6][8]

GLM-4.5 viene confrontato con 355B total, 32B active e 92 layers.[6]

Flash riduce quindi drasticamente compute attivo e depth.

1M context e 128K output

Docs ufficiali Z.ai:

Context Length: 1M
Maximum Output: 128K

per entrambi.[2][6]

Utile per grandi repository, agent session lunghe e analisi multi-file.

Ma 1M context non equivale a memoria perfetta: retrieval e instruction retention vanno testati.

Text-only contro multimodal

GLM-5.3:

Input: Text
Output: Text

[2]

Flash:

Input: Text, Image, Video, File
Output: Text

[6]

Flash è quindi più adatto a screenshot, GUI, documenti, PDF, presentazioni e visual coding. Artificial Analysis standardizza oggi text+image nel proprio profilo indipendente.[11]

Sparse + linear attention

Flash combina sparse attention e linear attention.[6][8]

Linear attention gestisce dipendenze locali tramite state modeling, sparse attention recupera elementi globali con un indexer.

Obiettivo: ridurre il costo dei contesti lunghi.

IndexPool

Flash introduce:

IndexPool

[6]

Comprime quattro key vectors cacheati in uno tramite weighted pooling.

Z.ai dichiara rispetto a GLM-5.3:

3.01× meno attention compute
4.44× meno KV cache

[6]

Sono misure vendor.

mHC

Flash usa anche:

Manifold-Constrained Hyper-Connections

[6][8]

La tecnica mira a migliorare information flow e scaling efficiency, cercando di mantenere molta capacità con 18B parametri attivi.

30T token multimodali

Z.ai dichiara:

30T-token multimodal corpus

[6][8]

GLM-5.3 mantiene la base GLM-5.2 e cresce tramite post-training; Flash riceve nuovo pre-training multimodale.

Ox Alpha era Flash

Prima del nome ufficiale:

ox-alpha

era testato su OpenCode e OpenRouter.[6][19]

Z.ai conferma che era GLM-5.3-Flash. La frase "più popolare della settimana" resta vendor claim.[7]

Perché il test stealth è interessante?

L'anonimato riduce parte del brand bias.

Non era però un esperimento scientifico controllato: utilizzo e popolarità possono dipendere da price, promo, routing, UI e availability.

Quindi è un segnale di interesse reale, non prova di superiorità.

Il salto viene dal post-training

Z.ai mantiene la stessa base GLM-5.2.[1][15]

Ha scalato:

  • environments,
  • task diversity,
  • post-training compute,
  • long-horizon tasks,
  • verifiers,
  • reinforcement learning,
  • environment generation.

Il framework open-source slime collega training, rollout e data generation.[1]

Cosa significa +50% coding?

Z.ai comunica:

+50% vs GLM-5.2

[1][2]

È il risultato del benchmark privato Z.ai Code Bench.

Max effort:

GLM-5.3: 34.5%, ~75K output tokens
GLM-5.2: 23.4%, ~96K output tokens

[1]

Non significa 50% meglio su ogni task di programmazione.

Benchmark pubblici

Z.ai riporta:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
AutomationBench48.226.246.741.046.245.8
Agents' Last Exam28.523.827.625.723.828.6
HLE + Tools62.554.759.857.963.964.5
GDPval-AA v2176915081682158817431730

Tutti valori Z.ai-reported.

Terminal-Bench 3.0

GLM-5.2: 4.6
GLM-5.3: 28.3

[1][3]

È un salto enorme, non "6× più intelligente".

Il setup usa Claude Code 2.1.207, max effort, grande context, fino a 600 agent turns e timeout lungo.[3]

DeepSWE

GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7

[3]

GLM migliora molto ma non domina questa tabella.

Terminal-Bench 2.1

GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0

[3]

Differenze minime.

Agents' Last Exam

GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6

[3]

Anche qui quasi parità.

CyberGym: 84.5%

Z.ai:

GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%

[1][3]

CyberGym parte da source code white-box e verifica vulnerability discovery. Non misura direttamente attacchi arbitrari a sistemi reali.

ExploitBench

GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%

[1][3]

Il salto è enorme, ma il closed frontier resta avanti.

ExploitGym

Task completati 2h/6h:

GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293

[3]

Z.ai normalizza il tempo sul throughput di ciascun modello, quindi la metodologia è specifica.

2.436 vulnerabilità

Z.ai dichiara dopo review e deduplication:

2,436 findings
269 projects
1,097 critical + high

[1][2]

Ledger:

53 pubbliche
2,383 embargo
107 critical
990 high
1,286 medium
53 low

[1]

Sono dati vendor, non un database CVE indipendente.

Cyber capability richiede governance

Use case difensivi:

  • secure code review,
  • vulnerability triage,
  • bug reproduction,
  • SAST augmentation,
  • patch analysis,
  • fuzzing,
  • threat modeling.

Servono sandbox, network isolation, logging, approval gates, secrets separati e privilegi minimi.

Benchmark Flash

Z.ai:[7][8]

BenchmarkFlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
AutomationBench48.826.2
Agents' Last Exam26.320.4
HLE + Tools55.354.7
GDPval-AA v217731504

Il punto è il trade-off qualità/prezzo, non l'uguaglianza con GLM-5.3.

Flash vs Opus 4.8 nel benchmark privato

Z.ai Code Bench Max:

Flash 29.0
Opus 4.8 29.5

[6]

Non prova che Flash equivalga a Claude in generale.

Artificial Analysis: 60 vs 57

Indice v4.1.1:

GLM-5.3 max: 60
Flash: 57

[10][11][12]

Misure API first-party:

GLM-5.3 ~66.5 tokens/s, ~1.6s TTFT
Flash ~45–49 tokens/s, ~1.5s TTFT

[10][11][20]

"Flash" non significa automaticamente più throughput token. Il vantaggio è costo, compute attivo e multimodalità.

Prezzi API

Z.ai:[9]

GLM-5.3

Input $1.40
Cached $0.26
Output $4.40

Flash list

Input $0.15
Cached $0.03
Output $0.50

Promo fino 9 settembre

Input $0.075
Cached $0.015
Output $0.25

per 1M token.

OpenRouter offre entrambi ma prezzi e routing possono differire.[18][19]

"One-tenth the price"

Flash è circa:

9.3× più economico input
8.8× più economico output

a list price.[9]

"Circa un decimo" è quindi ragionevole, ma cost per task dipende anche da reasoning e tools.

GLM-5.3 vs Kimi K3

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
AutomationBench 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

[3]

Nessun vincitore universale.

GLM-5.3 vs Hy4

Tencent: 163 esperti, 203 task.[13][14]

Hy4 2.99
Kimi K3 2.94
GLM-5.3 2.92

Hy4 vs GLM:

46.8% wins
12.8% ties
40.4% losses

[14]

È un test interno Tencent.

GLM-5.3 vs GPT-5.6 Sol

Z.ai:[3]

TB3.0 28.3 vs 34.6
DeepSWE 66.9 vs 72.7
ExploitBench 54.4 vs 76.5
ExploitGym 6h 130 vs 293
HLE+Tools 62.5 vs 64.5

GLM è leggermente sopra in CyberGym e AutomationBench. Quadro misto.

E Claude Opus 5?

La tabella launch Z.ai usa soprattutto Opus 4.8 e Fable 5, non Opus 5.[3]

Quindi non dimostra:

GLM-5.3 > Claude Opus 5

Open weights e licenze

Flash:

MIT

[8][11]

GLM-5.3:

custom GLM-5.3 License

[4]

La licenza consente uso, modifica, distribuzione, fine-tuning e vendita, ma per operatori Model as a Service oltre $10B di ricavi aggregati in 12 mesi consecutivi richiede una security review Z.ai prima dell'uso commerciale.[4]

Self-hosting

Supporto ufficiale:

vLLM
SGLang
Transformers
Docker Model Runner

e altri framework.[3][8]

Repo GLM-5.3:

~756 GB
141 safetensors shards

[5]

Flash è più leggero in compute attivo, ma resta grande.

Chip AI cinesi e 3× serving

Z.ai dice che il traffic Flash/Ox Alpha è stato servito su acceleratori cinesi.[6][7]

Stack include:

Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 cache
Layer Split
Encode–Prefill–Decode disaggregation

Claim Z.ai:

3× end-to-end serving
vs initial baseline sullo stesso hardware

[6][7]

Da verificare indipendentemente.

Quale modello scegliere?

GLM-5.3 per massima qualità coding GLM, terminal agents, reasoning testuale e security analysis.

Flash per costo, vision, screenshots, documenti, video/file, 1M context e MIT.

Kimi, Hy4, GPT o Claude se un POC interno offre migliore:

cost per successful task

Checklist POC

Qualità

  • Task reali.
  • Stesso harness.
  • Test pass rate.
  • Task completion.
  • Regressioni.
  • Out-of-scope changes.
  • Sessioni lunghe.
  • Recovery.
  • Tool calling.
  • Structured output.

Reasoning

  • Confrontare low, high, max.
  • Reasoning non disattivabile.
  • Misurare reasoning tokens.
  • Misurare output totale.
  • Misurare latency.
  • Non usare max ovunque.

Long context

  • Test 32K.
  • Test 128K.
  • Test 256K.
  • Test 1M.
  • Retrieval accuracy.
  • Instruction loss.
  • Grandi repo.
  • Cross-file dependencies.
  • KV cache/concurrency.
  • 1M non è memoria perfetta.

Flash multimodal

  • Screenshot.
  • Documenti.
  • Chart.
  • OCR-like workflow.
  • GUI verification.
  • Video reale.

Security

  • Sandbox cyber.
  • Limitare network.
  • Log tool calls.
  • Approval gates.
  • Separare production secrets.
  • Limitare credentials.
  • Validare patch prima del merge.
  • Non trattare il modello come autorità autonoma.

Licenza e operazioni

  • Leggere GLM-5.3 License.
  • Verificare clausola MaaS >$10B.
  • Verificare MIT Flash.
  • Data policy provider.
  • Processing region.
  • Retention.
  • Cache hit rate.
  • Cost per successful task.
  • Fallback model.
  • Prezzo Flash dopo promo.

Verdetto POLPROG

GLM-5.3 è una delle release coding più interessanti di agosto 2026 perché porta molto più avanti la stessa base di GLM-5.2 tramite post-training.[1][15]

Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4

[1][3]

Flash segue un'altra strategia:

320B total
18B active
multimodal
1M context
MIT
API molto economica

e ottiene 57 in Artificial Analysis contro 60 di GLM-5.3 max.[10][11][12]

Per molti prodotti Flash può essere più interessante del flagship.

La domanda corretta è:

quale modello offre il miglior cost per successful task con qualità, sicurezza e latency sufficienti?

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Domande frequenti

Quando è uscito GLM-5.3?

Annunciato il 14 agosto; pesi pubblici dal 28.

Open source?

Più preciso: open weights con custom GLM-5.3 License.

Flash?

Pesi pubblici MIT.

Parametri GLM-5.3

~753B total / 40B active oggi; GLM-5 originale 744B/40B.

Flash

320B/18B.

Context

1M entrambi.

Max output

128K.

Vision

GLM-5.3 text-only; Flash multimodal.

Reasoning disattivabile?

No.

Livelli

low, high, max.

Ox Alpha

Identità anonima pre-release di Flash.

Meglio di Kimi?

Non in tutti i benchmark.

Meglio di Hy4?

Tencent: Hy4 2.99, GLM 2.92 nel test interno.

Meglio di GPT-5.6 Sol?

Non globalmente.

Meglio di Opus 5?

Non dimostrato dalla tabella Z.ai.

84.5% CyberGym = miglior security model?

No.

Prezzo GLM-5.3

$1.40 / $0.26 / $4.40.

Prezzo Flash

$0.15 / $0.03 / $0.50; promo $0.075 / $0.015 / $0.25 fino al 9 settembre.

Self-hosting

Sì, con hardware importante.

Produzione

POC controllato con qualità, latency, token, tools e cost per successful task.

Fonti e note

  1. Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, 14 agosto 2026, consultato 31 agosto 2026.123456789101112131415
  2. Z.ai Developer Docs, GLM-5.3 — Overview, consultato 31 agosto 2026.12345
  3. Z.ai / Hugging Face, GLM-5.3 — model card ufficiale, consultato 31 agosto 2026.1234567891011121314
  4. Z.ai / Hugging Face, GLM-5.3 License, consultato 31 agosto 2026.12
  5. Hugging Face, zai-org/GLM-5.3 — files and versions, consultato 31 agosto 2026.123
  6. Z.ai Developer Docs, GLM-5.3-Flash — Overview, consultato 31 agosto 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, agosto 2026, consultato 31 agosto 2026.12345
  8. Z.ai / Hugging Face, GLM-5.3-Flash — model card ufficiale, consultato 31 agosto 2026.12345678910
  9. Z.ai Developer Docs, Pricing, consultato 31 agosto 2026.12
  10. Artificial Analysis, GLM-5.3 (max), stato 31 agosto 2026.12345
  11. Artificial Analysis, GLM-5.3-Flash, stato 31 agosto 2026.1234567
  12. Artificial Analysis, GLM-5.3-Flash vs GLM-5.3, stato 31 agosto 2026.12
  13. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 agosto 2026.
  14. Tencent / Hugging Face, Hy4 preview — model card ufficiale, consultato 31 agosto 2026.12
  15. Z.ai, GLM-5.2: Built for Long-Horizon Tasks, 16 giugno 2026.1234
  16. GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, arXiv:2602.15763, 2026.
  17. Hugging Face, zai-org/GLM-5.3, release marker verificato 31 agosto 2026.12
  18. OpenRouter, Z.ai: GLM 5.3, stato 31 agosto 2026.
  19. OpenRouter, Z.ai: GLM 5.3 Flash, stato 31 agosto 2026.123
  20. Artificial Analysis, GLM-5.3-Flash API Provider Benchmarking, stato 31 agosto 2026.

È stato utile?

Ricevi i nuovi articoli via e-mail

Una breve e-mail per ogni nuovo articolo di Formazione. Niente spam, disiscriviti con un clic.

Usiamo la tua e-mail solo per inviare nuovi articoli. Nessuna condivisione con terze parti.

Torna alla Formazione