GLM-5.3 y GLM-5.3-Flash: benchmarks, capacidades cyber, Ox Alpha, open weights y comparación con Kimi K3, Hy4, Claude y GPT-5.6 Sol Skip to content

GLM-5.3 y GLM-5.3-Flash: benchmarks, capacidades cyber, Ox Alpha, open weights y comparación con Kimi K3, Hy4, Claude y GPT-5.6 Sol

Análisis verificado de GLM-5.3 y GLM-5.3-Flash: arquitectura, contexto 1M, 753B/40B y 320B/18B, multimodalidad, Ox Alpha, benchmarks coding y cyber, licencias, precios API, self-hosting y comparación con Kimi K3, Hy4, Claude y GPT-5.6 Sol.

Publicado Escrito por Tiempo de lectura 23 min de lectura

Análisis verificado de GLM-5.3 y GLM-5.3-Flash: arquitectura, contexto 1M, 753B/40B y 320B/18B, multimodalidad, Ox Alpha, benchmarks coding y cyber, licencias, precios API, self-hosting y comparación con Kimi K3, Hy4, Claude y GPT-5.6 Sol.

En esta página
  1. 1TL;DR
  2. 2¿Qué ocurrió en agosto?
  3. 3GLM-5.3 no es simplemente un Flash grande
  4. 4¿Cuántos parámetros tiene GLM-5.3?
  5. 5Flash: 320B total, 18B activos
  6. 61M context y 128K output
  7. 7Text-only frente a multimodal
  8. 8Sparse + linear attention
  9. 9IndexPool
  10. 10mHC
  11. 1130T tokens multimodales
  12. 12Ox Alpha era Flash
  13. 13¿Por qué importa el stealth test?
  14. 14El salto viene del post-training
  15. 15¿Qué significa +50% coding?
  16. 16Benchmarks públicos GLM-5.3
  17. 17Terminal-Bench 3.0
  18. 18DeepSWE
  19. 19Terminal-Bench 2.1
  20. 20Agents' Last Exam
  21. 21CyberGym: 84.5%
  22. 22ExploitBench: frontera clara
  23. 23ExploitGym
  24. 242.436 vulnerabilidades
  25. 25Cyber capabilities requieren governance
  26. 26Benchmarks Flash
  27. 27Flash vs Opus 4.8 en benchmark privado
  28. 28Artificial Analysis: 60 vs 57
  29. 29Precios API
  30. 30¿“One-tenth the price” es razonable?
  31. 31GLM-5.3 vs Kimi K3
  32. 32GLM-5.3 vs Hy4
  33. 33GLM-5.3 vs GPT-5.6 Sol
  34. 34¿Y Claude Opus 5?
  35. 35Open weights y licencias
  36. 36Self-hosting
  37. 37Chips AI chinos y 3× serving
  38. 38¿Qué modelo elegir?
  39. 39Checklist POC
  40. 40Veredicto POLPROG

A finales de agosto de 2026 Z.ai presentó dos modelos muy distintos de la misma generación.

GLM-5.3 es el gran modelo text-only con reasoning orientado a ingeniería de larga duración, coding agents y capacidades de ciberseguridad en fuerte crecimiento. Z.ai lo anunció el 14 de agosto y los pesos públicos aparecieron en Hugging Face el 28 de agosto después del periodo de safety evaluation y hardening anunciado por la compañía.[1][17]

GLM-5.3-Flash llegó como modelo mucho más barato, nativamente multimodal y entrenado desde una nueva base. Tiene 320B parámetros totales, 18B activos por token, contexto de 1M, entrada text/image/video/file y pesos públicos con licencia MIT.[6][8][11]

Antes del lanzamiento Flash se probó de forma anónima como:

Ox Alpha

en OpenCode y OpenRouter. Z.ai afirma que se convirtió rápidamente en el modelo más popular de la semana y que el tráfico se sirvió sobre aceleradores AI chinos; esa popularidad es una afirmación del fabricante.[6][7][19]

GLM-5.3 y Flash no son simplemente una versión grande y pequeña del mismo modelo.

GLM-5.3:

~753B total según metadata HF/AA actual
~40B activos
text-only
contexto 1M
128K max output
reasoning siempre activo
licencia GLM-5.3 personalizada

Flash:

320B total
18B activos
multimodal nativo
contexto 1M
128K max output
sparse + linear attention
MIT

[2][6][10][11]

Los benchmarks de lanzamiento son sobre todo Z.ai-reported. En agentes, harness, herramientas, contexto, timeout y presupuesto de inference pueden cambiar mucho el resultado.

Estado de la información: 31 de agosto de 2026.

TL;DR

PreguntaRespuesta verificada
GLM-5.3 anunciado14 agosto 2026
Pesos GLM-5.3públicos desde 28 agosto
Flashfinales de agosto; Artificial Analysis: 26 agosto
GLM-5.3753B total en HF/AA, ~40B activos
Flash320B total, 18B activos
Input GLM-5.3text
Input Flashtext, image, video, file
Contexto1M ambos
Max output128K ambos
Reasoningsiempre activo: low, high, max; default max
Licencia GLM-5.3custom GLM-5.3 License
Licencia FlashMIT
API GLM-5.3$1.40 input / $0.26 cached / $4.40 output por 1M
Flash lista$0.15 / $0.03 / $0.50
Flash promo hasta 9/09$0.075 / $0.015 / $0.25
Terminal-Bench 2.188.2, Z.ai-reported
Terminal-Bench 3.028.3, Z.ai-reported
DeepSWE66.9, Z.ai-reported
CyberGym84.5%, Z.ai-reported
ExploitBench54.4%, Z.ai-reported
Ox Alphaidentidad pre-release de Flash
Artificial AnalysisGLM-5.3 60, Flash 57
Hy4 vs GLMTencent interno 2.99 vs 2.92
Caveatbenchmarks agentic dependen del setup

¿Qué ocurrió en agosto?

Z.ai anunció GLM-5.3 el 14 de agosto.[1]

La novedad es que mantiene el mismo base model que GLM-5.2. Según Z.ai, toda la mejora procede del post-training.[1][15]

La API estuvo disponible primero y los pesos llegaron después de una evaluación de seguridad adicional. Hugging Face marcó el 28 de agosto y actualmente los pesos están disponibles.[17][5]

Flash usa, en cambio, nueva base, nueva arquitectura y multimodalidad nativa.[6][8]

GLM-5.3 no es simplemente un Flash grande

GLM-5.3 prioriza máxima calidad en coding, long-horizon agents, terminal y cyber reasoning.

Flash prioriza coste, multimodalidad, inference efficiency, visual coding, workflows office y contexto largo.

Z.ai afirma que Flash fue entrenado desde una nueva base y no es una simple distillation del flagship.[6][8]

¿Cuántos parámetros tiene GLM-5.3?

La arquitectura original GLM-5 se presentó como:

744B total
40B active

[16]

Metadata actual de Hugging Face y Artificial Analysis:

753B total
40B active

[5][10]

Como GLM-5.3 comparte base con GLM-5.2, tratamos 744B vs 753B como diferencia de conteo/implementación y usamos 753B/40B para deployments actuales.[1][15]

Flash: 320B total, 18B activos

Z.ai especifica:

320B total
18B active
45 layers

[6][8]

GLM-4.5, en la comparación de Z.ai, tenía 355B total, 32B active y 92 layers.[6]

1M context y 128K output

Docs oficiales:

Context Length: 1M
Maximum Output: 128K

para ambos.[2][6]

Útil para grandes repos, sesiones largas y análisis multi-file.

Pero 1M context no es 1M memoria perfecta. Hay que validar retrieval e instruction retention.

Text-only frente a multimodal

GLM-5.3:

Input: Text
Output: Text

[2]

Flash:

Input: Text, Image, Video, File
Output: Text

[6]

Flash es mucho más adecuado para screenshots, GUI, documentos, PDF, slides y visual coding. Artificial Analysis estandariza actualmente text+image en su perfil independiente.[11]

Sparse + linear attention

Flash combina sparse attention y linear attention.[6][8]

Linear attention trabaja relaciones más locales con state modeling; sparse attention recupera información global mediante indexer.

El objetivo es reducir coste en contextos largos.

IndexPool

Flash introduce:

IndexPool

[6]

Comprime cuatro key vectors cacheados en uno.

Z.ai reporta frente a GLM-5.3:

3.01× menos attention compute
4.44× menos KV cache

[6]

Son cifras del fabricante.

mHC

También usa:

Manifold-Constrained Hyper-Connections

[6][8]

La técnica pretende mejorar flujo de información y scaling efficiency. El objetivo práctico es conservar mucha capacidad con solo 18B parámetros activos.

30T tokens multimodales

Z.ai dice que Flash usa:

30T-token multimodal corpus

[6][8]

GLM-5.3 mantiene la base de GLM-5.2; Flash incorpora nuevo pre-training.

Ox Alpha era Flash

Antes del nombre oficial:

ox-alpha

se probó en OpenCode y OpenRouter.[6][19]

Z.ai confirma que era GLM-5.3-Flash. La afirmación de que fue el modelo más popular de la semana sigue siendo vendor claim.[7]

¿Por qué importa el stealth test?

El anonimato reduce parte del sesgo de marca.

Pero uso y popularidad también dependen de precio, promoción, routing, disponibilidad e interfaz. Por eso es señal de interés real, no una evaluación científica.

El salto viene del post-training

Z.ai conserva la misma base que GLM-5.2.[1][15]

Escaló:

  • environments,
  • task diversity,
  • post-training compute,
  • long-horizon tasks,
  • verifiers,
  • reinforcement learning,
  • generación automática de entornos.

El framework open-source slime conecta training, rollout y data generation.[1]

¿Qué significa +50% coding?

Z.ai anuncia:

+50% vs GLM-5.2

[1][2]

Se refiere al benchmark privado Z.ai Code Bench.

Max effort:

GLM-5.3: 34.5% / ~75K output tokens
GLM-5.2: 23.4% / ~96K output tokens

[1]

No significa 50% mejor en toda programación.

Benchmarks públicos GLM-5.3

Tabla Z.ai:[3]

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE66.946.267.558.069.772.7
Toolathlon73.059.976.576.274.774.9
AutomationBench48.226.246.741.046.245.8
Agents' Last Exam28.523.827.625.723.828.6
HLE + Tools62.554.759.857.963.964.5
GDPval-AA v2176915081682158817431730

Todo es Z.ai-reported.

Terminal-Bench 3.0

GLM-5.2: 4.6
GLM-5.3: 28.3

[1][3]

Es un salto enorme, pero no “6× más inteligente”.

Z.ai usa un harness con Claude Code 2.1.207, max effort, gran contexto, hasta 600 agent turns y timeout amplio.[3]

DeepSWE

GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7

[3]

GLM mejora mucho, pero no lidera esta tabla.

Terminal-Bench 2.1

GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0

[3]

Las diferencias son demasiado pequeñas para titulares absolutos.

Agents' Last Exam

GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6

[3]

Otra situación prácticamente empatada.

CyberGym: 84.5%

Z.ai reporta:

GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%

[1][3]

CyberGym parte de source code white-box y valida vulnerabilidades provocando faults. No equivale a medir ataques sobre sistemas reales arbitrarios.

ExploitBench: frontera clara

GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%

[1][3]

GLM da un gran salto, pero el closed frontier sigue claramente por delante.

ExploitGym

Tareas 2h/6h:

GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293

[3]

Z.ai normaliza tiempo por throughput de cada modelo; es una metodología específica.

2.436 vulnerabilidades

Z.ai afirma que tras review, screening y deduplication se obtuvieron:

2,436 findings
269 proyectos
1,097 critical + high

[1][2]

Ledger:

53 publicadas
2,383 bajo embargo
107 critical
990 high
1,286 medium
53 low

[1]

Son datos operativos del fabricante, no un dataset CVE independiente.

Cyber capabilities requieren governance

Usos defensivos:

  • secure code review,
  • vulnerability triage,
  • reproducción controlada,
  • SAST augmentation,
  • patch analysis,
  • fuzzing support,
  • threat modeling.

Controles: sandbox, network isolation, logs, approval gates, separación de secrets y permisos mínimos.

Benchmarks Flash

Z.ai reporta:[7][8]

BenchmarkFlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE63.446.2
NL2Repo56.348.9
Toolathlon78.459.9
AutomationBench48.826.2
Agents' Last Exam26.320.4
HLE + Tools55.354.7
GDPval-AA v217731504

Flash recupera mucha calidad a menor coste; no significa igualdad con GLM-5.3.

Flash vs Opus 4.8 en benchmark privado

Z.ai Code Bench Max:

Flash: 29.0
Opus 4.8: 29.5

[6]

No es evidencia independiente de que Flash iguale Claude en todos los escenarios.

Artificial Analysis: 60 vs 57

Artificial Analysis Intelligence Index v4.1.1:

GLM-5.3 max: 60
Flash: 57

[10][11][12]

Mediciones actuales first-party:

GLM-5.3: ~66.5 tokens/s, ~1.6s TTFT
Flash: ~45–49 tokens/s, ~1.5s TTFT

[10][11][20]

El nombre Flash no implica necesariamente más output tokens/s. Sus ventajas son coste, compute activo y multimodalidad.

Precios API

Z.ai:[9]

GLM-5.3

Input $1.40
Cached $0.26
Output $4.40

Flash lista

Input $0.15
Cached $0.03
Output $0.50

Promo hasta 9 septiembre

Input $0.075
Cached $0.015
Output $0.25

por 1M tokens.

OpenRouter también ofrece ambos y puede tener precios/routing distintos.[18][19]

¿“One-tenth the price” es razonable?

A precio de lista Flash es aproximadamente:

9.3× más barato input
8.8× más barato output

[9]

“Una décima parte” es una aproximación razonable. Coste por task puede variar por reasoning y tool calls.

GLM-5.3 vs Kimi K3

Z.ai:[3]

TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
AutomationBench 48.2 vs 46.7
ExploitBench 54.4 vs 32.2

No hay un ganador único.

GLM-5.3 vs Hy4

Tencent evaluó 163 expertos y 203 tareas.[13][14]

Hy4 2.99
Kimi K3 2.94
GLM-5.3 2.92

Hy4 vs GLM:

46.8% wins
12.8% ties
40.4% losses

[14]

Es un test interno Tencent, no ranking universal.

GLM-5.3 vs GPT-5.6 Sol

Z.ai:[3]

TB3.0: 28.3 vs 34.6
DeepSWE: 66.9 vs 72.7
ExploitBench: 54.4 vs 76.5
ExploitGym 6h: 130 vs 293
HLE+Tools: 62.5 vs 64.5

GLM supera ligeramente CyberGym y AutomationBench. Resultado mixto.

¿Y Claude Opus 5?

La tabla launch de Z.ai usa sobre todo Opus 4.8 y Fable 5, no Opus 5.[3]

Por tanto no permite afirmar:

GLM-5.3 > Claude Opus 5

Open weights y licencias

Flash:

MIT

[8][11]

GLM-5.3:

custom GLM-5.3 License

[4]

La licencia permite uso, modificación, distribución, fine-tuning y venta, pero añade una condición para operadores Model as a Service con más de $10B de ingresos agregados en 12 meses consecutivos: deben pasar una security review de Z.ai antes de uso comercial.[4]

Self-hosting

Rutas oficiales:

vLLM
SGLang
Transformers
Docker Model Runner

y otros frameworks.[3][8]

Repositorio GLM-5.3:

~756 GB
141 safetensors shards

[5]

Flash es más ligero en compute activo, pero sigue siendo un modelo grande.

Chips AI chinos y 3× serving

Z.ai dice que traffic real de Flash/Ox Alpha fue servido sobre accelerators chinos.[6][7]

Stack:

Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 cache
Layer Split
Encode–Prefill–Decode disaggregation

Claim:

3× end-to-end serving
vs baseline inicial en el mismo hardware

[6][7]

Debe tratarse como vendor claim.

¿Qué modelo elegir?

GLM-5.3 para máxima calidad coding GLM, terminal agents, reasoning textual y security analysis.

Flash para coste, vision, screenshots, documentos, video/file, 1M context y licencia MIT.

Kimi, Hy4, GPT o Claude si un POC propio muestra mejor:

cost per successful task

Checklist POC

Calidad

  • Probar tareas reales.
  • Mismo harness.
  • Medir test pass rate.
  • Medir task completion.
  • Medir regresiones.
  • Medir cambios fuera de scope.
  • Probar sesiones largas.
  • Probar recovery.
  • Validar tool calling.
  • Validar structured output.

Reasoning

  • Comparar low, high, max.
  • Recordar que reasoning no se desactiva.
  • Medir reasoning tokens.
  • Medir output total.
  • Medir latencia end-to-end.
  • No usar max en todo.

Long context

  • Probar 32K.
  • Probar 128K.
  • Probar 256K.
  • Probar 1M.
  • Medir retrieval accuracy.
  • Medir instruction loss.
  • Probar repos grandes.
  • Probar cross-file dependencies.
  • Medir KV cache y concurrency.
  • No equiparar 1M con memoria perfecta.

Multimodal Flash

  • Probar screenshots.
  • Probar documentos.
  • Probar charts.
  • Probar OCR-like workflows.
  • Probar GUI verification.
  • Probar video real.

Security

  • Sandbox para cyber.
  • Limitar network.
  • Log de tool calls.
  • Approval gates.
  • Separar production secrets.
  • Limitar credentials.
  • Validar patches antes de merge.
  • No tratar el modelo como autoridad autónoma.

Licencia y operaciones

  • Revisar GLM-5.3 License.
  • Revisar cláusula MaaS >$10B.
  • Revisar MIT Flash.
  • Revisar data policy provider.
  • Revisar processing region.
  • Revisar retention.
  • Medir cache hit.
  • Medir cost per successful task.
  • Definir fallback.
  • Monitorizar precio Flash tras promo.

Veredicto POLPROG

GLM-5.3 es una de las releases coding más interesantes de agosto de 2026 porque empuja mucho más lejos la misma base que GLM-5.2 mediante post-training.[1][15]

Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4

[1][3]

Flash sigue otra estrategia:

320B total
18B active
multimodal
1M context
MIT
API muy barata

y logra 57 en Artificial Analysis frente a 60 para GLM-5.3 max.[10][11][12]

Para muchos productos Flash puede ser más atractivo que el flagship.

La pregunta correcta no es quién gana un leaderboard, sino:

qué modelo ofrece el mejor cost per successful task con la calidad, seguridad y latencia necesarias.

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Preguntas frecuentes

¿Cuándo salió GLM-5.3?

Anunciado el 14 de agosto; pesos públicos el 28.

¿Open source?

Más preciso: open weights con licencia GLM-5.3 personalizada.

¿Flash?

Pesos públicos bajo MIT.

Parámetros GLM-5.3

~753B total / 40B active en metadata actual; arquitectura original GLM-5 744B/40B.

Flash

320B/18B.

Contexto

1M ambos.

Output máximo

128K.

Vision

GLM-5.3 text-only; Flash multimodal.

¿Se puede apagar reasoning?

No.

Niveles

low, high, max.

Ox Alpha

Identidad anónima pre-release de Flash.

¿Mejor que Kimi?

No en todos los benchmarks.

¿Mejor que Hy4?

Tencent puntuó Hy4 2.99 y GLM 2.92 en su test interno.

¿Mejor que GPT-5.6 Sol?

No globalmente.

¿Mejor que Opus 5?

No demostrado en la tabla Z.ai.

¿84.5% CyberGym = mejor security model?

No. Deep exploitation sigue favoreciendo a modelos closed en la tabla Z.ai.

Precio GLM-5.3

$1.40 / $0.26 / $4.40.

Precio Flash

$0.15 / $0.03 / $0.50; promo $0.075 / $0.015 / $0.25 hasta 9 septiembre.

Self-hosting

Sí, con requisitos elevados.

Producción

POC propio con calidad, latency, tokens, tools y cost per successful task.

Fuentes y notas

  1. Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, 14 agosto 2026, consultado 31 agosto 2026.123456789101112131415
  2. Z.ai Developer Docs, GLM-5.3 — Overview, consultado 31 agosto 2026.12345
  3. Z.ai / Hugging Face, GLM-5.3 — model card oficial, consultado 31 agosto 2026.1234567891011121314
  4. Z.ai / Hugging Face, GLM-5.3 License, consultado 31 agosto 2026.12
  5. Hugging Face, zai-org/GLM-5.3 — files and versions, consultado 31 agosto 2026.123
  6. Z.ai Developer Docs, GLM-5.3-Flash — Overview, consultado 31 agosto 2026.123456789101112131415161718
  7. Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, agosto 2026, consultado 31 agosto 2026.12345
  8. Z.ai / Hugging Face, GLM-5.3-Flash — model card oficial, consultado 31 agosto 2026.12345678910
  9. Z.ai Developer Docs, Pricing, consultado 31 agosto 2026.12
  10. Artificial Analysis, GLM-5.3 (max), estado 31 agosto 2026.12345
  11. Artificial Analysis, GLM-5.3-Flash, estado 31 agosto 2026.1234567
  12. Artificial Analysis, GLM-5.3-Flash vs GLM-5.3, estado 31 agosto 2026.12
  13. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 agosto 2026.
  14. Tencent / Hugging Face, Hy4 preview — model card oficial, consultado 31 agosto 2026.12
  15. Z.ai, GLM-5.2: Built for Long-Horizon Tasks, 16 junio 2026.1234
  16. GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, arXiv:2602.15763, 2026.
  17. Hugging Face, zai-org/GLM-5.3, release marker comprobado 31 agosto 2026.12
  18. OpenRouter, Z.ai: GLM 5.3, estado 31 agosto 2026.
  19. OpenRouter, Z.ai: GLM 5.3 Flash, estado 31 agosto 2026.123
  20. Artificial Analysis, GLM-5.3-Flash API Provider Benchmarking, estado 31 agosto 2026.

¿Te ha resultado útil?

Recibe nuevos artículos por email

Un correo breve por cada nuevo artículo de la base de conocimiento. Sin spam, te das de baja con un clic.

Solo usamos tu email para enviar nuevos artículos. Sin compartir con terceros.

Volver a la base de conocimiento