A finales de agosto de 2026 Z.ai presentó dos modelos muy distintos de la misma generación.
GLM-5.3 es el gran modelo text-only con reasoning orientado a ingeniería de larga duración, coding agents y capacidades de ciberseguridad en fuerte crecimiento. Z.ai lo anunció el 14 de agosto y los pesos públicos aparecieron en Hugging Face el 28 de agosto después del periodo de safety evaluation y hardening anunciado por la compañía.[1][17]
GLM-5.3-Flash llegó como modelo mucho más barato, nativamente multimodal y entrenado desde una nueva base. Tiene 320B parámetros totales, 18B activos por token, contexto de 1M, entrada text/image/video/file y pesos públicos con licencia MIT.[6][8][11]
Antes del lanzamiento Flash se probó de forma anónima como:
Ox Alpha
en OpenCode y OpenRouter. Z.ai afirma que se convirtió rápidamente en el modelo más popular de la semana y que el tráfico se sirvió sobre aceleradores AI chinos; esa popularidad es una afirmación del fabricante.[6][7][19]
GLM-5.3 y Flash no son simplemente una versión grande y pequeña del mismo modelo.
GLM-5.3:
~753B total según metadata HF/AA actual
~40B activos
text-only
contexto 1M
128K max output
reasoning siempre activo
licencia GLM-5.3 personalizada
Flash:
320B total
18B activos
multimodal nativo
contexto 1M
128K max output
sparse + linear attention
MIT
Los benchmarks de lanzamiento son sobre todo Z.ai-reported. En agentes, harness, herramientas, contexto, timeout y presupuesto de inference pueden cambiar mucho el resultado.
Estado de la información: 31 de agosto de 2026.
TL;DR
| Pregunta | Respuesta verificada |
|---|---|
| GLM-5.3 anunciado | 14 agosto 2026 |
| Pesos GLM-5.3 | públicos desde 28 agosto |
| Flash | finales de agosto; Artificial Analysis: 26 agosto |
| GLM-5.3 | 753B total en HF/AA, ~40B activos |
| Flash | 320B total, 18B activos |
| Input GLM-5.3 | text |
| Input Flash | text, image, video, file |
| Contexto | 1M ambos |
| Max output | 128K ambos |
| Reasoning | siempre activo: low, high, max; default max |
| Licencia GLM-5.3 | custom GLM-5.3 License |
| Licencia Flash | MIT |
| API GLM-5.3 | $1.40 input / $0.26 cached / $4.40 output por 1M |
| Flash lista | $0.15 / $0.03 / $0.50 |
| Flash promo hasta 9/09 | $0.075 / $0.015 / $0.25 |
| Terminal-Bench 2.1 | 88.2, Z.ai-reported |
| Terminal-Bench 3.0 | 28.3, Z.ai-reported |
| DeepSWE | 66.9, Z.ai-reported |
| CyberGym | 84.5%, Z.ai-reported |
| ExploitBench | 54.4%, Z.ai-reported |
| Ox Alpha | identidad pre-release de Flash |
| Artificial Analysis | GLM-5.3 60, Flash 57 |
| Hy4 vs GLM | Tencent interno 2.99 vs 2.92 |
| Caveat | benchmarks agentic dependen del setup |
¿Qué ocurrió en agosto?
Z.ai anunció GLM-5.3 el 14 de agosto.[1]
La novedad es que mantiene el mismo base model que GLM-5.2. Según Z.ai, toda la mejora procede del post-training.[1][15]
La API estuvo disponible primero y los pesos llegaron después de una evaluación de seguridad adicional. Hugging Face marcó el 28 de agosto y actualmente los pesos están disponibles.[17][5]
Flash usa, en cambio, nueva base, nueva arquitectura y multimodalidad nativa.[6][8]
GLM-5.3 no es simplemente un Flash grande
GLM-5.3 prioriza máxima calidad en coding, long-horizon agents, terminal y cyber reasoning.
Flash prioriza coste, multimodalidad, inference efficiency, visual coding, workflows office y contexto largo.
Z.ai afirma que Flash fue entrenado desde una nueva base y no es una simple distillation del flagship.[6][8]
¿Cuántos parámetros tiene GLM-5.3?
La arquitectura original GLM-5 se presentó como:
744B total
40B active
Metadata actual de Hugging Face y Artificial Analysis:
753B total
40B active
Como GLM-5.3 comparte base con GLM-5.2, tratamos 744B vs 753B como diferencia de conteo/implementación y usamos 753B/40B para deployments actuales.[1][15]
Flash: 320B total, 18B activos
Z.ai especifica:
320B total
18B active
45 layers
GLM-4.5, en la comparación de Z.ai, tenía 355B total, 32B active y 92 layers.[6]
1M context y 128K output
Docs oficiales:
Context Length: 1M
Maximum Output: 128K
Útil para grandes repos, sesiones largas y análisis multi-file.
Pero 1M context no es 1M memoria perfecta. Hay que validar retrieval e instruction retention.
Text-only frente a multimodal
GLM-5.3:
Input: Text
Output: Text
Flash:
Input: Text, Image, Video, File
Output: Text
Flash es mucho más adecuado para screenshots, GUI, documentos, PDF, slides y visual coding. Artificial Analysis estandariza actualmente text+image en su perfil independiente.[11]
Sparse + linear attention
Flash combina sparse attention y linear attention.[6][8]
Linear attention trabaja relaciones más locales con state modeling; sparse attention recupera información global mediante indexer.
El objetivo es reducir coste en contextos largos.
IndexPool
Flash introduce:
IndexPool
Comprime cuatro key vectors cacheados en uno.
Z.ai reporta frente a GLM-5.3:
3.01× menos attention compute
4.44× menos KV cache
Son cifras del fabricante.
mHC
También usa:
Manifold-Constrained Hyper-Connections
La técnica pretende mejorar flujo de información y scaling efficiency. El objetivo práctico es conservar mucha capacidad con solo 18B parámetros activos.
30T tokens multimodales
Z.ai dice que Flash usa:
30T-token multimodal corpus
GLM-5.3 mantiene la base de GLM-5.2; Flash incorpora nuevo pre-training.
Ox Alpha era Flash
Antes del nombre oficial:
ox-alpha
se probó en OpenCode y OpenRouter.[6][19]
Z.ai confirma que era GLM-5.3-Flash. La afirmación de que fue el modelo más popular de la semana sigue siendo vendor claim.[7]
¿Por qué importa el stealth test?
El anonimato reduce parte del sesgo de marca.
Pero uso y popularidad también dependen de precio, promoción, routing, disponibilidad e interfaz. Por eso es señal de interés real, no una evaluación científica.
El salto viene del post-training
Z.ai conserva la misma base que GLM-5.2.[1][15]
Escaló:
- environments,
- task diversity,
- post-training compute,
- long-horizon tasks,
- verifiers,
- reinforcement learning,
- generación automática de entornos.
El framework open-source slime conecta training, rollout y data generation.[1]
¿Qué significa +50% coding?
Z.ai anuncia:
+50% vs GLM-5.2
Se refiere al benchmark privado Z.ai Code Bench.
Max effort:
GLM-5.3: 34.5% / ~75K output tokens
GLM-5.2: 23.4% / ~96K output tokens
No significa 50% mejor en toda programación.
Benchmarks públicos GLM-5.3
Tabla Z.ai:[3]
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Toolathlon | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| HLE + Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
Todo es Z.ai-reported.
Terminal-Bench 3.0
GLM-5.2: 4.6
GLM-5.3: 28.3
Es un salto enorme, pero no “6× más inteligente”.
Z.ai usa un harness con Claude Code 2.1.207, max effort, gran contexto, hasta 600 agent turns y timeout amplio.[3]
DeepSWE
GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7
GLM mejora mucho, pero no lidera esta tabla.
Terminal-Bench 2.1
GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0
Las diferencias son demasiado pequeñas para titulares absolutos.
Agents' Last Exam
GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6
Otra situación prácticamente empatada.
CyberGym: 84.5%
Z.ai reporta:
GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
Kimi K3: 80.0%
GLM-5.2: 77.2%
CyberGym parte de source code white-box y valida vulnerabilidades provocando faults. No equivale a medir ataques sobre sistemas reales arbitrarios.
ExploitBench: frontera clara
GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%
GLM da un gran salto, pero el closed frontier sigue claramente por delante.
ExploitGym
Tareas 2h/6h:
GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293
Z.ai normaliza tiempo por throughput de cada modelo; es una metodología específica.
2.436 vulnerabilidades
Z.ai afirma que tras review, screening y deduplication se obtuvieron:
2,436 findings
269 proyectos
1,097 critical + high
Ledger:
53 publicadas
2,383 bajo embargo
107 critical
990 high
1,286 medium
53 low
Son datos operativos del fabricante, no un dataset CVE independiente.
Cyber capabilities requieren governance
Usos defensivos:
- secure code review,
- vulnerability triage,
- reproducción controlada,
- SAST augmentation,
- patch analysis,
- fuzzing support,
- threat modeling.
Controles: sandbox, network isolation, logs, approval gates, separación de secrets y permisos mínimos.
Benchmarks Flash
| Benchmark | Flash | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 |
| DeepSWE | 63.4 | 46.2 |
| NL2Repo | 56.3 | 48.9 |
| Toolathlon | 78.4 | 59.9 |
| AutomationBench | 48.8 | 26.2 |
| Agents' Last Exam | 26.3 | 20.4 |
| HLE + Tools | 55.3 | 54.7 |
| GDPval-AA v2 | 1773 | 1504 |
Flash recupera mucha calidad a menor coste; no significa igualdad con GLM-5.3.
Flash vs Opus 4.8 en benchmark privado
Z.ai Code Bench Max:
Flash: 29.0
Opus 4.8: 29.5
No es evidencia independiente de que Flash iguale Claude en todos los escenarios.
Artificial Analysis: 60 vs 57
Artificial Analysis Intelligence Index v4.1.1:
GLM-5.3 max: 60
Flash: 57
Mediciones actuales first-party:
GLM-5.3: ~66.5 tokens/s, ~1.6s TTFT
Flash: ~45–49 tokens/s, ~1.5s TTFT
El nombre Flash no implica necesariamente más output tokens/s. Sus ventajas son coste, compute activo y multimodalidad.
Precios API
Z.ai:[9]
GLM-5.3
Input $1.40
Cached $0.26
Output $4.40
Flash lista
Input $0.15
Cached $0.03
Output $0.50
Promo hasta 9 septiembre
Input $0.075
Cached $0.015
Output $0.25
por 1M tokens.
OpenRouter también ofrece ambos y puede tener precios/routing distintos.[18][19]
¿“One-tenth the price” es razonable?
A precio de lista Flash es aproximadamente:
9.3× más barato input
8.8× más barato output
“Una décima parte” es una aproximación razonable. Coste por task puede variar por reasoning y tool calls.
GLM-5.3 vs Kimi K3
Z.ai:[3]
TB2.1 88.2 vs 88.3
DeepSWE 66.9 vs 67.5
TB3.0 28.3 vs 17.4
AutomationBench 48.2 vs 46.7
ExploitBench 54.4 vs 32.2
No hay un ganador único.
GLM-5.3 vs Hy4
Tencent evaluó 163 expertos y 203 tareas.[13][14]
Hy4 2.99
Kimi K3 2.94
GLM-5.3 2.92
Hy4 vs GLM:
46.8% wins
12.8% ties
40.4% losses
Es un test interno Tencent, no ranking universal.
GLM-5.3 vs GPT-5.6 Sol
Z.ai:[3]
TB3.0: 28.3 vs 34.6
DeepSWE: 66.9 vs 72.7
ExploitBench: 54.4 vs 76.5
ExploitGym 6h: 130 vs 293
HLE+Tools: 62.5 vs 64.5
GLM supera ligeramente CyberGym y AutomationBench. Resultado mixto.
¿Y Claude Opus 5?
La tabla launch de Z.ai usa sobre todo Opus 4.8 y Fable 5, no Opus 5.[3]
Por tanto no permite afirmar:
GLM-5.3 > Claude Opus 5
Open weights y licencias
Flash:
MIT
GLM-5.3:
custom GLM-5.3 License
La licencia permite uso, modificación, distribución, fine-tuning y venta, pero añade una condición para operadores Model as a Service con más de $10B de ingresos agregados en 12 meses consecutivos: deben pasar una security review de Z.ai antes de uso comercial.[4]
Self-hosting
Rutas oficiales:
vLLM
SGLang
Transformers
Docker Model Runner
Repositorio GLM-5.3:
~756 GB
141 safetensors shards
Flash es más ligero en compute activo, pero sigue siendo un modelo grande.
Chips AI chinos y 3× serving
Z.ai dice que traffic real de Flash/Ox Alpha fue servido sobre accelerators chinos.[6][7]
Stack:
Tensor Parallelism
ReplaySSM
W8A8
INT8/FP8/BF16 cache
Layer Split
Encode–Prefill–Decode disaggregation
Claim:
3× end-to-end serving
vs baseline inicial en el mismo hardware
Debe tratarse como vendor claim.
¿Qué modelo elegir?
GLM-5.3 para máxima calidad coding GLM, terminal agents, reasoning textual y security analysis.
Flash para coste, vision, screenshots, documentos, video/file, 1M context y licencia MIT.
Kimi, Hy4, GPT o Claude si un POC propio muestra mejor:
cost per successful task
Checklist POC
Calidad
- Probar tareas reales.
- Mismo harness.
- Medir test pass rate.
- Medir task completion.
- Medir regresiones.
- Medir cambios fuera de scope.
- Probar sesiones largas.
- Probar recovery.
- Validar tool calling.
- Validar structured output.
Reasoning
- Comparar
low,high,max. - Recordar que reasoning no se desactiva.
- Medir reasoning tokens.
- Medir output total.
- Medir latencia end-to-end.
- No usar
maxen todo.
Long context
- Probar 32K.
- Probar 128K.
- Probar 256K.
- Probar 1M.
- Medir retrieval accuracy.
- Medir instruction loss.
- Probar repos grandes.
- Probar cross-file dependencies.
- Medir KV cache y concurrency.
- No equiparar 1M con memoria perfecta.
Multimodal Flash
- Probar screenshots.
- Probar documentos.
- Probar charts.
- Probar OCR-like workflows.
- Probar GUI verification.
- Probar video real.
Security
- Sandbox para cyber.
- Limitar network.
- Log de tool calls.
- Approval gates.
- Separar production secrets.
- Limitar credentials.
- Validar patches antes de merge.
- No tratar el modelo como autoridad autónoma.
Licencia y operaciones
- Revisar GLM-5.3 License.
- Revisar cláusula MaaS >$10B.
- Revisar MIT Flash.
- Revisar data policy provider.
- Revisar processing region.
- Revisar retention.
- Medir cache hit.
- Medir cost per successful task.
- Definir fallback.
- Monitorizar precio Flash tras promo.
Veredicto POLPROG
GLM-5.3 es una de las releases coding más interesantes de agosto de 2026 porque empuja mucho más lejos la misma base que GLM-5.2 mediante post-training.[1][15]
Terminal-Bench 3.0: 4.6 → 28.3
DeepSWE: 46.2 → 66.9
ExploitBench: 24.4 → 54.4
Flash sigue otra estrategia:
320B total
18B active
multimodal
1M context
MIT
API muy barata
y logra 57 en Artificial Analysis frente a 60 para GLM-5.3 max.[10][11][12]
Para muchos productos Flash puede ser más atractivo que el flagship.
La pregunta correcta no es quién gana un leaderboard, sino:
qué modelo ofrece el mejor cost per successful task con la calidad, seguridad y latencia necesarias.

