GLM-5.3 de Z.ai: el modelo open-weights de 743B que mejora coding 50% solo con post-training y lidera CyberGym
GLM-5.3: mismo base model, mejoras solo de post-training
El 14 de agosto de 2026, Z.ai (antes Zhipu AI) lanzó GLM-5.3, el modelo más capaz de la familia GLM para coding. La historia detrás del lanzamiento es inusual: GLM-5.3 usa exactamente el mismo base model que GLM-5.2 (743B parámetros, 40B activos). Cada mejora viene enteramente de post-training escalado.
"Scaling post-training is all we did for GLM-5.3", escribió Z.ai en su launch post. "With GLM-5.2 we built the stack. Over the past month we kept scaling on this stack: more environments, more diverse tasks, and more compute spent training on them."
El resultado: +50% en su in-house Code Bench, saltos dramáticos en benchmarks agentivos de coding y una capability emergente inesperada — cybersecurity de clase frontier.
Arquitectura y especificaciones
| Especificación | Valor |
|---|---|
| Parámetros totales | 743B |
| Parámetros activos | ~40B (MoE) |
| Base model | Idéntico a GLM-5.2 |
| Context window | 1M tokens |
| Max output tokens | 128K |
| Reasoning effort | low, high, max (default) |
| API compatibility | OpenAI spec + Anthropic spec |
| Open weights | ~2 semanas post-launch (post safety review) |
Benchmarks: saltos dramáticos en coding agéntico
Coding y agentes
| Benchmark | GLM-5.2 | GLM-5.3 | Salto | Referencia |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | Fable 5: 33.7, GPT-5.6 Sol: 34.6 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | Kimi K3: 67.5, Fable 5: 69.7, Gemini 3.7 Flash: 65% |
| Agents' Last Exam | 23.8 | 28.5 | +4.7 | — |
| Z.ai Code Bench (Max effort) | 23.4% | 34.5% | +11.1pp | Fable 5: 39.5% |
El salto en Terminal-Bench 3.0 es particularmente notable: de 4.6 a 28.3 — un 6x de mejora. DeepSWE v1.1 sube de 46.2 a 66.9, colocándose junto a Gemini 3.7 Flash (65%) y Kimi K3 (67.5%), aunque por debajo de Fable 5 (69.7%).
Cybersecurity: la capability emergente
| Benchmark | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym (vulnerability discovery) | 77.2% | 84.5% | 83.8% | 83.6% |
| ExploitBench (exploitation chain) | 24.4% | 54.4% | 78% | 76.5% |
GLM-5.3 lidera CyberGym con 84.5%, superando a Anthropic Mythos 5 (83.8%) y OpenAI GPT-5.6 Sol (83.6%). Esto es notable: un modelo open-weights chino supera a los frontier cerrados de EE.UU. en discovery de vulnerabilidades.
Sin embargo, en ExploitBench —que mide cuánto sube el modelo por la cadena de explotación— GLM-5.3 queda en 54.4%, muy por detrás de Mythos 5 (78%) y GPT-5.6 Sol (76.5%). GLM-5.3 encuentra vulnerabilidades mejor que nadie, pero no las explota tan completamente como los frontier cerrados.
Token efficiency: mejor output con menos tokens
Un foco clave de GLM-5.3 fue token efficiency, no solo raw performance. En Z.ai Code Bench a Max effort:
- GLM-5.2: 23.4% accuracy, ~96,000 output tokens por tarea
- GLM-5.3: 34.5% accuracy, ~75,000 output tokens por tarea
- Claude Fable 5: 39.5% accuracy (referencia, no comparable en tokens)
GLM-5.3 logra mejor accuracy con 22% menos tokens que su predecesor. Z.ai afirma que el modelo optimiza el trade-off entre latencia, token efficiency y correctness.
Cyber capability emergente: 2.436 vulnerabilidades reales
Z.ai introdujo entornos de vulnerability-discovery en el post-training de GLM-5.3 esperando que mejorara encontrando bugs. En cambio, algo inesperado ocurrió: el modelo "began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains".
Trabajando con security teams en China, GLM-5.3 analizó codebases reales y encontró:
- 2.436 vulnerabilidades across 269 proyectos open-source
- 1.097 de severidad media-alta
- Algunas con hasta 40 años de antigüedad
- Documentadas en un registry público
El hallazgo más mediático: GLM-5.3 encontró una vulnerabilidad potencialmente seria en Cursor (el editor de IA adquirido por SpaceX), reportada por el developer advocate de Z.ai en X. VentureBeat contactó a Cursor para confirmación.
Disponibilidad y acceso
Disponible ahora
- GLM Coding Plan — suscripción con points quota (off-peak cuesta la mitad)
- ZCode — entorno de coding de Z.ai (zcode.z.ai)
- Compatible con Claude Code, Codex CLI, Cline, OpenCode via Anthropic y OpenAI API spec
Próximamente
- API access directo — "coming soon", pricing no publicado aún
- Open weights — ~2 semanas post-launch (semana del 25-28 de agosto), post safety evaluation y hardening
Pricing estimado
Z.ai no ha publicado pricing oficial de GLM-5.3 aún. Como referencia, GLM-5.2 tenía un precio de $1.40 input / $4.40 output por millón de tokens — aproximadamente una décima parte de los rates de frontier de EE.UU. El GLM Coding Plan funciona con points quota en lugar de pricing por token directo.
Integración con agentes CLI
GLM-5.3 es compatible con los agentes CLI más populares via Anthropic y OpenAI API spec:
- Claude Code — usando
glm-5.3oglm-5.3[1m](para 1M contexto) como model tag - Codex CLI — via OpenAI-compatible endpoint
- Cline — via custom model configuration
- OpenCode — via Anthropic/OpenAI compatible endpoints
- ZCode — entorno nativo de Z.ai
Para Claude Code con 1M contexto, usar el tag glm-5.3[1m] con matching 1M-token compaction window.
GLM-5.3 vs la competencia
vs Claude Fable 5
Fable 5 sigue liderando en la mayoría de benchmarks: Terminal-Bench 33.7 vs 28.3, DeepSWE 69.7 vs 66.9, Z.ai Code Bench 39.5% vs 34.5%, ExploitBench 78% vs 54.4%. GLM-5.3 solo supera a Fable 5 en CyberGym (84.5% vs 83.8%). Fable 5 es el frontier cerrado más fuerte; GLM-5.3 es el open-weights que más se acerca.
vs GPT-5.6 Sol
Sol lidera Terminal-Bench (34.6 vs 28.3) y ExploitBench (76.5% vs 54.4%). GLM-5.3 supera a Sol en CyberGym (84.5% vs 83.6%). En coding profundo, Sol sigue adelante.
vs Kimi K3 (Moonshot AI)
Competencia directa entre modelos chinos open-weights. Kimi K3 supera a GLM-5.3 en DeepSWE (67.5 vs 66.9). GLM-5.3 supera a K3 en CyberGym y ExploitBench. K3 tiene open weights disponibles desde ya; GLM-5.3 los tendrá en ~2 semanas. K3 es 2.8T params (mayor), GLM-5.3 es 743B (más liviano para self-host).
vs GLM-5.2
El salto generacional es masivo y 100% atribuible a post-training: Terminal-Bench 4.6 → 28.3 (6x), DeepSWE 46.2 → 66.9 (+45%), CyberGym 77.2% → 84.5%, ExploitBench 24.4% → 54.4% (2.2x). El mismo model con mejor training produce resultados radicalmente distintos.
El contexto: Z.ai y la carrera open-weights
Z.ai (antes Zhipu AI) es un lab de Beijing incluido en la U.S. Entity List, lo que significa que firms estadounidenses no pueden exportar tech controlado hacia ellos. A pesar de esto, GLM es un modelo extremadamente popular y los modelos open-weights chinos ya superan a los americanos en token usage en OpenRouter.
Z.ai raised aproximadamente HK$31.4 billion (~$4 billion) via una Hong Kong share sale el mes pasado, destinados a R&D, infraestructura de cómputo, talento y expansión de negocio.
El lanzamiento de GLM-5.3 sigue una estrategia que se está volviendo común en labs chinos: anunciar open weights y liberarlos 1-2 semanas después, tras safety reviews. Moonshot hizo lo mismo con Kimi K3. El gap entre "open weights anunciados" y "weights que puedes correr" se ha vuelto un patrón recurrente.
Caveats
- Benchmarks vendor-run: todos los scores son reportados por Z.ai. Falta verificación independiente cuando los weights se liberen.
- API pricing no publicado: el costo real de producción es difícil de comparar hasta que se publique el pricing directo.
- Open weights pendientes: "open-weights" aplica a lo que viene, no a lo descargable hoy. Hay que esperar ~2 semanas.
- Reasoning effort max = latencia: el modo max (default) introduce latencia y overhead de tokens notables. Los equipos deben evaluar si la accuracy justifica el compute cost.
- ExploitBench gap: GLM-5.3 encuentra vulnerabilidades mejor que nadie, pero no las explota tan completamente como Mythos 5 o GPT-5.6 Sol.
- Cyber capability es sensible: Z.ai reconoce que las capabilities ofensivas del modelo son un tema delicado, por lo que el release escalonado con safety review.
Conclusión
GLM-5.3 es un caso fascinante de post-training haciendo el trabajo pesado. Sin cambiar un solo parámetro del base model, Z.ai logró mejoras de 6x en Terminal-Bench, +45% en DeepSWE y +50% en su Code Bench interno. Y emergió una capability inesperada: cybersecurity frontier-tier, superando a Mythos 5 y GPT-5.6 Sol en CyberGym.
Pero el cuadro completo es más matizado. GLM-5.3 es el open-weights más capaz para coding, pero no supera a los frontier cerrados. Fable 5 y GPT-5.6 Sol siguen liderando en los benchmarks más duros. Y la capability cyber, mientras impresionante en discovery, queda atrás en exploitation completa.
Para desarrolladores: GLM-5.3 ya se puede usar via GLM Coding Plan con Claude Code, Codex, Cline u OpenCode. Si quieres self-host, espera ~2 semanas a los open weights. Si buscas el frontier absoluto en coding, Fable 5 sigue siendo la opción. Si buscas el mejor open-weights para coding con capability cyber emergente, GLM-5.3 es el candidato.
La lección más grande de GLM-5.3 es arquitectónica: el post-training es donde está la guerra ahora. No necesitas un base model nuevo para dar un salto generacional. Necesitas mejor data, más entornos y más compute en post-training. Z.ai lo demostró.
Fuentes y recursos
- GLM-5.3: Frontier Coding with Emergent Cyber Capabilities — Z.ai
- GLM-5.3 is here with advanced cyber capabilities — VentureBeat
- GLM-5.3 didn't change the base model — The New Stack
- China's Z.AI Ships GLM-5.3 — Decrypt
- Zhipu AI releases GLM-5.3 — The Decoder
- Zhipu launches flagship GLM-5.3 — South China Morning Post
- CVD Registry — vulnerabilidades encontradas por GLM-5.3
- ZCode — entorno de coding de Z.ai