GLM-5.3 de Z.ai: el modelo open-weights de 743B que mejora coding 50% solo con post-training y lidera CyberGym

GLM-5.3: mismo base model, mejoras solo de post-training
El 14 de agosto de 2026, Z.ai (antes Zhipu AI) lanzó GLM-5.3, el modelo más capaz de la familia GLM para coding. La historia detrás del lanzamiento es inusual: GLM-5.3 usa exactamente el mismo base model que GLM-5.2 (743B parámetros, 40B activos). Cada mejora viene enteramente de post-training escalado.
"Scaling post-training is all we did for GLM-5.3", escribió Z.ai en su launch post. "With GLM-5.2 we built the stack. Over the past month we kept scaling on this stack: more environments, more diverse tasks, and more compute spent training on them."
El resultado: +50% en su in-house Code Bench, saltos dramáticos en benchmarks agentivos de coding y una capability emergente inesperada — cybersecurity de clase frontier.
Arquitectura y especificaciones
| Especificación | Valor |
|---|---|
| Parámetros totales | 743B |
| Parámetros activos | ~40B (MoE) |
| Base model | Idéntico a GLM-5.2 |
| Context window | 1M tokens |
| Max output tokens | 128K |
| Reasoning effort | low, high, max (default) |
| API compatibility | OpenAI spec + Anthropic spec |
| Open weights | ~2 semanas post-launch (post safety review) |
Benchmarks: saltos dramáticos en coding agéntico
Coding y agentes
| Benchmark | GLM-5.2 | GLM-5.3 | Salto | Referencia |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | Fable 5: 33.7, GPT-5.6 Sol: 34.6 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | Kimi K3: 67.5, Fable 5: 69.7, Gemini 3.7 Flash: 65% |
| Agents' Last Exam | 23.8 | 28.5 | +4.7 | — |
| Z.ai Code Bench (Max effort) | 23.4% | 34.5% | +11.1pp | Fable 5: 39.5% |
El salto en Terminal-Bench 3.0 es particularmente notable: de 4.6 a 28.3 — un 6x de mejora. DeepSWE v1.1 sube de 46.2 a 66.9, colocándose junto a Gemini 3.7 Flash (65%) y Kimi K3 (67.5%), aunque por debajo de Fable 5 (69.7%).
Cybersecurity: la capability emergente
| Benchmark | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym (vulnerability discovery) | 77.2% | 84.5% | 83.8% | 83.6% |
| ExploitBench (exploitation chain) | 24.4% | 54.4% | 78% | 76.5% |
GLM-5.3 lidera CyberGym con 84.5%, superando a Anthropic Mythos 5 (83.8%) y OpenAI GPT-5.6 Sol (83.6%). Esto es notable: un modelo open-weights chino supera a los frontier cerrados de EE.UU. en discovery de vulnerabilidades.
Sin embargo, en ExploitBench —que mide cuánto sube el modelo por la cadena de explotación— GLM-5.3 queda en 54.4%, muy por detrás de Mythos 5 (78%) y GPT-5.6 Sol (76.5%). GLM-5.3 encuentra vulnerabilidades mejor que nadie, pero no las explota tan completamente como los frontier cerrados.
Token efficiency: mejor output con menos tokens
Un foco clave de GLM-5.3 fue token efficiency, no solo raw performance. En Z.ai Code Bench a Max effort:
- GLM-5.2: 23.4% accuracy, ~96,000 output tokens por tarea
- GLM-5.3: 34.5% accuracy, ~75,000 output tokens por tarea
- Claude Fable 5: 39.5% accuracy (referencia, no comparable en tokens)
GLM-5.3 logra mejor accuracy con 22% menos tokens que su predecesor. Z.ai afirma que el modelo optimiza el trade-off entre latencia, token efficiency y correctness.
Cyber capability emergente: 2.436 vulnerabilidades reales
Z.ai introdujo entornos de vulnerability-discovery en el post-training de GLM-5.3 esperando que mejorara encontrando bugs. En cambio, algo inesperado ocurrió: el modelo "began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains".
Trabajando con security teams en China, GLM-5.3 analizó codebases reales y encontró:
- 2.436 vulnerabilidades across 269 proyectos open-source
- 1.097 de severidad media-alta
- Algunas con hasta 40 años de antigüedad
- Documentadas en un registry público
El hallazgo más mediático: GLM-5.3 encontró una vulnerabilidad potencialmente seria en Cursor (el editor de IA adquirido por SpaceX), reportada por el developer advocate de Z.ai en X. VentureBeat contactó a Cursor para confirmación.
GLM Coding Plan: el plan de codificación con IA de Z.ai
GLM-5.3 está disponible principalmente a través del GLM Coding Plan, la suscripción de Z.ai diseñada para developers que usan agentes de coding. Es un plan flat mensual con cuota de credits, pensado para sesiones largas de coding dentro de agent tools — no para integraciones per-token via API.
Tres tiers: Lite, Pro y Max
| Tier | Precio/mes | Precio anual (efectivo/mes) | Credits/semana | Ideal para |
|---|---|---|---|---|
| Lite | $18 | $12.60 | 10,000 | Iteración ligera en repos pequeños |
| Pro | $80 | $56 | 60,000 (6× Lite) | Desarrollo diario en repos medianos |
| Max | $168 | $117.60 | 140,000 (14× Lite) | Work avanzado en repos grandes |
Z.ai ofrece tres términos de billing con descuento creciente:
- Mensual: precio full, sin descuento
- Trimestral: 20% off
- Anual: 30% off (billed upfront)
Cada tier incluye acceso a GLM-5.3. La diferencia entre tiers es la cantidad de credits, no qué modelo puedes usar. Todos soportan 20+ agent tools incluyendo ZCode, Claude Code, Codex, Cline, OpenCode y más.
Qué incluye cada tier
Lite ($18/mes):
- 10,000 credits/semana
- Rolling access a los últimos modelos flagship y features
- Soporta 20+ agent tools (ZCode, Claude Code, etc.)
- Data privacy por defecto
Pro ($80/mes):
- 6× Lite usage (60,000 credits/semana)
- Todo lo de Lite
- Priority access a modelos flagship y features
- Selección curada de MCP tools
- Velocidad de generación más rápida
Max ($168/mes):
- 14× Lite usage (140,000 credits/semana)
- Todo lo de Pro
- First access a nuevos modelos y features
- Recursos dedicados durante peak times
Cómo funciona el sistema de credits
GLM-5.3 cobra via points, no via flat request count. Los credits se consumen según:
- Input tokens: multiplier 6.9 por token unit
- Cached input tokens: multiplier 1.7 por token unit
- Output tokens: multiplier 24 por token unit
El output es el componente más caro (~3.5× el input fresco). Pero el cached input es muy barato, así que reutilizar contexto es mucho más económico que generar texto nuevo. Para coding agents que leen archivos grandes y devuelven edits focalizados, ese ratio juega a tu favor.
Peak y off-peak: el descuento del 50%
Z.ai cobra mitad de precio fuera del horario peak. Los peak hours son lunes a viernes, 14:00 a 18:00 hora de Singapur (UTC+8). Todo el resto — incluyendo sábados y domingos completos — factura al rate off-peak (50% del standard).
Para un developer fuera de Asia Oriental, esto es prácticamente un descuento permanente. Si tu jornada laboral rara vez overlapping con esa ventana de 4 horas en UTC+8, la mayoría de tu usage cae en half-price por defecto.
Tokens estimados por semana
Assumiendo GLM-5.3 con 90.9% cache hit rate (el promedio para coding según Z.ai):
| Tier | Tokens/semana (peak) | Tokens/semana (off-peak) |
|---|---|---|
| Lite | ~43M | ~87M |
| Pro | ~263M | ~526M |
| Max | ~613M | ~1,226M |
API per-token: aún no publicado
El rate per-token de GLM-5.3 via API aún no está publicado. La tabla oficial de Z.ai sigue listando GLM-5.2 como la entrada más reciente ($1.40 input / $0.26 cached / $4.40 output por 1M tokens). No hay row de GLM-5.3. Z.ai ha sido explícito que el API access se está liberando en stages tras el safety review.
Si necesitas per-token API pricing para tu budget, la opción honesta es esperar a que Z.ai actualice la tabla. Mientras tanto, el Coding Plan te da acceso a GLM-5.3 a un precio conocido.
Ver planes del GLM Coding Plan y suscribirse →
ZCode: el entorno de coding desktop para GLM-5.3
ZCode es el Agentic Development Environment (ADE) oficial de Z.ai, diseñado para llevar GLM-5.3 a flujos de coding reales. Es una aplicación desktop que combina los mejores AI agents con tus herramientas existentes para plan, code, review y deploy sin fricción.
Qué es ZCode
ZCode es un entorno desktop que actúa como harness para GLM-5.3 y otros agentes. Te permite:
- Plan — estructurar tareas complejas antes de codear
- Code — ejecutar agents que escriben y editan código
- Review — revisar cambios y diffs
- Deploy — desplegar sin salir del entorno
Soporta multi-agent: puedes usar ZCode Agent, Claude Code, Codex, Gemini, OpenCode y otros desde la misma interfaz. Si ya trabajas en Claude Code, puedes importar tu session history y tasks a ZCode.
Descargar ZCode
ZCode está disponible para macOS, Windows y Linux. La versión actual es v3.7.7 (lanzada el 14 de agosto de 2026, mismo día que GLM-5.3).
| Plataforma | Descarga | Versión |
|---|---|---|
| macOS (Apple Silicon) | .dmg | 3.7.7 |
| macOS (Intel) | .dmg | 3.7.7 |
| Windows (64-bit) | .exe | 3.7.7 |
| Windows (ARM64) | .exe | 3.7.7 |
| Linux x64 (.deb) | .deb | 3.7.7 |
| Linux x64 (AppImage) | .AppImage | 3.7.7 |
| Linux ARM64 (.deb) | .deb | 3.7.7 |
| Linux ARM64 (AppImage) | .AppImage | 3.7.7 |
Instalación
macOS
- Abrir el downloaded
ZCode.dmgdisk image - Drag
ZCode.appinto Applications folder - Find ZCode in Launchpad y launch
Windows
- Download el installer de ZCode
- Double-click y seguir el setup wizard
- Launch ZCode desde Start menu o desktop shortcut
Linux
- Download el
.AppImagefile - Hacerlo executable:
chmod +x ZCode-*.AppImage - Double-click o run from terminal
Primer launch
El primer launch abre el onboarding setup. Al finish, click Connect en el bottom-left para llegar al sign-in page. Puedes conectar via:
- Connect Z.ai — login con tu cuenta de Z.ai (incluye GLM Coding Plan)
- Connect BigModel — para usuarios de la plataforma china
- Use API Key — si tienes una API key directa
Quickstart en 5 minutos
- Abrir un Workspace — click
+ Workspaceen la sidebar. Puede ser local directory o remote workspace (SSH, Docker, WSL) - Elegir Agent y Model — usar el
Agentselector. Opciones: ZCode Agent, Claude Code, Codex, Gemini, OpenCode - Start the task — describir lo que necesitas y dejar que el agent trabaje
Remote Workspace
ZCode soporta remote development via SSH, Docker y WSL. Puedes conectar un workspace remoto directamente desde el main workflow, sin necesidad de configuraciones adicionales.
Integración con agentes CLI externos
No necesitas ZCode para usar GLM-5.3. El modelo es compatible con los agentes CLI más populares via Anthropic y OpenAI API spec:
- Claude Code — usando
glm-5.3oglm-5.3[1m](para 1M contexto) como model tag - Codex CLI — via OpenAI-compatible endpoint
- Cline — via custom model configuration
- OpenCode — via Anthropic/OpenAI compatible endpoints
- Cursor — via Anthropic-compatible endpoint
- TRAE, Qoder, Droid, Kilo Code, Roo Code, Crush, Goose, Eigent — todos oficialmente soportados
Para Claude Code con 1M contexto, usar el tag glm-5.3[1m] con matching 1M-token compaction window.
GLM-5.3 vs la competencia
vs Claude Fable 5
Fable 5 sigue liderando en la mayoría de benchmarks: Terminal-Bench 33.7 vs 28.3, DeepSWE 69.7 vs 66.9, Z.ai Code Bench 39.5% vs 34.5%, ExploitBench 78% vs 54.4%. GLM-5.3 solo supera a Fable 5 en CyberGym (84.5% vs 83.8%). Fable 5 es el frontier cerrado más fuerte; GLM-5.3 es el open-weights que más se acerca.
vs GPT-5.6 Sol
Sol lidera Terminal-Bench (34.6 vs 28.3) y ExploitBench (76.5% vs 54.4%). GLM-5.3 supera a Sol en CyberGym (84.5% vs 83.6%). En coding profundo, Sol sigue adelante.
vs Kimi K3 (Moonshot AI)
Competencia directa entre modelos chinos open-weights. Kimi K3 supera a GLM-5.3 en DeepSWE (67.5 vs 66.9). GLM-5.3 supera a K3 en CyberGym y ExploitBench. K3 tiene open weights disponibles desde ya; GLM-5.3 los tendrá en ~2 semanas. K3 es 2.8T params (mayor), GLM-5.3 es 743B (más liviano para self-host).
vs GLM-5.2
El salto generacional es masivo y 100% atribuible a post-training: Terminal-Bench 4.6 → 28.3 (6x), DeepSWE 46.2 → 66.9 (+45%), CyberGym 77.2% → 84.5%, ExploitBench 24.4% → 54.4% (2.2x). El mismo model con mejor training produce resultados radicalmente distintos.
El contexto: Z.ai y la carrera open-weights
Z.ai (antes Zhipu AI) es un lab de Beijing incluido en la U.S. Entity List, lo que significa que firms estadounidenses no pueden exportar tech controlado hacia ellos. A pesar de esto, GLM es un modelo extremadamente popular y los modelos open-weights chinos ya superan a los americanos en token usage en OpenRouter.
Z.ai raised aproximadamente HK$31.4 billion (~$4 billion) via una Hong Kong share sale el mes pasado, destinados a R&D, infraestructura de cómputo, talento y expansión de negocio.
El lanzamiento de GLM-5.3 sigue una estrategia que se está volviendo común en labs chinos: anunciar open weights y liberarlos 1-2 semanas después, tras safety reviews. Moonshot hizo lo mismo con Kimi K3. El gap entre "open weights anunciados" y "weights que puedes correr" se ha vuelto un patrón recurrente.
Caveats
- Benchmarks vendor-run: todos los scores son reportados por Z.ai. Falta verificación independiente cuando los weights se liberen.
- API pricing no publicado: el costo per-token de GLM-5.3 no está disponible aún. No asumir que es igual a GLM-5.2.
- Open weights pendientes: "open-weights" aplica a lo que viene, no a lo descargable hoy. Hay que esperar ~2 semanas.
- Reasoning effort max = latencia: el modo max (default) introduce latencia y overhead de tokens notables. Los equipos deben evaluar si la accuracy justifica el compute cost.
- ExploitBench gap: GLM-5.3 encuentra vulnerabilidades mejor que nadie, pero no las explota tan completamente como Mythos 5 o GPT-5.6 Sol.
- Cyber capability es sensible: Z.ai reconoce que las capabilities ofensivas del modelo son un tema delicado, por lo que el release escalonado con safety review.
- GLM Coding Plan locked a tools oficiales: el plan está restringido a las herramientas oficialmente soportadas (20+). El API per-token no tiene esta restricción.
Conclusión
GLM-5.3 es un caso fascinante de post-training haciendo el trabajo pesado. Sin cambiar un solo parámetro del base model, Z.ai logró mejoras de 6x en Terminal-Bench, +45% en DeepSWE y +50% en su Code Bench interno. Y emergió una capability inesperada: cybersecurity frontier-tier, superando a Mythos 5 y GPT-5.6 Sol en CyberGym.
Pero el cuadro completo es más matizado. GLM-5.3 es el open-weights más capaz para coding, pero no supera a los frontier cerrados. Fable 5 y GPT-5.6 Sol siguen liderando en los benchmarks más duros. Y la capability cyber, mientras impresionante en discovery, queda atrás en exploitation completa.
Para desarrolladores: GLM-5.3 ya se puede usar via GLM Coding Plan desde $18/mes con Claude Code, Codex, Cline, OpenCode, ZCode y 20+ agentes más. Si quieres self-host, espera ~2 semanas a los open weights. Si buscas el frontier absoluto en coding, Fable 5 sigue siendo la opción. Si buscas el mejor open-weights para coding con capability cyber emergente, GLM-5.3 es el candidato.
La lección más grande de GLM-5.3 es arquitectónica: el post-training es donde está la guerra ahora. No necesitas un base model nuevo para dar un salto generacional. Necesitas mejor data, más entornos y más compute en post-training. Z.ai lo demostró.
Suscribirse al GLM Coding Plan →
Fuentes y recursos
- GLM-5.3: Frontier Coding with Emergent Cyber Capabilities — Z.ai
- GLM-5.3 is here with advanced cyber capabilities — VentureBeat
- GLM-5.3 didn't change the base model — The New Stack
- China's Z.AI Ships GLM-5.3 — Decrypt
- Zhipu AI releases GLM-5.3 — The Decoder
- Zhipu launches flagship GLM-5.3 — South China Morning Post
- GLM-5.3 Pricing — Emergent
- ZCode — entorno de coding desktop
- ZCode installation guide
- ZCode 5-minute quickstart
- ZCode releases & updates
- CVD Registry — vulnerabilidades encontradas por GLM-5.3
- GLM Coding Plan — suscripción