Z.ai lanza GLM-5.3-Flash: el MoE multimodal de 320B que fue "Ox Alpha" en OpenRouter

El misterio de Ox Alpha, resuelto
La semana pasada, un modelo desconocido llamado "Ox Alpha" apareció en OpenRouter y OpenCode sin que se supiera quién lo había creado. Rápidamente empezó a generar atención por su calidad y velocidad. Hoy, Z.ai ha revelado que Ox Alpha es en realidad GLM-5.3-Flash, el primer modelo multimodal nativo de la serie GLM-5.
Qué es GLM-5.3-Flash
GLM-5.3-Flash es un modelo Mixture-of-Experts (MoE) multimodal nativo con las siguientes características:
| Característica | Valor |
|---|---|
| Parámetros totales | 320B |
| Parámetros activos por token | 18B |
| Ventana de contexto | 1.048.576 tokens (1M) |
| Input multimodal | Imágenes y video |
| Licencia | MIT (pesos en Hugging Face) |
| Checkpoint FP8 | ~306 GiB antes de KV cache |
Rendimiento: 10x más barato que GLM-5.2
Z.ai reporta que GLM-5.3-Flash cuesta aproximadamente una décima parte que su predecesor GLM-5.2, manteniendo o superando su rendimiento. En benchmarks:
- GDPval-AA v2: primer lugar (mide capacidad de knowledge work) — supera a Claude Opus 4.8, GPT-5.6 Terra y Gemini 3.7 Flash
- AutomationBench: segundo lugar (mide capacidad de completar tareas en aplicaciones cloud)
- Queda a medio punto de Claude Opus 4.8 en su benchmark interno de coding
Arquitectura: MoE con 18B activos
Con 320B de parámetros totales pero solo 18B activos por token, GLM-5.3-Flash logra una eficiencia extrema. El modelo solo activa ~5.6% de sus parámetros en cada inferencia, lo que explica el costo 10x menor. La entrada multimodal nativa significa que el modelo procesa imágenes y video sin necesidad de un encoder separado.
Self-hosting: quién puede correrlo
No todos pueden self-hostear GLM-5.3-Flash. Los requisitos son significativos:
- Checkpoint FP8: ~306 GiB solo de pesos (antes del KV cache)
- La ruta vLLM actual solo soporta NVIDIA Hopper o superior
- Mínimo un nodo de 8 GPUs (o bandeja GB200 en TP4)
- Organizaciones medianas/grandes con capacidad GPU dedicada
Para todos los demás, el modelo está disponible como API alojada con pricing competitivo.
Casos de uso inmediatos
- Agentes de coding a escala de repositorio: con 1M de contexto, puede procesar codebases completos
- Agentes de uso de terminal y browser/computadora: tool use nativo
- Análisis de contratos y registros de millones de tokens
- Verificación de regresión de UI a partir de capturas de pantalla
- Razonamiento de spreadsheets y dashboards que normalmente necesitarían pipeline OCR-to-text
Industrias con fit inmediato
- Software y herramientas de desarrollo
- Automatización IT/BPO
- Servicios financieros y operaciones de documentos de seguros
- BI empresarial y trabajo de conocimiento administrativo
- E-commerce y equipos que shipan UI en volumen
Hecho en chips chinos
Un detalle notable: GLM-5.3-Flash pasó su primera semana corriendo anónimamente como "Ox Alpha" y se utilizó íntegramente en chips de IA chinos de producción nacional. Esto refuerza la tendencia de China hacia soberanía de hardware para IA, independizándose de las GPUs de NVIDIA.
Disponibilidad
- Pesos open-source: disponibles en Hugging Face bajo licencia MIT
- API alojada: ya tiene pricing y servicio activo
- OpenRouter: disponible como modelo gratuito y de pago
- OpenCode: integrado como opción de modelo
Contexto: la carrera de modelos MoE
GLM-5.3-Flash se une a una oleada de modelos MoE que priorizan eficiencia sobre tamaño bruto. La misma semana, Alibaba lanzó Qwen3.8-Flash-Next (125B, 6B activos) y IBM lanzó Granite 4.2. La tendencia es clara: menos parámetros activos, más contexto, más modalidades, menor costo.
Conclusión
GLM-5.3-Flash es un hito para Z.ai y para el ecosistema open-source. Que un modelo de 320B con 1M de contexto y capacidades multimodales nativas esté disponible bajo MIT, a 1/10 del costo de su predecesor, y que haya sido probado en producción de forma anónima en OpenRouter, dice mucho sobre la madurez del ecosistema. Y que corra en chips chinos sin depender de NVIDIA añade una dimensión geopolítica que no se puede ignorar.
Fuentes verificadas
siliconangle.com
siliconangle.com
7minutos.es
7minutos.es
huggingface.co
huggingface.co