Qwen3.8-Max: el modelo flagship de Alibaba con 2,4 billones de parámetros y contexto de 1 millón de tokens

Alibaba lanza su modelo más potente hasta la fecha
Alibaba anunció hoy el lanzamiento de Qwen3.8-Max, el modelo más capaz de la familia Qwen hasta la fecha. Con 2,4 billones de parámetros (95B activos por token) y una ventana de contexto de hasta 1 millón de tokens, este modelo multimedial marca un hito: es la primera vez que Alibaba liberará los pesos open source de un modelo de clase Max.
Arquitectura y especificaciones técnicas
Qwen3.8-Max es un modelo Mixture-of-Experts (MoE) construido sobre la base arquitectónica de Qwen 3.5, escalado a 2,4 billones de parámetros totales con 95B activos por token. Esto lo sitúa entre Moonshot Kimi K3 (2,8T total, 104B activo) y el anterior Qwen3.7-Max.
| Especificación | Valor |
|---|---|
| Parámetros totales | 2,4 billones (2,4T) |
| Parámetros activos por token | 95B |
| Ventana de contexto | 1.000.000 tokens |
| Input máximo | 991K tokens (983K con thinking) |
| Output máximo | 131.072 tokens |
| Presupuesto de razonamiento máximo | 262K tokens |
| Modalidades de input | Texto, imágenes, video |
| Modalidad de output | Texto |
| Rate limits | 2M tokens/min, 15K requests/min |
Benchmarks: dónde brilla y dónde queda atrás
Alibaba publicó una tabla completa de benchmarks comparando Qwen3.8-Max contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol y su predecesor Qwen3.7-Max. Los resultados son mixtos: hay victorias claras y derrotas honestas.
Donde Qwen3.8-Max lidera
| Benchmark | Qwen3.8-Max | Mejor competidor |
|---|---|---|
| PaperBench (reproducir papers) | 93.0 | GPT-5.6 Sol: 90.5 |
| IFBench (instrucciones) | 82.8 | GPT-5.6 Sol: 72.7 |
| Terminal-Bench 2.1 | 86.6 | GPT-5.6 Sol: 88.8 |
PaperBench es el resultado más impresionante: 93.0, superando a GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3). Un salto de 28 puntos respecto a Qwen3.7-Max (64.8). Si se mantiene bajo testing independiente, dice algo real sobre la capacidad de investigación de largo horizonte del modelo.
IFBench (seguimiento de instrucciones) muestra una ventaja de 10-20 puntos sobre todos los competidores. Qwen3.7-Max ya lideraba esta categoría (79.1), por lo que el seguimiento de instrucciones parece una fortaleza durable de la familia Qwen.
Donde Qwen3.8-Max queda atrás
| Benchmark | Qwen3.8-Max | Líder |
|---|---|---|
| SWE-bench Pro | 67.7 | Fable 5: 80.0 |
| FrontierSWE | 73.5 | Fable 5: 88.8 |
| HLE (Humanity Last Exam) | 43.6 | Fable 5: 53.3 |
| GPQA Diamond | 92.6 | GPT-5.6 Sol: 94.1 |
En SWE-bench Pro, el benchmark de ingeniería de software sobre repositorios reales, Qwen3.8-Max queda 12 puntos detrás de Fable 5. La mejora generacional sobre Qwen3.7-Max (60.6) es real, pero "le gana a Claude en Terminal-Bench" y "pierde con Fable 5 en SWE-bench Pro" son ambas ciertas simultáneamente.
En HLE, el benchmark de conocimiento amplio que resiste mejor el tuning específico, Qwen3.8-Max ocupa el último lugar entre los cuatro flagships con 43.6, casi 10 puntos detrás de Fable 5 (53.3).
Capacidades multimediales
En la tabla multimedial, Qwen3.8-Max se ve más fuerte en general. Alibaba reporta MathVision 95.2, LogicVista 91.9 y OSWorld-Verified 86.1, liderando casi todas las filas de OCR y razonamiento visual contra Gemini 3.1 Pro y GPT-5.6 Sol.
Capacidades agénticas y de largo horizonte
Qwen3.8-Max destaca en tareas complejas de largo horizonte con planificación autónoma y aprendizaje adaptativo de ciclo cerrado. Algunos ejemplos destacados:
- Diseño de hardware digital: completó de forma autónoma el flujo completo de diseño de silicio, desde reestructuración lógica hasta optimización multi-restricción. En un diseño de hardware criptográfico RSA, redujo el conteo de gates de 8.298 a 678 gates en una sola corrida continua, liderando todos los modelos evaluados.
- Procesamiento de documentos extensos: puede entender texto, gráficos y documentos de más de 200 páginas, extrayendo insights clave y generando reportes estructurados.
- Memoria de video: al procesar videos de más de 100 minutos, puede organizar personas, eventos y escenas en un grafo de memoria de video, rastreando progresión de eventos y relaciones entre personajes.
- Auto-corrección: detecta desviaciones en su propia salida (una interfaz mal alineada, un resultado visual que no coincide con el diseño previsto), revisa su plan y corrige el output de forma autónoma.
Control de razonamiento y costo
Qwen3.8-Max soporta reasoning_effort para ajustar la profundidad de razonamiento y controlar costos:
- xhigh (por defecto): para tareas complejas que requieren análisis exhaustivo
- medium: balance entre precisión y velocidad
- low: respuestas rápidas para tareas simples
Además, preserve_thinking está activado por defecto, permitiendo conservar las cadenas de razonamiento.
Precios
| Concepto | Precio por 1M tokens |
|---|---|
| Input (cache miss) | $2,00 |
| Output | $6,00 |
| Input (cache implícito) | $0,25 |
| Creación de cache explícito | $2,50 |
| Lectura de cache explícito | $0,17 |
El caching de contexto es la característica que cambia el costo efectivo. A $0,25/MTok en lecturas de cache implícito, un loop de agente que relee el mismo repositorio de 200K tokens a lo largo de 50 turnos paga 8x menos en input que la tarifa sin cache.
Para contexto: Qwen3.7-Max está en $1,25/$3,75, Kimi K3 en $3,00/$15,00, y DeepSeek V4 Flash en $0,14/$0,28. Qwen3.8-Max es el tier premium de su propia familia —60% por encima de 3.7-Max en input— pero todavía muy por debajo del output rate de K3.
Disponibilidad y acceso
El modelo está disponible desde hoy a través de múltiples superficies:
- QwenCloud (API directa) con el model ID
qwen3.8-max - Alibaba Cloud Model Studio para desarrolladores globales
- QwenWork: plataforma all-in-one de workplace AI (beta pública desde hoy, web y desktop)
- Vercel AI Gateway como
alibaba/qwen3.8-max(sin markup, pricing de proveedor)
Compatibilidad con APIs existentes
La API es compatible con los protocolos de OpenAI y Anthropic, lo que significa que podés apuntar tu tooling existente sin reescribir código:
- Claude Code: setear
ANTHROPIC_MODEL=qwen3.8-maxcon base URLhttps://dashscope.intl.aliyuncs.com/apps/anthropic - OpenAI-compatible: cambiar el base URL y el model ID
- Codex: el catálogo ya incluye una entrada
qwen3.8-max
Open weights: la primera vez para un Max
Los pesos open source de Qwen3.8-Max se publicarán la próxima semana en Hugging Face y ModelScope. Esto marca la primera vez en la historia de Qwen que un modelo de clase Max sale de la API. Sin embargo, hay detalles importantes:
- No hay fecha exacta: solo "la próxima semana"
- No hay licencia publicada todavía
- No hay model card disponible aún
- A 2,4T parámetros, el checkpoint es un artefacto de datacenter multi-nodo (aproximadamente 1,2TB solo en pesos a 4-bit)
Adicionalmente, Alibaba anunció Qwen3.8-27B, un checkpoint dimensionado para hardware GPU on-premise convencional —la parte del release que más probablemente termine en máquinas de terceros.
El contexto competitivo
Qwen3.8-Max llega a un mercado caliente. La línea Max de Qwen ha tenido un ritmo de lanzamiento acelerado: Qwen3-Max-Preview en septiembre 2025, Qwen3.6-Max-Preview en abril 2026, Qwen3.7-Max en mayo y ahora Qwen3.8-Max. Esta cadencia es parte de la estrategia: mantener a Alibaba en la conversación cada vez que un rival reclama el liderazgo.
El competidor directo es Moonshot Kimi K3 (2,8T parámetros), que ha sido el modelo a batir este año en China. La demanda fue tan alta que Moonshot pausó nuevos registros para proteger capacidad. Qwen3.8-Max se acerca lo suficiente en tamaño (2,4T vs 2,8T) para que la comparación sea la historia.
En paralelo, QwenWork entra en un campo ya saturado: Tencent WorkBuddy, Moonshot Kimi Work, Claude Cowork y ChatGPT Work son los competidores directos en el espacio de workplace AI.
Veredicto honesto
Qwen3.8-Max es un modelo frontier-class genuino con fortalezas claras:
- Lidera en: seguimiento de instrucciones (IFBench), reproducción de papers (PaperBench), razonamiento visual y multimedial
- Competitivo en: benchmarks agénticos de terminal, GPQA Diamond
- Queda atrás en: ingeniería de software sobre repos reales (SWE-bench Pro, FrontierSWE), conocimiento amplio (HLE)
Para desarrolladores latinoamericanos, el atractivo principal es el precio: a $2/$6 por millón de tokens, es la forma más económica de acceder a autonomía de largo contexto clase K3 desde un modelo frontier-adyacente. Y la compatibilidad con APIs de OpenAI y Anthropic significa que podés integrarlo en flujos existentes (Claude Code, Codex, agentes custom) con un cambio de base URL.
Si los pesos open source llegan como prometido, cambiará lo que "frontier" significa para operadores self-hosted —aunque a 2,4T parámetros, el self-hosting es realista solo para labs bien financiados. El checkpoint Qwen3.8-27B es la variante que terminará en hardware convencional.