Qwen 3.8-Max: el flagship de 2.4T parámetros de Alibaba con open weights, coding autónomo de 16 días y benchmarks frontier

Qwen3.8-Max: el flagship más grande de Alibaba hasta la fecha
El 3 de agosto de 2026, Alibaba lanzó oficialmente Qwen3.8-Max, el modelo más capaz de la familia Qwen hasta la fecha. Con 2.4 billones (trillones en inglés) de parámetros en arquitectura sparse Mixture-of-Experts (MoE) y 95B parámetros activos por token, es el segundo modelo más grande públicamente conocido, superado solo por Kimi K3 de Moonshot AI (2.8T).
Pero el tamaño no es la única historia. Qwen3.8-Max trae tres novedades históricas para la familia Qwen:
- Primer open weights de un modelo Max-tier: Alibaba abrió los pesos tanto del flagship (2.4T) como de un modelo más pequeño (Qwen3.8-27B), algo nunca antes hecho en la línea Max.
- Multimodal nativo: texto + imágenes + video como entrada, no solo texto como sus predecesores Max.
- 1M tokens de contexto con hasta 131K tokens de output por respuesta.
Arquitectura y especificaciones
| Especificación | Valor |
|---|---|
| Parámetros totales | 2.4 billones (2.4T) |
| Parámetros activos por token | ~95B (≈4% del total) |
| Arquitectura | Sparse Mixture-of-Experts (MoE) |
| Context window | 1,000,000 tokens (991K input) |
| Max output tokens | 131,072 |
| Modalidades | Texto + imágenes + video (multimodal nativo) |
| Base arquitectónica | Qwen 3.5 (escalada) |
| reasoning_effort | xhigh (default), medium, low |
| preserve_thinking | Habilitado por defecto |
| API compatibility | OpenAI spec + Anthropic spec |
Los 95B parámetros activos por token posicionan a Qwen3.8-Max en una clase de serving más ligera que Kimi K3 (104B activos), lo que se traduce en menor costo de inferencia y latencia por token a pesar de tener más parámetros totales que la mayoría de modelos.
Benchmarks: dónde gana y dónde pierde
Alibaba publicó una tabla completa de benchmarks comparando Qwen3.8-Max contra Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol y su predecesor Qwen3.7-Max. Estos son los resultados:
Benchmarks de coding y agentes
| Benchmark | Qwen3.8-Max | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| DeepSWE 1.1 | 56.6 | 59.0 | 70.0 | 73.0 | 21.6 |
| NL2Repo-Bench | 55.9 | 69.4 | — | — | 47.2 |
| FrontierSWE | 73.5 | 70.0 | 88.8 | — | 40.7 |
| MLS-Bench-Lite | 41.0 | 42.8 | 49.9 | 46.2 | 31.7 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| AndroidBench | 75.1 | 69.8 | 84.5 | 74.0 | 56.5 |
Benchmarks de razonamiento y conocimiento
| Benchmark | Qwen3.8-Max | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity's Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Benchmarks multimodales
| Benchmark | Qwen3.8-Max | Gemini 3.1 Pro | GPT-5.6 Sol |
|---|---|---|---|
| MathVision | 95.2 | — | — |
| LogicVista | 91.9 | — | — |
| OSWorld-Verified | 86.1 | — | 85.0 |
Lectura honesta de los benchmarks
Dónde gana Qwen3.8-Max:
- PaperBench 93.0 — el score más alto de la tabla, supera a GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3). Un salto de +28 puntos sobre Qwen3.7-Max.
- IFBench 82.8 — lidera por 10-20 puntos sobre todos los competidores. Instruction following es una fortaleza durable de Qwen (3.7-Max ya lideraba con 79.1).
- Terminal-Bench 2.1 86.6 — supera a ambos Claude flagships (84.6), solo por detrás de GPT-5.6 Sol (88.8).
- FrontierSWE 73.5 — supera a Opus 4.8 (70.0), aunque queda detrás de Fable 5 (88.8).
- Multimodal — MathVision 95.2, LogicVista 91.9 y OSWorld-Verified 86.1 lideran sus respectivas tablas.
Dónde pierde:
- SWE-bench Pro 67.7 — 12 puntos detrás de Fable 5 (80.0). El engineering más profundo no es su fortaleza.
- DeepSWE 1.1 56.6 — detrás de Opus (59.0), Fable 5 (70.0) y GPT-5.6 Sol (73.0).
- HLE 43.6 — último entre los cuatro flagships, 10 puntos detrás de Fable 5 (53.3).
- NL2Repo-Bench 55.9 — significativamente detrás de Opus 4.8 (69.4).
El resumen honesto: Qwen3.8-Max es un modelo frontier-tier legítimo que gana en investigación estilo paper reproduction, instruction following y tareas agentivas de terminal, pero trail los leaders en software engineering profundo y knowledge exams. "Mejor overall" depende enteramente de qué benchmarks peses.
El salto generacional sobre Qwen3.7-Max
El resultado menos ambiguo de toda la tabla es el salto generacional. Sin importar el ranking cross-vendor, la mejora sobre su predecesor es enorme:
| Benchmark | Qwen3.7-Max | Qwen3.8-Max | Salto |
|---|---|---|---|
| Terminal-Bench 2.1 | 74.5 | 86.6 | +12.1 |
| DeepSWE 1.1 | 21.6 | 56.6 | +35.0 |
| FrontierSWE | 40.7 | 73.5 | +32.8 |
| PaperBench | 64.8 | 93.0 | +28.2 |
| SWE-bench Pro | 60.6 | 67.7 | +7.1 |
Coding autónomo: tres demos que demuestran long-horizon
Alibaba no solo publicó benchmarks sintéticos. Mostró tres casos reales de coding autónomo que demuestran la capacidad de Qwen3.8-Max para tareas largas y complejas sin intervención humana.
1. 16 días de coding autónomo: self-evolving harness
Qwen3.8-Max creó el proyecto oh-my-cli desde cero y, durante 16 días de operación autónoma, construyó un harness que se auto-evoluciona. El sistema combina feedback de usuarios, prácticas de la comunidad y resultados de self-tests en un loop de ingeniería: los requirements se normalizan en issues, los agents los reclaman automáticamente, implementan, corren E2E tests y mergean PRs.
Resultados tras 16 días: 265 commits, 127 PRs, 151 issues. El repositorio completo está público en GitHub (qwen-code-dev-bot/oh-my-cli).
2. Reproducir un paper de investigación — y mejorarlo
Se le entregó a Qwen3.8-Max un paper de investigación sobre data selection para LLM reasoning (Unified Data Selection for LLM Reasoning) sin starter code. El modelo:
- Escribió ~7,600 líneas de código desde cero
- Tomó más de 1,100 acciones
- Corrió 33 rondas de GPU training durante ~125 horas (5 días)
- Reprodujo los 6 hallazgos principales del paper
- Luego ejecutó un loop de self-improvement: 4 rondas, 18 ideas, 88 horas adicionales
- Logró un método nuevo que supera al paper original en +2.7 puntos en AIME24
3. Competición real: beat 87% de equipos humanos en 24 horas
Qwen3.8-Max participó en el WWW2025 Multimodal Dialogue Intent Recognition Challenge en Alibaba Cloud Tianchi, donde competían 526 equipos humanos. En 24 horas y sin intervención humana:
- Construyó una solución completa en código: fine-tuneó y ensembled BERT, MacBERT y RoBERTa para texto; Qwen2.5-VL-7B + Chinese-CLIP para imágenes
- Sistema de weighted-voting con calibración por cross-validation
- 45 submissions, escalando accuracy de 0.60 a 0.853
- Superó al 87% de los equipos humanos (458 de 526)
Open weights: dos modelos, dos licencias
El 14 de agosto de 2026, Alibaba publicó los pesos abiertos de dos modelos Qwen3.8 en Hugging Face y ModelScope. La noticia importante es que es la primera vez que un modelo Max-tier de Qwen tiene open weights. Pero la licencia difiere entre los dos modelos:
Qwen3.8-27B — Apache 2.0
- 27B parámetros, dense con hybrid attention
- Multimodal nativo: texto + imágenes + video (incluye diagramas, documentos y video de varias horas)
- 262K contexto nativo, extensible a 1M via YaRN
- Thinking mode activable por query (xhigh, medium, low)
- Apache 2.0 — uso comercial, modificación y redistribución permitidos
- Repo oficial: Qwen/Qwen3.8-27B
- Reporta 61.7 en SWE-bench Pro (self-published)
- Supera a Qwen3.7-Plus en coding y office tasks según Alibaba
- Quants disponibles en Ollama, llama.cpp, LM Studio y Jan desde el día 1
- Requisitos: ~17GB VRAM con quant 4-bit, 48GB para FP8, 80GB para BF16
Qwen3.8-2.4T-A95B — Licencia custom (Qwen3.8-Max License)
- 2.4T parámetros, 95B activos (MoE) — el flagship completo
- Requiere infraestructura multi-nodo (datacenter)
- Licencia custom con dos condiciones que Apache 2.0 no tiene:
- Productos con >100M MAU o >$20M/mes en revenue deben mostrar el nombre del modelo en la UI
- Companies con >$50M/año en revenue operando "Model as a Service" o "AI Work Assistant" deben obtener licencia separada de Qwen
- Repo: Qwen/Qwen3.8-2.4T-A95B
Importante: La licencia del 2.4T no es Apache 2.0. Llamar a ambos releases "open weights" es correcto; llamar a ambos "Apache 2.0" no lo es. El 27B es el punto de partida seguro para productos comerciales mientras se hace review legal del 2.4T.
Pricing y acceso
API de Qwen3.8-Max
| Concepto | Precio |
|---|---|
| Input tokens | $2 / millón |
| Output tokens | $6 / millón |
| Cached input | $0.25 / millón |
| Cache writes | $2.50 / millón |
| Thinking tokens | Cuentan como output |
Esto es aproximadamente un tercio del precio list de Claude Fable 5. Un solo tier plano cubre todo el contexto de 1M de tokens, sin pricing escalonado por longitud.
Disponibilidad
- QwenCloud (qwencloud.com) — API directa
- Alibaba Cloud Model Studio — API para developers globales
- Regiones: Beijing, Singapur, Tokio, Frankfurt, Virginia
- Token Plan — suscripción para uso individual
- QwenWork — plataforma all-in-one de productividad con IA (public beta)
Compatibilidad de API
Qwen3.8-Max soporta dos protocolos estándar:
- OpenAI spec — chat completions y responses API
- Anthropic spec — compatible directo con Claude Code
Integración con coding agents
Una de las ventajas clave de Qwen3.8-Max es su compatibilidad con los agentes CLI más populares:
Claude Code
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
Codex CLI
Configurar en ~/.codex/model-catalog.local.json y ~/.codex/config.toml con el provider "ModelStudio", base URL de DashScope y modelo qwen3.8-max. Soporta parallel tool calls, image input y reasoning levels low/medium/xhigh.
Qwen Code
npm install -g @qwen-code/qwen-code@latest
qwen
Qoder CLI
curl -fsSL https://qoder.com/install | bash
qoder
Qwen3.8-Max vs la competencia
vs Claude Fable 5
Qwen gana en PaperBench, IFBench y Terminal-Bench. Fable 5 gana en SWE-bench Pro (80.0 vs 67.7), DeepSWE y HLE. Fable 5 sigue siendo superior para software engineering profundo y knowledge exams. Qwen es mejor para research reproduction, instruction following y tareas agentivas de terminal. A un tercio del precio.
vs GPT-5.6 Sol
Qwen gana en PaperBench (93.0 vs 90.5), IFBench (82.8 vs 72.7) y FrontierSWE. Sol gana en Terminal-Bench (88.8 vs 86.6), GPQA Diamond (94.1 vs 92.6) y DeepSWE (73.0 vs 56.6). Sol es más fuerte en coding profundo y razonamiento, Qwen en research e instruction following.
vs Kimi K3 (Moonshot AI)
Apuestas opuestas: K3 es 2.8T con open weights desde el día 1 (Apache 2.0). Qwen3.8-Max es 2.4T, API primero con open weights una semana después. K3 cuesta $3/$15 por millón, Qwen $2/$6. K3 tiene resultados de terceros; Qwen3.8-Max tiene benchmarks vendor-run. K3 para control de deployment, Qwen para menor costo por token y multimodal.
vs Qwen3.7-Max
El salto generacional es masivo: Terminal-Bench +12.1, DeepSWE +35.0, FrontierSWE +32.8, PaperBench +28.2. 3.7-Max es el Qwen verificable para producción hoy; 3.8-Max es el que hay que evaluar. Si el costo es decisivo, 3.7-Max sigue siendo competitivo.
Arena rankings
En los rankings de terceros publicados recientemente:
- Text Arena: puesto 5
- Vision Arena: puesto 2
En Arena, el modelo Qwen quedó segundo solo detrás de la serie Claude de Anthropic, confirmando el posicionamiento frontier-tier.
QwenWork: la apuesta de productividad
Junto con Qwen3.8-Max, Alibaba lanzó QwenWork en public beta: una plataforma all-in-one de productividad con IA que compite directamente con WorkBuddy de Tencent y Kimi Work de Moonshot AI. QwenWork integra el modelo Qwen3.8-Max para tareas de oficina, análisis de datos, investigación y workflows profesionales.
Caveats y lo que falta
- Benchmarks vendor-run: todos los scores son reportados por Alibaba. Falta verificación independiente de terceros.
- SWE-bench Pro tiene problemas conocidos: una auditoría de julio 2026 flaggeó ~30% de las tareas públicas como rotas. El gap de 12 puntos con Fable 5 debe interpretarse con cautela.
- Terminal-Bench 2.1 cambió 28 de 89 tareas tras encontrar drift en dependencias. Los scores varían según el harness usado.
- La documentación en inglés de Model Studio aún lista la generación anterior en algunas regiones. El rollout internacional va detrás del anuncio.
- Aún no aparece en OpenRouter al momento de escribir.
- Los open weights del 2.4T tienen licencia custom, no Apache 2.0. Revisar thresholds de revenue antes de deployar comercialmente.
Conclusión
Qwen3.8-Max es un hito para Alibaba y para el ecosistema open weights en general. Por primera vez, un modelo Max-tier de Qwen —el tier que siempre fue cerrado y comercial— tiene pesos abiertos. El modelo entrega números frontier-tier en coding agentivo, research reproduction e instruction following, a un tercio del precio de Claude Fable 5. Y lo respalda con demos reales de coding autónomo de 16 días, reproducción de papers científicos y competiciones contra equipos humanos.
Pero no es un sweep. En software engineering profundo (SWE-bench Pro, DeepSWE) y knowledge exams (HLE), Fable 5 y GPT-5.6 Sol siguen adelante. Y todos los benchmarks son vendor-run: la verificación independiente será lo que confirme o ajuste estos números.
Para equipos que evalúan: Qwen3.8-Max merece un lugar en tu set de evaluación. El pricing es simple ($2/$6), la compatibilidad con Claude Code y Codex CLI es nativa, y el 27B bajo Apache 2.0 te permite probar localmente en una sola GPU. La pregunta no es si es frontier-tier —los números dicen que sí— sino en qué tasks específicos de tu workload gana o pierde contra Fable 5 y GPT-5.6 Sol. Eso solo lo responde tu propio benchmark.
Fuentes y recursos
- Qwen3.8-Max: A New Bar for Coding and Cowork — Alibaba Cloud
- Alibaba Unveils Qwen3.8-Max — Alibaba Cloud
- Alibaba launches Qwen3.8-Max — Quartz
- Alibaba debuts Qwen3.8-Max — SiliconANGLE
- Alibaba launches next-gen Qwen3.8 — TechNode
- Qwen 3.8 Benchmarks analysis — Apidog
- Qwen 3.8-Max: Specs, Pricing, Benchmark Status — Yotta Labs
- Qwen 3.8 open weights release — The Decoder
- Qwen3.8 Open Weights: Two Models, Two Licenses — SQ Magazine
- Qwen3.8-27B en Hugging Face
- Qwen3.8-2.4T-A95B en Hugging Face
- QwenCloud
- oh-my-cli — 16 días de coding autónomo (GitHub)