Alibaba lanza Qwen3.8-Flash-Next: preview de la arquitectura Qwen4 con 125B params y 6B activos

Un vistazo al futuro de Qwen
El equipo Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo open-weight que sirve como preview de la arquitectura que impulsará la próxima serie Qwen4. Con 125B de parámetros totales y solo 6B activos por token, representa un salto en eficiencia que reduce los costos de entrenamiento a una fracción de lo que sería esperable.
Arquitectura: cuatro innovaciones clave
Qwen3.8-Flash-Next no es solo otro MoE. Introduce cuatro innovaciones arquitectónicas que definen la dirección de Qwen4:
1. Gated DeltaNet (GDN)
Un mecanismo de compresión eficiente del historial. En lugar de mantener todo el contexto en memoria, GDN comprime la información histórica de forma selectiva, reduciendo drásticamente el consumo de memoria para secuencias largas.
2. Qwen Sparse Attention (QSA)
Una atención dispersa novedosa que usa un indexador comprimido ligero para seleccionar solo el contexto relevante. Esto reduce sustancialmente el costo de atención para secuencias largas, sin sacrificar precisión.
3. Gated Residual (GR)
Un mecanismo que expande las rutas de datos entre capas mientras fortalece el flujo de información cross-layer y la estabilidad del entrenamiento. Esto permite que modelos más profundos entrenen de forma más estable.
4. N-gram Embedding
Permite escalar la capacidad del modelo con cómputo adicional mínimo. Qwen3.8-Flash-Next tiene 51B de parámetros dedicados a N-gram embeddings, expandiendo el vocabulario representable sin aumentar proporcionalmente el costo de inferencia.
Bonus: Muon Optimizer
Un optimizador novedoso que mejora la eficiencia del entrenamiento a gran escala, permitiendo que el modelo converja con menos recursos.
Specs técnicas
| Característica | Valor |
|---|---|
| Parámetros principales | 125B |
| Parámetros activos por token | 6B |
| N-gram Embedding params | 51B |
| Contexto por defecto | 262.144 tokens (262K) |
| Contexto extendido (YaRN) | 1.048.576 tokens (1M) |
| Modalidad | Multimodal (texto + imagen) |
| Licencia | Open-weight (Hugging Face + ModelScope) |
Pricing: imbatible
| Concepto | Costo |
|---|---|
| Input por 1M tokens | $0.16 USD (1 RMB) |
| Output por 1M tokens | $0.47 USD (3 RMB) |
Para contexto, GPT-5.6 cobra varias veces más por 1M de tokens. Qwen3.8-Flash está diseñado para high-volume applications donde el costo por token es crítico.
Benchmarks: compite con modelos mucho más grandes
A pesar de tener solo 6B activos, Qwen3.8-Flash compite con modelos significativamente más grandes:
| Benchmark | Qué mide | Competidores |
|---|---|---|
| SWE-bench Pro | Agentic coding | DeepSeek-V4-Flash, Claude-Opus-4.6 |
| CoWorkBench | Long-horizon office work | — |
| Toolathlon Verified | Real-world tool use | — |
| MathVision | Visual math problem solving | — |
| AndroidWorld | Agentic mobile use | — |
| ERQA | Embodied intelligence | — |
Eficiencia de entrenamiento: 1/9 de los recursos
Uno de los datos más impresionantes: Qwen3.8-Flash requiere aproximadamente 1/9 de los recursos de entrenamiento comparado con Qwen3.7-Plus (un modelo tres veces más grande), pero entrega rendimiento superior en coding y tareas de oficina. Esto demuestra que las innovaciones arquitectónicas (GDN + QSA + GR + N-gram) no solo mejoran la inferencia, sino también el entrenamiento.
QwenWork: reducción de 75% en tokens
El modelo también está integrado en QwenWork, la plataforma workplace AI agent de Alibaba. En QwenWork, el modo Standard rediseñado:
- Corta el consumo de tokens por tarea en 75%
- Duplica aproximadamente la velocidad de generación
- Trae capacidad flagship-level a workloads diarios
Disponibilidad
- Pesos open-weight: Hugging Face y ModelScope
- API: Model Studio y Qwen Cloud (Alibaba)
- QwenWork: plataforma integrada de agentes
- Versión quantizada: ya disponible via Unsloth
Por qué importa: el preview de Qwen4
Qwen3.8-Flash-Next no es solo un modelo más. Es la primera implementación pública de la arquitectura que definirá la serie Qwen4. Las cuatro innovaciones (GDN, QSA, GR, N-gram Embedding) representan un cambio fundamental en cómo los modelos manejan atención, memoria y capacidad:
- De atención densa a atención dispersa con indexación comprimida
- De residual estándar a gated residual con flujo cross-layer
- De embeddings fijos a N-gram embeddings escalables
- De optimizadores estándar a Muon Optimizer
Si Qwen4 escala estas innovaciones a modelos más grandes, el gap de eficiencia entre modelos open-source y propietarios podría cerrarse definitivamente.
Conclusión
Qwen3.8-Flash-Next es un modelo notable por sí mismo (125B, 6B activos, $0.16/1M input), pero su verdadero valor es ser un teaser de Qwen4. Las innovaciones arquitectónicas que introduce —GDN, QSA, GR, N-gram Embedding, Muon Optimizer— señalan un futuro donde los modelos son dramáticamente más eficientes en tanto entrenamiento como inferencia. Y a $0.16 por millón de tokens de input, pone la capacidad de modelos frontier al alcance de cualquier aplicación de alto volumen.
Fuentes verificadas
gigazine.net
gigazine.net
www.alizila.com
www.alizila.com
7minutos.es
7minutos.es