Xiaomi lanza modelos open source MiMo-V2.6 tras escalar entrenamiento con aprendizaje por refuerzo
Qué lanzó Xiaomi exactamente
Xiaomi publicó y liberó como open source la serie MiMo-V2.6, compuesta por los modelos nativamente multimodales MiMo-V2.6-Pro y MiMo-V2.6-Flash, ambos con licencia MIT y pesos disponibles en Hugging Face bajo la organización XiaomiMiMo. El lanzamiento incluye además MiMo-V2.6-Distill-Qwen-9B (una versión destilada sobre Qwen para quien necesita un modelo liviano), recursos de investigación sobre aprendizaje por refuerzo, nuevas capacidades de razonamiento espacial 3D, percepción multimodal, computer-use y un cliente de escritorio.
Ficha técnica: arquitectura MoE omnimodal
Ambos modelos son sparse Mixture-of-Experts omnimodales: aceptan texto, imagen, video y audio como entrada y generan texto, con una ventana de contexto de 1.048.576 tokens (cerca de 1.600 páginas). La diferencia clave entre las dos variantes está en la escala:
| Especificación | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| Parámetros totales | 1,02 billones (1,02T) | 309.000 millones (309B) |
| Parámetros activos por token | 42B | 15B |
| Arquitectura | MoE sparse omnimodal | MoE sparse omnimodal |
| Contexto | 1.048.576 tokens | 1.048.576 tokens |
| Entrada | Texto, imagen, video, audio | Texto, imagen, video, audio |
| Salida | Texto | Texto |
| Licencia | MIT (uso comercial) | MIT (uso comercial) |
| API (input/output por 1M) | USD 0,435 / 0,870 | USD 0,140 / 0,280 |
El diseño MoE explica por qué un modelo de un billón de parámetros es operable: solo se activan 42B (Pro) o 15B (Flash) por token, lo que reduce drásticamente el costo de inferencia respecto de un modelo denso equivalente.
El entrenamiento con refuerzo, en números
El corazón del anuncio es la escala del aprendizaje por refuerzo (RL). Según documentó Xiaomi, ambos modelos completaron 30 pasos de RL en menos de seis días usando aproximadamente 750.000 trayectorias, con costos reportados de USD 2,62 millones para el Pro y USD 850.000 para el Flash. Que un ciclo completo de RL a esa escala se ejecute en menos de una semana marca un contraste fuerte con los entrenamientos de meses que dominaron la generación anterior de modelos, y sugiere que Xiaomi optimizó agresivamente su infraestructura de datos y cómputo para RL.
Rendimiento: el open-weight mejor rankeado del índice Artificial Analysis
Según la comparación citada por Xiaomi, MiMo-V2.6-Pro obtuvo 46 puntos en el Artificial Analysis Intelligence Index, por encima de Kimi K3 (44) y GLM-5.3 (45). La compañía lo describe como el modelo open-weight con mejor posición en ese índice, aunque con honestidad reconoce que los modelos cerrados líderes alcanzan 53. La lectura práctica: la brecha entre lo abierto y lo cerrado se estrechó, pero no desapareció. Conviene recordar que estas cifras provienen del anuncio oficial del fabricante; la verificación independiente de la comunidad todavía está en curso.
Precios y disponibilidad
Los pesos se descargan gratis desde Hugging Face (XiaomiMiMo/MiMo-V2.6-Pro-RL y XiaomiMiMo/MiMo-V2.6-Flash-RL), junto con el informe técnico en PDF. Para quien prefiere no auto-alojar, Xiaomi ofrece API oficial en platform.xiaomimimo.com: el Pro cuesta USD 0,435 por millón de tokens de entrada y USD 0,870 de salida, mientras que el Flash baja a USD 0,140 / USD 0,280, con entrada cacheada a centavos (USD 0,0036 y USD 0,0028 por millón respectivamente). Esos precios lo posicionan entre las opciones multimodales más baratas del mercado, muy por debajo de los modelos cerrados de frontera.
Qué significa para desarrolladores en Latinoamérica
- Auto-alojamiento realista: el Flash, con 309B totales y solo 15B activos, es candidato a correr en infraestructura moderada con cuantización; el Pro exige más hardware pero sigue más liviano que un denso de su escala.
- Contexto de 1M: habilita análisis de repositorios completos, expedientes largos o transcripciones extensas sin fragmentar.
- Omnimodal sin costo de licencia: entender imagen, video y audio de entrada con licencia MIT elimina la barrera legal para productos comerciales.
- Ecosistema en español pendiente: como todo modelo chino reciente, el rendimiento en español deberá validarse por la comunidad; el informe técnico se centra en inglés y chino.
Preguntas frecuentes
- ¿Cuántos parámetros tiene cada modelo? MiMo-V2.6-Pro tiene 1,02T totales con 42B activos por token; MiMo-V2.6-Flash tiene 309B totales con 15B activos. Ambos son MoE sparse omnimodales.
- ¿Bajo qué licencia se liberaron? MIT, que permite uso comercial, modificación y redistribución sin restricciones prácticas.
- ¿Qué contexto soportan? 1.048.576 tokens de entrada en ambas variantes.
- ¿Cuánto costó el entrenamiento con RL? Según Xiaomi, USD 2,62 millones para el Pro y USD 850.000 para el Flash, en 30 pasos de RL con ~750.000 trayectorias completados en menos de seis días.
- ¿Dónde descargo los pesos? En Hugging Face, organización XiaomiMiMo: MiMo-V2.6-Pro-RL y MiMo-V2.6-Flash-RL, con informe técnico incluido.
Fuentes y referencias
Fuentes verificadas
TechNode: Xiaomi open-sources MiMo-V2.6 models after scaling reinforcement learning
technode.com
Hugging Face - Organización XiaomiMiMo
huggingface.co
Xiaomi Official Blog / IA Section
mi.com
Papers with Code - Xiaomi MiMo-V2.6
huggingface.co
ArXiv - Búsqueda de papers relacionados con MiMo-V2.6 y aprendizaje por refuerzo en LLM
arxiv.org