DeepSeek lanza V4.1-Flash: MoE de 552B con pesos abiertos y el agente más barato del mercado
DeepSeek lanzó el 10 de septiembre de 2026 DeepSeek-V4.1-Flash, el primer modelo de su nueva familia arquitectónica, con pesos abiertos bajo licencia MIT y disponible de inmediato en su API como deepseek-flash. Según la empresa, supera de forma comprehensiva a V4 Pro —su flagship anterior— en rendimiento, costo, velocidad y tiempo total, y viene con una rebaja de precios agresiva: US$0,30 por millón de tokens de entrada y US$1,20 por millón de salida en hora pico, con 50% de descuento en horario valle.
Arquitectura: MoE asimétrico con memoria condicional
La novedad técnica central es la activación asimétrica: del backbone MoE de 552B de parámetros, solo se activan 8B por token durante el prefill y 16B durante la decodificación. El modelo completo suma 763B de parámetros en precisión mixta (FP8 e INT8) e incluye un módulo de memoria condicional llamado Engram, de 196B de parámetros, al que se accede de forma dispersa. El diseño usa un nuevo esquema Causal Encoder-Decoder, métodos de pre-entrenamiento renovados y post-entrenamiento con RL a mayor escala.
El resultado práctico es eficiencia de hardware: frente a la generación anterior, V4.1-Flash necesita un cuarto de la memoria HBM y un octavo del almacenamiento SSD para el mismo trabajo. DeepSeek lo destaca como el gran ahorro para cargas agénticas, donde el costo real de un agente lo dominan los accesos a cache de contexto largo, no los tokens nuevos.
Rendimiento: fuerte en su liga, a años luz en precio
La ficha oficial en Hugging Face publica estos resultados para la versión instruct en esfuerzo máximo:
| Benchmark | Resultado | Referencia |
|---|---|---|
| GPQA Diamond | 90,9 | GPT-6 Astra: 96,0 (a 33 veces el precio por token de salida) |
| Terminal-Bench 2.1 | 90,6 | Serie propia; la versión 4.0 del mismo test le asigna 31,2 |
| DeepSWE v1.1 | 74,2 | Ingeniería de software autónoma de largo horizonte |
| HLE con herramientas | 63,9 | Sin herramientas: 36,8 |
| Codeforces | 3471 | Rating de programación competitiva |
| MMLU-Pro (base) | 74,1 | Modelo base sin post-entrenamiento instruct |
La lectura honesta: en la versión más dura de Terminal-Bench (4.0), V4.1-Flash obtiene 31,2 frente a 57,9 de GPT-6 Astra y 55,8 de Claude Fable 5.1. No compite en el tope de gama; compite en la relación precio-capacidad, y ahí no tiene rival cercano: contra Astra y Fable 5.1 (US$10/US$50 por millón), V4.1-Flash es entre 33 y 42 veces más barato por token.
Precios: la carrera al fondo se acelera
| Modelo | Entrada (cache miss) | Salida | Cache hit |
|---|---|---|---|
| DeepSeek V4.1-Flash (pico) | US$0,30 | US$1,20 | US$0,006 |
| Gemini 3.8 Flash (intro) | US$0,75 | US$3,75 | US$0,075 |
| Claude Fable 5.1 | US$10 | US$50 | US$0,25 |
| GPT-6 Astra | US$10 | US$50 | Tarifa separada |
El acceso a cache en hora pico cuesta US$0,006 por millón de tokens: doce veces menos que Gemini 3.8 Flash y cuarenta veces menos que Fable 5.1. Para agentes que releen contexto constantemente, esa línea es la que define el costo total. Además acepta 1M de tokens de contexto con salida máxima de 384K —seis veces el límite de salida de Gemini 3.8 Flash— y un límite de concurrencia de 2.500 peticiones.
Un detalle favorable para la región: las horas pico de DeepSeek son 01:00–04:00 y 06:00–10:00 UTC de lunes a viernes; todo el resto es tarifa valle al 50%. Eso deja prácticamente todo el horario laboral de América Latina en la franja barata, un arbitraje de zona horaria que los equipos locales pueden aprovechar de forma sistemática.
Pesos abiertos y ecosistema
Los pesos están publicados en Hugging Face como deepseek-ai/DeepSeek-V4.1-Flash bajo licencia MIT, sin gate de acceso: unos 510 GB repartidos en 48 archivos safetensors, con el reporte técnico en PDF, un encoder de prompts de referencia y carpetas de inferencia y evaluación para reproducir los benchmarks. Corre en vLLM, SGLang y Transformers, y ya existen 17 cuantizaciones comunitarias para ejecutarlo en formatos locales tipo llama.cpp y Ollama — aunque ejecutar el modelo completo en local exige un clúster serio: DeepSeek invita a contactarse para despliegues grandes de 2.000 GPUs o más.
En el ecosistema, WorkBuddy (incluido CodeBuddy) y OpenCode ya lo soportan de forma nativa.
Cambios en la API que hay que conocer
- Identificador actual: deepseek-flash. Los nombres legacy deepseek-v4-flash y deepseek-v4-flash-vision-exp siguen aceptados y se enrutan a V4.1-Flash.
- Retiro de V4 Pro: desde las 04:00 UTC del 14 de septiembre, todas las peticiones a deepseek-v4-pro se enrutan a V4.1-Flash y se facturan a precio Flash, hasta que llegue V4.1 Pro.
- Compatibilidad Anthropic: endpoint https://api.deepseek.com/anthropic además del formato OpenAI.
- Modo thinking por defecto con reasoning_effort configurable de 1 a 100, visión nativa sin sobreprecio y FIM en beta.
- DeepSeek Harness: un runtime de agentes en developer preview con filosofía "todo es un plugin", publicado en GitHub.
Preguntas frecuentes
¿DeepSeek V4.1-Flash es open source?
Sí. Los pesos se publicaron en Hugging Face bajo licencia MIT, sin registro ni aprobación previa, junto al reporte técnico y el código para inferencia y evaluación. La licencia permite uso comercial sin restricciones.
¿Cuánto cuesta respecto a la competencia?
US$0,30/US$1,20 por millón de tokens en hora pico, la mitad en horario valle. Es 2,5–3 veces más barato que Gemini 3.8 Flash en su precio introductorio y 33–42 veces más barato que Claude Fable 5.1 o GPT-6 Astra por token.
¿Qué pasa si uso deepseek-v4-pro?
Sigue funcionando hasta el 14 de septiembre de 2026. Desde esa fecha, las peticiones se redirigen automáticamente a V4.1-Flash y se facturan a precio Flash, hasta que DeepSeek lance V4.1 Pro.
¿Puedo correrlo en local?
Sí, con hardware considerable: el modelo completo pesa unos 510 GB y DeepSeek sugiere contacto directo para despliegues de 2.000 GPUs o más. Para hardware menor existen 17 cuantizaciones comunitarias compatibles con llama.cpp y Ollama, con la pérdida de calidad propia de esa reducción.
Fuentes verificadas
DeepSeek API Docs — News: DeepSeek-V4.1-Flash (2026/09/10)
api-docs.deepseek.com · 2026-09-10
DeepSeek API Docs — Models & Pricing
api-docs.deepseek.com
Hugging Face — deepseek-ai/DeepSeek-V4.1-Flash (model card)
huggingface.co · 2026-09-10