DeepSeek V4.1-Flash: el modelo multimodal que jubila a V4 Pro
DeepSeek acaba de jubilar su propio modelo insignia con el más pequeño de su nueva familia. V4.1-Flash es multimodal, cuesta una fracción de lo que costaba V4 Pro y, según las pruebas de la compañía, lo supera en rendimiento, velocidad y coste total. Desde el 14 de septiembre no hay vuelta atrás.
Qué es DeepSeek V4.1-Flash y por qué importa
El 10 de septiembre de 2026 DeepSeek publicó V4.1-Flash, el modelo más pequeño de su nueva familia de arquitecturas y el primero con comprensión visual nativa. Llega con pesos abiertos y su informe técnico disponible en Hugging Face, así que se puede auditar y desplegar en infraestructura propia, no solo consumir a través de una API.
El movimiento es poco habitual: en vez de presentar un modelo más grande que el anterior, la compañía apuesta por uno más pequeño y más barato que rinde mejor. DeepSeek lo resume como más inteligencia con menos coste.
Visión nativa y contexto de un millón de tokens
El modelo acepta texto e imágenes, mantiene el contexto de un millón de tokens de la generación previa y permite generar hasta 384.000 tokens en una sola respuesta. Para quien trabaja con agentes que leen repositorios enteros o documentos largos, ese margen deja de ser el cuello de botella del proyecto.
Lee también
Arquitectura asimétrica: 552B de parámetros, 8B activos
V4.1-Flash es un modelo de mezcla de expertos con 552.000 millones de parámetros, pero no todos trabajan a la vez. Su arquitectura Causal Encoder–Decoder activa solo 8.000 millones de parámetros en la fase de entrada y 16.000 millones en la de salida. Ese diseño asimétrico es lo que le permite tener capacidad de modelo grande con coste de inferencia pequeño.
A eso se suman nuevos métodos de preentrenamiento y un post-entrenamiento con aprendizaje por refuerzo a mayor escala. El resultado que destaca la compañía es que el modelo queda por delante de sus propios insignia en pruebas de referencia, incluido V4-Pro.
Menos caché KV, menos coste por agente
En los bucles de agentes, buena parte de la factura no viene de generar texto, sino de releer el mismo contexto una y otra vez. La caché KV de V4.1-Flash necesita un cuarto de la memoria HBM y un octavo del almacenamiento SSD de la generación anterior. Menos memoria para el mismo contexto se traduce directamente en menos coste por tarea repetida.
Precios de la API: qué cambia en tu factura
El modelo queda disponible en la API con el nombre deepseek-flash. Los precios nuevos, por millón de tokens, son los siguientes. Entrada con acierto de caché: 0,003 dólares en horario valle y 0,006 en horario pico. Entrada sin acierto de caché: 0,15 y 0,30 dólares. Salida: 0,60 y 1,20 dólares.
El horario pico va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes; el valle cuesta la mitad. En hora de Chile continental eso deja las franjas caras entre las 22:00 y la 01:00, y entre las 03:00 y las 07:00. Si tus procesos por lotes no son urgentes, programarlos fuera de esas ventanas recorta la factura a la mitad.
Además sube el techo de concurrencia: 2.500 peticiones simultáneas frente a las 500 de V4-Pro.
Cómo probarlo hoy: API, pesos abiertos y herramientas
Cambiar de modelo es cuestión de una línea: basta con apuntar a deepseek-flash en la API, que mantiene compatibilidad con los formatos de OpenAI y de Anthropic. Los nombres antiguos siguen respondiendo por compatibilidad, pero ya sirven al modelo nuevo.
En herramientas, WorkBuddy (incluido CodeBuddy) y OpenCode se declaran compatibles desde el primer día. Y si prefieres no depender de una API, los pesos están publicados y la compañía dice que trabajará con la comunidad de código abierto en el soporte de inferencia. Si vas por ese camino, en este blog ya explicamos cómo ejecutar modelos locales con Ollama sin pagar por token.
La retirada de V4 Pro: qué cambia el 14 de septiembre
V4-Flash y V4-Flash-Vision-Exp quedan retirados, y sus nombres heredan a V4.1-Flash. El cambio importante llega el 14 de septiembre a las 04:00 UTC: desde ese momento todas las peticiones dirigidas a deepseek-v4-pro se enrutarán a V4.1-Flash y se facturarán a precio Flash, hasta que aparezca V4.1-Pro. Es decir, V4 Pro entra en un retiro ordenado.
La consecuencia práctica es doble. Quien tenga el nombre viejo fijado en su código no verá errores, pero sí un modelo distinto respondiendo. Y quien esté pagando precio Pro por tareas que Flash resuelve igual empezará a pagar menos sin tocar una línea.
Conclusión
V4.1-Flash es una jugada clara: DeepSeek deja de competir consigo mismo y estandariza su oferta en un modelo multimodal, barato y con pesos abiertos que cubre el caso de uso masivo. Si desarrollas agentes o pipelines con modelos de lenguaje, esta es la semana para revisar qué modelo tienes fijado y cuánto estás pagando por él. En el blog seguimos el pulso de la carrera de modelos: tienes el análisis del lanzamiento de la generación anterior de DeepSeek para comparar la evolución.

