Noticias de Tecnología 5-8 minutos

DeepSeek V4 Flash: lanzamiento oficial del modelo ligero que supera a V4-Pro en agentes

Diego Cortés
Diego Cortés
Full Stack Developer & SEO Specialist
Compartir:
DeepSeek V4 Flash: lanzamiento oficial del modelo ligero que supera a V4-Pro en agentes

El 31 de julio de 2026 DeepSeek sacó de preview la API de V4 Flash: el build 0731, un modelo MoE de 284B de parámetros re-entrenado cuyos benchmarks de agentes superan a V4-Pro-Preview, ya está en beta pública y sus pesos se publicaron el mismo día.

Qué ha anunciado DeepSeek

De preview a beta pública: el build 0731

Según el changelog oficial de la API, fechado el 31 de julio, el lanzamiento oficial de DeepSeek-V4-Flash está disponible en beta pública bajo el build DeepSeek-V4-Flash-0731. No es un ajuste menor: el modelo se ha re-entrenado por completo y los resultados en benchmarks de agentes superan a los de V4-Pro-Preview, el modelo tope de la casa.

Un cambio quirúrgico: solo la API de V4-Flash

La actualización afecta únicamente a la API de V4-Flash. Ni la aplicación, ni la web, ni la API de V4-Pro se han tocado, así que los equipos que ya consumen V4-Flash reciben la mejora sin migraciones forzadas. El mismo día se publicaron los pesos del modelo, de modo que cualquiera puede autoalojarlo si prefiere no depender de la API.

Qué es DeepSeek V4 Flash

Un MoE de 284B parámetros re-entrenado

V4 Flash nació el 24 de abril de 2026 como la variante ligera de la familia V4: razonamiento cercano a V4-Pro, rendimiento a la par en tareas de agentes simples, menor tamaño, respuestas más rápidas y un precio muy inferior. Con el build 0731, DeepSeek re-entrena ese modelo de 284B de parámetros con arquitectura MoE (mixture of experts) y sube el listón justo donde más le interesa: las tareas de agentes.

Benchmarks de agentes por encima de V4-Pro-Preview

El dato más llamativo es que el modelo ligero supera al tope de gama en benchmarks de agentes. En la práctica significa que para flujos multi-paso —uso de herramientas, ejecución de código, tareas autónomas— V4 Flash puede ser la opción más rentable sin sacrificar resultados, un argumento directo para quienes construyen agentes en producción.

Precios y contexto de la familia V4

0,14/0,28 dólares por millón de tokens

En la página oficial de DeepSeek, V4-Flash cuesta 0,14 dólares por millón de tokens de entrada y 0,28 por millón de salida. En OpenRouter, el snapshot 0731 baja a 0,09 y 0,18 dólares respectivamente, con una ventana de contexto de 1.048.576 tokens (1M) y hasta 65.536 tokens de salida. Son de los precios más bajos del mercado para un modelo con ese contexto.

V4-Pro y el descuento permanente del 75 %

El lanzamiento encaja en la estrategia de precios agresiva de DeepSeek: V4-Pro mantiene desde el 22 de mayo de 2026 un descuento permanente del 75 %, que lo deja en 0,435 dólares por millón de tokens de entrada y 0,87 por salida, sin fecha de caducidad. La familia V4 queda así escalonada por coste: V4-Pro para tareas complejas, V4-Flash para volumen.

Para desarrolladores: Responses API, Codex y contexto de 1M

V4-Flash-0731 incluye soporte nativo de la Responses API y adaptación para Codex, dos piezas clave para integrarlo en agentes y herramientas de programación. Con un contexto de 1M de tokens y ese precio por token, el modelo se posiciona para cargas de trabajo masivas: procesamiento de documentos largos, pipelines de datos y agentes que necesitan mantener conversaciones extensas sin disparar la factura. Un ejemplo mínimo de llamada con la Responses API:

from openai import OpenAI

client = OpenAI(api_key="...", base_url="https://api.deepseek.com")
r = client.responses.create(
    model="deepseek-v4-flash",
    input="Resume este changelog en tres puntos"
)
print(r.output_text)

El snippet es ilustrativo: cada SDK adapta el nombre del parámetro, pero el slug del modelo y el endpoint son los que quedan registrados en la documentación oficial.

Conclusión

DeepSeek V4 Flash 0731 convierte al modelo ligero en la opción económica para agentes y cargas masivas, con un precio por token difícil de igualar y un contexto de 1M. Si trabajas con IA en producción, es un buen momento para comparar tu coste por token actual con esta alternativa. Sigue el blog para más novedades de tecnología e inteligencia artificial.

Categorías