DeepSeek V4.1 Flash: qué trae el modelo open-weight con licencia MIT y qué revisar antes de usar su API

Por Felipe Traina · 28/9/2026 · 6 min · ia, llm, open-source, deepseek

El 10 de septiembre de 2026 DeepSeek lanzó V4.1 Flash, un modelo Mixture-of-Experts de 552.000 millones de parámetros que activa solo 8.000 millones por token al procesar la entrada y 16.000 millones al generar. Los pesos están en Hugging Face bajo licencia MIT, lo que permite uso comercial, fine-tuning y redistribución. Y la API cuesta USD 0,15 por millón de tokens de entrada en horario off-peak.

Los números llaman la atención, pero lo más útil para un equipo de desarrollo está en los detalles: una arquitectura pensada para cargas con mucho input, un benchmark que cambia 8,6 puntos según el harness y una compatibilidad con la Responses API que tiene letra chica.

La arquitectura: asimétrica a propósito

Según el model card, V4.1 Flash usa una arquitectura Causal Encoder-Decoder (CED): un Transformer de 40 capas organizado en 20 de encoder causal y 20 de decoder. La caché KV global del decoder se proyecta desde los estados finales del encoder, y eso permite activar 8B parámetros por token durante el prefill (lectura de la entrada) y 16B durante la generación.

Otros datos del model card y del anuncio:

DeepSeek explica en el anuncio por qué importa la caché: los cobros por cache hit suelen ser una parte grande del costo de un agente, y comprimir la caché los reduce. El diseño apunta a agentes de código, análisis de repositorios y cualquier tarea donde se lee mucho y se escribe poco.

Los benchmarks (de DeepSeek) y el dato que casi nadie mira

En la tabla del model card, con esfuerzo máximo, V4.1 Flash obtiene 74,2 en DeepSWE v1.1, frente a 74,0 de Opus 5.0 y 73,0 de GPT-5.6 Sol. En Terminal-Bench 2.1 llega a 90,6. Pero en Terminal-Bench 4.0 marca 31,2 contra 51,8 de Opus 5.0. El panorama es mixto.

El dato más valioso está en otra tabla del mismo model card, que mide el modelo con distintos scaffolds de agente en DeepSWE v1.1:

Harness DeepSWE v1.1 (resueltos)
mini-SWE 74,2
DSH Minimal 72,6
Claude Code 69,8
Pi 66,2
Codex 65,6
OpenCode 65,5

Mismo modelo, mismo benchmark, 8,7 puntos de diferencia entre el mejor y el peor harness. Si comparás modelos sin fijar el harness, estás comparando dos variables a la vez. Esta es probablemente la lección más transferible del lanzamiento, más allá de DeepSeek.

La API: precios por franja horaria

El modelo se usa con el nombre deepseek-flash y hay endpoints con formato OpenAI y con formato Anthropic. Precios por millón de tokens, según la página oficial:

Concepto Off-peak Peak
Entrada (cache hit) USD 0,003 USD 0,006
Entrada (cache miss) USD 0,15 USD 0,30
Salida USD 0,60 USD 1,20

El horario pico es de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, excluyendo feriados de China. Traducido a Argentina (UTC-3): de 22:00 a 01:00 (de domingo a jueves por la noche) y de 03:00 a 07:00 (de lunes a viernes). La jornada laboral argentina queda entera en tarifa off-peak. En México (UTC-6), el pico cae de 19:00 a 22:00 y de 00:00 a 04:00. Si programás jobs batch, conviene evitar esas franjas.

La letra chica del "compatible con Responses API"

DeepSeek soporta el formato de la Responses API (lo hizo, dice su documentación, para poder usarse con Codex). Pero la misma documentación lista diferencias importantes:

El ejemplo mínimo de la documentación usa el SDK de OpenAI apuntando a otro base_url:

from openai import OpenAI

client = OpenAI(api_key="<tu API key de DeepSeek>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)
print(response.output_text)

Que el código corra sin errores no garantiza que se comporte igual. Si tu parser de SSE espera [DONE], o tu app depende de previous_response_id, vas a tener bugs silenciosos.

El alias que cambió de modelo

Otra lección de ciclo de vida. Con el lanzamiento, V4 Flash quedó retirado y los nombres deepseek-v4-flash y deepseek-v4-flash-vision-exp pasaron a ser atendidos por V4.1 Flash: mismo string, otro modelo. DeepSeek también anunció que desde el 14 de septiembre deepseek-v4-pro se redirigiría a V4.1 Flash, y luego dio marcha atrás "en respuesta a la demanda de usuarios": V4 Pro sigue disponible con la misma facturación. Quien no leía el changelog no se enteraba de ninguno de los dos cambios.

Qué hacer con esto

¿Tu equipo ya tiene algún modelo open-weight en el routing de producción, o todavía es todo API cerrada?

Lecturas relacionadas

Fuentes

← Volver al blog