DeepSeek V4.1 Flash: qué trae el modelo open-weight con licencia MIT y qué revisar antes de usar su API
El 10 de septiembre de 2026 DeepSeek lanzó V4.1 Flash, un modelo Mixture-of-Experts de 552.000 millones de parámetros que activa solo 8.000 millones por token al procesar la entrada y 16.000 millones al generar. Los pesos están en Hugging Face bajo licencia MIT, lo que permite uso comercial, fine-tuning y redistribución. Y la API cuesta USD 0,15 por millón de tokens de entrada en horario off-peak.
Los números llaman la atención, pero lo más útil para un equipo de desarrollo está en los detalles: una arquitectura pensada para cargas con mucho input, un benchmark que cambia 8,6 puntos según el harness y una compatibilidad con la Responses API que tiene letra chica.
La arquitectura: asimétrica a propósito
Según el model card, V4.1 Flash usa una arquitectura Causal Encoder-Decoder (CED): un Transformer de 40 capas organizado en 20 de encoder causal y 20 de decoder. La caché KV global del decoder se proyecta desde los estados finales del encoder, y eso permite activar 8B parámetros por token durante el prefill (lectura de la entrada) y 16B durante la generación.
Otros datos del model card y del anuncio:
- Caché KV de 890 bytes por token, aproximadamente un cuarto de lo que necesitaba V4 Flash. El anuncio lo resume como 1/4 de la memoria HBM y 1/8 del almacenamiento en SSD.
- 1M de tokens de contexto y entrada de imágenes nativa.
- Esfuerzo de razonamiento continuo, de 1 a 100.
- 384 expertos enrutados y 1 compartido por capa MoE, con 6 expertos activos por token.
DeepSeek explica en el anuncio por qué importa la caché: los cobros por cache hit suelen ser una parte grande del costo de un agente, y comprimir la caché los reduce. El diseño apunta a agentes de código, análisis de repositorios y cualquier tarea donde se lee mucho y se escribe poco.
Los benchmarks (de DeepSeek) y el dato que casi nadie mira
En la tabla del model card, con esfuerzo máximo, V4.1 Flash obtiene 74,2 en DeepSWE v1.1, frente a 74,0 de Opus 5.0 y 73,0 de GPT-5.6 Sol. En Terminal-Bench 2.1 llega a 90,6. Pero en Terminal-Bench 4.0 marca 31,2 contra 51,8 de Opus 5.0. El panorama es mixto.
El dato más valioso está en otra tabla del mismo model card, que mide el modelo con distintos scaffolds de agente en DeepSWE v1.1:
| Harness | DeepSWE v1.1 (resueltos) |
|---|---|
| mini-SWE | 74,2 |
| DSH Minimal | 72,6 |
| Claude Code | 69,8 |
| Pi | 66,2 |
| Codex | 65,6 |
| OpenCode | 65,5 |
Mismo modelo, mismo benchmark, 8,7 puntos de diferencia entre el mejor y el peor harness. Si comparás modelos sin fijar el harness, estás comparando dos variables a la vez. Esta es probablemente la lección más transferible del lanzamiento, más allá de DeepSeek.
La API: precios por franja horaria
El modelo se usa con el nombre deepseek-flash y hay endpoints con formato OpenAI y con formato Anthropic. Precios por millón de tokens, según la página oficial:
| Concepto | Off-peak | Peak |
|---|---|---|
| Entrada (cache hit) | USD 0,003 | USD 0,006 |
| Entrada (cache miss) | USD 0,15 | USD 0,30 |
| Salida | USD 0,60 | USD 1,20 |
El horario pico es de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, excluyendo feriados de China. Traducido a Argentina (UTC-3): de 22:00 a 01:00 (de domingo a jueves por la noche) y de 03:00 a 07:00 (de lunes a viernes). La jornada laboral argentina queda entera en tarifa off-peak. En México (UTC-6), el pico cae de 19:00 a 22:00 y de 00:00 a 04:00. Si programás jobs batch, conviene evitar esas franjas.
La letra chica del "compatible con Responses API"
DeepSeek soporta el formato de la Responses API (lo hizo, dice su documentación, para poder usarse con Codex). Pero la misma documentación lista diferencias importantes:
- Es stateless. No soporta
previous_response_idniconversation: hay que reenviar el historial completo en cada turno. - Las herramientas integradas se ignoran.
web_search,file_search,code_interpreter,computer_useymcpno hacen nada. Solo funcionan las tools de tipofunctiony la customapply_patch. - Los parámetros no soportados se ignoran en silencio. El request devuelve éxito aunque lo que pediste no haya tenido efecto.
- El streaming termina con un evento
response.completed,response.incompleteoresponse.failed, sin el clásicodata: [DONE].
El ejemplo mínimo de la documentación usa el SDK de OpenAI apuntando a otro base_url:
from openai import OpenAI
client = OpenAI(api_key="<tu API key de DeepSeek>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
Que el código corra sin errores no garantiza que se comporte igual. Si tu parser de SSE espera [DONE], o tu app depende de previous_response_id, vas a tener bugs silenciosos.
El alias que cambió de modelo
Otra lección de ciclo de vida. Con el lanzamiento, V4 Flash quedó retirado y los nombres deepseek-v4-flash y deepseek-v4-flash-vision-exp pasaron a ser atendidos por V4.1 Flash: mismo string, otro modelo. DeepSeek también anunció que desde el 14 de septiembre deepseek-v4-pro se redirigiría a V4.1 Flash, y luego dio marcha atrás "en respuesta a la demanda de usuarios": V4 Pro sigue disponible con la misma facturación. Quien no leía el changelog no se enteraba de ninguno de los dos cambios.
Qué hacer con esto
- Evaluá por tipo de carga. El diseño asimétrico favorece tareas con mucho input y poco output: revisión de código, RAG sobre repos, extracción de documentos.
- Fijá el harness en tus evals antes de comparar modelos.
- Escribí tests semánticos, no solo de transporte. Un 200 no prueba que la tool o el parámetro hayan funcionado.
- Registrá qué modelo respondió (identificador, fecha y precio vigente) y seguí los changelogs de tus proveedores.
- Self-hosting con los pies en la tierra. Que active 8B-16B por token habla del cómputo, no de la memoria: los 552B hay que almacenarlos y servirlos igual. La licencia MIT te da la opción de hostearlo, pero la operación pasa a ser tuya.
- Revisá términos y jurisdicción antes de mandar datos de clientes a cualquier API. Para datos sensibles, los pesos abiertos permiten correrlo en infraestructura propia o en un proveedor que elijas.
¿Tu equipo ya tiene algún modelo open-weight en el routing de producción, o todavía es todo API cerrada?
Lecturas relacionadas
- GPT-6 Sol y Luna: precios, prompt caching y cómo recalcular el costo de tus agentes: los precios nuevos de Sol y Luna, el prompt caching y la letra chica de los 272K tokens.
- RAG o fine-tuning: guía para decidir cómo darle conocimiento y comportamiento a un LLM: cuándo conviene RAG, cuándo fine-tuning y cuándo alcanza con prompting o contexto largo.
- Cómo evaluar LLMs en producción: guía práctica de evals para equipos de desarrollo: cómo armar un dataset de evaluación, cuándo usar LLM-as-a-judge y cómo sumarlo al CI.
Fuentes
- DeepSeek API Docs, anuncio "DeepSeek-V4.1-Flash" (10/09/2026): https://api-docs.deepseek.com/news/news260910
- DeepSeek API Docs, Change Log: https://api-docs.deepseek.com/updates
- DeepSeek API Docs, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing
- DeepSeek API Docs, Using the Responses API: https://api-docs.deepseek.com/guides/responses_api
- Hugging Face, model card DeepSeek-V4.1-Flash: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash