DeepSeek V4.1 Flash reemplaza la breve beta con una versión de producción basada en cómputo asimétrico, multimodalidad nativa, benchmarks de agentes más sólidos y precios de API notablemente más bajos.
TL;DR
DeepSeek V4.1 Flash es ahora una API oficial y un modelo de pesos abiertos, no un endpoint beta con caducidad. DeepSeek afirma que es un modelo de Mixture-of-Experts de 552B parámetros que utiliza una nueva arquitectura Causal-Encoder-Decoder. Solo se activan 8B parámetros durante el procesamiento de entrada, mientras que 16B se activan durante la generación de salida. Ese diseño asimétrico busca gastar menos cómputo en prompts largos sin debilitar la etapa de generación autoregresiva.
El nombre del modelo de la API de producción es deepseek-flash. Admite una ventana de contexto de 1M tokens, hasta 384K tokens de salida, modos con y sin pensamiento, salida JSON, llamadas a herramientas, la Responses API, la API compatible con Anthropic y entrada visual nativa. La tabla oficial de benchmarks de DeepSeek muestra mejoras sustanciales frente a V4 Flash 0731 y V4 Pro 0813 en tareas de programación, agentes, ciberseguridad y multimodalidad.
El cambio de precios es igualmente importante. En horas pico, V4.1 Flash cuesta $0.006 por millón de tokens de entrada con acierto de caché, $0.30 por millón de tokens de entrada con fallo de caché y $1.20 por millón de tokens de salida. Las tarifas fuera de pico son la mitad de esos importes.
Key Takeaways
- DeepSeek V4.1 Flash es un modelo lanzado con pesos abiertos; el identificador temporal
deepseek-v4.1-flash-expires-on-0910ya no es la referencia de producción correcta. - Su diseño MoE de 552B activa 8B parámetros para la entrada y 16B para la salida, creando un perfil de eficiencia diferente al de la arquitectura de 284B total/13B activa de V4 Flash.
- La multimodalidad nativa forma parte del modelo principal en lugar de una rama Vision Exp separada.
- La comparación oficial muestra a V4.1 Flash por delante de V4 Pro 0813 en la mayoría de los benchmarks seleccionados de agentes y programación, aunque no lidera cada benchmark de conocimiento o terminal frente a todos los competidores de frontera.
- El caché KV global cae a 890 bytes por token, aproximadamente 3.9 veces más pequeño que V4 Flash y alrededor de una cuarta parte de su huella anterior.
- Los precios de API en horas pico son $0.006 para entrada con acierto de caché, $0.30 para entrada con fallo de caché y $1.20 para salida por millón de tokens; fuera de pico, los precios son un 50% menores.
What Is DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash es el modelo base de septiembre de 2026 de DeepSeek enfocado en eficiencia para razonamiento, programación, agentes y comprensión multimodal. El anuncio oficial lo describe como un modelo MoE de 552B parámetros que mejora la capacidad mientras reduce el cómputo y la memoria requeridos para el procesamiento de entrada.
El cambio clave es arquitectónico. El V4 Flash anterior usaba el mismo presupuesto de parámetros activos durante toda la inferencia. V4.1 Flash separa las cargas de entrada y salida: 8B parámetros están activos al codificar el prompt y 16B están activos al generar la respuesta. DeepSeek llama a este diseño Causal-Encoder-Decoder.
| Date | Status | Model ID |
|---|---|---|
| Sep 8 | Limited beta | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Production release | deepseek-flash |
DeepSeek V4.1 Flash Specification:
| Specification | DeepSeek V4.1 Flash |
|---|---|
| Release status | Official API release and open-weight model |
| Architecture | Mixture-of-Experts with Causal-Encoder-Decoder structure |
| Total parameters | 552B |
| Activated parameters | 8B for input; 16B for output |
| Context window | 1M tokens |
| Maximum output | 384K tokens |
| Input modalities | Text and images |
| Output modality | Text |
| Production API model name | deepseek-flash |
| Thinking modes | Thinking and non-thinking |
| API features | JSON output, tool calls, Responses API, Anthropic API, prefix completion, FIM completion |
| Open weights | Released on Hugging Face |
How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder
Los modelos de lenguaje tradicionales solo-decodificador usan esencialmente la misma pila grande para el procesamiento del prompt y la generación de tokens. DeepSeek V4.1 Flash asigna distinta capacidad activa a esas etapas.
Durante la etapa de entrada, el modelo procesa el prompt con una huella activa de 8B. Esta etapa puede examinar eficientemente el contexto de texto o imagen suministrado porque la respuesta completa aún no se ha generado. Durante la etapa de salida, el modelo activa 16B parámetros y continúa la generación causal token por token. Por lo tanto, el diseño ahorra cómputo en la codificación del prompt mientras mantiene más capacidad activa para el razonamiento y la generación de respuestas.
DeepSeek no ha publicado todos los detalles de implementación en el anuncio, por lo que la descripción más segura es funcional: la arquitectura es asimétrica, las etapas de entrada y salida usan diferentes presupuestos de parámetros activos y el sistema resultante reduce la memoria y el coste de inferencia.
KV Cache Reduction
El resultado en memoria es medible. DeepSeek informa de 890 bytes de caché KV global por token para V4.1 Flash, frente a 3,514 bytes para V4 Flash, 48,068 bytes para V3.2 y 389,120 bytes para V1. La cifra de V4.1 es aproximadamente 3.9 veces menor que la de V4 Flash.
Para agentes de contexto largo, esto importa más allá de un único benchmark. Un caché KV más pequeño reduce la presión sobre la memoria de alto ancho de banda mientras una solicitud está activa y disminuye la cantidad de estado que debe trasladarse a almacenamiento más lento. DeepSeek afirma que V4.1 Flash necesita aproximadamente una cuarta parte de la HBM y un octavo de la capacidad de SSD requerida por el modelo anterior para cargas de trabajo de caché comparables.
DeepSeek V4.1 Flash Features
Native Multimodal Input
V4.1 Flash acepta imágenes como parte de la API del modelo principal. Esto reemplaza la división anterior entre V4 Flash solo texto y el endpoint experimental V4 Flash Vision. Los desarrolladores ahora pueden construir flujos de trabajo de comprensión de documentos, análisis de gráficos, interpretación de capturas de pantalla y agentes visuales sobre la misma familia de modelos de producción.
Long-Context Reasoning
La especificación oficial de la API mantiene una ventana de contexto de 1M tokens y permite hasta 384K tokens de salida. Esto hace que el modelo sea adecuado para programación a escala de repositorios, análisis multidocumento, sesiones de agentes de larga duración y flujos de trabajo que necesitan preservar un historial amplio de herramientas.
Production API Features
El modelo admite modos con y sin pensamiento, salida JSON estructurada, llamadas a herramientas, la Responses API, una interfaz compatible con Anthropic, completado por prefijo de chat y completado FIM en modo sin pensamiento. Estas capacidades hacen que V4.1 Flash sea un reemplazo de producción directo para muchas cargas de trabajo de agentes y programación de V4 Flash.
Open Weights
DeepSeek ha publicado los pesos de V4.1 Flash y un informe técnico. La publicación mejora la reproducibilidad, pero el modelo sigue siendo extremadamente grande: el anuncio de DeepSeek pide a las organizaciones interesadas en despliegues de gran escala que planifiquen aproximadamente 2,000 GPUs más un clúster de almacenamiento.
DeepSeek V4.1 Flash Benchmark Performance
Los resultados oficiales cambian la evaluación anterior de que V4.1 no tenía evidencia de benchmark. DeepSeek ahora proporciona una tabla amplia que cubre conocimiento, matemáticas, programación, agentes de terminal, ciberseguridad, automatización y tareas de agentes multimodales.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
En esta vista seleccionada de ocho benchmarks, V4.1 Flash supera a V4 Pro 0813 en siete pruebas y supera a V4 Flash 0731 en las ocho. Las mayores ganancias aparecen en ingeniería de software y agentes: DeepSWE sube 11.5 puntos frente a V4 Pro y 19.8 frente a V4 Flash, mientras que Automation-Bench mejora 11.6 y 17.1 puntos respectivamente.
Los resultados aún requieren una interpretación cuidadosa. V4.1 Flash puntúa por debajo de V4 Pro en GPQA Diamond, y la gráfica oficial completa muestra que Claude Opus 5 y GPT-5.6 Sol siguen por delante en Terminal-Bench 3.0. Una conclusión útil es que V4.1 Flash mejora sustancialmente el equilibrio entre eficiencia y capacidad de DeepSeek; la tabla de benchmarks no prueba el liderazgo universal en cada tarea.
DeepSeek V4.1 Flash API Pricing
DeepSeek utiliza facturación en horas pico y fuera de pico. Las horas pico son 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes; todos los demás periodos, incluidos fines de semana, usan la tarifa fuera de pico. La documentación de precios actual indica que los precios fuera de pico son la mitad de los precios en pico.
| Price per 1M tokens | V4.1 Flash off-peak | V4.1 Flash peak | V4 Pro 0813 off-peak | V4 Pro 0813 peak |
|---|---|---|---|---|
| Cache-hit input | $0.003 | $0.006 | $0.022 | $0.044 |
| Cache-miss input | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

El ahorro es sustancial. Para una carga de trabajo que use 100 millones de tokens de entrada con fallo de caché y 10 millones de tokens de salida, V4.1 Flash cuesta aproximadamente $21 fuera de pico o $42 en horas pico. La misma combinación de tokens a las tarifas publicadas de V4 Pro 0813 cuesta aproximadamente $85.80 fuera de pico o $171.60 en horas pico. V4.1 Flash es alrededor de un 75.5% menos costoso en este ejemplo.
El almacenamiento en caché del prompt fortalece la ventaja para agentes que reutilizan repetidamente instrucciones del sistema, contexto de repositorios o documentos. La tarifa de acierto de caché de V4.1 es 50 veces menor que su tarifa de fallo de caché en ambos periodos de facturación.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Total parameters | 552B | 284B | 1.6T |
| Activated parameters | 8B input / 16B output | 13B | 49B |
| Architecture focus | Asymmetric input/output efficiency | Lightweight V4 MoE | Maximum V4 capacity |
| Native vision | Yes | Separate Vision Exp variant | No |
| Context window | 1M | 1M | 1M |
| Maximum output | 384K | 384K | 384K |
| API status on DeepSeek | Current production model | Retired; legacy name routes to V4.1 Flash | Scheduled to route to V4.1 Flash from September 14, 2026 |
| Best fit | General agents, coding, vision, high throughput | Migration compatibility only | Existing Pro workloads during transition |
V4.1 Flash es mayor en parámetros totales que V4 Flash pero puede ser más barato de servir porque su etapa de entrada activa solo 8B parámetros y usa un caché KV mucho más pequeño. En comparación con V4 Pro, activa muchos menos parámetros mientras supera a Pro en la mayoría de los benchmarks de agentes y programación seleccionados arriba.
API Access and Migration
El nombre del modelo de producción es deepseek-flash. Las aplicaciones existentes pueden mantener la URL base compatible con OpenAI https://api.deepseek.com o la URL base compatible con Anthropic https://api.deepseek.com/anthropic.
- Actualiza el nombre del modelo a
deepseek-flash. - Mantén la URL base de DeepSeek y el método de autenticación existentes.
- Vuelve a probar el modo con pensamiento, las llamadas a herramientas, las entradas de visión, la latencia y el uso de tokens con prompts de producción.
- Supervisa los alias heredados:
deepseek-v4-flashydeepseek-v4-flash-vision-expahora enrutan a V4.1 Flash, mientras quedeepseek-v4-proestá programado para enrutar a V4.1 Flash desde el 14 de septiembre de 2026 hasta un futuro lanzamiento de V4.1 Pro.
Para usuarios de CometAPI, la API DeepSeek V4.1 en CometAPI ya está disponible junto con la API DeepSeek V4 Flash existente. Antes de cambiar el tráfico de producción, confirma el nombre final del modelo, los precios y el mapeo de alias en el panel de CometAPI, ya que los proveedores de terceros pueden diferir en la nomenclatura y tarifas oficiales de DeepSeek.
Who Should Use DeepSeek V4.1 Flash?
V4.1 Flash es una opción sólida para agentes de programación, análisis de repositorios, automatización de terminales, flujos de trabajo multimodales de documentos, asistentes de contexto largo y sistemas de alto volumen que usan herramientas. Sus mejoras de benchmark se concentran en las mismas cargas de trabajo que más se benefician de un caché de memoria más bajo y precios de tokens más bajos.
Los equipos que ya usan V4 Flash deben tratarlo como un candidato de migración directa. Los equipos que usan V4 Pro deben probar cuidadosamente, pero los propios datos de benchmarks y precios de DeepSeek ahora hacen de V4.1 Flash el predeterminado más económico para muchas cargas de trabajo de clase Pro.
El autoalojamiento es una decisión diferente. Los pesos abiertos no convierten a un modelo de 552B en liviano. Las organizaciones deben comparar el coste de un despliegue con grandes GPUs y almacenamiento con el uso de la API hospedada antes de comprometerse con inferencia local.
Limitations and Open Questions
- Los resultados de benchmarks provienen del entorno de evaluación oficial de DeepSeek; se necesitarán replicaciones independientes para medir el rendimiento en diferentes marcos y entornos de herramientas.
- El soporte multimodal nativo está confirmado, pero los equipos de aplicaciones deben validar formatos de imagen soportados, contabilización de tokens y comportamiento de visión contra la API en vivo.
- Los alias de modelos heredados ahora cambian el modelo detrás de un nombre existente, lo que puede alterar salidas sin un cambio en el código de la aplicación.
- V4.1 Flash reduce los requisitos de infraestructura respecto a modelos anteriores de DeepSeek, pero su despliegue con pesos abiertos aún requiere cómputo y almacenamiento sustanciales.
- El endpoint dedicado de V4.1 en CometAPI y los precios finales deben confirmarse en la consola en vivo antes del uso en producción.
Final Verdict
DeepSeek V4.1 Flash es una actualización importante de arquitectura y producto. El modelo MoE de 552B combina una etapa de entrada con 8B activos, una etapa de salida con 16B activos, visión nativa, una ventana de contexto de 1M tokens y un caché KV fuertemente comprimido. Esas elecciones de diseño se traducen en benchmarks oficiales más sólidos en programación y agentes a precios de API mucho más bajos que V4 Pro 0813.
El cambio más práctico es la consolidación. V4.1 Flash reúne texto, visión, razonamiento, uso de herramientas y operación de contexto largo en un único nombre de modelo de producción. Para la mayoría de las nuevas integraciones con DeepSeek, deepseek-flash es ahora el punto de partida lógico; V4 Pro se convierte en una comparación de migración más que en la elección automática para trabajos difíciles.
FAQ
Is DeepSeek V4.1 Flash officially released?
Sí. Está disponible a través de la API de DeepSeek bajo el nombre de modelo deepseek-flash, y DeepSeek ha publicado pesos abiertos y un informe técnico.
Is the temporary V4.1 beta model ID still required?
No. deepseek-v4.1-flash-expires-on-0910 fue un identificador beta de corta duración. Las aplicaciones de producción deben usar deepseek-flash.
How many parameters does DeepSeek V4.1 Flash have?
El modelo tiene 552B parámetros totales. Activa 8B parámetros durante el procesamiento de entrada y 16B durante la generación de salida.
Does DeepSeek V4.1 Flash support images?
Sí. La entrada de visión es nativa del modelo de producción, por lo que ya no se requiere un endpoint V4 Flash Vision Exp separado.
Is V4.1 Flash better than V4 Pro?
Lidera a V4 Pro 0813 en la mayoría de las comparaciones publicadas por DeepSeek de programación, agentes, automatización y ciberseguridad, pero V4 Pro se mantiene por delante en GPQA Diamond. Los equipos deben evaluar ambos con sus propios prompts antes de migrar.
How much does the API cost?
En horas pico, las tarifas por millón de tokens son $0.006 para entrada con acierto de caché, $0.30 para entrada con fallo de caché y $1.20 para salida. Fuera de pico, las tarifas son la mitad.
What happens to the old V4 model names?
Los nombres heredados deepseek-v4-flash y deepseek-v4-flash-vision-exp enrutan a V4.1 Flash. DeepSeek indica que deepseek-v4-pro también enrutará a V4.1 Flash desde el 14 de septiembre de 2026 hasta que se lance V4.1 Pro.
Can I use DeepSeek V4.1 Flash through CometAPI?
Sí. CometAPI ya ofrece un endpoint de API DeepSeek V4.1. Antes de enviar tráfico de producción, confirma el nombre exacto del modelo, los precios y las funciones soportadas en la consola de CometAPI, ya que los proveedores externos pueden usar convenciones de nombres o tarifas de facturación diferentes a las de la API oficial de DeepSeek.
