Especificaciones técnicas de DeepSeek-V4-Flash-Vision-Exp
| Especificación | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| ID del modelo | deepseek-v4-flash-vision-exp |
| Proveedor | DeepSeek |
| Tipo de modelo | Modelo experimental multimodal de visión y lenguaje |
| Fecha de lanzamiento | 21 de agosto de 2026 |
| Modalidades de entrada | Texto, Imagen |
| Modalidad de salida | Texto |
| Ventana de contexto | 1M tokens |
| Salida máxima | Hasta 384K tokens |
| Máximo de tokens de imagen | 384 tokens por imagen |
| Formatos de imagen admitidos | JPEG, PNG, GIF, WebP |
| Métodos de entrada de imagen | Base64, URL pública, Files API |
| Interfaces de API | Chat Completions, Messages, Responses |
| Razonamiento | Admitido |
| Estado del modelo | Experimental |
| Precio de entrada | Mismo precio que DeepSeek-V4-Flash |
| Precio de salida | Mismo precio que DeepSeek-V4-Flash |
DeepSeek-V4-Flash-Vision-Exp se presentó el 21 de agosto de 2026 como un modelo multimodal experimental en la plataforma de API de DeepSeek. Amplía la familia V4-Flash con comprensión de imágenes nativa, manteniendo las capacidades orientadas al texto de Agent, razonamiento y conocimiento del mundo de V4-Flash.
Una de sus características de API más destacadas es la eficiencia de tokens de imagen: cada imagen se convierte en tokens y se limita a 384 tokens por imagen para la facturación. El modelo admite tres métodos de ingestión de imágenes—Base64 en línea, URLs externas y la Files API—lo que lo hace adecuado tanto para solicitudes de visión simples como para flujos de trabajo de Agente de múltiples pasos.
¿Qué es DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp es la versión multimodal experimental de V4-Flash de DeepSeek, diseñada para combinar la comprensión visual con el razonamiento y los flujos de trabajo de Agente.
La distinción con un modelo convencional de comprensión de imágenes es importante. El modelo no se posiciona simplemente como un sistema de OCR o subtitulado de imágenes. Su valor principal es la capacidad de incorporar información visual a flujos de trabajo donde un agente de IA debe entender una imagen, razonar sobre la información que contiene y luego continuar con una tarea basada en texto o herramientas.
Por ejemplo, un Agente puede recibir una captura de pantalla de una interfaz web, identificar los elementos de UI relevantes, razonar sobre lo que necesita cambiar y continuar un flujo de trabajo de programación o automatización. Del mismo modo, gráficos, paneles, capturas de pantalla y documentos basados en imágenes pueden convertirse en entradas para una canalización de razonamiento más amplia.
DeepSeek describe el modelo experimental como manteniendo las capacidades de texto del modelo V4-Flash, al tiempo que mejora sustancialmente el rendimiento en benchmarks de Agente que requieren comprensión visual. DeepSeek también informa que su capacidad multimodal de Agente se aproxima al nivel de Claude Opus 4.8. Estas afirmaciones de benchmark son reportadas por el proveedor y no deben interpretarse como evaluaciones independientes de terceros.
¿Cuáles son las principales características de DeepSeek-V4-Flash-Vision-Exp?
- Entrada multimodal nativa: El modelo acepta texto e imágenes en la misma solicitud, lo que permite a los desarrolladores combinar evidencia visual con instrucciones en lenguaje natural en lugar de construir una canalización de preprocesamiento separada de imagen a texto.
- Visión para flujos de trabajo de Agente: Su diferenciación más importante es la integración de la comprensión visual con el razonamiento orientado a Agentes. Esto hace que capturas de pantalla, gráficos, interfaces y otros estados visuales sean utilizables como parte de flujos de trabajo de IA de múltiples pasos.
- Techo de imagen de 384 tokens: Las imágenes se convierten en tokens para inferencia y facturación, y cada imagen consume no más de 384 tokens. Esto crea una estructura de costos relativamente predecible para aplicaciones con muchas imágenes.
- Contexto de 1M tokens: El modelo mantiene la capacidad de contexto extremadamente grande asociada con la familia V4-Flash, lo que lo hace adecuado para flujos de trabajo que combinan contextos textuales extensos con entradas visuales. Los listados actuales del modelo reportan una ventana de contexto de 1M tokens y hasta 384K tokens de salida.
- Múltiples interfaces de API: Los desarrolladores pueden acceder al modelo a través de Chat Completions, Mensajes compatibles con Anthropic o APIs de Responses. Esto facilita la integración del modelo en infraestructura existente de LLM y Agentes.
- Files API para imágenes reutilizables: Los desarrolladores pueden subir una imagen una vez y posteriormente referenciarla usando un
file_id, lo cual es particularmente útil cuando la misma imagen necesita examinarse a lo largo de múltiples turnos de un Agente. DeepSeek introdujo la Files API junto con el modelo de visión.
¿Cómo se desempeña DeepSeek-V4-Flash-Vision-Exp en benchmarks?
Los resultados públicos más sólidos se concentran en evaluaciones de Agente y multimodales. DeepSeek reporta que V4-Flash-Vision-Exp mantiene las capacidades de texto de V4-Flash mientras logra una mejora sustancial en tareas que requieren comprensión visual.
Los resultados reportados incluyen:
| Benchmark | Puntuación reportada |
|---|---|
| Terminal-Bench 2.1 | 83.9 |
| DeepSWE | 59.3 |
| Chartography, p0.95 | 64.3 |
| Chartography, p1.0 | 63.3 |
| NL2Repo | 57.7 |
| DSBench-Hard | 63.6 |
| AutomationBench (Public) | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| ZeroBench, Pass@5 | 35.0 |
La puntuación de Chartography de 64.3 en p0.95 es particularmente relevante porque representa una evaluación visual/de Agente en lugar de un benchmark convencional solo de texto. DeepSeek usa estos resultados para respaldar su afirmación de que la capacidad multimodal de Agente del modelo se acerca a Opus 4.8.
No obstante, estos números deben tratarse como resultados de lanzamiento reportados, más que puntuaciones de benchmark reproducidas independientemente. Para la selección de modelos en producción, los desarrolladores deberían probar el modelo con sus propias capturas de pantalla, gráficos, documentos, estados de UI y arneses de Agente.
¿Cómo se compara DeepSeek-V4-Flash-Vision-Exp con otros modelos?
| Modelo | Fortaleza principal | Visión | Agente/Razonamiento | Contexto | Mejor encaje |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | Flujos de trabajo multimodales de Agente de bajo costo | ✓ | Fuerte | 1M | Agentes visuales, capturas de pantalla, gráficos, automatización |
| DeepSeek-V4-Flash | Razonamiento general y tareas de Agente | Sin visión nativa en el modelo original | Fuerte | 1M | Agentes basados en texto y programación |
| Claude Opus 4.8 | Razonamiento de frontera y rendimiento multimodal de Agente | ✓ | Muy fuerte | Contexto amplio | Agentes empresariales complejos |
| Gemini family | Comprensión multimodal y aplicaciones de contexto largo | ✓ | Fuerte | Contexto amplio | Documentos, medios, aplicaciones multimodales |
La comparación más significativa no es simplemente si un modelo puede reconocer imágenes. DeepSeek-V4-Flash-Vision-Exp apunta a una capa de Agente multimodal de bajo costo: combina comprensión de imágenes con las capacidades de razonamiento y Agente ya asociadas a V4-Flash.
En comparación con DeepSeek-V4-Flash, la mejora principal es la percepción visual. Las capacidades subyacentes orientadas al texto están diseñadas para permanecer en línea con V4-Flash, mientras que las evaluaciones de Agente visual muestran una mejora sustancial.
En comparación con modelos multimodales de frontera como Claude Opus 4.8, el posicionamiento de lanzamiento de DeepSeek enfatiza una afirmación mucho más estrecha: su rendimiento en benchmarks multimodales de Agente se aproxima a Opus 4.8. Eso no debe interpretarse como que los dos modelos sean equivalentes en inteligencia general, programación, visión, razonamiento, uso de herramientas y confiabilidad.
¿Cuáles son los mejores casos de uso para DeepSeek-V4-Flash-Vision-Exp?
De captura de pantalla a código y análisis de UI
Los desarrolladores pueden proporcionar capturas de pantalla de sitios web, aplicaciones, paneles o interfaces de diseño y pedir al modelo que identifique elementos de UI, diagnostique problemas de diseño o genere instrucciones de implementación. Esto hace que el modelo sea particularmente interesante para Agentes de programación de IA que necesitan razonar a partir de evidencia visual.
Agentes de navegador visuales
Un Agente de navegador puede usar capturas de pantalla como observaciones en lugar de basarse exclusivamente en información del DOM o del árbol de accesibilidad. El modelo puede interpretar el estado visual de una página web y combinar esa información con su razonamiento y bucle de llamadas a herramientas.
Análisis de gráficos y paneles
El modelo puede analizar gráficos, paneles y otras representaciones visuales de datos. Esta es una de las áreas donde el resultado de Chartography es particularmente relevante.
Comprensión de documentos basada en imágenes
Se pueden proporcionar directamente imágenes que contengan texto, tablas, diagramas o información estructurada al modelo. Los desarrolladores pueden usar esta capacidad para análisis de documentos, extracción de información y preguntas y respuestas visuales.
Agentes de programación multimodales
Un Agente de programación puede combinar código fuente con capturas de pantalla de errores, estados de IDE, páginas web renderizadas o referencias de diseño. En lugar de convertir cada captura de pantalla en una descripción textual generada manualmente, el modelo puede razonar directamente a partir de la entrada visual.
Automatización visual
El modelo puede servir como el componente de percepción de sistemas de automatización que necesitan entender lo que está visible actualmente antes de seleccionar la siguiente acción. Esto es particularmente relevante para la automatización de GUI y flujos de trabajo de uso de computadoras.
¿Cuáles son las limitaciones de DeepSeek-V4-Flash-Vision-Exp?
La primera limitación es el estado experimental. El sufijo -exp es significativo: todavía no es un modelo que deba considerarse automáticamente como un reemplazo maduro para todos los modelos multimodales de producción. El propio DeepSeek lo identifica como un modelo experimental.
En segundo lugar, las afirmaciones públicas más sólidas sobre rendimiento multimodal de Agente se basan en benchmarks reportados por el proveedor. Las evaluaciones independientes siguen siendo limitadas, por lo que las puntuaciones de benchmark deben considerarse direccionales más que definitivas.
En tercer lugar, el límite de 384 tokens por imagen es simultáneamente una ventaja de costo y una restricción técnica. Las imágenes se redimensionan antes de la inferencia, lo que significa que los desarrolladores que trabajan con detalles visuales extremadamente finos deben probar si la resolución resultante es suficiente para su aplicación. La documentación de la API de DeepSeek indica que las imágenes se redimensionan antes de la inferencia y que la representación de la imagen resultante se limita a 384 tokens.
La API también impone límites prácticos de imagen/solicitud. La información derivada de la documentación actual enumera un límite de 32 MiB para imágenes suministradas a través de Base64 o URLs externas, un límite de 64 MiB para referencias de imágenes mediante Files API y un máximo de 600 imágenes por solicitud.
Finalmente, los desarrolladores no deben suponer que un buen rendimiento en benchmarks se traduce automáticamente en una operación autónoma de GUI confiable. Los Agentes de visión son muy sensibles a la calidad de las capturas de pantalla, arneses de tareas, definiciones de herramientas, latencia, gestión de estado y recuperación de errores.
Versión del modelo DeepSeek-V4-Flash-Vision-Exp y disponibilidad de API
El identificador actual del modelo es:
deepseek-v4-flash-vision-exp
El modelo estuvo disponible a través de la API de DeepSeek el 21 de agosto de 2026. Los desarrolladores pueden especificar este ID de modelo al realizar solicitudes de API multimodales.
El modelo actualmente admite tres estilos principales de API:
Chat Completions
Messages
Responses
Las imágenes se pueden proporcionar a través de:
Base64
Public image URL
Files API / file_id
Esta combinación es particularmente útil para desarrolladores que construyen Agentes multimodales, porque el mismo modelo puede incorporarse en infraestructura existente compatible con OpenAI, compatible con Anthropic o basada en Responses.
¿Por qué usar DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp es más convincente cuando la visión y el razonamiento de Agente deben trabajar juntos sin aumentar drásticamente los costos de API.
Sus ventajas más grandes no son simplemente la capacidad de describir una imagen. El modelo combina entrada visual con una ventana de contexto de 1M tokens, razonamiento orientado a Agentes, múltiples interfaces de API y facturación de imágenes limitada a 384 tokens por imagen.
Para desarrolladores que construyen análisis de capturas de pantalla, Agentes de programación visual, canalizaciones de procesamiento de gráficos, automatización de navegador o flujos de trabajo multimodales de negocio, esto convierte a deepseek-v4-flash-vision-exp en un modelo experimental especialmente interesante para realizar benchmarks.
Para despliegues en producción, sin embargo, inicialmente debe tratarse como un modelo para evaluar y realizar benchmarks en lugar de un predeterminado incuestionable. Su estado experimental y la cantidad limitada de datos de benchmark multimodal independientes significan que las pruebas específicas de la aplicación siguen siendo esenciales.
Cómo acceder a la API de DeepSeek-V4-Flash-Vision-Exp en CometAPI
CometAPI puede proporcionar una capa de acceso API unificada para desarrolladores que quieran experimentar con DeepSeek-V4-Flash-Vision-Exp sin construir una integración separada para cada proveedor de modelo.
El flujo de trabajo básico es:
- Crea una cuenta en CometAPI y obtén una clave de API.
- Selecciona
deepseek-v4-flash-vision-expcomo el modelo. - Envía texto junto con una imagen usando el formato de solicitud multimodal admitido.
- Procesa la respuesta de texto devuelta en tu aplicación.
- Realiza benchmarks del modelo frente a tu modelo de visión o Agente existente antes de mover tráfico de producción.
Conclusión
DeepSeek-V4-Flash-Vision-Exp es un modelo experimental de Agente multimodal que añade comprensión de imágenes nativa a la pila de capacidades de V4-Flash, manteniendo su diseño de gran contexto y orientación al razonamiento.
Su combinación más interesante es visión + razonamiento de Agente + contexto de 1M tokens + un límite de 384 tokens por imagen. DeepSeek reporta ganancias sustanciales en benchmarks de Agente visual y afirma que la capacidad de Agente multimodal del modelo se acerca a Opus 4.8, pero esos resultados siguen siendo reportados por el proveedor y deben validarse de manera independiente.
Para usuarios de CometAPI, vale la pena probar el modelo cuando la aplicación necesite ir más allá de Agentes solo de texto hacia comprensión de capturas de pantalla, programación visual, análisis de gráficos, automatización de navegador y flujos de trabajo multimodales.