GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness: Guía del avance de la programación agéntica (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness: Guía del avance de la programación agéntica (2026)

TLDR DeepSeek-V4-Flash-0731 (lanzado el 31 de julio de 2026) es la versión oficial y lista para producción del modelo eficiente Mixture-of-Experts de DeepSeek (284B totales / 13B activos, contexto de 1M tokens). Mediante post-entrenamiento dirigido ofrece mejoras drásticas en codificación con agentes, uso de herramientas y ciclos de ingeniería de software multietapa. Es compatible de forma nativa con Responses API y OpenAI Codex. DeepSeek Harness es el framework de agente complementario (modo mínimo ya usado en evaluaciones oficiales; lanzamiento completo próximamente) diseñado para convertir el modelo en un agente autónomo fiable.

Juntos ofrecen una de las mejores relaciones costo-rendimiento en IA agentiva con pesos abiertos y accesible por API a agosto de 2026.

Puntos clave

  • Gran salto agentivo solo vía post-entrenamiento: misma arquitectura 284B/13B que la preview de abril, pero puntajes mucho más altos (p. ej., Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
  • Supera a DeepSeek-V4-Pro (Preview) en múltiples benchmarks de agentes a pesar de activar muchos menos parámetros.
  • Competitivo con modelos propietarios tope de gama (cerca de Claude Opus 4.8 en varias tareas de agentes) a una fracción del costo.
  • Contexto nativo de 1M, decodificación especulativa (DSpark), tres niveles de esfuerzo de razonamiento (low/high/max), licencia MIT, pesos abiertos.
  • Soporte oficial para Responses API y Codex (CLI, escritorio, extensión de VS Code).
  • DeepSeek Harness (modo mínimo ya usado en evaluaciones) es el framework de agente oficial en beta cerrada; se espera lanzamiento público pronto. DeepSeek Harness proporciona la capa de runtime del agente; modelo + harness = agente en producción.
  • Ideal para agentes de codificación de alto volumen, automatización de terminal, uso de herramientas y flujos de trabajo de contexto largo.
  • Accede a los modelos DeepSeek de forma asequible y con tooling unificado a través de CometAPI (endpoint compatible con OpenAI, precios competitivos, enrutamiento multi-modelo).

¿Qué hay de nuevo en DeepSeek V4 Flash 0731?

Cambio en el estado de lanzamiento oficial

El cambio de producto más importante es que DeepSeek V4 Flash 0731 es ahora el lanzamiento oficial de DeepSeek V4 Flash en la API, en beta pública. El registro de cambios de DeepSeek del 31 de julio (https://api-docs.deepseek.com/updates/) indica que los desarrolladores pueden seguir llamando al mismo nombre de modelo, deepseek-v4-flash, para acceder a la versión más reciente. Eso es importante para la migración porque evita un nuevo slug de modelo y permite a los equipos probar la actualización detrás de la lógica de enrutamiento existente.

DeepSeek también señala que la actualización solo mejora la API de V4 Flash. La API de V4 Pro y los modelos de la app/web no cambiaron con el lanzamiento del 31 de julio, y DeepSeek dijo que el lanzamiento oficial de V4 Pro seguiría pronto. En otras palabras, no es una actualización completa de la familia DeepSeek V4. Es una actualización dirigida de Flash.

La arquitectura se mantuvo, el post-entrenamiento cambió

La arquitectura central permanece sin cambios: un modelo Mixture-of-Experts (MoE) con 284 mil millones de parámetros totales y solo 13 mil millones activados por token, un diseño de atención híbrida optimizado para contexto largo y una ventana de contexto nativa de 1 millón de tokens. Se adjunta un módulo de decodificación especulativa (DSpark) para una generación más rápida. El modelo es solo texto, admite niveles ajustables de esfuerzo de razonamiento (low / high / max), invocación de herramientas, salida estructurada y se publica bajo la permisiva licencia MIT.

Esa distinción importa. Muchas actualizaciones de modelos mejoran porque el modelo es más grande. Esta actualización es más interesante porque DeepSeek afirma un gran salto en capacidades de agente sin aumentar el tamaño de parámetros del modelo. V4 Flash sigue siendo un modelo MoE de 284B totales y 13B activos, que es mucho más pequeño en tiempo de inferencia que el diseño de V4 Pro con 1.6T totales y 49B activos.

Los puntajes de codificación con agentes se dispararon

La tabla oficial de DeepSeek (https://api-docs.deepseek.com/updates/) muestra mejoras importantes en tareas de terminal, construcción de repositorios, ciberseguridad, ingeniería de software, uso de herramientas, automatización y full-stack. El mayor salto absoluto sobre la preview anterior de Flash es en DeepSWE: 54.4 frente a 7.3, un aumento de 47.1 puntos. Cybergym mejora en 38.0 puntos, DSBench-Hard en 33.8 puntos y DSBench-FullStack en 31.7 puntos.

Por eso V4 Flash 0731 está siendo discutido menos como un "modelo rápido" normal y más como un candidato a modelo predeterminado para agentes de codificación. La propuesta de valor no es solo chat barato. Es inferencia agentiva barata, de contexto largo y amigable con herramientas.

Llegó el soporte para Responses API y Codex

El registro de cambios de DeepSeek del 31 de julio dice que el V4 Flash oficial ahora es compatible de forma nativa con el formato de Responses API y está específicamente adaptado para Codex. La guía de Responses API de DeepSeek indica que el formato se agregó para satisfacer la demanda de Codex, usa la URL base https://api.deepseek.com, y actualmente admite deepseek-v4-flash.

Esto importa porque los flujos de trabajo estilo Codex no son simples sesiones de chat. Necesitan elementos de entrada y salida estructurados, elementos de razonamiento, llamadas a herramientas, operaciones de cambio de archivos, eventos de streaming, contabilización de uso e integración con clientes de agentes de codificación. El soporte de DeepSeek no es un clon perfecto de todas las capacidades de la OpenAI Responses API, pero es suficiente para hacer que V4 Flash sea un candidato mucho más práctico como reemplazo en experimentos de agentes de codificación.

Benchmarks de rendimiento para la versión oficial V4-Flash

Advertencias sobre benchmarks que los desarrolladores no deben ignorar

Los resultados oficiales de evaluación (reportados por DeepSeek en la ficha del modelo: https://api-docs.deepseek.com/updates/) muestran grandes saltos sobre la preview y, notablemente, sobre la mucho más grande V4-Pro Preview en tareas centradas en agentes. Las evaluaciones para benchmarks de agentes de código usaron el modo mínimo de DeepSeek Harness (por publicar) con esfuerzo de razonamiento máximo, temperature = 1.0, top_p = 0.95.

Eso tiene dos implicaciones. Primero, el resultado es en parte un resultado de modelo y harness. Si tu runtime de agente tiene herramientas distintas, permisos de shell, gestión de contexto, reintentos, reglas de parches o manejo de fallos diferentes, puede que no obtengas los mismos puntajes. Segundo, la reproducción independiente es limitada hasta que DeepSeek publique suficiente del harness y la configuración de evaluación para que equipos externos ejecuten pruebas comparables.

Tabla oficial de benchmarks de DeepSeek

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

En estos nueve benchmarks, V4 Flash 0731 promedia 55.2. La antigua preview de V4 Flash promedia 29.6, y V4-Pro Preview promedia 34.9. Eso significa que V4 Flash 0731 está aproximadamente 25.6 puntos por encima de la preview de Flash y 20.3 puntos por encima de V4-Pro Preview en esta tabla.

Señales de terceros

ARC Prize reporta que V4 Flash 0731 (https://arcprize.org/results/deepseek-v4-flash-0731) con esfuerzo máximo obtiene 89.0% en ARC-AGI-1 Semi-Private y 61.4% en ARC-AGI-2 Semi-Private, con costos listados de $0.02 y $0.04 por tarea. No son benchmarks de agentes de codificación, pero respaldan la visión más amplia de que el modelo es competitivo en tareas de razonamiento cuando se ejecuta con mayor esfuerzo.

Las ganancias son especialmente llamativas en DeepSWE (bucle de agente de ingeniería de software) y Cybergym. Medidas independientes (p. ej., Artificial Analysis: https://artificialanalysis.ai/models/deepseek-v4-flash) reportan cifras ligeramente menores pero aún sólidas en Terminal-Bench alrededor de 79%, confirmando la dirección de la mejora y recordando que los números con harness del proveedor tienden a ser optimistas.

Contexto adicional de evaluaciones anteriores de V4 y agregadores de terceros muestra un rendimiento sólido en conocimiento y codificación en modo de razonamiento máximo (GPQA Diamond ~88–91%, LiveCodeBench entre altos 80s–90s según la fuente). El post-entrenamiento 0731 desbloqueó específicamente la confiabilidad agentiva que faltaba en la preview.

DeepSeek-V4-Flash ahora es compatible con Responses API y Codex

Una incorporación estratégicamente importante es la compatibilidad nativa con la Responses API de OpenAI. La documentación oficial de DeepSeek confirma que la Responses API actualmente admite deepseek-v4-flash (se espera soporte para Pro a principios de agosto de 2026). La URL base sigue siendo https://api.deepseek.com.

Esto supone una gran mejora en la experiencia de desarrollo. Antes de la Responses API y el soporte de Codex, DeepSeek V4 Flash ya podía llamarse como modelo de texto, pero un agente de codificación tenía que cubrir más detalles de integración por su cuenta. Ahora el modelo puede usarse en flujos que esperan semánticas estilo Responses.

Qué incluye la compatibilidad con Responses API

La Responses API de DeepSeek crea una respuesta del modelo en formato de la OpenAI Responses API en /responses. La Responses API admite model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, herramientas, elección de herramienta, esfuerzo de razonamiento, formato de texto e informes de uso. La API es sin estado, por lo que los clientes deben enviar el historial de conversación completo para interacciones multi-turno.

Los detalles de compatibilidad más importantes son prácticos:

  • deepseek-v4-flash es actualmente el único modelo compatible con Responses API.
  • Los mensajes developer se tratan como mensajes system.
  • Se admiten herramientas de función, streaming y esfuerzo de razonamiento ajustable y búsqueda web del lado del servidor.
  • El tipo de herramienta personalizada solo se admite para apply_patch, lo que importa para la compatibilidad con Codex.
  • No se admiten entradas de imágenes ni de archivos; las partes de entrada de imagen se reemplazan con texto de marcador de posición.
  • No se admiten previous_response_id, conversation, store, el modo en segundo plano, metadatos y algunas funciones de gestión de contexto.
  • Los parámetros no admitidos pueden ser ignorados silenciosamente, por lo que los clientes en producción deben probar el comportamiento esperado explícitamente.

Para los desarrolladores, el punto clave es que el soporte de Responses API no es solo un detalle sintáctico. Permite que DeepSeek V4 Flash se sitúe en un carril de protocolo usado por agentes de codificación modernos, especialmente donde las llamadas a funciones, eventos de streaming, elementos de razonamiento y aplicación de parches deben representarse de manera consistente.

Diseño sin estado (el cliente gestiona el historial de conversación). Ejemplo (Python):

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Eres un asistente de programación útil.",
    input="Refactoriza esta función de Python para mejorar la legibilidad...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Detalles completos y guía de integración con Codex: DeepSeek API Docs – Responses API (https://api-docs.deepseek.com/guides/responses_api) e Integrate with Codex (https://api-docs.deepseek.com/quick_start/agent_integrations/codex/).

Qué significa el soporte de Codex

La guía de integración de Codex de DeepSeek indica que Codex se comunica con los modelos a través de la Responses API, que DeepSeek ahora admite de forma nativa. Esto habilita la integración directa con Codex (el ecosistema de agentes de codificación de OpenAI — CLI, app de escritorio de ChatGPT y extensión IDE de Codex para VS Code).

Los desarrolladores pueden configurar un proveedor personalizado una vez mediante un script de configuración o editando ~/.codex/config.toml y un archivo de catálogo de modelos. Tras la configuración, los clientes de Codex reconocen DeepSeek-V4-Flash y pueden usar sus capacidades de llamada de herramientas, apply_patch, búsqueda web y razonamiento.

DeepSeek V4 Flash vs. DeepSeek V4 Pro

AspectoV4-Flash-0731V4-Pro (típico / Preview)
Parámetros totales / activos284B / 13B~1.6T / 49B
Ventana de contexto1M tokens1M tokens
FortalezasCodificación con agentes, terminal, costo, velocidadRazonamiento más profundo, conocimiento, tareas más difíciles
Ventaja en benchmarks de agentesGana en la suite de agentes publicada en 0731Más fuerte en conocimiento puro y multiarcivo complejo en evaluaciones anteriores
Precios típicos de API~$0.14 entrada / $0.28 salida (mucho menor con caché)Significativamente más alto (históricamente 3–12×)
Ideal paraAgentes de alto volumen, bucles de codificación en producción, apps sensibles al costoInvestigación de frontera, máxima capacidad en tareas puntuales
Pesos abiertosSí (MIT)Sí (MIT)

¿Cuál deberían usar primero los desarrolladores?

En los benchmarks específicos de agentes publicados con 0731, el modelo Flash más pequeño supera a la preview de Pro en todos los frentes listados. Para recuperación de conocimiento puro o los problemas de razonamiento absolutamente más difíciles, Pro aún mantiene ventaja en muchas evaluaciones independientes y anteriores. En la práctica, muchos equipos ahora usan Flash por defecto para la mayoría de cargas agentivas y enrutan solo las tareas más exigentes a Pro (u otros modelos de frontera).

Esa estrategia de enrutamiento es donde CometAPI (https://www.cometapi.com/) puede ayudar. En lugar de codificar un único modelo para todas las cargas, usa CometAPI para centralizar la selección de modelos, el registro, el seguimiento de costos y las políticas de fallback. Por ejemplo:

  • Usa V4 Flash para resumen de repositorios, planificación de refactorización, borradores de revisión de código, tests generados, extracción estructurada, QA de contexto largo y bucles de agente repetidos.
  • Escala a V4 Pro u otro modelo premium cuando la tarea tenga alto riesgo de negocio, requisitos ambiguos, código de producción frágil o intentos fallidos repetidos.
  • Haz seguimiento a la métrica final que importa: arreglos aceptados por dólar, tareas exitosas por hora o minutos de revisión humana ahorrados.

¿Qué es DeepSeek Harness?

DeepSeek Harness es el framework de agente / capa de runtime oficial que DeepSeek está construyendo para convertir sus modelos en agentes autónomos fiables. La compañía lo resume simple: Modelo + Harness = Agente.

Las evaluaciones oficiales de V4-Flash-0731 ya usaron el “modo mínimo” de DeepSeek Harness. El producto completo sigue desplegándose (reclutamiento y pruebas tempranas activos a finales de julio–principios de agosto de 2026). El equipo está liderado por Cui Tianyi (trayectoria en sistemas de trading cuantitativo), y las descripciones de puesto enfatizan la integración profunda con funciones de DeepSeek-V4 como caché de prefijo, gestión de contexto largo, optimización de KV-cache, encadenamiento de uso de herramientas, recuperación de errores y reintento automático.

Harness no es un wrapper genérico al estilo LangChain. Se está co-diseñando con el modelo para que la gestión de contexto, la orquestación de herramientas, la recopilación de evidencias y los bucles de reparación aprovechen eficiencias específicas de V4 (atención dispersa, caché, modos de razonamiento). Existen proyectos comunitarios y harnesses de terceros, pero el Harness oficial apunta al acoplamiento modelo–runtime más estrecho posible.

Cuando se lance por completo, se espera que proporcione:

  • Bucles de agente estructurados para codificación y automatización.
  • Puertas de seguridad y flujos de aprobación.
  • Manejo eficiente de contexto para tareas de horizonte largo.
  • Observabilidad y generación de artefactos.

Hasta el lanzamiento completo, los desarrolladores ya pueden lograr resultados sólidos emparejando V4-Flash-0731 con frameworks de agentes existentes o usando la vía Responses API + Codex.

Precios, disponibilidad y despliegue práctico

  • Precios oficiales de API (aprox.): $0.14 / 1M tokens de entrada (fallo de caché), ~$0.0028–0.03 en acierto de caché, $0.28 / 1M tokens de salida. Límites de concurrencia altos.
  • Pesos abiertos bajo MIT en Hugging Face; versiones cuantizadas GGUF ampliamente disponibles para uso local/autohospedado (requiere VRAM sustancial; precisión completa es grande).
  • La decodificación especulativa (DSpark) y la atención híbrida mantienen la inferencia de contexto largo relativamente eficiente.
  • Motores de inferencia compatibles: vLLM, SGLang y otros con recetas documentadas.

Para muchos equipos, el camino más fácil a producción es una pasarela compatible con OpenAI. CometAPI (https://www.cometapi.com/) ofrece acceso unificado a modelos DeepSeek (incluida la serie V4) junto con cientos de otros modelos a través de un único endpoint (https://api.cometapi.com/v1). Los beneficios incluyen enrutamiento multi-modelo simplificado, precios competitivos o con descuento respecto a proveedores directos, analítica de uso y la capacidad de alternar entre Flash, Pro y otros modelos sin cambiar el código de la aplicación. Esto es especialmente útil para sistemas agentivos que pueden recurrir a fallback o enrutar por dificultad/costo.

A la fecha de este artículo, CometAPI listaba DeepSeek V4 Flash con un precio inicial de entrada de $0.12 por 1M tokens, un precio de salida de $0.24 por 1M tokens en su tabla comparativa, 100.0% de uptime en 24 horas y 2941 ms de respuesta observada. DeepSeek también advierte que los precios generales de la API pueden subir en un futuro próximo. Dado que los precios de los proveedores pueden cambiar, el lenguaje de publicación seguro es: consulta el catálogo en vivo de CometAPI y los precios oficiales de DeepSeek antes de comprometer presupuestos de producción.

Recomendaciones prácticas para desarrolladores y equipos

  1. Empieza con Flash-0731 para codificación con agentes: la relación costo/rendimiento es actualmente sobresaliente para flujos de terminal, repositorio y multi-herramienta. Usa esfuerzo de razonamiento máximo + bucles estilo Harness para las tareas más difíciles.
  2. Para inferencia local, descarga desde Hugging Face y sigue las recetas oficiales de vLLM/SGLang que habilitan DSpark.
  3. Integra vía Responses API si ya usas Codex o quieres semántica moderna de llamadas a herramientas.
  4. Autoalberga o usa pesos cuantizados para máximo control de costos y privacidad de datos.
  5. Enruta inteligentemente: Flash para volumen, Pro (u otros modelos grandes) para la cola larga de problemas ultra-difíciles.
  6. Considera CometAPI para acceso multi-modelo simplificado, especialmente si tu stack ya mezcla DeepSeek con otros proveedores.

Conclusión

DeepSeek-V4-Flash-0731 representa un momento crucial en la IA agentiva eficiente. Al ofrecer rendimiento competitivo de frontera desde un MoE relativamente compacto (13B activos) mediante post-entrenamiento enfocado, y emparejarlo con un Harness diseñado para el propósito y compatibilidad con APIs modernas (Responses + Codex), DeepSeek ha redefinido las expectativas para agentes de codificación y automatización rentables.

Ya sea que autohospedes los pesos abiertos, llames a la API oficial o enrutes a través de una pasarela unificada como CometAPI, V4-Flash-0731 + el ecosistema de Harness en evolución ofrece una base de alto rendimiento y costo efectivo para la próxima generación de agentes de IA.

Preguntas frecuentes

¿Qué es DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 es el lanzamiento oficial en beta pública de DeepSeek V4 Flash en la API de DeepSeek, anunciado en el registro de cambios del 31 de julio de 2026. Sustituye a la versión preview manteniendo el mismo nombre de modelo en la API, deepseek-v4-flash.

¿Qué hay de nuevo en DeepSeek V4 Flash 0731?

Los principales cambios son un rendimiento mucho más fuerte en benchmarks agentivos, soporte nativo para Responses API, adaptación a Codex y una build oficial de V4 Flash re-post-entrenada. DeepSeek afirma que la arquitectura y el tamaño del modelo permanecieron iguales a la versión preview.

¿DeepSeek V4 Flash 0731 es compatible con Codex?

Sí. La guía de Codex de DeepSeek indica que solo deepseek-v4-flash admite actualmente la integración con Codex. Funciona a través de la Responses API y puede configurarse para el CLI de Codex, la app de escritorio de ChatGPT y la extensión IDE de Codex para VS Code.

¿Qué es DeepSeek Harness?

DeepSeek Harness es el framework de agente de DeepSeek para convertir modelos de lenguaje en agentes autónomos de codificación o de flujo de trabajo. Informes públicos describen un harness como la capa que gestiona herramientas, contexto, archivos, ejecución de comandos y flujos de trabajo multietapa. DeepSeek usó el modo mínimo de Harness en su configuración de benchmarks de V4 Flash 0731.

¿Cómo puedo acceder a DeepSeek V4 Flash a través de CometAPI?

Usa el endpoint compatible con OpenAI de CometAPI con el ID de modelo deepseek-v4-flash. La página del modelo en CometAPI proporciona ejemplos en cURL, Python y JavaScript para /v1/chat/completions, además de especificaciones del modelo, precios y uptime.

¿Es DeepSeek V4 Flash mejor que DeepSeek V4 Pro?

Para la tabla de benchmarks del 31 de julio, V4 Flash 0731 supera a V4-Pro Preview en los benchmarks de agentes listados. Eso no significa que Flash siempre sea mejor que Pro. V4 Pro es más grande y sigue siendo más fuerte en muchas tareas difíciles y de conocimiento intensivo según la ficha del modelo. Usa Flash como predeterminado para flujos agentivos sensibles al costo y Pro como ruta de escalado.

54 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más