TLDR: DeepSeek-V4-Pro-0813 es la versión de disponibilidad general (GA) del modelo insignia MoE de 1.6T parámetros de DeepSeek (49B activos). Ofrece importantes mejoras en capacidades de agentes respecto a la vista previa de abril de 2026, admite una ventana de contexto de 1M tokens, hasta 384K tokens de salida, tres niveles de esfuerzo de razonamiento (bajo/alto/máximo), compatibilidad nativa con la API Responses de OpenAI, llamadas a herramientas, modo JSON y extremos compatibles tanto con OpenAI como con Anthropic.
La tarifa oficial comienza en $0.435 / $0.87 por 1M de tokens de entrada/salida (fallo de caché), con tarifas de hora pico/fuera de pico a partir del 16 de agosto de 2026. La forma más fácil y a menudo más rentable de acceder es a través de la pasarela unificada compatible con OpenAI de CometAPI con tarifas con descuento.
Puntos clave
- DeepSeek-V4-Pro-0813 es la versión GA de producción lanzada alrededor del 12–13 de agosto de 2026; el ID del modelo sigue siendo
deepseek-v4-pro. - Aumentos significativos en benchmarks de agentes: DeepSWE 62.7, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, HLE (con herramientas) 60.0.
- Tres modos/niveles de esfuerzo de razonamiento: sin razonamiento + razonamiento bajo / alto / máximo.
- Conjunto completo de funciones: contexto de 1M, salida máxima de 384K, llamadas a herramientas, salida JSON, Responses API, formato Anthropic, streaming, salidas estructuradas.
- La tarificación en hora pico/fuera de pico comienza el 16 de agosto de 2026 (UTC); planifica las cargas de trabajo en consecuencia.
- La compatibilidad con el SDK de OpenAI como reemplazo directo hace que la migración sea trivial.
Esta guía integral cubre todo lo que necesitan los desarrolladores: qué cambió en la versión 0813, especificaciones y precios oficiales, modos de razonamiento, streaming y salidas estructuradas, y un paso a paso para usar el modelo a través de CometAPI (recomendado para muchas cargas de trabajo de producción y multi-modelo). Toda la información proviene de la documentación oficial de DeepSeek y reportes contemporáneos al 13 de agosto de 2026.
¿Qué es DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 es la instantánea de producción de disponibilidad general de DeepSeek V4 Pro lanzada en agosto de 2026.
DeepSeek announced on August 13 que la versión oficial V4 Pro pasó a estar disponible simultáneamente en su app, sitio web y API. El anuncio del 13 de agosto de DeepSeek también agrega compatibilidad nativa con la API Responses de OpenAI y tres niveles prácticos de razonamiento: sin razonamiento, razonamiento de esfuerzo alto y razonamiento de esfuerzo máximo. Importante para desarrolladores, DeepSeek indica que el nombre del modelo en la API no cambia. Los desarrolladores siguen invocando:
deepseek-v4-pro
La designación 0813 identifica la instantánea de producción en lugar de un identificador de modelo que los desarrolladores tengan necesariamente que poner en su solicitud a la API.
El modelo está orientado principalmente a razonamiento avanzado, ingeniería de software, análisis de contexto largo y cargas de trabajo de agentes. La evaluación independiente de Artificial Analysis currently reports un Intelligence Index de 53, frente a una mediana de 27 entre sus modelos open-weight comparables seleccionados. También informa aproximadamente 77.6 tokens/second de velocidad de salida y 1.71-second de tiempo hasta el primer token basados en sus pruebas de API.
¿Qué cambios se han hecho en la API en V4 Pro 0813?
El identificador central del modelo y las URL base se mantienen, por lo que las integraciones existentes continúan funcionando sin cambios de código. Las mejoras significativas están en la capacidad, la calidad de post-entrenamiento y las funciones de soporte.
Mejoras clave de capacidad
Según el anuncio oficial de GA de DeepSeek-V4-Pro y el registro de cambios:
- Importantes mejoras agenciales, con incrementos especialmente fuertes en cargas de trabajo de estilo producción.
- Los puntajes de benchmarks para la versión 0813 incluyen:
- HLE (sin / con herramientas): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench (Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Estos representan aumentos sustanciales frente a la vista previa de abril de 2026 (por ejemplo, DeepSWE subió de forma dramática). El modelo sigue siendo de arquitectura Mixture-of-Experts con 1.6 billones de parámetros totales y aproximadamente 49 mil millones activados por token.
Nuevas y mejoradas funciones de la API
- Compatibilidad nativa con la API Responses de OpenAI, optimizada para Codex con scripts de configuración de un clic.
- Control de esfuerzo de razonamiento más flexible: bajo / alto / máximo (antes el mapeo era más limitado en Pro).
- Soporte de modo dual continuo (razonamiento activado por defecto; modo sin razonamiento disponible).
- Compatibilidad total con OpenAI Chat Completions y el formato Anthropic Messages.
- Salida JSON, Tool Calls, Chat Prefix Completion (Beta) y FIM Completion (Beta, solo sin razonamiento).
- La longitud de contexto sigue en 1M tokens; la salida máxima es de 384K tokens.
- Límite de concurrencia para Pro: 500 (Flash: 2,500).
Anuncio de actualización de precios
Tarifas actuales (al 13 de agosto de 2026) por 1M de tokens:
| Modelo | Entrada (acierto de caché) | Entrada (fallo de caché) | Salida |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
A partir de las 16:00 UTC del 16 de agosto de 2026, entra en vigor la facturación por hora pico/fuera de pico (fuera de pico = la mitad de pico). Horas pico: 01:00–04:00 y 06:00–10:00 UTC. Nuevas tarifas:
| Modelo | Periodo | Entrada (acierto de caché) | Entrada (fallo de caché) | Salida |
|---|---|---|---|---|
| deepseek-v4-pro | Fuera de pico | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Pico | $0.044 | $1.32 | $3.96 |
DeepSeek también ha indicado que podrían seguir nuevos aumentos generales de precio; monitorea la página oficial de precios.
La documentación de límites de tasa de DeepSeek establece la concurrencia estándar de V4 Pro en 500 solicitudes por cuenta. Una conexión cuenta desde el envío hasta que la respuesta se completa, y las solicitudes en exceso reciben respuestas HTTP 429. DeepSeek acepta a para el aislamiento de programación; debe coincidir con y no superar los 512 caracteres. No debe contener información personal.
Compatibilidad nativa con Responses API
Uno de los cambios más claros es la compatibilidad nativa con el formato de la API Responses de OpenAI.
DeepSeek indica que la Responses API se diseñó en parte para soportar flujos de trabajo de agentes de codificación como Codex. El endpoint oficial utiliza:
https://api.deepseek.com
y puede accederse con el SDK de Python de OpenAI.
Ejemplo:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
La documentación de DeepSeek también admite streaming para solicitudes de la Responses API, usando SSE semánticos en lugar de la convención antigua de data: [DONE].
Controles de razonamiento más flexibles
V4 Pro hace que el razonamiento sea configurable en lugar de obligar a usar un modelo de razonamiento por separado.
La documentación de DeepSeek describe el interruptor de razonamiento como:
{
"thinking": {
"type": "enabled"
}
}
y el esfuerzo de razonamiento como:
high
max
La configuración de razonamiento predeterminada está activada, con high para solicitudes normales. Ciertas cargas complejas de agentes pueden usar automáticamente max.
Esto crea tres modos prácticos para desarrolladores de aplicaciones:
- Sin razonamiento
- Razonamiento — Alto
- Razonamiento — Máximo
Esta distinción es muy útil al diseñar aplicaciones de IA porque no todas las solicitudes merecen el razonamiento máximo.
Un detalle de implementación importante: en modo de razonamiento, parámetros como
temperatureytop_pno afectan la salida del modelo. DeepSeek documenta explícitamente este comportamiento.
Cómo usar la API de DeepSeek V4 Pro 0813 con CometAPI
CometAPI es útil si quieres integrar DeepSeek V4 Pro sin mantener integraciones API separadas para cada proveedor de IA.
CometAPI anuncia actualmente una API unificada que cubre 500+ modelos de IA, con una capa API común y facturación unificada. Su documentación de precios indica que, en general, ofrece precios de modelos oficiales con un 20% de descuento frente a la tarifa del proveedor.
Aquí tienes un flujo práctico de integración con CometAPI.
Paso 1: Crea una cuenta en CometAPI
Primero, crea o inicia sesión en tu cuenta de CometAPI.
Abre el sitio web de CometAPI y accede a la consola de la API.
La documentación de DeepSeek V4 Pro en CometAPI indica que hay que obtener un token de API desde la consola de CometAPI.
Paso 2: Crea tu clave de API de CometAPI
Tras iniciar sesión, abre la sección de tokens/clave de API de tu cuenta y genera una clave.
Guárdala como variable de entorno en lugar de hardcodearla dentro de tu aplicación.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Nunca subas una clave de API a GitHub, JavaScript del frontend, aplicaciones móviles o archivos de configuración con acceso público.
Paso 3: Instala el SDK de Python de OpenAI
Como CometAPI ofrece una interfaz compatible con OpenAI, puedes usar el cliente de OpenAI para Python.
pip install openai
Esto hace que la migración sea especialmente sencilla para desarrolladores que ya conocen el formato de la API de OpenAI.
Paso 4: Configura la URL base de CometAPI
Crea el cliente así:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
El ejemplo publicado por CometAPI para V4 Pro usa esta URL base y el ID de modelo deepseek-v4-pro.
Paso 5: Envía tu primera solicitud a DeepSeek V4 Pro
Ahora envía una solicitud básica:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
Los parámetros críticos son:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Explicación de los tres modos de razonamiento
DeepSeek V4 Pro admite:
- Modo sin razonamiento — Respuestas más rápidas, sin cadena de pensamiento explícita. Ideal para Q&A simples o escenarios de alto rendimiento.
- Modo con razonamiento de bajo/alto esfuerzo — El modelo produce reasoning_content antes de la respuesta final. Alto es el predeterminado práctico para la mayoría de trabajos de agentes y codificación.
- Esfuerzo máximo — Lleva al máximo la capacidad de razonamiento; recomendado para problemas complejos de múltiples pasos. Puede consumir más tokens y latencia.
En el formato compatible con OpenAI, esto se controla con el objeto thinking y el parámetro reasoning_effort. La cadena de pensamiento aparece en message.reasoning_content. Cuando no se usan herramientas, el razonamiento previo a menudo puede omitirse del contexto subsiguiente; cuando sí se usan herramientas, debe pasarse de vuelta el razonamiento completo.
Cambia entre niveles de esfuerzo y modo sin razonamiento
- Sin razonamiento:
"thinking": {"type": "disabled"}(o el equivalente estilo Anthropicreasoning.effort: "none"). - Con razonamiento y esfuerzo:
"reasoning_effort": "low" | "high" | "max"más"thinking": {"type": "enabled"}.
Por defecto, el razonamiento está activado con esfuerzo high. Usa low para consultas simples, high para trabajo típico de agentes y max para los problemas más difíciles o tareas de codificación de múltiples pasos.
Streaming de respuestas y salidas estructuradas
El streaming se habilita simplemente con "stream": true. Pueden emitirse tanto el contenido como, cuando corresponde, los tokens de razonamiento. Esto es fundamental para agentes interactivos y aplicaciones de cara al usuario.
Las salidas estructuradas / JSON son de primera clase: usa response_format={"type": "json_object"} o el soporte de esquemas más avanzado disponible mediante la Responses API y definiciones de herramientas. Combinado con llamadas a herramientas, permite bucles de agente fiables que emiten acciones legibles por máquina.
El endpoint de Responses API (/responses) ofrece una superficie más moderna, alineada con OpenAI, especialmente útil para flujos al estilo Codex y ahora está soportado de forma nativa para V4 Pro.
Usa salidas estructuradas / modo JSON
DeepSeek admite salida JSON. Solicítala con response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
Para un control de esquema más estricto, combínalo con llamadas a herramientas o la Responses API cuando esté soportado.
Implementa llamadas a herramientas (Function Calling)
Define herramientas en el formato de OpenAI. En modo de razonamiento debes reenviar correctamente reasoning_content en turnos posteriores cuando haya herramientas implicadas.
Al interactuar con la herramienta más adelante, los desarrolladores deben conservar el reasoning_content correspondiente al invocar la herramienta de mindset. Un manejo incorrecto puede resultar en un error 400.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Consulta las guías oficiales de Tool Calls y Thinking Mode para el patrón exacto multi-turno requerido cuando se usan herramientas.
Mejores prácticas para usar la API de DeepSeek V4 Pro 0813
Ajusta el esfuerzo de razonamiento a la tarea
No uses razonamiento máximo para una tarea que solo requiera clasificación.
Una política de enrutamiento simple funciona bien:
Simple → Sin razonamiento
Moderado → Alto
Complejo → Máximo
Esto puede reducir tanto la latencia como el costo.
Haz streaming de respuestas largas
Si tu aplicación puede tardar varios segundos en generar una respuesta, usa:
stream=True
Los usuarios suelen percibir la salida incremental como sustancialmente más rápida que esperar una respuesta completa.
Valida la salida estructurada
El modo JSON mejora la fiabilidad, pero tu aplicación aún debe validar el JSON devuelto.
Usa:
import json
data = json.loads(response_text)
y luego valida los campos requeridos antes de escribir en tu base de datos o disparar una acción externa.
Supervisa el uso de tokens
Inspecciona siempre:
response.usage
cuando esté disponible.
A la escala de V4 Pro, la contabilidad de tokens no es una función opcional de analítica. Es un mecanismo central de control de costos.
Separa prompts estables y dinámicos
Para aplicaciones de contexto largo, mantiene estables las instrucciones y documentos recurrentes para maximizar la reutilización de caché.
Mantén un modelo de respaldo
Una arquitectura de producción práctica puede enrutar:
Solicitud simple
↓
V4 Flash
Solicitud compleja
↓
V4 Pro
Solicitud muy difícil
↓
V4 Pro razonamiento máximo
La política exacta de enrutamiento debe determinarse mediante tus propios benchmarks.
Errores comunes de la API de DeepSeek V4 Pro
Error: Modelo no encontrado
Verifica que estás usando:
deepseek-v4-pro
en lugar de inventar accidentalmente un nombre de instantánea de modelo.
DeepSeek indica que el nombre del modelo de la API permanece sin cambios para la versión de producción 0813.
Error: Parámetros de razonamiento no válidos
Para solicitudes compatibles con OpenAI, usa:
"thinking": {
"type": "enabled"
}
dentro del cuerpo de la solicitud correspondiente, y usa:
reasoning_effort=high
o:
reasoning_effort=max
La documentación oficial de la API de DeepSeek define estos parámetros.
Error: Salida JSON con formato incorrecto
Usa:
"response_format": {
"type": "json_object"
}
e indica explícitamente en el prompt que se genere JSON. DeepSeek advierte que el modo JSON debe acompañarse de una instrucción para producir JSON.
Error durante llamadas a herramientas multi-turno
Cuando uses el modo de razonamiento con llamadas a herramientas, conserva el reasoning_content requerido en solicitudes posteriores.
Es un detalle fácil de pasar por alto y puede producir una respuesta 400.
API DeepSeek V4 Pro 0813: Arquitectura recomendada
Para una aplicación de producción, un buen punto de partida es esta arquitectura:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Esto separa la selección del modelo de la lógica de la aplicación.
Si otro modelo se vuelve más económico o rinde mejor en una carga de trabajo concreta, la capa de enrutamiento puede cambiar sin reescribir toda la aplicación.
Conclusión y recomendaciones
DeepSeek-V4-Pro-0813 marca la madurez de la línea V4 Pro hacia un buque insignia listo para producción con un rendimiento agencial notablemente más fuerte, preservando al mismo tiempo el generoso contexto de 1M y la economía atractiva de la serie. Los desarrolladores pueden empezar a usarlo hoy con prácticamente cero costo de migración gracias a la compatibilidad con OpenAI y Anthropic.
Para la mayoría de los equipos recomendamos:
- Prototipado y experimentación multi-modelo en CometAPI.
- Mover las cargas de trabajo de DeepSeek de alto volumen o sensibles a latencia al endpoint oficial una vez que se estabilicen los precios pico/fuera de pico y cualquier ajuste adicional.
- Usar por defecto el modo de razonamiento con reasoning_effort="high" para tareas de agentes y codificación; reservar max para los problemas más difíciles.
- Implementar siempre el redondeo correcto del reasoning_content en llamadas a herramientas y aprovechar streaming + salidas estructuradas para aplicaciones robustas.
Con la versión 0813, DeepSeek ha entregado un modelo open-weight-class altamente capaz y rentable, competitivo para cargas de trabajo serias de agentes y contexto largo. Intégralo vía CometAPI o la API oficial y empieza a construir. Explora DeepSeek V4 Pro en CometAPI.
Preguntas frecuentes
¿DeepSeek V4 Pro 0813 es el mismo que deepseek-v4-pro?
Sí. El anuncio oficial de lanzamiento de DeepSeek indica que el nombre del modelo en la API permanece sin cambios mientras la versión de producción se actualiza a V4 Pro 0813.
¿DeepSeek V4 Pro admite una ventana de contexto de 1M tokens?
Sí. La documentación actual del modelo/precios de DeepSeek lista una longitud de contexto de 1M tokens y salida máxima de 384K.
¿Cuáles son los tres modos de razonamiento de DeepSeek V4 Pro?
Para el diseño práctico de aplicaciones, son:
- Sin razonamiento
- Razonamiento con esfuerzo alto
- Razonamiento con esfuerzo máximo
La API usa el interruptor de razonamiento más reasoning_effort. La API actual de DeepSeek expone high y max, mientras que valores de compatibilidad como low y medium se mapean a high.
¿Puedo hacer streaming de las respuestas de DeepSeek V4 Pro?
Sí. El streaming está soportado a través de la API de Chat Completions, y los streams en modo de razonamiento pueden incluir deltas de reasoning_content antes del contenido normal de la respuesta.
¿Puedo usar DeepSeek V4 Pro con CometAPI?
Sí. CometAPI documenta actualmente el modelo deepseek-v4-pro a través de su endpoint compatible con OpenAI /v1/chat/completions.
¿Debería usar DeepSeek V4 Pro o V4 Flash?
Usa V4 Flash cuando primen rendimiento, latencia y costo. Usa V4 Pro para razonamiento difícil, codificación, análisis de contexto largo y flujos de trabajo de agentes.
Una estrategia híbrida de enrutamiento suele ser mejor que usar Pro para todo.
¿Está cambiando el precio de la API de DeepSeek V4 Pro?
Sí. DeepSeek ha anunciado precios pico/fuera de pico a partir del 17 de agosto de 2026. La documentación oficial lista V4 Pro a $0.66/M de entrada sin caché y $1.98/M de salida durante periodos fuera de pico, frente a $1.32/M de entrada y $3.96/M de salida en periodos pico bajo el nuevo esquema.
