TLDR: DeepSeek V4 Pro es el modelo V4 de mayor capacidad de DeepSeek para razonamiento, programación, análisis de contexto largo y flujos de trabajo de agentes. Es un modelo de mezcla de expertos con 1.6 trillion total parameters, 49 billion active parameters, una ventana de contexto de 1 millón de tokens y una salida máxima de 384,000 tokens, según el anuncio de lanzamiento de V4 de DeepSeek y la tabla oficial de precios del modelo.
Los propios resultados de DeepSeek sitúan a V4 Pro en 90.1 en MMLU, 73.5 en MMLU-Pro, 76.8 en HumanEval y 51.5 en LongBench-V2. Las pruebas independientes son más matizadas: la evaluación del U.S. Center for AI Standards and Innovation encontró sólidos resultados en matemáticas y ciencias, incluyendo 97% en OTIS-AIME-2025 y 90% en GPQA-Diamond, pero un rendimiento más débil en pruebas retenidas de ciberseguridad, razonamiento abstracto e ingeniería de software.
Veredicto práctico: usa DeepSeek V4 Pro cuando tareas difíciles de programación, razonamiento o documentos largos justifiquen pagar aproximadamente tres veces las tarifas de tokens sin caché de V4 Flash. Comienza con V4 Flash para aplicaciones de alto volumen y enruta solo las tareas difíciles o fallidas a V4 Pro. Para desarrolladores que busquen acceso multimodelo simple y rentable, plataformas como CometAPI proporcionan un endpoint unificado compatible con OpenAI para DeepSeek V4 Pro junto con cientos de otros modelos.
Puntos clave
- Arquitectura y escala: 1.6T totales / 49B activos en MoE con Atención Dispersa Comprimida (CSA) + Atención Fuertemente Comprimida (HCA) híbridas, reduciendo los FLOPs de inferencia de un solo token a ~27% y la caché KV a ~10% respecto a niveles de DeepSeek-V3.2 en contexto de 1M.
- Contexto y eficiencia: Contexto nativo de 1M tokens y hasta 384K tokens de salida máxima, haciendo viables agentes de horizonte largo y análisis de bases de código completas.
- Benchmarks (V4-Pro-Max): 80.6% en SWE-bench Verified, 93.5% en LiveCodeBench, rating Codeforces 3206, 90.1% en GPQA Diamond, puntajes agentic fuertes (p. ej., MCPAtlas Public ~73.6). El precio oficial de DeepSeek es $0.435/M tokens de entrada sin caché, $0.003625/M tokens de entrada en caché y $0.87/M tokens de salida.
- El modelo es solo de texto. Una extensión de Copilot puede puentear imágenes a través de otro modelo, pero eso no hace que V4 Pro sea multimodal de forma nativa.
- DeepSeek admite OpenAI Chat Completions, su implementación de Responses API, una interfaz compatible con Anthropic, salida JSON, llamadas a herramientas y controles de razonamiento.
- CAISI midió V4 Pro en 74% en SWE-bench Verified, 90% en GPQA Diamond y 97% en OTIS-AIME-2025, pero solo 44% en PortBench y 46% en ARC-AGI-2 semi-private.
Especificaciones del modelo confirmadas
| Especificación | DeepSeek V4 Pro |
|---|---|
| ID de modelo de API | deepseek-v4-pro |
| Versión documentada actual | DeepSeek-V4-Pro-0813 |
| Tamaño de la arquitectura | 1.6T parámetros totales; 49B activos |
| Ventana de contexto | 1M tokens |
| Salida máxima | 384K tokens |
| Modalidad de entrada | Texto |
| Razonamiento | Modos con y sin razonamiento |
| Esfuerzo de razonamiento | high and documented for the official interfacemax |
| Salida estructurada | Salida JSON compatible |
| Funciones de agente | Llamadas a herramientas y Responses API soportadas |
| Compatibilidad de API | OpenAI Chat Completions y API compatible con Anthropic |
| Pesos abiertos | Sí |
| Concurrencia predeterminada de la cuenta | 500 solicitudes concurrentes V4 Pro |
¿Qué es DeepSeek V4 Pro?
DeepSeek V4 Pro (ID de modelo típicamente deepseek-v4-pro) es el nivel de mayor capacidad de la serie DeepSeek-V4, desarrollada por el laboratorio chino de IA DeepSeek. Se lanzó por primera vez como vista previa el 24 de abril de 2026, junto con el más ligero DeepSeek-V4-Flash, y pasó a disponibilidad general a mediados de agosto de 2026 bajo la cadena de versión DeepSeek-V4-Pro-0813.
Construido como un modelo de mezcla de expertos, activa solo una fracción de sus parámetros totales (49B de 1.6T) por token. Este diseño, combinado con innovaciones arquitectónicas en atención, ofrece inteligencia de frontera manteniendo la eficiencia de inferencia, especialmente en longitudes de contexto extremas. El modelo es solo de texto (las capacidades multimodales siguen en desarrollo), con licencia MIT y pesos abiertos disponibles en Hugging Face.
Posicionamiento clave de DeepSeek: V4-Pro apunta a capacidades agenticas mejoradas, conocimiento del mundo rico (lidera entre los modelos abiertos, por detrás solo de ciertas variantes de Gemini) y razonamiento de clase mundial en matemáticas, STEM y programación que rivaliza con los sistemas de código cerrado de primer nivel.
Admite dos modos: con razonamiento (cadena de pensamiento/razonamiento extendido, predeterminado en muchas configuraciones) y sin razonamiento (respuestas más rápidas), junto con niveles configurables de esfuerzo de razonamiento (incluido un máximo “V4-Pro-Max”). La compatibilidad de API abarca tanto OpenAI Chat Completions como el formato de Anthropic Messages, además de llamadas a herramientas, salida JSON estructurada y funciones beta como completado fill-in-the-middle (FIM) (modo sin razonamiento) y continuación de prefijo de conversación.
Estado de lanzamiento de DeepSeek V4 Pro
Hay varias fechas a distinguir:
- 24 de abril de 2026: DeepSeek anunció la vista previa de V4, pesos abiertos y acceso API para V4 Pro y V4 Flash.
- 24 de julio de 2026: DeepSeek retiró los nombres antiguos y de API tras un periodo de migración de tres meses.
deepseek-chatdeepseek-reasoner - 13 de agosto de 2026: El alias actual apunta a la versión del modelo V4-Pro-0813, según la tabla de modelos en vivo de DeepSeek.
deepseek-v4-pro
¿Cómo funciona DeepSeek V4 Pro?
En esencia, V4 Pro es un modelo de mezcla de expertos con 1.6 trillion total parameters y 49 billion activated parameters por pasada directa. Este diseño ofrece alta capacidad manteniendo los costos de inferencia manejables. Tanto V4 Pro como V4 Flash admiten una ventana de contexto de 1 millón de tokens y hasta 384,000 tokens de salida máxima. Los modelos son solo de texto en el lanzamiento (las capacidades multimodales se mencionaron como en desarrollo en materiales tempranos) y se distribuyen bajo la permisiva licencia MIT, con pesos abiertos disponibles en Hugging Face.
Las innovaciones arquitectónicas clave incluyen:
- Mecanismo de atención híbrido: combina Atención Dispersa Comprimida (CSA) y Atención Fuertemente Comprimida (HCA). En el ajuste de 1M tokens, DeepSeek-V4-Pro requiere solo alrededor del 27% de los FLOPs de inferencia de un token y el 10% de la memoria de caché KV en comparación con DeepSeek-V3.2. Esto hace que los contextos de un millón de tokens sean mucho más prácticos de forma rutinaria.
- Hiperconexiones restringidas a variedades (mHC): mejora las conexiones residuales para una mejor estabilidad de entrenamiento y propagación de señal.
- Muon Optimizer: usado durante el preentrenamiento para una convergencia más rápida y mayor estabilidad.
- Preentrenamiento en más de 32 trillion high-quality tokens, seguido de una sofisticada canalización de postentrenamiento (SFT específico por dominio + RL, luego destilación on-policy).
Estos cambios permiten el uso rutinario de contextos de 1M tokens para tareas de agentes de horizonte largo, análisis de bases de código completas o grandes colecciones de documentos sin las penalizaciones previas de memoria y cómputo.
Precios de la API de DeepSeek V4 Pro
DeepSeek factura por separado la entrada sin caché, la entrada con acierto de caché y la salida generada. Los precios se cotizan por un millón de tokens.
| Modelo | Entrada sin caché | Entrada con caché | Salida | Contexto |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 | 1M tokens |
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 | 1M tokens |
Estas son las tarifas mostradas en la página oficial de precios de la API de DeepSeek en el momento de la publicación. DeepSeek advierte allí que planea aumentar los precios generales de la API en el futuro, pero no ha divulgado una nueva tarifa definitiva ni fecha de vigencia. Por lo tanto, los presupuestos de producción deberían leer precios dinámicamente en lugar de codificarlos en previsiones a largo plazo.
Ejemplos realistas de costos de DeepSeek V4 Pro
La fórmula básica es:
cost = uncached input × $0.435/M + cached input × $0.003625/M + output × $0.87/M
| Carga de trabajo | Supuestos de tokens | Costo aproximado de V4 Pro |
|---|---|---|
| Solicitud de programación corta | 10,000 de entrada + 2,000 de salida | $0.00609 |
| Análisis a nivel de repositorio | 100,000 de entrada + 20,000 de salida | $0.0609 |
| Análisis de documento muy largo | 1M de entrada + 100,000 de salida | $0.522 |
| Análisis de documento largo en caché | 1M de entrada con acierto de caché + 100,000 de salida | $0.090625 |
| 100,000 llamadas de producción | 20,000 de entrada + 4,000 de salida por llamada | $1,218 |
En comparación, el escenario final de 100,000 llamadas costaría aproximadamente $392 en V4 Flash, asumiendo que toda la entrada es un fallo de caché. Esa es una diferencia de $826, lo que hace que la estrategia de enrutamiento sea económicamente importante incluso cuando ambos modelos parecen baratos por llamada.
Estos ejemplos son estimaciones de costo por tokens, no presupuestos de infraestructura completos. Excluyen reintentos, turnos de agente fallidos, resultados de herramientas repetidos, moderación, almacenamiento vectorial, APIs de búsqueda, observabilidad y cualquier tarifa cobrada por una plataforma separada.
Por qué importa el precio de los aciertos en caché
La tarifa de entrada con acierto de caché de V4 Pro es aproximadamente 120 veces menor que su tarifa de entrada sin caché. Los mayores ahorros ocurren cuando las solicitudes reutilizan repetidamente el mismo prefijo; por ejemplo:
- Un prompt de sistema y manual de políticas estables
- Una instantánea de repositorio compartida
- Un esquema de herramienta estándar
- Un catálogo de productos extenso
- Análisis repetido del mismo contrato o informe
La caché no abarata la salida generada. Un trazo de razonamiento largo o una finalización verbosa siguen facturándose a la tarifa de salida. Los desarrolladores deberían monitorizar el estado de caché de la entrada y la longitud de la salida por separado, en lugar de basarse únicamente en el costo promedio por solicitud.
Cómo acceder a DeepSeek V4 Pro (incluido a través de CometAPI)
Métodos de acceso:
- API oficial de DeepSeek (
https://api.deepseek.com) — usa el modelodeepseek-v4-pro. - Pesos abiertos en Hugging Face para despliegue local o privado.
- Agregadores y plataformas serverless (OpenRouter, Together, DeepInfra, etc.).
Recomendación para usuarios de CometAPI: CometAPI ofrece acceso conveniente a DeepSeek V4 Pro (y V4 Flash) mediante un único endpoint compatible con OpenAI (https://api.cometapi.com/v1). Te beneficias de facturación unificada en más de 500 modelos, tarifas competitivas (a menudo con ahorros a nivel de plataforma), paneles de uso en tiempo real y cero cambios de código más allá de la URL base y la clave al migrar desde los SDK de OpenAI. Esto es especialmente útil para desarrolladores independientes y equipos que desean hacer A/B testing de V4 Pro frente a Claude, GPT, Gemini u otros modelos sin gestionar múltiples cuentas.
¿Quién debería usar DeepSeek V4 Pro?
V4 Pro merece una prueba seria para:
- síntesis de documentos extensos con citas rastreables;
- programación y revisión de código a escala de repositorio;
- agentes de larga duración con contexto repetido;
- asistencia en matemáticas y STEM con verificación;
- generación de informes o documentos estructurados;
- razonamiento de alto volumen donde el costo directo por token es una restricción importante;
- equipos interesados en una vía de despliegue con pesos abiertos.
V4 Flash puede ser una mejor primera opción para tareas simples de agente, clasificación, extracción, ruteo o trabajos sensibles a la latencia. El propio DeepSeek afirma que Flash se aproxima a Pro en razonamiento y lo iguala en evaluaciones de agentes más simples mientras usa un modelo activo más pequeño.
V4 Pro es una opción menos sólida cuando la comprensión nativa de imágenes es obligatoria, cuando una política de adquisiciones prohíbe dependencias en estado de vista previa, o cuando la organización no puede construir controles de evaluación y verificación. La guía de integración oficial de GitHub Copilot describe explícitamente que V4 es solo de texto; el manejo de imágenes en esa extensión lo realiza un modelo proxy separado.
DeepSeek V4 Pro vs V4 Flash
| Factor de decisión | V4 Pro | V4 Flash |
|---|---|---|
| Función principal | Razonamiento difícil, código, agentes | Trabajo de alto volumen y sensible a la latencia |
| Parámetros totales/activos | 1.6T / 49B | 284B / 13B |
| Contexto | 1M | 1M |
| Salida máxima | 384K | 384K |
| Precio de entrada sin caché | $0.435/M | $0.14/M |
| Precio de salida | $0.87/M | $0.28/M |
| Concurrencia | 500 | 2,500 |
| Uso recomendado | Nivel de escalamiento | Nivel de enrutamiento predeterminado |
Una arquitectura sensata comienza con Flash para extracción, resumen, clasificación, chat básico y programación sencilla. Escala a Pro cuando Flash falla un validador, reporta baja confianza, encuentra un cambio complejo de repositorio o necesita una planificación más profunda.
Este enfoque refleja un principio económico más amplio: la selección de modelo debe seguir el valor entregado, no simplemente la inteligencia teórica máxima.
Conclusión y recomendación
DeepSeek V4 Pro representa un paso significativo para los pesos abiertos en IA: capacidad cercana a la frontera en programación y razonamiento, contexto de un millón de tokens práctico gracias a innovaciones arquitectónicas y economía que hace accesible la inteligencia de alta gama. La combinación de pesos abiertos (MIT), benchmarks agenticos sólidos y precios oficiales agresivos consolida la posición de DeepSeek como una fuerza importante en el panorama de IA de 2026.
Para la mayoría de desarrolladores y equipos, comenzar con la API oficial o un agregador confiable es el camino más rápido. CometAPI destaca como una recomendación práctica para un acceso simplificado: proporciona DeepSeek V4 Pro (y Flash) dentro de una plataforma multimodelo más amplia que reduce la fricción operativa. Ya sea que estés creando agentes de programación, analizando documentos largos u optimizando costos de inferencia, V4 Pro merece una evaluación seria.
Fuentes y lecturas adicionales
- Vista previa de lanzamiento de DeepSeek V4: https://api-docs.deepseek.com/news/news260424/
- Precios oficiales de DeepSeek: https://api-docs.deepseek.com/quick_start/pricing
- Hugging Face DeepSeek-V4-Pro: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- Informe técnico (arXiv/Hugging Face): artículo de DeepSeek-V4
- Cobertura de Artificial Analysis e informes de Intelligence Index
- Reseñas contemporáneas y evaluaciones independientes (2026)
- Modelos y documentación de DeepSeek en CometAPI: https://www.cometapi.com/ y páginas de modelos relacionadas
Esta visión general se basa en información disponible públicamente a agosto de 2026. Verifica siempre las fuentes oficiales más recientes antes del despliegue en producción.
