Especificaciones técnicas
| Elemento | DeepSeek-V4-Pro |
|---|---|
| Proveedor | DeepSeek |
| Nombre del modelo de API | deepseek-v4-pro |
| URLs base | https://api.deepseek.com y https://api.deepseek.com/anthropic |
| Tipo de entrada | Texto |
| Tipo de salida | Texto, llamadas a herramientas, salida de razonamiento |
| Longitud de contexto | 1.000.000 tokens |
| Salida máxima | 384.000 tokens |
| Modos de razonamiento | Sin razonamiento, con razonamiento (predeterminado) |
| Valores predeterminados de agente/codificación | reasoning_effort puede establecerse en high; las solicitudes de agente complejas pueden usar max |
| Funciones compatibles | Salida JSON, Llamadas a herramientas, Finalización de prefijo de chat (beta), FIM Completion (beta en modo sin razonamiento) |
| Publicación local/con pesos abiertos | 1.6T parámetros totales, 49B parámetros activados, precisión mixta FP4 + FP8 |
| Licencia (tarjeta del modelo) | MIT |
| Tarjeta del modelo de referencia | Vista previa de DeepSeek-V4-Pro en Hugging Face |
¿Qué es DeepSeek-V4-Pro?
DeepSeek-V4-Pro es el miembro más potente de la familia de vista previa V4 de DeepSeek. La tarjeta oficial del modelo lo describe como un modelo MoE de 1.6T parámetros con 49B parámetros activados y una ventana de contexto de un millón de tokens, orientado al trabajo de conocimiento de largo horizonte, la generación de código y las tareas de agente. La documentación del API lo expone a través de la interfaz estándar de chat-completions de DeepSeek y admite estilos de SDK tanto de OpenAI como de Anthropic.
Características principales
- Contexto de un millón de tokens: DeepSeek documenta una longitud de contexto de 1M tokens, lo que hace que el modelo sea adecuado para conjuntos de documentos muy grandes, repositorios y sesiones de agentes de múltiples pasos.
- Dos modos de razonamiento: El API admite modos sin razonamiento y con razonamiento; con razonamiento es el predeterminado, y la documentación señala que las solicitudes complejas de agente como Claude Code u OpenCode pueden usar automáticamente el esfuerzo max.
- Capacidad de llamadas a herramientas: El modo de razonamiento de DeepSeek admite llamadas a herramientas, lo cual es importante para agentes que necesitan búsqueda, operaciones de archivos o funciones externas.
- Eficiencia en contextos largos: La tarjeta del modelo indica que V4 utiliza un diseño de atención híbrida con Compressed Sparse Attention y Heavily Compressed Attention para reducir el cómputo de contextos largos y el costo de la caché KV en relación con V3.2. citeturn980363view2
- Enfoque en codificación y razonamiento: DeepSeek afirma que el modo de razonamiento V4-Pro-Max mejora los benchmarks de codificación y cierra gran parte de la brecha con los principales modelos de código cerrado en tareas de razonamiento y agentic. citeturn980363view2
- Flexibilidad de SDK: Puede accederse a través de las finalizaciones de chat compatibles con OpenAI estándar o mediante el endpoint compatible con Anthropic de DeepSeek para flujos de trabajo orientados a herramientas.
Rendimiento en benchmarks
La tarjeta oficial del modelo de DeepSeek reporta los siguientes resultados de evaluación para la familia de modelos base y para el conjunto de comparación V4-Pro-Max. En la tabla de modelos base, V4-Pro obtiene una puntuación más alta que V3.2-Base en varios benchmarks de conocimiento y contexto largo, incluidos MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1) y LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
La misma tarjeta del modelo también muestra que V4-Pro-Max se mantiene competitivo con los modelos de punta en tareas seleccionadas. Por ejemplo, registra 87.5 en MMLU-Pro, 57.9 en SimpleQA-Verified, 90.1 en GPQA Diamond y 67.9 en Terminal Bench 2.0 en la tabla de comparación publicada.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modelo | Mejor ajuste | Contexto | Notas |
|---|---|---|---|
| DeepSeek-V4-Pro | Razonamiento intensivo, codificación, agentes, documentos grandes | 1M | El modelo más grande de la serie V4, 49B parámetros activados, la mayor capacidad general de la serie. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Uso general más rápido y ligero | 1M | Modelo más pequeño de 284B/13B, aún admite razonamiento y llamadas a herramientas. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Línea base de generación anterior para contexto largo | 128K en documentos de API anteriores; V4 utiliza un diseño de contexto de 1M diferente | Útil como punto de referencia para las ganancias de eficiencia; la tarjeta del modelo de V4-Pro reporta grandes reducciones en FLOPs de contexto largo y caché KV frente a V3.2. citeturn321011view1turn980363view2 |
Mejores casos de uso
- Asistentes de codificación a escala de repositorio y herramientas de refactorización
- Análisis y síntesis de documentos largos
- Agentes con uso de herramientas que requieren razonamiento multi-turno
- Flujos de trabajo de soporte técnico que se benefician de memoria larga y salidas estructuradas
- Tareas de conocimiento en chino y multilingües donde la tarjeta del modelo muestra un fuerte rendimiento en benchmarks
Cómo acceder y usar la API de Deepseek v4 pro
Paso 1: Regístrate para obtener la clave de API
Inicia sesión en cometapi.com. Si aún no eres usuario, regístrate primero. Inicia sesión en tu Consola de CometAPI. Obtén la credencial de acceso (API key) de la interfaz. Haz clic en “Add Token” en el token de API del centro personal, obtén la clave del token: sk-xxxxx y envíala.
Paso 2: Envía solicitudes a la API de Deepseek v4 pro
Selecciona el endpoint “deepseek-v4-pro” para enviar la solicitud de API y configura el cuerpo de la solicitud. El método de solicitud y el cuerpo de la solicitud se obtienen de la documentación de nuestra web del API. Nuestro sitio web también proporciona pruebas en Apifox para tu conveniencia. Reemplaza <YOUR_API_KEY> con tu clave real de CometAPI de tu cuenta. Dónde invocarlo: formato de Anthropic Messages y formato de Chat.
Inserta tu pregunta o solicitud en el campo content: esto es lo que el modelo responderá. Procesa la respuesta del API para obtener la respuesta generada.
Paso 3: Recuperar y verificar resultados
Procesa la respuesta del API para obtener la respuesta generada. Después del procesamiento, el API responde con el estado de la tarea y los datos de salida. Habilita funciones como streaming, caché de prompts o manejo de contexto largo mediante parámetros estándar.