Especificaciones técnicas
| Elemento | DeepSeek-V4-Pro |
|---|---|
| Proveedor | DeepSeek |
| Nombre del modelo de API | deepseek-v4-pro |
| URL base | https://api.deepseek.com y https://api.deepseek.com/anthropic |
| Tipo de entrada | Texto |
| Tipo de salida | Texto, llamadas a herramientas, razonamiento |
| Contexto | 1,000,000 tokens |
| Salida máx. | 384,000 tokens |
| Modos de razonamiento | Sin razonamiento, con razonamiento (predeterminado) |
| Predeterminados de agente/código | reasoning_effort se puede establecer en alto; peticiones de agente complejas pueden usar max |
| Funciones compatibles | Salida JSON, llamadas a herramientas, Chat Prefix Completion (beta), FIM Completion (beta en modo sin razonamiento) |
| Lanzamiento local/pesos abiertos | 1.6T parámetros totales, 49B parámetros activados, precisión mixta FP4 + FP8 |
| Licencia (tarjeta del modelo) | MIT |
| Tarjeta de modelo de referencia | Vista previa de DeepSeek-V4-Pro en Hugging Face |
¿Qué es DeepSeek-V4-Pro?
DeepSeek-V4-Pro es el miembro más potente de la familia de vista previa V4 de DeepSeek. La tarjeta oficial del modelo lo describe como un modelo MoE de 1.6T parámetros con 49B parámetros activados y una ventana de contexto de un millón de tokens, orientado al trabajo de conocimiento de largo horizonte, generación de código y tareas de agente. La API lo expone mediante la interfaz estándar de chat-completions de DeepSeek y admite estilos de SDK compatibles con OpenAI y Anthropic.
Funciones principales
- Contexto de un millón de tokens: DeepSeek documenta una longitud de contexto de 1M tokens, lo que hace que el modelo sea adecuado para conjuntos de documentos muy grandes, repositorios y sesiones de agente de múltiples pasos.
- Dos modos de razonamiento: la API admite modos sin razonamiento y con razonamiento; con razonamiento es el predeterminado, y la documentación indica que solicitudes de agente complejas como Claude Code u OpenCode pueden usar automáticamente max.
- Compatible con llamadas a herramientas: el modo con razonamiento de DeepSeek admite llamadas a herramientas, lo cual es importante para agentes que necesitan búsqueda, operaciones de archivos o funciones externas.
- Eficiencia en contextos largos: la tarjeta del modelo indica que V4 utiliza un diseño de atención híbrido con Compressed Sparse Attention y Heavily Compressed Attention para reducir el cómputo en contextos largos y el costo de la caché KV en comparación con V3.2. citeturn980363view2
- Enfoque en codificación y razonamiento: DeepSeek afirma que el modo de razonamiento V4-Pro-Max mejora los benchmarks de programación y cierra gran parte de la brecha con los modelos cerrados líderes en tareas de razonamiento y orientadas a agentes. citeturn980363view2
- Flexibilidad del SDK: se puede acceder a él mediante completions de chat compatibles con OpenAI o a través del endpoint compatible con Anthropic de DeepSeek para flujos de trabajo orientados a herramientas.
Rendimiento en benchmarks
La tarjeta oficial del modelo de DeepSeek reporta los siguientes resultados de evaluación para la familia de modelos base y para el conjunto de comparación V4-Pro-Max. En la tabla del modelo base, V4-Pro obtiene puntuaciones más altas que V3.2-Base en varios benchmarks de conocimiento y contexto largo, incluidos MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1) y LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
La misma tarjeta del modelo también muestra que V4-Pro-Max se mantiene competitivo con los modelos de frontera en tareas seleccionadas. Por ejemplo, obtiene 87.5 en MMLU-Pro, 57.9 en SimpleQA-Verified, 90.1 en GPQA Diamond y 67.9 en Terminal Bench 2.0 en la tabla de comparación publicada.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modelo | Mejor uso | Contexto | Notas |
|---|---|---|---|
| DeepSeek-V4-Pro | Razonamiento intensivo, programación, agentes, documentos grandes | 1M | El mayor modelo de V4, 49B parámetros activados, la mayor capacidad general de la serie. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Uso general más rápido y ligero | 1M | Modelo más pequeño 284B/13B, aún admite razonamiento y llamadas a herramientas. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Línea base de la generación anterior con contexto largo | En documentación de API anteriores, 128K; V4 usa un diseño de contexto de 1M diferente | Útil como punto de referencia para las mejoras de eficiencia; la tarjeta del modelo de V4-Pro reporta grandes reducciones en FLOPs de contexto largo y caché KV frente a V3.2. citeturn321011view1turn980363view2 |
Mejores casos de uso
- Asistentes de programación a escala de repositorio y herramientas de refactorización
- Análisis y síntesis de documentos extensos
- Agentes que usan herramientas y necesitan razonamiento multi-turno
- Flujos de soporte técnico que se benefician de memoria larga y salidas estructuradas
- Tareas de conocimiento en chino y multilingües donde la tarjeta del modelo muestra un fuerte rendimiento en benchmarks
Cómo acceder y usar la API de Deepseek v4 pro
Paso 1: Regístrate para obtener la clave de API
Inicia sesión en cometapi.com. Si aún no eres usuario, regístrate primero. Inicia sesión en tu Consola de CometAPI. Obtén la clave de API de credenciales de acceso de la interfaz. Haz clic en “Add Token” en el API token del centro personal, obtén la clave de token: sk-xxxxx y envíala.
Paso 2: Envía solicitudes a la API de Deepseek v4 pro
Selecciona el endpoint “deepseek-v4-pro” para enviar la solicitud a la API y configura el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de API de nuestro sitio web. Nuestro sitio web también proporciona pruebas en Apifox para tu comodidad. Reemplaza <YOUR_API_KEY> con tu clave real de CometAPI de tu cuenta. Dónde llamarlo: formato Anthropic Messages y formato Chat.
Inserta tu pregunta o solicitud en el campo content; esto es lo que el modelo responderá. Procesa la respuesta de la API para obtener la respuesta generada.
Paso 3: Recupera y verifica los resultados
Procesa la respuesta de la API para obtener la respuesta generada. Después del procesamiento, la API responde con el estado de la tarea y los datos de salida. Habilita funciones como streaming, almacenamiento en caché de prompts o manejo de contexto largo mediante parámetros estándar.