Especificaciones técnicas de DeepSeek-V4-Flash
| Elemento | Detalles |
|---|---|
| Modelo | DeepSeek-V4-Flash |
| Proveedor | DeepSeek |
| Familia | DeepSeek-V4 preview series |
| Arquitectura | Mixture-of-Experts (MoE) |
| Parámetros totales | 284B |
| Parámetros activados | 13B |
| Longitud de contexto | 1,000,000 tokens |
| Precisión | FP4 + FP8 mixed |
| Modos de razonamiento | Non-think, Think, Think Max |
| Estado de lanzamiento | Preview model |
| Licencia | MIT License |
¿Qué es DeepSeek-V4-Flash?
DeepSeek-V4-Flash es el modelo preliminar de la serie V4 de DeepSeek, centrado en la eficiencia. Está construido como un modelo de lenguaje Mixture-of-Experts con una huella activa relativamente pequeña para su tamaño, lo que ayuda a mantener la respuesta ágil mientras soporta una ventana de contexto muy grande de 1M tokens.
Características principales de DeepSeek-V4-Flash
- Contexto de un millón de tokens: El modelo soporta una ventana de contexto de 1,000,000 tokens, lo que lo hace adecuado para documentos muy largos, grandes bases de código y sesiones de agentes de múltiples pasos.
- Diseño MoE orientado a la eficiencia: Usa 284B parámetros totales pero solo 13B parámetros activados por solicitud, una configuración orientada a una inferencia más rápida y eficiente.
- Tres modos de razonamiento: Non-think, Think y Think Max permiten intercambiar velocidad por razonamiento más profundo cuando la tarea se complica.
- Arquitectura sólida para contextos largos: DeepSeek afirma que la serie V4 combina Compressed Sparse Attention y Heavily Compressed Attention para mejorar la eficiencia en contextos largos.
- Comportamiento competitivo en programación y agentes: La model card reporta resultados sólidos en benchmarks de programación y comportamiento agentico, incluyendo HumanEval, SWE Verified, Terminal Bench 2.0 y BrowseComp.
- Pesos abiertos y despliegue local: La versión incluye pesos del modelo, guía para inferencia local y una MIT License, lo que hace viable el autoalojamiento y la experimentación.
Rendimiento en benchmarks de DeepSeek-V4-Flash
Resultados seleccionados de la model card oficial muestran que DeepSeek-V4-Flash mejora sobre DeepSeek-V3.2-Base en varios benchmarks clave:
| Benchmark | DeepSeek-V3.2-Base | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base |
|---|---|---|---|
| AGIEval (EM) | 80.1 | 82.6 | 83.1 |
| MMLU (EM) | 87.8 | 88.7 | 90.1 |
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
En la tabla de razonamiento y agentes, la variante Flash también publica resultados sólidos en tareas de terminal y software, con Flash Max alcanzando 56.9 en Terminal Bench 2.0 y 79.0 en SWE Verified, aunque aún por detrás del modelo Pro más grande en las tareas más complejas y de mayor carga de conocimiento.
DeepSeek-V4-Flash vs DeepSeek-V4-Pro vs DeepSeek-V3.2
| Modelo | Mejor para | Compromiso |
|---|---|---|
| DeepSeek-V4-Flash | Trabajo rápido con contextos largos, asistentes de programación y flujos de agentes de alto rendimiento | Un poco por detrás de Pro en conocimiento puro y las tareas de agentes más complejas |
| DeepSeek-V4-Pro | Tareas de máxima capacidad, razonamiento más profundo y flujos de agentes más difíciles | Más pesado y menos orientado a la eficiencia que Flash |
| DeepSeek-V3.2 | Base antigua para comparación y planificación de migración | Rendimiento inferior en benchmarks respecto a V4-Flash en las tablas oficiales |
Casos de uso típicos de DeepSeek-V4-Flash
- Análisis de documentos largos para contratos, paquetes de investigación, bases de conocimiento de soporte y wikis internas.
- Asistentes de programación que necesitan inspeccionar repositorios grandes, seguir instrucciones a través de muchos archivos y mantener el contexto vivo.
- Flujos de agentes donde el modelo necesita razonar, invocar herramientas e iterar sin perder el hilo.
- Sistemas de chat empresariales que se benefician de una ventana de contexto muy grande y un despliegue de baja fricción.
- Despliegues locales de prototipos para equipos que quieren evaluar el comportamiento de DeepSeek-V4 antes del endurecimiento para producción.
Cómo acceder y usar la API de Deepseek v4 Flash
Paso 1: Regístrate para obtener la clave de API
Inicia sesión en cometapi.com. Si aún no eres usuario, regístrate primero. Inicia sesión en tu CometAPI console. Obtén la clave de API de credenciales de acceso de la interfaz. Haz clic en “Add Token” en el token de API del centro personal, obtén la clave de token: sk-xxxxx y envía.
Paso 2: Envía solicitudes a deepseek v4 flash API
Selecciona el endpoint “deepseek-v4-flash” para enviar la solicitud de API y establece el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen del documento de API de nuestro sitio web. Nuestro sitio web también proporciona pruebas con Apifox para tu comodidad. Reemplaza <YOUR_API_KEY> con tu clave real de CometAPI de tu cuenta. Dónde llamarlo: formato Anthropic Messages y formato Chat.
Inserta tu pregunta o solicitud en el campo content — esto es a lo que responderá el modelo. Procesa la respuesta de la API para obtener la respuesta generada.
Paso 3: Recupera y verifica los resultados
Procesa la respuesta de la API para obtener la respuesta generada. Tras el procesamiento, la API responde con el estado de la tarea y los datos de salida. Habilita funciones como streaming, caché de prompts o manejo de contexto largo mediante parámetros estándar.