Spécifications techniques
| Élément | DeepSeek-V4-Pro |
|---|---|
| Fournisseur | DeepSeek |
| Nom du modèle API | deepseek-v4-pro |
| URL de base | https://api.deepseek.com et https://api.deepseek.com/anthropic |
| Type d’entrée | Texte |
| Type de sortie | Texte, appels d’outils, sortie de raisonnement |
| Longueur de contexte | 1,000,000 jetons |
| Sortie maximale | 384,000 jetons |
| Modes de raisonnement | Sans réflexion, réflexion (par défaut) |
| Valeurs par défaut agent/codage | reasoning_effort peut être défini sur high ; des requêtes d’agent complexes peuvent utiliser max |
| Fonctionnalités prises en charge | Sortie JSON, appels d’outils, Chat Prefix Completion (bêta), FIM Completion (bêta en mode sans réflexion) |
| Publication locale/open-weights | 1.6T total parameters, 49B activated parameters, FP4 + FP8 mixed precision |
| Licence (fiche du modèle) | MIT |
| Fiche de référence du modèle | Aperçu de DeepSeek-V4-Pro sur Hugging Face |
Qu’est-ce que DeepSeek-V4-Pro ?
DeepSeek-V4-Pro est le membre le plus performant de la famille d’aperçus V4 de DeepSeek. La fiche officielle du modèle le décrit comme un modèle MoE à 1,6T de paramètres, avec 49B de paramètres activés et une fenêtre de contexte d’un million de jetons, destiné au travail de connaissance à long horizon, à la génération de code et aux tâches d’agent. La documentation de l’API l’expose via l’interface standard de chat-completions DeepSeek et prend en charge les styles SDK OpenAI et Anthropic.
Principales fonctionnalités
- Contexte à un million de jetons : DeepSeek documente une longueur de contexte de 1M de jetons, ce qui rend le modèle adapté à des ensembles de documents très volumineux, des dépôts et des sessions d’agent multi-étapes.
- Deux modes de raisonnement : l’API prend en charge les modes sans réflexion et réflexion ; la réflexion est le mode par défaut, et la documentation indique que des requêtes d’agent complexes telles que Claude Code ou OpenCode peuvent automatiquement utiliser l’effort
max. - Compatible avec les appels d’outils : le mode réflexion de DeepSeek prend en charge les appels d’outils, ce qui est important pour les agents nécessitant la recherche, des opérations sur fichiers ou des fonctions externes.
- Efficacité en long contexte : la fiche du modèle indique que V4 utilise un design d’attention hybride avec Compressed Sparse Attention et Heavily Compressed Attention pour réduire le calcul long-contexte et le coût du cache KV par rapport à V3.2. citeturn980363view2
- Focalisé sur le code et le raisonnement : DeepSeek indique que le mode de raisonnement V4-Pro-Max améliore les benchmarks de codage et comble une grande partie de l’écart avec les principaux modèles propriétaires sur les tâches de raisonnement et d’agent. citeturn980363view2
- Flexibilité des SDK : il est accessible via des chat completions compatibles OpenAI ou via l’endpoint compatible Anthropic de DeepSeek pour des workflows orientés outils.
Performances de référence
La fiche officielle de DeepSeek rapporte les résultats d’évaluation suivants pour la famille de modèles de base et pour l’ensemble comparatif V4-Pro-Max. Dans le tableau des modèles de base, V4-Pro obtient des scores plus élevés que V3.2-Base sur plusieurs benchmarks de connaissances et de long contexte, notamment MMLU-Pro (73.5 vs 65.5), FACTS Parametric (62.6 vs 27.1) et LongBench-V2 (51.5 vs 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
La même fiche de modèle montre aussi que V4-Pro-Max reste compétitif face aux modèles de pointe sur certaines tâches. Par exemple, il affiche 87.5 sur MMLU-Pro, 57.9 sur SimpleQA-Verified, 90.1 sur GPQA Diamond, et 67.9 sur Terminal Bench 2.0 dans le tableau comparatif publié.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modèle | Meilleur usage | Contexte | Notes |
|---|---|---|---|
| DeepSeek-V4-Pro | Raisonnement intensif, codage, agents, grands documents | 1M | Plus grand modèle V4, 49B de paramètres activés, capacité globale la plus forte de la série. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Usage général plus rapide et plus léger | 1M | Modèle plus petit 284B/13B, prend néanmoins en charge la réflexion et les appels d’outils. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Baseline longue-contexte de génération précédente | 128K dans les docs API antérieures ; V4 utilise un design de contexte 1M différent | Utile comme point de référence pour les gains d’efficacité ; la fiche de V4-Pro rapporte de fortes réductions des FLOPs long-contexte et du cache KV par rapport à V3.2. citeturn321011view1turn980363view2 |
Meilleurs cas d’utilisation
- Assistants de codage à l’échelle des dépôts et outils de refactorisation
- Analyse et synthèse de documents longs
- Agents utilisant des outils nécessitant un raisonnement multi-tours
- Flux de support technique bénéficiant d’une longue mémoire et de sorties structurées
- Tâches de connaissances en chinois et multilingues où la fiche du modèle montre de bonnes performances de benchmark
Comment accéder à et utiliser l’API Deepseek v4 pro
Étape 1 : Inscrivez-vous pour obtenir une clé API
Connectez-vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez-vous à votre CometAPI console. Obtenez la clé API d’identification d’accès de l’interface. Cliquez sur « Add Token » dans la section API token du centre personnel, obtenez la clé de jeton : sk-xxxxx et validez.
Étape 2 : Envoyez des requêtes à Deepseek v4 proAPI
Sélectionnez l’endpoint « deepseek-v4-pro » pour envoyer la requête API et définissez le corps de la requête. La méthode et le corps de la requête sont disponibles dans la documentation API de notre site. Notre site propose également un test Apifox pour votre commodité. Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle depuis votre compte. Où l’appeler : format Anthropic Messages et format Chat.
Insérez votre question ou votre requête dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir la réponse générée.
Étape 3 : Récupérer et vérifier les résultats
Traitez la réponse de l’API pour obtenir la réponse générée. Après traitement, l’API renvoie le statut de la tâche et les données de sortie. Activez des fonctionnalités telles que le streaming, la mise en cache des prompts ou la gestion du long contexte via les paramètres standards.