DeepSeek V4.1 Flash remplace la courte phase bêta par une version de production conçue autour d’un calcul asymétrique, d’une multimodalité native, de benchmarks agents renforcés et de prix d’API nettement plus bas.
TL;DR
DeepSeek V4.1 Flash est désormais une API officielle et un modèle à poids ouverts, et non plus un endpoint bêta à expiration. DeepSeek indique qu’il s’agit d’un modèle Mixture-of-Experts de 552B paramètres utilisant une nouvelle architecture Causal-Encoder-Decoder. Seuls 8B paramètres sont activés lors du traitement des entrées, tandis que 16B sont activés pendant la génération de sortie. Cette conception asymétrique vise à réduire le calcul sur les longs prompts sans affaiblir la phase de génération auto-régressive.
Le nom du modèle de l’API de production est deepseek-flash. Il prend en charge une fenêtre de contexte de 1M jetons, jusqu’à 384K jetons de sortie, des modes avec réflexion et sans réflexion, la sortie JSON, les appels d’outils, l’API Responses, l’API compatible Anthropic et l’entrée vision native. Le tableau officiel des benchmarks de DeepSeek montre des gains notables par rapport à V4 Flash 0731 et V4 Pro 0813 sur les tâches de codage, d’agents, de cybersécurité et multimodales.
Le changement de tarification est tout aussi important. En période de pointe, V4.1 Flash coûte 0,006 $ par million de jetons d’entrée en cache-hit, 0,30 $ par million de jetons d’entrée en cache-miss et 1,20 $ par million de jetons de sortie. Les tarifs hors pointe sont moitié moindres.
Principaux points à retenir
- DeepSeek V4.1 Flash est un modèle publié avec poids ouverts ; l’identifiant temporaire
deepseek-v4.1-flash-expires-on-0910n’est plus la référence de production correcte. - Son design MoE à 552B active 8B paramètres pour l’entrée et 16B pour la sortie, offrant un profil d’efficacité différent de l’architecture 284B au total/13B actifs de V4 Flash.
- La multimodalité native fait partie du modèle principal au lieu d’une branche Vision Exp séparée.
- La comparaison officielle montre V4.1 Flash devant V4 Pro 0813 sur la plupart des benchmarks d’agents et de codage sélectionnés, bien qu’il ne soit pas en tête de tous les benchmarks de connaissances ou de terminal face à tous les concurrents de pointe.
- Le cache KV global tombe à 890 octets par jeton, environ 3,9 fois plus petit que V4 Flash et environ un quart de son empreinte précédente.
- Les prix d’API en période de pointe sont de 0,006 $ pour l’entrée en cache-hit, 0,30 $ pour l’entrée en cache-miss et 1,20 $ pour la sortie par million de jetons ; les tarifs hors pointe sont 50 % plus bas.
Qu’est-ce que DeepSeek V4.1 Flash ?
DeepSeek V4.1 Flash est le modèle fondamental de DeepSeek, publié en septembre 2026, axé sur l’efficacité pour le raisonnement, le codage, les agents et la compréhension multimodale. L’annonce officielle le décrit comme un modèle MoE de 552B paramètres qui améliore les capacités tout en réduisant le calcul et la mémoire nécessaires au traitement des entrées.
Le changement clé est architectural. Le précédent V4 Flash utilisait un budget de paramètres actifs unique tout au long de l’inférence. V4.1 Flash sépare les charges d’entrée et de sortie : 8B paramètres sont actifs lors de l’encodage du prompt et 16B sont actifs pendant la génération de réponse. DeepSeek appelle cette conception Causal-Encoder-Decoder.
| Date | Statut | Model ID |
|---|---|---|
| Sep 8 | Bêta limitée | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Version de production | deepseek-flash |
DeepSeek V4.1 Flash Specification:
| Spécification | DeepSeek V4.1 Flash |
|---|---|
| Statut de publication | API officielle et modèle à poids ouverts |
| Architecture | Mixture-of-Experts avec structure Causal-Encoder-Decoder |
| Paramètres totaux | 552B |
| Paramètres activés | 8B pour l’entrée ; 16B pour la sortie |
| Fenêtre de contexte | 1M jetons |
| Sortie maximale | 384K jetons |
| Modalités d’entrée | Texte et images |
| Modalité de sortie | Texte |
| Nom du modèle API prod | deepseek-flash |
| Modes de réflexion | Avec réflexion et sans réflexion |
| Fonctionnalités API | Sortie JSON, appels d’outils, Responses API, API Anthropic, complétion par préfixe, complétion FIM |
| Poids ouverts | Publiés sur Hugging Face |
Comment fonctionne DeepSeek V4.1 Flash : Causal-Encoder-Decoder
Les modèles de langage classiques de type decoder-only utilisent essentiellement la même grande pile pour le traitement du prompt et la génération de jetons. DeepSeek V4.1 Flash attribue des capacités actives différentes à ces étapes.
Pendant la phase d’entrée, le modèle traite le prompt avec une empreinte active de 8B. Cette étape peut examiner efficacement le contexte fourni en texte ou image, car la réponse complète n’est pas encore générée. Pendant la phase de sortie, le modèle active 16B paramètres et poursuit la génération causale jeton par jeton. La conception économise donc du calcul lors de l’encodage du prompt tout en conservant davantage de capacité active pour le raisonnement et la génération de réponse.
DeepSeek n’a pas publié tous les détails d’implémentation dans l’annonce ; la description la plus sûre est donc fonctionnelle : l’architecture est asymétrique, les étapes d’entrée et de sortie utilisent des budgets de paramètres actifs différents et le système qui en résulte réduit la mémoire et le coût d’inférence.
Réduction du cache KV
Le résultat en mémoire est mesurable. DeepSeek rapporte 890 octets de cache KV global par jeton pour V4.1 Flash, contre 3 514 octets pour V4 Flash, 48 068 octets pour V3.2 et 389 120 octets pour V1. Le chiffre de V4.1 est environ 3,9 fois plus petit que V4 Flash.
Pour les agents à long contexte, cela compte au-delà d’un seul benchmark. Un cache KV plus petit réduit la pression sur la HBM pendant qu’une requête est active et diminue la quantité d’état à déplacer vers un stockage plus lent. DeepSeek indique que V4.1 Flash a besoin d’environ un quart de la HBM et d’un huitième de la capacité SSD requises par le modèle précédent pour des charges de cache comparables.
Fonctionnalités de DeepSeek V4.1 Flash
Entrée multimodale native
V4.1 Flash accepte les images au sein de l’API du modèle principal. Cela remplace l’ancienne séparation entre V4 Flash uniquement texte et l’endpoint expérimental V4 Flash Vision. Les développeurs peuvent désormais créer des flux de compréhension de documents, d’analyse de graphiques, d’interprétation de captures d’écran et d’agents visuels avec le même modèle de production.
Raisonnement en contexte long
La spécification officielle de l’API conserve une fenêtre de contexte de 1M jetons et permet jusqu’à 384K jetons de sortie. Cela rend le modèle adapté au codage à l’échelle d’un dépôt, à l’analyse multi-documents, aux sessions d’agents longues et aux flux de travail nécessitant de conserver un historique important d’outils.
Fonctionnalités de l’API de production
Le modèle prend en charge les modes avec et sans réflexion, la sortie JSON structurée, les appels d’outils, l’API Responses, une interface compatible Anthropic, la complétion par préfixe et la complétion FIM en mode sans réflexion. Ces capacités font de V4.1 Flash un remplacement direct en production pour de nombreuses charges d’agents et de codage V4 Flash.
Poids ouverts
DeepSeek a publié les poids de V4.1 Flash et un rapport technique. La publication améliore la reproductibilité, mais le modèle reste extrêmement grand : l’annonce de DeepSeek demande aux organisations intéressées par de grands déploiements de prévoir environ 2 000 GPU plus un cluster de stockage.
Performances de benchmark de DeepSeek V4.1 Flash
Les résultats officiels modifient l’évaluation précédente selon laquelle V4.1 n’avait pas de preuves de benchmark. DeepSeek fournit désormais un large tableau couvrant les connaissances, les mathématiques, le codage, les agents terminal, la cybersécurité, l’automatisation et les tâches d’agents multimodales.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
Sur cette vue sélectionnée de huit benchmarks, V4.1 Flash dépasse V4 Pro 0813 sur sept tests et V4 Flash 0731 sur les huit. Les plus grands gains apparaissent en génie logiciel et agents : DeepSWE grimpe de 11,5 points par rapport à V4 Pro et de 19,8 par rapport à V4 Flash, tandis que Automation-Bench s’améliore de 11,6 et 17,1 points respectivement.
Les résultats doivent encore être interprétés avec prudence. V4.1 Flash est en dessous de V4 Pro sur GPQA Diamond, et le graphique officiel complet montre que Claude Opus 5 et GPT-5.6 Sol restent devant sur Terminal-Bench 3.0. Une conclusion utile est que V4.1 Flash améliore sensiblement l’équilibre efficacité/capacités de DeepSeek ; le tableau des benchmarks ne prouve pas un leadership universel sur chaque tâche.
Tarification de l’API DeepSeek V4.1 Flash
DeepSeek utilise une facturation en heures de pointe et hors pointe. Les heures de pointe sont 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi ; toutes les autres périodes, week-ends compris, utilisent le tarif hors pointe. La documentation tarifaire actuelle indique que les prix hors pointe sont la moitié des prix de pointe.
| Prix par 1M jetons | V4.1 Flash hors pointe | V4.1 Flash pointe | V4 Pro 0813 hors pointe | V4 Pro 0813 pointe |
|---|---|---|---|---|
| Entrée cache-hit | 0,003 $ | 0,006 $ | 0,022 $ | 0,044 $ |
| Entrée cache-miss | 0,15 $ | 0,30 $ | 0,66 $ | 1,32 $ |
| Sortie | 0,60 $ | 1,20 $ | 1,98 $ | 3,96 $ |

Les économies sont substantielles. Pour une charge utilisant 100 millions de jetons d’entrée en cache-miss et 10 millions de jetons de sortie, V4.1 Flash coûte environ 21 $ hors pointe ou 42 $ en période de pointe. Le même mix de jetons aux tarifs publiés de V4 Pro 0813 coûte environ 85,80 $ hors pointe ou 171,60 $ en période de pointe. V4.1 Flash est environ 75,5 % moins cher dans cet exemple.
Le cache des prompts renforce l’avantage pour les agents qui réutilisent à plusieurs reprises les instructions système, le contexte de dépôt ou des documents. Le tarif cache-hit de V4.1 est 50 fois inférieur à son tarif cache-miss dans les deux périodes de facturation.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Paramètres totaux | 552B | 284B | 1,6T |
| Paramètres activés | 8B entrée / 16B sortie | 13B | 49B |
| Focalisation archi | Efficacité asymétrique entrée/sortie | V4 MoE allégé | Capacité maximale V4 |
| Vision native | Oui | Variante Vision Exp séparée | Non |
| Fenêtre de contexte | 1M | 1M | 1M |
| Sortie maximale | 384K | 384K | 384K |
| Statut API chez DeepSeek | Modèle de production actuel | Retiré ; l’ancien nom redirige vers V4.1 Flash | Prévu pour rediriger vers V4.1 Flash à partir du 14 septembre 2026 |
| Meilleur cas d’usage | Agents généraux, codage, vision, haut débit | Compatibilité de migration uniquement | Charges Pro existantes pendant la transition |
V4.1 Flash est plus grand en paramètres totaux que V4 Flash, mais peut être moins coûteux à servir car sa phase d’entrée n’active que 8B paramètres et utilise un cache KV bien plus petit. Par rapport à V4 Pro, il active bien moins de paramètres tout en surpassant Pro sur la plupart des benchmarks d’agents et de codage sélectionnés ci-dessus.
Accès à l’API et migration
Le nom du modèle de production chez DeepSeek est deepseek-flash. Les applications existantes peuvent conserver l’URL de base compatible OpenAI https://api.deepseek.com ou l’URL de base compatible Anthropic https://api.deepseek.com/anthropic.
- Mettre à jour le nom du modèle vers
deepseek-flash. - Conserver l’URL de base DeepSeek et la méthode d’authentification existantes.
- Re-tester le mode de réflexion, les appels d’outils, les entrées vision, la latence et l’usage de jetons avec des prompts de production.
- Surveiller les alias hérités :
deepseek-v4-flashetdeepseek-v4-flash-vision-expredirigent désormais vers V4.1 Flash, tandis quedeepseek-v4-prodoit rediriger vers V4.1 Flash à partir du 14 septembre 2026 jusqu’à la sortie d’un futur V4.1 Pro.
Pour les utilisateurs CometAPI, l’API DeepSeek V4.1 dans CometAPI est désormais disponible aux côtés de l’API DeepSeek V4 Flash. Avant de basculer le trafic de production, confirmez le nom final du modèle, la tarification et la correspondance des alias dans le tableau de bord CometAPI, car les fournisseurs tiers peuvent différer de l’API officielle de DeepSeek en termes de dénominations et de tarifs.
Qui devrait utiliser DeepSeek V4.1 Flash ?
V4.1 Flash convient particulièrement aux agents de codage, à l’analyse de dépôts, à l’automatisation terminal, aux workflows de documents multimodaux, aux assistants à long contexte et aux systèmes à fort volume d’appels d’outils. Ses gains de benchmark se concentrent sur les mêmes charges qui bénéficient le plus d’un cache mémoire plus petit et de prix de jetons plus bas.
Les équipes utilisant déjà V4 Flash devraient le considérer comme un candidat de migration directe. Les équipes utilisant V4 Pro devraient tester avec soin, mais les propres données de benchmark et de tarification de DeepSeek font désormais de V4.1 Flash le choix par défaut plus économique pour de nombreuses charges de classe Pro.
L’auto-hébergement est une décision différente. Des poids ouverts ne rendent pas un modèle de 552B léger. Les organisations devraient comparer le coût d’un large déploiement GPU et stockage à l’usage d’une API hébergée avant de s’engager dans une inférence locale.
Limitations et questions en suspens
- Les résultats de benchmark proviennent de la configuration d’évaluation officielle de DeepSeek ; des réplications indépendantes seront nécessaires pour mesurer les performances dans différents cadres et environnements d’outils.
- La prise en charge multimodale native est confirmée, mais les équipes applicatives doivent valider les formats d’image, la comptabilisation des jetons et le comportement vision sur l’API en direct.
- Les alias de modèles hérités changent désormais le modèle derrière un nom existant, ce qui peut modifier les sorties sans changement de code applicatif.
- V4.1 Flash réduit les exigences d’infrastructure par rapport aux modèles précédents de DeepSeek, mais son déploiement à poids ouverts nécessite toujours des ressources de calcul et de stockage substantielles.
- L’endpoint dédié V4.1 de CometAPI et la tarification finale doivent être confirmés dans la console en direct avant un usage en production.
Verdict final
DeepSeek V4.1 Flash est une mise à jour majeure d’architecture et de produit. Le modèle MoE de 552B combine une phase d’entrée active à 8B, une phase de sortie à 16B, la vision native, une fenêtre de contexte de 1M jetons et un cache KV fortement compressé. Ces choix se traduisent par de meilleurs benchmarks officiels de codage et d’agents à des prix d’API bien plus bas que V4 Pro 0813.
Le changement le plus pratique est la consolidation. V4.1 Flash réunit texte, vision, raisonnement, utilisation d’outils et fonctionnement en contexte long sous un seul nom de modèle de production. Pour la plupart des nouvelles intégrations DeepSeek, deepseek-flash est désormais le point de départ logique ; V4 Pro devient une comparaison de migration plutôt que le choix automatique pour les travaux difficiles.
FAQ
DeepSeek V4.1 Flash est-il officiellement publié ?
Oui. Il est disponible via l’API de DeepSeek sous le nom de modèle deepseek-flash, et DeepSeek a publié des poids ouverts ainsi qu’un rapport technique.
L’identifiant temporaire du modèle bêta V4.1 est-il encore requis ?
Non. deepseek-v4.1-flash-expires-on-0910 était un identifiant bêta de courte durée. Les applications de production doivent utiliser deepseek-flash.
Combien de paramètres DeepSeek V4.1 Flash possède-t-il ?
Le modèle a 552B paramètres au total. Il active 8B paramètres pendant le traitement des entrées et 16B pendant la génération de sortie.
DeepSeek V4.1 Flash prend-il en charge les images ?
Oui. L’entrée vision est native au modèle de production, donc un endpoint V4 Flash Vision Exp séparé n’est plus nécessaire.
V4.1 Flash est-il meilleur que V4 Pro ?
Il devance V4 Pro 0813 sur la plupart des comparaisons publiées par DeepSeek en codage, agents, automatisation et cybersécurité, mais V4 Pro reste devant sur GPQA Diamond. Les équipes doivent évaluer les deux avec leurs propres prompts avant migration.
Combien coûte l’API ?
En période de pointe, les tarifs par million de jetons sont de 0,006 $ pour l’entrée en cache-hit, 0,30 $ pour l’entrée en cache-miss et 1,20 $ pour la sortie. Les tarifs hors pointe sont la moitié de ces montants.
Que deviennent les anciens noms de modèles V4 ?
Les noms hérités deepseek-v4-flash et deepseek-v4-flash-vision-exp redirigent vers V4.1 Flash. DeepSeek indique que deepseek-v4-pro redirigera également vers V4.1 Flash à partir du 14 septembre 2026 jusqu’à la sortie de V4.1 Pro.
Puis-je utiliser DeepSeek V4.1 Flash via CometAPI ?
Oui. CometAPI propose désormais un endpoint API DeepSeek V4.1. Avant d’envoyer du trafic de production, confirmez le nom exact du modèle, la tarification et les fonctionnalités prises en charge dans la console CometAPI, car les fournisseurs tiers peuvent utiliser des conventions de nommage ou des tarifs différents de l’API officielle de DeepSeek.
