GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Recherche CometAPI

Qu'est-ce que DeepSeek V4.1 Flash ? Architecture, fonctionnalités & tarification

DeepSeek V4.1 Flash expliqué : MoE de 552B avec encodeur-décodeur causal, économies de cache KV, benchmarks, tarification de l'API, vision native et comparaison V4 Flash/V4 Pro.

CometAPI
Mia MarenÉquipe de recherche sur les modèles IA et API
Mis à jour Sep 10, 2026 14 min de lecture
Qu'est-ce que DeepSeek V4.1 Flash ? Architecture, fonctionnalités & tarification
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DeepSeek V4.1 Flash remplace la courte phase bêta par une version de production conçue autour d’un calcul asymétrique, d’une multimodalité native, de benchmarks agents renforcés et de prix d’API nettement plus bas.

TL;DR

DeepSeek V4.1 Flash est désormais une API officielle et un modèle à poids ouverts, et non plus un endpoint bêta à expiration. DeepSeek indique qu’il s’agit d’un modèle Mixture-of-Experts de 552B paramètres utilisant une nouvelle architecture Causal-Encoder-Decoder. Seuls 8B paramètres sont activés lors du traitement des entrées, tandis que 16B sont activés pendant la génération de sortie. Cette conception asymétrique vise à réduire le calcul sur les longs prompts sans affaiblir la phase de génération auto-régressive.

Le nom du modèle de l’API de production est deepseek-flash. Il prend en charge une fenêtre de contexte de 1M jetons, jusqu’à 384K jetons de sortie, des modes avec réflexion et sans réflexion, la sortie JSON, les appels d’outils, l’API Responses, l’API compatible Anthropic et l’entrée vision native. Le tableau officiel des benchmarks de DeepSeek montre des gains notables par rapport à V4 Flash 0731 et V4 Pro 0813 sur les tâches de codage, d’agents, de cybersécurité et multimodales.

Le changement de tarification est tout aussi important. En période de pointe, V4.1 Flash coûte 0,006 $ par million de jetons d’entrée en cache-hit, 0,30 $ par million de jetons d’entrée en cache-miss et 1,20 $ par million de jetons de sortie. Les tarifs hors pointe sont moitié moindres.

Principaux points à retenir

  • DeepSeek V4.1 Flash est un modèle publié avec poids ouverts ; l’identifiant temporaire deepseek-v4.1-flash-expires-on-0910 n’est plus la référence de production correcte.
  • Son design MoE à 552B active 8B paramètres pour l’entrée et 16B pour la sortie, offrant un profil d’efficacité différent de l’architecture 284B au total/13B actifs de V4 Flash.
  • La multimodalité native fait partie du modèle principal au lieu d’une branche Vision Exp séparée.
  • La comparaison officielle montre V4.1 Flash devant V4 Pro 0813 sur la plupart des benchmarks d’agents et de codage sélectionnés, bien qu’il ne soit pas en tête de tous les benchmarks de connaissances ou de terminal face à tous les concurrents de pointe.
  • Le cache KV global tombe à 890 octets par jeton, environ 3,9 fois plus petit que V4 Flash et environ un quart de son empreinte précédente.
  • Les prix d’API en période de pointe sont de 0,006 $ pour l’entrée en cache-hit, 0,30 $ pour l’entrée en cache-miss et 1,20 $ pour la sortie par million de jetons ; les tarifs hors pointe sont 50 % plus bas.

Qu’est-ce que DeepSeek V4.1 Flash ?

DeepSeek V4.1 Flash est le modèle fondamental de DeepSeek, publié en septembre 2026, axé sur l’efficacité pour le raisonnement, le codage, les agents et la compréhension multimodale. L’annonce officielle le décrit comme un modèle MoE de 552B paramètres qui améliore les capacités tout en réduisant le calcul et la mémoire nécessaires au traitement des entrées.

Le changement clé est architectural. Le précédent V4 Flash utilisait un budget de paramètres actifs unique tout au long de l’inférence. V4.1 Flash sépare les charges d’entrée et de sortie : 8B paramètres sont actifs lors de l’encodage du prompt et 16B sont actifs pendant la génération de réponse. DeepSeek appelle cette conception Causal-Encoder-Decoder.

DateStatutModel ID
Sep 8Bêta limitéedeepseek-v4.1-flash-expires-on-0910
Sep 10Version de productiondeepseek-flash

DeepSeek V4.1 Flash Specification:

SpécificationDeepSeek V4.1 Flash
Statut de publicationAPI officielle et modèle à poids ouverts
ArchitectureMixture-of-Experts avec structure Causal-Encoder-Decoder
Paramètres totaux552B
Paramètres activés8B pour l’entrée ; 16B pour la sortie
Fenêtre de contexte1M jetons
Sortie maximale384K jetons
Modalités d’entréeTexte et images
Modalité de sortieTexte
Nom du modèle API proddeepseek-flash
Modes de réflexionAvec réflexion et sans réflexion
Fonctionnalités APISortie JSON, appels d’outils, Responses API, API Anthropic, complétion par préfixe, complétion FIM
Poids ouvertsPubliés sur Hugging Face

Comment fonctionne DeepSeek V4.1 Flash : Causal-Encoder-Decoder

Les modèles de langage classiques de type decoder-only utilisent essentiellement la même grande pile pour le traitement du prompt et la génération de jetons. DeepSeek V4.1 Flash attribue des capacités actives différentes à ces étapes.

Pendant la phase d’entrée, le modèle traite le prompt avec une empreinte active de 8B. Cette étape peut examiner efficacement le contexte fourni en texte ou image, car la réponse complète n’est pas encore générée. Pendant la phase de sortie, le modèle active 16B paramètres et poursuit la génération causale jeton par jeton. La conception économise donc du calcul lors de l’encodage du prompt tout en conservant davantage de capacité active pour le raisonnement et la génération de réponse.

DeepSeek n’a pas publié tous les détails d’implémentation dans l’annonce ; la description la plus sûre est donc fonctionnelle : l’architecture est asymétrique, les étapes d’entrée et de sortie utilisent des budgets de paramètres actifs différents et le système qui en résulte réduit la mémoire et le coût d’inférence.

Réduction du cache KV

Le résultat en mémoire est mesurable. DeepSeek rapporte 890 octets de cache KV global par jeton pour V4.1 Flash, contre 3 514 octets pour V4 Flash, 48 068 octets pour V3.2 et 389 120 octets pour V1. Le chiffre de V4.1 est environ 3,9 fois plus petit que V4 Flash.

Qu'est-ce que DeepSeek V4.1 Flash ? Architecture, fonctionnalités & tarification

Pour les agents à long contexte, cela compte au-delà d’un seul benchmark. Un cache KV plus petit réduit la pression sur la HBM pendant qu’une requête est active et diminue la quantité d’état à déplacer vers un stockage plus lent. DeepSeek indique que V4.1 Flash a besoin d’environ un quart de la HBM et d’un huitième de la capacité SSD requises par le modèle précédent pour des charges de cache comparables.

Fonctionnalités de DeepSeek V4.1 Flash

Entrée multimodale native

V4.1 Flash accepte les images au sein de l’API du modèle principal. Cela remplace l’ancienne séparation entre V4 Flash uniquement texte et l’endpoint expérimental V4 Flash Vision. Les développeurs peuvent désormais créer des flux de compréhension de documents, d’analyse de graphiques, d’interprétation de captures d’écran et d’agents visuels avec le même modèle de production.

Raisonnement en contexte long

La spécification officielle de l’API conserve une fenêtre de contexte de 1M jetons et permet jusqu’à 384K jetons de sortie. Cela rend le modèle adapté au codage à l’échelle d’un dépôt, à l’analyse multi-documents, aux sessions d’agents longues et aux flux de travail nécessitant de conserver un historique important d’outils.

Fonctionnalités de l’API de production

Le modèle prend en charge les modes avec et sans réflexion, la sortie JSON structurée, les appels d’outils, l’API Responses, une interface compatible Anthropic, la complétion par préfixe et la complétion FIM en mode sans réflexion. Ces capacités font de V4.1 Flash un remplacement direct en production pour de nombreuses charges d’agents et de codage V4 Flash.

Poids ouverts

DeepSeek a publié les poids de V4.1 Flash et un rapport technique. La publication améliore la reproductibilité, mais le modèle reste extrêmement grand : l’annonce de DeepSeek demande aux organisations intéressées par de grands déploiements de prévoir environ 2 000 GPU plus un cluster de stockage.

Performances de benchmark de DeepSeek V4.1 Flash

Les résultats officiels modifient l’évaluation précédente selon laquelle V4.1 n’avait pas de preuves de benchmark. DeepSeek fournit désormais un large tableau couvrant les connaissances, les mathématiques, le codage, les agents terminal, la cybersécurité, l’automatisation et les tâches d’agents multimodales.

Qu'est-ce que DeepSeek V4.1 Flash ? Architecture, fonctionnalités & tarification

BenchmarkDeepSeek V4.1 FlashV4 Pro 0813V4 Flash 0731
GPQA Diamond90.992.489.9
Codeforces rating347133483289
MathArena Apex65.665.358.6
Terminal-Bench 2.190.687.982.7
DeepSWE v1.174.262.754.4
NL2Repo-Bench65.461.554.2
CyberGym88.183.376.7
Automation-Bench54.843.237.7

Sur cette vue sélectionnée de huit benchmarks, V4.1 Flash dépasse V4 Pro 0813 sur sept tests et V4 Flash 0731 sur les huit. Les plus grands gains apparaissent en génie logiciel et agents : DeepSWE grimpe de 11,5 points par rapport à V4 Pro et de 19,8 par rapport à V4 Flash, tandis que Automation-Bench s’améliore de 11,6 et 17,1 points respectivement.

Les résultats doivent encore être interprétés avec prudence. V4.1 Flash est en dessous de V4 Pro sur GPQA Diamond, et le graphique officiel complet montre que Claude Opus 5 et GPT-5.6 Sol restent devant sur Terminal-Bench 3.0. Une conclusion utile est que V4.1 Flash améliore sensiblement l’équilibre efficacité/capacités de DeepSeek ; le tableau des benchmarks ne prouve pas un leadership universel sur chaque tâche.

Tarification de l’API DeepSeek V4.1 Flash

DeepSeek utilise une facturation en heures de pointe et hors pointe. Les heures de pointe sont 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi ; toutes les autres périodes, week-ends compris, utilisent le tarif hors pointe. La documentation tarifaire actuelle indique que les prix hors pointe sont la moitié des prix de pointe.

Prix par 1M jetonsV4.1 Flash hors pointeV4.1 Flash pointeV4 Pro 0813 hors pointeV4 Pro 0813 pointe
Entrée cache-hit0,003 $0,006 $0,022 $0,044 $
Entrée cache-miss0,15 $0,30 $0,66 $1,32 $
Sortie0,60 $1,20 $1,98 $3,96 $

Qu'est-ce que DeepSeek V4.1 Flash ? Architecture, fonctionnalités & tarification

Les économies sont substantielles. Pour une charge utilisant 100 millions de jetons d’entrée en cache-miss et 10 millions de jetons de sortie, V4.1 Flash coûte environ 21 $ hors pointe ou 42 $ en période de pointe. Le même mix de jetons aux tarifs publiés de V4 Pro 0813 coûte environ 85,80 $ hors pointe ou 171,60 $ en période de pointe. V4.1 Flash est environ 75,5 % moins cher dans cet exemple.

Le cache des prompts renforce l’avantage pour les agents qui réutilisent à plusieurs reprises les instructions système, le contexte de dépôt ou des documents. Le tarif cache-hit de V4.1 est 50 fois inférieur à son tarif cache-miss dans les deux périodes de facturation.

DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro

DimensionDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Pro
Paramètres totaux552B284B1,6T
Paramètres activés8B entrée / 16B sortie13B49B
Focalisation archiEfficacité asymétrique entrée/sortieV4 MoE allégéCapacité maximale V4
Vision nativeOuiVariante Vision Exp séparéeNon
Fenêtre de contexte1M1M1M
Sortie maximale384K384K384K
Statut API chez DeepSeekModèle de production actuelRetiré ; l’ancien nom redirige vers V4.1 FlashPrévu pour rediriger vers V4.1 Flash à partir du 14 septembre 2026
Meilleur cas d’usageAgents généraux, codage, vision, haut débitCompatibilité de migration uniquementCharges Pro existantes pendant la transition

V4.1 Flash est plus grand en paramètres totaux que V4 Flash, mais peut être moins coûteux à servir car sa phase d’entrée n’active que 8B paramètres et utilise un cache KV bien plus petit. Par rapport à V4 Pro, il active bien moins de paramètres tout en surpassant Pro sur la plupart des benchmarks d’agents et de codage sélectionnés ci-dessus.

Accès à l’API et migration

Le nom du modèle de production chez DeepSeek est deepseek-flash. Les applications existantes peuvent conserver l’URL de base compatible OpenAI https://api.deepseek.com ou l’URL de base compatible Anthropic https://api.deepseek.com/anthropic.

  1. Mettre à jour le nom du modèle vers deepseek-flash.
  2. Conserver l’URL de base DeepSeek et la méthode d’authentification existantes.
  3. Re-tester le mode de réflexion, les appels d’outils, les entrées vision, la latence et l’usage de jetons avec des prompts de production.
  4. Surveiller les alias hérités : deepseek-v4-flash et deepseek-v4-flash-vision-exp redirigent désormais vers V4.1 Flash, tandis que deepseek-v4-pro doit rediriger vers V4.1 Flash à partir du 14 septembre 2026 jusqu’à la sortie d’un futur V4.1 Pro.

Pour les utilisateurs CometAPI, l’API DeepSeek V4.1 dans CometAPI est désormais disponible aux côtés de l’API DeepSeek V4 Flash. Avant de basculer le trafic de production, confirmez le nom final du modèle, la tarification et la correspondance des alias dans le tableau de bord CometAPI, car les fournisseurs tiers peuvent différer de l’API officielle de DeepSeek en termes de dénominations et de tarifs.

Qui devrait utiliser DeepSeek V4.1 Flash ?

V4.1 Flash convient particulièrement aux agents de codage, à l’analyse de dépôts, à l’automatisation terminal, aux workflows de documents multimodaux, aux assistants à long contexte et aux systèmes à fort volume d’appels d’outils. Ses gains de benchmark se concentrent sur les mêmes charges qui bénéficient le plus d’un cache mémoire plus petit et de prix de jetons plus bas.

Les équipes utilisant déjà V4 Flash devraient le considérer comme un candidat de migration directe. Les équipes utilisant V4 Pro devraient tester avec soin, mais les propres données de benchmark et de tarification de DeepSeek font désormais de V4.1 Flash le choix par défaut plus économique pour de nombreuses charges de classe Pro.

L’auto-hébergement est une décision différente. Des poids ouverts ne rendent pas un modèle de 552B léger. Les organisations devraient comparer le coût d’un large déploiement GPU et stockage à l’usage d’une API hébergée avant de s’engager dans une inférence locale.

Limitations et questions en suspens

  • Les résultats de benchmark proviennent de la configuration d’évaluation officielle de DeepSeek ; des réplications indépendantes seront nécessaires pour mesurer les performances dans différents cadres et environnements d’outils.
  • La prise en charge multimodale native est confirmée, mais les équipes applicatives doivent valider les formats d’image, la comptabilisation des jetons et le comportement vision sur l’API en direct.
  • Les alias de modèles hérités changent désormais le modèle derrière un nom existant, ce qui peut modifier les sorties sans changement de code applicatif.
  • V4.1 Flash réduit les exigences d’infrastructure par rapport aux modèles précédents de DeepSeek, mais son déploiement à poids ouverts nécessite toujours des ressources de calcul et de stockage substantielles.
  • L’endpoint dédié V4.1 de CometAPI et la tarification finale doivent être confirmés dans la console en direct avant un usage en production.

Verdict final

DeepSeek V4.1 Flash est une mise à jour majeure d’architecture et de produit. Le modèle MoE de 552B combine une phase d’entrée active à 8B, une phase de sortie à 16B, la vision native, une fenêtre de contexte de 1M jetons et un cache KV fortement compressé. Ces choix se traduisent par de meilleurs benchmarks officiels de codage et d’agents à des prix d’API bien plus bas que V4 Pro 0813.

Le changement le plus pratique est la consolidation. V4.1 Flash réunit texte, vision, raisonnement, utilisation d’outils et fonctionnement en contexte long sous un seul nom de modèle de production. Pour la plupart des nouvelles intégrations DeepSeek, deepseek-flash est désormais le point de départ logique ; V4 Pro devient une comparaison de migration plutôt que le choix automatique pour les travaux difficiles.

FAQ

DeepSeek V4.1 Flash est-il officiellement publié ?

Oui. Il est disponible via l’API de DeepSeek sous le nom de modèle deepseek-flash, et DeepSeek a publié des poids ouverts ainsi qu’un rapport technique.

L’identifiant temporaire du modèle bêta V4.1 est-il encore requis ?

Non. deepseek-v4.1-flash-expires-on-0910 était un identifiant bêta de courte durée. Les applications de production doivent utiliser deepseek-flash.

Combien de paramètres DeepSeek V4.1 Flash possède-t-il ?

Le modèle a 552B paramètres au total. Il active 8B paramètres pendant le traitement des entrées et 16B pendant la génération de sortie.

DeepSeek V4.1 Flash prend-il en charge les images ?

Oui. L’entrée vision est native au modèle de production, donc un endpoint V4 Flash Vision Exp séparé n’est plus nécessaire.

V4.1 Flash est-il meilleur que V4 Pro ?

Il devance V4 Pro 0813 sur la plupart des comparaisons publiées par DeepSeek en codage, agents, automatisation et cybersécurité, mais V4 Pro reste devant sur GPQA Diamond. Les équipes doivent évaluer les deux avec leurs propres prompts avant migration.

Combien coûte l’API ?

En période de pointe, les tarifs par million de jetons sont de 0,006 $ pour l’entrée en cache-hit, 0,30 $ pour l’entrée en cache-miss et 1,20 $ pour la sortie. Les tarifs hors pointe sont la moitié de ces montants.

Que deviennent les anciens noms de modèles V4 ?

Les noms hérités deepseek-v4-flash et deepseek-v4-flash-vision-exp redirigent vers V4.1 Flash. DeepSeek indique que deepseek-v4-pro redirigera également vers V4.1 Flash à partir du 14 septembre 2026 jusqu’à la sortie de V4.1 Pro.

Puis-je utiliser DeepSeek V4.1 Flash via CometAPI ?

Oui. CometAPI propose désormais un endpoint API DeepSeek V4.1. Avant d’envoyer du trafic de production, confirmez le nom exact du modèle, la tarification et les fonctionnalités prises en charge dans la console CometAPI, car les fournisseurs tiers peuvent utiliser des conventions de nommage ou des tarifs différents de l’API officielle de DeepSeek.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Sep 10, 2026
Dernière mise à jour Sep 10, 2026
0 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus