Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →
D

DeepSeek V4 Flash

Entrée:$0.12/M
Sortie:$0.24/M
Publié:Apr 23, 2026

DeepSeek V4 Flash est un modèle à mélange d’experts optimisé pour l’efficacité de DeepSeek, avec 284B de paramètres au total et 13B de paramètres activés, prenant en charge une fenêtre de contexte de 1M de tokens. Il est conçu pour une inférence rapide et des charges de travail à haut débit, tout en conservant de solides performances en raisonnement et en programmation.

Nouveau
Populaire
Usage commercial

Playground pour DeepSeek V4 Flash

Explorez le Playground de DeepSeek V4 Flash — un environnement interactif pour tester les modèles et exécuter des requêtes en temps réel. Essayez des invites, ajustez les paramètres et itérez instantanément pour accélérer le développement et valider les cas d'utilisation.

Caractéristiques techniques de DeepSeek-V4-Flash

ÉlémentDétails
ModelDeepSeek-V4-Flash
ProviderDeepSeek
Familysérie d’aperçu DeepSeek-V4
ArchitectureMixture-of-Experts (MoE)
Total parameters284B
Activated parameters13B
Context length1,000,000 jetons
PrecisionFP4 + FP8 mixte
Reasoning modesNon-think, Think, Think Max
Release statusModèle en aperçu
LicenseLicence MIT

Qu’est-ce que DeepSeek-V4-Flash ?

DeepSeek-V4-Flash est le modèle en aperçu de DeepSeek axé sur l’efficacité dans la série V4. Il est construit comme un modèle de langage Mixture-of-Experts avec une empreinte active relativement petite pour sa taille, ce qui l’aide à rester réactif tout en prenant en charge une très grande fenêtre de contexte de 1M de jetons.

Principales fonctionnalités de DeepSeek-V4-Flash

  • Contexte d’un million de jetons : Le modèle prend en charge une fenêtre de contexte de 1,000,000 jetons, ce qui le rend adapté aux documents très longs, aux grands dépôts de code et aux sessions d’agents multi-étapes.
  • Conception MoE axée sur l’efficacité : Il utilise 284B de paramètres au total mais seulement 13B de paramètres activés par requête, une configuration visant une inférence plus rapide et plus efficace.
  • Trois modes de raisonnement : Non-think, Think et Think Max vous permettent d’échanger de la vitesse contre un raisonnement plus poussé lorsque la tâche se complique.
  • Architecture robuste pour le long contexte : DeepSeek indique que la série V4 combine Compressed Sparse Attention et Heavily Compressed Attention afin d’améliorer l’efficacité sur les longs contextes.
  • Codage et comportement d’agent compétitifs : La fiche du modèle rapporte de solides résultats sur des benchmarks de codage et d’agent, notamment HumanEval, SWE Verified, Terminal Bench 2.0 et BrowseComp.
  • Poids ouverts et déploiement local : La publication inclut les poids du modèle, des indications pour l’inférence locale et une Licence MIT, ce qui rend l’auto-hébergement et l’expérimentation pratiques.

Performances de DeepSeek-V4-Flash aux benchmarks

Des résultats sélectionnés de la fiche officielle du modèle montrent que DeepSeek-V4-Flash améliore DeepSeek-V3.2-Base sur plusieurs benchmarks clés :

BenchmarkDeepSeek-V3.2-BaseDeepSeek-V4-Flash-BaseDeepSeek-V4-Pro-Base
AGIEval (EM)80.182.683.1
MMLU (EM)87.888.790.1
MMLU-Pro (EM)65.568.373.5
HumanEval (Pass@1)62.869.576.8
LongBench-V2 (EM)40.244.751.5

Dans le tableau raisonnement-et-agents, la variante Flash affiche également de bons résultats sur les tâches terminal et logicielle, avec Flash Max atteignant 56.9 sur Terminal Bench 2.0 et 79.0 sur SWE Verified, tout en restant derrière le modèle Pro plus grand sur les tâches les plus difficiles axées sur la connaissance et l’agentique.

DeepSeek-V4-Flash vs DeepSeek-V4-Pro vs DeepSeek-V3.2

ModèleMeilleur usageCompromis
DeepSeek-V4-FlashTravaux rapides et à long contexte, assistants de codage, et flux d’agents à haut débitLégèrement derrière Pro sur les tâches de pure connaissance et les tâches agentiques les plus complexes
DeepSeek-V4-ProTâches de plus haute capacité, raisonnement plus approfondi, et workflows d’agents plus difficilesPlus lourd et moins axé sur l’efficacité que Flash
DeepSeek-V3.2Ligne de base plus ancienne pour la comparaison et la planification de migrationPerformances aux benchmarks inférieures à V4-Flash dans les tableaux officiels

Cas d’utilisation typiques de DeepSeek-V4-Flash

  1. Analyse de longs documents pour des contrats, des dossiers de recherche, des bases de connaissances support et des wikis internes.
  2. Assistants de codage devant inspecter de grands dépôts, suivre des instructions à travers de nombreux fichiers et conserver le contexte.
  3. Workflows d’agents où le modèle doit raisonner, appeler des outils et itérer sans perdre le fil.
  4. Systèmes de chat d’entreprise bénéficiant d’une très grande fenêtre de contexte et d’un déploiement à faible friction.
  5. Déploiements locaux de prototype pour les équipes souhaitant évaluer le comportement de DeepSeek-V4 avant le durcissement pour la production.

Comment accéder et utiliser l’API Deepseek v4 Flash

Étape 1 : S’inscrire pour obtenir une clé API

Connectez-vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez-vous à votre CometAPI console. Obtenez la clé API d’identification d’accès de l’interface. Cliquez sur “Add Token” au jeton API dans le centre personnel, obtenez la clé de jeton : sk-xxxxx et soumettez.

Étape 2 : Envoyer des requêtes à l’API deepseek v4 flash

Sélectionnez le point de terminaison “deepseek-v4-flash” pour envoyer la requête API et définir le corps de la requête. La méthode de requête et le corps de la requête sont obtenus à partir de la documentation API de notre site Web. Notre site propose également un test Apifox pour votre commodité. Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle de votre compte. Où l’appeler : format Anthropic Messages et format Chat.

Insérez votre question ou demande dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir la réponse générée.

Étape 3 : Récupérer et vérifier les résultats

Traitez la réponse de l’API pour obtenir la réponse générée. Après traitement, l’API répond avec le statut de la tâche et les données de sortie. Activez des fonctionnalités telles que le streaming, la mise en cache des prompts, ou la gestion du long contexte via des paramètres standard.

FAQ

Tarification pour DeepSeek V4 Flash

Découvrez des tarifs compétitifs pour DeepSeek V4 Flash, conçus pour s'adapter à différents budgets et besoins d'utilisation. Nos formules flexibles garantissent que vous ne payez que ce que vous utilisez, ce qui facilite l'adaptation à mesure que vos besoins évoluent. Découvrez comment DeepSeek V4 Flash peut améliorer vos projets tout en maîtrisant les coûts.

Comet Price (USD / M Tokens)Official Price (USD / M Tokens)Discount
Entrée:$0.12/M
Sortie:$0.24/M
Entrée:$0.15/M
Sortie:$0.3/M
-20%

Exemple de code et API pour DeepSeek V4 Flash

Accédez à des exemples de code complets et aux ressources API pour DeepSeek V4 Flash afin de simplifier votre processus d'intégration. Notre documentation détaillée fournit des instructions étape par étape pour vous aider à exploiter tout le potentiel de DeepSeek V4 Flash dans vos projets.

from openai import OpenAI
import os

# Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
COMETAPI_KEY = os.environ.get("COMETAPI_KEY") or "<YOUR_COMETAPI_KEY>"
BASE_URL = "https://api.cometapi.com/v1"

client = OpenAI(base_url=BASE_URL, api_key=COMETAPI_KEY)

completion = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Hello!"},
    ],
    stream=False,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(completion.choices[0].message.content)

Python Code Example

from openai import OpenAI
import os

# Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
COMETAPI_KEY = os.environ.get("COMETAPI_KEY") or "<YOUR_COMETAPI_KEY>"
BASE_URL = "https://api.cometapi.com/v1"

client = OpenAI(base_url=BASE_URL, api_key=COMETAPI_KEY)

completion = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Hello!"},
    ],
    stream=False,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(completion.choices[0].message.content)

JavaScript Code Example

import OpenAI from "openai";

// Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
const api_key = process.env.COMETAPI_KEY || "<YOUR_COMETAPI_KEY>";
const base_url = "https://api.cometapi.com/v1";

const client = new OpenAI({
  apiKey: api_key,
  baseURL: base_url,
});

const completion = await client.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "system", content: "You are a helpful assistant." },
    { role: "user", content: "Hello!" },
  ],
  thinking: { type: "enabled" },
  reasoning_effort: "high",
  stream: false,
});

console.log(completion.choices[0].message.content);

Curl Code Example

curl https://api.cometapi.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "thinking": {
      "type": "enabled"
    },
    "reasoning_effort": "high",
    "stream": false
  }'

Uptime

Taux de succès des requêtes sur les 30 derniers jours, reflétant la fiabilité de chaque fournisseur de modèles. CometAPI surveille tous les fournisseurs connectés en temps réel, 24h/24 et 7j/7.

RespondLIVE
2370msAvg. Response
UptimeLIVE
100.0%Avg. Uptime