GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness : Guide de la percée dans la programmation agentique (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness : Guide de la percée dans la programmation agentique (2026)

TLDR DeepSeek-V4-Flash-0731 (publié le 31 juillet 2026) est la version officielle, prête pour la production, du modèle Mixture-of-Experts efficace de DeepSeek (284B paramètres totaux / 13B actifs, contexte de 1M de tokens). Grâce à un post-entraînement ciblé, il apporte des gains spectaculaires en codage agentique, utilisation d’outils et ingénierie logicielle multi-étapes. Il prend en charge nativement la Responses API et OpenAI Codex. DeepSeek Harness est le framework d’agent compagnon (mode minimal déjà utilisé dans les évaluations officielles ; version complète à venir) conçu pour transformer le modèle en un agent autonome fiable.

Ensemble, ils offrent l’un des meilleurs rapports coût/performance en IA agentique à poids ouverts et accessible via API à la date d’août 2026.

Points clés

  • Avancée agentique majeure via post-entraînement uniquement : même architecture 284B/13B que l’aperçu d’avril, mais scores nettement supérieurs (par ex., Terminal Bench 2.1 : 82,7 vs 61,8 ; DeepSWE : 54,4 vs 7,3).
  • Surpasse DeepSeek-V4-Pro (Preview) sur plusieurs benchmarks d’agents malgré bien moins de paramètres activés.
  • Compétitif face aux meilleurs modèles propriétaires (proche de Claude Opus 4.8 sur plusieurs tâches d’agent) pour une fraction du coût.
  • Contexte natif 1M, décodage spéculatif (DSpark), trois niveaux d’effort de raisonnement (low/high/max), licence MIT, poids ouverts.
  • Prise en charge officielle de la Responses API et de Codex (CLI, desktop, extension VS Code).
  • DeepSeek Harness (mode minimal déjà utilisé dans les évaluations) est le framework d’agent officiel en bêta fermée ; sortie publique attendue prochainement. DeepSeek Harness fournit la couche d’exécution agent ; modèle + harness = agent de production.
  • Idéal pour les agents de codage à grand volume, l’automatisation de terminal, l’utilisation d’outils et les workflows à long contexte.
  • Accédez aux modèles DeepSeek à coût maîtrisé et avec un outillage unifié via CometAPI (endpoint compatible OpenAI, tarification compétitive, routage multi-modèles).

Quoi de neuf dans DeepSeek V4 Flash 0731 ?

Statut de sortie officielle modifié

Le changement produit le plus important est que DeepSeek V4 Flash 0731 est désormais la version officielle de DeepSeek V4 Flash sur l’API, en bêta publique. Le journal des modifications du 31 juillet de DeepSeek indique que les développeurs peuvent continuer à appeler le même nom de modèle, deepseek-v4-flash, pour accéder à la dernière version. C’est important pour la migration, car cela évite un nouveau slug de modèle et permet aux équipes de tester la mise à jour derrière la logique de routage existante.

DeepSeek précise également que la mise à jour ne concerne que l’API V4 Flash. L’API V4 Pro et les modèles de l’application/web n’ont pas été modifiés par la sortie du 31 juillet, et DeepSeek a indiqué que la version officielle de V4 Pro suivrait bientôt. En d’autres termes, il ne s’agit pas d’un rafraîchissement complet de la famille DeepSeek V4. C’est une mise à jour ciblée de Flash.

Architecture inchangée, post-entraînement modifié

L’architecture centrale reste inchangée : un modèle Mixture-of-Experts (MoE) avec 284 milliards de paramètres totaux et seulement 13 milliards activés par token, un design d’attention hybride optimisé pour le long contexte, et une fenêtre de contexte native de 1 million de tokens. Un module de décodage spéculatif (DSpark) est attaché pour une génération plus rapide. Le modèle est texte uniquement, prend en charge des niveaux d’effort de raisonnement réglables (low / high / max), l’appel d’outils, la sortie structurée, et est publié sous licence MIT permissive.

Cette distinction est importante. Beaucoup de mises à jour de modèles s’améliorent parce que le modèle est plus grand. Cette mise à jour est plus intéressante car DeepSeek revendique une grande avancée agentique sans augmenter l’empreinte en paramètres. V4 Flash reste un modèle Mixture-of-Experts 284B au total, 13B actifs, bien plus petit à l’inférence que le design 1,6T au total, 49B actifs de V4 Pro.

Les scores de codage agentique ont bondi

Le tableau officiel de DeepSeek montre des améliorations majeures sur des tâches de terminal, construction de dépôt, cyber, ingénierie logicielle, utilisation d’outils, automatisation et full‑stack. Le plus grand bond absolu par rapport à l’ancien aperçu Flash est sur DeepSWE : 54,4 contre 7,3, soit une augmentation de 47,1 points. Cybergym s’améliore de 38,0 points, DSBench‑Hard de 33,8 points, et DSBench‑FullStack de 31,7 points.

C’est pourquoi V4 Flash 0731 est moins discuté comme un simple « fast model » et davantage comme un candidat modèle par défaut pour les agents de codage. La proposition de valeur n’est pas seulement du chat bon marché. C’est une inférence d’agent économique, long-contexte et compatible outils.

La Responses API et la prise en charge de Codex sont arrivées

Le journal de modifications du 31 juillet de DeepSeek indique que le V4 Flash officiel prend en charge nativement le format Responses API et est spécifiquement adapté pour Codex. Le guide Responses API de DeepSeek indique que le format a été ajouté pour répondre à la demande de Codex, utilise l’URL de base https://api.deepseek.com, et prend actuellement en charge deepseek-v4-flash.

Cela compte car les workflows de développement de type Codex ne sont pas de simples sessions de chat. Ils nécessitent des éléments d’entrée et de sortie structurés, des éléments de raisonnement, des appels d’outils, des opérations de modification de fichiers, des événements de streaming, de la comptabilité d’usage, et une intégration avec des clients agents de codage. La prise en charge de DeepSeek n’est pas un clone parfait de toutes les capacités de la Responses API d’OpenAI, mais elle est suffisante pour faire de V4 Flash un candidat bien plus pratique « drop‑in » pour des expérimentations d’agents de codage.

Benchmarks de performance pour la version officielle V4‑Flash

Mises en garde sur les benchmarks à ne pas ignorer pour les développeurs

Les résultats d’évaluation officiels (rapportés par DeepSeek sur la fiche du modèle) montrent de grands sauts par rapport à l’aperçu et, de manière remarquable, par rapport au V4‑Pro Preview bien plus grand sur des tâches centrées agent. Les évaluations pour les benchmarks d’agents de code ont utilisé le minimal mode de DeepSeek Harness (à publier) avec l’effort de raisonnement au maximum, temperature = 1.0, top_p = 0.95.

Cela a deux implications. Premièrement, le résultat est en partie un résultat modèle + harness. Si votre runtime d’agent dispose d’outils, permissions shell, gestion du contexte, reprises, règles de patch ou gestion des erreurs différentes, vous pourriez ne pas obtenir les mêmes scores. Deuxièmement, la reproduction indépendante est limitée jusqu’à ce que DeepSeek publie suffisamment du harness et de la configuration d’évaluation pour que des équipes externes puissent exécuter des tests comparables.

Tableau de benchmark officiel de DeepSeek

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

Sur ces neuf benchmarks, V4 Flash 0731 affiche une moyenne de 55,2. L’ancien V4 Flash preview affiche 29,6, et V4‑Pro Preview 34,9. Cela signifie que V4 Flash 0731 est environ 25,6 points au‑dessus du Flash preview et 20,3 points au‑dessus de V4‑Pro Preview dans ce tableau.

Indices tiers

L’ARC Prize signale que V4 Flash 0731 en effort max obtient 89,0 % sur ARC‑AGI‑1 Semi‑Private et 61,4 % sur ARC‑AGI‑2 Semi‑Private, avec des coûts indiqués de 0,02 $ et 0,04 $ par tâche. Ce ne sont pas des benchmarks d’agent de code, mais ils soutiennent l’idée plus large que le modèle est compétitif sur des tâches de raisonnement lorsqu’il est exécuté à effort élevé.

Les gains sont particulièrement frappants sur DeepSWE (boucle d’agent d’ingénierie logicielle) et Cybergym. Des mesures indépendantes (par ex., Artificial Analysis) rapportent des chiffres Terminal‑Bench légèrement inférieurs mais toujours solides autour de 79 %, confirmant la direction de l’amélioration tout en rappelant que les chiffres avec harness fournisseur tendent à être optimistes.

Un contexte supplémentaire provenant des évaluations V4 antérieures et des agrégateurs tiers montre de solides performances en connaissance et en codage en mode raisonnement max (GPQA Diamond ~88–91 %, LiveCodeBench entre haut 80 et 90 selon la source). Le post-entraînement 0731 a spécifiquement débloqué une fiabilité agentique qui manquait à l’aperçu.

DeepSeek‑V4‑Flash prend désormais en charge la Responses API et Codex

Un ajout stratégiquement important est la prise en charge native de la Responses API d’OpenAI. La documentation officielle de DeepSeek confirme que la Responses API prend actuellement en charge deepseek-v4-flash (support Pro attendu début août 2026). L’URL de base reste https://api.deepseek.com.

C’est une grande amélioration de l’expérience développeur. Avant la Responses API et la prise en charge de Codex, DeepSeek V4 Flash pouvait déjà être appelé comme modèle texte, mais un agent de codage devait combler davantage de détails d’intégration lui‑même. Désormais, le modèle peut être utilisé au sein de workflows qui attendent des sémantiques de type Responses.

Ce que couvre la prise en charge de la Responses API

La Responses API de DeepSeek crée une réponse de modèle au format OpenAI Responses API sur /responses. La Responses API prend en charge model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, les outils, le choix d’outil, l’effort de raisonnement, le format texte, et le reporting d’usage. L’API est sans état, donc les clients doivent envoyer l’historique complet de la conversation pour les interactions multi‑tours.

Les détails de compatibilité les plus importants sont pratiques :

  • deepseek-v4-flash est actuellement le seul modèle pris en charge pour la Responses API.
  • Les messages developer sont traités comme des messages system.
  • Les fonctions outils, le streaming, l’effort de raisonnement réglable et la recherche web côté serveur sont pris en charge.
  • Le type d’outil personnalisé n’est pris en charge que pour apply_patch, ce qui compte pour la compatibilité Codex.
  • Les entrées image et fichier ne sont pas prises en charge ; les parties d’entrée image sont remplacées par du texte de remplacement.
  • previous_response_id, conversation, store, le mode arrière‑plan, les métadonnées et certaines fonctionnalités de gestion du contexte ne sont pas pris en charge.
  • Les paramètres non pris en charge peuvent être ignorés silencieusement, donc les clients en production devraient tester explicitement le comportement attendu.

Pour les développeurs, le point clé est que la prise en charge de la Responses API n’est pas qu’un détail syntaxique. Elle permet à DeepSeek V4 Flash de s’inscrire dans une voie de protocole utilisée par les agents de codage modernes, notamment là où les appels de fonction, les événements de streaming, les éléments de raisonnement et l’application de patch doivent être représentés de manière cohérente.

Conception sans état (le client gère l’historique de conversation). Exemple (Python) :

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="Refactor this Python function for better readability...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Détails complets et guide d’intégration Codex : DeepSeek API Docs – Responses API et Intégrer avec Codex.

Ce que signifie la prise en charge de Codex

Le guide d’intégration Codex de DeepSeek indique que Codex communique avec les modèles via la Responses API, que DeepSeek prend désormais en charge nativement. Cela permet une intégration directe avec Codex (l’écosystème d’agents de codage d’OpenAI — CLI, application desktop ChatGPT, et extension IDE Codex pour VS Code).

Les développeurs peuvent configurer un fournisseur personnalisé une fois via un script de configuration ou en éditant ~/.codex/config.toml et un fichier de catalogue de modèles. Après configuration, les clients Codex reconnaissent DeepSeek‑V4‑Flash et peuvent utiliser ses capacités d’appel d’outils, apply_patch, recherche web et raisonnement.

DeepSeek V4 Flash vs. DeepSeek V4 Pro

AspectV4-Flash-0731V4-Pro (typique / Preview)
Paramètres total / actifs284B / 13B~1.6T / 49B
Fenêtre de contexte1M tokens1M tokens
AtoutsCodage agentique, terminal, coût, vitesseRaisonnement le plus profond, connaissances, tâches les plus difficiles
Avantage sur benchs d’agentsGagne sur la suite d’agents publiée 0731Plus fort sur la pure connaissance et le multi‑fichiers complexe dans des évaluations antérieures
Tarification API typique~0,14 $ entrée / 0,28 $ sortie (cache bien plus bas)Nettement plus élevé (historiquement 3–12×)
Idéal pourAgents à grand volume, boucles de codage en production, apps sensibles au coûtRecherche de pointe, capacité maximale sur tâches uniques
Poids ouvertsOui (MIT)Oui (MIT)

Lequel les développeurs devraient-ils utiliser en premier ?

Sur les benchmarks d’agents spécifiques publiés avec 0731, le plus petit modèle Flash surpasse le Pro preview sur toute la ligne. Pour la pure recherche de connaissances ou les problèmes de raisonnement les plus difficiles, Pro conserve un avantage dans de nombreuses évaluations indépendantes et antérieures. En pratique, beaucoup d’équipes utilisent désormais Flash par défaut pour la majorité des charges agentiques et ne routent vers Pro (ou d’autres modèles de pointe) que les tâches les plus exigeantes.

C’est précisément là que CometAPI peut aider. Plutôt que de coder en dur un seul modèle pour toutes les charges, utilisez CometAPI pour centraliser la sélection de modèle, la journalisation, le suivi des coûts et les politiques de repli. Par exemple :

  • Utilisez V4 Flash pour la synthèse de dépôts, la planification de refactorisation, les brouillons de revue de code, les tests générés, l’extraction structurée, la QA long contexte et les boucles d’agent répétées.
  • Escaladez vers V4 Pro ou un autre modèle premium lorsque la tâche comporte un risque métier élevé, des exigences ambiguës, du code de production fragile ou des tentatives répétées échouées.
  • Suivez la métrique qui compte vraiment : correctifs acceptés par dollar, tâches réussies par heure, ou minutes de revue humaine économisées.

Qu’est-ce que DeepSeek Harness ?

DeepSeek Harness est le framework / couche d’exécution d’agent officiel que DeepSeek construit pour transformer ses modèles en agents autonomes fiables. L’entreprise formule l’équation simplement : modèle + harness = agent.

Les évaluations officielles de V4‑Flash‑0731 ont déjà utilisé le « minimal mode » de DeepSeek Harness. Le produit complet est encore en déploiement (recrutement et tests précoces actifs vers fin juillet – début août 2026). L’équipe est dirigée par Cui Tianyi (expérience en systèmes de trading quantitatif), et les descriptions de poste mettent l’accent sur l’intégration profonde avec les fonctionnalités de DeepSeek‑V4 telles que le cache de préfixe, la gestion de long contexte, l’optimisation du KV‑cache, l’enchaînement d’utilisation d’outils, la récupération d’erreurs et la reprise automatique.

Harness n’est pas un wrapper générique à la LangChain. Il est co‑conçu avec le modèle pour que la gestion du contexte, l’orchestration d’outils, la collecte d’éléments de preuve et les boucles de réparation exploitent les efficacités spécifiques à V4 (attention clairsemée, mise en cache, modes de raisonnement). Des projets communautaires et des harness tiers existent également, mais le Harness officiel vise le couplage modèle–runtime le plus étroit possible.

Une fois pleinement publié, il devrait fournir :

  • Des boucles d’agent structurées pour le codage et l’automatisation.
  • Des garde‑fous de sécurité et des flux d’approbation.
  • Une gestion de contexte efficace pour les tâches à long horizon.
  • De l’observabilité et la production d’artéfacts.

En attendant la sortie complète, les développeurs peuvent déjà obtenir de solides résultats en associant V4‑Flash‑0731 à des frameworks d’agent existants ou en utilisant la voie Responses API + Codex.

Tarification, disponibilité et déploiement pratique

  • Tarification API officielle (approximative) : 0,14 $ / 1M tokens en entrée (cache miss), ~0,0028–0,03 $ sur cache hit, 0,28 $ / 1M tokens en sortie. Limites de concurrence élevées.
  • Poids ouverts sous licence MIT sur Hugging Face ; versions quantifiées GGUF largement disponibles pour un usage local/auto‑hébergé (nécessite une VRAM substantielle — pleine précision volumineuse).
  • Le décodage spéculatif (DSpark) et l’attention hybride maintiennent une inférence long contexte relativement efficace.
  • Moteurs d’inférence pris en charge : vLLM, SGLang, et d’autres avec recettes documentées.

Pour de nombreuses équipes, le chemin de production le plus simple est une passerelle compatible OpenAI. CometAPI offre un accès unifié aux modèles DeepSeek (dont la série V4) aux côtés de centaines d’autres modèles via un endpoint unique (https://api.cometapi.com/v1). Les avantages incluent un routage multi‑modèles simplifié, une tarification compétitive ou remise par rapport aux fournisseurs directs, des analyses d’usage et la possibilité de passer entre Flash, Pro et d’autres modèles sans changer le code applicatif. C’est particulièrement utile pour les systèmes agentiques qui peuvent basculer ou router selon la difficulté/le coût.

À la date de cet article, la page modèle de DeepSeek V4 Flash chez CometAPI indiquait un prix d’entrée de départ de 0,12 $ par 1M tokens, un prix de sortie de 0,24 $ par 1M tokens dans son tableau comparatif, 100,0 % de disponibilité sur 24 heures, et un temps de réponse observé de 2941 ms. DeepSeek avertit également que les prix globaux de l’API pourraient augmenter prochainement. Comme les prix des fournisseurs peuvent changer, la formulation prudente à publier est : vérifiez le catalogue en direct de CometAPI et la tarification officielle de DeepSeek avant d’engager des budgets de production.

Recommandations pratiques pour les développeurs et les équipes

  1. Commencez avec Flash‑0731 pour le codage agentique — Le rapport coût/performance est actuellement remarquable pour les workflows de terminal, dépôt et multi‑outils. Utilisez l’effort de raisonnement max + des boucles à la Harness pour les tâches les plus difficiles.
  2. Pour l’inférence locale, téléchargez depuis Hugging Face et suivez les recettes vLLM/SGLang officielles qui activent DSpark.
  3. Intégrez via la Responses API si vous utilisez déjà Codex ou souhaitez des sémantiques d’appel d’outils modernes.
  4. Auto‑hébergez ou utilisez des poids quantifiés pour un contrôle maximal des coûts et de la confidentialité des données.
  5. Routez intelligemment — Flash pour le volume, Pro (ou d’autres grands modèles) pour la longue traîne des problèmes ultra‑difficiles.
  6. Envisagez CometAPI pour un accès multi‑modèles simplifié, surtout si votre stack mélange déjà DeepSeek avec d’autres fournisseurs.

Conclusion

DeepSeek‑V4‑Flash‑0731 représente un moment charnière pour l’IA agentique efficace. En offrant des performances agentiques compétitives de pointe à partir d’un MoE relativement compact (13B actifs) grâce à un post‑entraînement ciblé, et en l’associant à un Harness dédié et à une compatibilité API moderne (Responses + Codex), DeepSeek a redéfini les attentes pour des agents de codage et d’automatisation rentables.

Que vous auto‑hébergiez les poids ouverts, appeliez l’API officielle, ou passiez par une passerelle unifiée comme CometAPI, V4‑Flash‑0731 + l’écosystème Harness en évolution offre une base performante et économique pour la prochaine génération d’agents IA.

FAQs

Qu’est-ce que DeepSeek V4 Flash 0731 ?

DeepSeek V4 Flash 0731 est la version bêta publique officielle de DeepSeek V4 Flash sur l’API DeepSeek, annoncée dans le journal des modifications du 31 juillet 2026. Elle remplace la version preview tout en conservant le même nom de modèle, deepseek-v4-flash.

Quelles sont les nouveautés de DeepSeek V4 Flash 0731 ?

Les principaux changements sont des performances de benchmark agentique renforcées, la prise en charge native de la Responses API, l’adaptation à Codex, et une build officielle V4 Flash re‑post‑entraînée. DeepSeek indique que l’architecture et la taille du modèle sont restées identiques à la version preview.

DeepSeek V4 Flash 0731 prend‑il en charge Codex ?

Oui. Le guide Codex de DeepSeek indique que seul deepseek-v4-flash prend actuellement en charge l’intégration Codex. Cela fonctionne via la Responses API et peut être configuré pour le CLI Codex, l’application desktop ChatGPT et l’extension IDE Codex pour VS Code.

Qu’est-ce que DeepSeek Harness ?

DeepSeek Harness est le framework d’agent de DeepSeek pour transformer des modèles de langage en agents autonomes de codage ou de workflow. Les rapports publics décrivent un harness comme la couche qui gère les outils, le contexte, les fichiers, l’exécution de commandes et les workflows multi‑étapes. DeepSeek a utilisé le minimal mode de Harness dans sa configuration de benchmark V4 Flash 0731.

Comment accéder à DeepSeek V4 Flash via CometAPI ?

Utilisez l’endpoint compatible OpenAI de CometAPI avec l’ID de modèle deepseek-v4-flash. La page modèle de CometAPI fournit des exemples cURL, Python et JavaScript pour /v1/chat/completions, ainsi que les spécifications du modèle, la tarification et la disponibilité.

DeepSeek V4 Flash est‑il meilleur que DeepSeek V4 Pro ?

Pour le tableau de benchmarks du 31 juillet, V4 Flash 0731 bat V4‑Pro Preview sur les benchmarks d’agents listés. Cela ne signifie pas que Flash est toujours meilleur que Pro. V4 Pro est plus grand et reste plus fort sur de nombreuses tâches lourdes en connaissances et en raisonnement difficiles selon la fiche du modèle. Utilisez Flash par défaut pour les workflows agentiques sensibles au coût et Pro comme voie d’escalade.

54 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus