TLDR DeepSeek-V4-Flash-0731 (uitgebracht op 31 juli 2026) is de officiële, productierijpe versie van DeepSeek’s efficiënte Mixture-of-Experts-model (284B totaal / 13B actieve parameters, 1M-tokencontext). Door gerichte post-training levert het dramatische verbeteringen op in agentgestuurd coderen, toolgebruik en meerstaps software-engineering. Het ondersteunt native de Responses API en OpenAI Codex. DeepSeek Harness is het bijbehorende agent-framework (minimale modus al gebruikt in officiële evaluaties; volledige release volgt) dat is ontworpen om het model om te zetten in een betrouwbare autonome agent.
Samen bieden ze per augustus 2026 een van de sterkste prijs-prestatieverhoudingen in open-gewichten en via API toegankelijke agent-AI.
Belangrijkste punten
- Grote sprong in agent-capaciteiten via uitsluitend post-training: dezelfde 284B/13B-architectuur als de preview van april, maar aanzienlijk hogere scores (bijv. Terminal Bench 2.1: 82,7 vs 61,8; DeepSWE: 54,4 vs 7,3).
- Overtreft DeepSeek-V4-Pro (Preview) op meerdere agent-benchmarks ondanks aanzienlijk minder geactiveerde parameters.
- Concurrerend met top-proprietary modellen (dicht bij Claude Opus 4.8 op meerdere agent-taken) tegen een fractie van de kosten.
- Native 1M context, speculatieve decodering (DSpark), drie niveaus van redeneerinspanning (low/high/max), MIT-licentie, open gewichten.
- Officiële ondersteuning voor Responses API en Codex (CLI, desktop, VS Code-extensie).
- DeepSeek Harness (minimale modus al gebruikt in evaluaties) is het officiële agent-framework in gesloten bèta; publieke release volgt binnenkort. DeepSeek Harness levert de agent-runtime-laag; model + harness = productieagent.
- Ideaal voor high-volume code-agents, terminalautomatisering, toolgebruik en long-context-werkstromen.
- Toegang tot DeepSeek-modellen betaalbaar en met uniforme tooling via CometAPI (OpenAI-compatibel endpoint, concurrerende prijzen, multi-model routing).
Wat is nieuw in DeepSeek V4 Flash 0731?
Officiële release-status gewijzigd
De belangrijkste productwijziging is dat DeepSeek V4 Flash 0731 nu de officiële release is van DeepSeek V4 Flash op de API, in publieke bèta. DeepSeek’s wijzigingslogboek van 31 juli zegt dat ontwikkelaars dezelfde modelnaam, deepseek-v4-flash, kunnen blijven aanroepen om toegang te krijgen tot de nieuwste versie. Dat is belangrijk voor migratie, omdat het een nieuwe modelslug vermijdt en teams de update laat testen achter bestaande routinglogica.
DeepSeek zegt ook dat de update alleen de V4 Flash API upgrade. V4 Pro API en de app/webmodellen zijn door de release van 31 juli niet gewijzigd en DeepSeek gaf aan dat de officiële V4 Pro-release snel zou volgen. Met andere woorden, dit is geen volledige verversing van de DeepSeek V4-familie. Het is een gerichte Flash-update.
Architectuur bleef hetzelfde, post-training veranderde
De kernarchitectuur blijft ongewijzigd: een Mixture-of-Experts (MoE)-model met 284 miljard totale parameters en slechts 13 miljard geactiveerd per token, een hybride attention-ontwerp geoptimaliseerd voor lange context, en een native contextvenster van 1 miljoen tokens. Een speculatieve decodermodule (DSpark) is gekoppeld voor snellere generatie. Het model is alleen-tekst, ondersteunt instelbare niveaus voor redeneerinspanning (low / high / max), toolaanroepen, gestructureerde output en wordt uitgebracht onder de permissieve MIT-licentie.
Dat onderscheid is belangrijk. Veel modelupdates verbeteren doordat het model groter wordt. Deze update is interessanter omdat DeepSeek een grote agent-sprong claimt zonder de parameterfootprint van het model te vergroten. V4 Flash blijft een MoE-model met 284B totaal en 13B actief, wat tijdens inference veel kleiner is dan V4 Pro’s ontwerp met 1,6T totaal en 49B actief.
Agentgestuurde coderingsscores zijn sterk gestegen
De officiële tabel van DeepSeek toont grote verbeteringen op terminal-, repository-bouw-, cyber-, software-engineering-, toolgebruik-, automatiserings- en full-stack-coderingstaken. De grootste absolute sprong ten opzichte van de oudere Flash-preview is op DeepSWE: 54,4 versus 7,3, een stijging van 47,1 punten. Cybergym verbetert met 38,0 punten, DSBench-Hard met 33,8 punten en DSBench-FullStack met 31,7 punten.
Daarom wordt V4 Flash 0731 minder besproken als een normale “snel model” en meer als een kandidaat-standaardmodel voor code-agents. De waardepropositie is niet alleen goedkope chat. Het is goedkope, long-context, toolvriendelijke agent-inference.
Responses API- en Codex-ondersteuning is gearriveerd
Het wijzigingslogboek van 31 juli van DeepSeek zegt dat de officiële V4 Flash native de Responses API indeling ondersteunt en specifiek is aangepast voor Codex. DeepSeek’s Responses API-gids zegt dat het formaat is toegevoegd om te voldoen aan de vraag naar Codex, de basis-URL gebruikt https://api.deepseek.com, en momenteel deepseek-v4-flash ondersteunt.
Dit is belangrijk omdat Codex-stijl ontwikkelwerkstromen niet simpele chatsessies zijn. Ze hebben gestructureerde input- en output-items nodig, redeneeritems, toolaanroepen, bestandswijzigingen, streamingevents, gebruiksrapportage en integratie met clients voor code-agents. DeepSeek’s ondersteuning is geen perfecte kloon van elke OpenAI Responses API-capabiliteit, maar het is genoeg om V4 Flash een veel praktischer drop-in-kandidaat te maken voor experimenten met code-agents.
Prestatiebenchmarks voor de officiële V4-Flash-versie
Benchmark-nuances die ontwikkelaars niet mogen negeren
Officiële evaluatieresultaten (gerapporteerd door DeepSeek op de modelkaart) laten grote sprongen zien ten opzichte van de preview en, opmerkelijk, ten opzichte van de veel grotere V4-Pro Preview op agentgerichte taken. Evaluaties voor code-agent-benchmarks gebruikten de minimale modus van DeepSeek Harness (nog te releasen) met max reasoning effort, temperature = 1.0, top_p = 0.95.
Dat heeft twee implicaties. Ten eerste is het resultaat deels een model-en-harness-resultaat. Als jouw agent-runtime andere tools, shellrechten, contextbeheer, retries, patchregels of foutafhandeling heeft, behaal je mogelijk niet dezelfde scores. Ten tweede is onafhankelijke reproductie beperkt totdat DeepSeek voldoende van de harness en de evaluatie-setup vrijgeeft voor externe teams om vergelijkbare tests te draaien.
Officiële DeepSeek-benchmarktabel
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Over deze negen benchmarks gemiddeld V4 Flash 0731 55,2. De oude V4 Flash-preview gemiddeld 29,6, en V4-Pro Preview gemiddeld 34,9. Dat betekent dat V4 Flash 0731 ongeveer 25,6 punten hoger ligt dan de Flash-preview en 20,3 punten hoger dan V4-Pro Preview in deze tabel.
Signalen van derden
ARC Prize meldt V4 Flash 0731 met maximale inspanning 89,0% op ARC-AGI-1 Semi-Private en 61,4% op ARC-AGI-2 Semi-Private, met vermelde kosten van $0,02 en $0,04 per taak. Dit zijn geen benchmarks voor code-agents, maar ze ondersteunen de bredere visie dat het model competitief is op redeneertaken wanneer het op hogere inspanning draait.
De winst is vooral opvallend op DeepSWE (software-engineering agent-loop) en Cybergym. Onafhankelijke metingen (bijv. Artificial Analysis) rapporteren iets lagere maar nog steeds sterke Terminal-Bench-cijfers rond 79%, wat de richting van de verbetering bevestigt en gebruikers eraan herinnert dat cijfers van de leverancier-harness vaak optimistisch zijn.
Extra context uit eerdere V4-evaluaties en aggregators van derden toont sterke kennis- en coderingsprestaties in max-reasoning-modus (GPQA Diamond ~88–91%, LiveCodeBench hoog 80–90 bereik afhankelijk van bron). De 0731-post-training ontgrendelde specifiek agent-betrouwbaarheid die in de preview ontbrak.
DeepSeek-V4-Flash ondersteunt nu de Responses API en Codex
Een strategisch belangrijke toevoeging is native ondersteuning voor OpenAI’s Responses API. De officiële documentatie van DeepSeek bevestigt dat de Responses API momenteel deepseek-v4-flash ondersteunt (Pro-ondersteuning verwacht begin augustus 2026). De basis-URL blijft https://api.deepseek.com.
Dit is een grote verbetering van de ontwikkelaarservaring. Voor Responses API- en Codex-ondersteuning kon DeepSeek V4 Flash al als tekstmodel worden aangeroepen, maar een code-agent moest meer integratiedetails zelf overbruggen. Nu kan het model worden gebruikt binnen werkstromen die Responses-achtige semantiek verwachten.
Wat de Responses API-ondersteuning omvat
De Responses API van DeepSeek creëert een modelrespons in OpenAI Responses API-formaat op /responses. De Responses API ondersteunt model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, tools, toolkeuze, reasoning effort, tekstformaat en gebruiksrapportage. De API is stateless, dus clients moeten voor multi-turn interacties de volledige gespreksgeschiedenis meesturen.
De belangrijkste compatibiliteitsdetails zijn praktisch:
deepseek-v4-flashis momenteel het enige model dat wordt ondersteund voor Responses API.developer-berichten worden behandeld alssystem-berichten.- Function tools, streaming, instelbare redeneerinspanning en webzoeken aan serverzijde worden ondersteund.
- Het aangepaste tooltype wordt alleen ondersteund voor
apply_patch, wat belangrijk is voor Codex-compatibiliteit. - Afbeeldings- en bestandsinput worden niet ondersteund; afbeeldingsinvoegingen worden vervangen door plaatshoudertekst.
previous_response_id,conversation,store, achtergrondmodus, metadata en sommige contextbeheerfuncties worden niet ondersteund.- Niet-ondersteunde parameters kunnen stilzwijgend worden genegeerd, dus productieclients moeten het verwachte gedrag expliciet testen.
Voor ontwikkelaars is het belangrijkste punt dat Responses API-ondersteuning niet slechts een syntactisch detail is. Het stelt DeepSeek V4 Flash in staat te werken binnen een protocol dat door moderne code-agents wordt gebruikt, vooral waar functieaanroepen, streamingevents, redeneeritems en patchtoepassing consistent moeten worden weergegeven.
Stateless ontwerp (client beheert de gespreksgeschiedenis). Voorbeeld (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Volledige details en Codex-integratiegids: DeepSeek API Docs – Responses API en Integrate with Codex.
Wat Codex-ondersteuning betekent
De Codex-integratiegids van DeepSeek zegt dat Codex met modellen praat via de Responses API, die DeepSeek nu native ondersteunt. Dit maakt directe integratie met Codex mogelijk (OpenAI’s code-agent-ecosysteem — CLI, ChatGPT-desktopapp en VS Code-extensie).
Ontwikkelaars kunnen eenmaal een aangepaste provider configureren via een setupscript of door ~/.codex/config.toml en een modelcatalogusbestand te bewerken. Na configuratie herkennen Codex-clients DeepSeek-V4-Flash en kunnen ze zijn tool-calls, apply_patch, websearch en redeneercapaciteiten gebruiken.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspect | V4-Flash-0731 | V4-Pro (typisch / Preview) |
|---|---|---|
| Totaal / Actieve parameters | 284B / 13B | ~1,6T / 49B |
| Contextvenster | 1M tokens | 1M tokens |
| Sterke punten | Agentgestuurd coderen, terminal, kosten, snelheid | Diepste redeneren, kennis, moeilijkste taken |
| Voordeel op agent-benchmarks | Wint op de gepubliceerde 0731 agent-suite | Sterker op pure kennis & complexe multi-file in eerdere evals |
| Typische API-prijzen | ~$0,14 in / $0,28 uit (cache veel lager) | Aanzienlijk hoger (historisch 3–12×) |
| Het beste voor | High-volume agents, productie-coderingsloops, kostengevoelige apps | Frontier-onderzoek, maximale capaciteiten op enkelvoudige taken |
| Open gewichten | Ja (MIT) | Ja (MIT) |
Welke moeten ontwikkelaars eerst gebruiken?
Op de specifieke agent-benchmarks die met 0731 zijn vrijgegeven, presteert het kleinere Flash-model beter dan de Pro-preview over de hele linie. Voor pure kennisopvraging of de allerzwaarste redeneerproblemen behoudt Pro in veel onafhankelijke en eerdere evaluaties nog steeds een voorsprong. In de praktijk kiezen veel teams nu standaard voor Flash voor het merendeel van agent-werkbelastingen en routeren ze alleen de meest veeleisende taken naar Pro (of andere frontier-modellen).
Die routingstrategie is waar CometAPI bij kan helpen. In plaats van één model hard te coderen voor alle workloads, gebruik CometAPI om modelselectie, logging, kostentracking en fallbackbeleid te centraliseren. Bijvoorbeeld:
- Gebruik V4 Flash voor repository-samenvattingen, refactorplannen, concepten voor codereview, gegenereerde tests, gestructureerde extractie, QA met lange context en herhaalde agent-loops.
- Schakel op naar V4 Pro of een ander premium model wanneer de taak hoge zakelijke risico’s heeft, vage requirements, fragiele productiecode of herhaaldelijk mislukte pogingen.
- Volg de uiteindelijke metric die telt: geaccepteerde fixes per dollar, succesvolle taken per uur, of bespaarde minuten aan menselijke review.
Wat is DeepSeek Harness?
DeepSeek Harness is het officiële agent-framework / de runtime-laag die DeepSeek bouwt om zijn modellen om te zetten in betrouwbare autonome agents. Het bedrijf formuleert de vergelijking eenvoudig: Model + Harness = Agent.
Officiële evaluaties van V4-Flash-0731 gebruikten al de “minimale modus” van DeepSeek Harness. Het volledige product wordt nog uitgerold (werving en vroege tests waren actief rond eind juli–begin augustus 2026). Het team staat onder leiding van Cui Tianyi (achtergrond in kwantitatieve handelssystemen), en functiebeschrijvingen benadrukken diepe integratie met DeepSeek-V4-functies zoals prefix-caching, lang-contextbeheer, KV-cache-optimalisatie, tool-ketening, foutherstel en automatische herpogingen.
Harness is geen generieke wrapper in LangChain-stijl. Het wordt samen met het model ontworpen zodat contextbeheer, toolorkestratie, bewijsverzameling en reparatielussen V4-specifieke efficiënties benutten (sparse attention, caching, redeneermodi). Communityprojecten en third-party harnesses bestaan ook, maar de officiële Harness mikt op de strakst mogelijke koppeling tussen model en runtime.
Wanneer volledig uitgebracht, zal het naar verwachting bieden:
- Gestructureerde agent-loops voor codering en automatisering.
- Safety-gates en goedkeuringsflows.
- Efficiënt contextbeheer voor langetermijntaken.
- Observeerbaarheid en artefactproductie.
Tot de volledige release kunnen ontwikkelaars al sterke resultaten behalen door V4-Flash-0731 te koppelen aan bestaande agent-frameworks of door het pad Responses API + Codex te gebruiken.
Prijzen, beschikbaarheid en praktische implementatie
- Officiële API-prijzen (ongeveer): $0,14 / 1M inputtokens (cache-miss), ~$0,0028–0,03 bij cache-hit, $0,28 / 1M outputtokens. Hoge limieten voor gelijktijdigheid.
- Open gewichten onder MIT op Hugging Face; gekwantiseerde GGUF-versies breed beschikbaar voor lokale/zelf-gehoste inzet (vereist aanzienlijke VRAM—volledige precisie is groot).
- Speculatieve decodering (DSpark) en hybride attention houden inference met lange context relatief efficiënt.
- Ondersteunde inference-engines: vLLM, SGLang en andere met gedocumenteerde recepten.
Voor veel teams is de makkelijkste productieroute een OpenAI-compatibele gateway. CometAPI biedt uniforme toegang tot DeepSeek-modellen (inclusief de V4-serie) naast honderden andere modellen via één endpoint (https://api.cometapi.com/v1). Voordelen zijn onder meer vereenvoudigde multi-model routing, concurrerende of lagere prijzen dan directe providers, gebruiksanalyse en de mogelijkheid om te schakelen tussen Flash, Pro en andere modellen zonder applicatiecode te wijzigen. Dit is vooral nuttig voor agent-systemen die kunnen terugvallen of routeren op basis van moeilijkheid/kosten.
Op het moment van dit artikel vermeldde CometAPI’s DeepSeek V4 Flash in de vergelijkingstabel een startprijs van $0,12 per 1M inputtokens, een outputprijs van $0,24 per 1M tokens, 100,0% uptime over 24 uur en een geobserveerde respons van 2941 ms. DeepSeek waarschuwt ook dat de algehele API-prijzen binnenkort kunnen stijgen. Omdat prijzen van providers kunnen veranderen, is veilige taal bij publicatie: bekijk de live catalogus van CometAPI en de officiële prijzen van DeepSeek voordat je productiebudgetten vastlegt.
Praktische aanbevelingen voor ontwikkelaars en teams
- Begin met Flash-0731 voor agentgestuurd coderen — De prijs/prestatieverhouding is momenteel uitstekend voor terminal-, repository- en multi-tool-werkstromen. Gebruik maximale redeneerinspanning + loops in Harness-stijl voor de moeilijkste taken.
- Voor lokale inference: download van Hugging Face en volg de officiële vLLM/SGLang-handleidingen die DSpark inschakelen.
- Integreer via de Responses API als je al Codex gebruikt of moderne tool-callingsemantiek wilt.
- Zelf hosten of gekwantiseerde gewichten gebruiken voor maximale kostenbeheersing en dataprivacy.
- Routeer intelligent — Flash voor volume, Pro (of andere grote modellen) voor de long tail van ultramoeilijke problemen.
- Overweeg CometAPI voor vereenvoudigde multi-modeltoegang, vooral als je stack DeepSeek al met andere providers mengt.
Conclusie
DeepSeek-V4-Flash-0731 vertegenwoordigt een kantelpunt in efficiënte agent-AI. Door frontier-concurrerende agentprestaties te leveren vanuit een relatief compacte MoE (13B actief) via gerichte post-training, en door het te koppelen aan een doelgericht Harness en moderne API-compatibiliteit (Responses + Codex), heeft DeepSeek de verwachtingen herijkt voor kosteneffectieve codering en automatiseringsagents.
Of je nu de open gewichten zelf host, de officiële API aanroept, of routeert via een uniforme gateway zoals CometAPI, V4-Flash-0731 + het evoluerende Harness-ecosysteem biedt een krachtige, kosteneffectieve basis voor de volgende generatie AI-agents.
Veelgestelde vragen
Wat is DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 is de officiële publieke bèta-release van DeepSeek V4 Flash op de DeepSeek API, aangekondigd in het wijzigingslogboek van 31 juli 2026. Het vervangt de previewversie, terwijl de API-modelnaam deepseek-v4-flash gelijk blijft.
Wat is er nieuw in DeepSeek V4 Flash 0731?
De belangrijkste wijzigingen zijn sterkere agent-benchmarkprestaties, native Responses API-ondersteuning, Codex-adaptatie en een opnieuw post-getrainde officiële V4 Flash-build. DeepSeek zegt dat de modelarchitectuur en -grootte hetzelfde zijn gebleven als in de previewversie.
Ondersteunt DeepSeek V4 Flash 0731 Codex?
Ja. De Codex-gids van DeepSeek zegt dat alleen deepseek-v4-flash momenteel Codex-integratie ondersteunt. Het werkt via de Responses API en kan worden geconfigureerd voor de Codex-CLI, de ChatGPT-desktopapp en de Codex IDE-extensie voor VS Code.
Wat is DeepSeek Harness?
DeepSeek Harness is DeepSeek’s agent-framework om taalmodellen om te zetten in autonome code- of workflowagents. Publieke beschrijvingen definiëren een harness als de laag die tools, context, bestanden, commando-uitvoering en meerstapswerkstromen beheert. DeepSeek gebruikte de minimale modus van Harness in de V4 Flash 0731-benchmarksetup.
Hoe krijg ik toegang tot DeepSeek V4 Flash via CometAPI?
Gebruik het OpenAI-compatibele endpoint van CometAPI met het model-ID deepseek-v4-flash. De CometAPI-modelpagina biedt cURL-, Python- en JavaScript-voorbeelden voor /v1/chat/completions, plus modelspecificaties, prijzen en uptime-informatie.
Is DeepSeek V4 Flash beter dan DeepSeek V4 Pro?
Voor de benchmarktabel van 31 juli verslaat V4 Flash 0731 V4-Pro Preview op de vermelde agent-benchmarks. Dat betekent niet dat Flash altijd beter is dan Pro. V4 Pro is groter en blijft sterker op veel kennisintensieve en moeilijke redeneerstaken in de modelkaart. Gebruik Flash als standaard voor kostengevoelige agent-werkstromen en Pro als escalatiepad.
