TLDR DeepSeek-V4-Flash-0731 (udgivet 31. juli 2026) er den officielle, produktionsklare version af DeepSeeks effektive Mixture-of-Experts-model (284B total / 13B aktive parametre, 1M-token kontekst). Gennem målrettet eftertræning leverer den markante forbedringer i agent-baseret kodning, værktøjsanvendelse og flertrins softwareudvikling. Den understøtter nativt Responses API og OpenAI Codex. DeepSeek Harness er det ledsagende agent-rammeværk (minimal tilstand bruges allerede i officielle evalueringer; fuld udgivelse på vej), designet til at gøre modellen til en pålidelig autonom agent.
Sammen tilbyder de et af de stærkeste pris-ydeevne-forhold i agent-baseret AI med åbne vægte og API-adgang pr. august 2026.
Væsentlige pointer
- Stort agent-spring via kun eftertræning: Samme 284B/13B-arkitektur som april-preview, men dramatisk højere scorer (fx Terminal Bench 2.1: 82,7 vs 61,8; DeepSWE: 54,4 vs 7,3).
- Overgår DeepSeek-V4-Pro (Preview) på flere agent-benchmarks trods langt færre aktiverede parametre.
- Konkurrerer med top proprietære modeller (tæt på Claude Opus 4.8 på flere agentopgaver) til en brøkdel af prisen.
- Naturlig 1M kontekst, spekulativ dekodning (DSpark), tre niveauer af ræsonneringsindsats (low/high/max), MIT-licens, åbne vægte.
- Officiel support for Responses API og Codex (CLI, desktop, VS Code-udvidelse).
- DeepSeek Harness (minimal tilstand allerede brugt i evalueringer) er det officielle agent-rammeværk i lukket beta; offentlig udgivelse forventes snart. DeepSeek Harness leverer agentens runtime-lag; model + Harness = produktionsagent.
- Ideel til højvolumen kodningsagenter, terminalautomatisering, værktøjsbrug og arbejdsgange med lange kontekster.
- Få adgang til DeepSeek-modeller til en overkommelig pris og med samlet værktøjskæde via CometAPI (OpenAI-kompatibel endpoint, konkurrencedygtige priser, multi-model routing).
Hvad er nyt i DeepSeek V4 Flash 0731?
Officiel udgivelsesstatus ændret
Den vigtigste produktopdatering er, at DeepSeek V4 Flash 0731 nu er den officielle udgave af DeepSeek V4 Flash på API’en, i offentlig beta. DeepSeeks ændringslog for 31. juli siger, at udviklere kan blive ved med at kalde det samme modelnavn, deepseek-v4-flash, for at få adgang til den nyeste version. Det er vigtigt for migration, fordi det undgår en ny model slug og lader teams teste opdateringen bag eksisterende routinglogik.
DeepSeek siger også, at opdateringen kun opgraderer V4 Flash API. V4 Pro API og app/web-modellerne blev ikke ændret af udgivelsen 31. juli, og DeepSeek sagde, at den officielle V4 Pro-udgivelse snart ville følge. Med andre ord er dette ikke en fuld opdatering af DeepSeek V4-familien. Det er en målrettet Flash-opdatering.
Arkitekturen forblev den samme, eftertræningen ændret
Kernearkitekturen er uændret: en Mixture-of-Experts (MoE)-model med 284 milliarder samlede parametre og kun 13 milliarder aktiveret pr. token, et hybridt opmærksomhedsdesign optimeret til lang kontekst og en naturlig kontekstvindue på 1 million tokens. Et spekulativt dekodningsmodul (DSpark) er tilknyttet for hurtigere generering. Modellen er tekst-only, understøtter justerbare niveauer af ræsonneringsindsats (low / high / max), værktøjskald, struktureret output og er udgivet under den permissive MIT-licens.
Denne sondring er vigtig. Mange modelopdateringer forbedrer sig, fordi modellen er større. Denne opdatering er mere interessant, fordi DeepSeek hævder et stort agent-spring uden at øge modellens parameterfodaftryk. V4 Flash forbliver en Mixture-of-Experts-model med 284B total og 13B aktive, hvilket er meget mindre ved inferens end V4 Pro’s design med 1,6T total og 49B aktive.
Agent-baserede kodningsscore steg
DeepSeeks officielle tabel viser store forbedringer på terminal-, repository-opbygning-, cyber-, software engineering-, værktøjsbrug-, automations- og full-stack-kodningsopgaver. Det største absolutte spring over den ældre Flash preview er på DeepSWE: 54,4 versus 7,3, en stigning på 47,1 point. Cybergym forbedres med 38,0 point, DSBench-Hard med 33,8 point og DSBench-FullStack med 31,7 point.
Derfor bliver V4 Flash 0731 mindre omtalt som en normal “hurtig model” og mere som en kandidat til standardmodellen for kodningsagenter. Værditilbuddet er ikke bare billig chat. Det er billig, lang-kontekst, værktøjsvenlig agentinferens.
Responses API og Codex-support ankom
DeepSeeks ændringslog fra 31. juli siger, at den officielle V4 Flash nativt understøtter Responses API-formatet og er specifikt tilpasset til Codex. DeepSeeks Responses API-guide siger, at formatet blev tilføjet for at imødekomme efterspørgslen efter Codex, bruger basis-URL’en https://api.deepseek.com og understøtter i øjeblikket deepseek-v4-flash.
Det betyder noget, fordi Codex-stil udviklingsworkflows ikke er simple chat-sessioner. De har brug for strukturerede input- og outputelementer, ræsonneringselementer, værktøjskald, filændringsoperationer, streamingbegivenheder, forbrugsopgørelse og integration med kodningsagent-klienter. DeepSeeks support er ikke en perfekt klon af alle OpenAI Responses API-funktioner, men den er tilstrækkelig til at gøre V4 Flash til en langt mere praktisk kandidat, der kan sættes ind i Codex-eksperimenter.
Ydelsesbenchmarks for den officielle V4-Flash-version
Benchmark-forbehold, som udviklere ikke bør ignorere
Officielle evalueringsresultater (rapporteret af DeepSeek på modelkortet) viser store spring over previewet og, bemærkelsesværdigt, over den langt større V4-Pro Preview på agentcentriske opgaver. Evalueringer for kode-agent-benchmarks brugte den minimale tilstand af DeepSeek Harness (frigives) ved maksimal ræsonneringsindsats, temperature = 1.0, top_p = 0.95.
Det har to implikationer. For det første er modelresultatet delvist et model-og-harness-resultat. Hvis din agent-runtime har andre værktøjer, shell-tilladelser, konteksthåndtering, retries, patch-regler eller fejlhåndtering, får du måske ikke de samme scorer. For det andet er uafhængig reproduktion begrænset, indtil DeepSeek frigiver nok af harness og evalueringsopsætning til, at eksterne teams kan køre sammenlignelige tests.
Officiel DeepSeek benchmark-tabel
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
På tværs af disse ni benchmarks gennemsnitligt scorer V4 Flash 0731 55,2. Den gamle V4 Flash preview gennemsnitligt 29,6, og V4-Pro Preview gennemsnitligt 34,9. Det betyder, at V4 Flash 0731 ligger ca. 25,6 point over Flash preview og 20,3 point over V4-Pro Preview i denne tabel.
Tredjepartssignaler
ARC Prize rapporterer V4 Flash 0731 ved maksimal indsats med 89,0% på ARC-AGI-1 Semi-Private og 61,4% på ARC-AGI-2 Semi-Private, med angivne omkostninger på $0,02 og $0,04 pr. opgave. Dette er ikke kodningsagent-benchmarks, men de understøtter det bredere syn, at modellen er konkurrencedygtig på ræsonneringsopgaver, når den køres ved højere indsats.
Gevinsterne er særligt markante på DeepSWE (software engineering agent-loop) og Cybergym. Uafhængige målinger (fx Artificial Analysis) rapporterer en smule lavere, men stadig stærke Terminal-Bench-tal omkring 79%, hvilket bekræfter forbedringens retning, mens det minder brugerne om, at leverandør-harness-tal ofte er optimistiske.
Yderligere kontekst fra tidligere V4-evalueringer og tredjepartsaggregatorer viser stærk viden og kodningsydelse i max-ræsonneringstilstand (GPQA Diamond ~88–91%, LiveCodeBench høje 80’ere–90’ere afhængigt af kilde). Eftertræningen 0731 låste specifikt op for agentpålidelighed, som previewet manglede.
DeepSeek-V4-Flash understøtter nu Responses API og Codex
En strategisk vigtig tilføjelse er native support for OpenAI’s Responses API. DeepSeeks officielle dokumentation bekræfter, at Responses API i øjeblikket understøtter deepseek-v4-flash (Pro-support forventes i begyndelsen af august 2026). Basis-URL’en forbliver https://api.deepseek.com.
Dette er en stor opgradering af udvikleroplevelsen. Før Responses API- og Codex-support kunne DeepSeek V4 Flash allerede kaldes som en tekstmodel, men en kodningsagent måtte selv bygge bro over flere integrationsdetaljer. Nu kan modellen bruges i arbejdsgange, der forventer Responses-lignende semantik.
Hvad Responses API-support omfatter
DeepSeeks Responses API skaber et modelrespons i OpenAI Responses API-format på /responses. Responses API understøtter model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, tools, værktøjsvalg, ræsonneringsindsats, tekstformat og forbrugsrapportering. API’en er stateless, så klienter skal sende hele samtalehistorikken for flertrinsinteraktioner.
De vigtigste kompatibilitetsdetaljer er praktiske:
deepseek-v4-flasher i øjeblikket den eneste model, der understøttes af Responses API.developer-beskeder behandles somsystem-beskeder.- Funktionværktøjer, streaming og justerbar ræsonneringsindsats samt server-side websøgning understøttes.
- Den brugerdefinerede værktøjstype understøttes kun for
apply_patch, hvilket er vigtigt for Codex-kompatibilitet. - Billed- og filinput understøttes ikke; billedinputdele erstattes med pladsholdertekst.
previous_response_id,conversation,store, background mode, metadata og nogle konteksthåndteringsfunktioner understøttes ikke.- Ikke-understøttede parametre kan blive ignoreret stille, så produktionsklienter bør teste forventet adfærd eksplicit.
For udviklere er hovedpointen, at Responses API-support ikke bare er en syntaktisk detalje. Den gør, at DeepSeek V4 Flash kan placeres i en protokollane, som moderne kodningsagenter bruger, især hvor funktionskald, streamingbegivenheder, ræsonneringselementer og patch-anvendelse skal repræsenteres konsistent.
Stateless design (klienten styrer samtalehistorikken). Eksempel (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Fuldte detaljer og Codex-integrationsguide: DeepSeek API Docs – Responses API og Integrate with Codex.
Hvad Codex-support betyder
DeepSeeks Codex-integrationsguide siger, at Codex taler med modeller via Responses API, som DeepSeek nu understøtter nativt. Dette muliggør direkte integration med Codex (OpenAIs kodningsagent-økosystem — CLI, ChatGPT desktop-app og Codex IDE-udvidelsen til VS Code).
Udviklere kan konfigurere en brugerdefineret provider én gang via et setup-script eller ved at redigere ~/.codex/config.toml og en modelkatalogfil. Efter konfiguration genkender Codex-klienter DeepSeek-V4-Flash og kan bruge dens værktøjskald, apply_patch, websøgning og ræsonneringsfunktioner.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspekt | V4-Flash-0731 | V4-Pro (typisk / Preview) |
|---|---|---|
| Total / aktive param. | 284B / 13B | ~1,6T / 49B |
| Kontekstvindue | 1M tokens | 1M tokens |
| Styrker | Agent-baseret kodning, terminal, pris, hastighed | Dybeste ræsonnering, viden, sværeste opgaver |
| Agent-benchmark-fordel | Vinder på den offentliggjorte 0731-agent-suite | Stærkere på ren viden & kompleks multi-fil i tidligere evalueringer |
| Typisk API-pris | ~$0,14 ind / $0,28 ud (cache meget lavere) | Signifikant højere (historisk 3–12×) |
| Bedst til | Højvolumen agenter, produktions-kodningsloops, prisfølsomme apps | Frontierresearch, maksimal kapabilitet på enkeltopgaver |
| Åbne vægte | Ja (MIT) | Ja (MIT) |
Hvad bør udviklere starte med?
På de specifikke agent-benchmarks udgivet med 0731 overgår den mindre Flash-model Pro-previewet på hele linjen. For ren vidensindhentning eller de absolut sværeste ræsonneringsproblemer har Pro stadig en fordel i mange uafhængige og tidligere evalueringer. I praksis default’er mange teams nu til Flash for størstedelen af agent-baserede workloads og ruter kun de mest krævende opgaver til Pro (eller andre frontmodeller).
Den routingstrategi er der, hvor CometAPI kan hjælpe. I stedet for at hardkode én model på tværs af alle workloads, brug CometAPI til at centralisere modelvalg, logging, omkostningssporing og fallback-politikker. For eksempel:
- Brug V4 Flash til repositoriesammenfatning, refaktorplanlægning, kodegennemsynsudkast, genererede tests, struktureret ektraktion, lang-kontekst QA og gentagne agent-loops.
- Eskaler til V4 Pro eller en anden premium-model, når opgaven har høj forretningsrisiko, tvetydige krav, skrøbelig produktionskode eller gentagne mislykkede forsøg.
- Spor den endelige metrik, der betyder noget: accepterede rettelser pr. dollar, succesfulde opgaver pr. time eller sparede minutter til menneskelig gennemgang.
Hvad er DeepSeek Harness?
DeepSeek Harness er det officielle agent-rammeværk / runtime-lag, som DeepSeek bygger for at gøre sine modeller til pålidelige autonome agenter. Virksomheden opstiller ligningen enkelt: Model + Harness = Agent.
Officielle evalueringer af V4-Flash-0731 brugte allerede “minimal mode” af DeepSeek Harness. Det fulde produkt rulles stadig ud (rekruttering og tidlig test var aktive omkring slut juli–begyndelsen af august 2026). Teamet ledes af Cui Tianyi (baggrund i kvantitativ handelssystemer), og jobbeskrivelser understreger dyb integration med DeepSeek-V4-funktioner såsom prefix caching, lang-kontekst-håndtering, KV-cache-optimering, kædning af værktøjsbrug, fejlretning og automatisk retry.
Harness er ikke en generisk LangChain-stil wrapper. Det co-designes med modellen, så konteksthåndtering, værktøjsorkestrering, evidensindsamling og reparationsloops udnytter V4-specifikke effektivitetspunkter (sparsom opmærksomhed, caching, ræsonneringstilstande). Fællesskabsprojekter og tredjeparts-harnesses findes også, men det officielle Harness sigter efter den tættest mulige model–runtime-kobling.
Når det er fuldt udgivet, forventes det at levere:
- Strukturerede agent-loops til kodning og automatisering.
- Sikkerhedsgates og godkendelsesflows.
- Effektiv kontekthåndtering til langhorisont-opgaver.
- Observérbarhed og artefaktproduktion.
Indtil den fulde udgivelse kan udviklere allerede opnå stærke resultater ved at kombinere V4-Flash-0731 med eksisterende agent-rammeværk eller ved at bruge Responses API + Codex-vejen.
Priser, tilgængelighed og praktisk udrulning
- Officielle API-priser (omtrentlige): $0,14 / 1M inputtokens (cache miss), ~$0,0028–0,03 ved cache hit, $0,28 / 1M outputtokens. Høje samtidighedsgrænser.
- Åbne vægte under MIT på Hugging Face; kvantiserede GGUF-versioner er bredt tilgængelige til lokal/selvhostet brug (kræver betydelig VRAM — fuld præcision er stor).
- Spekulativ dekodning (DSpark) og hybrid opmærksomhed holder lang-kontekst-inferens relativt effektiv.
- Understøttede inferensmotorer: vLLM, SGLang og andre med dokumenterede opskrifter.
For mange teams er den nemmeste produktionsvej en OpenAI-kompatibel gateway. CometAPI tilbyder samlet adgang til DeepSeek-modeller (inkl. V4-serien) sammen med hundredvis af andre modeller via et enkelt endpoint (https://api.cometapi.com/v1). Fordele omfatter forenklet multi-model routing, konkurrencedygtige eller rabatterede priser i forhold til direkte udbydere, forbrugsanalyse og muligheden for at skifte mellem Flash, Pro og andre modeller uden at ændre applikationskode. Dette er særligt nyttigt for agentiske systemer, der kan falde tilbage eller rute efter sværhedsgrad/omkostning.
På tidspunktet for denne artikel listede CometAPI’s DeepSeek V4 Flash en startinputpris på $0,12 pr. 1M tokens, en outputpris på $0,24 pr. 1M tokens i sin sammenligningstabel, 100,0% oppetid over 24 timer og en observeret respons på 2941 ms. DeepSeek advarer også om, at de samlede API-priser kan stige i den nærmeste fremtid. Da udbyderpriser kan ændre sig, er den sikre formulering: tjek CometAPI’s livekatalog og DeepSeeks officielle priser, før du forpligter produktionsbudgetter.
Praktiske anbefalinger til udviklere og teams
- Start med Flash-0731 til agent-baseret kodning — Pris/ydelse er i øjeblikket fremragende til terminal-, repository- og multi-værktøjs-workflows. Brug maksimal ræsonneringsindsats + Harness-stil loops til de sværeste opgaver.
- For lokal inferens, download fra Hugging Face og følg de officielle vLLM/SGLang-opskrifter, der aktiverer DSpark.
- Integrer via Responses API, hvis du allerede bruger Codex eller ønsker moderne værktøjskaldssemantik.
- Selvhost eller brug kvantiserede vægte for maksimal omkostningskontrol og dataprivatliv.
- Ruter intelligent — Flash til volumen, Pro (eller andre store modeller) til long-tail af ultra-svære problemer.
- Overvej CometAPI for forenklet multi-model adgang, især hvis din stack allerede blander DeepSeek med andre udbydere.
Konklusion
DeepSeek-V4-Flash-0731 repræsenterer et afgørende øjeblik i effektiv agent-baseret AI. Ved at levere frontier-konkurrencedygtig agentydelse fra en relativt kompakt MoE (13B aktiv) gennem fokuseret eftertræning og ved at parre den med et formålsbygget Harness og moderne API-kompatibilitet (Responses + Codex), har DeepSeek sat nye forventninger til omkostningseffektive kodnings- og automationsagenter.
Uanset om du selv hoster de åbne vægte, kalder den officielle API eller ruter gennem en samlet gateway som CometAPI, tilbyder V4-Flash-0731 + det udviklende Harness-økosystem et højtydende, omkostningseffektivt fundament for næste generation af AI-agenter.
FAQs
Hvad er DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 er den officielle offentlige betaudgivelse af DeepSeek V4 Flash på DeepSeek API, annonceret i ændringsloggen den 31. juli 2026. Den afløser preview-versionen, mens den beholder det samme API-modelnavn, deepseek-v4-flash.
Hvad er nyt i DeepSeek V4 Flash 0731?
De vigtigste ændringer er stærkere agent-benchmark-ydelse, native Responses API-support, Codex-tilpasning og en gen-eftertrænet officiel V4 Flash-build. DeepSeek siger, at modelarkitektur og størrelse forblev de samme som i preview-versionen.
Understøtter DeepSeek V4 Flash 0731 Codex?
Ja. DeepSeeks Codex-guide siger, at kun deepseek-v4-flash i øjeblikket understøtter Codex-integration. Det fungerer via Responses API og kan konfigureres til Codex CLI, ChatGPT desktop-appen og Codex IDE-udvidelsen til VS Code.
Hvad er DeepSeek Harness?
DeepSeek Harness er DeepSeeks agent-rammeværk til at gøre sprogmodeller til autonome kodnings- eller arbejdsflowagenter. Offentlige beskrivelser forklarer et harness som laget, der håndterer værktøjer, kontekst, filer, kommandoeksekvering og flertrins arbejdsgange. DeepSeek brugte Harness minimal tilstand i sin V4 Flash 0731 benchmarkopsætning.
Hvordan kan jeg få adgang til DeepSeek V4 Flash via CometAPI?
Brug CometAPI’s OpenAI-kompatible endpoint med model-ID’et deepseek-v4-flash. CometAPI-modellsiden giver cURL-, Python- og JavaScript-eksempler for /v1/chat/completions samt modelspecs, priser og oppetidsinformation.
Er DeepSeek V4 Flash bedre end DeepSeek V4 Pro?
For benchmark-tabellen fra 31. juli slår V4 Flash 0731 V4-Pro Preview på de listede agent-benchmarks. Det betyder ikke, at Flash altid er bedre end Pro. V4 Pro er større og forbliver stærkere på mange videnstunge og svære ræsonneringsopgaver i modelkortet. Brug Flash som standard for prisfølsomme agent-workflows og Pro som en eskalationsrute.
