TLDR DeepSeek-V4-Flash-0731 (lansert 31. juli 2026) er den offisielle, produksjonsklare versjonen av DeepSeeks effektive Mixture-of-Experts-modell (284B total / 13B aktive parametere, 1M-token kontekst). Gjennom målrettet ettertrening leverer den dramatiske gevinster i agentkoding, verktøybruk og flertrinns programvareutvikling. Den støtter nativt Responses API og OpenAI Codex. DeepSeek Harness er det tilhørende agentrammeverket (minimal modus allerede brukt i offisielle evalueringer; full lansering kommer) designet for å gjøre modellen til en pålitelig autonom agent.
Sammen tilbyr de et av de sterkeste kost–ytelsesforholdene innen agent-AI med åpne vekter og API-tilgang per august 2026.
Hovedpoenger
- Stort agentsprang kun via ettertrening: Samme 284B/13B-arkitektur som forhåndsvisningen i april, men dramatisk høyere scorer (f.eks. Terminal Bench 2.1: 82,7 vs. 61,8; DeepSWE: 54,4 vs. 7,3).
- Overgår DeepSeek-V4-Pro (Preview) på flere agent-benchmarker til tross for langt færre aktiverte parametere.
- Konkurransedyktig med topp proprietære modeller (nær Claude Opus 4.8 på flere agentoppgaver) til en brøkdel av kostnaden.
- Innfødt 1M kontekst, spekulativ dekoding (DSpark), tre nivåer av resonneringsinnsats (low/high/max), MIT-lisens, åpne vekter.
- Offisiell støtte for Responses API og Codex (CLI, desktop, VS Code-utvidelse).
- DeepSeek Harness (minimal modus allerede brukt i evalueringsoppsett) er det offisielle agentrammeverket i lukket beta; offentlig lansering forventes snart. DeepSeek Harness leverer agentens runtime-lag; modell + harness = produksjonsagent.
- Ideell for høyvolums agentkoding, terminalautomatisering, verktøybruk og langkontekst-arbeidsflyter.
- Få rimelig tilgang til DeepSeek-modeller og enhetlig verktøykjede via CometAPI (OpenAI-kompatibelt endepunkt, konkurransedyktige priser, multi-modell-ruting).
Hva er nytt i DeepSeek V4 Flash 0731?
Offisiell lanseringsstatus endret
Den viktigste produktendringen er at DeepSeek V4 Flash 0731 nå er den offisielle utgaven av DeepSeek V4 Flash på API-et, i offentlig beta. DeepSeeks endringslogg for 31. juli sier at utviklere kan fortsette å kalle det samme modellnavnet, deepseek-v4-flash, for å få tilgang til den nyeste versjonen. Det er viktig for migrering fordi det unngår et nytt modellnavn og lar team teste oppdateringen bak eksisterende rutingslogikk.
DeepSeek sier også at oppdateringen kun oppgraderer V4 Flash API. V4 Pro API og app-/nettmodellene ble ikke endret av 31. juli-utgivelsen, og DeepSeek sa at den offisielle V4 Pro-lanseringen ville følge snart. Med andre ord er dette ikke en full oppfriskning av hele DeepSeek V4-familien. Det er en målrettet Flash-oppdatering.
Arkitekturen forble den samme, ettertreningen endret seg
Kjernearkitekturen er uendret: en Mixture-of-Experts (MoE)-modell med 284 milliarder totale parametere og kun 13 milliarder aktivert per token, et hybrid oppmerksomhetsdesign optimalisert for lang kontekst, og et innebygd kontekstvindu på 1 million tokens. En spekulativ dekomponent (DSpark) er tilkoblet for raskere generering. Modellen er kun tekst, støtter justerbare nivåer av resonneringsinnsats (low / high / max), verktøykall, strukturert utdata, og er utgitt under den permissive MIT-lisensen.
Det skillet er viktig. Mange modelloppgraderinger forbedres fordi modellen er større. Denne oppdateringen er mer interessant fordi DeepSeek hevder et stort agentsprang uten å øke modellens parameterfotavtrykk. V4 Flash forblir en 284B total, 13B aktiv MoE-modell, som er langt mindre ved inferens enn V4 Pros 1,6T total, 49B aktiv design.
Agentkodingsscorer hoppet
DeepSeeks offisielle tabell viser store forbedringer på terminal-, repositoriebygging-, cyber-, programvareingeniør-, verktøybruk-, automatiserings- og fullstack-kodingsoppgaver. Det største absolutte hoppet over den eldre Flash-forhåndsvisningen er på DeepSWE: 54,4 versus 7,3, en økning på 47,1 poeng. Cybergym forbedres med 38,0 poeng, DSBench-Hard med 33,8 poeng, og DSBench-FullStack med 31,7 poeng.
Dette er grunnen til at V4 Flash 0731 diskuteres mindre som en vanlig «rask modell» og mer som en kandidat til standardmodell for agentkoding. Verdiforslaget er ikke bare rimelig chat. Det er rimelig, langkontekst, verktøyvennlig agentinferens.
Responses API og Codex-støtte kom
DeepSeeks endringslogg for 31. juli sier at den offisielle V4 Flash støtter Responses API-formatet nativt og er spesifikt tilpasset Codex. DeepSeeks Responses API-guide sier at formatet ble lagt til for å møte etterspørselen fra Codex, bruker basis-URL-en https://api.deepseek.com, og støtter for øyeblikket deepseek-v4-flash.
Dette betyr noe fordi Codex-lignende utviklingsarbeidsflyter ikke er enkle chatsesjoner. De trenger strukturerte input- og outputelementer, resonnementselementer, verktøykall, filendringsoperasjoner, strømming, brukskontoering og integrasjon med klienter for kodeagenter. DeepSeeks støtte er ikke en perfekt klone av alle OpenAI Responses API-funksjoner, men den er nok til å gjøre V4 Flash til en langt mer praktisk kandidat for eksperimenter med kodeagenter.
Ytelsesbenchmarker for den offisielle V4-Flash-versjonen
Benchmark-forbehold utviklere ikke bør ignorere
Offisielle evalueringsresultater (rapportert av DeepSeek på modellkortet) viser store hopp over forhåndsvisningen og, bemerkelsesverdig, over den mye større V4-Pro Preview på agent-sentriske oppgaver. Evalueringer for kodeagent-benchmarker brukte minimal modus av DeepSeek Harness (kommer) med maksimal resonneringsinnsats, temperatur = 1,0, top_p = 0,95.
Det har to implikasjoner. For det første er resultatet delvis et modell-OG-harness-resultat. Hvis din agent-runtime har andre verktøy, shell-tillatelser, konteksthåndtering, retrier, patch-regler eller feilhandtering, kan du ikke få de samme score. For det andre er uavhengig reproduksjon begrenset til DeepSeek frigir nok av harness og evalueringsoppsettet til at eksterne team kan kjøre sammenlignbare tester.
Offisiell DeepSeek-benchmark-tabell
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
På tvers av disse ni benchmarkene snitter V4 Flash 0731 55,2. Den gamle V4 Flash-forhåndsvisningen snitter 29,6, og V4-Pro Preview snitter 34,9. Det betyr at V4 Flash 0731 ligger omtrent 25,6 poeng høyere enn Flash-forhåndsvisningen og 20,3 poeng høyere enn V4-Pro Preview på denne tabellen.
Signaler fra tredjepart
ARC Prize rapporterer V4 Flash 0731 med maksimal innsats til 89,0 % på ARC-AGI-1 Semi-Private og 61,4 % på ARC-AGI-2 Semi-Private, med oppgitte kostnader på $0,02 og $0,04 per oppgave. Dette er ikke kodeagent-benchmarker, men de støtter det bredere bildet om at modellen er konkurransedyktig på resonnement når den kjøres med høy innsats.
Gevinstene er spesielt slående på DeepSWE (programvareingeniør-agent-loop) og Cybergym. Uavhengige målinger (f.eks. Artificial Analysis) rapporterer noe lavere, men fortsatt sterke Terminal-Bench-tall rundt 79 %, som bekrefter forbedringsretningen og samtidig minner om at leverandør-harness-tall har en tendens til å være optimistiske.
Tilleggsdata fra tidligere V4-evalueringer og tredjepartsaggregatorer viser sterke kunnskaps- og kodeprestasjoner i maks-resonneringsmodus (GPQA Diamond ~88–91 %, LiveCodeBench høye 80–90-tall avhengig av kilde). Ettertreningen i 0731 låste spesifikt opp agentpålitelighet som forhåndsvisningen manglet.
DeepSeek-V4-Flash støtter nå Responses API og Codex
En strategisk viktig tillegg er innfødt støtte for OpenAIs Responses API. DeepSeeks offisielle dokumentasjon bekrefter at Responses API for øyeblikket støtter deepseek-v4-flash (Pro-støtte forventet tidlig i august 2026). Basis-URL forblir https://api.deepseek.com.
Dette er en stor oppgradering for utvikleropplevelsen. Før Responses API- og Codex-støtte kunne DeepSeek V4 Flash allerede kalles som en tekstmodell, men en kodeagent måtte selv håndtere flere integrasjonsdetaljer. Nå kan modellen brukes i arbeidsflyter som forventer Responses-lignende semantikk.
Hva Responses API-støtten inkluderer
DeepSeeks Responses API oppretter et modellrespons i OpenAI Responses API-format på /responses. Responses API støtter model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, verktøy, verktøyvalg, resonneringsinnsats, tekstformat og brukerrapportering. API-et er tilstandsløst, så klienter må sende full samtalehistorikk for flerstegsinteraksjoner.
De viktigste kompatibilitetsdetaljene er praktiske:
deepseek-v4-flasher for øyeblikket den eneste støttede modellen for Responses API.developer-meldinger behandles somsystem-meldinger.- Funksjonsverktøy, strømming og justerbar resonneringsinnsats og serverside nettsøk støttes.
- Tilpasset verktøytype støttes kun for
apply_patch, noe som er viktig for Codex-kompatibilitet. - Bilde- og filinput støttes ikke; bildeinnholds-deler erstattes med plassholdertekst.
previous_response_id,conversation,store, bakgrunnsmodus, metadata og noen konteksthåndteringsfunksjoner støttes ikke.- Ikke-støttede parametre kan bli ignorert uten varsel, så produksjonsklienter bør eksplisitt teste forventet oppførsel.
For utviklere er hovedpoenget at Responses API-støtte ikke bare er en syntaktisk detalj. Den lar DeepSeek V4 Flash operere i en protokoll som brukes av moderne kodeagenter, spesielt der verktøykall, strømming, resonnementselementer og patch-anvendelse må representeres konsekvent.
Tilstandsløs design (klienten styrer samtalehistorikk). Eksempel (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Fullstendige detaljer og Codex-integrasjonsveiledning: DeepSeek API Docs – Responses API og Integrate with Codex.
Hva Codex-støtte betyr
DeepSeeks Codex-integrasjonsguide sier at Codex kommuniserer med modeller via Responses API, som DeepSeek nå støtter nativt. Dette muliggjør direkte integrasjon med Codex (OpenAIs økosystem for kodeagenter — CLI, ChatGPT desktop-app og VS Code-utvidelse).
Utviklere kan konfigurere en egendefinert leverandør én gang via et oppsettskript eller ved å redigere ~/.codex/config.toml og en modellkatalogfil. Etter konfigurasjon gjenkjenner Codex-klienter DeepSeek-V4-Flash og kan bruke dens verktøykall, apply_patch, nettsøk og resonneringskapabiliteter.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspekt | V4-Flash-0731 | V4-Pro (typisk / Preview) |
|---|---|---|
| Total / aktive param. | 284B / 13B | ~1,6T / 49B |
| Kontekstvindu | 1M tokens | 1M tokens |
| Styrker | Agentkoding, terminal, kostnad, hastighet | Dypest resonnement, kunnskap, de vanskeligste oppgavene |
| Agent-benchmark-fordel | Vinner på publisert 0731 agent-suite | Sterkere på ren kunnskap og kompleks multi-fil i tidligere eval. |
| Typisk API-prising | ~$0,14 inn / $0,28 ut (cache langt lavere ved treff) | Betydelig høyere (historisk 3–12×) |
| Best for | Høyvolums agenter, produksjons-kodeløkker, kostsensitive apper | Frontforskning, maksimal kapasitet enkeltsoppgaver |
| Åpne vekter | Ja (MIT) | Ja (MIT) |
Hvilken bør utviklere bruke først?
På de spesifikke agent-benchmarkene som ble publisert med 0731, overgår den mindre Flash-modellen Pro-forhåndsvisningen på tvers av bordet. For ren kunnskapshenting eller de absolutt vanskeligste resonnementsoppgavene har Pro fortsatt et forsprang i mange uavhengige og tidligere evalueringer. I praksis defaulter mange team nå til Flash for majoriteten av agent-arbeidsbelastningene og ruter bare de mest krevende oppgavene til Pro (eller andre toppmodeller).
Den rutingsstrategien er der CometAPI kan hjelpe. I stedet for å hardkode én modell på tvers av alle arbeidsbelastninger, bruk CometAPI for å sentralisere modellvalg, logging, kostnadssporing og fallback-regler. For eksempel:
- Bruk V4 Flash for repositorieoppsummering, refaktorplanlegging, kodevurderingsutkast, genererte tester, strukturert ekstraksjon, langkontekst QA og gjentatte agentløkker.
- Eskaler til V4 Pro eller en annen premiummodell når oppgaven har høy forretningsrisiko, tvetydige krav, skjør produksjonskode eller gjentatte mislykkede forsøk.
- Spor den endelige metrikken som betyr noe: godkjente rettelser per dollar, vellykkede oppgaver per time, eller menneskelige gjennomgangsminutter spart.
Hva er DeepSeek Harness?
DeepSeek Harness er det offisielle agentrammeverket / runtime-laget som DeepSeek bygger for å gjøre modellene sine til pålitelige autonome agenter. Selskapet formulerer likningen enkelt: Modell + Harness = Agent.
Offisielle evalueringer av V4-Flash-0731 brukte allerede “minimal modus” av DeepSeek Harness. Hele produktet rulles fortsatt ut (rekruttering og tidlig testing var aktive rundt slutten av juli–begynnelsen av august 2026). Teamet ledes av Cui Tianyi (bakgrunn fra kvantitative handelssystemer), og stillingsbeskrivelser vektlegger dyp integrasjon med DeepSeek-V4-funksjoner som prefiks-caching, langkontekst-håndtering, KV-cache-optimalisering, verktøykjeding, feilretting og automatisk retry.
Harness er ikke en generisk LangChain-lignende wrapper. Den samskapes med modellen slik at konteksthåndtering, verktøyorkestrering, evidensinnsamling og reparasjonsløkker utnytter V4-spesifikke effektiviseringer (spredt oppmerksomhet, caching, resonneringsmoduser). Fellesskapsprosjekter og tredjeparts-harness finnes også, men den offisielle Harness sikter mot tettest mulig kobling mellom modell og runtime.
Når den er fullt lansert, forventes den å levere:
- Strukturerte agentløkker for koding og automatisering.
- Sikkerhetsporter og godkjenningsflyter.
- Effektiv konteksthåndtering for langhorisont-oppgaver.
- Observabilitet og artefaktproduksjon.
Inntil full lansering kan utviklere allerede oppnå sterke resultater ved å pare V4-Flash-0731 med eksisterende agentrammeverk eller ved å bruke Responses API + Codex-veien.
Priser, tilgjengelighet og praktisk produksjonssetting
- Offisiell API-prising (omtrentlig): $0,14 / 1M input-tokens (cache-miss), ~$0,0028–0,03 ved cache-treff, $0,28 / 1M output-tokens. Høye samtidighetsgrenser.
- Åpne vekter under MIT på Hugging Face; kvantiserte GGUF-versjoner er bredt tilgjengelige for lokal/selvhostet bruk (krever betydelig VRAM—full presisjon er stor).
- Spekulativ dekoding (DSpark) og hybrid oppmerksomhet holder langkontekst-inferens relativt effektiv.
- Støttede inferensmotorer: vLLM, SGLang og andre med dokumenterte oppskrifter.
For mange team er den enkleste veien til produksjon en OpenAI-kompatibel gateway. CometAPI tilbyr samlet tilgang til DeepSeek-modeller (inkludert V4-serien) sammen med hundrevis av andre modeller via ett endepunkt (https://api.cometapi.com/v1). Fordeler inkluderer forenklet multimodell-ruting, konkurransedyktig eller rabattert prising relativt til direkte tilbydere, bruksanalyser, og muligheten til å bytte mellom Flash, Pro og andre modeller uten å endre applikasjonskode. Dette er spesielt nyttig for agentiske systemer som kan falle tilbake eller rute etter vanskelighetsgrad/kostnad.
Per denne artikkelen listet CometAPI sin DeepSeek V4 Flash en startpris på $0,12 per 1M input-tokens, en output-pris på $0,24 per 1M tokens i sin sammenligningstabell, 100,0 % oppetid over 24 timer, og en observert responstid på 2941 ms. DeepSeek advarer også om at de generelle API-prisene kan øke i nær fremtid. Fordi leverandørpriser kan endre seg, er den trygge formuleringen: sjekk CometAPIs live-katalog og DeepSeeks offisielle prising før dere låser produksjonsbudsjetter.
Praktiske anbefalinger for utviklere og team
- Start med Flash-0731 for agentkoding — Kost/ytelsesforholdet er for øyeblikket fremragende for terminal-, repo- og multi-verktøy-arbeidsflyter. Bruk maksimal resonneringsinnsats + Harness-lignende løkker for de vanskeligste oppgavene.
- For lokal inferens, last ned fra Hugging Face og følg de offisielle vLLM/SGLang-oppskriftene som aktiverer DSpark.
- Integrer via Responses API hvis du allerede bruker Codex eller ønsker moderne verktøykall-semantikk.
- Selvhost eller bruk kvantiserte vekter for maksimal kostnadskontroll og dataprivacy.
- Ruter intelligent — Flash for volum, Pro (eller andre store modeller) for langhalen av ultrakrevende problemer.
- Vurder CometAPI for forenklet multimodell-tilgang, særlig hvis stakken din allerede mikser DeepSeek med andre tilbydere.
Konklusjon
DeepSeek-V4-Flash-0731 representerer et veiskille i effektiv agent-AI. Ved å levere frontier-konkurransedyktig agentytelse fra en relativt kompakt MoE (13B aktiv) gjennom fokusert ettertrening, og ved å pare den med et formålsbygd Harness og moderne API-kompatibilitet (Responses + Codex), har DeepSeek flyttet forventningene til kostnadseffektive kode- og automasjonsagenter.
Enten du selvhoster de åpne vektene, kaller det offisielle API-et, eller ruter gjennom en samlet gateway som CometAPI, gir V4-Flash-0731 + det voksende Harness-økosystemet et høytytende, kostnadseffektivt fundament for neste generasjon AI-agenter.
Vanlige spørsmål
Hva er DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 er den offisielle offentlige beta-utgaven av DeepSeek V4 Flash på DeepSeek API, kunngjort i endringsloggen 31. juli 2026. Den erstatter forhåndsvisningen mens den beholder samme API-modellnavn, deepseek-v4-flash.
Hva er nytt i DeepSeek V4 Flash 0731?
Hovedendringene er sterkere agent-benchmark-ytelse, innfødt Responses API-støtte, Codex-tilpasning, og en ny ettertrent offisiell V4 Flash-build. DeepSeek sier at modellarkitektur og størrelse forble de samme som i forhåndsvisningen.
Støtter DeepSeek V4 Flash 0731 Codex?
Ja. DeepSeeks Codex-guide sier at bare deepseek-v4-flash for øyeblikket støtter Codex-integrasjon. Det fungerer gjennom Responses API og kan konfigureres for Codex CLI, ChatGPT desktop-appen og Codex IDE-utvidelsen for VS Code.
Hva er DeepSeek Harness?
DeepSeek Harness er DeepSeeks agentrammeverk for å gjøre språkmodeller til autonome kode- eller arbeidsflytagenter. Offentlige rapporter beskriver et harness som laget som styrer verktøy, kontekst, filer, kommandoeksekvering og flertrinns arbeidsflyter. DeepSeek brukte Harness minimal modus i sitt V4 Flash 0731-benchmarkoppsett.
Hvordan kan jeg få tilgang til DeepSeek V4 Flash via CometAPI?
Bruk CometAPIs OpenAI-kompatible endepunkt med modell-ID-en deepseek-v4-flash. CometAPI-modellsiden gir cURL-, Python- og JavaScript-eksempler for /v1/chat/completions, samt modellspecs, prising og oppetidsinformasjon.
Er DeepSeek V4 Flash bedre enn DeepSeek V4 Pro?
For benchmark-tabellen 31. juli slår V4 Flash 0731 V4-Pro Preview på tvers av de listede agent-benchmarkene. Det betyr ikke at Flash alltid er bedre enn Pro. V4 Pro er større og forblir sterkere på mange kunnskapsintensive og vanskelige resonnementsoppgaver i modellkortet. Bruk Flash som standard for kostsensitive agent-arbeidsflyter og Pro som eskaleringsrute.
