GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/CometAPI-forskning

Hva er DeepSeek V4.1 Flash? Arkitektur, funksjoner & priser

DeepSeek V4.1 Flash forklart: 552B MoE med Causal-Encoder-Decoder, KV-cache-besparelser, benchmarker, API-priser, innebygd visuell forståelse og V4 Flash/V4 Pro-sammenligning.

CometAPI
Mia MarenForskerteam for AI-modeller og API
Oppdatert Sep 10, 2026 11 min lesetid
Hva er DeepSeek V4.1 Flash? Arkitektur, funksjoner & priser
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DeepSeek V4.1 Flash erstatter den kortlivede betahistorien med en produksjonsutgivelse bygget rundt asymmetrisk beregning, innebygd multimodalitet, sterkere agent-benchmarker og markant lavere API-priser.

TL;DR

DeepSeek V4.1 Flash er nå et offisielt API og en modell med åpne vekter, ikke et utløpende beta-endepunkt. DeepSeek sier at det er en 552B-parameter Mixture-of-Experts-modell som bruker en ny Causal-Encoder-Decoder-arkitektur. Bare 8B parametere aktiveres ved behandling av inndata, mens 16B aktiveres under generering av utdata. Den asymmetriske utformingen er ment å bruke mindre beregning på lange prompt uten å svekke den autoregressive genereringsfasen.

Modellnavnet i produksjons-API-et er deepseek-flash. Den støtter et kontekstvindu på 1M tokens, opptil 384K utdata-tokens, tenkemodus og ikke-tenkemodus, JSON-utdata, verktøykall, Responses API, Anthropic-kompatibelt API og innebygd bildeinndata. DeepSeeks offisielle benchmark-tabell viser materielle gevinster over både V4 Flash 0731 og V4 Pro 0813 på koding, agenter, cybersikkerhet og multimodale oppgaver.

Prisendringen er like viktig. På topptid koster V4.1 Flash $0.006 per million cache-hit-inndata-tokens, $0.30 per million cache-miss-inndata-tokens og $1.20 per million utdata-tokens. Prisene utenom topptid er halvparten av disse beløpene.

Key Takeaways

  • DeepSeek V4.1 Flash er en utgitt modell med åpne vekter; den midlertidige identifikatoren deepseek-v4.1-flash-expires-on-0910 er ikke lenger korrekt referanse for produksjon.
  • Dens 552B MoE-design aktiverer 8B parametere for inndata og 16B for utdata, og skaper en annen effektivitetsprofil enn V4 Flashs 284B totalt/13B aktive arkitektur.
  • Innebygd multimodalitet er en del av hovedmodellen i stedet for en separat Vision Exp-branch.
  • Den offisielle sammenligningen viser V4.1 Flash foran V4 Pro 0813 på de fleste utvalgte agent- og kode-benchmarker, selv om den ikke leder hver kunnskaps- eller terminalbenchmark mot alle frontkonkurrenter.
  • Global KV-cache faller til 890 byte per token, omtrent 3.9 ganger mindre enn V4 Flash og omtrent en fjerdedel av tidligere fotavtrykk.
  • API-priser i topptid er $0.006 for cache-hit-inndata, $0.30 for cache-miss-inndata og $1.20 for utdata per million tokens; prisene utenom topptid er 50% lavere.

What Is DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash er DeepSeeks effektivitetsfokuserte grunnlagsmodell fra september 2026 for resonnering, koding, agenter og multimodal forståelse. Den offisielle kunngjøringen beskriver den som en 552B-parameter MoE-modell som forbedrer kapasitet samtidig som den reduserer beregning og minne nødvendig for inndatabehandling.

Den viktigste endringen er arkitektonisk. Tidligere V4 Flash brukte ett aktivt parameterbudsjett gjennom hele inferensen. V4.1 Flash separerer inndata- og utdataarbeidslastene: 8B parametere er aktive når prompten kodes, og 16B er aktive under generering av svaret. DeepSeek kaller dette designet Causal-Encoder-Decoder.

DateStatusModel ID
Sep 8Limited betadeepseek-v4.1-flash-expires-on-0910
Sep 10Production releasedeepseek-flash

DeepSeek V4.1 Flash-spesifikasjon:

SpecificationDeepSeek V4.1 Flash
Release statusOffisiell API-utgivelse og modell med åpne vekter
ArchitectureMixture-of-Experts med Causal-Encoder-Decoder-struktur
Total parameters552B
Activated parameters8B for inndata; 16B for utdata
Context window1M tokens
Maximum output384K tokens
Input modalitiesTekst og bilder
Output modalityTekst
Production API model namedeepseek-flash
Thinking modesTenkemodus og ikke-tenkemodus
API featuresJSON-utdata, verktøykall, Responses API, Anthropic API, prefiksfullføring, FIM-fullføring
Open weightsUtgitt på Hugging Face

How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder

Tradisjonelle kun-dekoder-språkmodeller bruker i praksis samme store stabel for promptbehandling og tokengenerering. DeepSeek V4.1 Flash tilordner forskjellig aktiv kapasitet til disse fasene.

I inndatafasen behandler modellen prompten med et aktivt fotavtrykk på 8B. Denne fasen kan undersøke den oppgitte tekst- eller bildekonteksten effektivt fordi det fulle svaret ennå ikke er generert. I utdatafasen aktiverer modellen 16B parametere og fortsetter kausal token-for-token-generering. Designet sparer dermed beregning på promptkoding samtidig som det beholder mer aktiv kapasitet for resonnering og svargenerering.

DeepSeek har ikke publisert alle implementasjonsdetaljer i kunngjøringen, så den sikreste beskrivelsen er funksjonell: arkitekturen er asymmetrisk, inndata- og utdatafasene bruker ulike aktive parameterbudsjetter, og det resulterende systemet reduserer inferensminne og kostnad.

KV Cache Reduction

Minnereultatet er målbart. DeepSeek rapporterer 890 byte global KV-cache per token for V4.1 Flash, sammenlignet med 3,514 byte for V4 Flash, 48,068 byte for V3.2 og 389,120 byte for V1. V4.1-tallet er omtrent 3.9 ganger mindre enn V4 Flash.

Hva er DeepSeek V4.1 Flash? Arkitektur, funksjoner & priser

For langt-kontekst-agenter betyr dette mer enn en enkelt benchmark. Mindre KV-cache reduserer HBM-presset mens en forespørsel er aktiv og senker mengden tilstand som må flyttes til tregere lagring. DeepSeek sier V4.1 Flash trenger omtrent en fjerdedel av HBM og en åttedel av SSD-kapasiteten som den forrige modellen krevde for sammenlignbare cache-arbeidsbelastninger.

DeepSeek V4.1 Flash Features

Native Multimodal Input

V4.1 Flash aksepterer bilder som en del av hovedmodellens API. Dette erstatter det tidligere skillet mellom tekst-only V4 Flash og det eksperimentelle V4 Flash Vision-endepunktet. Utviklere kan nå bygge dokumentforståelse, diagramanalyse, skjermbildefortolkning og visuelle agentarbeidsflyter mot samme produksjonsmodellsfamilie.

Long-Context Reasoning

Den offisielle API-spesifikasjonen beholder et kontekstvindu på 1M tokens og tillater opptil 384K utdata-tokens. Det gjør modellen egnet for kode på depotskala, flerdokumentanalyse, langvarige agentsesjoner og arbeidsflyter som må bevare en stor verktøyhistorikk.

Production API Features

Modellen støtter tenkemodus og ikke-tenkemodus, strukturert JSON-utdata, verktøykall, Responses API, et Anthropic-kompatibelt grensesnitt, chat-prefiksfullføring og FIM-fullføring i ikke-tenkemodus. Disse mulighetene gjør V4.1 Flash til en direkte produksjonserstatter for mange V4 Flash-agent- og kodearbeidslaster.

Open Weights

DeepSeek har utgitt V4.1 Flash-vektene og en teknisk rapport. Utgivelsen forbedrer reproduserbarhet, men modellen er fortsatt ekstremt stor: DeepSeeks kunngjøring ber organisasjoner som er interessert i store utrullinger om å planlegge omtrent 2,000 GPUs pluss en lagringsklynge.

DeepSeek V4.1 Flash Benchmark Performance

De offisielle resultatene endrer den tidligere vurderingen om at V4.1 manglet benchmark-bevis. DeepSeek gir nå en bred tabell som dekker kunnskap, matematikk, koding, terminalagenter, cybersikkerhet, automatisering og multimodale agentoppgaver.

Hva er DeepSeek V4.1 Flash? Arkitektur, funksjoner & priser

BenchmarkDeepSeek V4.1 FlashV4 Pro 0813V4 Flash 0731
GPQA Diamond90.992.489.9
Codeforces rating347133483289
MathArena Apex65.665.358.6
Terminal-Bench 2.190.687.982.7
DeepSWE v1.174.262.754.4
NL2Repo-Bench65.461.554.2
CyberGym88.183.376.7
Automation-Bench54.843.237.7

På tvers av denne utvalgte åtte-benchmark-oversikten slår V4.1 Flash V4 Pro 0813 på sju tester og slår V4 Flash 0731 på alle åtte. De største gevinstene vises i programvareteknikk og agenter: DeepSWE øker med 11.5 poeng over V4 Pro og 19.8 over V4 Flash, mens Automation-Bench forbedres med henholdsvis 11.6 og 17.1 poeng.

Resultatene må fortsatt tolkes nøye. V4.1 Flash scorer under V4 Pro på GPQA Diamond, og hele den offisielle grafen viser at Claude Opus 5 og GPT-5.6 Sol fortsatt ligger foran på Terminal-Bench 3.0. En nyttig konklusjon er at V4.1 Flash materiellt forbedrer DeepSeeks balanse mellom effektivitet og kapasitet; benchmark-tabellen beviser ikke universell ledelse på hver oppgave.

DeepSeek V4.1 Flash API Pricing

DeepSeek bruker fakturering for topptid og utenom topptid. Topptid er 01:00–04:00 og 06:00–10:00 UTC, mandag til fredag; alle andre perioder, inkludert helger, bruker prisen utenom topptid. Den gjeldende prisdokumentasjonen sier at prisene utenom topptid er halvparten av prisene i topptid.

Price per 1M tokensV4.1 Flash off-peakV4.1 Flash peakV4 Pro 0813 off-peakV4 Pro 0813 peak
Cache-hit input$0.003$0.006$0.022$0.044
Cache-miss input$0.15$0.30$0.66$1.32
Output$0.60$1.20$1.98$3.96

Hva er DeepSeek V4.1 Flash? Arkitektur, funksjoner & priser

Besparelsene er betydelige. For en arbeidslast som bruker 100 millioner cache-miss-inndata-tokens og 10 millioner utdata-tokens, koster V4.1 Flash omtrent $21 utenom topptid eller $42 i topptid. Den samme tokenmiksen til de publiserte V4 Pro 0813-satsene koster omtrent $85.80 utenom topptid eller $171.60 i topptid. V4.1 Flash er omtrent 75.5% rimeligere i dette eksempelet.

Prompt-caching forsterker fordelen for agenter som gjentatte ganger gjenbruker systeminstruksjoner, depotkontekst eller dokumenter. V4.1 cache-hit-raten er 50 ganger lavere enn cache-miss-raten i begge faktureringsperioder.

DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro

DimensionDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Pro
Total parameters552B284B1.6T
Activated parameters8B inndata / 16B utdata13B49B
Architecture focusAsymmetrisk inndata-/utdataeffektivitetLettvekts V4 MoEMaksimal V4-kapasitet
Native visionYesSeparate Vision Exp-variantNo
Context window1M1M1M
Maximum output384K384K384K
API status on DeepSeekGjeldende produksjonsmodellPensjonert; legacynavn rutes til V4.1 FlashPlanlagt å rute til V4.1 Flash fra 14. september 2026
Best fitGenerelle agenter, koding, visjon, høy gjennomstrømningKun migreringskompatibilitetEksisterende Pro-arbeidslaster under overgang

V4.1 Flash er større i totale parametere enn V4 Flash, men kan være billigere å drifte fordi inndatafasen aktiverer bare 8B parametere og bruker en mye mindre KV-cache. Sammenlignet med V4 Pro aktiverer den langt færre parametere samtidig som den overgår Pro på de fleste av de utvalgte agent- og kode-benchmarkene ovenfor.

API Access and Migration

DeepSeeks produksjonsmodellnavn er deepseek-flash. Eksisterende applikasjoner kan beholde den OpenAI-kompatible base-URL-en https://api.deepseek.com eller den Anthropic-kompatible base-URL-en https://api.deepseek.com/anthropic.

  1. Oppdater modellnavnet til deepseek-flash.
  2. Behold eksisterende DeepSeek base-URL og autentiseringsmetode.
  3. Test på nytt tenkemodus, verktøykall, bildeenndata, ventetid og tokenbruk med produksjonsprompter.
  4. Overvåk eldre aliaser: deepseek-v4-flash og deepseek-v4-flash-vision-exp ruter nå til V4.1 Flash, mens deepseek-v4-pro er planlagt å rute til V4.1 Flash fra 14. september 2026 til en fremtidig V4.1 Pro-utgivelse.

For CometAPI-brukere er DeepSeek V4.1 API i CometAPI nå live sammen med den eksisterende DeepSeek V4 Flash API. Før du flytter produksjonstrafikk, bekreft endelig modellnavn, priser og alias-mapping i CometAPI-konsollen, ettersom tredjepartsleverandører kan avvike fra DeepSeeks offisielle API-navngivning og faktureringssatser.

Who Should Use DeepSeek V4.1 Flash?

V4.1 Flash passer godt for kodeagenter, depot-analyse, terminalautomatisering, multimodale dokumentarbeidsflyter, assistenter med lang kontekst og systemer med høyt volum som bruker verktøy. Benchmark-gevinstene er konsentrert i de samme arbeidslastene som drar mest nytte av lavere cacheminne og lavere tokenpriser.

Team som allerede bruker V4 Flash bør behandle den som en direkte migrasjonskandidat. Team som bruker V4 Pro bør teste nøye, men DeepSeeks egne benchmark- og prisdata gjør nå V4.1 Flash til det mer økonomiske standardvalget for mange Pro-klasses arbeidslaster.

Egenhosting er en annen beslutning. Åpne vekter gjør ikke en 552B-modell lettvekter. Organisasjoner bør sammenligne kostnaden ved en stor GPU- og lagringsutrulling med hostet API-bruk før de forplikter seg til lokal inferens.

Limitations and Open Questions

  • Benchmark-resultatene kommer fra DeepSeeks offisielle evalueringsoppsett; uavhengige replikasjoner vil være nødvendig for å måle ytelse på tvers av ulike rammeverk og verktøymiljøer.
  • Innebygd multimodal støtte er bekreftet, men applikasjonsteam bør validere støttede bildeformater, tokenregnskap og visjonsatferd mot live-API-et.
  • Eldre modellaliaser endrer nå modellen bak et eksisterende navn, noe som kan endre utdata uten endring i applikasjonskoden.
  • V4.1 Flash reduserer infrastrukturkravene relativt til tidligere DeepSeek-modeller, men utrulling med åpne vekter krever fortsatt betydelig beregning og lagring.
  • CometAPIs dedikerte V4.1-endepunkt og endelige priser bør bekreftes i live-konsollen før produksjonsbruk.

Final Verdict

DeepSeek V4.1 Flash er en stor arkitektur- og produktoppdatering. 552B MoE-modellen kombinerer en 8B-aktiv inndatafase, en 16B-aktiv utdatafase, innebygd visjon, et kontekstvindu på 1M tokens og en kraftig komprimert KV-cache. Disse designvalgene oversettes til sterkere offisielle kode- og agent-benchmarker til mye lavere API-priser enn V4 Pro 0813.

Den mest praktiske endringen er konsolidering. V4.1 Flash samler tekst, visjon, resonnering, verktøybruk og drift med lang kontekst i ett produksjonsmodellnavn. For de fleste nye DeepSeek-integrasjoner er deepseek-flash nå det logiske startpunktet; V4 Pro blir en migreringssammenligning snarere enn det automatiske valget for vanskelig arbeid.

FAQ

Is DeepSeek V4.1 Flash officially released?

Ja. Den er tilgjengelig via DeepSeeks API under modellnavnet deepseek-flash, og DeepSeek har utgitt åpne vekter og en teknisk rapport.

Is the temporary V4.1 beta model ID still required?

Nei. deepseek-v4.1-flash-expires-on-0910 var en kortvarig betaidentifikator. Produksjonsapplikasjoner bør bruke deepseek-flash.

How many parameters does DeepSeek V4.1 Flash have?

Modellen har 552B totale parametere. Den aktiverer 8B parametere under inndatabehandling og 16B under generering av utdata.

Does DeepSeek V4.1 Flash support images?

Ja. Bildeinndata er innebygd i produksjonsmodellen, så et separat V4 Flash Vision Exp-endepunkt er ikke lenger nødvendig.

Is V4.1 Flash better than V4 Pro?

Den leder V4 Pro 0813 på de fleste av DeepSeeks publiserte sammenligninger for koding, agenter, automatisering og cybersikkerhet, men V4 Pro ligger fortsatt foran på GPQA Diamond. Team bør evaluere begge mot sine egne prompter før migrering.

How much does the API cost?

I topptid er prisene per million tokens $0.006 for cache-hit-inndata, $0.30 for cache-miss-inndata og $1.20 for utdata. Prisene utenom topptid er halvparten av disse prisene.

What happens to the old V4 model names?

De eldre navnene deepseek-v4-flash og deepseek-v4-flash-vision-exp ruter til V4.1 Flash. DeepSeek sier at deepseek-v4-pro også vil rute til V4.1 Flash fra 14. september 2026 til V4.1 Pro er utgitt.

Can I use DeepSeek V4.1 Flash through CometAPI?

Ja. CometAPI tilbyr nå et live DeepSeek V4.1 API-endepunkt. Før du sender produksjonstrafikk, bekreft eksakt modellnavn, priser og støttede funksjoner i CometAPI-konsollen, da tredjepartsleverandører kan bruke andre navngivningskonvensjoner eller faktureringssatser enn DeepSeeks offisielle API.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Sep 10, 2026
Sist oppdatert Sep 10, 2026
163 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer