TLDR: DeepSeek-V4-Pro-0813 er GA-utgivelsen (general availability) av DeepSeek sin flaggskip-MoE-modell med 1,6T parametere (49B aktive). Den leverer store forbedringer i agentkapasiteter over forhåndsvisningen fra april 2026, støtter et kontekstvindu på 1M tokens, opptil 384K utdatatokens, tre nivåer for resonneringsinnsats (low/high/max), innebygd OpenAI Responses API, verktøykall, JSON-modus og både OpenAI- og Anthropic-kompatible endepunkter.
Offisielle priser starter på $0.435 / $0.87 per 1M inn-/utdata-tokens (cache miss), med peak/off-peak-satser fra 16. august 2026. Den enkleste og ofte mest kostnadseffektive måten å få tilgang på er via CometAPIs OpenAI-kompatible gateway med rabatterte priser.
Viktige punkter
- DeepSeek-V4-Pro-0813 er produksjonsklar GA-versjon lansert rundt August 12–13, 2026; modell-ID forblir
deepseek-v4-pro. - Betydelige løft på agent-benchmarker: DeepSWE 62.7, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, HLE (m/ verktøy) 60.0.
- Tre tenkemoduser/nivåer for resonneringsinnsats: uten tenking + lav / høy / maks resonneringsinnsats.
- Komplette funksjoner: 1M kontekst, 384K maks utdata, verktøykall, JSON-utdata, Responses API, Anthropic-format, strømming, strukturerte utdata.
- Peak/off-peak-prising starter August 16, 2026 (UTC); planlegg arbeidsmengder deretter.
- Drop-in-kompatibilitet med OpenAI SDK gjør migrering trivial.
Denne omfattende veiledningen dekker alt utviklere trenger: hva som er endret i 0813-utgivelsen, offisielle spesifikasjoner og priser, tenkemoduser, strømming og strukturerte utdata, og en trinnvis gjennomgang av bruk av modellen via CometAPI (anbefalt for mange produksjons- og multimodell-arbeidsflyter). All informasjon er hentet fra offisiell DeepSeek-dokumentasjon og samtidige rapporter per August 13, 2026.
Hva er DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 er produksjonssnapshotet for generell tilgjengelighet av DeepSeek V4 Pro lansert i august 2026.
DeepSeek annonserte 13. august at den offisielle V4 Pro-versjonen samtidig var tilgjengelig via app, nettsted og API. DeepSeeks kunngjøring 13. august legger også til innebygd kompatibilitet med OpenAI Responses API og tre praktiske resonneringsnivåer: uten tenking, høy innsats-tenking og maks innsats-tenking. Viktig for utviklere: DeepSeek oppgir at API-modellnavnet ikke endres. Utviklere fortsetter å bruke:
deepseek-v4-pro
0813-betegnelsen identifiserer produksjonssnapshotet og er ikke et modellnavn som utviklere nødvendigvis må angi i API-forespørselen.
Modellen er primært posisjonert for avansert resonnering, programvareutvikling, langtidskontekst-analyse og agentbaserte arbeidsoppgaver. Uavhengig evaluering fra Artificial Analysis rapporterer for tiden en Intelligence Index-score på 53, sammenlignet med en median på 27 blant utvalgte sammenlignbare open-weight-modeller. Den rapporterer også omtrent 77.6 tokens/second utdatahastighet og 1.71-second time-to-first-token basert på API-testing.
Hvilke endringer er gjort i API-et i V4 Pro 0813?
Kjernemodellens identifikator og base-URL-er er uendret, så eksisterende integrasjoner fortsetter å fungere uten kodeendringer. De meningsfulle oppgraderingene ligger i kapasitet, ettertreningskvalitet og støttefunksjoner.
Viktige kapasitetsforbedringer
I følge den offisielle GA-kunngjøringen for DeepSeek-V4-Pro og endringsloggen:
- Store agentoppgraderinger med spesielt sterke gevinster i produksjonsnære arbeidsoppgaver.
- Benchmark-score for 0813-bygget inkluderer:
- HLE (uten / med verktøy): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench (Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Dette representerer substansielle løft over forhåndsvisningen fra april 2026 (f.eks. steg DeepSWE markant). Modellen forblir en Mixture-of-Experts-arkitektur med totalt 1,6 billioner parametere og omtrent 49 milliarder aktivert per token.
Nye og forbedrede API-funksjoner
- Innebygd støtte for OpenAI Responses API, optimalisert for Codex med ett-klikk-konfigurasjonsskript.
- Mer fleksibel kontroll av resonneringsinnsats: low / high / max (tidligere mer begrenset mapping på Pro).
- Fortsatt to-modus-støtte (tenking aktivert som standard; uten tenking er tilgjengelig).
- Full kompatibilitet med OpenAI Chat Completions og Anthropic Messages-formater.
- JSON-utdata, verktøykall, Chat Prefix Completion (Beta) og FIM Completion (Beta, kun uten tenking).
- Kontekstlengde forblir 1M tokens; maksimal utdata er 384K tokens.
- Samtidighetsgrense for Pro: 500 (Flash: 2,500).
Prisoppdatering
Gjeldende (per August 13, 2026) pris per 1M tokens:
| Modell | Inndata (cache-treff) | Inndata (cache-miss) | Utdata |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
Fra og med 16:00 UTC den August 16, 2026 trer peak/off-peak-fakturering i kraft (off-peak = halvparten av peak). Peak-timer: 01:00–04:00 og 06:00–10:00 UTC. Nye satser:
| Modell | Periode | Inndata (cache-treff) | Inndata (cache-miss) | Utdata |
|---|---|---|---|---|
| deepseek-v4-pro | Off-peak | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Peak | $0.044 | $1.32 | $3.96 |
DeepSeek har også indikert at ytterligere generelle prisøkninger kan komme; følg med på den offisielle prissiden.
Den DeepSeek-dokumentasjonen for raterestriksjoner setter standard samtidighet for V4 Pro til 500 forespørsler per konto. En tilkobling teller fra innsending til svaret er fullført, og overskytende forespørsler får HTTP 429-svar. DeepSeek accepts a for scheduling isolation; it must match and be no longer than 512 characters. It should not contain personal information.
Innebygd støtte for Responses API
En av de tydeligste API-endringene er innebygd støtte for OpenAI Responses API-formatet.
DeepSeek sier at Responses API er designet delvis for å støtte kodeagent-arbeidsflyter som Codex. Det offisielle endepunktet bruker:
https://api.deepseek.com
og kan nås med OpenAI Python SDK.
Eksempel:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
DeepSeeks dokumentasjon støtter også strømming for Responses API-forespørsler, ved bruk av semantiske server-sent events i stedet for den eldre data: [DONE]-konvensjonen.
Mer fleksibel tenkekontroll
V4 Pro gjør resonnering konfigurerbar i stedet for å tvinge utviklere til å bruke en separat resonneringsmodell.
DeepSeeks dokumentasjon beskriver tenkebryteren som:
{
"thinking": {
"type": "enabled"
}
}
og resonneringsinnsats som:
high
max
Standard tenkekonfigurasjon er aktivert, med high brukt for vanlige forespørsler. Enkelte komplekse agentarbeidsoppgaver kan automatisk bruke max.
Dette skaper tre praktiske moduser for applikasjonsutviklere:
- Uten tenking
- Tenking — Høy
- Tenking — Maks
Dette er svært nyttig når man designer KI-applikasjoner, fordi ikke alle forespørsler fortjener maksimal resonnering.
En viktig implementasjonsdetalj: I tenkemodus påvirker ikke parametere som
temperatureogtop_pmodellens utdata. DeepSeek dokumenterer eksplisitt denne oppførselen.
Hvordan bruke DeepSeek V4 Pro 0813 API med CometAPI
CometAPI er nyttig dersom du vil integrere DeepSeek V4 Pro uten å vedlikeholde separate API-integrasjoner for hver KI-leverandør.
CometAPI reklamerer i dag for et samlet API som dekker 500+ KI-modeller, med et felles API-lag og samlet fakturering. Prisdokumentasjonen sier at offisielle modellpriser generelt tilbys med 20 % rabatt i forhold til leverandørens offisielle sats.
Her er en praktisk CometAPI-integrasjonsflyt.
Trinn 1: Opprett en CometAPI-konto
Først, opprett eller logg inn på CometAPI-kontoen din.
Åpne CometAPI-nettstedet og gå til API-konsollen.
CometAPIs DeepSeek V4 Pro-dokumentasjon instruerer brukere om å hente et API-token fra CometAPI-konsollen.
Trinn 2: Opprett din CometAPI API-nøkkel
Etter innlogging, åpne token-/API-nøkkel-seksjonen i kontoen din og generer en API-nøkkel.
Lagre den som en miljøvariabel i stedet for å hardkode den i applikasjonen.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Aldri legg en API-nøkkel i GitHub, frontend-JavaScript, mobilapper eller offentlig tilgjengelige konfigurasjonsfiler.
Trinn 3: Installer OpenAI Python SDK
Fordi CometAPI tilbyr et OpenAI-kompatibelt grensesnitt, kan du bruke den velkjente OpenAI Python-klienten.
pip install openai
Dette gjør migreringen spesielt enkel for utviklere som allerede kjenner OpenAI API-formatet.
Trinn 4: Konfigurer CometAPI base-URL
Opprett klienten slik:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
CometAPIs publiserte V4 Pro-eksempel bruker denne base-URL-en og modell-ID-en deepseek-v4-pro.
Trinn 5: Send din første DeepSeek V4 Pro-forespørsel
Send nå en grunnleggende forespørsel:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
De kritiske parameterne er:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Tre tenkemoduser forklart
DeepSeek V4 Pro støtter:
- Modus uten tenking — Raskeste svar, ingen eksplisitt chain-of-thought. Ideelt for enkel Q&A eller høy gjennomstrømning.
- Tenking med lav / høy innsats — Modellen produserer reasoning_content før det endelige svaret. Høy er det praktiske standardvalget for de fleste agent- og kodeoppgaver.
- Maks innsats — Presser modellens resonneringsevne lengst; anbefalt for komplekse, flertrinns problemer. Kan bruke flere tokens og gi høyere latens.
I det OpenAI-kompatible formatet styrer du dette med thinking-objektet og parameteren reasoning_effort. Chain-of-thought vises i message.reasoning_content. Når verktøy ikke brukes, kan tidligere resonnering ofte utelates fra påfølgende kontekst; når verktøy brukes, må full resonnering leveres videre.
Bytt mellom resonneringsinnsats og modus uten tenking
- Uten tenking:
"thinking": {"type": "disabled"}(eller tilsvarende Anthropic-stilreasoning.effort: "none"). - Tenking med innsats:
"reasoning_effort": "low" | "high" | "max"pluss"thinking": {"type": "enabled"}.
Standard er tenking aktivert med høy innsats. Bruk low for enkle forespørsler, high for typisk agentarbeid, og max for de mest krevende resonnerings- eller flertrinns kodeoppgavene.
Strømming av svar og strukturerte utdata
Strømming aktiveres enkelt ved å sette "stream": true. Både innhold og (der det er relevant) resonneringstokener kan strømme. Dette er kritisk for interaktive agenter og brukerrettede applikasjoner.
Strukturerte / JSON-utdata er førsteklasses: bruk response_format={"type": "json_object"} eller den mer avanserte skjemastøtten via Responses API og verktøydefinisjoner. Kombinert med verktøykall muliggjør dette pålitelige agent-løkker som avgir maskinlesbare handlinger.
Responses API-endepunktet (/responses) gir en mer moderne, OpenAI-tilpasset overflate som er spesielt nyttig for Codex-lignende arbeidsflyter og støttes nå innebygd for V4 Pro.
Bruk strukturerte utdata / JSON-modus
DeepSeek støtter JSON-utdata. Be om det via response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
For strengere skjemakontroll, kombiner med verktøykall eller Responses API der det støttes.
Implementer verktøykall (funksjonskall)
Definer verktøy i OpenAI-format. I tenkemodus må du korrekt sende reasoning_content videre på påfølgende turer når verktøy er involvert.
Når du senere interagerer med verktøyet, må utviklere beholde tilsvarende reasoning_content når mindset-verktøyet påkalles. Feil håndtering kan resultere i en 400-feil.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Se de offisielle veiledningene for Tool Calls og Thinking Mode for nøyaktig flertrinnsmønster som kreves når verktøy brukes.
Beste praksis for bruk av DeepSeek V4 Pro 0813 API
Tilpass resonneringsinnsats til oppgaven
Ikke bruk maks resonnering for en oppgave som bare krever klassifisering.
En enkel rutingspolicy fungerer godt:
Enkel → Uten tenking
Moderat → Høy
Kompleks → Maks
Dette kan redusere både latens og kostnader.
Strøm lange svar
Hvis applikasjonen din kan bruke flere sekunder på å generere et svar, bruk:
stream=True
Brukere oppfatter generelt inkrementell utdata som betydelig raskere enn å vente på et komplett svar.
Valider strukturerte utdata
JSON-modus forbedrer påliteligheten, men applikasjonen din bør likevel validere returnert JSON.
Bruk:
import json
data = json.loads(response_text)
og valider deretter påkrevde felt før du skriver til databasen eller utløser en ekstern handling.
Overvåk token-bruk
Inspiser alltid:
response.usage
når det er tilgjengelig.
På V4 Pro-skala er token-regnskap ikke en valgfri analysefunksjon. Det er en kjernekomponent i kostnadskontroll.
Skill stabile og dynamiske promptdeler
For applikasjoner med lang kontekst, hold tilbakevendende instruksjoner og dokumenter stabile for å maksimere cache-gjenbruk.
Ha en fallback-modell
En praktisk produksjonsarkitektur kan rute:
Enkel forespørsel
↓
V4 Flash
Kompleks forespørsel
↓
V4 Pro
Svært vanskelig forespørsel
↓
V4 Pro maks resonnering
Den eksakte rutingspolicyen bør bestemmes gjennom egne benchmarktester.
Vanlige DeepSeek V4 Pro API-feil
Feil: Modell ikke funnet
Sjekk at du bruker:
deepseek-v4-pro
i stedet for å ved et uhell finne opp et snapshot-modellnavn.
DeepSeek oppgir at API-modellnavnet er uendret for 0813-produksjonsutgivelsen.
Feil: Ugyldige tenkeparametere
For OpenAI-kompatible forespørsler, bruk:
"thinking": {
"type": "enabled"
}
inne i riktig forespørselsbody, og bruk:
reasoning_effort=high
eller:
reasoning_effort=max
DeepSeeks offisielle API-dokumentasjon definerer disse parameterne.
Feil: JSON-utdata er ugyldig formatert
Bruk:
"response_format": {
"type": "json_object"
}
og instruer eksplisitt modellen i prompten om å returnere JSON. DeepSeek advarer om at JSON-modus bør ledsages av instruksjon om å generere JSON.
Feil under flerturns verktøykall
Når du bruker tenkemodus med verktøykall, bevar nødvendig reasoning_content i påfølgende forespørsler.
Dette er lett å overse og kan gi et 400-svar.
DeepSeek V4 Pro 0813 API: Anbefalt arkitektur
For en produksjonsapplikasjon ser en solid startarkitektur slik ut:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Dette skiller modellvalg fra applikasjonslogikken.
Hvis en annen modell blir mer økonomisk eller leverer bedre på en bestemt arbeidsoppgave, kan rutingslaget endres uten å skrive om hele applikasjonen.
Konklusjon og anbefalinger
DeepSeek-V4-Pro-0813 markerer modningen av V4 Pro-linjen til en produksjonsklar flaggskipsmodell med merkbart sterkere agentkapasitet, samtidig som den bevarer det generøse 1M-kontekstvinduet og den attraktive økonomien i serien. Utviklere kan begynne å bruke den i dag med praktisk talt null migrasjonskostnad takket være kompatibilitet med OpenAI og Anthropic.
For de fleste team anbefaler vi:
- Prototyping og multimodell-eksperimentering på CometAPI.
- Flytt DeepSeek-only-arbeidsmengder med høyt volum eller strenge latenskrav til det offisielle endepunktet når peak/off-peak-prising og eventuelle videre justeringer har stabilisert seg.
- Standardiser på tenkemodus med
reasoning_effort="high"for agent- og kodeoppgaver; reserver maks for de vanskeligste problemene. - Implementer alltid korrekt rundtur av
reasoning_contentved verktøykall og utnytt strømming + strukturerte utdata for robuste applikasjoner.
Med 0813-utgivelsen har DeepSeek levert en svært kapabel, kostnadseffektiv open-weight-klassemodell som er konkurransedyktig for seriøse agentbaserte og langkontekst-arbeidsoppgaver. Integrer den via CometAPI eller det offisielle API-et og begynn å bygge. Utforsk DeepSeek V4 Pro på CometAPI.
Ofte stilte spørsmål
Er DeepSeek V4 Pro 0813 det samme som deepseek-v4-pro?
Ja. DeepSeeks offisielle lanseringskunngjøring sier at API-modellnavnet forblir uendret mens produksjonsversjonen oppdateres til V4 Pro 0813.
Støtter DeepSeek V4 Pro et kontekstvindu på 1M tokens?
Ja. DeepSeeks gjeldende modell-/pris-dokumentasjon oppgir 1M tokens kontekstlengde og 384K maksimal utdata.
Hva er de tre tenkemodusene i DeepSeek V4 Pro?
For praktisk applikasjonsdesign er de:
- Uten tenking
- Tenking med høy innsats
- Tenking med maks innsats
API-et bruker tenkebryter pluss reasoning_effort. DeepSeeks nåværende API eksponerer high og max, mens kompatibilitetsverdier som low og medium mappes til high.
Kan jeg strømme svar fra DeepSeek V4 Pro?
Ja. Strømming støttes gjennom Chat Completions API, og tenkemodus-strømmer kan inkludere reasoning_content-deltaer før normalt svarinnhold.
Kan jeg bruke DeepSeek V4 Pro med CometAPI?
Ja. CometAPI dokumenterer for tiden modellen deepseek-v4-pro via sitt OpenAI-kompatible /v1/chat/completions-endepunkt.
Bør jeg bruke DeepSeek V4 Pro eller V4 Flash?
Bruk V4 Flash når gjennomstrømning, latens og kostnad veier tyngst. Bruk V4 Pro for krevende resonnering, koding, langkontekst-analyse og agentbaserte arbeidsoppgaver.
En hybrid rutingsstrategi er vanligvis bedre enn å bruke Pro til alt.
Endres prisingen for DeepSeek V4 Pro API?
Ja. DeepSeek har annonsert peak/off-peak-prising fra August 17, 2026. Den offisielle dokumentasjonen lister V4 Pro til $0.66/M cache-miss inndata og $1.98/M utdata i off-peak-perioder, mot $1.32/M inndata og $3.96/M utdata i peak-perioder etter den nye planen.
