TLDR: DeepSeek-V4-Pro-0813 er GA-udgivelsen (general availability) af DeepSeeks flagskibs MoE-model med 1,6T parametre (49B aktive). Den leverer markante agent-orienterede forbedringer i forhold til forhåndsvisningen fra april 2026, understøtter et kontekstvindue på 1M tokens, op til 384K output-tokens, tre niveauer af tænke-indsats (low/high/max), indbygget OpenAI Responses API, værktøjskald, JSON-tilstand og både OpenAI- og Anthropic-kompatible endepunkter.
Officiel prissætning starter ved $0.435 / $0.87 pr. 1M input/output tokens (cache-miss), med spids-/uden for spidsbelastningssatser fra den 16. august 2026. Den nemmeste og ofte mest omkostningseffektive adgang er via CometAPI’s samlede OpenAI-kompatible gateway til rabatterede priser.
Vigtige pointer
- DeepSeek-V4-Pro-0813 er produktions-GA-versionen frigivet omkring 12.–13. august 2026; model-ID forbliver
deepseek-v4-pro. - Betydelige løft på agent-benchmarks: DeepSWE 62,7, Terminal Bench 2.1 87,9, NL2Repo 61,5, Cybergym 83,3, HLE (m. værktøjer) 60,0.
- Tre tænkningstilstande/indsatsniveauer: uden tænkning + lav / høj / maks. ræsonneringsindsats.
- Fuldt funktionssæt: 1M kontekst, 384K maks. output, værktøjskald, JSON-output, Responses API, Anthropic-format, streaming, strukturerede output.
- Spids-/uden for spidsbelastningspriser starter 16. august 2026 (UTC); planlæg arbejdsbelastninger derefter.
- OpenAI SDK drop-in-kompatibilitet gør migrering triviel.
Denne komplette guide dækker alt, udviklere behøver: hvad der ændrede sig i 0813-udgivelsen, officielle specifikationer og priser, tænkningstilstande, streaming og strukturerede output samt en trinvis gennemgang af brug af modellen via CometAPI (anbefales til mange produktions- og multimodel-arbejdsgange). Al information er hentet fra officiel DeepSeek-dokumentation og samtidige rapporter pr. 13. august 2026.
Hvad er DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 er den produktionsklare GA-snapshot af DeepSeek V4 Pro, frigivet i august 2026.
DeepSeek annoncerede den 13. august, at den officielle V4 Pro-version samtidig var blevet tilgængelig gennem app, website og API. DeepSeeks meddelelse den 13. august tilføjer også indbygget kompatibilitet med OpenAI Responses API og tre praktiske ræsonneringsniveauer: uden tænkning, høj indsats og maksimal indsats. Vigtigt for udviklere: DeepSeek oplyser, at API-modelnavnet ikke ændres. Udviklere fortsætter med at kalde:
deepseek-v4-pro
Betegnelsen 0813 identificerer produktions-snapshot’et snarere end et modelnavn, som udviklere nødvendigvis skal bruge i deres API-anmodning.
Modellen er primært positioneret til avanceret ræsonnering, software engineering, langt kontekst-arbejde og agent-orienterede arbejdsbelastninger. Uafhængig evaluering fra Artificial Analysis rapporterer aktuelt en Intelligence Index-score på 53 sammenlignet med en median på 27 blandt udvalgte sammenlignelige open-weight-modeller. Den rapporterer også cirka 77,6 tokens/sekund i outputhastighed og 1,71 sekunder tid til første token baseret på API-test.
Hvilke ændringer er lavet i API’et i V4 Pro 0813?
Kerne-modelidentifikatoren og base-URL’er er uændrede, så eksisterende integrationer fortsætter med at virke uden kodeændringer. De meningsfulde opgraderinger ligger i kapabilitet, eftertræningskvalitet og understøttende funktioner.
Centrale kapabilitetsforbedringer
Ifølge den officielle DeepSeek-V4-Pro GA-meddelelse og ændringsloggen:
- Store agent-orienterede opgraderinger med særligt stærke gevinster i produktionslignende arbejdsbelastninger.
- Benchmark-scorer for 0813-build’en omfatter:
- HLE (uden / med værktøjer): 42,7 / 60,0
- Terminal Bench 2.1: 87,9
- NL2Repo: 61,5
- Cybergym: 83,3
- DeepSWE: 62,7
- Toolathlon-Verified: 74,1
- Agents’ Last Exam: 25,7
- AutomationBench (Public): 31,8
- DSBench-FullStack: 71,1
- DSBench-Hard: 67,2
Disse repræsenterer væsentlige løft over forhåndsvisningen fra april 2026 (f.eks. steg DeepSWE markant). Modellen forbliver en Mixture-of-Experts-arkitektur med i alt 1,6 billioner parametre og cirka 49 milliarder aktiveret pr. token.
Nye og forbedrede API-funktioner
- Indbygget understøttelse af OpenAI Responses API, optimeret til Codex med one-click-konfigurationsscripts.
- Mere fleksibel styring af tænke-indsats: low / high / max (tidligere mere begrænset mapping på Pro).
- Fortsat dual-tilstand (tænkning aktiveret som standard; uden tænkning tilgængelig).
- Fuld kompatibilitet med OpenAI Chat Completions og Anthropic Messages-formater.
- JSON Output, Tool Calls, Chat Prefix Completion (Beta) og FIM Completion (Beta, kun uden tænkning).
- Kontekstlængde forbliver 1M tokens; maksimalt output er 384K tokens.
- Samtidighedsgrænse for Pro: 500 (Flash: 2.500).
Meddelelse om prisopdatering
Aktuel pris (pr. 13. august 2026) pr. 1M tokens:
| Model | Input (cache-hit) | Input (cache-miss) | Output |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
Fra 16:00 UTC den 16. august 2026 træder taksering med spids-/uden for spidsbelastning i kraft (uden for spidsbelastning = halvdelen af spids). Spidsbelastningstider: 01:00–04:00 og 06:00–10:00 UTC. Nye satser:
| Model | Periode | Input (cache-hit) | Input (cache-miss) | Output |
|---|---|---|---|---|
| deepseek-v4-pro | Uden for spidsbelastn. | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Spidsbelastning | $0.044 | $1.32 | $3.96 |
DeepSeek har også indikeret, at yderligere generelle prisstigninger kan følge; overvåg den officielle prisside.
DeepSeek-dokumentationen om ratebegrænsning fastsætter standard V4 Pro-samtidighed til 500 anmodninger pr. konto. En forbindelse tæller fra indsendelse, til svaret er fuldført, og overskydende anmodninger modtager HTTP 429-svar. DeepSeek accepterer en for scheduling isolation; den skal matche og må højst være 512 tegn. Den bør ikke indeholde personlige oplysninger.
Indbygget Responses API-understøttelse
En af de tydeligste API-ændringer er indbygget understøttelse af OpenAI Responses API-formatet.
DeepSeek siger, at Responses API bl.a. er designet til at understøtte kodeagent-arbejdsgange såsom Codex. Det officielle endepunkt bruger:
https://api.deepseek.com
og kan tilgås med OpenAI Python SDK.
Eksempel:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
DeepSeeks dokumentation understøtter også streaming for Responses API-anmodninger ved brug af semantiske server-sent events frem for den ældre data: [DONE]-konvention.
Mere fleksibel styring af tænkning
V4 Pro gør ræsonnering konfigurerbar frem for at tvinge udviklere til at bruge en separat ræsonneringsmodel.
DeepSeeks dokumentation beskriver tænkningstoggl’en som:
{
"thinking": {
"type": "enabled"
}
}
og ræsonneringsindsatsen som:
high
max
Standardkonfigurationen er tænkning aktiveret, med high brugt til almindelige anmodninger. Visse komplekse agent-arbejdsbelastninger kan automatisk bruge max.
Dette skaber tre praktiske tilstande for applikationsudviklere:
- Uden tænkning
- Tænkning — Høj
- Tænkning — Maks
Denne sondring er særdeles nyttig ved design af AI-applikationer, fordi ikke alle anmodninger kræver maksimal ræsonnering.
En vigtig implementeringsdetalje: I tænkningstilstand påvirker parametre som
temperatureogtop_pikke modellens output. DeepSeek dokumenterer dette eksplicit.
Sådan bruger du DeepSeek V4 Pro 0813 API med CometAPI
CometAPI er nyttig, hvis du vil integrere DeepSeek V4 Pro uden at vedligeholde separate API-integrationer for hver AI-udbyder.
CometAPI annoncerer i øjeblikket en samlet API, der dækker 500+ AI-modeller, med et fælles API-lag og samlet fakturering. Deres prissætningsdokumentation siger, at officielle modelpriser typisk tilbydes til 20% rabat i forhold til udbyderens officielle takst.
Her er en praktisk CometAPI-integrationsworkflow.
Trin 1: Opret en CometAPI-konto
Opret eller log ind på din CometAPI-konto.
Åbn CometAPI-websitet og få adgang til API-konsollen.
CometAPI’s DeepSeek V4 Pro-dokumentation instruerer brugere i at hente et API-token fra CometAPI-konsollen.
Trin 2: Opret din CometAPI API-nøgle
Når du er logget ind, åbner du sektionen for tokens/API-nøgler på din konto og genererer en API-nøgle.
Gem den som en miljøvariabel i stedet for at hardkode den i din applikation.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Commit aldrig en API-nøgle til GitHub, frontend JavaScript, mobilapplikationer eller offentligt tilgængelige konfigurationsfiler.
Trin 3: Installer OpenAI Python SDK
Fordi CometAPI stiller et OpenAI-kompatibelt interface til rådighed, kan du bruge den kendte OpenAI Python-klient.
pip install openai
Dette gør migrering særligt ligetil for udviklere, der allerede kender OpenAI API-formatet.
Trin 4: Konfigurer CometAPI base-URL
Opret klienten sådan her:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
CometAPI’s offentliggjorte V4 Pro-eksempel bruger denne base-URL og model-ID’et deepseek-v4-pro.
Trin 5: Send din første DeepSeek V4 Pro-anmodning
Send nu en grundlæggende anmodning:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
De kritiske parametre er:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Tre tænkningstilstande forklaret
DeepSeek V4 Pro understøtter:
- Tilstand uden tænkning — Hurtigste svar, ingen eksplicit chain-of-thought. Ideel til simple Q&A eller høj-gennemløbs-scenarier.
- Tænkning med lav / høj indsats — Modellen producerer reasoning_content før det endelige svar. Høj er den praktiske standard for de fleste agent- og kodeopgaver.
- Maksimal indsats — Presser modellens ræsonneringsevner længst; anbefales til komplekse flertrinsproblemer. Kan forbruge flere tokens og øge latens.
I det OpenAI-kompatible format styrer du dette med thinking-objektet og parameteren reasoning_effort. Chain-of-thought vises i message.reasoning_content. Når værktøjer ikke bruges, kan tidligere ræsonnering ofte udelades fra efterfølgende kontekst; når værktøjer bruges, skal den fulde ræsonnering føres videre.
Skift mellem tænkning og indsatsniveauer
- Uden tænkning:
"thinking": {"type": "disabled"}(eller tilsvarende Anthropic-stilreasoning.effort: "none"). - Tænkning med indsats:
"reasoning_effort": "low" | "high" | "max"plus"thinking": {"type": "enabled"}.
Standard er tænkning aktiveret med høj indsats. Brug low til simple forespørgsler, high til typiske agentopgaver og max til de sværeste ræsonnerings- eller flertrinskodeopgaver.
Streaming af svar og strukturerede output
Streaming aktiveres blot ved at sætte "stream": true. Både indhold og (hvor relevant) ræsonnerings-tokens kan streames. Dette er kritisk for interaktive agenter og brugerrettede applikationer.
Strukturerede/JSON-outputs er førsteklasses: brug response_format={"type": "json_object"} eller den mere avancerede schema-understøttelse via Responses API og værktøjsdefinitioner. Kombineret med værktøjskald muliggør dette pålidelige agent-loops, der udsender maskinlæsbare handlinger.
Responses API-endepunktet (/responses) giver en mere moderne, OpenAI-tilpasset grænseflade, særligt nyttig til Codex-lignende arbejdsgange og er nu indbygget understøttet for V4 Pro.
Brug strukturerede outputs / JSON-tilstand
DeepSeek understøtter JSON Output. Anmod om det via response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
For strengere schema-kontrol kombineres dette med værktøjskald eller Responses API, hvor det er understøttet.
Implementer værktøjskald (Function Calling)
Definér værktøjer i OpenAI-format. I tænkningstilstand skal du korrekt videreføre reasoning_content i efterfølgende ture, når der bruges værktøjer.
Når du interagerer med værktøjet senere, skal udviklere bevare den tilhørende reasoning_content, når mindset-værktøjet påkaldes. Forkert håndtering kan resultere i en 400-fejl.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Se de officielle guider til Tool Calls og Thinking Mode for det præcise flerturnsmønster, der kræves, når værktøjer bruges.
Best practices for brug af DeepSeek V4 Pro 0813 API
Match ræsonneringsindsats til opgaven
Brug ikke maksimal indsats til en opgave, der kun kræver klassificering.
En simpel routeringspolitik virker godt:
Simpel → Uden tænkning
Moderat → Høj
Kompleks → Maks
Dette kan reducere både latens og omkostninger.
Stream lange svar
Hvis din applikation kan være flere sekunder om at generere et svar, så brug:
stream=True
Brugere opfatter generelt inkrementelt output som væsentligt hurtigere end at vente på et komplet svar.
Validér struktureret output
JSON-tilstand forbedrer pålideligheden, men din applikation bør stadig validere det returnerede JSON.
Brug:
import json
data = json.loads(response_text)
og validér derefter påkrævede felter, før du skriver til din database eller udløser en ekstern handling.
Overvåg tokenforbrug
Inspicér altid:
response.usage
hvor det er tilgængeligt.
I V4 Pro-skala er tokenregnskab ikke et valgfrit analysefeature. Det er en kerne-mekanisme til omkostningskontrol.
Adskil stabile og dynamiske prompts
Til langkontekst-applikationer: hold tilbagevendende instruktioner og dokumenter stabile for at maksimere cache-genbrug.
Hav en fallback-model
En praktisk produktionsarkitektur kan route:
Simpel forespørgsel
↓
V4 Flash
Kompleks forespørgsel
↓
V4 Pro
Meget vanskelig forespørgsel
↓
V4 Pro maksimal ræsonnering
Den præcise routeringspolitik bør fastlægges gennem egne benchmarks.
Almindelige DeepSeek V4 Pro API-fejl
Fejl: Model ikke fundet
Tjek, at du bruger:
deepseek-v4-pro
og ikke ved et uheld opfinder et snapshot-modelnavn.
DeepSeek oplyser, at API-modelnavnet forbliver uændret for 0813-produktionsudgivelsen.
Fejl: Ugyldige tænkningparametre
For OpenAI-kompatible anmodninger, brug:
"thinking": {
"type": "enabled"
}
i den relevante anmodningsbody, og brug:
reasoning_effort=high
eller:
reasoning_effort=max
DeepSeeks officielle API-dokumentation definerer disse parametre.
Fejl: JSON-output er ugyldigt
Brug:
"response_format": {
"type": "json_object"
}
og instruér eksplicit modellen i prompten om kun at outputte JSON. DeepSeek advarer om, at JSON-tilstand bør ledsages af en instruktion om at generere JSON.
Fejl under flerturns værktøjskald
Når du bruger tænkningstilstand med værktøjskald, så bevar den nødvendige reasoning_content i efterfølgende anmodninger.
Dette er let at overse og kan give et 400-svar.
DeepSeek V4 Pro 0813 API: Anbefalet arkitektur
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Dette adskiller modelvalg fra applikationslogik.
Hvis en anden model bliver mere økonomisk eller performer bedre på en bestemt arbejdsbelastning, kan routeringslaget ændres uden at omskrive hele applikationen.
Konklusion og anbefalinger
DeepSeek-V4-Pro-0813 markerer modningen af V4 Pro-serien til et produktionsklart flagskib med markant stærkere agent-orienteret performance, samtidig med at den generøse 1M-kontekst og attraktive økonomi i serien bevares. Udviklere kan begynde at bruge den i dag med stort set nul migrationsomkostninger takket være kompatibilitet med OpenAI og Anthropic.
For de fleste teams anbefaler vi:
- Prototyper og multimodel-eksperimenter på CometAPI.
- Flyt DeepSeek-only arbejdsbelastninger med høj volumen eller latensfølsomhed til det officielle endepunkt, når spids-/uden for spidsbelastningspriser og eventuelle yderligere justeringer har lagt sig.
- Brug som standard tænkningstilstand med
reasoning_effort="high"til agent- og kodeopgaver; reserver max til de hårdeste problemer. - Implementér altid korrekt round-tripping af
reasoning_contentved værktøjskald, og udnyt streaming + strukturerede output for robuste applikationer.
Med 0813-udgivelsen har DeepSeek leveret en yderst kapabel, omkostningseffektiv open-weight-klasse model, der er konkurrencedygtig til seriøse agent- og langkontekst-arbejdsbelastninger. Integrér den via CometAPI eller den officielle API og begynd at bygge. Udforsk DeepSeek V4 Pro på CometAPI.
Ofte stillede spørgsmål
Er DeepSeek V4 Pro 0813 det samme som deepseek-v4-pro?
Ja. DeepSeeks officielle udgivelsesmeddelelse siger, at API-modelnavnet forbliver uændret, mens produktionsversionen opdateres til V4 Pro 0813.
Understøtter DeepSeek V4 Pro et 1M-token kontekstvindue?
Ja. DeepSeeks nuværende model-/pris-dokumentation angiver en 1M-token kontekstlængde og 384K maksimalt output.
Hvad er de tre DeepSeek V4 Pro-tænkningstilstande?
For praktisk applikationsdesign er de:
- Uden tænkning
- Tænkning med høj indsats
- Tænkning med maksimal indsats
API’et bruger tænkningstoggle plus reasoning_effort. DeepSeeks nuværende API eksponerer high og max, mens kompatibilitetsværdier som low og medium mappes til high.
Kan jeg streame DeepSeek V4 Pro-svar?
Ja. Streaming understøttes via Chat Completions API, og streams i tænkningstilstand kan inkludere reasoning_content-deltaer før normalt svarindhold.
Kan jeg bruge DeepSeek V4 Pro med CometAPI?
Ja. CometAPI dokumenterer i øjeblikket modellen deepseek-v4-pro via sit OpenAI-kompatible /v1/chat/completions-endepunkt.
Bør jeg bruge DeepSeek V4 Pro eller V4 Flash?
Brug V4 Flash, når gennemløb, latens og omkostninger dominerer. Brug V4 Pro til vanskelig ræsonnering, kodning, langkontekst-analyse og agent-orienterede arbejdsgange.
En hybrid routeringsstrategi er normalt bedre end at bruge Pro til alt.
Ændres DeepSeek V4 Pro API-prissætning?
Ja. DeepSeek har annonceret spids-/uden for spidsbelastningspriser fra den 17. august 2026. Den officielle dokumentation angiver V4 Pro til $0.66/M cache-miss input og $1.98/M output uden for spidsbelastning, mod $1.32/M input og $3.96/M output i spidsbelastningsperioder under den nye plan.
