**TLDR:**DeepSeek-V4-Pro-0813 是 DeepSeek 旗艦 1.6T 參數 MoE 模型(每個 token 啟用 49B)的正式一般可用(GA)版本。相較 2026 年 4 月預覽版,該版本在代理型能力上有重大提升,支援 1M token 上下文視窗、最高 384K 輸出 token、三檔思考力度(low/high/max)、原生 OpenAI Responses API、工具呼叫、JSON 模式,並同時相容 OpenAI 與 Anthropic 端點。
官方定價(快取未命中)為每 100 萬輸入/輸出 token 分別 $0.435 / $0.87,尖峰/離峰費率將於 2026 年 8 月 16 日生效。最簡單且往往最具成本效益的接入方式是透過 CometAPI 的統一 OpenAI 相容閘道,享受折扣價。
關鍵重點
- DeepSeek-V4-Pro-0813 是於 2026 年 8 月 12–13 日左右發布的生產 GA 版本;模型 ID 維持為
deepseek-v4-pro。 - 顯著的代理相關基準分數提升:DeepSWE 62.7、Terminal Bench 2.1 87.9、NL2Repo 61.5、Cybergym 83.3、HLE(含工具)60.0。
- 三種思考模式/力度:非思考 + 低/高/最大推理力度。
- 完整功能集:1M 上下文、384K 最大輸出、工具呼叫、JSON 輸出、Responses API、Anthropic 格式、串流、結構化輸出。
- 尖峰/離峰定價自 2026 年 8 月 16 日(UTC)起生效;請合理規劃工作負載。
- OpenAI SDK 可直接相容,遷移幾乎零成本。
本指南涵蓋開發者所需的一切:0813 版本變更、官方規格與定價、思考模式、串流與結構化輸出,並提供透過 CometAPI 使用該模型的逐步教學(對多模型與生產流程強烈建議)。所有資訊來自 DeepSeek 官方文件與 2026 年 8 月 13 日當時報導。
什麼是 DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 是 2026 年 8 月發布的 DeepSeek V4 Pro「正式一般可用」生產快照。
DeepSeek 於 8 月 13 日公告 官方 V4 Pro 版本同時在 App、網站與 API 上線。該公告也加入原生 OpenAI Responses API 相容與三檔實用推理等級:非思考、高力度思考、最大力度思考。對開發者而言重要的是,API 模型名稱不變,仍沿用:
deepseek-v4-pro
0813 僅用於標識生產快照,開發者不必在 API 請求中填入該標識。
該模型主要面向高階推理、軟體工程、長上下文分析與代理型工作負載。第三方評測網站 Artificial Analysis 當前報告其 Intelligence Index 為 53(相較其選取的開放權重模型中位數 27),並測得約 77.6 tokens/second 的輸出速度與 1.71 秒的首 token 延遲(TTFT)。
V4 Pro 0813 在 API 上有哪些變更?
核心模型 ID 與基底 URL 維持不變,既有整合無需改動即可繼續使用。實質升級體現在能力、後訓練品質與周邊支援功能。
重要能力提升
根據 DeepSeek-V4-Pro GA 官方公告與變更日誌:
- 重大代理能力升級,在接近實務生產的工作負載上尤為明顯。
- 0813 版本基準分數包含:
- HLE(無工具/含工具):42.7 / 60.0
- Terminal Bench 2.1:87.9
- NL2Repo:61.5
- Cybergym:83.3
- DeepSWE:62.7
- Toolathlon-Verified:74.1
- Agents’ Last Exam:25.7
- AutomationBench(Public):31.8
- DSBench-FullStack:71.1
- DSBench-Hard:67.2
相較 2026 年 4 月預覽版,這些升幅相當可觀(例如 DeepSWE 大幅提升)。模型仍採用 Mixture-of-Experts 架構,總參數規模 1.6 兆,每個 token 約啟用 49 億參數。
新增與增強的 API 功能
- 原生支援 OpenAI Responses API,針對 Codex 流程優化,提供一鍵配置腳本。
- 更靈活的思考力度控制:low / high / max(先前 Pro 的映射較受限)。
- 持續支援雙模式(預設啟用思考;可切換為非思考)。
- 與 OpenAI Chat Completions 與 Anthropic Messages 格式完全相容。
- JSON 輸出、工具呼叫、Chat Prefix Completion(Beta)、FIM Completion(Beta,僅非思考)。
- 上下文長度維持 1M token;最大輸出為 384K token。
- Pro 版並發限制:500(Flash:2,500)。
定價更新公告
截至 2026 年 8 月 13 日的每百萬 token 價格:
| Model | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
自 2026 年 8 月 16 日 16:00 UTC 起,將實施尖峰/離峰計費(off-peak = peak 的一半)。尖峰時段:01:00–04:00 與 06:00–10:00 UTC。新費率:
| Model | Period | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|---|
| deepseek-v4-pro | Off-peak | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Peak | $0.044 | $1.32 | $3.96 |
DeepSeek 亦表示可能進一步全面調價;請持續關注官方定價頁。
DeepSeek 並發限制文件指出標準 V4 Pro 每帳戶並發為 500。連線從提交開始計入,直至回應完成;超額請求將返回 HTTP 429。DeepSeek 接受一個用於調度隔離的參數;其必須匹配相應值且長度不超過 512 字元。該值不應包含個人資訊。
原生 Responses API 支援
最明顯的變更之一是原生支援 OpenAI Responses API 格式。
DeepSeek 表示 Responses API 部分是為了支援如 Codex 的程式代理工作流程。官方端點為:
https://api.deepseek.com
並可透過 OpenAI Python SDK 使用。
範例:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
DeepSeek 的文件也支援 Responses API 的串流,採用語義化的 SSE,而非舊式的 data: [DONE] 約定。
更靈活的思考控制
V4 Pro 讓推理可配置,而不再要求使用獨立的推理模型。
DeepSeek 文件描述的思考開關為:
{
"thinking": {
"type": "enabled"
}
}
而推理力度為:
high
max
預設為啟用思考,常規請求使用 high。部分複雜代理工作負載可自動使用 max。
這為應用開發者帶來三種實用模式:
- 非思考
- 思考 — High
- 思考 — Max
這種區分在設計 AI 應用時極為實用,因為並非每個請求都值得使用最大推理。
一個重要的實作細節:在思考模式下,
temperature與top_p等參數不會影響模型輸出。DeepSeek 明確在文件中說明此行為。
如何透過 CometAPI 使用 DeepSeek V4 Pro 0813 API
若希望整合 DeepSeek V4 Pro 而無需為每個供應商維護獨立 API,CometAPI 很實用。
CometAPI 目前提供覆蓋 500+ AI 模型 的統一 API,具備共同的 API 介面與統一計費。其定價文件表示官方模型的定價一般提供較官方價低 20% 的折扣。
以下是實務的 CometAPI 整合流程。
步驟 1:建立 CometAPI 帳號
首先建立或登入 CometAPI 帳號。
開啟 CometAPI 網站 並進入 API 主控台。
CometAPI 的 DeepSeek V4 Pro 文件指示使用者需在 CometAPI 主控台取得 API Token。
步驟 2:建立 CometAPI API Key
登入後,進入帳號的 token/API key 區生成 API key。
請將其保存為環境變數,避免硬編碼於應用程式。
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
切勿將 API key 提交到 GitHub、前端 JavaScript、行動應用或公開設定檔中。
步驟 3:安裝 OpenAI Python SDK
由於 CometAPI 提供 OpenAI 相容介面,可直接使用熟悉的 OpenAI Python 客戶端。
pip install openai
這讓已熟悉 OpenAI API 的開發者遷移格外順暢。
步驟 4:設定 CometAPI Base URL
建立客戶端如下:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
CometAPI 發布的 V4 Pro 範例使用此 Base URL 與模型 ID deepseek-v4-pro。
步驟 5:送出你的第一個 DeepSeek V4 Pro 請求
現在送出基本請求:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
關鍵參數為:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
三種思考模式說明
DeepSeek V4 Pro 支援:
- 非思考模式 — 最快回應,不輸出顯式的 chain-of-thought。適合簡單問答或高吞吐場景。
- 思考模式(低/高力度) — 模型會在最終回答前產生 reasoning_content。High 是多數代理與編碼工作的實用預設。
- 最大力度(Max) — 將模型推理能力發揮到最大;建議用於複雜多步驟問題。可能增加 token 消耗與延遲。
在 OpenAI 相容格式中,使用 thinking 物件與 reasoning_effort 參數控制。鏈式推理會出現在 message.reasoning_content。未使用工具時,先前的推理內容通常可從後續上下文省略;使用工具時,必須完整回傳先前推理。
在思考力度與非思考模式間切換
- 非思考:
"thinking": {"type": "disabled"}(或等效的 Anthropic 風格reasoning.effort: "none")。 - 思考並指定力度:
"reasoning_effort": "low" | "high" | "max",並搭配"thinking": {"type": "enabled"}。
預設為啟用思考且使用 high 力度。簡單請求用 low;一般代理工作用 high;最困難的推理或多步驟編碼用 max。
串流回應與結構化輸出
串流 只需設定 "stream": true。內容與(若適用)推理 token 均可串流。這對互動式代理與使用者導向應用至關重要。
結構化/JSON 輸出 是一等公民:使用 response_format={"type": "json_object"} 或透過 Responses API 與工具定義提供的更嚴格結構化支援。結合工具呼叫,可產出可機器解析的動作,強化代理閉環。
Responses API 端點(/responses)提供更現代、對齊 OpenAI 的介面,對 Codex 類工作流程尤其實用,現已原生支援 V4 Pro。
使用結構化輸出/JSON 模式
DeepSeek 支援 JSON Output。透過 response_format 請求:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
若需更嚴格的結構控制,可結合工具呼叫或在 Responses API 中使用可用的結構化能力。
實作工具呼叫(Function Calling)
以 OpenAI 格式定義工具。在思考模式下,進行工具互動時,務必在後續輪次正確回傳 reasoning_content。
後續與工具互動時,開發者必須保留對應的 reasoning_content,在呼叫 mindset 工具時一併傳遞。處理不當可能導致 400 錯誤。
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
工具呼叫與思考模式的多輪互動細節請參考官方指南。
使用 DeepSeek V4 Pro 0813 API 的最佳實務
依任務匹配推理力度
不要為只需分類的任務使用 Max 推理。
簡單的路由策略效果良好:
簡單 → Non-thinking
中等 → High
複雜 → Max
可同時降低延遲與成本。
串流長回應
若你的應用需要數秒以上生成回應,請使用:
stream=True
使用者通常會感受到逐步輸出遠快於等待完整回應。
驗證結構化輸出
JSON 模式能提升可靠性,但應用仍應驗證返回的 JSON。
使用:
import json
data = json.loads(response_text)
寫入資料庫或觸發外部動作前,先驗證必要欄位。
監控 token 用量
在可用時,請總是檢視:
response.usage
在 V4 Pro 的規模下,token 會計不是可選分析,而是核心成本控制機制。
分離穩定與動態提示
對長上下文應用,將重複的指令與文件保持穩定,有助於最大化快取重用。
保留後備模型
實務生產架構可以如下路由:
Simple request
↓
V4 Flash
Complex request
↓
V4 Pro
Very difficult request
↓
V4 Pro Max reasoning
具體路由策略應以你自身基準測試為準。
常見 DeepSeek V4 Pro API 錯誤
錯誤:Model not found
請確認你使用的是:
deepseek-v4-pro
避免誤用快照名稱。DeepSeek 表示 0813 生產版發布後 API 模型名維持不變。
錯誤:Invalid thinking parameters
對 OpenAI 相容請求,請使用:
"thinking": {
"type": "enabled"
}
並設定:
reasoning_effort=high
或:
reasoning_effort=max
這些參數以 DeepSeek 官方 API 文件為準。
錯誤:JSON output is malformed
使用:
"response_format": {
"type": "json_object"
}
並在提示中明確要求輸出 JSON。DeepSeek 提醒,JSON 模式應搭配指示產生 JSON。
錯誤:多輪工具呼叫失敗
在思考模式搭配工具呼叫時,請保留並回傳必要的 reasoning_content 到後續請求。
此細節很容易忽略,會導致 400 回應。
DeepSeek V4 Pro 0813 API:建議架構
對生產應用而言,可從如下架構著手:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
這讓模型選擇與應用邏輯解耦。若日後有更具成本效益或在特定負載上表現更佳的模型,只需調整路由層即可,無須重寫整個應用。
結論與建議
DeepSeek-V4-Pro-0813 宣示 V4 Pro 系列邁入生產可用階段:在維持 1M 上下文與具競爭力成本的同時,代理能力大幅強化。得益於與 OpenAI 與 Anthropic 的相容性,開發者幾乎可零成本上手。
我們對多數團隊的建議:
- 在 CometAPI 上進行原型開發與多模型試驗。
- 當尖峰/離峰定價與後續調整穩定後,將高流量或延遲敏感的 DeepSeek 專用工作負載移至官方端點。
- 針對代理與編碼任務,預設使用思考模式且 reasoning_effort="high";僅在最困難問題時使用 max。
- 正確實作工具呼叫的
reasoning_content往返,並結合串流與結構化輸出,打造健壯應用。
隨著 0813 版本,DeepSeek 交付了一款能力強大、成本效率高、可用於嚴肅代理與長上下文工作負載的開放權重要級模型。透過 CometAPI 或官方 API 開始整合吧。在 CometAPI 探索 DeepSeek V4 Pro。
常見問題
DeepSeek V4 Pro 0813 是否等同於 deepseek-v4-pro?
是。DeepSeek 官方發布指出,API 模型名稱維持不變,同時生產版本更新為 V4 Pro 0813。
DeepSeek V4 Pro 是否支援 1M token 上下文視窗?
是。DeepSeek 當前的模型/定價文件列出 1M token 上下文長度 與 384K 最大輸出。
DeepSeek V4 Pro 有哪三種思考模式?
在實務應用設計上為:
- 非思考
- 高力度思考
- 最大力度思考
API 透過 thinking 開關與 reasoning_effort 控制。DeepSeek 當前 API 暴露 high 與 max,而相容值如 low、medium 會映射至 high。
可以串流 DeepSeek V4 Pro 的回應嗎?
可以。Chat Completions API 支援串流;思考模式的串流可在最終內容前輸出 reasoning_content 的增量。
可以透過 CometAPI 使用 DeepSeek V4 Pro 嗎?
可以。CometAPI 目前在其 OpenAI 相容的 /v1/chat/completions 端點提供 deepseek-v4-pro。
我應該使用 DeepSeek V4 Pro 還是 V4 Flash?
當吞吐量、延遲與成本優先時用 V4 Flash;遇到困難推理、編碼、長上下文分析與代理工作負載時用 V4 Pro。
混合路由策略通常優於「全部使用 Pro」。
DeepSeek V4 Pro API 定價是否會變動?
會。DeepSeek 已公告自 2026 年 8 月 17 日起實施尖峰/離峰定價。官方文件列出離峰期間 V4 Pro 為每百萬快取未命中輸入 $0.66、輸出 $1.98,相對尖峰期間輸入 $1.32、輸出 $3.96。
