TLDR DeepSeek-V4-Flash-0731(2026 年 7 月 31 日發佈)是 DeepSeek 高效混合專家(MoE)模型的官方生產就緒版本(總參數 284B / 啟用參數 13B,1M-token 上下文)。透過針對性的後訓練,它在代理型程式編寫、工具使用與多步驟軟體工程方面帶來大幅提升。它原生支援 Responses API 與 OpenAI Codex。DeepSeek Harness 是配套的代理框架(極簡模式已用於官方評測;完整版即將釋出),旨在將模型變成可靠的自主代理。
兩者結合,在 2026 年 8 月的開放權重與可透過 API 存取的代理型 AI 中,提供了極具競爭力的成本效益比。
關鍵重點
- 僅透過後訓練帶來的重大代理能力飛躍:與 4 月預覽相同的 284B/13B 架構,但分數大幅提高(例如 Terminal Bench 2.1:82.7 對 61.8;DeepSWE:54.4 對 7.3)。
- 在多個代理基準上超越參數啟用更多的 DeepSeek-V4-Pro(預覽)。
- 與頂級專有模型競爭(在多項代理任務上接近 Claude Opus 4.8),但成本僅為其一小部分。
- 原生 1M 上下文、推測式解碼(DSpark)、三段推理力度(low/high/max)、MIT 授權、開放權重。
- 官方支援 Responses API 與 Codex(CLI、桌面版、VS Code 擴充)。
- DeepSeek Harness(極簡模式已用於評測)是官方代理框架,現為封測;公測即將開放。DeepSeek Harness 提供代理執行時層;模型 + harness = 生產級代理。
- 非常適合高吞吐程式代理、終端機自動化、工具使用與長上下文工作流程。
- 透過 CometAPI(與 OpenAI 相容的端點、具競爭力的定價、多模型路由)可平價存取 DeepSeek 模型並使用統一工具鏈。
DeepSeek V4 Flash 0731 有哪些新變化?
官方發佈狀態變更
最重要的產品變更是 DeepSeek V4 Flash 0731 現已成為 DeepSeek V4 Flash 在 API 上的官方發佈版,處於公開測試中。DeepSeek 7 月 31 日的變更日誌表示,開發者可以繼續呼叫相同的模型名稱 deepseek-v4-flash 以存取最新版本。這對遷移很重要,因為避免了新增模型代稱,並讓團隊可在既有路由邏輯下測試更新。
DeepSeek 也表示此次更新僅升級了 V4 Flash API。V4 Pro API 與應用/網頁模型未受 7 月 31 日發佈影響,且 DeepSeek 表示 V4 Pro 的官方發佈將很快跟進。換言之,這不是整個 DeepSeek V4 系列的全面更新,而是針對 Flash 的定向更新。
架構不變,後訓練改變
核心架構保持不變:一個混合專家(MoE)模型,具有「總參數 2840 億、每個 token 啟用參數 130 億」,採用針對長上下文最佳化的混合式注意力設計,並具備原生「100 萬 token 的上下文視窗」。還附加了推測式解碼模組(DSpark)以加速生成。模型為純文字,支援可調整的推理力度(low / high / max)、工具呼叫、結構化輸出,並以寬鬆的 MIT 授權釋出。
這個差異很重要。許多模型更新是因為模型更大而變強。此次更有意思之處在於 DeepSeek 聲稱在未增加參數規模的情況下帶來大幅代理能力提升。V4 Flash 仍是總參數 284B、啟用參數 13B 的混合專家模型,其推論時計算量遠小於 V4 Pro 的總參數 1.6T、啟用參數 49B 設計。
代理型程式編寫分數大幅躍升
DeepSeek 的官方表格顯示,在終端、倉庫構建、網安、軟體工程、工具使用、自動化與全端程式編寫任務上有顯著提升。對比舊版 Flash 預覽,最大絕對增幅出現在 DeepSWE:54.4 對 7.3,上升 47.1 分。Cybergym 提升 38.0 分,DSBench-Hard 提升 33.8 分,DSBench-FullStack 提升 31.7 分。
因此,V4 Flash 0731 不再只是被當成一般的「快速模型」,而是被視為程式代理的候選預設模型。其價值主張不僅是便宜的聊天,而是便宜、長上下文、工具友善的代理推論。
Responses API 與 Codex 支援到位
7 月 31 日的 DeepSeek 變更日誌表示,官方版 V4 Flash 原生支援 Responses API 格式,並專門適配 Codex。DeepSeek 的 Responses API 指南指出,此格式為滿足 Codex 需求而新增,使用基底 URL https://api.deepseek.com,目前支援 deepseek-v4-flash。
這很重要,因為 Codex 風格的開發流程並非簡單的聊天會話。它需要結構化的輸入與輸出項、推理項、工具呼叫、檔案變更操作、串流事件、用量統計,以及與程式代理客戶端整合。DeepSeek 的支援並非完全複製 OpenAI Responses API 的所有能力,但足以讓 V4 Flash 成為更實際的程式代理落地候選。
官方版 V4-Flash 的效能基準
開發者不應忽視的基準測試注意事項
官方評測結果(DeepSeek 在模型卡上所述)顯示相較預覽版有大幅躍升,且在代理任務上出人意料地超過更大的 V4-Pro 預覽。程式代理基準測試使用了 DeepSeek Harness 的「極簡模式」,推理力度為 max,temperature = 1.0、top_p = 0.95。
這帶來兩個含義。第一,結果部分是「模型 + harness」的合成結果。如果你的代理執行時環境在工具、Shell 權限、上下文管理、重試、修補規則或錯誤處理上不同,你可能得不到相同分數。第二,在 DeepSeek 釋出足夠的 harness 與評測設定之前,外部團隊的獨立重現性有限。
官方 DeepSeek 基準表
| 基準測試 | V4-Flash-0731 | V4-Flash 預覽版 | V4-Pro 預覽版 | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
在這九項基準上,V4 Flash 0731 平均 55.2;舊版 V4 Flash 預覽平均 29.6,V4-Pro 預覽平均 34.9。這意味著 V4 Flash 0731 相較 Flash 預覽高約 25.6 分,相較 V4-Pro 預覽高 20.3 分。
第三方信號
ARC Prize 報告 V4 Flash 0731 在最大推理力度下,ARC-AGI-1 半私域得分 89.0%、ARC-AGI-2 半私域得分 61.4%,並列出每個任務成本分別為 $0.02 與 $0.04。這些並非程式代理基準,但支持在高推理力度下模型在推理任務上的競爭力。
在 DeepSWE(軟體工程代理循環)與 Cybergym 上的提升尤為顯著。獨立測量(例如 Artificial Analysis)報告稍低但仍然強勁的 Terminal-Bench 約 79%,確認了改進方向,同時提醒使用者供應商-harness 的數字往往更樂觀。
早前 V4 評測與第三方聚合亦顯示,在最大推理模式下具備強大的知識與編碼表現(GPQA Diamond 約 88–91%、LiveCodeBench 視來源在高 80 至 90 區間)。0731 的後訓練特別解鎖了預覽版所缺乏的代理可靠性。
DeepSeek-V4-Flash 現已支援 Responses API 與 Codex
一項策略性的重要新增是原生支援 OpenAI 的「Responses API」。DeepSeek 官方文件確認,Responses API 目前支援 deepseek-v4-flash(Pro 預計在 2026 年 8 月上旬支援)。基底 URL 仍為 https://api.deepseek.com.
這是開發者體驗上的重大升級。在 Responses API 與 Codex 支援之前,DeepSeek V4 Flash 已可作為文字模型被呼叫,但程式代理需自行橋接更多整合細節。現在模型可用於需要 Responses 風格語意的工作流程中。
Responses API 支援包含哪些內容
DeepSeek 的 Responses API 會在 /responses 以 OpenAI Responses API 格式建立模型回應。Responses API 支援 model、input、instructions、stream、temperature、top_p、max_output_tokens、top_logprobs、工具、工具選擇、推理力度、文字格式與用量回報。API 為無狀態,因此多輪互動時客戶端需傳送完整對話歷史。
最重要的相容性細節是實務面的:
- 目前只有
deepseek-v4-flash支援 Responses API。 developer訊息會被視為system訊息。- 支援函式工具、串流、可調整推理力度與伺服器端網頁搜尋。
- 自訂工具類型僅支援
apply_patch,這對 Codex 相容性很重要。 - 不支援影像與檔案輸入;影像輸入片段會被替換為佔位文字。
- 不支援
previous_response_id、conversation、store、背景模式、metadata 與部分上下文管理功能。 - 不支援的參數可能會被靜默忽略,因此生產客戶端應明確測試預期行為。
對開發者而言,重點不只是語法層面的相容。它讓 DeepSeek V4 Flash 能運作在現代程式代理常用的協定軌道上,尤其是當需要一致地表達函式呼叫、串流事件、推理項與修補套用時。
無狀態設計(客戶端管理對話歷史)。範例(Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
完整細節與 Codex 整合指南:DeepSeek API Docs – Responses API 與 Integrate with Codex。
Codex 支援代表什麼
DeepSeek 的 Codex 整合指南表示,Codex 透過 Responses API 與模型通訊,DeepSeek 現已原生支援。這使其可直接整合進 Codex(OpenAI 的程式代理生態系——CLI、ChatGPT 桌面版與 VS Code 擴充)。
開發者可透過設定腳本或編輯 ~/.codex/config.toml 與模型目錄檔來配置自訂供應商。完成後,Codex 客戶端會識別 DeepSeek-V4-Flash,並可使用其工具呼叫、apply_patch、網頁搜尋與推理能力。
DeepSeek V4 Flash 與 DeepSeek V4 Pro 的比較
| 面向 | V4-Flash-0731 | V4-Pro(典型 / 預覽) |
|---|---|---|
| 總參數 / 啟用參數 | 284B / 13B | ~1.6T / 49B |
| 上下文視窗 | 1M tokens | 1M tokens |
| 優勢 | 代理型編碼、終端機、成本、速度 | 更深的推理、知識、最難任務 |
| 代理基準優勢 | 在公布的 0731 代理套件中占優 | 在更純知識與複雜多檔任務上更強(早期評測) |
| 典型 API 定價 | ~$0.14 輸入 / $0.28 輸出(快取命中時更低) | 顯著更高(歷來高出 3–12×) |
| 適合用例 | 高吞吐代理、量產編碼循環、成本敏感應用 | 前沿研究、單一任務追求最大能力 |
| 開放權重 | 是(MIT) | 是(MIT) |
開發者該先用哪個?
在 0731 發佈的特定代理基準表上,較小的 Flash 模型在各項上都勝過 Pro 預覽。對純知識檢索或最困難的推理題,Pro 在許多獨立與早期評測中仍佔優。實務上,許多團隊現以 Flash 作為多數代理工作負載的預設,僅將最艱難的任務導流至 Pro(或其他前沿模型)。
這種路由策略可由 CometAPI 提供幫助。與其在所有工作負載中硬編碼單一模型,不如使用 CometAPI 集中化模型選擇、記錄、成本追蹤與回退策略。例如:
- 將 V4 Flash 用於倉庫摘要、重構規劃、程式碼審查草稿、產生測試、結構化抽取、長上下文問答與重複代理循環。
- 當任務具有高商業風險、需求含糊、涉及脆弱的生產程式碼,或多次嘗試失敗時,再升級到 V4 Pro 或其他高階模型。
- 追蹤真正重要的最終指標:每美元接受的修復次數、每小時成功完成的任務數、或節省的人審工時。
什麼是 DeepSeek Harness?
DeepSeek Harness 是 DeepSeek 正在打造的官方代理框架/執行時層,用以將其模型變成可靠的自主代理。公司用一句話概括:模型 + Harness = 代理。
V4-Flash-0731 的官方評測已使用 DeepSeek Harness 的「極簡模式」。完整產品仍在推出中(約在 7 月下旬至 8 月上旬進行招募與早期測試)。團隊由崔天逸領導(量化交易系統背景),職缺描述強調與 DeepSeek-V4 特性的深度整合,例如前綴快取、長上下文管理、KV-cache 最佳化、工具鏈接、錯誤恢復與自動重試。
Harness 並非泛用的 LangChain 式包裝。它與模型共同設計,使得上下文管理、工具協調、證據收集與修復循環可充分利用 V4 的特有效率(稀疏注意力、快取、推理模式)。社群專案與第三方 harness 也存在,但官方 Harness 旨在實現最緊密的模型—執行時耦合。
在完整釋出後,預期將提供:
- 面向程式編寫與自動化的結構化代理循環。
- 安全閘與核准流程。
- 面向長期任務的高效上下文處理。
- 可觀測性與產物產出。
在完整釋出之前,開發者已可將 V4-Flash-0731 與既有代理框架搭配,或採用 Responses API + Codex 路徑,取得強勁的效果。
定價、可用性與實務部署
- 官方 API 定價(約):每 1M 輸入 token $0.14(快取未命中),快取命中約 $0.0028–0.03,每 1M 輸出 token $0.28。高並發上限。
- 在 Hugging Face 提供 MIT 開放權重;量化的 GGUF 版本可廣泛在本地/自託管使用(需相當的 VRAM——全精度體量較大)。
- 推測式解碼(DSpark)與混合式注意力使長上下文推論相對高效。
- 支援的推論引擎:vLLM、SGLang 等,具備官方食譜。
對許多團隊而言,最簡單的生產路徑是使用與 OpenAI 相容的閘道。CometAPI 透過單一端點(https://api.cometapi.com/v1)提供對 DeepSeek 模型(包含 V4 系列)與數百種其他模型的統一存取。優勢包括簡化多模型路由、相對更具競爭力或優惠的定價、用量分析,以及在不改變應用程式碼的前提下在 Flash、Pro 與其他模型間切換。這對需要回退或依難度/成本路由的代理系統特別有用。
在本文撰寫時,CometAPI 的 DeepSeek V4 Flash 在比較表中列出:每 1M 輸入 token 起價 $0.12、每 1M 輸出 token $0.24、過去 24 小時 100.0% 正常運行時間,以及 2941 ms 的觀測回應時間。DeepSeek 也提醒整體 API 價格可能在不久的將來上調。由於供應商價格可能變動,較安全的表述是:在制定生產預算前,請查閱 CometAPI 的即時目錄與 DeepSeek 的官方定價。
給開發者與團隊的實務建議
- 代理型編碼請從 Flash-0731 起步——在終端、倉庫、與多工具工作流程上的成本/效能比目前極佳。對最困難任務,請使用最大推理力度 + 類 Harness 的循環。
- 對本地推論,請從 Hugging Face 下載並遵循啟用 DSpark 的 vLLM/SGLang 官方食譜。
- 若已使用 Codex 或想要現代工具呼叫語意,請透過 Responses API 整合。
- 若需最大成本控制與資料隱私,請自託管或使用量化權重。
- 智能路由——大量任務用 Flash,對超高難度長尾問題升級至 Pro(或其他前沿模型)。
- 若技術棧已混用多家供應商,考慮使用 CometAPI 以簡化多模型存取。
結論
DeepSeek-V4-Flash-0731 是高效率代理型 AI 的關鍵時刻。透過針對性後訓練,從相對緊湊的 MoE(啟用 13B)中交付接近前沿的代理表現,並結合專用的 Harness 與現代 API 相容性(Responses + Codex),DeepSeek 重設了針對程式編寫與自動化代理的成本效益預期。
無論你選擇自託管開放權重、呼叫官方 API,或透過 CometAPI 這類統一閘道,V4-Flash-0731 + 不斷演進的 Harness 生態都為下一代 AI 代理提供了高效能、具成本效益的基礎。
常見問題
什麼是 DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 是 DeepSeek V4 Flash 在 DeepSeek API 上的官方公開測試發佈版,於 2026 年 7 月 31 日變更日誌中宣布。它取代了預覽版,且保持相同的 API 模型名稱 deepseek-v4-flash。
DeepSeek V4 Flash 0731 有哪些新內容?
主要變化是更強的代理基準表現、原生 Responses API 支援、Codex 適配,以及重新後訓練的官方 V4 Flash 構建。DeepSeek 表示模型架構與規模與預覽版相同。
DeepSeek V4 Flash 0731 支援 Codex 嗎?
是。DeepSeek 的 Codex 指南表示,目前只有 deepseek-v4-flash 支援 Codex 整合。它透過 Responses API 運作,並可配置用於 Codex CLI、ChatGPT 桌面版與 VS Code 的 Codex IDE 擴充。
什麼是 DeepSeek Harness?
DeepSeek Harness 是 DeepSeek 的代理框架,用於將語言模型轉變為自主的程式或工作流程代理。公開資訊將 harness 描述為管理工具、上下文、檔案、命令執行與多步驟工作流程的執行時層。DeepSeek 在 V4 Flash 0731 的基準設定中使用了 Harness 的極簡模式。
我如何透過 CometAPI 存取 DeepSeek V4 Flash?
使用 CometAPI 與 OpenAI 相容的端點,並指定模型 ID 為 deepseek-v4-flash。CometAPI 的模型頁面提供 /v1/chat/completions 的 cURL、Python 與 JavaScript 範例,以及模型規格、定價與運行時間資訊。
DeepSeek V4 Flash 比 DeepSeek V4 Pro 更好嗎?
在 7 月 31 日的基準表上,V4 Flash 0731 在所列代理基準中全面領先 V4-Pro 預覽。但這不代表 Flash 永遠優於 Pro。Pro 更大,且在許多知識密集與困難推理任務上仍更強(見模型卡)。對成本敏感的代理工作流程,以 Flash 為預設;遇到最艱難的任務再升級到 Pro。
