DeepSeek V4.1 Flash 以生產級發佈取代了短暫存在的測試版,圍繞非對稱計算、原生多模態、更強的智能體基準,以及大幅降低的 API 價格構建。
TL;DR
DeepSeek V4.1 Flash 現已成為正式的 API 與開放權重模型,而非會過期的測試端點。DeepSeek 稱其為一個採用全新 Causal-Encoder-Decoder 架構的「具備 552B 參數的 Mixture-of-Experts 模型」。在處理輸入時僅啟用 8B 參數,輸出生成時啟用 16B 參數。這種非對稱設計旨在在不削弱自回歸生成階段的前提下,對長提示花費更少算力。
生產版 API 模型名稱為 deepseek-flash。它支援 1M 權杖的上下文視窗、最多 384K 的輸出權杖、思考與非思考模式、JSON 輸出、工具呼叫、Responses API、相容 Anthropic 的 API,以及原生視覺輸入。DeepSeek 的官方基準表顯示,在程式設計、智能體、網路安全與多模態任務上,相較於 V4 Flash 0731 與 V4 Pro 0813 有實質提升。
價格變動同樣重要。在尖峰時段,V4.1 Flash 的費率為每百萬「快取命中輸入權杖」$0.006、「快取未命中輸入權杖」$0.30,以及「輸出權杖」$1.20。離峰費率是上述價格的一半。
關鍵要點
- DeepSeek V4.1 Flash 已為開放權重的正式發佈模型;臨時的
deepseek-v4.1-flash-expires-on-0910不再是正確的生產參照。 - 其 552B 的 MoE 設計在輸入啟用 8B 參數、輸出啟用 16B 參數,與 V4 Flash 的「總計 284B/啟用 13B」架構有不同的效率特性。
- 原生多模態已成為主模型的一部分,而非獨立的 Vision Exp 分支。
- 官方對比顯示,在多數選定的智能體與程式設計基準上,V4.1 Flash 領先 V4 Pro 0813,但在所有知識或終端基準上不一定對所有前沿競品都領先。
- 全域 KV 快取降至每權杖 890 位元組,約為 V4 Flash 的 3.9 倍縮減,約為其先前佔用的四分之一。
- 尖峰 API 價格為每百萬權杖:快取命中輸入 $0.006、快取未命中輸入 $0.30、輸出 $1.20;離峰價格為上述的一半。
什麼是 DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash 是 DeepSeek 於 2026 年 9 月推出、聚焦效率的基礎模型,面向推理、程式設計、智能體與多模態理解。官方公告將其描述為一個 552B 參數的 MoE 模型,在提升能力的同時,降低了輸入處理所需的計算與記憶體。
關鍵變化在於架構。較早的 V4 Flash 在推理全程使用同一套啟用參數預算。V4.1 Flash 將輸入與輸出工作負載分離:編碼提示時啟用 8B 參數,生成答案時啟用 16B 參數。DeepSeek 將此設計稱為 Causal-Encoder-Decoder。
| Date | Status | Model ID |
|---|---|---|
| Sep 8 | Limited beta | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Production release | deepseek-flash |
DeepSeek V4.1 Flash 規格:
| Specification | DeepSeek V4.1 Flash |
|---|---|
| Release status | Official API release and open-weight model |
| Architecture | Mixture-of-Experts with Causal-Encoder-Decoder structure |
| Total parameters | 552B |
| Activated parameters | 8B for input; 16B for output |
| Context window | 1M tokens |
| Maximum output | 384K tokens |
| Input modalities | Text and images |
| Output modality | Text |
| Production API model name | deepseek-flash |
| Thinking modes | Thinking and non-thinking |
| API features | JSON output, tool calls, Responses API, Anthropic API, prefix completion, FIM completion |
| Open weights | Released on Hugging Face |
DeepSeek V4.1 Flash 如何運作:Causal-Encoder-Decoder
傳統僅解碼式語言模型在提示處理與權杖生成時基本使用同一大型堆疊。DeepSeek V4.1 Flash 則為這兩個階段分配不同的啟用容量。
在輸入階段,模型以 8B 的啟用足跡處理提示。由於尚未生成完整答案,此階段可高效檢視提供的文字或影像上下文。在輸出階段,模型啟用 16B 參數,並繼續以因果方式逐權杖生成。此設計因此在提示編碼上節省算力,同時保留更多啟用容量用於推理與回應生成。
DeepSeek 並未在公告中公開所有實作細節,因此最安全的描述是功能性的:架構是非對稱的,輸入與輸出階段使用不同的啟用參數預算,最終系統降低了推理記憶體與成本。
KV 快取縮減
記憶體結果可被量化。DeepSeek 報告 V4.1 Flash 的「每權杖全域 KV 快取」為 890 位元組,相較之下,V4 Flash 為 3,514 位元組、V3.2 為 48,068 位元組、V1 為 389,120 位元組。V4.1 的數字約比 V4 Flash 小 3.9 倍。
對長上下文的智能體來說,這不僅影響單一基準。更小的 KV 快取可減少請求活動期間對高頻寬記憶體的壓力,並降低需移至較慢儲存的狀態量。DeepSeek 稱 V4.1 Flash 在相當的快取工作負載下,所需的 HBM 約為前代的四分之一,SSD 容量約為八分之一。
DeepSeek V4.1 Flash 功能
原生多模態輸入
V4.1 Flash 將影像作為主模型 API 的一部分接受輸入。這取代了先前文字版 V4 Flash 與實驗性的 V4 Flash Vision 端點的分裂。開發者現在可在同一生產模型系列上構建文件理解、圖表分析、截圖解讀與視覺智能體工作流程。
長上下文推理
官方 API 規格保留了 1M 權杖的上下文視窗,並允許最多 384K 的輸出權杖。這使模型適用於原始碼庫規模的程式開發、多文件分析、長時段智能體會話,以及需要保留大量工具歷史的工作流程。
生產環境 API 功能
該模型支援思考與非思考模式、結構化 JSON 輸出、工具呼叫、Responses API、相容 Anthropic 介面、聊天前綴補全,以及非思考模式下的 FIM 補全。這些能力使 V4.1 Flash 能直接在生產中替代許多 V4 Flash 的智能體與程式設計工作負載。
開放權重
DeepSeek 已釋出 V4.1 Flash 權重 與技術報告。此舉提升可重現性,但模型仍極其龐大:DeepSeek 的公告請有意進行大規模部署的組織預估約 2,000 張 GPU 外加一個儲存叢集。
DeepSeek V4.1 Flash 基準測試表現
官方結果改變了先前「V4.1 沒有基準證據」的觀點。DeepSeek 現提供涵蓋知識、數學、程式設計、終端智能體、網路安全、自動化與多模態智能體任務的廣泛表格。

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
在這 8 項選定基準上,V4.1 Flash 在 7 項測試中領先 V4 Pro 0813,並在全部 8 項上領先 V4 Flash 0731。最大增益出現在軟體工程與智能體領域:DeepSWE 較 V4 Pro 提升 11.5 分、較 V4 Flash 提升 19.8 分;Automation-Bench 分別提升 11.6 與 17.1 分。
這些結果仍需審慎解讀。V4.1 Flash 在 GPQA Diamond 低於 V4 Pro,且完整官方圖表顯示,Claude Opus 5 與 GPT-5.6 Sol 在 Terminal-Bench 3.0 上仍領先。一個實用結論是:V4.1 Flash 實質改善了 DeepSeek 的效率-能力平衡;該基準表並不證明其在每個任務上都居於領先。
DeepSeek V4.1 Flash API 價格
DeepSeek 採用尖峰與離峰計費。尖峰時段為每週一至週五的 UTC 01:00–04:00 與 06:00–10:00;其他時段(含週末)使用離峰費率。目前的價格文件指出離峰價格為尖峰價格的一半。
| Price per 1M tokens | V4.1 Flash off-peak | V4.1 Flash peak | V4 Pro 0813 off-peak | V4 Pro 0813 peak |
|---|---|---|---|---|
| Cache-hit input | $0.003 | $0.006 | $0.022 | $0.044 |
| Cache-miss input | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

節省十分可觀。對於使用 1 億個快取未命中輸入權杖與 1,000 萬個輸出權杖的工作負載,V4.1 Flash 在離峰時約為 $21、尖峰時約為 $42。以已公布的 V4 Pro 0813 費率計算,相同權杖組合在離峰約為 $85.80、尖峰約為 $171.60。在此例中,V4.1 Flash 約便宜 75.5%。
提示快取進一步強化優勢,特別是反覆重用系統指令、原始碼庫上下文或文件的智能體。V4.1 的快取命中單價在兩種計費時段都比快取未命中低 50 倍。
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Total parameters | 552B | 284B | 1.6T |
| Activated parameters | 8B input / 16B output | 13B | 49B |
| Architecture focus | Asymmetric input/output efficiency | Lightweight V4 MoE | Maximum V4 capacity |
| Native vision | Yes | Separate Vision Exp variant | No |
| Context window | 1M | 1M | 1M |
| Maximum output | 384K | 384K | 384K |
| API status on DeepSeek | Current production model | Retired; legacy name routes to V4.1 Flash | Scheduled to route to V4.1 Flash from September 14, 2026 |
| Best fit | General agents, coding, vision, high throughput | Migration compatibility only | Existing Pro workloads during transition |
V4.1 Flash 的總參數量高於 V4 Flash,但服務成本可能更低,因其輸入階段僅啟用 8B 參數,且使用更小的 KV 快取。與 V4 Pro 相比,它啟用的參數遠少,卻在上述多數智能體與程式設計基準上超越 Pro。
API 存取與遷移
DeepSeek 的生產模型名稱為 deepseek-flash。既有應用程式可沿用 OpenAI 相容的基底 URL https://api.deepseek.com 或相容 Anthropic 的基底 URL https://api.deepseek.com/anthropic.
- 將模型名稱更新為
deepseek-flash。 - 保持既有的 DeepSeek 基底 URL 與驗證方式不變。
- 以生產提示重新測試思考模式、工具呼叫、視覺輸入、延遲與權杖用量。
- 監控舊有別名:
deepseek-v4-flash與deepseek-v4-flash-vision-exp現已路由至 V4.1 Flash,而deepseek-v4-pro預計自 2026 年 9 月 14 日起在 V4.1 Pro 發佈前路由至 V4.1 Flash。
對於 CometAPI 使用者,CometAPI 上的 DeepSeek V4.1 API 現已上線,與現有的 DeepSeek V4 Flash API 並存。在切換生產流量前,請於 CometAPI 控制台確認最終的模型名稱、定價與別名對應,因第三方供應商可能與 DeepSeek 官方 API 的命名與計費不同。
誰應該使用 DeepSeek V4.1 Flash?
V4.1 Flash 非常適合程式設計智能體、原始碼庫分析、終端自動化、多模態文件流程、長上下文助理與高流量的工具使用系統。其基準提升集中在最能受益於較低快取記憶體與較低權杖價格的同類工作負載。
已使用 V4 Flash 的團隊應將其視為直接的遷移候選。使用 V4 Pro 的團隊應謹慎測試,但基於 DeepSeek 自身的基準與定價資料,V4.1 Flash 現在對許多 Pro 級工作負載而言是更經濟的預設選項。
自託管是另一個決策。開放權重並不意味著 552B 模型變輕。組織應在承諾本地推理前,將大型 GPU 與儲存部署的成本與託管 API 使用進行比較。
限制與未解問題
- 基準結果來自 DeepSeek 的官方評測設定;仍需獨立重現以測量在不同測試架與工具環境下的表現。
- 原生多模態已確認,但應用團隊應根據實際 API 驗證支援的影像格式、權杖計價與視覺行為。
- 舊有模型別名現在會改變既有名稱背後的模型,可能在不更動應用程式碼的情況下改變輸出。
- 相較於早期 DeepSeek 模型,V4.1 Flash 降低了基礎設施需求,但其開放權重的部署仍需要可觀的運算與儲存。
- CometAPI 的專用 V4.1 端點與最終定價需在正式上線前於主控台確認。
最終結論
DeepSeek V4.1 Flash 是一次重大的架構與產品更新。這款 552B 的 MoE 模型結合了 8B 啟用的輸入階段、16B 啟用的輸出階段、原生視覺、1M 權杖上下文視窗與大幅壓縮的 KV 快取。這些設計選擇轉化為更強的官方程式設計與智能體基準,同時相較 V4 Pro 0813 具有更低的 API 價格。
最實用的變化是整合。V4.1 Flash 將文字、視覺、推理、工具使用與長上下文操作整合到一個生產模型名稱之下。對多數新的 DeepSeek 整合來說,deepseek-flash 現是合乎邏輯的起點;V4 Pro 更像遷移比較對象,而非困難任務的自動首選。
常見問題
DeepSeek V4.1 Flash 是否已正式發佈?
是的。可透過 DeepSeek 的 API 以模型名稱 deepseek-flash 使用,且 DeepSeek 已釋出開放權重與技術報告。
是否仍需使用臨時的 V4.1 測試模型 ID?
不需要。deepseek-v4.1-flash-expires-on-0910 是短暫的測試標識。生產應用應使用 deepseek-flash。
DeepSeek V4.1 Flash 具備多少參數?
模型共有 552B 參數。輸入處理期間啟用 8B,輸出生成期間啟用 16B。
DeepSeek V4.1 Flash 是否支援影像?
是的。視覺輸入是生產模型的原生能力,不再需要獨立的 V4 Flash Vision Exp 端點。
V4.1 Flash 是否優於 V4 Pro?
在 DeepSeek 發布的大多數程式設計、智能體、自動化與網安對比中領先 V4 Pro 0813,但在 GPQA Diamond 上 V4 Pro 仍占優。團隊在遷移前應以自身提示進行評估。
API 多少錢?
在尖峰時段,每百萬權杖的費率為:快取命中輸入 $0.006、快取未命中輸入 $0.30、輸出 $1.20。離峰價格為這些數字的一半。
舊的 V4 模型名稱會如何處理?
舊有的 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 會路由至 V4.1 Flash。DeepSeek 稱 deepseek-v4-pro 將自 2026 年 9 月 14 日起路由至 V4.1 Flash,直至 V4.1 Pro 發佈。
可以透過 CometAPI 使用 DeepSeek V4.1 Flash 嗎?
可以。CometAPI 現已提供上線的 DeepSeek V4.1 API 端點。在導入生產流量前,請於 CometAPI 控制台確認精確的模型名稱、價格與支援功能,因第三方供應商可能採用不同於 DeepSeek 官方 API 的命名規則或計費標準。
