DeepSeek V4.1 Flash
DeepSeek V4.1 Flash 的技術規格
| 項目 | DeepSeek V4.1 Flash |
|---|---|
| 模型名稱 | DeepSeek V4.1 Flash |
| 提供方 | DeepSeek |
| 模型世代 | V4.1 |
| 模型狀態 | 新近發布 / 先前以限量測試版提供 |
| API 模型 ID | deepseek-v4.1-flash |
| 先前測試版 ID | deepseek-v4.1-flash-expires-on-0910 |
| 輸入模態 | 文字 + 圖像 |
| 架構 | 全新模型架構;詳細架構規格尚未公開文件化 |
| 推理能力 | 支援 |
| Agent 能力 | 增強 |
| 多模態理解 | 原生 |
| 上下文長度 | DeepSeek 尚未針對 V4.1 Flash 獨立公開文件 |
| 最大輸出 | DeepSeek 尚未針對 V4.1 Flash 獨立公開文件 |
| 參數量 | 尚未公開 |
規格說明:DeepSeek 的公開 API 文件目前記載的是
deepseek-v4-flash(DeepSeek-V4-Flash-0731)、deepseek-v4-pro與deepseek-v4-flash-vision-exp;尚未提供 V4.1 Flash 的完整且永久的模型卡。因此,對於上下文長度、參數量、最大輸出等尚未文件化的規格,不應從 V4 Flash 複製並宣稱為 V4.1 規格。
什麼是 DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash 是 DeepSeek 最新的 Flash 級模型,基於全新架構打造,旨在在保持 Flash 家族效率定位的同時,提升能力、推理速度、吞吐量與可擴展性。DeepSeek 的初始 V4.1 Flash 測試版被描述為具備原生多模態支援,而非依賴上一代使用的獨立 V4-Flash-Vision-Exp 模型。
該模型首先以 deepseek-v4.1-flash-expires-on-0910 這一臨時識別符出現在有限的 API 測試中。開發者只需保留既有的 DeepSeek API 端點並僅變更模型識別符。由於該測試明確限定時限,該臨時識別符不應被視為正式生產環境的永久模型 ID。
DeepSeek V4.1 Flash 的主要特性
- 全新模型架構:V4.1 Flash 引入全新架構,而非對 V4-Flash-0731 的簡單後訓練更新。DeepSeek 的測試版公告將此架構描述為朝向更高能力上限、更快推理、更高吞吐與更佳可擴展性的重大一步。
- 原生多模態理解:V4.1 Flash 原生支援視覺理解,允許圖像輸入與文字一同處理。這比先前以文字為主的
deepseek-v4-flash模型更具整合性的多模態設計。 - 更快的推理:速度是 V4.1 Flash 的核心目標之一。DeepSeek 將其定位在較高推理速度與吞吐量,同時維持 Flash 級的效率。
- 更強的 Agent 能力:該新模型針對高需求的程式與代理工作流程而設計。早期回報的基準結果顯示,相較上一代 V4 Flash,在軟體工程與代理評測上有顯著提升。
- 更高的能力上限:DeepSeek 表示新架構旨在擴展至更大型模型,同時提升 Flash 級的能力上限。
- 統一的多模態工作流程:原生視覺理解使模型從純文字的程式與推理任務拓展至涉及螢幕截圖、圖表、介面與其他視覺輸入的任務。
DeepSeek V4.1 Flash 的基準表現
早期發布資訊報告了以下 V4.1 Flash 的結果:
| Benchmark | Reported result |
|---|---|
| GPQA Diamond | 90.9 |
| HLE | 36.8 |
| HLE with tools | 63.9 |
| Codeforces | 3471 |
| MathArena Apex | 65.6 |
| Terminal-Bench 2.1 | 90.6 |
| Terminal-Bench 3.0 | 30.0 |
| Terminal-Bench 4.0 | 31.2 |
| DeepSWE v1.1 | 74.2 |
| NL2Repo-Bench | 65.4 |
| CyberGym | 88.1 |
| SEC-Bench Pro | 62.8 |
| Automation-Bench | 54.8 |
| Agents' Last Exam | 31.8 |
| Chartography with tools | 78.9 |
| BabyVision with tools | 89.6 |
| ZeroBench-main | 49.0 |
這些數據來自目前對 V4.1 Flash 發布的報導,但 DeepSeek 的公開 API 文件尚未發布 V4.1 Flash 的完整官方基準表。因此,應標註為發布報導中的數據,而非獨立驗證後的規格。
最顯著的回報提升出現在「代理式程式撰寫與軟體工程」方面。Terminal-Bench 2.1 的 90.6 分與 DeepSWE v1.1 的 74.2 分顯示,V4.1 Flash 相對先前的 V4 Flash,明確瞄準更強大的自動化程式工作流程。
DeepSeek V4.1 Flash vs DeepSeek V4 Flash
| 能力 | DeepSeek V4.1 Flash | DeepSeek V4 Flash |
|---|---|---|
| 世代 | V4.1 | V4 |
| 架構 | 全新架構 | V4 架構 |
| 原生視覺 | 是 | 否 |
| 是否需要獨立視覺模型 | 否 | 需使用 V4-Flash-Vision-Exp 處理圖像 |
| Agent 能力 | 增強 | 強 |
| 程式碼表現 | 報告顯示有重大提升 | 強 |
| 推理速度 | 定位為更快 | 快速 |
| 狀態 | 新發佈/近期完成測試 | 穩定的 API 模型 |
| 公開技術文件 | 仍在完善中 | 文件完備 |
這一區別很重要:V4.1 Flash 不應僅被描述為「在 V4 Flash 上加入視覺」。DeepSeek 表示 V4.1 Flash 採用全新架構,具備原生多模態能力,並在能力、速度與可擴展性上有所提升。
先前的 deepseek-v4-flash 仍由 DeepSeek 記載為 DeepSeek-V4-Flash-0731,擁有 1M token 的上下文視窗、384K 的最大輸出、思考/非思考模式、工具調用、JSON 輸出、支援 Responses API,以及相容 Anthropic API。這些規格屬於 V4 Flash,若 DeepSeek 未發布對應的 V4.1 文件,則不應自動歸屬於 V4.1 Flash。
建議的使用場景
1. 多模態程式代理
V4.1 Flash 的原生視覺理解,對需要同時解讀螢幕截圖、UI 版面、圖表或視覺除錯資訊與原始碼的程式代理特別有吸引力。
2. 自主化軟體工程
Terminal-Bench、DeepSWE、NL2Repo 與 CyberGym 的回報表現顯示,V4.1 Flash 很適合進行倉庫層級的程式開發、除錯、終端互動、安全測試與其他代理式軟體工程任務。
3. 高吞吐量 AI 代理
在 Flash 的定位與更快推理的強調下,V4.1 Flash 是在應用程式中並行執行大量模型呼叫的強力候選,特別是程式代理與自動化開發管線。
4. 視覺文件與介面分析
原生多模態支援將可用場景擴展到螢幕截圖、圖表、示意圖、UI 分析,以及其他需要視覺輸入的工作流程,而非只能依賴純文字模型配合獨立視覺模型。
5. 在 Flash 級效率下進行複雜推理
GPQA Diamond、HLE、MathArena Apex 與代理基準結果的回報顯示,V4.1 Flash 旨在將更高的推理能力下放至 Flash 級效率。
限制與考量
當前評估 V4.1 Flash 的最大限制在於文件成熟度。DeepSeek 的公開 API 模型列表仍包含 deepseek-v4-flash、deepseek-v4-pro 與 deepseek-v4-flash-vision-exp,而 V4.1 的臨時測試識別符明確排定於 9 月 10 日到期。
因此,參數量、上下文長度、最大輸出、詳細架構與穩定 API 保證等規格,不應自 V4 Flash 推斷。
開發者亦應區分臨時測試識別符:
deepseek-v4.1-flash-expires-on-0910
與正式模型名稱:
deepseek-v4.1-flash
前者是具時限的測試端點,不應作為長期生產用識別符。
API 整合
V4.1 Flash 測試版沿用既有的 DeepSeek API 端點,僅需更改模型名稱,而非變更 API 基底 URL。這意味著該模型旨在融入既有的 DeepSeek/OpenAI 相容整合模式。
DeepSeek 既有的 API 支援 OpenAI 相容與 Anthropic 相容介面,而目前穩定的 V4 模型亦支援 Responses API。然而,V4.1 專屬的 API 相容性,在 DeepSeek 更新其官方模型文件之前,應視為暫定。
摘要
DeepSeek V4.1 Flash 是下一代的 Flash 模型,著重於在原生多模態理解的前提下,結合更高的推理與代理式程式表現,以及更快的推理速度。其回報的基準概要顯示,與先前的 V4 Flash 相比,在多項程式與代理評測上有明顯提升,而其新架構亦旨在進一步擴展。
對於 CometAPI 的模型頁面,最安全的定位是「下一代多模態代理模型」,而非聲稱尚未文件化的上下文、參數或輸出上限。這些數據應待 DeepSeek 發布 V4.1 Flash 的權威模型規格後再行補充。