DeepSeek-V4-Flash-Vision-Exp 技術規格
| 規格 | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| Model ID | deepseek-v4-flash-vision-exp |
| Provider | DeepSeek |
| Model Type | Experimental multimodal vision-language model |
| Release Date | August 21, 2026 |
| Input Modalities | 文字、圖片 |
| Output Modality | 文字 |
| Context Window | 1M tokens |
| Maximum Output | 最多 384K tokens |
| Maximum Image Tokens | 每張圖片 384 tokens |
| Supported Image Formats | JPEG, PNG, GIF, WebP |
| Image Input Methods | Base64, public URL, Files API |
| API Interfaces | Chat Completions, Messages, Responses |
| Reasoning | 支援 |
| Model Status | Experimental |
| Input Pricing | 與 DeepSeek-V4-Flash 相同 |
| Output Pricing | 與 DeepSeek-V4-Flash 相同 |
DeepSeek-V4-Flash-Vision-Exp 於 2026 年 8 月 21 日在 DeepSeek API 平台以實驗性多模態模型的形式推出。它在 V4-Flash 系列的基礎上新增原生的圖片理解能力,同時保留 V4-Flash 的文本導向 Agent、推理與世界知識能力。
其最顯著的 API 特性之一是圖片 token 的高效率:每張圖片會被轉換為 token,並在計費上限為每張圖片 384 個 token。該模型支援三種圖片導入方式——行內 Base64、外部 URL 與 Files API——可用於簡單的視覺請求以及多步驟的 Agent 工作流程。
什麼是 DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 針對 V4-Flash 的實驗性多模態版本,旨在將視覺理解與推理及 Agent 工作流程結合起來。
與傳統的圖片理解模型有重要區別。該模型的定位並非僅僅是 OCR 或圖像描述系統。其主要價值在於能夠將視覺資訊引入工作流程中,讓 AI Agent 能理解圖片、推理圖片所含資訊,並進一步接續文本或工具導向的任務。
例如,Agent 可接收網頁介面截圖,識別相關的 UI 元素,推理需要變更的部分,並延續進行編碼或自動化的工作流程。同樣地,圖表、儀表板、截圖與基於影像的文件也能成為更廣泛推理管線的輸入。
DeepSeek 表示,該實驗模型在維持 V4-Flash 文本能力的同時,對需要視覺理解的 Agent 基準測試有顯著提升。DeepSeek 也稱其多模態 Agent 能力已接近 Claude Opus 4.8。這些基準成績由供應商提供,不應被視為第三方獨立評估。
DeepSeek-V4-Flash-Vision-Exp 的主要特性是什麼?
- 原生多模態輸入: 模型在同一請求中接受文本與圖片,開發者可用自然語言指令結合視覺證據,而無需另建圖片轉文本的前處理管線。
- 面向 Agent 的視覺能力: 其最重要的差異化在於將視覺理解與面向 Agent 的推理整合,使截圖、圖表、介面與其他視覺狀態可用作多步驟 AI 工作流程的一部分。
- 384-token 圖片上限: 圖片會被轉換為 token 用於推理與計費,每張圖片不超過 384 個 token,為圖片密集型應用提供相對可預測的成本結構。
- 1M-token 上下文: 該模型保留 V4-Flash 系列的超大上下文能力,適合將大量文本上下文與視覺輸入結合的工作流程。目前模型列表顯示提供 1M-token 上下文視窗與最高 384K 輸出 tokens。
- 多種 API 介面: 開發者可透過 Chat Completions、與 Anthropic 相容的 Messages,或 Responses API 存取該模型,更易整合至現有的 LLM 與 Agent 基礎設施。
- 可重用圖片的 Files API: 開發者可上傳圖片一次,之後以
file_id引用,同一圖片需在多輪 Agent 互動中重複分析時尤其便利。DeepSeek 與該視覺模型一同推出了 Files API。
DeepSeek-V4-Flash-Vision-Exp 在基準測試上的表現如何?
最強的公開結果集中在 Agent 與多模態評估。DeepSeek 報告稱 V4-Flash-Vision-Exp 維持 V4-Flash 的文本能力,同時在需要視覺理解的任務上有大幅提升。
報告結果包括:
| 基準測試 | 報告分數 |
|---|---|
| Terminal-Bench 2.1 | 83.9 |
| DeepSWE | 59.3 |
| Chartography, p0.95 | 64.3 |
| Chartography, p1.0 | 63.3 |
| NL2Repo | 57.7 |
| DSBench-Hard | 63.6 |
| AutomationBench (Public) | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| ZeroBench, Pass@5 | 35.0 |
其中,Chartography 在 p0.95 下的 64.3 分尤為相關,因為它代表的是視覺/面向 Agent 的評估,而非傳統的文本專用基準。DeepSeek 以此支持其聲稱:模型的多模態 Agent 能力正在接近 Opus 4.8。
然而,這些數據應視為發佈時的報告結果,而非獨立重現的基準分數。在生產環境中選型時,開發者應以自身的截圖、圖表、文件、UI 狀態與 Agent 測試框架進行測試。
DeepSeek-V4-Flash-Vision-Exp 與其他模型相比如何?
| 模型 | 主要優勢 | 視覺 | Agent/推理 | 上下文 | 最佳適用場景 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | 低成本的多模態 Agent 工作流程 | ✓ | 強 | 1M | 視覺 Agent、截圖、圖表、流程自動化 |
| DeepSeek-V4-Flash | 一般推理與 Agent 任務 | 原始模型無原生視覺 | 強 | 1M | 基於文本的 Agent 與程式設計 |
| Claude Opus 4.8 | 前沿推理與多模態 Agent 表現 | ✓ | 非常強 | 大型上下文 | 複雜的企業級 Agent |
| Gemini family | 多模態理解與長上下文應用 | ✓ | 強 | 大型上下文 | 文件、媒體、多模態應用 |
最有意義的比較不僅在於模型是否能識別圖片。DeepSeek-V4-Flash-Vision-Exp 針對的是較低成本的多模態 Agent 層:將圖片理解與 V4-Flash 已具備的推理與 Agent 能力結合。
與 DeepSeek-V4-Flash 相比,主要升級在於視覺感知。其底層的文本導向能力預期與 V4-Flash 大致一致,而視覺 Agent 評估顯示有顯著提升。
與前沿多模態模型如 Claude Opus 4.8 相比,DeepSeek 在發佈定位上強調更窄的主張:其多模態 Agent 基準表現接近 Opus 4.8。這不應被解讀為兩者在通用智能、程式設計、視覺、推理、工具使用與可靠性上等同。
DeepSeek-V4-Flash-Vision-Exp 的最佳使用場景是什麼?
截圖轉程式碼與 UI 分析
開發者可提供網站、應用、儀表板或設計介面的截圖,要求模型識別 UI 元素、診斷版面問題,或產生實作指引。這對需要從視覺證據推理的 AI 程式設計 Agent 尤其有吸引力。
視覺瀏覽器 Agent
瀏覽器 Agent 可將截圖作為觀察,而非僅依賴 DOM 或無障礙樹資訊。模型能解讀網頁的視覺狀態,並將其與推理及工具調用迴圈結合。
圖表與儀表板分析
該模型能分析圖表、儀表板與其他視覺化資料表示。這是 Chartography 成績尤其相關的領域之一。
基於圖片的文件理解
包含文字、表格、圖示或結構化資訊的圖片可直接提供給模型。開發者可利用此能力進行文件分析、資訊擷取與視覺問答。
多模態程式設計 Agent
程式設計 Agent 可將原始碼與錯誤截圖、IDE 狀態、渲染的網頁或設計參考結合。與其將每張截圖手動轉為文字描述,該模型可直接從視覺輸入中進行推理。
視覺自動化
該模型可作為自動化系統的感知組件,先理解當前可見內容,再選擇下一步動作。這對 GUI 自動化與電腦使用工作流程特別相關。
DeepSeek-V4-Flash-Vision-Exp 的限制是什麼?
第一個限制是其實驗性狀態。後綴 -exp 具有意義:它尚未到可以自動視為所有生產多模態模型的成熟替代品。DeepSeek 自身也將其識別為實驗性模型。
第二,關於多模態 Agent 表現最強的公開宣稱基於供應商報告的基準。獨立評估仍有限,因此基準分數應視為方向性而非定論。
第三,384-token 的圖片上限同時是成本優勢與技術約束。大型圖片會在推理前被調整尺寸,意味著處理極細微視覺細節的開發者需要測試最終解析度是否足以滿足應用需求。DeepSeek 的 API 文件指出圖片會在推理前被調整,且最終圖片表徵被限制為每張 384 個 token。
API 也施加了實務上的圖片/請求限制。目前基於文件的資訊列出:透過 Base64 或外部 URL 提供的圖片上限為 32 MiB;透過 Files API 參照的圖片上限為 64 MiB;每個請求最多 600 張圖片。
最後,開發者不應假設強勁的基準分數會自動轉化為可靠的自主 GUI 操作。視覺 Agent 對截圖品質、任務框架、工具定義、延遲、狀態管理與錯誤恢復高度敏感。
DeepSeek-V4-Flash-Vision-Exp 的模型版本與 API 可用性
目前的模型識別符為:
deepseek-v4-flash-vision-exp
該模型自 2026 年 8 月 21 日起可透過 DeepSeek API 使用。開發者可在進行多模態 API 請求時指定此模型 ID。
目前該模型支援三種主要的 API 風格:
Chat Completions
Messages
Responses
圖片可透過以下方式提供:
Base64
Public image URL
Files API / file_id
這種組合對建構多模態 Agent 的開發者尤其有用,因為同一模型可整合進現有的 OpenAI 相容、Anthropic 相容或基於 Responses 的基礎設施中。
為何使用 DeepSeek-V4-Flash-Vision-Exp?
當視覺與 Agent 推理需要協同工作且不希望 API 成本大幅增加時,DeepSeek-V4-Flash-Vision-Exp 最具吸引力。
其最大優勢並非僅能描述圖片。該模型將視覺輸入與 1M-token 上下文視窗、面向 Agent 的推理、多種 API 介面結合,並對每張圖片的計費上限為 384 個 token。
對於開發截圖分析、視覺程式設計 Agent、圖表處理管線、瀏覽器自動化或多模態業務工作流程的開發者而言,deepseek-v4-flash-vision-exp 是值得納入基準測試的實驗性模型。
但在生產部署中,初期應將其視為需要評估與測試的模型,而非不加質疑的預設。由於其實驗性狀態與獨立多模態基準資料有限,仍需基於應用場景進行特定測試。
如何在 CometAPI 上存取 DeepSeek-V4-Flash-Vision-Exp API
CometAPI 可為希望在不為每個模型供應商分別整合的情況下試用 DeepSeek-V4-Flash-Vision-Exp 的開發者提供統一的 API 存取層。
基本流程如下:
- 建立 CometAPI 帳戶並取得 API 金鑰。
- 選擇
deepseek-v4-flash-vision-exp作為模型。 - 使用支援的多模態請求格式,同時傳送文字與圖片。
- 在應用程式中處理返回的文字回應。
- 將該模型與現有的視覺或 Agent 模型進行基準對比後,再導入生產流量。
重點
DeepSeek-V4-Flash-Vision-Exp 是一個實驗性的多模態 Agent 模型,為 V4-Flash 能力堆疊新增原生圖片理解,同時保留其大上下文與推理導向設計。
其最具吸引力的組合是視覺 + Agent 推理 + 1M-token 上下文 + 每張圖片 384-token 上限。DeepSeek 報告在視覺 Agent 基準上取得顯著提升,並表示模型的多模態 Agent 能力接近 Opus 4.8,但這些結果仍屬供應商報告,應由獨立測試加以驗證。
對於 CometAPI 使用者而言,當應用需要從純文本 Agent 走向截圖理解、視覺程式設計、圖表分析、瀏覽器自動化與多模態工作流程時,該模型值得納入測試。