TL;DR
DeepSeek-V4.1-Flash 是目前 DeepSeek API 以模型 ID deepseek-flash 提供的多模態 Flash 模型。它支援 1M token 的上下文、最高 384K 的輸出,並支援影像輸入;依據目前的視覺指南,每張影像在自動調整大小後最多計為 1024 個 token。
其最強定位仍然是面向代理的視覺工作:在繼續進行程式碼或工具操作之前,先檢視螢幕截圖、圖表、介面與影像型文件。本文稍後的基準結果屬於已退役的 Vision-Exp 發佈版本,應視為歷史的、由供應商報告的證據,而非對 DeepSeek-V4.1-Flash 的最新基準。
CometAPI 目前仍以 deepseek-v4-flash-vision-exp 作為其目錄模型 ID,而 DeepSeek 的直連 API 建議使用 deepseek-flash,並以 DeepSeek-V4.1-Flash 回應請求。請以「文字 + 影像」請求開始,然後在你自己的截圖和視覺任務上評估實際路由。
Key Takeaways
- 現行路由:DeepSeek-V4.1-Flash 是活躍的多模態 Flash 模型。已退役的
deepseek-v4-flash-vision-exp名稱在 DeepSeek 的 API 中僅作為相容別名被接受。 - 大型文字工作空間:1M token 上下文與最高 384K 輸出,可在一次對話中處理長文件、程式碼庫、工具歷史與影像。
- 目前影像計價:DeepSeek 會自動調整每張影像大小並將其上限設定為 1024 個輸入 token。約低於 544×544 總像素的影像會被放大;較大的影像則會縮放至約 1300×1300 的總像素。
- 代理導向的視覺:官方比較重點在螢幕截圖、圖表、瀏覽器、程式撰寫與視覺工具工作流程,而非影像生成。
- 廣泛的介面支援:DeepSeek 文件列出支援的 API 介面:Chat Completions、相容 Anthropic 的 Messages,以及 Responses API。以下 CometAPI 範例使用 Chat Completions。
- 生產注意事項:路由別名、自動影像縮放,以及對測試環境敏感的基準結果,仍使工作負載特定測試至關重要。
What Is DeepSeek-V4-Flash-Vision?
DeepSeek 目前的文件將 deepseek-flash 指向 DeepSeek-V4.1-Flash,支援文字與影像輸入,以及文字輸出。較早的 Vision-Exp 模型已退役;其舊版模型名稱是指向目前 Flash 模型的相容別名。
其目標用例是多模態代理。視覺代理可以檢視已渲染的應用程式、識別按鈕或版面配置故障、推理下一步、呼叫工具,然後檢查下一張截圖。相同模式適用於圖表分析、視覺品質保證、文件擷取、瀏覽器自動化,以及需將設計參考與渲染頁面比較的程式代理。
命名說明:在 DeepSeek 直連 API 上,請使用 deepseek-flash;目前它對應至 DeepSeek-V4.1-Flash。舊名 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 仍被 DeepSeek 接受,但對應模型已退役,請求將由 DeepSeek-V4.1-Flash 服務。CometAPI 則持續以 deepseek-v4-flash-vision-exp 暴露其目錄路由。
Technical Specifications
| Specification (official docs) | Current value |
|---|---|
| Official model ID | deepseek-flash |
| Status | 活躍的多模態 Flash API 路由;舊版 Vision-Exp 模型已退役 |
| Inputs / output | 文字 + 影像輸入;文字輸出 |
| Context window | 1,048,576 tokens (1M) |
| Maximum output | 最高 384K tokens |
| Legacy Vision-Exp checkpoint listing | 官方 Hugging Face 儲存庫標示為 305B 參數 |
| Legacy Vision-Exp text backbone | 43 層;隱藏層大小 4,096;64 個注意力頭 |
| Legacy Vision-Exp MoE routing | 256 個路由化專家;每個 token 選擇 6 個;1 個共享專家 |
| Legacy Vision-Exp vision encoder | 32 層;寬度 1,024;16 個頭;patch 大小 14 |
| Image representation | 目前 DeepSeek API 上每張影像最多 1024 個影像 token |
| Image formats | JPEG, PNG, GIF, WebP |
| Image input methods | Base64 data URL、外部 URL、DeepSeek Files API 的 file_id |
| API styles | Chat Completions、相容 Anthropic 的 Messages、Responses |
| Reasoning modes | 思考與非思考;努力等級 low、high、max |
| License | 官方模型儲存庫採 MIT 授權 |
上述架構欄位來自官方設定。該儲存庫列出 305B 參數的檢查點,但 DeepSeek 未另行公布完整視覺模型的啟用參數數量。與其假設僅文字 V4-Flash 的啟用數量在加入視覺堆疊後仍不變,不如報告儲存庫值較為安全。
How DeepSeek-V4-Flash-Vision-Exp's Legacy Architecture Works
V4-Flash Text Backbone
語言端延續了 V4 設計主題,使長上下文的代理工作變得實用。官方儲存庫記錄了 V4 的架構組件:稀疏 Mixture-of-Experts 路由、DFlash 注意力、Hyper-Connections,以及 DSpark。即使在此規模下本地部署仍然要求嚴苛,該釋出仍比僅 API 的模型更可檢視。
Vision Encoder and Aligner
對於已退役的 Vision-Exp 檢查點,公開設定使用 32 層視覺編碼器、patch 大小 14、視覺寬度 1,024、16 個視覺注意力頭,以及 384 個影像表示 token。這些架構細節描述的是歷史檢查點,不應視為記錄目前服務中的 DeepSeek-V4.1-Flash 堆疊。
Current 1024-Token Image Limit
DeepSeek 目前的視覺分詞規則會在維持長寬比的前提下,將約低於 544×544 總像素的影像放大,並將較大的影像縮放至約 1300×1300 的像素面積。這會為每張影像產生最多 1024 個 token 的上限。因此,一張 2000×2000 的影像與 5000×5000 的影像在縮放後消耗的影像 token 相同。
實務影響:在傳送影像前,裁切包含小字標籤、程式碼或 UI 控件的區域。僅提高來源解析度無法突破目前 1024 個影像 token 的上限。
Legacy Vision-Exp Benchmark Performance
DeepSeek 的官方模型卡評估將該視覺模型與 DeepSeek-V4-Flash-0731 及 Claude Opus 4.8 在文字代理與多模態代理任務上進行比較。視覺模型通常在需要視覺證據時優於僅文字的 Flash 模型,同時仍具競爭力,但並非在每個方面都領先於以能力為先的競品。
官方文字與多模態代理評測對比。來源:DeepSeek 官方發佈
| Official benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents' Last Exam | 27.3 | 25.2* | 25.7 |
| Chartography | 64.3 | - | 65.0 |
| ZeroBench (Pass@5) | 35.0 | - | 34.0 |
* 在 ApexBench 與 Agents' Last Exam 中,僅文字的 V4-Flash 模型忽略了輸入中的多模態元素。DeepSeek 使用 DeepSeek Harness 最小模式、最大推理努力、temperature 1.0、top_p 0.95 來評估其文字代理任務。
基準說明:這些是 DeepSeek 在發佈時報告的結果,並非獨立重現。代理分數對測試架構、工具定義、token 預算與重試策略尤其敏感,因此應將其視為方向性證據。
What the Benchmark Results Mean
最清晰的結果是在視覺證據重要時相較僅文字 V4-Flash 的提升。ApexBench 從 26.2 提升至 36.5;視覺模型亦新增了競爭性的 Chartography 與 ZeroBench 成績,而僅文字模型未報告這些結果。該模型也在數個文字代理任務上提升,包括 Terminal Bench 2.1、NL2Repo、DeepSWE、Toolathlon-Verified 與 DSBench-Hard,雖然 Cybergym 略低。
與 Opus 4.8 相比,結果是混合的。Vision-Exp 在 DeepSWE、Agents' Last Exam 與 ZeroBench 上較高,而競品則在 Terminal Bench、NL2Repo、Cybergym、Toolathlon、DSBench-Hard、ApexBench 與 Chartography 上較高。因此,DeepSeek 的多模態基準主張更偏向方向性,而非證明在所有視覺、推理或可靠性面向的全面等同性。
DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash
| Dimension | DeepSeek Vision-Exp | DeepSeek V4 Flash | Claude Opus 4.8 | Gemini 3.7 Flash |
|---|---|---|---|---|
| Status | 實驗性 | 公測 / 目前的 Flash 路由 | 一般可用 | 一般可用 |
| Input modalities | 文字、影像 | 文字 | 文字、影像、文件 | 文字、影像、影片、音訊、PDF |
| Output | 文字 | 文字 | 文字 / 結構化資料 / 程式碼 | 文字 |
| Context | 1M | 1M | 取決於平台,最高可達 1M | 1,048,576 |
| Max output | 384K | 384K | 128K | 65,536 |
| Main strength | 低成本視覺代理 | 高吞吐量文字代理 | 高自主、複雜代理 | 廣泛多模態主力 |
| Best first test | 螢幕截圖、圖表、UI、視覺程式撰寫 | 程式撰寫與文字自動化 | 最困難、長期跨度任務 | 豐富媒體與 Google 工具工作流程 |
當需要在低成本代理迴圈中加入影像感知時,選擇 Vision-Exp。當所有輸入皆為文字且吞吐量優先時,選擇 V4 Flash。在 DeepSeek 自身比較中,Opus 4.8 仍是以能力為先的選項;當需要影片、音訊、PDF 與 Google 原生工具時,Gemini 3.7 Flash 是更廣泛的多模態替代方案。
What Can DeepSeek-V4-Flash-Vision Do?
- 截圖轉程式碼與 UI 審查——比較渲染頁面與設計,識別版面或無障礙問題,並生成實作建議。
- 視覺瀏覽器代理——在 DOM 或可及性樹資料不完整時以截圖作為觀測,然後選擇下一個工具動作。
- 圖表與儀表板分析——解釋趨勢、識別異常,並將可見指標連結到更大的文字或工具工作流程。
- 基於影像的文件理解——在結構化處理前,從掃描表單、圖示、投影片、表格與截圖中擷取資訊。
- 多模態程式代理——在單一除錯迴圈中結合原始碼、錯誤截圖、IDE 狀態與渲染輸出。
- 視覺品質保證——比較不同裝置的產品截圖、偵測缺漏元素,並生成結構化缺陷報告。
- 多影像比較——在一次請求中評估一系列截圖或替代設計,受限於請求大小與影像數量上限。
DeepSeek 發佈頁的官方視覺代理範例(Word 中的動態 GIF)。來源:DeepSeek 官方發佈
Pricing and Availability
DeepSeek 將影像 token 與文字輸入 token 一併計費。其官方定價表使用尖峰與離峰費率,而 CometAPI 模型頁面則發布單一路由現價。這些數字不應被折算為單一「通用價格」,因為最便宜的路由會隨 DeepSeek 的時間窗而變化。
| Route / source | Cache-hit input | Cache-miss input | Output | Condition |
|---|---|---|---|---|
| DeepSeek official - off-peak | $0.003 | $0.15 | $0.60 | 非尖峰時段,包括週末與中國法定節假日 |
| DeepSeek official - peak | $0.006 | $0.30 | $1.20 | 週一至週五 01:00-04:00 與 06:00-10:00 UTC,排除中國法定節假日 |
| CometAPI current route | Not listed separately | $0.352 | $1.056 | 目前的統一路由價格 |
所有價格為每 1M token 的美元計價。DeepSeek 目前的 Flash 費率在離峰時段為 $0.003/$0.15/$0.60(快取命中輸入/快取未命中輸入/輸出),在尖峰時段為 $0.006/$0.30/$1.20。CometAPI 目前列為每 1M 輸入 token 約 $0.352、每 1M 輸出 token 約 $1.06 的相容路由。影像在目前的 DeepSeek API 上每張最多計為 1024 個輸入 token;在上線前務必重新確認即時路由定價。
定價說明:模型價格可能變動。請將價格數據連結至即時定價頁面,並在發布或上線前立即重新確認。
How to Use DeepSeek-V4-Flash-Vision with CometAPI
CometAPI 目前透過其相容 OpenAI 的 /v1/chat/completions 端點列出 deepseek-v4-flash-vision-exp,因此以下 CometAPI 範例保留該目錄 ID。對於 DeepSeek 直連 API,請改用 deepseek-flash。
Step 1: Create an API Key
- 建立或登入 CometAPI 帳戶。
- 開啟 API token 控制台 並建立金鑰。
- 將其儲存在 COMETAPI_KEY 環境變數中。切勿將生產金鑰置於用戶端程式碼或提交至版本控制。
export COMETAPI_KEY="your-cometapi-key"
Step 2: Send a Base64 Image with cURL
Base64 適用於本機檔案與影像已在記憶體中的伺服端作業。用編碼後的影像位元組取代占位符,勿加入空格或換行。
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Read this dashboard and return the three most important findings."
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64;<BASE64_DATA>"
}
}
]
}
],
"max_tokens": 1200
}'
Step 3: Analyze a Local Image with Python
OpenAI Python SDK 可透過更改 base URL 呼叫 CometAPI。當 SDK 未直接暴露相應選項時,使用 extra_body 傳遞 DeepSeek 特定的 thinking 控制。
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
with open("dashboard.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Analyze the chart. Return JSON with keys: trend, "
"anomalies, evidence, and confidence."
),
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}"
},
},
],
}
],
max_tokens=1500,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
print(response.choices[0].message.content)
Step 4: Use a Public Image URL with JavaScript
影像 URL 可保持 JSON 請求精簡,但該 URL 必須可被上游模型公開存取。避免使用臨時、私有或需認證的連結,除非你的應用先將影像轉為 Base64。
const response = await fetch(
"https://api.cometapi.com/v1/chat/completions",
{
method: "POST",
headers: {
Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "deepseek-v4-flash-vision-exp",
messages: [
{
role: "user",
content: [
{
type: "text",
text: "Identify the UI issue and propose a concrete CSS fix.",
},
{
type: "image_url",
image_url: {
url: "https://example.com/screenshot.png",
},
},
],
},
],
max_tokens: 1200,
}),
}
);
if (!response.ok) {
throw new Error(`CometAPI request failed: ${response.status}`);
}
const data = await response.json();
console.log(data.choices[0].message.content);
Step 5: Send Multiple Images
在同一個 user 訊息中放置多個 image_url 區塊,並告訴模型如何標記它們。明確標籤可降低跨影像引用錯誤。
{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Compare Image A and Image B. List every visible regression."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-a.png"}
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-b.png"}
}
]
}
],
"max_tokens": 1800
}
Input Methods and Limits
| Limit | Official DeepSeek value |
|---|---|
| Supported formats | JPEG, PNG, GIF, WebP |
| External URL length | 最長 8,192 字元 |
| Request body | 48 MiB |
| Single image via Base64 / URL | 32 MiB |
| Single image via DeepSeek Files API | 64 MiB |
| Maximum images per request | 600 |
| Total image size | 無 file_id 時為 64 MiB;包含 file_id 可達 200 MiB |
| Maximum dimension | 每邊最長 8,192 px;當請求含 15+ 張影像時每邊 4,096 px |
| Image message role | 僅限 user 訊息 |
官方 DeepSeek API 也透過其 Files API 支援可重用的 file_id 影像參照。此處的 CometAPI 快速路徑使用 image_url 區塊,搭配公開 URL 或 Base64 data URL。透過聚合路由前,請先確認供應商特定的檔案上傳與 file_id 透傳行為。
How to Prompt the Model Effectively
可靠的視覺代理提示應說明影像是什麼、要檢視的證據、要採取的行動,以及要遵循的輸出契約。像是「描述此影像」這樣的模糊提示自由度過大,且更難驗證結果。
- Context——標明截圖、圖表、文件或介面的類型及其在工作流程中的角色。
- Task——指定重要的決策、診斷、比較或擷取任務。
- Evidence——要求可見證據、標籤、座標、數值,或引用的 UI 文字。
- Constraints——禁止不受支援的假設,並說明如何處理不可讀的細節。
- Output——定義 JSON 鍵、核對清單、嚴重性等級,或其他可機器檢查的結構。
You are reviewing a web application screenshot.
Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.
Production Best Practices
- 當小字或控件很重要時請先裁切;影像 token 上限代表無關背景會消耗有限的視覺解析度。
- 測試推理努力等級,而非對所有請求一律啟用最大。簡單 OCR 或分類通常不需要高推理。
- 要求每個結論都附帶證據。這使得可視化的杜撰更容易被自動拒絕。
- 在高風險自動化中將「感知」與「動作」分離。先讓模型描述狀態、驗證後,再讓受控的工具層執行。
- 保護影像 URL,因為公開 URL 可能暴露敏感截圖。對私密資料偏好伺服端 Base64,並自行制定保留政策。
- 以與生產相同的截圖擷取、提示、工具、重試與成功標準進行端到端基準。
- 釘住提示與評測資料以追蹤實驗變更。-exp 端點的行為變更速度可能比成熟的 GA 模型更快。
- 記錄請求 ID 與失敗,以區分供應商錯誤、模型錯誤與應用解析錯誤。
Limitations
最重要的限制是路由透明度:舊的 Vision-Exp 名稱可能仍被接受,但請求實際由 DeepSeek-V4.1-Flash 服務。請記錄供應商、請求的模型 ID、回傳的模型中繼資料與請求 ID;在賦予自主操作前使用明確的評估閘門。歷史發佈分數不能替代在目標路由上的可重現測試。
第二個限制是視覺細節。自動縮放與目前每張影像 1024 個 token 的上限使成本可預測,但仍可能抑制微小文字、細密圖表標記或高密度介面元素。請裁切、分割或放大相關區域,並保留原始影像供人工檢閱。
該模型僅輸出文字。它可以分析影像並提出程式碼或結構化動作建議,但不會生成或編輯影像。它也僅在 user 訊息中接受影像;官方文件指出在 system 或 assistant 訊息中的影像內容會回傳 400 錯誤。
最後,本地部署需要沉重的基礎設施。官方儲存庫列出 305B 參數,並提供參考推論程式碼,而非輕量級的即用型執行環境。對大多數團隊而言,受管 API 評估是務實的起點。
Common Errors and Fixes
| Symptom | Likely cause | Recommended fix |
|---|---|---|
| 400: model does not support image | 錯誤的模型 ID | 使用 deepseek-v4-flash-vision-exp |
| 400 for message content | 將影像放在 system 或 assistant 訊息中 | 將影像區塊移至 user 訊息 |
| Image download failure | 私有、過期或過慢的 URL | 使用 Base64 或穩定的公開 URL |
| Fine details are missed | 自動下採樣 / 384 token 上限 | 裁切或分割相關區域 |
| Unexpectedly high cost | 輸出過長、重試或多輪對話 | 限制 max_tokens 並記錄每輪用量 |
| Inconsistent agent result | 測試架構或工具狀態變動 | 固定提示、工具、重試與評估標準 |
FAQ
Is DeepSeek-V4-Flash-Vision the same as DeepSeek-V4-Flash?
不是。Vision-Exp 新增了原生影像輸入與多模態訓練。僅文字的 Flash 路由不具相同的視覺感知能力。
What model ID should I use?
在 DeepSeek 直連 API 上使用 deepseek-flash。在 CometAPI 上,於該路由仍可用時使用目錄 ID deepseek-v4-flash-vision-exp。
Can it analyze multiple images?
可以。DeepSeek 文件記載每次請求最多 600 張影像,受限於請求大小與尺寸上限。由於延遲與提示清晰度會隨影像數增加而下降,實際應用中的上限可能較低。
How many tokens does an image use?
在目前的 DeepSeek API 上,影像會被縮放並轉為 token,每張影像最多 1024 個 token。多張影像分別計算。
Does it support image generation?
不支援。它接受文字與影像,並回傳文字。
Is it ready for production?
可以,但需先進行路由特定評估。由於舊別名可能解析到 DeepSeek-V4.1-Flash,請使用監控、回退、任務特定驗收測試與模型路由記錄。
Should I use CometAPI or DeepSeek's direct API?
當你需要單一金鑰、單一計費層與便於切換模型時,CometAPI 很實用。當你需要供應商特定功能(如官方 Files API 語意或離峰定價)時,DeepSeek 直連可能更合適。請在同一工作負載下測試兩種路由。
Conclusion
DeepSeek-V4.1-Flash 現已成為 DeepSeek API 上活躍的多模態 Flash 路由。其 1M 上下文、384K 輸出上限、多介面支援,以及「每張影像至多 1024 個 token」的上限,使其對截圖理解、圖表分析、視覺程式撰寫與瀏覽器或 GUI 自動化極具吸引力。本文中的 Vision-Exp 架構與發佈基準保留作為歷史背景。
決策仍應以工作負載為導向。已退役 Vision-Exp 模型的公開基準主要由供應商報告,現行路由別名可能模糊實際服務模型,而影像縮放仍可能限制細節任務。請在代表性影像上測試實際供應商路由,將成功任務成本而非單價作為衡量基準,並保留回退機制,直到該路由在你的生產測試架構中表現可靠為止。
