GPT-6.1 Sol are now live on CometAPI →
ai-model/CometAPI 研究

DeepSeek V4 Flash Vision:是什麼與如何使用

瞭解 DeepSeek V4 Flash Vision 是什麼、目前的圖片限制與定價,並以程式碼透過 DeepSeek 或 CometAPI 的路由進行使用。

CometAPI
Deon GoodwinAI 模型與 API 研究團隊
更新於 Sep 30, 2026 9 分鐘閱讀
DeepSeek V4 Flash Vision:是什麼與如何使用
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

DeepSeek-V4.1-Flash 是目前 DeepSeek API 以模型 ID deepseek-flash 提供的多模態 Flash 模型。它支援 1M token 的上下文、最高 384K 的輸出,並支援影像輸入;依據目前的視覺指南,每張影像在自動調整大小後最多計為 1024 個 token。

其最強定位仍然是面向代理的視覺工作:在繼續進行程式碼或工具操作之前,先檢視螢幕截圖、圖表、介面與影像型文件。本文稍後的基準結果屬於已退役的 Vision-Exp 發佈版本,應視為歷史的、由供應商報告的證據,而非對 DeepSeek-V4.1-Flash 的最新基準。

CometAPI 目前仍以 deepseek-v4-flash-vision-exp 作為其目錄模型 ID,而 DeepSeek 的直連 API 建議使用 deepseek-flash,並以 DeepSeek-V4.1-Flash 回應請求。請以「文字 + 影像」請求開始,然後在你自己的截圖和視覺任務上評估實際路由。

Key Takeaways

  • 現行路由:DeepSeek-V4.1-Flash 是活躍的多模態 Flash 模型。已退役的 deepseek-v4-flash-vision-exp 名稱在 DeepSeek 的 API 中僅作為相容別名被接受。
  • 大型文字工作空間:1M token 上下文與最高 384K 輸出,可在一次對話中處理長文件、程式碼庫、工具歷史與影像。
  • 目前影像計價:DeepSeek 會自動調整每張影像大小並將其上限設定為 1024 個輸入 token。約低於 544×544 總像素的影像會被放大;較大的影像則會縮放至約 1300×1300 的總像素。
  • 代理導向的視覺:官方比較重點在螢幕截圖、圖表、瀏覽器、程式撰寫與視覺工具工作流程,而非影像生成。
  • 廣泛的介面支援:DeepSeek 文件列出支援的 API 介面:Chat Completions、相容 Anthropic 的 Messages,以及 Responses API。以下 CometAPI 範例使用 Chat Completions。
  • 生產注意事項:路由別名、自動影像縮放,以及對測試環境敏感的基準結果,仍使工作負載特定測試至關重要。

What Is DeepSeek-V4-Flash-Vision?

DeepSeek 目前的文件將 deepseek-flash 指向 DeepSeek-V4.1-Flash,支援文字與影像輸入,以及文字輸出。較早的 Vision-Exp 模型已退役;其舊版模型名稱是指向目前 Flash 模型的相容別名。

其目標用例是多模態代理。視覺代理可以檢視已渲染的應用程式、識別按鈕或版面配置故障、推理下一步、呼叫工具,然後檢查下一張截圖。相同模式適用於圖表分析、視覺品質保證、文件擷取、瀏覽器自動化,以及需將設計參考與渲染頁面比較的程式代理。

命名說明:在 DeepSeek 直連 API 上,請使用 deepseek-flash;目前它對應至 DeepSeek-V4.1-Flash。舊名 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 仍被 DeepSeek 接受,但對應模型已退役,請求將由 DeepSeek-V4.1-Flash 服務。CometAPI 則持續以 deepseek-v4-flash-vision-exp 暴露其目錄路由。

Technical Specifications

Specification (official docs)Current value
Official model IDdeepseek-flash
Status活躍的多模態 Flash API 路由;舊版 Vision-Exp 模型已退役
Inputs / output文字 + 影像輸入;文字輸出
Context window1,048,576 tokens (1M)
Maximum output最高 384K tokens
Legacy Vision-Exp checkpoint listing官方 Hugging Face 儲存庫標示為 305B 參數
Legacy Vision-Exp text backbone43 層;隱藏層大小 4,096;64 個注意力頭
Legacy Vision-Exp MoE routing256 個路由化專家;每個 token 選擇 6 個;1 個共享專家
Legacy Vision-Exp vision encoder32 層;寬度 1,024;16 個頭;patch 大小 14
Image representation目前 DeepSeek API 上每張影像最多 1024 個影像 token
Image formatsJPEG, PNG, GIF, WebP
Image input methodsBase64 data URL、外部 URL、DeepSeek Files API 的 file_id
API stylesChat Completions、相容 Anthropic 的 Messages、Responses
Reasoning modes思考與非思考;努力等級 low、high、max
License官方模型儲存庫採 MIT 授權

上述架構欄位來自官方設定。該儲存庫列出 305B 參數的檢查點,但 DeepSeek 未另行公布完整視覺模型的啟用參數數量。與其假設僅文字 V4-Flash 的啟用數量在加入視覺堆疊後仍不變,不如報告儲存庫值較為安全。

How DeepSeek-V4-Flash-Vision-Exp's Legacy Architecture Works

V4-Flash Text Backbone

語言端延續了 V4 設計主題,使長上下文的代理工作變得實用。官方儲存庫記錄了 V4 的架構組件:稀疏 Mixture-of-Experts 路由、DFlash 注意力、Hyper-Connections,以及 DSpark。即使在此規模下本地部署仍然要求嚴苛,該釋出仍比僅 API 的模型更可檢視。

Vision Encoder and Aligner

對於已退役的 Vision-Exp 檢查點,公開設定使用 32 層視覺編碼器、patch 大小 14、視覺寬度 1,024、16 個視覺注意力頭,以及 384 個影像表示 token。這些架構細節描述的是歷史檢查點,不應視為記錄目前服務中的 DeepSeek-V4.1-Flash 堆疊。

Current 1024-Token Image Limit

DeepSeek 目前的視覺分詞規則會在維持長寬比的前提下,將約低於 544×544 總像素的影像放大,並將較大的影像縮放至約 1300×1300 的像素面積。這會為每張影像產生最多 1024 個 token 的上限。因此,一張 2000×2000 的影像與 5000×5000 的影像在縮放後消耗的影像 token 相同。

實務影響:在傳送影像前,裁切包含小字標籤、程式碼或 UI 控件的區域。僅提高來源解析度無法突破目前 1024 個影像 token 的上限。

Legacy Vision-Exp Benchmark Performance

DeepSeek 的官方模型卡評估將該視覺模型與 DeepSeek-V4-Flash-0731 及 Claude Opus 4.8 在文字代理與多模態代理任務上進行比較。視覺模型通常在需要視覺證據時優於僅文字的 Flash 模型,同時仍具競爭力,但並非在每個方面都領先於以能力為先的競品。

DeepSeek V4 Flash Vision:是什麼與如何使用

官方文字與多模態代理評測對比。來源:DeepSeek 官方發佈

Official benchmarkVision-ExpV4-Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
Cybergym75.376.778.3
DeepSWE59.354.458.0
Toolathlon-Verified75.970.376.2
DSBench-Hard63.659.671.7
AutomationBench (Public)25.725.127.2
ApexBench (Pass@1)36.526.2*39.4
Agents' Last Exam27.325.2*25.7
Chartography64.3-65.0
ZeroBench (Pass@5)35.0-34.0

* 在 ApexBench 與 Agents' Last Exam 中,僅文字的 V4-Flash 模型忽略了輸入中的多模態元素。DeepSeek 使用 DeepSeek Harness 最小模式、最大推理努力、temperature 1.0、top_p 0.95 來評估其文字代理任務。

基準說明:這些是 DeepSeek 在發佈時報告的結果,並非獨立重現。代理分數對測試架構、工具定義、token 預算與重試策略尤其敏感,因此應將其視為方向性證據。

What the Benchmark Results Mean

最清晰的結果是在視覺證據重要時相較僅文字 V4-Flash 的提升。ApexBench 從 26.2 提升至 36.5;視覺模型亦新增了競爭性的 Chartography 與 ZeroBench 成績,而僅文字模型未報告這些結果。該模型也在數個文字代理任務上提升,包括 Terminal Bench 2.1、NL2Repo、DeepSWE、Toolathlon-Verified 與 DSBench-Hard,雖然 Cybergym 略低。

與 Opus 4.8 相比,結果是混合的。Vision-Exp 在 DeepSWE、Agents' Last Exam 與 ZeroBench 上較高,而競品則在 Terminal Bench、NL2Repo、Cybergym、Toolathlon、DSBench-Hard、ApexBench 與 Chartography 上較高。因此,DeepSeek 的多模態基準主張更偏向方向性,而非證明在所有視覺、推理或可靠性面向的全面等同性。

DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash

DimensionDeepSeek Vision-ExpDeepSeek V4 FlashClaude Opus 4.8Gemini 3.7 Flash
Status實驗性公測 / 目前的 Flash 路由一般可用一般可用
Input modalities文字、影像文字文字、影像、文件文字、影像、影片、音訊、PDF
Output文字文字文字 / 結構化資料 / 程式碼文字
Context1M1M取決於平台,最高可達 1M1,048,576
Max output384K384K128K65,536
Main strength低成本視覺代理高吞吐量文字代理高自主、複雜代理廣泛多模態主力
Best first test螢幕截圖、圖表、UI、視覺程式撰寫程式撰寫與文字自動化最困難、長期跨度任務豐富媒體與 Google 工具工作流程

當需要在低成本代理迴圈中加入影像感知時,選擇 Vision-Exp。當所有輸入皆為文字且吞吐量優先時,選擇 V4 Flash。在 DeepSeek 自身比較中,Opus 4.8 仍是以能力為先的選項;當需要影片、音訊、PDF 與 Google 原生工具時,Gemini 3.7 Flash 是更廣泛的多模態替代方案。

What Can DeepSeek-V4-Flash-Vision Do?

  • 截圖轉程式碼與 UI 審查——比較渲染頁面與設計,識別版面或無障礙問題,並生成實作建議。
  • 視覺瀏覽器代理——在 DOM 或可及性樹資料不完整時以截圖作為觀測,然後選擇下一個工具動作。
  • 圖表與儀表板分析——解釋趨勢、識別異常,並將可見指標連結到更大的文字或工具工作流程。
  • 基於影像的文件理解——在結構化處理前,從掃描表單、圖示、投影片、表格與截圖中擷取資訊。
  • 多模態程式代理——在單一除錯迴圈中結合原始碼、錯誤截圖、IDE 狀態與渲染輸出。
  • 視覺品質保證——比較不同裝置的產品截圖、偵測缺漏元素,並生成結構化缺陷報告。
  • 多影像比較——在一次請求中評估一系列截圖或替代設計,受限於請求大小與影像數量上限。

DeepSeek V4 Flash Vision:是什麼與如何使用

DeepSeek 發佈頁的官方視覺代理範例(Word 中的動態 GIF)。來源:DeepSeek 官方發佈

Pricing and Availability

DeepSeek 將影像 token 與文字輸入 token 一併計費。其官方定價表使用尖峰與離峰費率,而 CometAPI 模型頁面則發布單一路由現價。這些數字不應被折算為單一「通用價格」,因為最便宜的路由會隨 DeepSeek 的時間窗而變化。

Route / sourceCache-hit inputCache-miss inputOutputCondition
DeepSeek official - off-peak$0.003$0.15$0.60非尖峰時段,包括週末與中國法定節假日
DeepSeek official - peak$0.006$0.30$1.20週一至週五 01:00-04:00 與 06:00-10:00 UTC,排除中國法定節假日
CometAPI current routeNot listed separately$0.352$1.056目前的統一路由價格

所有價格為每 1M token 的美元計價。DeepSeek 目前的 Flash 費率在離峰時段為 $0.003/$0.15/$0.60(快取命中輸入/快取未命中輸入/輸出),在尖峰時段為 $0.006/$0.30/$1.20。CometAPI 目前列為每 1M 輸入 token 約 $0.352、每 1M 輸出 token 約 $1.06 的相容路由。影像在目前的 DeepSeek API 上每張最多計為 1024 個輸入 token;在上線前務必重新確認即時路由定價。

定價說明:模型價格可能變動。請將價格數據連結至即時定價頁面,並在發布或上線前立即重新確認。

How to Use DeepSeek-V4-Flash-Vision with CometAPI

CometAPI 目前透過其相容 OpenAI 的 /v1/chat/completions 端點列出 deepseek-v4-flash-vision-exp,因此以下 CometAPI 範例保留該目錄 ID。對於 DeepSeek 直連 API,請改用 deepseek-flash。

Step 1: Create an API Key

  1. 建立或登入 CometAPI 帳戶。
  2. 開啟 API token 控制台 並建立金鑰。
  3. 將其儲存在 COMETAPI_KEY 環境變數中。切勿將生產金鑰置於用戶端程式碼或提交至版本控制。
export COMETAPI_KEY="your-cometapi-key"

Step 2: Send a Base64 Image with cURL

Base64 適用於本機檔案與影像已在記憶體中的伺服端作業。用編碼後的影像位元組取代占位符,勿加入空格或換行。

curl https://api.cometapi.com/v1/chat/completions \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "Read this dashboard and return the three most important findings."
          },
          {
            "type": "image_url",
            "image_url": {
              "url": "data:image/png;base64;<BASE64_DATA>"
            }
          }
        ]
      }
    ],
    "max_tokens": 1200
  }'

Step 3: Analyze a Local Image with Python

OpenAI Python SDK 可透過更改 base URL 呼叫 CometAPI。當 SDK 未直接暴露相應選項時,使用 extra_body 傳遞 DeepSeek 特定的 thinking 控制。

import base64
import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

with open("dashboard.png", "rb") as image_file:
    encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "Analyze the chart. Return JSON with keys: trend, "
                        "anomalies, evidence, and confidence."
                    ),
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{encoded}"
                    },
                },
            ],
        }
    ],
    max_tokens=1500,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(response.choices[0].message.content)

Step 4: Use a Public Image URL with JavaScript

影像 URL 可保持 JSON 請求精簡,但該 URL 必須可被上游模型公開存取。避免使用臨時、私有或需認證的連結,除非你的應用先將影像轉為 Base64。

const response = await fetch(
  "https://api.cometapi.com/v1/chat/completions",
  {
    method: "POST",
    headers: {
      Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
      "Content-Type": "application/json",
    },
    body: JSON.stringify({
      model: "deepseek-v4-flash-vision-exp",
      messages: [
        {
          role: "user",
          content: [
            {
              type: "text",
              text: "Identify the UI issue and propose a concrete CSS fix.",
            },
            {
              type: "image_url",
              image_url: {
                url: "https://example.com/screenshot.png",
              },
            },
          ],
        },
      ],
      max_tokens: 1200,
    }),
  }
);

if (!response.ok) {
  throw new Error(`CometAPI request failed: ${response.status}`);
}

const data = await response.json();
console.log(data.choices[0].message.content);

Step 5: Send Multiple Images

在同一個 user 訊息中放置多個 image_url 區塊,並告訴模型如何標記它們。明確標籤可降低跨影像引用錯誤。

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "Compare Image A and Image B. List every visible regression."
        },
        {
          "type": "image_url",
          "image_url": {"url": "https://example.com/image-a.png"}
        },
        {
          "type": "image_url",
          "image_url": {"url": "https://example.com/image-b.png"}
        }
      ]
    }
  ],
  "max_tokens": 1800
}

Input Methods and Limits

LimitOfficial DeepSeek value
Supported formatsJPEG, PNG, GIF, WebP
External URL length最長 8,192 字元
Request body48 MiB
Single image via Base64 / URL32 MiB
Single image via DeepSeek Files API64 MiB
Maximum images per request600
Total image size無 file_id 時為 64 MiB;包含 file_id 可達 200 MiB
Maximum dimension每邊最長 8,192 px;當請求含 15+ 張影像時每邊 4,096 px
Image message role僅限 user 訊息

官方 DeepSeek API 也透過其 Files API 支援可重用的 file_id 影像參照。此處的 CometAPI 快速路徑使用 image_url 區塊,搭配公開 URL 或 Base64 data URL。透過聚合路由前,請先確認供應商特定的檔案上傳與 file_id 透傳行為。

How to Prompt the Model Effectively

可靠的視覺代理提示應說明影像是什麼、要檢視的證據、要採取的行動,以及要遵循的輸出契約。像是「描述此影像」這樣的模糊提示自由度過大,且更難驗證結果。

  • Context——標明截圖、圖表、文件或介面的類型及其在工作流程中的角色。
  • Task——指定重要的決策、診斷、比較或擷取任務。
  • Evidence——要求可見證據、標籤、座標、數值,或引用的 UI 文字。
  • Constraints——禁止不受支援的假設,並說明如何處理不可讀的細節。
  • Output——定義 JSON 鍵、核對清單、嚴重性等級,或其他可機器檢查的結構。
You are reviewing a web application screenshot.

Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.

Production Best Practices

  • 當小字或控件很重要時請先裁切;影像 token 上限代表無關背景會消耗有限的視覺解析度。
  • 測試推理努力等級,而非對所有請求一律啟用最大。簡單 OCR 或分類通常不需要高推理。
  • 要求每個結論都附帶證據。這使得可視化的杜撰更容易被自動拒絕。
  • 在高風險自動化中將「感知」與「動作」分離。先讓模型描述狀態、驗證後,再讓受控的工具層執行。
  • 保護影像 URL,因為公開 URL 可能暴露敏感截圖。對私密資料偏好伺服端 Base64,並自行制定保留政策。
  • 以與生產相同的截圖擷取、提示、工具、重試與成功標準進行端到端基準。
  • 釘住提示與評測資料以追蹤實驗變更。-exp 端點的行為變更速度可能比成熟的 GA 模型更快。
  • 記錄請求 ID 與失敗,以區分供應商錯誤、模型錯誤與應用解析錯誤。

Limitations

最重要的限制是路由透明度:舊的 Vision-Exp 名稱可能仍被接受,但請求實際由 DeepSeek-V4.1-Flash 服務。請記錄供應商、請求的模型 ID、回傳的模型中繼資料與請求 ID;在賦予自主操作前使用明確的評估閘門。歷史發佈分數不能替代在目標路由上的可重現測試。

第二個限制是視覺細節。自動縮放與目前每張影像 1024 個 token 的上限使成本可預測,但仍可能抑制微小文字、細密圖表標記或高密度介面元素。請裁切、分割或放大相關區域,並保留原始影像供人工檢閱。

該模型僅輸出文字。它可以分析影像並提出程式碼或結構化動作建議,但不會生成或編輯影像。它也僅在 user 訊息中接受影像;官方文件指出在 system 或 assistant 訊息中的影像內容會回傳 400 錯誤。

最後,本地部署需要沉重的基礎設施。官方儲存庫列出 305B 參數,並提供參考推論程式碼,而非輕量級的即用型執行環境。對大多數團隊而言,受管 API 評估是務實的起點。

Common Errors and Fixes

SymptomLikely causeRecommended fix
400: model does not support image錯誤的模型 ID使用 deepseek-v4-flash-vision-exp
400 for message content將影像放在 system 或 assistant 訊息中將影像區塊移至 user 訊息
Image download failure私有、過期或過慢的 URL使用 Base64 或穩定的公開 URL
Fine details are missed自動下採樣 / 384 token 上限裁切或分割相關區域
Unexpectedly high cost輸出過長、重試或多輪對話限制 max_tokens 並記錄每輪用量
Inconsistent agent result測試架構或工具狀態變動固定提示、工具、重試與評估標準

FAQ

Is DeepSeek-V4-Flash-Vision the same as DeepSeek-V4-Flash?

不是。Vision-Exp 新增了原生影像輸入與多模態訓練。僅文字的 Flash 路由不具相同的視覺感知能力。

What model ID should I use?

在 DeepSeek 直連 API 上使用 deepseek-flash。在 CometAPI 上,於該路由仍可用時使用目錄 ID deepseek-v4-flash-vision-exp。

Can it analyze multiple images?

可以。DeepSeek 文件記載每次請求最多 600 張影像,受限於請求大小與尺寸上限。由於延遲與提示清晰度會隨影像數增加而下降,實際應用中的上限可能較低。

How many tokens does an image use?

在目前的 DeepSeek API 上,影像會被縮放並轉為 token,每張影像最多 1024 個 token。多張影像分別計算。

Does it support image generation?

不支援。它接受文字與影像,並回傳文字。

Is it ready for production?

可以,但需先進行路由特定評估。由於舊別名可能解析到 DeepSeek-V4.1-Flash,請使用監控、回退、任務特定驗收測試與模型路由記錄。

Should I use CometAPI or DeepSeek's direct API?

當你需要單一金鑰、單一計費層與便於切換模型時,CometAPI 很實用。當你需要供應商特定功能(如官方 Files API 語意或離峰定價)時,DeepSeek 直連可能更合適。請在同一工作負載下測試兩種路由。

Conclusion

DeepSeek-V4.1-Flash 現已成為 DeepSeek API 上活躍的多模態 Flash 路由。其 1M 上下文、384K 輸出上限、多介面支援,以及「每張影像至多 1024 個 token」的上限,使其對截圖理解、圖表分析、視覺程式撰寫與瀏覽器或 GUI 自動化極具吸引力。本文中的 Vision-Exp 架構與發佈基準保留作為歷史背景。

決策仍應以工作負載為導向。已退役 Vision-Exp 模型的公開基準主要由供應商報告,現行路由別名可能模糊實際服務模型,而影像縮放仍可能限制細節任務。請在代表性影像上測試實際供應商路由,將成功任務成本而非單價作為衡量基準,並保留回退機制,直到該路由在你的生產測試架構中表現可靠為止。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 30, 2026
最後更新 Sep 30, 2026
0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

閱讀更多