Thông số kỹ thuật của DeepSeek-V4-Flash-Vision-Exp
| Thông số | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| Model ID | deepseek-v4-flash-vision-exp |
| Nhà cung cấp | DeepSeek |
| Loại mô hình | Mô hình ngôn ngữ-thị giác đa phương thức thử nghiệm |
| Ngày phát hành | August 21, 2026 |
| Loại đầu vào | Văn bản, Hình ảnh |
| Loại đầu ra | Văn bản |
| Cửa sổ ngữ cảnh | 1M token |
| Đầu ra tối đa | Tối đa 384K token |
| Token ảnh tối đa | 384 token mỗi ảnh |
| Định dạng ảnh được hỗ trợ | JPEG, PNG, GIF, WebP |
| Phương thức nhập ảnh | Base64, public URL, Files API |
| Giao diện API | Chat Completions, Messages, Responses |
| Suy luận | Được hỗ trợ |
| Trạng thái mô hình | Thử nghiệm |
| Giá đầu vào | Giá giống với DeepSeek-V4-Flash |
| Giá đầu ra | Giá giống với DeepSeek-V4-Flash |
DeepSeek-V4-Flash-Vision-Exp được giới thiệu vào ngày August 21, 2026 như một mô hình đa phương thức thử nghiệm trên nền tảng API của DeepSeek. Mô hình mở rộng họ V4-Flash với khả năng hiểu hình ảnh nguyên bản, đồng thời vẫn giữ các khả năng Agent hướng văn bản, suy luận và hiểu biết về thế giới của V4-Flash.
Một đặc điểm nổi bật của API là hiệu quả token cho ảnh: mỗi ảnh được chuyển đổi thành token và bị giới hạn ở 384 token mỗi ảnh cho mục đích tính phí. Mô hình hỗ trợ ba phương thức nạp hình ảnh—Base64 nội tuyến, URL bên ngoài và Files API—khiến nó phù hợp cho cả các yêu cầu thị giác đơn giản và quy trình Agent nhiều bước.
DeepSeek-V4-Flash-Vision-Exp là gì?
DeepSeek-V4-Flash-Vision-Exp là phiên bản đa phương thức thử nghiệm của V4-Flash do DeepSeek phát triển, được thiết kế để kết hợp hiểu thị giác với suy luận và các quy trình Agent.
Sự khác biệt so với mô hình hiểu hình ảnh thông thường rất quan trọng. Mô hình không chỉ được định vị như một hệ thống OCR hay tạo chú thích ảnh. Giá trị chính của nó là khả năng đưa thông tin thị giác vào các quy trình nơi một Agent AI cần hiểu hình ảnh, suy luận về thông tin nó chứa, rồi tiếp tục với tác vụ văn bản hoặc dựa trên công cụ.
Ví dụ, một Agent có thể nhận ảnh chụp màn hình giao diện web, xác định các phần tử UI liên quan, suy luận về những gì cần thay đổi, rồi tiếp tục quy trình mã hóa hoặc tự động hóa. Tương tự, biểu đồ, bảng điều khiển, ảnh chụp màn hình và tài liệu dựa trên hình ảnh có thể trở thành đầu vào của một chuỗi suy luận rộng hơn.
DeepSeek mô tả mô hình thử nghiệm này là duy trì các khả năng văn bản của V4-Flash trong khi cải thiện đáng kể hiệu suất trên các chuẩn Agent yêu cầu hiểu thị giác. DeepSeek cũng báo cáo rằng khả năng Agent đa phương thức của mô hình tiệm cận mức của Claude Opus 4.8. Những tuyên bố điểm chuẩn này do nhà cung cấp báo cáo và không nên được hiểu là đánh giá độc lập từ bên thứ ba.
Những tính năng chính của DeepSeek-V4-Flash-Vision-Exp là gì?
- Đầu vào đa phương thức nguyên bản: Mô hình chấp nhận văn bản và hình ảnh trong cùng một yêu cầu, cho phép nhà phát triển kết hợp chứng cứ trực quan với hướng dẫn ngôn ngữ tự nhiên thay vì xây dựng một pipeline tiền xử lý chuyển ảnh thành văn bản riêng.
- Thị giác cho quy trình Agent: Điểm khác biệt quan trọng nhất là tích hợp hiểu thị giác với suy luận định hướng Agent. Điều này khiến ảnh chụp màn hình, biểu đồ, giao diện và các trạng thái trực quan khác có thể sử dụng như một phần của quy trình AI nhiều bước.
- Trần 384 token cho ảnh: Ảnh được chuyển đổi thành token cho suy luận và tính phí, mỗi ảnh tiêu thụ không quá 384 token. Điều này tạo nên cấu trúc chi phí tương đối dễ dự đoán cho các ứng dụng nặng về hình ảnh.
- Ngữ cảnh 1M token: Mô hình giữ khả năng ngữ cảnh cực lớn gắn với họ V4-Flash, phù hợp cho các quy trình kết hợp ngữ cảnh văn bản lớn với đầu vào thị giác. Danh mục mô hình hiện tại báo cáo cửa sổ ngữ cảnh 1M token và đầu ra tối đa 384K token.
- Nhiều giao diện API: Nhà phát triển có thể truy cập mô hình qua Chat Completions, Anthropic-compatible Messages hoặc Responses APIs. Điều này giúp dễ tích hợp mô hình vào hạ tầng LLM và Agent hiện có.
- Files API cho ảnh dùng lại: Nhà phát triển có thể tải lên một ảnh một lần và sau đó tham chiếu nó bằng
file_id, đặc biệt hữu ích khi cùng một ảnh cần được xem xét qua nhiều lượt Agent. DeepSeek giới thiệu Files API cùng với mô hình thị giác.
DeepSeek-V4-Flash-Vision-Exp hoạt động ra sao trên các chuẩn điểm?
Các kết quả công khai mạnh nhất tập trung ở đánh giá Agent và đa phương thức. DeepSeek báo cáo rằng V4-Flash-Vision-Exp duy trì các khả năng văn bản của V4-Flash đồng thời cải thiện đáng kể trên các nhiệm vụ cần hiểu thị giác.
Kết quả báo cáo bao gồm:
| Benchmark | Điểm báo cáo |
|---|---|
| Terminal-Bench 2.1 | 83.9 |
| DeepSWE | 59.3 |
| Chartography, p0.95 | 64.3 |
| Chartography, p1.0 | 63.3 |
| NL2Repo | 57.7 |
| DSBench-Hard | 63.6 |
| AutomationBench (Public) | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| ZeroBench, Pass@5 | 35.0 |
Điểm Chartography 64.3 tại p0.95 đặc biệt liên quan vì nó đại diện cho một đánh giá theo hướng thị giác/Agent, thay vì chuẩn văn bản thuần túy. DeepSeek sử dụng các kết quả này để củng cố tuyên bố rằng khả năng Agent đa phương thức của mô hình đang tiệm cận Opus 4.8.
Tuy nhiên, các con số này nên được coi là kết quả thời điểm ra mắt do nhà cung cấp báo cáo, không phải điểm số điểm chuẩn được tái lập độc lập. Đối với việc chọn mô hình sản xuất, nhà phát triển nên thử nghiệm mô hình trên chính ảnh chụp màn hình, biểu đồ, tài liệu, trạng thái UI và bộ khung Agent của mình.
DeepSeek-V4-Flash-Vision-Exp so sánh với các mô hình khác thế nào?
| Mô hình | Thế mạnh chính | Thị giác | Agent/Suy luận | Ngữ cảnh | Phù hợp nhất |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | Quy trình Agent đa phương thức chi phí thấp | ✓ | Mạnh | 1M | Agent thị giác, ảnh chụp màn hình, biểu đồ, tự động hóa |
| DeepSeek-V4-Flash | Nhiệm vụ suy luận và Agent tổng quát | Không có thị giác nguyên bản trong mô hình gốc | Mạnh | 1M | Agent dựa trên văn bản và mã hóa |
| Claude Opus 4.8 | Suy luận tiên phong và hiệu năng Agent đa phương thức | ✓ | Rất mạnh | Ngữ cảnh lớn | Agent doanh nghiệp phức tạp |
| Gemini family | Hiểu đa phương thức và ứng dụng ngữ cảnh dài | ✓ | Mạnh | Ngữ cảnh lớn | Tài liệu, media, ứng dụng đa phương thức |
So sánh ý nghĩa nhất không đơn giản là liệu một mô hình có thể nhận diện hình ảnh hay không. DeepSeek-V4-Flash-Vision-Exp nhắm tới một lớp Agent đa phương thức chi phí thấp: nó kết hợp hiểu hình ảnh với các khả năng suy luận và Agent vốn gắn với V4-Flash.
So với DeepSeek-V4-Flash, nâng cấp chủ đạo là nhận thức thị giác. Các khả năng hướng văn bản nền tảng được dự định vẫn tương đồng rộng với V4-Flash, trong khi các đánh giá Agent thị giác cho thấy cải thiện đáng kể.
So với các mô hình đa phương thức tiên phong như Claude Opus 4.8, định vị khi ra mắt của DeepSeek nhấn mạnh một tuyên bố hẹp hơn: hiệu năng điểm chuẩn Agent đa phương thức của mô hình tiệm cận Opus 4.8. Điều đó không nên được hiểu là hai mô hình tương đương trên trí tuệ tổng quát, mã hóa, thị giác, suy luận, sử dụng công cụ và độ tin cậy.
Trường hợp sử dụng tốt nhất cho DeepSeek-V4-Flash-Vision-Exp là gì?
Từ ảnh chụp màn hình sang mã và phân tích UI
Nhà phát triển có thể cung cấp ảnh chụp màn hình của website, ứng dụng, bảng điều khiển hoặc giao diện thiết kế và yêu cầu mô hình xác định các phần tử UI, chẩn đoán vấn đề bố cục hoặc tạo hướng dẫn triển khai. Điều này khiến mô hình đặc biệt thú vị cho các Agent mã hóa AI cần suy luận từ chứng cứ trực quan.
Agent trình duyệt trực quan
Một Agent trình duyệt có thể sử dụng ảnh chụp màn hình làm quan sát thay vì chỉ dựa hoàn toàn vào DOM hoặc thông tin cây khả năng truy cập. Mô hình có thể diễn giải trạng thái trực quan của trang web và kết hợp thông tin đó với vòng lặp suy luận và gọi công cụ.
Phân tích biểu đồ và bảng điều khiển
Mô hình có thể phân tích biểu đồ, bảng điều khiển và các dạng biểu diễn dữ liệu trực quan khác. Đây là một trong những lĩnh vực mà kết quả Chartography được báo cáo đặc biệt liên quan.
Hiểu tài liệu dựa trên hình ảnh
Có thể cung cấp trực tiếp các ảnh chứa văn bản, bảng, sơ đồ hoặc thông tin có cấu trúc cho mô hình. Nhà phát triển có thể sử dụng khả năng này cho phân tích tài liệu, trích xuất thông tin và hỏi đáp trực quan.
Agent mã hóa đa phương thức
Một Agent mã hóa có thể kết hợp mã nguồn với ảnh chụp màn hình lỗi, trạng thái IDE, trang web render hoặc tham chiếu thiết kế. Thay vì chuyển mọi ảnh chụp màn hình thành mô tả văn bản tạo thủ công, mô hình có thể suy luận trực tiếp từ đầu vào thị giác.
Tự động hóa trực quan
Mô hình có thể đóng vai trò thành phần cảm nhận của hệ thống tự động hóa cần hiểu những gì đang hiển thị trước khi chọn hành động tiếp theo. Điều này đặc biệt liên quan tới tự động hóa GUI và quy trình sử dụng máy tính.
Phiên bản mô hình và tình trạng khả dụng API của DeepSeek-V4-Flash-Vision-Exp
Định danh mô hình hiện tại là:
deepseek-v4-flash-vision-exp
Mô hình trở nên khả dụng qua DeepSeek API vào ngày August 21, 2026. Nhà phát triển có thể chỉ định model ID này khi thực hiện yêu cầu API đa phương thức.
Mô hình hiện hỗ trợ ba phong cách API chính:
Chat Completions
Messages
Responses
Ảnh có thể được cung cấp qua:
Base64
Public image URL
Files API / file_id
Sự kết hợp này đặc biệt hữu ích cho nhà phát triển xây dựng Agent đa phương thức vì cùng một mô hình có thể được tích hợp vào hạ tầng tương thích với OpenAI, Anthropic hoặc dựa trên Responses hiện có.
Vì sao nên dùng DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp hấp dẫn nhất khi thị giác và suy luận Agent cần hoạt động cùng nhau mà không làm tăng chi phí API quá mức.
Lợi thế lớn nhất của nó không chỉ là khả năng mô tả ảnh. Mô hình kết hợp đầu vào thị giác với cửa sổ ngữ cảnh 1M token, suy luận định hướng Agent, nhiều giao diện API và tính phí ảnh được giới hạn ở 384 token mỗi ảnh.
Đối với nhà phát triển xây dựng phân tích ảnh chụp màn hình, Agent mã hóa trực quan, pipeline xử lý biểu đồ, tự động hóa trình duyệt hoặc quy trình công việc đa phương thức, điều này khiến deepseek-v4-flash-vision-exp trở thành một mô hình thử nghiệm đặc biệt đáng để đánh giá điểm chuẩn.
Tuy nhiên, đối với triển khai sản xuất, ban đầu mô hình nên được coi là một ứng viên để đánh giá và kiểm chuẩn hơn là mặc định không cần nghi ngờ. Trạng thái thử nghiệm và lượng dữ liệu điểm chuẩn đa phương thức độc lập còn hạn chế nghĩa là thử nghiệm theo ứng dụng cụ thể vẫn rất cần thiết.
Cách truy cập API DeepSeek-V4-Flash-Vision-Exp trên CometAPI
CometAPI có thể cung cấp lớp truy cập API hợp nhất cho nhà phát triển muốn thử nghiệm DeepSeek-V4-Flash-Vision-Exp mà không cần xây dựng tích hợp riêng cho từng nhà cung cấp mô hình.
Quy trình cơ bản là:
- Tạo tài khoản CometAPI và lấy khóa API.
- Chọn
deepseek-v4-flash-vision-explàm mô hình. - Gửi văn bản cùng với một hình ảnh bằng định dạng yêu cầu đa phương thức được hỗ trợ.
- Xử lý phản hồi văn bản trả về trong ứng dụng của bạn.
- Đánh giá điểm chuẩn mô hình so với mô hình thị giác hoặc Agent hiện tại trước khi chuyển lưu lượng sản xuất.
Kết luận
DeepSeek-V4-Flash-Vision-Exp là mô hình Agent đa phương thức thử nghiệm bổ sung khả năng hiểu hình ảnh nguyên bản vào ngăn khả năng của V4-Flash, đồng thời giữ thiết kế ngữ cảnh lớn và định hướng suy luận.
Sự kết hợp thú vị nhất là thị giác + suy luận Agent + ngữ cảnh 1M token + trần 384 token mỗi ảnh. DeepSeek báo cáo mức tăng đáng kể trên các chuẩn Agent thị giác và cho biết khả năng Agent đa phương thức của mô hình tiệm cận Opus 4.8, nhưng các kết quả đó vẫn do nhà cung cấp báo cáo và cần được xác thực độc lập.
Đối với người dùng CometAPI, mô hình đáng để thử nghiệm khi ứng dụng cần vượt ra ngoài Agent chỉ văn bản hướng tới hiểu ảnh chụp màn hình, mã hóa trực quan, phân tích biểu đồ, tự động hóa trình duyệt và quy trình đa phương thức.