TL;DR
DeepSeek-V4.1-Flash là mô hình Flash đa phương thức hiện tại được phục vụ qua DeepSeek API với ID mô hình deepseek-flash. Mô hình hỗ trợ ngữ cảnh 1M token, đầu ra tối đa 384K, và đầu vào hình ảnh; theo hướng dẫn Vision hiện tại, mỗi ảnh sử dụng nhiều nhất 1024 token sau khi tự động thay đổi kích thước.
Điểm mạnh nhất vẫn là thị giác hướng agent: kiểm tra ảnh chụp màn hình, biểu đồ, giao diện và tài liệu dạng ảnh rồi tiếp tục với mã hoặc công cụ. Các kết quả benchmark ở phần sau thuộc đợt ra mắt Vision-Exp đã ngừng phục vụ và chỉ nên xem như bằng chứng lịch sử do nhà cung cấp công bố — không phải benchmark mới cho DeepSeek-V4.1-Flash.
CometAPI hiện giữ deepseek-v4-flash-vision-exp làm ID mô hình trong danh mục, trong khi API trực tiếp của DeepSeek khuyến nghị deepseek-flash và sẽ phục vụ yêu cầu bằng DeepSeek-V4.1-Flash. Hãy bắt đầu bằng một yêu cầu văn bản+kèm ảnh, rồi tự đánh giá tuyến chính xác trên ảnh chụp màn hình và tác vụ thị giác của bạn.
Key Takeaways
- Tuyến hiện tại: DeepSeek-V4.1-Flash là mô hình Flash đa phương thức đang hoạt động. Tên cũ
deepseek-v4-flash-vision-expchỉ còn là bí danh tương thích trên API của DeepSeek. - Không gian văn bản lớn: Ngữ cảnh 1M token và đầu ra tối đa 384K hỗ trợ tài liệu dài, kho mã, lịch sử công cụ và ảnh trong một cuộc hội thoại.
- Cách tính ảnh hiện tại: DeepSeek tự động thay đổi kích thước mỗi ảnh và giới hạn tối đa 1024 token đầu vào cho mỗi ảnh. Ảnh dưới khoảng 544×544 pixel tổng sẽ được phóng to; ảnh lớn hơn sẽ được co về khoảng 1300×1300 pixel tổng.
- Thị giác hướng agent: so sánh chính thức nhấn mạnh quy trình ảnh chụp màn hình, biểu đồ, trình duyệt, lập trình và công cụ trực quan thay vì tạo ảnh.
- Hỗ trợ giao diện rộng: DeepSeek ghi tài liệu về các giao diện API được hỗ trợ: Chat Completions, Messages tương thích Anthropic và Responses API. Ví dụ CometAPI dưới đây dùng Chat Completions.
- Thận trọng khi lên sản xuất: bí danh tuyến, thay đổi kích thước ảnh tự động và kết quả benchmark nhạy cảm với harness khiến thử nghiệm theo khối lượng công việc cụ thể vẫn là điều thiết yếu.
What Is DeepSeek-V4-Flash-Vision?
Tài liệu hiện tại của DeepSeek xác định deepseek-flash là DeepSeek-V4.1-Flash, hỗ trợ đầu vào văn bản+kèm ảnh và đầu ra văn bản. Mô hình Vision-Exp trước đây đã bị ngừng; các tên mô hình kế thừa là bí danh tương thích được định tuyến tới mô hình Flash hiện tại.
Trường hợp sử dụng mục tiêu là tác tử đa phương thức. Một agent thị giác có thể kiểm tra ứng dụng đã render, xác định nút hoặc lỗi bố cục, suy luận bước tiếp theo, gọi công cụ, rồi kiểm tra ảnh chụp màn hình tiếp theo. Mẫu này cũng áp dụng cho phân tích biểu đồ, đảm bảo chất lượng trực quan, trích xuất tài liệu, tự động hóa trình duyệt và agent lập trình cần so sánh bản thiết kế với trang đã render.
Lưu ý đặt tên: với API trực tiếp của DeepSeek, dùng deepseek-flash; hiện nó ánh xạ tới DeepSeek-V4.1-Flash. Các tên kế thừa deepseek-v4-flash và deepseek-v4-flash-vision-exp vẫn được DeepSeek chấp nhận, nhưng mô hình tương ứng đã ngừng và yêu cầu sẽ được phục vụ bởi DeepSeek-V4.1-Flash. CometAPI tiếp tục cung cấp deepseek-v4-flash-vision-exp như một tuyến trong danh mục của họ.
Technical Specifications
| Thông số (tài liệu chính thức) | Giá trị hiện tại |
|---|---|
| Official model ID | deepseek-flash |
| Trạng thái | Tuyến Flash đa phương thức đang hoạt động; mô hình Vision-Exp đã nghỉ |
| Đầu vào / đầu ra | Đầu vào văn bản + ảnh; đầu ra văn bản |
| Cửa sổ ngữ cảnh | 1,048,576 token (1M) |
| Đầu ra tối đa | Tối đa 384K token |
| Danh sách checkpoint Vision-Exp cũ | 305B tham số trên kho chính thức Hugging Face |
| Backbone văn bản Vision-Exp cũ | 43 lớp; kích thước ẩn 4.096; 64 đầu attention |
| Định tuyến MoE Vision-Exp cũ | 256 expert định tuyến; chọn 6 mỗi token; 1 expert chia sẻ |
| Bộ mã hóa thị giác Vision-Exp cũ | 32 lớp; độ rộng 1.024; 16 đầu; kích cỡ patch 14 |
| Biểu diễn ảnh | Tối đa 1024 token ảnh mỗi ảnh trên DeepSeek API hiện tại |
| Định dạng ảnh | JPEG, PNG, GIF, WebP |
| Phương thức đưa ảnh vào | Base64 data URL, URL ngoài, file_id qua DeepSeek Files API |
| Kiểu API | Chat Completions, Messages tương thích Anthropic, Responses |
| Chế độ suy luận | Thinking và non-thinking; mức effort low, high, max |
| Giấy phép | MIT cho kho mô hình chính thức |
Các trường kiến trúc ở trên đến từ cấu hình chính thức. Giao diện kho liệt kê checkpoint 305B tham số, nhưng DeepSeek không công bố riêng số tham số kích hoạt cho mô hình thị giác hoàn chỉnh. An toàn hơn là báo cáo giá trị từ kho thay vì giả định rằng số tham số kích hoạt của V4-Flash chỉ văn bản chuyển nguyên vẹn sau khi thêm stack thị giác.
How DeepSeek-V4-Flash-Vision-Exp's Legacy Architecture Works
V4-Flash Text Backbone
Phía ngôn ngữ giữ các chủ đề thiết kế V4 giúp công việc agent ngữ cảnh dài trở nên thực tiễn. Kho chính thức ghi lại các thành phần kiến trúc V4: định tuyến Mixture-of-Experts thưa, DFlash attention, Hyper-Connections và DSpark. Điều này giúp bản phát hành minh bạch hơn so với mô hình chỉ API, dù triển khai cục bộ ở quy mô này vẫn đòi hỏi hạ tầng lớn.
Vision Encoder and Aligner
Với checkpoint Vision-Exp đã nghỉ, cấu hình công bố dùng bộ mã hóa thị giác 32 lớp, patch size 14, độ rộng thị giác 1.024, 16 đầu attention thị giác và biểu diễn ảnh 384 token. Các chi tiết kiến trúc này mô tả checkpoint lịch sử và không nên giả định là mô tả stack phục vụ DeepSeek-V4.1-Flash hiện tại.
Current 1024-Token Image Limit
Quy tắc token hóa thị giác hiện tại của DeepSeek phóng to ảnh dưới khoảng 544×544 pixel tổng và thu nhỏ ảnh lớn hơn trong khi giữ tỷ lệ. Ảnh lớn được co về gần vùng pixel của ảnh 1300×1300, tạo ra giới hạn trên 1024 token mỗi ảnh. Vì thế ảnh 2000×2000 và 5000×5000 tiêu thụ số token ảnh như nhau sau khi thay đổi kích thước.
Hệ quả thực tế: hãy cắt vùng chứa nhãn nhỏ, mã hoặc điều khiển UI trước khi gửi ảnh. Độ phân giải nguồn cao hơn không vượt qua trần 1024 token hiện tại.
Legacy Vision-Exp Benchmark Performance
Thẻ mô hình chính thức của DeepSeek so sánh mô hình thị giác với DeepSeek-V4-Flash-0731 và Claude Opus 4.8 trên các tác vụ agent văn bản và agent đa phương thức. Mô hình thị giác nói chung cải thiện so với mô hình Flash chỉ văn bản trong khi vẫn cạnh tranh, nhưng không vượt trội đồng đều, so với đối thủ thiên về năng lực.
So sánh benchmark chính thức cho đánh giá agent văn bản và đa phương thức. Nguồn: phát hành chính thức của DeepSeek
| Benchmark chính thức | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents' Last Exam | 27.3 | 25.2* | 25.7 |
| Chartography | 64.3 | - | 65.0 |
| ZeroBench (Pass@5) | 35.0 | - | 34.0 |
* Ở ApexBench và Agents' Last Exam, V4-Flash chỉ văn bản đã bỏ qua phần đa phương thức trong đầu vào. DeepSeek đánh giá tác vụ agent văn bản với DeepSeek Harness chế độ tối giản, effort suy luận tối đa, temperature 1.0 và top_p 0.95.
Ghi chú benchmark: đây là kết quả đợt ra mắt do DeepSeek công bố, không phải tái lập độc lập. Điểm agent đặc biệt nhạy cảm với harness, định nghĩa công cụ, ngân sách token và chính sách retry, vì vậy chỉ nên xem như bằng chứng định hướng.
What the Benchmark Results Mean
Kết quả rõ nhất là cải thiện so với V4-Flash chỉ văn bản khi bằng chứng thị giác quan trọng. ApexBench tăng từ 26.2 lên 36.5, và mô hình thị giác bổ sung kết quả Chartography và ZeroBench cạnh tranh mà mô hình chỉ văn bản không báo cáo. Mô hình cũng cải thiện trên một số tác vụ agent văn bản, gồm Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon-Verified và DSBench-Hard, dù Cybergym hơi thấp hơn.
Đối chiếu với Opus 4.8, kết quả lẫn lộn. Vision-Exp cao hơn ở DeepSWE, Agents' Last Exam và ZeroBench trong bảng này, trong khi mô hình đối thủ cao hơn ở Terminal Bench, NL2Repo, Cybergym, Toolathlon, DSBench-Hard, ApexBench và Chartography. Vì vậy, tuyên bố benchmark đa phương thức của DeepSeek mang tính định hướng hơn là bằng chứng cho sự tương đương tổng quát trên mọi khía cạnh thị giác, suy luận hay độ tin cậy.
DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash
| Chiều so sánh | DeepSeek Vision-Exp | DeepSeek V4 Flash | Claude Opus 4.8 | Gemini 3.7 Flash |
|---|---|---|---|---|
| Trạng thái | Thử nghiệm | Beta công khai / tuyến Flash hiện tại | Sẵn sàng rộng rãi | Sẵn sàng rộng rãi |
| Phương thức vào | Văn bản, ảnh | Văn bản | Văn bản, ảnh, tài liệu | Văn bản, ảnh, video, âm thanh, PDF |
| Đầu ra | Văn bản | Văn bản | Văn bản / dữ liệu có cấu trúc / mã | Văn bản |
| Ngữ cảnh | 1M | 1M | Tối đa 1M tùy nền tảng | 1,048,576 |
| Đầu ra tối đa | 384K | 384K | 128K | 65,536 |
| Thế mạnh chính | Agent thị giác chi phí thấp | Agent văn bản thông lượng cao | Agent tự chủ cho tác vụ phức tạp | Đa phương thức rộng, linh hoạt |
| Bài test khởi đầu tốt nhất | Ảnh chụp màn hình, biểu đồ, UI, lập trình trực quan | Tự động hóa mã và văn bản | Tác vụ dài, khó nhất | Media phong phú và workflow công cụ Google |
Chọn Vision-Exp khi cần thêm khả năng thị giác vào vòng lặp agent giá rẻ. Chọn V4 Flash khi mọi đầu vào là văn bản và thông lượng quan trọng hơn hiểu biết thị giác. Opus 4.8 vẫn là lựa chọn ưu tiên năng lực theo so sánh của chính DeepSeek, trong khi Gemini 3.7 Flash là lựa chọn đa phương thức rộng hơn khi video, âm thanh, PDF và công cụ gốc của Google là cần thiết.
What Can DeepSeek-V4-Flash-Vision Do?
- Ảnh chụp màn hình thành mã và rà soát UI — so sánh trang đã render với thiết kế, xác định vấn đề bố cục hoặc khả năng truy cập và tạo hướng dẫn triển khai.
- Agent trình duyệt trực quan — dùng ảnh chụp màn hình làm quan sát khi dữ liệu DOM hoặc accessibility-tree chưa đầy đủ, rồi chọn hành động công cụ tiếp theo.
- Phân tích biểu đồ và dashboard — giải thích xu hướng, xác định bất thường và kết nối số đo hiển thị với workflow văn bản hoặc công cụ lớn hơn.
- Hiểu tài liệu dựa trên ảnh — trích xuất thông tin từ form scan, sơ đồ, slide, bảng và ảnh chụp màn hình trước khi xử lý có cấu trúc.
- Agent lập trình đa phương thức — kết hợp mã nguồn, ảnh lỗi, trạng thái IDE và đầu ra đã render trong một vòng gỡ lỗi.
- Đảm bảo chất lượng trực quan — so sánh ảnh chụp sản phẩm giữa các thiết bị, phát hiện phần tử thiếu và sinh báo cáo lỗi có cấu trúc.
- So sánh đa ảnh — đánh giá chuỗi ảnh chụp màn hình hoặc các thiết kế thay thế trong một yêu cầu, tùy theo giới hạn kích thước và số lượng ảnh.
Ví dụ agent thị giác chính thức từ trang ra mắt DeepSeek (GIF động trong Word). Nguồn: phát hành chính thức của DeepSeek
Pricing and Availability
DeepSeek tính phí token ảnh cùng với token đầu vào văn bản. Bảng giá chính thức sử dụng mức cao điểm và ngoài cao điểm, trong khi trang mô hình của CometAPI công bố một mức giá tuyến hiện tại. Không nên gộp các con số thành một giá chung vì tuyến rẻ nhất thay đổi theo khung giờ của DeepSeek.
| Tuyến / nguồn | Đầu vào cache-hit | Đầu vào cache-miss | Đầu ra | Điều kiện |
|---|---|---|---|---|
| DeepSeek chính thức - ngoài cao điểm | $0.003 | $0.15 | $0.60 | Mọi giờ ngoài khung cao điểm, gồm cuối tuần và ngày lễ công ở Trung Quốc |
| DeepSeek chính thức - cao điểm | $0.006 | $0.30 | $1.20 | 01:00-04:00 và 06:00-10:00 UTC, Thứ Hai–Thứ Sáu, trừ ngày lễ công Trung Quốc |
| CometAPI tuyến hiện tại | Không liệt kê riêng | $0.352 | $1.056 | Giá tuyến thống nhất hiện tại |
Tất cả giá tính theo USD cho mỗi 1M token. Mức Flash hiện tại của DeepSeek là $0.003/$0.15/$0.60 ngoài cao điểm và $0.006/$0.30/$1.20 cao điểm cho lần lượt đầu vào cache-hit, đầu vào cache-miss và đầu ra. CometAPI hiện liệt kê $0.352 mỗi 1M token đầu vào và khoảng $1.06 mỗi 1M token đầu ra cho tuyến tương thích. Ảnh dùng tối đa 1024 token đầu vào mỗi ảnh trên API hiện tại của DeepSeek; luôn kiểm tra lại giá tuyến trực tiếp trước khi lên sản xuất.
Lưu ý giá: giá mô hình có thể thay đổi. Hãy gắn con số với các trang giá trực tiếp và kiểm tra lại ngay trước khi xuất bản hoặc triển khai sản xuất.
How to Use DeepSeek-V4-Flash-Vision with CometAPI
CometAPI hiện liệt kê deepseek-v4-flash-vision-exp qua endpoint /v1/chat/completions tương thích OpenAI, nên ví dụ của CometAPI giữ nguyên ID danh mục đó. Với API trực tiếp của DeepSeek, hãy dùng deepseek-flash.
Step 1: Create an API Key
- Tạo hoặc đăng nhập tài khoản CometAPI.
- Mở bảng điều khiển token API và tạo khóa.
- Lưu khóa vào biến môi trường COMETAPI_KEY. Không bao giờ đặt khóa sản xuất trong mã phía client hoặc commit vào kho nguồn.
export COMETAPI_KEY="your-cometapi-key"
Step 2: Send a Base64 Image with cURL
Base64 hữu ích cho tệp cục bộ và tác vụ phía máy chủ nơi ảnh đã ở trong bộ nhớ. Thay thế placeholder bằng byte ảnh đã mã hóa, không thêm khoảng trắng hoặc xuống dòng.
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Read this dashboard and return the three most important findings."
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,<BASE64_DATA>"
}
}
]
}
],
"max_tokens": 1200
}'
Step 3: Analyze a Local Image with Python
OpenAI Python SDK có thể gọi CometAPI bằng cách đổi base URL. Dùng extra_body cho điều khiển thinking cụ thể của DeepSeek khi SDK của bạn không cung cấp trực tiếp.
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
with open("dashboard.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Analyze the chart. Return JSON with keys: trend, "
"anomalies, evidence, and confidence."
),
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}"
},
},
],
}
],
max_tokens=1500,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
print(response.choices[0].message.content)
Step 4: Use a Public Image URL with JavaScript
URL ảnh giúp JSON nhỏ gọn, nhưng URL phải được mô hình thượng nguồn truy cập công khai. Tránh liên kết tạm thời, riêng tư hoặc yêu cầu xác thực trừ khi ứng dụng của bạn chuyển ảnh sang Base64 trước.
const response = await fetch(
"https://api.cometapi.com/v1/chat/completions",
{
method: "POST",
headers: {
Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "deepseek-v4-flash-vision-exp",
messages: [
{
role: "user",
content: [
{
type: "text",
text: "Identify the UI issue and propose a concrete CSS fix.",
},
{
type: "image_url",
image_url: {
url: "https://example.com/screenshot.png",
},
},
],
},
],
max_tokens: 1200,
}),
}
);
if (!response.ok) {
throw new Error(`CometAPI request failed: ${response.status}`);
}
const data = await response.json();
console.log(data.choices[0].message.content);
Step 5: Send Multiple Images
Đặt nhiều khối image_url trong cùng một tin nhắn user và nói rõ cách gán nhãn ảnh. Nhãn rõ ràng giúp giảm nhầm lẫn tham chiếu giữa các ảnh.
{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Compare Image A and Image B. List every visible regression."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-a.png"}
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-b.png"}
}
]
}
],
"max_tokens": 1800
}
Input Methods and Limits
| Giới hạn | Giá trị chính thức của DeepSeek |
|---|---|
| Định dạng được hỗ trợ | JPEG, PNG, GIF, WebP |
| Độ dài URL ngoài | Tối đa 8.192 ký tự |
| Kích thước thân yêu cầu | 48 MiB |
| Ảnh đơn qua Base64 / URL | 32 MiB |
| Ảnh đơn qua DeepSeek Files API | 64 MiB |
| Số lượng ảnh tối đa mỗi yêu cầu | 600 |
| Tổng kích thước ảnh | 64 MiB nếu không có file_id; tối đa 200 MiB nếu có file_id |
| Kích thước tối đa | 8.192 px mỗi cạnh; 4.096 px khi yêu cầu có 15+ ảnh |
| Vai trò thông điệp ảnh | Chỉ trong tin nhắn user |
API chính thức của DeepSeek cũng hỗ trợ tham chiếu ảnh tái sử dụng qua file_id bằng Files API. Lộ trình nhanh qua CometAPI được ghi ở đây dùng các khối image_url với URL công khai hoặc Base64 data URL. Hãy xác minh tải tệp theo nhà cung cấp và khả năng chuyển tiếp file_id trước khi phụ thuộc vào workflow đó qua tuyến tổng hợp.
How to Prompt the Model Effectively
Một prompt agent thị giác đáng tin cậy nên nêu rõ ảnh là gì, bằng chứng cần kiểm tra, hành động cần thực hiện và hợp đồng đầu ra phải tuân thủ. Những prompt mơ hồ như mô tả ảnh này để lại quá nhiều tự do và khiến kết quả khó xác thực.
- Ngữ cảnh — xác định ảnh chụp màn hình, biểu đồ, tài liệu hoặc giao diện và vai trò của nó trong workflow.
- Nhiệm vụ — chỉ rõ quyết định, chẩn đoán, so sánh hoặc trích xuất quan trọng.
- Bằng chứng — yêu cầu bằng chứng hiển thị, nhãn, tọa độ, giá trị hoặc văn bản UI trích dẫn.
- Ràng buộc — cấm giả định không được hỗ trợ và hướng dẫn cách xử lý chi tiết khó đọc.
- Đầu ra — xác định khóa JSON, checklist, mức độ nghiêm trọng hoặc cấu trúc có thể kiểm tra bằng máy khác.
You are reviewing a web application screenshot.
Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.
Production Best Practices
- Cắt ảnh trước khi tải lên khi văn bản nhỏ hoặc điều khiển quan trọng; trần token ảnh khiến nền không liên quan tiêu tốn độ phân giải thị giác quý giá.
- Thử mức suy luận thinking thay vì luôn bật max cho mọi yêu cầu. OCR đơn giản hoặc phân loại thường cần ít suy luận hơn chẩn đoán UI nhiều bước.
- Yêu cầu bằng chứng trong mọi phát hiện có cấu trúc. Điều này giúp dễ loại bỏ tự tưởng tượng trực quan một cách tự động.
- Tách nhận thức khỏi hành động trong tự động hóa rủi ro cao. Để mô hình mô tả trạng thái, xác thực nó, rồi mới cho lớp công cụ được kiểm soát hành động.
- Bảo vệ URL ảnh vì URL công khai có thể lộ ảnh chụp nhạy cảm. Ưu tiên Base64 phía máy chủ cho dữ liệu riêng tư và áp dụng chính sách lưu trữ của bạn.
- Benchmark end-to-end với cùng quy trình chụp ảnh, prompt, công cụ, retry và tiêu chí thành công như môi trường sản xuất.
- Theo dõi thay đổi thử nghiệm bằng cách ghim prompt và dữ liệu đánh giá. Endpoint -exp có thể thay đổi hành vi nhanh hơn mô hình GA trưởng thành.
- Ghi log ID yêu cầu và lỗi để phân biệt lỗi nhà cung cấp, lỗi mô hình và lỗi phân tích của ứng dụng.
Limitations
Hạn chế quan trọng nhất là tính minh bạch tuyến: tên Vision-Exp cũ có thể vẫn được chấp nhận dù yêu cầu được phục vụ bởi DeepSeek-V4.1-Flash. Ghi log nhà cung cấp, ID mô hình yêu cầu, metadata mô hình trả về và ID yêu cầu; dùng cổng đánh giá rõ ràng trước khi giao quyền hành động tự động.
Hạn chế thứ hai là chi tiết thị giác. Việc thay đổi kích thước tự động và trần 1024 token mỗi ảnh hiện tại giúp chi phí dự đoán được nhưng vẫn có thể làm giảm chi tiết nhỏ, dấu biểu đồ mảnh hoặc phần tử dày đặc. Hãy cắt, lát (tile) hoặc phóng to vùng liên quan và lưu ảnh gốc cho người xem xét.
Mô hình chỉ trả về văn bản. Nó có thể phân tích ảnh và đề xuất mã hoặc hành động có cấu trúc, nhưng không tạo hay chỉnh sửa ảnh. Nó cũng chỉ nhận ảnh trong tin nhắn user, và tài liệu chính thức cho biết đặt nội dung ảnh trong system hoặc assistant sẽ trả về lỗi 400.
Cuối cùng, triển khai cục bộ đòi hỏi hạ tầng nặng. Kho chính thức liệt kê mô hình 305B tham số và cung cấp mã tham chiếu suy luận thay vì runtime nhẹ sẵn sàng. Với đa số đội, đánh giá qua API quản lý là điểm khởi đầu thực tế.
Common Errors and Fixes
| Triệu chứng | Nguyên nhân có thể | Cách khắc phục khuyến nghị |
|---|---|---|
| 400: model does not support image | Sai ID mô hình | Dùng deepseek-v4-flash-vision-exp |
| 400 cho nội dung thông điệp | Ảnh đặt trong system hoặc assistant | Chuyển khối ảnh vào tin nhắn user |
| Lỗi tải ảnh | URL riêng tư, hết hạn hoặc chậm | Dùng Base64 hoặc URL công khai ổn định |
| Bỏ sót chi tiết nhỏ | Thu nhỏ tự động / trần 384 token | Cắt hoặc lát (tile) vùng liên quan |
| Chi phí cao bất ngờ | Đầu ra dài, retry hoặc nhiều lượt | Giới hạn max_tokens và ghi log mức sử dụng mỗi lượt |
| Kết quả agent không nhất quán | Khác biệt harness hoặc trạng thái công cụ | Cố định prompt, công cụ, retry và tiêu chí đánh giá |
FAQ
DeepSeek-V4-Flash-Vision có giống DeepSeek-V4-Flash không?
Không. Vision-Exp thêm đầu vào ảnh và huấn luyện đa phương thức. Tuyến Flash chỉ văn bản không có khả năng nhận thức thị giác tương đương.
Tôi nên dùng ID mô hình nào?
Dùng deepseek-flash trên API trực tiếp của DeepSeek. Trên CometAPI, dùng ID danh mục deepseek-v4-flash-vision-exp khi tuyến này còn khả dụng.
Có thể phân tích nhiều ảnh không?
Có. DeepSeek ghi tài liệu hỗ trợ tối đa 600 ảnh mỗi yêu cầu, tùy theo giới hạn kích thước và kích thước ảnh. Giới hạn thực tế có thể thấp hơn trong ứng dụng vì độ trễ và độ rõ ràng prompt giảm khi tập ảnh lớn.
Một ảnh dùng bao nhiêu token?
Trên API hiện tại của DeepSeek, ảnh được thay đổi kích thước và chuyển thành token với tối đa 1024 token mỗi ảnh. Nhiều ảnh được tính độc lập.
Có hỗ trợ tạo ảnh không?
Không. Mô hình nhận văn bản và ảnh và trả về văn bản.
Đã sẵn sàng cho sản xuất chưa?
Có, nhưng chỉ sau đánh giá theo tuyến cụ thể. Dùng giám sát, fallback, bài kiểm thử chấp nhận theo tác vụ và ghi log tuyến mô hình vì bí danh cũ có thể được định tuyến tới DeepSeek-V4.1-Flash.
Nên dùng CometAPI hay API trực tiếp của DeepSeek?
CometAPI hữu ích khi cần một khóa, một lớp thanh toán và chuyển đổi mô hình dễ dàng. Truy cập trực tiếp DeepSeek có thể phù hợp hơn khi bạn cần tính năng riêng của nhà cung cấp như Files API chính thức hoặc giá ngoài cao điểm. Hãy thử cả hai tuyến với cùng khối lượng công việc.
Conclusion
DeepSeek-V4.1-Flash hiện là tuyến Flash đa phương thức đang hoạt động trên API của DeepSeek. Ngữ cảnh 1M, trần đầu ra 384K, hỗ trợ nhiều giao diện và trần 1024 token mỗi ảnh khiến mô hình hấp dẫn cho hiểu ảnh chụp màn hình, phân tích biểu đồ, lập trình trực quan và tự động hóa trình duyệt hoặc GUI. Kiến trúc Vision-Exp và benchmark đợt ra mắt trong bài viết này được giữ lại như bối cảnh lịch sử.
Quyết định nên dựa trên khối lượng công việc. Bằng chứng benchmark công khai cho mô hình Vision-Exp đã nghỉ chủ yếu do nhà cung cấp công bố; bí danh tuyến hiện tại có thể che khuất mô hình phục vụ yêu cầu, và thay đổi kích thước ảnh vẫn có thể hạn chế tác vụ chi tiết cao. Hãy thử nghiệm đúng tuyến nhà cung cấp trên ảnh đại diện, đo chi phí theo tác vụ thành công thay vì chỉ giá token, và giữ một phương án dự phòng cho đến khi tuyến chứng minh được độ tin cậy trong harness sản xuất của bạn.
