TL;DR
DeepSeek V4.1 Flash thay thế thế hệ V4 Flash trước đó bằng một mô hình MoE mã hóa–giải mã nhân quả với 552B tham số, khả năng hiểu hình ảnh nguyên bản, cửa sổ ngữ cảnh 1M token và chi phí phục vụ thấp hơn đáng kể. Trong so sánh chính thức của DeepSeek, nó cải thiện hầu hết các benchmark về coding, terminal, bảo mật và agent so với V4 Pro 0813, trong khi V4 Pro vẫn dẫn trước trên GPQA Diamond và HLE không dùng công cụ.
Trang định giá API hiện tại của DeepSeek một lần nữa liệt kê deepseek-flash và deepseek-v4-pro là các tuyến riêng biệt, lần lượt phục vụ V4.1 Flash và V4-Pro-0813. Chúng có mức giá, giới hạn đồng thời và hỗ trợ thị giác khác nhau. Do đó, các tích hợp mới nên chọn ID model phù hợp với khối công việc dự định thay vì dựa vào hành vi alias lịch sử.
Key Takeaways
- V4.1 Flash và V4 Pro hiện là hai lựa chọn API chính thức khác nhau: dùng deepseek-flash cho V4.1 Flash và deepseek-v4-pro cho V4-Pro-0813.
- Các mức tăng lớn nhất xuất hiện ở tác vụ terminal, agent lập trình, tự động hóa và thực thi định hướng bảo mật—không phải ở mọi benchmark suy luận closed-book.
- V4.1 Flash rẻ hơn đáng kể so với tuyến V4 Pro hiện tại trên đầu vào cache-hit, đầu vào cache-miss và token đầu ra.
- V4.1 Flash bổ sung thị giác nguyên bản, nâng mức đồng thời được ghi nhận từ 500 lên 2.500 và giảm lưu trữ KV-cache toàn cục xuống 890 byte mỗi token.
- Việc di trú nên được thực hiện rõ ràng ngay cả khi alias vẫn hoạt động: cập nhật ID model, xác thực hành vi thinking và non-thinking, kiểm thử lại lời gọi công cụ và đầu vào hình ảnh, và theo dõi mức sử dụng token cùng độ trễ.
Current routing note: the official pricing page identifies deepseek-v4-pro as V4-Pro-0813, separate from V4.1 Flash.
How Do DeepSeek V4.1 Flash and V4 Pro Specifications Compare?
Kiến trúc đã thay đổi từ một thiết kế MoE thưa cực lớn ở V4 Pro sang thiết kế mã hóa–giải mã nhân quả bất đối xứng ở V4.1 Flash. Mô hình mới kích hoạt ít tham số hơn khi xử lý đầu vào so với khi sinh đầu ra, điều này giúp giảm chi phí prefill trong khi vẫn giữ năng lực sinh mạnh.
| Specification | DeepSeek V4.1 Flash | DeepSeek V4 Pro 0813 |
|---|---|---|
| Architecture | Causal encoder–decoder MoE | Sparse MoE |
| Total parameters Backbone parameters / repository weight count | 552B backbone parameters; Hugging Face lists 763B model size | 1.6T backbone parameters; Hugging Face lists about 1.7T model size |
| Active parameters | 8B for input; 16B for output | 49B per token |
| Context window | 1M tokens | 1M tokens |
| Maximum output | 384K tokens | 384K tokens |
| Thinking and non-thinking modes | Supported | Supported |
| Native image understanding | Supported | Not supported |
| Documented concurrency | 2,500 | 500 on the current configuration |
| Current official API status | Active as deepseek-flash | Active as deepseek-v4-pro (V4-Pro-0813) |
Parameter-count clarification: Thẻ mô hình V4.1 Flash của DeepSeek mô tả 552B tham số backbone, trong khi repository trên Hugging Face báo kích thước mô hình 763B. Những con số này mô tả các phạm vi tính toán khác nhau và không nên được trình bày như các tổng số có thể hoán đổi cho nhau.
Output-length clarification: thẻ mô hình V4.1 Flash khuyến nghị max_tokens ≥ 256K cho suy luận cục bộ, trong khi trang định giá API hiện tại của DeepSeek nêu rõ mức tối đa đầu ra 384K cho cả hai model API. Một thiết lập suy luận được khuyến nghị không giống với một giới hạn tối đa do API áp đặt.
Where Does DeepSeek V4.1 Flash Improve on V4 Pro?
Bảng benchmark chính thức của DeepSeek cho thấy các cải thiện rõ nhất ở các khối công việc nhiều thực thi. Cột phần trăm dưới đây được tính từ điểm đã công bố; các so sánh phần trăm bị lược bỏ khi chỉ số là xếp hạng hoặc khi phần trăm đơn giản có thể gây hiểu nhầm.
| Benchmark | V4.1 Flash | V4 Pro 0813 | Difference | Interpretation |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 | +2.7 points; +3.1% | Thực thi terminal đáng tin cậy hơn |
| Terminal-Bench 3.0 | 30.0 | 11.8 | +18.2 points; +154.2% | Tăng lớn ở tác vụ terminal khó hơn |
| Terminal-Bench 4.0 | 31.2 | 12.4 | +18.8 points; +151.6% | Tăng lớn ở tác vụ terminal mới hơn |
| DeepSWE v1.1 | 74.2 | 62.7 | +11.5 points; +18.3% | Công việc phần mềm cấp repository mạnh hơn |
| ProgramBench | 20.3 | 15.5 | +4.8 points; +31.0% | Cải thiện tổng hợp chương trình |
| NL2Repo-Bench | 64.0 | 61.5 | +2.5 points; +4.1% | Tốt hơn ở chuyển NL thành repository |
| CyberGym | 88.1 | 83.3 | +4.8 points; +5.8% | Thực thi tác vụ an ninh mạng mạnh hơn |
| HLE with tools | 63.9 | 60.0 | +3.9 points; +6.5% | Lý luận có hỗ trợ công cụ tốt hơn |
| Automation-Bench | 54.8 | 43.2 | +11.6 points; +26.9% | Tăng đáng kể về tự động hóa |
| Agents’ Last Exam | 31.8 | 25.7 | +6.1 points; +23.7% | Hành vi agent tổng quát mạnh hơn |
| Codeforces rating | 3,471 | 3,348 | +123 rating points | Cải thiện lập trình thi đấu |
| GPQA Diamond | 90.9 | 92.4 | −1.5 points | V4 Pro vẫn có lợi thế |
| HLE without tools | 36.8; 39.1 on text subset | 42.7 on text subset | −3.6 points on comparable text subset | V4 Pro vẫn có lợi thế |
Kết quả là đa chiều: V4.1 Flash vượt trội dứt khoát cho agent lập trình, thao tác terminal, tự động hóa, tác vụ bảo mật, sử dụng công cụ, thị giác, mức đồng thời và chi phí. Lợi thế còn lại của V4 Pro tập trung vào một số bài kiểm tra suy luận thuần. Do đó, khối công việc nên được đánh giá dựa trên tổ hợp tác vụ thay vì một tuyên bố tổng hợp đơn lẻ.
Why Is DeepSeek V4.1 Flash More Efficient Than V4 Pro?
Tính toán đầu vào và đầu ra bất đối xứng
V4.1 Flash kích hoạt 8B tham số khi xử lý đầu vào và 16B khi sinh đầu ra. Thiết kế bất đối xứng này nhắm tới nhu cầu tính toán khác nhau của prefill và decoding, giảm chi phí mà không buộc cả hai giai đoạn dùng cùng một ngân sách tham số kích hoạt.
Dấu chân KV-cache nhỏ hơn
DeepSeek báo cáo rằng V4.1 Flash dùng một phần tư HBM và một phần tám dung lượng SSD cho KV cache so với thế hệ trước. Biểu đồ công bố đặt KV cache toàn cục ở mức 890 byte mỗi token, so với 3.514 byte cho V4 Flash.

Đầu vào đa phương thức native và mức đồng thời cao hơn
V4.1 Flash có thể diễn giải hình ảnh nguyên bản và công bố giới hạn đồng thời 2.500, gấp năm lần con số 500 của V4 Pro hiện tại. Những thay đổi này quan trọng cho agent dựa trên ảnh chụp màn hình, trích xuất tài liệu, khắc phục sự cố bằng hình ảnh và hàng đợi sản xuất khối lượng lớn.
What Does DeepSeek V4.1 Flash Cost Compared with V4 Pro?
Biểu giá API chính thức hiện tại định giá hai tuyến riêng biệt. Trên mỗi 1M token, V4.1 Flash có chi phí $0.003/$0.006 cho đầu vào cache-hit, $0.15/$0.30 cho đầu vào cache-miss và $0.60/$1.20 cho đầu ra (off-peak/peak). V4 Pro lần lượt có chi phí $0.022/$0.044, $0.66/$1.32 và $1.98/$3.96. Giá có thể thay đổi, nên ngân sách production nên tham chiếu trang giá trực tiếp.
How Should You Migrate from DeepSeek V4 Pro or V4 Flash to V4.1 Flash?
Use the explicit production model ID
Dùng deepseek-flash khi bạn muốn V4.1 Flash. Các tên cũ deepseek-v4-flash và deepseek-v4-flash-vision-exp vẫn được định tuyến tới V4.1 Flash và được tính giá theo Flash mới, nhưng đặt tên rõ ràng giúp việc giám sát và hoàn nguyên trong tương lai dễ kiểm toán hơn. Dùng deepseek-v4-pro khi bạn cố ý muốn backend V4-Pro-0813 hiện đang được liệt kê.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # or "deepseek-v4-pro"
messages=[{"role": "user", "content": "Review this migration plan."}],
)
print(response.choices[0].message.content)
Retest behavior, not only endpoint compatibility
- Chạy các prompt đại diện ở cả chế độ thinking và non-thinking; so sánh tỷ lệ thành công, số token và độ trễ.
- Kiểm thử lại schema công cụ, đầu ra JSON, hành vi Responses API, prefix completion và FIM nếu có dùng.
- Thêm kiểm thử đầu vào hình ảnh nếu sản phẩm sẽ dùng khả năng thị giác native mới.
- Chuẩn hóa lại ngân sách sử dụng mức off-peak và peak thay vì lấy giả định từ V4 Pro.
- Theo dõi tỷ lệ hit của prompt cache vì nó có thể chi phối chi phí đầu vào ở quy mô lớn.
Choose the intended backend explicitly
Tuyến deepseek-v4-pro hiện tại chọn V4-Pro-0813. Các nhóm nên ghi lại phiên bản model được phân giải, ngày đánh giá, bộ prompt và khung thời gian giá để so sánh vẫn có thể tái lập nếu định tuyến thay đổi lần nữa.
Which Workloads Fit DeepSeek V4.1 Flash Best?
| Workload | Recommended choice | Reason |
|---|---|---|
| Coding agents and repository maintenance | V4.1 Flash | Điểm cao hơn trên DeepSWE, ProgramBench, NL2Repo và terminal |
| Tool-driven automation | V4.1 Flash | Điểm cao hơn trên Automation-Bench, HLE-with-tools và agent |
| Image-aware assistants | V4.1 Flash | Hiểu hình ảnh nguyên bản |
| High-throughput or cost-sensitive serving | V4.1 Flash | Mức đồng thời cao hơn và giá token thấp hơn nhiều |
| Historical V4 Pro reproductionCurrent V4 Pro access and evaluation | V4 Pro | Tuyến chính thức hiện nhận diện V4-Pro-0813 |
| Pure closed-book reasoning | Validate on domain data | V4 Pro vẫn cao hơn trên GPQA Diamond và HLE không dùng công cụ |
DeepSeek V4.1 Flash vs V4 Pro FAQ
Is DeepSeek V4.1 Flash better than V4 Pro?
Với đa số khía cạnh production—agent lập trình, tác vụ terminal, tự động hóa, dùng công cụ, thị giác, thông lượng và giá—có. V4 Pro vẫn có điểm công bố cao hơn trên GPQA Diamond và HLE không dùng công cụ, nên các khối công việc suy luận thuần túy cần được kiểm thử bằng prompt theo miền.
Can I still call deepseek-v4-pro?
Có. Trang API chính thức hiện liệt kê deepseek-v4-pro là V4-Pro-0813, với mức giá và giới hạn đồng thời riêng.
What model ID should a new integration use?
Dùng deepseek-flash cho V4.1 Flash, hoặc deepseek-v4-pro cho V4-Pro-0813. Đừng coi hai ID này là alias.
Do old V4 Flash model IDs still work?
DeepSeek cho biết các yêu cầu deepseek-v4-flash và deepseek-v4-flash-vision-exp được tự động định tuyến tới V4.1 Flash và tính giá theo Flash mới. Tuy vậy, nên cập nhật ID model đã cấu hình để rõ ràng.
Does DeepSeek V4.1 Flash support images?
Có. Hiểu hình ảnh nguyên bản là một phần của V4.1 Flash; API V4 Pro lịch sử không cung cấp khả năng này.
Is DeepSeek V4.1 Flash cheaper than the current V4 Pro?
Có. Biểu giá chính thức hiện liệt kê chi phí đầu vào cache-hit, đầu vào cache-miss và đầu ra của V4.1 Flash thấp hơn so với V4 Pro.
Should I expect identical outputs after migration?
Không. Khả năng tương thích endpoint không đảm bảo cùng đường suy luận, lựa chọn công cụ, sử dụng token hoặc định dạng. Hãy chạy lại các đánh giá production trước khi dựa vào các ngưỡng trước đây.
