Thông số kỹ thuật của DeepSeek-V4-Flash
| Mục | Chi tiết |
|---|---|
| Mô hình | DeepSeek-V4-Flash |
| Nhà cung cấp | DeepSeek |
| Dòng | Dòng xem trước DeepSeek-V4 |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Tổng số tham số | 284B |
| Tham số được kích hoạt | 13B |
| Độ dài ngữ cảnh | 1,000,000 token |
| Độ chính xác | FP4 + FP8 kết hợp |
| Chế độ suy luận | Non-think, Think, Think Max |
| Trạng thái phát hành | Mô hình xem trước |
| Giấy phép | MIT License |
DeepSeek-V4-Flash là gì?
DeepSeek-V4-Flash là mô hình xem trước tập trung vào hiệu năng trong dòng V4 của DeepSeek. Mô hình được xây dựng theo kiến trúc Mixture-of-Experts với lượng tham số kích hoạt tương đối nhỏ so với quy mô tổng, giúp duy trì độ phản hồi nhanh trong khi vẫn hỗ trợ cửa sổ ngữ cảnh rất lớn 1M-token.
Tính năng chính của DeepSeek-V4-Flash
- Ngữ cảnh một triệu token: Mô hình hỗ trợ cửa sổ ngữ cảnh 1,000,000 token, phù hợp cho tài liệu rất dài, codebase lớn và các phiên agent nhiều bước.
- Thiết kế MoE ưu tiên hiệu năng: Sử dụng 284B tổng tham số nhưng chỉ 13B tham số được kích hoạt cho mỗi yêu cầu, nhằm suy luận nhanh hơn và hiệu quả hơn.
- Ba chế độ suy luận: Non-think, Think và Think Max cho phép đánh đổi tốc độ để có suy luận sâu hơn khi tác vụ trở nên khó hơn.
- Kiến trúc ngữ cảnh dài mạnh mẽ: DeepSeek cho biết dòng V4 kết hợp Compressed Sparse Attention và Heavily Compressed Attention để cải thiện hiệu quả với ngữ cảnh dài.
- Khả năng lập trình và hành vi agent cạnh tranh: Model card báo cáo kết quả mạnh trên các benchmark về lập trình và agent, bao gồm HumanEval, SWE Verified, Terminal Bench 2.0 và BrowseComp.
- Mở trọng số và triển khai cục bộ: Bản phát hành bao gồm trọng số mô hình, hướng dẫn suy luận cục bộ và MIT License, giúp tự lưu trữ và thử nghiệm trở nên khả thi.
Hiệu năng benchmark của DeepSeek-V4-Flash
Một số kết quả chọn lọc từ model card chính thức cho thấy DeepSeek-V4-Flash cải thiện so với DeepSeek-V3.2-Base trên nhiều benchmark cốt lõi:
| Benchmark | DeepSeek-V3.2-Base | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base |
|---|---|---|---|
| AGIEval (EM) | 80.1 | 82.6 | 83.1 |
| MMLU (EM) | 87.8 | 88.7 | 90.1 |
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
Trong bảng về suy luận và agent, biến thể Flash cũng đạt kết quả ổn định trên các tác vụ terminal và phần mềm, với Flash Max đạt 56.9 trên Terminal Bench 2.0 và 79.0 trên SWE Verified, dù vẫn kém mẫu Pro lớn hơn ở các tác vụ khó nhất đòi hỏi nhiều kiến thức và mang tính agent cao.
DeepSeek-V4-Flash so với DeepSeek-V4-Pro và DeepSeek-V3.2
| Mô hình | Phù hợp nhất | Đánh đổi |
|---|---|---|
| DeepSeek-V4-Flash | Công việc nhanh, ngữ cảnh dài, trợ lý lập trình và luồng agent thông lượng cao | Hơi kém Pro ở kiến thức thuần và các tác vụ agent phức tạp nhất |
| DeepSeek-V4-Pro | Tác vụ năng lực cao nhất, suy luận sâu hơn và quy trình agent khó | Nặng hơn và ít thiên về hiệu năng so với Flash |
| DeepSeek-V3.2 | Chuẩn cũ để so sánh và lên kế hoạch di trú | Hiệu năng benchmark thấp hơn V4-Flash theo bảng chính thức |
Trường hợp sử dụng điển hình cho DeepSeek-V4-Flash
- Phân tích tài liệu dài cho hợp đồng, gói nghiên cứu, kho tri thức hỗ trợ và wiki nội bộ.
- Trợ lý lập trình cần kiểm tra repo lớn, làm theo hướng dẫn xuyên suốt nhiều tệp và duy trì ngữ cảnh.
- Quy trình agent nơi mô hình cần suy luận, gọi công cụ và lặp mà không đánh mất mạch.
- Hệ thống chat doanh nghiệp hưởng lợi từ cửa sổ ngữ cảnh rất lớn và triển khai ít rào cản.
- Triển khai thử nghiệm cục bộ cho các nhóm muốn đánh giá hành vi DeepSeek-V4 trước khi gia cố sản xuất.
Cách truy cập và sử dụng Deepseek v4 Flash API
Bước 1: Đăng ký khóa API
Đăng nhập vào cometapi.com. Nếu bạn chưa phải là người dùng của chúng tôi, vui lòng đăng ký trước. Đăng nhập vào CometAPI console. Lấy khóa API thông tin xác thực truy cập của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, nhận khóa token: sk-xxxxx và gửi.
Bước 2: Gửi yêu cầu tới deepseek v4 flash API
Chọn endpoint “deepseek-v4-flash” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức và phần thân yêu cầu được lấy từ tài liệu API trên website của chúng tôi. Website của chúng tôi cũng cung cấp kiểm thử Apifox để thuận tiện cho bạn. Thay thế <YOUR_API_KEY> bằng khóa CometAPI thực tế từ tài khoản của bạn. Nơi gọi: định dạng Anthropic Messages và định dạng Chat.
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là nội dung mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời được tạo. Sau khi xử lý, API phản hồi với trạng thái tác vụ và dữ liệu đầu ra. Bật các tính năng như streaming, bộ nhớ đệm prompt hoặc xử lý ngữ cảnh dài thông qua các tham số tiêu chuẩn.