Thông số kỹ thuật
| Hạng mục | DeepSeek-V4-Pro |
|---|---|
| Nhà cung cấp | DeepSeek |
| Tên mô hình API | deepseek-v4-pro |
| URL cơ sở | https://api.deepseek.com and https://api.deepseek.com/anthropic |
| Loại đầu vào | Text |
| Loại đầu ra | Text, tool calls, reasoning output |
| Độ dài ngữ cảnh | 1,000,000 tokens |
| Đầu ra tối đa | 384,000 tokens |
| Chế độ lập luận | Không tư duy, tư duy (mặc định) |
| Thiết lập mặc định agent/lập trình | reasoning_effort có thể được đặt ở mức cao; các yêu cầu agent phức tạp có thể dùng max |
| Tính năng được hỗ trợ | JSON Output, Tool Calls, Chat Prefix Completion (beta), FIM Completion (beta in non-thinking mode) |
| Bản phát hành trọng số mở/cục bộ | 1.6T tổng tham số, 49B tham số được kích hoạt, độ chính xác hỗn hợp FP4 + FP8 |
| Giấy phép (model card) | MIT |
| Model card tham chiếu | DeepSeek-V4-Pro preview on Hugging Face |
DeepSeek-V4-Pro là gì?
DeepSeek-V4-Pro là thành viên mạnh hơn trong gia đình V4 preview của DeepSeek. Model card chính thức mô tả đây là mô hình MoE 1.6T tham số với 49B tham số được kích hoạt và cửa sổ ngữ cảnh một triệu token, hướng tới công việc tri thức dài hạn, sinh mã và các tác vụ agent. Tài liệu API cung cấp qua bề mặt chat-completions tiêu chuẩn của DeepSeek và hỗ trợ cả kiểu SDK của OpenAI và Anthropic.
Tính năng chính
- Million-token context: DeepSeek ghi nhận độ dài ngữ cảnh 1M token, phù hợp với tập tài liệu rất lớn, kho mã, và các phiên agent nhiều bước.
- Hai chế độ lập luận: API hỗ trợ chế độ không tư duy và tư duy; tư duy là mặc định, và tài liệu nêu rằng các yêu cầu agent phức tạp như Claude Code hoặc OpenCode có thể tự động dùng nỗ lực
max. - Hỗ trợ gọi công cụ: Chế độ tư duy của DeepSeek hỗ trợ tool calls, quan trọng cho agent cần tìm kiếm, thao tác tệp, hoặc hàm bên ngoài.
- Hiệu quả ngữ cảnh dài: Model card cho biết V4 dùng thiết kế attention lai với Compressed Sparse Attention và Heavily Compressed Attention để giảm chi phí tính toán ngữ cảnh dài và KV cache so với V3.2. citeturn980363view2
- Tập trung vào lập trình và lập luận: DeepSeek cho biết chế độ lập luận V4-Pro-Max cải thiện các benchmark về mã và thu hẹp nhiều khoảng cách với các mô hình đóng hàng đầu trong các tác vụ lập luận và agent. citeturn980363view2
- Linh hoạt SDK: Có thể truy cập qua chat completions tương thích OpenAI tiêu chuẩn hoặc qua endpoint tương thích Anthropic của DeepSeek cho các quy trình hướng công cụ.
Hiệu năng benchmark
Model card chính thức của DeepSeek báo cáo các kết quả đánh giá sau cho họ model base và bộ so sánh V4-Pro-Max. Trong bảng base-model, V4-Pro đạt điểm cao hơn V3.2-Base trên một số benchmark về tri thức và ngữ cảnh dài, bao gồm MMLU-Pro (73.5 so với 65.5), FACTS Parametric (62.6 so với 27.1), và LongBench-V2 (51.5 so với 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
Cùng model card cũng cho thấy V4-Pro-Max vẫn cạnh tranh với các mô hình tiên phong hàng đầu trên một số tác vụ đã chọn. Ví dụ, model đạt 87.5 trên MMLU-Pro, 57.9 trên SimpleQA-Verified, 90.1 trên GPQA Diamond, và 67.9 trên Terminal Bench 2.0 trong bảng so sánh đã công bố.
DeepSeek-V4-Pro so với DeepSeek-V4-Flash và DeepSeek-V3.2
| Mô hình | Phù hợp nhất | Ngữ cảnh | Ghi chú |
|---|---|---|---|
| DeepSeek-V4-Pro | Lập luận nặng, lập trình, agent, tài liệu lớn | 1M | Mô hình V4 lớn nhất, 49B tham số được kích hoạt, năng lực tổng thể mạnh nhất trong dòng. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Nhanh hơn, nhẹ cho sử dụng chung | 1M | Mô hình nhỏ hơn 284B/13B, vẫn hỗ trợ thinking và tool calls. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Thế hệ trước với ngữ cảnh dài cơ bản | 128K trong tài liệu API trước; V4 dùng thiết kế ngữ cảnh 1M khác | Hữu ích làm điểm tham chiếu cho các cải tiến hiệu quả; model card của V4-Pro báo cáo giảm lớn FLOPs ngữ cảnh dài và KV cache so với V3.2. citeturn321011view1turn980363view2 |
Trường hợp sử dụng tốt nhất
- Trợ lý lập trình ở quy mô kho mã và công cụ tái cấu trúc
- Phân tích và tổng hợp tài liệu dài
- Agent sử dụng công cụ cần lập luận nhiều lượt
- Quy trình hỗ trợ kỹ thuật hưởng lợi từ bộ nhớ dài và đầu ra có cấu trúc
- Các tác vụ tri thức tiếng Trung và đa ngôn ngữ nơi model card cho thấy hiệu năng benchmark mạnh
Cách truy cập và sử dụng Deepseek v4 pro API
Bước 1: Đăng ký lấy API Key
Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng, vui lòng đăng ký trước. Đăng nhập vào CometAPI console. Lấy API key thông tin xác thực truy cập của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.
Bước 2: Gửi yêu cầu tới Deepseek v4 pro API
Chọn endpoint “deepseek-v4-pro” để gửi yêu cầu API và thiết lập phần nội dung yêu cầu. Phương thức và nội dung yêu cầu được lấy từ tài liệu API trên website của chúng tôi. Website cũng cung cấp Apifox để bạn thử nghiệm. Thay thế <YOUR_API_KEY> bằng khóa CometAPI thực từ tài khoản của bạn. Nơi gọi: định dạng Anthropic Messages và định dạng Chat.
Chèn câu hỏi hoặc yêu cầu của bạn vào trường nội dung — đây là nội dung mà mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời được tạo. Sau khi xử lý, API phản hồi trạng thái tác vụ và dữ liệu đầu ra. Bật các tính năng như streaming, lưu đệm prompt, hoặc xử lý ngữ cảnh dài qua các tham số tiêu chuẩn.