Tóm tắt: DeepSeek V4 Pro là mẫu V4 có năng lực cao nhất của DeepSeek cho suy luận, lập trình, phân tích ngữ cảnh dài và quy trình tác nhân. Đây là mô hình Mixture-of-Experts (MoE) với 1.6 nghìn tỷ tham số tổng, 49 tỷ tham số hoạt động, cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 384.000 token, theo thông báo phát hành V4 của DeepSeek và bảng giá chính thức của mô hình.
Kết quả do chính DeepSeek công bố đặt V4 Pro ở 90.1 trên MMLU, 73.5 trên MMLU-Pro, 76.8 trên HumanEval và 51.5 trên LongBench-V2. Kiểm thử độc lập tinh tế hơn: đánh giá của U.S. Center for AI Standards and Innovation cho thấy kết quả mạnh về toán và khoa học, bao gồm 97% trên OTIS-AIME-2025 và 90% trên GPQA-Diamond, nhưng yếu hơn trên các bài kiểm tra an ninh mạng giữ lại, suy luận trừu tượng và kỹ nghệ phần mềm.
Kết luận thực tiễn: dùng DeepSeek V4 Pro khi các tác vụ lập trình khó, suy luận phức tạp, hoặc tài liệu rất dài xứng đáng với chi phí khoảng gấp ba lần mức token uncached của V4 Flash. Bắt đầu với V4 Flash cho khối lượng lớn, sau đó chỉ định tuyến các tác vụ khó hoặc thất bại sang V4 Pro. Với nhà phát triển cần truy cập đa mô hình đơn giản và tiết kiệm chi phí, các nền tảng như CometAPI cung cấp một endpoint tương thích OpenAI hợp nhất cho DeepSeek V4 Pro cùng hàng trăm mô hình khác.
Những điểm chính
- Kiến trúc & Quy mô: MoE 1.6T tổng/49B hoạt động với cơ chế Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) lai, giảm FLOPs suy luận mỗi token xuống còn ~27% và KV cache xuống ~10% so với DeepSeek-V3.2 trước đó ở ngữ cảnh 1M.
- Ngữ cảnh & Hiệu quả: Ngữ cảnh gốc 1M token và đầu ra tối đa đến 384K token, giúp các agent tầm nhìn dài và phân tích toàn bộ codebase trở nên khả thi.
- Benchmarks (V4-Pro-Max): 80.6% SWE-bench Verified, 93.5% LiveCodeBench, xếp hạng Codeforces 3206, 90.1% GPQA Diamond, điểm agent mạnh (ví dụ, MCPAtlas Public ~73.6). Giá chính thức của DeepSeek là $0.435/M token đầu vào uncached, $0.003625/M token đầu vào cached, và $0.87/M token đầu ra.
- Mô hình chỉ hỗ trợ văn bản. Phần mở rộng Copilot có thể proxy hình ảnh qua mô hình khác, nhưng điều đó không khiến V4 Pro trở thành mô hình đa phương thức gốc.
- DeepSeek hỗ trợ OpenAI Chat Completions, triển khai Responses API, giao diện tương thích Anthropic, xuất JSON, gọi công cụ và điều khiển thinking.
- CAISI đo V4 Pro ở mức 74% trên SWE-bench Verified, 90% trên GPQA Diamond và 97% trên OTIS-AIME-2025, nhưng chỉ 44% trên PortBench và 46% trên ARC-AGI-2 bán riêng.
Thông số kỹ thuật đã xác nhận
| Specification | DeepSeek V4 Pro |
|---|---|
| API model ID | deepseek-v4-pro |
| Current documented version | DeepSeek-V4-Pro-0813 |
| Architecture size | 1.6T total parameters; 49B active |
| Context window | 1M tokens |
| Maximum output | 384K tokens |
| Input modality | Text |
| Reasoning | Thinking and non-thinking modes |
| Thinking effort | high and documented for the official interfacemax |
| Structured output | JSON output supported |
| Agent features | Tool calls and Responses API supported |
| API compatibility | OpenAI Chat Completions and Anthropic-compatible API |
| Open weights | Yes |
| Default account concurrency | 500 concurrent V4 Pro requests |
DeepSeek V4 Pro là gì?
DeepSeek V4 Pro (thường có model ID là deepseek-v4-pro) là hạng năng lực cao của dòng DeepSeek-V4, do phòng thí nghiệm AI DeepSeek phát triển. Bản xem trước ra mắt ngày 24 tháng 4, 2026, cùng bản nhẹ hơn DeepSeek-V4-Flash, và chuyển sang khả dụng rộng rãi giữa tháng 8, 2026 dưới phiên bản DeepSeek-V4-Pro-0813.
Được xây dựng dưới dạng mô hình Mixture-of-Experts, mỗi token chỉ kích hoạt một phần tham số (49B trong tổng 1.6T). Thiết kế này, cùng các đổi mới trong cơ chế attention, mang lại trí tuệ cấp đầu bảng trong khi vẫn hiệu quả suy luận—đặc biệt ở độ dài ngữ cảnh cực lớn. Mô hình chỉ hỗ trợ văn bản (đa phương thức vẫn đang phát triển), cấp phép MIT, và có trọng số mở trên Hugging Face.
Định vị chính từ DeepSeek: V4-Pro nhắm tới năng lực agent nâng cao, kiến thức thế giới phong phú (dẫn đầu trong nhóm mô hình mở, chỉ sau một số biến thể Gemini), và suy luận đẳng cấp thế giới ở toán, STEM và lập trình, sánh với các hệ thống đóng hàng đầu.
Mô hình hỗ trợ hai chế độ—thinking (chain-of-thought/lập luận mở rộng, mặc định trong nhiều cấu hình) và non-thinking (phản hồi nhanh hơn)—cùng các mức nỗ lực suy luận có thể cấu hình (bao gồm mức tối đa “V4-Pro-Max”). Tương thích API với cả OpenAI Chat Completions và định dạng Messages của Anthropic, cộng thêm gọi công cụ, xuất JSON có cấu trúc, và các tính năng beta như fill-in-the-middle (FIM) completion (chế độ non-thinking) và tiếp tục tiền tố hội thoại.
Trạng thái phát hành DeepSeek V4 Pro
- 24 tháng 4, 2026: DeepSeek công bố bản V4 Preview, trọng số mở và truy cập API cho V4 Pro và V4 Flash.
- 24 tháng 7, 2026: DeepSeek ngừng dùng các tên API cũ sau giai đoạn di trú ba tháng.
deepseek-chatdeepseek-reasoner - 13 tháng 8, 2026: Bí danh hiện tại trỏ đến phiên bản mô hình V4-Pro-0813, theo bảng mô hình trực tiếp của DeepSeek.
deepseek-v4-pro
V4 Pro hoạt động như thế nào?
Cốt lõi, V4 Pro là mô hình Mixture-of-Experts (MoE) với 1.6 nghìn tỷ tham số tổng và 49 tỷ tham số kích hoạt cho mỗi lần truyền tiến. Thiết kế này mang lại dung lượng cao trong khi vẫn kiểm soát được chi phí suy luận. Cả V4 Pro và V4 Flash đều hỗ trợ cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 384.000 token. Các mô hình ra mắt chỉ hỗ trợ văn bản (khả năng đa phương thức được ghi nhận là đang phát triển trong tài liệu đầu) và phát hành dưới giấy phép MIT, với trọng số mở trên Hugging Face.
Các đổi mới kiến trúc chính gồm:
- Cơ chế Attention lai: Kết hợp Compressed Sparse Attention (CSA) và Heavily Compressed Attention (HCA). Ở mức 1M token, DeepSeek-V4-Pro chỉ cần khoảng 27% FLOPs suy luận một token và 10% bộ nhớ đệm KV so với DeepSeek-V3.2. Điều này khiến việc dùng ngữ cảnh 1 triệu token thường xuyên trở nên thực tế hơn.
- Manifold-Constrained Hyper-Connections (mHC): Tăng cường kết nối dư để cải thiện ổn định huấn luyện và truyền tín hiệu.
- Trình tối ưu Muon: Dùng trong tiền huấn luyện để hội tụ nhanh hơn và ổn định hơn.
- Tiền huấn luyện trên hơn 32 nghìn tỷ token chất lượng cao, tiếp đó là pipeline hậu huấn luyện tinh vi (SFT theo miền + RL, rồi chưng cất on-policy).
Những thay đổi này cho phép dùng thường xuyên ngữ cảnh 1M token cho các tác vụ agent tầm nhìn dài, phân tích toàn bộ codebase, hoặc bộ tài liệu lớn mà không chịu phạt nặng về bộ nhớ và tính toán như trước.
Giá API DeepSeek V4 Pro
DeepSeek tính phí riêng cho đầu vào cache-miss, đầu vào cache-hit và đầu ra sinh thành. Giá niêm yết theo một triệu token.
| Model | Cache-miss input | Cache-hit input | Output | Context |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 | 1M tokens |
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 | 1M tokens |
Đây là mức giá trên trang giá API chính thức của DeepSeek tại thời điểm công bố. DeepSeek cảnh báo sẽ tăng giá API tổng thể trong tương lai, nhưng chưa công bố mức mới hay ngày hiệu lực. Vì vậy, ngân sách sản xuất nên đọc giá động thay vì hard-code vào dự báo dài hạn.
Ví dụ chi phí thực tế với DeepSeek V4 Pro
Công thức cơ bản:
cost = uncached input × $0.435/M + cached input × $0.003625/M + output × $0.87/M
| Workload | Token assumptions | Approximate V4 Pro cost |
|---|---|---|
| Short coding request | 10,000 input + 2,000 output | $0.00609 |
| Repository-level analysis | 100,000 input + 20,000 output | $0.0609 |
| Very long document analysis | 1M input + 100,000 output | $0.522 |
| Cached long document analysis | 1M cache-hit input + 100,000 output | $0.090625 |
| 100,000 production calls | 20,000 input + 4,000 output per call | $1,218 |
So sánh, kịch bản 100.000 cuộc gọi cuối cùng sẽ tốn khoảng $392 trên V4 Flash, giả định toàn bộ đầu vào là cache-miss. Đó là chênh lệch $826, khiến chiến lược định tuyến trở nên quan trọng về kinh tế ngay cả khi cả hai mô hình có vẻ rẻ trên mỗi cuộc gọi.
Các ví dụ này là ước tính chi phí token, không phải ngân sách hạ tầng đầy đủ. Chúng không tính retry, lượt agent thất bại, lặp lại kết quả công cụ, kiểm duyệt, lưu trữ vector, API tìm kiếm, quan sát, và bất kỳ phí nền tảng nào khác.
Vì sao định giá cache-hit quan trọng
Mức giá đầu vào cache-hit của V4 Pro thấp hơn khoảng 120 lần so với đầu vào cache-miss. Tiết kiệm lớn nhất xảy ra khi yêu cầu nhiều lần dùng cùng một tiền tố—ví dụ:
- Một system prompt và sổ tay chính sách ổn định
- Một snapshot repository dùng chung
- Schema công cụ tiêu chuẩn
- Danh mục sản phẩm dài
- Phân tích lặp lại cùng hợp đồng hay báo cáo
Caching không làm đầu ra sinh thành rẻ hơn. Một vết suy luận dài hay phần hoàn thành dài dòng vẫn bị tính phí theo mức đầu ra. Nhà phát triển nên theo dõi trạng thái cache của đầu vào và độ dài đầu ra riêng rẽ thay vì chỉ dựa vào chi phí trung bình mỗi yêu cầu.
Cách truy cập DeepSeek V4 Pro (bao gồm qua CometAPI)
Phương thức truy cập:
- API chính thức của DeepSeek (
https://api.deepseek.com) — dùng modeldeepseek-v4-pro. - Trọng số mở trên Hugging Face để triển khai cục bộ hoặc riêng.
- Các nền tảng tổng hợp và serverless (OpenRouter, Together, DeepInfra, v.v.).
Khuyến nghị cho người dùng CometAPI: CometAPI cung cấp truy cập thuận tiện đến DeepSeek V4 Pro (và V4 Flash) qua một endpoint tương thích OpenAI duy nhất (https://api.cometapi.com/v1). Bạn được lợi từ hóa đơn hợp nhất cho 500+ mô hình, mức giá cạnh tranh (thường có tiết kiệm ở cấp nền tảng), bảng điều khiển sử dụng thời gian thực, và không cần đổi mã ngoài URL cơ sở và khóa khi di chuyển từ SDK của OpenAI. Điều này đặc biệt hữu ích cho indie developer và các đội muốn A/B test V4 Pro so với Claude, GPT, Gemini hoặc mô hình khác mà không cần quản lý nhiều tài khoản.
Ai nên dùng DeepSeek V4 Pro?
V4 Pro rất đáng thử cho:
- tổng hợp tài liệu lớn với trích dẫn có thể truy vết;
- lập trình và review ở quy mô repository;
- agent chạy dài với ngữ cảnh lặp lại;
- hỗ trợ toán học và STEM với bước xác minh;
- tạo báo cáo hay tài liệu có cấu trúc;
- khối lượng suy luận lớn khi chi phí token trực tiếp là ràng buộc chính;
- đội ngũ quan tâm đến lộ trình triển khai trọng số mở trong tương lai.
V4 Flash có thể là lựa chọn khởi đầu tốt hơn cho tác vụ agent đơn giản, phân loại, trích xuất, định tuyến, hoặc công việc nhạy độ trễ. Chính DeepSeek nói Flash tiệm cận Pro ở suy luận và ngang bằng trên các đánh giá agent đơn giản trong khi dùng mô hình hoạt động nhỏ hơn.
V4 Pro kém phù hợp làm mặc định khi bắt buộc cần hiểu hình ảnh gốc, khi chính sách mua sắm cấm phụ thuộc trạng thái preview, hoặc khi tổ chức không thể xây dựng cơ chế đánh giá và xác minh. Hướng dẫn tích hợp GitHub Copilot chính thức nêu rõ V4 chỉ hỗ trợ văn bản; xử lý ảnh trong phần mở rộng đó do một mô hình proxy riêng đảm nhận.
So sánh DeepSeek V4 Pro và V4 Flash
| Decision factor | V4 Pro | V4 Flash |
|---|---|---|
| Primary role | Lý luận khó, lập trình, agent | Khối lượng lớn và nhạy độ trễ |
| Total/active parameters | 1.6T / 49B | 284B / 13B |
| Context | 1M | 1M |
| Maximum output | 384K | 384K |
| Uncached input price | $0.435/M | $0.14/M |
| Output price | $0.87/M | $0.28/M |
| Concurrency | 500 | 2,500 |
| Recommended use | Tầng leo thang | Tầng định tuyến mặc định |
Một kiến trúc hợp lý bắt đầu với Flash cho trích xuất, tóm tắt, phân loại, chat cơ bản và lập trình đơn giản. Nâng cấp sang Pro khi Flash trượt bộ xác thực, báo mức tự tin thấp, gặp thay đổi repository phức tạp, hoặc cần lập kế hoạch sâu hơn.
Cách tiếp cận này phản ánh một nguyên tắc kinh tế rộng hơn: chọn mô hình theo giá trị mang lại, không chỉ theo trí thông minh lý thuyết tối đa.
Kết luận và Khuyến nghị
DeepSeek V4 Pro là bước tiến đáng kể cho AI trọng số mở: năng lực cận biên giới trong lập trình và suy luận, ngữ cảnh 1 triệu token thực dụng nhờ đổi mới kiến trúc, và kinh tế học khiến trí tuệ cao cấp trở nên dễ tiếp cận. Kết hợp trọng số mở (MIT), điểm agent mạnh, và mức giá chính thức quyết liệt giúp củng cố vị thế của DeepSeek trong bức tranh AI năm 2026.
Với đa số nhà phát triển và đội ngũ, bắt đầu bằng API chính thức hoặc nhà tổng hợp đáng tin là con đường nhanh nhất. CometAPI nổi bật như khuyến nghị thực dụng cho truy cập tinh gọn—cung cấp DeepSeek V4 Pro (và Flash) trong một nền tảng đa mô hình rộng hơn giúp giảm ma sát vận hành. Dù bạn xây dựng agent lập trình, phân tích tài liệu dài, hay tối ưu chi phí suy luận, V4 Pro xứng đáng được đánh giá nghiêm túc.
Nguồn & Tài liệu tham khảo
- DeepSeek V4 Preview Release: https://api-docs.deepseek.com/news/news260424/
- DeepSeek Official Pricing: https://api-docs.deepseek.com/quick_start/pricing
- Hugging Face DeepSeek-V4-Pro: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- Báo cáo kỹ thuật (arXiv/Hugging Face): bài báo DeepSeek-V4
- Bài viết của Artificial Analysis và các báo cáo Intelligence Index
- Các đánh giá đương thời và kiểm định độc lập (2026)
- CometAPI các mô hình DeepSeek và tài liệu: https://www.cometapi.com/ và các trang mô hình liên quan
Tổng quan này dựa trên thông tin công khai tính đến tháng 8, 2026. Luôn xác minh nguồn chính thức mới nhất trước khi triển khai sản xuất.
