TLDR: DeepSeek-V4-Pro-0813 là bản phát hành GA (general-availability) của mô hình MoE chủ lực 1.6T tham số (49B active) từ DeepSeek. Bản này mang lại bước nhảy lớn về năng lực tác tử so với bản preview tháng 4/2026, hỗ trợ cửa sổ ngữ cảnh 1M token, tối đa 384K token đầu ra, ba mức nỗ lực tư duy (low/high/max), tương thích nguyên bản với OpenAI Responses API, gọi công cụ (tool calling), JSON mode, và cả endpoint tương thích OpenAI lẫn Anthropic.
Giá chính thức bắt đầu ở mức $0.435 / $0.87 trên mỗi 1M token đầu vào/đầu ra (cache miss), với khung giá peak/off-peak áp dụng từ ngày 16 tháng 8, 2026. Cách đơn giản và thường tiết kiệm chi phí để truy cập là thông qua cổng OpenAI-compatible hợp nhất của CometAPI với mức giá chiết khấu.
Những điểm chính
- DeepSeek-V4-Pro-0813 là bản GA sản xuất phát hành khoảng ngày 12–13 tháng 8, 2026; model ID vẫn là
deepseek-v4-pro. - Tăng mạnh trên các benchmark tác tử: DeepSWE 62.7, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, HLE (w/ tools) 60.0.
- Ba chế độ tư duy/mức nỗ lực: non-thinking + low / high / max reasoning effort.
- Bộ tính năng đầy đủ: ngữ cảnh 1M, đầu ra tối đa 384K, tool calls, JSON output, Responses API, định dạng Anthropic, streaming, structured outputs.
- Khung giá peak/off-peak bắt đầu từ ngày 16 tháng 8, 2026 (UTC); lên kế hoạch khối lượng công việc phù hợp.
- OpenAI SDK tương thích drop-in giúp việc di trú trở nên đơn giản.
Hướng dẫn toàn diện này bao phủ mọi thứ nhà phát triển cần: những gì thay đổi trong bản 0813, thông số và giá chính thức, các chế độ tư duy, streaming và structured outputs, và hướng dẫn từng bước sử dụng mô hình qua CometAPI (được khuyến nghị cho nhiều quy trình sản xuất và đa mô hình). Tất cả thông tin được rút từ tài liệu chính thức của DeepSeek và các nguồn tin đồng thời tính đến ngày 13 tháng 8, 2026.
DeepSeek V4 Pro 0813 là gì?
DeepSeek-V4-Pro-0813 là ảnh chụp sản xuất GA của DeepSeek V4 Pro phát hành vào tháng 8/2026.
DeepSeek thông báo ngày 13 tháng 8 rằng phiên bản V4 Pro chính thức đã đồng thời khả dụng qua ứng dụng, website và API của hãng. Thông báo ngày 13 tháng 8 của DeepSeek cũng bổ sung tương thích nguyên bản với OpenAI Responses API và ba mức tư duy thực tiễn: non-thinking, high-effort thinking, và max-effort thinking. Quan trọng với nhà phát triển, DeepSeek nêu rõ tên model API không thay đổi. Nhà phát triển tiếp tục gọi:
deepseek-v4-pro
Ký hiệu 0813 xác định ảnh chụp sản xuất chứ không phải là định danh mà nhà phát triển bắt buộc phải đưa vào yêu cầu API.
Mô hình được định vị chủ yếu cho suy luận nâng cao, kỹ thuật phần mềm, phân tích ngữ cảnh dài và khối công việc mang tính tác tử. Đánh giá độc lập từ Artificial Analysis hiện báo cáo điểm Intelligence Index ở mức 53, so với trung vị 27 trong số các mô hình open-weight so sánh được chọn. Họ cũng báo cáo tốc độ xuất token khoảng 77.6 token/giây và 1.71 giây đến token đầu tiên dựa trên thử nghiệm API.
Có những thay đổi gì với API trong V4 Pro 0813?
Định danh mô hình lõi và base URL giữ nguyên, vì vậy các tích hợp hiện có tiếp tục hoạt động mà không cần đổi mã. Nâng cấp đáng kể nằm ở năng lực, chất lượng hậu huấn luyện và các tính năng hỗ trợ.
Cải thiện năng lực chính
Theo thông báo GA DeepSeek-V4-Pro chính thức và change log:
- Nâng cấp lớn về năng lực tác tử với mức tăng mạnh ở các khối công việc kiểu sản xuất.
- Điểm benchmark cho bản 0813 gồm:
- HLE (không / có tools): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench (Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Đây là những mức tăng đáng kể so với bản preview tháng 4/2026 (ví dụ, DeepSWE tăng mạnh). Mô hình vẫn là kiến trúc Mixture-of-Experts với tổng 1.6 nghìn tỷ tham số và khoảng 49 tỷ tham số kích hoạt mỗi token.
Tính năng API mới và nâng cấp
- Hỗ trợ nguyên bản OpenAI Responses API, tối ưu cho Codex với script cấu hình một chạm.
- Điều khiển mức nỗ lực tư duy linh hoạt hơn: low / high / max (trước đây mapping hạn chế hơn trên Pro).
- Duy trì chế độ kép (thinking bật theo mặc định; có tùy chọn non-thinking).
- Tương thích đầy đủ với định dạng OpenAI Chat Completions và Anthropic Messages.
- JSON Output, Tool Calls, Chat Prefix Completion (Beta), và FIM Completion (Beta, chỉ non-thinking).
- Độ dài ngữ cảnh giữ ở 1M token; đầu ra tối đa 384K token.
- Giới hạn đồng thời cho Pro: 500 (Flash: 2,500).
Thông báo cập nhật giá
Giá hiện tại (tính đến ngày 13 tháng 8, 2026) trên mỗi 1M token:
| Model | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
Bắt đầu từ 16:00 UTC ngày 16 tháng 8, 2026, cơ chế tính phí peak/off-peak có hiệu lực (off-peak = một nửa peak). Khung giờ peak: 01:00–04:00 và 06:00–10:00 UTC. Mức giá mới:
| Model | Period | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|---|
| deepseek-v4-pro | Off-peak | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Peak | $0.044 | $1.32 | $3.96 |
DeepSeek cũng cho biết có thể có các đợt tăng giá chung tiếp theo; theo dõi trang giá chính thức.
Tài liệu giới hạn tốc độ của DeepSeek đặt mức đồng thời tiêu chuẩn của V4 Pro là 500 yêu cầu mỗi tài khoản. Một kết nối được tính từ khi gửi đến khi phản hồi hoàn tất, và yêu cầu vượt quá nhận HTTP 429. DeepSeek chấp nhận một for scheduling isolation; nó phải khớp và không dài quá 512 ký tự. Không nên chứa thông tin cá nhân.
Hỗ trợ nguyên bản Responses API
Một thay đổi API rõ rệt là hỗ trợ nguyên bản định dạng OpenAI Responses API.
DeepSeek cho biết Responses API được thiết kế một phần để hỗ trợ quy trình tác tử lập trình như Codex. Endpoint chính thức dùng:
https://api.deepseek.com
và có thể truy cập bằng OpenAI Python SDK.
Ví dụ:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
Tài liệu của DeepSeek cũng hỗ trợ streaming cho yêu cầu Responses API, sử dụng semantic server-sent events thay vì quy ước cũ data: [DONE].
Điều khiển tư duy linh hoạt hơn
V4 Pro khiến suy luận có thể cấu hình thay vì buộc nhà phát triển dùng một mô hình reasoning riêng.
Tài liệu của DeepSeek mô tả công tắc thinking như:
{
"thinking": {
"type": "enabled"
}
}
và mức nỗ lực suy luận như:
high
max
Cấu hình thinking mặc định là bật, với high dùng cho các yêu cầu thường xuyên. Một số khối công việc tác tử phức tạp có thể tự động dùng max.
Điều này tạo ra ba chế độ thực tiễn cho nhà phát triển ứng dụng:
- Non-thinking
- Thinking — High
- Thinking — Max
Sự phân biệt này rất hữu ích khi thiết kế ứng dụng AI vì không phải yêu cầu nào cũng cần mức suy luận tối đa.
Một chi tiết triển khai quan trọng: ở chế độ thinking, các tham số như
temperaturevàtop_pkhông ảnh hưởng đến đầu ra của mô hình. DeepSeek nêu rõ hành vi này trong tài liệu.
Cách dùng DeepSeek V4 Pro 0813 API với CometAPI
CometAPI hữu ích nếu bạn muốn tích hợp DeepSeek V4 Pro mà không phải duy trì tích hợp API riêng cho từng nhà cung cấp AI.
CometAPI hiện quảng bá một API hợp nhất bao phủ 500+ mô hình AI, với lớp API chung và thanh toán hợp nhất. Tài liệu giá của họ cho biết giá chính thức của mô hình thường được chiết khấu 20% so với mức của nhà cung cấp.
Dưới đây là quy trình tích hợp CometAPI thực tiễn.
Bước 1: Tạo tài khoản CometAPI
Đầu tiên, tạo hoặc đăng nhập tài khoản CometAPI.
Mở website CometAPI và truy cập console API.
Tài liệu DeepSeek V4 Pro của CometAPI hướng dẫn người dùng lấy API token từ console của CometAPI.
Bước 2: Tạo khóa API CometAPI
Sau khi đăng nhập, mở mục token/API-key trong tài khoản và tạo khóa API.
Lưu khóa dưới dạng biến môi trường thay vì hard-code trong ứng dụng.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Không bao giờ commit khóa API lên GitHub, JavaScript frontend, ứng dụng di động, hoặc file cấu hình công khai.
Bước 3: Cài đặt OpenAI Python SDK
Vì CometAPI cung cấp giao diện tương thích OpenAI, bạn có thể dùng client OpenAI Python quen thuộc.
pip install openai
Điều này giúp việc di trú đặc biệt đơn giản cho những ai đã quen định dạng API OpenAI.
Bước 4: Cấu hình Base URL của CometAPI
Tạo client như sau:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
Ví dụ V4 Pro được CometAPI công bố dùng base URL này và model ID deepseek-v4-pro.
Bước 5: Gửi yêu cầu DeepSeek V4 Pro đầu tiên
Giờ hãy gửi một yêu cầu cơ bản:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
Các tham số quan trọng:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Giải thích ba chế độ tư duy
DeepSeek V4 Pro hỗ trợ:
- Non-thinking — Phản hồi nhanh nhất, không có chuỗi lập luận tường minh. Lý tưởng cho Q&A đơn giản hoặc bối cảnh throughput cao.
- Thinking với nỗ lực thấp / cao — Mô hình tạo reasoning_content trước câu trả lời cuối. High là mặc định thực tiễn cho hầu hết tác vụ tác tử và lập trình.
- Max effort — Đẩy năng lực suy luận của mô hình lên mức cao nhất; khuyến nghị cho bài toán đa bước phức tạp. Có thể tiêu tốn nhiều token và tăng độ trễ.
Trong định dạng tương thích OpenAI bạn điều khiển qua đối tượng thinking và tham số reasoning_effort. Chuỗi lập luận xuất hiện trong message.reasoning_content. Khi không dùng tools, lập luận trước đó thường có thể được lược bỏ khỏi ngữ cảnh tiếp theo; khi có dùng tools, cần truyền đầy đủ lập luận trở lại.
Chuyển đổi giữa các mức tư duy và chế độ non-thinking
- Non-thinking:
"thinking": {"type": "disabled"}(hoặc kiểu Anthropic tương đươngreasoning.effort: "none"). - Thinking với nỗ lực:
"reasoning_effort": "low" | "high" | "max"kèm"thinking": {"type": "enabled"}.
Mặc định là thinking bật với nỗ lực high. Dùng low cho truy vấn đơn giản, high cho tác vụ tác tử điển hình, và max cho bài toán khó hoặc lập trình đa bước.
Streaming và Structured Outputs
Streaming được bật đơn giản bằng cách đặt "stream": true. Cả nội dung và (nếu áp dụng) token lập luận có thể stream. Điều này then chốt cho tác tử tương tác và ứng dụng hướng người dùng.
Structured / JSON outputs là tính năng hạng nhất: dùng response_format={"type": "json_object"} hoặc schema nâng cao qua Responses API và định nghĩa tool. Kết hợp với tool calling, điều này cho phép vòng lặp tác tử phát ra hành động có thể đọc máy đáng tin cậy.
Endpoint Responses API (/responses) cung cấp bề mặt hiện đại, bám sát OpenAI, đặc biệt hữu ích cho workflow kiểu Codex và nay đã hỗ trợ nguyên bản cho V4 Pro.
Dùng Structured Outputs / JSON Mode
DeepSeek hỗ trợ JSON Output. Yêu cầu qua response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
Để kiểm soát schema chặt chẽ hơn, kết hợp với tool calls hoặc Responses API nơi được hỗ trợ.
Triển khai Tool Calls (Function Calling)
Định nghĩa tools theo định dạng OpenAI. Ở chế độ thinking bạn phải truyền đúng reasoning_content trở lại ở các lượt sau khi có dùng tools.
Khi tương tác với tool sau đó, nhà phát triển phải giữ lại reasoning_content tương ứng khi gọi mindset tool. Xử lý sai có thể dẫn đến lỗi 400.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Xem hướng dẫn chính thức về Tool Calls và Thinking Mode để biết mẫu đa lượt chính xác cần dùng khi có tools.
Thực hành tốt khi dùng DeepSeek V4 Pro 0813 API
Khớp mức nỗ lực suy luận với tác vụ
Đừng dùng reasoning Max cho tác vụ chỉ cần phân loại.
Một chính sách định tuyến đơn giản hoạt động tốt:
Đơn giản → Non-thinking
Trung bình → High
Phức tạp → Max
Điều này có thể giảm cả độ trễ và chi phí.
Stream các phản hồi dài
Nếu ứng dụng của bạn cần vài giây để tạo phản hồi, hãy dùng:
stream=True
Người dùng thường cảm nhận tốc độ nhanh hơn đáng kể khi thấy kết quả dần hiển thị thay vì chờ phản hồi hoàn chỉnh.
Xác thực structured output
JSON mode cải thiện độ tin cậy, nhưng ứng dụng của bạn vẫn nên xác thực JSON trả về.
Dùng:
import json
data = json.loads(response_text)
và xác thực trường bắt buộc trước khi ghi vào cơ sở dữ liệu hay kích hoạt tác vụ bên ngoài.
Theo dõi việc sử dụng token
Luôn kiểm tra:
response.usage
khi khả dụng.
Ở quy mô của V4 Pro, thống kê token không chỉ là tính năng phân tích tùy chọn. Nó là cơ chế cốt lõi để kiểm soát chi phí.
Tách prompt ổn định và động
Với ứng dụng ngữ cảnh dài, giữ chỉ dẫn và tài liệu lặp lại ở dạng ổn định để tối đa hóa tái sử dụng cache.
Duy trì mô hình dự phòng
Một kiến trúc sản xuất thực tiễn có thể định tuyến:
Yêu cầu đơn giản
↓
V4 Flash
Yêu cầu phức tạp
↓
V4 Pro
Yêu cầu rất khó
↓
V4 Pro Max reasoning
Chính sách định tuyến chính xác nên được xác định qua benchmark của chính bạn.
Lỗi thường gặp với DeepSeek V4 Pro API
Lỗi: Model not found
Kiểm tra bạn đang dùng:
deepseek-v4-pro
thay vì vô tình tạo ra tên model ảnh chụp.
DeepSeek cho biết tên model API vẫn không đổi cho bản phát hành sản xuất 0813.
Lỗi: Invalid thinking parameters
Với yêu cầu tương thích OpenAI, dùng:
"thinking": {
"type": "enabled"
}
bên trong body yêu cầu phù hợp, và dùng:
reasoning_effort=high
hoặc:
reasoning_effort=max
Tài liệu API chính thức của DeepSeek định nghĩa các tham số này.
Lỗi: JSON output sai định dạng
Dùng:
"response_format": {
"type": "json_object"
}
và nêu rõ trong prompt yêu cầu mô hình xuất JSON. DeepSeek cảnh báo JSON mode nên đi kèm chỉ dẫn tạo JSON.
Lỗi trong tool calling đa lượt
Khi dùng chế độ thinking với tool calls, giữ nguyên reasoning_content cần thiết ở các yêu cầu tiếp theo.
Chi tiết này rất dễ bỏ sót và có thể gây phản hồi 400.
Kiến trúc khuyến nghị cho DeepSeek V4 Pro 0813 API
Với ứng dụng sản xuất, một kiến trúc khởi điểm vững chắc như sau:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Cách này tách biệt việc chọn mô hình khỏi logic ứng dụng.
Nếu một mô hình khác có chi phí hiệu quả hơn hoặc hiệu năng tốt hơn cho một khối công việc cụ thể, lớp định tuyến có thể thay đổi mà không cần viết lại toàn bộ ứng dụng.
Kết luận và khuyến nghị
DeepSeek-V4-Pro-0813 đánh dấu sự trưởng thành của dòng V4 Pro thành một sản phẩm chủ lực sẵn sàng sản xuất với hiệu năng tác tử mạnh hơn rõ rệt, đồng thời giữ cửa sổ ngữ cảnh 1M hào phóng và mức chi phí hấp dẫn của dòng sản phẩm. Nhờ tương thích OpenAI và Anthropic, nhà phát triển có thể bắt đầu sử dụng ngay với chi phí di trú gần như bằng không.
Khuyến nghị cho đa số đội ngũ:
- Thử nghiệm prototype và đa mô hình trên CometAPI.
- Chuyển khối lượng lớn hoặc nhạy độ trễ dành riêng DeepSeek sang endpoint chính thức khi khung giá peak/off-peak và các điều chỉnh ổn định.
- Mặc định bật thinking với
reasoning_effort="high"cho tác vụ tác tử và lập trình; dànhmaxcho bài toán khó nhất. - Luôn triển khai vòng lặp tool-call với
reasoning_contentđúng cách và tận dụng streaming + structured outputs cho ứng dụng vững chắc.
Với bản 0813, DeepSeek đã mang đến một mô hình open-weight-class có năng lực cao, chi phí hiệu quả, cạnh tranh cho khối công việc tác tử nghiêm túc và ngữ cảnh dài. Tích hợp qua CometAPI hoặc API chính thức và bắt đầu xây dựng. Khám phá DeepSeek V4 Pro trên CometAPI.
Câu hỏi thường gặp
DeepSeek V4 Pro 0813 có giống deepseek-v4-pro không?
Có. Thông báo phát hành chính thức của DeepSeek cho biết tên model API không thay đổi trong khi phiên bản sản xuất được cập nhật lên V4 Pro 0813.
DeepSeek V4 Pro có hỗ trợ cửa sổ ngữ cảnh 1M token không?
Có. Tài liệu model/giá hiện tại của DeepSeek liệt kê độ dài ngữ cảnh 1M token và đầu ra tối đa 384K.
Ba chế độ tư duy của DeepSeek V4 Pro là gì?
Theo thiết kế ứng dụng thực tiễn, đó là:
- Non-thinking
- Thinking với nỗ lực cao (high)
- Thinking với nỗ lực tối đa (max)
API dùng công tắc thinking cùng reasoning_effort. API hiện bộc lộ high và max, trong khi các giá trị tương thích như low và medium sẽ map về high.
Tôi có thể stream phản hồi của DeepSeek V4 Pro không?
Có. Streaming được hỗ trợ qua Chat Completions API, và stream ở chế độ thinking có thể bao gồm các delta của reasoning_content trước nội dung trả lời thông thường.
Tôi có thể dùng DeepSeek V4 Pro với CometAPI không?
Có. CometAPI hiện công bố mô hình deepseek-v4-pro qua endpoint /v1/chat/completions tương thích OpenAI.
Tôi nên dùng DeepSeek V4 Pro hay V4 Flash?
Dùng V4 Flash khi throughput, độ trễ và chi phí là ưu tiên. Dùng V4 Pro cho suy luận khó, lập trình, phân tích ngữ cảnh dài và khối công việc tác tử.
Chiến lược định tuyến lai thường tốt hơn là dùng Pro cho mọi thứ.
Giá DeepSeek V4 Pro API có thay đổi không?
Có. DeepSeek đã thông báo áp dụng giá peak/off-peak bắt đầu từ ngày 17 tháng 8, 2026. Tài liệu chính thức liệt kê V4 Pro ở mức $0.66/M cache-miss input và $1.98/M output trong off-peak, so với $1.32/M input và $3.96/M output trong peak theo lịch mới.
