TLDR: DeepSeek-V4-Pro-0813 adalah rilis ketersediaan umum (GA) dari model MoE unggulan DeepSeek dengan 1,6T parameter (49B aktif). Model ini menghadirkan peningkatan agentik besar dibanding pratinjau April 2026, mendukung jendela konteks 1M token, hingga 384K token output, tiga tingkat upaya berpikir (rendah/tinggi/maks), OpenAI Responses API native, pemanggilan alat (tool calling), mode JSON, dan endpoint yang kompatibel dengan OpenAI maupun Anthropic.
Harga resmi mulai dari $0,435 / $0,87 per 1M token input/output (cache miss), dengan tarif puncak/non-puncak hadir pada 16 Agustus 2026. Cara termudah dan sering kali paling hemat untuk mengaksesnya adalah melalui gateway seragam yang kompatibel dengan OpenAI dari CometAPI dengan tarif diskon.
Key Takeaways
- DeepSeek-V4-Pro-0813 adalah versi GA produksi yang dirilis sekitar 12–13 Agustus 2026; ID model tetap
deepseek-v4-pro. - Kenaikan signifikan pada tolok ukur agen: DeepSWE 62,7, Terminal Bench 2.1 87,9, NL2Repo 61,5, Cybergym 83,3, HLE (dengan tools) 60,0.
- Tiga mode berpikir/tingkat upaya: non-thinking + upaya penalaran rendah / tinggi / maks.
- Set fitur lengkap: konteks 1M, output maks 384K, pemanggilan alat, output JSON, Responses API, format Anthropic, streaming, output terstruktur.
- Penetapan harga puncak/non-puncak mulai 16 Agustus 2026 (UTC); rencanakan beban kerja sesuai jadwal.
- Kompatibilitas SDK OpenAI drop-in membuat migrasi menjadi sepele.
Panduan komprehensif ini mencakup semua yang dibutuhkan pengembang: apa yang berubah di rilis 0813, spesifikasi dan harga resmi, mode berpikir, streaming dan output terstruktur, serta panduan langkah demi langkah menggunakan model melalui CometAPI (direkomendasikan untuk banyak alur kerja produksi dan multi-model). Semua informasi diambil dari dokumentasi resmi DeepSeek dan pelaporan kontemporer per 13 Agustus 2026.
What Is DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 adalah snapshot produksi ketersediaan umum dari DeepSeek V4 Pro yang dirilis pada Agustus 2026.
DeepSeek mengumumkan pada 13 Agustus bahwa versi resmi V4 Pro secara bersamaan tersedia melalui aplikasi, situs web, dan API. Pengumuman 13 Agustus dari DeepSeek juga menambahkan kompatibilitas native OpenAI Responses API dan tiga tingkat penalaran praktis: non-thinking, upaya tinggi, dan upaya maks. Penting bagi pengembang, DeepSeek menyatakan bahwa nama model API tidak berubah. Pengembang tetap memanggil:
deepseek-v4-pro
Penunjukan 0813 mengidentifikasi snapshot produksi alih-alih pengenal model yang perlu ditempatkan pengembang dalam permintaan API.
Model ini diposisikan terutama untuk penalaran tingkat lanjut, rekayasa perangkat lunak, analisis konteks panjang, dan beban kerja agentik. Evaluasi independen dari Artificial Analysis saat ini melaporkan skor Intelligence Index sebesar 53, dibandingkan median 27 di antara model open-weight sebanding yang dipilihnya. Laporan tersebut juga mencatat kecepatan output sekitar 77,6 token/detik dan 1,71 detik waktu ke token pertama berdasarkan pengujian API-nya.
What Changes Have Been Made to the API in V4 Pro 0813?
Pengenal model inti dan base URL tetap sama, sehingga integrasi yang ada terus bekerja tanpa perubahan kode. Peningkatan yang bermakna ada pada kapabilitas, kualitas pasca-pelatihan, dan fitur pendukung.
Key Capability Improvements
Menurut pengumuman GA DeepSeek-V4-Pro resmi dan catatan perubahan:
- Peningkatan agentik besar dengan kenaikan yang sangat kuat dalam beban kerja bergaya produksi.
- Skor tolok ukur untuk build 0813 meliputi:
- HLE (tanpa / dengan tools): 42,7 / 60,0
- Terminal Bench 2.1: 87,9
- NL2Repo: 61,5
- Cybergym: 83,3
- DeepSWE: 62,7
- Toolathlon-Verified: 74,1
- Agents’ Last Exam: 25,7
- AutomationBench (Public): 31,8
- DSBench-FullStack: 71,1
- DSBench-Hard: 67,2
Ini merepresentasikan kenaikan substansial dibanding pratinjau April 2026 (misalnya, DeepSWE naik secara dramatis). Model tetap berarsitektur Mixture-of-Experts dengan total 1,6 triliun parameter dan sekitar 49 miliar parameter diaktifkan per token.
New and Enhanced API Features
- Dukungan native untuk OpenAI Responses API, dioptimalkan untuk Codex dengan skrip konfigurasi satu klik.
- Kontrol upaya berpikir yang lebih fleksibel: rendah / tinggi / maks (sebelumnya pemetaan pada Pro lebih terbatas).
- Dukungan mode ganda tetap (berpikir diaktifkan secara default; non-thinking tersedia).
- Kompatibilitas penuh dengan format OpenAI Chat Completions dan Anthropic Messages.
- Output JSON, Tool Calls, Chat Prefix Completion (Beta), dan FIM Completion (Beta, hanya non-thinking).
- Panjang konteks tetap 1M token; output maksimum adalah 384K token.
- Batas konkurensi untuk Pro: 500 (Flash: 2.500).
Pricing Update Announcement
Harga saat ini (per 13 Agustus 2026) per 1M token:
| Model | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|
| deepseek-v4-flash | $0,0028 | $0,14 | $0,28 |
| deepseek-v4-pro | $0,003625 | $0,435 | $0,87 |
Mulai 16:00 UTC pada 16 Agustus 2026, penagihan puncak/non-puncak berlaku (non-puncak = setengah dari puncak). Jam puncak: 01:00–04:00 dan 06:00–10:00 UTC. Tarif baru:
| Model | Periode | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|---|
| deepseek-v4-pro | Non-puncak | $0,022 | $0,66 | $1,98 |
| deepseek-v4-pro | Puncak | $0,044 | $1,32 | $3,96 |
DeepSeek juga mengindikasikan bahwa kenaikan harga keseluruhan lebih lanjut mungkin mengikuti; pantau halaman harga resmi.
Dokumentasi batas laju DeepSeek menetapkan konkurensi standar V4 Pro sebesar 500 permintaan per akun. Sebuah koneksi dihitung sejak pengajuan hingga respons selesai, dan permintaan berlebih menerima respons HTTP 429. DeepSeek menerima sebuah untuk isolasi penjadwalan; itu harus cocok dan tidak lebih dari 512 karakter. Itu tidak boleh berisi informasi pribadi.
Native Responses API support
Salah satu perubahan API yang paling jelas adalah dukungan native untuk format OpenAI Responses API.
DeepSeek mengatakan Responses API dirancang sebagian untuk mendukung alur kerja agen pemrograman seperti Codex. Endpoint resmi menggunakan:
https://api.deepseek.com
dan dapat diakses dengan OpenAI Python SDK.
Contoh:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
Dokumentasi DeepSeek juga mendukung streaming untuk permintaan Responses API, menggunakan server-sent events semantik alih-alih konvensi lama data: [DONE].
More flexible thinking controls
V4 Pro membuat penalaran dapat dikonfigurasi alih-alih memaksa pengembang menggunakan model penalaran terpisah.
Dokumentasi DeepSeek menggambarkan sakelar berpikir sebagai:
{
"thinking": {
"type": "enabled"
}
}
dan upaya penalaran sebagai:
high
max
Konfigurasi berpikir default diaktifkan, dengan high digunakan untuk permintaan reguler. Beban kerja agen yang kompleks tertentu dapat secara otomatis menggunakan max.
Ini menciptakan tiga mode praktis bagi pengembang aplikasi:
- Non-thinking
- Thinking — High
- Thinking — Max
Pembedaan ini sangat berguna saat merancang aplikasi AI karena tidak setiap permintaan layak mendapatkan penalaran maksimum.
Satu detail implementasi penting: dalam mode berpikir, parameter seperti
temperaturedantop_ptidak memengaruhi output model. DeepSeek secara eksplisit mendokumentasikan perilaku ini.
How to Use DeepSeek V4 Pro 0813 API with CometAPI
CometAPI berguna jika Anda ingin mengintegrasikan DeepSeek V4 Pro tanpa memelihara integrasi API terpisah untuk setiap penyedia AI.
CometAPI saat ini mengiklankan API terpadu yang mencakup 500+ model AI, dengan lapisan API umum dan penagihan terpadu. Dokumentasi harganya mengatakan harga model resmi umumnya ditawarkan dengan diskon 20% dari tarif resmi penyedia.
Berikut alur kerja integrasi CometAPI yang praktis.
Step 1: Create a CometAPI Account
Pertama, buat atau masuk ke akun CometAPI Anda.
Buka situs web CometAPI dan akses konsol API.
Dokumentasi DeepSeek V4 Pro dari CometAPI menginstruksikan pengguna untuk memperoleh token API dari konsol CometAPI.
Step 2: Create Your CometAPI API Key
Setelah masuk, buka bagian token/API key pada akun Anda dan buat API key.
Simpan sebagai variabel lingkungan alih-alih menuliskannya langsung di dalam aplikasi Anda.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Jangan pernah melakukan commit API key ke GitHub, JavaScript frontend, aplikasi mobile, atau file konfigurasi yang dapat diakses publik.
Step 3: Install the OpenAI Python SDK
Karena CometAPI menyediakan antarmuka yang kompatibel dengan OpenAI, Anda dapat menggunakan klien Python OpenAI yang familier.
pip install openai
Ini membuat migrasi menjadi sangat mudah bagi pengembang yang sudah mengetahui format API OpenAI.
Step 4: Configure the CometAPI Base URL
Buat klien seperti ini:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
Contoh V4 Pro yang dipublikasikan CometAPI menggunakan base URL ini dan ID model deepseek-v4-pro.
Step 5: Send Your First DeepSeek V4 Pro Request
Sekarang kirim permintaan dasar:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
Parameter penting adalah:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Three Thinking Modes Explained
DeepSeek V4 Pro mendukung:
- Mode non-thinking — Respons tercepat, tanpa chain-of-thought eksplisit. Ideal untuk tanya jawab sederhana atau skenario throughput tinggi.
- Mode berpikir dengan upaya rendah / tinggi — Model menghasilkan reasoning_content sebelum jawaban final. Tinggi adalah default praktis untuk sebagian besar pekerjaan agen dan pemrograman.
- Upaya maks — Mendorong kemampuan penalaran model sejauh mungkin; direkomendasikan untuk masalah multi-langkah yang kompleks. Mungkin mengonsumsi lebih banyak token dan latensi.
Dalam format yang kompatibel dengan OpenAI Anda mengontrol ini dengan objek thinking dan parameter reasoning_effort. Chain-of-thought muncul di message.reasoning_content. Saat tools tidak digunakan, penalaran sebelumnya sering kali dapat dihilangkan dari konteks berikutnya; saat tools digunakan, penalaran penuh harus diteruskan kembali.
Switch Between Thinking Efforts and Non-Thinking Mode
- Non-thinking:
"thinking": {"type": "disabled"}(atau gaya Anthropic yang setarareasoning.effort: "none"). - Berpikir dengan upaya:
"reasoning_effort": "low" | "high" | "max"ditambah"thinking": {"type": "enabled"}.
Default adalah berpikir diaktifkan dengan upaya tinggi. Gunakan rendah untuk kueri sederhana, tinggi untuk pekerjaan agen tipikal, dan maks untuk penalaran paling sulit atau tugas pemrograman multi-langkah.
Streaming Responses and Structured Outputs
Streaming diaktifkan cukup dengan menetapkan "stream": true. Baik konten maupun (bila berlaku) token penalaran dapat melakukan streaming. Ini penting untuk agen interaktif dan aplikasi yang menghadap pengguna.
Output terstruktur / JSON adalah kelas satu: gunakan response_format={"type": "json_object"} atau dukungan skema yang lebih maju tersedia melalui Responses API dan definisi tools. Digabungkan dengan pemanggilan alat, ini memungkinkan loop agen yang andal yang memancarkan tindakan yang dapat dibaca mesin.
Endpoint Responses API (/responses) menyediakan permukaan yang lebih modern dan selaras dengan OpenAI yang sangat berguna untuk alur kerja bergaya Codex dan sekarang didukung secara native untuk V4 Pro.
Use Structured Outputs / JSON Mode
DeepSeek mendukung Output JSON. Minta melalui response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
Untuk kontrol skema yang lebih ketat, gabungkan dengan pemanggilan alat atau Responses API bila didukung.
Implement Tool Calls (Function Calling)
Definisikan tools dalam format OpenAI. Dalam mode berpikir Anda harus meneruskan reasoning_content dengan benar pada giliran berikutnya ketika tools digunakan.
Saat berinteraksi dengan alat nanti, pengembang harus mempertahankan reasoning_content yang sesuai saat memanggil alat mindset. Penanganan yang tidak tepat dapat menghasilkan kesalahan 400.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Lihat panduan resmi Tool Calls dan Thinking Mode untuk pola multi-giliran yang tepat saat tools digunakan.
Best Practices for Using DeepSeek V4 Pro 0813 API
Sesuaikan upaya penalaran dengan tugas
Jangan gunakan penalaran Maks untuk tugas yang hanya memerlukan klasifikasi.
Kebijakan perutean sederhana bekerja dengan baik:
Sederhana → Non-thinking
Sedang → High
Kompleks → Max
Ini dapat mengurangi latensi dan biaya.
Streaming respons panjang
Jika aplikasi Anda memerlukan beberapa detik untuk menghasilkan respons, gunakan:
stream=True
Pengguna umumnya merasakan keluaran bertahap secara signifikan lebih cepat daripada menunggu respons lengkap.
Validasi output terstruktur
Mode JSON meningkatkan keandalan, tetapi aplikasi Anda tetap harus memvalidasi JSON yang dikembalikan.
Gunakan:
import json
data = json.loads(response_text)
dan kemudian validasi field yang diperlukan sebelum menulis ke database atau memicu tindakan eksternal.
Pantau penggunaan token
Selalu inspeksi:
response.usage
bila tersedia.
Pada skala V4 Pro, penghitungan token bukan fitur analitik opsional. Itu adalah mekanisme kontrol biaya inti.
Pisahkan prompt yang stabil dan dinamis
Untuk aplikasi konteks panjang, buat instruksi dan dokumen berulang menjadi stabil untuk memaksimalkan penggunaan cache.
Siapkan model cadangan
Arsitektur produksi yang praktis dapat merutekan:
Permintaan sederhana
↓
V4 Flash
Permintaan kompleks
↓
V4 Pro
Permintaan sangat sulit
↓
V4 Pro penalaran Maks
Kebijakan perutean yang tepat harus ditentukan melalui tolok ukur Anda sendiri.
Common DeepSeek V4 Pro API Errors
Error: Model not found
Periksa bahwa Anda menggunakan:
deepseek-v4-pro
alih-alih secara tidak sengaja menciptakan nama model snapshot.
DeepSeek menyatakan bahwa nama model API tetap tidak berubah untuk rilis produksi 0813.
Error: Invalid thinking parameters
Untuk permintaan yang kompatibel dengan OpenAI, gunakan:
"thinking": {
"type": "enabled"
}
di dalam body permintaan yang sesuai, dan gunakan:
reasoning_effort=high
atau:
reasoning_effort=max
Dokumentasi API resmi DeepSeek mendefinisikan parameter ini.
Error: JSON output is malformed
Gunakan:
"response_format": {
"type": "json_object"
}
dan secara eksplisit minta model dalam prompt untuk menghasilkan JSON. DeepSeek memperingatkan bahwa mode JSON harus disertai instruksi untuk menghasilkan JSON.
Error during multi-turn tool calling
Saat menggunakan mode berpikir dengan pemanggilan alat, pertahankan reasoning_content yang diperlukan dalam permintaan berikutnya.
Ini adalah detail yang mudah terlewat dan dapat menghasilkan respons 400.
DeepSeek V4 Pro 0813 API: Recommended Architecture
Untuk aplikasi produksi, arsitektur awal yang kuat terlihat seperti ini:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Ini memisahkan pemilihan model dari logika aplikasi.
Jika model lain menjadi lebih ekonomis atau berkinerja lebih baik pada beban kerja tertentu, lapisan perutean dapat diubah tanpa menulis ulang seluruh aplikasi.
Conclusion and Recommendations
DeepSeek-V4-Pro-0813 menandai pematangan lini V4 Pro menjadi flagship siap produksi dengan performa agentik yang jauh lebih kuat sambil mempertahankan konteks 1M yang lapang dan ekonomi menarik dari seri ini. Pengembang dapat mulai menggunakannya hari ini dengan hampir nol biaya migrasi berkat kompatibilitas OpenAI dan Anthropic.
Untuk sebagian besar tim kami merekomendasikan:
- Prototipe dan eksperimen multi-model di CometAPI.
- Pindahkan beban kerja DeepSeek-only ber-volume tinggi atau sensitif latensi ke endpoint resmi setelah penetapan harga puncak/non-puncak dan penyesuaian lebih lanjut stabil.
- Default ke mode berpikir dengan
reasoning_effort="high"untuk tugas agen dan pemrograman; sisihkan maks untuk masalah paling sulit. - Selalu terapkan round-tripping
reasoning_contentyang tepat pada pemanggilan alat dan manfaatkan streaming + output terstruktur untuk aplikasi yang tangguh.
Dengan rilis 0813, DeepSeek telah menghadirkan model kelas open-weight yang sangat kapabel dan hemat biaya, kompetitif untuk beban kerja agentik dan konteks panjang yang serius. Integrasikan melalui CometAPI atau API resmi dan mulai membangun. Jelajahi DeepSeek V4 Pro di CometAPI.
Frequently Asked Questions
Is DeepSeek V4 Pro 0813 the same as deepseek-v4-pro?
Ya. Pengumuman rilis resmi DeepSeek mengatakan nama model API tetap tidak berubah sementara versi produksi diperbarui ke V4 Pro 0813.
Does DeepSeek V4 Pro support a 1M-token context window?
Ya. Dokumentasi model/harga DeepSeek saat ini mencantumkan panjang konteks 1M token dan output maksimum 384K.
What are the three DeepSeek V4 Pro thinking modes?
Untuk desain aplikasi praktis, yaitu:
- Non-thinking
- Berpikir dengan upaya tinggi
- Berpikir dengan upaya maks
API menggunakan sakelar berpikir ditambah reasoning_effort. API DeepSeek saat ini mengekspos high dan max, sementara nilai kompatibilitas seperti low dan medium memetakan ke high.
Can I stream DeepSeek V4 Pro responses?
Ya. Streaming didukung melalui Chat Completions API, dan stream mode berpikir dapat menyertakan delta reasoning_content sebelum konten jawaban normal.
Can I use DeepSeek V4 Pro with CometAPI?
Ya. CometAPI saat ini mendokumentasikan model deepseek-v4-pro melalui endpoint /v1/chat/completions yang kompatibel dengan OpenAI.
Should I use DeepSeek V4 Pro or V4 Flash?
Gunakan V4 Flash ketika throughput, latensi, dan biaya mendominasi. Gunakan V4 Pro untuk penalaran sulit, pemrograman, analisis konteks panjang, dan beban kerja agentik.
Strategi perutean hibrida biasanya lebih baik daripada menggunakan Pro untuk semuanya.
Is DeepSeek V4 Pro API pricing changing?
Ya. DeepSeek telah mengumumkan penetapan harga puncak/non-puncak mulai 17 Agustus 2026. Dokumentasi resmi mencantumkan V4 Pro pada $0,66/M input cache-miss dan $1,98/M output selama periode non-puncak, versus $1,32/M input dan $3,96/M output selama periode puncak di bawah jadwal baru.
