Spesifikasi teknis
| Item | DeepSeek-V4-Pro |
|---|---|
| Penyedia | DeepSeek |
| Nama model API | deepseek-v4-pro |
| URL dasar | https://api.deepseek.com dan https://api.deepseek.com/anthropic |
| Jenis input | Teks |
| Jenis output | Teks, pemanggilan alat, keluaran penalaran |
| Panjang konteks | 1,000,000 tokens |
| Output maksimum | 384,000 tokens |
| Mode penalaran | Non-thinking, thinking (bawaan) |
| Bawaan agen/pengodean | reasoning_effort dapat disetel tinggi; permintaan agen yang kompleks dapat menggunakan max |
| Fitur yang didukung | Keluaran JSON, Pemanggilan Alat, Penyelesaian Prefiks Chat (beta), Penyelesaian FIM (beta pada mode non-thinking) |
| Rilis bobot lokal/terbuka | 1.6T parameter total, 49B parameter yang diaktifkan, presisi campuran FP4 + FP8 |
| Lisensi (kartu model) | MIT |
| Kartu model referensi | Pratinjau DeepSeek-V4-Pro di Hugging Face |
Apa itu DeepSeek-V4-Pro?
DeepSeek-V4-Pro adalah anggota yang lebih kuat dalam keluarga pratinjau V4 dari DeepSeek. Kartu model resmi menggambarkannya sebagai model MoE berparameter 1.6T dengan 49B parameter aktif dan jendela konteks satu juta token, ditujukan untuk pekerjaan pengetahuan jangka panjang, pembuatan kode, dan tugas agen. Dokumentasi API mengeksposnya melalui antarmuka chat-completions standar DeepSeek dan mendukung gaya SDK OpenAI maupun Anthropic.
Fitur utama
- Konteks sejuta token: DeepSeek mendokumentasikan panjang konteks 1M token, yang membuat model cocok untuk himpunan dokumen yang sangat besar, repositori, dan sesi agen multi-langkah.
- Dua mode penalaran: API mendukung mode non-thinking dan thinking; thinking adalah bawaan, dan dokumen mencatat bahwa permintaan agen yang kompleks seperti Claude Code atau OpenCode dapat otomatis menggunakan upaya
max. - Mendukung pemanggilan alat: Mode thinking DeepSeek mendukung pemanggilan alat, yang penting bagi agen yang memerlukan pencarian, operasi berkas, atau fungsi eksternal.
- Efisiensi konteks panjang: Kartu model menyebut V4 menggunakan desain atensi hibrida dengan Compressed Sparse Attention dan Heavily Compressed Attention untuk mengurangi komputasi konteks panjang dan biaya cache KV relatif terhadap V3.2. citeturn980363view2
- Fokus pada pengodean dan penalaran: DeepSeek menyatakan mode penalaran V4-Pro-Max meningkatkan tolok ukur pengodean dan menutup sebagian besar kesenjangan dengan model sumber tertutup terdepan pada tugas penalaran dan agen. citeturn980363view2
- Fleksibilitas SDK: Dapat diakses melalui chat completions standar yang kompatibel dengan OpenAI atau melalui endpoint yang kompatibel dengan Anthropic milik DeepSeek untuk alur kerja berorientasi alat.
Performa benchmark
Kartu model resmi DeepSeek melaporkan hasil evaluasi berikut untuk keluarga model dasar dan untuk set perbandingan V4-Pro-Max. Dalam tabel model dasar, V4-Pro mencetak lebih tinggi daripada V3.2-Base pada beberapa tolok ukur pengetahuan dan konteks panjang, termasuk MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1), dan LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
Kartu model yang sama juga menunjukkan V4-Pro-Max tetap kompetitif dengan model frontier teratas pada tugas tertentu. Misalnya, model ini mencatat 87.5 pada MMLU-Pro, 57.9 pada SimpleQA-Verified, 90.1 pada GPQA Diamond, dan 67.9 pada Terminal Bench 2.0 dalam tabel perbandingan yang dipublikasikan.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Model | Kegunaan terbaik | Konteks | Catatan |
|---|---|---|---|
| DeepSeek-V4-Pro | Penalaran berat, pengodean, agen, dokumen besar | 1M | Model V4 terbesar, 49B parameter diaktifkan, kapasitas keseluruhan terkuat dalam seri. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Lebih cepat, ringan untuk penggunaan umum | 1M | Model 284B/13B yang lebih kecil, tetap mendukung thinking dan pemanggilan alat. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Baseline konteks panjang generasi sebelumnya | 128K dalam dokumen API sebelumnya; V4 menggunakan desain 1M | Berguna sebagai titik acuan untuk peningkatan efisiensi; kartu model V4-Pro melaporkan pengurangan besar pada FLOPs konteks panjang dan cache KV dibandingkan V3.2. citeturn321011view1turn980363view2 |
Kasus penggunaan terbaik
- Asisten pengodean skala repositori dan alat refaktorisasi
- Analisis dan sintesis dokumen panjang
- Agen yang menggunakan alat dan memerlukan penalaran multi-giliran
- Alur kerja dukungan teknis yang diuntungkan oleh memori panjang dan keluaran terstruktur
- Tugas pengetahuan bahasa Tionghoa dan multibahasa di mana kartu model menunjukkan performa tolok ukur yang kuat
Cara mengakses dan menggunakan API Deepseek v4 pro
Langkah 1: Daftar untuk Kunci API
Masuk ke cometapi.com. Jika Anda belum menjadi pengguna kami, silakan daftar terlebih dahulu. Masuk ke CometAPI console. Dapatkan kredensial akses kunci API antarmuka. Klik “Add Token” pada token API di pusat pribadi, dapatkan kunci token: sk-xxxxx dan kirim.
Langkah 2: Kirim Permintaan ke Deepseek v4 proAPI
Pilih endpoint “deepseek-v4-pro” untuk mengirim permintaan API dan atur badan permintaan. Metode permintaan dan badan permintaan diperoleh dari dokumen API di situs kami. Situs kami juga menyediakan pengujian Apifox untuk kenyamanan Anda. Ganti <YOUR_API_KEY> dengan kunci CometAPI Anda yang sebenarnya dari akun Anda. Tempat memanggilnya: format Anthropic Messages dan format Chat.
Masukkan pertanyaan atau permintaan Anda ke dalam bidang konten—ini yang akan ditanggapi oleh model. Proses respons API untuk mendapatkan jawaban yang dihasilkan.
Langkah 3: Ambil dan Verifikasi Hasil
Proses respons API untuk mendapatkan jawaban yang dihasilkan. Setelah pemrosesan, API merespons dengan status tugas dan data keluaran. Aktifkan fitur seperti streaming, cache prompt, atau penanganan konteks panjang melalui parameter standar.