TLDR DeepSeek-V4-Flash-0731 (dirilis 31 Juli 2026) adalah versi resmi yang siap produksi dari model Mixture-of-Experts efisien milik DeepSeek (284B total / 13B parameter aktif, konteks 1M token). Melalui post-training terarah, model ini menghadirkan lonjakan besar dalam pengodean berbasis agen, penggunaan tool, dan rekayasa perangkat lunak multi-langkah. Model ini mendukung Responses API dan OpenAI Codex secara native. DeepSeek Harness adalah kerangka kerja agen pendamping (mode minimal sudah digunakan dalam evaluasi resmi; rilis penuh segera hadir) yang dirancang untuk menjadikan model sebagai agen otonom yang andal.
Bersama-sama, keduanya menawarkan salah satu rasio biaya-kinerja terkuat di ranah AI agen berbobot terbuka dan dapat diakses melalui API per Agustus 2026.
Poin Utama
- Lonjakan kemampuan agen besar hanya lewat post-training: Arsitektur 284B/13B yang sama seperti pratinjau April, tetapi skor jauh lebih tinggi (mis., Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
- Mengungguli DeepSeek-V4-Pro (Preview) pada beberapa benchmark agen meskipun parameter aktif jauh lebih sedikit.
- Kompetitif dengan model proprietary papan atas (mendekati Claude Opus 4.8 pada beberapa tugas agen) dengan biaya jauh lebih rendah.
- Native 1M context, speculative decoding (DSpark), tiga tingkat upaya penalaran (low/high/max), lisensi MIT, open weights.
- Dukungan resmi untuk Responses API dan Codex (CLI, desktop, ekstensi VS Code).
- DeepSeek Harness (mode minimal sudah digunakan dalam evaluasi) adalah kerangka kerja agen resmi dalam closed beta; rilis publik segera. DeepSeek Harness menyediakan lapisan runtime agen; model + harness = agen produksi.
- Ideal untuk agen coding volume tinggi, otomatisasi terminal, penggunaan tool, dan alur kerja konteks panjang.
- Akses model DeepSeek secara terjangkau dan dengan tooling terpadu melalui CometAPI (endpoint kompatibel OpenAI, harga kompetitif, routing multi-model).
Apa yang Baru di DeepSeek V4 Flash 0731?
Status Rilis Resmi Berubah
Perubahan produk terpenting adalah DeepSeek V4 Flash 0731 kini menjadi rilis resmi DeepSeek V4 Flash di API, dalam public beta. Change log 31 Juli DeepSeek menyebut developer dapat terus memanggil nama model yang sama, deepseek-v4-flash, untuk mengakses versi terbaru. Ini penting bagi migrasi karena tidak membutuhkan slug model baru dan memungkinkan tim menguji pembaruan di balik logika routing yang ada.
DeepSeek juga mengatakan pembaruan ini hanya meningkatkan API V4 Flash. API V4 Pro serta model di app/web tidak berubah oleh rilis 31 Juli, dan DeepSeek menyebut rilis resmi V4 Pro akan segera menyusul. Dengan kata lain, ini bukan penyegaran penuh keluarga DeepSeek V4. Ini adalah pembaruan Flash yang terarah.
Arsitektur Tetap, Post-Training Berubah
Arsitektur inti tetap tidak berubah: model Mixture-of-Experts (MoE) dengan 284 miliar total parameter dan hanya 13 miliar yang aktif per token, desain atensi hibrida yang dioptimalkan untuk konteks panjang, dan jendela konteks native 1 juta token. Modul decoding spekulatif (DSpark) dilampirkan untuk generasi yang lebih cepat. Model ini hanya teks, mendukung tingkat upaya penalaran yang dapat disetel (low / high / max), pemanggilan tool, output terstruktur, dan dirilis di bawah lisensi MIT yang permisif.
Pembedaan itu penting. Banyak pembaruan model membaik karena modelnya lebih besar. Pembaruan ini menarik karena DeepSeek mengklaim lompatan kemampuan agen besar tanpa menambah jejak parameter model. V4 Flash tetap menjadi model MoE 284B total, 13B aktif, yang jauh lebih kecil saat inferensi dibanding desain V4 Pro 1.6T total, 49B aktif.
Skor Pengodean Agen Melonjak
Tabel resmi DeepSeek menunjukkan peningkatan besar pada tugas terminal, pembangunan repositori, keamanan siber, rekayasa perangkat lunak, penggunaan tool, otomasi, dan full-stack coding. Lonjakan absolut terbesar dibanding Flash preview lama adalah pada DeepSWE: 54.4 versus 7.3, peningkatan 47.1 poin. Cybergym naik 38.0 poin, DSBench-Hard naik 33.8 poin, dan DSBench-FullStack naik 31.7 poin.
Inilah mengapa V4 Flash 0731 dibahas bukan sekadar sebagai “model cepat” biasa melainkan kandidat model default untuk agen coding. Nilai yang ditawarkan bukan sekadar chat murah. Ini adalah inferensi agen yang murah, konteks panjang, dan ramah tool.
Dukungan Responses API dan Codex Hadir
Change log 31 Juli DeepSeek menyebut V4 Flash resmi kini mendukung format Responses API secara native dan diadaptasi khusus untuk Codex. Panduan Responses API DeepSeek menyebut format ini ditambahkan untuk memenuhi kebutuhan Codex, menggunakan base URL https://api.deepseek.com, dan saat ini mendukung deepseek-v4-flash.
Ini penting karena alur kerja gaya Codex bukan sekadar sesi chat. Mereka membutuhkan item input dan output terstruktur, item penalaran, pemanggilan tool, operasi perubahan file, event streaming, pelaporan penggunaan, dan integrasi dengan klien agen coding. Dukungan DeepSeek bukan klon sempurna dari semua kapabilitas OpenAI Responses API, tetapi sudah cukup untuk menjadikan V4 Flash kandidat drop-in yang jauh lebih praktis untuk eksperimen agen coding.
Benchmark Kinerja untuk Versi Resmi V4-Flash
Catatan Benchmark yang Tak Boleh Diabaikan Developer
Hasil evaluasi resmi (dilaporkan DeepSeek pada model card) menunjukkan lompatan besar dibanding pratinjau dan, menakjubkan, dibanding V4-Pro Preview yang jauh lebih besar pada tugas berpusat pada agen. Evaluasi untuk benchmark agen-kode menggunakan mode minimal dari DeepSeek Harness (akan dirilis) pada upaya penalaran maksimum, temperature = 1.0, top_p = 0.95.
Ada dua implikasi. Pertama, hasil model sebagian adalah hasil model-dan-harness. Jika runtime agen Anda memiliki tool, izin shell, manajemen konteks, retry, aturan patch, atau penanganan kegagalan yang berbeda, Anda mungkin tidak mendapatkan skor yang sama. Kedua, reproduksi independen terbatas sampai DeepSeek merilis cukup banyak komponen harness dan setup evaluasi agar tim luar dapat menjalankan uji yang sebanding.
Tabel Benchmark Resmi DeepSeek
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Di sembilan benchmark ini, V4 Flash 0731 rata-ratanya 55.2. V4 Flash preview lama rata-rata 29.6, dan V4-Pro Preview rata-rata 34.9. Artinya V4 Flash 0731 sekitar 25.6 poin lebih tinggi dari Flash preview dan 20.3 poin lebih tinggi dari V4-Pro Preview pada tabel ini.
Sinyal Pihak Ketiga
ARC Prize melaporkan V4 Flash 0731 pada upaya maksimum mencetak 89.0% di ARC-AGI-1 Semi-Private dan 61.4% di ARC-AGI-2 Semi-Private, dengan biaya tercantum $0.02 dan $0.04 per tugas. Ini bukan benchmark agen coding, tetapi mendukung pandangan lebih luas bahwa model kompetitif pada tugas penalaran saat dijalankan pada upaya lebih tinggi.
Kenaikan sangat mencolok pada DeepSWE (loop agen rekayasa perangkat lunak) dan Cybergym. Pengukuran independen (mis., Artificial Analysis) melaporkan angka Terminal-Bench sedikit lebih rendah namun masih kuat sekitar 79%, mengonfirmasi arah peningkatan sekaligus mengingatkan bahwa angka dari vendor-harness cenderung optimistis.
Konteks tambahan dari evaluasi V4 sebelumnya dan agregator pihak ketiga menunjukkan kinerja pengetahuan dan coding yang kuat pada mode penalaran maksimum (GPQA Diamond ~88–91%, LiveCodeBench kisaran tinggi 80–90 tergantung sumber). Post-training 0731 secara khusus membuka keandalan agen yang kurang pada pratinjau.
DeepSeek-V4-Flash Kini Mendukung Responses API dan Codex
Tambahan yang penting secara strategis adalah dukungan native untuk OpenAI’s Responses API. Dokumentasi resmi DeepSeek menegaskan bahwa Responses API saat ini mendukung deepseek-v4-flash (dukungan Pro diperkirakan awal Agustus 2026). Base URL tetap https://api.deepseek.com.
Ini merupakan peningkatan besar pada pengalaman developer. Sebelum dukungan Responses API dan Codex, DeepSeek V4 Flash sudah bisa dipanggil sebagai model teks, tetapi agen coding harus menjembatani lebih banyak detail integrasi sendiri. Kini model dapat digunakan di alur kerja yang mengharapkan semantik bergaya Responses.
Cakupan Dukungan Responses API
Responses API DeepSeek membuat respons model dalam format OpenAI Responses API di /responses. Responses API mendukung model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, tools, pilihan tool, upaya penalaran, format teks, dan pelaporan penggunaan. API bersifat stateless, sehingga klien perlu mengirim riwayat percakapan lengkap untuk interaksi multi-giliran.
Detail kompatibilitas terpenting yang praktis:
deepseek-v4-flashsaat ini satu-satunya model yang didukung untuk Responses API.- Pesan
developerdiperlakukan sebagai pesansystem. - Function tools, streaming, dan tingkat upaya penalaran yang dapat disetel serta penelusuran web sisi server didukung.
- Jenis tool kustom hanya didukung untuk
apply_patch, yang penting untuk kompatibilitas Codex. - Input gambar dan file tidak didukung; bagian input gambar diganti dengan teks placeholder.
previous_response_id,conversation,store, mode background, metadata, dan beberapa fitur manajemen konteks tidak didukung.- Parameter yang tidak didukung mungkin diabaikan tanpa peringatan, jadi klien produksi harus menguji perilaku yang diharapkan secara eksplisit.
Bagi developer, poin kunci adalah bahwa dukungan Responses API bukan hanya detail sintaksis. Ini memungkinkan DeepSeek V4 Flash berada di jalur protokol yang digunakan oleh agen coding modern, terutama di mana pemanggilan fungsi, event streaming, item penalaran, dan penerapan patch perlu direpresentasikan secara konsisten.
Desain tanpa status (stateless) (klien mengelola riwayat percakapan). Contoh (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Detail lengkap dan panduan integrasi Codex: DeepSeek API Docs – Responses API dan Integrate with Codex.
Makna Dukungan Codex
Panduan integrasi Codex DeepSeek menyebut Codex berkomunikasi dengan model melalui Responses API, yang kini didukung DeepSeek secara native. Ini memungkinkan integrasi langsung dengan Codex (ekosistem agen coding OpenAI — CLI, aplikasi desktop ChatGPT, dan ekstensi VS Code).
Developer dapat mengonfigurasi penyedia kustom sekali saja melalui skrip setup atau dengan mengedit ~/.codex/config.toml dan berkas katalog model. Setelah konfigurasi, klien Codex mengenali DeepSeek-V4-Flash dan dapat menggunakan kapabilitas pemanggilan tool, apply_patch, penelusuran web, dan penalarannya.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspek | V4-Flash-0731 | V4-Pro (tipikal / Preview) |
|---|---|---|
| Total / Parameter Aktif | 284B / 13B | ~1.6T / 49B |
| Jendela Konteks | 1M tokens | 1M tokens |
| Kekuatan | Pengodean agen, terminal, biaya, kecepatan | Penalaran terdalam, pengetahuan, tugas tersulit |
| Keunggulan di Benchmark Agen | Menang pada suite agen 0731 yang dipublikasikan | Lebih kuat pada pengetahuan murni & multi-berkas kompleks di evaluasi sebelumnya |
| Harga API Tipikal | ~$0.14 in / $0.28 out (cache jauh lebih rendah) | Jauh lebih tinggi (historis 3–12×) |
| Paling Cocok Untuk | Agen volume tinggi, loop coding produksi, aplikasi sensitif biaya | Riset frontier, kapabilitas maksimum untuk tugas tunggal |
| Open Weights | Ya (MIT) | Ya (MIT) |
Mana yang Sebaiknya Dipakai Developer Terlebih Dahulu?
Pada benchmark agen spesifik yang dirilis bersama 0731, model Flash yang lebih kecil mengungguli Pro preview di seluruh daftar. Untuk pengambilan pengetahuan murni atau masalah penalaran paling sulit, Pro masih unggul pada banyak evaluasi independen dan sebelumnya. Dalam praktiknya, banyak tim kini menjadikan Flash default untuk mayoritas beban kerja agen dan hanya merutekan tugas paling menuntut ke Pro (atau model frontier lain).
Strategi routing itulah yang dibantu oleh CometAPI. Alih-alih mengunci satu model untuk semua beban kerja, gunakan CometAPI untuk memusatkan pemilihan model, logging, pelacakan biaya, dan kebijakan fallback. Contoh:
- Gunakan V4 Flash untuk ringkasan repositori, perencanaan refactor, draf code review, test terhasilkan, ekstraksi terstruktur, QA konteks panjang, dan loop agen berulang.
- Eskalasi ke V4 Pro atau model premium lain saat tugas memiliki risiko bisnis tinggi, kebutuhan ambigu, kode produksi rapuh, atau kegagalan berulang.
- Lacak metrik akhir yang penting: perbaikan diterima per dolar, tugas sukses per jam, atau menit review manusia yang dihemat.
Apa Itu DeepSeek Harness?
DeepSeek Harness adalah kerangka kerja agen / lapisan runtime resmi yang dibangun DeepSeek untuk menjadikan modelnya agen otonom yang andal. Perusahaan merumuskan persamaan dengan sederhana: Model + Harness = Agen.
Evaluasi resmi V4-Flash-0731 sudah menggunakan “mode minimal” dari DeepSeek Harness. Produk penuh masih bergulir (rekrutmen dan pengujian awal aktif sekitar akhir Juli–awal Agustus 2026). Tim dipimpin oleh Cui Tianyi (berlatar sistem trading kuantitatif), dan deskripsi pekerjaan menekankan integrasi mendalam dengan fitur DeepSeek-V4 seperti caching prefix, manajemen konteks panjang, optimasi KV-cache, rantai penggunaan tool, pemulihan error, dan retry otomatis.
Harness bukan pembungkus generik ala LangChain. Ia dirancang bersama model sehingga manajemen konteks, orkestrasi tool, pengumpulan bukti, dan loop perbaikan memanfaatkan efisiensi spesifik V4 (atensi sparse, caching, mode penalaran). Proyek komunitas dan harness pihak ketiga juga ada, tetapi Harness resmi menargetkan keterikatan model–runtime yang serapat mungkin.
Saat dirilis penuh, diharapkan menyediakan:
- Loop agen terstruktur untuk coding dan otomasi.
- Gerbang keamanan dan alur persetujuan.
- Penanganan konteks efisien untuk tugas jangka panjang.
- Observabilitas dan produksi artefak.
Sampai rilis penuh, developer sudah dapat meraih hasil kuat dengan memasangkan V4-Flash-0731 dengan kerangka agen yang ada atau menggunakan jalur Responses API + Codex.
Harga, Ketersediaan, dan Penerapan Praktis
- Harga API resmi (perkiraan): $0.14 / 1M token input (cache miss), ~$0.0028–0.03 pada cache hit, $0.28 / 1M token output. Batas konkurensi tinggi.
- Open weights di bawah MIT di Hugging Face; versi GGUF terkuantisasi tersedia luas untuk penggunaan lokal/self-hosted (membutuhkan VRAM besar—presisi penuh sangat besar).
- Speculative decoding (DSpark) dan atensi hibrida menjaga inferensi konteks panjang tetap relatif efisien.
- Engine inferensi yang didukung: vLLM, SGLang, dan lainnya dengan resep terdokumentasi.
Bagi banyak tim, jalur produksi termudah adalah gateway yang kompatibel OpenAI. CometAPI menawarkan akses terpadu ke model DeepSeek (termasuk seri V4) bersama ratusan model lain melalui satu endpoint (https://api.cometapi.com/v1). Keuntungannya termasuk penyederhanaan routing multi-model, harga kompetitif atau diskon dibanding penyedia langsung, analitik penggunaan, dan kemampuan beralih antara Flash, Pro, dan model lain tanpa mengubah kode aplikasi. Ini sangat berguna untuk sistem agenik yang mungkin fallback atau routing berdasarkan tingkat kesulitan/biaya.
Per artikel ini, DeepSeek V4 Flash di CometAPI mencantumkan harga input awal $0.12 per 1M token, harga output $0.24 per 1M token dalam tabel perbandingan, uptime 100.0% selama 24 jam, dan respons teramati 2941 ms. DeepSeek juga memperingatkan bahwa harga API keseluruhan dapat naik dalam waktu dekat. Karena harga penyedia dapat berubah, bahasa publikasi yang aman adalah: periksa katalog live CometAPI dan harga resmi DeepSeek sebelum menganggarkan produksi.
Rekomendasi Praktis untuk Developer dan Tim
- Mulai dengan Flash-0731 untuk pengodean agen — Rasio biaya/kinerja saat ini unggul untuk terminal, repositori, dan alur kerja multi-tool. Gunakan upaya penalaran maksimum + loop bergaya Harness untuk tugas tersulit.
- Untuk inferensi lokal, unduh dari Hugging Face dan ikuti resep vLLM/SGLang resmi yang mengaktifkan DSpark.
- Integrasikan melalui Responses API jika Anda sudah menggunakan Codex atau menginginkan semantik pemanggilan tool modern.
- Self-host atau gunakan bobot terkuantisasi untuk kontrol biaya maksimum dan privasi data.
- Rute secara cerdas — Flash untuk volume, Pro (atau model besar lain) untuk long-tail masalah yang sangat sulit.
- Pertimbangkan CometAPI untuk akses multi-model yang disederhanakan, terutama jika stack Anda sudah mencampur DeepSeek dengan penyedia lain.
Kesimpulan
DeepSeek-V4-Flash-0731 menandai momen penting dalam AI agen yang efisien. Dengan menghadirkan kinerja agen kompetitif frontier dari MoE yang relatif kompak (13B aktif) melalui post-training terfokus, dan dengan memasangkannya dengan Harness yang purpose-built serta kompatibilitas API modern (Responses + Codex), DeepSeek mengatur ulang ekspektasi untuk agen coding dan otomasi yang hemat biaya.
Baik Anda self-host open weights, memanggil API resmi, atau merutekan melalui gateway terpadu seperti CometAPI, V4-Flash-0731 + ekosistem Harness yang berkembang menawarkan fondasi berkinerja tinggi dan hemat biaya untuk generasi berikutnya dari agen AI.
FAQ
Apa itu DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 adalah rilis public beta resmi DeepSeek V4 Flash di DeepSeek API, diumumkan pada change log 31 Juli 2026. Versi ini menggantikan versi pratinjau sambil mempertahankan nama model API yang sama, deepseek-v4-flash.
Apa yang baru di DeepSeek V4 Flash 0731?
Perubahan utama adalah kinerja benchmark agen yang lebih kuat, dukungan native Responses API, adaptasi Codex, dan build V4 Flash resmi hasil post-training ulang. DeepSeek mengatakan arsitektur dan ukuran model tetap sama seperti versi pratinjau.
Apakah DeepSeek V4 Flash 0731 mendukung Codex?
Ya. Panduan Codex DeepSeek menyebut hanya deepseek-v4-flash yang saat ini mendukung integrasi Codex. Ia bekerja melalui Responses API dan dapat dikonfigurasi untuk Codex CLI, aplikasi desktop ChatGPT, dan ekstensi IDE Codex untuk VS Code.
Apa itu DeepSeek Harness?
DeepSeek Harness adalah kerangka agen dari DeepSeek untuk menjadikan model bahasa sebagai agen coding atau alur kerja yang otonom. Laporan publik menggambarkan harness sebagai lapisan yang mengelola tool, konteks, file, eksekusi perintah, dan alur kerja multi-langkah. DeepSeek menggunakan Harness mode minimal dalam setup benchmark V4 Flash 0731.
Bagaimana cara mengakses DeepSeek V4 Flash melalui CometAPI?
Gunakan endpoint yang kompatibel OpenAI milik CometAPI dengan model ID deepseek-v4-flash. Halaman model CometAPI menyediakan contoh cURL, Python, dan JavaScript untuk /v1/chat/completions, plus spesifikasi model, harga, dan informasi uptime.
Apakah DeepSeek V4 Flash lebih baik daripada DeepSeek V4 Pro?
Untuk tabel benchmark 31 Juli, V4 Flash 0731 mengalahkan V4-Pro Preview di benchmark agen yang terdaftar. Itu tidak berarti Flash selalu lebih baik daripada Pro. V4 Pro lebih besar dan tetap lebih kuat pada banyak tugas berat pengetahuan dan penalaran sulit dalam model card. Gunakan Flash sebagai default untuk alur kerja agen yang sensitif biaya dan Pro sebagai jalur eskalasi.
