DeepSeek V4.1 Flash menggantikan fase beta berumur pendek dengan rilis produksi yang dibangun di atas komputasi asimetris, multimodalitas native, tolok ukur agen yang lebih kuat, dan harga API yang jauh lebih rendah.
TL;DR
DeepSeek V4.1 Flash kini menjadi API resmi dan model open-weight, bukan endpoint beta yang akan kedaluwarsa. DeepSeek menyebutnya sebagai model Mixture-of-Experts dengan 552B parameter yang menggunakan arsitektur baru Causal-Encoder-Decoder. Hanya 8B parameter yang diaktifkan saat memproses input, sementara 16B diaktifkan selama pembuatan output. Desain asimetris tersebut dimaksudkan untuk mengurangi komputasi pada prompt panjang tanpa melemahkan tahap generasi autoregresif.
Nama model API produksi adalah deepseek-flash. Model ini mendukung jendela konteks 1M token, hingga 384K token output, mode berpikir dan non-berpikir, output JSON, pemanggilan alat, Responses API, API yang kompatibel dengan Anthropic, serta input visi native. Tabel tolok ukur resmi DeepSeek menunjukkan peningkatan material dibanding V4 Flash 0731 dan V4 Pro 0813 pada tugas coding, agen, keamanan siber, dan multimodal.
Perubahan harga sama pentingnya. Pada jam sibuk, V4.1 Flash berharga $0.006 per satu juta token input cache-hit, $0.30 per satu juta token input cache-miss, dan $1.20 per satu juta token output. Tarif off-peak adalah setengah dari jumlah tersebut.
Key Takeaways
- DeepSeek V4.1 Flash adalah model rilis dengan bobot terbuka; pengenal sementara
deepseek-v4.1-flash-expires-on-0910bukan lagi referensi produksi yang benar. - Desain MoE 552B-nya mengaktifkan 8B parameter untuk input dan 16B untuk output, menciptakan profil efisiensi yang berbeda dari arsitektur V4 Flash dengan total 284B/13B aktif.
- Multimodalitas native menjadi bagian dari model utama alih-alih cabang Vision Exp terpisah.
- Perbandingan resmi menunjukkan V4.1 Flash unggul atas V4 Pro 0813 pada sebagian besar tolok ukur agen dan coding yang dipilih, meski tidak memimpin setiap tolok ukur pengetahuan atau terminal terhadap semua pesaing terdepan.
- Cache KV global turun menjadi 890 byte per token, sekitar 3,9 kali lebih kecil dari V4 Flash dan kira-kira seperempat dari jejak sebelumnya.
- Harga API puncak adalah $0.006 untuk input cache-hit, $0.30 untuk input cache-miss, dan $1.20 untuk output per satu juta token; harga off-peak 50% lebih rendah.
What Is DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash adalah model fondasi DeepSeek edisi September 2026 yang berfokus pada efisiensi untuk penalaran, coding, agen, dan pemahaman multimodal. Pengumuman resmi menggambarkannya sebagai model MoE dengan 552B parameter yang meningkatkan kapabilitas sambil mengurangi jumlah komputasi dan memori yang dibutuhkan untuk pemrosesan input.
Perubahan kunci adalah arsitektural. V4 Flash sebelumnya menggunakan anggaran parameter aktif yang sama sepanjang inferensi. V4.1 Flash memisahkan beban kerja input dan output: 8B parameter aktif saat mengodekan prompt dan 16B aktif saat menghasilkan jawaban. DeepSeek menyebut desain ini Causal-Encoder-Decoder.
| Date | Status | Model ID |
|---|---|---|
| Sep 8 | Beta terbatas | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Rilis produksi | deepseek-flash |
DeepSeek V4.1 Flash Specification:
| Specification | DeepSeek V4.1 Flash |
|---|---|
| Release status | Rilis API resmi dan model open-weight |
| Architecture | Mixture-of-Experts dengan struktur Causal-Encoder-Decoder |
| Total parameters | 552B |
| Activated parameters | 8B untuk input; 16B untuk output |
| Context window | 1M token |
| Maximum output | 384K token |
| Input modalities | Teks dan gambar |
| Output modality | Teks |
| Production API model name | deepseek-flash |
| Thinking modes | Mode berpikir dan non-berpikir |
| API features | Output JSON, pemanggilan alat, Responses API, Anthropic API, prefix completion, FIM completion |
| Open weights | Dirilis di Hugging Face |
How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder
Model bahasa tradisional berbasis decoder-only pada dasarnya menggunakan tumpukan besar yang sama untuk pemrosesan prompt dan generasi token. DeepSeek V4.1 Flash menetapkan kapasitas aktif yang berbeda untuk tahap tersebut.
Selama tahap input, model memproses prompt dengan jejak aktif 8B. Tahap ini dapat memeriksa konteks teks atau gambar yang diberikan secara efisien karena jawaban penuh belum dihasilkan. Selama tahap output, model mengaktifkan 16B parameter dan melanjutkan generasi kausal token demi token. Desain ini menghemat komputasi pada pengodean prompt sekaligus mempertahankan kapasitas aktif lebih besar untuk penalaran dan pembuatan respons.
DeepSeek belum memublikasikan setiap detail implementasi dalam pengumuman, sehingga deskripsi paling aman adalah fungsional: arsitektur bersifat asimetris, tahap input dan output menggunakan anggaran parameter aktif berbeda, dan sistem yang dihasilkan mengurangi memori inferensi dan biaya.
KV Cache Reduction
Hasil memori dapat diukur. DeepSeek melaporkan cache KV global sebesar 890 byte per token untuk V4.1 Flash, dibandingkan 3,514 byte untuk V4 Flash, 48,068 byte untuk V3.2, dan 389,120 byte untuk V1. Angka V4.1 kira-kira 3,9 kali lebih kecil daripada V4 Flash.
Untuk agen ber-konteks panjang, hal ini penting melampaui satu tolok ukur. Cache KV yang lebih kecil mengurangi tekanan high-bandwidth-memory saat permintaan aktif dan menurunkan jumlah state yang harus dipindahkan ke penyimpanan yang lebih lambat. DeepSeek mengatakan V4.1 Flash membutuhkan kira-kira seperempat HBM dan seperdelapan kapasitas SSD yang diperlukan model sebelumnya untuk beban kerja cache yang sebanding.
DeepSeek V4.1 Flash Features
Native Multimodal Input
V4.1 Flash menerima gambar sebagai bagian dari API model utama. Ini menggantikan pemisahan sebelumnya antara V4 Flash teks-saja dan endpoint V4 Flash Vision eksperimental. Pengembang kini dapat membangun alur kerja pemahaman dokumen, analisis grafik, interpretasi tangkapan layar, dan agen visual pada keluarga model produksi yang sama.
Long-Context Reasoning
Spesifikasi API resmi mempertahankan jendela konteks 1M token dan memungkinkan hingga 384K token output. Ini membuat model cocok untuk coding skala repositori, analisis multi-dokumen, sesi agen jangka panjang, dan alur kerja yang perlu mempertahankan riwayat alat yang besar.
Production API Features
Model mendukung mode berpikir dan non-berpikir, output JSON terstruktur, pemanggilan alat, Responses API, antarmuka yang kompatibel dengan Anthropic, chat-prefix completion, dan FIM completion dalam mode non-berpikir. Kapabilitas ini menjadikan V4.1 Flash pengganti produksi langsung untuk banyak beban kerja agen dan coding V4 Flash.
Open Weights
DeepSeek telah merilis bobot V4.1 Flash dan laporan teknis. Rilis ini meningkatkan reprodusibilitas, namun model tetap sangat besar: pengumuman DeepSeek meminta organisasi yang tertarik pada penerapan besar untuk merencanakan sekitar 2.000 GPU plus klaster penyimpanan.
DeepSeek V4.1 Flash Benchmark Performance
Hasil resmi mengubah penilaian sebelumnya bahwa V4.1 tidak memiliki bukti tolok ukur. DeepSeek kini menyediakan tabel luas yang mencakup pengetahuan, matematika, coding, agen terminal, keamanan siber, otomasi, dan tugas agen multimodal.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
Dalam delapan tolok ukur terpilih ini, V4.1 Flash mengungguli V4 Pro 0813 pada tujuh tes dan mengungguli V4 Flash 0731 pada semua delapan. Kenaikan terbesar muncul di rekayasa perangkat lunak dan agen: DeepSWE naik 11.5 poin dibanding V4 Pro dan 19.8 dibanding V4 Flash, sementara Automation-Bench meningkat 11.6 dan 17.1 poin masing-masing.
Hasil tersebut tetap perlu ditafsirkan dengan hati-hati. V4.1 Flash berada di bawah V4 Pro pada GPQA Diamond, dan grafik resmi penuh menunjukkan bahwa Claude Opus 5 dan GPT-5.6 Sol tetap unggul pada Terminal-Bench 3.0. Kesimpulan yang berguna adalah bahwa V4.1 Flash secara material meningkatkan keseimbangan efisiensi-kapabilitas DeepSeek; tabel tolok ukur tidak membuktikan kepemimpinan universal di setiap tugas.
DeepSeek V4.1 Flash API Pricing
DeepSeek menggunakan penagihan peak dan off-peak. Jam sibuk adalah 01:00–04:00 dan 06:00–10:00 UTC, Senin hingga Jumat; semua periode lainnya, termasuk akhir pekan, menggunakan tarif off-peak. Dokumentasi harga saat ini menyatakan bahwa harga off-peak adalah setengah dari harga peak.
| Price per 1M tokens | V4.1 Flash off-peak | V4.1 Flash peak | V4 Pro 0813 off-peak | V4 Pro 0813 peak |
|---|---|---|---|---|
| Cache-hit input | $0.003 | $0.006 | $0.022 | $0.044 |
| Cache-miss input | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

Penghematan sangat besar. Untuk beban kerja yang menggunakan 100 juta token input cache-miss dan 10 juta token output, V4.1 Flash berbiaya sekitar $21 saat off-peak atau $42 pada jam sibuk. Campuran token yang sama pada tarif V4 Pro 0813 yang dipublikasikan berbiaya sekitar $85.80 saat off-peak atau $171.60 pada jam sibuk. V4.1 Flash kira-kira 75.5% lebih murah dalam contoh ini.
Caching prompt memperkuat keunggulan bagi agen yang berulang kali menggunakan instruksi sistem, konteks repositori, atau dokumen. Tarif cache-hit V4.1 adalah 50 kali lebih rendah daripada tarif cache-miss pada kedua periode penagihan.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Total parameters | 552B | 284B | 1.6T |
| Activated parameters | 8B input / 16B output | 13B | 49B |
| Architecture focus | Efisiensi input/output asimetris | V4 MoE ringan | Kapasitas V4 maksimum |
| Native vision | Ya | Varian Vision Exp terpisah | Tidak |
| Context window | 1M | 1M | 1M |
| Maximum output | 384K | 384K | 384K |
| API status on DeepSeek | Model produksi saat ini | Pensiun; nama lama diarahkan ke V4.1 Flash | Dijadwalkan diarahkan ke V4.1 Flash sejak 14 Sep 2026 |
| Best fit | Agen umum, coding, visi, throughput tinggi | Kompatibilitas migrasi saja | Beban Pro yang ada selama transisi |
V4.1 Flash lebih besar dalam total parameter dibanding V4 Flash namun dapat lebih murah untuk dilayani karena tahap input-nya hanya mengaktifkan 8B parameter dan menggunakan cache KV yang jauh lebih kecil. Dibanding V4 Pro, model ini mengaktifkan jauh lebih sedikit parameter namun mengungguli Pro pada sebagian besar tolok ukur agen dan coding yang dipilih di atas.
API Access and Migration
Nama model produksi DeepSeek adalah deepseek-flash. Aplikasi yang ada dapat mempertahankan base URL yang kompatibel dengan OpenAI https://api.deepseek.com atau base URL yang kompatibel dengan Anthropic https://api.deepseek.com/anthropic.
- Perbarui nama model menjadi
deepseek-flash. - Pertahankan base URL DeepSeek dan metode autentikasi yang ada.
- Uji ulang mode berpikir, pemanggilan alat, input visi, latensi, dan penggunaan token dengan prompt produksi.
- Pantau alias lama:
deepseek-v4-flashdandeepseek-v4-flash-vision-expkini diarahkan ke V4.1 Flash, sementaradeepseek-v4-prodijadwalkan diarahkan ke V4.1 Flash mulai 14 September 2026 hingga rilis V4.1 Pro di masa depan.
Bagi pengguna CometAPI, DeepSeek V4.1 API di CometAPI kini aktif bersama DeepSeek V4 Flash API. Sebelum mengalihkan trafik produksi, konfirmasikan nama model akhir, harga, dan pemetaan alias di dasbor CometAPI, karena penyedia pihak ketiga dapat berbeda dari penamaan API resmi dan tarif penagihan DeepSeek.
Who Should Use DeepSeek V4.1 Flash?
V4.1 Flash sangat cocok untuk agen coding, analisis repositori, otomasi terminal, alur kerja dokumen multimodal, asisten ber-konteks panjang, dan sistem ber-volume tinggi yang menggunakan alat. Peningkatan tolok ukur terkonsentrasi pada beban kerja yang paling diuntungkan oleh memori cache yang lebih rendah dan harga token yang lebih rendah.
Tim yang sudah menggunakan V4 Flash harus memperlakukannya sebagai kandidat migrasi langsung. Tim yang menggunakan V4 Pro harus menguji dengan cermat, tetapi data tolok ukur dan harga milik DeepSeek kini menjadikan V4.1 Flash default yang lebih ekonomis untuk banyak beban kerja kelas Pro.
Self-hosting adalah keputusan berbeda. Bobot terbuka tidak menjadikan model 552B ringan. Organisasi harus membandingkan biaya penerapan GPU dan penyimpanan besar dengan penggunaan API hosted sebelum berkomitmen pada inferensi lokal.
Limitations and Open Questions
- Hasil tolok ukur berasal dari setup evaluasi resmi DeepSeek; replikasi independen diperlukan untuk mengukur performa di berbagai harness dan lingkungan alat.
- Dukungan multimodal native telah dikonfirmasi, tetapi tim aplikasi harus memvalidasi format gambar yang didukung, perhitungan token, dan perilaku visi terhadap API live.
- Alias model lama kini mengubah model di balik nama yang ada, yang dapat mengubah output tanpa perubahan kode aplikasi.
- V4.1 Flash mengurangi kebutuhan infrastruktur dibanding model DeepSeek sebelumnya, tetapi penerapan open-weight-nya masih membutuhkan komputasi dan penyimpanan substansial.
- Endpoint V4.1 khusus CometAPI dan harga final harus dikonfirmasi di konsol live sebelum penggunaan produksi.
Final Verdict
DeepSeek V4.1 Flash adalah pembaruan arsitektur dan produk yang besar. Model MoE 552B ini menggabungkan tahap input aktif 8B, tahap output aktif 16B, visi native, jendela konteks 1M token, dan cache KV yang terkompresi tajam. Pilihan desain tersebut diterjemahkan menjadi tolok ukur coding dan agen resmi yang lebih kuat dengan harga API yang jauh lebih rendah dibanding V4 Pro 0813.
Perubahan paling praktis adalah konsolidasi. V4.1 Flash menghadirkan teks, visi, penalaran, penggunaan alat, dan operasi konteks panjang ke dalam satu nama model produksi. Untuk sebagian besar integrasi DeepSeek baru, deepseek-flash kini menjadi titik awal yang logis; V4 Pro menjadi perbandingan migrasi alih-alih pilihan otomatis untuk pekerjaan sulit.
FAQ
Is DeepSeek V4.1 Flash officially released?
Ya. Model ini tersedia melalui API DeepSeek dengan nama model deepseek-flash, dan DeepSeek telah merilis bobot terbuka serta laporan teknis.
Is the temporary V4.1 beta model ID still required?
Tidak. deepseek-v4.1-flash-expires-on-0910 adalah pengenal beta berumur pendek. Aplikasi produksi harus menggunakan deepseek-flash.
How many parameters does DeepSeek V4.1 Flash have?
Model ini memiliki total 552B parameter. Model mengaktifkan 8B parameter selama pemrosesan input dan 16B selama pembuatan output.
Does DeepSeek V4.1 Flash support images?
Ya. Input visi bersifat native pada model produksi, sehingga endpoint V4 Flash Vision Exp terpisah tidak lagi diperlukan.
Is V4.1 Flash better than V4 Pro?
Model ini memimpin V4 Pro 0813 pada sebagian besar perbandingan coding, agen, otomasi, dan keamanan siber yang dipublikasikan DeepSeek, tetapi V4 Pro tetap unggul pada GPQA Diamond. Tim harus mengevaluasi keduanya terhadap prompt masing-masing sebelum migrasi.
How much does the API cost?
Pada jam sibuk, tarif per satu juta token adalah $0.006 untuk input cache-hit, $0.30 untuk input cache-miss, dan $1.20 untuk output. Tarif off-peak adalah setengah dari harga tersebut.
What happens to the old V4 model names?
Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp diarahkan ke V4.1 Flash. DeepSeek menyatakan deepseek-v4-pro juga akan diarahkan ke V4.1 Flash mulai 14 September 2026 hingga V4.1 Pro dirilis.
Can I use DeepSeek V4.1 Flash through CometAPI?
Ya. CometAPI kini menawarkan endpoint DeepSeek V4.1 API. Sebelum mengirim trafik produksi, konfirmasikan nama model, harga, dan fitur yang didukung secara tepat di konsol CometAPI, karena penyedia pihak ketiga dapat menggunakan konvensi penamaan atau tarif penagihan yang berbeda dari API resmi DeepSeek.
