GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Riset CometAPI

Apa itu DeepSeek V4.1 Flash? Arsitektur, Fitur & Harga

Penjelasan DeepSeek V4.1 Flash: 552B MoE dengan Causal-Encoder-Decoder, penghematan cache KV, benchmark, harga API, visi native & perbandingan V4 Flash/V4 Pro.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 10, 2026 12 menit baca
Apa itu DeepSeek V4.1 Flash? Arsitektur, Fitur & Harga
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DeepSeek V4.1 Flash menggantikan fase beta berumur pendek dengan rilis produksi yang dibangun di atas komputasi asimetris, multimodalitas native, tolok ukur agen yang lebih kuat, dan harga API yang jauh lebih rendah.

TL;DR

DeepSeek V4.1 Flash kini menjadi API resmi dan model open-weight, bukan endpoint beta yang akan kedaluwarsa. DeepSeek menyebutnya sebagai model Mixture-of-Experts dengan 552B parameter yang menggunakan arsitektur baru Causal-Encoder-Decoder. Hanya 8B parameter yang diaktifkan saat memproses input, sementara 16B diaktifkan selama pembuatan output. Desain asimetris tersebut dimaksudkan untuk mengurangi komputasi pada prompt panjang tanpa melemahkan tahap generasi autoregresif.

Nama model API produksi adalah deepseek-flash. Model ini mendukung jendela konteks 1M token, hingga 384K token output, mode berpikir dan non-berpikir, output JSON, pemanggilan alat, Responses API, API yang kompatibel dengan Anthropic, serta input visi native. Tabel tolok ukur resmi DeepSeek menunjukkan peningkatan material dibanding V4 Flash 0731 dan V4 Pro 0813 pada tugas coding, agen, keamanan siber, dan multimodal.

Perubahan harga sama pentingnya. Pada jam sibuk, V4.1 Flash berharga $0.006 per satu juta token input cache-hit, $0.30 per satu juta token input cache-miss, dan $1.20 per satu juta token output. Tarif off-peak adalah setengah dari jumlah tersebut.

Key Takeaways

  • DeepSeek V4.1 Flash adalah model rilis dengan bobot terbuka; pengenal sementara deepseek-v4.1-flash-expires-on-0910 bukan lagi referensi produksi yang benar.
  • Desain MoE 552B-nya mengaktifkan 8B parameter untuk input dan 16B untuk output, menciptakan profil efisiensi yang berbeda dari arsitektur V4 Flash dengan total 284B/13B aktif.
  • Multimodalitas native menjadi bagian dari model utama alih-alih cabang Vision Exp terpisah.
  • Perbandingan resmi menunjukkan V4.1 Flash unggul atas V4 Pro 0813 pada sebagian besar tolok ukur agen dan coding yang dipilih, meski tidak memimpin setiap tolok ukur pengetahuan atau terminal terhadap semua pesaing terdepan.
  • Cache KV global turun menjadi 890 byte per token, sekitar 3,9 kali lebih kecil dari V4 Flash dan kira-kira seperempat dari jejak sebelumnya.
  • Harga API puncak adalah $0.006 untuk input cache-hit, $0.30 untuk input cache-miss, dan $1.20 untuk output per satu juta token; harga off-peak 50% lebih rendah.

What Is DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash adalah model fondasi DeepSeek edisi September 2026 yang berfokus pada efisiensi untuk penalaran, coding, agen, dan pemahaman multimodal. Pengumuman resmi menggambarkannya sebagai model MoE dengan 552B parameter yang meningkatkan kapabilitas sambil mengurangi jumlah komputasi dan memori yang dibutuhkan untuk pemrosesan input.

Perubahan kunci adalah arsitektural. V4 Flash sebelumnya menggunakan anggaran parameter aktif yang sama sepanjang inferensi. V4.1 Flash memisahkan beban kerja input dan output: 8B parameter aktif saat mengodekan prompt dan 16B aktif saat menghasilkan jawaban. DeepSeek menyebut desain ini Causal-Encoder-Decoder.

DateStatusModel ID
Sep 8Beta terbatasdeepseek-v4.1-flash-expires-on-0910
Sep 10Rilis produksideepseek-flash

DeepSeek V4.1 Flash Specification:

SpecificationDeepSeek V4.1 Flash
Release statusRilis API resmi dan model open-weight
ArchitectureMixture-of-Experts dengan struktur Causal-Encoder-Decoder
Total parameters552B
Activated parameters8B untuk input; 16B untuk output
Context window1M token
Maximum output384K token
Input modalitiesTeks dan gambar
Output modalityTeks
Production API model namedeepseek-flash
Thinking modesMode berpikir dan non-berpikir
API featuresOutput JSON, pemanggilan alat, Responses API, Anthropic API, prefix completion, FIM completion
Open weightsDirilis di Hugging Face

How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder

Model bahasa tradisional berbasis decoder-only pada dasarnya menggunakan tumpukan besar yang sama untuk pemrosesan prompt dan generasi token. DeepSeek V4.1 Flash menetapkan kapasitas aktif yang berbeda untuk tahap tersebut.

Selama tahap input, model memproses prompt dengan jejak aktif 8B. Tahap ini dapat memeriksa konteks teks atau gambar yang diberikan secara efisien karena jawaban penuh belum dihasilkan. Selama tahap output, model mengaktifkan 16B parameter dan melanjutkan generasi kausal token demi token. Desain ini menghemat komputasi pada pengodean prompt sekaligus mempertahankan kapasitas aktif lebih besar untuk penalaran dan pembuatan respons.

DeepSeek belum memublikasikan setiap detail implementasi dalam pengumuman, sehingga deskripsi paling aman adalah fungsional: arsitektur bersifat asimetris, tahap input dan output menggunakan anggaran parameter aktif berbeda, dan sistem yang dihasilkan mengurangi memori inferensi dan biaya.

KV Cache Reduction

Hasil memori dapat diukur. DeepSeek melaporkan cache KV global sebesar 890 byte per token untuk V4.1 Flash, dibandingkan 3,514 byte untuk V4 Flash, 48,068 byte untuk V3.2, dan 389,120 byte untuk V1. Angka V4.1 kira-kira 3,9 kali lebih kecil daripada V4 Flash.

Apa itu DeepSeek V4.1 Flash? Arsitektur, Fitur & Harga

Untuk agen ber-konteks panjang, hal ini penting melampaui satu tolok ukur. Cache KV yang lebih kecil mengurangi tekanan high-bandwidth-memory saat permintaan aktif dan menurunkan jumlah state yang harus dipindahkan ke penyimpanan yang lebih lambat. DeepSeek mengatakan V4.1 Flash membutuhkan kira-kira seperempat HBM dan seperdelapan kapasitas SSD yang diperlukan model sebelumnya untuk beban kerja cache yang sebanding.

DeepSeek V4.1 Flash Features

Native Multimodal Input

V4.1 Flash menerima gambar sebagai bagian dari API model utama. Ini menggantikan pemisahan sebelumnya antara V4 Flash teks-saja dan endpoint V4 Flash Vision eksperimental. Pengembang kini dapat membangun alur kerja pemahaman dokumen, analisis grafik, interpretasi tangkapan layar, dan agen visual pada keluarga model produksi yang sama.

Long-Context Reasoning

Spesifikasi API resmi mempertahankan jendela konteks 1M token dan memungkinkan hingga 384K token output. Ini membuat model cocok untuk coding skala repositori, analisis multi-dokumen, sesi agen jangka panjang, dan alur kerja yang perlu mempertahankan riwayat alat yang besar.

Production API Features

Model mendukung mode berpikir dan non-berpikir, output JSON terstruktur, pemanggilan alat, Responses API, antarmuka yang kompatibel dengan Anthropic, chat-prefix completion, dan FIM completion dalam mode non-berpikir. Kapabilitas ini menjadikan V4.1 Flash pengganti produksi langsung untuk banyak beban kerja agen dan coding V4 Flash.

Open Weights

DeepSeek telah merilis bobot V4.1 Flash dan laporan teknis. Rilis ini meningkatkan reprodusibilitas, namun model tetap sangat besar: pengumuman DeepSeek meminta organisasi yang tertarik pada penerapan besar untuk merencanakan sekitar 2.000 GPU plus klaster penyimpanan.

DeepSeek V4.1 Flash Benchmark Performance

Hasil resmi mengubah penilaian sebelumnya bahwa V4.1 tidak memiliki bukti tolok ukur. DeepSeek kini menyediakan tabel luas yang mencakup pengetahuan, matematika, coding, agen terminal, keamanan siber, otomasi, dan tugas agen multimodal.

Apa itu DeepSeek V4.1 Flash? Arsitektur, Fitur & Harga

BenchmarkDeepSeek V4.1 FlashV4 Pro 0813V4 Flash 0731
GPQA Diamond90.992.489.9
Codeforces rating347133483289
MathArena Apex65.665.358.6
Terminal-Bench 2.190.687.982.7
DeepSWE v1.174.262.754.4
NL2Repo-Bench65.461.554.2
CyberGym88.183.376.7
Automation-Bench54.843.237.7

Dalam delapan tolok ukur terpilih ini, V4.1 Flash mengungguli V4 Pro 0813 pada tujuh tes dan mengungguli V4 Flash 0731 pada semua delapan. Kenaikan terbesar muncul di rekayasa perangkat lunak dan agen: DeepSWE naik 11.5 poin dibanding V4 Pro dan 19.8 dibanding V4 Flash, sementara Automation-Bench meningkat 11.6 dan 17.1 poin masing-masing.

Hasil tersebut tetap perlu ditafsirkan dengan hati-hati. V4.1 Flash berada di bawah V4 Pro pada GPQA Diamond, dan grafik resmi penuh menunjukkan bahwa Claude Opus 5 dan GPT-5.6 Sol tetap unggul pada Terminal-Bench 3.0. Kesimpulan yang berguna adalah bahwa V4.1 Flash secara material meningkatkan keseimbangan efisiensi-kapabilitas DeepSeek; tabel tolok ukur tidak membuktikan kepemimpinan universal di setiap tugas.

DeepSeek V4.1 Flash API Pricing

DeepSeek menggunakan penagihan peak dan off-peak. Jam sibuk adalah 01:00–04:00 dan 06:00–10:00 UTC, Senin hingga Jumat; semua periode lainnya, termasuk akhir pekan, menggunakan tarif off-peak. Dokumentasi harga saat ini menyatakan bahwa harga off-peak adalah setengah dari harga peak.

Price per 1M tokensV4.1 Flash off-peakV4.1 Flash peakV4 Pro 0813 off-peakV4 Pro 0813 peak
Cache-hit input$0.003$0.006$0.022$0.044
Cache-miss input$0.15$0.30$0.66$1.32
Output$0.60$1.20$1.98$3.96

Apa itu DeepSeek V4.1 Flash? Arsitektur, Fitur & Harga

Penghematan sangat besar. Untuk beban kerja yang menggunakan 100 juta token input cache-miss dan 10 juta token output, V4.1 Flash berbiaya sekitar $21 saat off-peak atau $42 pada jam sibuk. Campuran token yang sama pada tarif V4 Pro 0813 yang dipublikasikan berbiaya sekitar $85.80 saat off-peak atau $171.60 pada jam sibuk. V4.1 Flash kira-kira 75.5% lebih murah dalam contoh ini.

Caching prompt memperkuat keunggulan bagi agen yang berulang kali menggunakan instruksi sistem, konteks repositori, atau dokumen. Tarif cache-hit V4.1 adalah 50 kali lebih rendah daripada tarif cache-miss pada kedua periode penagihan.

DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro

DimensionDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Pro
Total parameters552B284B1.6T
Activated parameters8B input / 16B output13B49B
Architecture focusEfisiensi input/output asimetrisV4 MoE ringanKapasitas V4 maksimum
Native visionYaVarian Vision Exp terpisahTidak
Context window1M1M1M
Maximum output384K384K384K
API status on DeepSeekModel produksi saat iniPensiun; nama lama diarahkan ke V4.1 FlashDijadwalkan diarahkan ke V4.1 Flash sejak 14 Sep 2026
Best fitAgen umum, coding, visi, throughput tinggiKompatibilitas migrasi sajaBeban Pro yang ada selama transisi

V4.1 Flash lebih besar dalam total parameter dibanding V4 Flash namun dapat lebih murah untuk dilayani karena tahap input-nya hanya mengaktifkan 8B parameter dan menggunakan cache KV yang jauh lebih kecil. Dibanding V4 Pro, model ini mengaktifkan jauh lebih sedikit parameter namun mengungguli Pro pada sebagian besar tolok ukur agen dan coding yang dipilih di atas.

API Access and Migration

Nama model produksi DeepSeek adalah deepseek-flash. Aplikasi yang ada dapat mempertahankan base URL yang kompatibel dengan OpenAI https://api.deepseek.com atau base URL yang kompatibel dengan Anthropic https://api.deepseek.com/anthropic.

  1. Perbarui nama model menjadi deepseek-flash.
  2. Pertahankan base URL DeepSeek dan metode autentikasi yang ada.
  3. Uji ulang mode berpikir, pemanggilan alat, input visi, latensi, dan penggunaan token dengan prompt produksi.
  4. Pantau alias lama: deepseek-v4-flash dan deepseek-v4-flash-vision-exp kini diarahkan ke V4.1 Flash, sementara deepseek-v4-pro dijadwalkan diarahkan ke V4.1 Flash mulai 14 September 2026 hingga rilis V4.1 Pro di masa depan.

Bagi pengguna CometAPI, DeepSeek V4.1 API di CometAPI kini aktif bersama DeepSeek V4 Flash API. Sebelum mengalihkan trafik produksi, konfirmasikan nama model akhir, harga, dan pemetaan alias di dasbor CometAPI, karena penyedia pihak ketiga dapat berbeda dari penamaan API resmi dan tarif penagihan DeepSeek.

Who Should Use DeepSeek V4.1 Flash?

V4.1 Flash sangat cocok untuk agen coding, analisis repositori, otomasi terminal, alur kerja dokumen multimodal, asisten ber-konteks panjang, dan sistem ber-volume tinggi yang menggunakan alat. Peningkatan tolok ukur terkonsentrasi pada beban kerja yang paling diuntungkan oleh memori cache yang lebih rendah dan harga token yang lebih rendah.

Tim yang sudah menggunakan V4 Flash harus memperlakukannya sebagai kandidat migrasi langsung. Tim yang menggunakan V4 Pro harus menguji dengan cermat, tetapi data tolok ukur dan harga milik DeepSeek kini menjadikan V4.1 Flash default yang lebih ekonomis untuk banyak beban kerja kelas Pro.

Self-hosting adalah keputusan berbeda. Bobot terbuka tidak menjadikan model 552B ringan. Organisasi harus membandingkan biaya penerapan GPU dan penyimpanan besar dengan penggunaan API hosted sebelum berkomitmen pada inferensi lokal.

Limitations and Open Questions

  • Hasil tolok ukur berasal dari setup evaluasi resmi DeepSeek; replikasi independen diperlukan untuk mengukur performa di berbagai harness dan lingkungan alat.
  • Dukungan multimodal native telah dikonfirmasi, tetapi tim aplikasi harus memvalidasi format gambar yang didukung, perhitungan token, dan perilaku visi terhadap API live.
  • Alias model lama kini mengubah model di balik nama yang ada, yang dapat mengubah output tanpa perubahan kode aplikasi.
  • V4.1 Flash mengurangi kebutuhan infrastruktur dibanding model DeepSeek sebelumnya, tetapi penerapan open-weight-nya masih membutuhkan komputasi dan penyimpanan substansial.
  • Endpoint V4.1 khusus CometAPI dan harga final harus dikonfirmasi di konsol live sebelum penggunaan produksi.

Final Verdict

DeepSeek V4.1 Flash adalah pembaruan arsitektur dan produk yang besar. Model MoE 552B ini menggabungkan tahap input aktif 8B, tahap output aktif 16B, visi native, jendela konteks 1M token, dan cache KV yang terkompresi tajam. Pilihan desain tersebut diterjemahkan menjadi tolok ukur coding dan agen resmi yang lebih kuat dengan harga API yang jauh lebih rendah dibanding V4 Pro 0813.

Perubahan paling praktis adalah konsolidasi. V4.1 Flash menghadirkan teks, visi, penalaran, penggunaan alat, dan operasi konteks panjang ke dalam satu nama model produksi. Untuk sebagian besar integrasi DeepSeek baru, deepseek-flash kini menjadi titik awal yang logis; V4 Pro menjadi perbandingan migrasi alih-alih pilihan otomatis untuk pekerjaan sulit.

FAQ

Is DeepSeek V4.1 Flash officially released?

Ya. Model ini tersedia melalui API DeepSeek dengan nama model deepseek-flash, dan DeepSeek telah merilis bobot terbuka serta laporan teknis.

Is the temporary V4.1 beta model ID still required?

Tidak. deepseek-v4.1-flash-expires-on-0910 adalah pengenal beta berumur pendek. Aplikasi produksi harus menggunakan deepseek-flash.

How many parameters does DeepSeek V4.1 Flash have?

Model ini memiliki total 552B parameter. Model mengaktifkan 8B parameter selama pemrosesan input dan 16B selama pembuatan output.

Does DeepSeek V4.1 Flash support images?

Ya. Input visi bersifat native pada model produksi, sehingga endpoint V4 Flash Vision Exp terpisah tidak lagi diperlukan.

Is V4.1 Flash better than V4 Pro?

Model ini memimpin V4 Pro 0813 pada sebagian besar perbandingan coding, agen, otomasi, dan keamanan siber yang dipublikasikan DeepSeek, tetapi V4 Pro tetap unggul pada GPQA Diamond. Tim harus mengevaluasi keduanya terhadap prompt masing-masing sebelum migrasi.

How much does the API cost?

Pada jam sibuk, tarif per satu juta token adalah $0.006 untuk input cache-hit, $0.30 untuk input cache-miss, dan $1.20 untuk output. Tarif off-peak adalah setengah dari harga tersebut.

What happens to the old V4 model names?

Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp diarahkan ke V4.1 Flash. DeepSeek menyatakan deepseek-v4-pro juga akan diarahkan ke V4.1 Flash mulai 14 September 2026 hingga V4.1 Pro dirilis.

Can I use DeepSeek V4.1 Flash through CometAPI?

Ya. CometAPI kini menawarkan endpoint DeepSeek V4.1 API. Sebelum mengirim trafik produksi, konfirmasikan nama model, harga, dan fitur yang didukung secara tepat di konsol CometAPI, karena penyedia pihak ketiga dapat menggunakan konvensi penamaan atau tarif penagihan yang berbeda dari API resmi DeepSeek.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 10, 2026
Terakhir diperbarui Sep 10, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya