Spesifikasi Teknis DeepSeek-V4-Flash-Vision-Exp
| Spesifikasi | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| ID Model | deepseek-v4-flash-vision-exp |
| Penyedia | DeepSeek |
| Jenis Model | Model visi-bahasa multimodal eksperimental |
| Tanggal Rilis | 21 Agustus 2026 |
| Modalitas Masukan | Teks, Gambar |
| Modalitas Keluaran | Teks |
| Jendela Konteks | 1M token |
| Keluaran Maksimum | Hingga 384K token |
| Token Gambar Maksimum | 384 token per gambar |
| Format Gambar yang Didukung | JPEG, PNG, GIF, WebP |
| Metode Input Gambar | Base64, URL publik, Files API |
| Antarmuka API | Chat Completions, Messages, Responses |
| Penalaran | Didukung |
| Status Model | Eksperimental |
| Harga Masukan | Harga sama seperti DeepSeek-V4-Flash |
| Harga Keluaran | Harga sama seperti DeepSeek-V4-Flash |
DeepSeek-V4-Flash-Vision-Exp diperkenalkan pada 21 Agustus 2026 sebagai model multimodal eksperimental di platform API DeepSeek. Model ini memperluas keluarga V4-Flash dengan pemahaman gambar bawaan sambil mempertahankan kapabilitas V4-Flash untuk Agen berorientasi teks, penalaran, dan pengetahuan dunia.
Salah satu karakteristik API yang paling menonjol adalah efisiensi token gambar: setiap gambar dikonversi menjadi token dan dibatasi hingga 384 token per gambar untuk penagihan. Model ini mendukung tiga metode pemasukan gambar—Base64 inline, URL eksternal, dan Files API—sehingga cocok untuk permintaan visi sederhana maupun alur kerja Agen multi-langkah.
Apa Itu DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp adalah versi multimodal eksperimental dari V4-Flash milik DeepSeek, dirancang untuk menggabungkan pemahaman visual dengan penalaran dan alur kerja Agen.
Perbedaannya dari model pemahaman gambar konvensional penting. Model ini tidak diposisikan sekadar sebagai sistem OCR atau penulisan keterangan gambar. Nilai utamanya adalah kemampuan memasukkan informasi visual ke dalam alur kerja di mana sebuah Agen AI harus memahami gambar, menalar tentang informasi yang dikandungnya, lalu melanjutkan dengan tugas berbasis teks atau alat.
Sebagai contoh, sebuah Agen dapat menerima tangkapan layar antarmuka web, mengidentifikasi elemen UI yang relevan, menalar tentang apa yang perlu diubah, dan melanjutkan alur kerja pengodean atau otomatisasi. Demikian pula, bagan, dasbor, tangkapan layar, dan dokumen berbasis gambar dapat menjadi masukan untuk pipeline penalaran yang lebih luas.
DeepSeek menggambarkan model eksperimental ini sebagai mempertahankan kemampuan teks dari model V4-Flash sekaligus meningkatkan kinerja secara substansial pada tolok ukur Agen yang membutuhkan pemahaman visual. DeepSeek juga melaporkan bahwa kapabilitas Agen multimodalnya mendekati level Claude Opus 4.8. Klaim tolok ukur ini dilaporkan oleh vendor dan tidak boleh ditafsirkan sebagai evaluasi independen pihak ketiga.
Apa Fitur Utama DeepSeek-V4-Flash-Vision-Exp?
- Masukan multimodal bawaan: Model ini menerima teks dan gambar dalam permintaan yang sama, memungkinkan pengembang menggabungkan bukti visual dengan instruksi bahasa alami alih-alih membangun pipeline praproses gambar-ke-teks terpisah.
- Visi untuk alur kerja Agen: Diferensiasi terpentingnya adalah integrasi pemahaman visual dengan penalaran berorientasi Agen. Ini membuat tangkapan layar, bagan, antarmuka, dan status visual lainnya dapat digunakan sebagai bagian dari alur kerja AI multi-langkah.
- Batas 384 token per gambar: Gambar dikonversi menjadi token untuk inferensi dan penagihan, dengan setiap gambar mengonsumsi tidak lebih dari 384 token. Ini menciptakan struktur biaya yang relatif dapat diprediksi untuk aplikasi yang banyak menggunakan gambar.
- Konteks 1M token: Model ini mempertahankan kemampuan konteks yang sangat besar yang terkait dengan keluarga V4-Flash, sehingga cocok untuk alur kerja yang menggabungkan konteks tekstual besar dengan masukan visual. Daftar model saat ini melaporkan jendela konteks 1M token dan hingga 384K token keluaran.
- Berbagai antarmuka API: Pengembang dapat mengakses model melalui Chat Completions, Messages yang kompatibel dengan Anthropic, atau Responses API. Ini memudahkan integrasi model ke dalam infrastruktur LLM dan Agen yang ada.
- Files API untuk gambar yang dapat digunakan ulang: Pengembang dapat mengunggah gambar sekali dan selanjutnya mereferensikannya menggunakan
file_id, yang sangat berguna ketika gambar yang sama perlu diperiksa di beberapa giliran Agen. DeepSeek memperkenalkan Files API bersamaan dengan model visi ini.
Bagaimana Performa DeepSeek-V4-Flash-Vision-Exp pada Tolok Ukur?
Hasil publik terkuat yang dilaporkan terkonsentrasi pada evaluasi Agen dan multimodal. DeepSeek melaporkan bahwa V4-Flash-Vision-Exp mempertahankan kemampuan teks V4-Flash sambil memberikan peningkatan substansial pada tugas yang membutuhkan pemahaman visual.
Hasil yang dilaporkan mencakup:
| Tolok Ukur | Skor yang Dilaporkan |
|---|---|
| Terminal-Bench 2.1 | 83.9 |
| DeepSWE | 59.3 |
| Chartography, p0.95 | 64.3 |
| Chartography, p1.0 | 63.3 |
| NL2Repo | 57.7 |
| DSBench-Hard | 63.6 |
| AutomationBench (Public) | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| ZeroBench, Pass@5 | 35.0 |
Skor Chartography sebesar 64.3 pada p0.95 sangat relevan karena merepresentasikan evaluasi yang berorientasi visual/Agen alih-alih tolok ukur teks saja yang konvensional. DeepSeek menggunakan hasil ini untuk mendukung klaim bahwa kapabilitas Agen multimodal modelnya mendekati Opus 4.8.
Namun, angka-angka ini harus diperlakukan sebagai hasil peluncuran yang dilaporkan, bukan skor tolok ukur yang direproduksi secara independen. Untuk pemilihan model produksi, pengembang sebaiknya menguji model pada tangkapan layar, bagan, dokumen, status UI, dan kerangka tugas Agen mereka sendiri.
Bagaimana Perbandingan DeepSeek-V4-Flash-Vision-Exp dengan Model Lain?
| Model | Kekuatan Utama | Visi | Agen/Penalaran | Konteks | Kecocokan Terbaik |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | Alur kerja Agen multimodal berbiaya rendah | ✓ | Kuat | 1M | Agen visual, tangkapan layar, bagan, otomatisasi |
| DeepSeek-V4-Flash | Tugas penalaran dan Agen umum | Tidak ada visi bawaan pada model asli | Kuat | 1M | Agen berbasis teks dan pengodean |
| Claude Opus 4.8 | Penalaran terdepan dan performa Agen multimodal | ✓ | Sangat kuat | Konteks besar | Agen perusahaan yang kompleks |
| Gemini family | Pemahaman multimodal dan aplikasi konteks panjang | ✓ | Kuat | Konteks besar | Dokumen, media, aplikasi multimodal |
Perbandingan yang paling bermakna bukan sekadar apakah suatu model dapat mengenali gambar. DeepSeek-V4-Flash-Vision-Exp menargetkan lapisan Agen multimodal berbiaya lebih rendah: ia menggabungkan pemahaman gambar dengan kemampuan penalaran dan Agen yang sudah diasosiasikan dengan V4-Flash.
Dibandingkan dengan DeepSeek-V4-Flash, peningkatan utama adalah persepsi visual. Kapabilitas dasar yang berorientasi teks dimaksudkan tetap selaras secara umum dengan V4-Flash, sementara evaluasi Agen visual menunjukkan peningkatan substansial.
Dibandingkan dengan model multimodal terdepan seperti Claude Opus 4.8, posisi peluncuran DeepSeek menekankan klaim yang jauh lebih sempit: performa tolok ukur Agen multimodalnya mendekati Opus 4.8. Hal itu tidak boleh ditafsirkan bahwa kedua model setara dalam kecerdasan umum, pengodean, visi, penalaran, penggunaan alat, dan keandalan.
Apa Kasus Penggunaan Terbaik untuk DeepSeek-V4-Flash-Vision-Exp?
Tangkapan Layar ke Kode dan Analisis UI
Pengembang dapat menyediakan tangkapan layar situs web, aplikasi, dasbor, atau antarmuka desain dan meminta model mengidentifikasi elemen UI, mendiagnosis masalah tata letak, atau menghasilkan instruksi implementasi. Ini membuat model sangat menarik untuk Agen pengodean AI yang perlu menalar dari bukti visual.
Agen Peramban Visual
Sebuah Agen peramban dapat menggunakan tangkapan layar sebagai observasi alih-alih bergantung sepenuhnya pada informasi DOM atau pohon aksesibilitas. Model ini dapat menafsirkan keadaan visual sebuah halaman web dan menggabungkan informasi tersebut dengan loop penalaran serta pemanggilan alatnya.
Analisis Bagan dan Dasbor
Model ini dapat menganalisis bagan, dasbor, dan representasi data visual lainnya. Ini adalah salah satu area di mana hasil Chartography yang dilaporkan sangat relevan.
Pemahaman Dokumen Berbasis Gambar
Gambar yang mengandung teks, tabel, diagram, atau informasi terstruktur dapat diberikan langsung ke model. Pengembang dapat menggunakan kapabilitas ini untuk analisis dokumen, ekstraksi informasi, dan tanya jawab visual.
Agen Pengodean Multimodal
Sebuah Agen pengodean dapat menggabungkan kode sumber dengan tangkapan layar bug, keadaan IDE, halaman web yang dirender, atau referensi desain. Alih-alih mengonversi setiap tangkapan layar menjadi deskripsi tekstual yang dibuat secara manual, model dapat menalar langsung dari masukan visual.
Otomatisasi Visual
Model ini dapat berfungsi sebagai komponen persepsi dalam sistem otomatisasi yang perlu memahami apa yang saat ini terlihat sebelum memilih tindakan berikutnya. Hal ini sangat relevan untuk otomatisasi GUI dan alur kerja penggunaan komputer.
Apa Keterbatasan DeepSeek-V4-Flash-Vision-Exp?
Keterbatasan pertama adalah status eksperimental. Akhiran -exp bermakna: ini belum merupakan model yang secara otomatis harus diperlakukan sebagai pengganti matang untuk setiap model multimodal produksi. DeepSeek sendiri mengidentifikasikannya sebagai model eksperimental.
Kedua, klaim publik terkuat tentang performa Agen multimodal didasarkan pada tolok ukur yang dilaporkan oleh vendor. Evaluasi independen masih terbatas, sehingga skor tolok ukur harus dianggap sebagai indikasi, bukan definitif.
Ketiga, batas 384 token per gambar sekaligus merupakan keunggulan biaya dan kendala teknis. Gambar berukuran besar diubah ukurannya sebelum inferensi, yang berarti pengembang yang bekerja dengan detail visual yang sangat halus harus menguji apakah resolusi hasilnya cukup untuk aplikasi mereka. Dokumentasi API DeepSeek menunjukkan bahwa gambar diubah ukurannya sebelum inferensi dan representasi gambar yang dihasilkan dibatasi pada 384 token.
API juga memberlakukan batasan praktis pada gambar/permintaan. Informasi yang berasal dari dokumentasi saat ini mencantumkan batas 32 MiB untuk gambar yang diberikan melalui Base64 atau URL eksternal, batas 64 MiB untuk referensi gambar Files API, dan maksimum 600 gambar per permintaan.
Terakhir, pengembang tidak boleh berasumsi bahwa performa tolok ukur yang kuat secara otomatis menerjemah menjadi operasi GUI otonom yang andal. Agen visi sangat sensitif terhadap kualitas tangkapan layar, kerangka tugas, definisi alat, latensi, manajemen keadaan, dan pemulihan kesalahan.
Versi Model dan Ketersediaan API DeepSeek-V4-Flash-Vision-Exp
Pengidentifikasi model saat ini adalah:
deepseek-v4-flash-vision-exp
Model ini tersedia melalui DeepSeek API pada 21 Agustus 2026. Pengembang dapat menentukan ID model ini saat membuat permintaan API multimodal.
Saat ini model mendukung tiga gaya API utama:
Chat Completions
Messages
Responses
Gambar dapat disediakan melalui:
Base64
Public image URL
Files API / file_id
Kombinasi ini sangat berguna bagi pengembang yang membangun Agen multimodal karena model yang sama dapat dimasukkan ke dalam infrastruktur yang kompatibel dengan OpenAI, kompatibel dengan Anthropic, atau berbasis Responses yang sudah ada.
Mengapa Menggunakan DeepSeek-V4-Flash-Vision-Exp?
DeepSeek-V4-Flash-Vision-Exp paling menarik ketika visi dan penalaran Agen perlu bekerja bersama tanpa secara drastis meningkatkan biaya API.
Keunggulan terbesarnya bukan sekadar kemampuan mendeskripsikan gambar. Model ini menggabungkan masukan visual dengan jendela konteks 1M token, penalaran berorientasi Agen, berbagai antarmuka API, dan penagihan gambar yang dibatasi pada 384 token per gambar.
Bagi pengembang yang membangun analisis tangkapan layar, Agen pengodean visual, pipeline pemrosesan bagan, otomatisasi peramban, atau alur kerja bisnis multimodal, hal ini membuat deepseek-v4-flash-vision-exp menjadi model eksperimental yang sangat menarik untuk diuji tolok ukur.
Untuk penerapan produksi, namun, model ini pada awalnya harus diperlakukan sebagai model untuk dievaluasi dan diuji tolok ukur, bukan sebagai default yang tak perlu dipertanyakan. Status eksperimentalnya dan terbatasnya data tolok ukur multimodal independen berarti pengujian spesifik aplikasi tetap sangat penting.
Cara Mengakses API DeepSeek-V4-Flash-Vision-Exp di CometAPI
CometAPI dapat menyediakan lapisan akses API terpadu bagi pengembang yang ingin bereksperimen dengan DeepSeek-V4-Flash-Vision-Exp tanpa membangun integrasi terpisah untuk setiap penyedia model.
Alur kerja dasar adalah:
- Buat akun CometAPI dan dapatkan kunci API.
- Pilih
deepseek-v4-flash-vision-expsebagai model. - Kirim teks bersama gambar menggunakan format permintaan multimodal yang didukung.
- Proses respons teks yang dikembalikan di aplikasi Anda.
- Uji tolok ukur model terhadap model visi atau Agen yang sudah Anda miliki sebelum memindahkan trafik produksi.
Kesimpulan
DeepSeek-V4-Flash-Vision-Exp adalah model Agen multimodal eksperimental yang menambahkan pemahaman gambar bawaan ke tumpukan kapabilitas V4-Flash sambil mempertahankan desain berorientasi konteks besar dan penalaran.
Kombinasi yang paling menarik adalah visi + penalaran Agen + konteks 1M token + batas 384 token per gambar. DeepSeek melaporkan peningkatan substansial pada tolok ukur Agen visual dan menyatakan bahwa kapabilitas Agen multimodal model mendekati Opus 4.8, tetapi hasil tersebut tetap dilaporkan oleh vendor dan sebaiknya divalidasi secara independen.
Bagi pengguna CometAPI, model ini layak diuji ketika aplikasi perlu melampaui Agen berbasis teks saja menuju pemahaman tangkapan layar, pengodean visual, analisis bagan, otomatisasi peramban, dan alur kerja multimodal.