GPT-6.1 Sol are now live on CometAPI →
ai-model/Riset CometAPI

DeepSeek V4 Flash Vision: Apa Itu dan Cara Menggunakannya

Ringkasan cepat - DeepSeek V4 Flash Vision: kemungkinan adalah model visi multimodal berlatensi rendah (“flash”) yang mengutamakan throughput/biaya rendah untuk tugas analisis gambar cepat (tanya jawab atas tangkapan layar/UI, bagan/diagram, OCR ringan, deskripsi adegan, dan grounding sederhana). Pastikan nama model persisnya di dokumentasi resmi karena penamaan dapat berubah antar penyedia/aggregator. - Limit gambar & harga: bergantung pada penyedia (langsung DeepSeek vs aggregator seperti CometAPI). Selalu rujuk halaman harga resmi dan/atau katalog model. Anda bisa mendeteksi kemampuan via endpoint daftar model dan uji respons 400/429 untuk menginfer batas. Hindari mengandalkan nilai bawaan karena dapat berubah. Cara memeriksa limit & harga (praktis) - Cek katalog model: - Panggil GET /v1/models (basis API penyedia). Cari entri model yang berisi kata kunci seperti “v4”, “flash”, “vision”. - Periksa dokumentasi harga: - Harga bisa berupa per 1K token (input/output), per piksel/warna, atau tarif tetap per permintaan bervisi. Aggregator dapat menambahkan margin. - Uji batas operasional (defensif): - Validasi sebelum kirim: jumlah gambar per permintaan, ukuran file, dimensi (px), format (JPEG/PNG/WebP/HEIC), dan total token konteks. - Tangani 400 (bad request) dan 413 (payload too large) untuk menyesuaikan ulang ukuran/kuota. Pola konten multimodal (OpenAI-compatible) - Kirim gambar sebagai: - URL publik: {"type":"image_url","image_url":{"url":"https://..."}} - Data URL base64: {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}} - Pesan multimodal berada di messages[].content sebagai array berisi blok text dan image_url. Contoh kode — Langsung ke DeepSeek Catatan: - Ganti BASE_URL, MODEL, dan API key sesuai dokumen DeepSeek terbaru. - Model hanya contoh; gunakan nama persis dari katalog (mis. "deepseek-v4-flash-vision" jika memang demikian di dokumen). 1) curl ``` curl https://api.deepseek.com/v1/chat/completions \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek-v4-flash-vision", "messages": [ { "role": "user", "content": [ {"type":"text","text":"Ringkas isi layar ini dan sebutkan 3 poin utama."}, {"type":"image_url","image_url":{"url":"https://example.com/screenshot.png"}} ] } ], "temperature": 0.2, "max_tokens": 300 }' ``` 2) Python (requests) ``` import os, base64, requests API_KEY = os.getenv("DEEPSEEK_API_KEY") BASE_URL = "https://api.deepseek.com/v1" MODEL = "deepseek-v4-flash-vision" def encode_image_to_data_url(path, mime="image/png"): with open(path, "rb") as f: b64 = base64.b64encode(f.read()).decode("utf-8") return f"data:{mime};base64,{b64}" image_data_url = encode_image_to_data_url("screenshot.png", mime="image/png") payload = { "model": MODEL, "messages": [ { "role": "user", "content": [ {"type":"text","text":"Apa anomali pada diagram ini? Jelaskan singkat."}, {"type":"image_url","image_url":{"url": image_data_url}} ] } ], "temperature": 0.1, "max_tokens": 200 } resp = requests.post( f"{BASE_URL}/chat/completions", headers={"Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json"}, json=payload, timeout=60 ) resp.raise_for_status() print(resp.json()["choices"][0]["message"]["content"]) ``` 3) Node.js (fetch) ``` import 'node-fetch'; const API_KEY = process.env.DEEPSEEK_API_KEY; const BASE_URL = "https://api.deepseek.com/v1"; const MODEL = "deepseek-v4-flash-vision"; const body = { model: MODEL, messages: [ { role: "user", content: [ { type: "text", text: "Ekstrak 5 item to-do dari foto papan tulis ini." }, { type: "image_url", image_url: { url: "https://example.com/whiteboard.jpg" } } ] } ], temperature: 0.2, max_tokens: 250 }; const res = await fetch(`${BASE_URL}/chat/completions`, { method: "POST", headers: { "Authorization": `Bearer ${API_KEY}`, "Content-Type": "application/json" }, body: JSON.stringify(body) }); const json = await res.json(); console.log(json.choices[0].message.content); ``` Contoh kode — Melalui CometAPI (aggregator) Catatan: - Sesuaikan BASE_URL CometAPI dan cara penentuan provider/route. Aggregator umumnya kompatibel OpenAI dan memakai: - Model namespaced: "model": "deepseek/deepseek-v4-flash-vision" - atau header route: mis. "X-Provider: deepseek" (nama header bisa berbeda). - Periksa dokumentasi CometAPI untuk skema yang tepat. 1) curl (namespaced model) ``` curl https://COMET_BASE_URL/v1/chat/completions \ -H "Authorization: Bearer $COMET_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek/deepseek-v4-flash-vision", "messages": [ { "role": "user", "content": [ {"type":"text","text":"Deskripsikan produk pada brosur ini."}, {"type":"image_url","image_url":{"url":"https://example.com/brochure.webp"}} ] } ], "temperature": 0.3, "max_tokens": 200 }' ``` 2) Python (header route) ``` import os, requests API_KEY = os.getenv("COMET_API_KEY") BASE_URL = "https://COMET_BASE_URL/v1" MODEL = "deepseek-v4-flash-vision" # atau "deepseek/deepseek-v4-flash-vision" sesuai katalog payload = { "model": MODEL, "messages": [{ "role":"user", "content":[ {"type":"text","text":"Hitung jumlah komponen pada PCB ini."}, {"type":"image_url","image_url":{"url":"https://example.com/pcb.jpg"}} ] }], "temperature": 0.1, "max_tokens": 150 } resp = requests.post( f"{BASE_URL}/chat/completions", headers={ "Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json", "X-Provider": "deepseek" # jika CometAPI memakai header seperti ini }, json=payload, timeout=60 ) resp.raise_for_status() print(resp.json()["choices"][0]["message"]["content"]) ``` Streaming (SSE) singkat — DeepSeek langsung ``` import os, requests, sseclient API_KEY = os.getenv("DEEPSEEK_API_KEY") BASE_URL = "https://api.deepseek.com/v1" payload = { "model": "deepseek-v4-flash-vision", "messages": [{ "role":"user", "content":[ {"type":"text","text":"Ringkas isi poster ini menjadi 2 kalimat."}, {"type":"image_url","image_url":{"url":"https://example.com/poster.jpg"}} ] }], "stream": True } with requests.post( f"{BASE_URL}/chat/completions", headers={"Authorization": f"Bearer {API_KEY}", "Content-Type":"application/json"}, json=payload, stream=True ) as r: r.raise_for_status() client = sseclient.SSEClient(r) for ev in client.events(): if ev.data == "[DONE]": break chunk = eval(ev.data) # gunakan json.loads di produksi delta = chunk.get("choices",[{}])[0].get("delta",{}).get("content","") if delta: print(delta, end="", flush=True) ``` Validasi & penanganan limit (contoh util) ``` import os from PIL import Image MAX_IMAGES = int(os.getenv("VIZ_MAX_IMAGES", "10")) # sesuaikan dari dokumen MAX_BYTES = int(os.getenv("VIZ_MAX_BYTES", str(20*1024*1024))) # contoh default 20MB MAX_SIDE = int(os.getenv("VIZ_MAX_SIDE", "4096")) # sisi terpanjang (px), sesuaikan def validate_images(paths): if len(paths) > MAX_IMAGES: raise ValueError(f"Terlalu banyak gambar: {len(paths)} > {MAX_IMAGES}") for p in paths: sz = os.path.getsize(p) if sz > MAX_BYTES: raise ValueError(f"{p} melebihi {MAX_BYTES} bytes") with Image.open(p) as im: w, h = im.size if max(w,h) > MAX_SIDE: raise ValueError(f"{p} {w}x{h} melebihi sisi {MAX_SIDE}px") ``` Praktik terbaik - Gunakan model ID yang tepat dari /v1/models katalog penyedia/CometAPI. - Kirim URL gambar yang dapat diakses publik atau gunakan data URL base64 jika konten privat. - Terapkan retry eksponensial untuk 429 (rate limit) dan kurangi ukuran/kuantitas gambar bila 400/413. - Catat usage bila disediakan respon (mis. usage.prompt_tokens, usage.completion_tokens) untuk estimasi biaya. - Harga dan limit bisa berbeda antara DeepSeek langsung dan aggregator. Selalu rujuk halaman harga resmi dan changelog model.

CometAPI
Deon GoodwinTim riset model AI dan API
Diperbarui Sep 30, 2026 17 menit baca
DeepSeek V4 Flash Vision: Apa Itu dan Cara Menggunakannya
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

DeepSeek-V4.1-Flash adalah model Flash multimodal saat ini yang dilayani oleh DeepSeek API dengan ID model deepseek-flash. Model ini mendukung konteks 1M token, keluaran hingga 384K, dan masukan gambar; di bawah panduan Vision saat ini, setiap gambar menggunakan maksimal 1024 token setelah pengubahan ukuran otomatis.

Posisi terkuatnya tetap pada visi berorientasi agen: memeriksa tangkapan layar, bagan, antarmuka, dan dokumen berbasis gambar sebelum melanjutkan dengan kode atau alat. Hasil benchmark di bagian akhir artikel ini berasal dari peluncuran Vision-Exp yang sudah dipensiunkan dan sebaiknya dibaca sebagai bukti historis yang dilaporkan vendor—bukan sebagai benchmark terbaru DeepSeek-V4.1-Flash.

CometAPI saat ini mempertahankan deepseek-v4-flash-vision-exp sebagai ID model katalog, sementara API langsung DeepSeek merekomendasikan deepseek-flash dan melayani permintaan dengan DeepSeek-V4.1-Flash. Mulailah dengan permintaan teks-plus-gambar, lalu evaluasi rute tepat pada tangkapan layar dan tugas visual Anda sendiri.

Pokok-Pokok Utama

  • Rute saat ini: DeepSeek-V4.1-Flash adalah model Flash multimodal aktif. Nama deepseek-v4-flash-vision-exp yang dipensiunkan tetap diterima hanya sebagai alias kompatibilitas pada API DeepSeek.
  • Ruang kerja teks besar: Konteks 1M token dan keluaran hingga 384K mendukung dokumen panjang, repositori kode, riwayat alat, dan gambar dalam satu percakapan.
  • Perhitungan gambar saat ini: DeepSeek secara otomatis mengubah ukuran setiap gambar dan membatasinya pada 1024 token masukan. Gambar di bawah kira-kira total piksel 544×544 akan diperbesar; gambar lebih besar akan diskalakan menuju kira-kira total piksel 1300×1300.
  • Visi berfokus agen: perbandingan resmi menekankan alur kerja tangkapan layar, bagan, peramban, pengodean, dan alat visual, bukan pembuatan gambar.
  • Dukungan antarmuka luas: DeepSeek mendokumentasikan antarmuka API yang didukung: Chat Completions, Messages kompatibel Anthropic, dan Responses API. Contoh CometAPI di bawah menggunakan Chat Completions.
  • Kewaspadaan produksi: alias rute, pengubahan ukuran gambar otomatis, dan hasil benchmark yang sensitif terhadap harness tetap membuat pengujian spesifik beban kerja menjadi esensial.

Apa Itu DeepSeek-V4-Flash-Vision?

Dokumentasi DeepSeek saat ini mengidentifikasi deepseek-flash sebagai DeepSeek-V4.1-Flash, dengan masukan teks-dan-gambar serta keluaran teks. Model Vision-Exp sebelumnya telah dipensiunkan; nama model warisannya adalah alias kompatibilitas yang diarahkan ke model Flash saat ini.

Kasus penggunaan yang dituju adalah agen multimodal. Agen visual dapat memeriksa aplikasi yang dirender, mengidentifikasi tombol atau kegagalan tata letak, menalar tindakan berikutnya, memanggil alat, lalu memeriksa tangkapan layar berikutnya. Pola yang sama berlaku untuk analisis bagan, jaminan kualitas visual, ekstraksi dokumen, otomasi peramban, dan agen pengodean yang harus membandingkan referensi desain dengan halaman yang dirender.

Catatan penamaan: untuk API langsung DeepSeek, gunakan deepseek-flash; saat ini dipetakan ke DeepSeek-V4.1-Flash. Nama warisan deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih diterima oleh DeepSeek, tetapi model terkait sudah dipensiunkan dan permintaan dilayani oleh DeepSeek-V4.1-Flash. CometAPI terus mengekspos deepseek-v4-flash-vision-exp sebagai rute katalognya sendiri.

Spesifikasi Teknis

Spesifikasi (dokumen resmi)Nilai saat ini
ID model resmideepseek-flash
StatusRute API Flash multimodal aktif; model Vision-Exp warisan dipensiunkan
Masukan / keluaranMasukan teks + gambar; keluaran teks
Jendela konteks1,048,576 token (1M)
Keluaran maksimumHingga 384K token
Listing checkpoint Vision-Exp warisan305B parameter pada repositori resmi Hugging Face
Backbone teks Vision-Exp warisan43 layer; ukuran hidden 4,096; 64 attention head
Routing MoE Vision-Exp warisan256 expert ter-routing; 6 dipilih per token; 1 expert bersama
Encoder visi Vision-Exp warisan32 layer; lebar 1,024; 16 head; ukuran patch 14
Representasi gambarMaksimum 1024 token gambar per gambar pada API DeepSeek saat ini
Format gambarJPEG, PNG, GIF, WebP
Metode masukan gambarData URL Base64, URL eksternal, file_id DeepSeek Files API
Gaya APIChat Completions, Messages kompatibel Anthropic, Responses
Mode penalaranThinking dan non-thinking; tingkat effort low, high, max
LisensiMIT untuk repositori model resmi

Bidang arsitektur di atas berasal dari konfigurasi resmi. Antarmuka repositori mencantumkan checkpoint 305B parameter, tetapi DeepSeek tidak memublikasikan secara terpisah jumlah parameter aktif untuk model visi lengkap. Lebih aman melaporkan nilai repositori daripada mengasumsikan bahwa jumlah parameter aktif V4-Flash khusus teks berpindah tanpa perubahan setelah menambahkan tumpukan visual.

Cara Kerja Arsitektur Legacy DeepSeek-V4-Flash-Vision-Exp

Backbone Teks V4-Flash

Sisi bahasa mempertahankan tema desain V4 yang membuat pekerjaan agen konteks panjang menjadi praktis. Repositori resmi mendokumentasikan komponen arsitektur V4: routing Mixture-of-Experts sparse, DFlash attention, Hyper-Connections, dan DSpark. Ini membuat rilis lebih dapat diinspeksi daripada model hanya-API meskipun penerapan lokal tetap menuntut pada skala ini.

Encoder dan Aligner Visi

Untuk checkpoint Vision-Exp yang dipensiunkan, konfigurasi yang dipublikasikan menggunakan encoder visual 32 layer, ukuran patch 14, lebar visi 1,024, 16 head atensi visual, dan representasi gambar 384 token. Detail arsitektur ini menggambarkan checkpoint historis dan tidak boleh diasumsikan mendokumentasikan tumpukan layanan DeepSeek-V4.1-Flash saat ini.

Batas 1024 Token Gambar Saat Ini

Aturan tokenisasi visi DeepSeek saat ini menaikkan skala gambar di bawah kira-kira total piksel 544×544 dan menurunkan skala gambar yang lebih besar sambil mempertahankan rasio aspek. Masukan besar diskalakan menuju kira-kira luas piksel gambar 1300×1300, menghasilkan batas atas 1024 token per gambar. Gambar 2000×2000 dan 5000×5000 oleh karena itu mengonsumsi jumlah token gambar yang sama setelah pengubahan ukuran.

Implikasi praktis: potong wilayah yang berisi label kecil, kode, atau kontrol UI sebelum mengirim gambar. Resolusi sumber yang lebih tinggi saja tidak mengatasi plafon 1024 token saat ini.

Kinerja Benchmark Legacy Vision-Exp

Evaluasi kartu model resmi DeepSeek membandingkan model visi dengan DeepSeek-V4-Flash-0731 dan Claude Opus 4.8 di seluruh tugas agen teks dan agen multimodal. Model visi umumnya meningkat dibandingkan model Flash khusus teks sambil tetap kompetitif, tetapi tidak selalu unggul, dibandingkan pesaing berorientasi kapabilitas.

DeepSeek V4 Flash Vision: Apa Itu dan Cara Menggunakannya

Perbandingan benchmark resmi untuk evaluasi agen teks dan multimodal. Sumber: rilis resmi DeepSeek

Benchmark resmiVision-ExpV4-Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
Cybergym75.376.778.3
DeepSWE59.354.458.0
Toolathlon-Verified75.970.376.2
DSBench-Hard63.659.671.7
AutomationBench (Public)25.725.127.2
ApexBench (Pass@1)36.526.2*39.4
Agents' Last Exam27.325.2*25.7
Chartography64.3-65.0
ZeroBench (Pass@5)35.0-34.0

* Pada ApexBench dan Agents' Last Exam, V4-Flash khusus teks mengabaikan elemen multimodal dalam masukan. DeepSeek mengevaluasi tugas agen teksnya dengan DeepSeek Harness mode minimal, upaya penalaran maksimum, temperatur 1.0, dan top_p 0.95.

Catatan benchmark: ini adalah hasil peluncuran yang dilaporkan DeepSeek, bukan reproduksi independen. Skor agen sangat sensitif terhadap harness, definisi alat, anggaran token, dan kebijakan retry, sehingga harus diperlakukan sebagai bukti arah.

Arti Hasil Benchmark

Hasil paling jelas adalah peningkatan dibandingkan V4-Flash khusus teks ketika bukti visual penting. ApexBench meningkat dari 26.2 menjadi 36.5, dan model visi menambahkan hasil Chartography dan ZeroBench yang kompetitif yang tidak dilaporkan oleh model khusus teks. Model ini juga meningkat pada beberapa tugas agen teks, termasuk Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon-Verified, dan DSBench-Hard, meskipun Cybergym sedikit lebih rendah.

Dibandingkan dengan Opus 4.8, hasilnya campuran. Vision-Exp lebih tinggi pada DeepSWE, Agents' Last Exam, dan ZeroBench dalam tabel ini, sementara model pesaing lebih tinggi pada Terminal Bench, NL2Repo, Cybergym, Toolathlon, DSBench-Hard, ApexBench, dan Chartography. Klaim benchmark multimodal DeepSeek karenanya bersifat arah, bukan bukti kesetaraan umum di setiap dimensi visi, penalaran, atau reliabilitas.

DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash

DimensiDeepSeek Vision-ExpDeepSeek V4 FlashClaude Opus 4.8Gemini 3.7 Flash
StatusEksperimentalBeta publik / rute Flash saat iniTersedia umumTersedia umum
Modalitas inputTeks, gambarTeksTeks, gambar, dokumenTeks, gambar, video, audio, PDF
KeluaranTeksTeksTeks / data terstruktur / kodeTeks
Konteks1M1MHingga 1M bergantung platform1,048,576
Keluaran maks384K384K128K65,536
Kekuatan utamaAgen visual biaya rendahAgen teks throughput tinggiAgen kompleks otonomi tinggiPekerja multimodal serba bisa
Uji pertama terbaikTangkapan layar, bagan, UI, coding visualOtomasi pengodean dan teksTugas berjangka panjang tersulitMedia kaya dan alur kerja alat Google

Pilih Vision-Exp ketika persepsi gambar harus ditambahkan ke loop agen berbiaya rendah. Pilih V4 Flash ketika setiap masukan bersifat tekstual dan throughput lebih penting daripada pemahaman visual. Opus 4.8 tetap menjadi opsi berorientasi kapabilitas dalam perbandingan DeepSeek, sementara Gemini 3.7 Flash adalah alternatif multimodal yang lebih luas ketika video, audio, PDF, dan alat native Google penting.

Apa yang Dapat Dilakukan DeepSeek-V4-Flash-Vision?

  • Screenshot-to-code dan tinjauan UI - membandingkan halaman yang dirender dengan desain, mengidentifikasi masalah tata letak atau aksesibilitas, dan menghasilkan panduan implementasi.
  • Agen peramban visual - menggunakan tangkapan layar sebagai observasi ketika data DOM atau accessibility-tree tidak lengkap, lalu memilih tindakan alat berikutnya.
  • Analisis bagan dan dasbor - menjelaskan tren, mengidentifikasi anomali, dan menghubungkan metrik yang terlihat ke alur kerja teks atau alat yang lebih besar.
  • Pemahaman dokumen berbasis gambar - mengekstrak informasi dari formulir pindaian, diagram, slide, tabel, dan tangkapan layar sebelum pemrosesan terstruktur.
  • Agen pengodean multimodal - menggabungkan kode sumber, tangkapan layar bug, status IDE, dan keluaran yang dirender dalam satu loop debugging.
  • Jaminan kualitas visual - membandingkan tangkapan layar produk di berbagai perangkat, mendeteksi elemen yang hilang, dan menghasilkan laporan cacat terstruktur.
  • Perbandingan multi-gambar - mengevaluasi rangkaian tangkapan layar atau desain alternatif dalam satu permintaan, tunduk pada batas ukuran dan jumlah gambar.

DeepSeek V4 Flash Vision: Apa Itu dan Cara Menggunakannya

Contoh agen visual resmi dari halaman peluncuran DeepSeek (GIF animasi dalam Word). Sumber: rilis resmi DeepSeek

Harga dan Ketersediaan

DeepSeek menagihkan token gambar bersama dengan token masukan teks. Tabel harga resmi menggunakan tarif puncak dan luar puncak, sementara halaman model CometAPI memublikasikan satu harga rute saat ini. Angka-angka tidak boleh diringkas menjadi satu harga generik karena rute termurah berubah mengikuti jendela waktu DeepSeek.

Rute / sumberMasukan cache-hitMasukan cache-missKeluaranKondisi
DeepSeek resmi - luar puncak$0.003$0.15$0.60Semua jam di luar jendela puncak, termasuk akhir pekan dan hari libur umum Tiongkok
DeepSeek resmi - puncak$0.006$0.30$1.2001:00-04:00 dan 06:00-10:00 UTC, Senin-Jumat, tidak termasuk hari libur umum Tiongkok
Rute CometAPI saat iniTidak dicantumkan terpisah$0.352$1.056Harga rute terpadu saat ini

Semua harga dalam USD per 1M token. Tarif Flash DeepSeek saat ini adalah $0.003/$0.15/$0.60 di luar puncak dan $0.006/$0.30/$1.20 pada puncak untuk masukan cache-hit, masukan cache-miss, dan keluaran. CometAPI saat ini mencantumkan $0.352 per 1M token masukan dan sekitar $1.06 per 1M token keluaran untuk rute kompatibilitasnya. Gambar menggunakan maksimal 1024 token masukan masing-masing pada API DeepSeek saat ini; selalu periksa ulang harga rute langsung sebelum penggunaan produksi.

Catatan harga: harga model dapat berubah. Jaga angka harga tertaut ke halaman harga live dan periksa ulang segera sebelum publikasi atau rollout produksi.

Cara Menggunakan DeepSeek-V4-Flash-Vision dengan CometAPI

CometAPI saat ini mencantumkan deepseek-v4-flash-vision-exp melalui endpoint /v1/chat/completions yang kompatibel OpenAI, sehingga contoh CometAPI mempertahankan ID katalog tersebut. Untuk API langsung DeepSeek, gunakan deepseek-flash.

Langkah 1: Buat Kunci API

  1. Buat atau masuk ke akun CometAPI.
  2. Buka konsol token API dan buat kunci.
  3. Simpan di variabel lingkungan COMETAPI_KEY. Jangan pernah menempatkan kunci produksi di kode sisi klien atau mengkomitnya ke kontrol versi.
export COMETAPI_KEY="your-cometapi-key"

Langkah 2: Kirim Gambar Base64 dengan cURL

Base64 berguna untuk file lokal dan pekerjaan sisi server ketika gambar sudah ada di memori. Ganti placeholder dengan byte gambar yang telah dienkode, tanpa menambahkan spasi atau pemisah baris.

curl https://api.cometapi.com/v1/chat/completions \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "Read this dashboard and return the three most important findings."
          },
          {
            "type": "image_url",
            "image_url": {
              "url": "data:image/png;base64,<BASE64_DATA>"
            }
          }
        ]
      }
    ],
    "max_tokens": 1200
  }'

Langkah 3: Analisis Gambar Lokal dengan Python

OpenAI Python SDK dapat memanggil CometAPI dengan mengubah base URL. Gunakan extra_body untuk kontrol thinking khusus DeepSeek ketika SDK Anda tidak mengeksposnya langsung.

import base64
import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

with open("dashboard.png", "rb") as image_file:
    encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "Analyze the chart. Return JSON with keys: trend, "
                        "anomalies, evidence, and confidence."
                    ),
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{encoded}"
                    },
                },
            ],
        }
    ],
    max_tokens=1500,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(response.choices[0].message.content)

Langkah 4: Gunakan URL Gambar Publik dengan JavaScript

URL gambar menjaga permintaan JSON tetap kecil, tetapi URL harus dapat dijangkau secara publik oleh model hulu. Hindari tautan sementara, privat, atau yang dilindungi autentikasi kecuali aplikasi Anda terlebih dahulu mengonversi gambar ke Base64.

const response = await fetch(
  "https://api.cometapi.com/v1/chat/completions",
  {
    method: "POST",
    headers: {
      Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
      "Content-Type": "application/json",
    },
    body: JSON.stringify({
      model: "deepseek-v4-flash-vision-exp",
      messages: [
        {
          role: "user",
          content: [
            {
              type: "text",
              text: "Identify the UI issue and propose a concrete CSS fix.",
            },
            {
              type: "image_url",
              image_url: {
                url: "https://example.com/screenshot.png",
              },
            },
          ],
        },
      ],
      max_tokens: 1200,
    }),
  }
);

if (!response.ok) {
  throw new Error(`CometAPI request failed: ${response.status}`);
}

const data = await response.json();
console.log(data.choices[0].message.content);

Langkah 5: Kirim Banyak Gambar

Tempatkan beberapa blok image_url dalam pesan user yang sama dan beri tahu model cara memberi label. Label eksplisit mengurangi referensi lintas-gambar yang tidak disengaja.

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "Compare Image A and Image B. List every visible regression."
        },
        {
          "type": "image_url",
          "image_url": {"url": "https://example.com/image-a.png"}
        },
        {
          "type": "image_url",
          "image_url": {"url": "https://example.com/image-b.png"}
        }
      ]
    }
  ],
  "max_tokens": 1800
}

Metode Masukan dan Batas

BatasNilai resmi DeepSeek
Format yang didukungJPEG, PNG, GIF, WebP
Panjang URL eksternalHingga 8,192 karakter
Bodi permintaan48 MiB
Satu gambar via Base64 / URL32 MiB
Satu gambar via DeepSeek Files API64 MiB
Maksimum gambar per permintaan600
Total ukuran gambar64 MiB tanpa file_id; hingga 200 MiB termasuk file_id
Dimensi maksimum8,192 px per sisi; 4,096 px saat permintaan punya 15+ gambar
Peran pesan gambarHanya pesan user

API resmi DeepSeek juga mendukung referensi gambar file_id yang dapat digunakan ulang melalui Files API. Jalur cepat CometAPI yang didokumentasikan di sini menggunakan blok image_url dengan URL publik atau data URL Base64. Verifikasi unggah file khusus penyedia dan passthrough file_id sebelum mengandalkan alur kerja tersebut melalui rute agregasi.

Cara Menyusun Prompt Model secara Efektif

Prompt agen visual yang andal harus menyatakan apa gambarnya, bukti apa yang diperiksa, tindakan apa yang diambil, dan kontrak keluaran apa yang diikuti. Prompt samar seperti describe this image memberi terlalu banyak kebebasan dan membuat hasil lebih sulit divalidasi.

  • Konteks - identifikasi tangkapan layar, bagan, dokumen, atau antarmuka dan perannya dalam alur kerja.
  • Tugas - tentukan keputusan, diagnosis, perbandingan, atau ekstraksi yang penting.
  • Bukti - minta bukti yang terlihat, label, koordinat, nilai, atau teks UI yang dikutip.
  • Batasan - larang asumsi yang tidak didukung dan beri tahu model cara menangani detail yang tidak terbaca.
  • Keluaran - definisikan kunci JSON, daftar periksa, level keparahan, atau struktur lain yang dapat diperiksa mesin.
You are reviewing a web application screenshot.

Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.

Praktik Terbaik Produksi

  • Potong sebelum unggah ketika teks kecil atau kontrol penting; plafon token gambar berarti latar belakang yang tidak relevan mengonsumsi resolusi visual yang terbatas.
  • Uji effort thinking alih-alih mengaktifkan max untuk setiap permintaan. OCR sederhana atau klasifikasi biasanya membutuhkan penalaran lebih rendah dibanding diagnosis UI multi-langkah.
  • Wajibkan bukti di setiap temuan terstruktur. Ini membuat klaim visual halusinatif lebih mudah ditolak secara otomatis.
  • Pisahkan persepsi dari aksi pada otomasi berisiko tinggi. Biarkan model mendeskripsikan keadaan, validasi, lalu izinkan lapisan alat terkontrol untuk bertindak.
  • Lindungi URL gambar karena URL publik dapat mengekspos tangkapan layar sensitif. Lebih suka Base64 sisi server untuk data privat dan terapkan kebijakan retensi Anda sendiri.
  • Benchmark end-to-end dengan penangkapan tangkapan layar, prompt, alat, retry, dan kriteria keberhasilan yang sama seperti di produksi.
  • Lacak perubahan eksperimental dengan mem-pin prompt dan data evaluasi. Endpoint -exp dapat mengubah perilaku lebih cepat daripada model GA matang.
  • Catat ID permintaan dan kegagalan agar kesalahan penyedia, kesalahan model, dan kesalahan parsing aplikasi dapat dibedakan.

Batasan

Batasan terpenting adalah transparansi rute: nama Vision-Exp warisan mungkin masih diterima meskipun permintaan dilayani oleh DeepSeek-V4.1-Flash. Catat penyedia, ID model yang diminta, metadata model yang dikembalikan, dan ID permintaan; gunakan gerbang evaluasi eksplisit sebelum menetapkan tindakan otonom. Skor peluncuran historis bukan pengganti pengujian yang dapat direproduksi pada rute yang dimaksud.

Batasan kedua adalah detail visual. Pengubahan ukuran otomatis dan plafon 1024 token gambar saat ini membuat biaya dapat diprediksi tetapi mungkin tetap menekan teks kecil, tanda bagan halus, atau elemen antarmuka yang padat. Potong, ubin, atau perbesar wilayah relevan dan simpan gambar asli untuk tinjauan manusia.

Model hanya mengembalikan teks. Model dapat menganalisis gambar dan mengusulkan kode atau tindakan terstruktur, tetapi tidak menghasilkan atau mengedit gambar. Model juga hanya menerima gambar dalam pesan user, dan dokumentasi resmi menyatakan bahwa konten gambar dalam pesan system atau assistant mengembalikan error 400.

Akhirnya, penerapan lokal membutuhkan infrastruktur berat. Repositori resmi mencantumkan model 305B parameter dan menyediakan kode inferensi referensi alih-alih runtime ringan siap pakai. Bagi sebagian besar tim, evaluasi API terkelola adalah titik awal yang praktis.

Kesalahan Umum dan Perbaikannya

GejalaPenyebab kemungkinanPerbaikan yang disarankan
400: model does not support imageID model salahGunakan deepseek-v4-flash-vision-exp
400 untuk konten pesanGambar ditempatkan di pesan system atau assistantPindahkan blok gambar ke pesan user
Kegagalan unduh gambarURL privat, kedaluwarsa, atau lambatGunakan Base64 atau URL publik yang stabil
Detail halus terlewatDownscaling otomatis / plafon 384 tokenPotong atau ubin wilayah relevan
Biaya tidak terduga tinggiKeluaran panjang, retry, atau putaran berulangBatasi max_tokens dan catat penggunaan per putaran
Hasil agen tidak konsistenVariasi harness atau status alatTetapkan prompt, alat, retry, dan rubric evaluasi

FAQ

Apakah DeepSeek-V4-Flash-Vision sama dengan DeepSeek-V4-Flash?

Tidak. Vision-Exp menambahkan masukan gambar native dan pelatihan multimodal. Rute Flash khusus teks tidak menyediakan kapabilitas persepsi visual yang sama.

ID model apa yang harus saya gunakan?

Gunakan deepseek-flash pada API langsung DeepSeek. Pada CometAPI, gunakan ID katalog deepseek-v4-flash-vision-exp selama rute tersebut masih tersedia.

Apakah bisa menganalisis banyak gambar?

Ya. DeepSeek mendokumentasikan hingga 600 gambar per permintaan, tunduk pada batas ukuran permintaan dan dimensi. Batas praktis mungkin lebih rendah dalam aplikasi karena latensi dan kejernihan prompt menurun seiring pertumbuhan set gambar.

Berapa banyak token yang digunakan gambar?

Pada API DeepSeek saat ini, gambar diubah ukuran dan dikonversi menjadi token dengan maksimum 1024 token per gambar. Banyak gambar dihitung secara independen.

Apakah mendukung pembuatan gambar?

Tidak. Model menerima teks dan gambar dan mengembalikan teks.

Apakah siap untuk produksi?

Ya, tetapi hanya setelah evaluasi spesifik rute. Gunakan pemantauan, fallback, tes penerimaan spesifik tugas, dan logging rute model karena alias warisan dapat di-resolve ke DeepSeek-V4.1-Flash.

Haruskah saya menggunakan CometAPI atau API langsung DeepSeek?

CometAPI berguna ketika satu kunci, satu lapisan penagihan, dan pergantian model yang mudah penting. Akses langsung DeepSeek mungkin lebih disukai ketika Anda membutuhkan fitur khusus penyedia seperti semantik Files API resmi atau harga luar puncak. Uji kedua rute terhadap beban kerja yang sama.

Kesimpulan

DeepSeek-V4.1-Flash kini menjadi rute Flash multimodal aktif pada API DeepSeek. Konteks 1M, plafon keluaran 384K, dukungan multi-antarmuka, dan plafon 1024 token per gambar menjadikannya menarik untuk pemahaman tangkapan layar, analisis bagan, coding visual, dan otomasi peramban atau GUI. Arsitektur Vision-Exp dan benchmark peluncuran dalam artikel ini dipertahankan sebagai konteks historis.

Keputusan harus tetap digerakkan oleh beban kerja. Bukti benchmark publik untuk model Vision-Exp yang dipensiunkan terutama dilaporkan vendor, alias rute saat ini dapat mengaburkan model mana yang melayani permintaan, dan pengubahan ukuran gambar masih dapat membatasi tugas detail halus. Uji rute penyedia yang tepat pada gambar representatif, ukur biaya tugas-berhasil alih-alih hanya harga token, dan pertahankan fallback hingga rute terbukti andal dalam harness produksi Anda.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 30, 2026
Terakhir diperbarui Sep 30, 2026
4 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya