Spesifikasi teknis API Seed 1.8
| Item | Spesifikasi / catatan |
|---|---|
| Model name / family | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalities supported | Teks, gambar, video (kapabilitas VLM multimodal), alat audio dalam ekosistem (model terpisah untuk pembuatan audio/video). |
| Context window (text) | 256K token |
| Video / visual capacity | Dirancang untuk penalaran video panjang, mendukung pengodean visual yang efisien dan anggaran token video besar (kartu model melaporkan eksperimen token video dan tolok ukur video panjang). |
| Input formats | Prompt teks bebas; unggahan gambar (tangkapan layar, grafik, foto); video sebagai frame yang ditokenisasi / alat video untuk inspeksi segmen; unggahan file (dokumen). |
| Output formats | Teks bahasa natural, keluaran terstruktur (structured-output beta), pemanggilan fungsi / alat, kode, dan keluaran multimodal melalui orkestrasi. |
| Thinking / inference modes | no_think, think-low, think-medium, think-high — mempertukarkan akurasi dengan latensi/biaya. |
Apa itu Doubao Seed 1.8?
Doubao Seed 1.8 adalah rilis 1.8 dari tim Seed: sebuah LLM+VLM terpadu yang secara eksplisit menargetkan agency dunia nyata yang digeneralisasi — yaitu persepsi (gambar/video), penalaran, orkestrasi alat (pencarian, pemanggilan fungsi, eksekusi kode, grounding GUI) dan pengambilan keputusan multi-langkah dalam satu model. Desainnya menekankan “mode pemikiran” yang dapat dikonfigurasi (kompromi antara latensi dan kedalaman), pengodean visual yang efisien, serta dukungan native untuk konteks panjang dan masukan multimodal agar model dapat beroperasi sebagai asisten/agen otonom dalam alur kerja produksi.
Fitur utama API Seed 1.8
- Model agenik multimodal terpadu. Mengintegrasikan persepsi (gambar/video), penalaran (LLM), dan aksi (panggilan alat/G U I, eksekusi kode) dalam satu model alih-alih pipeline terpisah. Ini memungkinkan alur kerja agen yang ringkas dan kompleksitas orkestrasi yang lebih rendah.
- Konteks sangat panjang & penanganan video panjang. Konteks panjang (dukungan produk hingga 256k token) dan tolok ukur spesifik untuk video panjang (Seed1.8 menunjukkan efisiensi token video yang kuat). Model mendukung alat video selektif (VideoCut) untuk memfokuskan penalaran pada stempel waktu.
- Automasi GUI agenik & penggunaan alat. Tolok ukur dan pengujian internal (OSWorld, AndroidWorld, LiveCodeBench, tolok ukur grounding GUI) menunjukkan peningkatan dalam tugas agen GUI dan automasi multi-langkah. Model dapat menghasilkan perintah grounding GUI dan beroperasi dalam konteks OS/web/mobile tersimulasi.
- Mode pemikiran yang dapat dikonfigurasi untuk kontrol latensi/biaya. Empat mode inferensi memungkinkan pengembang menyetel komputasi saat uji untuk tugas interaktif vs. batch berkualitas tinggi. Ini berguna untuk sistem produksi dengan anggaran latensi ketat.
- Efisiensi token yang meningkat (multimodal). Seed 1.8 menunjukkan efisiensi token yang lebih kuat pada tolok ukur multimodal dibanding pendahulunya (seri Seed-1.5/1.6), mencapai akurasi tinggi dengan anggaran token lebih kecil pada beberapa tugas video panjang.
- Mode pemikiran yang dapat dikonfigurasi: menukar kedalaman inferensi vs. latensi/biaya dengan mode berbeda (
no_think→think-high) untuk penyetelan penggunaan produksi interaktif. - Kemampuan teknis
- Token efficiency: Seed1.8 menunjukkan efisiensi token yang jelas dibanding pendahulunya (Seed-1.5/1.6), menghadirkan akurasi lebih kuat pada anggaran token lebih rendah untuk tugas video panjang (misalnya mencapai akurasi kompetitif bahkan pada 32K token video). Ini memungkinkan biaya inferensi lebih rendah untuk masukan panjang.
- Multimodal reasoning & perception: Model mencapai SOTA pada beberapa tugas VQA multi-gambar dan tugas gerak/persepsi serta meraih peringkat kedua atau mendekati SOTA pada banyak tolok ukur penalaran multimodal; secara khusus mengungguli pendahulunya pada hampir setiap dimensi visual/video yang diukur.
- Agentic tool use & GUI grounding: Dukungan terdokumentasi untuk grounding GUI dan tolok ukur operasi berbasis layar (ScreenSpot-Pro, agen GUI) dengan skor grounding yang kuat (misalnya peningkatan dibanding Seed-1.5-VL pada ScreenSpot-Pro).
- Parallel / stepped reasoning: Peningkatan komputasi saat uji (parallel thinking) menghasilkan kenaikan terukur pada tolok ukur matematika, pengodean, dan penalaran multimodal.
Sorotan tolok ukur publik terpilih dari Seed1.8
- VCRBench (visual commonsense reasoning): Seed1.8 meraih 59.8 (Pass@1 dilaporkan dalam tabel kartu model), peningkatan dibanding Seed-1.5-VL dan kompetitif dengan model teratas.
- VideoHolmes (penalaran video): Seed1.8 65.5, melampaui Seed-1.5-VL dan mendekati model pesaing kelas pro.
- MMLB-NIAH (multimodal long-context, 128k): Seed1.8 mencapai 72.2 Pass@1 pada konteks 128k di MMLB-NIAH, melampaui beberapa model pro kontemporer.
- Motion & Perception suite: SOTA pada 5 dari 6 tugas yang dievaluasi; contoh mencakup TVBench, TempCompass, dan TOMATO di mana Seed1.8 menunjukkan peningkatan substansial dalam persepsi temporal.
- Agentic workflows: Pada BrowseComp dan tolok ukur pencarian/kode agenik lainnya, Seed1.8 sering berada di dekat atau di atas model pro pesaing.
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Peningkatan yang jelas dalam persepsi multimodal, efisiensi token untuk video panjang, dan eksekusi agenik.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: Pada banyak tolok ukur multimodal Seed1.8 menyamai atau melampaui Gemini 3 Pro (SOTA pada beberapa tugas VQA / gerak; lebih baik pada run MMLB-NIAH 128k). Namun, kartu juga menunjukkan area di mana keluarga Gemini tetap unggul pada beberapa tugas pengetahuan disipliner — sehingga urutan relatif bergantung pada tolok ukur.
- Seed-Code variant (Doubao-Seed-Code): khusus untuk tugas pemrograman/agenik kode (konteks besar untuk basis kode; tolok ukur SWE khusus). Seed1.8 adalah model multimodal agenik generalis, sedangkan Seed-Code adalah varian berfokus pemrograman.
Penggunaan praktis oleh API Seedream 4.5 di CometAPI
- Asisten riset multimodal & analisis dokumen: mengekstrak, meringkas, dan bernalar lintas dokumen panjang, deck slide, dan laporan multi-halaman.
- Pemahaman & pemantauan video panjang: analitik siaran keamanan/olahraga, perangkuman rapat panjang, dan analisis streaming di mana efisiensi token video panjang model penting.
- Alur kerja agenik / automasi: skenario multi-langkah pencarian web + eksekusi kode + ekstraksi data (misalnya analisis kompetitif otomatis, perencanaan perjalanan, pipeline riset yang ditunjukkan dalam tolok ukur internal).
- Perkakas pengembang (jika menggunakan Seed-Code): analisis basis kode besar, asisten IDE, dan eksekusi kode agenik untuk pengujian & perbaikan (Seed-Code adalah varian khusus yang direkomendasikan).
- Automasi GUI & RPA: grounding layar dan tolok ukur agen GUI menunjukkan model dapat melakukan tugas GUI terstruktur lebih baik daripada rilis Seed sebelumnya.
Cara menggunakan API doubao Seed 1.8 melalui CometAPI
Doubao seed1.8 kini tersedia secara komersial melalui CometAPI sebagai API inferensi terhosting. API mendukung muatan multimodal (teks + gambar + fragmen video / stempel waktu) dan mode inferensi yang dapat dikonfigurasi untuk menukar latensi dan komputasi terhadap kualitas jawaban.
Pola pemanggilan: API mendukung permintaan bergaya chat/completion standar, respons streaming, dan aliran agenik di mana model mengeluarkan panggilan alat (pencarian, eksekusi kode, aksi GUI) dan mengonsumsi keluaran alat sebagai konteks berikutnya.
Streaming & penanganan konteks panjang: API mendukung streaming dan memiliki primitif manajemen konteks bawaan untuk sesi panjang (untuk memungkinkan konteks 100K+ / jejak agen multi-langkah).
Langkah 1: Daftar untuk Kunci API
Masuk ke cometapi.com. Jika Anda belum menjadi pengguna kami, silakan daftar terlebih dahulu. Masuk ke Konsol CometAPI. Dapatkan kredensial akses kunci API untuk antarmuka. Klik “Add Token” pada token API di pusat pribadi, dapatkan kunci token: sk-xxxxx dan kirimkan.
Langkah 2: Kirim permintaan ke API doubao Seed 1.8
Pilih endpoint “doubao-seed-1-8-251228” untuk mengirim permintaan API dan atur body permintaan. Metode dan body permintaan diperoleh dari dokumentasi API di situs kami. Situs kami juga menyediakan uji Apifox untuk kenyamanan Anda. Ganti <YOUR_API_KEY> dengan kunci CometAPI Anda yang sebenarnya dari akun Anda. Kompatibel dengan API Chat.
Masukkan pertanyaan atau permintaan Anda ke dalam field content—ini yang akan direspons oleh model. Proses respons API untuk mendapatkan jawaban yang dihasilkan.
Langkah 3: Ambil dan verifikasi hasil
Proses respons API untuk mendapatkan jawaban yang dihasilkan. Setelah diproses, API merespons dengan status tugas dan data keluaran.