Seed 1.8 API'nin teknik özellikleri
| Öğe | Özellik / not |
|---|---|
| Model adı / aile | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Desteklenen modaliteler | Metin, görseller, video (çok modlu VLM yetenekleri), ekosistemde ses araçları (ses/video üretimi için ayrı modeller). |
| Bağlam penceresi (metin) | 256K token |
| Video / görsel kapasitesi | Uzun video akıl yürütmesi için tasarlanmıştır, verimli görsel kodlamayı ve büyük video token bütçelerini destekler (model kartı video token deneylerini ve uzun video kıyaslamalarını rapor eder). |
| Girdi biçimleri | Serbest metin istemleri; görsel yüklemeleri (ekran görüntüleri, grafikler, fotoğraflar); tokenleştirilmiş kareler olarak video / segment incelemesi için video araçları; dosya yüklemeleri (belgeler). |
| Çıktı biçimleri | Doğal dil metni, yapılandırılmış çıktılar (structured-output beta), fonksiyon çağrıları / araç çağrıları, kod ve orkestrasyon yoluyla çok modlu çıktılar. |
| Düşünme / çıkarım modları | no_think, think-low, think-medium, think-high — doğruluk ile gecikme/maliyet arasında denge kurar. |
Doubao Seed 1.8 nedir?
Doubao Seed 1.8, Seed ekibinin 1.8 sürümüdür: açıkça genelleştirilmiş gerçek dünya ajanlığını hedefleyen birleşik bir LLM+VLM — yani algı (görseller/video), akıl yürütme, araç orkestrasyonu (arama, fonksiyon çağrıları, kod yürütme, GUI grounding) ve tek bir model içinde çok adımlı karar verme. Tasarım, yapılandırılabilir “düşünme kipleri”ni (gecikme ile derinlik arasındaki ödünler), verimli görsel kodlamayı ve uzun bağlam ile çok modlu girdilere yerel desteği vurgular; böylece model üretim iş akışlarında özerk bir asistan/ajan olarak çalışabilir.
Seed 1.8 API'nin başlıca özellikleri
- Birleşik çok modlu ajan odaklı model. Algıyı (görsel/video), akıl yürütmeyi (LLM) ve eylemi (araç/G U I çağrıları, kod yürütme) ayrık bir boru hattı yerine tek bir modelde bütünleştirir. Bu, daha kompakt ajan iş akışlarını ve daha düşük orkestrasyon karmaşıklığını mümkün kılar.
- Ultra uzun bağlam ve uzun video işleme. Uzun bağlam (ürün desteği 256k tokena kadar) ve belirli uzun video kıyaslamaları (Seed1.8, uzun videolarda güçlü token verimliliği gösterir). Model, akıl yürütmeyi zaman damgalarına odaklamak için seçici video araçlarını (VideoCut) destekler.
- Ajan odaklı GUI otomasyonu ve araç kullanımı. Kıyaslamalar ve dahili testler (OSWorld, AndroidWorld, LiveCodeBench, GUI grounding kıyaslamaları) GUI ajan görevlerinde ve çok adımlı otomasyonda iyileşmeler gösterir. Model, GUI grounding komutları üretebilir ve benzetilmiş OS/web/mobil bağlamlarında çalışabilir.
- Gecikme/maliyet kontrolü için yapılandırılabilir düşünme kipleri. Dört çıkarım modu, geliştiricilerin etkileşimli ile yüksek kaliteli toplu görevler arasında test zamanında hesaplamayı ayarlamasına olanak tanır. Bu, sıkı gecikme bütçeleri olan üretim sistemleri için kullanışlıdır.
- Geliştirilmiş token verimliliği (çok modlu). Seed 1.8, seleflerine (Seed-1.5/1.6 serisi) kıyasla çok modlu kıyaslamalarda daha güçlü token verimliliği gösterir; çeşitli uzun video görevlerinde daha küçük token bütçeleriyle yüksek doğruluk sağlar.
- Yapılandırılabilir düşünme kipleri: çıkarım derinliği ile gecikme/maliyet arasında denge; etkileşimli üretim kullanımı için farklı kipler (
no_think→think-high) ile ayar yapma olanağı. - Teknik yetenekler
- Token verimliliği: Seed1.8, seleflerine (Seed-1.5/1.6) kıyasla belirgin token verimliliği sergiler; uzun video görevlerinde daha düşük token bütçeleriyle daha yüksek doğruluk sunar (ör. 32K video token düzeyinde bile rekabetçi doğruluk). Bu, uzun girdiler için daha düşük çıkarım maliyeti sağlar.
- Çok modlu akıl yürütme ve algı: Model, çok görselli VQA ve hareket/algı görevlerinin birçoğunda SOTA seviyesine ulaşır ve birçok çok modlu akıl yürütme kıyaslamasında ikinci sırayı veya SOTA'ya yakın sonuçlar elde eder; özellikle, görsel/video boyutlarının neredeyse tamamında selefini geride bırakır.
- Ajan odaklı araç kullanımı ve GUI grounding: GUI grounding ve ekran tabanlı işlem kıyaslamaları (ScreenSpot-Pro, GUI agenting) için belgelenmiş destek; ScreenSpot-Pro'da Seed-1.5-VL'e göre iyileşen güçlü grounding skorları.
- Paralel / adımlı akıl yürütme: Test zamanı hesaplamayı artırmak (paralel düşünme) matematik, kodlama ve çok modlu akıl yürütme kıyaslamalarında ölçülebilir kazanımlar sağlar.
Seed1.8'in seçili halka açık kıyaslama öne çıkanları
- VCRBench (görsel sağduyu akıl yürütme): Seed1.8, model kartı tablosunda bildirilen Pass@1 değeri olarak 59.8 aldı; Seed-1.5-VL'ye göre iyileşme ve üst düzey modellerle rekabetçi.
- VideoHolmes (video akıl yürütme): Seed1.8 65.5, Seed-1.5-VL'yi geride bırakarak profesyonel seviye rakip modellere yaklaşmaktadır.
- MMLB-NIAH (çok modlu uzun bağlam, 128k): Seed1.8, 128k bağlamda 72.2 Pass@1 elde ederek bazı çağdaş profesyonel modelleri geride bıraktı.
- Hareket ve Algı paketi: Değerlendirilen 6 görevin 5'inde SOTA; örnekler arasında Seed1.8'in zamansal algıda önemli kazanımlar gösterdiği TVBench, TempCompass ve TOMATO yer alır.
- Ajan odaklı iş akışları: BrowseComp ve diğer ajan odaklı arama/kod kıyaslamalarında Seed1.8 sıklıkla rakip profesyonel modellerle aynı seviyede veya üzerinde yer alır.
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Çok modlu algı, uzun videolar için token verimliliği ve ajan odaklı yürütmede net iyileşmeler.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: Birçok çok modlu kıyaslamada Seed1.8, Gemini 3 Pro ile eşleşir veya onu aşar (bazı VQA / hareket görevlerinde SOTA; MMLB-NIAH 128k çalışmasında daha iyi). Ancak kart, Gemini ailesi modellerinin belirli disipliner bilgi görevlerinde üstünlüklerini koruduğu alanları da gösterir — dolayısıyla göreli sıralama kıyaslamaya bağlıdır.
- Seed-Code varyantı (Doubao-Seed-Code): programlama/ajan odaklı kod görevleri için özelleştirilmiştir (kod tabanları için büyük bağlam; uzmanlaşmış SWE kıyaslamaları). Seed1.8 genel amaçlı ajan odaklı çok modlu modeldir; Seed-Code ise programlamaya odaklı varyanttır.
CometAPI üzerinde Seedream 4.5 API ile pratik kullanım örnekleri
- Çok modlu araştırma asistanları ve belge analizi: uzun belgeler, sunumlar ve çok sayfalı raporlar arasında çıkarım yapma, özetleme ve akıl yürütme.
- Uzun video kavrama ve izleme: güvenlik/spor yayını analitiği, uzun toplantı özetleme ve akış analizi; modelin uzun videolarda token verimliliğinin önemli olduğu senaryolar.
- Ajan odaklı iş akışları / otomasyon: çok adımlı web araması + kod yürütme + veri çıkarımı senaryoları (ör. dahili kıyaslamalarda gösterilen otomatik rekabet analizi, seyahat planlama, araştırma boru hatları).
- Geliştirici araçları (Seed-Code kullanılıyorsa): büyük kod tabanı analizi, IDE asistanları ve test/düzeltme için ajan odaklı kod yürütme (önerilen uzmanlaşmış varyant Seed-Code'dur).
- GUI otomasyonu ve RPA: ekran grounding ve GUI ajan kıyaslamaları, modelin önceki Seed sürümlerine göre yapılandırılmış GUI görevlerini daha iyi gerçekleştirebildiğini gösterir.
CometAPI üzerinden doubao Seed 1.8 API nasıl kullanılır
Doubao seed1.8, şu anda CometAPI aracılığıyla barındırılan bir çıkarım API'si olarak ticari biçimde sunulmaktadır. API, çok modlu yükleri (metin + görseller + video parçaları / zaman damgaları) ve yanıt kalitesine karşı gecikme ile hesaplamayı dengelemek için yapılandırılabilir çıkarım kiplerini destekler.
Çağrı kalıpları: API, standart sohbet/tamamlama tarzı istekleri, akış (streaming) yanıtlarını ve modelin araç çağrıları (arama, kod yürütme, GUI eylemleri) yaptığı ve araç çıktılarının sonraki bağlam olarak içeri alındığı ajan odaklı akışları destekler.
Akış ve uzun bağlam yönetimi: API akışı destekler ve uzun oturumlar için yerleşik bağlam yönetimi ilkelere sahiptir (100K+ bağlamlar / çok adımlı ajan izlerini etkinleştirmek için).
Adım 1: API anahtarı için kayıt
cometapi.com adresine giriş yapın. Henüz kullanıcımız değilseniz lütfen önce kaydolun. CometAPI console hesabınıza giriş yapın. Arabirimin erişim kimlik bilgisi API anahtarını edinin. Kişisel merkezde API token bölümünde “Add Token”a tıklayın, token anahtarını alın: sk-xxxxx ve gönderin.
Adım 2: doubao Seed 1.8 API'ye istek gönderin
API isteğini göndermek için “doubao-seed-1-8-251228 ” endpoint'ini seçin ve istek gövdesini ayarlayın. İstek yöntemi ve istek gövdesi web sitemizdeki API dokümanından elde edilir. Web sitemiz ayrıca kolaylığınız için Apifox testi sağlar. <YOUR_API_KEY> öğesini hesabınızdaki gerçek CometAPI anahtarınızla değiştirin. Chat API'leriyle uyumludur.
Sorunuzu veya isteğinizi content alanına ekleyin—modelin yanıt vereceği şey budur . Üretilen yanıtı almak için API yanıtını işleyin.
Adım 3: Sonuçları alın ve doğrulayın
Üretilen yanıtı almak için API yanıtını işleyin. İşlemenin ardından API, görev durumunu ve çıktı verilerini döndürür.