Specifiche tecniche dell'API Seed 1.8
| Voce | Specifiche / note |
|---|---|
| Nome modello / famiglia | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalità supportate | Testo, immagini, video (capacità VLM multimodali), strumenti audio nell'ecosistema (modelli separati per la generazione audio/video). |
| Finestra di contesto (testo) | 256K token |
| Capacità video/visiva | Progettato per il ragionamento su video lunghi, supporta una codifica visiva efficiente e grandi budget di token video (la scheda del modello riporta esperimenti sui token video e benchmark per video lunghi). |
| Formati di input | Prompt in testo libero; caricamenti di immagini (screenshot, grafici, foto); video come frame tokenizzati / strumenti video per l'ispezione di segmenti; caricamenti di file (documenti). |
| Formati di output | Testo in linguaggio naturale, output strutturati (structured-output beta), chiamate di funzione / chiamate a strumenti, codice e output multimodali tramite orchestrazione. |
| Modalità di pensiero/inferenza | no_think, think-low, think-medium, think-high — compromesso tra accuratezza e latenza/costo. |
Che cos'è Doubao Seed 1.8?
Doubao Seed 1.8 è la release 1.8 del team Seed: un LLM+VLM unificato che punta esplicitamente all'agency generalizzata nel mondo reale — cioè percezione (immagini/video), ragionamento, orchestrazione di strumenti (ricerca, chiamate di funzione, esecuzione di codice, GUI grounding) e presa di decisioni multi‑step all'interno di un unico modello. Il design enfatizza “modalità di pensiero” configurabili (compromessi tra latenza e profondità), una codifica visiva efficiente e supporto nativo per contesti lunghi e input multimodali, così che il modello possa operare come assistente/agente autonomo in flussi di lavoro di produzione.
Funzionalità principali dell'API Seed 1.8
- Modello multimodale agentico unificato. Integra percezione (immagine/video), ragionamento (LLM) e azione (chiamate a strumenti/G U I, esecuzione di codice) in un unico modello invece di una pipeline separata. Questo abilita workflow compatti per agenti e riduce la complessità di orchestrazione.
- Contesto ultra‑lungo e gestione di video lunghi. Contesto lungo (supporto del prodotto fino a 256k token) e benchmark specifici per video lunghi (Seed1.8 mostra un'elevata efficienza dei token su video lunghi). Il modello supporta strumenti video selettivi (VideoCut) per focalizzare il ragionamento sui timestamp.
- Automazione GUI agentica e uso di strumenti. Benchmark e test interni (OSWorld, AndroidWorld, LiveCodeBench, benchmark di GUI grounding) mostrano miglioramenti nelle attività degli agenti GUI e nell'automazione multi‑step. Il modello può emettere comandi di GUI grounding e operare in contesti OS/web/mobile simulati.
- Modalità di pensiero configurabili per il controllo di latenza/costo. Quattro modalità di inferenza consentono agli sviluppatori di tarare il calcolo al momento del test per attività interattive vs batch di alta qualità. Ciò è utile per sistemi di produzione con rigorosi budget di latenza.
- Efficienza dei token migliorata (multimodale). Seed 1.8 dimostra una maggiore efficienza dei token sui benchmark multimodali rispetto ai predecessori (serie Seed-1.5/1.6), raggiungendo alta accuratezza con budget di token più ridotti in diverse attività su video lunghi.
- Modalità di pensiero configurabili: bilanciare profondità di inferenza vs latenza/costo con modalità distinte (
no_think→think-high) per ottimizzare l'uso in produzione interattiva. - Capacità tecniche
- Efficienza dei token: Seed1.8 mostra un'evidente efficienza dei token rispetto ai predecessori (Seed-1.5/1.6), offrendo maggiore accuratezza con budget di token inferiori nelle attività su video lunghi (ad es., ottenendo un'accuratezza competitiva anche con 32K token video). Ciò consente costi di inferenza più bassi per input lunghi.
- Ragionamento e percezione multimodali: Il modello raggiunge SOTA su diverse attività VQA multi‑immagine e di movimento/percezione e ottiene il secondo posto o è vicino a SOTA su molti benchmark di ragionamento multimodale; in particolare supera il suo predecessore in quasi ogni dimensione visiva/video misurata.
- Uso agentico di strumenti e GUI grounding: Supporto documentato per il GUI grounding e benchmark di operazioni basate su schermo (ScreenSpot-Pro, GUI agenting) con punteggi di grounding elevati (ad es., miglioramenti rispetto a Seed-1.5-VL su ScreenSpot-Pro).
- Ragionamento parallelo/a passi: Aumentare il calcolo al momento del test (pensiero parallelo) produce guadagni misurabili su benchmark di matematica, coding e ragionamento multimodale
Evidenze selezionate dei benchmark pubblici di Seed1.8
- VCRBench (visual commonsense reasoning): Seed1.8 ha ottenuto 59.8 (Pass@1 riportato nella tabella della scheda del modello), un miglioramento rispetto a Seed-1.5-VL e competitivo con i modelli di vertice
- VideoHolmes (video reasoning): Seed1.8 65.5, superando Seed-1.5-VL e avvicinandosi ai modelli concorrenti di livello professionale.
- MMLB-NIAH (multimodal long-context, 128k): Seed1.8 ha raggiunto 72.2 Pass@1 con contesto a 128k in MMLB-NIAH, superando alcuni modelli professionali contemporanei.
- Suite Motion & Perception: SOTA in 5 delle 6 attività valutate; esempi includono TVBench, TempCompass e TOMATO dove Seed1.8 mostra guadagni sostanziali nella percezione temporale.
- Workflow agentici: Su BrowseComp e altri benchmark agentici di ricerca/codice, Seed1.8 si classifica spesso vicino o al di sopra dei modelli professionali concorrenti
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Chiari miglioramenti nella percezione multimodale, efficienza dei token per video lunghi e esecuzione agentica.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: Su molti benchmark multimodali Seed1.8 egua gli o supera Gemini 3 Pro (SOTA su diverse attività VQA/movimento; migliore sull'esecuzione MMLB-NIAH 128k). Tuttavia, la scheda mostra anche aree in cui i modelli della famiglia Gemini mantengono vantaggi su alcune attività di conoscenza disciplinare — quindi l'ordinamento relativo dipende dal benchmark.
- Variante Seed-Code (Doubao-Seed-Code): specializzata per attività di programmazione/codice agentico (contesto ampio per codebase; benchmark SWE specializzati). Seed1.8 è il modello multimodale agentico generalista, mentre Seed-Code è la variante focalizzata sulla programmazione.
Casi d'uso pratici tramite l'API Seedream 4.5 su CometAPI
- Assistenti di ricerca multimodali e analisi di documenti: estrarre, riassumere e ragionare su documenti lunghi, presentazioni e report multi‑pagina.
- Comprensione e monitoraggio di video lunghi: analitiche per sicurezza/trasmissioni sportive, sintesi di riunioni lunghe e analisi di streaming dove l'efficienza dei token su video lunghi del modello è importante.
- Workflow agentici / automazione: scenari con ricerca web multi‑step + esecuzione di codice + estrazione di dati (ad es., analisi competitiva automatizzata, pianificazione viaggi, pipeline di ricerca dimostrate in benchmark interni).
- Strumenti per sviluppatori (se si usa Seed-Code): analisi di grandi codebase, assistenti IDE e esecuzione agentica di codice per test e riparazione (Seed-Code è la variante specializzata consigliata).
- Automazione GUI e RPA: grounding dello schermo e benchmark per agenti GUI indicano che il modello può eseguire attività GUI strutturate meglio delle release Seed precedenti.
Come usare l'API doubao Seed 1.8 tramite CometAPI
Doubao seed1.8 è ora disponibile commercialmente tramite CometAPI come API di inferenza ospitata. L'API supporta payload multimodali (testo + immagini + frammenti video/timestamp) e modalità di inferenza configurabili per bilanciare latenza e calcolo rispetto alla qualità delle risposte.
Pattern di chiamata: l'API supporta richieste in stile chat/completion standard, risposte in streaming e flussi agentici in cui il modello emette chiamate a strumenti (ricerca, esecuzione di codice, azioni GUI) e ingerisce gli output degli strumenti come contesto successivo.
Streaming e gestione del contesto lungo: l'API supporta lo streaming e dispone di primitive di gestione del contesto integrate per sessioni lunghe (per abilitare contesti 100K+ / tracce di agenti multi‑step).
Passo 1: Registrati per la chiave API
Accedi a cometapi.com. Se non sei ancora nostro utente, registrati prima. Accedi alla CometAPI console. Ottieni la chiave API di accesso dell'interfaccia. Fai clic su “Add Token” nel token API nel centro personale, ottieni la chiave del token: sk-xxxxx e inviala.
Passo 2: Invia richieste all'API doubao Seed 1.8
Seleziona l'endpoint “doubao-seed-1-8-251228” per inviare la richiesta API e imposta il body della richiesta. Il metodo e il body della richiesta sono ottenuti dalla documentazione API sul nostro sito. Il nostro sito fornisce anche Apifox per i test. Sostituisci <YOUR_API_KEY> con la tua chiave CometAPI effettiva dal tuo account. Compatibilità con le Chat API.
Inserisci la tua domanda o richiesta nel campo content — è a questo che il modello risponderà. Elabora la risposta dell'API per ottenere l'output generato.
Passo 3: Recupera e verifica i risultati
Elabora la risposta dell'API per ottenere l'output generato. Dopo l'elaborazione, l'API restituisce lo stato dell'attività e i dati di output.