Spécifications techniques de l’API Seed 1.8
| Élément | Spécification / note |
|---|---|
| Nom du modèle / famille | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalités prises en charge | Texte, images, vidéo (capacités VLM multimodales), outils audio dans l’écosystème (modèles distincts pour la génération audio/vidéo). |
| Fenêtre de contexte (texte) | 256K jetons |
| Capacité vidéo/visuelle | Conçu pour le raisonnement sur longues vidéos, prend en charge un encodage visuel efficace et de grands budgets de jetons vidéo (la fiche modèle rapporte des expériences sur jetons vidéo et des benchmarks long-métrage). |
| Formats d’entrée | Prompts en texte libre ; téléversement d’images (captures d’écran, graphiques, photos) ; vidéo en frames tokenisées / outils vidéo pour inspection par segments ; téléversement de fichiers (documents). |
| Formats de sortie | Texte en langue naturelle, sorties structurées (structured-output beta), appels de fonctions / d’outils, code, et sorties multimodales via orchestration. |
| Modes de réflexion / inférence | no_think, think-low, think-medium, think-high — compromis précision vs latence/coût. |
Qu’est-ce que Doubao Seed 1.8 ?
Doubao Seed 1.8 est la version 1.8 de l’équipe Seed : un LLM+VLM unifié qui cible explicitement l’agentivité généralisée dans le monde réel — c’est-à-dire la perception (images/vidéo), le raisonnement, l’orchestration d’outils (search, appels de fonctions, exécution de code, ancrage GUI) et la prise de décision multi-étapes au sein d’un même modèle. La conception met l’accent sur des “modes de réflexion” configurables (arbitrages entre latence et profondeur), un encodage visuel efficace et un support natif pour le long contexte et les entrées multimodales, afin que le modèle puisse opérer comme un assistant/agent autonome dans des workflows de production.
Principales fonctionnalités de l’API Seed 1.8
- Modèle agentique multimodal unifié. Intègre perception (image/vidéo), raisonnement (LLM) et action (appels d’outils/GUI, exécution de code) dans un seul modèle plutôt qu’un pipeline séparé. Cela permet des workflows d’agent compacts et une complexité d’orchestration réduite.
- Contexte ultra-long et gestion des longues vidéos. Long contexte (prise en charge produit jusqu’à 256k jetons) et benchmarks spécifiques “long-video” (Seed1.8 montre une forte efficacité en jetons vidéo). Le modèle prend en charge des outils vidéo sélectifs (VideoCut) pour concentrer le raisonnement sur des horodatages.
- Automatisation GUI agentique et utilisation d’outils. Les benchmarks et tests internes (OSWorld, AndroidWorld, LiveCodeBench, benchmarks d’ancrage GUI) montrent des améliorations sur les tâches d’agent GUI et l’automatisation multi-étapes. Le modèle peut produire des commandes d’ancrage GUI et opérer dans des contextes OS/web/mobile simulés.
- Modes de réflexion configurables pour contrôler latence/coût. Quatre modes d’inférence permettent aux développeurs d’ajuster le calcul au moment du test pour des tâches interactives vs. des lots de haute qualité. Utile pour les systèmes de production avec des budgets de latence stricts.
- Efficacité en jetons améliorée (multimodale). Seed 1.8 affiche une meilleure efficacité en jetons sur des benchmarks multimodaux par rapport à ses prédécesseurs (séries Seed-1.5/1.6), atteignant une haute précision avec des budgets de jetons plus faibles sur plusieurs tâches long-vidéo.
- Modes de réflexion configurables : arbitrer profondeur d’inférence vs latence/coût avec des modes distincts (
no_think→think-high) pour l’ajustement en usage de production interactif. - Capacités techniques
- Efficacité en jetons : Seed1.8 montre une efficacité en jetons marquée par rapport aux prédécesseurs (Seed-1.5/1.6), offrant une meilleure précision avec des budgets de jetons inférieurs sur les tâches vidéo longues (par ex., une précision compétitive même à 32K jetons vidéo). Cela permet de réduire le coût d’inférence pour de longues entrées.
- Raisonnement et perception multimodaux : Le modèle atteint le SOTA sur plusieurs tâches VQA multi-images et de mouvement/perception, et obtient la deuxième place ou proche du SOTA sur de nombreux benchmarks de raisonnement multimodal ; il surpasse spécifiquement son prédécesseur sur presque toutes les dimensions visuelles/vidéo mesurées.
- Utilisation d’outils agentiques et ancrage GUI : Support documenté pour l’ancrage GUI et les benchmarks d’opération sur écran (ScreenSpot-Pro, agent GUI) avec de forts scores d’ancrage (par ex., des améliorations par rapport à Seed-1.5-VL sur ScreenSpot-Pro).
- Raisonnement parallèle / par étapes : L’augmentation du calcul au moment du test (réflexion parallèle) entraîne des gains mesurables sur les benchmarks de mathématiques, de code et de raisonnement multimodal
Points forts sélectionnés sur benchmarks publics de Seed1.8
- VCRBench (visual commonsense reasoning) : Seed1.8 a obtenu 59.8 (Pass@1 reporté dans la table de la fiche modèle), une amélioration par rapport à Seed-1.5-VL et compétitive avec les meilleurs modèles
- VideoHolmes (raisonnement vidéo) : Seed1.8 65.5, dépassant Seed-1.5-VL et se rapprochant de modèles concurrents de niveau professionnel.
- MMLB-NIAH (multimodal long-context, 128k) : Seed1.8 a atteint 72.2 Pass@1 à 128k de contexte sur MMLB-NIAH, surpassant certains modèles pro contemporains.
- Suite Motion & Perception : SOTA sur 5 des 6 tâches évaluées ; exemples : TVBench, TempCompass et TOMATO où Seed1.8 montre des gains substantiels en perception temporelle.
- Workflows agentiques : Sur BrowseComp et d’autres benchmarks de recherche/code agentiques, Seed1.8 se classe souvent au niveau ou au-dessus des modèles pro concurrents
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6 : Améliorations nettes en perception multimodale, efficacité en jetons pour les longues vidéos, et exécution agentique.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x : Sur de nombreux benchmarks multimodaux, Seed1.8 égale ou dépasse Gemini 3 Pro (SOTA sur plusieurs tâches VQA / mouvement ; meilleur sur l’exécution MMLB-NIAH 128k). Toutefois, la fiche montre aussi des domaines où la famille Gemini conserve des avantages sur certaines tâches de connaissances disciplinaires — l’ordre relatif dépend donc des benchmarks.
- Variante Seed-Code (Doubao-Seed-Code) : spécialisée pour les tâches de programmation/code agentique (grand contexte pour bases de code ; benchmarks SWE spécialisés). Seed1.8 est le modèle multimodal agentique généraliste, tandis que Seed-Code est la variante axée programmation.
Cas d’usage pratiques via l’API Seedream 4.5 sur CometAPI
- Assistants de recherche multimodaux et analyse de documents : extraire, résumer et raisonner sur de longs documents, jeux de diapositives et rapports multi-pages.
- Compréhension et surveillance de longues vidéos : analytique pour sécurité/sports, synthèse de longues réunions, et analyse de flux où l’efficacité en jetons vidéo du modèle est déterminante.
- Workflows / automatisation agentiques : scénarios multi-étapes de recherche web + exécution de code + extraction de données (par ex., analyses concurrentielles automatisées, planification de voyage, pipelines de recherche démontrés dans des benchmarks internes).
- Outils pour développeurs (si usage de Seed-Code) : analyse de grandes bases de code, assistants IDE et exécution de code agentique pour tests & réparations (Seed-Code est la variante spécialisée recommandée).
- Automatisation GUI et RPA : les benchmarks d’agent GUI et d’ancrage d’écran indiquent que le modèle exécute mieux des tâches GUI structurées que les précédentes versions Seed.
Comment utiliser l’API doubao Seed 1.8 via CometAPI
Doubao seed1.8 est désormais proposé commercialement via CometAPI comme API d’inférence hébergée. L’API prend en charge des charges multimodales (texte + images + fragments/horodatages vidéo) et des modes d’inférence configurables pour arbitrer latence et calcul par rapport à la qualité de la réponse.
Schémas d’appel : L’API prend en charge des requêtes style chat/completion standard, des réponses en streaming, et des flux agentiques où le modèle émet des appels d’outils (recherche, exécution de code, actions GUI) et ingère les sorties des outils comme contexte ultérieur.
Streaming & gestion du long contexte : L’API prend en charge le streaming et dispose de primitifs de gestion de contexte intégrés pour de longues sessions (pour permettre des contextes 100K+ / traces d’agent multi-étapes).
Étape 1 : S’inscrire pour obtenir une clé API
Connectez-vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez-vous à votre console CometAPI. Obtenez la clé API d’accès à l’interface. Cliquez sur « Add Token » dans la section des tokens API du centre personnel, obtenez la clé : sk-xxxxx puis soumettez.
Étape 2 : Envoyer des requêtes à l’API doubao Seed 1.8
Sélectionnez le point de terminaison “doubao-seed-1-8-251228 ” pour envoyer la requête API et définissez le corps de requête. La méthode et le corps de requête sont fournis dans la documentation API de notre site web. Notre site propose également un test Apifox pour votre commodité. Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle issue de votre compte. Compatibilité avec les API Chat.
Insérez votre question ou demande dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir la réponse générée.
Étape 3 : Récupérer et vérifier les résultats
Traitez la réponse de l’API pour obtenir la réponse générée. Après traitement, l’API répond avec le statut de la tâche et les données de sortie.