Spécifications techniques de l'API Seed 1.8
| Élément | Spécification / note |
|---|---|
| Nom du modèle / famille | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalités prises en charge | Texte, images, vidéo (capacités VLM multimodales), outils audio dans l'écosystème (modèles distincts pour la génération audio/vidéo). |
| Fenêtre de contexte (texte) | 256K jetons |
| Capacité vidéo / visuelle | Conçu pour le raisonnement sur longues vidéos, prend en charge un encodage visuel efficace et de larges budgets de jetons vidéo (la fiche du modèle rapporte des expériences sur les jetons vidéo et des benchmarks de longues vidéos). |
| Formats d'entrée | Invites en texte libre ; téléversement d’images (captures d’écran, graphiques, photos) ; vidéo sous forme d’images tokenisées / outils vidéo pour inspection de segments ; téléversement de fichiers (documents). |
| Formats de sortie | Texte en langue naturelle, sorties structurées (structured-output beta), appels de fonctions / d’outils, code, et sorties multimodales via orchestration. |
| Modes de réflexion / d’inférence | no_think, think-low, think-medium, think-high — compromis précision vs latence/coût. |
Qu’est-ce que Doubao Seed 1.8 ?
Doubao Seed 1.8 est la version 1.8 de l’équipe Seed : un LLM+VLM unifié visant explicitement l’agentivité généralisée dans le monde réel — c’est-à-dire perception (images/vidéo), raisonnement, orchestration d’outils (recherche, appels de fonctions, exécution de code, ancrage d’interface GUI) et prise de décision en plusieurs étapes au sein d’un seul modèle. La conception met l’accent sur des « modes de réflexion » configurables (arbitrages entre latence et profondeur), un encodage visuel efficace et une prise en charge native du long contexte et des entrées multimodales afin que le modèle puisse opérer comme assistant/agent autonome dans des workflows de production.
Principales fonctionnalités de l’API Seed 1.8
- Modèle agentique multimodal unifié. Intègre la perception (image/vidéo), le raisonnement (LLM) et l’action (appels d’outils/G U I, exécution de code) dans un seul modèle plutôt qu’une chaîne éclatée. Cela permet des workflows d’agents compacts et une complexité d’orchestration réduite.
- Contexte ultra-long et gestion des longues vidéos. Contexte long (prise en charge produit jusqu’à 256k jetons) et benchmarks spécifiques sur longues vidéos (Seed1.8 montre une forte efficacité en jetons vidéo). Le modèle prend en charge des outils vidéo sélectifs (VideoCut) pour focaliser le raisonnement sur des horodatages.
- Automatisation GUI agentique et utilisation d’outils. Des benchmarks et tests internes (OSWorld, AndroidWorld, LiveCodeBench, benchmarks d’ancrage GUI) montrent des améliorations sur les tâches d’agent GUI et l’automatisation multi-étapes. Le modèle peut produire des commandes d’ancrage GUI et opérer dans des contextes OS/web/mobile simulés.
- Modes de réflexion configurables pour contrôler latence/coût. Quatre modes d’inférence permettent d’ajuster le calcul à l’exécution pour des tâches interactives vs. des lots de haute qualité. Utile pour les systèmes de production avec des budgets de latence stricts.
- Efficacité en jetons améliorée (multimodal). Seed 1.8 démontre une meilleure efficacité en jetons sur des benchmarks multimodaux par rapport à ses prédécesseurs (séries Seed-1.5/1.6), atteignant une grande précision avec des budgets de jetons plus faibles sur plusieurs tâches de longues vidéos.
- Modes de réflexion configurables : arbitrer profondeur d’inférence vs latence/coût avec des modes distincts (
no_think→think-high) pour s’adapter à un usage de production interactif. - Capacités techniques
- Efficacité en jetons : Seed1.8 présente une efficacité en jetons nettement supérieure à celle de ses prédécesseurs (Seed-1.5/1.6), offrant une meilleure précision avec des budgets de jetons plus faibles sur les tâches de longues vidéos (par ex., une précision compétitive même à 32K jetons vidéo). Cela permet de réduire le coût d’inférence pour des entrées longues.
- Raisonnement et perception multimodaux : Le modèle atteint l’état de l’art sur plusieurs tâches VQA multi-images et de mouvement/perception et obtient la deuxième place ou un niveau proche de l’état de l’art sur de nombreux benchmarks de raisonnement multimodal ; il surpasse en particulier son prédécesseur sur presque toutes les dimensions visuelles/vidéo mesurées.
- Utilisation d’outils agentique et ancrage GUI : Prise en charge documentée de l’ancrage GUI et des benchmarks d’opérations basées sur l’écran (ScreenSpot-Pro, GUI agenting) avec de forts scores d’ancrage (par ex., améliorations par rapport à Seed-1.5-VL sur ScreenSpot-Pro).
- Raisonnement parallèle / par étapes : L’augmentation du calcul à l’exécution (réflexion parallèle) apporte des gains mesurables sur les benchmarks de mathématiques, de codage et de raisonnement multimodal
Faits saillants de benchmarks publics sélectionnés de Seed1.8
- VCRBench (visual commonsense reasoning) : Seed1.8 a obtenu 59.8 (Pass@1 reporté dans la fiche du modèle), une amélioration par rapport à Seed-1.5-VL et compétitif avec les meilleurs modèles
- VideoHolmes (video reasoning) : Seed1.8 65.5, dépassant Seed-1.5-VL et se rapprochant des modèles concurrents de niveau pro.
- MMLB-NIAH (multimodal long-context, 128k) : Seed1.8 a atteint 72.2 Pass@1 avec un contexte 128k sur MMLB-NIAH, dépassant certains modèles pro contemporains.
- Suite Motion & Perception : État de l’art sur 5 des 6 tâches évaluées ; exemples : TVBench, TempCompass et TOMATO où Seed1.8 montre des gains substantiels en perception temporelle.
- Workflows agentiques : Sur BrowseComp et d’autres benchmarks de recherche/code agentiques, Seed1.8 se classe souvent au niveau ou au-dessus des modèles pro concurrents
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6 : Améliorations nettes en perception multimodale, efficacité en jetons pour les longues vidéos et exécution agentique.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x : Sur de nombreux benchmarks multimodaux, Seed1.8 égale ou dépasse Gemini 3 Pro (état de l’art sur plusieurs tâches VQA/mouvement ; meilleur sur l’exécution MMLB-NIAH 128k). Toutefois, la fiche montre aussi des domaines où les modèles de la famille Gemini conservent des avantages sur certaines tâches de connaissances disciplinaires — l’ordre relatif dépend donc du benchmark.
- Variante Seed-Code (Doubao-Seed-Code) : spécialisée pour les tâches de programmation/code agentique (grand contexte pour les bases de code ; benchmarks SWE spécialisés). Seed1.8 est le modèle agentique multimodal généraliste, tandis que Seed-Code est la variante axée programmation.
Cas d’usage pratiques avec l’API Seedream 4.5 sur CometAPI
- Assistants de recherche multimodaux et analyse de documents : extraire, résumer et raisonner à travers de longs documents, des présentations et des rapports multi-pages.
- Compréhension et supervision de longues vidéos : analyses pour la sécurité/la diffusion sportive, synthèse de longues réunions, et analyses de flux où l’efficacité en jetons sur longues vidéos du modèle est déterminante.
- Workflows agentiques / automatisation : scénarios de recherche web multi-étapes + exécution de code + extraction de données (p. ex., analyses concurrentielles automatisées, planification de voyages, pipelines de recherche démontrés dans des benchmarks internes).
- Outils développeur (si vous utilisez Seed-Code) : analyse de grandes bases de code, assistants d’IDE et exécution de code agentique pour test et réparation (Seed-Code est la variante spécialisée recommandée).
- Automatisation GUI et RPA : les benchmarks d’ancrage d’écran et d’agent GUI indiquent que le modèle exécute des tâches GUI structurées mieux que les versions Seed précédentes.
Comment utiliser l’API doubao Seed 1.8 via CometAPI
Doubao seed1.8 est désormais proposé commercialement via CometAPI comme une API d’inférence hébergée. L’API prend en charge des charges utiles multimodales (texte + images + fragments/horodatages vidéo) et des modes d’inférence configurables pour arbitrer latence et calcul par rapport à la qualité de réponse.
Schémas d’appel : l’API prend en charge les requêtes de type chat/completion standard, les réponses en streaming, et des flux agentiques où le modèle émet des appels d’outils (recherche, exécution de code, actions GUI) et ingère les sorties d’outils comme contexte ultérieur.
Diffusion en continu et gestion du long contexte : l’API prend en charge le streaming et dispose de primitives de gestion de contexte intégrées pour les sessions longues (pour permettre des contextes de 100K+ / des traces d’agent multi-étapes).
Étape 1 : S’inscrire pour obtenir une clé API
Connectez-vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez-vous à votre console CometAPI. Obtenez la clé API d’identification d’accès de l’interface. Cliquez sur « Add Token » dans la section des jetons API du centre personnel, récupérez la clé de jeton : sk-xxxxx et soumettez.
Étape 2 : Envoyer des requêtes à l’API doubao Seed 1.8
Sélectionnez l’endpoint “doubao-seed-1-8-251228” pour envoyer la requête API et définir le corps de la requête. La méthode et le corps de la requête sont fournis dans la documentation API de notre site. Notre site propose également des tests Apifox pour votre commodité. Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle issue de votre compte. Compatibilité avec les API Chat.
Insérez votre question ou votre demande dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir la réponse générée.
Étape 3 : Récupérer et vérifier les résultats
Traitez la réponse de l’API pour obtenir la réponse générée. Après traitement, l’API renvoie l’état de la tâche et les données de sortie.