Seed 1.8 API の技術仕様
| Item | Specification / note |
|---|---|
| Model name / family | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalities supported | テキスト、画像、動画(マルチモーダル VLM 機能)、エコシステム内の音声ツール(音声/動画生成は別モデル)。 |
| Context window (text) | 256Kトークン |
| Video / visual capacity | 長尺動画の推論に最適化され、効率的なビジュアルエンコーディングと大型のビデオトークン予算をサポート(モデルカードではビデオトークン実験と長尺動画ベンチマークを報告)。 |
| Input formats | 自由形式のテキストプロンプト;画像アップロード(スクリーンショット、チャート、写真);トークン化フレームとしての動画/セグメント検査用ビデオツール;ファイルアップロード(ドキュメント)。 |
| Output formats | 自然言語テキスト、構造化出力(structured-output beta)、関数コール/ツールコール、コード、オーケストレーションによるマルチモーダル出力。 |
| Thinking / inference modes | no_think, think-low, think-medium, think-high — 正確性とレイテンシー/コストのトレードオフ。 |
Doubao Seed 1.8 とは?
Doubao Seed 1.8 は Seed チームの 1.8 リリースで、LLM+VLM を統合したモデルです。明示的に「一般化された実世界エージェンシー」を目標としており、すなわち知覚(画像/動画)、推論、ツールのオーケストレーション(検索、関数コール、コード実行、GUI グラウンディング)および単一モデル内でのマルチステップ意思決定を指します。設計上、構成可能な「thinking modes」(レイテンシーと深さのトレードオフ)、効率的なビジュアルエンコーディング、長大なコンテキストとマルチモーダル入力のネイティブ対応を重視し、実運用のワークフローにおける自律アシスタント/エージェントとして機能できるようにしています。
Seed 1.8 API の主な特長
- 統合型マルチモーダル・エージェントモデル。 分割パイプラインではなく、単一モデル内で知覚(画像/動画)、推論(LLM)、アクション(ツール/G U I コール、コード実行)を統合。これにより、コンパクトなエージェントワークフローと低いオーケストレーション複雑性を実現。
- 超ロングコンテキストと長尺動画ハンドリング。 長いコンテキスト(製品として 256k トークンに対応)および特定の長尺動画ベンチマーク(Seed1.8 は長尺動画のトークン効率で高性能)をサポート。モデルは選択的なビデオツール(VideoCut)により、特定のタイムスタンプへ推論を集中可能。
- エージェント的 GUI 自動化とツール使用。 ベンチマークや社内テスト(OSWorld、AndroidWorld、LiveCodeBench、GUI グラウンディング系ベンチマーク)において、GUI エージェントタスクやマルチステップ自動化の性能が向上。モデルは GUI グラウンディングコマンドを出力し、OS/Web/モバイルのシミュレーション環境内で動作可能。
- レイテンシー/コスト制御のための思考モードを構成可能。 4 種の推論モードにより、対話的用途と高品質バッチ用途でテスト時の計算量を調整可能。厳格なレイテンシー要件のある本番システムに有用。
- (マルチモーダル)トークン効率の改善。 Seed 1.8 は前世代(Seed-1.5/1.6 シリーズ)と比較してマルチモーダルベンチマークでより高いトークン効率を示し、複数の長尺動画タスクで少ないトークン予算でも高精度を達成。
- 構成可能な思考モード: 明確に区別されたモード(
no_think→think-high)で推論の深さとレイテンシー/コストをトレードオフし、対話的な本番利用に合わせてチューニング可能。 - 技術的な能力
- トークン効率: Seed1.8 は前世代(Seed-1.5/1.6)に対して顕著なトークン効率を示し、長尺動画タスクでより少ないトークン予算でも高い精度を達成(例:32K のビデオトークンでも競争力のある精度)。これにより長い入力に対する推論コストを削減。
- マルチモーダル推論と知覚: 複数画像の VQA およびモーション/知覚タスクで SOTA を達成し、多くのマルチモーダル推論ベンチマークで 2 位または SOTA 近傍の成績を獲得;特にビジュアル/動画のほぼすべての側面で前世代を上回る測定結果。
- エージェント的ツール使用と GUI グラウンディング: ScreenSpot-Pro、GUI エージェントなどの画面グラウンディング系ベンチマークでのサポートを文書化しており、強力なグラウンディングスコアを記録(例:ScreenSpot-Pro で Seed-1.5-VL を上回る)。
- 並列/段階的推論: テスト時の計算量を増やす(並列思考)と、数学、コーディング、マルチモーダル推論ベンチマークでの性能向上が確認可能
Seed1.8 の公開ベンチマークのハイライト
- VCRBench(ビジュアル常識推論): Seed1.8 は 59.8(モデルカードの表に記載の Pass@1)を記録。Seed-1.5-VL からの改善で、トップモデルに匹敵。
- VideoHolmes(動画推論): Seed1.8 は 65.5。Seed-1.5-VL を上回り、プロ向け競合モデルに迫る。
- MMLB-NIAH(マルチモーダル長コンテキスト、128k): Seed1.8 は 128k コンテキストの MMLB-NIAH で 72.2 Pass@1 を達成し、同時代の一部プロモデルを上回る。
- Motion & Perception スイート: 評価した 6 タスク中 5 タスクで SOTA。例として TVBench、TempCompass、TOMATO などで時間的知覚に大幅な改善。
- エージェントワークフロー: BrowseComp および他のエージェント的検索/コード系ベンチマークで、多くの場合で競合プロモデルと同等以上の順位。
Seed 1.8 と Gemini 3 Pro/GPT-5.x の比較
- Seed1.8 vs Seed-1.5-VL/Seed-1.6: マルチモーダル知覚、長尺動画におけるトークン効率、エージェント実行で明確な改善。
- Seed1.8 vs Gemini 3 Pro/GPT-5.x: 多くのマルチモーダルベンチマークで Seed1.8 は Gemini 3 Pro に「匹敵または凌駕」(複数の VQA/モーションタスクで SOTA、MMLB-NIAH 128k ランでより良好)。一方で、学術分野など特定領域では Gemini 系モデルに優位性が示される箇所もあり、相対順位はベンチマーク依存。
- Seed-Code バリアント(Doubao-Seed-Code): プログラミング/エージェント的コードタスクに特化(大規模コードベース用コンテキスト、特化した SWE ベンチマーク)。Seed1.8 は汎用のエージェント型マルチモーダルモデルで、Seed-Code はプログラミング特化の派生モデル。
CometAPI 上の Seedream 4.5 API による実用ユースケース
- マルチモーダル研究アシスタントとドキュメント分析: 長文ドキュメント、スライド、複数ページのレポートを横断して抽出・要約・推論。
- 長尺動画の理解とモニタリング: セキュリティ/スポーツ中継分析、長時間の会議要約、ストリーミング分析など、長尺動画でのトークン効率が効く場面。
- エージェントワークフロー/自動化: 複数ステップのウェブ検索+コード実行+データ抽出(例:社内ベンチで示した自動競合分析、旅行計画、リサーチパイプライン)。
- 開発者向けツール(Seed-Code を利用する場合): 大規模コードベース分析、IDE アシスタント、テストと修復のためのエージェント的コード実行(プログラミング特化の Seed-Code を推奨)。
- GUI 自動化と RPA: 画面グラウンディングおよび GUI エージェント系ベンチマークで、前世代の Seed を上回る構造化 GUI タスク遂行能力。
CometAPI 経由で doubao Seed 1.8 API を使う方法
現在、Doubao seed1.8 は CometAPI によりホスティング推論 API として商用提供されています。API はマルチモーダルペイロード(テキスト+画像+動画フラグメント/タイムスタンプ)と、レイテンシーと回答品質のトレードオフを制御できる構成可能な推論モードをサポートします。
Call patterns: API は標準的なチャット/コンプリーション形式のリクエスト、ストリーミングレスポンス、およびモデルがツールコール(検索、コード実行、GUI アクション)を発行し、ツール出力を後続コンテキストとして取り込むエージェントフローをサポートします。
Streaming & long-context handling: API はストリーミングに対応し、長いセッションを扱うためのコンテキスト管理プリミティブを内蔵(100K+ のコンテキスト/マルチステップのエージェントトレースを可能に)。
Step 1: Sign Up for API Key
cometapi.com にログインしてください。まだユーザーでない場合は、まず登録してください。CometAPI console にサインインします。インターフェースのアクセス認証 API キーを取得します。パーソナルセンターの API token で「Add Token」をクリックし、トークンキー sk-xxxxx を取得して送信します。
Step 2: Send Requests to doubao Seed 1.8 API
API リクエストを送信するには “doubao-seed-1-8-251228” エンドポイントを選択し、リクエストボディを設定します。リクエストメソッドとリクエストボディは当社ウェブサイトの API ドキュメントから取得できます。便利のため、当社ウェブサイトは Apifox テストも提供しています。アカウントの実際の CometAPI キーに置き換えてください: <YOUR_API_KEY>。 Chat API との互換性があります。
content フィールドにあなたの質問やリクエストを挿入します。モデルはそれに応答します。API レスポンスを処理して生成された回答を取得します。
Step 3: Retrieve and Verify Results
API レスポンスを処理して生成された回答を取得します。処理後、API はタスクのステータスと出力データで応答します。