Seed 1.8 API 的技術規格
| 項目 | 規格 / 備註 |
|---|---|
| 模型名稱 / 系列 | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| 支援模態 | 文字、圖片、影片(多模態 VLM 能力)、生態系中的音訊工具(音訊/影片生成使用獨立模型)。 |
| 上下文視窗(文字) | 256K tokens |
| 視覺 / 影片能力 | 為長影片推理而設計,支援高效視覺編碼與大型影片 token 預算(模型卡報告了影片 token 實驗與長影片基準)。 |
| 輸入格式 | 自由文字提示;圖片上傳(截圖、圖表、照片);影片以已 token 化影格 / 影片工具進行片段檢視;檔案上傳(文件)。 |
| 輸出格式 | 自然語言文字、結構化輸出(structured-output beta)、函式呼叫 / 工具呼叫、程式碼,以及透過協調的多模態輸出。 |
| 思考 / 推理模式 | no_think, think-low, think-medium, think-high — 在準確度與延遲/成本間取捨。 |
什麼是 Doubao Seed 1.8?
Doubao Seed 1.8 是 Seed 團隊的 1.8 版:一個統一的 LLM+VLM,明確面向「廣義的真實世界代理能力」——即在單一模型內涵蓋感知(圖片/影片)、推理、工具協同(搜尋、函式呼叫、程式碼執行、GUI 對應)與多步決策。其設計強調可配置的「思考模式」(在延遲與深度之間權衡)、高效率視覺編碼,以及對長上下文與多模態輸入的原生支援,使模型可在生產工作流程中作為自主助理/代理運作。
Seed 1.8 API 的主要特性
- 統一的多模態代理模型。將感知(圖片/影片)、推理(LLM)與行動(工具/G U I 呼叫、程式碼執行)整合於單一模型,而非拆分流程。這降低了協調複雜度,讓代理工作流程更精簡。
- 超長上下文與長影片處理。長上下文(產品支援至 256k tokens)與特定長影片基準(Seed1.8 顯示出強勁的長影片 token 效率)。模型支援選擇性影片工具(VideoCut)以聚焦於時間戳進行推理。
- 代理式 GUI 自動化與工具使用。基準與內部測試(OSWorld、AndroidWorld、LiveCodeBench、GUI grounding 基準)顯示在 GUI 代理任務與多步自動化方面有所提升。模型可輸出 GUI 對位指令,並在模擬的作業系統/網頁/行動端環境中運作。
- 可配置思考模式以控制延遲/成本。四種推理模式讓開發者可在測試時依互動式或高品質批次任務調整運算,適用於具嚴格延遲預算的生產系統。
- (多模態)改進的 token 效率。Seed 1.8 在多模態基準上較其前代(Seed-1.5/1.6 系列)展現更高的 token 效率,在多項長影片任務中以較少的 token 預算達到更高準確度。
- 可配置思考模式:透過不同模式(
no_think→think-high)在推理深度與延遲/成本間權衡,以便針對互動式生產使用進行調校。 - 技術能力
- Token 效率:相較於前代(Seed-1.5/1.6),Seed1.8 在長影片任務上以更低的 token 預算提供更高的準確度(例如,即使在 32K 影片 tokens 下也能達到具競爭力的準確度),使長輸入的推理成本更低。
- 多模態推理與感知:在多圖 VQA 與動作/感知任務上達到 SOTA,並在多數多模態推理基準中取得第二名或接近 SOTA;相較前代,在幾乎所有視覺/影片面向上都有所超越。
- 代理式工具使用與 GUI 對位:對 GUI 對位與基於螢幕的操作基準(ScreenSpot-Pro、GUI agenting)提供已記錄的支援,並取得強勁的對位分數(如相較 Seed-1.5-VL 在 ScreenSpot-Pro 上有所提升)。
- 平行 / 分步推理:增加測試時計算(平行思考)能在數學、程式設計與多模態推理基準上帶來可量化提升。
Seed1.8 的精選公開基準亮點
- VCRBench(視覺常識推理):Seed1.8 獲得 59.8(模型卡表格中報告之 Pass@1),較 Seed-1.5-VL 有所提升,並與頂尖模型具競爭力
- VideoHolmes(影片推理):Seed1.8 取得 65.5,優於 Seed-1.5-VL,並逼近專業級競品模型
- MMLB-NIAH(多模態長上下文,128k):Seed1.8 在 128k 上下文下達成 72.2 Pass@1,超越部分同代專業模型
- Motion & Perception 套件:在 6 個受評任務中的 5 個達到 SOTA;例如 TVBench、TempCompass 與 TOMATO,Seed1.8 在時間感知上有顯著提升
- 代理式工作流程:在 BrowseComp 與其他代理式搜尋/程式基準上,Seed1.8 經常達到或超越競爭對手的專業模型
Seed 1.8 與 Gemini 3 Pro / GPT-5.x 對比
- Seed1.8 vs Seed-1.5-VL / Seed-1.6:在多模態感知、長影片的 token 效率與代理式執行方面有明顯改進。
- Seed1.8 vs Gemini 3 Pro / GPT-5.x:在許多多模態基準上,Seed1.8 可與 Gemini 3 Pro 匹敵或超越(在多個 VQA / 動作任務上達到 SOTA;在 MMLB-NIAH 128k 測試上更佳)。但卡片也顯示在某些學科知識任務上 Gemini 系列仍具優勢——相對排序取決於基準。
- Seed-Code 變體(Doubao-Seed-Code):專為程式設計/代理式程式任務而設(針對大型程式碼庫的長上下文;專門的 SWE 基準)。Seed1.8 是通才型的代理式多模態模型,而 Seed-Code 是面向程式設計的專用變體。
由 CometAPI 上的 Seedream 4.5 API 支援的實際用例
- 多模態研究助理與文件分析:在長文件、簡報、與多頁報告中抽取、摘要並進行跨文件推理。
- 長影片理解與監控:安全/體育轉播分析、長會議摘要,以及串流分析等情境,模型的長影片 token 效率尤為重要。
- 代理式工作流程 / 自動化:多步網頁搜尋 + 程式碼執行 + 資料擷取的場景(例如內部基準示範的自動化競品分析、旅遊規劃、研究管線)。
- 開發者工具(若使用 Seed-Code):大型程式碼庫分析、IDE 助理、與代理式程式碼執行以進行測試與修復(建議使用專門的 Seed-Code 變體)。
- GUI 自動化與 RPA:螢幕對位與 GUI 代理基準顯示該模型在結構化 GUI 任務上的表現優於先前的 Seed 版本。
如何透過 CometAPI 使用 doubao Seed 1.8 API
Doubao seed1.8 現已透過 CometAPI 以託管推理 API 商業化提供。該 API 支援多模態負載(文字 + 圖片 + 影片片段 / 時間戳),以及可配置的推理模式,以在延遲與計算資源與答案品質之間取捨。
呼叫樣式:API 支援標準的聊天/補全式請求、串流回應,以及代理式流程,其中模型可發出工具呼叫(搜尋、程式碼執行、GUI 動作),並將工具輸出作為後續上下文攝入。
串流與長上下文處理:API 支援串流,並內建長工作階段的上下文管理原語(支援 100K+ 上下文 / 多步代理軌跡)。
步驟 1:註冊取得 API Key
登入 cometapi.com。若您尚未成為我們的用戶,請先註冊。登入您的 CometAPI console。取得介面的存取憑證 API key。在個人中心的 API token 處點擊 "Add Token",取得 token 金鑰:sk-xxxxx 並提交。
步驟 2:向 doubao Seed 1.8 API 發送請求
選擇 “doubao-seed-1-8-251228 ” 端點發送 API 請求,並設定請求主體。請求方法與請求主體可從我們網站的 API 文件取得。我們的網站也提供 Apifox 測試以供您使用。將 <YOUR_API_KEY> 替換為您帳戶中的實際 CometAPI 金鑰。與 Chat APIs 相容。
將您的問題或請求填入 content 欄位——模型將對此做出回應。處理 API 回應以取得生成的答案。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的答案。處理完成後,API 會回傳任務狀態與輸出資料。