Seed 1.8 API 的技術規格
| 項目 | 規格 / 備註 |
|---|---|
| 模型名稱 / 系列 | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| 支援模態 | 文字、圖片、影片(多模態 VLM 能力),生態系中的音訊工具(音訊/影片生成由獨立模型提供)。 |
| 上下文視窗(文字) | 256K tokens |
| 影片 / 視覺能力 | 為長影片推理而設計,支援高效視覺編碼與大型影片 token 預算(模型卡報告了影片 token 實驗與長影片基準)。 |
| 輸入格式 | 自由文字提示;圖片上傳(截圖、圖表、照片);以 token 化影格提供影片 / 影片工具用於片段檢視;檔案上傳(文件)。 |
| 輸出格式 | 自然語言文字、結構化輸出(structured-output beta)、函式呼叫 / 工具呼叫、程式碼,以及透過編排產生的多模態輸出。 |
| 思考 / 推理模式 | no_think、think-low、think-medium、think-high — 在準確度與延遲/成本之間取捨。 |
什麼是 Doubao Seed 1.8?
Doubao Seed 1.8 是 Seed 團隊的 1.8 版本:一個統一的 LLM+VLM,明確面向廣義的真實世界代理能力——即在單一模型中實現感知(圖片/影片)、推理、工具編排(搜尋、函式呼叫、程式碼執行、GUI 定位)與多步決策。其設計強調可配置的「思考模式」(在延遲與深度之間權衡)、高效視覺編碼,以及對長上下文與多模態輸入的原生支援,使模型能在生產工作流程中作為自主助理/代理運作。
Seed 1.8 API 的主要特性
- 統一的多模態代理模型。 將感知(影像/影片)、推理(LLM)與行動(tool/G U I 呼叫、程式碼執行)整合於單一模型,而非分裂式管線。這使代理流程更精簡,並降低編排複雜度。
- 超長上下文與長影片處理。 長上下文(產品支援至 256k tokens)與專門的長影片基準(Seed1.8 展現強勁的長影片 token 效率)。模型支援選擇性影片工具(VideoCut),以聚焦於時間戳的推理。
- 代理式 GUI 自動化與工具使用。 基準與內部測試(OSWorld、AndroidWorld、LiveCodeBench、GUI 定位基準)顯示在 GUI 代理任務與多步自動化方面有所提升。模型可輸出 GUI 定位指令,並在模擬的作業系統/網頁/行動情境中運作。
- 可配置的思考模式以控制延遲/成本。 四種推理模式允許開發者在測試時調校計算量,兼顧互動式與高品質批次任務。這對延遲預算嚴格的生產系統尤為實用。
- 改進的(多模態)token 效率。 相較前代(Seed-1.5/1.6 系列),Seed 1.8 在多模態基準上展現更強的 token 效率,於多個長影片任務中在較小的 token 預算下仍能達到高準確度。
- 可配置思考模式: 透過不同模式(
no_think→think-high)在推理深度與延遲/成本之間權衡,以便為互動式生產用例進行調優。 - 技術能力
- Token 效率: 相較於前代(Seed-1.5/1.6),Seed1.8 在長影片任務中以更低的 token 預算提供更高的準確度(例如,即使在 32K 影片 tokens 下也能取得具競爭力的準確度),使長輸入的推理成本更低。
- 多模態推理與感知: 多張圖片 VQA 與運動/感知任務達到 SOTA;在多模態推理基準上取得第二名或接近 SOTA;在幾乎所有視覺/影片面向上超越其前代。
- 代理式工具使用與 GUI 定位: 已記錄對 GUI 定位與螢幕操作基準(ScreenSpot-Pro、GUI 代理)之支援,相較 Seed-1.5-VL 在 ScreenSpot-Pro 上取得更高定位分數。
- 平行/逐步推理: 增加測試時計算量(平行思考)在數學、程式碼與多模態推理基準上帶來可測量的提升。
Seed1.8 的部分公開基準亮點
- VCRBench(視覺常識推理): Seed1.8 得分 59.8(模型卡表格中的 Pass@1),較 Seed-1.5-VL 有所提升,並具備與頂尖模型競爭的水準
- VideoHolmes(影片推理): Seed1.8 65.5,超越 Seed-1.5-VL,接近專業級競品模型
- MMLB-NIAH(多模態長上下文,128k): Seed1.8 在 128k 上下文下達到 72.2 Pass@1,超越部分同代專業模型
- 運動與感知套件: 在 6 項評估任務中的 5 項達到 SOTA;例如 TVBench、TempCompass 與 TOMATO,Seed1.8 在時間感知方面有顯著進步
- 代理式工作流程: 在 BrowseComp 與其他代理式搜尋/程式碼基準中,Seed1.8 經常排名接近或超過競爭的專業模型
Seed 1.8 與 Gemini 3 Pro / GPT-5.x 的對比
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: 在多模態感知、長影片的 token 效率與代理式執行方面有明顯改進。
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: 在許多多模態基準上,Seed1.8 相當或超越 Gemini 3 Pro(多個 VQA / 運動任務達到 SOTA;在 MMLB-NIAH 128k 測試中更佳)。不過,模型卡也顯示 Gemini 系列在某些學科知識任務上仍具優勢——因此相對排序取決於具體基準。
- Seed-Code 變體(Doubao-Seed-Code): 針對程式設計/代理式程式任務專精(大型程式碼庫上下文;專門的 SWE 基準)。Seed1.8 是通用的代理式多模態模型,而 Seed-Code 是聚焦程式的專門變體。
Seedream 4.5 API 在 CometAPI 上的實際用例
- 多模態研究助理與文件分析: 從長文件、簡報與多頁報告中擷取、摘要並進行跨文件推理。
- 長影片理解與監控: 安防/體育轉播分析、長會議摘要與串流分析等場景,模型的長影片 token 效率尤為重要。
- 代理式工作流程/自動化: 多步驟的網頁搜尋 + 程式碼執行 + 數據擷取情境(例如內部基準展示的自動化競品分析、旅遊規劃、研究管線)。
- 開發者工具(若使用 Seed-Code): 大型程式碼庫分析、IDE 助理,以及代理式程式碼執行以進行測試與修復(建議使用專門的 Seed-Code 變體)。
- GUI 自動化與 RPA: 螢幕定位與 GUI 代理基準顯示,相較過往 Seed 版本,該模型可更好地執行結構化 GUI 任務。
如何透過 CometAPI 使用 doubao Seed 1.8 API
Doubao seed1.8 目前透過 CometAPI 以託管推理 API 的形式商業提供。該 API 支援多模態負載(文字 + 圖片 + 影片片段/時間戳),並可配置推理模式,以在延遲與計算成本間權衡答案品質。
呼叫模式:API 支援標準的聊天/完成式請求、串流回傳,以及代理式流程,模型可發出工具呼叫(搜尋、程式碼執行、GUI 動作),並將工具輸出作為後續上下文攝入。
串流與長上下文處理:API 支援串流,並內建長工作階段的上下文管理原語(以支援 100K+ 上下文/多步代理追踪)。
步驟 1:申請 API 金鑰
登入 cometapi.com。若非用戶,請先註冊。登入您的 CometAPI 控制台。取得介面的存取憑證 API key。點擊個人中心的 API token 中的「Add Token」,取得 token 金鑰:sk-xxxxx 並提交。
步驟 2:向 doubao Seed 1.8 API 發送請求
選擇「doubao-seed-1-8-251228」端點發送 API 請求並設定請求主體。請求方法與請求主體可於我們網站的 API 文件獲得。我們的網站也提供 Apifox 測試以供方便。將 <YOUR_API_KEY> 替換為您帳戶中的實際 CometAPI 金鑰。與 Chat API 相容。
將您的問題或請求插入 content 欄位——模型將回應該內容。處理 API 回應以取得生成的答案。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的答案。處理完成後,API 會回傳任務狀態與輸出資料。