Thông số kỹ thuật của Seed 1.8 API
| Hạng mục | Thông số / ghi chú |
|---|---|
| Tên mô hình / họ | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Các phương thức hỗ trợ | Văn bản, hình ảnh, video (khả năng VLM đa phương thức), công cụ âm thanh trong hệ sinh thái (các mô hình riêng cho tạo âm thanh/video). |
| Cửa sổ ngữ cảnh (văn bản) | 256K tokens |
| Năng lực video / thị giác | Được thiết kế cho suy luận video dài, hỗ trợ mã hóa thị giác hiệu quả và ngân sách video-token lớn (thẻ mô hình báo cáo các thí nghiệm token video và điểm chuẩn video dài). |
| Định dạng đầu vào | Prompt văn bản tự do; tải lên hình ảnh (ảnh chụp màn hình, biểu đồ, ảnh); video dưới dạng khung hình đã token hóa / công cụ video để kiểm tra phân đoạn; tải lên tệp (tài liệu). |
| Định dạng đầu ra | Văn bản ngôn ngữ tự nhiên, đầu ra có cấu trúc (structured-output beta), lời gọi hàm / lời gọi công cụ, mã, và đầu ra đa phương thức thông qua điều phối. |
| Chế độ suy nghĩ / suy luận | no_think, think-low, think-medium, think-high — đánh đổi độ chính xác với độ trễ/chi phí. |
Doubao Seed 1.8 là gì?
Doubao Seed 1.8 là bản phát hành 1.8 của đội Seed: một mô hình hợp nhất LLM+VLM nhắm tới “năng lực tác tử trong thế giới thực” tổng quát — tức là tri nhận (hình ảnh/video), suy luận, điều phối công cụ (tìm kiếm, lời gọi hàm, thực thi mã, định vị GUI) và ra quyết định đa bước trong cùng một mô hình. Thiết kế nhấn mạnh các “chế độ suy nghĩ” có thể cấu hình (đánh đổi giữa độ trễ và độ sâu), mã hóa thị giác hiệu quả và hỗ trợ gốc cho ngữ cảnh dài và đầu vào đa phương thức để mô hình có thể hoạt động như một trợ lý/tác tử tự chủ trong quy trình sản xuất.
Tính năng chính của Seed 1.8 API
- Mô hình tác tử đa phương thức hợp nhất. Tích hợp tri nhận (hình ảnh/video), suy luận (LLM) và hành động (lời gọi công cụ/G U I, thực thi mã) trong một mô hình thay vì pipeline tách rời. Điều này cho phép quy trình tác tử gọn nhẹ và giảm độ phức tạp điều phối.
- Ngữ cảnh siêu dài & xử lý video dài. Ngữ cảnh dài (sản phẩm hỗ trợ đến 256k token) và các điểm chuẩn video dài cụ thể (Seed1.8 thể hiện hiệu quả token video mạnh). Mô hình hỗ trợ công cụ video chọn lọc (VideoCut) để tập trung suy luận vào các mốc thời gian.
- Tự động hóa GUI mang tính tác tử & sử dụng công cụ. Các điểm chuẩn và thử nghiệm nội bộ (OSWorld, AndroidWorld, LiveCodeBench, điểm chuẩn định vị GUI) cho thấy cải thiện trong nhiệm vụ tác tử GUI và tự động hóa đa bước. Mô hình có thể xuất lệnh định vị GUI và vận hành trong ngữ cảnh OS/web/di động mô phỏng.
- Chế độ suy nghĩ có thể cấu hình để kiểm soát độ trễ/chi phí. Bốn chế độ suy luận cho phép nhà phát triển tinh chỉnh compute tại thời gian chạy cho tác vụ tương tác vs. lô chất lượng cao. Hữu ích cho hệ thống sản xuất với ngân sách độ trễ nghiêm ngặt.
- Hiệu quả token được cải thiện (đa phương thức). Seed 1.8 thể hiện hiệu quả token mạnh hơn trên các điểm chuẩn đa phương thức so với các phiên bản trước (Seed-1.5/1.6), đạt độ chính xác cao với ngân sách token nhỏ hơn trong nhiều tác vụ video dài.
- Chế độ suy nghĩ có thể cấu hình: đánh đổi độ sâu suy luận với độ trễ/chi phí bằng các chế độ riêng biệt (
no_think→think-high) để tinh chỉnh cho sử dụng sản xuất mang tính tương tác. - Năng lực kỹ thuật
- Hiệu quả token: Seed1.8 cho thấy hiệu quả token nổi bật so với các phiên bản trước (Seed-1.5/1.6), mang lại độ chính xác cao hơn với ngân sách token thấp hơn trên các tác vụ video dài (ví dụ, đạt độ chính xác cạnh tranh ngay cả ở 32K video tokens). Điều này cho phép giảm chi phí suy luận cho đầu vào dài.
- Suy luận & tri nhận đa phương thức: Mô hình đạt SOTA trên một số tác vụ VQA đa ảnh và chuyển động/tri nhận, và đứng thứ hai hoặc gần SOTA trên nhiều điểm chuẩn suy luận đa phương thức; cụ thể vượt trội so với phiên bản tiền nhiệm ở hầu như mọi khía cạnh thị giác/video được đo.
- Sử dụng công cụ mang tính tác tử & định vị GUI: Hỗ trợ được ghi nhận cho định vị GUI và các điểm chuẩn vận hành dựa trên màn hình (ScreenSpot-Pro, GUI agenting) với điểm số định vị mạnh (ví dụ, cải thiện so với Seed-1.5-VL trên ScreenSpot-Pro).
- Suy luận song song / theo bước: Tăng compute tại thời gian kiểm thử (suy nghĩ song song) mang lại tăng trưởng đo được trên các điểm chuẩn toán, lập trình và suy luận đa phương thức
Selected public benchmark highlights of Seed1.8
- VCRBench (suy luận thường thức thị giác): Seed1.8 đạt 59.8 (Pass@1 được báo cáo trong bảng thẻ mô hình), cải thiện so với Seed-1.5-VL và cạnh tranh với các mô hình hàng đầu
- VideoHolmes (suy luận video): Seed1.8 65.5, vượt Seed-1.5-VL và tiệm cận các mô hình đối thủ cấp pro.
- MMLB-NIAH (đa phương thức, ngữ cảnh dài, 128k): Seed1.8 đạt 72.2 Pass@1 ở ngữ cảnh 128k trong MMLB-NIAH, vượt một số mô hình pro đương thời.
- Bộ Motion & Perception: SOTA ở 5/6 tác vụ được đánh giá; ví dụ gồm TVBench, TempCompass và TOMATO nơi Seed1.8 cho thấy mức tăng đáng kể về tri nhận theo thời gian.
- Quy trình tác tử: Trên BrowseComp và các điểm chuẩn tác tử tìm kiếm/mã khác, Seed1.8 thường xếp gần hoặc cao hơn các mô hình pro cạnh tranh
Seed 1.8 so với Gemini 3 Pro / GPT-5.x
- Seed1.8 so với Seed-1.5-VL / Seed-1.6: Cải thiện rõ rệt về tri nhận đa phương thức, hiệu quả token cho video dài và khả năng thực thi tác tử.
- Seed1.8 so với Gemini 3 Pro / GPT-5.x: Trên nhiều điểm chuẩn đa phương thức, Seed1.8 sánh ngang hoặc vượt Gemini 3 Pro (SOTA trên một số tác vụ VQA / chuyển động; tốt hơn ở lượt chạy MMLB-NIAH 128k). Tuy nhiên, thẻ cũng cho thấy các mô hình họ Gemini vẫn có lợi thế ở một số tác vụ kiến thức chuyên ngành — nên thứ hạng tương đối phụ thuộc vào điểm chuẩn.
- Biến thể Seed-Code (Doubao-Seed-Code): chuyên cho nhiệm vụ lập trình/nhiệm vụ mã mang tính tác tử (ngữ cảnh lớn cho codebase; điểm chuẩn SWE chuyên biệt). Seed1.8 là mô hình tác tử đa phương thức tổng quát, còn Seed-Code là biến thể tập trung lập trình.
Các trường hợp sử dụng thực tế bởi Seedream 4.5 API trên CometAPI
- Trợ lý nghiên cứu đa phương thức & phân tích tài liệu: trích xuất, tóm tắt và suy luận trên tài liệu dài, bộ slide và báo cáo nhiều trang.
- Hiểu & giám sát video dài: phân tích an ninh/phát sóng thể thao, tóm tắt họp dài và phân tích streaming nơi hiệu quả token video dài của mô hình quan trọng.
- Quy trình tác tử / tự động hóa: kịch bản đa bước gồm tìm kiếm web + thực thi mã + trích xuất dữ liệu (ví dụ, phân tích cạnh tranh tự động, lập kế hoạch du lịch, pipeline nghiên cứu được minh họa trong điểm chuẩn nội bộ).
- Công cụ cho nhà phát triển (nếu dùng Seed-Code): phân tích codebase lớn, trợ lý IDE và thực thi mã mang tính tác tử cho kiểm thử & sửa lỗi (Seed-Code là biến thể chuyên dụng được khuyến nghị).
- Tự động hóa GUI & RPA: các điểm chuẩn định vị màn hình và tác tử GUI cho thấy mô hình có thể thực hiện các tác vụ GUI có cấu trúc tốt hơn so với các bản Seed trước.
Cách sử dụng doubao Seed 1.8 API qua CometAPI
Doubao seed1.8 hiện được cung cấp thương mại qua CometAPI như một API suy luận được lưu trữ. API hỗ trợ payload đa phương thức (văn bản + hình ảnh + phân đoạn/timestamp video) và các chế độ suy luận có thể cấu hình để đánh đổi giữa độ trễ và compute với chất lượng câu trả lời.
Mẫu gọi: API hỗ trợ yêu cầu kiểu chat/completion tiêu chuẩn, phản hồi dạng streaming và luồng tác tử nơi mô hình phát ra lời gọi công cụ (tìm kiếm, thực thi mã, hành động GUI) và nạp đầu ra công cụ làm ngữ cảnh tiếp theo.
Streaming & xử lý ngữ cảnh dài: API hỗ trợ streaming và có sẵn các nguyên thủy quản lý ngữ cảnh cho phiên dài (để cho phép ngữ cảnh 100K+ / vết truy vết tác tử đa bước).
Bước 1: Đăng ký API Key
Đăng nhập cometapi.com. Nếu bạn chưa là người dùng, vui lòng đăng ký trước. Đăng nhập vào Bảng điều khiển CometAPI. Lấy khóa truy cập API key của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.
Bước 2: Gửi yêu cầu đến doubao Seed 1.8 API
Chọn endpoint “doubao-seed-1-8-251228 ” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức và phần thân yêu cầu được lấy từ tài liệu API trên website của chúng tôi. Website cũng cung cấp kiểm thử Apifox để bạn tiện sử dụng. Thay <YOUR_API_KEY> bằng khóa CometAPI thực tế từ tài khoản của bạn. Tương thích với API Chat.
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là nội dung mà mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời được tạo. Sau khi xử lý, API phản hồi trạng thái tác vụ và dữ liệu đầu ra.