ข้อมูลจำเพาะทาง技术ของ Seed 1.8 API
| รายการ | ข้อกำหนด / หมายเหตุ |
|---|---|
| ชื่อรุ่น / ตระกูล | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| รูปแบบสื่อที่รองรับ | ข้อความ, รูปภาพ, วิดีโอ (ความสามารถ VLM แบบมัลติโหมด), เครื่องมือด้านเสียงในระบบนิเวศ (มีโมเดลแยกสำหรับการสร้างเสียง/วิดีโอ) |
| ขนาดหน้าต่างบริบท (ข้อความ) | 256K tokens |
| ความสามารถด้านวิดีโอ/ภาพ | ออกแบบมาสำหรับการให้เหตุผลกับวิดีโอยาว รองรับการเข้ารหัสภาพ/วิดีโออย่างมีประสิทธิภาพและงบประมาณโทเคนวิดีโอขนาดใหญ่ (การ์ดโมเดลรายงานการทดลองโทเคนวิดีโอและเบนช์มาร์กวิดีโอยาว) |
| รูปแบบอินพุต | ข้อความอิสระ; อัปโหลดรูปภาพ (ภาพหน้าจอ, ชาร์ต, รูปถ่าย); วิดีโอเป็นเฟรมที่ทำโทเคนไว้ / เครื่องมือวิดีโอสำหรับตรวจส่วน; อัปโหลดไฟล์ (เอกสาร) |
| รูปแบบเอาต์พุต | ข้อความภาษาธรรมชาติ, เอาต์พุตแบบมีโครงสร้าง (structured-output beta), การเรียกฟังก์ชัน/เครื่องมือ, โค้ด และเอาต์พุตมัลติโหมดผ่านการจัดออร์เคสเตรต |
| โหมดการคิด/อนุมาน | no_think, think-low, think-medium, think-high — ปรับสมดุลความแม่นยำกับความหน่วง/ต้นทุน |
Doubao Seed 1.8 คืออะไร?
Doubao Seed 1.8 คือรุ่น 1.8 ของทีม Seed: โมเดล LLM+VLM แบบรวมที่มุ่งเน้น “ความสามารถในการเป็นตัวแทนในโลกจริงแบบทั่วไป” — กล่าวคือ การรับรู้ (ภาพ/วิดีโอ), การให้เหตุผล, การจัดออร์เคสเตรตเครื่องมือ (ค้นหา, เรียกฟังก์ชัน, รันโค้ด, GUI grounding) และการตัดสินใจแบบหลายขั้นภายในโมเดลเดียว การออกแบบเน้นโหมด “การคิด” ที่กำหนดค่าได้ (แลกเปลี่ยนระหว่างความหน่วงกับความลึก), การเข้ารหัสภาพอย่างมีประสิทธิภาพ และการรองรับคอนเท็กซ์ยาวและอินพุตมัลติโหมดโดยกำเนิด เพื่อให้โมเดลทำงานเป็นผู้ช่วย/เอเจนต์อัตโนมัติในเวิร์กโฟลว์การผลิต
คุณลักษณะหลักของ Seed 1.8 API
- โมเดลเอเจนต์มัลติโหมดแบบรวม หนึ่งเดียว รวมการรับรู้ (ภาพ/วิดีโอ), การให้เหตุผล (LLM) และการลงมือทำ (การเรียกเครื่องมือ/G U I, การรันโค้ด) ไว้ในโมเดลเดียว แทนการแยกสายงาน ช่วยให้เวิร์กโฟลว์เอเจนต์กะทัดรัดและลดความซับซ้อนในการออร์เคสเตรต
- คอนเท็กซ์ยาวพิเศษและการจัดการวิดีโอยาว คอนเท็กซ์ยาว (รองรับถึง 256k tokens) และเบนช์มาร์กวิดีโอยาวเฉพาะ (Seed1.8 แสดงประสิทธิภาพโทเคนวิดีโอที่ดี) โมเดลรองรับเครื่องมือวิดีโอแบบเลือกใช้ (VideoCut) เพื่อโฟกัสการให้เหตุผลที่ไทม์สแตมป์
- ระบบอัตโนมัติ GUI แบบเอเจนต์และการใช้เครื่องมือ เบนช์มาร์กและการทดสอบภายใน (OSWorld, AndroidWorld, LiveCodeBench, เบนช์มาร์ก GUI grounding) แสดงการพัฒนางานเอเจนต์ GUI และระบบอัตโนมัติหลายขั้น โมเดลสามารถส่งคำสั่ง GUI grounding และทำงานในบริบท OS/เว็บ/มือถือจำลอง
- โหมดการคิดที่กำหนดค่าได้เพื่อควบคุมความหน่วง/ต้นทุน โหมดอนุมาน 4 ระดับให้ผู้พัฒนาปรับคอมพิวต์ในเวลาทดสอบทั้งสำหรับงานโต้ตอบและงานชุดคุณภาพสูง เหมาะกับระบบโปรดักชันที่มีงบความหน่วงเข้มงวด
- ประสิทธิภาพโทเคนที่ดีขึ้น (มัลติโหมด) Seed 1.8 แสดงประสิทธิภาพโทเคนที่แข็งแกร่งกว่าในเบนช์มาร์กมัลติโหมดเมื่อเทียบกับรุ่นก่อน (ซีรีส์ Seed-1.5/1.6) บรรลุความแม่นยำสูงด้วยงบโทเคนที่เล็กลงในงานวิดีโอยาวหลายตัว
- โหมดการคิดที่กำหนดค่าได้: แลกความลึกของการอนุมานกับความหน่วง/ต้นทุนด้วยโหมดที่แตกต่างกัน (
no_think→think-high) เพื่อปรับใช้ในโปรดักชันแบบโต้ตอบ - ความสามารถทางเทคนิค
- ประสิทธิภาพโทเคน: Seed1.8 แสดงประสิทธิภาพโทเคนที่ชัดเจนกว่าเมื่อเทียบกับรุ่นก่อน (Seed-1.5/1.6) ให้ความแม่นยำที่สูงขึ้นด้วยงบโทเคนต่ำกว่าในงานวิดีโอยาว (เช่น ทำความแม่นยำได้แข่งขันได้แม้ที่ 32K video tokens) ช่วยลดต้นทุนอนุมานสำหรับอินพุตยาว
- การให้เหตุผลและการรับรู้แบบมัลติโหมด: โมเดลทำได้ระดับ SOTA ในหลายงาน VQA แบบหลายภาพและงาน motion/perception และได้ที่สองหรือใกล้ SOTA ในหลายเบนช์มาร์กการให้เหตุผลมัลติโหมด; โดยเฉพาะเหนือกว่ารุ่นก่อนในแทบทุกมิติภาพ/วิดีโอที่วัดผล
- การใช้เครื่องมือแบบเอเจนต์และ GUI grounding: มีการรองรับ GUI grounding และเบนช์มาร์กการทำงานบนหน้าจอ (ScreenSpot-Pro, GUI agenting) โดยให้คะแนน grounding ที่แข็งแกร่ง (เช่น ดีขึ้นกว่า Seed-1.5-VL บน ScreenSpot-Pro)
- การให้เหตุผลแบบขนาน/เป็นขั้น: การเพิ่มคอมพิวต์ขณะทดสอบ (parallel thinking) ให้ผลดีที่วัดได้ในเบนช์มาร์กคณิต, โค้ด และการให้เหตุผลแบบมัลติโหมด
ไฮไลท์จากเบนช์มาร์กสาธารณะของ Seed1.8
- VCRBench (visual commonsense reasoning): Seed1.8 ทำคะแนน 59.8 (Pass@1 ตามรายงานในตารางการ์ดโมเดล) ดีขึ้นจาก Seed-1.5-VL และแข่งขันได้กับโมเดลชั้นนำ
- VideoHolmes (video reasoning): Seed1.8 65.5, เหนือกว่า Seed-1.5-VL และเข้าใกล้โมเดลระดับโปร
- MMLB-NIAH (multimodal long-context, 128k): Seed1.8 ทำได้ 72.2 Pass@1 ที่คอนเท็กซ์ 128k เหนือกว่าบางโมเดลโปรร่วมสมัย
- Motion & Perception suite: SOTA ใน 5 จาก 6 งานที่ประเมิน; ตัวอย่างเช่น TVBench, TempCompass และ TOMATO ที่ Seed1.8 แสดงพัฒนาการเด่นใน perception เชิงเวลา
- Agentic workflows: บน BrowseComp และเบนช์มาร์กการค้นหา/โค้ดแบบเอเจนต์อื่นๆ Seed1.8 มักทำได้ใกล้หรือเหนือกว่าโมเดลโปรคู่แข่ง
Seed 1.8 เทียบกับ Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: เห็นการพัฒนาอย่างชัดเจนในด้านการรับรู้มัลติโหมด, ประสิทธิภาพโทเคนสำหรับวิดีโอยาว และการดำเนินการแบบเอเจนต์
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: บนเบนช์มาร์กมัลติโหมดจำนวนมาก Seed1.8 ทัดเทียมหรือเหนือกว่า Gemini 3 Pro (SOTA บนงาน VQA/การเคลื่อนไหวหลายรายการ; ดีกว่าใน MMLB-NIAH รัน 128k) อย่างไรก็ตาม การ์ดแสดงพื้นที่ที่ตระกูล Gemini ยังได้เปรียบบนงานความรู้เฉพาะสาขาบางส่วน — ดังนั้นการจัดอันดับสัมพันธ์กันขึ้นกับเบนช์มาร์ก
- Seed-Code variant (Doubao-Seed-Code): เชี่ยวชาญสำหรับงานเขียนโปรแกรม/โค้ดแบบเอเจนต์ (คอนเท็กซ์ใหญ่สำหรับฐานโค้ด; เบนช์มาร์ก SWE เฉพาะทาง) Seed1.8 เป็นโมเดลมัลติโหมดเชิงเอเจนต์แบบทั่วไป ขณะที่ Seed-Code คือรุ่นเน้นงานโปรแกรมมิ่ง
กรณีใช้งานจริงโดย Seedream 4.5 API บน CometAPI
- ผู้ช่วยวิจัยแบบมัลติโหมดและการวิเคราะห์เอกสาร: สกัด สรุป และให้เหตุผลข้ามเอกสารยาว เด็ค และรายงานหลายหน้า
- ความเข้าใจและการเฝ้าระวังวิดีโอยาว: วิเคราะห์ด้านความปลอดภัย/กีฬา สรุปการประชุมยาว และการวิเคราะห์สตรีมมิงที่ประสิทธิภาพโทเคนวิดีโอของโมเดลมีความสำคัญ
- เวิร์กโฟลว์แบบเอเจนต์/ระบบอัตโนมัติ: สถานการณ์ค้นเว็บหลายขั้น + รันโค้ด + สกัดข้อมูล (เช่น ท่อส่งการวิเคราะห์คู่แข่งอัตโนมัติ วางแผนการเดินทาง เวิร์กโฟลว์วิจัยตามที่สาธิตในการทดสอบภายใน)
- เครื่องมือสำหรับนักพัฒนา (หากใช้ Seed-Code): วิเคราะห์ฐานโค้ดขนาดใหญ่ ผู้ช่วยใน IDE และการรันโค้ดแบบเอเจนต์เพื่อทดสอบและแก้ไข (แนะนำใช้ Seed-Code สำหรับงานเฉพาะนี้)
- ระบบอัตโนมัติ GUI และ RPA: เบนช์มาร์กการยึดโยงกับหน้าจอและเอเจนต์ GUI บ่งชี้ว่าโมเดลทำงาน GUI แบบมีโครงสร้างได้ดีกว่ารุ่น Seed ก่อนหน้า
วิธีใช้ doubao Seed 1.8 API ผ่าน CometAPI
Doubao seed1.8 เปิดให้ใช้งานเชิงพาณิชย์ผ่าน CometAPI เป็น API ให้บริการอินเฟอเรนซ์แล้ว API รองรับเพย์โหลดแบบมัลติโหมด (ข้อความ + รูปภาพ + ชิ้นส่วนวิดีโอ/ไทม์สแตมป์) และโหมดอนุมานที่กำหนดค่าได้เพื่อแลกความหน่วงและคอมพิวต์กับคุณภาพคำตอบ
รูปแบบการเรียก: API รองรับคำขอแบบแชต/คอมพลีชันมาตรฐาน, การสตรีมคำตอบ และโฟลว์แบบเอเจนต์ที่โมเดลส่ง tool calls (ค้นหา รันโค้ด การกระทำ GUI) และรับผลลัพธ์เครื่องมือเป็นคอนเท็กซ์ลำดับถัดไป
การสตรีมและการจัดการคอนเท็กซ์ยาว: API รองรับสตรีมมิงและมีปฐมธาตุการจัดการคอนเท็กซ์สำหรับเซสชันยาวในตัว (เพื่อรองรับคอนเท็กซ์ 100K+ / ร่องรอยเอเจนต์หลายขั้น)
ขั้นตอนที่ 1: สมัครรับ API Key
เข้าสู่ระบบที่ cometapi.com หากคุณยังไม่เป็นผู้ใช้ กรุณาลงทะเบียนก่อน เข้าสู่ระบบ CometAPI console รับ API key ที่เป็นข้อมูลรับรองการเข้าถึงอินเทอร์เฟซ คลิก “Add Token” ที่ API token ในศูนย์ผู้ใช้ รับ token key: sk-xxxxx แล้วส่ง
ขั้นตอนที่ 2: ส่งคำขอไปยัง doubao Seed 1.8 API
เลือก “doubao-seed-1-8-251228 ” เอนด์พอยต์เพื่อส่งคำขอ API และตั้งค่า request body วิธีการเรียกและ request body สามารถดูได้จากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ยังมี Apifox สำหรับทดสอบเพื่อความสะดวกของคุณ แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ เข้ากันได้กับ Chat APIs
แทรกคำถามหรือคำขอของคุณลงในฟิลด์ content — โมเดลจะตอบสิ่งนี้ ประมวลผลการตอบกลับ API เพื่อรับคำตอบที่สร้างขึ้น
ขั้นตอนที่ 3: ดึงและตรวจสอบผลลัพธ์
ประมวลผลการตอบกลับ API เพื่อรับคำตอบที่สร้างขึ้น หลังประมวลผล API จะตอบสถานะงานและข้อมูลเอาต์พุต