สเปกทางเทคนิคของ Seed 1.8 API
| รายการ | ข้อมูลจำเพาะ / หมายเหตุ |
|---|---|
| ชื่อโมเดล / ตระกูล | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| รูปแบบสื่อที่รองรับ | ข้อความ, ภาพ, วิดีโอ (ความสามารถ VLM แบบมัลติโหมด), เครื่องมือเสียงในระบบนิเวศ (โมเดลแยกสำหรับการสร้างเสียง/วิดีโอ) |
| หน้าต่างบริบท (ข้อความ) | 256K โทเคน |
| ความสามารถด้านวิดีโอ/ภาพ | ออกแบบเพื่อการให้เหตุผลกับวิดีโอแบบยาว รองรับการเข้ารหัสภาพ/วิดีโออย่างมีประสิทธิภาพและงบประมาณโทเคนวิดีโอจำนวนมาก (เอกสารโมเดลรายงานการทดลองโทเคนวิดีโอและการทดสอบวิดีโอยาว) |
| รูปแบบอินพุต | พรอมต์ข้อความอิสระ; อัปโหลดภาพ (สกรีนช็อต, ชาร์ต, ภาพถ่าย); วิดีโอเป็นเฟรมที่แปลงเป็นโทเคน / เครื่องมือวิดีโอสำหรับตรวจดูเซกเมนต์; อัปโหลดไฟล์ (เอกสาร) |
| รูปแบบเอาต์พุต | ข้อความภาษาธรรมชาติ, เอาต์พุตแบบมีโครงสร้าง (structured-output beta), การเรียกฟังก์ชัน/การเรียกเครื่องมือ, โค้ด, และเอาต์พุตมัลติโหมดผ่านการจัดวงจรการทำงาน |
| โหมดการคิด/การอนุมาน | no_think, think-low, think-medium, think-high — แลกเปลี่ยนความแม่นยำกับเวลาแฝง/ต้นทุน |
Doubao Seed 1.8 คืออะไร?
Doubao Seed 1.8 คือรุ่น 1.8 ของทีม Seed: โมเดลรวม LLM+VLM ที่มุ่งสู่ ความเป็นเอเจนต์ในโลกจริงแบบทั่วไป — กล่าวคือ การรับรู้ (ภาพ/วิดีโอ), การให้เหตุผล, การประสานเครื่องมือ (ค้นหา, เรียกฟังก์ชัน, รันโค้ด, การยึดโยง GUI) และการตัดสินใจหลายขั้นตอนภายในโมเดลเดียว การออกแบบเน้นโหมด “การคิด” ที่ปรับแต่งได้ (แลกเวลาแฝงกับความลึก), การเข้ารหัสภาพที่มีประสิทธิภาพ และการรองรับบริบทยาวและอินพุตมัลติโหมดแบบเนทีฟ เพื่อให้โมเดลทำงานเป็นผู้ช่วย/เอเจนต์อัตโนมัติในเวิร์กโฟลว์การผลิต
ฟีเจอร์หลักของ Seed 1.8 API
- โมเดลเอเจนต์แบบมัลติโหมดที่เป็นหนึ่งเดียว รวมการรับรู้ (ภาพ/วิดีโอ), การให้เหตุผล (LLM) และการกระทำ (การเรียกเครื่องมือ/การเรียก G U I, การรันโค้ด) ไว้ในโมเดลเดียวแทนการแยกสายงาน ช่วยให้เวิร์กโฟลว์เอเจนต์กระชับและลดความซับซ้อนในการจัดวงจร
- บริบทยาวพิเศษและการจัดการวิดีโอยาว รองรับบริบทยาว (ผลิตภัณฑ์รองรับถึง 256k โทเคน) และมีงานทดสอบเฉพาะด้านวิดีโอยาว (Seed1.8 แสดงประสิทธิภาพโทเคนวิดีโอที่แข็งแกร่ง) โมเดลรองรับเครื่องมือวิดีโอแบบเลือกใช้ (VideoCut) เพื่อโฟกัสการให้เหตุผลตามเวลาแสตมป์
- ระบบอัตโนมัติ GUI แบบเอเจนต์และการใช้เครื่องมือ ผลการทดสอบ (OSWorld, AndroidWorld, LiveCodeBench, การยึดโยง GUI) แสดงการปรับปรุงในงานเอเจนต์ GUI และระบบอัตโนมัติหลายขั้นตอน โมเดลสามารถส่งคำสั่งการยึดโยง GUI และทำงานในบริบท OS/เว็บ/มือถือจำลอง
- โหมดการคิดที่ปรับแต่งได้เพื่อควบคุมเวลาแฝง/ต้นทุน โหมดการอนุมาน 4 แบบช่วยให้ผู้พัฒนาปรับการคำนวณได้ขณะทดสอบสำหรับงานโต้ตอบกับงานแบบแบตช์คุณภาพสูง เหมาะกับระบบโปรดักชันที่มีข้อกำหนดเวลาแฝงเข้มงวด
- ประสิทธิภาพโทเคนที่ดีขึ้น (มัลติโหมด) Seed 1.8 แสดงประสิทธิภาพโทเคนที่แข็งแกร่งขึ้นในงานทดสอบมัลติโหมดเมื่อเทียบกับรุ่นก่อน (ซีรีส์ Seed-1.5/1.6) ทำความแม่นยำสูงในงบโทเคนที่เล็กลงในงานวิดีโอยาวหลายรายการ
- โหมดการคิดที่ปรับแต่งได้: แลกระดับความลึกของการอนุมานกับเวลาแฝง/ต้นทุนด้วยโหมดที่แตกต่าง (
no_think→think-high) เพื่อปรับให้เหมาะกับการใช้งานเชิงโปรดักชันแบบโต้ตอบ - ความสามารถเชิงเทคนิค
- ประสิทธิภาพโทเคน: Seed1.8 แสดงประสิทธิภาพโทเคนที่โดดเด่นเมื่อเทียบกับรุ่นก่อน (Seed-1.5/1.6) ให้ความแม่นยำสูงขึ้นในงบโทเคนที่ต่ำกว่าในงานวิดีโอยาว (เช่น ทำความแม่นยำแข่งขันได้แม้ที่ 32K โทเคนวิดีโอ) ช่วยลดต้นทุนการอนุมานสำหรับอินพุตยาว
- การให้เหตุผลและการรับรู้แบบมัลติโหมด: โมเดลทำได้ระดับ SOTA ในงาน VQA หลายภาพและงานการเคลื่อนไหว/การรับรู้ และได้อันดับสองหรือใกล้ SOTA ในงานให้เหตุผลแบบมัลติโหมดหลายรายการ โดยเฉพาะเหนือกว่ารุ่นก่อนในเกือบทุกมิติด้านภาพ/วิดีโอที่วัดผล
- การใช้เครื่องมือแบบเอเจนต์และการยึดโยง GUI: รองรับอย่างมีเอกสารในงานการยึดโยงหน้าจอและเกณฑ์ปฏิบัติการบนหน้าจอ (ScreenSpot-Pro, GUI agenting) พร้อมคะแนนการยึดโยงที่แข็งแกร่ง (เช่น ดีกว่า Seed-1.5-VL บน ScreenSpot-Pro)
- การให้เหตุผลแบบขนาน/เป็นขั้นตอน: การเพิ่มการคำนวณขณะทดสอบ (parallel thinking) ให้ผลวัดได้ในงานคณิตศาสตร์, การเขียนโค้ด, และการให้เหตุผลแบบมัลติโหมด
ไฮไลต์เกณฑ์สาธารณะที่คัดสรรของ Seed1.8
- VCRBench (การให้เหตุผลเชิงสามัญสำนึกเชิงภาพ): Seed1.8 ได้คะแนน 59.8 (Pass@1 รายงานในตารางการ์ดโมเดล) เพิ่มขึ้นจาก Seed-1.5-VL และแข่งขันกับโมเดลชั้นนำ
- VideoHolmes (การให้เหตุผลจากวิดีโอ): Seed1.8 65.5 เหนือกว่า Seed-1.5-VL และเข้าใกล้โมเดลคู่แข่งระดับโปร
- MMLB-NIAH (มัลติโหมดบริบทยาว, 128k): Seed1.8 ทำได้ 72.2 Pass@1 ที่บริบท 128k ใน MMLB-NIAH เหนือกว่าโมเดลโปรบางรุ่นร่วมสมัย
- ชุด Motion & Perception: ระดับ SOTA ใน 5 จาก 6 งานที่ประเมิน; ตัวอย่างเช่น TVBench, TempCompass และ TOMATO ซึ่ง Seed1.8 แสดงพัฒนาการชัดเจนในด้านการรับรู้เชิงเวลา
- เวิร์กโฟลว์แบบเอเจนต์: บน BrowseComp และงานค้นหา/โค้ดแบบเอเจนต์อื่น ๆ Seed1.8 มักอยู่ใกล้หรือเหนือกว่าโมเดลโปรคู่แข่ง
Seed 1.8 เทียบกับ Gemini 3 Pro / GPT-5.x
- Seed1.8 เทียบกับ Seed-1.5-VL / Seed-1.6: มีความชัดเจนในด้านการรับรู้มัลติโหมด, ประสิทธิภาพโทเคนสำหรับวิดีโอยาว, และการดำเนินการแบบเอเจนต์
- Seed1.8 เทียบกับ Gemini 3 Pro / GPT-5.x: ในงานทดสอบมัลติโหมดหลายรายการ Seed1.8 ทัดเทียมหรือเหนือกว่า Gemini 3 Pro (ระดับ SOTA ในหลายงาน VQA/งานการเคลื่อนไหว; ดีกว่าในการรัน MMLB-NIAH 128k) อย่างไรก็ตาม การ์ดแสดงพื้นที่ที่ตระกูล Gemini ยังคงได้เปรียบในบางงานความรู้เชิงวิชาการ — ดังนั้นการจัดอันดับสัมพัทธ์ขึ้นกับเกณฑ์
- รุ่น Seed-Code (Doubao-Seed-Code): เชี่ยวชาญงานโปรแกรมมิ่ง/โค้ดแบบเอเจนต์ (บริบทใหญ่สำหรับฐานโค้ด; เกณฑ์ SWE เฉพาะด้าน) Seed1.8 เป็นโมเดลมัลติโหมดเชิงเอเจนต์ทั่วไป ในขณะที่ Seed-Code เน้นงานโปรแกรมมิ่ง
กรณีใช้งานจริงโดย Seedream 4.5 API บน CometAPI
- ผู้ช่วยวิจัยแบบมัลติโหมดและการวิเคราะห์เอกสาร: ดึงข้อมูล ย่อความ และให้เหตุผลข้ามเอกสารยาว, สไลด์เด็ค, และรายงานหลายหน้า
- ความเข้าใจและการมอนิเตอร์วิดีโอยาว: วิเคราะห์ความปลอดภัย/การออกอากาศกีฬา, สรุปประชุมยาว, และการวิเคราะห์สตรีมที่ประสิทธิภาพโทเคนวิดีโอยาวของโมเดลมีความสำคัญ
- เวิร์กโฟลว์แบบเอเจนต์/ระบบอัตโนมัติ: สถานการณ์ค้นหาเว็บหลายขั้น + รันโค้ด + ดึงข้อมูล (เช่น การวิเคราะห์คู่แข่งอัตโนมัติ, การวางแผนการเดินทาง, สายงานวิจัยที่สาธิตในงานทดสอบภายใน)
- เครื่องมือสำหรับนักพัฒนา (หากใช้ Seed-Code): วิเคราะห์ฐานโค้ดขนาดใหญ่, ผู้ช่วย IDE, และการรันโค้ดแบบเอเจนต์เพื่อทดสอบ & ซ่อมแซม (Seed-Code เป็นรุ่นเฉพาะที่แนะนำ)
- ระบบอัตโนมัติ GUI และ RPA: เกณฑ์การยึดโยงหน้าจอและงานเอเจนต์ GUI บ่งชี้ว่าโมเดลสามารถทำงาน GUI แบบมีโครงสร้างได้ดีกว่ารุ่น Seed ก่อนหน้า
วิธีใช้ doubao Seed 1.8 API ผ่าน CometAPI
Doubao seed1.8 เปิดให้บริการเชิงพาณิชย์ผ่าน CometAPI เป็น API การอนุมานแบบโฮสต์แล้ว API รองรับเพย์โหลดมัลติโหมด (ข้อความ + ภาพ + ส่วนวิดีโอ/เวลาแสตมป์) และโหมดการอนุมานที่ปรับแต่งได้เพื่อแลกเวลาแฝงและการคำนวณกับคุณภาพคำตอบ
รูปแบบการเรียก: API รองรับคำขอแบบแชต/สำเร็จรูปมาตรฐาน, การสตรีมผลลัพธ์, และโฟลว์แบบเอเจนต์ที่โมเดลส่งการเรียกเครื่องมือ (ค้นหา, การเรียกฟังก์ชัน, การรันโค้ด, การกระทำ GUI) และรับอินพุตจากเครื่องมือเข้ามาเป็นบริบทถัดไป
การสตรีมและการจัดการบริบทยาว: API รองรับการสตรีมและมีปริมิทีฟจัดการบริบทในตัวสำหรับเซสชันยาว (เพื่อรองรับบริบท 100K+ / ร่องรอยเอเจนต์หลายขั้นตอน)
ขั้นตอนที่ 1: ลงทะเบียนสำหรับ API Key
เข้าสู่ระบบที่ cometapi.com หากยังไม่เป็นผู้ใช้ของเรา โปรดลงทะเบียนก่อน ลงชื่อเข้าใช้ CometAPI console รับ API key สำหรับการเข้าถึงอินเทอร์เฟซ คลิก “Add Token” ที่ API token ในศูนย์ส่วนบุคคล รับ token key: sk-xxxxx แล้วส่ง
ขั้นตอนที่ 2: ส่งคำขอไปยัง doubao Seed 1.8 API
เลือก “doubao-seed-1-8-251228” endpoint เพื่อส่งคำขอ API และตั้งค่าบอดี้ของคำขอ วิธีการและบอดี้คำขอได้รับจากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ของเรายังมีการทดสอบ Apifox เพื่อความสะดวก แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ เข้ากันได้กับ Chat APIs
แทรกคำถามหรือคำขอของคุณลงในช่อง content — โมเดลจะตอบสนองต่อสิ่งนี้ ประมวลผลการตอบสนองของ API เพื่อรับคำตอบที่สร้างขึ้น
ขั้นตอนที่ 3: ดึงและตรวจสอบผลลัพธ์
ประมวลผลการตอบสนองของ API เพื่อรับคำตอบที่สร้างขึ้น หลังการประมวลผล API จะตอบกลับด้วยสถานะงานและข้อมูลเอาต์พุต