ตอบก่อน Vidu Q3 สามารถสร้างวิดีโอเล่าเรื่องสั้นจากพรอมป์ข้อความหรือภาพอ้างอิง พร้อมสร้างบทสนทนา เอฟเฟ็กต์เสียง บรรยากาศ และภาพให้ซิงก์กันในเวิร์กโฟลว์เดียว รองรับคลิป ยาวสูงสุด 16 วินาที ที่ 540p, 720p หรือ 1080p ผู้สร้างสามารถทำงานในผลิตภัณฑ์เว็บของ Vidu ขณะที่นักพัฒนาสามารถเรียกโมเดลผ่าน CometAPI ด้วย model ID viduq3.
คู่มือนี้มุ่งเน้นกระบวนการสร้างสรรค์: วางแผนช็อต เลือก text-to-video หรือ image-to-video กำกับการเคลื่อนกล้องและเสียง สร้างตัวแปร ทบทวนข้อบกพร่อง และสร้างเวิร์กโฟลว์เว็บหรือ API ที่ทำซ้ำได้
Vidu Q3 คืออะไร?
Vidu Q3 เป็นโมเดลวิดีโอรุ่นที่สามจาก ShengShu Technology และ Vidu ถูกออกแบบมาเพื่อการสร้างวิดีโอแบบขับเคลื่อนด้วยเรื่องเล่า มากกว่าลูปภาพเคลื่อนไหวง่ายๆ โมเดลสามารถสร้างทั้งลำดับภาพและเสียงเนทีฟไปพร้อมกัน ทำให้บทสนทนา เสียงแวดล้อม เอฟเฟ็กต์ และคิวดนตรีสอดรับกับไทม์มิ่งของฉาก
โมเดลนี้โดดเด่นสำหรับละครสั้น การดัดแปลงคอมิกและมังงะ โฆษณาแนวเล่าเรื่อง พรีวิซภาพยนตร์ เรื่องเล่าผลิตภัณฑ์ และโซเชียลวิดีโอ Vidu เน้น การซิงโครไนซ์ภาพและเสียง เอาต์พุตหลายภาษา ฉากหลายผู้บรรยาย และการควบคุมกล้องและจังหวะอย่างละเอียดเป็นความสามารถหลักของ Q3
Vidu Q3 ปัจจุบันเป็นตระกูลโมเดล ไม่ใช่คอนฟิกเดี่ยว คู่มือนี้โฟกัสหลักไปที่เส้นทาง Q3 Pro ที่เปิดผ่าน viduq3 บน CometAPI
สเปก Vidu Q3 โดยย่อ
หมายเหตุแหล่งข้อมูล: สเปกรวมจาก เอกสาร API ของ Vidu และ หน้ารายการโมเดลของ CometAPI**.
| สเปก | รายละเอียด Vidu Q3 | ความหมายเชิงปฏิบัติ |
|---|---|---|
| ผู้พัฒนา | ShengShu Technology / Vidu | โมเดลวิดีโอเชิงพาณิชย์แบบปิด |
| Official API model ID | viduq3-pro | ใช้ในเวิร์กโฟลว์ข้อความ ภาพ และเฟรมของ Vidu โดยตรง |
| CometAPI model ID | viduq3 | ใช้กับ Videos API แบบรวมของ CometAPI |
| โหมดอินพุต | ข้อความ ภาพ เฟรมเริ่ม/จบ การอ้างอิง | โหมดจริงขึ้นกับหน้าตา API |
| CometAPI inputs ปัจจุบัน | ข้อความ หรือภาพอ้างอิงหนึ่งภาพ | อัปโหลด multipart form สำหรับ image-to-video |
| เอาต์พุต | วิดีโอ MP4 พร้อมเสียงเนทีฟที่ซิงก์ | สร้างบทสนทนาและเอฟเฟ็กต์เสียงไปพร้อมกัน |
| ระยะเวลา | 1–16 วินาทีสำหรับข้อความ ภาพ และเริ่ม/จบ; 3–16 วินาทีสำหรับ reference-to-video | ดีฟอลต์มักอยู่ที่ 5 วินาที |
| ความละเอียด | 540p, 720p, 1080p | CometAPI ใช้ค่า WxH ที่แน่นอน |
| เฟรมเรต | 24 FPS | ระบุไว้บนหน้ารายการโมเดลของ CometAPI |
| ภาษาที่รองรับ | English, Japanese, Chinese | มีประโยชน์สำหรับบทสนทนาแบบlocalized |
| โฟกัสหลัก | วิดีโอเชิงเรื่องเล่าและตัวละคร | ละครสั้น โฆษณา ลำดับภาพสไตล์ภาพยนตร์ |
บริบทสมรรถนะโดยย่อ
บेंชมาร์กสาธารณะมีประโยชน์เป็นเพียงจุดเริ่ม เพราะคุณภาพวิดีโอขึ้นกับพรอมป์ ภาพอ้างอิง การออกแบบช็อต และมาตรฐานการทบทวนอย่างมาก บน SuperCLUE-R2V, Vidu Q3 ได้ 70.89 เทียบกับ 64.01 สำหรับ Vidu Q2 ผลลัพธ์สนับสนุนการปรับปรุงด้านการรักษาอ้างอิงและความต่อเนื่องของตัวแบบใน Q3 แต่ผู้สร้างควรประเมินโมเดลกับตัวละคร ผลิตภัณฑ์ ภาษากล้อง และข้อกำหนดเสียงของตนเอง
การสร้างสรรค์สำคัญกว่าตารางจัดอันดับ สำหรับงานจริง ให้ติดตามสัดส่วนคลิปที่รักษาเอกลักษณ์ตัวตน ดำเนินแอ็กชันตามที่ตั้งใจ ใช้การเคลื่อนกล้องที่ยอมรับได้ ซิงก์บทสนทนา และผ่านการทบทวน เวิร์กโฟลว์ที่ดีที่สุดคือเวิร์กโฟลว์ที่ผลิตช็อตที่ใช้การได้มากที่สุด ไม่ใช่คะแนนโดดเดี่ยวที่สูงที่สุด
คุณสมบัติเด่นของ Vidu Q3
การสร้างภาพและเสียงแบบเนทีฟ
Vidu Q3 สร้างภาพและเสียงในคราวเดียว พรอมป์สามารถขอให้สร้างบทพูด เสียงบรรยาย บรรยากาศเสียง เสียงฝีเท้า การกระทบ หรือเอฟเฟ็กต์อื่นควบคู่ภาพได้ ลดความจำเป็นต้องทำซาวนด์แทร็กแยกสำหรับร่างทุกตัว และทำให้การประเมินไทม์มิ่งระหว่างรีวิวสร้างสรรค์ง่ายขึ้น
มีจุดสำคัญเชิง API: เอกสารของ Vidu เปิดเผยตัวควบคุม audio สำหรับ Q3 แต่สวิตช์ bgm แยกต่างหากไม่เกิดผลกับ Q3 หากดนตรีสำคัญ ให้บรรยายคิวดนตรีและไทม์มิ่งในพรอมป์ CometAPI ในปัจจุบันเปิดพารามิเตอร์พรอมป์ ระยะเวลา ขนาด และภาพอ้างอิงเสริม ดังนั้นคำสั่งด้านเสียงก็ควรถูกเขียนในพรอมป์เช่นกัน
สูงสุด 16 วินาทีต่อการสร้างหนึ่งครั้ง
เพดาน 16 วินาทีเพียงพอสำหรับจังหวะเล่าเรื่องสั้นๆ ครบถ้วน: มุมเปิดเรื่อง แอ็กชันหลักหนึ่งอย่าง บทพูดหนึ่งบรรทัด การเคลื่อนกล้อง และปิดด้วยปฏิกิริยา ยังไม่ใช่การสร้างแบบยาว โฆษณา ตอน หรือมิวสิกวิดีโอต้องการแผนช็อต หลายงาน และการประกอบตัดต่อ
บทสนทนาแบบหลายผู้พูดและหลายภาษา
ผลิตภัณฑ์ถูกออกแบบมาสำหรับบทสนทนาหลายตัวละคร และรองรับเอาต์พุตภาษา English, Japanese, และ Chinese ซึ่งมีประโยชน์สำหรับละครสั้นและแคมเปญโซเชียลที่ localized จงมองการรองรับภาษาเป็นความสามารถ ไม่ใช่การรับประกันว่าการออกเสียง อารมณ์ หรือการขยับปากจะสมบูรณ์แบบทุกครั้ง ควรรีวิวเอาต์พุตก่อนเผยแพร่
การควบคุมกล้องและจังหวะ
Q3 ตอบสนองได้ดีที่สุดเมื่อพรอมป์บรรยายเจตนาภาพยนตร์ แทนการลิสต์วัตถุเพียงอย่างเดียว ระบุขนาดช็อต อารมณ์เลนส์ เส้นทางกล้อง แสง ลำดับแอ็กชัน จังหวะ บทพูด และคิวเสียง คำสั่งกล้องที่สอดคล้องเดี่ยวๆ มักให้โอกาสสำเร็จสูงกว่าการสั่งเคลื่อนไหวที่ขัดแย้งหลายอย่างในช็อตเดียว
ความสม่ำเสมอจากการอ้างอิง
เวิร์กโฟลว์ reference-to-video โดยตรงของ Vidu รองรับ หัวข้ออ้างอิงภาพหรือข้อความสูงสุดเจ็ดรายการ การอ้างอิงสามารถยึดโยงตัวละคร ผลิตภัณฑ์ พร็อพ หรือสไตล์ภาพตลอดตำแหน่งกล้องต่างๆ
- Text-to-video: สร้างฉาก การเคลื่อน การจัดวาง และเสียงจากพรอมป์ที่เขียน
- Image-to-video: ทำให้ภาพอินพุตเดี่ยวขยับ; พรอมป์ควรโฟกัสที่การเคลื่อนไหว พฤติกรรมกล้อง และเสียง
- Start/end-frame generation: สร้างทรานซิชันระหว่างสองจุดยึดภาพบน API ของ Vidu โดยตรง
- Reference-to-video: รักษาความสอดคล้องของหัวข้อหรือสไตล์ตลอดลำดับที่สร้าง
วิธีสร้างวิดีโอด้วย Vidu Q3 บนเว็บ
เวิร์กโฟลว์บนเว็บเร็วที่สุดจากไอเดียไปสู่คลิปที่รีวิวแล้ว ป้ายอินเทอร์เฟซอาจเปลี่ยน แต่ตรรกะการสร้างสรรค์เหมือนเดิม: เลือกโหมดอินพุตที่ถูกต้อง เตรียมจุดยึดภาพ เขียนช็อตที่กำกับได้ สร้างตัวแปร และปรับเฉพาะมิติที่ล้มเหลว
ขั้นที่ 1: กำหนดงานที่ต้องส่งมอบ
ตัดสินใจว่าจะใช้วิดีโอที่ไหน อัตราส่วนภาพ ระยะเวลาที่ตั้งเป้า สไตล์ภาพ ภาษาในการพูด และเอาต์พุตต้องเชื่อมกับช็อตอื่นหรือไม่ ฮุกโซเชียล ช็อตรายละเอียดผลิตภัณฑ์ จังหวะละครสั้น และช็อตพรีวิซภาพยนตร์ต้องใช้จังหวะต่างกัน
ขั้นที่ 2: เลือกโหมดสร้าง
เลือก Text to Video เมื่อการจัดวางองค์ประกอบสามารถให้โมเดลสร้างจากพรอมป์ได้ เลือก Image to Video เมื่อคุณมีตัวละคร ผลิตภัณฑ์ งานภาพ หรือเฟรมที่ต้องการอยู่แล้ว ใช้ Reference to Video บน Vidu โดยตรงเมื่อเอกลักษณ์หรือสไตล์ต้องถูกยึดโดยหลายหัวข้อ
การตัดสินใจโหมด ใช้ text-to-video สำหรับการสำรวจ ใช้ image-to-video เมื่อเฟรมแรกมีการออกแบบที่คุณต้องการปกป้อง ใช้เวิร์กโฟลว์แบบอ้างอิงเมื่อความสม่ำเสมอสำคัญกว่าความประหลาดใจทางภาพ
ขั้นที่ 3: เตรียมภาพอ้างอิง
สำหรับ image-to-video เริ่มจากภาพคมชัดที่มีสัดส่วนตัวแบบ การจัดเฟรม ทิศทางแสง และฉากหลังถูกต้องอยู่แล้ว เว้นพื้นที่ภาพไปทางทิศที่ตัวแบบหรือกล้องควรเคลื่อน หลีกเลี่ยงใบหน้าจิ๋ว มือถูกบัง ฉลากผลิตภัณฑ์อ่านไม่ออก เงาสะท้อนขัดกัน และครอปที่ไม่เหลือพื้นที่ให้เคลื่อนไหว
ขั้นที่ 4: เลือก Vidu Q3
เลือก Q3 สำหรับช็อตในบัญชีรายชื่อที่คุณภาพด้านเรื่องเล่า ความต่อเนื่องของตัวละคร บทสนทนา และเสียงที่ซิงก์สำคัญ ใช้ Q3 Turbo เพื่อสำรวจต้นทุนต่ำ จากนั้นย้ายพรอมป์และภาพอ้างอิงที่ดีที่สุดไปยัง Q3 สำหรับเรนเดอร์สุดท้าย
ขั้นที่ 5: เขียนพรอมป์ช็อตแบบมีโครงสร้าง
เขียนพรอมป์ตามลำดับที่ผู้ชมรับชมช็อต: ตัวแบบและฉาก แอ็กชัน กล้อง ลุค บทพูด เสียง จังหวะเวลา และข้อจำกัด ให้โมเดลมีการเคลื่อนกล้องหลักหนึ่งแบบและแอ็กชันหลักหนึ่งอย่าง
โครงสร้างพรอมป์แบบใช้ซ้ำ
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
ขั้นที่ 6: กำกับบทพูดและเสียง
วางประโยคพูดในเครื่องหมายอัญประกาศ ระบุตัวผู้พูด อธิบายวิธีการพูด และให้บทพูดสั้นพอสำหรับคลิป แยกเสียงบรรยากาศออกจากเอฟเฟ็กต์เสียงที่มีเวลา เช่น Audio: เสียงห้องเงียบตลอด; เสียงกระทบแก้วเซรามิกตอนวินาทีที่สี่; ไม่มีดนตรี
ขั้นที่ 7: ตั้งระยะเวลาและความละเอียด
เริ่มที่ 5 วินาที 720p ยืนยันองค์ประกอบ เอกลักษณ์ การเคลื่อนไหว และเสียง ก่อนใช้เวลามากขึ้นกับเวอร์ชันที่ยาวหรือความละเอียดสูง เพิ่มระยะเวลาเมื่อช็อตต้องเวลามากขึ้นเพื่อให้จังหวะครบเท่านั้น วินาทีที่เพิ่มไม่ทำให้การเคลื่อนไหวดีขึ้นโดยอัตโนมัติ
ขั้นที่ 8: สร้างตัวแปร
สร้างผู้ท้าชิงหลายรายการจากพรอมป์แกนเดียวกันก่อนเขียนใหม่ทั้งหมด ตัวแปรช่วยเผยว่าเป็นปัญหาสุ่มหรือโครงสร้าง หากทุกเอาต์พุตล้มในรูปแบบเดียวกัน เปลี่ยนพรอมป์หรือภาพอ้างอิง หากล้มเพียงรายการเดียว ให้คงพรอมป์และเลือกผู้ท้าชิงตัวอื่น
ขั้นที่ 9: ทบทวนและแก้เพียงหนึ่งมิติ
ทบทวนคลิปเป็นรอบๆ ตรวจเอกลักษณ์และความสมบูรณ์ของวัตถุก่อน จากนั้นแอ็กชันและการเคลื่อนกล้อง ต่อด้วยบทพูดและไทม์มิ่งเสียง และสุดท้ายเฟรมปิด เปลี่ยนเฉพาะมิติที่ล้มเหลวเพื่อไม่ให้คอมโพสิชันดีๆ สูญหายขณะแก้คิวเสียง
- เอกลักษณ์ล้มเหลว: เสริมภาษาการคงสภาพ หรือใช้ภาพอ้างอิงที่สะอาดกว่า
- แอ็กชันอ่อน: แทนที่คำกริยานามธรรมด้วยการเคลื่อนไหวที่มองเห็นได้และทิศทางชัดเจน
- กล้องสับสน: ลบการเคลื่อนที่ขัดแย้ง และระบุเส้นทางเดียวพร้อมความเร็ว
- ลิปซิงก์ไม่ดี: ย่อบทพูด ลดการกระทำพร้อมกัน และระบุผู้พูดกับวิธีการพูด
- ฉากหลังไม่นิ่ง: ทำฉากให้เรียบง่าย และระบุชัดเจนให้รักษาการจัดวางและแสง
ขั้นที่ 10: ดาวน์โหลดและจัดเก็บคลิปที่ชนะ
ดาวน์โหลดหลังจากเอาต์พุตผ่านมาตรฐานเผยแพร่หรือรีวิวลูกค้าแล้ว บันทึกคลิปสุดท้ายพร้อมพรอมป์ ภาพอินพุต ตัวแปรโมเดล ระยะเวลา ความละเอียด และโน้ตการสร้าง เพื่อใช้สูตรสร้างสรรค์ซ้ำได้
ทำไมใช้ Vidu Q3 ผ่าน CometAPI?
CometAPI มีประโยชน์เมื่อผลิตภัณฑ์ต้องการเข้าถึงผู้ให้บริการ AI หลายรายโดยไม่ต้องดูแลชั้นการยืนยันตัวตนและการจัดการงานแยกสำหรับแต่ละราย เส้นทาง Vidu ปัจจุบัน ทำตามเวิร์กโฟลว์แบบอะซิงก์ที่เป็นหนึ่งเดียว: สร้างงาน รับ ID โพลงาน และดาวน์โหลด MP4 ที่เสร็จสิ้น
- API key เดียว สำหรับ Vidu และตระกูลโมเดลอื่น
- แพตเทิร์นงานวิดีโอหนึ่งเดียว สำหรับส่งงาน ดึงสถานะ และดาวน์โหลด
- A/B testing ง่ายขึ้น เมื่อแอปเดียวกันเปรียบเทียบ Vidu, Kling, Veo, Seedance หรือ Wan
- การจัดการการใช้งานแบบศูนย์กลาง สำหรับบิลลิ่ง มอนิเตอร์ และรีวิวการปฏิบัติการ
- โค้ดเฉพาะผู้ให้บริการน้อยลง เมื่อความพร้อมโมเดลหรือราคาเปลี่ยน
หมายเหตุด้านราคา CometAPI ไม่ได้ถูกกว่า API ของ Vidu โดยตรงสำหรับทุกคอนฟิก Q3 ค่าคุ้มคือความสม่ำเสมอเชิงปฏิบัติการและตัวเลือกโมเดล เปรียบเทียบเส้นทาง ความละเอียด ระยะเวลา โหมดคิว และนโยบายบิลลิ่งก่อนใช้งาน
วิธีใช้ Vidu Q3 กับ CometAPI
การใช้งาน Vidu ผ่าน CometAPI ใช้ POST /v1/videos ด้วย multipart/form-data ตัวอย่างด้านล่างเป็นฝั่งเซิร์ฟเวอร์ อย่าเปิดเผยคีย์โปรดักชันใน JavaScript ฝั่งเบราว์เซอร์ แอปมือถือ ที่เก็บสาธารณะ สกรีนช็อต หรือบันทึกฝั่งลูกค้า
ขั้นที่ 1: สร้างและเก็บ CometAPI Key ของคุณ
สร้างหรือเข้าสู่บัญชี CometAPI จากนั้น สร้าง API key เก็บเป็น environment variable
macOS หรือ Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
ขั้นที่ 2: สร้างงาน Text-to-Video
คำขอขั้นต่ำที่ใช้งานได้ต้องมี model ID และพรอมป์ เพิ่มระยะเวลาและขนาดให้ชัดเจนเพื่อให้คำขอทำซ้ำได้
คำขอ cURL text-to-video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
เอนด์พอยต์ตอบกลับทันทีด้วยออบเจกต์งาน โดยไม่รอเรนเดอร์เสร็จ บันทึก id หรือ task_id ที่ได้รับ
ขั้นที่ 3: สร้างงาน Image-to-Video
สำหรับ image-to-video อัปโหลดภาพท้องถิ่นหนึ่งภาพผ่านฟิลด์ multipart input_reference บรรยายการเคลื่อนไหวของภาพ ไม่ใช่ทวนรายละเอียดทุกอย่างที่เห็น
คำขอ cURL image-to-video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
ขั้นที่ 4: อ่านการตอบกลับของงาน
ตัวอย่างการตอบรับงานที่ยอมรับ
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
ถือว่าตัวระบุงานเป็นสตริงที่ไม่ต้องการความหมาย กำหนดมาตรฐาน id และ alias เพื่อความเข้ากันได้ task_id หนึ่งครั้ง จากนั้นเก็บค่าสุดท้ายพร้อมโมเดล พรอมป์ ระยะเวลา ขนาด เวลาเริ่มคำขอ และข้อมูลผู้ใช้หรืองานที่เริ่มเรนเดอร์
ขั้นที่ 5: โพลสถานะงาน
เรียก GET /v1/videos/{task_id} จนสถานะเป็น completed, failed หรือ error เอกสาร retrieve ของ CometAPI แสดงรูปแบบสถานะสุดท้ายเช่นกัน
ลูปโพล Python พร้อม timeout
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
ขั้นที่ 6: ดาวน์โหลดวิดีโอที่เสร็จแล้ว
เมื่อสถานะเป็น completed ให้ดาวน์โหลด MP4 ผ่าน content endpoint บันทึกไฟล์ไปยังสตอเรจถาวรถ้าต้องเก็บระยะยาว
ดาวน์โหลด MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
ขั้นที่ 7: รันเวิร์กโฟลว์ครบใน JavaScript
ตัวอย่าง end-to-end บน Node.js
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
พารามิเตอร์ API ของ Vidu Q3
หมายเหตุแหล่งข้อมูล: ชื่อตัวแปรและลิมิตปัจจุบันตาม เอนด์พอยต์ Vidu บน CometAPI**.
| พารามิเตอร์ | ชนิด | จำเป็น | แนะนำ | วัตถุประสงค์ |
|---|---|---|---|---|
| model | String | ใช่ | viduq3 | เลือก Vidu Q3 |
| prompt | String | ใช่ | พรอมป์ฉากแบบโครงสร้าง | บรรยายภาพ การเคลื่อนไหว กล้อง บทพูด และเสียง |
| seconds | Integer | ไม่ | เริ่มที่ 5 | รับค่า 1 ถึง 16 |
| size | String | ไม่ | 1280x720 | ใช้ค่า WxH ที่รองรับ |
| input_reference | File | โหมดภาพ | PNG/JPEG/WebP | นำทางการสร้างแบบ image-to-video |
ค่าขนาดที่รองรับบนเส้นทาง Vidu ที่มีเอกสาร:
-
960x528— ระดับ 540p, 16:9 -
1280x720— ระดับ 720p, 16:9 -
1920x1080— ระดับ 1080p, 16:9
กฎความเข้ากันได้ ใช้เฉพาะพารามิเตอร์ที่เอกสารของเส้นทางที่คุณเรียกระบุไว้ ฟิลด์เฉพาะผู้ให้บริการเช่น audio, callback_url, หลายหัวข้อ หรือโหมด off-peak ไม่ควรสันนิษฐานว่าจะใช้ได้บนเอนด์พอยต์แบบรวมของ CometAPI เว้นแต่เอกสารของ CometAPI ระบุไว้อย่างชัดเจน
จะเขียนพรอมป์ Vidu Q3 ให้ดีกว่าเดิมได้อย่างไร?
เขียนพรอมป์แต่ละรายการเป็นบรีฟช็อตแบบกระชับ รักษาลำดับฟิลด์ด้านล่าง เพื่อให้ Vidu Q3 ได้รับฐานภาพก่อนการเคลื่อนไหว คำสั่งกล้อง แสง บทพูด เสียง และกฎการคงสภาพ
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
ใช้ตัวแบบชัดเจนหนึ่งตัว แอ็กชันหลักหนึ่งอย่าง และเส้นทางกล้องหนึ่งเส้น รักษาบทพูดให้สั้น แยกเสียงบรรยากาศออกจากเสียงเหตุการณ์ และใช้ข้อจำกัดเพื่อระบุสิ่งที่ต้องไม่เปลี่ยน สำหรับ image-to-video ให้ถือว่าภาพอินพุตคือแหล่งความจริงทางภาพ และโฟกัสพรอมป์ไปที่การเคลื่อนไหว พฤติกรรมกล้อง เสียง และการคงสภาพ
ตัวอย่างพรอมป์ภาพยนตร์
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
ตัวอย่างพรอมป์ผลิตภัณฑ์
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
ตัวอย่างพรอมป์อนิเมะ
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
ตัวอย่างพรอมป์ Image-to-Video
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
สร้างวิดีโอหลายช็อตด้วย Vidu Q3
โฆษณาเต็ม ละครสั้น ตัวอย่างหนัง หรือมิวสิกวิดีโอมักต้องการหลายคลิปที่สร้าง แกะ Vidu Q3 เป็นตัวสร้างช็อต และใช้ช็อตลิสต์ง่ายๆ เพื่อรักษาความต่อเนื่องทั้งลำดับ
| ช็อต | วัตถุประสงค์ | จุดยึดความต่อเนื่อง |
|---|---|---|
| 1. Establish | ช็อตกว้างแนะนำโลเคชันและตัวแบบ | ฉาก เสื้อผ้า เวลา |
| 2. Approach | ช็อตกลางเริ่มแอ็กชันหลัก | ทิศทางบนจอ ตำแหน่งพร็อพ แสง |
| 3. Emphasis | โคลสอัพส่งบทพูดหรือรายละเอียดผลิตภัณฑ์ | ใบหน้าหรือเรขาคณิตของผลิตภัณฑ์ เอกลักษณ์เสียง |
| 4. Resolve | ปฏิกิริยาหรือเฟรมปิดที่สะอาดเพื่อจบจังหวะ | โพสสุดท้าย เกรดสี ทิศทางทรานซิชัน |
ใช้ส่วนหัวความต่อเนื่องซ้ำได้
เริ่มพรอมป์ทุกช็อตด้วยบล็อกเอกลักษณ์สั้นๆ เดียวกัน: ลักษณะตัวละคร เสื้อผ้า การออกแบบผลิตภัณฑ์ โลเคชัน เวลา และสไตล์ภาพ แล้วเปลี่ยนเฉพาะแอ็กชันเฉพาะช็อต การจัดเฟรม กล้อง และเสียง
แพตเทิร์นพรอมป์หลายช็อตแบบใช้ซ้ำ
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
จับคู่ท้ายช็อตหนึ่งกับต้นช็อตถัดไป
- รักษาทิศทางบนจอให้สอดคล้อง เว้นแต่ต้องการกลับทิศโดยตั้งใจ
- ถือพร็อพเดียวกันในมือหรือที่เดิม
- แมตช์เสื้อผ้า สภาพอากาศ ทิศทางแสง และสีเด่น
- จบด้วยโพสหรือคอมโพสิชันนิ่งเพื่อเป็นภาพอ้างอิงช็อตถัดไป
- ใช้เสียงบรรยากาศสอดคล้องกันในช็อตใกล้กัน และเพิ่มเสียงเหตุการณ์เฉพาะที่มีแอ็กชัน
ประกอบและฟินิชนอกตัวสร้าง
ตัดเฟรมเปิดหรือปิดที่อ่อนไม่ชัด จัดลำดับช็อต ทำระดับเสียงให้สม่ำเสมอ เพิ่มไตเติลหรือแคปชันในโปรแกรมตัดต่อ และทำเกรดสีและเสียงสุดท้ายหลังการสร้าง ข้อความบนหน้าจอที่สร้างด้วย AI เชื่อถือน้อยกว่าการใส่ไทโปกราฟีที่แม่นยำในโพสต์โปรดักชัน
เมื่อไหร่ควรเลือก Vidu Q3?
การเปรียบเทียบโมเดลควรสนับสนุนการตัดสินใจสร้างสรรค์ ไม่ใช่ครอบงำมัน คำถามเชิงปฏิบัติคือเวิร์กโฟลว์ใดเหมาะกับช็อตที่คุณต้องผลิตที่สุด
| มิติ | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| ระยะเวลา | 1–16s; official reference-to-video 3–16s | 1–16s; official reference-to-video 3–16s | 4–30s | สูงสุด 15s ขึ้นกับโหมด | 4s, 6s, หรือ 8s ต่อการสร้างใน API |
| เสียง | เสียงเนทีฟที่ซิงก์ | เสียงเนทีฟที่ซิงก์ | สร้างภาพและเสียงเนทีฟ | มีในโหมดเสียงเนทีฟ | เสียงเนทีฟ |
| อ้างอิง | ภาพเดียวบน CometAPI; พื้นผิวทางการมีมากกว่า | ภาพเดียวบน CometAPI; พื้นผิวทางการมีมากกว่า | อ้างอิงมัลติโหมดสูงสุด 50 รายการ | โหมดภาพ เริ่ม/จบ และควบคุมการเคลื่อนไหว | ภาพและคำแนะนำเฟรมแรก/สุดท้าย |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | เส้นทาง text2video/image2video ที่เข้ากันได้กับ Kling | CometAPI POST /v1/videos |
| ราคาที่ระบุ | จาก $0.056/s | จาก $0.028/s | จาก $0.0824/s ในตัวประเมินเส้นทาง | V3 720p: $0.336/5s ไม่มีเสียง | $0.32/s ที่ 720p หรือ 1080p |
| กรณีใช้งานดีที่สุด | ช็อตเล่าเรื่องสั้นพร้อมบทสนทนาและความต่อเนื่อง | ร่าง ทดลองพรอมป์ และการผลิตปริมาณมากขึ้น | เรื่องเล่าที่ยาวขึ้นและอ้างอิงหนัก | กล้องที่ควบคุมได้ การเคลื่อนไหว และการผลิตหลายช็อต | ช็อตภาพยนตร์โฟโตเรียลและฟิสิกส์ที่สมจริง |
หมายเหตุแหล่งข้อมูล: พื้นผิวโมเดลและโหมดที่ใช้ได้อาจเปลี่ยน เอกสารทางการของ Kling อธิบาย โหมด 720p/1080p และเสียงเนทีฟ**; Google อธิบายเวิร์กโฟลว์ เสียงเนทีฟ การควบคุมอ้างอิง และความละเอียดสูงของ Veo 3.1**. รายการราคาคือสแน็ปช็อตเส้นทาง ไม่ใช่การเปรียบเทียบคุณภาพแบบทำให้เท่ากัน; ความละเอียด โหมดเสียง และระดับคุณภาพต่างกัน จึงควรตรวจสอบหน้ารายการโมเดลก่อนเผยแพร่
ผลลัพธ์การเลือกเชิงปฏิบัติ
เลือก Vidu Q3 เมื่อคุณต้องการช็อตเล่าเรื่องสั้นที่มีความต่อเนื่องของตัวละครหรือผลิตภัณฑ์ จังหวะกล้องที่กำกับได้ บทสนทนา บรรยากาศ และเอฟเฟ็กต์เสียงครบในคราวเดียว ใช้ Q3 Turbo เพื่อสำรวจพรอมป์ จากนั้นย้ายเฉพาะทิศทางสร้างสรรค์ที่แข็งแรงที่สุดไปยังเส้นทางพรีเมียม พิจารณาโมเดลอื่นเมื่อความยาวคลิป สแต็กอ้างอิงที่ใหญ่กว่า การควบคุมหลายช็อตเฉพาะทาง หรือฟิสิกส์โฟโตเรียลสำคัญกว่าเวิร์กโฟลว์เชิงเรื่องเล่าของ Q3
Vidu Q3 ราคาเท่าไร?
การตั้งราคาต้องเปรียบเทียบตามเส้นทางอย่างตรงไปตรงมา CometAPI คิดค่าบริการเส้นทาง Vidu Q3 ตามวินาทีที่สร้าง API โดยตรงของ Vidu ก็คิดตามระยะเวลาและความละเอียด และมีคิว off-peak ราคาต่ำกว่าพร้อมหน้าต่างเวลาสำเร็จนานกว่า
| ความละเอียด | CometAPI Vidu Q3 | Vidu Official API | Official off-peak |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
หมายเหตุแหล่งข้อมูล: ราคาต่อวินาทีจาก หน้ารายการโมเดลของ CometAPI และ เอกสารราคา Vidu**. ตรวจสอบบิลลิ่งจริงก่อนเผยแพร่สู่ลูกค้าหรือใช้งาน
ด้วยอัตราที่ระบุ CometAPI ไม่ใช่เส้นทางที่ถูกกว่าสำหรับทุกคอนฟิก Q3 ข้อได้เปรียบคือเชิงปฏิบัติ: key เดียว เอนด์พอยต์วิดีโอที่สม่ำเสมอ การจัดการงานแบบศูนย์กลาง และการสลับผู้ให้บริการง่ายขึ้น ทีมที่ใช้ Vidu เพียงรายเดียวและรอ off-peak ได้ อาจจ่ายน้อยกว่าผ่าน API ของ Vidu โดยตรง
ตัวอย่างค่าใช้จ่ายการรันบน CometAPI
| ระยะเวลา | 540p | 720p | 1080p |
|---|---|---|---|
| 5 วินาที | $0.28 | $0.616 | $0.616 |
| 10 วินาที | $0.56 | $1.232 | $1.232 |
| 16 วินาที | $0.896 | $1.9712 | $1.9712 |
ต้นทุนต่อคลิปที่ใช้ได้ อัตราต่อวินาทีต่ำก็ยังแพงได้ถ้าส่วนใหญ่ถูกปฏิเสธ ติดตามค่าใช้จ่ายรวมหารด้วยเอาต์พุตที่ผ่านรีวิวสร้างสรรค์ ไม่ใช่เพียงราคาที่โฆษณาของเรนเดอร์หนึ่งครั้ง
แนวปฏิบัติที่ดีที่สุดในการผลิต
กลยุทธ์การไล่ซ้ำสร้างสรรค์ที่ดีกว่า
- เริ่มเล็ก. ใช้คำขอ 5 วินาที 720p เพื่อยืนยันองค์ประกอบ แอ็กชัน และการเคลื่อนกล้อง
- สร้างตัวแปรแบบควบคุม. รักษาพรอมป์แกนให้คงที่และเปลี่ยนเพียงทางเลือกสร้างสรรค์หนึ่งอย่างในแต่ละครั้ง
- วินิจฉัยมิติที่ล้มเหลว. แยกปัญหาเอกลักษณ์ การเคลื่อนไหว กล้อง เสียง และความต่อเนื่องก่อนแก้พรอมป์
- แยกเส้นทางร่างและสุดท้าย. ใช้เวอร์ชันเร็วเพื่อสำรวจ และเวอร์ชันพรีเมียมเฉพาะสำหรับพรอมป์ที่ผ่านคัดเลือก
- เก็บสูตรที่ชนะ. จัดเก็บพรอมป์สุดท้าย อ้างอิง การตั้งค่า เอาต์พุต และโน้ตรีวิวเพื่อใช้ซ้ำ
เช็กลิสต์รีวิววิดีโอ Vidu Q3
การรีวิวทุกอย่างพร้อมกันทำให้แก้พรอมป์ยาก ใช้รอบแยกเพื่อให้การปฏิเสธแต่ละครั้งนำไปสู่การแก้เฉพาะจุด
| รอบรีวิว | เกณฑ์ยอมรับ | แก้ไขอะไรถ้าล้มเหลว |
|---|---|---|
| ตัวแบบ | ใบหน้า ร่างกาย เสื้อผ้า เรขาคณิตผลิตภัณฑ์ ฉลาก และพร็อพยังคงสอดคล้อง | อ้างอิงหรือพรอมป์การคงสภาพ |
| แอ็กชัน | การเคลื่อนไหวหลักสมบูรณ์ อ่านออก และมีเวลาเหมาะสม | คำกริยาแอ็กชัน ทิศทาง และลำดับจังหวะ |
| กล้อง | การเคลื่อนตามเส้นทางเดียว ไม่มีจัมพ์ ดริฟต์ หรือรีเฟรมไม่ตั้งใจ | ขนาดช็อต เส้นทาง ความเร็ว และจุดสิ้นสุด |
| ฉาก | การจัดฉาก แสง อากาศ และการเคลื่อนไหวรองนิ่งและเสถียร | ความซับซ้อนของฉากและข้อจำกัดความต่อเนื่อง |
| เสียง | บทพูด การออกเสียง ลิปซิงก์ บรรยากาศ และคิวเสียงสอดคล้องกับแอ็กชัน | บทพูดให้สั้นลงและไทม์ไลน์เสียงที่ชัดเจน |
| เฟรมปิด | คอมโพสิชันสุดท้ายสะอาดพอจะค้าง ตัด หรือเป็นเมล็ดช็อตถัดไป | โพสสุดท้ายและจุดสิ้นสุดของกล้อง |
กฎการอนุมัติ อย่าอนุมัติคลิปเพียงเพราะเฟรมเดียวดูดี ดูที่ความเร็วปกติ แล้วตรวจเฟรมเปิด จุดพีคของแอ็กชัน ช่วงบทพูด และเฟรมสุดท้าย วิดีโอที่ใช้ได้ต้องสอดคล้องตลอดเวลา
คำถามที่พบบ่อยเกี่ยวกับ Vidu Q3
Vidu Q3 สร้างวิดีโอและเสียงพร้อมกันได้หรือไม่?
ได้ Q3 ถูกออกแบบมาสำหรับการสร้างภาพและเสียงโดยตรง รวมทั้งบทสนทนาและเอฟเฟ็กต์เสียง อธิบายเสียงที่ต้องการและไทม์มิ่งภายในพรอมป์เมื่อใช้เส้นทางแบบรวมของ CometAPI
CometAPI model ID สำหรับ Vidu Q3 คืออะไร?
ใช้ viduq3 กับ Videos API ปัจจุบันของ CometAPI อย่าแทนที่ด้วยชื่อผู้ให้บริการ viduq3-pro เว้นแต่เอกสารของเส้นทางนั้นจะระบุไว้ชัดเจน
วิดีโอ Vidu Q3 ยาวได้แค่ไหน?
การสร้าง Q3 เดี่ยวรองรับ 1–16 วินาที งานที่ยาวกว่าต้องใช้หลายช็อตและการตัดต่อ
Vidu Q3 รองรับ image-to-video หรือไม่?
รองรับ บน CometAPI ให้อัปโหลดภาพหนึ่งภาพผ่าน input_reference และใช้พรอมป์เพื่ออธิบายการเคลื่อนไหว พฤติกรรมกล้อง เสียง และสิ่งที่ต้องไม่เปลี่ยน
Vidu Q3 สร้างบทสนทนาได้หลายภาษาไหม?
Vidu ระบุเอาต์พุตภาษา English, Japanese, และ Chinese ให้รีวิวการออกเสียง เอกลักษณ์เสียง อารมณ์ และลิปซิงก์ก่อนเผยแพร่เนื้อหาที่ localized
ควรใช้ Vidu Q3 หรือ Vidu Q3 Turbo?
ใช้ Q3 เมื่อคุณภาพภาพสุดท้าย ความสม่ำเสมอของเรื่องเล่า และความต่อเนื่องของตัวละครสำคัญกว่าความเร็ว ใช้ Q3 Turbo สำหรับร่าง ทดลองพรอมป์ และเวิร์กโฟลว์ปริมาณมาก
CometAPI ถูกกว่าหรือไม่เมื่อเทียบกับ API ทางการของ Vidu?
ไม่ใช่ทุกคอนฟิก อัตราสาธารณะปัจจุบันแสดงว่าโหมดปกติและ off-peak ของ Vidu โดยตรงอาจถูกกว่า เลือก CometAPI สำหรับการเข้าถึงรวม key เดียว การจัดการงานแบบเดียว และการสลับโมเดลข้ามผู้ให้บริการที่ง่ายขึ้น ไม่ใช่จากคำอ้างที่ไม่มีหลักฐานว่าถูกกว่าเสมอ
ข้อแนะนำสุดท้าย
Vidu Q3 เป็นตัวเลือกที่แข็งแรงสำหรับวิดีโอเล่าเรื่องสั้นที่ต้องการภาพ บทสนทนา บรรยากาศ และเอฟเฟ็กต์เสียงออกมาพร้อมกัน จุดแข็งในการผลิตที่มีประโยชน์ที่สุดคือการสร้างสูงสุด 16 วินาที ความสอดคล้องจากอ้างอิง บทสนทนาแบบหลายผู้พูด เอาต์พุตหลายภาษา และการควบคุมกล้องและจังหวะผ่านพรอมป์
สำหรับการทดสอบครั้งแรก ใช้คำขอ 5 วินาที 720p ที่มีตัวแบบหนึ่ง แอ็กชันหลักหนึ่ง การเคลื่อนกล้องหนึ่ง และคำสั่งเสียงที่ชัดเจน ไล่ซ้ำพรอมป์ด้วยต้นทุนต่ำ แล้วค่อยเพิ่มความละเอียดหรือระยะเวลาเมื่อคอมโพสิชันทำงาน ใช้ Q3 Turbo สำหรับการสำรวจ และใช้ Q3 มาตรฐานสำหรับเรนเดอร์สุดท้ายของพรอมป์ที่ผ่านคัดเลือก
เพื่อการผลิตที่ทำซ้ำได้ เปลี่ยนผลลัพธ์ที่อนุมัติแต่ละรายการให้เป็นสูตรสร้างสรรค์ที่นำกลับมาใช้ใหม่: เก็บพรอมป์สุดท้าย ภาพอ้างอิง ID โมเดล ระยะเวลา ความละเอียด เมทาดาท้างาน และโน้ตรรีวิว สร้างวิดีโอหลายช็อตจากคลิปเดี่ยวที่นิ่ง แล้วเพิ่มไตเติล แคปชัน การตัดต่อ เกรดสี และเสียงสุดท้ายในโพสต์โปรดักชัน CometAPI มีคุณค่ามากที่สุดเมื่อเวิร์กโฟลว์นี้ต้องการแพตเทิร์นงานเดียวและการรูตไปยังโมเดลวิดีโอหลายตัวได้ง่าย
เริ่มลงมือสร้าง เปิดหน้ารายการโมเดล Vidu Q3 สร้าง CometAPI key ส่งงานทดสอบขนาดเล็ก และทดสอบเวิร์กโฟลว์ครบ create → poll → download
