สเปกทางเทคนิคของ Wan 3.0
| ข้อกำหนด | Wan 3.0 |
|---|---|
| ประเภทโมเดล | โมเดลสร้างวิดีโอแบบมัลติโหมดครบวงจร |
| สถานะโมเดล | พรีวิว API สาธารณะ |
| ประเภทอินพุต | ข้อความ, รูปภาพ, วิดีโอ, เสียง, เอกสาร, หน้าเว็บ |
| การสร้างวิดีโอ | ข้อความเป็นวิดีโอ, รูปภาพเป็นวิดีโอ, อ้างอิงเป็นวิดีโอ |
| การตัดต่อวิดีโอ | การตัดต่อแบบอิงคำสั่งและแบบอิงข้อมูลอ้างอิง |
| ระยะเวลาสูงสุด | 30 วินาทีต่อการสร้างหนึ่งครั้ง |
| ความละเอียดเอาต์พุต | 480P, 720P, 1080P |
| การสร้างภาพและเสียงแบบเนทีฟ | ใช่ |
| แอสเซ็ตอ้างอิง | สูงสุด 20 แอสเซ็ตอ้างอิงแบบมัลติโหมด |
| อินพุตเอกสาร | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| ขนาดเอกสารสูงสุด | 100 MB |
| จำนวนหน้าสูงสุดของเอกสาร | 50 หน้า |
| การเข้าถึง API | พรีวิว Alibaba Cloud Model Studio API |
| โหมดการสร้าง API | แบบอะซิงโครนัส |
| ราคา 480P | $0.05/sec |
| ราคา 720P | $0.10/sec |
| ราคา 1080P | $0.20/sec |
Wan 3.0 เป็นโมเดลสร้างวิดีโอแบบมัลติโหมดครบวงจรรุ่นล่าสุดของ Alibaba Cloud เปิดตัวอย่างเป็นทางการในเดือนสิงหาคม 2026. การอัปเกรดที่สำคัญที่สุดเหนือรุ่น Wan ก่อนหน้าไม่ใช่เพียงคุณภาพภาพที่สูงขึ้น แต่คือการรวมข้อความ รูปภาพ วิดีโอ เสียง เอกสาร และหน้าเว็บไว้ในเวิร์กโฟลว์สร้างสรรค์เดียว Alibaba Cloud อธิบายว่าโมเดลรองรับการสร้างวิดีโอแบบเนทีฟ 30 วินาที อินพุตอ้างอิงแบบมัลติโหมด การสร้างภาพและเสียงแบบซิงก์กัน และการตัดต่อวิดีโอที่แม่นยำ
Wan 3.0 คืออะไร?
Wan 3.0 คือโมเดลสร้างวิดีโอแบบมัลติโหมดรุ่นถัดไปของ Alibaba ที่ออกแบบมาเพื่อเปลี่ยนข้อความ รูปภาพ วิดีโอ เสียง เอกสาร และเนื้อหาเว็บให้เป็นวิดีโอที่สอดคล้องกัน.
เวิร์กโฟลว์วิดีโอ AI ก่อนหน้านี้มักต้องใช้หลายโมเดลเฉพาะทาง: โมเดลหนึ่งสำหรับข้อความเป็นวิดีโอ อีกโมเดลสำหรับรูปภาพเป็นวิดีโอ อีกโมเดลสำหรับความสม่ำเสมอจากอ้างอิง และเครื่องมือแยกต่างหากสำหรับการตัดต่อหรือเสียง Wan 3.0 ก้าวสู่ โมเดลการผลิตครบวงจร ซึ่งอินพุตเหล่านี้สามารถถูกรวมเข้าด้วยกันภายใต้คำสั่งสร้างสรรค์เดียว
ความสามารถหลักคือ การสร้างแบบเนทีฟ 30 วินาที แทนที่จะผลิตคลิปสั้น 5 หรือ 10 วินาทีที่ต้องขยายและต่อเข้าหากันหลายครั้ง Wan 3.0 สามารถสร้างลำดับวิดีโอต่อเนื่องยาว 30 วินาทีได้ในครั้งเดียว เดโมของ Alibaba แสดงให้เห็นว่าโมเดลสามารถรักษาความคงที่ของตัวละคร สภาพแวดล้อม การเคลื่อนไหว มุมกล้อง บทสนทนา และเสียง ตลอดฉากที่ยาวขึ้น
การเปลี่ยนแปลงสำคัญอีกประการคือ Omni-Reference นักพัฒนาสามารถใช้แอสเซ็ตอ้างอิงหลายรายการเพื่อกำหนดตัวละคร ผลิตภัณฑ์ สภาพแวดล้อม การเคลื่อนไหว หรือคุณลักษณะภาพอื่นๆ ที่เก็บ (repository) อย่างเป็นทางการของ Wan 3.0 ระบุว่ารองรับแอสเซ็ตอ้างอิงสูงสุด 20 รายการ ขณะที่หน้าสินค้าของ Alibaba Cloud เน้นความสามารถในการผสานรูปภาพ ข้อความ วิดีโอ เสียง เอกสาร และหน้าเว็บเป็นข้อมูลอ้างอิงสร้างสรรค์ได้
สิ่งนี้ทำให้ Wan 3.0 มีลักษณะน้อยกว่าเครื่องมือสร้างวิดีโอจากพรอมป์ตแบบง่าย และมากกว่าเป็น เอนจินผลิตงานสร้างสรรค์แบบมัลติโหมด
คุณสมบัติหลักของ Wan 3.0
- การสร้างวิดีโอแบบเนทีฟ 30 วินาที: Wan 3.0 สามารถสร้างวิดีโอได้นานสูงสุด 30 วินาทีในครั้งเดียว พร้อมการเลือกความยาวอัจฉริยะและความสามารถในการขยายวิดีโอ
- Omni-Reference: สามารถผสานข้อความ รูปภาพ วิดีโอ และเสียงเป็นข้อมูลอ้างอิงได้ Wan 3.0 ยังขยายการสร้างแบบอ้างอิงไปยังเอกสารและหน้าเว็บ
- แปลงเอกสารเป็นวิดีโอ (Document-to-video): รองรับไฟล์ PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS และ MD เป็นอินพุตสร้างสรรค์ ทำให้พรีเซนเทชัน รายงาน และข้อมูลเชิงโครงสร้างกลายเป็นคอนเทนต์วิดีโอได้
- การสร้างภาพและเสียงแบบเนทีฟ: สามารถสร้างวิดีโอและเสียงพร้อมกัน รองรับบทสนทนา เสียงบรรยากาศ และฉากเชิงภาพ-ดนตรี
- ความสม่ำเสมอตามข้อมูลอ้างอิง: โมเดลถูกออกแบบให้คงตัวละคร อุปกรณ์ประกอบฉาก สภาพแวดล้อม ความสัมพันธ์เชิงพื้นที่ และสไตล์ ให้สอดคล้องในงานสร้างที่ขับเคลื่อนด้วยอ้างอิง
- การตัดต่อวิดีโอ: Wan 3.0 รองรับการแก้ไขเนื้อหาภาพที่สร้างแล้ว เนื้อเรื่อง และบทสนทนา โดยไม่ต้องเริ่มใหม่ทุกครั้ง
Wan 3.0 เปรียบเทียบกับโมเดลวิดีโออื่นอย่างไร?
| โมเดล | ระยะเวลาเนทีฟ | รูปภาพเป็นวิดีโอ | การควบคุมอ้างอิง | เสียง | อินพุตเอกสาร/เว็บ | จุดแข็งหลัก |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | แข็งแกร่ง | ✓ | ✓ | การผลิตแบบมัลติโหมดครบวงจร |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | จำกัด | เวิร์กโฟลว์วิดีโอ Wan ที่ใช้งานแล้ว |
| Grok Imagine Video 1.5 | สูงสุด 15s | ✓ | ✓ | ✓ | — | วิดีโอครีเอทีฟแบบสั้นที่รวดเร็ว |
| Veo | ขึ้นกับโมเดล | ✓ | ✓ | ✓ | มัลติโหมด | การสร้างสไตล์ภาพยนตร์ |
| Kling | ขึ้นกับโมเดล | ✓ | ✓ | ✓ | — | การสร้างตัวละครและการเคลื่อนไหว |
| Seedance | ขึ้นกับโมเดล | ✓ | ✓ | ✓ | — | วิดีโอสร้างสรรค์และหลายช็อต |
จุดต่างสำคัญคือ ความกว้างของอินพุต
เมื่อเทียบกับ Grok Imagine Video 1.5 Wan 3.0 ก้าวไปไกลกว่าสู่เวิร์กโฟลว์การผลิตแบบครบวงจรอย่างมาก Grok มุ่งเน้นการสร้างวิดีโอสั้นด้วยเวิร์กโฟลว์ข้อความ รูปภาพ และอ้างอิง ขณะที่ Wan 3.0 ผสานเอกสาร หน้าเว็บ เสียง และวิดีโอเข้ามาเป็นข้อมูลอ้างอิงโดยตรงเพิ่มเติม
เมื่อเทียบกับ Wan 2.7 ความเปลี่ยนแปลงเชิงสถาปัตยกรรม/ผลิตภัณฑ์ที่ใหญ่ที่สุดคือการเคลื่อนไปสู่เวิร์กโฟลว์มัลติโหมดแบบรวมศูนย์ และเพดานการสร้างแบบเนทีฟ 30 วินาที เมื่อเทียบกับคลิปรุ่นก่อนที่สั้นกว่า เอกสารของ Alibaba Cloud สำหรับ Wan 3.0 ในปัจจุบันวางตำแหน่งโมเดลรอบการเล่าเรื่องแบบยาวและการสร้างแบบ Omni-Reference อย่างชัดเจน
เมื่อเทียบกับ Kling และ Veo ตัวสร้างความแตกต่างที่แข็งแกร่งที่สุดของ Wan 3.0 ไม่จำเป็นต้องเป็นว่าทุกเฟรมจะดีกว่า แต่คือความสามารถในการผสานวัสดุต้นทางจำนวนมากและคงข้อมูลนั้นไว้ตลอดการสร้างที่ยาวขึ้น
สำหรับแอปพลิเคชันที่อินพุตคือแค่ "เขียนพรอมป์ตนี้แล้วสร้างคลิปสไตล์ภาพยนตร์" โมเดลอื่นๆ อาจยังแข่งขันได้ สำหรับเวิร์กโฟลว์ที่อินพุตคือ "นี่คือรูปผลิตภัณฑ์ อ้างอิงตัวละคร PDF สเปรดชีต ตัวอย่างเสียง และบรีฟงานสร้างสรรค์—เปลี่ยนทั้งหมดให้เป็นวิดีโอที่สอดคล้องกัน" Wan 3.0 จะน่าสนใจกว่ามาก
กรณีการใช้งานที่เป็นตัวอย่างสำหรับ Wan 3.0
1. การทำภาพยนตร์ AI และการผลิตเรื่องราว
ความสามารถในการสร้างครั้งเดียว 30 วินาทีทำให้ Wan 3.0 เหมาะกับฉากที่ต้องการการเคลื่อนไหวกล้องต่อเนื่อง บทสนทนา และหลายแอ็กชันโดยไม่ต้องต่อคลิปสั้นจำนวนมาก
2. โฆษณาสินค้า
รูปภาพผลิตภัณฑ์หรือชุดอ้างอิงสามารถผสานกับพรอมป์ตสไตล์ผู้กำกับเพื่อสร้างเดโมสินค้า โฆษณา UGC และวิดีโอแบรนด์เชิงภาพยนตร์
3. การแปลงพรีเซนเทชันเป็นวิดีโอ
Wan 3.0 รองรับไฟล์ PPT, PDF, DOC, XLS และรูปแบบเอกสารอื่นๆ ที่รองรับ เหมาะสำหรับแปลงรายงาน พรีเซนเทชัน และข้อมูลเชิงโครงสร้างให้เป็นเรื่องเล่าเชิงภาพ
4. วิดีโอที่คงความสม่ำเสมอของตัวละคร
สามารถใช้อ้างอิงรูปภาพ วิดีโอ และสื่ออื่นเพื่อกำหนดตัวละคร วัตถุ และสภาพแวดล้อมก่อนสร้างฉาก
5. คอนเทนต์โซเชียลมีเดีย
ระยะเวลา 30 วินาทีและอัตราส่วนภาพแนวตั้ง 9:16 ทำให้ Wan 3.0 เหมาะสำหรับคอนเทนต์สั้น โฆษณา และคลิปเล่าเรื่อง
6. การตัดต่อและการทำซ้ำวิดีโอ
Wan 3.0 สามารถปรับแก้คอนเทนต์ที่สร้างแล้ว ทั้งองค์ประกอบภาพ เนื้อเรื่อง และบทสนทนา ช่วยให้เวิร์กโฟลว์สร้างสรรค์ทำซ้ำได้อย่างต่อเนื่อง
พารามิเตอร์ API ของ Wan 3.0
API อย่างเป็นทางการใช้เอ็นด์พอยต์การสร้างวิดีโอแบบอะซิงโครนัส คำขอแบบย่อประกอบด้วยอ็อบเจ็กต์ model, input และ parameters
พารามิเตอร์สำคัญประกอบด้วย:
| พารามิเตอร์ | คำอธิบาย |
|---|---|
| model | wan3.0-video |
| input.prompt | คำสั่งการสร้างในสไตล์ผู้กำกับ |
| input.media | รูปภาพ วิดีโอ เสียง ไฟล์ หรือแหล่งข้อมูลเว็บสำหรับอ้างอิง |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 วินาที; -1 เปิดใช้งานความยาวอัจฉริยะ |
| parameters.audio | ว่าจะใส่แทร็กเสียงหรือไม่ |
| parameters.seed | ค่า seed แบบสุ่มเพื่อการทำซ้ำได้ |
| parameters.watermark | ว่าจะใส่วอเตอร์มาร์กหรือไม่ |
เอกสารทางการระบุว่าเมื่อไม่มีวิดีโออินพุต ระยะเวลาสามารถเป็นจำนวนเต็มตั้งแต่ 2 ถึง 30 วินาที เมื่อมีวิดีโออินพุต ระยะเวลาของอินพุตและเอาต์พุตรวมกันต้องอยู่ภายในระยะเวลารวมที่รองรับ
วิธีใช้ Wan 3.0 API บน CometAPI
สำหรับนักพัฒนาที่ใช้โมเดลวิดีโอ AI หลายตัว CometAPI สามารถเป็นเลเยอร์การเข้าถึงแบบรวม เพื่อทดลองใช้ Wan 3.0 ควบคู่กับโมเดลสร้างวิดีโอตัวอื่น
เวิร์กโฟลว์ทั่วไปคือ:
- สร้างหรือลงชื่อเข้าใช้บัญชี CometAPI
- รับคีย์ API ของ CometAPI
- เลือกเอ็นด์พอยต์โมเดล Wan 3.0
- ส่งคำขอสร้างแบบข้อความเป็นวิดีโอ รูปภาพเป็นวิดีโอ หรือแบบอ้างอิง
- กำหนดความละเอียด ระยะเวลา อัตราส่วนภาพ และพารามิเตอร์ที่รองรับอื่นๆ
- ติดตามงานการสร้างแบบอะซิงโครนัส
- ดึงวิดีโอที่สร้างเสร็จเมื่อประมวลผลเสร็จสิ้น
เอ็นด์พอยต์ CometAPI และพารามิเตอร์ที่รองรับที่แน่นอนควรตรวจสอบกับการผสาน Wan 3.0 ของ CometAPI ปัจจุบันก่อนนำไปใช้ โดยเฉพาะอย่างยิ่งเนื่องจาก API ต้นทางของ Alibaba ยังอยู่ในช่วงพรีวิว