ข้อมูลจำเพาะทางเทคนิคของ Wan 2.6
| รายการ | ชุดวิดีโอ Wan 2.6 |
|---|---|
| ผู้ให้บริการ | Alibaba / Tongyi Lab |
| ตระกูลโมเดล | Wan 2.6 |
| กรอบเวลาเปิดตัว | รุ่นเดือนธันวาคม 2025 |
| ประเภทอินพุต | ข้อความ ภาพ วิดีโออ้างอิง อินพุตเสียง |
| ประเภทเอาต์พุต | วิดีโอพร้อมเสียงที่ซิงก์ได้ตามต้องการ |
| โหมดหลัก | Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (R2V) |
| รุ่น Flash | I2V Flash, R2V Flash |
| รองรับความละเอียด | 720P และ 1080P |
| รองรับระยะเวลา | 2–15 วินาที (ขึ้นอยู่กับเวิร์กโฟลว์) |
| ความสามารถด้านเสียง | การสร้างเสียงแบบเนทีฟ การอ้างอิงเสียง ลิปซิงก์ |
| รองรับหลายช็อต | 2–8 เซกเมนต์ฉากภายในเวิร์กโฟลว์เดียว |
| รองรับการอ้างอิง | สูงสุด 5 รายการ (ภาพ/วิดีโอผสมกันตามเวิร์กโฟลว์) |
| เวิร์กโฟลว์ API | การสร้างงานแบบอะซิงก์ + การโพลลิง |
Wan 2.6 คืออะไร?
Wan 2.6 คือระบบสร้างวิดีโอแบบหลายโมดัลของ Alibaba ที่มุ่งเน้นการผลิตคอนเทนต์รูปแบบสั้นที่ควบคุมได้ แทนที่จะขับเคลื่อนด้วยพรอมต์เพียงอย่างเดียว โมเดลนี้ผสานพรอมต์ข้อความ การอ้างอิงภาพ วิดีโออ้างอิง การปรับสภาพเสียง และการเชื่อมฉาก เพื่อเวิร์กโฟลว์ของผู้สร้าง การอัปเกรดหลักเหนือรุ่น Wan ก่อนหน้า คือการเพิ่มความสม่ำเสมอแบบขับเคลื่อนด้วยการอ้างอิงที่แข็งแกร่งขึ้น และความสามารถในการสร้างเรื่องเล่าที่ยาวขึ้น
ฟีเจอร์หลักของ Wan 2.6
- เวิร์กโฟลว์อ้างอิงสู่วิดีโอ: ผู้ใช้สามารถป้อนการอ้างอิงภาพหรือวิดีโอเพื่อคงเอกลักษณ์ตัวละคร สไตล์ และความต่อเนื่องของเสียงข้ามการสร้างหลายครั้ง
- การสร้างเรื่องเล่าหลายช็อต: รองรับการเชื่อมโยงพรอมต์หลายรายการเข้าด้วยกันเพื่อการเปลี่ยนฉากและการดำเนินเรื่องในเวิร์กโฟลว์การสร้างครั้งเดียว
- การซิงโครไนซ์เสียงแบบเนทีฟ: รองรับในตัวสำหรับเสียงที่สร้างขึ้น การอัปโหลดเสียงแบบกำหนดเอง และเวิร์กโฟลว์การลิปซิงก์
- โหมดอินพุตที่ยืดหยุ่น: รองรับการสร้างด้วยพรอมต์อย่างเดียว การแอนิเมตเฟรมแรก และเวิร์กโฟลว์แบบขับเคลื่อนด้วยการอ้างอิง
- รุ่น Flash สำหรับการทดสอบวนรอบ: เวอร์ชันที่เร็วกว่าเพื่อการทดลองอย่างรวดเร็วก่อนเรนเดอร์คุณภาพสูงสุด
- คลิปยาวขึ้น: ระยะเวลาคลิปขยายเมื่อเทียบกับรุ่นก่อนหน้า รองรับการสร้างเนื้อหาเชิงเรื่องเล่า
ประสิทธิภาพตามเกณฑ์วัดของ Wan 2.6
ความโปร่งใสของเกณฑ์มาตรฐานแบบทางการสำหรับ Wan 2.6 ยังมีจำกัด; Alibaba เผยแพร่ตัวเลขเกณฑ์มาตรฐานแบบมาตรฐานน้อยกว่าผู้ให้บริการ LLM ข้อความ การประเมินส่วนใหญ่มาจากการทดสอบเวิร์กโฟลว์และการเปรียบเทียบภายในระบบนิเวศ มากกว่าจากกระดานจัดอันดับสาธารณะ การทดสอบจากชุมชนเน้นอย่างสม่ำเสมอว่า:
- ความสม่ำเสมอของตัวละครดีขึ้นเมื่อเทียบกับรุ่น Wan เก่า
- การซิงโครไนซ์เสียง-วิดีโอที่ดีขึ้น
- ความต่อเนื่องหลายช็อตที่แข็งแรงขึ้น
- การปรับสภาพด้วยการอ้างอิงที่เชื่อถือได้มากขึ้น
เนื่องจากการเผยแพร่เกณฑ์มาตรฐานมีน้อย การทดสอบในสภาพการผลิตยังคงสำคัญก่อนการนำไปใช้งาน
Wan 2.6 เทียบกับโมเดลวิดีโออื่น
| ฟีเจอร์ | Wan 2.6 | Wan 2.7 | โมเดลตระกูล Veo |
|---|---|---|---|
| การสร้างเสียงแบบเนทีฟ | แข็งแกร่ง | แข็งแกร่งกว่า | แข็งแกร่ง |
| เวิร์กโฟลว์หลายช็อต | มี | ปรับปรุงดีขึ้น | ปานกลาง |
| อ้างอิงสู่วิดีโอ | เน้นอย่างมาก | การควบคุมที่แข็งแกร่งกว่า | ปานกลาง |
| ระยะเวลาคลิป | สูงสุด 15 วินาที | ใกล้เคียง / ขึ้นอยู่กับเวิร์กโฟลว์ | แตกต่างกันไป |
| รองรับการอ้างอิงหลายรายการ | สูงสุด 5 รายการ | เวิร์กโฟลว์ที่ขยายเพิ่ม | ปานกลาง |
| เวิร์กโฟลว์การตัดต่อ | ปานกลาง | การรองรับการตัดต่อที่ดีกว่า | แข็งแกร่ง |
ข้อจำกัดของ Wan 2.6
- ระยะเวลาคลิปที่สั้นยังเป็นข้อจำกัดต่อการผลิตเนื้อหาระยะยาว
- ฉากที่มีการเคลื่อนไหวสูงอาจยังแสดงความไม่เสถียรเชิงเวลา
- เวิร์กโฟลว์ที่พึ่งพาการอ้างอิงมากทำให้ความซับซ้อนในการตั้งค่าเพิ่มขึ้น
- การรายงานเกณฑ์มาตรฐานสาธารณะยังมีจำกัด
- ไปป์ไลน์การสร้างแบบอะซิงก์เพิ่มความซับซ้อนในการบูรณาการ
กรณีใช้งานตัวแทน
- วิดีโอมาร์เก็ตติ้งที่คงความสม่ำเสมอของตัวละคร
- คลิปโซเชียลมีเดียหลายฉาก
- แอนิเมชันอวาตาร์ของครีเอเตอร์
- วิดีโอผลิตภัณฑ์แบบขับเคลื่อนด้วยการอ้างอิง
- การเล่าเรื่องด้วย AI พร้อมเสียงซิงก์
- คอนเทนต์แบรนด์ที่ต้องการคงเอกลักษณ์