ข้อมูลจำเพาะทางเทคนิคของ Wan 2.6
| รายการ | ชุดวิดีโอ Wan 2.6 |
|---|---|
| ผู้ให้บริการ | Alibaba / Tongyi Lab |
| ตระกูลโมเดล | Wan 2.6 |
| ช่วงเวลาเปิดตัว | เจเนอเรชันเดือนธันวาคม 2025 |
| ประเภทอินพุต | ข้อความ, รูปภาพ, วิดีโออ้างอิง, อินพุตเสียง |
| ประเภทเอาต์พุต | วิดีโอพร้อมตัวเลือกเสียงที่ซิงโครไนซ์ |
| โหมดหลัก | ข้อความเป็นวิดีโอ (T2V), รูปภาพเป็นวิดีโอ (I2V), อ้างอิงเป็นวิดีโอ (R2V) |
| ตัวแปร Flash | I2V Flash, R2V Flash |
| รองรับความละเอียด | 720P และ 1080P |
| รองรับระยะเวลา | 2–15 วินาที (ขึ้นกับเวิร์กโฟลว์) |
| ความสามารถด้านเสียง | การสร้างเสียงแบบเนทีฟ, การอ้างอิงเสียง, ลิปซิงก์ |
| การรองรับหลายช็อต | 2–8 ส่วนฉากในเวิร์กโฟลว์เดียว |
| การรองรับอ้างอิง | สูงสุด 5 รายการ (ผสมรูปภาพ/วิดีโอ ขึ้นกับเวิร์กโฟลว์) |
| เวิร์กโฟลว์ API | การสร้างงานแบบอะซิงก์ + การโพลลิ่ง |
Wan 2.6 คืออะไร?
Wan 2.6 เป็นระบบสร้างวิดีโอแบบมัลติโหมดของ Alibaba ที่มุ่งเน้นการผลิตคอนเทนต์สั้นที่ควบคุมได้ แทนที่จะขับเคลื่อนด้วยพรอมต์เพียงอย่างเดียว โมเดลผสานพรอมต์ข้อความ การอ้างอิงรูปภาพ วิดีโออ้างอิง การคอนดิชันเสียง และการเชื่อมฉาก เพื่อรองรับเวิร์กโฟลว์ของผู้สร้าง การอัปเกรดสำคัญเหนือกว่า Wan รุ่นก่อนคือการเพิ่มความสม่ำเสมอที่ขับเคลื่อนด้วยอ้างอิงให้แข็งแกร่งขึ้น และการสร้างเรื่องเล่าที่มีความยาวมากขึ้น
คุณสมบัติหลักของ Wan 2.6
- เวิร์กโฟลว์แบบ Reference-to-Video: ผู้ใช้สามารถป้อนอ้างอิงเป็นรูปภาพหรือวิดีโอเพื่อคงอัตลักษณ์ตัวละคร สไตล์ และความต่อเนื่องของเสียงข้ามการสร้างหลายครั้ง
- การสร้างเรื่องเล่าแบบหลายช็อต: รองรับการเชื่อมพรอมต์หลายรายการเพื่อการเปลี่ยนฉากและความก้าวหน้าของเรื่องราวภายในเวิร์กโฟลว์เดียว
- การซิงโครไนซ์เสียงแบบเนทีฟ: รองรับเสียงที่สร้างขึ้นในตัว การอัปโหลดเสียงแบบกำหนดเอง และเวิร์กโฟลว์ลิปซิงก์
- โหมดอินพุตที่ยืดหยุ่น: รองรับการสร้างจากพรอมต์อย่างเดียว แอนิเมชันเฟรมแรก และเวิร์กโฟลว์ที่ขับเคลื่อนด้วยอ้างอิง
- เวอร์ชัน Flash สำหรับการทดลองทำซ้ำ: เวอร์ชันที่เร็วกว่าเพื่อทดสอบอย่างรวดเร็วก่อนเรนเดอร์คุณภาพสูงขั้นสุดท้าย
- คลิปยาวขึ้น: ระยะเวลาคลิปยืดออกเมื่อเทียบกับเจเนอเรชันก่อนหน้า รองรับการสร้างคอนเทนต์เชิงเรื่องเล่า
สมรรถนะจาก Benchmark ของ Wan 2.6
ความโปร่งใสของ Benchmark อย่างเป็นทางการสำหรับ Wan 2.6 ยังคงจำกัด; Alibaba เผยแพร่ตัวเลข Benchmark มาตรฐานน้อยกว่าผู้ให้บริการ LLM ด้านข้อความ การประเมินส่วนใหญ่มาจากการทดสอบเวิร์กโฟลว์และการเปรียบเทียบในระบบนิเวศ มากกว่าจากกระดานจัดอันดับสาธารณะ การทดสอบโดยชุมชนชี้ให้เห็นอย่างต่อเนื่องว่า:
- ความสม่ำเสมอของตัวละครดีขึ้นเมื่อเทียบกับ Wan รุ่นเก่า
- การซิงโครไนซ์ภาพและเสียงดีขึ้น
- ความต่อเนื่องของหลายช็อตแข็งแกร่งขึ้น
- การคอนดิชันด้วยอ้างอิงเชื่อถือได้มากขึ้น
เนื่องจากการเผยแพร่ Benchmark ยังมีน้อย การทดสอบในสภาพการผลิตยังคงมีความสำคัญก่อนนำไปใช้งานจริง
Wan 2.6 เทียบกับโมเดลวิดีโออื่นๆ
| คุณสมบัติ | Wan 2.6 | Wan 2.7 | Veo-family models |
|---|---|---|---|
| การสร้างเสียงแบบเนทีฟ | แข็งแกร่ง | แข็งแกร่งยิ่งขึ้น | แข็งแกร่ง |
| เวิร์กโฟลว์แบบหลายช็อต | มี | ปรับปรุงแล้ว | ปานกลาง |
| Reference-to-Video | เน้นย้ำอย่างมาก | การควบคุมที่แข็งแกร่งยิ่งขึ้น | ปานกลาง |
| ระยะเวลาคลิป | สูงสุด 15 วินาที | ใกล้เคียง / ขึ้นกับเวิร์กโฟลว์ | แปรผัน |
| การรองรับหลายอ้างอิง | สูงสุด 5 อ้างอิง | เวิร์กโฟลว์ที่ขยายเพิ่ม | ปานกลาง |
| เวิร์กโฟลว์การตัดต่อ | ปานกลาง | การรองรับงานตัดต่อที่ดีกว่า | แข็งแกร่ง |
ข้อจำกัดของ Wan 2.6
- ระยะเวลาคลิปที่สั้นยังเป็นข้อจำกัดต่อการผลิตแบบเนื้อหายาว
- ฉากที่มีการเคลื่อนไหวสูงอาจยังแสดงความไม่เสถียรตามเวลา
- เวิร์กโฟลว์ที่พึ่งพาอ้างอิงมากทำให้ความซับซ้อนในการตั้งค่าเพิ่มขึ้น
- การรายงาน Benchmark ต่อสาธารณะยังคงจำกัด
- ไปป์ไลน์การสร้างแบบอะซิงก์เพิ่มความซับซ้อนในการผสานระบบ
กรณีการใช้งานที่เป็นตัวอย่าง
- วิดีโอการตลาดที่คงความสม่ำเสมอของตัวละคร
- คลิปโซเชียลมีเดียแบบหลายฉาก
- แอนิเมชันอวตารของครีเอเตอร์
- วิดีโอสินค้าแบบขับเคลื่อนด้วยอ้างอิง
- การเล่าเรื่องด้วย AI พร้อมเสียงที่ซิงโครไนซ์
- คอนเทนต์แบรนด์ที่ต้องการคงเอกลักษณ์