สรุปย่อ Wan 3.0 (หรือเขียนว่า Wan3.0) โมเดลวิดีโอแบบ all-in-one รุ่นล่าสุดจาก Alibaba Tongyi Lab สร้างคลิปต่อเนื่องแบบเนทีฟความยาว 30 วินาที ระดับความละเอียดสูงสุด 1080p พร้อมเสียงที่ซิงก์กันได้ในครั้งเดียว รองรับการแปลงข้อความเป็นวิดีโอ (text-to-video), ภาพเป็นวิดีโอ (image-to-video), การกำหนดเงื่อนไขเฟรมแรกและเฟรมสุดท้าย และเวิร์กโฟลว์ Omni-Reference อันทรงพลังที่รับอินพุตผสมได้ทั้งรูปภาพ วิดีโอ เสียง เอกสาร (PDF, PPT, XLS, DOC, MD ฯลฯ) และเว็บเพจ
เปิด Public beta เมื่อวันที่ 6 สิงหาคม 2026; ขยายการเข้าถึงกว้างขึ้นราววันที่ 24 สิงหาคม 2026 ราคาโดยประมาณ $0.05/วินาที (480p), $0.10/วินาที (720p) และ $0.20/วินาที (1080p) สำหรับนักพัฒนาและทีมที่ต้องการ API แบบรวมศูนย์ที่เข้ากันได้กับ OpenAI เพื่อเข้าถึงโมเดลตระกูล Wan และโมเดลอื่นๆ อีกกว่า 500 โมเดลด้วยการผสานที่เรียบง่าย สามารถใช้ CometAPI เป็นทางเลือกที่มีประสิทธิภาพ—ขณะนี้มี Wan 2.7 และแคตตาล็อกวิดีโอที่เพิ่มขึ้นผ่าน /v1/videos
ประเด็นสำคัญ
- การสร้างแบบเนทีฟ 30 วินาทีในครั้งเดียว (เพิ่มขึ้นเป็นสองเท่าจากข้อจำกัด ~15 วินาทีของ Wan 2.7/2.5) พร้อมการจับคู่ความยาวอย่างชาญฉลาด
- Omni-Reference: รองรับสินทรัพย์ผสมได้ราว ~10–20 รายการ (ภาพ วิดีโอรวม ≤15 วินาที เสียง เอกสาร/เว็บเพจ 1 แหล่ง) เพื่อความคงเส้นคงวาของตัวแบบ ผลิตภัณฑ์ และสไตล์
- การแปลงเอกสารและเว็บเพจเป็นวิดีโอโดดเด่นเป็นพิเศษ: ป้อน PDF สไลด์ สเปรดชีต หรือ URL สาธารณะแล้วรับวิดีโอที่มีโครงสร้าง
- รองรับการสร้างเสียงแบบเนทีฟในครั้งเดียวกัน; ความละเอียด 480p/720p/1080p; อัตราส่วนภาพหลากหลาย
- ความเที่ยงตรงใบหน้า/ไมโครเอกซ์เพรสชันดีขึ้น อ้างอิงเสถียรกว่าเดิม และข้อความบนหน้าจอสะอาดกว่ารุ่นก่อน
- เข้าถึงผ่าน Alibaba Cloud Model Studio / Qwen Cloud (โมเดล
wan3.0-video), wan.video และแพลตฟอร์มบุคคลที่สาม สำหรับการพัฒนาแบบหลายโมเดลที่คล่องตัว ใช้เอ็นด์พอยต์วิดีโอแบบรวมของ CometAPI - เขียนพรอมต์ให้เหมือนบรีฟถ่ายทำ (ตัวแบบ + แอ็กชัน + กล้อง + ไทมิ่ง + ข้อจำกัด) และระบุเรฟชัดเจน (@Image1 เป็นต้น)
Wan 3.0 คืออะไร
Wan 3.0 เป็นรุ่นเรือธงล่าสุดในตระกูลโมเดลสร้างวิดีโอ Tongyi Wanxiang (Wan) ของ Alibaba ที่พัฒนาโดย Tongyi Lab โดยต่อยอดจากสายพันธุ์ diffusion-transformer ของรุ่น Wan แบบเปิดและปิดก่อนหน้า (รวมถึงซีรีส์ Wan แบบโอเพ่นที่ถูกศึกษาอย่างแพร่หลายในปี 2025)
การอัปเกรดสำคัญเมื่อเทียบกับ Wan 2.7 / 2.5 ได้แก่:
- ระยะเวลาสูงสุดแบบเนทีฟเพิ่มเป็น 30 วินาทีในครั้งเดียว (ไม่ใช่การตัดต่อช็อต)
- ขยายอินพุตแบบมัลติโหมดจากข้อความ/ภาพ/วิดีโอ/เสียง ไปสู่เอกสารสำนักงานและเว็บเพจสาธารณะ
- การเรนเดอร์ระดับ “สมจริง” ดีขึ้นสำหรับใบหน้า ไมโครเอกซ์เพรสชัน รายละเอียดสินค้า และความคงเส้นคงวาของคอนเทนต์ดิจิทัล/ส่วนติดต่อผู้ใช้
- โมเดล all-in-one แบบรวมที่ครอบคลุม text-to-video (T2V), image-to-video (I2V), เฟรมแรกและเฟรมสุดท้าย, reference-to-video และความสามารถด้านการแก้ไข/ขยายที่เกี่ยวข้อง
Alibaba วางตำแหน่งโมเดลนี้สำหรับวิดีโอการตลาด ละครสั้น คอนเทนต์โซเชียล เดโมผลิตภัณฑ์ ฟุตเทจฝึก/จำลอง (เช่น โรบอติกส์หรือ AV) และวิดีโออธิบายเชิงองค์กร โมเดลนี้ยังเป็นแบบปิดน้ำหนัก/ให้บริการผ่าน API เท่านั้น (รุ่นเปิดน้ำหนักหยุดอยู่ที่ Wan 2.x ก่อนหน้า)
ข้อมูลและแหล่งอ้างอิงสนับสนุน: ตัวอย่างราคา (ระดับสากล): 480p $0.05/วินาที, 720p $0.10/วินาที, 1080p $0.20/วินาที (คลิป 1080p 30 วินาที ≈ $6 แบบ Standard) บางแพลตฟอร์มมี ระดับ Standard เทียบกับ Prime ที่เร็วกว่า หรือส่วนลดชั่วคราว
วิธีใช้งาน Wan 3.0 API
Alibaba Cloud เปิดให้ใช้ Wan 3.0 ผ่าน API ของ Model Studio สำหรับการสร้างวิดีโอ โดยตัวระบุโมเดลปัจจุบันคือ:
wan3.0-video
API ใช้การสร้างวิดีโอแบบอะซิงก์ แอปพลิเคชันควรส่งงานแล้วดึงผลลัพธ์หลังประมวลผล ตัวอย่างคำขอ:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
ตามเอกสารอ้างอิงของ Alibaba ระบุว่าโมเดล เอ็นด์พอยต์ และคีย์ API ต้องอยู่ในภูมิภาคเดียวกัน API เป็นแบบอะซิงก์ จึงควรส่งงานแล้วเรียกผลลัพธ์ภายหลังเมื่อประมวลผลเสร็จ
สำหรับเวิร์กโฟลว์ภาพเป็นวิดีโอและอ้างอิง โมดูล input สามารถแนบสื่ออ้างอิงได้ ตัวอย่างปัจจุบันของ Alibaba แสดงการใช้วิดีโออ้างอิงร่วมกับภาพอ้างอิงภายในคำขอเดียว
วิธีใช้ Wan 3.0 ผ่าน CometAPI (แนะนำสำหรับนักพัฒนา)
CometAPI มีอินเทอร์เฟซแบบรวมและเข้ากันได้กับ OpenAI เพื่อเข้าถึงโมเดลกว่า 500 รายการ รวมโมเดลวิดีโอตระกูล Alibaba Wan (ปัจจุบันมี Wan 2.7 พร้อมราคาต่อวินาทีที่แข่งขันได้; ตรวจสอบแคตตาล็อกสดสำหรับ Wan 3.0 เมื่อพร้อมใช้งาน) การสร้างวิดีโอใช้เอ็นด์พอยต์ /v1/videos ด้วย multipart form data เหมาะกับสายการผลิตจริง ออโตเมชัน n8n/Make หรือการสลับระหว่าง Wan, Seedance, Kling, Veo, MiniMax ฯลฯ ภายใต้คีย์เดียว
ขั้นตอน CometAPI:
- สมัคร/เข้าสู่ระบบที่ cometapi.com และสร้าง API key (sk-…)
- ดูเอกสารวิดีโอ API (apidoc.cometapi.com) และรายการโมเดลเพื่อยืนยัน ID ของ Wan ที่ถูกต้อง (เช่นรูปแบบ
wan2.7; ตรวจสอบรุ่นล่าสุด) - ส่งคำขอด้วย POST ไปที่
https://api.cometapi.com/v1/videosพร้อมฟิลด์ฟอร์ม - รับหมายเลขงาน/ID; โพลสถานะหรือใช้เว็บฮุคจนเสร็จ
- ดาวน์โหลดคอนเทนต์วิดีโอที่ได้
- ติดตามการใช้งานและค่าใช้จ่ายในแดชบอร์ดของ CometAPI (จ่ายตามการใช้ ไม่มีขั้นต่ำรายเดือน)
วิธีเขียนพรอมต์สำหรับ Wan 3.0 ให้ได้ผล
ปฏิบัติต่อพรอมต์เหมือนบรีฟช็อต ไม่ใช่คำบรรยายลอยๆ โครงสร้างที่พิสูจน์แล้ว (ดัดแปลงจากคู่มือชุมชนและแพลตฟอร์ม):
สูตรสไตล์ SPACE หรือช็อตลิสต์:
- Subject: คำอธิบายที่เป็นรูปธรรมว่า “ใคร/อะไร”
- Performance/Action: การเคลื่อนไหวและการเปลี่ยนสภาพที่มองเห็นได้ตามลำดับเวลา
- Ambience/Setting: สถานที่ เวลา แสง อากาศ
- Camera: ขนาดช็อต + การเคลื่อนกล้องที่ชัดเจนหนึ่งอย่าง (เช่น ดันช้า หมุนรอบ ติดตาม คงที่)
- Extra: สไตล์ คิวเสียง จังหวะ ข้อจำกัด (“ให้ป้ายอ่านได้ชัด”, “รักษาเอกลักษณ์ใบหน้า”)
สำหรับคลิป 30 วินาทีที่มีหลายบีต ให้ลิสต์ช็อตพร้อมช่วงเวลา:
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
การผูกอ้างอิง (Reference binding) (สำคัญสำหรับ Omni-Reference):
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
เคล็ดลับเพิ่มเติม:
- ระบุการกระทำที่สังเกตได้และความสัมพันธ์เชิงพื้นที่ให้ชัด
- ใช้พรอมต์เชิงลบสำหรับปัญหาทั่วไป (มือบิดเบี้ยว ข้อความที่ไม่ต้องการ สไตล์หลุด)
- สำหรับเอกสาร: “สร้างวิดีโออธิบายที่เดินตามโครงสร้างของ PDF ที่แนบมา เน้น 3 เมตริกสำคัญในหน้า 2 และข้อเสนอแนะในบทสรุป”
- ทำซ้ำอย่างเป็นขั้น: สร้างเวอร์ชันสั้นก่อน แล้วค่อยขยายบีตที่สำเร็จ
- ภาษากล้องและคำอธิบายแสงช่วยยกระดับความเป็นภาพยนตร์
ทำไมต้องใช้ Wan 3.0?
Wan 3.0 โดดเด่นเมื่อแอปพลิเคชันต้องการเปลี่ยน “สื่ออินพุตหลายชนิดให้กลายเป็นวิดีโอที่สอดคล้องเป็นหนึ่งเดียว” มากกว่าการแปลงข้อความเป็นคลิปสั้นธรรมดา
ข้อได้เปรียบที่สำคัญ ได้แก่:
- การสร้างวิดีโอแบบเนทีฟ 30 วินาที
- ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ
- การสร้างวิดีโอแบบหลายอ้างอิง
- อินพุตข้อความ ภาพ วิดีโอ เสียง และเอกสาร
- เวิร์กโฟลว์แปลงเอกสารและเว็บเพจเป็นวิดีโอ
- การสร้างภาพและเสียงแบบเนทีฟ
- ผลลัพธ์ 1080P
- การแก้ไขวิดีโอบนคำสั่ง (instruction-based)
- ความคงเส้นคงวาของอ้างอิงที่แข็งแรง
- การคิดราคาเป็นวินาที
- โมเดลเดียวครอบคลุมเวิร์กโฟลว์สร้างสรรค์หลายแบบ
สำหรับนักพัฒนาที่สร้างเครื่องมือภาพยนตร์ AI ระบบโฆษณา เครื่องมือผลิตวิดีโอสินค้า แพลตฟอร์มเนื้อหาเพื่อการศึกษา หรือเอเจนต์สร้างสรรค์แบบมัลติโหมด ความสามารถเหล่านี้ช่วยลดจำนวนโมเดลและขั้นตอนพรีโปรเซสที่ต้องใช้ลงได้อย่างมาก
บทสรุปและข้อแนะนำ
Wan 3.0 เป็นก้าวสำคัญสู่ AI วิดีโอเชิงผลิตจริง: ช็อตต่อเนื่องที่ยาวขึ้นจริง การแปลงเอกสารเป็นวิดีโอที่แท้จริง และการควบคุมแบบมัลติโหมดที่แข็งแรง เมื่อผสานกับการเขียนพรอมต์ที่รอบคอบและวินัยในการใช้เรฟ จึงสามารถย่นเวลาการผลิตจากหลายวันเหลือไม่กี่นาทีสำหรับงานการตลาด วิดีโออธิบาย และงานรูปแบบสั้นจำนวนมาก
สำหรับนักพัฒนาและทีมที่สร้างแอปหรือเครื่องมือภายใน เริ่มจากช่องทางทางการของ Alibaba เพื่อสัมผัสประสบการณ์ Wan 3.0 ที่ครบถ้วน และพิจารณา CometAPI (cometapi.com) เป็นเกตเวย์เพื่อการผลิตสูง ด้วยวิดีโอ API แบบรวม ความครอบคลุมโมเดลกว้าง (รวม Wan 2.7 ปัจจุบันและแคตตาล็อกที่ขยาย) อินเทอร์เฟซที่เข้ากันกับ OpenAI และโมเดลการคิดค่าบริการแบบจ่ายตามการใช้ ทำให้ทดลอง ขยาย และผสมผสานการสร้างแบบ Wan กับ LLMs ภาพ และเสียงได้ภายใต้การผสานเพียงครั้งเดียว
ตรวจสอบรายการโมเดลล่าสุดและเอกสารที่ CometAPI และ Alibaba Cloud Model Studio เริ่มจากคลิปสั้นๆ ปรับปรุงพรอมต์แบบช็อตลิสต์ แล้วขยายสู่โปรดักชัน 30 วินาทีเต็ม ชุดความสามารถอย่างความยาวเนทีฟที่มากขึ้นและ Omni-Reference เปิดโอกาสสร้างสรรค์และเวิร์กโฟลว์ธุรกิจใหม่ๆ ที่ก่อนหน้านี้ยุ่งยากหรือมีค่าใช้จ่ายสูง
