المواصفات التقنية لـ Wan 3.0
| Specification | Wan 3.0 |
|---|---|
| Model Type | نموذج توليد فيديو متعدد الوسائط شامل |
| Model Status | معاينة عامة لـ API |
| Input Types | نص، صورة، فيديو، صوت، مستندات، صفحات ويب |
| Video Generation | من نص إلى فيديو، من صورة إلى فيديو، من مرجع إلى فيديو |
| Video Editing | تحرير قائم على التعليمات وقائم على المراجع |
| Maximum Duration | 30 ثانية في توليد واحد |
| Output Resolution | 480P, 720P, 1080P |
| Native Audio-Visual Generation | نعم |
| Reference Assets | حتى 20 أصلًا مرجعيًا متعدد الوسائط |
| Document Inputs | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Maximum Document Size | 100 MB |
| Maximum Document Pages | 50 صفحة |
| API Access | معاينة Alibaba Cloud Model Studio API |
| API Generation Mode | غير متزامن |
| 480P Price | $0.05/ثانية |
| 720P Price | $0.10/ثانية |
| 1080P Price | $0.20/ثانية |
Wan 3.0 هو أحدث نموذج توليد فيديو متعدد الوسائط شامل من Alibaba Cloud، أُطلق رسميًا في أغسطس 2026. وأبرز ترقياته مقارنة بإصدارات Wan السابقة ليست مجرد جودة بصرية أعلى، بل توحيد النصوص والصور والفيديو والصوت والمستندات وصفحات الويب ضمن سير عمل إبداعي واحد. تصف Alibaba Cloud هذا النموذج بأنه يدعم توليد فيديو أصلي مدته 30 ثانية، ومدخلات مرجعية متعددة الوسائط، وتوليدًا سمعيًا بصريًا متزامنًا، وتحرير فيديو دقيقًا.
ما هو Wan 3.0؟
Wan 3.0 هو نموذج توليد فيديو متعدد الوسائط من الجيل التالي من Alibaba، صُمم لتحويل النصوص والصور والفيديو والصوت والمستندات ومحتوى الويب إلى فيديو متماسك.
كانت سير عمل الفيديو بالذكاء الاصطناعي سابقًا تتطلب عدة نماذج متخصصة: واحدًا لتحويل النص إلى فيديو، وآخر لتحويل الصورة إلى فيديو، وآخر للاتساق المرجعي، وأدوات منفصلة للتحرير أو الصوت. يتجه Wan 3.0 نحو نموذج إنتاج شامل حيث يمكن دمج هذه المدخلات حول تعليمات إبداعية واحدة.
القدرة الأبرز هي توليد أصلي لمدة 30 ثانية. بدلًا من إنتاج مقطع قصير من 5 أو 10 ثوانٍ يجب تمديده وخياطته مرارًا، يستطيع Wan 3.0 توليد تسلسل مستمر مدته 30 ثانية في تمريرة واحدة. تُظهر عروض Alibaba أن النموذج يحافظ على الشخصيات والبيئات والأفعال وحركة الكاميرا والحوار والصوت عبر مشاهد أطول.
تغيير رئيسي آخر هو Omni-Reference. يمكن للمطورين استخدام أصول مرجعية متعددة لإرساء الشخصيات والمنتجات والبيئات والحركة أو خصائص بصرية أخرى. يصف المستودع الرسمي لـ Wan 3.0 دعم ما يصل إلى 20 أصلًا مرجعيًا، بينما تؤكد صفحة منتج Alibaba Cloud القدرة على دمج الصور والنصوص والفيديو والصوت والمستندات وصفحات الويب كمرجع إبداعي.
يجعل ذلك Wan 3.0 أقل شبهًا بمولّد بسيط من مطالبة إلى فيديو، وأكثر شبهًا بـ محرك إنتاج إبداعي متعدد الوسائط.
الميزات الرئيسية لـ Wan 3.0
- توليد فيديو أصلي لمدة 30 ثانية: يمكن لـ Wan 3.0 توليد ما يصل إلى 30 ثانية من الفيديو في تمريرة واحدة، مع اختيار ذكي للمدة وقدرات تمديد الفيديو.
- Omni-Reference: يمكن دمج النصوص والصور والفيديو والصوت كمرجع. كما يوسّع Wan 3.0 التوليد القائم على المراجع ليشمل المستندات وصفحات الويب.
- Document-to-video: يمكن استخدام ملفات PPT وPDF وDOC وXLS وTXT وKEY وPAGES وNUMBERS وMD كمدخلات إبداعية، مما يسمح بتحويل العروض التقديمية والتقارير والمعلومات المهيكلة إلى محتوى فيديو.
- توليد سمعي بصري أصيل: يمكن لـ Wan 3.0 توليد الفيديو والصوت معًا، مع دعم الحوار والصوت البيئي والمشاهد السمعية البصرية الموجهة بالموسيقى.
- اتساق المراجع: صُمم النموذج للحفاظ على الشخصيات والدعائم والبيئات والعلاقات المكانية والأساليب عبر عمليات التوليد المعتمدة على المراجع.
- تحرير الفيديو: يدعم Wan 3.0 تعديلات على المحتوى البصري المُولّد والحبكة والحوار بدلًا من الحاجة لبدء كل تكرار من جديد.
كيف يقارن Wan 3.0 مع نماذج الفيديو الأخرى؟
| Model | Native Duration | Image-to-Video | Reference Control | Audio | Document/Web Input | Main Strength |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | قوي | ✓ | ✓ | إنتاج متعدد الوسائط شامل |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | محدود | سير عمل Wan للفيديو الراسخ |
| Grok Imagine Video 1.5 | Up to 15s | ✓ | ✓ | ✓ | — | فيديو إبداعي قصير سريع |
| Veo | Model-dependent | ✓ | ✓ | ✓ | متعدد الوسائط | توليد سينمائي |
| Kling | Model-dependent | ✓ | ✓ | ✓ | — | توليد الشخصيات والحركة |
| Seedance | Model-dependent | ✓ | ✓ | ✓ | — | فيديو إبداعي ومتعدد اللقطات |
الفارق الرئيسي هو اتساع نطاق المدخلات.
مقارنةً بـ Grok Imagine Video 1.5، يذهب Wan 3.0 أبعد بكثير نحو سير عمل إنتاج شامل. يركز Grok على توليد الفيديو القصير مع سير عمل النص والصورة والمرجع، بينما يدمج Wan 3.0 بالإضافة إلى ذلك المستندات وصفحات الويب والصوت والفيديو كمرجع إبداعي مباشر.
مقارنةً بـ Wan 2.7، أكبر تغيير على مستوى الهندسة/المنتج هو الانتقال نحو سير عمل متعدد الوسائط موحّد وسقف توليد أصلي لمدة 30 ثانية، مقارنةً بالمقاطع الأقصر للجيل السابق. تضع مواد Wan 3.0 الحالية من Alibaba Cloud النموذج صراحةً حول السرد الطويل وتوليد Omni-Reference.
مقارنةً بـ Kling وVeo، فإن أقوى عوامل تمييز Wan 3.0 ليست بالضرورة أن كل إطار مولّد سيكون أفضل. بل هي القدرة على دمج كمية كبيرة من المواد المصدرية والحفاظ على تلك المعلومات طوال توليد أطول.
في التطبيقات حيث يكون الإدخال ببساطة "اكتب هذه المطالبة وولّد مقطعًا سينمائيًا"، قد تظل نماذج أخرى تنافسية. أما في سير العمل حيث يكون الإدخال "إليك صورة منتج ومرجع شخصية وPDF وجدول بيانات وعينة صوتية وموجز إبداعي — حوّلها إلى فيديو متماسك"، يصبح Wan 3.0 أكثر إقناعًا بكثير.
حالات استخدام تمثيلية لـ Wan 3.0
1. صناعة الأفلام بالذكاء الاصطناعي وإنتاج القصص
تجعل القدرة على توليد 30 ثانية في تمريرة واحدة Wan 3.0 مفيدًا للمشاهد التي تتطلب حركة كاميرا مستمرة، وحوارًا، وعدة أفعال دون خياطة العديد من المقاطع القصيرة.
2. إعلانات المنتجات
يمكن دمج صورة منتج أو مجموعة من المراجع مع مطالبة بأسلوب المخرج لإنشاء عروض توضيحية للمنتج وإعلانات UGC وفيديوهات علامية سينمائية.
3. تحويل العروض التقديمية إلى فيديو
يمكن لـ Wan 3.0 معالجة تنسيقات المستندات المدعومة مثل PPT وPDF وDOC وXLS، ما يجعله مناسبًا لتحويل التقارير والعروض التقديمية والمعلومات المهيكلة إلى سرد بصري.
4. فيديو متسق الشخصيات
يمكن استخدام الصور المرجعية والفيديو ووسائط أخرى لإرساء الشخصيات والأجسام والبيئات قبل توليد المشهد.
5. محتوى وسائل التواصل الاجتماعي
تجعل مدة 30 ثانية ونسبة العرض إلى الارتفاع العمودية 9:16 Wan 3.0 مناسبًا للمحتوى القصير على وسائل التواصل، والإعلانات، واللقطات السردية.
6. تحرير الفيديو والتكرار
يمكن لـ Wan 3.0 تعديل المحتوى المُولّد القائم، بما في ذلك العناصر البصرية والمحتوى القصصي والحوار، مما يمكّن سير عمل إبداعيًا تكراريًا.
معاملات Wan 3.0 API
تستخدم الواجهة الرسمية نقطة نهاية غير متزامنة لتوليد الفيديو. يحتوي طلب مبسّط على كائن model وinput وparameters.
تشمل المعاملات المهمة:
| Parameter | Description |
|---|---|
| model | wan3.0-video |
| input.prompt | تعليمات توليد بأسلوب المخرج |
| input.media | صور أو فيديوهات أو صوت أو ملفات أو موارد ويب مرجعية |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | من 2 إلى 30 ثانية؛ القيمة -1 تفعّل المدة الذكية |
| parameters.audio | ما إذا كان سيتم تضمين مسار صوتي |
| parameters.seed | البذرة العشوائية لإمكانية إعادة الإنتاج |
| parameters.watermark | ما إذا كان سيتم إضافة علامة مائية |
تنص الوثائق الرسمية على أنه عند عدم توفير إدخال فيديو، يمكن أن تكون المدة عددًا صحيحًا من 2 إلى 30 ثانية. عند توفير إدخال فيديو، يجب أن تظل مدة الإدخال والإخراج معًا ضمن المدة الإجمالية المدعومة.
كيفية استخدام Wan 3.0 API على CometAPI
بالنسبة للمطورين الذين يستخدمون نماذج فيديو متعددة بالذكاء الاصطناعي، يمكن أن تكون CometAPI طبقة وصول موحّدة للتجربة مع Wan 3.0 جنبًا إلى جنب مع نماذج توليد الفيديو الأخرى.
سير عمل نموذجي هو:
- إنشاء حساب CometAPI أو تسجيل الدخول إليه.
- الحصول على مفتاح CometAPI API.
- اختيار نقطة نهاية نموذج Wan 3.0.
- إرسال طلب توليد من نص إلى فيديو أو من صورة إلى فيديو أو قائم على المراجع.
- تحديد الدقة والمدة ونسبة العرض إلى الارتفاع والمعاملات المدعومة الأخرى.
- مراقبة مهمة التوليد غير المتزامنة.
- استرداد الفيديو المُولّد عند اكتمال المعالجة.
يجب التحقق من نقطة النهاية الدقيقة لـ CometAPI والمعاملات المدعومة مقابل تكامل Wan 3.0 الحالي في CometAPI قبل التنفيذ، لا سيما لأن API الأصلية من Alibaba ما تزال في مرحلة المعاينة.