ملخص سريع: FLUX 3 هو نموذج أساسي موحّد متعدد الوسائط من Black Forest Labs. واجهة الفيديو العامة الخاصة به تولّد مقاطع حتى 20 ثانية عند 24 إطارًا في الثانية، مع صوت متزامن اختياري، انطلاقًا من نصوص أو صور أو لقطات مفتاحية أو فيديو موجود. يدعم درجات وضوح من HD حتى UHD/4K، بينما يظل FLUX 3 Image ونموذج FLUX 3 Dev مفتوح الأوزان عناصر طرح منفصلة.
ما هو FLUX 3؟
FLUX 3 هو نموذج متعدد الوسائط متقدم من Black Forest Labs. بدلاً من تدريب نموذج مستقل للصور وآخر للفيديو وآخر للصوت، تقوم BFL بتدريب تمثيل مشترك عبر هذه الوسائط.
الفكرة المركزية هي أن الصور والفيديو والصوت تمثّل ملاحظات مختلفة للعالم نفسه. السيارة المتحركة لها مظهر بصري وحركة وصوت وعلاقات مكانية وخصائص مادية وسلوك سببي. تعلم هذه الإشارات معًا يضع قيودًا أكثر على النموذج مما لو تعلم إطارات فردية بمفردها.
لهذا تصف Black Forest Labs نموذج FLUX 3 بأنه خطوة نحو نموذج الواقع أو نموذج العالم وليس مجرد مولّد للصور أو الفيديو. النظام الفيديوي المُتاح يبرهن هذا الاتجاه بالفعل: الصوت المتزامن والحركة وبنية المشهد والحوار وسلوك الكاميرا والأصوات البيئية تُدار ضمن سير توليد واحد.
ليست كل قدرات FLUX 3 المُعلنة متاحة علنًا بعد. اعتبارًا من سبتمبر 2026، يتوفر FLUX 3 Video، بينما يظل FLUX 3 Image ونموذج FLUX 3 Dev مفتوح الأوزان عناصر طرح منفصلة.
مواصفات FLUX 3 بإيجاز
تعكس المواصفات التالية وثائق مطوّري FLUX 3 الحالية بدلًا من إعداد الإطلاق الأولي في يوليو.
| المواصفة | وثائق FLUX 3 الرسمية |
|---|---|
| المطوّر | Black Forest Labs |
| عائلة النموذج | FLUX 3 |
| نوع النموذج | نموذج أساسي موحّد متعدد الوسائط/مولّد فيديو |
| الإصدار العام للفيديو | 4 أغسطس 2026 |
| اتجاه التدريب الأساسي | تعلّم تمثيل مشترك للصورة والفيديو والصوت |
| الأساس البحثي | Self-Flow |
| مخرج API الأساسي الحالي | فيديو مع صوت متزامن |
| نص إلى فيديو | مدعوم |
| صورة إلى فيديو | مدعوم |
| لقطات مفتاحية إلى فيديو | مدعوم |
| متابعة الفيديو | مدعومة |
| الحد الأقصى لمدة T2V/I2V | 20 ثانية |
| مدة متابعة الفيديو | 5–15 ثانية |
| معدل الإطارات | 24 إطارًا/ث |
| الدقة | HD وFHD وQHD/2K وUHD/4K |
| دقة 16:9 FHD | 1920 × 1088 |
| مراجع الصور | حتى 10 لمسارات I2V/اللقطات المفتاحية |
| صوت أصلي | نعم |
| حوار متعدد اللغات | نعم |
| مزامنة حركة الشفاه | نعم |
| توليد متعدد اللقطات | نعم |
| وضع المسودّة | نعم |
| واجهة FLUX 3 للصور الثابتة | لم تُطرح عامة بعد من BFL |
| FLUX 3 Dev مفتوح الأوزان | مخطط له |
تحدد وثائق BFL الحالية نطاق 5–20 ثانية للنص إلى فيديو والصورة إلى فيديو، بينما تقبل متابعة الفيديو نافذة توليد 5–15 ثانية. تتضمن نِسَب الأبعاد المدعومة 21:9 و2:1 و16:9 و4:3 و1:1 و3:4 و9:16.
كيف يعمل FLUX 3؟
Self-Flow
الأساس البحثي الرئيسي هو Self-Flow، وهو نهج BFL للتعلّم الذاتي الإشراف لمطابقة التدفق. تعتمد خطوط التدريب التوليدي التقليدية غالبًا على نماذج تمثيل مُسبقة التدريب أو إشراف مساعد منفصل. صُمم Self-Flow لتعلّم تمثيلات مفيدة مباشرةً من الهدف التوليدي.
آلية رئيسية هي Dual-Timestep Scheduling. يمكن تعيين مستويات ضوضاء مختلفة لمجموعات مختلفة من الرموز أثناء التدريب. هذا يخلق عدم تماثل معلوماتي: بعض أجزاء الإدخال تحتوي معلومات قابلة للاستخدام أكثر من غيرها، ما يجبر الشبكة على بناء تمثيلات تساعد في استنتاج ما هو مفقود.
عمليًا، يُشجَّع FLUX 3 على تعلّم العلاقات بين الأجسام والإطارات والحركة والصوت والأحداث الزمنية، وليس مجرد حفظ شكل الإطارات الفردية.

بنية طريقة Self-Flow - مصدر الصورة الرسمي: مشروع Black Forest Labs Self-Flow
اختبرت BFL أيضًا التدريب المتعدد الوسائط المشترك باستخدام عمود فقري مشتق من FLUX.2 مع ملايين الفيديوهات ومئات الملايين من الصور. تدعم التجارب فرضية FLUX 3 الأوسع بأن تعلّم التمثيل والتوليد لا يحتاجان إلى أن يكونا نظامين منفصلين.
لماذا الفيديو محوريًا في FLUX 3
الفيديو ذو قيمة خاصة لنمذجة العالم لأنه يحتوي معلومات لا تستطيع الصورة الثابتة توفيرها. يمكن لإطار واحد أن يُظهر كرة فوق الأرض؛ بينما يكشف الفيديو أن الكرة تسقط وترتد وتتشوه عند الاصطدام وتُحدِث صوتًا وتغيّر اتجاهها بعد ذلك.
كشفت BFL أن تنبؤ الفيديو يشكّل أكثر من 95% من عتاد تدريب FLUX 3. الصوت أقل كلفة لأنه إشارة منخفضة الأبعاد ومقترنة بشكل وثيق بالأحداث المرئية. يفسر ذلك لماذا كانت قدرة الفيديو أول قدرات FLUX 3 التي وصلت إلى الإتاحة العامة.
ماذا يستطيع FLUX 3 أن يفعل؟
نص إلى فيديو
يمكن للمستخدمين توليد فيديو كامل من تعليمات باللغة الطبيعية. تقول BFL إن النموذج المُتاح يتعامل مع المطالبات البسيطة والمعقدة مع تنسيق الحركة ومنطق المشهد والتكوين البصري والصوت. يُفيد هذا خصوصًا للمطالبات التي تحتوي أحداثًا متسلسلة متعددة بدلًا من موضوع متحرك واحد.
صورة إلى فيديو واللقطات المفتاحية
يمكن لـ FLUX 3 تحريك صورة أولية أو العمل نحو إطار نهائي أو استخدام صور متعددة كلقطات مفتاحية محددة التوقيت. تدعم واجهة البرمجة الحالية حتى عشرة مراجع للصور في مسارات الصورة إلى فيديو، مما يسمح للمبدعين بالتحكم في كيفية تغيّر المشهد بمرور الوقت بدلًا من مطالبة النموذج بابتكار التسلسل بالكامل.
متابعة الفيديو
يمكن تزويد فيديو موجود وصوته كسياق، ويمكن لـ FLUX 3 توليد ما يحدث بعد ذلك. تصف BFL متابعةً تحفظ الحركة وسلوك الكاميرا والحوار والصوت عبر الانتقال، وهو أمر مختلف جوهريًا عن توليد مقطع ثان مستقل ثم ضم الملفين لاحقًا.
صوت أصلي وحوار
ينتج FLUX 3 الصوت أثناء التوليد بدلًا من الحاجة إلى خطوة مستقلة لتوليد الكلام أو الصوت. تشمل قدراته الصوتية المُتاحة الحوار والمؤثرات والصوت المحيطي. كما يدعم الحوار متعدد اللغات مع مزامنة حركة الشفاه.
لقطات متعددة في توليد واحد
يمكن لطلب واحد أن يحتوي عدة مشاهد أو زوايا كاميرا. يهم هذا لأن العديد من نماذج الفيديو السابقة تكون أقوى عند طلب لقطة قصيرة متصلة بصريًا؛ صُمم FLUX 3 صراحةً لدعم تسلسلات متعددة اللقطات ضمن توليد واحد.
وضع المسودّة
وضع المسودّة من الإضافات العملية للإنتاج عالي الحجم. بدلًا من دفع السعر الكامل لكل تجربة مطالبة، يمكن للمطورين إنشاء معاينة أسرع وأقل تكلفة ثم ترقية المسودّة المختارة مع الحفاظ على التكوين والحركة المختارين. وفقًا لـتسعير BFL الحالي، تكلف مسودّة T2V/I2V القياسية 0.06$ لكل ثانية، مقابل 0.17$ لكل ثانية للتوليد HD الاعتيادي.
ما الذي لم يتم شحنه بعد؟
وصف إعلان إطلاق FLUX 3 قدرات الصورة والفيديو والصوت والأفعال ضمن اتجاه معماري واحد، لكن الإتاحة جاءت متدرجة.
| القدرة | خارطة طريق BFL الحالية والتوفر |
|---|---|
| توليد فيديو FLUX 3 | متاح عمومًا |
| الصوت الأصلي للفيديو | متاح عمومًا |
| نص إلى فيديو | متاح عمومًا |
| صورة إلى فيديو/لقطات مفتاحية | متاح عمومًا |
| متابعة الفيديو | متاحة عمومًا |
| مجموعات أغنى من مراجع الصورة/الفيديو/الصوت | توسعة مخططة |
| توليد وتحرير الصور FLUX 3 Image | قادم |
| FLUX 3 Dev مفتوح الأوزان | مخطط له |
| نشر تنبؤ الأفعال | بحث/مسار شراكات تجارية |
هذا التمييز مهم خصوصًا للمستخدمين المعتادين على FLUX.2 Max. يظل FLUX.2 خيارًا مخصصًا حاليًا لتوليد الصور الثابتة، بينما يرتكز منتج FLUX 3 العام على الفيديو والصوت.
أداء معايير FLUX 3
هناك نوعان مفيدان الآن من أدلة المعايير لنموذج FLUX 3: تقييم BFL الداخلي بعد الإصدار وتقييم مستقل من طرف ثالث. يُظهر الأول تفضيلًا بشريًا نسبيًا وفق بروتوكول BFL؛ بينما يفحص الثاني ما إذا كانت تلك نقاط القوة تظهر تحت معيار مُصمّم منفصل.
تقييم ELO بعد إصدار BFL
شمل إعلان يوليو الأولي نسب فوز تمهيدية. المعيار الأكثر صلة بالمستخدمين الحاليين هو تقييم BFL في 4 أغسطس للنموذج المُتاح. تُبلغ Black Forest Labs عن درجة ELO للنص إلى فيديو قدرها 1135 في تقييم داخلي شامل.

تقييم ELO لنموذج FLUX 3 المُتاح - مصدر الصورة الرسمي: Black Forest Labs
| المقياس | تقييم نموذج BFL المُتاح |
|---|---|
| ELO للنص إلى فيديو | 1135 |
| موقع T2V | أعلى درجة ضمن المجموعة المختبرة لدى BFL |
| نتيجة الصورة إلى فيديو | تعادل مع أقوى منافس مُختبر وتفوّق على باقي النماذج المُقيّمة |
| نوع التقييم | تقييم داخلي قائم على تفضيل بشري |
| مرحلة النموذج | إصدار FLUX 3 Video المتاح عمومًا |
هذا الدليل أقوى من معيار الإطلاق الأولي لأنه يقيم نموذج أغسطس المُتاح. ومع ذلك، يظل معيارًا تديره الشركة الموردة، ولا ينبغي تفسيره على أنه دليل على أن FLUX 3 سيتفوق على كل المنافسين في كل فئة مطالبات.
معيار FLUX 3 المستقل
يوفر v-benchmark v2 من Megaton تحققًا مستقلاً. تم تقييم FLUX 3 في أغسطس 2026 ويسجّل حاليًا مؤشر Megaton بقيمة 76.51/100، محتلاً المرتبة الثالثة في المجموعة المنشورة وقت التقييم.
| بُعد المعيار | تقييم FLUX 3 لدى Megaton |
|---|---|
| مؤشر Megaton | 76.51 |
| الالتزام بالمطالبة | 87.07 |
| اتساق المشهد | 94.76 |
| الفيزياء | 70.63 |
| واقعية البشر | 73.70 |
| دقة الأجسام والمنتجات | 83.82 |
| الترابط السببي والدلالي | 80.91 |
| دقة النص | 82.41 |
| التصوير السينمائي | 71.43 |
| الذائقة والإخراج الفني | 65.00 |
الملف التعريفي أكثر إفادة من الدرجة الإجمالية. اتساق المشهد عند 94.76 هو أقوى فئة رئيسية، بينما يتجاوز الالتزام بالمطالبة ودقة الأجسام والترابط السببي ودقة النص 80. الفيزياء وواقعية البشر والذائقة/الإخراج الفني أضعف، ما يُظهر أن تمثيلًا زمنيًا أقوى لا يُلغي الحركة الاصطناعية أو تباين الجودة الفنية.
يشرح هذا أيضًا لماذا قد تختلف استنتاجات المعايير: يضع اختبار التفضيل الداخلي لدى BFL نموذج FLUX 3 في قمة مجموعة المقارنة لديها، بينما يضعه لوح Megaton المستقل ثالثًا. يمكن أن تنتج مجموعات مطالبات مختلفة وأبعاد تقييم وسكان مُقيِّمين وأساليب تجميع مختلفة ترتيبات متباينة.
FLUX 3 مقابل Seedance 2.5 مقابل MiniMax H3 مقابل Wan 3.0
تحرك سوق الفيديو بالذكاء الاصطناعي بسرعة في 2026. ينافس FLUX 3 الآن أنظمة متعددة الوسائط تجمع بشكل متزايد التوليد طويل المدى والصوت المتزامن والمراجع والتحرير.
| البُعد | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| المطوّر | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| أقصى مدة مقطع مُعلَن | 20 s | 30 s | 15 s | 30 s |
| دقة الفيديو | HD / FHD / QHD (2K) / UHD (4K) | تعتمد على فئة API | حتى 2K | حتى 1080p |
| صوت أصلي | نعم | نعم | نعم، ستيريو | نعم |
| نص إلى فيديو | نعم | نعم | نعم | نعم |
| إدخال صورة/مرجع | نعم | نعم | نعم | نعم |
| تحكم اللقطات/المراجع | لقطات مفتاحية محددة التوقيت قوية | تحكم قوي بالمراجع متعددة الوسائط | تكييف متعدد الوسائط | تحكم بالمراجع متعددة الوسائط |
| متابعة/تحرير الفيديو | متابعة متاحة | سير عمل متمحور حول التحرير | تركيز على توليد شامل | سير عمل للتحرير والمراجع |
| توليد متعدد اللقطات | نعم | نعم | نعم | نعم |
| نقطة القوة المميّزة | هندسة "نموذج الواقع"، اتساق المشاهد، Self-Flow | سرد طويل وتحكم مرجعي قوي | توليد سمعي- بصري بدقة 2K وسياق متعدد الوسائط | مقاطع طويلة وكلفة بدئية أقل |
| السعر الابتدائي/لكل ثانية عبر CometAPI* | $0.136/s | $0.0824/s مُعلَن | $0.064/s | $0.040/s |
* التسعير مقارنة تقريبية فقط. تستخدم واجهات فيديو مختلفة درجات وضوح ومددًا وطبقات جودة وقواعد فوترة مختلفة، لذا فإن أقل كلفة لكل ثانية ليست بالضرورة الأرخص لجودة مكافئة.
FLUX 3 مقابل Seedance 2.5
يمتلك Seedance 2.5 أفضلية واضحة في المدة، حتى 30 ثانية مقابل 20 ثانية لـ FLUX 3. كما يتجه بقوة نحو توليد مدفوع بالمراجع والتحرير والسرد الطويل. يميز FLUX 3 نفسه عبر هيكليته المشتركة لنموذج العالم، واتساق المشهد، والتوليد السمعي-البصري الأصلي، واللقطات المفتاحية محددة التوقيت، وخريطة طريق أوسع للصور/الأفعال.
يدعم الاختبار المستقل أن هذه منافسة عالية المستوى فعلية: تضع Megaton حاليًا Seedance 2.5 فوق FLUX 3 إجمالًا.
FLUX 3 مقابل MiniMax H3
يوفر MiniMax H3 خرجًا حتى 2K وصوتًا أصليًا ستيريو، ما يعطيه مواصفة تقنية قوية للمحتوى السمعي-البصري. يدعم FLUX 3 نافذة توليد أطول — 20 ثانية مقابل 15 ثانية لدى H3 — كما يوفر وضع المسودّة لتدفق تكرار مضبوط التكلفة.
FLUX 3 مقابل Wan 3.0
يركّز Wan 3.0 على مدخلات متعددة الوسائط واسعة، وتوليد سمعي-بصري، والتحرير، ومقاطع حتى 30 ثانية. كما أنه أرخص عند السعر الابتدائي المُعلن لدى CometAPI. FLUX 3 أغلى لكنه يميز نفسه عبر تموضع "نموذج الواقع"، واتساق المشهد، والأساس البحثي Self-Flow، ووضع المسودّة، والتكامل مع تنبؤ الأفعال.
تسعير FLUX 3
تسعّر Black Forest Labs FLUX 3 وفق مدة الفيديو المُولّد.
| الوضع | تسعير FLUX 3 الرسمي لدى BFL |
|---|---|
| مسودّة T2V/I2V HD | $0.06/s |
| T2V / I2V HD | $0.17/s |
| T2V / I2V FHD | $0.29/s |
| T2V / I2V QHD (2K) | $0.40/s |
| T2V / I2V UHD (4K) | $0.80/s |
| مسودّة متابعة الفيديو | $0.12/s |
| متابعة فيديو HD | $0.41/s |
| متابعة فيديو FHD | $0.53/s |
| متابعة فيديو QHD (2K) | $0.65/s |
| متابعة فيديو UHD (4K) | $0.95/s |
تكلفة توليد HD قياسي لمدة 10 ثوانٍ تبلغ تقريبًا 1.70$ وفق السعر المُعلن لدى BFL، بينما تبلغ تكلفة توليد FHD لمدة 10 ثوانٍ نحو 2.90$. متابعة الفيديو أغلى بكثير لكل ثانية من التوليد الاعتيادي، لذا يجب على التطبيقات التي تمدد المقاطع كثيرًا أن تُنمذج تلك التكاليف بشكل منفصل.
سعر FLUX 3 على CometAPI
تُدرج CometAPI حاليًا FLUX 3 كمتاح بمعرّف النموذج flux-3.
| الدقة | تسعير FLUX 3 لدى CometAPI |
|---|---|
| 720p | $0.136/s |
| 1080p | $0.232/s |
بالنسبة لتوليد 10 ثوانٍ، يقابل ذلك تقريبًا 1.36$ عند 720p أو 2.32$ عند 1080p. مقارنةً بأسعار BFL المُعلنة 0.17$/s و0.29$/s لهاتين الفئتين، أسعار CometAPI الافتراضية أقل بنحو 20%.
ملاحظة الإتاحة: لا يزال بعض الوصف الأقدم على CometAPI يعكس فترة الوصول المبكر في يوليو. النص الحالي للتعريف الحي للنموذج، وقسم التسعير، ومثال API يدرجون flux-3 كمتاح، مع تاريخ إصدار CometAPI في 13 أغسطس 2026. لقرارات التكامل، تُعد حقول الواجهة الحية والتسعير أكثر صلة من النصوص الأقدم حول الإتاحة.
لماذا يهم FLUX 3 أبعد من فيديو الذكاء الاصطناعي
الجزء غير المعتاد في FLUX 3 ليس توليد فيديو 20 ثانية. لدى عدة منافسين القدرة بالفعل على توليد مقاطع بطول مماثل أو أطول. الرهان التقني الأكبر هو أن تمثيل فيديو قوي يمكن أن يصبح أساسًا لأشكال أخرى من الذكاء.
من تنبؤ الفيديو إلى تنبؤ الأفعال
إشارات التحكم بالروبوت هي تنبؤات زمنية مشروطة بملاحظات بصرية، لذا تستخدم BFL تمثيل الفيديو في FLUX 3 كأساس لتنبؤ الأفعال. أثمر تعاونها مع mimic robotics عن FLUX-mimic، حيث يقرأ مفكك الأفعال التمثيلات من نموذج الفيديو بدلًا من تدريب مجموعة إدراك مستقلة بالكامل.
تبلغ BFL أن الهيكل الخلفي لـ FLUX-mimic يمكن أن يعمل في أقل من 80 مللي ثانية على بطاقة RTX 5090 واحدة، بينما يصل النظام الروبوتي الكامل إلى دورة استجابة حوالي 101 مللي ثانية. كما ناقشت الشركة تقييمًا صناعيًا مع Audi.
لا يجعل هذا واجهة FLUX 3 Video العامة واجهة روبوتات. لكنه يوضح لماذا استثمرت BFL بكثافة في تمثيل فيديو متعدد الوسائط بدلًا من التعامل مع توليد الفيديو كمهمة وسائط معزولة.
ما أبرز نقاط قوة FLUX 3؟
- الاتساق الزمني واتساق المشهد. درجة اتساق المشهد 94.76 لدى Megaton هي أقوى فئة رئيسية للنموذج.
- التوليد السمعي-البصري الأصلي. يمكن توليد الحوار والمؤثرات والصوت المحيط والمرئيات معًا بدلًا من تجميعها من نماذج منفصلة.
- الالتزام القوي بالمطالبة. تُشير نتيجة الالتزام بالمطالبة المستقلة 87.07 إلى أن قوة النموذج تتجاوز الصقل المرئي البحت.
- تحكم باللقطات المفتاحية. يمكن أن تشارك حتى عشرة صور في مسارات الصورة إلى فيديو الحالية، ما يعطي المبدعين تحكمًا زمنيًا صريحًا.
- سير عمل من المسودّة إلى النهائي. يعالج وضع المسودّة مشكلة تكلفة حقيقية في فيديو الذكاء الاصطناعي: العديد من التوليدات تُهمل أثناء تكرار المطالبات.
- نطاق بصري واسع. تتموضع BFL بأن FLUX 3 قادر على مخرجات خامة وطبيعية وسينمائية وحالمة ومرحة ومؤسلبة وغريبة بدلًا من نمط ثابت واحد.
- اتجاه بحث "نموذج العالم". يجعل Self-Flow وتنبؤ الأفعال FLUX 3 ذا صلة أبعد من توليد الوسائط.
ما هي محدوديات FLUX 3؟
- لم تُشحَن خارطة الطريق متعددة الوسائط كاملة. لا ينبغي افتراض توفر FLUX 3 Image وFLUX 3 Dev مفتوح الأوزان من إعلان العائلة.
- 20 ثانية ليست مدة رائدة صناعيًا بعد الآن. بعض منافسي 2026 يدعمون توليد 30 ثانية.
- الفيزياء ليست محلولة. تمنح Megaton FLUX 3 درجة فيزيائية 70.63، أدنى بكثير من درجة اتساق المشهد.
- واقعية البشر لا تزال قابلة للتحسن. درجة مستقلة 73.70 تعني أن تشريحًا صعبًا وحركة بشرية واقعية قد تفشل أحيانًا.
- متابعة الفيديو مكلفة. سعر المتابعة لدى BFL أعلى بكثير لكل ثانية من ت2ف/ص2ف الاعتيادية.
- معيار المنافسة الرئيسي لدى BFL داخلي. ينبغي أن تشمل قرارات الإنتاج اختبارات مستقلة باستخدام مطالبات التطبيق وأنواع اللقطات واللغات وأصول المراجع الخاصة به.
كيفية استخدام FLUX 3 مع CometAPI
تشرح تغطية FLUX 3 السابقة لدى CometAPI مرحلة الوصول المبكر في يوليو والمعايير الأولية وخطة الطرح. يركّز هذا القسم على تكامل الإنتاج الحالي والتسعير وتدفق API العامل حتى لا يكرر ذلك الشرح التاريخي. يستخدم نموذج FLUX 3 في الإنتاج معرّف النموذج flux-3.
طلب 720p أساسي يستخدم نقطة النهاية /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=A paper boat glides across a still pond in soft morning light" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
سير عمل الفيديو غير متزامن. بعد أن تُعيد الطلبية الأولية مُعرّف مهمة، يتحقق التطبيق من المهمة حتى يكتمل التوليد ثم يسترجع الفيديو الناتج. لتطبيقات الإنتاج، ينبغي عادةً التعامل مع التوليد بواسطة مهمة خلفية أو قائمة مهام بدلًا من إبقاء طلب HTTP مفتوحًا لمدة التصيير كاملة.
من ينبغي أن يستخدم FLUX 3؟
يُعد FLUX 3 جذابًا خصوصًا للتطبيقات التي تحتاج أكثر من مقاطع جميلة بصريًا بطول خمس ثوانٍ: أنظمة إعلانات مع صور وصوت متزامنين، إنتاج آلي قصير، عروض منتجات حيث ثبات الأجسام مهم، توليد حوار متعدد اللغات، سير عمل من لوحات قصص إلى فيديو، تحريك مُتحكّم باللقطات المفتاحية، محتوى تعليمي، وتجارب مع مسارات متعددة الوسائط أطول.
قد يكون أقل جاذبية عندما يكون المطلوب الوحيد هو أدنى كلفة لكل ثانية، أو عندما يجب توليد أكثر من 20 ثانية في تمريرة واحدة، أو عندما يكون توليد الصور الثابتة المهمة الأساسية. للصور الثابتة، قد يكون نموذج FLUX للصور القائم مثل FLUX.2 Max مناسبًا أكثر حاليًا.
هل FLUX 3 أفضل من نماذج فيديو الذكاء الاصطناعي الأخرى؟
لا توجد إجابة واحدة قابلة للدفاع عبر كل حالات الاستخدام. يضع تقييم BFL الداخلي الإصدار المُتاح من FLUX 3 في قمة مقارنة النص إلى فيديو لديها، بينما يُصنّف تقييم Megaton المستقل FLUX 3 ثالثًا إجمالًا خلف منافسين أحدث. كلا النتيجتين يمكن أن تكونا صحيحتين لأن الاختبارات تقيس توزيعات مطالبات وأبعاد جودة ومجتمعات مُقيّمين وأساليب تجميع مختلفة.
يبدو FLUX 3 قويًا بشكل خاص عندما يكون اتساق المشهد والالتزام بالمطالبة ودقة الأجسام والترابط السببي ودقة النص والصوت المتزامن واللقطات المفتاحية القابلة للتحكم مهمة. قد تفوز نماذج أخرى في أقصى مدة أو دقة أو تفضيلات فنية أو واقعية البشر أو سير عمل التحرير أو الكلفة. بالنسبة للمطورين، المقارنة الصحيحة تعتمد على عبء العمل أكثر من اعتمادها على لوح الصدارة.
الأسئلة المتكررة
هل FLUX 3 متاح الآن؟
نعم. أصبح FLUX 3 Video متاحًا عمومًا عبر BFL في 4 أغسطس 2026. تُدرج CometAPI أيضًا FLUX 3 كمتاح تحت معرّف النموذج flux-3. يظل إصدار FLUX 3 Image وأوزان FLUX 3 Dev المفتوحة عناصر في خارطة الطريق.
هل يستطيع FLUX 3 توليد الصوت؟
نعم. يولّد FLUX 3 Video صوتًا أصليًا متزامنًا بما يشمل الحوار والصوت المحيط والمؤثرات. كما يدعم الحوار متعدد اللغات ومزامنة حركة الشفاه.
ما مدة الفيديو التي يستطيع FLUX 3 توليدها؟
يدعم التوليد الحالي للنص إلى فيديو والصورة إلى فيديو 5–20 ثانية. تدعم متابعة الفيديو 5–15 ثانية من المحتوى المُولّد حديثًا.
ما الدقة التي يدعمها FLUX 3؟
تدعم BFL HD (حتى 1 ميغابكسل لكل إطار) وFHD (حتى 2 ميغابكسل) وQHD/2K (حتى 4 ميغابكسل) وUHD/4K (حتى 8 ميغابكسل). مخرج 16:9 FHD هو 1920 × 1088. تُبنى فئات الدقة على إجمالي البكسلات لكل إطار بدلًا من نسبة الأبعاد؛ وضع المسودّة HD فقط.
هل يدعم FLUX 3 الصورة إلى فيديو؟
نعم. توليد الصورة إلى فيديو واللقطات المفتاحية جزء من مجموعة ميزات FLUX 3 Video المتاحة عمومًا.
هل FLUX 3 نموذج توليد صور؟
من الناحية المعمارية، يُدرّب FLUX 3 عبر الصور والفيديو والصوت، وقد عرضت BFL بحثًا في توليد الصور والتحرير. ومع ذلك، يظل منتج FLUX 3 Image إصدارًا قادمًا؛ لا تخلط بين خارطة طريق العائلة وواجهة FLUX 3 Video العامة الحالية.
هل FLUX 3 مفتوح المصدر؟
ليس حاليًا. أعلنت BFL عن FLUX 3 Dev، وهو نوع مفتوح الأوزان متعدد الوسائط، لكنها لم تقدم تاريخ إصدار عام بعد.
كم يكلف FLUX 3؟
تسعّر BFL النص/الصورة إلى فيديو عند 0.06$/s لمسودّة HD، و0.17$/s لـ HD، و0.29$/s لـ FHD، و0.40$/s لـ QHD، و0.80$/s لـ UHD. تكلف متابعة الفيديو 0.12$/s لمسودّة HD، ثم 0.41$/s لـ HD، و0.53$/s لـ FHD، و0.65$/s لـ QHD، و0.95$/s لـ UHD. تُدرج CometAPI حاليًا 0.136$/s لـ 720p و0.232$/s لـ 1080p.
ما هو Self-Flow؟
Self-Flow هو نهج BFL للتعلّم الذاتي الإشراف لمطابقة التدفق. صُمم لتمكين النموذج التوليدي من تطوير تمثيلات داخلية مفيدة دون الاعتماد على نموذج تمثيل خارجي. يشجع استخدام مستويات ضوضاء مختلفة عبر الرموز الشبكة على استنتاج المعلومات المفقودة وتعلّم العلاقات بين الملاحظات متعددة الوسائط.
هل FLUX 3 نموذج عالم؟
تموضع Black Forest Labs FLUX 3 كأساس "نموذج واقع" لأن تمثيلاته المشتركة تمتد من التنبؤ السمعي-البصري نحو تنبؤ الأفعال الفيزيائية. تسمية ذلك نموذج عالم عام شامل ستكون أقوى من الأدلة الحالية؛ وصف أدق هو نموذج تأسيسي توليدي متعدد الوسائط مصمم صراحةً حول أهداف نمذجة العالم.
خاتمة
يمثل FLUX 3 تغييرًا أكبر لـ Black Forest Labs من ترقية تقليدية بين نموذج FLUX للصور وآخر. فكرته الأساسية هي تدريب تمثيل متعدد الوسائط مشترك للعالم، ثم استخدام ذلك التمثيل للفيديو والصوت والصور وفي النهاية الأفعال. يوفر Self-Flow الأساس البحثي، بينما يُعد FLUX 3 Video المُتاح أول برهان إنتاجي على تلك الاستراتيجية.
اعتبارًا من سبتمبر 2026، يدعم FLUX 3 Video مقاطع حتى 20 ثانية، 24 إطارًا في الثانية، مخرجات من HD حتى UHD/4K، صوتًا متزامنًا، حوارًا متعدد اللغات، صورة إلى فيديو، لقطات مفتاحية، متابعة فيديو، توليدًا متعدد اللقطات، ووضع المسودّة.
صورة المعايير أكثر مصداقية أيضًا مما كانت عليه عند الإطلاق. يضع تقييم BFL الحالي للنموذج المُتاح FLUX 3 أولًا في اختبار ELO الداخلي للنص إلى فيديو، بينما يصنّفه اختبار Megaton المستقل ثالثًا إجمالًا ويبرز قوة خاصة في اتساق المشهد.
لذلك FLUX 3 ليس تلقائيًا أفضل نموذج فيديو لكل عبء عمل. يمكن أن يقدم Seedance 2.5 وMiniMax H3 وWan 3.0 توليدًا أطول أو دقة اسمية أعلى أو تسعيرًا أقل أو قدرات مرجع وتحرير مختلفة.
ما يجعل FLUX 3 مثيرًا للاهتمام بشكل غير معتاد هو الاتجاه الكامن تحت مولّد الفيديو: تراهن BFL على أن التمثيلات نفسها المطلوبة لتنبؤ فيديو مقنع يمكن أن تدعم في النهاية توليد الصور والصوت والاستدلال الفيزيائي وأفعال الروبوت. يمكن للمطورين اختبار الخطوة الإنتاجية الأولى عبر FLUX 3 على CometAPI باستخدام معرّف النموذج flux-3.
