ما هو Flux 3؟
جيل جديد من نماذج الأساس متعددة الوسائط
FLUX 3 هو نموذج حدودي جديد طورته Black Forest Labs، الشركة التي أسسها عدد من الباحثين الأصليين في Stable Diffusion.
بدلاً من التعامل مع توليد الصور، وتوليد الفيديو، وفهم الصوت، والروبوتات كنُظم ذكاء اصطناعي منفصلة، يحاول FLUX 3 حلّها عبر تمثيل عصبي مشترك واحد.
تتعلم النماذج الانتشارية التقليدية أساساً:
- نص → صورة
- تحرير الصور
- تنويعات الصور
أما FLUX 3 فيتعلم بدلاً من ذلك:
- توليد الصور
- توليد الفيديو
- فهم الصوت
- تنبؤ الحركة
- الاتساق الزمني
- تنبؤ الأفعال
- ديناميكيات العالم
تنقل هذه البنية ما بعد الذكاء الاصطناعي التوليدي البحت نحو ما يسميه الباحثون بشكل متزايد نماذج العالم.
المواصفات التقنية
| المواصفة | Flux 3 |
|---|---|
| المطوّر | Black Forest Labs |
| الإصدار | 2026 (إعلان معاينة) |
| نوع النموذج | نموذج أساس متعدد الوسائط موحّد |
| البنية | مطابقة التدفق / بنية الأساس متعدد الوسائط |
| أنماط الإدخال | نص، صورة، فيديو، صوت |
| أنماط الإخراج | صورة، فيديو، صوت، تنبؤ الأفعال |
| إستراتيجية التدريب | تدريب متعدد الوسائط مشترك |
| الهدف الأساسي | نمذجة العالم |
| توليد الصور | نعم |
| توليد الفيديو | نعم |
| نمذجة الصوت | نعم |
| دعم الروبوتات | نعم |
| تنبؤ الأفعال | نعم |
| توفر الـ API | وصول مبكر |
| مفتوح المصدر | لا (حالياً) |
| واجهة برمجة تجارية | مخطط لها |
الميزات والخصائص البارزة في Flux 3
تصحيح: طلب مخططك "الميزات والخصائص البارزة في Claude Sonnet 5." بما أن هذه المقالة عن Flux 3، فالقسم المناسب هو "الميزات والخصائص البارزة في Flux 3."
1. تدريب متعدد الوسائط موحّد
بدلاً من تجميع عدة نماذج خبيرة، يقوم Flux 3 بتحسين مشترك عبر جميع الأنماط المدعومة.
تشمل الفوائد:
- فهم دلالي مشترك
- استدلال عبر الأنماط
- اتساق أفضل
- تقليل التبديل بين الأنماط
2. نمذجة العالم
ربما أكبر ابتكار هو الانتقال من توليف الصور إلى فهم العالم.
يحاول النموذج تعلم:
- الجاذبية
- ثبات الشيء
- التصادم
- الحركة الزمنية
- السببية
- حركة الإنسان
هذا يجعل Flux 3 مناسباً لمحاكاة الروبوتات والبيئات التفاعلية.
3. تعلّم الفيديو كقدرة أصلية
على عكس العديد من أنظمة الانتشار التي توسّع توليد الصور إلى فيديو، يُقال إن Flux 3 يتعامل مع الفيديو كإشارة التعلم الأساسية.
وفقاً لـ Black Forest Labs:
- يستهلك تدريب الفيديو أكثر من 95% من حسابات التدريب
- يتم تفضيل الفهم الزمني على العرض الثابت
- يحسن تنبؤ الحركة الاتساق
4. تكامل الصوت
يتعلم Flux 3 الصوت بصورة مشتركة بدلاً من إضافته لاحقاً.
تشمل القدرات المحتملة:
- مزامنة حركة الشفاه
- فهم الأصوات البيئية
- الاستدلال متعدد الوسائط
- توليد فيديو متزامن
5. تصميم موجّه للروبوتات
يسلط الإعلان الضوء على الروبوتات كهدف نشر مهم.
التطبيقات المحتملة:
- تخطيط الروبوت
- الملاحة
- الأتمتة الصناعية
- الأنظمة المستقلة
6. توليد صور عالية الجودة
يواصل Flux 3 سمعة BFL القوية في:
- الواقعية التصويرية
- الطباعة
- الالتزام بالمطالبات
- واقعية الإضاءة
- التكوين
مع التوسع إلى ما هو أبعد من المهام الخاصة بالصور فقط.
إصدارات النموذج
عند الإطلاق، قدمت Black Forest Labs Flux 3 كمنصة متعددة الوسائط موحّدة بدلاً من عائلة واسعة من المتغيرات. تشمل المعلومات العامة حالياً:
| النموذج | الحالة |
|---|---|
| Flux 3 | وصول مبكر |
| Flux 3 API | مخطط لها |
| توليد الصور | متاح |
| توليد الفيديو | معاينة |
| توليد الصوت | معاينة |
| تنبؤ الأفعال | معاينة |
لم يتم الإعلان رسمياً بعد عن متغيرات إضافية (مثل Pro أو Dev أو الإصدارات الخفيفة).
أداء المقاييس
نظراً لأن النموذج والبنية المحيطة به ما زالا قيد التطوير، فهذه النتائج أولية، ونتوقع المزيد من التحسينات خلال مرحلة الوصول المبكر. عبر تقييمات مبكرة، تم تفضيل FLUX 3 على Grok Imagine Video في ما يصل إلى 69% من المقارنات، وعلى Kling v3 Pro في 60%، وعلى Happy Horse v1 في 59%، وعلى Happy Horse 1.1 في 57%، وعلى Seedance 2.0 وGemini Omni Flash في 52%. وتم تفضيل FLUX 3 على Runway Gen-4.5 في 77% من المقارنات وعلى Luma Ray 3.2 في 93% من المقارنات.

تشمل نقاط القوة المزعومة:
- اتساق زمني متفوق
- استدلال فيزيائي أفضل
- توليد حركة محسّن
- تعلّم متعدد الوسائط أصيل
- نمذجة عالم موجّهة للروبوتات
وعلى عكس مقاييس الصور التقليدية (FID، CLIPScore، GenEval)، من المرجح أن تتطلب العديد من تطبيقات Flux 3 المقصودة أساليب تقييم جديدة تركز على تماسك الفيديو، والمحاذاة متعددة الوسائط، وتنبؤ الأفعال.
القيود
على الرغم من بنيته المبهرة، لا يزال لدى Flux 3 عدة قيود.
الوصول المبكر
النموذج غير متاح حالياً بشكل عام.
تسعير غير معروف
لم يتم الإعلان بعد عن تسعير الـ API الرسمي.
متطلبات العتاد
لأن النموذج يتعلم الصور والفيديو والصوت وتنبؤ الأفعال بشكل مشترك، فمن المتوقع أن يتطلب الاستدلال حسابات أكبر بكثير مقارنة بنماذج FLUX الخاصة بالصور فقط.
توثيق محدود
ما زالت العديد من التفاصيل المعمارية غير مُعلنة.
كيفية استخدام واجهة Flux 3 عبر CometAPI
بمجرد أن يصبح Flux 3 متاحاً عبر مزودي الـ API، يمكن لبوابة API موحدة مثل CometAPI تبسيط عملية التكامل.
سير عمل نموذجي:
- سجّل حساب CometAPI.
- احصل على مفتاح واجهة برمجة التطبيقات من لوحة التحكم.
- اختر نموذج Flux 3 (عند توفره).
- أرسل الطلبات باستخدام واجهات REST أو SDK القياسية.
- استلم الصور أو الفيديوهات أو المخرجات متعددة الوسائط المولّدة.
سيعتمد عنوان الطرفية والحمولة الدقيقة على وثائق CometAPI المنشورة عند إطلاق دعم Flux 3.
لماذا تستخدم CometAPI؟
بالنسبة للمطورين الذين يبنون تطبيقات قد تستخدم مزودين متعددين للذكاء الاصطناعي، يمكن لمنصة تجميع واجهات API أن تقدم عدة فوائد تشغيلية:
- واجهة موحّدة: واجهة API واحدة لعدة نماذج أساس بدلاً من صيانة تكاملات منفصلة.
- مرونة المزود: يسهل التبديل بين النماذج مع تطور القدرات أو التسعير.
- تبسيط إدارة المفاتيح: مصادقة وفوترة مركزية.
- تجريب أسرع: قارن بين نماذج الصور أو النماذج متعددة الوسائط مع تغييرات برمجية محدودة.
- قابلية التوسع: وجّه الطلبات عبر المزودين وأدر الاستخدام بكفاءة أكبر.
ما إذا كانت CometAPI تدعم Flux 3—ومجموعة الميزات الدقيقة—يعتمد على فهرس نماذجها الحالي والجدول الزمني للإصدار.