ما هو Qwen-Image-3.0؟
Qwen-Image-3.0 هو الجيل الثالث من نموذج توليد الصور لدى Alibaba Qwen، وقد صُمّم لجعل الصور المولّدة بالذكاء الاصطناعي أكثر فائدة لعمليات الإبداع والتصميم الفعلية، بدلًا من التركيز فقط على الجماليات البصرية. يدعم كلًا من التحويل من نص إلى صورة (T2I) والتحرير من صورة إلى صورة (I2I)، مع تركيز خاص على التخطيطات المعقدة، وكثافة المعلومات البصرية، وتصييـر النص بدقة، والطباعة متعددة اللغات، وبناء الصور بتفاصيل دقيقة.
تُموضع Alibaba نموذج Qwen-Image-3.0 حول ثلاث قدرات أساسية: محتوى غني، تفاصيل أصيلة، ومعرفة عميقة. يقبل النموذج موجهات تصل إلى حوالي 4.5K رمزًا، مما يتيح للمستخدمين وصف تراكيب معقدة مثل الصحف، واللوحات القصصية، وأوراق الامتحان، والرسوم المعلوماتية متعددة اللوحات، ونماذج الواجهات في طلب واحد. كما يمكنه تصيير نص بحجم يصل إلى 10 بكسل، ويدعم 12 لغة وأكثر من 20 خطًا، وصُمّم لاستنساخ التفاصيل البصرية الدقيقة مثل خصلات الشعر، والمسامات، والميكرو-تعابير الوجه.
ما هي الميزات الرئيسية لـ Qwen-Image-3.0؟
إنشاء تخطيطات معقدة: صُمّم Qwen-Image-3.0 للتراكيب البصرية ذات المعلومات الكثيفة. تعرض Alibaba تخطيطات تشمل شبكات مرئية 3×3، وشرائح رياضية، وصحف، ولوحات قصصية، وقوائم، وأوراق امتحان، وتصميمات مُهيكلة أخرى تُولَّد ضمن صورة واحدة بدلًا من تجميع صور متعددة.
تعليمات أطول لتوليد الصور: يدعم النموذج موجهات تصل إلى حوالي 4.5K رمزًا، ما يمنح المستخدمين مساحة أكبر بكثير لتحديد العناصر والعلاقات والطباعة والتخطيط والتسلسل الهرمي البصري والأسلوب ضمن طلب توليد واحد.
تصيير نصوص بدقة متناهية: صُمّم Qwen-Image-3.0 خصيصًا لتصيير النصوص الصغيرة، مع إبراز Alibaba لنص بحجم يصل إلى 10px. يجعل ذلك النموذج ذا صلة خاصة بالملصقات، والرسوم المعلوماتية، والمخططات، ومفاهيم واجهات المستخدم، والمواد التعليمية، وغيرها من التصاميم التي يكون فيها النص المقروء جزءًا من الصورة لا مجرد إضافة لاحقة.
طباعة متعددة اللغات: يدعم النموذج التصيير الأصلي عبر 12 لغة وأكثر من 20 خطًا، ما يوسّع فائدته للمواد التسويقية متعددة اللغات، والرسومات المحلية، وواجهات المنتجات، وإنشاء المحتوى الدولي.
تحرير الصور: يدعم Qwen-Image-3.0 التوليد من صورة إلى صورة والتحرير باستخدام صور مرجعية مع تعليمات تحرير. تدعم وثائق API الحالية لدى Alibaba 1–3 صور مرجعية لتدفقات عمل I2I.
مخرجات متعددة: يدعم الـ API حتى 6 صور مخرجة لكل طلب، مما يتيح للمستخدمين إنشاء عدة تنويعات من الموجه نفسه.
المواصفات التقنية لـ Qwen-Image-3.0
تنشر Alibaba معلومات وصول وقدرات ملموسة للإصدار Standard. يفصل الجدول بين الحدود الموثقة والادعاءات التسويقية حتى لا يخلط المطورون بين عرض توضيحي وضمان على مستوى واجهة API.
| المواصفة | Qwen-Image-3.0 |
|---|---|
| المطوّر | Alibaba Qwen Team |
| نوع النموذج | توليد الصور وتحرير الصور |
| التموضع الأساسي | توازن بين الجودة والسرعة والتكلفة |
| معرّف النموذج | qwen-image-3.0 |
| أنماط الإدخال | نصوص وصور |
| نوع الإخراج | صورة |
| أوضاع التوليد | من نص إلى صورة؛ من صورة إلى صورة؛ تحرير موجّه |
| الحد الأقصى للموجه | حوالي 4.5K رمزًا |
| الصور المرجعية | 1-3 |
| نطاق بكسلات الإخراج | إجمالي البكسلات من 512 x 512 إلى 2048 x 2048 |
| تنسيق الإخراج | PNG |
| تصيير النص الصغير المُعلن | حوالي 10 px |
| لغات النص المرئي الأصلية | 12 |
| حد المعدل القياسي | 20 RPM في المناطق الموثّقة |
| استدعاء الوظائف | غير مدعوم |
| الاستدلال الدفعي | غير مدعوم |
| الضبط الدقيق | غير مدعوم |
| نقاط نهاية CometAPI | /v1/images/generations; /v1/images/edits |
أداء Qwen-Image-3.0 في الاختبارات المعيارية
| النموذج | Elo T2I | ترتيب T2I | Elo التحرير | ترتيب التحرير | سعر API / 1K |
|---|---|---|---|---|---|
| GPT Image 2 (high) | 1,367 | #1 | 1,257 | #4 | $211 |
| Nano Banana 2 | 1,319 | #3 | 1,250 | #7 | $67 |
| Qwen-Image-3.0-Pro | 1,284 | #9 | 1,250 | #5 | $43 |
| Seedream 5.0 Pro | 1,279 | #10 | 1,247 | #8 | $90 |
| Qwen-Image-3.0 | 1,275 | #11 | 1,218 | #15 | $30 |
ماذا تعني النتائج
- Standard مقابل Pro: الفجوة في التحويل من نص إلى صورة لا تتجاوز 9 نقاط Elo، لكن Pro يتقدم بـ 32 نقطة Elo في التحرير. قد يكون السبب الأقوى للدفع مقابل Pro هو جودة التحرير لا التوليد الأولي.
- مقارنة بـ Seedream 5.0 Pro: يتأخر Standard بـ 4 نقاط Elo فقط في التحويل من نص إلى صورة، بينما يتقدم Pro بـ 5 نقاط Elo. هذه الفروق الصغيرة تقع ضمن هوامش عدم اليقين المنشورة ويجب التعامل معها كمجموعة متقاربة لا ترتيبًا حاسمًا.
- مقارنة بـ Nano Banana 2: يتأخر Standard بـ 44 نقطة Elo في التحويل من نص إلى صورة و32 نقطة Elo في التحرير. يقلّص Pro فجوة التحرير إلى تعادل عند 1,250 Elo.
- مقارنة بـ GPT Image 2: يتقدم GPT على Standard بـ 92 نقطة Elo في التحويل من نص إلى صورة و39 نقطة Elo في التحرير. وبذلك تكون حجة Qwen هي السعر مقابل الأداء والتخصص في التخطيطات، لا ريادة الجودة الشاملة.
- مقارنة بالإصدار السابق Qwen Image 2.0 Pro، يحقق نموذج Standard 3.0 مكسبًا قدره 39 نقطة Elo في التحويل من نص إلى صورة على لوحة النتائج نفسها، بينما ينخفض السعر التمثيلي من $75 إلى $30 لكل 1,000 صورة.
مقارنة بين Qwen-Image-3.0 وGPT Image 2 وNano Banana 2
لا يتفوّق أي نموذج صور في كل أبعاد الإنتاج. يمكن أن تشير التفضيلات العامة، وإخلاص التحرير، وتصييـر النصوص، وسعة المراجع، ودقة الإخراج، والإسناد، والزمن الأدنى للاستجابة، والتكلفة إلى فائزين مختلفين. تركز المقارنة أدناه على القدرات الموثقة ونتائج Arena المستقلة.
| البعد | Qwen 3 Standard | Qwen 3 Pro | GPT Image 2 | Nano Banana 2 | Seedream 5 Pro |
|---|---|---|---|---|---|
| التموضع | توازن الجودة/السرعة/التكلفة | أعلى إخلاص لدى Qwen | نموذج صور عام فئة مميزة | نموذج Gemini للصور سريع وعالي السعة | تصميم وتحرير احترافيان |
| Elo T2I / التحرير | 1,275 / 1,218 | 1,284 / 1,250 | 1,367 / 1,257 | 1,319 / 1,250 | 1,279 / 1,247 |
| الإخراج المذكور | حوالي 2K | حوالي 2K | أحجام مرنة | حتى 4K | حوالي 2K على CometAPI |
| المراجع المدخلة | 1-3 | 1-3 | مدعوم | مراجع متعددة | حتى 10 على CometAPI |
| زاوية الطباعة | 4.5K brief؛ 10px claim؛ 12 languages | التركيز الأساسي نفسه مع إخلاص أعلى | نص متعدد اللغات قوي | نص مع إسناد عبر البحث | إنفوجرافيك كثيف وتحكم مكاني |
| الإسناد للويب | لا | لا | ليست ميزة محدِّدة في API | بحث Google وبحث الصور | يعتمد على مسار الوصول |
| أفضل ملاءمة | تخطيطات كثيفة بتكلفة مضبوطة | تحرير Qwen عالي الجودة | أفضل تفضيل عام ممكن | 4K سريع وتدفقات عمل بمعلومات حديثة | تحرير دقيق وتصميم متعدد المراجع |