الخلاصة
Qwen3.8-Omni-Flash هو نموذج Qwen من Alibaba الأصلي متعدد الوسائط لفهم النصوص والصور والصوت والفيديو، مع النص كصيغة الإخراج. أُعلن عنه في 18 سبتمبر 2026، ويجمع بين نافذة سياق بحجم 1M رمز، واستدلال صوتي-مرئي أصلي، وتفكير قابل للضبط، واستدعاء الدوال، وبحث الويب، وفهم الصوت المكاني، واستخدام الأدوات.
التغيير الأهم ليس مجرد فهم أفضل للفيديو. تصف Qwen هذا النموذج بأنه أول نموذج متعدد الوسائط يبنى حول قدرات وكيليّة: يمكنه فهم ما يراه ويسمعه، والتخطيط لما يجب فعله لاحقًا، واستدعاء الأدوات، والعمل عبر مهام أطول مثل تحرير الفلوغات، وترجمة الفيديو، وإنتاج ملخصات الأفلام، وتحليل الاجتماعات، والبحث متعدد الوسائط.
عند الإطلاق، أفادت Qwen بوجود تحسن متوسط يزيد عن 25% عبر 29 تقييمًا مقارنةً بـ Qwen3.5-Omni-Plus. هذه نتائج مُعلنة من البائع عند الإطلاق وليست تقييمات مستقلة.
أهم النقاط
- إدخال أصلي متعدد الوسائط: يقبل Qwen3.8-Omni-Flash النص والصور والصوت والفيديو، بينما يُرجع النص حاليًا.
- سير عمل وسائط وكيلي: يمكنه الجمع بين فهم الوسائط مع التخطيط، واستدعاء الدوال، وبحث الويب.
- سياق طويل وعمق صوتي: يوفر النموذج المستضاف نافذة سياق 1M رمز ويدعم الصوت متعدّد اللغات، والاستيريو، وصوت FOA من الدرجة الأولى.
- مكاسب معيارية مُعلنة من البائع: تظهر أكبر التحسينات في الوكلاء متعدد الوسائط، وفهم الصوت الطويل، وتمييز المتحدثين، والإسناد الصوتي.
- إتاحة مستضافة: النموذج متاح عبر واجهات برمجة تطبيقات مستضافة؛ Qwen-MM-Plugins متاح مفتوح المصدر بشكل منفصل لسلَسل الوكلاء متعدد الوسائط.
يمكن للمطورين الوصول إلى واجهة Qwen3.8-Omni-Flash في CometAPI عبر سير عمل موحد للواجهة.
ما هو Qwen3.8-Omni-Flash؟
Qwen3.8-Omni-Flash هو الجيل التالي من نموذج Qwen الأصلي متعدد الوسائط. بدلًا من التعامل مع الصوت أو الفيديو كمخرجات تمهيدية فقط، فإنه يستدل عبر النص، والإطارات المرئية، والكلام، والأصوات البيئية، والعلاقات الزمنية داخل سير عمل واحد. أنماط الإدخال المدعومة هي النصوص والصور والصوت والفيديو؛ أما الإخراج الحالي فهو النص.
هذا الفارق في الإخراج مهم. تُقدِّم وثائق Alibaba Cloud الرسمية Qwen3.8-Omni-Flash بوصفه مخصصًا للفهم متعدد الوسائط وتنفيذ الوكلاء، بينما تظل حالات استخدام إخراج الكلام أنسب لنسخ Qwen Omni التي تدعم توليد الصوت صراحةً.
يتحوّل إطار الإطلاق من "استشعار الوسائط" نحو "الفهم، والتخطيط، والتنفيذ، والتسليم". وهذا يجعل النموذج ذا صلة بتحرير الفيديو، والبحث متعدد الوسائط، وتحليل الاجتماعات، ومعالجة الفيديوهات التعليمية، وغيرها من سير العمل التي يجب على النموذج فيها القيام بشيءٍ بالوسائط لا مجرد تلخيصها.
مواصفات Qwen3.8-Omni-Flash
الجدول التالي للمواصفات مبني على صفحات نموذج Alibaba Cloud وQwenCloud الرسمية؛ قد تختلف الحدود والأسعار بحسب المنطقة ويجب إعادة التحقق منها قبل النشر أو النشر الإنتاجي.
| المواصفة | Qwen3.8-Omni-Flash — الصفحة الرسمية للنموذج |
|---|---|
| المطور | Alibaba Qwen |
| الإصدار | 18 سبتمبر 2026 |
| نوع النموذج | نموذج أصلي متعدد الوسائط |
| الإدخال / الإخراج | نص، صورة، صوت، فيديو / نص |
| نافذة السياق | 1,000,000 رمز |
| الحد الأقصى للإدخال | 991,808 رمز في الوضع العادي؛ 983,616 رمز في وضع التفكير |
| الحد الأقصى للإخراج | 131,072 رمز |
| حد الاستدلال الأقصى | حتى 262K رمز على QwenCloud |
| التفكير | مُفعّل افتراضيًا؛ جهد الاستدلال قابل للتهيئة |
| الأدوات والتخزين المؤقت | استدعاء الدوال، وبحث الويب، وذاكرة تخزين مؤقت ضمنية، وذاكرة جلسة مؤقتة |
| الصوت | 113 لغة ولهجة؛ استيريو وFOA بأربع قنوات |
| أنماط API | Chat Completions وResponses |
| سعر QwenCloud | $0.15 للإدخال، $0.47 للإخراج، و$0.016 لإدخال implicit-cache لكل 1M رمز |
| الأوزان المفتوحة | لم تُعلن لهذا النموذج عند الإطلاق |
كيف يعمل Qwen3.8-Omni-Flash؟
تذكر QwenCloud أن Qwen3.8-Omni-Flash مبني على معمارية Qwen3.8-Flash-Next. يوفّر ذلك سياقًا معماريًا، لكن عدد المعاملات المنشور لـ Flash-Next لا ينبغي عرضه تلقائيًا بوصفه المواصفة الدقيقة لمعاملات نموذج Omni ما لم تؤكد Qwen ذلك التطابق.
Gated DeltaNet + Qwen Sparse Attention
يجمع أساس Flash-Next بين Gated DeltaNet وQwen Sparse Attention. مبسّطًا، يقوم المكوّن التكراري بضغط المعلومات التاريخية في حالة مدمجة، بينما يستعيد الانتباه المتناثر سياقًا بعيد المدى محددًا بدل تطبيق انتباه كثيف كامل على كل زوج من الرموز. هذا مهم بشكل خاص مع تدفقات الصوت والفيديو الطويلة، حيث يمكن أن يهيمن طول التسلسل على التكلفة الحاسوبية.
إدراك وكيلي بدل الإدراك الساكن
التغيير الأكبر على مستوى النظام. تقول Qwen إن النموذج يمكنه استكشاف مقاطع الفيديو الطويلة بنشاط والتركيز على اللحظات ذات الصلة بدل إنفاق حساب متساوٍ على كل جزء. من الناحية المفاهيمية، يحدد الوكيل أين يُحتمل وجود الأدلة، ويفحص تلك اللحظات بعمق أكبر، ويستدل بشأنها، ثم يقرر أي أداة أو عملية يجب تنفيذها لاحقًا.
ما هي الميزات الرئيسية في Qwen3.8-Omni-Flash؟
استدلال صوتي-مرئي أصلي
يستدل Qwen3.8-Omni-Flash بشكل مشترك عبر المسارين المرئي والصوتي للفيديو. وهذا مهم عندما يعتمد الجواب على القناتين معًا: تحديد من قال شيئًا، تقرير ما إذا وقع صوت قبل حركةٍ ما أو بعدها، تفسير الموسيقى أو الصوت المحيطي، أو وصل التعليمات المنطوقة بما يظهر على الشاشة.
فهم متعدد المتحدثين وصوت مكاني
تدعم الواجهة الصوت متعدّد القنوات، بما في ذلك الاستيريو ثنائي القناة وAmbisonics من الدرجة الأولى بأربع قنوات. الحفاظ على المعلومات الاتجاهية يمكن أن يساعد في تحليل الاجتماعات، والوكلاء المجسّدين، والفعاليات المسجّلة، والبيئات متعددة المتحدثين، والإسناد الصوتي.
جهد استدلال قابل للضبط
التفكير مُفعّل افتراضيًا. يمكن للمطورين تهيئة جهد الاستدلال للموازنة بين الكمون واستهلاك الرموز مقابل استدلال أعمق للمهام المتعددة الوسائط المعقدة.
استدعاء الدوال وبحث الويب
يُعد استدعاء الدوال وبحث الويب جوهريين في التموضع الوكيلي. بعد فهم فيديو أو صورة أو ملف صوتي، يمكن للنموذج تمرير وسائط منظمة إلى أداة خارجية، واسترجاع معلومات إضافية، أو متابعة سير العمل خارج النموذج.
Qwen-MM-Plugins
كما أصدرت Qwen Qwen-MM-Plugins، وهي مجموعة أدوات بترخيص Apache-2.0 لأطر عمل الوكلاء متعددة الوسائط أصالةً. تتضمن سير العمل إنتاج الفيديو، والتحويل من الفيديو إلى ملاحظات، وتعلّم مهارات قابلة لإعادة الاستخدام من فيديوهات العرض، والذاكرة السمعية-البصرية.
ما مدى جودة Qwen3.8-Omni-Flash على المقاييس القياسية؟
هل ما يزال Qwen3.8-Omni-Flash قويًا في النص والبرمجة؟
تشير نتائج الإطلاق لدى Qwen إلى أن نموذج Omni يبقى قريبًا من نموذج Flash النصي المرتبط به في عدة تقييمات للبرمجة والاستدلال. تبلغ Qwen 92.6 على LiveCodeBench v6، و63.3 على SWE-bench Pro، و91.0 على GPQA Diamond. هذه نتائج مُعلنة من البائع ضمن إعدادات الإطلاق لدى Qwen وينبغي التحقق منها مقابل مهام البرمجة وهيكل الوكيل المستخدم في الإنتاج.
تفيد Qwen بتحسن متوسط يزيد عن 25% عبر 29 تقييمًا مقارنةً بـ Qwen3.5-Omni-Plus. تلخّص الجداول التالية نتائج الإطلاق الرسمية. وهي نتائج من الطرف الأول ولم تكن قد أُعيد إنتاجها بشكل مستقل عند النشر.
شروط التقييم: تقيس الأسطر الثابتة تشغيلًا واحدًا للنموذج ضمن إعدادات الإطلاق لدى Qwen. وتتضمن الأسطر الموسومة بـ “+ agent” هيكل وكيل محيط، أو استرجاعًا، أو تفحصًا تكراريًا للوسائط. ينبغي الرجوع إلى مواد الإطلاق الرسمية لقوالب الحثّ وإعدادات التوليد ومعالجة الوسائط وإصدارات الهياكل؛ وحيث لا تُكشف تلك التفاصيل، يجب التعامل مع النتيجة على أنها مُعلنة من البائع وليست قابلة لإعادة الإنتاج بشكل مستقل.
الدلالة الأكبر هي التحول من الفهم متعدد الوسائط إلى التنفيذ متعدد الوسائط. كانت الأنابيب السابقة كثيرًا ما تُفرّغ الصوت، وتعيّن عينات من إطارات الفيديو، وترسل تلك المخرجات إلى نموذج لغوي، وتنتج جوابًا، ثم تعتمد على منطق تطبيقي منفصل للمهمة الفعلية. صُمم Qwen3.8-Omni-Flash لضغط المزيد من تلك الحلقة في نظام وكيل واحد.
يمكن لوكيل إنتاج الوسائط تفحص اللقطات والصوت قبل تخطيط التحريرات. يمكن لوكيل الاجتماعات دمج هوية المتحدث مع المحتوى المنطوق والمرئيات المعروضة. يمكن لوكيل البحث تحديد اللحظات ذات الصلة في ساعات من المادة السمعية-البصرية ثم البحث عن سياق خارجي. في هذا الإطار، يصبح الصوت والفيديو سياقَ عمل للوكيل بدل مرفقات سلبية.
وكلاء الصوت-الفيديو
| المعيار — مرجع الإطلاق الرسمي | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
القفزة الأجيالية الأكبر في WildClawBench-MM، حيث تُبلغ Qwen عن ارتفاع من 34.5 إلى 71.0. يتحسن AgenticVBench أيضًا بوضوح، بينما يبقى Gemini 3.8 Flash متقدمًا في ذلك المعيار. النمط إذًا ليس نتيجة عامة من نوع "نموذج واحد يفوز بكل شيء".
فهم واستدلال الصوت-الفيديو
| المعيار | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
الأسطر الثابتة متباينة. يتصدر Gemini عدة اختبارات تقليدية لاستدلال الفيديو، لكن نتيجة Qwen ترتفع غالبًا داخل حلقة وكيل. هذا الفارق لا يهم إلا عندما يستخدم التطبيق الإنتاجي استرجاعًا وأدوات أو تفحصًا تكراريًا قابلًا للمقارنة.
الصوت وفهم متعدد المتحدثين
| المعيار | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
أسطر الاجتماعات هي الأبرز، بينما لا يتحسن FLEURS-ASR وVoiceBench عن السلف. تشير نتائج الإطلاق لذلك إلى فهمٍ أغنى للصوت طويل السياق ومتعدد المتحدثين والمكاني بدل مكسب موحّد في التعرف على الكلام.
Qwen3.8-Omni-Flash مقابل Qwen3.5-Omni-Plus مقابل Gemini 3.8 Flash
يجمع الجدول معلومات منتج Qwen الرسمية مع مواصفة Gemini 3.8 Flash الرسمية من Google. تبقى المقارنات المعيارية مُدارة من Qwen ولا ينبغي التعامل معها كتصنيفات محايدة من طرف ثالث.
| البُعد | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| المعمارية | أساس Qwen3.8-Flash-Next؛ لم يُكشف التطابق الدقيق لمعاملات Omni | جيل Qwen Omni السابق | معمارية Gemini المملوكة لـ Google |
| نافذة السياق | 1M رمز | حدود نشر أصغر | 1,048,576 رمز إدخال |
| الاستدلال | جهد استدلال قابل للضبط؛ التفكير مُفعّل افتراضيًا | لا يوجد وضع تفكير مُفعّل افتراضيًا مكافئ في النشر المشار إليه | مستويات تفكير منخفضة، متوسطة وعالية |
| الإدخال متعدد الوسائط | نص، صورة، صوت، فيديو | نص، صورة، صوت، فيديو | نص، صورة، فيديو، صوت وPDF |
| الإخراج | نص | نص وسير عمل توليد الكلام مدعومة | نص |
| البرمجة | درجات قوية مُعلنة من البائع؛ ليست عنصر التفريق الأساسي | ليس التموضع الرئيسي | مصمم لهندسة برمجيات بعيدة المدى والوكلاء |
| توافر API | Chat Completions وResponses؛ واجهة مستضافة | واجهات Qwen المستضافة | Gemini API؛ متاحة عمومًا |
| الأدوات | استدعاء الدوال وبحث الويب | استدعاء الدوال وبحث الويب | استدعاء الدوال، إسناد البحث، تنفيذ الشفرة وأدوات مدمجة أخرى |
| تسعير API المنشور | QwenCloud: $0.15 إدخال / $0.47 إخراج لكل 1M رمز | يعتمد على المنطقة ونقطة النهاية | سعر Google التمهيدي: $0.75 إدخال / $3.75 إخراج لكل 1M رمز حتى 31 ديسمبر 2026 |
| أفضل ملاءمة | وكلاء الوسائط والتحليل | محادثة Omni وإخراج الكلام | سير عمل متعددة الوسائط واسعة، والبرمجة، والوكلاء الذاتيون |
تظل Qwen3.5-Omni-Plus ذات صلة عندما يُطلب توليد الكلام. Qwen3.8-Omni-Flash أوضحُ في تحسينه حول فهم الصوت-الفيديو بكفاءة مع تنفيذ موجّه بالأدوات.
مقابل Gemini 3.8 Flash، تقييم Qwen متوازن: Qwen3.8-Omni-Flash منافسٌ في الصوت، والمعالجة متعددة المتحدثين، والإسناد، وعدة سير عمل وكلاء، بينما يتصدر Gemini بعض اختبارات استدلال الفيديو الثابتة. المقارنة المعقولة إذًا خاصة بعبء العمل.
يمكن للمطورين الذين يقيّمون الوصول الموحّد مقارنة واجهة Gemini 3.8 Flash في CometAPI، وواجهة Qwen3.8-Flash في CometAPI، وواجهة Qwen3.8-Flash-Next في CometAPI خارج الجدول حتى تبقى روابط المصادر التقنية وروابط الوصول إلى المنتج متميزة.
قيود Qwen3.8-Omni-Flash
- إخراج نصي فقط: يفهم الصوت والفيديو لكنه لا يولد الكلام كصيغة استجابة.
- نشر مستضاف: لم تُعلن الأوزان المفتوحة لـ Qwen3.8-Omni-Flash عند الإطلاق.
- مقاييس جديدة: المقارنات الرئيسية من الطرف الأول أساسًا وتحتاج إلى تكرار مستقل.
- تأثير هياكل الوكلاء: تتضمن بعض الدرجات استرجاعًا أو بيئات أدوات أو تفحصًا تكراريًا ولا ينبغي الخلط بينها وبين نتائج النموذج الخام فقط.
- تكلفة تعتمد على سير العمل: لا تزال مقاطع الفيديو الطويلة قد تصبح مكلفة إذا أعاد التطبيق معالجة أجزاء كبيرة مرارًا بدل استخدام الاسترجاع أو التخزين المؤقت أو التفحص المستهدف.
من ينبغي أن يستخدم Qwen3.8-Omni-Flash؟
يكون Qwen3.8-Omni-Flash أكثر إثارة للاهتمام عندما يكون الصوت أو الفيديو جزءًا من المهمة نفسها لا مجرد مرفق يحتاج إلى تلخيص. تشمل حالات الاستخدام المناسبة ذكاء الاجتماعات، والبحث طويل المدى في الوسائط، وخطوط ترجمة الفيديو، وتحويل الدروس إلى ملاحظات، ووكلاء إنتاج الوسائط، والأرشيفات السمعية-البصرية.
للدردشة النصية التقليدية، قد يبقى نموذج Flash النصي المخصص أبسط. لتطبيقات إخراج الكلام، قد يكون نموذج Omni مع توليد صوتي صريح أفضل. لسير العمل التي تجمع بين الرؤية والسمع والاستدلال والفعل، يُعد Qwen3.8-Omni-Flash الخيار الأكثر تميّزًا ضمن تشكيلة Qwen.
الخلاصة
يُفهم Qwen3.8-Omni-Flash على أنه نموذج صوتي-مرئي وكيلي، لا مجرد إصدار Flash متعدد الوسائط آخر. تهدف نافذة السياق 1M، والاستدلال الصوتي-المرئي الأصلي، وإمكانات المتحدثين المتعددين والصوت المكاني، والتفكير القابل للضبط، واستدعاء الدوال، والبحث، ونظام Qwen-MM-Plugins البيئي إلى التحول ذاته: السماح للنظام بالانتقال من فهم الوسائط المتعددة إلى إنجاز العمل بها.
تشير بيانات الإطلاق إلى تحسن جلي بين الأجيال مقارنةً بـ Qwen3.5-Omni-Plus، لاسيما في سير عمل الوكلاء والسيناريوهات الصوتية المعقدة. مقابل Gemini 3.8 Flash، تظل أرقام Qwen أكثر توازنًا. إذًا السؤال المهم ليس أي نموذج يفوز بجدول واحد، بل أي مزيج نموذج-وهيكل وكيل يُتم سير العمل المستهدف بدقة وكفاءة اقتصادية.
