Qwen3.8-Flash-Next ليس مجرد عضو أصغر أو أسرع ضمن عائلة Qwen3.8. تصفه Qwen بأنه نموذج MoE متعدد الوسائط بأوزان مفتوحة ومعاينة مبكرة للمعمارية المستخدمة في Qwen4. تغيّر تصميمه الانتباه والاتصالات المتبقية وسعة التضمين والتحسين في الوقت نفسه، بهدف تحسين القدرات مع خفض حاد لمقدار الحوسبة المطلوبة لكل رمز.
TL;DR
يجمع Qwen3.8-Flash-Next بين نموذج أساسي بعدد 125 مليار معلمة وجدول تضمين N-gram إضافي بحجم 51 مليار، مع تنشيط 6 مليارات معلمة فقط لكل رمز. يتعامل أصليًا مع 262,144 رمزًا ويمكن تمديده إلى 1,000,000 رمز باستخدام YaRN. بُنيت المعمارية حول مزيج 3:1 من Gated DeltaNet وQwen Sparse Attention، واتصالات Gated Residual بأربعة فروع، وتضمين N-gram، ومجمّع خبراء MoE شديد التبعثر، وتنبؤ متعدد الرموز، وتدريب قائم على Muon.
النقطة الأهم هي الكفاءة وليس عدد المعاملات الخام. تشير Qwen إلى أن تدريب النموذج يتطلب حوالي تسع تكلفة Qwen3.7-Plus، ومع ذلك يضعه تقييم الإطلاق أمام خطوط أساس Qwen السابقة في العديد من مهام الترميز ووكلاء المكاتب والمهام متعددة الوسائط. هذه نتائج مُعلنة من البائع ويجب قراءتها كأدلة إطلاق لا كتحقق مستقل.
للمطورين، الأوزان المفتوحة متاحة عبر قنوات Qwen، بينما النسخة المُدارة للإنتاج تُسمّى Qwen3.8-Flash على QwenCloud. CometAPI تُدرج Qwen3.8-Flash-Next بمعرّف النموذج qwen3.8-flash-next، ما يمنح المطورين مسارًا موحّدًا جنبًا إلى جنب مع نماذج حدودية أخرى.
أهم الخلاصات
- 125B معاملات نموذج أساسي + 51B تضمين N-gram، مع 6B معاملات نشطة لكل رمز.
- نمط انتباه هجين 3 GDN : 1 QSA مصمم لدمج ذاكرة فعالة مع استرجاع دقيق بعيد المدى.
- سياق أصلي بطول 262,144 رمزًا وحتى 1M رموز عبر YaRN.
- تشير Qwen إلى تسارع يصل إلى 7.6x في التهيئة المسبقة و4.9x في الفك عند سياق 1M لآلية QSA.
- توسيع تيار المتبقي إلى أربعة فروع ببوابات، ما يحسّن تدفق المعلومات عبر الطبقات واستقرار التدريب.
- يُظهر جدول الإطلاق الرسمي نتائج قوية في SWE-bench Pro وCoWorkBench وJobBench وToolathlon وAndroidWorld وRealWorldQA، لكنه ليس اكتساحًا كاملاً لكل معيار.
- تضع Qwen هذا الإصدار كمعاينة للمعمارية، لذا أهميته تتعلق جزئيًا بما يُشير إليه لـ Qwen4 أكثر من ترتيب معاييره الحالي فقط.
ما هو Qwen3.8-Flash-Next؟
Qwen3.8-Flash-Next هو نموذج لغوي سببي متعدد الوسائط مع مشفّر رؤية وعمود فقري لغوي من نوع Mixture-of-Experts شديد التبعثر. تصف بطاقة النموذج الرسمية معمارية من 48 طبقة مع 512 خبيرًا، و10 خبراء مُوجَّهين بالإضافة إلى خبير مشترك واحد، وتخطيطًا مخفيًا يكرر ثلاث طبقات Gated DeltaNet تليها طبقة Qwen Sparse Attention واحدة.
يلعب الإصدار دورًا مماثلًا لـ Qwen3-Next: فهو يكشف عن تغييرات معمارية قبل توسيعها إلى العائلة التالية الكاملة. تصف Qwen هذا النموذج صراحة بأنه معاينة تجريبية للمعمارية التي ستدعم Qwen4. يجعل ذلك النموذج مثيرًا للاهتمام بشكل غير عادي للمهندسين المهتمين بكفاءة الخدمة والسياقات الطويلة واتجاه أبحاث معمارية النماذج المفتوحة.
4 مكونات أساسية في Qwen3.8-Flash-Next
يغيّر النموذج أربعة مكونات أساسية معًا: الانتباه، وتدفق المتبقي، وسعة التضمين، والتحسين. هذا التصميم المشترك مهم لأن مكاسب الكفاءة في مكون قد تضيع إذا أصبح مكون آخر عنق زجاجة عند سياق طويل أو مقياس كبير.
انتباه هجيني: GDN + Qwen Sparse Attention
لا تؤدي معظم الطبقات انتباهًا عالميًا. بدلًا من ذلك، ثلاث من كل أربع طبقات تستخدم Gated DeltaNet لضغط المعلومات التاريخية في حالة بحجم ثابت. الطبقة الرابعة تستخدم انتباهًا عالميًا للاسترجاع الدقيق، لكن هذا الانتباه العالمي أُعيد تصميمه كـ Qwen Sparse Attention (QSA).
يتجنب QSA البحث عن كل رمز بشكل مستقل. يقوم مفهرس خفيف الوزن أولًا بتجميع التسلسل إلى كتل صغيرة، ويقدّر الكتل المهمة، ثم ينتبه فقط إلى المناطق المحددة. وفق وصف Qwen، يقلل هذا من كلٍ من حسابات الانتباه وتكاليف الفهرسة اللازمة لإيجاد السياق ذي الصلة. التصميم متوافق بشكل خاص مع شبكة هجينة لأن الفهرس المتناثر يُبنى بشكل مستقل داخل كل طبقة انتباه بدلًا من الاعتماد على التشابه بين طبقات الانتباه المتجاورة.
الأرقام المتعلقة بالكفاءة كبيرة. عند سياق 1M رمز، تشير Qwen إلى تسارع يصل إلى 7.6x في التهيئة المسبقة و4.9x في الفك لنواة انتباه QSA. في تجربة خدمة ذات إعادة استخدام عالية للذاكرة البادئة مع معدل إصابة 90%، يصل النموذج الكامل إلى 8.6x من معدل التهيئة المسبقة مقارنة بـ Qwen3.7-Plus عند سياق 1M.
Gated Residual: أربعة مسارات بدلًا من واحد
يقرأ ويكتب Transformer تقليدي تيارًا متبقيًا واحدًا بشكل متكرر. بدلاً من ذلك، يستخدم Qwen3.8-Flash-Next Gated Residual لتوسيع هذا التيار إلى أربعة فروع متوازية. تقرر بوابات القراءة على مستوى العناصر مقدار المعلومات المأخوذة من كل فرع، بينما تحدد بوابات الكتابة على مستوى الفرع ما يُكتب مجددًا.
يهدف ذلك إلى الحفاظ على الميزات المفيدة عبر العمق دون فرض مرور كل ميزة عبر قناة ممزوجة بشكل مستمر نفسها. تشير Qwen أيضًا إلى أن البوابات تثبط القيم الشاذة للتنشيط وأن الحالة المتبقية يمكن تخزينها بصيغة FP8، ما يقلل حركة المرور على الذاكرة. الفكرة الرئيسية ليست مجرد سعة متبقية أكبر؛ بل التوجيه المتحكم به للمعلومات عبر الطبقات.
تضمين N-gram: سعة أكبر دون حوسبة متناسبة
يضيف النموذج 51 مليار معلمة لتضمين N-gram إلى جانب 125 مليار معلمة في العمود الفقري الأساسي. بخلاف التضمين العادي الذي يفهرس من رمز واحد، يستخدم تضمين N-gram أنماط الرموز المحلية مثل الثنائيات والثلاثيات. يمنح ذلك النموذج ذاكرة بأسلوب البحث للأنماط المحلية المتكررة.
الجزء غير المألوف هو مكان السعة. نظرًا لإمكانية معرفة عنوان البحث قبل الحاجة إلى التضمين، يمكن الاحتفاظ بالجدول في ذاكرة المضيف وجلبه مسبقًا بشكل غير متزامن بينما تستمر حوسبة GPU. هذا يعني أن 51 مليار معلمة الإضافية لا تتصرف كأنها 51 مليار معلمة إضافية لضرب مصفوفات كثيفة. فعليًا، توسّع المعمارية موردين مختلفين: معاملات نموذج كثيفة ثقيلة الحوسبة وذاكرة بحث منخفضة الحوسبة.
Muon وتحسين التدريب
تدرّب Qwen المعمارية باستخدام محسّن Muon للخرائط الخطية ثنائية الأبعاد مثل الأوزان الرئيسية في الانتباه وGDN وخبراء MoE، بينما تستمر التضمينات والمُوجّه ومعاملات Gated Residual منخفضة الرتبة باستخدام AdamW. تُقسَّم المصفوفات المدمجة مثل إسقاطات QKV وSwiGLU إلى تحويلاتها الخطية المستقلة قبل التعامد.
أعادت الفريق أيضًا ملاءمة قانون التحجيم للمعمارية الجديدة ويشير إلى أن إحماء حجم الدفعات التقليدي لم يكن ضروريًا. لم يُحسّن الزيادة التدريجية في حجم الدفعات النتيجة النهائية وبدلاً من ذلك تطلبت 18.8% المزيد من خطوات المحسّن. لذلك يبدأ الوصفة النهائية مباشرة بحجم الدفعات المستهدف.
MoE شديد التبعثر وتنبؤ متعدد الرموز
تسرد بطاقة النموذج الرسمية 512 خبيرًا مع 10 خبراء مُوجَّهين وخبير مشترك واحد نشط لكل رمز. يزيد مجمّع الخبراء الكبير السعة المخزنة دون تنشيط النموذج بالكامل لكل رمز. يُدرّب نموذج تنبؤ متعدد الرموز (MTP) بطبقة واحدة مع خطوات متعددة لتحسين القبول في التوليد التكهني مع دعم العمود الفقري الرئيسي أيضًا.
أداء Qwen3.8-Flash-Next على المعايير
تنشر Qwen تقييمات واسعة للغة والترميز والوكلاء والرؤية-اللغة. هذه الأرقام مفيدة لأن العديد من نماذج المقارنة أعيد تشغيلها في إطار Qwen، لكنها لا تزال تقييمات إطلاق مُعلنة من البائع، وليست إعادة إنتاج مستقلة للمعايير. تستخدم عدة صفوف أيضًا أطرًا أو حكّامًا خاصين بالمعيار، لذا فإن القراءة الأكثر أمانًا هي اتجاهية: تُظهر أين يكون Qwen3.8-Flash-Next أقوى وأين لا يزال المنافسون متقدمين.
أداء الترميز والوكلاء
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
قصة الترميز قوية ولكنها دقيقة. يتصدر Qwen3.8-Flash-Next مجموعة المقارنة المذكورة في SWE-bench Pro وSWE-bench Multilingual وCoWorkBench وJobBench وToolathlon Verified وLiveCodeBench v6. ومع ذلك، DeepSeek V4 Flash متقدم في NL2Repo-Bench، بينما يتصدر Claude Opus 4.6 معيار HLE. هذا يجعل الكفاءة العنوان الأكثر قابلية للدفاع عنه أكثر من هيمنة شاملة على جميع المعايير.
أبرز المكاسب مقارنة بخطوط أساس Qwen السابقة تظهر في العمل طويل الأفق. يرتفع CoWorkBench من 65.1 على Qwen3.7-Plus إلى 73.9، بينما يتحرك JobBench من 27.6 إلى 55.7. نظرًا لأن CoWorkBench معيار داخلي لدى Qwen، فإن هذه المكاسب تستحق إعادة التحقق بشكل مستقل، لكنها تتوافق مع التركيز المعلن للمعمارية على وكلاء ومهام مكتبية طويلة السياق وفعّالة التكلفة.
الأداء متعدد الوسائط
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
مصدر البيانات: تقييم الإطلاق الرسمي من Qwen**.
تدعم النتائج متعددة الوسائط الرأي بأنه ليس مجرد نموذج Flash مُركَّز على الترميز. يسجل Qwen3.8-Flash-Next 84.5 على AndroidWorld، و64.0 على Vision2Web، و76.6 على LVBench، و88.5 على RealWorldQA في جدول Qwen. كما توفر بطاقة النموذج أمثلة لإدخال الصور والفيديو، بما في ذلك توصيات لأخذ عينات بمعدل إطار أعلى على أعباء عمل الفيديو على مستوى الساعة. أعباء عمل الفيديو.
Qwen3.8-Flash-Next مقارنة بنماذج أخرى
يجب أن تفصل مقارنة مفيدة بين ثلاثة أسئلة: مقدار الحوسبة المُفعّلة لكل رمز، ومدى اتساع وسائط النموذج وسياقه، ومدى أدائه على سير عمل تمثيلية. عدد المعاملات الإجمالي الخام وحده لا يجيب عن هذه الأسئلة.
Qwen3.8-Flash-Next مقابل Qwen3.8-27B مقابل Qwen3.7-Plus
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Model parameters | 125B + 51B N-gram embedding | 27B | 397B |
| Activated parameters | 6B | 27B | 17B |
| Native context | 262K | 262K in Qwen comparison setup | Prior-generation long-context model |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
النتيجة الأساسية هي القدرة لكل معاملة نشطة. يقوم Qwen3.8-Flash-Next بتنشيط 6 مليارات معلمة لكل رمز مقابل 27 مليارًا لـ Qwen3.8-27B و17 مليارًا لـ Qwen3.7-Plus، ومع ذلك فهو متقدم في درجات DeepSWE وCoWorkBench وJobBench وAndroidWorld المذكورة. المقايضة هي بصمة الذاكرة: التبعثر يقلل الحوسبة النشطة، لا مقدار سعة النموذج التي يجب تخزينها في نهاية المطاف في مكان ما.
Qwen3.8-Flash-Next مقابل DeepSeek V4 Flash مقابل Claude Opus 4.6
| Dimension | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Weights | Open-weight | Open-weight | Closed |
| Reported parameter profile | 125B main + 51B N-gram; 6B active | 284B total; 13B active | Not publicly disclosed |
| Primary efficiency story | QSA + GDN + 6B active MoE + lookup memory | High-throughput sparse MoE | Managed frontier reasoning and agent stack |
| Native multimodality | Text, image, video -> text | Text-oriented Flash family; vision route available separately on CometAPI | Text + vision/files through hosted APIs |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
يظل DeepSeek V4 Flash أقوى في NL2Repo-Bench في مقارنة Qwen، وهذا مهم لتوليد الشيفرة على مستوى المستودعات. يمثل Claude Opus 4.6 نموذجًا مُدارًا مغلقًا وليس هدف نشر مفتوحًا. يتميز Qwen3.8-Flash-Next بدرجة أكبر من خلال مزيج الأوزان المفتوحة وتعدد الوسائط الأصلي والهندسة للسياقات الطويلة وميزانية معاملات نشطة صغيرة جدًا.
Qwen3.8-Flash-Next مقابل Qwen3.8-Max
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Role | معاينة معمارية تركّز على الكفاءة | الرائد في Qwen3.8 |
| Main/total scale | 125B main + 51B N-gram; 6B active | 2.4T total; about 95B active on CometAPI model page |
| Architecture emphasis | QSA, GDN, Gated Residual, N-gram Embedding, Muon | أقصى قدرات حدودية على مقياس أكبر بكثير |
| Best fit | وكلاء كثيفو الحجم، مساعدين للترميز، أتمتة متعددة الوسائط، استضافة ذاتية | أقسى مهام الاستدلال، وكلاء المؤسسات الكبار، أعباء عمل تركز على القدرة |
| Context | 262K أصلي؛ حتى 1M مع YaRN | سياق فئة 1M مُستضاف على مسارات Qwen3.8 الرائدة الحالية |
تستند مواصفات Qwen3.8-Max إلى إدراج نموذج CometAPI الحالي.
التمييز بسيط: Qwen3.8-Max هو الرائد الذي يعطي الأولوية للقدرات، بينما Qwen3.8-Flash-Next هو تجربة معمارية وكفاءة. يجب على المطورين الذين يختارون بينهما أن يسألوا ما إذا كان عنق الزجاجة هو قدرة النموذج المطلقة أم تكلفة تشغيل العديد من المهام طويلة السياق واستخدام الأدوات على نطاق واسع.
تسعير وتوافر Qwen3.8-Flash-Next
الأوزان المفتوحة لـ Qwen3.8-Flash-Next منشورة عبر Hugging Face وModelScope. بالنسبة للخدمة المُدارة، تشير Qwen إلى أن النسخة الإنتاجية تُسمّى Qwen3.8-Flash على QwenCloud، مع سياق 1M مفعّلًا افتراضيًا وأدوات مدمجة رسمية.
تذكر Qwen أن السعر المُدار للإنتاج هو 0.16$ لكل مليون رموز إدخال و0.47$ لكل مليون رموز إخراج. يشير هذا السعر إلى نموذج الإنتاج Qwen3.8-Flash على QwenCloud، وليس إلى الاستضافة الذاتية للأوزان المفتوحة.
| Route | Input | Output |
|---|---|---|
| QwenCloud production model (Qwen3.8-Flash) | $0.16 / 1M tokens | $0.47 / 1M tokens |
| Open-weight self-hosting | Infrastructure-dependent | Infrastructure-dependent |
| CometAPI route | Check live model page | Check live model page |
أسعار QwenCloud مأخوذة من مقال الإطلاق الرسمي من Qwen؛ يجب التحقق من فواتير CometAPI على صفحة النموذج الحية.
توصية CometAPI
من المتوقع أن يصبح Qwen3.8-Flash-Next متاحًا عبر CometAPI قريبًا. توفّر CometAPI نقطة نهاية واحدة متوافقة مع OpenAI (https://api.cometapi.com/v1) تُجمِّع أكثر من 500 نموذج من مزودين رائدين، بما في ذلك سلسلة نماذج Qwen. يقلل هذا النهج الارتباط بمزوّد واحد، ويبسّط التجريب مع Qwen3.8-Flash (بمجرد توفره عبر المنصة أو نقاط Qwen ذات الصلة)، ويُسهل عمليات النشر الإنتاجية التي قد تمزج نماذج لمهام مختلفة (مثل Qwen لوكلاء ترميز فعّالي التكلفة + نموذج آخر لاستدلال متخصص). تتوفر الوثائق وأدلة البدء السريع على apidoc.cometapi.com والموقع الرئيسي لـ CometAPI.
سواء استضفت الأوزان المفتوحة ذاتيًا، أو استخدمت QwenCloud، أو مررت عبر منصة موحّدة مثل CometAPI، يُخفض Qwen3.8-Flash-Next الحاجز أمام وكلاء متعدد الوسائط طويل السياق عالي الأداء.
ما الذي يمكن لـ Qwen3.8-Flash-Next فعله؟
1. وكلاء ترميز كثيفو الحجم
ميزانية معاملات نشطة بحجم 6 مليارات مجتمعة مع درجة 62.5 في SWE-bench Pro وفق تقييم Qwen تجعل Qwen3.8-Flash-Next مثيرًا للاهتمام بشكل خاص لأنظمة الترميز التي تُشغّل العديد من الجلسات المتوازية. تشمل الأمثلة مراجعة الشيفرة، وفرز المشكلات، والتنقل في المستودعات، وتوليد الاختبارات، والترقيع التكراري حيث يكون مُعدّل الإنتاجية مهمًا تقريبًا بقدر الذكاء في التشغيل الفردي.
2. أعمال مكتبية ومعرفة طويلة الأفق
يُعد CoWorkBench وJobBench محوريين في تموضع النموذج. صُمّمت المعمارية لحلقات وكيل تقرأ السياق مرارًا، وتستدعي أدوات، وتحدّث الحالة، وتواصل العمل بدلًا من الإجابة مرة واحدة. يتوافق ذلك بشكل طبيعي مع سير عمل المستندات، وتحليل الجداول، وتركيب التقارير، وتوليف الأبحاث، وأتمتة العمليات التجارية.
3. وكلاء حوسبة وجوال متعدد الوسائط
تجعل مدخلات الصور والفيديو، وأداء AndroidWorld، وتقييم OSWorld، ونتائج Vision2Web النموذج ذا صلة بوكلاء واجهة المستخدم. يمكن أن يعمل كطبقة الاستدلال خلف أنظمة تفسّر لقطات الشاشة، وتُشغّل واجهات الهاتف المحمول، وتعيد إنشاء تخطيطات التطبيقات، أو تجمع الحالة البصرية مع استدعاءات الأدوات.
4. فيديو طويل واستدلال بصري
تتضمن بطاقة النموذج الرسمية أمثلة إدخال فيديو صريحة وإرشادات لمعالجة فيديو على مستوى الساعات. يجعل ذلك النموذج مفيدًا لإجابة الأسئلة على الفيديو، والبحث في الفيديو الطويل، واستخراج الأحداث المرئية، وسير العمل التي تجمع فهم الفيديو مع أدوات لاحقة.
5. أبحاث وسير عمل مستودعات بمليون رمز
النموذج المفتوح أصلي عند 262,144 رمزًا وقابل للتمديد إلى 1,000,000 باستخدام YaRN. هذا التمييز مهم: 1M امتداد وليس السياق الأصلي للنموذج المفتوح. بالنسبة للمستودعات الكبيرة أو مجموعات الأبحاث، يُقصد بـ QSA جعل تكلفة الاسترجاع لتلك السياقات الطويلة أكثر عملية من الانتباه العالمي الكثيف.
كيف يمكن للمطورين تشغيل Qwen3.8-Flash-Next؟
يمكن للمطورين تنزيل الأوزان المفتوحة من Hugging Face وتشغيل النموذج باستخدام Transformers أو vLLM أو SGLang أو TokenSpeed. توفّر Qwen أمثلة لإكمالات محادثة متوافقة مع OpenAI لكلٍ من الإدخال النصي والمتعدد الوسائط.
على سبيل المثال، تُظهر بطاقة النموذج الرسمية تقديم Qwen/Qwen3.8-Flash-Next باستخدام vLLM واستدعاءه عبر /v1/chat/completions. تُعرض أيضًا مدخلات الصور والفيديو عبر الواجهة المتوافقة مع OpenAI.
يعمل Qwen3.8-Flash-Next في وضع التفكير افتراضيًا. يمكن للمطورين التحكم في سلوك التفكير عبر enable_thinking وpreserve_thinking وreasoning_effort؛ مستويات الجهد الموثّقة هي xhigh وmedium وlow.
ما هي قيود Qwen3.8-Flash-Next؟
أكبر قيد عملي هو تكلفة العتاد. على الرغم من تنشيط 6 مليارات معلمة فقط من معلمات نموذج اللغة، يحتوي ملف نقطة التحقق على 125 مليار معلمة لغة بالإضافة إلى مكوّن تضمين n-gram بحجم 51 مليار ومعاملات MTP بحجم 4 مليارات. يبلغ حجم المستودع الحالي حوالي 360 جيجابايت، لذا يظل النشر المحلي مهمة ثقيلة من حيث البنية التحتية.
القيد الثاني هو أن 262K هو طول السياق الأصلي، وليس 1M. يمكن تمديد النموذج إلى 1M رموز، لكن لا ينبغي لصفحة CometAPI أو نموذج أن تُدرج ببساطة "1M سياق أصلي". الصياغة الصحيحة هي سياق أصلي 262K، قابل للتمديد إلى 1M.
أخيرًا، أداء المعايير غير متساوٍ. يعد Qwen3.8-Flash-Next تنافسيًا للغاية في مهام الترميز والوكلاء لكنه لا يتصدر كل معيار. على سبيل المثال، يُسجل Claude Opus 4.6 قيمة 40.0 على HLE مقابل 35.9 لـ Flash-Next، بينما يتصدر DeepSeek-V4-Flash-0731 النماذج المذكورة في NL2Repo-Bench.
Qwen3.8-Flash-Next: ما الذي يُشير إليه بالنسبة لـ Qwen4
تكمن الأهمية الأوسع لهذا الإصدار في دوره كمعاينة مبكرة للمعمارية المتوقع أن تدعم Qwen4. يجمع Qwen3.8-Flash-Next بين Qwen Sparse Attention وGated DeltaNet واتصالات Gated Residual بأربعة فروع وتضمين N-gram ومجمّع خبراء MoE شديد التبعثر وتنبؤ متعدد الرموز. تُظهر هذه الاختيارات كيف تستكشف Qwen سعة أعلى وسياقًا أطول وأداءً أقوى متعدد الوسائط والوكلاء دون زيادة الحوسبة النشطة بنفس المعدل.
الحُكم النهائي
Qwen3.8-Flash-Next مهم لأنه يغيّر شكل مسألة الكفاءة. بدلًا من التعامل مع جميع المعاملات على أنها متكافئة، يجمع بين مسار MoE نشط صغير نسبيًا وذاكرة بأسلوب البحث كبيرة جدًا وآلية استرجاع متناثرة مصممة للسياق الطويل. يمنح ذلك Qwen عدة روافع مستقلة لزيادة السعة دون زيادة حسابات المصفوفات لكل رمز بنفس المعدل.
بالنسبة للمطورين، يجعل ذلك النموذج خيارًا جذابًا لمساعدي الترميز كثيفي الحجم، ووكلاء طويلَي السياق، والأتمتة متعددة الوسائط، والتجارب المُستضافة ذاتيًا. بالنسبة لخارطة طريق Qwen الأوسع، فهو أكثر أهمية: تستخدم Qwen هذا الإصدار صراحةً للكشف عن الاتجاه المعماري الذي تخطط لصقله نحو Qwen4.
