Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/أبحاث CometAPI

ما هو Qwen3.8-Flash-Next؟

استكشف Qwen3.8-Flash-Next: بنية MoE بسعة 125B، 6B من المعاملات النشطة، QSA، سياق ممتد بطول 1M-token، مقاييس معيارية متعددة الوسائط، الميزات، التسعير.

CometAPI
Mia Marenفريق أبحاث نماذج AI وAPI
تم التحديث Aug 29, 2026 16 دقائق للقراءة
ما هو Qwen3.8-Flash-Next؟
استخدم هذا النمط

أجرِ أول استدعاء لـ API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next ليس مجرد عضو أصغر أو أسرع ضمن عائلة Qwen3.8. تصفه Qwen بأنه نموذج MoE متعدد الوسائط بأوزان مفتوحة ومعاينة مبكرة للمعمارية المستخدمة في Qwen4. تغيّر تصميمه الانتباه والاتصالات المتبقية وسعة التضمين والتحسين في الوقت نفسه، بهدف تحسين القدرات مع خفض حاد لمقدار الحوسبة المطلوبة لكل رمز.

TL;DR

يجمع Qwen3.8-Flash-Next بين نموذج أساسي بعدد 125 مليار معلمة وجدول تضمين N-gram إضافي بحجم 51 مليار، مع تنشيط 6 مليارات معلمة فقط لكل رمز. يتعامل أصليًا مع 262,144 رمزًا ويمكن تمديده إلى 1,000,000 رمز باستخدام YaRN. بُنيت المعمارية حول مزيج 3:1 من Gated DeltaNet وQwen Sparse Attention، واتصالات Gated Residual بأربعة فروع، وتضمين N-gram، ومجمّع خبراء MoE شديد التبعثر، وتنبؤ متعدد الرموز، وتدريب قائم على Muon.

النقطة الأهم هي الكفاءة وليس عدد المعاملات الخام. تشير Qwen إلى أن تدريب النموذج يتطلب حوالي تسع تكلفة Qwen3.7-Plus، ومع ذلك يضعه تقييم الإطلاق أمام خطوط أساس Qwen السابقة في العديد من مهام الترميز ووكلاء المكاتب والمهام متعددة الوسائط. هذه نتائج مُعلنة من البائع ويجب قراءتها كأدلة إطلاق لا كتحقق مستقل.

للمطورين، الأوزان المفتوحة متاحة عبر قنوات Qwen، بينما النسخة المُدارة للإنتاج تُسمّى Qwen3.8-Flash على QwenCloud. CometAPI تُدرج Qwen3.8-Flash-Next بمعرّف النموذج qwen3.8-flash-next، ما يمنح المطورين مسارًا موحّدًا جنبًا إلى جنب مع نماذج حدودية أخرى.

أهم الخلاصات

ما هو Qwen3.8-Flash-Next؟

Qwen3.8-Flash-Next هو نموذج لغوي سببي متعدد الوسائط مع مشفّر رؤية وعمود فقري لغوي من نوع Mixture-of-Experts شديد التبعثر. تصف بطاقة النموذج الرسمية معمارية من 48 طبقة مع 512 خبيرًا، و10 خبراء مُوجَّهين بالإضافة إلى خبير مشترك واحد، وتخطيطًا مخفيًا يكرر ثلاث طبقات Gated DeltaNet تليها طبقة Qwen Sparse Attention واحدة.

يلعب الإصدار دورًا مماثلًا لـ Qwen3-Next: فهو يكشف عن تغييرات معمارية قبل توسيعها إلى العائلة التالية الكاملة. تصف Qwen هذا النموذج صراحة بأنه معاينة تجريبية للمعمارية التي ستدعم Qwen4. يجعل ذلك النموذج مثيرًا للاهتمام بشكل غير عادي للمهندسين المهتمين بكفاءة الخدمة والسياقات الطويلة واتجاه أبحاث معمارية النماذج المفتوحة.

4 مكونات أساسية في Qwen3.8-Flash-Next

يغيّر النموذج أربعة مكونات أساسية معًا: الانتباه، وتدفق المتبقي، وسعة التضمين، والتحسين. هذا التصميم المشترك مهم لأن مكاسب الكفاءة في مكون قد تضيع إذا أصبح مكون آخر عنق زجاجة عند سياق طويل أو مقياس كبير.

انتباه هجيني: GDN + Qwen Sparse Attention

لا تؤدي معظم الطبقات انتباهًا عالميًا. بدلًا من ذلك، ثلاث من كل أربع طبقات تستخدم Gated DeltaNet لضغط المعلومات التاريخية في حالة بحجم ثابت. الطبقة الرابعة تستخدم انتباهًا عالميًا للاسترجاع الدقيق، لكن هذا الانتباه العالمي أُعيد تصميمه كـ Qwen Sparse Attention (QSA).

يتجنب QSA البحث عن كل رمز بشكل مستقل. يقوم مفهرس خفيف الوزن أولًا بتجميع التسلسل إلى كتل صغيرة، ويقدّر الكتل المهمة، ثم ينتبه فقط إلى المناطق المحددة. وفق وصف Qwen، يقلل هذا من كلٍ من حسابات الانتباه وتكاليف الفهرسة اللازمة لإيجاد السياق ذي الصلة. التصميم متوافق بشكل خاص مع شبكة هجينة لأن الفهرس المتناثر يُبنى بشكل مستقل داخل كل طبقة انتباه بدلًا من الاعتماد على التشابه بين طبقات الانتباه المتجاورة.

الأرقام المتعلقة بالكفاءة كبيرة. عند سياق 1M رمز، تشير Qwen إلى تسارع يصل إلى 7.6x في التهيئة المسبقة و4.9x في الفك لنواة انتباه QSA. في تجربة خدمة ذات إعادة استخدام عالية للذاكرة البادئة مع معدل إصابة 90%، يصل النموذج الكامل إلى 8.6x من معدل التهيئة المسبقة مقارنة بـ Qwen3.7-Plus عند سياق 1M.

Gated Residual: أربعة مسارات بدلًا من واحد

يقرأ ويكتب Transformer تقليدي تيارًا متبقيًا واحدًا بشكل متكرر. بدلاً من ذلك، يستخدم Qwen3.8-Flash-Next Gated Residual لتوسيع هذا التيار إلى أربعة فروع متوازية. تقرر بوابات القراءة على مستوى العناصر مقدار المعلومات المأخوذة من كل فرع، بينما تحدد بوابات الكتابة على مستوى الفرع ما يُكتب مجددًا.

يهدف ذلك إلى الحفاظ على الميزات المفيدة عبر العمق دون فرض مرور كل ميزة عبر قناة ممزوجة بشكل مستمر نفسها. تشير Qwen أيضًا إلى أن البوابات تثبط القيم الشاذة للتنشيط وأن الحالة المتبقية يمكن تخزينها بصيغة FP8، ما يقلل حركة المرور على الذاكرة. الفكرة الرئيسية ليست مجرد سعة متبقية أكبر؛ بل التوجيه المتحكم به للمعلومات عبر الطبقات.

تضمين N-gram: سعة أكبر دون حوسبة متناسبة

يضيف النموذج 51 مليار معلمة لتضمين N-gram إلى جانب 125 مليار معلمة في العمود الفقري الأساسي. بخلاف التضمين العادي الذي يفهرس من رمز واحد، يستخدم تضمين N-gram أنماط الرموز المحلية مثل الثنائيات والثلاثيات. يمنح ذلك النموذج ذاكرة بأسلوب البحث للأنماط المحلية المتكررة.

الجزء غير المألوف هو مكان السعة. نظرًا لإمكانية معرفة عنوان البحث قبل الحاجة إلى التضمين، يمكن الاحتفاظ بالجدول في ذاكرة المضيف وجلبه مسبقًا بشكل غير متزامن بينما تستمر حوسبة GPU. هذا يعني أن 51 مليار معلمة الإضافية لا تتصرف كأنها 51 مليار معلمة إضافية لضرب مصفوفات كثيفة. فعليًا، توسّع المعمارية موردين مختلفين: معاملات نموذج كثيفة ثقيلة الحوسبة وذاكرة بحث منخفضة الحوسبة.

Muon وتحسين التدريب

تدرّب Qwen المعمارية باستخدام محسّن Muon للخرائط الخطية ثنائية الأبعاد مثل الأوزان الرئيسية في الانتباه وGDN وخبراء MoE، بينما تستمر التضمينات والمُوجّه ومعاملات Gated Residual منخفضة الرتبة باستخدام AdamW. تُقسَّم المصفوفات المدمجة مثل إسقاطات QKV وSwiGLU إلى تحويلاتها الخطية المستقلة قبل التعامد.

أعادت الفريق أيضًا ملاءمة قانون التحجيم للمعمارية الجديدة ويشير إلى أن إحماء حجم الدفعات التقليدي لم يكن ضروريًا. لم يُحسّن الزيادة التدريجية في حجم الدفعات النتيجة النهائية وبدلاً من ذلك تطلبت 18.8% المزيد من خطوات المحسّن. لذلك يبدأ الوصفة النهائية مباشرة بحجم الدفعات المستهدف.

MoE شديد التبعثر وتنبؤ متعدد الرموز

تسرد بطاقة النموذج الرسمية 512 خبيرًا مع 10 خبراء مُوجَّهين وخبير مشترك واحد نشط لكل رمز. يزيد مجمّع الخبراء الكبير السعة المخزنة دون تنشيط النموذج بالكامل لكل رمز. يُدرّب نموذج تنبؤ متعدد الرموز (MTP) بطبقة واحدة مع خطوات متعددة لتحسين القبول في التوليد التكهني مع دعم العمود الفقري الرئيسي أيضًا.

أداء Qwen3.8-Flash-Next على المعايير

تنشر Qwen تقييمات واسعة للغة والترميز والوكلاء والرؤية-اللغة. هذه الأرقام مفيدة لأن العديد من نماذج المقارنة أعيد تشغيلها في إطار Qwen، لكنها لا تزال تقييمات إطلاق مُعلنة من البائع، وليست إعادة إنتاج مستقلة للمعايير. تستخدم عدة صفوف أيضًا أطرًا أو حكّامًا خاصين بالمعيار، لذا فإن القراءة الأكثر أمانًا هي اتجاهية: تُظهر أين يكون Qwen3.8-Flash-Next أقوى وأين لا يزال المنافسون متقدمين.

أداء الترميز والوكلاء

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

قصة الترميز قوية ولكنها دقيقة. يتصدر Qwen3.8-Flash-Next مجموعة المقارنة المذكورة في SWE-bench Pro وSWE-bench Multilingual وCoWorkBench وJobBench وToolathlon Verified وLiveCodeBench v6. ومع ذلك، DeepSeek V4 Flash متقدم في NL2Repo-Bench، بينما يتصدر Claude Opus 4.6 معيار HLE. هذا يجعل الكفاءة العنوان الأكثر قابلية للدفاع عنه أكثر من هيمنة شاملة على جميع المعايير.

أبرز المكاسب مقارنة بخطوط أساس Qwen السابقة تظهر في العمل طويل الأفق. يرتفع CoWorkBench من 65.1 على Qwen3.7-Plus إلى 73.9، بينما يتحرك JobBench من 27.6 إلى 55.7. نظرًا لأن CoWorkBench معيار داخلي لدى Qwen، فإن هذه المكاسب تستحق إعادة التحقق بشكل مستقل، لكنها تتوافق مع التركيز المعلن للمعمارية على وكلاء ومهام مكتبية طويلة السياق وفعّالة التكلفة.

الأداء متعدد الوسائط

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Binary / Partial)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (without / with CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (without / with CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

مصدر البيانات: تقييم الإطلاق الرسمي من Qwen**.

تدعم النتائج متعددة الوسائط الرأي بأنه ليس مجرد نموذج Flash مُركَّز على الترميز. يسجل Qwen3.8-Flash-Next 84.5 على AndroidWorld، و64.0 على Vision2Web، و76.6 على LVBench، و88.5 على RealWorldQA في جدول Qwen. كما توفر بطاقة النموذج أمثلة لإدخال الصور والفيديو، بما في ذلك توصيات لأخذ عينات بمعدل إطار أعلى على أعباء عمل الفيديو على مستوى الساعة. أعباء عمل الفيديو.

Qwen3.8-Flash-Next مقارنة بنماذج أخرى

يجب أن تفصل مقارنة مفيدة بين ثلاثة أسئلة: مقدار الحوسبة المُفعّلة لكل رمز، ومدى اتساع وسائط النموذج وسياقه، ومدى أدائه على سير عمل تمثيلية. عدد المعاملات الإجمالي الخام وحده لا يجيب عن هذه الأسئلة.

Qwen3.8-Flash-Next مقابل Qwen3.8-27B مقابل Qwen3.7-Plus

DimensionQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
Model parameters125B + 51B N-gram embedding27B397B
Activated parameters6B27B17B
Native context262K262K in Qwen comparison setupPrior-generation long-context model
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

النتيجة الأساسية هي القدرة لكل معاملة نشطة. يقوم Qwen3.8-Flash-Next بتنشيط 6 مليارات معلمة لكل رمز مقابل 27 مليارًا لـ Qwen3.8-27B و17 مليارًا لـ Qwen3.7-Plus، ومع ذلك فهو متقدم في درجات DeepSWE وCoWorkBench وJobBench وAndroidWorld المذكورة. المقايضة هي بصمة الذاكرة: التبعثر يقلل الحوسبة النشطة، لا مقدار سعة النموذج التي يجب تخزينها في نهاية المطاف في مكان ما.

Qwen3.8-Flash-Next مقابل DeepSeek V4 Flash مقابل Claude Opus 4.6

DimensionQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
WeightsOpen-weightOpen-weightClosed
Reported parameter profile125B main + 51B N-gram; 6B active284B total; 13B activeNot publicly disclosed
Primary efficiency storyQSA + GDN + 6B active MoE + lookup memoryHigh-throughput sparse MoEManaged frontier reasoning and agent stack
Native multimodalityText, image, video -> textText-oriented Flash family; vision route available separately on CometAPIText + vision/files through hosted APIs
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

يظل DeepSeek V4 Flash أقوى في NL2Repo-Bench في مقارنة Qwen، وهذا مهم لتوليد الشيفرة على مستوى المستودعات. يمثل Claude Opus 4.6 نموذجًا مُدارًا مغلقًا وليس هدف نشر مفتوحًا. يتميز Qwen3.8-Flash-Next بدرجة أكبر من خلال مزيج الأوزان المفتوحة وتعدد الوسائط الأصلي والهندسة للسياقات الطويلة وميزانية معاملات نشطة صغيرة جدًا.

Qwen3.8-Flash-Next مقابل Qwen3.8-Max

DimensionQwen3.8-Flash-NextQwen3.8-Max
Roleمعاينة معمارية تركّز على الكفاءةالرائد في Qwen3.8
Main/total scale125B main + 51B N-gram; 6B active2.4T total; about 95B active on CometAPI model page
Architecture emphasisQSA, GDN, Gated Residual, N-gram Embedding, Muonأقصى قدرات حدودية على مقياس أكبر بكثير
Best fitوكلاء كثيفو الحجم، مساعدين للترميز، أتمتة متعددة الوسائط، استضافة ذاتيةأقسى مهام الاستدلال، وكلاء المؤسسات الكبار، أعباء عمل تركز على القدرة
Context262K أصلي؛ حتى 1M مع YaRNسياق فئة 1M مُستضاف على مسارات Qwen3.8 الرائدة الحالية

تستند مواصفات Qwen3.8-Max إلى إدراج نموذج CometAPI الحالي.

التمييز بسيط: Qwen3.8-Max هو الرائد الذي يعطي الأولوية للقدرات، بينما Qwen3.8-Flash-Next هو تجربة معمارية وكفاءة. يجب على المطورين الذين يختارون بينهما أن يسألوا ما إذا كان عنق الزجاجة هو قدرة النموذج المطلقة أم تكلفة تشغيل العديد من المهام طويلة السياق واستخدام الأدوات على نطاق واسع.

تسعير وتوافر Qwen3.8-Flash-Next

الأوزان المفتوحة لـ Qwen3.8-Flash-Next منشورة عبر Hugging Face وModelScope. بالنسبة للخدمة المُدارة، تشير Qwen إلى أن النسخة الإنتاجية تُسمّى Qwen3.8-Flash على QwenCloud، مع سياق 1M مفعّلًا افتراضيًا وأدوات مدمجة رسمية.

تذكر Qwen أن السعر المُدار للإنتاج هو 0.16$ لكل مليون رموز إدخال و0.47$ لكل مليون رموز إخراج. يشير هذا السعر إلى نموذج الإنتاج Qwen3.8-Flash على QwenCloud، وليس إلى الاستضافة الذاتية للأوزان المفتوحة.

RouteInputOutput
QwenCloud production model (Qwen3.8-Flash)$0.16 / 1M tokens$0.47 / 1M tokens
Open-weight self-hostingInfrastructure-dependentInfrastructure-dependent
CometAPI routeCheck live model pageCheck live model page

أسعار QwenCloud مأخوذة من مقال الإطلاق الرسمي من Qwen؛ يجب التحقق من فواتير CometAPI على صفحة النموذج الحية.

توصية CometAPI

من المتوقع أن يصبح Qwen3.8-Flash-Next متاحًا عبر CometAPI قريبًا. توفّر CometAPI نقطة نهاية واحدة متوافقة مع OpenAI (https://api.cometapi.com/v1) تُجمِّع أكثر من 500 نموذج من مزودين رائدين، بما في ذلك سلسلة نماذج Qwen. يقلل هذا النهج الارتباط بمزوّد واحد، ويبسّط التجريب مع Qwen3.8-Flash (بمجرد توفره عبر المنصة أو نقاط Qwen ذات الصلة)، ويُسهل عمليات النشر الإنتاجية التي قد تمزج نماذج لمهام مختلفة (مثل Qwen لوكلاء ترميز فعّالي التكلفة + نموذج آخر لاستدلال متخصص). تتوفر الوثائق وأدلة البدء السريع على apidoc.cometapi.com والموقع الرئيسي لـ CometAPI.

سواء استضفت الأوزان المفتوحة ذاتيًا، أو استخدمت QwenCloud، أو مررت عبر منصة موحّدة مثل CometAPI، يُخفض Qwen3.8-Flash-Next الحاجز أمام وكلاء متعدد الوسائط طويل السياق عالي الأداء.

ما الذي يمكن لـ Qwen3.8-Flash-Next فعله؟

1. وكلاء ترميز كثيفو الحجم

ميزانية معاملات نشطة بحجم 6 مليارات مجتمعة مع درجة 62.5 في SWE-bench Pro وفق تقييم Qwen تجعل Qwen3.8-Flash-Next مثيرًا للاهتمام بشكل خاص لأنظمة الترميز التي تُشغّل العديد من الجلسات المتوازية. تشمل الأمثلة مراجعة الشيفرة، وفرز المشكلات، والتنقل في المستودعات، وتوليد الاختبارات، والترقيع التكراري حيث يكون مُعدّل الإنتاجية مهمًا تقريبًا بقدر الذكاء في التشغيل الفردي.

2. أعمال مكتبية ومعرفة طويلة الأفق

يُعد CoWorkBench وJobBench محوريين في تموضع النموذج. صُمّمت المعمارية لحلقات وكيل تقرأ السياق مرارًا، وتستدعي أدوات، وتحدّث الحالة، وتواصل العمل بدلًا من الإجابة مرة واحدة. يتوافق ذلك بشكل طبيعي مع سير عمل المستندات، وتحليل الجداول، وتركيب التقارير، وتوليف الأبحاث، وأتمتة العمليات التجارية.

3. وكلاء حوسبة وجوال متعدد الوسائط

تجعل مدخلات الصور والفيديو، وأداء AndroidWorld، وتقييم OSWorld، ونتائج Vision2Web النموذج ذا صلة بوكلاء واجهة المستخدم. يمكن أن يعمل كطبقة الاستدلال خلف أنظمة تفسّر لقطات الشاشة، وتُشغّل واجهات الهاتف المحمول، وتعيد إنشاء تخطيطات التطبيقات، أو تجمع الحالة البصرية مع استدعاءات الأدوات.

4. فيديو طويل واستدلال بصري

تتضمن بطاقة النموذج الرسمية أمثلة إدخال فيديو صريحة وإرشادات لمعالجة فيديو على مستوى الساعات. يجعل ذلك النموذج مفيدًا لإجابة الأسئلة على الفيديو، والبحث في الفيديو الطويل، واستخراج الأحداث المرئية، وسير العمل التي تجمع فهم الفيديو مع أدوات لاحقة.

5. أبحاث وسير عمل مستودعات بمليون رمز

النموذج المفتوح أصلي عند 262,144 رمزًا وقابل للتمديد إلى 1,000,000 باستخدام YaRN. هذا التمييز مهم: 1M امتداد وليس السياق الأصلي للنموذج المفتوح. بالنسبة للمستودعات الكبيرة أو مجموعات الأبحاث، يُقصد بـ QSA جعل تكلفة الاسترجاع لتلك السياقات الطويلة أكثر عملية من الانتباه العالمي الكثيف.

كيف يمكن للمطورين تشغيل Qwen3.8-Flash-Next؟

يمكن للمطورين تنزيل الأوزان المفتوحة من Hugging Face وتشغيل النموذج باستخدام Transformers أو vLLM أو SGLang أو TokenSpeed. توفّر Qwen أمثلة لإكمالات محادثة متوافقة مع OpenAI لكلٍ من الإدخال النصي والمتعدد الوسائط.

على سبيل المثال، تُظهر بطاقة النموذج الرسمية تقديم Qwen/Qwen3.8-Flash-Next باستخدام vLLM واستدعاءه عبر /v1/chat/completions. تُعرض أيضًا مدخلات الصور والفيديو عبر الواجهة المتوافقة مع OpenAI.

يعمل Qwen3.8-Flash-Next في وضع التفكير افتراضيًا. يمكن للمطورين التحكم في سلوك التفكير عبر enable_thinking وpreserve_thinking وreasoning_effort؛ مستويات الجهد الموثّقة هي xhigh وmedium وlow.

ما هي قيود Qwen3.8-Flash-Next؟

أكبر قيد عملي هو تكلفة العتاد. على الرغم من تنشيط 6 مليارات معلمة فقط من معلمات نموذج اللغة، يحتوي ملف نقطة التحقق على 125 مليار معلمة لغة بالإضافة إلى مكوّن تضمين n-gram بحجم 51 مليار ومعاملات MTP بحجم 4 مليارات. يبلغ حجم المستودع الحالي حوالي 360 جيجابايت، لذا يظل النشر المحلي مهمة ثقيلة من حيث البنية التحتية.

القيد الثاني هو أن 262K هو طول السياق الأصلي، وليس 1M. يمكن تمديد النموذج إلى 1M رموز، لكن لا ينبغي لصفحة CometAPI أو نموذج أن تُدرج ببساطة "1M سياق أصلي". الصياغة الصحيحة هي سياق أصلي 262K، قابل للتمديد إلى 1M.

أخيرًا، أداء المعايير غير متساوٍ. يعد Qwen3.8-Flash-Next تنافسيًا للغاية في مهام الترميز والوكلاء لكنه لا يتصدر كل معيار. على سبيل المثال، يُسجل Claude Opus 4.6 قيمة 40.0 على HLE مقابل 35.9 لـ Flash-Next، بينما يتصدر DeepSeek-V4-Flash-0731 النماذج المذكورة في NL2Repo-Bench.

Qwen3.8-Flash-Next: ما الذي يُشير إليه بالنسبة لـ Qwen4

تكمن الأهمية الأوسع لهذا الإصدار في دوره كمعاينة مبكرة للمعمارية المتوقع أن تدعم Qwen4. يجمع Qwen3.8-Flash-Next بين Qwen Sparse Attention وGated DeltaNet واتصالات Gated Residual بأربعة فروع وتضمين N-gram ومجمّع خبراء MoE شديد التبعثر وتنبؤ متعدد الرموز. تُظهر هذه الاختيارات كيف تستكشف Qwen سعة أعلى وسياقًا أطول وأداءً أقوى متعدد الوسائط والوكلاء دون زيادة الحوسبة النشطة بنفس المعدل.

الحُكم النهائي

Qwen3.8-Flash-Next مهم لأنه يغيّر شكل مسألة الكفاءة. بدلًا من التعامل مع جميع المعاملات على أنها متكافئة، يجمع بين مسار MoE نشط صغير نسبيًا وذاكرة بأسلوب البحث كبيرة جدًا وآلية استرجاع متناثرة مصممة للسياق الطويل. يمنح ذلك Qwen عدة روافع مستقلة لزيادة السعة دون زيادة حسابات المصفوفات لكل رمز بنفس المعدل.

بالنسبة للمطورين، يجعل ذلك النموذج خيارًا جذابًا لمساعدي الترميز كثيفي الحجم، ووكلاء طويلَي السياق، والأتمتة متعددة الوسائط، والتجارب المُستضافة ذاتيًا. بالنسبة لخارطة طريق Qwen الأوسع، فهو أكثر أهمية: تستخدم Qwen هذا الإصدار صراحةً للكشف عن الاتجاه المعماري الذي تخطط لصقله نحو Qwen4.

تابع التعلّم

اربط هذه المقالة بالقرار التالي.

عرض جميع الموضوعات
نُشر في Aug 28, 2026
آخر تحديث Aug 29, 2026
3 مشاهدات
تمت المراجعة للوضوح ودقة المصدر ومصطلحات API الحالية.

هل أنت مستعد لخفض تكاليف تطوير الذكاء الاصطناعي بنسبة 20%؟

ابدأ مجاناً في دقائق. رصيد تجريبي مجاني مدرج. لا حاجة لبطاقة ائتمانية.

اقرأ المزيد