المواصفات التقنية لـ Qwen3.7-Plus
| البند | المواصفة |
|---|---|
| Model Name | Qwen3.7-Plus |
| Provider | Alibaba Cloud (Qwen Team) |
| API Model ID | qwen3.7-plus |
| Model Type | نموذج وكيل متعدد الوسائط |
| Input Types | نص، صور، فيديو |
| Output Types | نص |
| Context Window | حتى 1,000,000 رمز |
| Maximum Input Tokens | ~991.8K |
| Maximum Output Tokens | ~65.5K |
| Core Strengths | استدلال رؤية-لغة، البرمجة، التفاعل مع واجهة المستخدم الرسومية، سير عمل الوكلاء |
| Built-in Features | استدعاء الدوال، مخرجات مُنظَّمة، ذاكرة تخزين مؤقت، بحث الويب، Batch API |
| API Compatibility | متوافق مع OpenAI عبر DashScope / Model Studio |
ما هو Qwen3.7-Plus؟
يعد Qwen3.7-Plus الرائد المتوازن متعدد الوسائط ضمن جيل Qwen 3.7 من Alibaba. بينما يركّز Qwen3.7-Max على الاستدلال النصي الخالص والبرمجة بعيدة المدى، يوسّع Qwen3.7-Plus تلك القدرات بفهم أصيل للصور والفيديو، ما يتيح له الاستدلال عبر المعلومات المرئية والنصية ضمن نموذج واحد.
تم تصميم النموذج حول فكرة وكيل تفاعلي هجين متعدد الوسائط: يمكنه تفسير لقطات الشاشة، وتحليل المخططات، وفهم الواجهات، وتوليد الشفرة من مراجع مرئية، واستخدام الأدوات لإتمام مهام متعددة الخطوات. وهذا يجعله جذّابًا بشكل خاص لوكلاء الذكاء الاصطناعي، وأتمتة واجهات المستخدم الرسومية، وسير عمل الإنتاجية حيث يكون للسياق المرئي أهمية.
الميزات الرئيسية لـ Qwen3.7-Plus
- إدخال متعدد الوسائط أصيل يدعم النصوص، والصور، والفيديو ضمن خط استدلال موحّد.
- نافذة سياق حتى 1M رمز، ما يتيح تحليل قواعد شفرة كبيرة وسير عمل للوثائق الطويلة.
- قدرات وكيل هجينة GUI + CLI، تتيح للنموذج فهم الشاشات والتفاعل مع بيئات البرمجيات.
- قدرات متقدمة في البرمجة واستخدام الأدوات، بما في ذلك استدعاء الدوال، والمخرجات المُنظَّمة، والتكامل مع أدوات خارجية.
- فهم بصري للمخططات والوثائق ولقطات الشاشة، ما يجعله مفيدًا لمهام الأعمال والهندسة وواجهات المستخدم.
- نقطة نهاية API متوافقة مع OpenAI، ما يسهّل نسبيًا الانتقال من البنية التحتية الحالية لـ LLM.
أداء Qwen3.7-Plus على المعايير القياسية
وفقًا لتقارير المعايير العلنية ومنصات التقييم التابعة لطرف ثالث، يقدّم Qwen3.7-Plus أداءً في طليعة المجال في القدرات متعددة الوسائط والوكلائية:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: تقريبًا 90.0%.
- IFBench: تقريبًا 78.0%.
- AA Long Context Reasoning (AA-LCR): تقريبًا 65.0%.
- Terminal-Bench Hard: تقريبًا 47.0%، ما يعكس قدرات قوية في البرمجة الوكيلية.
تشير تقارير Alibaba أيضًا إلى أن Qwen3.7-Plus يقدّم أداءً تنافسيًا مع النماذج الاحتكارية الرائدة على معايير الوكلاء والبرمجة، مع قوة خاصة في المهام متعددة الوسائط والتفاعل مع واجهات المستخدم.
Qwen3.7-Plus مقابل Qwen3.7-Max مقابل Claude Opus 4.6
| الميزة | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| طرائق الإدخال | نص، صورة، فيديو | نص فقط | نص، صورة |
| نافذة السياق | حتى 1M رمز | 1M رمز | سياق كبير |
| الفهم البصري | ممتاز | غير مدعوم | قوي |
| تفاعل الوكيل / واجهة المستخدم الرسومية | تركيز أساسي | محدود | جيد |
| الاستدلال النصي بعيد المدى | قوي جدًا | الأفضل ضمن عائلة Qwen | ممتاز |
| أفضل حالات الاستخدام | وكلاء متعدد الوسائط والإنتاجية | البرمجة، الرياضيات، الاستدلال العميق | الاستدلال والبرمجة للمؤسسات |
بالنسبة للمشاريع التي تتضمن لقطات شاشة، أو أتمتة واجهة المستخدم، أو تصحيحًا بصريًا للأخطاء، أو سير عمل متعدد الوسائط، يكون Qwen3.7-Plus عمومًا الخيار الأفضل. أما في مهام الاستدلال المعتمدة على النص فقط أو البرمجة على نطاق المستودعات، فيظل Qwen3.7-Max الخيار الأقوى.
القيود
- يُطرح Qwen3.7-Plus حاليًا كنموذج احتكاري في مرحلة المعاينة، وقد تتطور بعض القدرات قبل الإصدار المستقر.
- ميزات استدعاء الدوال وبعض أدوات الوكلاء لا تزال قيد الطرح.
- بالنسبة للأعباء المعتمدة على النص فقط والمكثفة في الاستدلال، قد يقدّم Qwen3.7-Max أداءً أفضل قليلًا.
- كما هو الحال مع معظم النماذج الكبيرة متعددة الوسائط، ينبغي على المطورين التحقق من الأداء على مجموعات بيانات الصور وواجهات المستخدم الخاصة بهم قبل النشر في الإنتاج.
حالات استخدام تمثيلية
- وكلاء ذكاء اصطناعي يجمعون بين تفاعلات المتصفح وGUI والطرفية.
- تنقيح البرمجيات انطلاقًا من لقطات الشاشة ولقطات واجهة المستخدم.
- تحليل الوثائق والمخططات ولوحات البيانات.
- مساعدو برمجة بصريون يولّدون الشفرة من النماذج الأولية أو المخططات.
- سير عمل إنتاجية للمؤسسات يتضمن مدخلات نصية وصورية مختلطة.
- مساعدو بحث متعدد الوسائط يجمعون بين البحث على الويب والفهم البصري