الخلاصة
يجمع نموذج Xiaomi القياسي V2.5 بين فهم أصيل للنصوص والصور والفيديو والصوت مع نافذة سياق بطول 1M من الرموز، واستخدام الأدوات، وكفاءة Mixture-of-Experts المتناثرة. وهو الأنسب عندما تكون المدخلات متعددة الوسائط وتكلفة إنجاز كل مهمة مهمة. أما إصدار Pro فهو أكبر وأقوى في مهام الترميز الصعبة وعمل الوكلاء على مدى طويل، لكنه يركز على الإدخال النصي وتكلفته تعادل نحو ثلاثة أضعاف لكل رمز وفق أسعار Xiaomi المنشورة.
القرار العملي بسيط: اختر النموذج القياسي للوكلاء متعدد الوسائط، وتحليل المستندات والوسائط، والأتمتة على نطاق واسع؛ واختر Pro عندما تكون هندسة البرمجيات الصعبة أو التنفيذ الذاتي المستمر هي عنق الزجاجة.
أهم النقاط
- يستخدم النموذج القياسي 310B من المعاملات الإجمالية مع تفعيل 15B لكل رمز.
- يقبل النصوص والصور والفيديو والصوت، ثم يعيد نصاً.
- يدعم API سياق 1M، وإخراجاً يصل إلى 128K، واستدعاءات الأدوات، والبحث على الويب، والبث، والمخرجات المهيكلة، والتخزين المؤقت للسياق.
- النتائج المعلنة من الناشر تشمل 65.8 على Terminal-Bench 2.0 و56.1 على SWE-Bench Pro.
- بطاقة نموذج Xiaomi الحالية MiMo-V2.5-Pro تسجل 1.02T إجمالي و42B معاملات مفعّلة. درجات SWE-Bench Pro المدرجة من الناشر هي 56.1 لـ MiMo-V2.5 و57.2 لـ Pro؛ هذه مقارنات قديمة مُعلنة من الناشر، وليست ضماناً لسير عمل ترميز محدد.
- وفق الأسعار الحالية لدى Xiaomi، تكاليف الإدخال/الإخراج القياسي هي $0.14/$0.28 لكل مليون رمز؛ وتكلفة Pro هي $0.435/$0.87.
- كلا واجهتي API في CometAPI مسعّرتان أقل بنسبة 20% من أزواج الأسعار الرسمية غير المخبأة.
تم التحقق من المعلومات: September 28, 2026. يمكن أن تتغير الأسعار والمعايير والحدود والتوفر وصيغ الطلب. أعلنت Xiaomi أن أسماء نماذج API الرسمية mimo-v2.5 و mimo-v2.5-pro سيتم إهمالها عند الساعة 10:00 بتوقيت بكين في October 21, 2026، دون استبدال تلقائي. خطط للهجرة وتحقق من المسار الفعّال قبل النشر.
ملاحظة دورة حياة API: تخطط منصة Xiaomi الرسمية لإيقاف كلا معرفي نماذج V2.5 في October 21, 2026. هذه الإشعار يتعلق بمنصة API الخاصة بـ Xiaomi؛ تحقق من أي بوابة طرف ثالث بشكل منفصل. إشعار إهمال نموذج Xiaomi
ما هو النموذج القياسي
MiMo-V2.5 هو نموذج الأساس الموجه للكفاءة من Xiaomi MiMo لإدراك متعدد الوسائط والعمل الوكيلي. يوفر إدخالاً أصيلاً للنص والصورة والفيديو والصوت ضمن بنية واحدة وينتج مخرجات نصية.
يؤرخ سجل إصدارات النموذج لدى Xiaomi بتاريخ April 23, 2026 لبداية النسخة التجريبية العامة لسلسلة MiMo-V2.5. ثم تم إصدار الأوزان لاحقاً تحت ترخيص MIT. يحتوي MiMo-V2.5 على 310B معاملات إجمالية، لكنه يفعّل حوالي 15B لكل رمز؛ إذ يستخدم مجموعة كبيرة من الخبراء دون تشغيلهم جميعاً في كل مرة.
MiMo-V2.5-Pro يستهدف عبئ عمل مختلفاً. إنه نموذج بواحد تريليون من المعاملات، بإدخال نصي، مصمم لأصعب مهام الترميز، والطرفية، ووكلاء المهام طويلة الأمد. يتشارك الإصداران سقف سياق 1M لكنهـما يختلفان بشكل واضح في الوسائط، والحوسبة الفعّالة، والسعر.
مواصفات وميزات MiMo-V2.5
| تفاصيل البنية الرسمية | القيمة | سبب الأهمية |
|---|---|---|
| البنية | MoE متفرق | سعة خبراء كبيرة مع تفعيل انتقائي |
| إجمالي/مفعّل المعاملات | 310B / 15B | الحوسبة الفعليّة أقل بكثير من السعة الإجمالية |
| طبقات المحول | 48: طبقة كثيفة 1 + 47 MoE | معظم الطبقات تستخدم خبراء موجهين |
| الخبراء الموجهون | 256؛ 8 مفعّلون لكل رمز | تخصص دون تنفيذ كثيف لـ 310B |
| الانتباه | 39 SWA + 9 طبقات عالمية | يوازن بين الكفاءة المحلية والتدفق بعيد المدى |
| نافذة SWA | 128 رمزاً | يقلل ضغط ذاكرة التخزين المؤقت للسياق الطويل |
| السياق/الإخراج الأقصى | 1M / 128K رمز | يدعم المستندات الطويلة وآثار التنفيذ الممتدة |
| الإدخال/الإخراج | نص، صورة، فيديو، صوت / نص | إدراك أصيل عبر أربعة أنواع إدخال |
| مشفر الرؤية | 729M ViT؛ 28 طبقة | فهم الصور والفيديو |
| مشفر الصوت | 261M محول؛ 24 طبقة | فهم الصوت الأصيل |
| تنبؤ متعدد الرموز | 3 وحدات؛ حوالي 329M معاملات | يدعم كفاءة فك التشفير التخَمُّني |
| حجم التدريب | حوالي 48T رموز | خط أنابيب تدريب نصي ومتعدد الوسائط واسع |
| قدرات API | أدوات، ويب، بث، مخرجات مهيكلة، تخزين مؤقت للسياق | بدائيات وكلاء موجهة للإنتاج |
| الترخيص | MIT | يُسمح بالاستخدام التجاري والتعديل |
يغطي نطاق التشغيل سياق 1M وإخراج 128K، إضافة إلى حدود منشورة تبلغ 100 طلب في الدقيقة و10 ملايين رمز في الدقيقة. قد تختلف حدود مستوى المزود حسب الحساب ومسار التكامل.
مخطط البنية الرسمي لـ Xiaomi MiMo. أصل المخطط الرسمي.
كيف تعمل بنية MiMo-V2.5
خبراء متناثرون: السعة الإجمالية ليست الحوسبة الفعلية
حقيقة الكفاءة المركزية هي تصميم 310B إجمالي، 15B مفعّل. يختار الموجِّه ثمانية من 256 خبيراً لكل رمز. هذا يمنح النموذج وصولاً إلى مجموعة معاملات أكبر بكثير من نموذج كثيف 15B تقليدي دون تنفيذ جميع 310B في كل مرة.
هذا لا يجعل الاستضافة الذاتية أمراً تافهاً. فلا بد من تخزين الأوزان الكاملة وتوزيعها، لذا تبقى سعة الذاكرة، وعرض نطاق الربط البيني، وتوجيه الخبراء، وبرمجيات الخدمة قيوداً مادية.
انتباه هجين للسياق الطويل
يتناوب العمود الفقري بين الانتباه بنوافذ منزلقة والانتباه العالمي بنسبة 5:1 لصالح SWA. تتحكم تسعٌ وثلاثون طبقة محلية في نمو ذاكرة التخزين المؤقت، بينما تحافظ تسع طبقات عالمية على تدفق المعلومات لمسافات طويلة. تُبلغ Xiaomi عن تقليل يقارب ستة أضعاف في مخزن مفاتيح القيم (KV-cache) مقارنة بتصميم عالمي بالكامل.
الحد الأقصى 1M رمز هو سعة، لا دقة مضمونة. لا تزال جودة الاسترجاع، والزمنية، ونمو حالة الأدوات، والانتباه للأدلة البعيدة تتطلب تقييماً خاصاً بالعبء.
مشفرات أصيلة وميزات وكيلة
يتعامل محول رؤية بسعة 729M مع مدخلات الصور والفيديو؛ ويتعامل محول صوت بسعة 261M مع الصوت. تقوم المُسقِّطات بمواءمة كلا التيارين إلى العمود الفقري اللغوي، ما يتيح لوكيـل واحد الجمع بين لقطة شاشة، ومقطع فيديو، ومسار صوتي، وتعليمات نصية، ونتائج أدوات.
تدعم ثلاثة وحدات للتنبؤ متعدد الرموز كفاءة فك التشفير التخمني والتعلم المعزز. تم تدريب النموذج على حوالي 48T رموز، مع توسيع السياق تدريجياً إلى 1M أثناء ما بعد التدريب.
تستخدم الأوزان المفتوحة ترخيص MIT. يُسمح بالنشر التجاري، لكن تكلفة البنية التحتية والاعتمادات الخارجية تحتاج لمراجعة منفصلة.
معايير MiMo-V2.5: الترميز والوكلاء ونتائج متعددة الوسائط
ملاحظة المعايير:
الأرقام أدناه مُعلنة من الناشر. إنها دليل اتجاهي، لا ضماناً لمستودع محدد، أو تنسيق وسائط، أو مجموعة أدوات، أو هدف زمنية، أو سياسة أمان معينة.
نتائج الترميز والوكلاء

مخطط معايير الترميز والوكلاء الرسمي لـ Xiaomi MiMo.
| معيار الترميز الرسمي | الدرجة المعلنة | إشارة القرار |
|---|---|---|
| MiMo Coding Bench | 71.8 | قدرة واسعة لوكلاء الترميز |
| Claw-Eval Text | 62.3 | إتمام عام للوكلاء النصيين |
| Terminal-Bench 2.0 | 65.8 | تنفيذ تفاعلي عبر الطرفية |
| SWE-Bench Pro | 56.1 | هندسة برمجيات واقعية |
| Claw-Eval Multi-Turn | 63.2 | عمل وكيل متعدد الخطوات أطول |
| ResearchClawBench | 16.91 | سير عمل بحثي ذاتي |
النتيجة: أقوى حالة هي الاستخدام العملي للأدوات بدلاً من إكمال الشيفرة المعزول. تدعم نتيجة 65.8 على Terminal-Bench وكلاء موجَّهين للطرفية، بينما تشير 56.1 على SWE-Bench Pro إلى قدرة مفيدة على مستوى المستودع. الدرجة البحثية المنخفضة بكثير تذكير بضرورة اختبار جمع الأدلة وسلوك الاستشهاد بشكل منفصل.
نتائج متعددة الوسائط

مخطط المعايير الرسمي لـ Xiaomi MiMo للصور والفيديو والوكلاء متعدد الوسائط.
| معيار متعدد الوسائط الرسمي | الدرجة المعلنة | القدرة المختبرة |
|---|---|---|
| CharXiv RQ | 81.0 | الاستدلال على المخططات والمستندات |
| MMMU-Pro | 77.9 | استدلال متعدد الوسائط بمستوى خبير |
| HR-Bench 4K | 88.5 | فهم صور عالية الدقة |
| OmniDocBench | 87.2 | فهم المستندات |
| Claw-Eval Multimodal | 23.8 | إتمام وكيل متعدد الوسائط |
| Video-MME | 87.7 | فهم الفيديو |
| DailyOmni | 83.5 | استدلال سمعي بصري يومي |
| VideoHolmes | 64.0 | استدلال زمني للفيديو |
النتيجة: تعد المستندات والصور عالية الدقة وفهم الفيديو أبرز نقاط القوة. نتيجة 23.8 في الوكلاء متعدد الوسائط أقل بكثير من درجات الإدراك، لذا ينبغي تقييم نظام يحتاج إلى فهم الوسائط وتشغيل الأدوات بشكل موثوق من طرف إلى طرف.
MiMo-V2.5 مقابل MiMo-V2.5-Pro: مقارنة متعددة الأبعاد
| مقارنة البنية الرسمية | MiMo-V2.5 | MiMo-V2.5-Pro المواصفات الرسمية لإصدار Pro المعايير الرسمية لإصدار Pro | الأثر العملي |
|---|---|---|---|
| إجمالي المعاملات | 310B | 1.02T | يمتلك Pro أكثر من 3× من السعة الإجمالية |
| المعاملات المفعّلة | 15B | 42B | يستخدم Pro حوالي 2.8× معاملات مفعّلة أكثر |
| الطبقات/الخبراء الموجهون | 48 / 256 | 70 / 384 | Pro هدف خدمة أكبر |
| سقف سياق بطاقة النموذج | 1M | 1M | كلاهما يُدرج حتى 1M رموز؛ اختبر الاسترجاع والزمنية عند حجم عبء العمل لديك |
| أقصى إخراج رسمي لـ API | 128K | 128K | كلا صفحتي API الحاليتين لدى Xiaomi تدرجان 128K؛ قد تختلف الحدود الخاصة بالمزود |
| الإدخال الأصيل | نص، صورة، فيديو، صوت | نص | MiMo-V2.5 هو الخيار متعدد الوسائط الموثق؛ تحقق من نقطة نهاية Pro الدقيقة قبل إرسال الوسائط |
| SWE-Bench Pro | 56.1 | 57.2 | يتقدم Pro بـ 1.1 نقطة |
| Terminal-Bench 2.0 | 65.8 | 68.4 | يتقدم Pro بـ 2.6 نقطة |
| الملاءمة الأساسية | وكلاء متعدد الوسائط بكفاءة | ترميز معقد ووكلاء أمد طويل | اختر حسب عبء العمل المُختَبَر؛ هوامش مستوى النموذج لا تثبت تفوقاً عاماً |
النتيجة المقارنة: تفوق Pro في المعايير المشتركة للترميز والوكلاء متواضع، بينما يضيف الإصدار القياسي إدخالاً أصيلاً للصور والفيديو والصوت ويستخدم معاملات مفعّلة أقل بكثير. يُبرَّر Pro عندما تكون المكاسب الصغيرة في إتمام المهام الصعبة أكثر قيمة من الإدخال متعدد الوسائط وانخفاض سعر الوحدة.
كم تكلفة MiMo-V2.5 وMiMo-V2.5-Pro؟
| أساس السعر: May 27, 2026 | API القياسي الرسمي | API Pro الرسمي | MiMo-V2.5 API في CometAPI | MiMo-V2.5-Pro API في CometAPI |
|---|---|---|---|---|
| الإدخال، إخفاق التخزين/MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| الإخراج/MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| الإدخال، نجاح التخزين/MTok | $0.0028 | $0.0036 | تحقق من الفوترة الحالية | تحقق من الفوترة الحالية |
| الخصم مقابل السعر الرسمي غير المخزن | خط الأساس | خط الأساس | 20% | 20% |
بالأسعار الرسمية، يكلف Pro حوالي 3.1× قدر الإصدار القياسي لكل من الإدخال والإخراج غير المخزَّنين. تُخفض الأسعار المعروضة لدى المزود أعلاه كل زوج غير مخزَّن بنسبة 20%، لكن الفجوة النسبية بين الإصدارين تبقى عملياً دون تغيير.
سعر الرمز ليس التكلفة الإجمالية. محاولات الأدوات، حجم السياق، طول الإخراج، الزمنية، تعافي المهام الفاشلة، والمراجعة البشرية تحدد تكلفة المهمة المكتملة. شغّل عينة ممثلة من عبء العمل قبل اختيار نموذج إنتاج افتراضي.
ما الذي يجيده MiMo-V2.5؟
- وكلاء متعدد الوسائط: اجمع لقطات الشاشة، والمستندات، والفيديو، والصوت، والتعليمات، والأدوات في سير عمل واحد.
- تحليل مستندات طويلة: معالجة المستودعات، والعقود، وأرشيفات الأبحاث، والسجلات، وتواريخ الدعم.
- فهم الوسائط: تلخيص الفيديوهات، استخراج الأحداث، تفسير المخططات، والإجابة عن أسئلة سمعية بصرية.
- وكلاء الترميز والطرفية: فحص الملفات، تشغيل الأوامر، تعديل الشيفرة، والتكرار على نتائج الاختبارات.
- أتمتة عالية الحجم: استخدم التفعيل المتناثر وتسعير الرموز المنخفض للمهام الإنتاجية المتكررة.
القيود والمخاطر
- يتم تفعيل 15B معاملات فقط لكل رمز، لكن الاستضافة الذاتية لا تزال تتطلب نظام أوزان 310B الكامل.
- المخرجات متعددة الوسائط نصية؛ توليد الصور والصوت والفيديو يتطلب نماذج أخرى.
- سقف سياق 1M لا يضمن دقة استرجاع موحدة عبر النافذة كاملة.
- قد لا تنتقل معايير الناشر إلى الأدوات، أو المستودعات، أو المطالبات، أو قيود الأمان المخصصة.
- قد تختلف إتاحة الوسائط لدى المزود عن الإمكانات الكاملة للنموذج مفتوح الأوزان الأساسي.
بوابة الإنتاج:
تحقق من الدقة، وإتمام استدعاءات الأدوات، والزمنية، واستهلاك الرموز، والتعامل مع الوسائط، وسلوك التراجع على مهام ممثلة قبل تحويل الحركة.
مثال API
يعرض المثال التالي Python باستخدام نقطة نهاية CometAPI المتوافقة مع OpenAI ومعرف نموذج الإصدار القياسي. أكد نقطة النهاية الحالية ومخطط الطلب المدعوم قبل النشر.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
دليل القرار
| إشارة عبء العمل | ابدأ بـ | غيّر عندما |
|---|---|---|
| الصور أو الفيديو أو الصوت مدخلات من الدرجة الأولى | القياسي | لا تغيّر إلا إذا كان تمهيد الوسائط مقبولاً |
| حجم كبير من المستندات أو وسائط مختلطة | القياسي | Pro فقط إذا كانت إخفاقات الاستدلال تهيمن على التكلفة |
| هندسة مستودعات صعبة | اختبر كلاهما | اختر Pro إذا غطت مكاسب الإتمام تكلفة 3.1× لكل وحدة |
| مسارات طرفية ذاتية طويلة | Pro | عُد إلى القياسي إذا لم تكن المكاسب قابلة للقياس |
| أتمتة روتينية عالية الحجم | القياسي | صعّد فقط المهام الفاشلة أو عالية القيمة |
التوجيه الموصى به:
استخدم القياسي كافتراض للوكلاء متعدد الوسائط والعمل عالي الحجم، ثم وجّه فقط مهام الترميز النصية الصعبة أو المهام طويلة الأمد إلى Pro. هذا يحافظ على القدرات مع ضبط التكلفة الإجمالية.
الخلاصة
النموذج القياسي ليس مجرد إصدار أصغر من Pro. إنه نقطة تحسين مميزة: إدخال متعدد الوسائط أصيل، سياق 1M، معايير قوية موجهة للأدوات، و15B معاملات مفعّلة بسعر رموز أقل بكثير.
Pro هو خيار متخصص لهندسة البرمجيات الصعبة والتنفيذ الذاتي المستمر. تمنح سعته الإضافية مكاسب قابلة للقياس لكنها ليست شاملة، لذا أقوى نمط نشر هو التوجيه القائم على عبء العمل بدلاً من اختيار إصدار واحد لكل طلب.
الأسئلة الشائعة
هل النموذج القياسي مفتوح المصدر؟
تم إصدار أوزانه بموجب ترخيص MIT، ما يتيح الاستخدام التجاري، والتعديل، وضبط الدقة، وإعادة التوزيع وفق شروط الترخيص.
كم عدد المعاملات التي يستخدمها؟
يحتوي MoE المتناثر على 310B معاملات إجمالية ويفعّل 15B لكل رمز. تصف المعاملات المفعّلة الحوسبة لكل رمز، لا حجم تخزين النموذج الكامل.
هل يدعم الصور والفيديو والصوت؟
نعم. يقبل الإصدار القياسي إدخال النص والصورة والفيديو والصوت ويعيد نصاً. تسرد مواصفات إصدار Pro الرسمية الإدخال النصي.
ما أقصى نافذة سياق؟
تحدد كلا بطاقتي النموذج نافذة سياق تصل إلى 1M رموز. تسرد صفحات API الحالية لدى Xiaomi إخراجاً أقصاه 128K لكل من MiMo-V2.5 وMiMo-V2.5-Pro. يمكن أن تختلف الحدود القابلة للاستخدام تبعاً لنقطة النهاية، والمزود، والحساب، وصيغة الطلب؛ تحقق من المسار المنشور قبل الاعتماد على تلك الحدود.
تؤكد صفحة API الرسمية الحالية لإصدار Pro بشكل منفصل سياق 1M وإخراجاً أقصاه 128K: MiMo-V2.5-Pro API specifications
أي إصدار أفضل لوكلاء الترميز؟
يُبلغ Pro عن نتائج أعلى على معايير الترميز والطرفية المشتركة، لكن الهامش متواضع. اختبر كليهما على المستودع المستهدف واختر بناءً على إتمام المهام، والزمنية، والتكلفة الإجمالية.
أي إصدار أفضل للوكلاء متعدد الوسائط؟
الإصدار القياسي هو الخيار الطبيعي لأنه يقبل إدخال الصور والفيديو والصوت أصيلاً. Pro يركز على الإدخال النصي.
كيف ينبغي أن يختار فريق إنتاج؟
ابدأ بالقياسي، قِس الإخفاقات، ووجّه فقط المهام النصية الصعبة التي تستفيد من Pro. قارن تكلفة المهمة المكتملة بدلاً من السعر لكل رمز فقط.
