GPT-6.1 Sol are now live on CometAPI →
ai-model/أبحاث CometAPI

ما هو MiMo-V2.5؟ المواصفات، معايير الأداء، الميزات، التسعير، والوصول إلى واجهة برمجة التطبيقات (API)

استكشف مواصفات Xiaomi MiMo-V2.5 وبنيته المعمارية، والاختبارات المعيارية الرسمية، والتسعير، والمقارنة مع MiMo-V2.5-Pro، وحالات الاستخدام، والقيود، وإمكانية الوصول إلى CometAPI.

CometAPI
Deon Goodwinفريق أبحاث نماذج AI وAPI
تم التحديث Oct 5, 2026 12 دقائق للقراءة
ما هو MiMo-V2.5؟ المواصفات، معايير الأداء، الميزات، التسعير، والوصول إلى واجهة برمجة التطبيقات (API)
استخدم هذا النمط

أجرِ أول استدعاء لـ API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

الخلاصة

يجمع نموذج Xiaomi القياسي V2.5 بين فهم أصيل للنصوص والصور والفيديو والصوت مع نافذة سياق بطول 1M من الرموز، واستخدام الأدوات، وكفاءة Mixture-of-Experts المتناثرة. وهو الأنسب عندما تكون المدخلات متعددة الوسائط وتكلفة إنجاز كل مهمة مهمة. أما إصدار Pro فهو أكبر وأقوى في مهام الترميز الصعبة وعمل الوكلاء على مدى طويل، لكنه يركز على الإدخال النصي وتكلفته تعادل نحو ثلاثة أضعاف لكل رمز وفق أسعار Xiaomi المنشورة.

القرار العملي بسيط: اختر النموذج القياسي للوكلاء متعدد الوسائط، وتحليل المستندات والوسائط، والأتمتة على نطاق واسع؛ واختر Pro عندما تكون هندسة البرمجيات الصعبة أو التنفيذ الذاتي المستمر هي عنق الزجاجة.

أهم النقاط

  • يستخدم النموذج القياسي 310B من المعاملات الإجمالية مع تفعيل 15B لكل رمز.
  • يقبل النصوص والصور والفيديو والصوت، ثم يعيد نصاً.
  • يدعم API سياق 1M، وإخراجاً يصل إلى 128K، واستدعاءات الأدوات، والبحث على الويب، والبث، والمخرجات المهيكلة، والتخزين المؤقت للسياق.
  • النتائج المعلنة من الناشر تشمل 65.8 على Terminal-Bench 2.0 و56.1 على SWE-Bench Pro.
  • بطاقة نموذج Xiaomi الحالية MiMo-V2.5-Pro تسجل 1.02T إجمالي و42B معاملات مفعّلة. درجات SWE-Bench Pro المدرجة من الناشر هي 56.1 لـ MiMo-V2.5 و57.2 لـ Pro؛ هذه مقارنات قديمة مُعلنة من الناشر، وليست ضماناً لسير عمل ترميز محدد.
  • وفق الأسعار الحالية لدى Xiaomi، تكاليف الإدخال/الإخراج القياسي هي $0.14/$0.28 لكل مليون رمز؛ وتكلفة Pro هي $0.435/$0.87.
  • كلا واجهتي API في CometAPI مسعّرتان أقل بنسبة 20% من أزواج الأسعار الرسمية غير المخبأة.
    تم التحقق من المعلومات: September 28, 2026. يمكن أن تتغير الأسعار والمعايير والحدود والتوفر وصيغ الطلب. أعلنت Xiaomi أن أسماء نماذج API الرسمية mimo-v2.5 و mimo-v2.5-pro سيتم إهمالها عند الساعة 10:00 بتوقيت بكين في October 21, 2026، دون استبدال تلقائي. خطط للهجرة وتحقق من المسار الفعّال قبل النشر.

ملاحظة دورة حياة API: تخطط منصة Xiaomi الرسمية لإيقاف كلا معرفي نماذج V2.5 في October 21, 2026. هذه الإشعار يتعلق بمنصة API الخاصة بـ Xiaomi؛ تحقق من أي بوابة طرف ثالث بشكل منفصل. إشعار إهمال نموذج Xiaomi

ما هو النموذج القياسي

MiMo-V2.5 هو نموذج الأساس الموجه للكفاءة من Xiaomi MiMo لإدراك متعدد الوسائط والعمل الوكيلي. يوفر إدخالاً أصيلاً للنص والصورة والفيديو والصوت ضمن بنية واحدة وينتج مخرجات نصية.

يؤرخ سجل إصدارات النموذج لدى Xiaomi بتاريخ April 23, 2026 لبداية النسخة التجريبية العامة لسلسلة MiMo-V2.5. ثم تم إصدار الأوزان لاحقاً تحت ترخيص MIT. يحتوي MiMo-V2.5 على 310B معاملات إجمالية، لكنه يفعّل حوالي 15B لكل رمز؛ إذ يستخدم مجموعة كبيرة من الخبراء دون تشغيلهم جميعاً في كل مرة.

MiMo-V2.5-Pro يستهدف عبئ عمل مختلفاً. إنه نموذج بواحد تريليون من المعاملات، بإدخال نصي، مصمم لأصعب مهام الترميز، والطرفية، ووكلاء المهام طويلة الأمد. يتشارك الإصداران سقف سياق 1M لكنهـما يختلفان بشكل واضح في الوسائط، والحوسبة الفعّالة، والسعر.

مواصفات وميزات MiMo-V2.5

تفاصيل البنية الرسميةالقيمةسبب الأهمية
البنيةMoE متفرقسعة خبراء كبيرة مع تفعيل انتقائي
إجمالي/مفعّل المعاملات310B / 15Bالحوسبة الفعليّة أقل بكثير من السعة الإجمالية
طبقات المحول48: طبقة كثيفة 1 + 47 MoEمعظم الطبقات تستخدم خبراء موجهين
الخبراء الموجهون256؛ 8 مفعّلون لكل رمزتخصص دون تنفيذ كثيف لـ 310B
الانتباه39 SWA + 9 طبقات عالميةيوازن بين الكفاءة المحلية والتدفق بعيد المدى
نافذة SWA128 رمزاًيقلل ضغط ذاكرة التخزين المؤقت للسياق الطويل
السياق/الإخراج الأقصى1M / 128K رمزيدعم المستندات الطويلة وآثار التنفيذ الممتدة
الإدخال/الإخراجنص، صورة، فيديو، صوت / نصإدراك أصيل عبر أربعة أنواع إدخال
مشفر الرؤية729M ViT؛ 28 طبقةفهم الصور والفيديو
مشفر الصوت261M محول؛ 24 طبقةفهم الصوت الأصيل
تنبؤ متعدد الرموز3 وحدات؛ حوالي 329M معاملاتيدعم كفاءة فك التشفير التخَمُّني
حجم التدريبحوالي 48T رموزخط أنابيب تدريب نصي ومتعدد الوسائط واسع
قدرات APIأدوات، ويب، بث، مخرجات مهيكلة، تخزين مؤقت للسياقبدائيات وكلاء موجهة للإنتاج
الترخيصMITيُسمح بالاستخدام التجاري والتعديل

يغطي نطاق التشغيل سياق 1M وإخراج 128K، إضافة إلى حدود منشورة تبلغ 100 طلب في الدقيقة و10 ملايين رمز في الدقيقة. قد تختلف حدود مستوى المزود حسب الحساب ومسار التكامل.

ما هو MiMo-V2.5؟ المواصفات، معايير الأداء، الميزات، التسعير، والوصول إلى واجهة برمجة التطبيقات (API)

مخطط البنية الرسمي لـ Xiaomi MiMo. أصل المخطط الرسمي.

كيف تعمل بنية MiMo-V2.5

خبراء متناثرون: السعة الإجمالية ليست الحوسبة الفعلية

حقيقة الكفاءة المركزية هي تصميم 310B إجمالي، 15B مفعّل. يختار الموجِّه ثمانية من 256 خبيراً لكل رمز. هذا يمنح النموذج وصولاً إلى مجموعة معاملات أكبر بكثير من نموذج كثيف 15B تقليدي دون تنفيذ جميع 310B في كل مرة.

هذا لا يجعل الاستضافة الذاتية أمراً تافهاً. فلا بد من تخزين الأوزان الكاملة وتوزيعها، لذا تبقى سعة الذاكرة، وعرض نطاق الربط البيني، وتوجيه الخبراء، وبرمجيات الخدمة قيوداً مادية.

انتباه هجين للسياق الطويل

يتناوب العمود الفقري بين الانتباه بنوافذ منزلقة والانتباه العالمي بنسبة 5:1 لصالح SWA. تتحكم تسعٌ وثلاثون طبقة محلية في نمو ذاكرة التخزين المؤقت، بينما تحافظ تسع طبقات عالمية على تدفق المعلومات لمسافات طويلة. تُبلغ Xiaomi عن تقليل يقارب ستة أضعاف في مخزن مفاتيح القيم (KV-cache) مقارنة بتصميم عالمي بالكامل.

الحد الأقصى 1M رمز هو سعة، لا دقة مضمونة. لا تزال جودة الاسترجاع، والزمنية، ونمو حالة الأدوات، والانتباه للأدلة البعيدة تتطلب تقييماً خاصاً بالعبء.

مشفرات أصيلة وميزات وكيلة

يتعامل محول رؤية بسعة 729M مع مدخلات الصور والفيديو؛ ويتعامل محول صوت بسعة 261M مع الصوت. تقوم المُسقِّطات بمواءمة كلا التيارين إلى العمود الفقري اللغوي، ما يتيح لوكيـل واحد الجمع بين لقطة شاشة، ومقطع فيديو، ومسار صوتي، وتعليمات نصية، ونتائج أدوات.

تدعم ثلاثة وحدات للتنبؤ متعدد الرموز كفاءة فك التشفير التخمني والتعلم المعزز. تم تدريب النموذج على حوالي 48T رموز، مع توسيع السياق تدريجياً إلى 1M أثناء ما بعد التدريب.

تستخدم الأوزان المفتوحة ترخيص MIT. يُسمح بالنشر التجاري، لكن تكلفة البنية التحتية والاعتمادات الخارجية تحتاج لمراجعة منفصلة.

معايير MiMo-V2.5: الترميز والوكلاء ونتائج متعددة الوسائط

ملاحظة المعايير:

الأرقام أدناه مُعلنة من الناشر. إنها دليل اتجاهي، لا ضماناً لمستودع محدد، أو تنسيق وسائط، أو مجموعة أدوات، أو هدف زمنية، أو سياسة أمان معينة.

نتائج الترميز والوكلاء

ما هو MiMo-V2.5؟ المواصفات، معايير الأداء، الميزات، التسعير، والوصول إلى واجهة برمجة التطبيقات (API)

مخطط معايير الترميز والوكلاء الرسمي لـ Xiaomi MiMo.

معيار الترميز الرسميالدرجة المعلنةإشارة القرار
MiMo Coding Bench71.8قدرة واسعة لوكلاء الترميز
Claw-Eval Text62.3إتمام عام للوكلاء النصيين
Terminal-Bench 2.065.8تنفيذ تفاعلي عبر الطرفية
SWE-Bench Pro56.1هندسة برمجيات واقعية
Claw-Eval Multi-Turn63.2عمل وكيل متعدد الخطوات أطول
ResearchClawBench16.91سير عمل بحثي ذاتي

النتيجة: أقوى حالة هي الاستخدام العملي للأدوات بدلاً من إكمال الشيفرة المعزول. تدعم نتيجة 65.8 على Terminal-Bench وكلاء موجَّهين للطرفية، بينما تشير 56.1 على SWE-Bench Pro إلى قدرة مفيدة على مستوى المستودع. الدرجة البحثية المنخفضة بكثير تذكير بضرورة اختبار جمع الأدلة وسلوك الاستشهاد بشكل منفصل.

نتائج متعددة الوسائط

ما هو MiMo-V2.5؟ المواصفات، معايير الأداء، الميزات، التسعير، والوصول إلى واجهة برمجة التطبيقات (API)

مخطط المعايير الرسمي لـ Xiaomi MiMo للصور والفيديو والوكلاء متعدد الوسائط.

معيار متعدد الوسائط الرسميالدرجة المعلنةالقدرة المختبرة
CharXiv RQ81.0الاستدلال على المخططات والمستندات
MMMU-Pro77.9استدلال متعدد الوسائط بمستوى خبير
HR-Bench 4K88.5فهم صور عالية الدقة
OmniDocBench87.2فهم المستندات
Claw-Eval Multimodal23.8إتمام وكيل متعدد الوسائط
Video-MME87.7فهم الفيديو
DailyOmni83.5استدلال سمعي بصري يومي
VideoHolmes64.0استدلال زمني للفيديو

النتيجة: تعد المستندات والصور عالية الدقة وفهم الفيديو أبرز نقاط القوة. نتيجة 23.8 في الوكلاء متعدد الوسائط أقل بكثير من درجات الإدراك، لذا ينبغي تقييم نظام يحتاج إلى فهم الوسائط وتشغيل الأدوات بشكل موثوق من طرف إلى طرف.

MiMo-V2.5 مقابل MiMo-V2.5-Pro: مقارنة متعددة الأبعاد

مقارنة البنية الرسميةMiMo-V2.5MiMo-V2.5-Pro
المواصفات الرسمية لإصدار Pro
المعايير الرسمية لإصدار Pro
الأثر العملي
إجمالي المعاملات310B1.02Tيمتلك Pro أكثر من 3× من السعة الإجمالية
المعاملات المفعّلة15B42Bيستخدم Pro حوالي 2.8× معاملات مفعّلة أكثر
الطبقات/الخبراء الموجهون48 / 25670 / 384Pro هدف خدمة أكبر
سقف سياق بطاقة النموذج1M1Mكلاهما يُدرج حتى 1M رموز؛ اختبر الاسترجاع والزمنية عند حجم عبء العمل لديك
أقصى إخراج رسمي لـ API128K128Kكلا صفحتي API الحاليتين لدى Xiaomi تدرجان 128K؛ قد تختلف الحدود الخاصة بالمزود
الإدخال الأصيلنص، صورة، فيديو، صوتنصMiMo-V2.5 هو الخيار متعدد الوسائط الموثق؛ تحقق من نقطة نهاية Pro الدقيقة قبل إرسال الوسائط
SWE-Bench Pro56.157.2يتقدم Pro بـ 1.1 نقطة
Terminal-Bench 2.065.868.4يتقدم Pro بـ 2.6 نقطة
الملاءمة الأساسيةوكلاء متعدد الوسائط بكفاءةترميز معقد ووكلاء أمد طويلاختر حسب عبء العمل المُختَبَر؛ هوامش مستوى النموذج لا تثبت تفوقاً عاماً

النتيجة المقارنة: تفوق Pro في المعايير المشتركة للترميز والوكلاء متواضع، بينما يضيف الإصدار القياسي إدخالاً أصيلاً للصور والفيديو والصوت ويستخدم معاملات مفعّلة أقل بكثير. يُبرَّر Pro عندما تكون المكاسب الصغيرة في إتمام المهام الصعبة أكثر قيمة من الإدخال متعدد الوسائط وانخفاض سعر الوحدة.

كم تكلفة MiMo-V2.5 وMiMo-V2.5-Pro؟

أساس السعر: May 27, 2026API القياسي الرسميAPI Pro الرسميMiMo-V2.5 API في CometAPIMiMo-V2.5-Pro API في CometAPI
الإدخال، إخفاق التخزين/MTok$0.14$0.435$0.112$0.348
الإخراج/MTok$0.28$0.87$0.224$0.696
الإدخال، نجاح التخزين/MTok$0.0028$0.0036تحقق من الفوترة الحاليةتحقق من الفوترة الحالية
الخصم مقابل السعر الرسمي غير المخزنخط الأساسخط الأساس20%20%

بالأسعار الرسمية، يكلف Pro حوالي 3.1× قدر الإصدار القياسي لكل من الإدخال والإخراج غير المخزَّنين. تُخفض الأسعار المعروضة لدى المزود أعلاه كل زوج غير مخزَّن بنسبة 20%، لكن الفجوة النسبية بين الإصدارين تبقى عملياً دون تغيير.

سعر الرمز ليس التكلفة الإجمالية. محاولات الأدوات، حجم السياق، طول الإخراج، الزمنية، تعافي المهام الفاشلة، والمراجعة البشرية تحدد تكلفة المهمة المكتملة. شغّل عينة ممثلة من عبء العمل قبل اختيار نموذج إنتاج افتراضي.

ما الذي يجيده MiMo-V2.5؟

  • وكلاء متعدد الوسائط: اجمع لقطات الشاشة، والمستندات، والفيديو، والصوت، والتعليمات، والأدوات في سير عمل واحد.
  • تحليل مستندات طويلة: معالجة المستودعات، والعقود، وأرشيفات الأبحاث، والسجلات، وتواريخ الدعم.
  • فهم الوسائط: تلخيص الفيديوهات، استخراج الأحداث، تفسير المخططات، والإجابة عن أسئلة سمعية بصرية.
  • وكلاء الترميز والطرفية: فحص الملفات، تشغيل الأوامر، تعديل الشيفرة، والتكرار على نتائج الاختبارات.
  • أتمتة عالية الحجم: استخدم التفعيل المتناثر وتسعير الرموز المنخفض للمهام الإنتاجية المتكررة.

القيود والمخاطر

  • يتم تفعيل 15B معاملات فقط لكل رمز، لكن الاستضافة الذاتية لا تزال تتطلب نظام أوزان 310B الكامل.
  • المخرجات متعددة الوسائط نصية؛ توليد الصور والصوت والفيديو يتطلب نماذج أخرى.
  • سقف سياق 1M لا يضمن دقة استرجاع موحدة عبر النافذة كاملة.
  • قد لا تنتقل معايير الناشر إلى الأدوات، أو المستودعات، أو المطالبات، أو قيود الأمان المخصصة.
  • قد تختلف إتاحة الوسائط لدى المزود عن الإمكانات الكاملة للنموذج مفتوح الأوزان الأساسي.

بوابة الإنتاج:

تحقق من الدقة، وإتمام استدعاءات الأدوات، والزمنية، واستهلاك الرموز، والتعامل مع الوسائط، وسلوك التراجع على مهام ممثلة قبل تحويل الحركة.

مثال API

يعرض المثال التالي Python باستخدام نقطة نهاية CometAPI المتوافقة مع OpenAI ومعرف نموذج الإصدار القياسي. أكد نقطة النهاية الحالية ومخطط الطلب المدعوم قبل النشر.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

دليل القرار

إشارة عبء العملابدأ بـغيّر عندما
الصور أو الفيديو أو الصوت مدخلات من الدرجة الأولىالقياسيلا تغيّر إلا إذا كان تمهيد الوسائط مقبولاً
حجم كبير من المستندات أو وسائط مختلطةالقياسيPro فقط إذا كانت إخفاقات الاستدلال تهيمن على التكلفة
هندسة مستودعات صعبةاختبر كلاهمااختر Pro إذا غطت مكاسب الإتمام تكلفة 3.1× لكل وحدة
مسارات طرفية ذاتية طويلةProعُد إلى القياسي إذا لم تكن المكاسب قابلة للقياس
أتمتة روتينية عالية الحجمالقياسيصعّد فقط المهام الفاشلة أو عالية القيمة

التوجيه الموصى به:

استخدم القياسي كافتراض للوكلاء متعدد الوسائط والعمل عالي الحجم، ثم وجّه فقط مهام الترميز النصية الصعبة أو المهام طويلة الأمد إلى Pro. هذا يحافظ على القدرات مع ضبط التكلفة الإجمالية.

الخلاصة

النموذج القياسي ليس مجرد إصدار أصغر من Pro. إنه نقطة تحسين مميزة: إدخال متعدد الوسائط أصيل، سياق 1M، معايير قوية موجهة للأدوات، و15B معاملات مفعّلة بسعر رموز أقل بكثير.

Pro هو خيار متخصص لهندسة البرمجيات الصعبة والتنفيذ الذاتي المستمر. تمنح سعته الإضافية مكاسب قابلة للقياس لكنها ليست شاملة، لذا أقوى نمط نشر هو التوجيه القائم على عبء العمل بدلاً من اختيار إصدار واحد لكل طلب.

الأسئلة الشائعة

هل النموذج القياسي مفتوح المصدر؟

تم إصدار أوزانه بموجب ترخيص MIT، ما يتيح الاستخدام التجاري، والتعديل، وضبط الدقة، وإعادة التوزيع وفق شروط الترخيص.

كم عدد المعاملات التي يستخدمها؟

يحتوي MoE المتناثر على 310B معاملات إجمالية ويفعّل 15B لكل رمز. تصف المعاملات المفعّلة الحوسبة لكل رمز، لا حجم تخزين النموذج الكامل.

هل يدعم الصور والفيديو والصوت؟

نعم. يقبل الإصدار القياسي إدخال النص والصورة والفيديو والصوت ويعيد نصاً. تسرد مواصفات إصدار Pro الرسمية الإدخال النصي.

ما أقصى نافذة سياق؟

تحدد كلا بطاقتي النموذج نافذة سياق تصل إلى 1M رموز. تسرد صفحات API الحالية لدى Xiaomi إخراجاً أقصاه 128K لكل من MiMo-V2.5 وMiMo-V2.5-Pro. يمكن أن تختلف الحدود القابلة للاستخدام تبعاً لنقطة النهاية، والمزود، والحساب، وصيغة الطلب؛ تحقق من المسار المنشور قبل الاعتماد على تلك الحدود.

تؤكد صفحة API الرسمية الحالية لإصدار Pro بشكل منفصل سياق 1M وإخراجاً أقصاه 128K: MiMo-V2.5-Pro API specifications

أي إصدار أفضل لوكلاء الترميز؟

يُبلغ Pro عن نتائج أعلى على معايير الترميز والطرفية المشتركة، لكن الهامش متواضع. اختبر كليهما على المستودع المستهدف واختر بناءً على إتمام المهام، والزمنية، والتكلفة الإجمالية.

أي إصدار أفضل للوكلاء متعدد الوسائط؟

الإصدار القياسي هو الخيار الطبيعي لأنه يقبل إدخال الصور والفيديو والصوت أصيلاً. Pro يركز على الإدخال النصي.

كيف ينبغي أن يختار فريق إنتاج؟

ابدأ بالقياسي، قِس الإخفاقات، ووجّه فقط المهام النصية الصعبة التي تستفيد من Pro. قارن تكلفة المهمة المكتملة بدلاً من السعر لكل رمز فقط.

تابع التعلّم

اربط هذه المقالة بالقرار التالي.

عرض جميع الموضوعات
نُشر في Oct 5, 2026
آخر تحديث Oct 5, 2026
0 مشاهدات
تمت المراجعة للوضوح ودقة المصدر ومصطلحات API الحالية.

اقرأ المزيد