TL;DR
Le modèle standard V2.5 de Xiaomi combine la compréhension native du texte, de l’image, de la vidéo et de l’audio avec une fenêtre de contexte de 1 million de tokens, l’usage d’outils et l’efficacité d’un Mixture-of-Experts clairsemé. C’est l’option la mieux adaptée quand l’entrée multimodale et le coût par tâche accomplie comptent. La variante Pro est plus grande et plus performante pour le codage exigeant et le travail d’agent à long horizon, mais elle est centrée sur l’entrée texte et coûte environ trois fois plus par token aux tarifs publiés par Xiaomi.
La décision pratique est simple : choisissez le modèle standard pour les agents multimodaux, l’analyse de documents et médias, et l’automatisation à grand volume ; choisissez Pro lorsque le goulot d’étranglement est l’ingénierie logicielle difficile ou l’exécution autonome soutenue.
Principaux enseignements
- Le modèle standard utilise 310B de paramètres au total tout en activant 15B par token.
- Il accepte du texte, des images, de la vidéo et de l’audio, puis retourne du texte.
- Son API prend en charge 1M de contexte, jusqu’à 128K de sortie, les appels d’outils, la recherche web, le streaming, la sortie structurée et la mise en cache du contexte.
- Les résultats rapportés par l’éditeur incluent 65,8 sur Terminal-Bench 2.0 et 56,1 sur SWE-Bench Pro.
- La fiche actuelle du modèle MiMo-V2.5-Pro de Xiaomi liste 1,02T de paramètres totaux et 42B de paramètres actifs. Les scores SWE-Bench Pro listés par l’éditeur sont 56,1 pour MiMo-V2.5 et 57,2 pour Pro ; ce sont des comparaisons datées et rapportées par l’éditeur, pas une garantie pour un workflow de codage spécifique.
- Aux tarifs actuels de Xiaomi, les coûts d’entrée/sortie du standard sont de 0,14 $/0,28 $ par million de tokens ; Pro coûte 0,435 $/0,87 $.
- Les deux API dans CometAPI sont tarifées 20 % en dessous des paires de prix officielles non mises en cache.
Informations vérifiées : 28 septembre 2026. Les prix, benchmarks, limites, disponibilités et formats de requêtes peuvent changer. Xiaomi a annoncé que ses noms de modèles d’API officiels mimo-v2.5 et mimo-v2.5-pro seront dépréciés à 10:00 heure de Pékin le 21 octobre 2026, sans remplacement automatique. Planifiez la migration et confirmez la route active avant le déploiement.
Note sur le cycle de vie de l’API : la plateforme officielle Xiaomi prévoit de retirer les deux IDs de modèles V2.5 le 21 octobre 2026. Cet avis concerne la plateforme d’API de Xiaomi ; vérifiez séparément toute passerelle tierce. Avis de retrait du modèle Xiaomi
Ce qu’est le modèle standard
MiMo-V2.5 est le modèle de base axé sur l’efficacité de Xiaomi MiMo pour la perception multimodale et le travail d’agent. Il fournit une entrée native texte, image, vidéo et audio au sein d’une même architecture et produit une sortie texte.
Le journal de publication des modèles de Xiaomi date la bêta publique de la série MiMo-V2.5 au 23 avril 2026. Les poids ont ensuite été publiés sous licence MIT. MiMo-V2.5 compte 310B de paramètres au total, mais n’en active qu’environ 15B par token ; il utilise un grand pool de spécialistes sans tous les exécuter en même temps.
MiMo-V2.5-Pro cible une charge de travail différente. C’est un modèle à l’échelle du trillion de paramètres, à entrée texte, conçu pour les tâches de codage les plus difficiles, le terminal et les agents à longue exécution. Les deux variantes partagent un contexte maximum de 1M mais diffèrent nettement en modalité, calcul actif et prix.
Spécifications et fonctionnalités de MiMo-V2.5
| Détails officiels d’architecture | Valeur | Pourquoi c’est important |
|---|---|---|
| Architecture | Sparse MoE | Grande capacité d’experts avec activation sélective |
| Paramètres totaux / actifs | 310B / 15B | Le calcul actif est bien inférieur à la capacité totale |
| Couches Transformer | 48 : 1 dense + 47 MoE | La plupart des couches utilisent des experts routés |
| Experts routés | 256 ; 8 actifs par token | Spécialisation sans exécution dense de 310B |
| Attention | 39 SWA + 9 couches globales | Équilibre efficacité locale et flux longue portée |
| Fenêtre SWA | 128 tokens | Réduit la pression du cache long contexte |
| Contexte / sortie maximale | 1M / 128K tokens | Prend en charge longs documents et traces étendues |
| Entrée / sortie | Texte, image, vidéo, audio / texte | Perception native sur quatre types d’entrée |
| Encodeur vision | ViT 729M ; 28 couches | Compréhension d’images et de vidéos |
| Encodeur audio | Transformer 261M ; 24 couches | Compréhension audio native |
| Prédiction multi‑tokens | 3 modules ; environ 329M paramètres | Efficacité de décodage spéculatif |
| Échelle d’entraînement | Environ 48T tokens | Pipeline large texte et multimodal |
| Capacités API | Outils, web, streaming, sortie structurée, cache | Primitives d’agent orientées production |
| Licence | MIT | Usage commercial et modification autorisés |
L’enveloppe de fonctionnement inclut 1M de contexte et 128K de sortie, plus des limites publiées de 100 requêtes par minute et 10 millions de tokens par minute. Les limites au niveau du fournisseur peuvent différer selon le compte et la route d’intégration.
Schéma d’architecture officiel de Xiaomi MiMo. Ressource d’architecture officielle.
Comment fonctionne l’architecture de MiMo-V2.5
Experts clairsemés : la capacité totale n’est pas le calcul actif
Le point d’efficacité central est la conception 310B au total, 15B actifs. Le routeur sélectionne huit des 256 experts pour chaque token. Cela donne au modèle accès à un pool de paramètres bien plus grand qu’un modèle dense de 15B conventionnel sans exécuter les 310B à chaque fois.
Cela ne rend pas l’auto‑hébergement trivial. Les poids complets doivent toujours être stockés et distribués, donc la capacité mémoire, la bande passante d’interconnexion, le routage des experts et le logiciel de service restent des contraintes importantes.
Attention hybride pour long contexte
Le backbone entrelace une attention à fenêtre glissante et une attention globale selon un rapport SWA‑global de 5:1. Trente‑neuf couches locales contrôlent la croissance du cache, tandis que neuf couches globales préservent le flux d’information à longue distance. Xiaomi rapporte une réduction du cache KV proche de six fois par rapport à une conception tout‑globale.
Un maximum de 1M tokens est une capacité, pas une précision garantie. La qualité de récupération, la latence, la croissance de l’état des outils et l’attention aux preuves lointaines nécessitent toujours une évaluation spécifique à la charge de travail.
Encodeurs natifs et fonctionnalités d’agent
Un transformeur vision de 729M paramètres gère les entrées image et vidéo ; un transformeur audio de 261M paramètres gère l’audio. Les projecteurs mappent les deux flux dans l’ossature linguistique, permettant à un agent de combiner une capture d’écran, un segment vidéo, une piste audio, des instructions texte et des résultats d’outils.
Trois modules de prédiction multi‑tokens soutiennent le décodage spéculatif et l’efficacité en apprentissage par renforcement. Le modèle a été entraîné sur environ 48T tokens, avec un contexte progressivement étendu à 1M lors du post‑entraînement.
Les poids ouverts utilisent une licence MIT. Le déploiement commercial est autorisé, mais les coûts d’infrastructure et les dépendances tierces doivent faire l’objet d’un examen séparé.
Benchmarks de MiMo-V2.5 : codage, agents et résultats multimodaux
Note sur les benchmarks :
les chiffres ci‑dessous sont rapportés par l’éditeur. Ils sont des indications, pas une garantie pour un dépôt spécifique, un format média, une pile d’outils, une cible de latence ou une politique de sûreté.
Résultats en codage et agents

Graphique officiel des benchmarks de codage et d’agents Xiaomi MiMo.
| Benchmark de codage officiel | Score rapporté | Signal de décision |
|---|---|---|
| MiMo Coding Bench | 71,8 | Capacité large d’agent de codage |
| Claw‑Eval Text | 62,3 | Achèvement général d’agent texte |
| Terminal‑Bench 2.0 | 65,8 | Exécution terminal interactive |
| SWE‑Bench Pro | 56,1 | Ingénierie logicielle réelle |
| Claw‑Eval Multi‑Turn | 63,2 | Travail d’agent multi‑étapes long |
| ResearchClawBench | 16,91 | Workflows de recherche autonomes |
Résultat : le cas le plus fort est l’usage pratique des outils plutôt que la complétion de code isolée. Un résultat de 65,8 sur Terminal‑Bench soutient les agents orientés terminal, tandis que 56,1 sur SWE‑Bench Pro suggère une capacité utile au niveau dépôt. Le score de recherche bien plus bas rappelle qu’il faut tester séparément la collecte de preuves et le comportement de citation.
Résultats multimodaux

Graphique officiel des benchmarks image, vidéo et agents multimodaux de Xiaomi MiMo.
| Benchmark multimodal officiel | Score rapporté | Capacité testée |
|---|---|---|
| CharXiv RQ | 81,0 | Raisonnement sur graphiques et docs |
| MMMU‑Pro | 77,9 | Raisonnement multimodal expert |
| HR‑Bench 4K | 88,5 | Compréhension d’images haute résolution |
| OmniDocBench | 87,2 | Compréhension de documents |
| Claw‑Eval Multimodal | 23,8 | Achèvement d’agent multimodal |
| Video‑MME | 87,7 | Compréhension vidéo |
| DailyOmni | 83,5 | Raisonnement audiovisuel quotidien |
| VideoHolmes | 64,0 | Raisonnement temporel vidéo |
Résultat : la compréhension de documents, d’images haute résolution et de vidéos est la force la plus nette. Le score d’agent multimodal de 23,8 est bien inférieur aux scores de perception, donc un système qui doit à la fois comprendre les médias et utiliser les outils de manière fiable doit être évalué de bout en bout.
MiMo-V2.5 vs MiMo-V2.5-Pro : comparaison multidimensionnelle
| Comparaison d’architecture officielle | MiMo-V2.5 | MiMo-V2.5-Pro Spécifications officielles Pro Benchmarks officiels Pro | Implication pratique |
|---|---|---|---|
| Paramètres totaux | 310B | 1,02T | Pro a plus de 3× la capacité totale |
| Paramètres activés | 15B | 42B | Pro utilise environ 2,8× plus de paramètres actifs |
| Couches / experts routés | 48 / 256 | 70 / 384 | Pro est une cible de service plus grande |
| Plafond de contexte (fiche modèle) | 1M | 1M | Les deux listent jusqu’à 1M tokens ; testez la récupération et la latence à la taille de votre charge |
| Sortie maximale API officielle | 128K | 128K | Les pages API Xiaomi actuelles listent 128K ; des limites spécifiques au fournisseur peuvent varier |
| Entrée native | Texte, image, vidéo, audio | Texte | MiMo‑V2.5 est le choix multimodal documenté ; vérifiez l’endpoint Pro exact avant d’envoyer des médias |
| SWE‑Bench Pro | 56,1 | 57,2 | Pro mène de 1,1 point |
| Terminal‑Bench 2.0 | 65,8 | 68,4 | Pro mène de 2,6 points |
| Adéquation principale | Agents multimodaux efficaces | Codage complexe et agents à long horizon | Choisissez selon la charge testée ; les marges au niveau modèle ne prouvent pas un avantage général |
Résultat de la comparaison : l’avantage de Pro sur les deux tests partagés de codage/agents est modeste, tandis que la variante standard ajoute une entrée native image, vidéo et audio et utilise bien moins de paramètres actifs. Pro se justifie lorsque de petits gains en réussite d’actions difficiles valent plus que l’entrée multimodale et le coût unitaire inférieur.
Combien coûtent MiMo-V2.5 et MiMo-V2.5-Pro ?
| Base de prix : 27 mai 2026 | API standard officielle | API Pro officielle | API MiMo‑V2.5 dans CometAPI | API MiMo‑V2.5‑Pro dans CometAPI |
|---|---|---|---|---|
| Entrée, cache manqué / MTok | 0,14 $ | 0,435 $ | 0,112 $ | 0,348 $ |
| Sortie / MTok | 0,28 $ | 0,87 $ | 0,224 $ | 0,696 $ |
| Entrée, cache touché / MTok | 0,0028 $ | 0,0036 $ | Vérifier la facturation live | Vérifier la facturation live |
| Remise vs taux officiel non caché | Baseline | Baseline | 20 % | 20 % |
Aux tarifs officiels, Pro coûte environ 3,1× plus que le standard pour l’entrée et la sortie non mises en cache. Les prix du fournisseur ci‑dessus réduisent chaque paire non mise en cache de 20 %, mais l’écart relatif entre variantes reste quasi inchangé.
Le prix par token n’est pas le coût total. Les réessais d’outils, la taille du contexte, la longueur de sortie, la latence, la reprise après échec et la relecture humaine déterminent le coût par tâche accomplie. Exécutez un échantillon de charge représentative avant de sélectionner un modèle de production par défaut.
Pour quoi MiMo-V2.5 est‑il le meilleur ?
- Agents multimodaux : combinez captures d’écran, documents, vidéo, audio, instructions et outils dans un seul flux.
- Analyse de longs documents : traitez dépôts, contrats, archives de recherche, journaux et historiques de support.
- Compréhension des médias : résumez des vidéos, extrayez des événements, interprétez des graphiques et répondez à des questions audiovisuelles.
- Agents de codage et terminal : inspectez des fichiers, exécutez des commandes, modifiez du code et itérez sur les résultats de tests.
- Automatisation à grand volume : utilisez l’activation clairsemée et un prix par token inférieur pour des tâches répétées en production.
Limites et risques
- Seuls 15B de paramètres sont actifs par token, mais l’auto‑hébergement nécessite toujours le système complet de poids 310B.
- La sortie multimodale est du texte ; la génération d’images, de parole et de vidéo requiert d’autres modèles.
- Un plafond de contexte de 1M ne garantit pas une précision uniforme sur toute la fenêtre.
- Les benchmarks de l’éditeur peuvent ne pas se transférer aux outils, dépôts, prompts ou contraintes de sûreté personnalisés.
- L’exposition de la modalité côté fournisseur peut différer des capacités complètes du modèle à poids ouverts.
Portail de production :
validez la précision, l’achèvement des appels d’outils, la latence, la consommation de tokens, la gestion des modalités et le comportement de repli sur des tâches représentatives avant d’engager du trafic.
Exemple d’API
L’exemple Python suivant utilise un endpoint CometAPI compatible OpenAI et l’ID du modèle standard. Confirmez l’endpoint actuel et le schéma de requête pris en charge avant le déploiement.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Guide de décision
| Signal de charge | Commencez avec | Basculez lorsque |
|---|---|---|
| Images, vidéo ou audio sont des entrées de premier plan | Standard | Ne basculez pas sauf si un prétraitement multimodal est acceptable |
| Volume important de documents ou médias mixtes | Standard | Pro seulement si les échecs de raisonnement dominent le coût |
| Ingénierie de dépôts difficile | Testez les deux | Choisissez Pro si son gain d’achèvement compense un coût ×3,1 |
| Longues trajectoires autonomes en terminal | Pro | Revenez au standard si les gains ne sont pas mesurables |
| Automatisation de routine à grand volume | Standard | Escalatez uniquement les tâches échouées ou à haute valeur |
Recommandation de routage :
utilisez standard par défaut pour le multimodal et le grand volume, puis routez uniquement les tâches difficiles centrées texte ou à long horizon vers Pro. Cela préserve la capacité tout en maîtrisant le coût total.
Conclusion
Le modèle standard n’est pas simplement un Pro plus petit. C’est un point d’optimisation distinct : entrée multimodale native, contexte 1M, benchmarks orientés outils solides et 15B de paramètres actifs à un prix par token bien plus bas.
Pro est l’option spécialiste pour l’ingénierie logicielle difficile et l’exécution autonome soutenue. Sa capacité supplémentaire produit des gains mesurables mais non universels ; le schéma de déploiement le plus solide est donc un routage fondé sur la charge plutôt que la sélection d’une seule variante pour chaque requête.
FAQ
Le modèle standard est‑il open source ?
Ses poids sont publiés sous licence MIT, permettant l’usage commercial, la modification, l’affinage et la redistribution sous réserve des termes de la licence.
Combien de paramètres utilise‑t‑il ?
Le Sparse MoE contient 310B de paramètres totaux et en active 15B pour chaque token. Les paramètres actifs décrivent le calcul par token, pas la taille de stockage du modèle complet.
Prend‑il en charge les images, la vidéo et l’audio ?
Oui. La variante standard accepte le texte, les images, la vidéo et l’audio et retourne du texte. La spécification officielle de la variante Pro liste l’entrée texte.
Quelle est la fenêtre de contexte maximale ?
Les deux fiches de modèle spécifient une fenêtre de contexte jusqu’à 1M tokens. Les pages API actuelles de Xiaomi listent une sortie maximale de 128K pour MiMo‑V2.5 et MiMo‑V2.5‑Pro. Les limites réellement exploitables peuvent varier selon l’endpoint, le fournisseur, le compte et le format de requête ; vérifiez la route déployée avant de vous appuyer sur ces plafonds.
La page API Pro officielle actuelle confirme séparément le contexte 1M et la sortie maximale 128K : Spécifications de l’API MiMo‑V2.5‑Pro
Quelle variante est meilleure pour les agents de codage ?
Pro rapporte de meilleurs résultats sur les tests partagés de codage et terminal, mais la marge est modeste. Testez les deux sur le dépôt cible et choisissez selon l’achèvement des tâches, la latence et le coût total.
Quelle variante est meilleure pour les agents multimodaux ?
La variante standard est le choix naturel car elle accepte nativement les entrées image, vidéo et audio. Pro est centrée sur l’entrée texte.
Comment une équipe de production doit‑elle choisir ?
Commencez par le standard, mesurez les échecs, et ne routez vers Pro que les tâches difficiles centrées texte qui en bénéficient. Comparez le coût par tâche accomplie plutôt que le prix par token seul.
