GPT-6.1 Sol are now live on CometAPI →
ai-model/Recherche CometAPI

Qu'est-ce que MiMo-V2.5 ? Spécifications, benchmarks, fonctionnalités, tarifs et accès à l'API

Explorez les spécifications de Xiaomi MiMo-V2.5, son architecture, les benchmarks officiels, la tarification, la comparaison avec MiMo-V2.5-Pro, les cas d'utilisation, les limitations et l'accès à CometAPI.

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Oct 5, 2026 14 min de lecture
Qu'est-ce que MiMo-V2.5 ? Spécifications, benchmarks, fonctionnalités, tarifs et accès à l'API
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Le modèle standard V2.5 de Xiaomi combine la compréhension native du texte, de l’image, de la vidéo et de l’audio avec une fenêtre de contexte de 1 million de tokens, l’usage d’outils et l’efficacité d’un Mixture-of-Experts clairsemé. C’est l’option la mieux adaptée quand l’entrée multimodale et le coût par tâche accomplie comptent. La variante Pro est plus grande et plus performante pour le codage exigeant et le travail d’agent à long horizon, mais elle est centrée sur l’entrée texte et coûte environ trois fois plus par token aux tarifs publiés par Xiaomi.

La décision pratique est simple : choisissez le modèle standard pour les agents multimodaux, l’analyse de documents et médias, et l’automatisation à grand volume ; choisissez Pro lorsque le goulot d’étranglement est l’ingénierie logicielle difficile ou l’exécution autonome soutenue.

Principaux enseignements

  • Le modèle standard utilise 310B de paramètres au total tout en activant 15B par token.
  • Il accepte du texte, des images, de la vidéo et de l’audio, puis retourne du texte.
  • Son API prend en charge 1M de contexte, jusqu’à 128K de sortie, les appels d’outils, la recherche web, le streaming, la sortie structurée et la mise en cache du contexte.
  • Les résultats rapportés par l’éditeur incluent 65,8 sur Terminal-Bench 2.0 et 56,1 sur SWE-Bench Pro.
  • La fiche actuelle du modèle MiMo-V2.5-Pro de Xiaomi liste 1,02T de paramètres totaux et 42B de paramètres actifs. Les scores SWE-Bench Pro listés par l’éditeur sont 56,1 pour MiMo-V2.5 et 57,2 pour Pro ; ce sont des comparaisons datées et rapportées par l’éditeur, pas une garantie pour un workflow de codage spécifique.
  • Aux tarifs actuels de Xiaomi, les coûts d’entrée/sortie du standard sont de 0,14 $/0,28 $ par million de tokens ; Pro coûte 0,435 $/0,87 $.
  • Les deux API dans CometAPI sont tarifées 20 % en dessous des paires de prix officielles non mises en cache.
    Informations vérifiées : 28 septembre 2026. Les prix, benchmarks, limites, disponibilités et formats de requêtes peuvent changer. Xiaomi a annoncé que ses noms de modèles d’API officiels mimo-v2.5 et mimo-v2.5-pro seront dépréciés à 10:00 heure de Pékin le 21 octobre 2026, sans remplacement automatique. Planifiez la migration et confirmez la route active avant le déploiement.

Note sur le cycle de vie de l’API : la plateforme officielle Xiaomi prévoit de retirer les deux IDs de modèles V2.5 le 21 octobre 2026. Cet avis concerne la plateforme d’API de Xiaomi ; vérifiez séparément toute passerelle tierce. Avis de retrait du modèle Xiaomi

Ce qu’est le modèle standard

MiMo-V2.5 est le modèle de base axé sur l’efficacité de Xiaomi MiMo pour la perception multimodale et le travail d’agent. Il fournit une entrée native texte, image, vidéo et audio au sein d’une même architecture et produit une sortie texte.

Le journal de publication des modèles de Xiaomi date la bêta publique de la série MiMo-V2.5 au 23 avril 2026. Les poids ont ensuite été publiés sous licence MIT. MiMo-V2.5 compte 310B de paramètres au total, mais n’en active qu’environ 15B par token ; il utilise un grand pool de spécialistes sans tous les exécuter en même temps.

MiMo-V2.5-Pro cible une charge de travail différente. C’est un modèle à l’échelle du trillion de paramètres, à entrée texte, conçu pour les tâches de codage les plus difficiles, le terminal et les agents à longue exécution. Les deux variantes partagent un contexte maximum de 1M mais diffèrent nettement en modalité, calcul actif et prix.

Spécifications et fonctionnalités de MiMo-V2.5

Détails officiels d’architectureValeurPourquoi c’est important
ArchitectureSparse MoEGrande capacité d’experts avec activation sélective
Paramètres totaux / actifs310B / 15BLe calcul actif est bien inférieur à la capacité totale
Couches Transformer48 : 1 dense + 47 MoELa plupart des couches utilisent des experts routés
Experts routés256 ; 8 actifs par tokenSpécialisation sans exécution dense de 310B
Attention39 SWA + 9 couches globalesÉquilibre efficacité locale et flux longue portée
Fenêtre SWA128 tokensRéduit la pression du cache long contexte
Contexte / sortie maximale1M / 128K tokensPrend en charge longs documents et traces étendues
Entrée / sortieTexte, image, vidéo, audio / textePerception native sur quatre types d’entrée
Encodeur visionViT 729M ; 28 couchesCompréhension d’images et de vidéos
Encodeur audioTransformer 261M ; 24 couchesCompréhension audio native
Prédiction multi‑tokens3 modules ; environ 329M paramètresEfficacité de décodage spéculatif
Échelle d’entraînementEnviron 48T tokensPipeline large texte et multimodal
Capacités APIOutils, web, streaming, sortie structurée, cachePrimitives d’agent orientées production
LicenceMITUsage commercial et modification autorisés

L’enveloppe de fonctionnement inclut 1M de contexte et 128K de sortie, plus des limites publiées de 100 requêtes par minute et 10 millions de tokens par minute. Les limites au niveau du fournisseur peuvent différer selon le compte et la route d’intégration.

Qu'est-ce que MiMo-V2.5 ? Spécifications, benchmarks, fonctionnalités, tarifs et accès à l'API

Schéma d’architecture officiel de Xiaomi MiMo. Ressource d’architecture officielle.

Comment fonctionne l’architecture de MiMo-V2.5

Experts clairsemés : la capacité totale n’est pas le calcul actif

Le point d’efficacité central est la conception 310B au total, 15B actifs. Le routeur sélectionne huit des 256 experts pour chaque token. Cela donne au modèle accès à un pool de paramètres bien plus grand qu’un modèle dense de 15B conventionnel sans exécuter les 310B à chaque fois.

Cela ne rend pas l’auto‑hébergement trivial. Les poids complets doivent toujours être stockés et distribués, donc la capacité mémoire, la bande passante d’interconnexion, le routage des experts et le logiciel de service restent des contraintes importantes.

Attention hybride pour long contexte

Le backbone entrelace une attention à fenêtre glissante et une attention globale selon un rapport SWA‑global de 5:1. Trente‑neuf couches locales contrôlent la croissance du cache, tandis que neuf couches globales préservent le flux d’information à longue distance. Xiaomi rapporte une réduction du cache KV proche de six fois par rapport à une conception tout‑globale.

Un maximum de 1M tokens est une capacité, pas une précision garantie. La qualité de récupération, la latence, la croissance de l’état des outils et l’attention aux preuves lointaines nécessitent toujours une évaluation spécifique à la charge de travail.

Encodeurs natifs et fonctionnalités d’agent

Un transformeur vision de 729M paramètres gère les entrées image et vidéo ; un transformeur audio de 261M paramètres gère l’audio. Les projecteurs mappent les deux flux dans l’ossature linguistique, permettant à un agent de combiner une capture d’écran, un segment vidéo, une piste audio, des instructions texte et des résultats d’outils.

Trois modules de prédiction multi‑tokens soutiennent le décodage spéculatif et l’efficacité en apprentissage par renforcement. Le modèle a été entraîné sur environ 48T tokens, avec un contexte progressivement étendu à 1M lors du post‑entraînement.

Les poids ouverts utilisent une licence MIT. Le déploiement commercial est autorisé, mais les coûts d’infrastructure et les dépendances tierces doivent faire l’objet d’un examen séparé.

Benchmarks de MiMo-V2.5 : codage, agents et résultats multimodaux

Note sur les benchmarks :

les chiffres ci‑dessous sont rapportés par l’éditeur. Ils sont des indications, pas une garantie pour un dépôt spécifique, un format média, une pile d’outils, une cible de latence ou une politique de sûreté.

Résultats en codage et agents

Qu'est-ce que MiMo-V2.5 ? Spécifications, benchmarks, fonctionnalités, tarifs et accès à l'API

Graphique officiel des benchmarks de codage et d’agents Xiaomi MiMo.

Benchmark de codage officielScore rapportéSignal de décision
MiMo Coding Bench71,8Capacité large d’agent de codage
Claw‑Eval Text62,3Achèvement général d’agent texte
Terminal‑Bench 2.065,8Exécution terminal interactive
SWE‑Bench Pro56,1Ingénierie logicielle réelle
Claw‑Eval Multi‑Turn63,2Travail d’agent multi‑étapes long
ResearchClawBench16,91Workflows de recherche autonomes

Résultat : le cas le plus fort est l’usage pratique des outils plutôt que la complétion de code isolée. Un résultat de 65,8 sur Terminal‑Bench soutient les agents orientés terminal, tandis que 56,1 sur SWE‑Bench Pro suggère une capacité utile au niveau dépôt. Le score de recherche bien plus bas rappelle qu’il faut tester séparément la collecte de preuves et le comportement de citation.

Résultats multimodaux

Qu'est-ce que MiMo-V2.5 ? Spécifications, benchmarks, fonctionnalités, tarifs et accès à l'API

Graphique officiel des benchmarks image, vidéo et agents multimodaux de Xiaomi MiMo.

Benchmark multimodal officielScore rapportéCapacité testée
CharXiv RQ81,0Raisonnement sur graphiques et docs
MMMU‑Pro77,9Raisonnement multimodal expert
HR‑Bench 4K88,5Compréhension d’images haute résolution
OmniDocBench87,2Compréhension de documents
Claw‑Eval Multimodal23,8Achèvement d’agent multimodal
Video‑MME87,7Compréhension vidéo
DailyOmni83,5Raisonnement audiovisuel quotidien
VideoHolmes64,0Raisonnement temporel vidéo

Résultat : la compréhension de documents, d’images haute résolution et de vidéos est la force la plus nette. Le score d’agent multimodal de 23,8 est bien inférieur aux scores de perception, donc un système qui doit à la fois comprendre les médias et utiliser les outils de manière fiable doit être évalué de bout en bout.

MiMo-V2.5 vs MiMo-V2.5-Pro : comparaison multidimensionnelle

Comparaison d’architecture officielleMiMo-V2.5MiMo-V2.5-Pro
Spécifications officielles Pro
Benchmarks officiels Pro
Implication pratique
Paramètres totaux310B1,02TPro a plus de 3× la capacité totale
Paramètres activés15B42BPro utilise environ 2,8× plus de paramètres actifs
Couches / experts routés48 / 25670 / 384Pro est une cible de service plus grande
Plafond de contexte (fiche modèle)1M1MLes deux listent jusqu’à 1M tokens ; testez la récupération et la latence à la taille de votre charge
Sortie maximale API officielle128K128KLes pages API Xiaomi actuelles listent 128K ; des limites spécifiques au fournisseur peuvent varier
Entrée nativeTexte, image, vidéo, audioTexteMiMo‑V2.5 est le choix multimodal documenté ; vérifiez l’endpoint Pro exact avant d’envoyer des médias
SWE‑Bench Pro56,157,2Pro mène de 1,1 point
Terminal‑Bench 2.065,868,4Pro mène de 2,6 points
Adéquation principaleAgents multimodaux efficacesCodage complexe et agents à long horizonChoisissez selon la charge testée ; les marges au niveau modèle ne prouvent pas un avantage général

Résultat de la comparaison : l’avantage de Pro sur les deux tests partagés de codage/agents est modeste, tandis que la variante standard ajoute une entrée native image, vidéo et audio et utilise bien moins de paramètres actifs. Pro se justifie lorsque de petits gains en réussite d’actions difficiles valent plus que l’entrée multimodale et le coût unitaire inférieur.

Combien coûtent MiMo-V2.5 et MiMo-V2.5-Pro ?

Base de prix : 27 mai 2026API standard officielleAPI Pro officielleAPI MiMo‑V2.5 dans CometAPIAPI MiMo‑V2.5‑Pro dans CometAPI
Entrée, cache manqué / MTok0,14 $0,435 $0,112 $0,348 $
Sortie / MTok0,28 $0,87 $0,224 $0,696 $
Entrée, cache touché / MTok0,0028 $0,0036 $Vérifier la facturation liveVérifier la facturation live
Remise vs taux officiel non cachéBaselineBaseline20 %20 %

Aux tarifs officiels, Pro coûte environ 3,1× plus que le standard pour l’entrée et la sortie non mises en cache. Les prix du fournisseur ci‑dessus réduisent chaque paire non mise en cache de 20 %, mais l’écart relatif entre variantes reste quasi inchangé.

Le prix par token n’est pas le coût total. Les réessais d’outils, la taille du contexte, la longueur de sortie, la latence, la reprise après échec et la relecture humaine déterminent le coût par tâche accomplie. Exécutez un échantillon de charge représentative avant de sélectionner un modèle de production par défaut.

Pour quoi MiMo-V2.5 est‑il le meilleur ?

  • Agents multimodaux : combinez captures d’écran, documents, vidéo, audio, instructions et outils dans un seul flux.
  • Analyse de longs documents : traitez dépôts, contrats, archives de recherche, journaux et historiques de support.
  • Compréhension des médias : résumez des vidéos, extrayez des événements, interprétez des graphiques et répondez à des questions audiovisuelles.
  • Agents de codage et terminal : inspectez des fichiers, exécutez des commandes, modifiez du code et itérez sur les résultats de tests.
  • Automatisation à grand volume : utilisez l’activation clairsemée et un prix par token inférieur pour des tâches répétées en production.

Limites et risques

  • Seuls 15B de paramètres sont actifs par token, mais l’auto‑hébergement nécessite toujours le système complet de poids 310B.
  • La sortie multimodale est du texte ; la génération d’images, de parole et de vidéo requiert d’autres modèles.
  • Un plafond de contexte de 1M ne garantit pas une précision uniforme sur toute la fenêtre.
  • Les benchmarks de l’éditeur peuvent ne pas se transférer aux outils, dépôts, prompts ou contraintes de sûreté personnalisés.
  • L’exposition de la modalité côté fournisseur peut différer des capacités complètes du modèle à poids ouverts.

Portail de production :

validez la précision, l’achèvement des appels d’outils, la latence, la consommation de tokens, la gestion des modalités et le comportement de repli sur des tâches représentatives avant d’engager du trafic.

Exemple d’API

L’exemple Python suivant utilise un endpoint CometAPI compatible OpenAI et l’ID du modèle standard. Confirmez l’endpoint actuel et le schéma de requête pris en charge avant le déploiement.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Guide de décision

Signal de chargeCommencez avecBasculez lorsque
Images, vidéo ou audio sont des entrées de premier planStandardNe basculez pas sauf si un prétraitement multimodal est acceptable
Volume important de documents ou médias mixtesStandardPro seulement si les échecs de raisonnement dominent le coût
Ingénierie de dépôts difficileTestez les deuxChoisissez Pro si son gain d’achèvement compense un coût ×3,1
Longues trajectoires autonomes en terminalProRevenez au standard si les gains ne sont pas mesurables
Automatisation de routine à grand volumeStandardEscalatez uniquement les tâches échouées ou à haute valeur

Recommandation de routage :
utilisez standard par défaut pour le multimodal et le grand volume, puis routez uniquement les tâches difficiles centrées texte ou à long horizon vers Pro. Cela préserve la capacité tout en maîtrisant le coût total.

Conclusion

Le modèle standard n’est pas simplement un Pro plus petit. C’est un point d’optimisation distinct : entrée multimodale native, contexte 1M, benchmarks orientés outils solides et 15B de paramètres actifs à un prix par token bien plus bas.

Pro est l’option spécialiste pour l’ingénierie logicielle difficile et l’exécution autonome soutenue. Sa capacité supplémentaire produit des gains mesurables mais non universels ; le schéma de déploiement le plus solide est donc un routage fondé sur la charge plutôt que la sélection d’une seule variante pour chaque requête.

FAQ

Le modèle standard est‑il open source ?

Ses poids sont publiés sous licence MIT, permettant l’usage commercial, la modification, l’affinage et la redistribution sous réserve des termes de la licence.

Combien de paramètres utilise‑t‑il ?

Le Sparse MoE contient 310B de paramètres totaux et en active 15B pour chaque token. Les paramètres actifs décrivent le calcul par token, pas la taille de stockage du modèle complet.

Prend‑il en charge les images, la vidéo et l’audio ?

Oui. La variante standard accepte le texte, les images, la vidéo et l’audio et retourne du texte. La spécification officielle de la variante Pro liste l’entrée texte.

Quelle est la fenêtre de contexte maximale ?

Les deux fiches de modèle spécifient une fenêtre de contexte jusqu’à 1M tokens. Les pages API actuelles de Xiaomi listent une sortie maximale de 128K pour MiMo‑V2.5 et MiMo‑V2.5‑Pro. Les limites réellement exploitables peuvent varier selon l’endpoint, le fournisseur, le compte et le format de requête ; vérifiez la route déployée avant de vous appuyer sur ces plafonds.

La page API Pro officielle actuelle confirme séparément le contexte 1M et la sortie maximale 128K : Spécifications de l’API MiMo‑V2.5‑Pro

Quelle variante est meilleure pour les agents de codage ?

Pro rapporte de meilleurs résultats sur les tests partagés de codage et terminal, mais la marge est modeste. Testez les deux sur le dépôt cible et choisissez selon l’achèvement des tâches, la latence et le coût total.

Quelle variante est meilleure pour les agents multimodaux ?

La variante standard est le choix naturel car elle accepte nativement les entrées image, vidéo et audio. Pro est centrée sur l’entrée texte.

Comment une équipe de production doit‑elle choisir ?

Commencez par le standard, mesurez les échecs, et ne routez vers Pro que les tâches difficiles centrées texte qui en bénéficient. Comparez le coût par tâche accomplie plutôt que le prix par token seul.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Oct 5, 2026
Dernière mise à jour Oct 5, 2026
0 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

En savoir plus