GPT-6.1 Sol are now live on CometAPI →
ai-comparisons/Recherche CometAPI

MiMo-V2.5 vs MiMo-V2.5-Pro Quel modèle Xiaomi est le meilleur ?

comparaison de MiMo V2.5, Xiaomi MiMo, benchmarks de MiMo Pro, tarification de l'API MiMo, modèle d'IA multimodal, modèle d'agent de codage, modèle à contexte 1M

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Oct 6, 2026 13 min de lecture
MiMo-V2.5 vs MiMo-V2.5-Pro Quel modèle Xiaomi est le meilleur ?
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiMo-V2.5 est le choix par défaut plus performant pour le travail multimodal, les agents de routine et la production sensible aux coûts. MiMo-V2.5-Pro est l’option spécialisée pour le raisonnement difficile, le codage à l’échelle d’un dépôt et l’usage prolongé d’outils. Les deux offrent une fenêtre de contexte de 1 M de jetons et jusqu’à 128 K jetons de sortie, mais Pro utilise une base linguistique bien plus grande et coûte environ 3,1× plus cher pour les jetons d’entrée et de sortie ordinaires.

MiMo-V2.5 vs. Pro: Décision rapide

Spécifications — version officielleMiMo-V2.5MiMo-V2.5-ProModèle recommandéRaison
Positionnement principalModèle omni-modal et agents efficacesAgent phare et codage complexeÀ choisir selon la charge de travailLes entrées omni-modales favorisent V2.5 ; un travail textuel difficile et soutenu favorise Pro.
ArchitectureMoE clairseméMoE clairseméÀ choisir selon la charge de travailLa taille du modèle ne suffit pas à déterminer le meilleur choix pour chaque tâche.
Paramètres totaux310B1,02TÀ choisir selon la charge de travailLe modèle plus grand cible le raisonnement difficile, mais la taille n’est pas un résultat de tâche.
Paramètres activés15B42BÀ choisir selon la charge de travailUtilisez l’accomplissement de la tâche et le coût pour décider.
Couches LLM4870À choisir selon la charge de travailLe nombre de couches décrit l’architecture, pas un gain universel.
Experts routés256384À choisir selon la charge de travailLa différence n’a d’importance que si elle améliore la charge de travail visée.
Experts activés par jeton88L’un ou l’autreLes deux activent huit experts par jeton.
Fenêtre de contexte1 M de jetons1 M de jetonsL’un ou l’autreLes deux annoncent une fenêtre de 1 M de jetons ; testez la récupération effective.
Sortie maximale128 K jetons128 K jetonsL’un ou l’autreLes deux annoncent jusqu’à 128 K jetons de sortie.
Modalités d’entréeTexte, image, vidéo et audioTexteMiMo-V2.5Il accepte les entrées image, vidéo et audio ; Pro est centré sur l’entrée texte.
Appel d’outilsOuiOuiÀ choisir selon la charge de travailLes deux appellent des outils ; testez le taux de succès sur la trajectoire réelle.
Poids ouverts et licenceOui ; MITOui ; MITL’un ou l’autreLes deux offrent des poids ouverts sous MIT ; les coûts de service diffèrent.

La différence décisive : multimodal vs agent d’abord

V2.5 accepte nativement texte, images, vidéo et audio. Xiaomi associe la base linguistique à un encodeur vision de 729 M de paramètres et un encodeur audio de 261 M, permettant aux informations multimodales de participer directement au même flux de raisonnement.

  • Analyser des captures d’écran avant d’appeler des outils.
  • Comprendre une vidéo et sa piste audio ensemble.
  • Extraire des informations de schémas et d’images de documents.
  • Exploiter des agents à interface visuelle et à support multimodal.
  • Raisonner sur de longues séquences vidéo.

V2.5-Pro suit une conception différente. Xiaomi spécifie actuellement le texte comme modalité d’entrée et met l’accent sur le raisonnement profond, le développement de code et l’orchestration d’outils de longue durée.

Si le flux de travail contient des entrées image, vidéo ou audio, commencez avec V2.5. Testez Pro lorsque la difficulté réside dans le raisonnement sur du texte, du code source, des outils ou une longue trajectoire d’agent.

MiMo-V2.5 vs MiMo-V2.5-Pro Quel modèle Xiaomi est le meilleur ?

Comparaison officielle des benchmarks multimodaux de Xiaomi.

Pourquoi V2.5-Pro peut mieux réussir sur les tâches difficiles

Échelle du modèle : 310B/15B vs 1,02T/42B

Les deux modèles utilisent des bases Mixture-of-Experts clairsemées, une attention hybride fenêtre coulissante et globale, et trois modules de prédiction multi-jetons (MTP). La fiche modèle V2.5 de Xiaomi documente une base de 310 B au total, 15 B actifs ; la fiche modèle Pro étend cela à 1,02 T de paramètres totaux avec 42 B activés par jeton.

Architecture — fiche modèle officielleV2.5ProDifférence
Paramètres totaux310B1,02TEnviron 3,3×
Paramètres actifs15B42B2,8×
Taille cachée4 0966 1441,5×
Couches LLM487022 de plus
Têtes d’attention641282×
Experts routés2563841,5×
Experts par jeton88Identique
Couches MTP33Identique

V2.5 utilise un schéma d’attention 5:1, tandis que Pro adopte un schéma local-vers-global 6:1. Xiaomi indique que ces conceptions réduisent les besoins de cache KV d’environ 6× et 7× respectivement par rapport à une attention complète sur tout le réseau.

Les paramètres totaux ne se traduisent pas linéairement en qualité de réponse. La base plus grande de Pro compte surtout lorsque la difficulté du raisonnement ou la longueur de la trajectoire fait que de petits gains de fiabilité par étape se cumulent.

Pourquoi de petits gains de fiabilité se cumulent

Une tâche d’agent longue comporte de nombreuses étapes dépendantes. Une erreur lors d’un appel d’outil précoce peut forcer des réessais ou invalider le travail ultérieur ; un gain modeste de fiabilité par étape peut donc avoir un effet plus important sur la complétion de bout en bout. Évaluez cet effet sur des tâches représentatives plutôt que de supposer que la taille du modèle le garantit.

Où V2.5-Pro s’améliore-t-il réellement ?

La comparaison numérique la plus nette est l’évaluation du modèle de base de Xiaomi, où les deux modèles apparaissent sous les mêmes réglages. Cela évite de combiner des résultats produits par des harnais ou des configurations post-entraînement sans rapport.

Connaissances générales : gains faibles à modérés

Dans la comparaison des modèles de base de Xiaomi, Pro gagne 1,2 point sur BBH, 3,1 sur MMLU et 2,7 sur MMLU-Pro. Ce sont des gains mesurables mais plus modestes que ses gains sur les tâches de raisonnement plus difficiles.

Mathématiques et sciences : gains plus importants

Pro gagne 8,6 points sur GPQA-Diamond, 16,3 sur GSM8K et 18,5 sur MATH dans la même évaluation de base. C’est la preuve la plus claire en faveur de Pro lorsque le succès de la tâche dépend d’un raisonnement difficile.

Programmation : mieux, mais pas uniformément mieux

Les gains rapportés sont de 4,3 points sur HumanEval+, 3,2 sur MBPP+, 4,1 sur LiveCodeBench v6 et 4,9 sur SWE-Bench AgentLess. Testez séparément les tâches au niveau du dépôt et l’usage d’outils : ces scores de modèles de base ne mesurent pas tous les flux d’agents en production.

MiMo-V2.5 vs MiMo-V2.5-Pro Quel modèle Xiaomi est le meilleur ?

Résultat de benchmark : Pro n’est pas trois fois meilleur parce qu’il coûte environ trois fois plus. Sa valeur augmente progressivement à mesure que la difficulté du raisonnement et la durée des tâches augmentent.

Ces lignes sont des évaluations de modèles de base, pas une promesse qu’une API de production reproduira les mêmes scores. Les résultats d’agents dépendent des outils, des prompts, des réessais, de l’environnement d’exécution et des budgets de jetons.

Post-entraînement et agents à long horizon

Les modèles de production ajoutent un affinement supervisé, un apprentissage par renforcement agentique et une distillation sur politique à multiples enseignants. Xiaomi rapporte des scores post-entraînement de 56,1 sur SWE-bench Pro, 65,8 sur Terminal-Bench 2.0 et 62,1 Pass³ sur la partie générale de Claw-Eval pour V2.5.

Pro est plus explicitement optimisé pour l’ingénierie logicielle à long horizon. Xiaomi décrit des centaines d’appels d’outils dans des trajectoires soutenues et publie un résultat de 78,9 % sur SWE-bench Verified.

Une étude de cas officielle montre Pro réalisant un compilateur SysY en 4,3 heures avec 672 appels d’outils et l’ensemble des 233 tests validés. La leçon n’est pas que chaque demande de codage nécessite Pro ; c’est que de petites différences de fiabilité peuvent déterminer si un flux de travail avec des centaines d’actions dépendantes aboutit.

MiMo-V2.5 vs MiMo-V2.5-Pro Quel modèle Xiaomi est le meilleur ?

Figure officielle des benchmarks de codage et d’agents de Xiaomi.

Long contexte : même capacité, charges de travail différentes

Les deux modèles offrent une fenêtre de contexte de 1 M de jetons et jusqu’à 128 K jetons de sortie via l’API actuelle de Xiaomi. La taille brute du contexte ne les différencie donc pas.

V2.5 est attrayant lorsque le long contexte inclut du matériel multimédia tel que de la vidéo, des images de documents ou des traces d’agents visuels. Pro est le modèle à tester lorsque le contexte lui-même devient le problème de raisonnement : un grand dépôt, un long contrat, un corpus de recherche ou une trajectoire d’agent contenant de nombreuses actions séquentielles.

Une grande fenêtre de contexte décrit une capacité, pas une fidélité de raisonnement garantie. Évaluez la récupération, la rétention d’instructions et l’usage des preuves aux longueurs qui comptent pour l’application.

Prix et efficacité coût

Les tarifs à l’usage à l’étranger de Xiaomi rendent le compromis clair.

Tarification — grille tarifaire officielleV2.5ProRatio
Entrée non mise en cache par 1 M de jetons0,14 $0,435 $3,11×
Entrée mise en cache par 1 M de jetons0,0028 $0,0036 $1,29×
Sortie par 1 M de jetons0,28 $0,87 $3,11×
Fenêtre de contexte1 M1 MIdentique
Sortie maximale128 K128 KIdentique

Une requête avec 1 M de jetons d’entrée non mis en cache et 200 K jetons de sortie coûte environ 0,196 $ sur V2.5 et 0,609 $ sur Pro avant les hits de cache, les frais de recherche web ou la facturation spécifique au fournisseur.

La différence de prix sur le cache est plus faible : Pro est environ 29 % plus cher pour l’entrée avec cache-hit plutôt que 211 % plus cher. Les agents de longue durée avec des invites système stables, des définitions d’outils ou des préfixes de dépôt devraient donc mesurer leur taux réel de cache-hit.

Estimez le coût par tâche réussie. Un agent Pro qui achève un flux de travail difficile une fois peut coûter moins cher que des tentatives répétées échouées sur un modèle moins cher.

Quel modèle devez-vous utiliser ?

Charge de travail — recommandations officiellesMeilleur choixPourquoi
Chat texte de routineV2.5Coût plus faible ; Pro souvent inutile
Génération à haut volumeV2.5Prix standard des jetons environ 3,1× plus bas
Compréhension d’images, vidéo ou audioV2.5Entrée multimodale native
Appel d’outils de routineV2.5Forte capacité d’agent à moindre coût
Mathématiques et sciences difficilesProGains de benchmark plus importants
Programmation à l’échelle d’un dépôtProConçu pour l’ingénierie logicielle complexe
Centaines d’appels d’outils dépendantsProMeilleure adéquation pour l’exécution soutenue
Fenêtre de contexte de 1 M sensible au coûtV2.5Même contexte nominal à un coût bien plus faible

Résultat de la sélection : V2.5 est le défaut pour les applications multimodales, les agents de routine et les charges sensibles aux coûts. Pro est la mise à niveau pour le raisonnement difficile, l’ingénierie logicielle complexe et les trajectoires autonomes longues.

Une meilleure stratégie de production : router entre les deux

Un choix de modèle global unique est souvent inutile. Routez les requêtes multimodales et de routine vers V2.5, puis n’escaladez vers Pro que le raisonnement textuel difficile, le codage complexe ou l’exécution à long horizon.

Dimension d’évaluationMesurePourquoi c’est importantSignal de routage
AchèvementTâches réussies / tentativesCapture la fiabilité de bout en boutEscalader les classes à faible achèvement
QualitéScore humain ou selon une grilleEmpêche le coût en jetons de dominerEscalader les tâches à enjeux élevés
Fiabilité des outilsErreurs et réessaisDe petites erreurs se cumulent dans les agentsEscalader les longues trajectoires
LatenceTemps jusqu’au résultat acceptéInclut la surcharge de réessaiGarder les tâches interactives légères
CoûtDépense par tâche acceptéeReflète les échecs et relancesUtiliser le modèle le moins cher qui réussit

Tester les deux API dans CometAPI

API MiMo-V2.5 dans CometAPI et API MiMo-V2.5-Pro dans CometAPI permettent une évaluation côte à côte via une couche d’agrégation unique. Envoyez les mêmes prompts, instructions système, outils et limites de sortie aux deux modèles, puis comparez le succès des tâches et le coût.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

models = ["mimo-v2.5", "mimo-v2.5-pro"]
prompt = """
Review this implementation plan.
Identify hidden technical risks and propose the three highest-priority fixes.
"""

for model in models:
    response = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        max_tokens=2000,
    )
    print(f"\n--- {model} ---")
    print(response.choices[0].message.content)

Exécutez un lot représentatif contenant des requêtes simples, du raisonnement difficile, de l’édition de code, des tâches à long contexte et des appels d’outils d’agents. Enregistrez le taux d’achèvement, les jetons, la latence, les erreurs d’outils, les réessais, la qualité des réponses et le coût par tâche réussie.

Limitations

Limitations de V2.5

La base linguistique plus petite laisse des performances sur la table à mesure que la difficulté du raisonnement augmente. L’écart est modeste sur BBH mais devient bien plus grand sur GPQA-Diamond et MATH. Une fenêtre de contexte de 1 M de jetons ne doit pas non plus être confondue avec une fidélité de raisonnement garantie à 1 M de jetons.

Limitations de Pro

Les prix ordinaires d’entrée et de sortie de Pro sont environ 3,1× ceux de V2.5, et son entrée uniquement texte le rend inadapté comme remplacement direct pour les applications multimodales. Le modèle à poids ouverts de 1,02 T de paramètres est aussi un projet exigeant en auto-hébergement, même si 42 B de paramètres sont activés par jeton.

Verdict final

Choisissez V2.5 pour les applications multimodales, les agents de routine et la production sensible aux coûts. Choisissez Pro pour le raisonnement difficile, l’ingénierie logicielle complexe et les agents autonomes de longue durée. Pour des charges mixtes, routez la plupart du trafic vers V2.5 et n’escaladez que les requêtes dont la difficulté ou la longueur de trajectoire justifie le coût accru.

FAQ

Le modèle Pro est-il toujours meilleur que V2.5 ?

Non. Pro est plus performant sur le raisonnement textuel difficile et la programmation, mais V2.5 prend en charge l’entrée image, vidéo et audio et est nettement moins cher.

Les deux modèles prennent-ils en charge une fenêtre de contexte de 1 M de jetons ?

Oui. Les deux annoncent 1 M de jetons de contexte et jusqu’à 128 K jetons de sortie. Les applications doivent néanmoins tester la récupération et le raisonnement aux longueurs réellement utilisées.

Quel modèle un agent multimodal doit-il utiliser ?

Commencez avec V2.5 car il accepte nativement les entrées visuelles et audio. Pro cible actuellement les flux de travail à entrée texte.

Quand le Pro justifie-t-il son prix plus élevé ?

Il est le plus défendable lorsque de meilleures fiabilités de raisonnement affectent la complétion de mathématiques difficiles, de programmation à l’échelle d’un dépôt ou de longues trajectoires contenant de nombreux appels d’outils dépendants.

Les systèmes de production doivent-ils n’utiliser qu’un seul modèle ?

Pas nécessairement. Une couche de routage peut conserver le travail de routine et multimodal sur V2.5 tout en escaladant le raisonnement textuel difficile et les tâches d’agents vers Pro.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Oct 6, 2026
Dernière mise à jour Oct 6, 2026
0 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

En savoir plus