Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
guide/Recherche CometAPI

Comment utiliser l'API MiMo-V2.5 : guide complet pour les développeurs

Apprenez les spécifications de l’API Xiaomi, les benchmarks, la tarification, les requêtes multimodales, le streaming, l’intégration Python et les meilleures pratiques de production.

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Oct 7, 2026 12 min de lecture
Comment utiliser l'API MiMo-V2.5 : guide complet pour les développeurs
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

L’API MiMo-V2.5 dans CometAPI donne accès au modèle à mélange d'experts parcimonieux (sparse MoE) de Xiaomi pour le codage, la compréhension multimodale et les charges de travail agentiques. L’API MiMo-V2.5 est le choix pragmatique par défaut lorsqu’un projet nécessite une fenêtre de contexte d’1 million de tokens, une entrée multimodale native et un coût de token faible ; MiMo-V2.5 Pro convient mieux lorsque les tâches de codage difficiles, le raisonnement ou l’usage d’outils à long horizon priment sur le prix. Ce guide montre comment appeler l’API via CometAPI, diffuser les réponses en streaming, structurer des requêtes multimodales, estimer les coûts et durcir une intégration en production.

Principaux enseignements

  • Le modèle MiMo-V2.5 utilise 310B paramètres au total avec 15B paramètres actifs par token et prend en charge une fenêtre de contexte de 1M de tokens.
  • Utilisez la route MiMo-V2.5 pour le travail multimodal, l’analyse sur large contexte et les agents sensibles aux coûts ; choisissez MiMo-V2.5 Pro pour les tâches de codage et de raisonnement les plus difficiles.
  • Le point de terminaison compatible OpenAI facilite la migration, mais les systèmes de production doivent tout de même implémenter des délais, une logique de retry, des budgets de tokens et des vérifications de capacités côté fournisseur.
  • Aux tarifs CometAPI indiqués, une requête avec 10 000 tokens d’entrée et 2 000 tokens de sortie coûte environ 0,001568 $ sur la route MiMo-V2.5.

Présentation du modèle MiMo-V2.5

Xiaomi a présenté le modèle le 22 avril 2026. MiMo-V2.5 API dans CometAPI l’expose via une interface de chat-completions compatible OpenAI, de sorte que les clients existants peuvent généralement migrer en changeant l’URL de base, la clé API et l’identifiant du modèle.

Selon la fiche officielle du modèle, le modèle combine une colonne vertébrale linguistique MoE parcimonieuse avec des encodeurs dédiés pour la vision et l’audio. Il accepte des entrées texte, image, vidéo et audio tout en produisant une sortie texte. Sa large fenêtre de contexte est utile pour la revue de code à l’échelle d’un dépôt, les ensembles de documents, les longues transcriptions et les agents multi‑étapes.

SpécificationValeurPourquoi c’est important
ArchitectureMélange d’experts parcimonieuxN’active qu’une partie limitée du réseau pour chaque token.
Paramètres totaux310BOffre une large capacité sans utiliser tous les paramètres/token.
Param. actifs15BPermet une inférence efficace par rapport à la taille totale.
Fenêtre de contexte1 000 000 tokensGère de grands dépôts et de longs ensembles de documents.
Sortie maximaleJusqu’à 128K tokens via la route actuellePrend en charge de longs rapports et du code étendu.
Entrées nativesTexte, image, vidéo, audioPermet des workflows multimodaux unifiés.
Modalité de sortieTexteLes réponses sont renvoyées sous forme de texte généré.
Encodeur visionViT de 729M paramètresTraite le contenu visuel pour les tâches image/vidéo.
Encodeur audioTransformer de 261M paramètresTraite la parole et d’autres entrées audio.
LicenceMITAutorise un large usage commercial et recherche selon les termes.

L’image de benchmark multimodal officielle ci‑dessous rapporte des résultats sur la compréhension d’images, les agents multimodaux et la compréhension vidéo.

Comment utiliser l'API MiMo-V2.5 : guide complet pour les développeurs

Comparaison officielle des benchmarks multimodaux Xiaomi MiMo‑V2.5

Les routes des fournisseurs peuvent exposer un ensemble de formats média plus restreint que celui pris en charge par le modèle sous‑jacent. Validez le format exact des images, de l’audio et de la vidéo accepté par le point de terminaison actif avant de livrer une fonctionnalité multimodale.

Performances de benchmark de MiMo-V2.5

Xiaomi rapporte de bons résultats en codage, usage du terminal et évaluation d’agents multimodaux. Ces chiffres sont utiles pour situer le modèle, mais ils ne remplacent pas des tests sur vos propres prompts, outils, objectifs de latence et conditions d’échec.

BenchmarkScore rapportéFocalisation de l’évaluation
SWE-Bench Pro56.1Ingénierie logicielle au niveau dépôt
Terminal-Bench 2.065.8Tâches d’agents basées sur terminal
Claw-Eval General62.1 Pass@3Capacité générale d’agent
Claw-Eval Multimodal23.8 Pass@3Tâches d’agent multimodal
Claw-Eval Multi-Turn63.2 Pass@3Comportement d’agent multi‑tour
ResearchClawBench16.91Workflows d’agent orientés recherche

La comparaison de codage officielle indique 65,8 sur Terminal-Bench 2.0 et 56,1 sur SWE-Bench Pro, tout en plaçant le modèle dans une comparaison plus large d’agents de codage.

Comment utiliser l'API MiMo-V2.5 : guide complet pour les développeurs

Comparaison officielle des benchmarks de codage Xiaomi MiMo‑V2.5

Ce que suggèrent les résultats : le modèle est particulièrement attractif pour les applications qui combinent code, outils et médias mixtes. Pour des décisions de production déterministes, exécutez une évaluation interne qui mesure le succès des tâches, l’usage de tokens, la latence de bout en bout, la fréquence des retries et le taux de correction humaine.

MiMo-V2.5 vs MiMo-V2.5 Pro : une comparaison multidimensionnelle

DimensionMiMo-V2.5MiMo-V2.5-Pro
Paramètres totaux310B1,02T
Paramètres actifs15B42B
Fenêtre de contexte1M tokens1M tokens
Force principaleCharges de travail omnimodales et agents générauxAgents complexes et codage exigeant
Prix entrée par 1M tokens0,112 $0,348 $
Prix sortie par 1M tokens0,224 $0,696 $
Cas d’usage idéalMultimodal, large contexte, systèmes sensibles au coûtRaisonnement difficile, codage et exécution longue
Entrées API officiellesTexte, image, vidéo, audioTexte
Sortie API officielleTexteTexte

Résultat de la comparaison : commencez avec la route MiMo-V2.5 lorsque le coût, le débit ou la couverture multimodale guident la décision. Redirigez certaines requêtes vers MiMo-V2.5 Pro lorsque vos évaluations internes montrent un gain d’exactitude significatif sur les cas de codage, de raisonnement ou d’usage d’outils difficiles. Un routeur à paliers offre souvent un meilleur équilibre coût‑qualité que l’envoi de toutes les requêtes vers MiMo‑V2.5 Pro.

Comment appeler l’API MiMo-V2.5

L’API suit le schéma familier des chat-completions. Conservez la clé sur votre serveur, chargez‑la depuis une variable d’environnement et ne l’intégrez jamais dans un code navigateur ou mobile.

Définir la clé API

export COMETAPI_KEY="your_api_key_here"

$env:COMETAPI_KEY = "your_api_key_here"


### Envoyer une requête cURL

curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'


### Utiliser Python avec le SDK OpenAI

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)

print(response.choices[0].message.content)


> Ne journalisez pas les clés API, les en-têtes d’autorisation complets ou le contenu sensible des prompts. Utilisez un gestionnaire de secrets en production et faites tourner les identifiants selon un calendrier défini.

## Comment diffuser les réponses de l’API MiMo-V2.5

Le streaming réduit la latence perçue pour les longues réponses. Le service renvoie des événements incrémentaux, que le SDK expose sous forme de morceaux.

stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)

for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)


Dans un service web, relayer les deltas via Server‑Sent Events ou WebSocket, gérer les déconnexions clients et arrêter la génération en amont lorsque l’utilisateur annule.

## Workflows multimodaux et structurés avec l’API MiMo-V2.5

Pour les tâches sensibles à l’image, envoyez une instruction texte plus un objet image dans le même message utilisateur. La représentation exacte des médias acceptée peut varier selon la route fournisseur ; traitez ceci comme un motif de charge utile et confirmez la prise en charge actuelle de la route.

{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}


Pour une sortie lisible par machine, demandez un objet JSON compact et validez‑le contre votre propre schéma. N’assumez jamais que du JSON généré est sûr simplement parce qu’il se parse.

import json

raw = response.choices[0].message.content
result = json.loads(raw)

required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")


## Tarification de l’API MiMo-V2.5 sur CometAPI et contrôle des coûts

| Route                          | Entrée par 1M tokens | Sortie par 1M tokens | Exemple pour 100 requêtes |
| ------------------------------ | -------------------- | -------------------- | ------------------------- |
| MiMo-V2.5                      | 0,112 $              | 0,224 $              | 0,1568 $                  |
| MiMo-V2.5 Pro                  | 0,348 $              | 0,696 $              | 0,4872 $                  |
| Référence Xiaomi à l’usage     | 0,14 $               | 0,28 $               | 0,1960 $                  |

L’exemple suppose 100 requêtes, chacune avec 10 000 tokens d’entrée et 2 000 tokens de sortie. Dans ces conditions, la route MiMo-V2.5 est environ 68 % moins chère que MiMo-V2.5 Pro. Les [tarifs publiés à l’usage de Xiaomi](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) offrent un point de référence utile, tandis que les factures réelles doivent être vérifiées par rapport au prix fournisseur actif avant déploiement.

MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568

Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872


Maîtrisez les coûts avec des limites de sortie maximale, la compression des prompts, du contexte mis en cache, la classification des requêtes et un routeur qui n’escalade que les tâches difficiles. Suivez le coût par tâche réussie plutôt que le coût par requête ; une requête moins chère qui échoue à répétition peut coûter plus cher au final.

## Comment concevoir des requêtes long-contexte pour l’API MiMo-V2.5

Une fenêtre de 1M de tokens rend possibles des entrées plus grandes, mais n’élimine pas les compromis de récupération et d’attention. Construisez le prompt pour que le modèle localise rapidement les preuves pertinentes.

* Placez la tâche, le contrat de sortie et les critères de décision au début.
* Séparez les documents avec des identifiants stables et des délimiteurs clairs.
* N’incluez que les éléments susceptibles d’influencer la réponse.
* Demandez au modèle de citer des identifiants de documents ou des références de lignes dans son résultat.
* Mesurez la précision à mesure que le contexte grandit ; ne traitez pas le contexte maximal comme le contexte idéal.

> Un long contexte augmente à la fois le coût en tokens et le risque que du contenu non pertinent distraie le modèle. La récupération, la synthèse et le prompting hiérarchique restent importants même lorsque l’ensemble du corpus tient dans la fenêtre.

## Fiabilité en production

### Retenter uniquement les échecs transitoires

Retentez les limites de débit et les défaillances serveur temporaires avec backoff exponentiel et jitter. Ne réessayez pas automatiquement les authentifications invalides, les charges utiles mal formées ou les erreurs de politique.

import random
import time

def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())

for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))


### Mettre en place des garde‑fous opérationnels

* Utilisez des timeouts de connexion et de requête globale.
* Attachez une clé d’idempotence aux workflows à effets externes.
* Enregistrez l’ID du modèle, la latence, les tokens entrants et sortants, le nombre de retries et l’état final.
* Masquez les secrets et données personnelles avant journalisation.
* Exigez des allowlists d’outils et une confirmation pour les actions destructrices.
* Maintenez un modèle ou une file d’attente de secours pour les pannes fournisseur.

## Erreurs courantes de l’API MiMo-V2.5 et solutions

| Symptôme      | Cause probable                               | Action recommandée                                              |
| ------------- | --------------------------------------------- | ---------------------------------------------------------------- |
| 401 ou 403    | Clé API manquante, invalide ou non autorisée  | Vérifiez le secret côté serveur et les permissions du projet.    |
| 400           | Messages mal formés ou média non pris en charge | Validez le JSON et confirmez la prise en charge spécifique à la route. |
| 413           | Corps de requête trop volumineux              | Réduisez la taille du média ou découpez l’entrée.                |
| 429           | Limite de débit ou de quota                   | Reculez avec jitter et imposez des limites de concurrence côté client. |
| 5xx           | Défaillance fournisseur temporaire            | Retentez dans un budget borné ou basculez.                       |
| Réponse lente | Contexte large, sortie longue ou latence outil | Diffusez en streaming, limitez les tokens et profilez chaque étape. |
| JSON invalide | Dérive de génération                          | Validez, réparez une fois si sûr, et rejetez les échecs persistants. |

## Conclusion

Le modèle MiMo-V2.5 est le meilleur point de départ pour les équipes ayant besoin d’entrées multimodales, d’un large contexte et d’un contrôle agressif des coûts. Pro doit être une escalade délibérée pour les tâches où des gains de qualité mesurés justifient le prix plus élevé. Commencez avec un petit jeu d’évaluation, instrumentez chaque requête et promouvez l’intégration uniquement après avoir testé les charges utiles réelles, le comportement long‑contexte, la gestion des retries et la reprise sur échec.

## FAQ

### Quel point de terminaison dois-je utiliser ?

Utilisez `/api.cometapi.com/v1/chat/completions`, ou définissez `/api.cometapi.com/v1` comme URL de base dans un SDK compatible OpenAI.

### Quel identifiant de modèle dois-je envoyer ?

Utilisez `mimo-v2.5` pour la route MiMo-V2.5. Confirmez l’identifiant actuel avant le lancement si votre compte utilise un alias spécifique fournisseur.

### Quand choisir MiMo-V2.5 Pro ?

Choisissez MiMo-V2.5 Pro lorsque votre évaluation montre un avantage significatif sur les tâches de codage, de raisonnement ou d’outils de longue durée. Gardez le trafic routinier ou multimodal sur la route MiMo-V2.5 lorsque sa qualité est suffisante.

### Une fenêtre de 1M de tokens signifie-t-elle que je dois tout envoyer ?

Non. Un grand contexte est une limite de capacité, pas un objectif de conception de prompt. Récupérez et organisez les preuves susceptibles d’influencer la réponse, puis mesurez la qualité et le coût à mesure que l’entrée grandit.

### Puis-je appeler l’API directement depuis un navigateur ?

N’exposez pas une clé API secrète dans le code frontend. Appelez le fournisseur depuis votre backend et appliquez l’authentification, les limites de débit, la journalisation et les contrôles de données à cet endroit.

### Comment vérifier la prise en charge multimodale ?

Testez la charge utile média exacte contre la route fournisseur active. Les modalités natives du modèle ne garantissent pas que chaque route expose tous les formats de la même manière.
Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Oct 7, 2026
Dernière mise à jour Oct 7, 2026
1 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

En savoir plus