Spécifications techniques de MiMo-V2.5
| Spécification | MiMo-V2.5 |
|---|---|
| Model ID | mimo-v2.5 |
| Fournisseur | Xiaomi MiMo |
| Type de modèle | Modèle de fondation natif omni-modal |
| Architecture | Mélange d’experts (Mixture-of-Experts) clairsemé |
| Nombre total de paramètres | 310B |
| Paramètres activés | 15B |
| Fenêtre de contexte | 1M tokens |
| Sortie maximale | 128K tokens |
| Modalités d’entrée | Texte, Image, Vidéo, Audio |
| Sortie | Texte |
| Encodeur de vision | ViT de 729M paramètres |
| Encodeur audio | Audio Transformer de 261M paramètres |
| Appel d’outils, Recherche web, Sortie structurée, Streaming, Mise en cache du contexte | Oui |
| Licence | MIT |
L’architecture 310B/15B est particulièrement importante. MiMo-V2.5 n’est pas un modèle 15B au sens conventionnel ; 15B correspond au nombre de paramètres activés pour chaque token, tandis que la MoE complète contient 310B paramètres. Le modèle utilise 256 experts routés et en active huit par token.
Qu’est-ce que MiMo-V2.5 ?
MiMo-V2.5 est le modèle multimodal de nouvelle génération de Xiaomi, conçu spécifiquement autour de la perception omni-modale et des applications agentiques.
Contrairement à un LLM textuel classique, MiMo-V2.5 comprend nativement des images, des vidéos, de l’audio et du texte. Xiaomi le positionne pour des scénarios d’agents à long contexte et multimodaux où le modèle doit percevoir l’information, raisonner dessus, puis utiliser des outils ou exécuter des actions.
Il y a également un point important pour les développeurs dans la version actuelle : Xiaomi a déprécié les anciens modèles MiMo-V2 le 30 juin 2026 et recommande la migration vers la série V2.5.
Cela fait de mimo-v2.5 l’ID de modèle pertinent pour les nouvelles intégrations, plutôt que les anciens mimo-v2-pro, mimo-v2-omni ou mimo-v2-flash.
Quelles sont les principales fonctionnalités de MiMo-V2.5 ?
Compréhension omni-modale native
La caractéristique déterminante de MiMo-V2.5 est que la multimodalité est intégrée directement au modèle.
Il accepte :
- Texte
- Images
- Vidéo
- Audio
Cela permet aux développeurs de créer des applications qui raisonnent à travers plusieurs types d’information, au lieu de traiter indépendamment chaque modalité et de transmettre les résultats à un LLM textuel. Xiaomi décrit cela comme une perception multimodale native complète.
Un exemple pratique est un agent d’analyse vidéo qui reçoit une longue vidéo accompagnée d’une piste audio et d’une question textuelle, puis identifie des événements, explique ce qui s’est passé et produit une réponse structurée.
Fenêtre de contexte de 1M tokens
MiMo-V2.5 prend en charge 1 million de tokens de contexte et jusqu’à 128K tokens de sortie.
Cela rend le modèle particulièrement intéressant pour :
- L’analyse de documents volumineux
- La compréhension de longues vidéos
- La programmation au niveau du dépôt
- Les sessions de recherche longues
- Les agents multi-étapes
- Les conversations prolongées
- Les grandes bases de connaissances d’entreprise
Le contexte 1M n’est pas seulement un chiffre marketing. Xiaomi identifie spécifiquement le suivi de longues vidéos, l’analyse de documents étendus et le raisonnement temporel prolongé comme charges de travail cibles.
Utilisation agentique des outils
MiMo-V2.5 prend en charge l’appel de fonctions, la recherche web, la sortie structurée et le streaming.
Cela le rend nettement plus utile pour les applications d’agents qu’un modèle limité à la génération de texte.
Un flux de travail typique peut ressembler à :
Percevoir → Raisonner → Rechercher → Appeler un outil → Analyser le résultat → Continuer
C’est particulièrement utile pour les agents de recherche, les assistants de programmation, les agents de support client et l’automatisation multimodale.
Efficacité de la MoE clairsemée
MiMo-V2.5 utilise une architecture MoE clairsemée de 310B paramètres avec seulement 15B paramètres activés par token.
Son backbone contient 48 couches, dont 39 couches d’attention à fenêtre glissante et neuf couches à attention complète. Le design hybride vise à rendre les contextes très longs plus gérables sur le plan computationnel.
La distinction importante pour les développeurs est que le nombre de paramètres activés ne doit pas être interprété comme les exigences mémoire totales. L’auto-hébergement d’un modèle de 310B paramètres reste une entreprise d’infrastructure substantielle.
Attention hybride à fenêtre glissante
MiMo-V2.5 combine une attention à fenêtre glissante avec une attention globale.
Son architecture utilise une fenêtre SWA de 128 tokens, avec 39 couches SWA et neuf couches à attention complète.
Ce choix architectural est particulièrement pertinent pour la capacité de contexte à 1M tokens du modèle, car maintenir une attention complète à chaque couche rendrait l’inférence sur long contexte nettement plus coûteuse.
Prédiction multi-token
MiMo-V2.5 inclut trois couches MTP avec environ 329M paramètres. La conception MTP vise à améliorer l’efficacité d’inférence via le décodage spéculatif et à favoriser un entraînement par apprentissage par renforcement plus efficace.
Comment MiMo-V2.5 se comporte-t-il sur les benchmarks ?
MiMo-V2.5 a publié des résultats de benchmark couvrant le codage, les agents terminal, les agents de recherche et les tâches d’agents multimodaux. La fiche modèle actuelle sur Hugging Face rapporte les résultats suivants :
| Benchmark | MiMo-V2.5 | Objectif de l’évaluation |
|---|---|---|
| SWE-Bench Pro | 56.1 | Ingénierie logicielle |
| Terminal-Bench 2.0 | 65.8 | Tâches terminal/agent |
| Claw-Eval General | 62.1 Pass³% | Capacité d’agent générale |
| Claw-Eval Multimodal | 23.8 Pass³% | Capacité d’agent multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass³% | Agents multi-tours |
| ResearchClawBench | 16.91 | Tâches d’agent de recherche |
Ces chiffres doivent être interprétés avec prudence.
Le résultat de 56.1 sur SWE-Bench Pro indique une capacité significative en ingénierie logicielle, tandis que le score de 65.8 sur Terminal-Bench 2.0 est particulièrement pertinent pour les agents qui interagissent avec des terminaux et des environnements de développement.
En même temps, la différence entre le score Claw-Eval général (62.1) et le score multimodal (23.8) est un avertissement utile : une forte performance générale d’agent ne signifie pas automatiquement une performance équivalente sur chaque tâche d’agent multimodal.
Pour l’évaluation en production, les développeurs devraient donc tester leur propre charge de travail plutôt que de se fier à un seul chiffre de classement.
Comment MiMo-V2.5 se compare-t-il à MiMo-V2.5-Pro ?
MiMo-V2.5 et MiMo-V2.5-Pro appartiennent à la même génération V2.5 mais ont des objectifs d’optimisation différents.
| Spécification | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Nombre total de paramètres | 310B | 1.02T |
| Paramètres activés | 15B | 42B |
| Contexte | 1M | 1M |
| Entrée multimodale | Texte/Image/Vidéo/Audio | Axée agent |
| Positionnement principal | Agents omni-modaux | Agents complexes et programmation |
| Experts routés | 256 | 384 |
| Experts par token | 8 | 8 |
| Couches LLM | 48 | 70 |
| Couches MTP | 3 | 3 |
La distinction est simple :
Choisissez MiMo-V2.5 pour une compréhension multimodale native et des agents généraux efficaces. Choisissez MiMo-V2.5-Pro pour les charges de travail d’agent les plus difficiles en raisonnement, programmation et long horizon.
Le guide de sélection de modèles de Xiaomi recommande mimo-v2.5 spécifiquement pour la compréhension de contenu image, audio et vidéo, tandis qu’il recommande mimo-v2.5-pro pour le raisonnement complexe et le traitement de longs documents.
Cas d’usage de MiMo-V2.5
Agents d’IA multimodaux
MiMo-V2.5 peut servir de modèle central pour des agents qui doivent inspecter des documents, des images, des vidéos et de l’audio avant de décider de l’action à entreprendre.
Analyse de documents à long contexte
La fenêtre de contexte de 1M tokens le rend adapté à l’analyse de :
- Grandes collections de documents juridiques
- Documentation technique
- Archives de recherche
- Grandes bases de code
- Bases de connaissances d’entreprise
Agents de programmation
Les benchmarks d’agent du modèle et ses capacités d’utilisation d’outils le rendent adapté aux assistants de programmation qui doivent inspecter des dépôts, raisonner sur des bugs, exécuter des outils et itérer sur des solutions.
Compréhension vidéo
Plutôt que de traiter la génération vidéo comme sa finalité principale, MiMo-V2.5 utilise la vidéo comme modalité d’entrée pour la compréhension.
Applications potentielles :
- Résumé de vidéo
- Questions-réponses sur longues vidéos
- Recherche vidéo
- Détection d’événements
- Analyse de vidéos éducatives
- Analyse d’images de sécurité
Assistants audio-visuels
Parce que le modèle accepte à la fois l’audio et l’information visuelle, les développeurs peuvent créer des assistants capables d’interpréter des instructions orales avec un contexte visuel.
Agents autonomes de longue durée
La combinaison d’un long contexte et d’un entraînement agentique rend MiMo-V2.5 adapté aux workflows où le modèle doit maintenir un état sur de nombreuses étapes intermédiaires plutôt que d’achever une tâche en une seule réponse.
Limitations de MiMo-V2.5
Les spécifications de MiMo-V2.5 sont impressionnantes, mais plusieurs limites pratiques méritent l’attention.
Premièrement, 1M de contexte ne signifie pas que chaque application atteindra des performances optimales à la fenêtre maximale. L’inférence sur long contexte implique toujours des considérations importantes de mémoire, de bande passante et de latence.
Deuxièmement, le modèle est un système MoE très large. Bien que seulement 15B paramètres soient activés par token, le modèle complet contient environ 310B paramètres, ce qui rend l’auto-hébergement nettement plus exigeant que l’exécution d’un petit modèle dense.
Troisièmement, les performances sur les benchmarks multimodaux peuvent varier significativement selon la tâche. Les résultats Claw-Eval montrent un score multimodal bien plus faible que le score général d’agent, ce qui renforce la nécessité de tests spécifiques à l’application.
Enfin, l’écosystème du modèle est encore plus récent que les écosystèmes matures entourant GPT, Claude et Gemini. Les développeurs devraient donc évaluer l’outillage, la compatibilité des fournisseurs, le comportement de sortie structurée et la fiabilité des appels d’outils avant de l’utiliser dans des systèmes de production critiques.
Comment utiliser l’API MiMo-V2.5 sur CometAPI
MiMo-V2.5 convient particulièrement à une plateforme d’agrégation d’API car il suit des schémas d’API compatibles avec les écosystèmes LLM établis. Xiaomi fournit elle-même un accès API compatible OpenAI et Anthropic.
Avec CometAPI, l’intégration peut suivre le même flux de base utilisé pour d’autres modèles pris en charge.
Étape 1 : Obtenir une clé API CometAPI
Créez ou connectez-vous à votre compte CometAPI et obtenez votre clé API.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
Étape 2 : Configurer le modèle MiMo-V2.5
Définissez le modèle sur :
mimo-v2.5
et utilisez le point de terminaison API compatible de CometAPI.
Le point de terminaison exact et le schéma de requête doivent être vérifiés par rapport à la documentation actuelle des modèles/API de CometAPI avant le déploiement.
Étape 3 : Construire des workflows multimodaux et d’agents
L’utilisation la plus intéressante de mimo-v2.5 n’est pas un simple chat textuel. Les développeurs peuvent combiner son raisonnement multimodal avec des outils externes pour créer des workflows tels que :
Entrée utilisateur → compréhension image/vidéo/audio → raisonnement → appel d’outil → analyse du résultat → action suivante
Cela rend le modèle particulièrement attractif pour des agents de recherche autonomes, des agents de programmation, des systèmes de support client multimodaux et des assistants d’entreprise à long contexte.
Pourquoi utiliser MiMo-V2.5 via CometAPI ?
MiMo-V2.5 est particulièrement utile dans un environnement d’API multi-modèles, car les développeurs peuvent vouloir le comparer à GPT, Claude, Gemini, DeepSeek ou d’autres modèles d’agent sans construire une pile d’infrastructure séparée pour chaque fournisseur.
CometAPI peut être utile lorsque votre application a besoin de :
- Une couche d’API unifiée
- Accès à plusieurs familles de modèles d’IA
- Un changement de modèle facilité
- Une gestion centralisée des clés API
- Une comparaison rapide des modèles
- Une couche d’intégration unique pour l’expérimentation et la production
Pour les équipes évaluant la performance des agents par rapport au coût d’inférence, MiMo-V2.5 mérite d’être testé aux côtés des modèles phares plus coûteux, plutôt que de supposer que le plus grand modèle propriétaire sera automatiquement le meilleur choix.