Caractéristiques techniques de MiMo‑V2.5‑Pro
| Spécification | MiMo‑V2.5‑Pro |
|---|---|
| Model ID | mimo-v2.5-pro |
| Provider | Xiaomi MiMo |
| Model type | Grand modèle de langage agentique |
| Architecture | Mélange d’experts clairsemé |
| Total parameters | 1.02T |
| Activated parameters | 42B |
| Context window | 1M tokens |
| Output | Texte |
| Attention architecture | Attention hybride SWA + attention globale |
| Training tokens | 27T |
| Maximum base-model context | 256K |
| Maximum Pro context | 1M |
| License | MIT |
La distinction entre 1.02T de paramètres au total et 42B de paramètres actifs est importante. MiMo‑V2.5‑Pro est un modèle MoE : chaque jeton n’active qu’un sous‑ensemble des paramètres disponibles. Cela modifie substantiellement son profil de calcul à l’inférence par rapport à un modèle dense de 1T de paramètres, bien que le modèle complet conserve des exigences considérables en matière de mémoire et de déploiement.
Quelles sont les principales fonctionnalités de MiMo‑V2.5‑Pro ?
1. Architecture MoE clairsemée à l’échelle du billion
MiMo‑V2.5‑Pro contient 1.02T de paramètres au total et 42B de paramètres activés.
Son architecture comporte 384 experts routés, avec huit experts activés pour chaque jeton. Le modèle possède 70 couches Transformer, comprenant une couche dense et 69 couches MoE.
Cela offre une capacité de représentation nettement supérieure au MiMo‑V2.5 standard tout en évitant le coût de calcul consistant à activer 1.02T de paramètres pour chaque jeton.
À retenir en pratique :
MiMo‑V2.5‑Pro est un modèle à un billion de paramètres par capacité totale, mais son calcul par jeton est gouverné par son chemin de 42B de paramètres actifs.
2. Contexte de 1 million de jetons
Le modèle prend en charge jusqu’à 1M de jetons de contexte.
C’est l’une de ses capacités les plus importantes pour les agents autonomes, car les flux de travail de longue durée peuvent accumuler :
- Résultats d’outils
- Code source
- Résultats de recherche
- Documentation
- État de raisonnement intermédiaire
- Instructions utilisateur
- Journaux d’exécution
Plutôt que de résumer et d’éliminer de manière répétée l’ancien contexte, un agent peut potentiellement conserver un historique de travail bien plus vaste.
L’évaluation long‑contexte de Xiaomi teste spécifiquement le modèle de 32K jusqu’à 1M jetons d’entrée.
3. Attention hybride à fenêtre glissante et globale
MiMo‑V2.5‑Pro utilise un ratio 6:1 d’attention à fenêtre glissante (SWA) par rapport à l’attention globale, avec une fenêtre de 128 jetons.
L’architecture contient :
- 60 couches SWA
- 10 couches à attention globale
- Fenêtre SWA de 128 jetons
Xiaomi indique que cette conception réduit le stockage du KV‑cache d’environ 7× tout en préservant les performances sur long contexte grâce à un biais de puits d’attention apprenable.
C’est l’un des aspects techniquement les plus significatifs du modèle.
Une fenêtre de contexte de 1M est coûteuse si chaque couche effectue une attention complète sur toute la séquence. L’attention hybride réduit la quantité d’informations auxquelles chaque couche doit prêter globalement attention, tout en conservant des couches dédiées à l’attention globale pour les relations longue portée.
4. Prédiction multi‑jetons
MiMo‑V2.5‑Pro contient trois modules MTP légers.
La prédiction multi‑jetons permet au modèle de prédire plusieurs jetons futurs d’une manière exploitable pour un décodage de type spéculatif et pour l’accélération de l’inférence.
Xiaomi rapporte que son architecture MTP peut tripler la vitesse de sortie à l’inférence dans la configuration de déploiement décrite.
Cela compte particulièrement pour les agents, car un agent peut générer de grandes quantités de sorties intermédiaires sur une longue trajectoire. Améliorer la vitesse de génération de jetons peut donc avoir un impact notable sur la latence totale des tâches.
5. Apprentissage par renforcement agentique
Le pipeline de post‑entraînement de MiMo‑V2.5‑Pro inclut :
- Affinage supervisé
- Apprentissage par renforcement agentique à grande échelle
- Distillation sur politique à enseignants multiples (MOPD)
L’objectif d’entraînement est explicitement orienté vers des comportements d’agent complexes plutôt que vers la seule réponse à des questions de benchmarks statiques.
C’est pourquoi ses meilleures évaluations se concentrent sur le codage, l’interaction en terminal, le raisonnement sur long contexte et les benchmarks d’agents.
6. Pré‑entraînement sur 27T de jetons
MiMo‑V2.5‑Pro a été pré‑entraîné sur environ 27 billions de jetons, en utilisant une précision mixte FP8 et une longueur de séquence native de 32K avant de prendre en charge la fenêtre de contexte étendue à 1M.
L’échelle du pré‑entraînement, combinée à l’architecture MoE à un billion de paramètres, place MiMo‑V2.5‑Pro résolument dans la classe des modèles de pointe actuels.
Comment MiMo‑V2.5‑Pro se comporte‑t‑il sur les benchmarks ?
Les résultats publiés sont particulièrement utiles car ils incluent à la fois des benchmarks de raisonnement général et des évaluations pratiques de codage/agents.
| Benchmark | Résultat MiMo‑V2.5‑Pro | Type d’évaluation |
|---|---|---|
| SWE-Bench Verified | 78.9 | Génie logiciel |
| SWE-Bench Pro | 57.2 | Génie logiciel |
| Terminal-Bench 2.0 | 68.4 | Agent terminal |
| GSM8K | 99.6 | Raisonnement mathématique |
| GPQA Diamond | 66.7 | Raisonnement de niveau master/doctorat |
| MMLU-Pro | 68.5 | Raisonnement général |
| MMLU | 89.4 | Connaissances générales/raisonnement |
| MMLU-Redux | 92.8 | Connaissances générales/raisonnement |
| HumanEval+ | 75.6 | Génération de code |
| MBPP+ | 74.1 | Programmation Python |
| LiveCodeBench v6 | 39.6 | Programmation compétitive |
| ARC-Challenge | 97.2 | Raisonnement |
| AIME 2024/2025 | 37.3 | Mathématiques de compétition |
Les résultats montrent un profil particulièrement fort en génie logiciel et raisonnement mathématique. Les 78.9 sur SWE‑Bench Verified et 68.4 sur Terminal‑Bench 2.0 sont particulièrement pertinents pour les développeurs construisant des systèmes de codage autonomes.
Performances sur long contexte
Les résultats sur long contexte sont sans doute plus intéressants que les benchmarks standards.
Sur l’évaluation GraphWalks, MiMo‑V2.5‑Pro maintient des performances mesurables à des longueurs de contexte extrêmes :
| Contexte | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi rapporte que le précédent MiMo‑V2‑Pro se détériore rapidement au‑delà de 128K et atteint 0.00 à 1M sur les deux sous‑tâches, tandis que V2.5‑Pro conserve des performances non nulles au plein contexte de 1M.
C’est une distinction significative : le contexte de 1M de MiMo‑V2.5‑Pro n’est pas seulement un maximum théorique ; l’évaluation long‑contexte publiée démontre des performances utiles jusque dans cette fenêtre.
Exemples d’agents en conditions réelles
| Tâche | Résultat rapporté |
|---|---|
| PKU SysY Compiler | 4.3 hours |
| Appels d’outils pendant la tâche de compilateur | 672 |
| Cas de test du compilateur réussis | 233/233 |
| Éditeur vidéo full‑stack | 11.5 hours |
| Code généré pour l’éditeur vidéo | 8,192 lines |
| Intervention humaine | Aucune rapportée |
| Appels d’outils à long horizon | Près de 1,000 |
Ce sont des démonstrations rapportées par Xiaomi plutôt que des scores de benchmarks standardisés.
MiMo‑V2.5‑Pro vs MiMo‑V2.5
Les deux modèles appartiennent à la même génération mais ciblent des charges de travail différentes.
| Spécification | MiMo‑V2.5 | MiMo‑V2.5‑Pro |
|---|---|---|
| Paramètres totaux | 310B | 1.02T |
| Paramètres actifs | 15B | 42B |
| Contexte | 1M | 1M |
| Couches | 48 | 70 |
| Experts routés | 256 | 384 |
| Experts/jeton | 8 | 8 |
| Couches à attention complète | 9 | 10 |
| Couches SWA | 39 | 60 |
| Objectif principal | Agents omnimodaux | Agents complexes/codage |
| Compréhension vidéo/audio/image | Oui | Principalement axé sur la langue/les agents |
| Performances d’agents à long horizon | Solides | Phare |
Le choix ne se résume donc pas à « le Pro est meilleur ».
Si une application a besoin d’une compréhension native des images, vidéos et de l’audio, MiMo‑V2.5 est le choix le plus naturel. Si la charge de travail est centrée sur le raisonnement complexe, le génie logiciel, l’interaction en terminal et les agents de longue durée, MiMo‑V2.5‑Pro est le mieux adapté.
Limites de MiMo‑V2.5‑Pro
1. Entrée du modèle limitée au texte
Contrairement à mimo-v2.5, les spécifications officielles du modèle Pro indiquent Texte comme modalité d’entrée. Il ne doit pas être présenté comme le modèle multimodal de la famille V2.5.
2. Exigences de calcul élevées pour l’auto‑hébergement
Le modèle a environ 1T de paramètres totaux / 42B de paramètres actifs, rendant le déploiement local nettement plus exigeant que les modèles ouverts conventionnels de petite taille.
3. Les performances des agents dépendent du framework
L’affirmation de Xiaomi proche de 1,000 appels d’outils est explicitement associée à l’utilisation d’un framework d’agent approprié. Le modèle seul ne garantit pas qu’une application atteindra les mêmes performances à long horizon.
4. Gestion du contenu de raisonnement
Les applications d’agents multi‑tours utilisant le mode de réflexion et des appels d’outils doivent préserver correctement reasoning_content. Une gestion incorrecte peut produire des erreurs d’API.
Meilleurs cas d’utilisation
Génie logiciel à grande échelle
- Migration de dépôts
- Refactorisation
- Débogage
- Génération de tests
- Développement de compilateurs
- Développement d’applications full‑stack
Agents de codage autonomes
MiMo‑V2.5‑Pro convient particulièrement aux agents qui doivent à plusieurs reprises :
inspecter → modifier → exécuter → tester → diagnostiquer → modifier
Raisonnement sur documents longs
Son contexte de 1M le rend utile pour :
- Contrats juridiques
- Spécifications techniques
- Grandes collections de recherche
- Documentation d’entreprise
Agents métier complexes
L’appel d’outils + la recherche web + les sorties structurées peuvent prendre en charge :
- Agents de recherche
- Agents de traitement de données
- Automatisation des workflows d’entreprise
- Systèmes de décision multi‑étapes
Comment utiliser l’API MiMo‑V2.5‑Pro sur CometAPI
L’identifiant de modèle CometAPI pertinent est :
mimo-v2.5-pro
Pour les développeurs, une couche d’agrégation d’API est particulièrement utile pour tester MiMo‑V2.5‑Pro face à d’autres modèles haut de gamme de raisonnement et d’agents sans maintenir des intégrations de fournisseurs indépendantes.
Étape 1 : Obtenir une clé d’API CometAPI
Créez ou connectez‑vous à votre compte CometAPI et obtenez votre clé d’API depuis la console API.
Définissez‑la comme variable d’environnement :
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Étape 2 : Configurer le client d’API
Xiaomi fournit une API compatible avec les protocoles OpenAI et Anthropic, ce qui rend la migration relativement simple. Pour une intégration en production, utilisez le point de terminaison/le schéma CometAPI actuel pour mimo-v2.5-pro, en particulier si vous avez besoin de fonctionnalités avancées telles que l’appel d’outils, le streaming, les sorties structurées ou des requêtes à long contexte.
Étape 3 : Connecter MiMo‑V2.5‑Pro à des outils
Le modèle devient nettement plus utile lorsqu’il est connecté à des outils externes.
Par exemple :
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Cette architecture correspond bien mieux à l’usage prévu du modèle qu’une simple intégration de type chatbot.