Technische specificaties van MiMo-V2.5-Pro
| Specificatie | MiMo-V2.5-Pro |
|---|---|
| Model-ID | mimo-v2.5-pro |
| Provider | Xiaomi MiMo |
| Modeltype | Agentgericht groot taalmodel |
| Architectuur | Sparse Mixture-of-Experts |
| Totaal aantal parameters | 1.02T |
| Geactiveerde parameters | 42B |
| Contextvenster | 1M tokens |
| Uitvoer | Tekst |
| Attention-architectuur | Hybride SWA + Global Attention |
| Trainingstokens | 27T |
| Maximale basismodelcontext | 256K |
| Maximale Pro-context | 1M |
| Licentie | MIT |
Het onderscheid tussen 1.02T totale parameters en 42B actieve parameters is belangrijk. MiMo-V2.5-Pro is een MoE-model: elke token activeert slechts een subset van de beschikbare parameters. Dat verandert het berekeningsprofiel tijdens inferentie aanzienlijk vergeleken met een dicht 1T-parameter-model, hoewel het complete model nog steeds enorme geheugen- en implementatievereisten heeft.
Wat zijn de belangrijkste kenmerken van MiMo-V2.5-Pro?
1. Sparse MoE-architectuur op biljoenschaal
MiMo-V2.5-Pro bevat 1.02T totale parameters en 42B geactiveerde parameters.
De architectuur bevat 384 gerouteerde experts, waarbij acht experts per token worden geactiveerd. Het model heeft 70 transformerlagen, bestaande uit één dichte laag en 69 MoE-lagen.
Dit biedt aanzienlijk meer representatiecapaciteit dan de standaard MiMo-V2.5, terwijl de rekenkosten van het activeren van alle 1.02T parameters per token worden vermeden.
De praktische conclusie is:
MiMo-V2.5-Pro is een model met biljoen-parameters qua totale capaciteit, maar de per-tokenberekening wordt bepaald door het pad met 42B actieve parameters.
2. Context van 1 miljoen tokens
Het model ondersteunt tot 1M tokens aan context.
Dit is een van de belangrijkste mogelijkheden voor autonome agents, omdat langdurige workflows het volgende kunnen accumuleren:
- Tooluitvoer
- Broncode
- Zoekresultaten
- Documentatie
- Intermediaire redeneerstaat
- Gebruikersinstructies
- Uitvoeringslogs
In plaats van herhaaldelijk oude context te samenvatten en weg te gooien, kan een agent potentieel een veel grotere werkgeschiedenis behouden.
Xiaomi’s lang-contextevaluatie test het model specifiek van 32K tot 1M invoertokens.
3. Hybride Sliding-Window en Global Attention
MiMo-V2.5-Pro gebruikt een 6:1-verhouding van Sliding Window Attention (SWA) tot Global Attention, met een sliding window van 128 tokens.
De architectuur bevat:
- 60 SWA-lagen
- 10 lagen met global attention
- 128-token SWA-venster
Xiaomi rapporteert dat dit ontwerp de KV-cacheopslag met bijna 7× vermindert, terwijl de lange-contextprestaties behouden blijven via leerbare attention-sink bias.
Dit is een van de technisch meest significante onderdelen van het model.
Een contextvenster van 1M is kostbaar als elke laag volledige attention over de hele sequentie uitvoert. Hybride attention vermindert de hoeveelheid informatie waar elke laag globaal naar moet attendereen, terwijl toegewijde lagen met global attention behouden blijven voor langeafstandsrelaties.
4. Voorspelling van meerdere tokens
MiMo-V2.5-Pro bevat drie lichtgewicht MTP-modules.
Voorspelling van meerdere tokens stelt het model in staat meerdere toekomstige tokens te voorspellen op een manier die kan worden gebruikt voor speculatieve decodering en inferentieversnelling.
Xiaomi rapporteert dat de MTP-architectuur de uitvoersnelheid tijdens inferentie kan verdrievoudigen onder de beschreven implementatieconfiguratie.
Dit is vooral belangrijk voor agents, omdat een agent grote hoeveelheden intermediaire output kan genereren over een lange traject. Het verbeteren van de tokengeneratiesnelheid kan daarom een grote impact hebben op de totale taaklatentie.
5. Agentgerichte reinforcement learning
De post-trainingspijplijn van MiMo-V2.5-Pro omvat:
- Gecontroleerde fine-tuning
- Grootschalige agentgerichte reinforcement learning
- Multi-Teacher On-Policy Distillation (MOPD)
Het trainingsdoel is expliciet georiënteerd op complex agentgedrag in plaats van alleen statische benchmark-vraagbeantwoording.
Hierom zijn de sterkste evaluaties van het model geconcentreerd rond codering, terminalinteractie, redeneervermogen met lange context en agentbenchmarks.
6. Pretraining met 27T tokens
MiMo-V2.5-Pro werd gepretraind op ongeveer 27 biljoen tokens, met FP8-gemengde precisie en een native sequentielengte van 32K voordat de uitgebreide 1M-context werd ondersteund.
De schaal van pretraining, gecombineerd met de MoE-architectuur met biljoen-parameters, plaatst MiMo-V2.5-Pro duidelijk in de huidige frontier-modelklasse.
Hoe presteert MiMo-V2.5-Pro op benchmarks?
De gepubliceerde evaluatieresultaten zijn bijzonder nuttig omdat ze zowel algemene redeneerbenchmarks als praktische codeer/agent-evaluaties omvatten.
| Benchmark | MiMo-V2.5-Pro-resultaat | Evaluatietype |
|---|---|---|
| SWE-Bench Verified | 78.9 | Software-engineering |
| SWE-Bench Pro | 57.2 | Software-engineering |
| Terminal-Bench 2.0 | 68.4 | Terminal-agent |
| GSM8K | 99.6 | Wiskundige redenering |
| GPQA Diamond | 66.7 | Master-niveau redenering |
| MMLU-Pro | 68.5 | Algemene redenering |
| MMLU | 89.4 | Algemene kennis/redenering |
| MMLU-Redux | 92.8 | Algemene kennis/redenering |
| HumanEval+ | 75.6 | Codegeneratie |
| MBPP+ | 74.1 | Python-programmering |
| LiveCodeBench v6 | 39.6 | Competitieve codering |
| ARC-Challenge | 97.2 | Redenering |
| AIME 2024/2025 | 37.3 | Competitieve wiskunde |
De resultaten tonen een bijzonder sterk profiel in software-engineering en wiskundige redenering. De gerapporteerde 78.9 op SWE-Bench Verified en 68.4 op Terminal-Bench 2.0 zijn vooral relevant voor ontwikkelaars die autonome coderingssystemen bouwen.
Prestaties bij lange context
De lang-contextresultaten zijn wellicht interessanter dan de standaardbenchmarks.
Bij de GraphWalks-evaluatie behoudt MiMo-V2.5-Pro meetbare prestaties bij extreme contextlengtes:
| Context | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi rapporteert dat de vorige MiMo-V2-Pro snel verslechtert voorbij 128K en 0.00 bereikt op 1M bij beide subtaken, terwijl V2.5-Pro niet-nul prestaties behoudt bij de volledige 1M context.
Dit is een betekenisvol onderscheid: MiMo-V2.5-Pro’s 1M-context is niet slechts een theoretisch maximum; de gepubliceerde lang-contextevaluatie demonstreert nuttige prestaties diep in dat venster.
Voorbeelden van agents in de echte wereld
| Taak | Gerapporteerd resultaat |
|---|---|
| PKU SysY Compiler | 4.3 uur |
| Toolaanroepen tijdens compilertaak | 672 |
| Compiler-testcases geslaagd | 233/233 |
| Full-stack video-editor | 11.5 uur |
| Gegenereerde code voor video-editor | 8,192 regels |
| Menselijke interventie | Geen gerapporteerd |
| Langetermijn-toolaanroepen | Bijna 1.000 |
Dit zijn door Xiaomi gerapporteerde demonstraties in plaats van gestandaardiseerde benchmarkscores.
MiMo-V2.5-Pro vs MiMo-V2.5
De twee modellen delen dezelfde generatie maar richten zich op verschillende workloads.
| Specificatie | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Totaal aantal parameters | 310B | 1.02T |
| Actieve parameters | 15B | 42B |
| Context | 1M | 1M |
| Lagen | 48 | 70 |
| Gerouteerde experts | 256 | 384 |
| Experts/token | 8 | 8 |
| Lagen met full attention | 9 | 10 |
| SWA-lagen | 39 | 60 |
| Hoofdfocus | Omnimodale agents | Complexe agents/codering |
| Begrip van video/audio/afbeeldingen | Ja | Primair gericht op taal/agent |
| Langetermijn-agentprestaties | Sterk | Vlaggenschip |
De keuze is dus niet simpelweg “Pro is beter.”
Als een toepassing native beeld-, video- en audiobegrip nodig heeft, is MiMo-V2.5 de meer logische keuze. Als de workload draait om complexe redenering, software-engineering, terminalinteractie en langlopende agents, is MiMo-V2.5-Pro de sterkere fit.
Beperkingen van MiMo-V2.5-Pro
1. Alleen-tekst modelinvoer
In tegenstelling tot mimo-v2.5 vermeldt de officiële specificatie van het Pro-model Tekst als invoermodaliteit. Het mag niet worden gepresenteerd als het multimodale model binnen de V2.5-familie.
2. Hoge rekenvereisten voor zelfhosting
Het model heeft ongeveer 1T totale parameters / 42B actieve parameters, waardoor lokale implementatie aanzienlijk veeleisender is dan conventionele kleine open modellen.
3. Agentprestaties hangen af van het framework
Xiaomi’s claim van bijna 1.000 toolaanroepen is expliciet gekoppeld aan het gebruik van een geschikt Agent-framework. Het model alleen garandeert niet dat een toepassing dezelfde langetermijnprestaties zal behalen.
4. Behandeling van reasoning-content
Agenttoepassingen met meerdere rondes die denkmodus en toolaanroepen gebruiken, moeten reasoning_content correct behouden. Onjuiste behandeling kan API-fouten veroorzaken.
Beste toepassingsscenario’s
Grootschalige software-engineering
- Repositoriummigratie
- Refactoring
- Debuggen
- Testgeneratie
- Compilerontwikkeling
- Full-stack applicatieontwikkeling
Autonome codeeragents
MiMo-V2.5-Pro is bijzonder geschikt voor agents die herhaaldelijk moeten:
inspecteren → wijzigen → uitvoeren → testen → diagnosticeren → wijzigen
Redeneren over lange documenten
De 1M-context maakt het nuttig voor:
- Juridische contracten
- Technische specificaties
- Grote onderzoekscollecties
- Enterprise-documentatie
Complexe bedrijfsagents
Toolaanroepen + websearch + gestructureerde output kunnen ondersteunen:
- Onderzoeksagents
- Dataverwerkingsagents
- Automatisering van enterprise-workflows
- Besluitvormingssystemen met meerdere stappen
Hoe MiMo-V2.5-Pro-API te gebruiken op CometAPI
De relevante CometAPI-model-ID is:
mimo-v2.5-pro
Voor ontwikkelaars is een API-aggregatielaag bijzonder nuttig om MiMo-V2.5-Pro te testen tegen andere high-end redeneer- en agentmodellen zonder onafhankelijke providerintegraties te onderhouden.
Stap 1: Verkrijg een CometAPI-API-sleutel
Maak een CometAPI-account aan of log in en haal je API-sleutel op via de API-console.
Stel deze in als omgevingsvariabele:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Stap 2: Configureer de API-client
Xiaomi biedt een API die compatibel is met zowel OpenAI- als Anthropic-protocollen, wat migratie relatief eenvoudig maakt. Gebruik voor productie-integratie het huidige CometAPI-endpoint/-schema voor mimo-v2.5-pro, vooral als je geavanceerde functies nodig hebt zoals toolaanroepen, streaming, gestructureerde output of verzoeken met lange context.
Stap 3: Koppel MiMo-V2.5-Pro aan tools
Het model wordt aanzienlijk nuttiger wanneer het is gekoppeld aan externe tools.
Bijvoorbeeld:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Deze architectuur sluit veel beter aan op het beoogde gebruik van het model dan een simpele chatbotintegratie.