TL;DR
Het standaardmodel V2.5 van Xiaomi combineert native begrip van tekst, beeld, video en audio met een contextvenster van 1 miljoen tokens, toolgebruik en efficiënte sparse Mixture-of-Experts. Het is beter geschikt wanneer multimodale invoer en kosten per voltooide taak belangrijk zijn. De Pro-variant is groter en sterker voor veeleisend coderen en lang-horizon agentwerk, maar is gericht op tekstinvoer en kost ongeveer driemaal zoveel per token tegen de gepubliceerde tarieven van Xiaomi.
De praktische keuze is eenvoudig: kies het standaardmodel voor multimodale agents, document- en media-analyse en automatisering op grote schaal; kies Pro wanneer moeilijk software-engineeringwerk of langdurige autonome uitvoering de bottleneck is.
Key Takeaways
- Het standaardmodel gebruikt 310B totale parameters en activeert 15B per token.
- Het accepteert tekst, afbeeldingen, video en audio en geeft tekst terug.
- De API ondersteunt 1M context, tot 128K output, tool-calls, webzoekopdrachten, streaming, gestructureerde output en contextcaching.
- Door de uitgever gerapporteerde resultaten omvatten 65,8 op Terminal-Bench 2.0 en 56,1 op SWE-Bench Pro.
- De huidige modelkaart van Xiaomi’s MiMo-V2.5-Pro vermeldt 1,02T totale en 42B actieve parameters. De door de uitgever vermelde SWE-Bench Pro-scores zijn 56,1 voor MiMo-V2.5 en 57,2 voor Pro; dit zijn gedateerde, door de uitgever gerapporteerde vergelijkingen, geen garantie voor een specifieke codewerkstroom.
- Tegen de huidige Xiaomi-tarieven kosten standaard input/output $0,14/$0,28 per miljoen tokens; Pro kost $0,435/$0,87.
- Beide API’s in CometAPI zijn geprijsd 20% onder de officiële ongecachte prijsparen.
Gecontroleerde informatie: 28 september 2026. Prijzen, benchmarks, limieten, beschikbaarheid en aanvraagformaten kunnen veranderen. Xiaomi heeft aangekondigd dat de officiële API-modelnamen mimo-v2.5 en mimo-v2.5-pro op 21 oktober 2026 om 10:00 uur Beijing-tijd worden afgeschaft zonder automatische vervanging. Plan migratie en bevestig de live route vóór uitrol.
Opmerking over API-levenscyclus: het officiële Xiaomi-platform is van plan beide V2.5-model-ID’s te verwijderen op 21 oktober 2026. Deze melding betreft het API-platform van Xiaomi; controleer eventuele gateways van derden afzonderlijk. Kennisgeving van buitengebruikstelling van Xiaomi-model
What the Standard Model Is
MiMo-V2.5 is Xiaomi MiMo’s op efficiëntie gerichte foundationmodel voor multimodale perceptie en agentisch werk. Het biedt native tekst-, beeld-, video- en audio-invoer binnen één architectuur en produceert tekstoutput.
Volgens het modelreleaselog dateert de publieke bèta van de MiMo-V2.5-serie van 23 april 2026. De gewichten zijn vervolgens vrijgegeven onder de MIT-licentie. MiMo-V2.5 heeft in totaal 310B parameters, maar activeert slechts ongeveer 15B per token; het gebruikt een grote pool van specialisten zonder ze allemaal tegelijk uit te voeren.
MiMo-V2.5-Pro richt zich op een andere werklast. Het is een triljoen-parameter, tekstinvoer-model ontworpen voor de moeilijkste codeer-, terminal- en langlopende agenttaken. De twee varianten delen een maximale context van 1M, maar verschillen sterk in modaliteit, actieve compute en prijs.
MiMo-V2.5 Specifications and Features
| Officiële architectuurdetails | Waarde | Waarom dit ertoe doet |
|---|---|---|
| Architectuur | Sparse MoE | Grote expertcapaciteit met selectieve activatie |
| Totale/actieve parameters | 310B / 15B | Actieve compute is ver onder totale capaciteit |
| Transformerlagen | 48: 1 dense + 47 MoE | De meeste lagen gebruiken gerouteerde experts |
| Gerouteerde experts | 256; 8 actief per token | Specialisatie zonder dense 310B-executie |
| Attention | 39 SWA + 9 globale lagen | Balanceert lokale efficiëntie en lange-afstandsstroom |
| SWA-venster | 128 tokens | Vermindert cachedruk voor lange context |
| Context / maximale output | 1M / 128K tokens | Ondersteunt lange documenten en extended traces |
| Invoer / uitvoer | Tekst, beeld, video, audio / tekst | Native perceptie over vier invoertypen |
| Visie-encoder | 729M ViT; 28 lagen | Begrip van afbeeldingen en video |
| Audio-encoder | 261M transformer; 24 lagen | Native begrip van audio |
| Multi-Token Prediction | 3 modules; circa 329M parameters | Ondersteunt efficiëntie via speculative decoding |
| Trainingsschaal | Circa 48T tokens | Brede tekst- en multimodale trainingspijplijn |
| API-mogelijkheden | Tools, web, streaming, gestructureerde output, caching | Productiegerichte agentprimitieven |
| Licentie | MIT | Commercieel gebruik en modificatie toegestaan |
Het operationele bereik omvat 1M context en 128K output, plus gepubliceerde limieten van 100 requests per minuut en 10 miljoen tokens per minuut. Providerlimieten kunnen per account en integratieroute verschillen.
Het officiële architectuurdiagram van Xiaomi MiMo. Officieel architectuur-asset.
How MiMo-V2.5 Architecture Works
Sparse Experts: Totale capaciteit is geen actieve compute
Het centrale efficiëntiepunt is het ontwerp met 310B totaal en 15B actief. De router selecteert acht van 256 experts voor elk token. Daardoor heeft het model toegang tot een veel grotere parameterpool dan een conventioneel 15B dense model zonder elke keer alle 310B parameters uit te voeren.
Dit maakt self-hosting niet triviaal. De complete gewichten moeten nog steeds worden opgeslagen en gedistribueerd, dus geheugencapaciteit, interconnectbandbreedte, expertroutering en servingsoftware blijven materiële beperkingen.
Hybride attention voor lange context
De ruggengraat verweeft sliding-window en globale attention met een 5:1 SWA-naar-globale verhouding. Negenendertig lokale lagen beheersen de cachegroei, terwijl negen globale lagen de langafstandsinformatiedoorstroming behouden. Xiaomi meldt bijna een zesvoudige KV-cache-reductie ten opzichte van een volledig globale opzet.
Een maximum van 1M tokens is capaciteit, geen gegarandeerde nauwkeurigheid. Retrievalkwaliteit, latentie, groei van toolstatus en aandacht over verre bewijslijnen vereisen nog steeds workload-specifieke evaluatie.
Native encoders en agentfuncties
Een vision transformer met 729M parameters verwerkt beeld- en video-invoer; een audiotransformer met 261M parameters verwerkt audio. De projectors mappen beide stromen in de taalruggengraat, zodat één agent een screenshot, een videosegment, een audiotrack, tekstinstructies en toolresultaten kan combineren.
Drie Multi-Token Prediction-modules ondersteunen speculative decoding en efficiëntie in bekrachtigingsleren. Het model is getraind op circa 48T tokens, met context die tijdens post-training progressief werd uitgebreid tot 1M.
De open gewichten gebruiken een MIT-licentie. Commerciële inzet is toegestaan, maar infrastructuurkosten en afhankelijkheden van derden vergen nog aparte beoordeling.
MiMo-V2.5 Benchmarks: Coderen, agents en multimodale resultaten
Benchmarkopmerking:
onderstaande cijfers zijn door de uitgever gerapporteerd. Zij zijn richtinggevend bewijs, geen garantie voor een specifieke repository, mediaformaat, toolstack, latentiedoel of veiligheidsbeleid.
Coding and Agent Results

Officiële Xiaomi MiMo-benchmarkgrafiek voor coderen en agents.
| Officiële codebenchmark | Gerapporteerde score | Beslissingssignaal |
|---|---|---|
| MiMo Coding Bench | 71,8 | Brede capaciteit voor coding-agents |
| Claw-Eval Text | 62,3 | Algemene tekst-agentcompletion |
| Terminal-Bench 2.0 | 65,8 | Interactieve terminaluitvoering |
| SWE-Bench Pro | 56,1 | Software-engineering in de praktijk |
| Claw-Eval Multi-Turn | 63,2 | Langer meerstaps agentwerk |
| ResearchClawBench | 16,91 | Autonome onderzoeksworkflows |
Resultaat: het sterkste argument is praktisch toolgebruik in plaats van geïsoleerde codecompletion. Een Terminal-Bench-score van 65,8 ondersteunt terminalgerichte agents, terwijl 56,1 op SWE-Bench Pro wijst op bruikbare vaardigheden op repository-niveau. De veel lagere researchscore herinnert eraan om bewijsverzameling en citeergedrag afzonderlijk te testen.
Multimodal Results

Officiële Xiaomi MiMo-benchmarkgrafiek voor beeld, video en multimodale agents.
| Officiële multimodale benchmark | Gerapporteerde score | Geteste capaciteit |
|---|---|---|
| CharXiv RQ | 81,0 | Redeneren over grafieken en documenten |
| MMMU-Pro | 77,9 | Multimodaal redeneren op expertniveau |
| HR-Bench 4K | 88,5 | Inzicht in beelden met hoge resolutie |
| OmniDocBench | 87,2 | Documentbegrip |
| Claw-Eval Multimodal | 23,8 | Multimodale agentcompletion |
| Video-MME | 87,7 | Videobegrip |
| DailyOmni | 83,5 | Alledaags audiovisueel redeneren |
| VideoHolmes | 64,0 | Temporeel redeneren over video |
Resultaat: document-, hoge-resolutiebeeld- en videobegrip zijn de duidelijkste sterke punten. De multimodale-agentscore van 23,8 is veel lager dan de perceptiescores, dus een systeem dat zowel media moet begrijpen als tools betrouwbaar moet bedienen, moet end-to-end worden geëvalueerd.
MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison
| Officiële architectuurvergelijking | MiMo-V2.5 | MiMo-V2.5-Pro Official Pro specifications Official Pro benchmarks | Praktische implicatie |
|---|---|---|---|
| Totale parameters | 310B | 1,02T | Pro heeft meer dan 3× de totale capaciteit |
| Geactiveerde parameters | 15B | 42B | Pro gebruikt circa 2,8× meer actieve parameters |
| Lagen / gerouteerde experts | 48 / 256 | 70 / 384 | Pro is een groter servingdoel |
| Modelkaart contextplafond | 1M | 1M | Beide vermelden tot 1M tokens; test retrieval en latentie op jouw werklastgrootte |
| Officiële API maximale output | 128K | 128K | Beide huidige Xiaomi API-paginamodellen vermelden 128K; provider-specifieke limieten kunnen verschillen |
| Native invoer | Tekst, beeld, video, audio | Tekst | MiMo-V2.5 is de gedocumenteerde multimodale keuze; verifieer de exacte Pro-endpoint vóór het verzenden van media |
| SWE-Bench Pro | 56,1 | 57,2 | Pro leidt met 1,1 punten |
| Terminal-Bench 2.0 | 65,8 | 68,4 | Pro leidt met 2,6 punten |
| Primaire fit | Efficiënte multimodale agents | Complex coderen en lang-horizon agents | Kies op basis van geteste werklast; de modelmarges bewijzen geen algemene kwaliteitsvoorsprong |
Vergelijkingsresultaat: het benchmarkvoordeel van Pro is bescheiden op de twee gedeelde coding-agenttests, terwijl de standaardvariant native beeld-, video- en audio-invoer toevoegt en veel minder actieve parameters gebruikt. Pro is gerechtvaardigd wanneer kleine winst in moeilijke taakvoltooiing waardevoller is dan multimodale invoer en lagere eenheidskosten.
How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?
| Prijsbasis: 27 mei 2026 | Officiële standaard-API | Officiële Pro-API | MiMo-V2.5-API in CometAPI | MiMo-V2.5-Pro-API in CometAPI |
|---|---|---|---|---|
| Invoer, cache-miss / MTok | $0,14 | $0,435 | $0,112 | $0,348 |
| Uitvoer / MTok | $0,28 | $0,87 | $0,224 | $0,696 |
| Invoer, cache-hit / MTok | $0,0028 | $0,0036 | Controleer actuele facturatie | Controleer actuele facturatie |
| Korting t.o.v. officiële ongecachte tarieven | Referentie | Referentie | 20% | 20% |
Tegen officiële tarieven kost Pro ongeveer 3,1× zoveel als standaard voor zowel ongecachte invoer als uitvoer. De hierboven getoonde providerprijzen verlagen elk ongecacht paar met 20%, maar de relatieve kloof tussen de varianten blijft praktisch ongewijzigd.
Prijs per token is niet gelijk aan de totale kosten. Toolretries, contextgrootte, outputlengte, latentie, herstel van mislukte taken en menselijke review bepalen de kosten per voltooide taak. Voer een representatieve workload uit voordat je een standaard productiemodel kiest.
What Is MiMo-V2.5 Best For?
- Multimodale agents: combineer screenshots, documenten, video, audio, instructies en tools in één workflow.
- Analyse van lange documenten: verwerk repositories, contracten, onderzoeksarchieven, logs en supporthistorie.
- Mediabegrip: vat video’s samen, extraheer gebeurtenissen, interpreteer grafieken en beantwoord audiovisuele vragen.
- Coding- en terminalagents: inspecteer bestanden, voer commando’s uit, wijzig code en itereren op testresultaten.
- Automatisering op grote schaal: gebruik sparse activatie en lagere tokenprijzen voor herhaalde productietaken.
Limitations and Risks
- Slechts 15B parameters zijn actief per token, maar self-hosting vereist nog steeds het volledige 310B-gewichtensysteem.
- Multimodale output is tekst; generatie van beeld, spraak en video vereist andere modellen.
- Een contextplafond van 1M garandeert geen uniforme retrievalnauwkeurigheid over het volledige venster.
- Door de uitgever gepubliceerde benchmarks zijn mogelijk niet overdraagbaar naar aangepaste tools, repositories, prompts of veiligheidsconstraints.
- De modaliteitsblootstelling door de provider kan verschillen van de volledige capaciteiten van het onderliggende open-gewichtenmodel.
Productiecontrole:
valideer nauwkeurigheid, afronding van tool-calls, latentie, tokenverbruik, modaliteitshandling en fallbackgedrag op representatieve taken voordat je verkeer committeert.
API Example
De volgende Python-voorbeeld maakt gebruik van een OpenAI-compatibele CometAPI-endpoint en de standaardmodel-ID. Bevestig de huidige endpoint en ondersteund aanvraagschema vóór uitrol.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Decision Guide
| Workloadsignaal | Start met | Schakel over wanneer |
|---|---|---|
| Afbeeldingen, video of audio zijn eersteklas invoer | Standaard | Niet overschakelen tenzij multimodale preprocessing acceptabel is |
| Groot volume aan documenten of mixed media | Standaard | Pro alleen als redeneerfouten de kosten domineren |
| Moeilijke repository-engineering | Test beide | Kies Pro als de winst in voltooiing de 3,1× eenheidskosten compenseert |
| Lange autonome terminaltrajecten | Pro | Ga terug naar standaard als winst niet meetbaar is |
| Routinematige automatisering op grote schaal | Standaard | Escaleer alleen mislukte of high-value taken |
Aanbevolen routing:
gebruik standaard als default voor multimodale en grootschalige workloads, en routeer alleen moeilijke tekst-eerst coding- of lang-horizon taken naar Pro. Dit behoudt capaciteit terwijl de totale kosten onder controle blijven.
Conclusion
Het standaardmodel is niet simpelweg een kleinere Pro. Het is een apart optimalisatiepunt: native multimodale invoer, 1M context, sterke toolgerichte benchmarks en 15B actieve parameters tegen een veel lagere tokenprijs.
Pro is de specialistische optie voor moeilijke software-engineering en langdurige autonome uitvoering. De extra capaciteit levert meetbare maar geen universele winst op, dus het sterkste implementatiepatroon is workloadgebaseerde routing in plaats van één variant voor elke aanvraag te kiezen.
FAQ
Is the standard model open source?
De gewichten zijn vrijgegeven onder de MIT-licentie, die commercieel gebruik, modificatie, fine-tuning en herdistributie toestaat onder de licentievoorwaarden.
How many parameters does it use?
De sparse MoE bevat 310B totale parameters en activeert 15B per token. Actieve parameters beschrijven per-tokenberekening, niet de opslaggrootte van het complete model.
Does it support images, video, and audio?
Ja. De standaardvariant accepteert tekst, afbeeldingen, video en audio en geeft tekst terug. De officiële specificatie van de Pro-variant vermeldt tekstinvoer.
What is the maximum context window?
Beide modelkaarten specificeren een contextvenster tot 1M tokens. De huidige API-pagina’s van Xiaomi vermelden een maximaal output van 128K voor MiMo-V2.5 en MiMo-V2.5-Pro. De daadwerkelijk bruikbare limieten kunnen variëren per endpoint, provider, account en aanvraagformaat; verifieer de ingezette route voordat je op die plafonds vertrouwt.
De huidige officiële Pro-API-pagina bevestigt afzonderlijk de 1M context en 128K maximale output: Specificaties van de MiMo-V2.5-Pro API
Which variant is better for coding agents?
Pro rapporteert hogere resultaten op gedeelde code- en terminalbenchmarks, maar de marge is bescheiden. Test beide op de doelrepository en kies op basis van taakvoltooiing, latentie en totale kosten.
Which variant is better for multimodal agents?
De standaardvariant is de natuurlijke keuze omdat deze native beeld-, video- en audio-invoer accepteert. Pro is gericht op tekstinvoer.
How should a production team choose?
Begin met standaard, meet mislukkingen, en routeer alleen de moeilijke tekst-eerst taken die baat hebben bij Pro. Vergelijk kosten per voltooide taak in plaats van alleen prijs per token.
