TL;DR
Xiaomis standardmodel V2.5 kombinerer native forståelse af tekst, billeder, video og lyd med et kontekstvindue på 1 million tokens, værktøjsbrug og effektivitet via en sparsom Mixture-of-Experts. Den er det bedre valg, når multimodalt input og omkostning pr. fuldført opgave er vigtige. Pro-varianten er større og stærkere til krævende kodning og lang-horisont agentarbejde, men den er fokuseret på tekstinput og koster omtrent tre gange så meget pr. token til Xiaomis offentliggjorte satser.
Den praktiske beslutning er enkel: vælg standardmodellen til multimodale agenter, dokument- og medieanalyse samt højvolumen-automatisering; vælg Pro, når vanskelig softwareudvikling eller vedvarende autonom eksekvering er flaskehalsen.
Key Takeaways
- Standardmodellen bruger 310B samlede parametre og aktiverer 15B pr. token.
- Den accepterer tekst, billeder, video og lyd og returnerer tekst.
- Dens API understøtter 1M kontekst, op til 128K output, værktøjsopkald, websøgning, streaming, struktureret output og kontekstcache.
- Udgiverrapporterede resultater inkluderer 65,8 på Terminal-Bench 2.0 og 56,1 på SWE-Bench Pro.
- Xiaomis nuværende modelkort for MiMo-V2.5-Pro angiver 1,02T samlede og 42B aktive parametre. De udgiverlistede SWE-Bench Pro-score er 56,1 for MiMo-V2.5 og 57,2 for Pro; dette er daterede, udgiver-rapporterede sammenligninger, ikke en garanti for en specifik kodningsarbejdsgang.
- Ved de nuværende Xiaomi-satser koster standard input/output $0,14/$0,28 pr. million tokens; Pro koster $0,435/$0,87.
- Begge API’er i CometAPI er prissat 20% under den officielle, ikke-cached prisduo.
Information kontrolleret: 28. september 2026. Priser, benchmarks, grænser, tilgængelighed og forespørgselsformater kan ændre sig. Xiaomi har annonceret, at de officielle modelnavne mimo-v2.5 og mimo-v2.5-pro for API vil blive udfaset kl. 10:00 Beijing-tid den 21. oktober 2026 uden automatisk erstatning. Planlæg migrering og bekræft den aktive rute før udrulning.
API-livscyklusnote: den officielle Xiaomi-platform planlægger at pensionere begge V2.5-model-ID’er den 21. oktober 2026. Denne meddelelse vedrører Xiaomis API-platform; kontroller enhver tredjeparts-gateway separat. Xiaomi model deprecation notice
What the Standard Model Is
MiMo-V2.5 er Xiaomi MiMos effektivitetsorienterede grundmodel til multimodal perception og agentarbejde. Den tilbyder native input af tekst, billeder, video og lyd inden for én arkitektur og producerer tekstoutput.
Xiaomis modelreleaselogs daterer MiMo-V2.5-seriens offentlige beta til 23. april 2026. Vægtene blev efterfølgende frigivet under MIT-licensen. MiMo-V2.5 har i alt 310B parametre, men aktiverer kun omkring 15B for hver token; den bruger en stor pulje af specialister uden at køre dem alle på én gang.
MiMo-V2.5-Pro retter sig mod en anden arbejdslast. Det er en trillion-parameters tekstinput-model designet til den hårdeste kodning, terminal og langvarige agentopgaver. De to varianter deler en maksimal kontekst på 1M, men adskiller sig markant i modalitet, aktiv beregning og pris.
MiMo-V2.5 Specifications and Features
| Officielle arkitekturdetaljer | Værdi | Hvorfor det er vigtigt |
|---|---|---|
| Arkitektur | Sparsom MoE | Stor ekspertkapacitet med selektiv aktivering |
| Samlede/aktive parametre | 310B / 15B | Aktiv beregning er langt under total kapacitet |
| Transformer-lag | 48: 1 dense + 47 MoE | De fleste lag bruger routed eksperter |
| Routed eksperter | 256; 8 aktive pr. token | Specialisering uden tæt 310B-eksekvering |
| Attention | 39 SWA + 9 globale lag | Balancerer lokal effektivitet og lang rækkevidde |
| SWA-vindue | 128 tokens | Reducerer kontekstcache-tryk |
| Kontekst / maksimalt output | 1M / 128K tokens | Understøtter lange dokumenter og udvidede forløb |
| Input / output | Tekst, billede, video, lyd / tekst | Native perception på fire inputtyper |
| Vision-encoder | 729M ViT; 28 lag | Billede- og videoforståelse |
| Audio-encoder | 261M transformer; 24 lag | Native lydforståelse |
| Multi-Token Prediction | 3 moduler; ca. 329M parametre | Understøtter effektiv spekulativ dekodning |
| Træningsskala | Ca. 48T tokens | Bred tekst- og multimodal træningspipeline |
| API-kapaciteter | Værktøjer, web, streaming, struktureret output, caching | Produktionsorienterede agentprimitive |
| Licens | MIT | Kommerciel brug og modifikation tilladt |
Driftsrammen omfatter 1M kontekst og 128K output samt publicerede grænser på 100 forespørgsler pr. minut og 10 millioner tokens pr. minut. Leverandørniveaugrænser kan variere efter konto og integrationsrute.
Xiaomi MiMos officielle arkitekturdiagram. Officiel arkitekturressource.
How MiMo-V2.5 Architecture Works
Sparsomt ekspertsystem: Total kapacitet er ikke aktiv beregning
Den centrale effektivitetsfakta er designet med 310B total og 15B aktiv. Routeren vælger otte af 256 eksperter for hver token. Det giver modellen adgang til en langt større parameterpulje end en konventionel 15B tæt model uden at eksekvere alle 310B parametre hver gang.
Dette gør ikke selv-hosting trivielt. De komplette vægte skal stadig lagres og distribueres, så hukommelseskapacitet, interconnect-båndbredde, ekspert-routing og serving-software forbliver væsentlige begrænsninger.
Hybrid attention til lang kontekst
Backbonen blander sliding-window og global attention i et 5:1-forhold mellem SWA og global. Niogtredive lokale lag kontrollerer cachevækst, mens ni globale lag bevarer langdistance informationsflow. Xiaomi rapporterer næsten seks gange reduktion i KV-cache i forhold til et fuldt globalt design.
Et maksimum på 1M tokens er kapacitet, ikke en garanti for nøjagtighed. Retrieval-kvalitet, latenstid, værktøjstilstands-vækst og attention over fjern evidens kræver stadig arbejdslastspecifik evaluering.
Native encodere og agentfunktioner
En vision-transformer på 729M parametre håndterer billede- og videoinput; en lydtransformer på 261M håndterer lyd. Projektorerne kortlægger begge strømme ind i sprog-backbonen, så én agent kan kombinere et skærmbillede, et videosegment, et lydspor, tekstinstruktioner og værktøjsresultater.
Tre Multi-Token Prediction-moduler understøtter spekulativ dekodning og effektivitet i reinforcement learning. Modellen blev trænet på ca. 48T tokens, med kontekst gradvist udvidet til 1M under eftertræning.
De åbne vægte bruger en MIT-licens. Kommerciel udrulning er tilladt, men infrastrukturkost og tredjepartsafhængigheder kræver stadig separat gennemgang.
MiMo-V2.5 Benchmarks: Kodning, agenter og multimodale resultater
Benchmark-note:
tallene nedenfor er udgiver-rapporterede. De er retningsgivende, ikke en garanti for en specifik repository, medieformat, værktøjsstack, latenstarget eller sikkerhedspolitik.
Kodnings- og agentresultater

Officielt Xiaomi MiMo-diagram for kodnings- og agenteresultater.
| Officiel kodningsbenchmark | Rapporteret score | Beslutningssignal |
|---|---|---|
| MiMo Coding Bench | 71,8 | Bred coding-agent kapabilitet |
| Claw-Eval Text | 62,3 | Generel tekst-agent fuldførelse |
| Terminal-Bench 2.0 | 65,8 | Interaktiv terminaleksekvering |
| SWE-Bench Pro | 56,1 | Virkelighedsnær software engineering |
| Claw-Eval Multi-Turn | 63,2 | Længere flertrins agentarbejde |
| ResearchClawBench | 16,91 | Autonome forskningsarbejdsgange |
Resultat: den stærkeste sag er praktisk værktøjsbrug snarere end isoleret kodekompletion. Et resultat på 65,8 i Terminal-Bench understøtter terminalorienterede agenter, mens 56,1 på SWE-Bench Pro antyder nyttig evne på repository-niveau. Den meget lavere forskningsscore er en påmindelse om at teste evidensindsamling og citeringsadfærd separat.
Multimodale resultater

Officielt Xiaomi MiMo-diagram for billede, video og multimodal-agent benchmarks.
| Officiel multimodal benchmark | Rapporteret score | Testet kapabilitet |
|---|---|---|
| CharXiv RQ | 81,0 | Diagram- og dokumentræsonnering |
| MMMU-Pro | 77,9 | Ekspertniveau multimodal ræsonnering |
| HR-Bench 4K | 88,5 | Højopløsningsbilledeforståelse |
| OmniDocBench | 87,2 | Dokumentforståelse |
| Claw-Eval Multimodal | 23,8 | Multimodal agentfuldførelse |
| Video-MME | 87,7 | Videoforståelse |
| DailyOmni | 83,5 | Daglig audiovisuel ræsonnering |
| VideoHolmes | 64,0 | Temporal videoræsonnering |
Resultat: dokument-, højopløsningsbillede- og videoforståelse er de tydeligste styrker. Den multimodale agent-score på 23,8 er langt lavere end perceptionsscorerne, så et system, som både skal forstå medier og pålideligt betjene værktøjer, bør evalueres end-to-end.
MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison
| Officiel arkitektursammenligning | MiMo-V2.5 | MiMo-V2.5-Pro Official Pro specifications Official Pro benchmarks | Praktisk implikation |
|---|---|---|---|
| Samlede parametre | 310B | 1,02T | Pro har over 3× den samlede kapacitet |
| Aktiverede parametre | 15B | 42B | Pro bruger ca. 2,8× flere aktive parametre |
| Lag / routed eksperter | 48 / 256 | 70 / 384 | Pro er et større serving-mål |
| Modelkortets kontekstloft | 1M | 1M | Begge angiver op til 1M tokens; test retrieval og latenstid i din arbejdslast |
| Officielt API maksimalt output | 128K | 128K | Begge nuværende Xiaomi API-modelsider angiver 128K; leverandørspecifikke grænser kan variere |
| Native input | Tekst, billede, video, lyd | Tekst | MiMo-V2.5 er det dokumenterede multimodale valg; verificer den præcise Pro-endpoint før medieinput |
| SWE-Bench Pro | 56,1 | 57,2 | Pro fører med 1,1 point |
| Terminal-Bench 2.0 | 65,8 | 68,4 | Pro fører med 2,6 point |
| Primær anvendelse | Effektive multimodale agenter | Kompleks kodning og lang-horisont agenter | Vælg ud fra testet arbejdslast; modelniveau-margener beviser ikke en generel kvalitetsledelse |
Sammenligningsresultat: Pros benchmark-fordel er beskeden på de to delte kodnings-agenttests, mens standardvarianten tilføjer native billed-, video- og lydinput og bruger langt færre aktive parametre. Pro er berettiget, når små gevinster i svær opgavefuldførelse er mere værdifulde end multimodalt input og lavere enhedsomkostning.
How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?
| Prisgrundlag: 27. maj 2026 | Officiel standard API | Officiel Pro API | MiMo-V2.5 API i CometAPI | MiMo-V2.5-Pro API i CometAPI |
|---|---|---|---|---|
| Input, cache-miss / MTok | $0,14 | $0,435 | $0,112 | $0,348 |
| Output / MTok | $0,28 | $0,87 | $0,224 | $0,696 |
| Input, cache-hit / MTok | $0,0028 | $0,0036 | Tjek live-billing | Tjek live-billing |
| Rabat vs. officiel ikke-cached sats | Baseline | Baseline | 20% | 20% |
Ved officielle satser koster Pro ca. 3,1× så meget som standard for både ikke-cached input og output. De viste udbyderpriser reducerer hvert ikke-cached par med 20%, men den relative forskel mellem varianterne forbliver i det væsentlige uændret.
Pris pr. token er ikke totalomkostningen. Værktøjs-retries, kontekststørrelse, outputlængde, latenstid, fejlopgaver og menneskelig review bestemmer omkostning pr. fuldført opgave. Kør et repræsentativt arbejdslastudsnit, før du vælger en standard produktionsmodel.
What Is MiMo-V2.5 Best For?
- Multimodale agenter: kombinér skærmbilleder, dokumenter, video, lyd, instruktioner og værktøjer i én arbejdsgang.
- Langdokumentanalyse: behandl repositories, kontrakter, forskningsarkiver, logs og supporthistorikker.
- Medieforståelse: opsummér videoer, udtræk hændelser, fortolk diagrammer og besvar audiovisuelle spørgsmål.
- Kodnings- og terminalagenter: inspicér filer, kør kommandoer, ændr kode og iterér på testresultater.
- Højvolumen-automatisering: brug sparsom aktivering og lavere tokenpriser til gentagne produktionstasks.
Limitations and Risks
- Kun 15B parametre er aktive pr. token, men selv-hosting kræver stadig det fulde 310B-vægtsystem.
- Multimodalt output er tekst; generering af billeder, tale og video kræver andre modeller.
- Et kontekstloft på 1M garanterer ikke ensartet retrieval-nøjagtighed på hele vinduet.
- Udgiverbenchmarks overføres muligvis ikke til brugerdefinerede værktøjer, repositories, prompts eller sikkerhedskrav.
- Leverandørens eksponering af modalitet kan afvige fra den underliggende open-weight models fulde kapacitet.
Produktionskontrol:
valider nøjagtighed, værktøjsopkald, latenstid, tokenforbrug, håndtering af modalitet og fallback-adfærd på repræsentative opgaver, før du sender trafik.
API Example
Det følgende Python-eksempel bruger et OpenAI-kompatibelt CometAPI-endpoint og standardmodellens ID. Bekræft det aktuelle endpoint og understøttet forespørgselsskema før udrulning.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Decision Guide
| Arbejdsbelastningssignal | Start med | Skift når |
|---|---|---|
| Billeder, video eller lyd er førsteklasses input | Standard | Skift ikke, medmindre multimodal forbehandling er acceptabel |
| Stor dokument- eller mixed-media-volumen | Standard | Pro kun hvis ræsonneringsfejl dominerer omkostningen |
| Svær repository-udvikling | Test begge | Vælg Pro hvis gevinsten i fuldførelse opvejer 3,1× enhedsprisen |
| Lange autonome terminalforløb | Pro | Gå tilbage til standard, hvis gevinster ikke er målbare |
| Højvolumen rutine-automatisering | Standard | Eskalér kun mislykkede eller højværdioveropgaver |
Anbefalet routing:
brug standard som default til multimodalt og højvolumen-arbejde, og rout kun svære, tekst-først kodnings- eller lang-horisont opgaver til Pro. Dette bevarer kapabilitet og kontrollerer totalomkostningen.
Conclusion
Standardmodellen er ikke blot en mindre Pro. Den er et særskilt optimeringspunkt: native multimodalt input, 1M kontekst, stærke værktøjsorienterede benchmarks og 15B aktive parametre til en langt lavere tokenpris.
Pro er specialistvalget til vanskelig softwareudvikling og vedvarende autonom eksekvering. Dens ekstra kapacitet giver målbare, men ikke universelle gevinster, så det stærkeste udrulningsmønster er arbejdslastbaseret routing frem for at vælge én variant til alle forespørgsler.
FAQ
Er standardmodellen open source?
Dens vægte er frigivet under MIT-licensen, hvilket tillader kommerciel brug, modifikation, finjustering og redistribution under licensbetingelserne.
Hvor mange parametre bruger den?
Den sparsomme MoE indeholder 310B samlede parametre og aktiverer 15B for hver token. Aktive parametre beskriver pr.-token-beregning, ikke lagringsstørrelsen for den komplette model.
Understøtter den billeder, video og lyd?
Ja. Standardvarianten accepterer tekst, billeder, video og lyd og returnerer tekst. Pro-variantens officielle specifikation angiver tekstinput.
Hvad er det maksimale kontekstvindue?
Begge modelkort angiver et kontekstvindue på op til 1M tokens. Xiaomis nuværende API-sider angiver et maksimalt output på 128K for MiMo-V2.5 og MiMo-V2.5-Pro. Faktiske, brugbare grænser kan variere efter endpoint, leverandør, konto og forespørgselsformat; verificér den udrullede rute før afhængighed af disse lofter.
Den nuværende officielle Pro API-side bekræfter separat 1M kontekst og 128K maksimalt output: MiMo-V2.5-Pro API specifications
Hvilken variant er bedre til kodeagenter?
Pro rapporterer højere resultater på delte kodnings- og terminalbenchmarks, men marginen er beskeden. Test begge på det målrettede repository og vælg baseret på opgavefuldførelse, latenstid og totalomkostning.
Hvilken variant er bedre til multimodale agenter?
Standardvarianten er det naturlige valg, fordi den natively accepterer billed-, video- og lydinput. Pro er fokuseret på tekstinput.
Hvordan bør et produktionsteam vælge?
Start med standard, mål fejl, og rout kun de svære tekst-først opgaver, som får fordel af Pro. Sammenlign omkostning pr. fuldført opgave fremfor pris pr. token alene.
