Kort oppsummert
Xiaomis standardmodell V2.5 kombinerer innebygd forståelse av tekst, bilde, video og lyd med et kontekstvindu på 1 million token, verktøybruk og effektivitet via sparse Mixture-of-Experts. Den passer best når multimodal inndata og kostnad per fullført oppgave er viktig. Pro-varianten er større og sterkere på krevende koding og langsiktige agent-oppgaver, men er fokusert på tekstinndata og koster omtrent tre ganger så mye per token etter Xiaomis publiserte priser.
Det praktiske valget er enkelt: velg standardmodellen for multimodale agenter, dokument- og medieanalyse og høyvolumsautomatisering; velg Pro når vanskelig programvareutvikling eller vedvarende autonom utførelse er flaskehalsen.
Viktige poenger
- Standardmodellen bruker 310B totale parametere og aktiverer 15B per token.
- Den aksepterer tekst, bilder, video og lyd, og returnerer tekst.
- API-et støtter 1M kontekst, opptil 128K utdata, verktøykall, websøk, strømming, strukturert utdata og kontekst-caching.
- Utgiver-rapporterte resultater inkluderer 65,8 på Terminal-Bench 2.0 og 56,1 på SWE-Bench Pro.
- Xiaomis nåværende modelkort for MiMo-V2.5-Pro oppgir 1,02T totale og 42B aktive parametere. Utgiverlistede SWE-Bench Pro-poeng er 56,1 for MiMo-V2.5 og 57,2 for Pro; dette er daterte, utgiver-rapporterte sammenligninger, ikke en garanti for en spesifikk kodearbeidsflyt.
- Med gjeldende Xiaomi-priser koster standard inndata/utdata $0,14/$0,28 per million token; Pro koster $0,435/$0,87.
- Begge API-ene i CometAPI er priset 20 % under de offisielle prisparene uten cache.
Informasjon kontrollert: 28. september 2026. Priser, benchmarker, grenser, tilgjengelighet og forespørselsformat kan endres. Xiaomi har annonsert at de offisielle API-modellnavnene mimo-v2.5 og mimo-v2.5-pro vil bli avviklet kl. 10:00 Beijing-tid 21. oktober 2026, uten automatisk erstatning. Planlegg migrasjon og bekreft aktiv rute før produksjonssetting.
Merknad om API-livssyklus: Xiaomis offisielle plattform planlegger å avvikle begge V2.5-modell-ID-ene 21. oktober 2026. Denne kunngjøringen gjelder Xiaomis API-plattform; kontroller eventuelle tredjeparts-gatewayer separat. Xiaomi model deprecation notice
Hva standardmodellen er
MiMo-V2.5 er Xiaomi MiMos effektivitetsorienterte grunnlagsmodell for multimodal persepsjon og agentarbeid. Den tilbyr innebygd tekst-, bilde-, video- og lydinndata innen én arkitektur og produserer tekstutdata.
Xiaomis modellutgivelseslogg daterer MiMo-V2.5-seriens offentlige beta til 23. april 2026. Vektene ble senere utgitt under MIT-lisensen. MiMo-V2.5 har 310B parametere totalt, men aktiverer bare rundt 15B for hver token; den bruker en stor pool av spesialister uten å kjøre alle samtidig.
MiMo-V2.5-Pro retter seg mot en annen arbeidsbelastning. Det er en trillion-parameters, tekst-inndata-modell designet for den vanskeligste kodingen, terminalarbeid og langvarige agentoppgaver. De to variantene deler et maksimalt kontekstvindu på 1M, men skiller seg skarpt i modalitet, aktiv beregning og pris.
MiMo-V2.5 spesifikasjoner og funksjoner
| Offisielle arkitekturdetaljer | Verdi | Hvorfor det er viktig |
|---|---|---|
| Arkitektur | Sparse MoE | Stor ekspertkapasitet med selektiv aktivering |
| Totale / aktive parametere | 310B / 15B | Aktiv beregning er langt under total kapasitet |
| Transformer-lag | 48: 1 tett + 47 MoE | De fleste lag bruker rutede eksperter |
| Rutede eksperter | 256; 8 aktive per token | Spesialisering uten tett 310B-kjøring |
| Oppmerksomhet | 39 SWA + 9 globale lag | Balanserer lokal effektivitet og langdistanseflyt |
| SWA-vindu | 128 token | Reduserer cache-press for lang kontekst |
| Kontekst / maksimum utdata | 1M / 128K token | Støtter lange dokumenter og utvidede spor |
| Inndata / utdata | Tekst, bilde, video, lyd / tekst | Innebygd persepsjon på fire inndatatyper |
| Visuell enkoder | 729M ViT; 28 lag | Bilde- og videoforståelse |
| Lyd-enkoder | 261M transformer; 24 lag | Innebygd lydforståelse |
| Multi-Token Prediction | 3 moduler; ca. 329M parametere | Støtter effektiv spekulativ dekoding |
| Treningsskala | Ca. 48T token | Bred tekst- og multimodal treningspipe |
| API-kapasiteter | Verktøy, web, strømming, strukturert utdata, caching | Produksjonsorienterte agentprimitiver |
| Lisens | MIT | Kommersiell bruk og modifikasjon tillatt |
Det operative området inkluderer 1M kontekst og 128K utdata, pluss publiserte grenser på 100 forespørsler per minutt og 10 millioner token per minutt. Leverandørnivåets grenser kan variere etter konto og integrasjonsrute.
Xiaomi MiMos offisielle arkitekturdiagram. Offisiell arkitekturressurs.
Slik fungerer arkitekturen i MiMo-V2.5
Sparse Experts: Total kapasitet er ikke aktiv beregning
Det sentrale effektivitetsfaktumet er 310B totalt og 15B aktivt design. Ruteren velger åtte av 256 eksperter for hver token. Det gir modellen tilgang til en mye større parameterpool enn en konvensjonell tett 15B-modell uten å kjøre alle 310B parametere hver gang.
Dette gjør ikke selvhosting trivielt. De komplette vektene må fortsatt lagres og distribueres, så minnekapasitet, interconnect-båndbredde, ekspertruting og tjenestesoftware forblir materielle begrensninger.
Hybrid oppmerksomhet for lang kontekst
Ryggraden blander sliding-window og global oppmerksomhet i et 5:1-forhold mellom SWA og global. Trettini lokale lag kontrollerer cache-vekst, mens ni globale lag bevarer langdistanseinformasjonsflyt. Xiaomi rapporterer nesten seks ganger KV-cache-reduksjon sammenlignet med et helt globalt design.
Et maksimum på 1M token er kapasitet, ikke garantert nøyaktighet. Gjenfinningskvalitet, latens, verktøytilstandens vekst og oppmerksomhet over fjern evidens krever fortsatt arbeidsbelastningsspesifikk evaluering.
Innebygde enkodere og agentfunksjoner
En visuell transformer med 729M parametere håndterer bilde- og videoinndata; en lydtransformer med 261M parametere håndterer lyd. Prosjektorene mapper begge strømmer inn i språkryggraden, slik at én agent kan kombinere et skjermbilde, et videosegment, et lydspor, tekstinstruksjoner og verktøyresultater.
Tre Multi-Token Prediction-moduler støtter spekulativ dekoding og effektivitet i forsterkningslæring. Modellen ble trent på omtrent 48T token, med kontekst gradvis utvidet til 1M under ettertrening.
De åpne vektene bruker en MIT-lisens. Kommersiell distribusjon er tillatt, men infrastrukturkostnader og tredjepartsavhengigheter må fortsatt vurderes separat.
MiMo-V2.5 benchmarker: koding, agenter og multimodale resultater
Merk:
tallene nedenfor er utgiver-rapporterte. De er retningsgivende, ikke en garanti for et spesifikt repository, medieformat, verktøystakk, latenstsmål eller sikkerhetspolicy.
Koding og agentresultater

Offisiell Xiaomi MiMo-diagram for koding og agentbenchmarker.
| Offisiell kodebenchmark | Rapportert poeng | Beslutningssignal |
|---|---|---|
| MiMo Coding Bench | 71,8 | Bred evne for kode-agenter |
| Claw-Eval Text | 62,3 | Generell tekst-agent fullføring |
| Terminal-Bench 2.0 | 65,8 | Interaktiv terminalutførelse |
| SWE-Bench Pro | 56,1 | Reell programvareutvikling |
| Claw-Eval Multi-Turn | 63,2 | Lengre flertrinns agentarbeid |
| ResearchClawBench | 16,91 | Autonome forskningsarbeidsflyter |
Resultat: den sterkeste saken er praktisk verktøybruk snarere enn isolert kodefullføring. En Terminal-Bench-score på 65,8 støtter terminalorienterte agenter, mens 56,1 på SWE-Bench Pro antyder nyttig evne på repository-nivå. Den langt lavere forskningsscoren minner om å teste evidensinnhenting og siteringsatferd separat.
Multimodale resultater

Offisielt Xiaomi MiMo-diagram for bilde, video og multimodale agentbenchmarker.
| Offisiell multimodal benchmark | Rapportert poeng | Kapabilitet testet |
|---|---|---|
| CharXiv RQ | 81,0 | Diagram- og dokumentresonnering |
| MMMU-Pro | 77,9 | Ekspertnivå multimodal resonnering |
| HR-Bench 4K | 88,5 | Høyoppløst bildeforståelse |
| OmniDocBench | 87,2 | Dokumentforståelse |
| Claw-Eval Multimodal | 23,8 | Multimodal agentfullføring |
| Video-MME | 87,7 | Videoforståelse |
| DailyOmni | 83,5 | Hverdags audiovisuell resonnering |
| VideoHolmes | 64,0 | Temporal videoresonnering |
Resultat: dokument-, høyoppløst bilde- og videoforståelse er de tydeligste styrkene. Den multimodale agentpoengsummen på 23,8 er mye lavere enn persepsjonsscorene, så et system som både må forstå media og pålitelig operere verktøy bør evalueres ende-til-ende.
MiMo-V2.5 vs MiMo-V2.5-Pro: flerdimensjonal sammenligning
| Offisiell arkitektursammenligning | MiMo-V2.5 | MiMo-V2.5-Pro Official Pro specifications Official Pro benchmarks | Praktisk implikasjon |
|---|---|---|---|
| Totale parametere | 310B | 1,02T | Pro har over 3× total kapasitet |
| Aktiverte parametere | 15B | 42B | Pro bruker omtrent 2,8× flere aktive parametere |
| Lag / rutede eksperter | 48 / 256 | 70 / 384 | Pro er et større tjenestemål |
| Konteksttak i modellkort | 1M | 1M | Begge oppgir opptil 1M token; test gjenfinning og latens på din arbeidsbelastning |
| Maksimalt utdata i offisiell API | 128K | 128K | Begge nåværende Xiaomi API-sider oppgir 128K; leverandørspesifikke grenser kan avvike |
| Native inndata | Tekst, bilde, video, lyd | Tekst | MiMo-V2.5 er den dokumenterte multimodale valget; verifiser nøyaktig Pro-endepunkt før mediesending |
| SWE-Bench Pro | 56,1 | 57,2 | Pro leder med 1,1 poeng |
| Terminal-Bench 2.0 | 65,8 | 68,4 | Pro leder med 2,6 poeng |
| Primær anvendelse | Effektive multimodale agenter | Kompleks koding og langsiktige agenter | Velg ut fra testet arbeidsbelastning; modellnivåmarginer beviser ikke en generell kvalitetsledelse |
Sammenligningsresultat: Pros benchmark-fordel er beskjeden på de to delte kode-agenttestene, mens standardvarianten legger til innebygd bilde-, video- og lydinndata og bruker langt færre aktive parametere. Pro er berettiget når små gevinster i harde oppgaver er mer verdifulle enn multimodal inndata og lavere enhetskostnad.
Hvor mye koster MiMo-V2.5 og MiMo-V2.5-Pro?
| Prisgrunnlag: 27. mai 2026 | Offisiell standard-API | Offisiell Pro-API | MiMo-V2.5 API i CometAPI | MiMo-V2.5-Pro API i CometAPI |
|---|---|---|---|---|
| Inndata, cache-miss / MTok | $0,14 | $0,435 | $0,112 | $0,348 |
| Utdata / MTok | $0,28 | $0,87 | $0,224 | $0,696 |
| Inndata, cache-treff / MTok | $0,0028 | $0,0036 | Sjekk live-billing | Sjekk live-billing |
| Rabatt vs offisiell sats uten cache | Baseline | Baseline | 20% | 20% |
Til offisielle satser koster Pro omtrent 3,1× så mye som standard for både ukachet inndata og utdata. Prisene hos leverandøren over reduserer hvert ukachede par med 20 %, men det relative gapet mellom variantene forblir i all hovedsak uendret.
Pris per token er ikke totalkostnad. Verktøyretryer, kontekststørrelse, utdatalengde, latens, gjenoppretting av mislykkede oppgaver og menneskelig gjennomgang bestemmer kostnad per fullført oppgave. Kjør et representativt arbeidsbelastningsutvalg før du velger en standard produksjonsmodell.
Hva er MiMo-V2.5 best til?
- Multimodale agenter: kombiner skjermbilder, dokumenter, video, lyd, instruksjoner og verktøy i én arbeidsflyt.
- Langdokumentanalyse: prosesser repositories, kontrakter, forskningsarkiver, logger og støttehistorikk.
- Medieforståelse: oppsummer videoer, hent ut hendelser, tolk diagrammer og svar på audiovisuelle spørsmål.
- Koding og terminalagenter: inspiser filer, kjør kommandoer, modifiser kode og iterer på testresultater.
- Høyvolumsautomatisering: bruk sparsom aktivering og lavere tokenpriser for gjentatte produksjonsoppgaver.
Begrensninger og risikoer
- Bare 15B parametere er aktive per token, men selvhosting krever fortsatt hele 310B-vekt-systemet.
- Multimodal utdata er tekst; bilde-, tale- og videoproduksjon krever andre modeller.
- Et konteksttak på 1M garanterer ikke jevn gjenfinningsnøyaktighet over hele vinduet.
- Utgiver-benchmarker kan ikke overføres til egendefinerte verktøy, repositories, promptoppsett eller sikkerhetskrav.
- Leverandørens eksponering av modaliteter kan avvike fra den underliggende åpenvektsmodellens fulle kapabilitet.
Produksjonsport:
valider nøyaktighet, verktøykall-fullføring, latenstid, tokenforbruk, håndtering av modaliteter og fallback-atferd på representative oppgaver før du ruter trafikk.
API-eksempel
Følgende Python-eksempel bruker et OpenAI-kompatibelt CometAPI-endepunkt og standardmodell-ID-en. Bekreft gjeldende endepunkt og støttet forespørselsskjema før produksjonssetting.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Beslutningsguide
| Arbeidsbelastningssignal | Start med | Bytt når |
|---|---|---|
| Bilder, video eller lyd er førsteklasses inndata | Standard | Ikke bytt med mindre multimodal forprosessering er akseptabel |
| Stort dokument- eller blandet mediavolum | Standard | Pro kun hvis resonnementssvikt dominerer kostnaden |
| Vanskelig repository-ingeniørarbeid | Test begge | Velg Pro hvis fullføringsgevinsten oppveier 3,1× enhetskost |
| Lange autonome terminalbaner | Pro | Gå tilbake til standard hvis gevinstene ikke er målbare |
| Høyvolums rutineautomatisering | Standard | Eskaler bare mislykkede eller høyverdi-oppgaver |
Anbefalt ruting:
bruk standard som default for multimodal og høyvolumsarbeid, og ruter kun vanskelig tekst-først-koding eller langsiktige oppgaver til Pro. Dette bevarer kapabilitet samtidig som totalkostnaden kontrolleres.
Konklusjon
Standardmodellen er ikke bare en mindre Pro. Den er et distinkt optimaliseringspunkt: innebygd multimodal inndata, 1M kontekst, sterke verktøyorienterte benchmarker og 15B aktive parametere til en langt lavere tokenpris.
Pro er spesialistvalget for vanskelig programvareutvikling og vedvarende autonom utførelse. Dens ekstra kapasitet gir målbare, men ikke universelle gevinster, så den sterkeste distribusjonsstrategien er arbeidsbelastningsbasert ruting snarere enn å velge én variant for alle forespørsler.
FAQ
Er standardmodellen åpen kildekode?
Vektene er utgitt under MIT-lisensen, som tillater kommersiell bruk, modifikasjon, finjustering og redistribusjon under lisensvilkårene.
Hvor mange parametere bruker den?
Den sparsomme MoE-en inneholder 310B totale parametere og aktiverer 15B for hver token. Aktive parametere beskriver beregning per token, ikke lagringsstørrelsen til den komplette modellen.
Støtter den bilder, video og lyd?
Ja. Standardvarianten aksepterer tekst, bilder, video og lyd og returnerer tekst. Pro-variantens offisielle spesifikasjon oppgir tekstinndata.
Hva er maks kontekstvindu?
Begge modellkortene spesifiserer et kontekstvindu på opptil 1M token. Xiaomis nåværende API-sider oppgir et maksimum på 128K utdata for MiMo-V2.5 og MiMo-V2.5-Pro. Faktiske brukbare grenser kan variere etter endepunkt, leverandør, konto og forespørselsformat; verifiser den distribuerte ruten før du stoler på disse takene.
Den nåværende offisielle Pro API-siden bekrefter separat 1M kontekst og 128K maksimum utdata: MiMo-V2.5-Pro API specifications
Hvilken variant er best for kode-agenter?
Pro rapporterer høyere resultater på delte kode- og terminalbenchmarker, men marginen er beskjeden. Test begge på mål-repositoryet og velg basert på oppgavefullføring, latens og totalkostnad.
Hvilken variant er best for multimodale agenter?
Standardvarianten er det naturlige valget fordi den nativt aksepterer bilde-, video- og lydinndata. Pro er fokusert på tekstinndata.
Hvordan bør et produksjonsteam velge?
Start med standard, mål feil, og ruter kun de vanskelige tekst-først-oppgavene som drar nytte av Pro. Sammenlign kostnad per fullført oppgave i stedet for bare pris per token.
