Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/CometAPI-forskning

Hva er MiMo-V2.5? Spesifikasjoner, Ytelsestester, Funksjoner, Priser, og API-tilgang

Utforsk spesifikasjoner, arkitektur, offisielle referansetester, priser, MiMo-V2.5-Pro-sammenligning, brukstilfeller, begrensninger og CometAPI-tilgang for Xiaomi MiMo-V2.5.

CometAPI
Deon GoodwinForskerteam for AI-modeller og API
Oppdatert Oct 5, 2026 11 min lesetid
Hva er MiMo-V2.5? Spesifikasjoner, Ytelsestester, Funksjoner, Priser, og API-tilgang
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Kort oppsummert

Xiaomis standardmodell V2.5 kombinerer innebygd forståelse av tekst, bilde, video og lyd med et kontekstvindu på 1 million token, verktøybruk og effektivitet via sparse Mixture-of-Experts. Den passer best når multimodal inndata og kostnad per fullført oppgave er viktig. Pro-varianten er større og sterkere på krevende koding og langsiktige agent-oppgaver, men er fokusert på tekstinndata og koster omtrent tre ganger så mye per token etter Xiaomis publiserte priser.

Det praktiske valget er enkelt: velg standardmodellen for multimodale agenter, dokument- og medieanalyse og høyvolumsautomatisering; velg Pro når vanskelig programvareutvikling eller vedvarende autonom utførelse er flaskehalsen.

Viktige poenger

  • Standardmodellen bruker 310B totale parametere og aktiverer 15B per token.
  • Den aksepterer tekst, bilder, video og lyd, og returnerer tekst.
  • API-et støtter 1M kontekst, opptil 128K utdata, verktøykall, websøk, strømming, strukturert utdata og kontekst-caching.
  • Utgiver-rapporterte resultater inkluderer 65,8 på Terminal-Bench 2.0 og 56,1 på SWE-Bench Pro.
  • Xiaomis nåværende modelkort for MiMo-V2.5-Pro oppgir 1,02T totale og 42B aktive parametere. Utgiverlistede SWE-Bench Pro-poeng er 56,1 for MiMo-V2.5 og 57,2 for Pro; dette er daterte, utgiver-rapporterte sammenligninger, ikke en garanti for en spesifikk kodearbeidsflyt.
  • Med gjeldende Xiaomi-priser koster standard inndata/utdata $0,14/$0,28 per million token; Pro koster $0,435/$0,87.
  • Begge API-ene i CometAPI er priset 20 % under de offisielle prisparene uten cache.
    Informasjon kontrollert: 28. september 2026. Priser, benchmarker, grenser, tilgjengelighet og forespørselsformat kan endres. Xiaomi har annonsert at de offisielle API-modellnavnene mimo-v2.5 og mimo-v2.5-pro vil bli avviklet kl. 10:00 Beijing-tid 21. oktober 2026, uten automatisk erstatning. Planlegg migrasjon og bekreft aktiv rute før produksjonssetting.

Merknad om API-livssyklus: Xiaomis offisielle plattform planlegger å avvikle begge V2.5-modell-ID-ene 21. oktober 2026. Denne kunngjøringen gjelder Xiaomis API-plattform; kontroller eventuelle tredjeparts-gatewayer separat. Xiaomi model deprecation notice

Hva standardmodellen er

MiMo-V2.5 er Xiaomi MiMos effektivitetsorienterte grunnlagsmodell for multimodal persepsjon og agentarbeid. Den tilbyr innebygd tekst-, bilde-, video- og lydinndata innen én arkitektur og produserer tekstutdata.

Xiaomis modellutgivelseslogg daterer MiMo-V2.5-seriens offentlige beta til 23. april 2026. Vektene ble senere utgitt under MIT-lisensen. MiMo-V2.5 har 310B parametere totalt, men aktiverer bare rundt 15B for hver token; den bruker en stor pool av spesialister uten å kjøre alle samtidig.

MiMo-V2.5-Pro retter seg mot en annen arbeidsbelastning. Det er en trillion-parameters, tekst-inndata-modell designet for den vanskeligste kodingen, terminalarbeid og langvarige agentoppgaver. De to variantene deler et maksimalt kontekstvindu på 1M, men skiller seg skarpt i modalitet, aktiv beregning og pris.

MiMo-V2.5 spesifikasjoner og funksjoner

Offisielle arkitekturdetaljerVerdiHvorfor det er viktig
ArkitekturSparse MoEStor ekspertkapasitet med selektiv aktivering
Totale / aktive parametere310B / 15BAktiv beregning er langt under total kapasitet
Transformer-lag48: 1 tett + 47 MoEDe fleste lag bruker rutede eksperter
Rutede eksperter256; 8 aktive per tokenSpesialisering uten tett 310B-kjøring
Oppmerksomhet39 SWA + 9 globale lagBalanserer lokal effektivitet og langdistanseflyt
SWA-vindu128 tokenReduserer cache-press for lang kontekst
Kontekst / maksimum utdata1M / 128K tokenStøtter lange dokumenter og utvidede spor
Inndata / utdataTekst, bilde, video, lyd / tekstInnebygd persepsjon på fire inndatatyper
Visuell enkoder729M ViT; 28 lagBilde- og videoforståelse
Lyd-enkoder261M transformer; 24 lagInnebygd lydforståelse
Multi-Token Prediction3 moduler; ca. 329M parametereStøtter effektiv spekulativ dekoding
TreningsskalaCa. 48T tokenBred tekst- og multimodal treningspipe
API-kapasiteterVerktøy, web, strømming, strukturert utdata, cachingProduksjonsorienterte agentprimitiver
LisensMITKommersiell bruk og modifikasjon tillatt

Det operative området inkluderer 1M kontekst og 128K utdata, pluss publiserte grenser på 100 forespørsler per minutt og 10 millioner token per minutt. Leverandørnivåets grenser kan variere etter konto og integrasjonsrute.

Hva er MiMo-V2.5? Spesifikasjoner, Ytelsestester, Funksjoner, Priser, og API-tilgang

Xiaomi MiMos offisielle arkitekturdiagram. Offisiell arkitekturressurs.

Slik fungerer arkitekturen i MiMo-V2.5

Sparse Experts: Total kapasitet er ikke aktiv beregning

Det sentrale effektivitetsfaktumet er 310B totalt og 15B aktivt design. Ruteren velger åtte av 256 eksperter for hver token. Det gir modellen tilgang til en mye større parameterpool enn en konvensjonell tett 15B-modell uten å kjøre alle 310B parametere hver gang.

Dette gjør ikke selvhosting trivielt. De komplette vektene må fortsatt lagres og distribueres, så minnekapasitet, interconnect-båndbredde, ekspertruting og tjenestesoftware forblir materielle begrensninger.

Hybrid oppmerksomhet for lang kontekst

Ryggraden blander sliding-window og global oppmerksomhet i et 5:1-forhold mellom SWA og global. Trettini lokale lag kontrollerer cache-vekst, mens ni globale lag bevarer langdistanseinformasjonsflyt. Xiaomi rapporterer nesten seks ganger KV-cache-reduksjon sammenlignet med et helt globalt design.

Et maksimum på 1M token er kapasitet, ikke garantert nøyaktighet. Gjenfinningskvalitet, latens, verktøytilstandens vekst og oppmerksomhet over fjern evidens krever fortsatt arbeidsbelastningsspesifikk evaluering.

Innebygde enkodere og agentfunksjoner

En visuell transformer med 729M parametere håndterer bilde- og videoinndata; en lydtransformer med 261M parametere håndterer lyd. Prosjektorene mapper begge strømmer inn i språkryggraden, slik at én agent kan kombinere et skjermbilde, et videosegment, et lydspor, tekstinstruksjoner og verktøyresultater.

Tre Multi-Token Prediction-moduler støtter spekulativ dekoding og effektivitet i forsterkningslæring. Modellen ble trent på omtrent 48T token, med kontekst gradvis utvidet til 1M under ettertrening.

De åpne vektene bruker en MIT-lisens. Kommersiell distribusjon er tillatt, men infrastrukturkostnader og tredjepartsavhengigheter må fortsatt vurderes separat.

MiMo-V2.5 benchmarker: koding, agenter og multimodale resultater

Merk:

tallene nedenfor er utgiver-rapporterte. De er retningsgivende, ikke en garanti for et spesifikt repository, medieformat, verktøystakk, latenstsmål eller sikkerhetspolicy.

Koding og agentresultater

Hva er MiMo-V2.5? Spesifikasjoner, Ytelsestester, Funksjoner, Priser, og API-tilgang

Offisiell Xiaomi MiMo-diagram for koding og agentbenchmarker.

Offisiell kodebenchmarkRapportert poengBeslutningssignal
MiMo Coding Bench71,8Bred evne for kode-agenter
Claw-Eval Text62,3Generell tekst-agent fullføring
Terminal-Bench 2.065,8Interaktiv terminalutførelse
SWE-Bench Pro56,1Reell programvareutvikling
Claw-Eval Multi-Turn63,2Lengre flertrinns agentarbeid
ResearchClawBench16,91Autonome forskningsarbeidsflyter

Resultat: den sterkeste saken er praktisk verktøybruk snarere enn isolert kodefullføring. En Terminal-Bench-score på 65,8 støtter terminalorienterte agenter, mens 56,1 på SWE-Bench Pro antyder nyttig evne på repository-nivå. Den langt lavere forskningsscoren minner om å teste evidensinnhenting og siteringsatferd separat.

Multimodale resultater

Hva er MiMo-V2.5? Spesifikasjoner, Ytelsestester, Funksjoner, Priser, og API-tilgang

Offisielt Xiaomi MiMo-diagram for bilde, video og multimodale agentbenchmarker.

Offisiell multimodal benchmarkRapportert poengKapabilitet testet
CharXiv RQ81,0Diagram- og dokumentresonnering
MMMU-Pro77,9Ekspertnivå multimodal resonnering
HR-Bench 4K88,5Høyoppløst bildeforståelse
OmniDocBench87,2Dokumentforståelse
Claw-Eval Multimodal23,8Multimodal agentfullføring
Video-MME87,7Videoforståelse
DailyOmni83,5Hverdags audiovisuell resonnering
VideoHolmes64,0Temporal videoresonnering

Resultat: dokument-, høyoppløst bilde- og videoforståelse er de tydeligste styrkene. Den multimodale agentpoengsummen på 23,8 er mye lavere enn persepsjonsscorene, så et system som både må forstå media og pålitelig operere verktøy bør evalueres ende-til-ende.

MiMo-V2.5 vs MiMo-V2.5-Pro: flerdimensjonal sammenligning

Offisiell arkitektursammenligningMiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
Praktisk implikasjon
Totale parametere310B1,02TPro har over 3× total kapasitet
Aktiverte parametere15B42BPro bruker omtrent 2,8× flere aktive parametere
Lag / rutede eksperter48 / 25670 / 384Pro er et større tjenestemål
Konteksttak i modellkort1M1MBegge oppgir opptil 1M token; test gjenfinning og latens på din arbeidsbelastning
Maksimalt utdata i offisiell API128K128KBegge nåværende Xiaomi API-sider oppgir 128K; leverandørspesifikke grenser kan avvike
Native inndataTekst, bilde, video, lydTekstMiMo-V2.5 er den dokumenterte multimodale valget; verifiser nøyaktig Pro-endepunkt før mediesending
SWE-Bench Pro56,157,2Pro leder med 1,1 poeng
Terminal-Bench 2.065,868,4Pro leder med 2,6 poeng
Primær anvendelseEffektive multimodale agenterKompleks koding og langsiktige agenterVelg ut fra testet arbeidsbelastning; modellnivåmarginer beviser ikke en generell kvalitetsledelse

Sammenligningsresultat: Pros benchmark-fordel er beskjeden på de to delte kode-agenttestene, mens standardvarianten legger til innebygd bilde-, video- og lydinndata og bruker langt færre aktive parametere. Pro er berettiget når små gevinster i harde oppgaver er mer verdifulle enn multimodal inndata og lavere enhetskostnad.

Hvor mye koster MiMo-V2.5 og MiMo-V2.5-Pro?

Prisgrunnlag: 27. mai 2026Offisiell standard-APIOffisiell Pro-APIMiMo-V2.5 API i CometAPIMiMo-V2.5-Pro API i CometAPI
Inndata, cache-miss / MTok$0,14$0,435$0,112$0,348
Utdata / MTok$0,28$0,87$0,224$0,696
Inndata, cache-treff / MTok$0,0028$0,0036Sjekk live-billingSjekk live-billing
Rabatt vs offisiell sats uten cacheBaselineBaseline20%20%

Til offisielle satser koster Pro omtrent 3,1× så mye som standard for både ukachet inndata og utdata. Prisene hos leverandøren over reduserer hvert ukachede par med 20 %, men det relative gapet mellom variantene forblir i all hovedsak uendret.

Pris per token er ikke totalkostnad. Verktøyretryer, kontekststørrelse, utdatalengde, latens, gjenoppretting av mislykkede oppgaver og menneskelig gjennomgang bestemmer kostnad per fullført oppgave. Kjør et representativt arbeidsbelastningsutvalg før du velger en standard produksjonsmodell.

Hva er MiMo-V2.5 best til?

  • Multimodale agenter: kombiner skjermbilder, dokumenter, video, lyd, instruksjoner og verktøy i én arbeidsflyt.
  • Langdokumentanalyse: prosesser repositories, kontrakter, forskningsarkiver, logger og støttehistorikk.
  • Medieforståelse: oppsummer videoer, hent ut hendelser, tolk diagrammer og svar på audiovisuelle spørsmål.
  • Koding og terminalagenter: inspiser filer, kjør kommandoer, modifiser kode og iterer på testresultater.
  • Høyvolumsautomatisering: bruk sparsom aktivering og lavere tokenpriser for gjentatte produksjonsoppgaver.

Begrensninger og risikoer

  • Bare 15B parametere er aktive per token, men selvhosting krever fortsatt hele 310B-vekt-systemet.
  • Multimodal utdata er tekst; bilde-, tale- og videoproduksjon krever andre modeller.
  • Et konteksttak på 1M garanterer ikke jevn gjenfinningsnøyaktighet over hele vinduet.
  • Utgiver-benchmarker kan ikke overføres til egendefinerte verktøy, repositories, promptoppsett eller sikkerhetskrav.
  • Leverandørens eksponering av modaliteter kan avvike fra den underliggende åpenvektsmodellens fulle kapabilitet.

Produksjonsport:

valider nøyaktighet, verktøykall-fullføring, latenstid, tokenforbruk, håndtering av modaliteter og fallback-atferd på representative oppgaver før du ruter trafikk.

API-eksempel

Følgende Python-eksempel bruker et OpenAI-kompatibelt CometAPI-endepunkt og standardmodell-ID-en. Bekreft gjeldende endepunkt og støttet forespørselsskjema før produksjonssetting.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Beslutningsguide

ArbeidsbelastningssignalStart medBytt når
Bilder, video eller lyd er førsteklasses inndataStandardIkke bytt med mindre multimodal forprosessering er akseptabel
Stort dokument- eller blandet mediavolumStandardPro kun hvis resonnementssvikt dominerer kostnaden
Vanskelig repository-ingeniørarbeidTest beggeVelg Pro hvis fullføringsgevinsten oppveier 3,1× enhetskost
Lange autonome terminalbanerProGå tilbake til standard hvis gevinstene ikke er målbare
Høyvolums rutineautomatiseringStandardEskaler bare mislykkede eller høyverdi-oppgaver

Anbefalt ruting:

bruk standard som default for multimodal og høyvolumsarbeid, og ruter kun vanskelig tekst-først-koding eller langsiktige oppgaver til Pro. Dette bevarer kapabilitet samtidig som totalkostnaden kontrolleres.

Konklusjon

Standardmodellen er ikke bare en mindre Pro. Den er et distinkt optimaliseringspunkt: innebygd multimodal inndata, 1M kontekst, sterke verktøyorienterte benchmarker og 15B aktive parametere til en langt lavere tokenpris.

Pro er spesialistvalget for vanskelig programvareutvikling og vedvarende autonom utførelse. Dens ekstra kapasitet gir målbare, men ikke universelle gevinster, så den sterkeste distribusjonsstrategien er arbeidsbelastningsbasert ruting snarere enn å velge én variant for alle forespørsler.

FAQ

Er standardmodellen åpen kildekode?

Vektene er utgitt under MIT-lisensen, som tillater kommersiell bruk, modifikasjon, finjustering og redistribusjon under lisensvilkårene.

Hvor mange parametere bruker den?

Den sparsomme MoE-en inneholder 310B totale parametere og aktiverer 15B for hver token. Aktive parametere beskriver beregning per token, ikke lagringsstørrelsen til den komplette modellen.

Støtter den bilder, video og lyd?

Ja. Standardvarianten aksepterer tekst, bilder, video og lyd og returnerer tekst. Pro-variantens offisielle spesifikasjon oppgir tekstinndata.

Hva er maks kontekstvindu?

Begge modellkortene spesifiserer et kontekstvindu på opptil 1M token. Xiaomis nåværende API-sider oppgir et maksimum på 128K utdata for MiMo-V2.5 og MiMo-V2.5-Pro. Faktiske brukbare grenser kan variere etter endepunkt, leverandør, konto og forespørselsformat; verifiser den distribuerte ruten før du stoler på disse takene.

Den nåværende offisielle Pro API-siden bekrefter separat 1M kontekst og 128K maksimum utdata: MiMo-V2.5-Pro API specifications

Hvilken variant er best for kode-agenter?

Pro rapporterer høyere resultater på delte kode- og terminalbenchmarker, men marginen er beskjeden. Test begge på mål-repositoryet og velg basert på oppgavefullføring, latens og totalkostnad.

Hvilken variant er best for multimodale agenter?

Standardvarianten er det naturlige valget fordi den nativt aksepterer bilde-, video- og lydinndata. Pro er fokusert på tekstinndata.

Hvordan bør et produksjonsteam velge?

Start med standard, mål feil, og ruter kun de vanskelige tekst-først-oppgavene som drar nytte av Pro. Sammenlign kostnad per fullført oppgave i stedet for bare pris per token.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Oct 5, 2026
Sist oppdatert Oct 5, 2026
1 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Les mer