Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/CometAPI research

Hvad er MiMo-V2.5? Specifikationer, benchmarks, funktioner, prissætning og API-adgang

Udforsk Xiaomi MiMo-V2.5-specifikationer, arkitektur, officielle benchmarks, prissætning, sammenligning med MiMo-V2.5-Pro, anvendelsesområder, begrænsninger og adgang til CometAPI.

CometAPI
Deon GoodwinForskningshold for AI-modeller og API
Opdateret Oct 5, 2026 11 min. læsning
Hvad er MiMo-V2.5? Specifikationer, benchmarks, funktioner, prissætning og API-adgang
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Xiaomis standardmodel V2.5 kombinerer native forståelse af tekst, billeder, video og lyd med et kontekstvindue på 1 million tokens, værktøjsbrug og effektivitet via en sparsom Mixture-of-Experts. Den er det bedre valg, når multimodalt input og omkostning pr. fuldført opgave er vigtige. Pro-varianten er større og stærkere til krævende kodning og lang-horisont agentarbejde, men den er fokuseret på tekstinput og koster omtrent tre gange så meget pr. token til Xiaomis offentliggjorte satser.

Den praktiske beslutning er enkel: vælg standardmodellen til multimodale agenter, dokument- og medieanalyse samt højvolumen-automatisering; vælg Pro, når vanskelig softwareudvikling eller vedvarende autonom eksekvering er flaskehalsen.

Key Takeaways

  • Standardmodellen bruger 310B samlede parametre og aktiverer 15B pr. token.
  • Den accepterer tekst, billeder, video og lyd og returnerer tekst.
  • Dens API understøtter 1M kontekst, op til 128K output, værktøjsopkald, websøgning, streaming, struktureret output og kontekstcache.
  • Udgiverrapporterede resultater inkluderer 65,8 på Terminal-Bench 2.0 og 56,1 på SWE-Bench Pro.
  • Xiaomis nuværende modelkort for MiMo-V2.5-Pro angiver 1,02T samlede og 42B aktive parametre. De udgiverlistede SWE-Bench Pro-score er 56,1 for MiMo-V2.5 og 57,2 for Pro; dette er daterede, udgiver-rapporterede sammenligninger, ikke en garanti for en specifik kodningsarbejdsgang.
  • Ved de nuværende Xiaomi-satser koster standard input/output $0,14/$0,28 pr. million tokens; Pro koster $0,435/$0,87.
  • Begge API’er i CometAPI er prissat 20% under den officielle, ikke-cached prisduo.
    Information kontrolleret: 28. september 2026. Priser, benchmarks, grænser, tilgængelighed og forespørgselsformater kan ændre sig. Xiaomi har annonceret, at de officielle modelnavne mimo-v2.5 og mimo-v2.5-pro for API vil blive udfaset kl. 10:00 Beijing-tid den 21. oktober 2026 uden automatisk erstatning. Planlæg migrering og bekræft den aktive rute før udrulning.

API-livscyklusnote: den officielle Xiaomi-platform planlægger at pensionere begge V2.5-model-ID’er den 21. oktober 2026. Denne meddelelse vedrører Xiaomis API-platform; kontroller enhver tredjeparts-gateway separat. Xiaomi model deprecation notice

What the Standard Model Is

MiMo-V2.5 er Xiaomi MiMos effektivitetsorienterede grundmodel til multimodal perception og agentarbejde. Den tilbyder native input af tekst, billeder, video og lyd inden for én arkitektur og producerer tekstoutput.

Xiaomis modelreleaselogs daterer MiMo-V2.5-seriens offentlige beta til 23. april 2026. Vægtene blev efterfølgende frigivet under MIT-licensen. MiMo-V2.5 har i alt 310B parametre, men aktiverer kun omkring 15B for hver token; den bruger en stor pulje af specialister uden at køre dem alle på én gang.

MiMo-V2.5-Pro retter sig mod en anden arbejdslast. Det er en trillion-parameters tekstinput-model designet til den hårdeste kodning, terminal og langvarige agentopgaver. De to varianter deler en maksimal kontekst på 1M, men adskiller sig markant i modalitet, aktiv beregning og pris.

MiMo-V2.5 Specifications and Features

Officielle arkitekturdetaljerVærdiHvorfor det er vigtigt
ArkitekturSparsom MoEStor ekspertkapacitet med selektiv aktivering
Samlede/aktive parametre310B / 15BAktiv beregning er langt under total kapacitet
Transformer-lag48: 1 dense + 47 MoEDe fleste lag bruger routed eksperter
Routed eksperter256; 8 aktive pr. tokenSpecialisering uden tæt 310B-eksekvering
Attention39 SWA + 9 globale lagBalancerer lokal effektivitet og lang rækkevidde
SWA-vindue128 tokensReducerer kontekstcache-tryk
Kontekst / maksimalt output1M / 128K tokensUnderstøtter lange dokumenter og udvidede forløb
Input / outputTekst, billede, video, lyd / tekstNative perception på fire inputtyper
Vision-encoder729M ViT; 28 lagBillede- og videoforståelse
Audio-encoder261M transformer; 24 lagNative lydforståelse
Multi-Token Prediction3 moduler; ca. 329M parametreUnderstøtter effektiv spekulativ dekodning
TræningsskalaCa. 48T tokensBred tekst- og multimodal træningspipeline
API-kapaciteterVærktøjer, web, streaming, struktureret output, cachingProduktionsorienterede agentprimitive
LicensMITKommerciel brug og modifikation tilladt

Driftsrammen omfatter 1M kontekst og 128K output samt publicerede grænser på 100 forespørgsler pr. minut og 10 millioner tokens pr. minut. Leverandørniveaugrænser kan variere efter konto og integrationsrute.

Hvad er MiMo-V2.5? Specifikationer, benchmarks, funktioner, prissætning og API-adgang

Xiaomi MiMos officielle arkitekturdiagram. Officiel arkitekturressource.

How MiMo-V2.5 Architecture Works

Sparsomt ekspertsystem: Total kapacitet er ikke aktiv beregning

Den centrale effektivitetsfakta er designet med 310B total og 15B aktiv. Routeren vælger otte af 256 eksperter for hver token. Det giver modellen adgang til en langt større parameterpulje end en konventionel 15B tæt model uden at eksekvere alle 310B parametre hver gang.

Dette gør ikke selv-hosting trivielt. De komplette vægte skal stadig lagres og distribueres, så hukommelseskapacitet, interconnect-båndbredde, ekspert-routing og serving-software forbliver væsentlige begrænsninger.

Hybrid attention til lang kontekst

Backbonen blander sliding-window og global attention i et 5:1-forhold mellem SWA og global. Niogtredive lokale lag kontrollerer cachevækst, mens ni globale lag bevarer langdistance informationsflow. Xiaomi rapporterer næsten seks gange reduktion i KV-cache i forhold til et fuldt globalt design.

Et maksimum på 1M tokens er kapacitet, ikke en garanti for nøjagtighed. Retrieval-kvalitet, latenstid, værktøjstilstands-vækst og attention over fjern evidens kræver stadig arbejdslastspecifik evaluering.

Native encodere og agentfunktioner

En vision-transformer på 729M parametre håndterer billede- og videoinput; en lydtransformer på 261M håndterer lyd. Projektorerne kortlægger begge strømme ind i sprog-backbonen, så én agent kan kombinere et skærmbillede, et videosegment, et lydspor, tekstinstruktioner og værktøjsresultater.

Tre Multi-Token Prediction-moduler understøtter spekulativ dekodning og effektivitet i reinforcement learning. Modellen blev trænet på ca. 48T tokens, med kontekst gradvist udvidet til 1M under eftertræning.

De åbne vægte bruger en MIT-licens. Kommerciel udrulning er tilladt, men infrastrukturkost og tredjepartsafhængigheder kræver stadig separat gennemgang.

MiMo-V2.5 Benchmarks: Kodning, agenter og multimodale resultater

Benchmark-note:

tallene nedenfor er udgiver-rapporterede. De er retningsgivende, ikke en garanti for en specifik repository, medieformat, værktøjsstack, latenstarget eller sikkerhedspolitik.

Kodnings- og agentresultater

Hvad er MiMo-V2.5? Specifikationer, benchmarks, funktioner, prissætning og API-adgang

Officielt Xiaomi MiMo-diagram for kodnings- og agenteresultater.

Officiel kodningsbenchmarkRapporteret scoreBeslutningssignal
MiMo Coding Bench71,8Bred coding-agent kapabilitet
Claw-Eval Text62,3Generel tekst-agent fuldførelse
Terminal-Bench 2.065,8Interaktiv terminaleksekvering
SWE-Bench Pro56,1Virkelighedsnær software engineering
Claw-Eval Multi-Turn63,2Længere flertrins agentarbejde
ResearchClawBench16,91Autonome forskningsarbejdsgange

Resultat: den stærkeste sag er praktisk værktøjsbrug snarere end isoleret kodekompletion. Et resultat på 65,8 i Terminal-Bench understøtter terminalorienterede agenter, mens 56,1 på SWE-Bench Pro antyder nyttig evne på repository-niveau. Den meget lavere forskningsscore er en påmindelse om at teste evidensindsamling og citeringsadfærd separat.

Multimodale resultater

Hvad er MiMo-V2.5? Specifikationer, benchmarks, funktioner, prissætning og API-adgang

Officielt Xiaomi MiMo-diagram for billede, video og multimodal-agent benchmarks.

Officiel multimodal benchmarkRapporteret scoreTestet kapabilitet
CharXiv RQ81,0Diagram- og dokumentræsonnering
MMMU-Pro77,9Ekspertniveau multimodal ræsonnering
HR-Bench 4K88,5Højopløsningsbilledeforståelse
OmniDocBench87,2Dokumentforståelse
Claw-Eval Multimodal23,8Multimodal agentfuldførelse
Video-MME87,7Videoforståelse
DailyOmni83,5Daglig audiovisuel ræsonnering
VideoHolmes64,0Temporal videoræsonnering

Resultat: dokument-, højopløsningsbillede- og videoforståelse er de tydeligste styrker. Den multimodale agent-score på 23,8 er langt lavere end perceptionsscorerne, så et system, som både skal forstå medier og pålideligt betjene værktøjer, bør evalueres end-to-end.

MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison

Officiel arkitektursammenligningMiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
Praktisk implikation
Samlede parametre310B1,02TPro har over 3× den samlede kapacitet
Aktiverede parametre15B42BPro bruger ca. 2,8× flere aktive parametre
Lag / routed eksperter48 / 25670 / 384Pro er et større serving-mål
Modelkortets kontekstloft1M1MBegge angiver op til 1M tokens; test retrieval og latenstid i din arbejdslast
Officielt API maksimalt output128K128KBegge nuværende Xiaomi API-modelsider angiver 128K; leverandørspecifikke grænser kan variere
Native inputTekst, billede, video, lydTekstMiMo-V2.5 er det dokumenterede multimodale valg; verificer den præcise Pro-endpoint før medieinput
SWE-Bench Pro56,157,2Pro fører med 1,1 point
Terminal-Bench 2.065,868,4Pro fører med 2,6 point
Primær anvendelseEffektive multimodale agenterKompleks kodning og lang-horisont agenterVælg ud fra testet arbejdslast; modelniveau-margener beviser ikke en generel kvalitetsledelse

Sammenligningsresultat: Pros benchmark-fordel er beskeden på de to delte kodnings-agenttests, mens standardvarianten tilføjer native billed-, video- og lydinput og bruger langt færre aktive parametre. Pro er berettiget, når små gevinster i svær opgavefuldførelse er mere værdifulde end multimodalt input og lavere enhedsomkostning.

How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?

Prisgrundlag: 27. maj 2026Officiel standard APIOfficiel Pro APIMiMo-V2.5 API i CometAPIMiMo-V2.5-Pro API i CometAPI
Input, cache-miss / MTok$0,14$0,435$0,112$0,348
Output / MTok$0,28$0,87$0,224$0,696
Input, cache-hit / MTok$0,0028$0,0036Tjek live-billingTjek live-billing
Rabat vs. officiel ikke-cached satsBaselineBaseline20%20%

Ved officielle satser koster Pro ca. 3,1× så meget som standard for både ikke-cached input og output. De viste udbyderpriser reducerer hvert ikke-cached par med 20%, men den relative forskel mellem varianterne forbliver i det væsentlige uændret.

Pris pr. token er ikke totalomkostningen. Værktøjs-retries, kontekststørrelse, outputlængde, latenstid, fejlopgaver og menneskelig review bestemmer omkostning pr. fuldført opgave. Kør et repræsentativt arbejdslastudsnit, før du vælger en standard produktionsmodel.

What Is MiMo-V2.5 Best For?

  • Multimodale agenter: kombinér skærmbilleder, dokumenter, video, lyd, instruktioner og værktøjer i én arbejdsgang.
  • Langdokumentanalyse: behandl repositories, kontrakter, forskningsarkiver, logs og supporthistorikker.
  • Medieforståelse: opsummér videoer, udtræk hændelser, fortolk diagrammer og besvar audiovisuelle spørgsmål.
  • Kodnings- og terminalagenter: inspicér filer, kør kommandoer, ændr kode og iterér på testresultater.
  • Højvolumen-automatisering: brug sparsom aktivering og lavere tokenpriser til gentagne produktionstasks.

Limitations and Risks

  • Kun 15B parametre er aktive pr. token, men selv-hosting kræver stadig det fulde 310B-vægtsystem.
  • Multimodalt output er tekst; generering af billeder, tale og video kræver andre modeller.
  • Et kontekstloft på 1M garanterer ikke ensartet retrieval-nøjagtighed på hele vinduet.
  • Udgiverbenchmarks overføres muligvis ikke til brugerdefinerede værktøjer, repositories, prompts eller sikkerhedskrav.
  • Leverandørens eksponering af modalitet kan afvige fra den underliggende open-weight models fulde kapacitet.

Produktionskontrol:

valider nøjagtighed, værktøjsopkald, latenstid, tokenforbrug, håndtering af modalitet og fallback-adfærd på repræsentative opgaver, før du sender trafik.

API Example

Det følgende Python-eksempel bruger et OpenAI-kompatibelt CometAPI-endpoint og standardmodellens ID. Bekræft det aktuelle endpoint og understøttet forespørgselsskema før udrulning.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Decision Guide

ArbejdsbelastningssignalStart medSkift når
Billeder, video eller lyd er førsteklasses inputStandardSkift ikke, medmindre multimodal forbehandling er acceptabel
Stor dokument- eller mixed-media-volumenStandardPro kun hvis ræsonneringsfejl dominerer omkostningen
Svær repository-udviklingTest beggeVælg Pro hvis gevinsten i fuldførelse opvejer 3,1× enhedsprisen
Lange autonome terminalforløbProGå tilbage til standard, hvis gevinster ikke er målbare
Højvolumen rutine-automatiseringStandardEskalér kun mislykkede eller højværdioveropgaver

Anbefalet routing:

brug standard som default til multimodalt og højvolumen-arbejde, og rout kun svære, tekst-først kodnings- eller lang-horisont opgaver til Pro. Dette bevarer kapabilitet og kontrollerer totalomkostningen.

Conclusion

Standardmodellen er ikke blot en mindre Pro. Den er et særskilt optimeringspunkt: native multimodalt input, 1M kontekst, stærke værktøjsorienterede benchmarks og 15B aktive parametre til en langt lavere tokenpris.

Pro er specialistvalget til vanskelig softwareudvikling og vedvarende autonom eksekvering. Dens ekstra kapacitet giver målbare, men ikke universelle gevinster, så det stærkeste udrulningsmønster er arbejdslastbaseret routing frem for at vælge én variant til alle forespørgsler.

FAQ

Er standardmodellen open source?

Dens vægte er frigivet under MIT-licensen, hvilket tillader kommerciel brug, modifikation, finjustering og redistribution under licensbetingelserne.

Hvor mange parametre bruger den?

Den sparsomme MoE indeholder 310B samlede parametre og aktiverer 15B for hver token. Aktive parametre beskriver pr.-token-beregning, ikke lagringsstørrelsen for den komplette model.

Understøtter den billeder, video og lyd?

Ja. Standardvarianten accepterer tekst, billeder, video og lyd og returnerer tekst. Pro-variantens officielle specifikation angiver tekstinput.

Hvad er det maksimale kontekstvindue?

Begge modelkort angiver et kontekstvindue på op til 1M tokens. Xiaomis nuværende API-sider angiver et maksimalt output på 128K for MiMo-V2.5 og MiMo-V2.5-Pro. Faktiske, brugbare grænser kan variere efter endpoint, leverandør, konto og forespørgselsformat; verificér den udrullede rute før afhængighed af disse lofter.

Den nuværende officielle Pro API-side bekræfter separat 1M kontekst og 128K maksimalt output: MiMo-V2.5-Pro API specifications

Hvilken variant er bedre til kodeagenter?

Pro rapporterer højere resultater på delte kodnings- og terminalbenchmarks, men marginen er beskeden. Test begge på det målrettede repository og vælg baseret på opgavefuldførelse, latenstid og totalomkostning.

Hvilken variant er bedre til multimodale agenter?

Standardvarianten er det naturlige valg, fordi den natively accepterer billed-, video- og lydinput. Pro er fokuseret på tekstinput.

Hvordan bør et produktionsteam vælge?

Start med standard, mål fejl, og rout kun de svære tekst-først opgaver, som får fordel af Pro. Sammenlign omkostning pr. fuldført opgave fremfor pris pr. token alene.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Oct 5, 2026
Sidst opdateret Oct 5, 2026
1 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Læs mere