GPT-6.1 Sol are now live on CometAPI →
ai-model/CometAPI research

Wat is MiMo-V2.5? Specificaties, benchmarks, functies, prijzen en API-toegang

Verken de specificaties, architectuur, officiële benchmarks, prijsstelling, vergelijking met MiMo-V2.5-Pro, gebruiksscenario's, beperkingen en CometAPI-toegang van Xiaomi MiMo-V2.5.

CometAPI
Deon GoodwinOnderzoeksteam voor AI-modellen en API
Bijgewerkt Oct 5, 2026 12 min leestijd
Wat is MiMo-V2.5? Specificaties, benchmarks, functies, prijzen en API-toegang
Gebruik dit patroon

Doe de eerste API-aanroep.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Het standaardmodel V2.5 van Xiaomi combineert native begrip van tekst, beeld, video en audio met een contextvenster van 1 miljoen tokens, toolgebruik en efficiënte sparse Mixture-of-Experts. Het is beter geschikt wanneer multimodale invoer en kosten per voltooide taak belangrijk zijn. De Pro-variant is groter en sterker voor veeleisend coderen en lang-horizon agentwerk, maar is gericht op tekstinvoer en kost ongeveer driemaal zoveel per token tegen de gepubliceerde tarieven van Xiaomi.

De praktische keuze is eenvoudig: kies het standaardmodel voor multimodale agents, document- en media-analyse en automatisering op grote schaal; kies Pro wanneer moeilijk software-engineeringwerk of langdurige autonome uitvoering de bottleneck is.

Key Takeaways

  • Het standaardmodel gebruikt 310B totale parameters en activeert 15B per token.
  • Het accepteert tekst, afbeeldingen, video en audio en geeft tekst terug.
  • De API ondersteunt 1M context, tot 128K output, tool-calls, webzoekopdrachten, streaming, gestructureerde output en contextcaching.
  • Door de uitgever gerapporteerde resultaten omvatten 65,8 op Terminal-Bench 2.0 en 56,1 op SWE-Bench Pro.
  • De huidige modelkaart van Xiaomi’s MiMo-V2.5-Pro vermeldt 1,02T totale en 42B actieve parameters. De door de uitgever vermelde SWE-Bench Pro-scores zijn 56,1 voor MiMo-V2.5 en 57,2 voor Pro; dit zijn gedateerde, door de uitgever gerapporteerde vergelijkingen, geen garantie voor een specifieke codewerkstroom.
  • Tegen de huidige Xiaomi-tarieven kosten standaard input/output $0,14/$0,28 per miljoen tokens; Pro kost $0,435/$0,87.
  • Beide API’s in CometAPI zijn geprijsd 20% onder de officiële ongecachte prijsparen.
    Gecontroleerde informatie: 28 september 2026. Prijzen, benchmarks, limieten, beschikbaarheid en aanvraagformaten kunnen veranderen. Xiaomi heeft aangekondigd dat de officiële API-modelnamen mimo-v2.5 en mimo-v2.5-pro op 21 oktober 2026 om 10:00 uur Beijing-tijd worden afgeschaft zonder automatische vervanging. Plan migratie en bevestig de live route vóór uitrol.

Opmerking over API-levenscyclus: het officiële Xiaomi-platform is van plan beide V2.5-model-ID’s te verwijderen op 21 oktober 2026. Deze melding betreft het API-platform van Xiaomi; controleer eventuele gateways van derden afzonderlijk. Kennisgeving van buitengebruikstelling van Xiaomi-model

What the Standard Model Is

MiMo-V2.5 is Xiaomi MiMo’s op efficiëntie gerichte foundationmodel voor multimodale perceptie en agentisch werk. Het biedt native tekst-, beeld-, video- en audio-invoer binnen één architectuur en produceert tekstoutput.

Volgens het modelreleaselog dateert de publieke bèta van de MiMo-V2.5-serie van 23 april 2026. De gewichten zijn vervolgens vrijgegeven onder de MIT-licentie. MiMo-V2.5 heeft in totaal 310B parameters, maar activeert slechts ongeveer 15B per token; het gebruikt een grote pool van specialisten zonder ze allemaal tegelijk uit te voeren.

MiMo-V2.5-Pro richt zich op een andere werklast. Het is een triljoen-parameter, tekstinvoer-model ontworpen voor de moeilijkste codeer-, terminal- en langlopende agenttaken. De twee varianten delen een maximale context van 1M, maar verschillen sterk in modaliteit, actieve compute en prijs.

MiMo-V2.5 Specifications and Features

Officiële architectuurdetailsWaardeWaarom dit ertoe doet
ArchitectuurSparse MoEGrote expertcapaciteit met selectieve activatie
Totale/actieve parameters310B / 15BActieve compute is ver onder totale capaciteit
Transformerlagen48: 1 dense + 47 MoEDe meeste lagen gebruiken gerouteerde experts
Gerouteerde experts256; 8 actief per tokenSpecialisatie zonder dense 310B-executie
Attention39 SWA + 9 globale lagenBalanceert lokale efficiëntie en lange-afstandsstroom
SWA-venster128 tokensVermindert cachedruk voor lange context
Context / maximale output1M / 128K tokensOndersteunt lange documenten en extended traces
Invoer / uitvoerTekst, beeld, video, audio / tekstNative perceptie over vier invoertypen
Visie-encoder729M ViT; 28 lagenBegrip van afbeeldingen en video
Audio-encoder261M transformer; 24 lagenNative begrip van audio
Multi-Token Prediction3 modules; circa 329M parametersOndersteunt efficiëntie via speculative decoding
TrainingsschaalCirca 48T tokensBrede tekst- en multimodale trainingspijplijn
API-mogelijkhedenTools, web, streaming, gestructureerde output, cachingProductiegerichte agentprimitieven
LicentieMITCommercieel gebruik en modificatie toegestaan

Het operationele bereik omvat 1M context en 128K output, plus gepubliceerde limieten van 100 requests per minuut en 10 miljoen tokens per minuut. Providerlimieten kunnen per account en integratieroute verschillen.

Wat is MiMo-V2.5? Specificaties, benchmarks, functies, prijzen en API-toegang

Het officiële architectuurdiagram van Xiaomi MiMo. Officieel architectuur-asset.

How MiMo-V2.5 Architecture Works

Sparse Experts: Totale capaciteit is geen actieve compute

Het centrale efficiëntiepunt is het ontwerp met 310B totaal en 15B actief. De router selecteert acht van 256 experts voor elk token. Daardoor heeft het model toegang tot een veel grotere parameterpool dan een conventioneel 15B dense model zonder elke keer alle 310B parameters uit te voeren.

Dit maakt self-hosting niet triviaal. De complete gewichten moeten nog steeds worden opgeslagen en gedistribueerd, dus geheugen­capaciteit, interconnectbandbreedte, expert­routering en servingsoftware blijven materiële beperkingen.

Hybride attention voor lange context

De ruggengraat verweeft sliding-window en globale attention met een 5:1 SWA-naar-globale verhouding. Negenendertig lokale lagen beheersen de cachegroei, terwijl negen globale lagen de langafstands­informatiedoorstroming behouden. Xiaomi meldt bijna een zesvoudige KV-cache-reductie ten opzichte van een volledig globale opzet.

Een maximum van 1M tokens is capaciteit, geen gegarandeerde nauwkeurigheid. Retrievalkwaliteit, latentie, groei van toolstatus en aandacht over verre bewijslijnen vereisen nog steeds workload-specifieke evaluatie.

Native encoders en agentfuncties

Een vision transformer met 729M parameters verwerkt beeld- en video-invoer; een audiotransformer met 261M parameters verwerkt audio. De projectors mappen beide stromen in de taalruggengraat, zodat één agent een screenshot, een videosegment, een audiotrack, tekstinstructies en toolresultaten kan combineren.

Drie Multi-Token Prediction-modules ondersteunen speculative decoding en efficiëntie in bekrachtigingsleren. Het model is getraind op circa 48T tokens, met context die tijdens post-training progressief werd uitgebreid tot 1M.

De open gewichten gebruiken een MIT-licentie. Commerciële inzet is toegestaan, maar infrastructuurkosten en afhankelijkheden van derden vergen nog aparte beoordeling.

MiMo-V2.5 Benchmarks: Coderen, agents en multimodale resultaten

Benchmarkopmerking:

onderstaande cijfers zijn door de uitgever gerapporteerd. Zij zijn richtinggevend bewijs, geen garantie voor een specifieke repository, mediaformaat, toolstack, latentiedoel of veiligheidsbeleid.

Coding and Agent Results

Wat is MiMo-V2.5? Specificaties, benchmarks, functies, prijzen en API-toegang

Officiële Xiaomi MiMo-benchmarkgrafiek voor coderen en agents.

Officiële codebenchmarkGerapporteerde scoreBeslissingssignaal
MiMo Coding Bench71,8Brede capaciteit voor coding-agents
Claw-Eval Text62,3Algemene tekst-agentcompletion
Terminal-Bench 2.065,8Interactieve terminaluitvoering
SWE-Bench Pro56,1Software-engineering in de praktijk
Claw-Eval Multi-Turn63,2Langer meerstaps agentwerk
ResearchClawBench16,91Autonome onderzoeksworkflows

Resultaat: het sterkste argument is praktisch toolgebruik in plaats van geïsoleerde codecompletion. Een Terminal-Bench-score van 65,8 ondersteunt terminalgerichte agents, terwijl 56,1 op SWE-Bench Pro wijst op bruikbare vaardigheden op repository-niveau. De veel lagere researchscore herinnert eraan om bewijsverzameling en citeergedrag afzonderlijk te testen.

Multimodal Results

Wat is MiMo-V2.5? Specificaties, benchmarks, functies, prijzen en API-toegang

Officiële Xiaomi MiMo-benchmarkgrafiek voor beeld, video en multimodale agents.

Officiële multimodale benchmarkGerapporteerde scoreGeteste capaciteit
CharXiv RQ81,0Redeneren over grafieken en documenten
MMMU-Pro77,9Multimodaal redeneren op expertniveau
HR-Bench 4K88,5Inzicht in beelden met hoge resolutie
OmniDocBench87,2Documentbegrip
Claw-Eval Multimodal23,8Multimodale agentcompletion
Video-MME87,7Videobegrip
DailyOmni83,5Alledaags audiovisueel redeneren
VideoHolmes64,0Temporeel redeneren over video

Resultaat: document-, hoge-resolutiebeeld- en videobegrip zijn de duidelijkste sterke punten. De multimodale-agentscore van 23,8 is veel lager dan de perceptiescores, dus een systeem dat zowel media moet begrijpen als tools betrouwbaar moet bedienen, moet end-to-end worden geëvalueerd.

MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison

Officiële architectuurvergelijkingMiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
Praktische implicatie
Totale parameters310B1,02TPro heeft meer dan 3× de totale capaciteit
Geactiveerde parameters15B42BPro gebruikt circa 2,8× meer actieve parameters
Lagen / gerouteerde experts48 / 25670 / 384Pro is een groter servingdoel
Modelkaart contextplafond1M1MBeide vermelden tot 1M tokens; test retrieval en latentie op jouw werklastgrootte
Officiële API maximale output128K128KBeide huidige Xiaomi API-paginamodellen vermelden 128K; provider-specifieke limieten kunnen verschillen
Native invoerTekst, beeld, video, audioTekstMiMo-V2.5 is de gedocumenteerde multimodale keuze; verifieer de exacte Pro-endpoint vóór het verzenden van media
SWE-Bench Pro56,157,2Pro leidt met 1,1 punten
Terminal-Bench 2.065,868,4Pro leidt met 2,6 punten
Primaire fitEfficiënte multimodale agentsComplex coderen en lang-horizon agentsKies op basis van geteste werklast; de modelmarges bewijzen geen algemene kwaliteitsvoorsprong

Vergelijkingsresultaat: het benchmarkvoordeel van Pro is bescheiden op de twee gedeelde coding-agenttests, terwijl de standaardvariant native beeld-, video- en audio-invoer toevoegt en veel minder actieve parameters gebruikt. Pro is gerechtvaardigd wanneer kleine winst in moeilijke taakvoltooiing waardevoller is dan multimodale invoer en lagere eenheidskosten.

How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?

Prijsbasis: 27 mei 2026Officiële standaard-APIOfficiële Pro-APIMiMo-V2.5-API in CometAPIMiMo-V2.5-Pro-API in CometAPI
Invoer, cache-miss / MTok$0,14$0,435$0,112$0,348
Uitvoer / MTok$0,28$0,87$0,224$0,696
Invoer, cache-hit / MTok$0,0028$0,0036Controleer actuele facturatieControleer actuele facturatie
Korting t.o.v. officiële ongecachte tarievenReferentieReferentie20%20%

Tegen officiële tarieven kost Pro ongeveer 3,1× zoveel als standaard voor zowel ongecachte invoer als uitvoer. De hierboven getoonde providerprijzen verlagen elk ongecacht paar met 20%, maar de relatieve kloof tussen de varianten blijft praktisch ongewijzigd.

Prijs per token is niet gelijk aan de totale kosten. Toolretries, contextgrootte, outputlengte, latentie, herstel van mislukte taken en menselijke review bepalen de kosten per voltooide taak. Voer een representatieve workload uit voordat je een standaard productiemodel kiest.

What Is MiMo-V2.5 Best For?

  • Multimodale agents: combineer screenshots, documenten, video, audio, instructies en tools in één workflow.
  • Analyse van lange documenten: verwerk repositories, contracten, onderzoeksarchieven, logs en supporthistorie.
  • Mediabegrip: vat video’s samen, extraheer gebeurtenissen, interpreteer grafieken en beantwoord audiovisuele vragen.
  • Coding- en terminalagents: inspecteer bestanden, voer commando’s uit, wijzig code en itereren op testresultaten.
  • Automatisering op grote schaal: gebruik sparse activatie en lagere tokenprijzen voor herhaalde productie­taken.

Limitations and Risks

  • Slechts 15B parameters zijn actief per token, maar self-hosting vereist nog steeds het volledige 310B-gewichtensysteem.
  • Multimodale output is tekst; generatie van beeld, spraak en video vereist andere modellen.
  • Een contextplafond van 1M garandeert geen uniforme retrievalnauwkeurigheid over het volledige venster.
  • Door de uitgever gepubliceerde benchmarks zijn mogelijk niet overdraagbaar naar aangepaste tools, repositories, prompts of veiligheidsconstraints.
  • De modaliteitsblootstelling door de provider kan verschillen van de volledige capaciteiten van het onderliggende open-gewichtenmodel.

Productiecontrole:

valideer nauwkeurigheid, afronding van tool-calls, latentie, tokenverbruik, modaliteitshandling en fallbackgedrag op representatieve taken voordat je verkeer committeert.

API Example

De volgende Python-voorbeeld maakt gebruik van een OpenAI-compatibele CometAPI-endpoint en de standaardmodel-ID. Bevestig de huidige endpoint en ondersteund aanvraag­schema vóór uitrol.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Decision Guide

WorkloadsignaalStart metSchakel over wanneer
Afbeeldingen, video of audio zijn eersteklas invoerStandaardNiet overschakelen tenzij multimodale preprocessing acceptabel is
Groot volume aan documenten of mixed mediaStandaardPro alleen als redeneerfouten de kosten domineren
Moeilijke repository-engineeringTest beideKies Pro als de winst in voltooiing de 3,1× eenheidskosten compenseert
Lange autonome terminaltrajectenProGa terug naar standaard als winst niet meetbaar is
Routinematige automatisering op grote schaalStandaardEscaleer alleen mislukte of high-value taken

Aanbevolen routing:
gebruik standaard als default voor multimodale en grootschalige workloads, en routeer alleen moeilijke tekst-eerst coding- of lang-horizon taken naar Pro. Dit behoudt capaciteit terwijl de totale kosten onder controle blijven.

Conclusion

Het standaardmodel is niet simpelweg een kleinere Pro. Het is een apart optimalisatiepunt: native multimodale invoer, 1M context, sterke toolgerichte benchmarks en 15B actieve parameters tegen een veel lagere tokenprijs.

Pro is de specialistische optie voor moeilijke software-engineering en langdurige autonome uitvoering. De extra capaciteit levert meetbare maar geen universele winst op, dus het sterkste implementatiepatroon is workloadgebaseerde routing in plaats van één variant voor elke aanvraag te kiezen.

FAQ

Is the standard model open source?

De gewichten zijn vrijgegeven onder de MIT-licentie, die commercieel gebruik, modificatie, fine-tuning en herdistributie toestaat onder de licentievoorwaarden.

How many parameters does it use?

De sparse MoE bevat 310B totale parameters en activeert 15B per token. Actieve parameters beschrijven per-tokenberekening, niet de opslaggrootte van het complete model.

Does it support images, video, and audio?

Ja. De standaardvariant accepteert tekst, afbeeldingen, video en audio en geeft tekst terug. De officiële specificatie van de Pro-variant vermeldt tekstinvoer.

What is the maximum context window?

Beide modelkaarten specificeren een contextvenster tot 1M tokens. De huidige API-pagina’s van Xiaomi vermelden een maximaal output van 128K voor MiMo-V2.5 en MiMo-V2.5-Pro. De daadwerkelijk bruikbare limieten kunnen variëren per endpoint, provider, account en aanvraagformaat; verifieer de ingezette route voordat je op die plafonds vertrouwt.

De huidige officiële Pro-API-pagina bevestigt afzonderlijk de 1M context en 128K maximale output: Specificaties van de MiMo-V2.5-Pro API

Which variant is better for coding agents?

Pro rapporteert hogere resultaten op gedeelde code- en terminalbenchmarks, maar de marge is bescheiden. Test beide op de doelrepository en kies op basis van taakvoltooiing, latentie en totale kosten.

Which variant is better for multimodal agents?

De standaardvariant is de natuurlijke keuze omdat deze native beeld-, video- en audio-invoer accepteert. Pro is gericht op tekstinvoer.

How should a production team choose?

Begin met standaard, meet mislukkingen, en routeer alleen de moeilijke tekst-eerst taken die baat hebben bij Pro. Vergelijk kosten per voltooide taak in plaats van alleen prijs per token.

Verder leren

Koppel dit artikel aan de volgende beslissing.

Alle onderwerpen bekijken
Gepubliceerd op Oct 5, 2026
Laatst bijgewerkt Oct 5, 2026
0 weergaven
Gecontroleerd op duidelijkheid, bronvermelding en actuele API-terminologie.

Lees Meer