TL;DR
MiMo-V2.5 API i CometAPI giver adgang til Xiaomis sparsomme mixture-of-experts-model til kodning, multimodal forståelse og agent-baserede arbejdsbelastninger. MiMo-V2.5 API'et er det praktiske standardvalg, når et projekt har brug for et kontekstvindue på 1 million tokens, native multimodale input og lav tokenpris; MiMo-V2.5 Pro passer bedre, når vanskelig kodning, ræsonnering eller værktøjsbrug over lang horisont vægter højere end prisen. Denne vejledning viser, hvordan man kalder API'et via CometAPI, streamer svar, strukturerer multimodale forespørgsler, estimerer omkostninger og gør en produktionsintegration mere robust.
Key Takeaways
- MiMo-V2.5-modellen bruger 310B samlede parametre med 15B aktive parametre pr. token og understøtter et kontekstvindue på 1M tokens.
- Brug MiMo-V2.5-ruten til multimodalt arbejde, analyse med store kontekster og omkostningsfølsomme agenter; vælg MiMo-V2.5 Pro til de sværeste kodnings- og ræsonneringsopgaver.
- Det OpenAI-kompatible endepunkt gør migrering ligetil, men produktionssystemer har stadig brug for timeouts, retry-logik, tokenbudgetter og kapabilitetstjek på udbydersiden.
- Ved de angivne CometAPI-takster koster en forespørgsel med 10.000 inputtokens og 2.000 outputtokens cirka $0.001568 på MiMo-V2.5-ruten.
MiMo-V2.5 Model Overview
Xiaomi introducerede modellen den 22. april 2026. MiMo-V2.5 API i CometAPI eksponerer den via et OpenAI-kompatibelt chat-completions-interface, så eksisterende klienter normalt kan migrere ved at ændre base-URL, API-nøgle og modelidentifikator.
Ifølge det officielle modelkort kombinerer modellen et sparsomme MoE-sprog-backbone med dedikerede vision- og lyd-enkodere. Den accepterer tekst-, billede-, video- og lydinput og producerer tekstoutput. Dens store kontekstvindue er nyttigt til kodegennemgang i repository-størrelse, dokumentsæt, lange transskriptioner og multi-step agenter.
| Specification | Value | Why it matters |
|---|---|---|
| Architecture | Spars mixture-of-experts | Aktiverer en begrænset del af netværket for hvert token. |
| Total parameters | 310B | Giver bred kapacitet uden at bruge hver parameter pr. token. |
| Active parameters | 15B | Understøtter effektiv inferens i forhold til den samlede modelstørrelse. |
| Context window | 1,000,000 tokens | Håndterer store repositories og lange dokumentsamlinger. |
| Maximum output | Op til 128K tokens via den aktuelle rute | Understøtter lange rapporter og udvidet kodegenerering. |
| Native inputs | Tekst, billede, video, lyd | Muliggør unified multimodale workflows. |
| Output modality | Tekst | Svar returneres som genereret tekst. |
| Vision encoder | 729M-parameter ViT | Behandler visuelt indhold til billede- og videoopgaver. |
| Audio encoder | 261M-parameter Transformer | Behandler tale og andet lydinput. |
| License | MIT | Tillader bred kommerciel og forskningsmæssig brug under licensvilkårene. |
Det officielle multimodale benchmark-billede nedenfor rapporterer resultater på billedforståelse, multimodale agenter og videoforståelse.

Officiel Xiaomi MiMo-V2.5 multimodal benchmark-sammenligning
Udbyderruter kan eksponere et smallere sæt medieformater end den underliggende model understøtter. Valider det præcise billed-, lyd- og videopayloadformat mod det aktive endepunkt, før du lancerer en multimodal funktion.
MiMo-V2.5 Benchmark Performance
Xiaomi rapporterer stærke resultater inden for kodning, terminalbrug og evaluering af multimodale agenter. Disse tal er nyttige til at positionere modellen, men de er ikke erstatninger for tests på dine egne prompts, værktøjer, latensmål og fejlbetingelser.
| Benchmark | Reported score | Evaluation focus |
|---|---|---|
| SWE-Bench Pro | 56.1 | Softwareudvikling på repository-niveau |
| Terminal-Bench 2.0 | 65.8 | Terminal-baserede agentopgaver |
| Claw-Eval General | 62.1 Pass@3 | Generel agentkapacitet |
| Claw-Eval Multimodal | 23.8 Pass@3 | Multimodale agentopgaver |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | Agentadfærd over flere omgange |
| ResearchClawBench | 16.91 | Forskningsorienterede agent-workflows |
Den officielle kodningssammenligning viser 65.8 på Terminal-Bench 2.0 og 56.1 på SWE-Bench Pro og placerer samtidig modellen i en bredere sammenligning af kode-agenter.

Officiel Xiaomi MiMo-V2.5 sammenligning af kode-benchmarks
Hvad resultaterne antyder: modellen er især attraktiv til applikationer, der kombinerer kode, værktøjer og blandede medier. For deterministiske produktionsbeslutninger bør du køre en intern evaluering, der måler opgavesucces, tokenforbrug, end-to-end latens, retry-frekvens og graden af menneskelig korrektion.
MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison
| Dimension | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Total parameters | 310B | 1.02T |
| Active parameters | 15B | 42B |
| Context window | 1M tokens | 1M tokens |
| Primary strength | Omnimodale og generelle agent-workloads | Komplekse agenter og krævende kodning |
| Input price per 1M tokens | $0.112 | $0.348 |
| Output price per 1M tokens | $0.224 | $0.696 |
| Best fit | Multimodale, store kontekster, omkostningsfølsomme systemer | Hård ræsonnering, kodning og lang horisont for udførelse |
| Official API input modalities | Tekst, billede, video, lyd | Tekst |
| Official API output modality | Tekst | Tekst |
Sammenligningsresultat: start med MiMo-V2.5-ruten når pris, gennemløb eller multimodal dækning styrer beslutningen. Flyt udvalgte forespørgsler til MiMo-V2.5 Pro, når interne evalueringer viser en meningsfuld nøjagtighedsgevinst på svær kodning, ræsonnering eller værktøjsbrug. En lagdelt router leverer ofte en bedre balance mellem pris og kvalitet end at sende alle forespørgsler til MiMo-V2.5 Pro.
How to Call the MiMo-V2.5 API
API'et følger det velkendte chat-completions-skema. Opbevar nøglen på din server, indlæs den fra en miljøvariabel, og indlejr den aldrig i browser- eller mobilkode.
Set the API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Send a cURL request
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Use Python with the OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> Log ikke API-nøgler, fulde autoriseringsheaders eller følsomt promptindhold. Brug en secrets manager i produktion og roter legitimationsoplysninger efter en defineret plan.
## How to Stream MiMo-V2.5 API Responses
Streaming reducerer oplevet latens ved lange svar. Tjenesten returnerer inkrementelle events, som SDK'et eksponerer som chunks.
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
I en webtjeneste skal du videresende deltas med Server-Sent Events eller WebSocket-beskeder, håndtere klientafbrydelser og stoppe upstream-generering, når brugeren annullerer.
## MiMo-V2.5 API Multimodal and Structured Workflows
Til billedebevidste opgaver skal du sende en tekstinstruktion plus et billedeobjekt i samme brugerbesked. Den præcise accepterede medierepræsentation kan variere efter udbyderrute, så behandl dette som et payloadmønster og bekræft aktuel ruteunderstøttelse.
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
Til maskinlæsbare resultater skal du bede om et kompakt JSON-objekt og validere det mod din egen skema. Antag aldrig, at genereret JSON er sikker, blot fordi den kan parses.
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## MiMo-V2.5 API Pricing on CometAPI and Cost Control
| Route | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Xiaomi pay-as-you-go reference | $0.14 | $0.28 | $0.1960 |
Eksemplet antager 100 forespørgsler, hver med 10.000 inputtokens og 2.000 outputtokens. Under disse antagelser er MiMo-V2.5-ruten cirka 68% billigere end MiMo-V2.5 Pro. Xiaomis [offentliggjorte pay-as-you-go-priser](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) er et nyttigt referencepunkt, mens de faktiske regninger bør verificeres mod den aktive udbyderpris før implementering.
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
Kontrollér omkostninger med maksimale outputgrænser, promptkomprimering, cachet kontekst, klassificering af forespørgsler og en router, der kun eskalerer vanskelige opgaver. Spor omkostninger pr. succesfuld opgave i stedet for pr. forespørgsel; en billigere forespørgsel, der fejler gentagne gange, kan være dyrere samlet set.
## How to Design Long-Context MiMo-V2.5 API Requests
Et kontekstvindue på 1M tokens gør større input muligt, men det fjerner ikke tradeoffs omkring retrieval og attention. Opbyg prompten, så modellen hurtigt kan finde relevant evidens.
* Placer opgaven, outputkontrakten og beslutningskriterierne nær begyndelsen.
* Adskil dokumenter med stabile identifikatorer og klare skilletegn.
* Medtag kun evidens, der kan påvirke svaret.
* Bed modellen om at citere dokumentidentifikatorer eller linjereferencer i resultatet.
* Mål nøjagtighed i takt med at konteksten vokser; betragt ikke maksimal kontekst som den ideelle kontekst.
> Lang kontekst øger både tokenomkostninger og risikoen for, at irrelevant materiale distraherer modellen. Retrieval, opsummering og hierarkisk prompting forbliver vigtige, selv når hele korpus kan være med.
## Production Reliability
### Retry only transient failures
Gentag ratebegrænsninger og midlertidige serverfejl med eksponentiel backoff og jitter. Gentag ikke automatisk ugyldig autentificering, malformerede payloads eller politikfejl.
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Set operational guardrails
* Brug forbindelses- og overordnede forespørgselstimeouts.
* Tilføj en idempotensnøgle til workflows med eksterne sideeffekter.
* Registrér model-ID, latens, input- og outputtokens, antal retries og endelig status.
* Redigér bort hemmeligheder og persondata før logging.
* Kræv tilladelseslister for værktøjer og bekræftelse for destruktive handlinger.
* Vedligehold en fallback-model eller kø til udbydernedbrud.
## MiMo-V2.5 API Common Errors and Solutions
| Symptom | Likely cause | Recommended action |
| ------------- | ---------------------------------------------- | ---------------------------------------------------------------- |
| 401 or 403 | Manglende, ugyldig eller uautoriseret API-nøgle | Verificér server-side hemmelighed og projektets tilladelser. |
| 400 | Malformerede beskeder eller ikke-understøttet medieobjekt | Validér JSON og bekræft rutespecifik payload-understøttelse. |
| 413 | Request body er for stor | Reducér mediestørrelse eller del inputtet op. |
| 429 | Rate- eller kvotebegrænsning | Backoff med jitter og håndhæv klient-side samtidighedsgrænser. |
| 5xx | Midlertidig udbyderfejl | Gentag inden for et begrænset budget eller failover. |
| Slow response | Stor kontekst, langt output eller værktøjslatens | Stream output, sæt tokenloft, og profilér hvert trin. |
| Invalid JSON | Drift i genereringen | Validér, reparér én gang hvis det er sikkert, og afvis vedvarende fejl. |
## Conclusion
MiMo-V2.5-modellen er det stærkeste udgangspunkt for teams, der har brug for multimodale input, stor kontekst og aggressiv omkostningsstyring. Pro bør være en bevidst eskalering til opgaver, hvor målte kvalitetsgevinster retfærdiggør den højere pris. Start med et lille evalueringssæt, instrumentér hver forespørgsel, og promover integrationen først efter test af reelle payloads, lang-kontekst-adfærd, retry-håndtering og fejlgendannelse.
## FAQ
### What endpoint should I use?
Brug `/api.cometapi.com/v1/chat/completions`, eller sæt `/api.cometapi.com/v1` som base-URL i et OpenAI-kompatibelt SDK.
### What model identifier should I send?
Brug `mimo-v2.5` til MiMo-V2.5-ruten. Bekræft den aktuelle identifikator før lancering, hvis din konto bruger et udbyderspecifikt alias.
### When should I choose MiMo-V2.5 Pro?
Vælg MiMo-V2.5 Pro, når din evaluering viser en væsentlig fordel på svære kodnings-, ræsonnerings- eller langvarige værktøjsopgaver. Behold rutine- eller multimodal trafik på MiMo-V2.5-ruten, når dens kvalitet er tilstrækkelig.
### Does a 1M-token context mean I should send everything?
Nej. Stor kontekst er en kapacitetsgrænse, ikke et promptdesignmål. Hent og organisér den evidens, der kan påvirke svaret, og mål kvalitet og omkostninger i takt med at input vokser.
### Can I call the API directly from a browser?
Eksponér ikke en hemmelig API-nøgle i frontend-kode. Kald udbyderen fra din backend og anvend autentificering, ratebegrænsning, logging og datakontroller dér.
### How do I verify multimodal support?
Test den præcise mediepayload mod den aktive udbyderrute. Modellens native modaliteter garanterer ikke, at hver rute eksponerer hvert format på samme måde.
