Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
guide/CometAPI research

Sådan bruger du MiMo-V2.5 API: komplet udviklervejledning

Lær Xiaomi API-specifikationer, benchmarks, prissætning, multimodale forespørgsler, streaming, Python-integration og best practices for produktion

CometAPI
Deon GoodwinForskningshold for AI-modeller og API
Opdateret Oct 7, 2026 10 min. læsning
Sådan bruger du MiMo-V2.5 API: komplet udviklervejledning
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiMo-V2.5 API i CometAPI giver adgang til Xiaomis sparsomme mixture-of-experts-model til kodning, multimodal forståelse og agent-baserede arbejdsbelastninger. MiMo-V2.5 API'et er det praktiske standardvalg, når et projekt har brug for et kontekstvindue på 1 million tokens, native multimodale input og lav tokenpris; MiMo-V2.5 Pro passer bedre, når vanskelig kodning, ræsonnering eller værktøjsbrug over lang horisont vægter højere end prisen. Denne vejledning viser, hvordan man kalder API'et via CometAPI, streamer svar, strukturerer multimodale forespørgsler, estimerer omkostninger og gør en produktionsintegration mere robust.

Key Takeaways

  • MiMo-V2.5-modellen bruger 310B samlede parametre med 15B aktive parametre pr. token og understøtter et kontekstvindue på 1M tokens.
  • Brug MiMo-V2.5-ruten til multimodalt arbejde, analyse med store kontekster og omkostningsfølsomme agenter; vælg MiMo-V2.5 Pro til de sværeste kodnings- og ræsonneringsopgaver.
  • Det OpenAI-kompatible endepunkt gør migrering ligetil, men produktionssystemer har stadig brug for timeouts, retry-logik, tokenbudgetter og kapabilitetstjek på udbydersiden.
  • Ved de angivne CometAPI-takster koster en forespørgsel med 10.000 inputtokens og 2.000 outputtokens cirka $0.001568 på MiMo-V2.5-ruten.

MiMo-V2.5 Model Overview

Xiaomi introducerede modellen den 22. april 2026. MiMo-V2.5 API i CometAPI eksponerer den via et OpenAI-kompatibelt chat-completions-interface, så eksisterende klienter normalt kan migrere ved at ændre base-URL, API-nøgle og modelidentifikator.

Ifølge det officielle modelkort kombinerer modellen et sparsomme MoE-sprog-backbone med dedikerede vision- og lyd-enkodere. Den accepterer tekst-, billede-, video- og lydinput og producerer tekstoutput. Dens store kontekstvindue er nyttigt til kodegennemgang i repository-størrelse, dokumentsæt, lange transskriptioner og multi-step agenter.

SpecificationValueWhy it matters
ArchitectureSpars mixture-of-expertsAktiverer en begrænset del af netværket for hvert token.
Total parameters310BGiver bred kapacitet uden at bruge hver parameter pr. token.
Active parameters15BUnderstøtter effektiv inferens i forhold til den samlede modelstørrelse.
Context window1,000,000 tokensHåndterer store repositories og lange dokumentsamlinger.
Maximum outputOp til 128K tokens via den aktuelle ruteUnderstøtter lange rapporter og udvidet kodegenerering.
Native inputsTekst, billede, video, lydMuliggør unified multimodale workflows.
Output modalityTekstSvar returneres som genereret tekst.
Vision encoder729M-parameter ViTBehandler visuelt indhold til billede- og videoopgaver.
Audio encoder261M-parameter TransformerBehandler tale og andet lydinput.
LicenseMITTillader bred kommerciel og forskningsmæssig brug under licensvilkårene.

Det officielle multimodale benchmark-billede nedenfor rapporterer resultater på billedforståelse, multimodale agenter og videoforståelse.

Sådan bruger du MiMo-V2.5 API: komplet udviklervejledning

Officiel Xiaomi MiMo-V2.5 multimodal benchmark-sammenligning

Udbyderruter kan eksponere et smallere sæt medieformater end den underliggende model understøtter. Valider det præcise billed-, lyd- og videopayloadformat mod det aktive endepunkt, før du lancerer en multimodal funktion.

MiMo-V2.5 Benchmark Performance

Xiaomi rapporterer stærke resultater inden for kodning, terminalbrug og evaluering af multimodale agenter. Disse tal er nyttige til at positionere modellen, men de er ikke erstatninger for tests på dine egne prompts, værktøjer, latensmål og fejlbetingelser.

BenchmarkReported scoreEvaluation focus
SWE-Bench Pro56.1Softwareudvikling på repository-niveau
Terminal-Bench 2.065.8Terminal-baserede agentopgaver
Claw-Eval General62.1 Pass@3Generel agentkapacitet
Claw-Eval Multimodal23.8 Pass@3Multimodale agentopgaver
Claw-Eval Multi-Turn63.2 Pass@3Agentadfærd over flere omgange
ResearchClawBench16.91Forskningsorienterede agent-workflows

Den officielle kodningssammenligning viser 65.8 på Terminal-Bench 2.0 og 56.1 på SWE-Bench Pro og placerer samtidig modellen i en bredere sammenligning af kode-agenter.

Sådan bruger du MiMo-V2.5 API: komplet udviklervejledning

Officiel Xiaomi MiMo-V2.5 sammenligning af kode-benchmarks

Hvad resultaterne antyder: modellen er især attraktiv til applikationer, der kombinerer kode, værktøjer og blandede medier. For deterministiske produktionsbeslutninger bør du køre en intern evaluering, der måler opgavesucces, tokenforbrug, end-to-end latens, retry-frekvens og graden af menneskelig korrektion.

MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison

DimensionMiMo-V2.5MiMo-V2.5-Pro
Total parameters310B1.02T
Active parameters15B42B
Context window1M tokens1M tokens
Primary strengthOmnimodale og generelle agent-workloadsKomplekse agenter og krævende kodning
Input price per 1M tokens$0.112$0.348
Output price per 1M tokens$0.224$0.696
Best fitMultimodale, store kontekster, omkostningsfølsomme systemerHård ræsonnering, kodning og lang horisont for udførelse
Official API input modalitiesTekst, billede, video, lydTekst
Official API output modalityTekstTekst

Sammenligningsresultat: start med MiMo-V2.5-ruten når pris, gennemløb eller multimodal dækning styrer beslutningen. Flyt udvalgte forespørgsler til MiMo-V2.5 Pro, når interne evalueringer viser en meningsfuld nøjagtighedsgevinst på svær kodning, ræsonnering eller værktøjsbrug. En lagdelt router leverer ofte en bedre balance mellem pris og kvalitet end at sende alle forespørgsler til MiMo-V2.5 Pro.

How to Call the MiMo-V2.5 API

API'et følger det velkendte chat-completions-skema. Opbevar nøglen på din server, indlæs den fra en miljøvariabel, og indlejr den aldrig i browser- eller mobilkode.

Set the API key

export COMETAPI_KEY="your_api_key_here"

$env:COMETAPI_KEY = "your_api_key_here"


### Send a cURL request

curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'


### Use Python with the OpenAI SDK

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)

print(response.choices[0].message.content)


> Log ikke API-nøgler, fulde autoriseringsheaders eller følsomt promptindhold. Brug en secrets manager i produktion og roter legitimationsoplysninger efter en defineret plan.

## How to Stream MiMo-V2.5 API Responses

Streaming reducerer oplevet latens ved lange svar. Tjenesten returnerer inkrementelle events, som SDK'et eksponerer som chunks.

stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)

for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)


I en webtjeneste skal du videresende deltas med Server-Sent Events eller WebSocket-beskeder, håndtere klientafbrydelser og stoppe upstream-generering, når brugeren annullerer.

## MiMo-V2.5 API Multimodal and Structured Workflows

Til billedebevidste opgaver skal du sende en tekstinstruktion plus et billedeobjekt i samme brugerbesked. Den præcise accepterede medierepræsentation kan variere efter udbyderrute, så behandl dette som et payloadmønster og bekræft aktuel ruteunderstøttelse.

{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}


Til maskinlæsbare resultater skal du bede om et kompakt JSON-objekt og validere det mod din egen skema. Antag aldrig, at genereret JSON er sikker, blot fordi den kan parses.

import json

raw = response.choices[0].message.content
result = json.loads(raw)

required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")


## MiMo-V2.5 API Pricing on CometAPI and Cost Control

| Route                          | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5                      | $0.112              | $0.224               | $0.1568             |
| MiMo-V2.5 Pro                  | $0.348              | $0.696               | $0.4872             |
| Xiaomi pay-as-you-go reference | $0.14               | $0.28                | $0.1960             |

Eksemplet antager 100 forespørgsler, hver med 10.000 inputtokens og 2.000 outputtokens. Under disse antagelser er MiMo-V2.5-ruten cirka 68% billigere end MiMo-V2.5 Pro. Xiaomis [offentliggjorte pay-as-you-go-priser](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) er et nyttigt referencepunkt, mens de faktiske regninger bør verificeres mod den aktive udbyderpris før implementering.

MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568

Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872


Kontrollér omkostninger med maksimale outputgrænser, promptkomprimering, cachet kontekst, klassificering af forespørgsler og en router, der kun eskalerer vanskelige opgaver. Spor omkostninger pr. succesfuld opgave i stedet for pr. forespørgsel; en billigere forespørgsel, der fejler gentagne gange, kan være dyrere samlet set.

## How to Design Long-Context MiMo-V2.5 API Requests

Et kontekstvindue på 1M tokens gør større input muligt, men det fjerner ikke tradeoffs omkring retrieval og attention. Opbyg prompten, så modellen hurtigt kan finde relevant evidens.

* Placer opgaven, outputkontrakten og beslutningskriterierne nær begyndelsen.
* Adskil dokumenter med stabile identifikatorer og klare skilletegn.
* Medtag kun evidens, der kan påvirke svaret.
* Bed modellen om at citere dokumentidentifikatorer eller linjereferencer i resultatet.
* Mål nøjagtighed i takt med at konteksten vokser; betragt ikke maksimal kontekst som den ideelle kontekst.

> Lang kontekst øger både tokenomkostninger og risikoen for, at irrelevant materiale distraherer modellen. Retrieval, opsummering og hierarkisk prompting forbliver vigtige, selv når hele korpus kan være med.

## Production Reliability

### Retry only transient failures

Gentag ratebegrænsninger og midlertidige serverfejl med eksponentiel backoff og jitter. Gentag ikke automatisk ugyldig autentificering, malformerede payloads eller politikfejl.

import random
import time

def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())

for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))


### Set operational guardrails

* Brug forbindelses- og overordnede forespørgselstimeouts.
* Tilføj en idempotensnøgle til workflows med eksterne sideeffekter.
* Registrér model-ID, latens, input- og outputtokens, antal retries og endelig status.
* Redigér bort hemmeligheder og persondata før logging.
* Kræv tilladelseslister for værktøjer og bekræftelse for destruktive handlinger.
* Vedligehold en fallback-model eller kø til udbydernedbrud.

## MiMo-V2.5 API Common Errors and Solutions

| Symptom       | Likely cause                                   | Recommended action                                               |
| ------------- | ---------------------------------------------- | ---------------------------------------------------------------- |
| 401 or 403    | Manglende, ugyldig eller uautoriseret API-nøgle | Verificér server-side hemmelighed og projektets tilladelser.     |
| 400           | Malformerede beskeder eller ikke-understøttet medieobjekt | Validér JSON og bekræft rutespecifik payload-understøttelse.     |
| 413           | Request body er for stor                       | Reducér mediestørrelse eller del inputtet op.                    |
| 429           | Rate- eller kvotebegrænsning                   | Backoff med jitter og håndhæv klient-side samtidighedsgrænser.   |
| 5xx           | Midlertidig udbyderfejl                        | Gentag inden for et begrænset budget eller failover.             |
| Slow response | Stor kontekst, langt output eller værktøjslatens | Stream output, sæt tokenloft, og profilér hvert trin.           |
| Invalid JSON  | Drift i genereringen                            | Validér, reparér én gang hvis det er sikkert, og afvis vedvarende fejl. |

## Conclusion

MiMo-V2.5-modellen er det stærkeste udgangspunkt for teams, der har brug for multimodale input, stor kontekst og aggressiv omkostningsstyring. Pro bør være en bevidst eskalering til opgaver, hvor målte kvalitetsgevinster retfærdiggør den højere pris. Start med et lille evalueringssæt, instrumentér hver forespørgsel, og promover integrationen først efter test af reelle payloads, lang-kontekst-adfærd, retry-håndtering og fejlgendannelse.

## FAQ

### What endpoint should I use?

Brug `/api.cometapi.com/v1/chat/completions`, eller sæt `/api.cometapi.com/v1` som base-URL i et OpenAI-kompatibelt SDK.

### What model identifier should I send?

Brug `mimo-v2.5` til MiMo-V2.5-ruten. Bekræft den aktuelle identifikator før lancering, hvis din konto bruger et udbyderspecifikt alias.

### When should I choose MiMo-V2.5 Pro?

Vælg MiMo-V2.5 Pro, når din evaluering viser en væsentlig fordel på svære kodnings-, ræsonnerings- eller langvarige værktøjsopgaver. Behold rutine- eller multimodal trafik på MiMo-V2.5-ruten, når dens kvalitet er tilstrækkelig.

### Does a 1M-token context mean I should send everything?

Nej. Stor kontekst er en kapacitetsgrænse, ikke et promptdesignmål. Hent og organisér den evidens, der kan påvirke svaret, og mål kvalitet og omkostninger i takt med at input vokser.

### Can I call the API directly from a browser?

Eksponér ikke en hemmelig API-nøgle i frontend-kode. Kald udbyderen fra din backend og anvend autentificering, ratebegrænsning, logging og datakontroller dér.

### How do I verify multimodal support?

Test den præcise mediepayload mod den aktive udbyderrute. Modellens native modaliteter garanterer ikke, at hver rute eksponerer hvert format på samme måde.
Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Oct 7, 2026
Sidst opdateret Oct 7, 2026
1 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Læs mere