TL;DR
API MiMo-V2.5 w CometAPI zapewnia dostęp do rzadkiej mieszanki ekspertów Xiaomi do zadań programistycznych, multimodalnego rozumienia i agentowych. API MiMo-V2.5 jest praktycznym domyślnym wyborem, gdy projekt wymaga okna kontekstu o wielkości 1 miliona tokenów, natywnego wejścia multimodalnego i niskiego kosztu tokenów; MiMo-V2.5 Pro lepiej sprawdza się, gdy trudne programowanie, wnioskowanie lub długotrwałe użycie narzędzi ma większe znaczenie niż cena. Ten przewodnik pokazuje, jak wywołać API przez CometAPI, strumieniować odpowiedzi, strukturyzować żądania multimodalne, oszacować koszt i utwardzić integrację produkcyjną.
Key Takeaways
- Model MiMo-V2.5 wykorzystuje łącznie 310B parametrów z 15B aktywnymi parametrami na token i obsługuje okno kontekstu 1M tokenów.
- Użyj trasy MiMo-V2.5 do pracy multimodalnej, analizy z dużym kontekstem i agentów wrażliwych na koszt; wybierz MiMo-V2.5 Pro do najtrudniejszych zadań programistycznych i wnioskowania.
- Zgodny z OpenAI punkt końcowy ułatwia migrację, ale systemy produkcyjne nadal potrzebują limitów czasu, logiki ponawiania, budżetów tokenów i kontroli możliwości po stronie dostawcy.
- Przy stawkach CometAPI, żądanie z 10 000 tokenów wejściowych i 2 000 tokenów wyjściowych kosztuje ok. $0.001568 na trasie MiMo-V2.5.
MiMo-V2.5 Model Overview
Xiaomi zaprezentowała model 22 kwietnia 2026 r. API MiMo-V2.5 w CometAPI udostępnia go przez zgodny z OpenAI interfejs chat-completions, więc istniejący klienci zwykle mogą się przenieść, zmieniając tylko bazowy URL, klucz API i identyfikator modelu.
Zgodnie z oficjalną kartą modelu model łączy rzadką mieszankę ekspertów w części językowej z dedykowanymi koderami wizji i audio. Akceptuje wejścia tekstowe, obraz, wideo i audio, generując wyjście tekstowe. Duże okno kontekstu jest przydatne do przeglądu kodu na poziomie repozytorium, zestawów dokumentów, długich transkryptów i agentów wieloetapowych.
| Specyfikacja | Wartość | Dlaczego to istotne |
|---|---|---|
| Architektura | Rzadka mieszanka ekspertów | Aktywuje ograniczoną część sieci dla każdego tokena. |
| Łączna liczba parametrów | 310B | Zapewnia szeroką pojemność bez używania wszystkich parametrów na token. |
| Aktywne parametry | 15B | Wspiera efektywny wnioskowanie względem całkowitego rozmiaru modelu. |
| Okno kontekstu | 1 000 000 tokenów | Obsługuje duże repozytoria i długie zbiory dokumentów. |
| Maksymalne wyjście | Do 128K tokenów w ramach bieżącej trasy | Umożliwia długie raporty i rozbudowane generowanie kodu. |
| Natywne wejścia | Tekst, obraz, wideo, audio | Umożliwia zintegrowane przepływy multimodalne. |
| Modalność wyjścia | Tekst | Odpowiedzi zwracane są jako generowany tekst. |
| Koder wizji | ViT o 729 mln parametrów | Przetwarza treści wizualne dla zadań obrazowych i wideo. |
| Koder audio | Transformer o 261 mln parametrów | Przetwarza mowę i inne sygnały audio. |
| Licencja | MIT | Umożliwia szerokie zastosowania komercyjne i badawcze zgodnie z warunkami licencji. |
Poniższy oficjalny obraz benchmarków multimodalnych przedstawia wyniki w zakresie rozumienia obrazu, agentów multimodalnych i rozumienia wideo.

Oficjalne porównanie wyników multimodalnych Xiaomi MiMo‑V2.5
Trasy dostawców mogą udostępniać węższy zestaw formatów multimediów niż wspiera sam model. Przed wdrożeniem funkcji multimodalnej zweryfikuj dokładny format obrazów, audio i wideo akceptowany przez aktywny punkt końcowy.
MiMo-V2.5 Benchmark Performance
Xiaomi podaje mocne wyniki w programowaniu, obsłudze terminala i ewaluacjach agentów multimodalnych. Te liczby są przydatne do pozycjonowania modelu, ale nie zastępują testów na własnych promptach, narzędziach, celach opóźnień i warunkach awarii.
| Benchmark | Zgłoszony wynik | Zakres oceny |
|---|---|---|
| SWE-Bench Pro | 56.1 | Inżynieria oprogramowania na poziomie repozytorium |
| Terminal-Bench 2.0 | 65.8 | Zadania agentowe oparte na terminalu |
| Claw-Eval General | 62.1 Pass@3 | Ogólne zdolności agenta |
| Claw-Eval Multimodal | 23.8 Pass@3 | Zadania agenta multimodalnego |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | Zachowanie agenta w wielu turach |
| ResearchClawBench | 16.91 | Procesy agentowe ukierunkowane na badania |
Oficjalne porównanie programistyczne pokazuje 65.8 na Terminal-Bench 2.0 i 56.1 na SWE-Bench Pro, umieszczając jednocześnie model w szerszym zestawieniu agentów programistycznych.

Oficjalne porównanie benchmarków programistycznych Xiaomi MiMo‑V2.5
Co wyniki sugerują: model jest szczególnie atrakcyjny dla aplikacji łączących kod, narzędzia i media mieszane. Dla deterministycznych decyzji produkcyjnych przeprowadź wewnętrzną ewaluację, która mierzy skuteczność zadań, zużycie tokenów, opóźnienie end‑to‑end, częstotliwość ponowień i odsetek korekt ludzkich.
MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison
| Wymiar | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Łączna liczba parametrów | 310B | 1.02T |
| Aktywne parametry | 15B | 42B |
| Okno kontekstu | 1M tokenów | 1M tokenów |
| Główna mocna strona | Zadania omnimodalne i ogólne obciążenia agentów | Złożeni agenci i wymagające programowanie |
| Cena wejścia za 1M tokenów | $0.112 | $0.348 |
| Cena wyjścia za 1M tokenów | $0.224 | $0.696 |
| Najlepsze zastosowanie | Systemy multimodalne, duży kontekst, wrażliwość na koszt | Trudne wnioskowanie, programowanie i długie sekwencje użycia narzędzi |
| Oficjalne modalności wejściowe API | Tekst, obraz, wideo, audio | Tekst |
| Oficjalna modalność wyjściowa API | Tekst | Tekst |
Wniosek z porównania: zacznij od trasy MiMo‑V2.5, gdy decyzję determinują koszt, przepustowość lub pokrycie multimodalne. Przenieś wybrane żądania do MiMo‑V2.5 Pro, gdy wewnętrzne ewaluacje pokażą istotny wzrost dokładności w trudnych zadaniach programistycznych, wnioskowania lub użycia narzędzi. Warstwowy router często zapewnia lepszą równowagę koszt‑jakość niż wysyłanie każdego żądania do MiMo‑V2.5 Pro.
How to Call the MiMo-V2.5 API
API stosuje znany schemat chat-completions. Przechowuj klucz na serwerze, ładuj go ze zmiennej środowiskowej i nigdy nie umieszczaj go w kodzie przeglądarki ani aplikacji mobilnej.
Set the API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Send a cURL request
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Use Python with the OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> Nie loguj kluczy API, pełnych nagłówków autoryzacyjnych ani wrażliwej treści promptów. W produkcji używaj menedżera sekretów i rotuj poświadczenia według zdefiniowanego harmonogramu.
## How to Stream MiMo-V2.5 API Responses
Strumieniowanie zmniejsza postrzegane opóźnienie przy długich odpowiedziach. Usługa zwraca przyrostowe zdarzenia, które SDK udostępnia jako fragmenty.
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
W usłudze webowej przekazuj delty przez Server-Sent Events lub WebSockety, obsługuj rozłączenia klientów i zatrzymuj generowanie po stronie dostawcy, gdy użytkownik anuluje.
## MiMo-V2.5 API Multimodal and Structured Workflows
W zadaniach zależnych od obrazu wyślij instrukcję tekstową oraz obiekt obrazu w tej samej wiadomości użytkownika. Dokładna akceptowana reprezentacja mediów może się różnić w zależności od trasy dostawcy, więc potraktuj to jako wzorzec ładunku i potwierdź wsparcie aktywnej trasy.
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
Dla wyjść nadających się do odczytu maszynowego poproś o zwarty obiekt JSON i zweryfikuj go względem własnego schematu. Nigdy nie zakładaj, że wygenerowany JSON jest bezpieczny tylko dlatego, że się parsuje.
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## MiMo-V2.5 API Pricing on CometAPI and Cost Control
| Trasa | Wejście za 1M tokenów | Wyjście za 1M tokenów | Przykład dla 100 żądań |
| ------------------------------ | --------------------- | --------------------- | ---------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Stawki referencyjne Xiaomi pay-as-you-go | $0.14 | $0.28 | $0.1960 |
Przykład zakłada 100 żądań, każde z 10 000 tokenów wejściowych i 2 000 tokenów wyjściowych. Przy tych założeniach trasa MiMo‑V2.5 jest ok. 68% tańsza niż MiMo‑V2.5 Pro. Opublikowane [stawki pay‑as‑you‑go Xiaomi](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) stanowią użyteczny punkt odniesienia, natomiast rzeczywiste koszty należy weryfikować względem aktywnej ceny dostawcy przed wdrożeniem.
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
Kontroluj koszty poprzez limity maksymalnego wyjścia, kompresję promptów, cache’owanie kontekstu, klasyfikację żądań i router, który eskaluje tylko trudne zadania. Śledź koszt na udane zadanie, a nie koszt na żądanie; tańsze żądanie, które wielokrotnie się nie powiedzie, może być łącznie droższe.
## How to Design Long-Context MiMo-V2.5 API Requests
Okno 1M tokenów umożliwia większe wejścia, ale nie usuwa kompromisów związanych z wyszukiwaniem i uwagą. Zbuduj prompt tak, aby model mógł szybko zlokalizować istotne dowody.
* Umieść zadanie, kontrakt wyjściowy i kryteria decyzji na początku.
* Oddzielaj dokumenty stabilnymi identyfikatorami i wyraźnymi separatorami.
* Zamieszczaj tylko dowody, które mogą wpłynąć na odpowiedź.
* Poproś model o cytowanie identyfikatorów dokumentów lub odwołań do linii w wyniku.
* Mierz dokładność wraz ze wzrostem kontekstu; nie traktuj maksymalnego kontekstu jako docelowego.
> Długi kontekst zwiększa zarówno koszt tokenów, jak i ryzyko, że nieistotny materiał rozproszy model. Wyszukiwanie, podsumowania i hierarchiczne promptowanie pozostają ważne nawet wtedy, gdy cały korpus się mieści.
## Production Reliability
### Retry only transient failures
Ponawiaj limity szybkości i tymczasowe błędy serwera z wykładniczym wycofywaniem i jitterem. Nie ponawiaj automatycznie nieprawidłowego uwierzytelniania, niepoprawnych ładunków ani błędów polityk.
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Set operational guardrails
* Używaj limitów czasu połączenia i całego żądania.
* Dołącz klucz idempotencji do przepływów z efektami ubocznymi na zewnątrz.
* Rejestruj ID modelu, opóźnienie, tokeny wejściowe i wyjściowe, liczbę ponowień i status końcowy.
* Przed logowaniem usuwaj sekrety i dane osobowe.
* Wymagaj list dozwolonych narzędzi i potwierdzeń dla działań destrukcyjnych.
* Utrzymuj model zapasowy lub kolejkę na wypadek awarii dostawcy.
## MiMo-V2.5 API Common Errors and Solutions
| Objaw | Prawdopodobna przyczyna | Zalecane działanie |
| ------------- | ---------------------------------------------- | --------------------------------------------------------------- |
| 401 lub 403 | Brakujący, nieprawidłowy lub nieautoryzowany klucz API | Zweryfikuj sekret po stronie serwera i uprawnienia projektu. |
| 400 | Niepoprawne wiadomości lub nieobsługiwany obiekt multimedialny | Zweryfikuj JSON i potwierdź wsparcie ładunku specyficzne dla trasy. |
| 413 | Zbyt duże body żądania | Zmniejsz rozmiar mediów lub podziel wejście. |
| 429 | Limit szybkości lub przydziału | Wycofuj z jitterem i egzekwuj limity współbieżności po stronie klienta. |
| 5xx | Tymczasowa awaria dostawcy | Ponów w ograniczonym budżecie lub przełącz na rezerwę. |
| Powolna odpowiedź | Duży kontekst, długie wyjście lub opóźnienie narzędzia | Strumieniuj wyjście, ogranicz liczbę tokenów i profiluj każdy etap. |
| Nieprawidłowy JSON | Dryf generowania | Waliduj, napraw jednorazowo, jeśli to bezpieczne, i odrzuć uporczywe błędy. |
## Conclusion
Model MiMo‑V2.5 to najsilniejszy punkt wyjścia dla zespołów potrzebujących wejścia multimodalnego, dużego kontekstu i agresywnej kontroli kosztów. Pro powinien być rozważną ścieżką eskalacji dla zadań, w których mierzalne zyski jakości uzasadniają wyższą cenę. Zacznij od małego zestawu ewaluacyjnego, instrumentuj każde żądanie i promuj integrację dopiero po przetestowaniu rzeczywistych ładunków, zachowania przy długim kontekście, obsługi ponowień i odzyskiwania po awarii.
## FAQ
### What endpoint should I use?
Użyj `/api.cometapi.com/v1/chat/completions` lub ustaw `/api.cometapi.com/v1` jako bazowy URL w zgodnym z OpenAI SDK.
### What model identifier should I send?
Użyj `mimo-v2.5` dla trasy MiMo‑V2.5. Przed uruchomieniem potwierdź bieżący identyfikator, jeśli Twoje konto używa aliasu specyficznego dla dostawcy.
### When should I choose MiMo-V2.5 Pro?
Wybierz MiMo‑V2.5 Pro, gdy Twoja ewaluacja pokazuje istotną przewagę w trudnych zadaniach programistycznych, wnioskowania lub długotrwałego użycia narzędzi. Utrzymuj ruch rutynowy lub multimodalny na trasie MiMo‑V2.5, jeśli jej jakość jest wystarczająca.
### Does a 1M-token context mean I should send everything?
Nie. Duży kontekst to limit pojemności, a nie docelowy projekt promptu. Wyszukaj i uporządkuj dowody, które mogą wpłynąć na odpowiedź, a następnie mierz jakość i koszt wraz ze wzrostem wejścia.
### Can I call the API directly from a browser?
Nie ujawniaj tajnego klucza API w kodzie frontendu. Wywołuj dostawcę z backendu i stosuj tam uwierzytelnianie, limity szybkości, logowanie i kontrolę danych.
### How do I verify multimodal support?
Przetestuj dokładny ładunek multimedialny względem aktywnej trasy dostawcy. Natywne modalności modelu nie gwarantują, że każda trasa udostępnia każdy format w ten sam sposób.
