TL;DR
Standardowy model V2.5 od Xiaomi łączy natywne rozumienie tekstu, obrazów, wideo i dźwięku z oknem kontekstu na 1 milion tokenów, obsługą narzędzi oraz efektywnością rzadkiej architektury Mixture-of-Experts. Lepiej sprawdza się tam, gdzie liczy się wejście multimodalne i koszt na ukończone zadanie. Wariant Pro jest większy i silniejszy w wymagającym kodowaniu oraz pracy agentów o długim horyzoncie, lecz koncentruje się na wejściu tekstowym i kosztuje około trzykrotnie więcej za token według opublikowanych stawek Xiaomi.
Decyzja praktyczna jest prosta: wybierz model standardowy do agentów multimodalnych, analizy dokumentów i mediów oraz automatyzacji na dużą skalę; wybierz Pro, gdy wąskim gardłem jest trudna inżynieria oprogramowania lub długotrwałe autonomiczne wykonywanie zadań.
Najważniejsze wnioski
-
Standardowy model ma łącznie 310B parametrów, aktywuje 15B na token.
-
Przyjmuje tekst, obrazy, wideo i audio, a zwraca tekst.
-
Jego API obsługuje kontekst 1M, do 128K wyjścia, wywołania narzędzi, wyszukiwanie w sieci, strumieniowanie, wyjście strukturalne i buforowanie kontekstu.
-
Wyniki zgłaszane przez wydawcę obejmują 65.8 w Terminal-Bench 2.0 oraz 56.1 w SWE-Bench Pro.
-
Obecna karta modelu Xiaomi MiMo-V2.5-Pro podaje 1.02T parametrów łącznie i 42B aktywnych. Wydawca podaje wyniki SWE-Bench Pro: 56.1 dla MiMo-V2.5 i 57.2 dla Pro; są to datowane, raportowane przez wydawcę porównania, a nie gwarancja dla konkretnego przepływu pracy z kodowaniem.
-
Przy obecnych stawkach Xiaomi standard kosztuje $0.14/$0.28 za milion tokenów dla wejścia/wyjścia; Pro kosztuje $0.435/$0.87.
-
Oba API w CometAPI mają ceny o 20% niższe niż oficjalne pary stawek bez cache.
Informacje sprawdzone: 28 września 2026 r. Ceny, benchmarki, limity, dostępność i formaty żądań mogą się zmieniać. Xiaomi ogłosiło, że oficjalne nazwy modeli API mimo-v2.5 i mimo-v2.5-pro zostaną wycofane o 10:00 czasu pekińskiego 21 października 2026 r., bez automatycznego zastąpienia. Zaplanuj migrację i potwierdź aktywną trasę przed wdrożeniem.
Uwaga dotycząca cyklu życia API: oficjalna platforma Xiaomi planuje wycofać oba identyfikatory modeli V2.5 w dniu 21 października 2026 r. Niniejsze powiadomienie dotyczy platformy API Xiaomi; oddzielnie sprawdź każdy zewnętrzny gateway. Xiaomi model deprecation notice
Czym jest model Standard
MiMo-V2.5 to ukierunkowany na efektywność model bazowy Xiaomi MiMo do percepcji multimodalnej i pracy agentów. Zapewnia natywne wejście tekstu, obrazów, wideo i audio w jednej architekturze i generuje wyjście tekstowe.
Dziennik wydawniczy modeli Xiaomi datuje publiczną betę serii MiMo-V2.5 na 23 kwietnia 2026 r. Wagi zostały następnie udostępnione na licencji MIT. MiMo-V2.5 ma łącznie 310B parametrów, ale aktywuje tylko ok. 15B dla każdego tokena; korzysta z dużej puli ekspertów bez uruchamiania wszystkich naraz.
MiMo-V2.5-Pro celuje w inny rodzaj obciążenia. To model o trylionie parametrów, z wejściem tekstowym, zaprojektowany do najtrudniejszego kodowania, pracy w terminalu oraz długotrwałych zadań agentowych. Oba warianty mają wspólny maksymalny kontekst 1M, lecz wyraźnie różnią się modalnościami, aktywnymi obliczeniami i ceną.
Specyfikacje i funkcje MiMo-V2.5
| Oficjalne szczegóły architektury | Wartość | Dlaczego to istotne |
|---|---|---|
| Architektura | Rzadkie MoE | Duża pojemność ekspertów z selektywną aktywacją |
| Parametry łącznie / aktywne | 310B / 15B | Aktywne obliczenia są znacznie mniejsze od całości |
| Warstwy transformera | 48: 1 gęsta + 47 MoE | Większość warstw używa kierowanych ekspertów |
| Kierowani eksperci | 256; 8 aktywnych na token | Specjalizacja bez gęstego wykonywania 310B |
| Attention | 39 warstw SWA + 9 globalnych | Balans wydajności lokalnej i przepływu dalekiego |
| Okno SWA | 128 tokenów | Redukuje presję na cache długiego kontekstu |
| Kontekst / maksymalne wyjście | 1M / 128K tokenów | Obsługuje długie dokumenty i wydłużone przebiegi |
| Wejście / wyjście | Tekst, obraz, wideo, audio / tekst | Natywna percepcja czterech typów wejścia |
| Koder wizji | 729M ViT; 28 warstw | Rozumienie obrazów i wideo |
| Koder audio | 261M transformer; 24 warstwy | Natywne rozumienie audio |
| Przewidywanie wielu tokenów | 3 moduły; ok. 329M parametrów | Wspiera efektywność spekulatywnego dekodowania |
| Skala treningu | Około 48T tokenów | Szeroka tekstowa i multimodalna ścieżka treningu |
| Możliwości API | Narzędzia, web, strumieniowanie, wyjście strukt., cache | Produkcyjne prymitywy agentowe |
| Licencja | MIT | Dozwolone użycie komercyjne i modyfikacje |
Zakres działania obejmuje kontekst 1M i wyjście 128K, plus opublikowane limity 100 żądań na minutę i 10 milionów tokenów na minutę. Limity na poziomie dostawcy mogą się różnić w zależności od konta i trasy integracji.
Oficjalny diagram architektury Xiaomi MiMo. Oficjalny zasób architektury.
Jak działa architektura MiMo-V2.5
Rzadcy eksperci: całkowita pojemność to nie aktywne obliczenia
Kluczowy fakt efektywności to projekt 310B łącznie, 15B aktywnych. Router wybiera ośmiu z 256 ekspertów dla każdego tokena. Daje to modelowi dostęp do znacznie większej puli parametrów niż konwencjonalny gęsty model 15B bez wykonywania wszystkich 310B parametrów za każdym razem.
Nie czyni to samodzielnego hostowania trywialnym. Pełne wagi nadal muszą być przechowywane i dystrybuowane, więc pojemność pamięci, przepustowość łączy, trasowanie ekspertów i oprogramowanie serwujące pozostają istotnymi ograniczeniami.
Hybrydowy mechanizm uwagi dla długiego kontekstu
Trzon przeplata uwagi przesuwnego okna i globalne w stosunku SWA do globalnej 5:1. Trzydzieści dziewięć lokalnych warstw kontroluje wzrost cache, a dziewięć warstw globalnych zachowuje przepływ informacji na dużych dystansach. Xiaomi raportuje niemal sześciokrotną redukcję cache KV względem projektu w pełni globalnego.
Maksimum 1M tokenów to pojemność, nie gwarantowana dokładność. Jakość wyszukiwania, opóźnienia, wzrost stanu narzędzi i uwaga nad odległymi dowodami nadal wymagają oceny zależnej od obciążenia.
Natywne kodery i funkcje agentowe
Koder wizji o 729M parametrach w architekturze transformera obsługuje wejścia obrazów i wideo; koder audio o 261M parametrach obsługuje audio. Projektory mapują oba strumienie do kręgosłupa językowego, umożliwiając jednemu agentowi połączenie zrzutu ekranu, segmentu wideo, ścieżki audio, instrukcji tekstowych i wyników narzędzi.
Trzy moduły przewidywania wielu tokenów wspierają efektywność dekodowania spekulatywnego i uczenia ze wzmocnieniem. Model był trenowany na ok. 48T tokenów, z kontekstem stopniowo rozszerzanym do 1M podczas post-treningu.
Otwarte wagi korzystają z licencji MIT. Wdrożenie komercyjne jest dozwolone, ale koszty infrastruktury i zależności stron trzecich wymagają odrębnego przeglądu.
Benchmarki MiMo-V2.5: kodowanie, agenci i wyniki multimodalne
Uwaga dot. benchmarków:
poniższe wartości pochodzą od wydawcy. Są wskazówkami kierunkowymi, a nie gwarancją dla konkretnego repozytorium, formatu mediów, stosu narzędzi, celu opóźnień czy polityki bezpieczeństwa.
Wyniki dla kodowania i agentów

Oficjalny wykres benchmarków kodowania i agentów Xiaomi MiMo.
| Oficjalny benchmark kodowania | Zgłoszony wynik | Sygnał decyzyjny |
|---|---|---|
| MiMo Coding Bench | 71.8 | Szerokie możliwości agenta kodującego |
| Claw-Eval Text | 62.3 | Ogólne wykonywanie zadań tekstowych |
| Terminal-Bench 2.0 | 65.8 | Interaktywne wykonywanie w terminalu |
| SWE-Bench Pro | 56.1 | Inżynieria oprogramowania w praktyce |
| Claw-Eval Multi-Turn | 63.2 | Dłuższa, wieloetapowa praca agenta |
| ResearchClawBench | 16.91 | Autonomiczne przepływy badań |
Wniosek: najmocniejszą stroną jest praktyczne użycie narzędzi, a nie izolowane uzupełnianie kodu. Wynik 65.8 w Terminal-Bench wspiera agentów ukierunkowanych na terminal, zaś 56.1 w SWE-Bench Pro sugeruje użyteczną zdolność na poziomie repozytorium. Znacznie niższy wynik badawczy przypomina, by osobno testować pozyskiwanie dowodów i zachowanie cytowań.
Wyniki multimodalne

Oficjalny wykres benchmarków obrazu, wideo i agenta multimodalnego Xiaomi MiMo.
| Oficjalny benchmark multimodalny | Zgłoszony wynik | Testowana zdolność |
|---|---|---|
| CharXiv RQ | 81.0 | Rozumowanie nad wykresami i dokumentami |
| MMMU-Pro | 77.9 | Rozumowanie multimodalne na poziomie eksperckim |
| HR-Bench 4K | 88.5 | Rozumienie obrazów w wysokiej rozdzielczości |
| OmniDocBench | 87.2 | Rozumienie dokumentów |
| Claw-Eval Multimodal | 23.8 | Wykonywanie zadań przez agenta multimodalnego |
| Video-MME | 87.7 | Rozumienie wideo |
| DailyOmni | 83.5 | Codzienne rozumowanie audiowizualne |
| VideoHolmes | 64.0 | Rozumowanie temporalne w wideo |
Wniosek: najmocniejsze strony to rozumienie dokumentów, obrazów w wysokiej rozdzielczości i wideo. Wynik 23.8 dla agenta multimodalnego jest znacznie niższy niż wyniki percepcyjne, więc system, który musi zarówno rozumieć media, jak i niezawodnie obsługiwać narzędzia, powinien być oceniany end-to-end.
MiMo-V2.5 vs MiMo-V2.5-Pro: porównanie wielowymiarowe
| Oficjalne porównanie architektury | MiMo-V2.5 | MiMo-V2.5-Pro Oficjalna specyfikacja Pro Oficjalne benchmarki Pro | Implikacja praktyczna |
|---|---|---|---|
| Łączna liczba parametrów | 310B | 1.02T | Pro ma ponad 3× większą pojemność całkowitą |
| Aktywowane parametry | 15B | 42B | Pro używa ok. 2.8× więcej aktywnych parametrów |
| Warstwy / kierowani eksperci | 48 / 256 | 70 / 384 | Pro jest większym celem serwowania |
| Sufit kontekstu w karcie modelu | 1M | 1M | Oba deklarują do 1M tokenów; przetestuj wyszukiwanie i opóźnienia przy rozmiarze Twojego obciążenia |
| Maksymalne wyjście w oficjalnym API | 128K | 128K | Obecne strony modeli API Xiaomi podają 128K; limity mogą się różnić u dostawców |
| Natywne wejście | Tekst, obraz, wideo, audio | Tekst | MiMo-V2.5 to udokumentowany wybór multimodalny; przed wysłaniem mediów zweryfikuj dokładny endpoint Pro |
| SWE-Bench Pro | 56.1 | 57.2 | Pro wyprzedza o 1.1 punktu |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro wyprzedza o 2.6 punktu |
| Główne zastosowanie | Efektywni agenci multimodalni | Złożone kodowanie i agenci o długim horyzoncie | Wybieraj na podstawie przetestowanego obciążenia; marginesy na poziomie modelu nie dowodzą ogólnej przewagi jakości |
Wniosek z porównania: przewaga benchmarkowa Pro jest umiarkowana w dwóch wspólnych testach agentów kodujących, podczas gdy wariant standardowy dodaje natywne wejście obrazu, wideo i audio oraz używa znacznie mniej aktywnych parametrów. Pro jest uzasadniony, gdy niewielkie zyski w trudnych zadaniach mają większą wartość niż wejście multimodalne i niższa cena jednostkowa.
Ile kosztują MiMo-V2.5 i MiMo-V2.5-Pro?
| Podstawa cenowa: 27 maja 2026 | Oficjalne API standard | Oficjalne API Pro | MiMo-V2.5 API w CometAPI | MiMo-V2.5-Pro API w CometAPI |
|---|---|---|---|---|
| Wejście, brak trafienia w cache / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| Wyjście / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| Wejście, trafienie w cache / MTok | $0.0028 | $0.0036 | Sprawdź rozliczanie na żywo | Sprawdź rozliczanie na żywo |
| Zniżka względem oficjalnej stawki bez cache | Bazowa | Bazowa | 20% | 20% |
Przy oficjalnych stawkach Pro kosztuje ok. 3.1× więcej niż standard dla niebuforowanych wejścia i wyjścia. Podane ceny u dostawcy obniżają każdą niebuforowaną parę o 20%, lecz względna różnica między wariantami pozostaje zasadniczo niezmieniona.
Cena za token to nie całkowity koszt. O liczbie narzędziowych powtórzeń, rozmiarze kontekstu, długości wyjścia, opóźnieniach, odzyskiwaniu po nieudanych zadaniach i przeglądzie przez człowieka decyduje koszt na ukończone zadanie. Uruchom reprezentatywną próbkę obciążenia przed wyborem domyślnego modelu produkcyjnego.
Do czego MiMo-V2.5 nadaje się najlepiej?
- Agenci multimodalni: łącz w jednym przepływie zrzuty ekranu, dokumenty, wideo, audio, instrukcje i narzędzia.
- Analiza długich dokumentów: przetwarzaj repozytoria, umowy, archiwa badań, logi i historię wsparcia.
- Rozumienie mediów: streszczaj filmy, wyodrębniaj zdarzenia, interpretuj wykresy i odpowiadaj na pytania audiowizualne.
- Agenci kodujący i terminalowi: badaj pliki, uruchamiaj komendy, modyfikuj kod i iteruj na wynikach testów.
- Automatyzacja na dużą skalę: używaj rzadkiej aktywacji i niższych cen tokenów do powtarzalnych zadań produkcyjnych.
Ograniczenia i ryzyka
- Na token aktywnych jest tylko 15B parametrów, ale samodzielne hostowanie nadal wymaga pełnego systemu wag 310B.
- Wyjście multimodalne to tekst; generowanie obrazów, mowy i wideo wymaga innych modeli.
- Sufit kontekstu 1M nie gwarantuje jednolitej dokładności wyszukiwania w całym oknie.
- Benchmarki wydawcy mogą nie przenosić się na własne narzędzia, repozytoria, promptowanie czy ograniczenia bezpieczeństwa.
- Ekspozycja modalności u dostawcy może różnić się od pełnych możliwości modelu o otwartych wagach.
Brama produkcyjna:
zweryfikuj dokładność, ukończenie wywołań narzędzi, opóźnienia, zużycie tokenów, obsługę modalności i zachowanie awaryjne na reprezentatywnych zadaniach przed przekierowaniem ruchu.
Przykład API
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Przewodnik decyzyjny
| Sygnał obciążenia | Zacznij od | Przełącz, gdy |
|---|---|---|
| Obrazy, wideo lub audio są pierwszorzędnymi wejściami | Standard | Nie przełączaj, chyba że dopuszczalna jest obróbka wstępna multimodalna |
| Duża objętość dokumentów lub mediów | Standard | Pro tylko, jeśli błędy rozumowania dominują koszt |
| Trudna inżynieria repozytoriów | Testuj oba | Wybierz Pro, jeśli zysk w ukończeniu kompensuje 3.1× koszt jednostkowy |
| Długie autonomiczne trajektorie terminalowe | Pro | Wróć do standardu, jeśli zyski są niemierzalne |
| Rutynowa automatyzacja na dużą skalę | Standard | Eskaluj tylko zadania nieudane lub wysokowartościowe |
Zalecane trasowanie:
używaj standardu jako domyślnego dla pracy multimodalnej i wysokiej objętości, a tylko trudne zadania tekstowe lub o długim horyzoncie kieruj do Pro. Zachowuje to możliwości przy kontroli całkowitego kosztu.
Wnioski
Model standardowy to nie tylko mniejszy Pro. To odrębny punkt optymalizacji: natywne wejście multimodalne, kontekst 1M, mocne benchmarki ukierunkowane na narzędzia oraz 15B aktywnych parametrów przy znacznie niższej cenie za token.
Pro to opcja specjalistyczna do trudnego tworzenia oprogramowania i długotrwałego autonomicznego wykonywania. Jego dodatkowa pojemność przynosi mierzalne, ale nie uniwersalne zyski, więc najsilniejszym wzorcem wdrożenia jest trasowanie według obciążenia, a nie wybór jednego wariantu do każdego żądania.
FAQ
Czy model standardowy jest open source?
Jego wagi są udostępnione na licencji MIT, co pozwala na użycie komercyjne, modyfikacje, dostrajanie i redystrybucję zgodnie z warunkami licencji.
Ile parametrów wykorzystuje?
Rzadkie MoE zawiera łącznie 310B parametrów i aktywuje 15B na każdy token. Parametry aktywne opisują obliczenia per token, a nie rozmiar magazynowania kompletnego modelu.
Czy obsługuje obrazy, wideo i audio?
Tak. Wariant standardowy przyjmuje tekst, obrazy, wideo i audio oraz zwraca tekst. Oficjalna specyfikacja wariantu Pro podaje wejście tekstowe.
Jaki jest maksymalny kontekst?
Obie karty modeli określają okno kontekstu do 1M tokenów. Obecne strony API Xiaomi podają maksymalne wyjście 128K dla MiMo-V2.5 i MiMo-V2.5-Pro. Rzeczywiste limity użyteczne mogą się różnić w zależności od endpointu, dostawcy, konta i formatu żądania; zweryfikuj trasę wdrożeniową przed poleganiem na tych sufitach.
Aktualna oficjalna strona API Pro osobno potwierdza kontekst 1M i maksymalne wyjście 128K: MiMo-V2.5-Pro API specifications
Który wariant jest lepszy dla agentów kodujących?
Pro raportuje wyższe wyniki w wspólnych benchmarkach kodowania i terminala, ale margines jest umiarkowany. Przetestuj oba na docelowym repozytorium i wybierz na podstawie ukończenia zadań, opóźnień i całkowitego kosztu.
Który wariant jest lepszy dla agentów multimodalnych?
Wariant standardowy jest naturalnym wyborem, ponieważ natywnie przyjmuje wejście obrazów, wideo i audio. Pro koncentruje się na wejściu tekstowym.
Jak powinna wybierać ekipa produkcyjna?
Zacznij od standardu, mierz błędy, a tylko trudne zadania tekstowe, które korzystają z Pro, kieruj do Pro. Porównuj koszt na ukończone zadanie, a nie wyłącznie cenę za token.
