GPT-6.1 Sol are now live on CometAPI →
ai-model/Badania CometAPI

Czym jest MiMo-V2.5? Specyfikacje, benchmarki, funkcje, ceny i dostęp do API

Poznaj specyfikacje Xiaomi MiMo-V2.5, architekturę, oficjalne benchmarki, cennik, porównanie z MiMo-V2.5-Pro, przypadki użycia, ograniczenia i dostęp do CometAPI.

CometAPI
Deon GoodwinZespół badań AI modeli i API
Zaktualizowano Oct 5, 2026 12 min czyt.
Czym jest MiMo-V2.5? Specyfikacje, benchmarki, funkcje, ceny i dostęp do API
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Standardowy model V2.5 od Xiaomi łączy natywne rozumienie tekstu, obrazów, wideo i dźwięku z oknem kontekstu na 1 milion tokenów, obsługą narzędzi oraz efektywnością rzadkiej architektury Mixture-of-Experts. Lepiej sprawdza się tam, gdzie liczy się wejście multimodalne i koszt na ukończone zadanie. Wariant Pro jest większy i silniejszy w wymagającym kodowaniu oraz pracy agentów o długim horyzoncie, lecz koncentruje się na wejściu tekstowym i kosztuje około trzykrotnie więcej za token według opublikowanych stawek Xiaomi.

Decyzja praktyczna jest prosta: wybierz model standardowy do agentów multimodalnych, analizy dokumentów i mediów oraz automatyzacji na dużą skalę; wybierz Pro, gdy wąskim gardłem jest trudna inżynieria oprogramowania lub długotrwałe autonomiczne wykonywanie zadań.

Najważniejsze wnioski

  • Standardowy model ma łącznie 310B parametrów, aktywuje 15B na token.

  • Przyjmuje tekst, obrazy, wideo i audio, a zwraca tekst.

  • Jego API obsługuje kontekst 1M, do 128K wyjścia, wywołania narzędzi, wyszukiwanie w sieci, strumieniowanie, wyjście strukturalne i buforowanie kontekstu.

  • Wyniki zgłaszane przez wydawcę obejmują 65.8 w Terminal-Bench 2.0 oraz 56.1 w SWE-Bench Pro.

  • Obecna karta modelu Xiaomi MiMo-V2.5-Pro podaje 1.02T parametrów łącznie i 42B aktywnych. Wydawca podaje wyniki SWE-Bench Pro: 56.1 dla MiMo-V2.5 i 57.2 dla Pro; są to datowane, raportowane przez wydawcę porównania, a nie gwarancja dla konkretnego przepływu pracy z kodowaniem.

  • Przy obecnych stawkach Xiaomi standard kosztuje $0.14/$0.28 za milion tokenów dla wejścia/wyjścia; Pro kosztuje $0.435/$0.87.

  • Oba API w CometAPI mają ceny o 20% niższe niż oficjalne pary stawek bez cache.

    Informacje sprawdzone: 28 września 2026 r. Ceny, benchmarki, limity, dostępność i formaty żądań mogą się zmieniać. Xiaomi ogłosiło, że oficjalne nazwy modeli API mimo-v2.5 i mimo-v2.5-pro zostaną wycofane o 10:00 czasu pekińskiego 21 października 2026 r., bez automatycznego zastąpienia. Zaplanuj migrację i potwierdź aktywną trasę przed wdrożeniem.

Uwaga dotycząca cyklu życia API: oficjalna platforma Xiaomi planuje wycofać oba identyfikatory modeli V2.5 w dniu 21 października 2026 r. Niniejsze powiadomienie dotyczy platformy API Xiaomi; oddzielnie sprawdź każdy zewnętrzny gateway. Xiaomi model deprecation notice

Czym jest model Standard

MiMo-V2.5 to ukierunkowany na efektywność model bazowy Xiaomi MiMo do percepcji multimodalnej i pracy agentów. Zapewnia natywne wejście tekstu, obrazów, wideo i audio w jednej architekturze i generuje wyjście tekstowe.

Dziennik wydawniczy modeli Xiaomi datuje publiczną betę serii MiMo-V2.5 na 23 kwietnia 2026 r. Wagi zostały następnie udostępnione na licencji MIT. MiMo-V2.5 ma łącznie 310B parametrów, ale aktywuje tylko ok. 15B dla każdego tokena; korzysta z dużej puli ekspertów bez uruchamiania wszystkich naraz.

MiMo-V2.5-Pro celuje w inny rodzaj obciążenia. To model o trylionie parametrów, z wejściem tekstowym, zaprojektowany do najtrudniejszego kodowania, pracy w terminalu oraz długotrwałych zadań agentowych. Oba warianty mają wspólny maksymalny kontekst 1M, lecz wyraźnie różnią się modalnościami, aktywnymi obliczeniami i ceną.

Specyfikacje i funkcje MiMo-V2.5

Oficjalne szczegóły architekturyWartośćDlaczego to istotne
ArchitekturaRzadkie MoEDuża pojemność ekspertów z selektywną aktywacją
Parametry łącznie / aktywne310B / 15BAktywne obliczenia są znacznie mniejsze od całości
Warstwy transformera48: 1 gęsta + 47 MoEWiększość warstw używa kierowanych ekspertów
Kierowani eksperci256; 8 aktywnych na tokenSpecjalizacja bez gęstego wykonywania 310B
Attention39 warstw SWA + 9 globalnychBalans wydajności lokalnej i przepływu dalekiego
Okno SWA128 tokenówRedukuje presję na cache długiego kontekstu
Kontekst / maksymalne wyjście1M / 128K tokenówObsługuje długie dokumenty i wydłużone przebiegi
Wejście / wyjścieTekst, obraz, wideo, audio / tekstNatywna percepcja czterech typów wejścia
Koder wizji729M ViT; 28 warstwRozumienie obrazów i wideo
Koder audio261M transformer; 24 warstwyNatywne rozumienie audio
Przewidywanie wielu tokenów3 moduły; ok. 329M parametrówWspiera efektywność spekulatywnego dekodowania
Skala treninguOkoło 48T tokenówSzeroka tekstowa i multimodalna ścieżka treningu
Możliwości APINarzędzia, web, strumieniowanie, wyjście strukt., cacheProdukcyjne prymitywy agentowe
LicencjaMITDozwolone użycie komercyjne i modyfikacje

Zakres działania obejmuje kontekst 1M i wyjście 128K, plus opublikowane limity 100 żądań na minutę i 10 milionów tokenów na minutę. Limity na poziomie dostawcy mogą się różnić w zależności od konta i trasy integracji.

Czym jest MiMo-V2.5? Specyfikacje, benchmarki, funkcje, ceny i dostęp do API

Oficjalny diagram architektury Xiaomi MiMo. Oficjalny zasób architektury.

Jak działa architektura MiMo-V2.5

Rzadcy eksperci: całkowita pojemność to nie aktywne obliczenia

Kluczowy fakt efektywności to projekt 310B łącznie, 15B aktywnych. Router wybiera ośmiu z 256 ekspertów dla każdego tokena. Daje to modelowi dostęp do znacznie większej puli parametrów niż konwencjonalny gęsty model 15B bez wykonywania wszystkich 310B parametrów za każdym razem.

Nie czyni to samodzielnego hostowania trywialnym. Pełne wagi nadal muszą być przechowywane i dystrybuowane, więc pojemność pamięci, przepustowość łączy, trasowanie ekspertów i oprogramowanie serwujące pozostają istotnymi ograniczeniami.

Hybrydowy mechanizm uwagi dla długiego kontekstu

Trzon przeplata uwagi przesuwnego okna i globalne w stosunku SWA do globalnej 5:1. Trzydzieści dziewięć lokalnych warstw kontroluje wzrost cache, a dziewięć warstw globalnych zachowuje przepływ informacji na dużych dystansach. Xiaomi raportuje niemal sześciokrotną redukcję cache KV względem projektu w pełni globalnego.

Maksimum 1M tokenów to pojemność, nie gwarantowana dokładność. Jakość wyszukiwania, opóźnienia, wzrost stanu narzędzi i uwaga nad odległymi dowodami nadal wymagają oceny zależnej od obciążenia.

Natywne kodery i funkcje agentowe

Koder wizji o 729M parametrach w architekturze transformera obsługuje wejścia obrazów i wideo; koder audio o 261M parametrach obsługuje audio. Projektory mapują oba strumienie do kręgosłupa językowego, umożliwiając jednemu agentowi połączenie zrzutu ekranu, segmentu wideo, ścieżki audio, instrukcji tekstowych i wyników narzędzi.

Trzy moduły przewidywania wielu tokenów wspierają efektywność dekodowania spekulatywnego i uczenia ze wzmocnieniem. Model był trenowany na ok. 48T tokenów, z kontekstem stopniowo rozszerzanym do 1M podczas post-treningu.

Otwarte wagi korzystają z licencji MIT. Wdrożenie komercyjne jest dozwolone, ale koszty infrastruktury i zależności stron trzecich wymagają odrębnego przeglądu.

Benchmarki MiMo-V2.5: kodowanie, agenci i wyniki multimodalne

Uwaga dot. benchmarków:

poniższe wartości pochodzą od wydawcy. Są wskazówkami kierunkowymi, a nie gwarancją dla konkretnego repozytorium, formatu mediów, stosu narzędzi, celu opóźnień czy polityki bezpieczeństwa.

Wyniki dla kodowania i agentów

Czym jest MiMo-V2.5? Specyfikacje, benchmarki, funkcje, ceny i dostęp do API

Oficjalny wykres benchmarków kodowania i agentów Xiaomi MiMo.

Oficjalny benchmark kodowaniaZgłoszony wynikSygnał decyzyjny
MiMo Coding Bench71.8Szerokie możliwości agenta kodującego
Claw-Eval Text62.3Ogólne wykonywanie zadań tekstowych
Terminal-Bench 2.065.8Interaktywne wykonywanie w terminalu
SWE-Bench Pro56.1Inżynieria oprogramowania w praktyce
Claw-Eval Multi-Turn63.2Dłuższa, wieloetapowa praca agenta
ResearchClawBench16.91Autonomiczne przepływy badań

Wniosek: najmocniejszą stroną jest praktyczne użycie narzędzi, a nie izolowane uzupełnianie kodu. Wynik 65.8 w Terminal-Bench wspiera agentów ukierunkowanych na terminal, zaś 56.1 w SWE-Bench Pro sugeruje użyteczną zdolność na poziomie repozytorium. Znacznie niższy wynik badawczy przypomina, by osobno testować pozyskiwanie dowodów i zachowanie cytowań.

Wyniki multimodalne

Czym jest MiMo-V2.5? Specyfikacje, benchmarki, funkcje, ceny i dostęp do API

Oficjalny wykres benchmarków obrazu, wideo i agenta multimodalnego Xiaomi MiMo.

Oficjalny benchmark multimodalnyZgłoszony wynikTestowana zdolność
CharXiv RQ81.0Rozumowanie nad wykresami i dokumentami
MMMU-Pro77.9Rozumowanie multimodalne na poziomie eksperckim
HR-Bench 4K88.5Rozumienie obrazów w wysokiej rozdzielczości
OmniDocBench87.2Rozumienie dokumentów
Claw-Eval Multimodal23.8Wykonywanie zadań przez agenta multimodalnego
Video-MME87.7Rozumienie wideo
DailyOmni83.5Codzienne rozumowanie audiowizualne
VideoHolmes64.0Rozumowanie temporalne w wideo

Wniosek: najmocniejsze strony to rozumienie dokumentów, obrazów w wysokiej rozdzielczości i wideo. Wynik 23.8 dla agenta multimodalnego jest znacznie niższy niż wyniki percepcyjne, więc system, który musi zarówno rozumieć media, jak i niezawodnie obsługiwać narzędzia, powinien być oceniany end-to-end.

MiMo-V2.5 vs MiMo-V2.5-Pro: porównanie wielowymiarowe

Oficjalne porównanie architekturyMiMo-V2.5MiMo-V2.5-Pro
Oficjalna specyfikacja Pro
Oficjalne benchmarki Pro
Implikacja praktyczna
Łączna liczba parametrów310B1.02TPro ma ponad 3× większą pojemność całkowitą
Aktywowane parametry15B42BPro używa ok. 2.8× więcej aktywnych parametrów
Warstwy / kierowani eksperci48 / 25670 / 384Pro jest większym celem serwowania
Sufit kontekstu w karcie modelu1M1MOba deklarują do 1M tokenów; przetestuj wyszukiwanie i opóźnienia przy rozmiarze Twojego obciążenia
Maksymalne wyjście w oficjalnym API128K128KObecne strony modeli API Xiaomi podają 128K; limity mogą się różnić u dostawców
Natywne wejścieTekst, obraz, wideo, audioTekstMiMo-V2.5 to udokumentowany wybór multimodalny; przed wysłaniem mediów zweryfikuj dokładny endpoint Pro
SWE-Bench Pro56.157.2Pro wyprzedza o 1.1 punktu
Terminal-Bench 2.065.868.4Pro wyprzedza o 2.6 punktu
Główne zastosowanieEfektywni agenci multimodalniZłożone kodowanie i agenci o długim horyzoncieWybieraj na podstawie przetestowanego obciążenia; marginesy na poziomie modelu nie dowodzą ogólnej przewagi jakości

Wniosek z porównania: przewaga benchmarkowa Pro jest umiarkowana w dwóch wspólnych testach agentów kodujących, podczas gdy wariant standardowy dodaje natywne wejście obrazu, wideo i audio oraz używa znacznie mniej aktywnych parametrów. Pro jest uzasadniony, gdy niewielkie zyski w trudnych zadaniach mają większą wartość niż wejście multimodalne i niższa cena jednostkowa.

Ile kosztują MiMo-V2.5 i MiMo-V2.5-Pro?

Podstawa cenowa: 27 maja 2026Oficjalne API standardOficjalne API ProMiMo-V2.5 API w CometAPIMiMo-V2.5-Pro API w CometAPI
Wejście, brak trafienia w cache / MTok$0.14$0.435$0.112$0.348
Wyjście / MTok$0.28$0.87$0.224$0.696
Wejście, trafienie w cache / MTok$0.0028$0.0036Sprawdź rozliczanie na żywoSprawdź rozliczanie na żywo
Zniżka względem oficjalnej stawki bez cacheBazowaBazowa20%20%

Przy oficjalnych stawkach Pro kosztuje ok. 3.1× więcej niż standard dla niebuforowanych wejścia i wyjścia. Podane ceny u dostawcy obniżają każdą niebuforowaną parę o 20%, lecz względna różnica między wariantami pozostaje zasadniczo niezmieniona.

Cena za token to nie całkowity koszt. O liczbie narzędziowych powtórzeń, rozmiarze kontekstu, długości wyjścia, opóźnieniach, odzyskiwaniu po nieudanych zadaniach i przeglądzie przez człowieka decyduje koszt na ukończone zadanie. Uruchom reprezentatywną próbkę obciążenia przed wyborem domyślnego modelu produkcyjnego.

Do czego MiMo-V2.5 nadaje się najlepiej?

  • Agenci multimodalni: łącz w jednym przepływie zrzuty ekranu, dokumenty, wideo, audio, instrukcje i narzędzia.
  • Analiza długich dokumentów: przetwarzaj repozytoria, umowy, archiwa badań, logi i historię wsparcia.
  • Rozumienie mediów: streszczaj filmy, wyodrębniaj zdarzenia, interpretuj wykresy i odpowiadaj na pytania audiowizualne.
  • Agenci kodujący i terminalowi: badaj pliki, uruchamiaj komendy, modyfikuj kod i iteruj na wynikach testów.
  • Automatyzacja na dużą skalę: używaj rzadkiej aktywacji i niższych cen tokenów do powtarzalnych zadań produkcyjnych.

Ograniczenia i ryzyka

  • Na token aktywnych jest tylko 15B parametrów, ale samodzielne hostowanie nadal wymaga pełnego systemu wag 310B.
  • Wyjście multimodalne to tekst; generowanie obrazów, mowy i wideo wymaga innych modeli.
  • Sufit kontekstu 1M nie gwarantuje jednolitej dokładności wyszukiwania w całym oknie.
  • Benchmarki wydawcy mogą nie przenosić się na własne narzędzia, repozytoria, promptowanie czy ograniczenia bezpieczeństwa.
  • Ekspozycja modalności u dostawcy może różnić się od pełnych możliwości modelu o otwartych wagach.

Brama produkcyjna:

zweryfikuj dokładność, ukończenie wywołań narzędzi, opóźnienia, zużycie tokenów, obsługę modalności i zachowanie awaryjne na reprezentatywnych zadaniach przed przekierowaniem ruchu.

Przykład API

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Przewodnik decyzyjny

Sygnał obciążeniaZacznij odPrzełącz, gdy
Obrazy, wideo lub audio są pierwszorzędnymi wejściamiStandardNie przełączaj, chyba że dopuszczalna jest obróbka wstępna multimodalna
Duża objętość dokumentów lub mediówStandardPro tylko, jeśli błędy rozumowania dominują koszt
Trudna inżynieria repozytoriówTestuj obaWybierz Pro, jeśli zysk w ukończeniu kompensuje 3.1× koszt jednostkowy
Długie autonomiczne trajektorie terminaloweProWróć do standardu, jeśli zyski są niemierzalne
Rutynowa automatyzacja na dużą skalęStandardEskaluj tylko zadania nieudane lub wysokowartościowe

Zalecane trasowanie:

używaj standardu jako domyślnego dla pracy multimodalnej i wysokiej objętości, a tylko trudne zadania tekstowe lub o długim horyzoncie kieruj do Pro. Zachowuje to możliwości przy kontroli całkowitego kosztu.

Wnioski

Model standardowy to nie tylko mniejszy Pro. To odrębny punkt optymalizacji: natywne wejście multimodalne, kontekst 1M, mocne benchmarki ukierunkowane na narzędzia oraz 15B aktywnych parametrów przy znacznie niższej cenie za token.

Pro to opcja specjalistyczna do trudnego tworzenia oprogramowania i długotrwałego autonomicznego wykonywania. Jego dodatkowa pojemność przynosi mierzalne, ale nie uniwersalne zyski, więc najsilniejszym wzorcem wdrożenia jest trasowanie według obciążenia, a nie wybór jednego wariantu do każdego żądania.

FAQ

Czy model standardowy jest open source?

Jego wagi są udostępnione na licencji MIT, co pozwala na użycie komercyjne, modyfikacje, dostrajanie i redystrybucję zgodnie z warunkami licencji.

Ile parametrów wykorzystuje?

Rzadkie MoE zawiera łącznie 310B parametrów i aktywuje 15B na każdy token. Parametry aktywne opisują obliczenia per token, a nie rozmiar magazynowania kompletnego modelu.

Czy obsługuje obrazy, wideo i audio?

Tak. Wariant standardowy przyjmuje tekst, obrazy, wideo i audio oraz zwraca tekst. Oficjalna specyfikacja wariantu Pro podaje wejście tekstowe.

Jaki jest maksymalny kontekst?

Obie karty modeli określają okno kontekstu do 1M tokenów. Obecne strony API Xiaomi podają maksymalne wyjście 128K dla MiMo-V2.5 i MiMo-V2.5-Pro. Rzeczywiste limity użyteczne mogą się różnić w zależności od endpointu, dostawcy, konta i formatu żądania; zweryfikuj trasę wdrożeniową przed poleganiem na tych sufitach.

Aktualna oficjalna strona API Pro osobno potwierdza kontekst 1M i maksymalne wyjście 128K: MiMo-V2.5-Pro API specifications

Który wariant jest lepszy dla agentów kodujących?

Pro raportuje wyższe wyniki w wspólnych benchmarkach kodowania i terminala, ale margines jest umiarkowany. Przetestuj oba na docelowym repozytorium i wybierz na podstawie ukończenia zadań, opóźnień i całkowitego kosztu.

Który wariant jest lepszy dla agentów multimodalnych?

Wariant standardowy jest naturalnym wyborem, ponieważ natywnie przyjmuje wejście obrazów, wideo i audio. Pro koncentruje się na wejściu tekstowym.

Jak powinna wybierać ekipa produkcyjna?

Zacznij od standardu, mierz błędy, a tylko trudne zadania tekstowe, które korzystają z Pro, kieruj do Pro. Porównuj koszt na ukończone zadanie, a nie wyłącznie cenę za token.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Oct 5, 2026
Ostatnia aktualizacja Oct 5, 2026
0 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Czytaj więcej