Specyfikacja techniczna MiMo-V2.5-Pro
| Specyfikacja | MiMo-V2.5-Pro |
|---|---|
| Identyfikator modelu | mimo-v2.5-pro |
| Dostawca | Xiaomi MiMo |
| Typ modelu | Agentowy duży model językowy |
| Architektura | Rzadka Mixture-of-Experts |
| Łączna liczba parametrów | 1.02T |
| Aktywne parametry | 42B |
| Okno kontekstu | 1M tokens |
| Wyjście | Text |
| Architektura uwagi | Hybrid SWA + Global Attention |
| Tokeny treningowe | 27T |
| Maksymalny kontekst modelu bazowego | 256K |
| Maksymalny kontekst Pro | 1M |
| Licencja | MIT |
Różnica między 1.02T łącznych parametrów a 42B aktywnych parametrów jest istotna. MiMo-V2.5-Pro to model MoE: każdy token aktywuje tylko podzbiór dostępnych parametrów. Znacząco zmienia to profil obliczeniowy inferencji w porównaniu z gęstym modelem o 1T parametrów, choć pełny model wciąż wymaga ogromnych zasobów pamięci i skomplikowanego wdrożenia.
Jakie są główne funkcje MiMo-V2.5-Pro?
1. Rzadka architektura MoE w skali biliona
MiMo-V2.5-Pro zawiera 1.02T łącznych parametrów i 42B aktywowanych parametrów.
Jego architektura obejmuje 384 routowanych ekspertów, przy czym dla każdego tokenu aktywowanych jest osiem ekspertów. Model ma 70 warstw transformera: jedną gęstą i 69 warstw MoE.
Zapewnia to znacznie większą pojemność reprezentacyjną niż standardowy MiMo-V2.5, unikając jednocześnie kosztu obliczeniowego aktywacji wszystkich 1.02T parametrów dla każdego tokenu.
Najważniejsza praktyczna konkluzja:
MiMo-V2.5-Pro to model o łącznej pojemności biliona parametrów, ale obliczenia na token są determinowane przez ścieżkę z 42B aktywnych parametrów.
2. Kontekst 1 miliona tokenów
Model obsługuje do 1M tokenów kontekstu.
To jedna z najważniejszych możliwości dla agentów autonomicznych, ponieważ długotrwałe procesy mogą gromadzić:
- Wyniki narzędzi
- Kod źródłowy
- Wyniki wyszukiwania
- Dokumentację
- Pośredni stan rozumowania
- Instrukcje użytkownika
- Logi wykonania
Zamiast wielokrotnego streszczania i odrzucania starego kontekstu, agent może potencjalnie utrzymać znacznie większą historię roboczą.
Długokontekstowa ewaluacja Xiaomi testuje model konkretnie od 32K do 1M tokenów wejściowych.
3. Hybrydowa uwaga z przesuwanym oknem i globalna
MiMo-V2.5-Pro wykorzystuje proporcję 6:1 między Sliding Window Attention (SWA) a uwagą globalną, z oknem SWA o długości 128 tokenów.
Architektura zawiera:
- 60 warstw SWA
- 10 warstw uwagi globalnej
- Okno SWA o długości 128 tokenów
Xiaomi podaje, że ten projekt zmniejsza zapotrzebowanie na przechowywanie KV-cache niemal 7×, zachowując wydajność przy długim kontekście dzięki wyuczanemu biasowi typu attention-sink.
To jeden z najbardziej technicznie istotnych elementów modelu.
Okno kontekstu 1M jest kosztowne, jeśli każda warstwa wykonuje pełną uwagę nad całym ciągiem. Hybrydowa uwaga ogranicza zakres informacji, do których każda warstwa musi odnosić się globalnie, jednocześnie pozostawiając dedykowane warstwy uwagi globalnej dla zależności dalekiego zasięgu.
4. Przewidywanie wielu tokenów
MiMo-V2.5-Pro zawiera trzy lekkie moduły MTP.
Multi-Token Prediction pozwala modelowi przewidywać wiele przyszłych tokenów w sposób, który może być wykorzystany do dekodowania w stylu spekulacyjnym i przyspieszenia inferencji.
Xiaomi podaje, że jego architektura MTP może potroić szybkość generowania podczas wnioskowania w opisanej konfiguracji wdrożenia.
Ma to szczególne znaczenie dla agentów, ponieważ agent może generować duże ilości wyjścia pośredniego w długiej trajektorii. Poprawa szybkości generowania tokenów może zatem istotnie wpłynąć na całkowitą latencję zadania.
5. Agentowe uczenie ze wzmocnieniem
Pipeline post-treningowy MiMo-V2.5-Pro obejmuje:
- Nadzorowane dostrajanie
- Wielkoskalowe agentowe uczenie ze wzmocnieniem
- Multi-Teacher On-Policy Distillation (MOPD)
Cel treningowy jest wyraźnie ukierunkowany na złożone zachowania agentowe, a nie wyłącznie na statyczne benchmarki QA.
Dlatego najsilniejsze ewaluacje modelu koncentrują się na kodowaniu, interakcji z terminalem, rozumowaniu przy długim kontekście i benchmarkach agentów.
6. Wstępne szkolenie na 27T tokenów
MiMo-V2.5-Pro był wstępnie szkolony na około 27 bilionach tokenów, z użyciem mieszanej precyzji FP8 i natywnej długości sekwencji 32K, zanim uzyskał wsparcie rozszerzonego okna kontekstu 1M.
Skala pretreningu, połączona z bilionową architekturą MoE, lokuje MiMo-V2.5-Pro jednoznacznie w klasie obecnych modeli czołowych.
Jak MiMo-V2.5-Pro wypada w benchmarkach?
Opublikowane wyniki ewaluacji są szczególnie użyteczne, ponieważ obejmują zarówno ogólne benchmarki rozumowania, jak i praktyczne ewaluacje kodowania/agentów.
| Benchmark | Wynik MiMo-V2.5-Pro | Typ ewaluacji |
|---|---|---|
| SWE-Bench Verified | 78.9 | Inżynieria oprogramowania |
| SWE-Bench Pro | 57.2 | Inżynieria oprogramowania |
| Terminal-Bench 2.0 | 68.4 | Agent terminalowy |
| GSM8K | 99.6 | Rozumowanie matematyczne |
| GPQA Diamond | 66.7 | Rozumowanie na poziomie studiów magisterskich |
| MMLU-Pro | 68.5 | Ogólne rozumowanie |
| MMLU | 89.4 | Wiedza ogólna/rozumowanie |
| MMLU-Redux | 92.8 | Wiedza ogólna/rozumowanie |
| HumanEval+ | 75.6 | Generowanie kodu |
| MBPP+ | 74.1 | Programowanie w Pythonie |
| LiveCodeBench v6 | 39.6 | Programowanie konkursowe |
| ARC-Challenge | 97.2 | Rozumowanie |
| AIME 2024/2025 | 37.3 | Matematyka konkursowa |
Wyniki pokazują szczególnie silny profil w inżynierii oprogramowania i rozumowaniu matematycznym. Zgłoszone 78.9 na SWE-Bench Verified i 68.4 na Terminal-Bench 2.0 są szczególnie istotne dla deweloperów budujących autonomiczne systemy kodujące.
Wydajność w długim kontekście
Wyniki dla długiego kontekstu są być może bardziej interesujące niż standardowe benchmarki.
W ewaluacji GraphWalks MiMo-V2.5-Pro utrzymuje mierzalną wydajność przy skrajnych długościach kontekstu:
| Kontekst | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi podaje, że poprzedni MiMo-V2-Pro gwałtownie pogarsza wyniki powyżej 128K i osiąga 0.00 przy 1M w obu podzadaniach, podczas gdy V2.5-Pro utrzymuje niezerową wydajność przy pełnym 1M kontekstu.
To znacząca różnica: 1M kontekstu w MiMo-V2.5-Pro to nie tylko teoretyczne maksimum; opublikowana ewaluacja długiego kontekstu pokazuje użyteczną wydajność głęboko w tym oknie.
Przykłady agentów ze świata rzeczywistego
| Zadanie | Zgłoszony wynik |
|---|---|
| PKU SysY Compiler | 4.3 hours |
| Wywołania narzędzi podczas zadania kompilatora | 672 |
| Zaliczone przypadki testowe kompilatora | 233/233 |
| Pełnostackowy edytor wideo | 11.5 hours |
| Wygenerowany kod dla edytora wideo | 8,192 lines |
| Interwencja człowieka | None reported |
| Długohoryzontowe wywołania narzędzi | Nearly 1,000 |
Są to demonstracje zgłaszane przez Xiaomi, a nie znormalizowane wyniki benchmarków.
MiMo-V2.5-Pro vs MiMo-V2.5
Oba modele należą do tej samej generacji, ale celują w różne obciążenia.
| Specyfikacja | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Łączna liczba parametrów | 310B | 1.02T |
| Aktywne parametry | 15B | 42B |
| Kontekst | 1M | 1M |
| Warstwy | 48 | 70 |
| Routowani eksperci | 256 | 384 |
| Ekspertów na token | 8 | 8 |
| Warstwy pełnej uwagi | 9 | 10 |
| Warstwy SWA | 39 | 60 |
| Główne ukierunkowanie | Agenci wielomodalni | Złożeni agenci/kodowanie |
| Rozumienie wideo/audio/obrazu | Yes | Primarily language/agent focused |
| Wydajność agentów w długim horyzoncie | Strong | Flagship |
Wybór nie sprowadza się więc po prostu do „Pro jest lepszy”.
Jeśli aplikacja wymaga natywnego rozumienia obrazu, wideo i dźwięku, bardziej naturalnym wyborem jest MiMo-V2.5. Jeśli obciążenie koncentruje się na złożonym rozumowaniu, inżynierii oprogramowania, interakcji z terminalem i długotrwale działających agentach, MiMo-V2.5-Pro lepiej się sprawdzi.
Ograniczenia MiMo-V2.5-Pro
1. Wejście modelu wyłącznie tekstowe
W przeciwieństwie do mimo-v2.5, oficjalna specyfikacja modelu Pro wskazuje Text jako modalność wejściową. Nie należy go promować jako modelu wielomodalnego w rodzinie V2.5.
2. Wysokie wymagania obliczeniowe przy samodzielnym hostingu
Model ma około 1T łącznych parametrów / 42B aktywnych parametrów, co sprawia, że lokalne wdrożenie jest znacznie bardziej wymagające niż w przypadku konwencjonalnych małych modeli otwartych.
3. Wydajność agenta zależy od frameworka
Twierdzenie Xiaomi o prawie 1,000 wywołań narzędzi jest explicite powiązane z użyciem odpowiedniego frameworka agenta. Sam model nie gwarantuje, że aplikacja osiągnie tę samą wydajność w długim horyzoncie.
4. Obsługa treści rozumowania
Aplikacje agenta w trybie wieloturowym, korzystające z trybu myślenia i wywołań narzędzi, muszą poprawnie zachowywać reasoning_content. Nieprawidłowa obsługa może powodować błędy API.
Najlepsze zastosowania
Inżynieria oprogramowania na dużą skalę
- Migracja repozytoriów
- Refaktoryzacja
- Debugowanie
- Generowanie testów
- Rozwój kompilatorów
- Tworzenie aplikacji full‑stack
Autonomiczne agenty programistyczne
MiMo-V2.5-Pro jest szczególnie dobrze dopasowany do agentów, którzy muszą wielokrotnie:
sprawdzać → modyfikować → wykonywać → testować → diagnozować → modyfikować
Rozumowanie nad długimi dokumentami
Jego kontekst 1M sprawia, że jest użyteczny dla:
- Umów prawnych
- Specyfikacji technicznych
- Dużych kolekcji badań
- Dokumentacji korporacyjnej
Złożone agenty biznesowe
Wywołania narzędzi + wyszukiwanie w sieci + strukturyzowane wyjście mogą wspierać:
- Agentów badawczych
- Agentów przetwarzania danych
- Automatyzację przepływów pracy w przedsiębiorstwie
- Wielostopniowe systemy decyzyjne
Jak używać API MiMo-V2.5-Pro w CometAPI
Odpowiedni identyfikator modelu w CometAPI to:
mimo-v2.5-pro
Dla deweloperów warstwa agregacji API jest szczególnie użyteczna do testowania MiMo-V2.5-Pro względem innych wysokiej klasy modeli rozumowania i agentowych bez utrzymywania niezależnych integracji z dostawcami.
Krok 1: Uzyskaj klucz API CometAPI
Utwórz lub zaloguj się na konto CometAPI i pobierz klucz API z konsoli API.
Ustaw go jako zmienną środowiskową:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Krok 2: Skonfiguruj klienta API
Xiaomi zapewnia API zgodne zarówno z protokołami OpenAI, jak i Anthropic, co ułatwia migrację. Do produkcyjnej integracji używaj bieżącego endpointu/schematu CometAPI dla mimo-v2.5-pro, zwłaszcza jeśli potrzebujesz zaawansowanych funkcji, takich jak wywołania narzędzi, strumieniowanie, strukturyzowane wyjścia lub żądania z długim kontekstem.
Krok 3: Połącz MiMo-V2.5-Pro z narzędziami
Model staje się znacznie bardziej użyteczny po podłączeniu do zewnętrznych narzędzi.
Na przykład:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Taka architektura jest znacznie bliższa zamierzonemu zastosowaniu modelu niż prosta integracja czatbota.