Technische Spezifikationen von MiMo-V2.5-Pro
| Spezifikation | MiMo-V2.5-Pro |
|---|---|
| Modell-ID | mimo-v2.5-pro |
| Anbieter | Xiaomi MiMo |
| Modelltyp | Agentisches großes Sprachmodell |
| Architektur | Spärliche Mixture-of-Experts |
| Gesamtparameter | 1.02T |
| Aktivierte Parameter | 42B |
| Kontextfenster | 1M Token |
| Ausgabe | Text |
| Aufmerksamkeitsarchitektur | Hybrides SWA + globale Aufmerksamkeit |
| Trainings-Token | 27T |
| Maximaler Basismodell-Kontext | 256K |
| Maximaler Pro-Kontext | 1M |
| Lizenz | MIT |
Die Unterscheidung zwischen 1.02T Gesamtparametern und 42B aktiven Parametern ist wichtig. MiMo-V2.5-Pro ist ein MoE-Modell: Jeder Token aktiviert nur eine Teilmenge der verfügbaren Parameter. Das verändert sein Inferenz-Compute-Profil erheblich im Vergleich zu einem dichten Modell mit 1T Parametern, auch wenn das vollständige Modell weiterhin enorme Speicher- und Deploymentsanforderungen hat.
Was sind die Hauptfunktionen von MiMo-V2.5-Pro?
1. Spärliche MoE-Architektur im Billionenmaßstab
MiMo-V2.5-Pro enthält 1.02T Gesamtparameter und 42B aktivierte Parameter.
Seine Architektur umfasst 384 geroutete Experten, wobei pro Token acht Experten aktiviert werden. Das Modell hat 70 Transformer-Schichten, bestehend aus einer dichten Schicht und 69 MoE-Schichten.
Dies bietet deutlich mehr Repräsentationskapazität als das Standardmodell MiMo-V2.5 und vermeidet die Rechenkosten, alle 1.02T Parameter für jeden Token zu aktivieren.
Die praktische Erkenntnis lautet:
MiMo-V2.5-Pro ist vom Gesamtkapazitätsmaßstab her ein Billionen-Parameter-Modell, aber seine Berechnung pro Token wird durch seinen Pfad mit 42B aktiven Parametern bestimmt.
2. Kontext mit 1 Million Token
Das Modell unterstützt bis zu 1M Token Kontext.
Dies ist eine seiner wichtigsten Fähigkeiten für autonome Agenten, denn in langlaufenden Workflows können sich ansammeln:
- Tool-Ausgaben
- Quellcode
- Suchergebnisse
- Dokumentation
- Zwischenzustand der Überlegungen
- Benutzeranweisungen
- Ausführungsprotokolle
Anstatt den alten Kontext wiederholt zu zusammenzufassen und zu verwerfen, kann ein Agent potenziell eine viel größere Arbeitshistorie beibehalten.
Xiaomis Langkontext-Evaluierung testet das Modell speziell von 32K bis 1M Eingangstoken.
3. Hybride Sliding-Window- und globale Aufmerksamkeit
MiMo-V2.5-Pro verwendet ein Verhältnis von 6:1 zwischen Sliding Window Attention (SWA) und Global Attention, mit einem 128-Token-Sliding-Window.
Die Architektur umfasst:
- 60 SWA-Schichten
- 10 globale Aufmerksamkeits-Schichten
- 128-Token SWA-Fenster
Xiaomi berichtet, dass dieses Design die KV-Cache-Speicherung um nahezu 7× reduziert, während die Langkontext-Leistung durch lernbaren Attention-Sink-Bias erhalten bleibt.
Dies ist einer der technisch bedeutendsten Teile des Modells.
Ein 1M-Kontextfenster ist teuer, wenn jede Schicht vollständige Aufmerksamkeit über die gesamte Sequenz ausführt. Hybride Aufmerksamkeit reduziert die Menge an Informationen, die jede Schicht global beachten muss, während dedizierte globale Aufmerksamkeits-Schichten für langreichweitige Beziehungen erhalten bleiben.
4. Mehrfach-Token-Vorhersage
MiMo-V2.5-Pro enthält drei leichte MTP-Module.
Mehrfach-Token-Vorhersage ermöglicht es dem Modell, mehrere zukünftige Token vorherzusagen, auf eine Weise, die für spekulatives Decoding und Inferenzbeschleunigung genutzt werden kann.
Xiaomi berichtet, dass seine MTP-Architektur die Ausgabegeschwindigkeit während der Inferenz unter der beschriebenen Deployment-Konfiguration verdreifachen kann.
Dies ist besonders für Agenten wichtig, da ein Agent über eine lange Trajektorie große Mengen an Zwischenoutput generieren kann. Die Verbesserung der Token-Generierungsgeschwindigkeit kann daher einen spürbaren Einfluss auf die Gesamtlatenz der Aufgabe haben.
5. Agentisches Reinforcement Learning
Die Post-Training-Pipeline von MiMo-V2.5-Pro umfasst:
- Überwachtes Feintuning
- Großskaliges agentisches Reinforcement Learning
- Multi-Teacher On-Policy Distillation (MOPD)
Das Trainingsziel ist explizit auf komplexes Agentenverhalten ausgerichtet und nicht nur auf statisches Benchmark-Frage-Antworten.
Darum sind die stärksten Evaluierungen des Modells auf Coding, Terminal-Interaktion, Langkontext-Reasoning und Agent-Benchmarks konzentriert.
6. Vortraining mit 27T Token
MiMo-V2.5-Pro wurde auf ungefähr 27 Billionen Token vortrainiert, mit FP8-Mischpräzision und einer nativen Sequenzlänge von 32K, bevor das erweiterte 1M-Kontextfenster unterstützt wurde.
Der Umfang des Vortrainings, kombiniert mit der MoE-Architektur im Billionenmaßstab, positioniert MiMo-V2.5-Pro klar in der Klasse aktueller Frontier-Modelle.
Wie schneidet MiMo-V2.5-Pro in Benchmarks ab?
Die veröffentlichten Evaluierungsergebnisse sind besonders hilfreich, weil sie sowohl allgemeine Reasoning-Benchmarks als auch praktische Coding-/Agenten-Evaluierungen umfassen.
| Benchmark | Ergebnis MiMo-V2.5-Pro | Evaluierungstyp |
|---|---|---|
| SWE-Bench Verified | 78.9 | Softwaretechnik |
| SWE-Bench Pro | 57.2 | Softwaretechnik |
| Terminal-Bench 2.0 | 68.4 | Terminal-Agent |
| GSM8K | 99.6 | Mathematisches Denken |
| GPQA Diamond | 66.7 | Denken auf Graduierten-Niveau |
| MMLU-Pro | 68.5 | Allgemeines Denken |
| MMLU | 89.4 | Allgemeines Wissen/Denken |
| MMLU-Redux | 92.8 | Allgemeines Wissen/Denken |
| HumanEval+ | 75.6 | Codegenerierung |
| MBPP+ | 74.1 | Python-Programmierung |
| LiveCodeBench v6 | 39.6 | Wettbewerbsprogrammierung |
| ARC-Challenge | 97.2 | Reasoning |
| AIME 2024/2025 | 37.3 | Wettbewerbs-Mathematik |
Die Ergebnisse zeigen ein besonders starkes Profil in Softwaretechnik und mathematischem Denken. Die gemeldeten 78.9 auf SWE-Bench Verified und 68.4 auf Terminal-Bench 2.0 sind besonders relevant für Entwickler, die autonome Codingsysteme bauen.
Langkontext-Leistung
Die Langkontext-Ergebnisse sind wohl interessanter als die Standard-Benchmarks.
In der GraphWalks-Evaluierung hält MiMo-V2.5-Pro messbare Leistung bei extremen Kontextlängen aufrecht:
| Kontext | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi berichtet, dass das vorherige MiMo-V2-Pro jenseits von 128K schnell degeneriert und bei 1M in beiden Teilaufgaben 0.00 erreicht, während V2.5-Pro bei vollem 1M-Kontext eine von Null verschiedene Leistung beibehält.
Dies ist eine bedeutsame Unterscheidung: MiMo-V2.5-Pro's 1M-Kontext ist nicht nur ein theoretisches Maximum; die veröffentlichte Langkontext-Evaluierung zeigt nützliche Leistung tief innerhalb dieses Fensters.
Praxisbeispiele für Agenten
| Aufgabe | Gemeldetes Ergebnis |
|---|---|
| PKU SysY Compiler | 4.3 Stunden |
| Tool-Aufrufe während der Compiler-Aufgabe | 672 |
| Bestandene Compiler-Testfälle | 233/233 |
| Full-Stack-Videoeditor | 11.5 Stunden |
| Für den Videoeditor generierter Code | 8,192 Zeilen |
| Menschliche Intervention | Keine gemeldet |
| Langfristige Tool-Aufrufe | Nahezu 1,000 |
Dies sind von Xiaomi gemeldete Demonstrationen und keine standardisierten Benchmark-Werte.
MiMo-V2.5-Pro vs MiMo-V2.5
Die beiden Modelle gehören zur gleichen Generation, zielen aber auf unterschiedliche Workloads.
| Spezifikation | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Gesamtparameter | 310B | 1.02T |
| Aktive Parameter | 15B | 42B |
| Kontext | 1M | 1M |
| Schichten | 48 | 70 |
| Geroutete Experten | 256 | 384 |
| Experten/Token | 8 | 8 |
| Schichten mit voller Aufmerksamkeit | 9 | 10 |
| SWA-Schichten | 39 | 60 |
| Hauptfokus | Omnimodale Agenten | Komplexe Agenten/Programmierung |
| Video-/Audio-/Bildverständnis | Ja | Primär auf Sprache/Agenten fokussiert |
| Agentenleistung über lange Horizonte | Stark | Flaggschiff |
Die Entscheidung ist daher nicht einfach „Pro ist besser“.
Wenn eine Anwendung natives Bild-, Video- und Audioverständnis benötigt, ist MiMo-V2.5 die naheliegendere Wahl. Wenn der Workload sich auf komplexes Reasoning, Softwaretechnik, Terminal-Interaktion und langlaufende Agenten konzentriert, ist MiMo-V2.5-Pro die stärkere Option.
Einschränkungen von MiMo-V2.5-Pro
1. Modelleingabe nur Text
Im Gegensatz zu mimo-v2.5 führt die offizielle Spezifikation des Pro-Modells Text als Eingabemodalität. Es sollte nicht als das multimodale Modell der V2.5-Familie vermarktet werden.
2. Hohe Rechenanforderungen für Self-Hosting
Das Modell hat ungefähr 1T Gesamtparameter / 42B aktive Parameter, was die lokale Bereitstellung deutlich anspruchsvoller macht als bei konventionellen kleinen Open-Modellen.
3. Agentenleistung hängt vom Framework ab
Xiaomis Behauptung von nahezu 1,000 Tool-Aufrufen ist ausdrücklich mit der Nutzung eines geeigneten Agenten-Frameworks verbunden. Das Modell allein garantiert nicht, dass eine Anwendung dieselbe Langhorizont-Leistung erzielt.
4. Umgang mit Reasoning-Inhalten
Mehrturn-Agenten-Anwendungen, die Thinking-Mode und Tool-Aufrufe nutzen, müssen reasoning_content korrekt beibehalten. Falscher Umgang kann zu API-Fehlern führen.
Beste Anwendungsfälle
Großskalige Softwaretechnik
- Repository-Migration
- Refactoring
- Debugging
- Testgenerierung
- Compiler-Entwicklung
- Full-Stack-Anwendungsentwicklung
Autonome Coding-Agenten
MiMo-V2.5-Pro eignet sich besonders gut für Agenten, die wiederholt Folgendes ausführen müssen:
inspizieren → ändern → ausführen → testen → diagnostizieren → ändern
Reasoning über lange Dokumente
Sein 1M-Kontext macht es nützlich für:
- Rechtsverträge
- Technische Spezifikationen
- Große Forschungssammlungen
- Unternehmensdokumentation
Komplexe Geschäfts-Agenten
Tool-Aufrufe + Websuche + strukturierte Ausgabe können unterstützen:
- Recherche-Agenten
- Datenverarbeitungs-Agenten
- Unternehmens-Workflow-Automatisierung
- Mehrschritt-Entscheidungssysteme
So verwenden Sie die MiMo-V2.5-Pro-API auf CometAPI
Die relevante CometAPI-Model-ID lautet:
mimo-v2.5-pro
Für Entwickler ist eine API-Aggregationsschicht besonders nützlich, um MiMo-V2.5-Pro gegen andere High-End-Reasoning- und Agenten-Modelle zu testen, ohne separate Provider-Integrationen zu pflegen.
Schritt 1: CometAPI-API-Schlüssel abrufen
Erstellen Sie ein CometAPI-Konto oder melden Sie sich an und holen Sie Ihren API-Schlüssel aus der API-Konsole.
Setzen Sie ihn als Umgebungsvariable:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Schritt 2: API-Client konfigurieren
Xiaomi bietet eine API, die sowohl mit OpenAI- als auch Anthropic-Protokollen kompatibel ist, was die Migration relativ unkompliziert macht. Für die Produktivintegration verwenden Sie den aktuellen CometAPI-Endpunkt/das Schema für mimo-v2.5-pro, insbesondere wenn Sie erweiterte Funktionen wie Tool-Aufrufe, Streaming, strukturierte Ausgaben oder Langkontext-Anfragen benötigen.
Schritt 3: MiMo-V2.5-Pro mit Tools verbinden
Das Modell wird erheblich nützlicher, wenn es mit externen Tools verbunden ist.
Zum Beispiel:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Diese Architektur entspricht der beabsichtigten Nutzung des Modells deutlich mehr als eine einfache Chatbot-Integration.