Tekniske spesifikasjoner for MiMo-V2.5-Pro
| Spesifikasjon | MiMo-V2.5-Pro |
|---|---|
| Modell-ID | mimo-v2.5-pro |
| Leverandør | Xiaomi MiMo |
| Modelltype | Agentisk stor språkmodell |
| Arkitektur | Sparse Mixture-of-Experts |
| Totalt antall parametere | 1.02T |
| Aktive parametere | 42B |
| Kontekstvindu | 1M tokens |
| Utdata | Tekst |
| Oppmerksomhetsarkitektur | Hybrid SWA + Global Attention |
| Treningstokens | 27T |
| Maksimal basemodell-kontekst | 256K |
| Maksimal Pro-kontekst | 1M |
| Lisens | MIT |
Forskjellen mellom 1.02T totalparametere og 42B aktive parametere er viktig. MiMo-V2.5-Pro er en MoE-modell: Hver token aktiverer kun en delmengde av de tilgjengelige parameterne. Det endrer beregningsprofilen under inferens betydelig sammenlignet med en tett 1T-parameter modell, selv om hele modellen fortsatt har enorme minne- og utrullingskrav.
Hva er hovedfunksjonene i MiMo-V2.5-Pro?
1. Trillionskala sparsom MoE-arkitektur
MiMo-V2.5-Pro inneholder 1.02T totalparametere og 42B aktive parametere.
Arkitekturen inneholder 384 dirigerte eksperter, med åtte eksperter aktivert for hver token. Modellen har 70 transformer-lag, bestående av ett tett lag og 69 MoE-lag.
Dette gir vesentlig mer representasjonskapasitet enn standard MiMo-V2.5 samtidig som man unngår beregningskostnaden ved å aktivere alle 1.02T parametere for hver token.
Det praktiske poenget er:
MiMo-V2.5-Pro er en trillion-parameter modell etter total kapasitet, men beregningen per token styres av dens 42B aktive-parameterløp.
2. 1 million tokens kontekst
Modellen støtter opptil 1M tokens med kontekst.
Dette er en av de viktigste egenskapene for autonome agenter fordi langvarige arbeidsflyter kan akkumulere:
- Verktøyutdata
- Kildekode
- Søkeresultater
- Dokumentasjon
- Mellomliggende resonnementstilstand
- Brukerinstruksjoner
- Kjøringslogger
I stedet for å gjentatte ganger oppsummere og forkaste gammel kontekst, kan en agent potensielt beholde en mye større arbeidshistorikk.
Xiaomis langtidskontekst-evaluering tester spesifikt modellen fra 32K til 1M inndatatokens.
3. Hybrid Sliding-Window og global oppmerksomhet
MiMo-V2.5-Pro bruker et 6:1-forhold mellom Sliding Window Attention (SWA) og global oppmerksomhet, med et 128-token glidevindu.
Arkitekturen inneholder:
- 60 SWA-lag
- 10 lag med global oppmerksomhet
- 128-token SWA-vindu
Xiaomi rapporterer at dette designet reduserer KV-cache-lagring med nær 7× samtidig som langkontekst-ytelse bevares gjennom lærbar attention-sink-bias.
Dette er en av de mest teknisk betydningsfulle delene av modellen.
Et 1M kontekstvindu er kostbart dersom hvert lag utfører full oppmerksomhet over hele sekvensen. Hybrid oppmerksomhet reduserer mengden informasjon hvert lag må rette globalt fokus mot, samtidig som dedikerte lag for global oppmerksomhet beholdes for langtrekkende relasjoner.
4. Multi-Token Prediction
MiMo-V2.5-Pro inneholder tre lette MTP-moduler.
Multi-Token Prediction gjør det mulig for modellen å forutsi flere fremtidige tokens på en måte som kan brukes til spekulativ dekoding og inferensakselerasjon.
Xiaomi rapporterer at MTP-arkitekturen kan tredoble utdatahastigheten under inferens i den beskrevne utrullingskonfigurasjonen.
Dette er særlig viktig for agenter fordi en agent kan generere store mengder mellomliggende utdata over en lang bane. Forbedret tokengenereringshastighet kan derfor ha en meningsfull effekt på total oppgavelatens.
5. Agentisk forsterkningslæring
Ettertreningsrøret til MiMo-V2.5-Pro inkluderer:
- Overvåket finjustering
- Storskala agentisk forsterkningslæring
- Multi-Teacher On-Policy Distillation (MOPD)
Treningsmålet er eksplisitt orientert mot kompleks agentatferd snarere enn bare statisk benchmark-spørsmål og -svar.
Dette er grunnen til at modellens sterkeste evalueringer er konsentrert rundt koding, terminalinteraksjon, langkontekst-resonnement og agent-benchmarker.
6. 27T-token pretrening
MiMo-V2.5-Pro ble pretrent på omtrent 27 billioner tokens, med FP8 blandet presisjon og en opprinnelig sekvenslengde på 32K før støtte for utvidet 1M kontekstvindu.
Skalaen på pretreningen, kombinert med trillion-parameter MoE-arkitekturen, plasserer MiMo-V2.5-Pro solid i frontier-modellklassen.
Hvordan presterer MiMo-V2.5-Pro på benchmarker?
De publiserte evalueringsresultatene er særlig nyttige fordi de inkluderer både generelle resonnement-benchmarker og praktiske koding-/agent-evalueringer.
| Benchmark | MiMo-V2.5-Pro-resultat | Evalueringstype |
|---|---|---|
| SWE-Bench Verified | 78.9 | Programvareteknikk |
| SWE-Bench Pro | 57.2 | Programvareteknikk |
| Terminal-Bench 2.0 | 68.4 | Terminalagent |
| GSM8K | 99.6 | Matematisk resonnement |
| GPQA Diamond | 66.7 | Resonnement på høyere nivå |
| MMLU-Pro | 68.5 | Generelt resonnement |
| MMLU | 89.4 | Allmennkunnskap/resonnement |
| MMLU-Redux | 92.8 | Allmennkunnskap/resonnement |
| HumanEval+ | 75.6 | Kodegenerering |
| MBPP+ | 74.1 | Python-programmering |
| LiveCodeBench v6 | 39.6 | Konkurransekoding |
| ARC-Challenge | 97.2 | Resonnement |
| AIME 2024/2025 | 37.3 | Konkurransematematikk |
Resultatene viser en særlig sterk profil innen programvareteknikk og matematisk resonnement. Den rapporterte 78.9 på SWE-Bench Verified og 68.4 på Terminal-Bench 2.0 er spesielt relevante for utviklere som bygger autonome kodingssystemer.
Langkontekst-ytelse
Langkontekst-resultatene er kanskje enda mer interessante enn standardbenchmarkene.
I GraphWalks-evalueringen opprettholder MiMo-V2.5-Pro målbar ytelse ved ekstreme kontekstlengder:
| Kontekst | BFS | Foreldre |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi rapporterer at den forrige MiMo-V2-Pro forverres raskt utover 128K og når 0.00 ved 1M på begge deloppgavene, mens V2.5-Pro bevarer ikke-null ytelse ved fulle 1M kontekst.
Dette er en meningsfull forskjell: MiMo-V2.5-Pros 1M kontekst er ikke bare et teoretisk maksimum; den publiserte langtidskontekst-evalueringen demonstrerer nyttig ytelse dypt inn i dette vinduet.
Reelle agenteksempler
| Oppgave | Rapportert resultat |
|---|---|
| PKU SysY Compiler | 4.3 timer |
| Verktøykall under kompilatoroppgaven | 672 |
| Beståtte kompilator-testcaser | 233/233 |
| Fullstack videoredigerer | 11.5 timer |
| Kode generert for videoredigerer | 8,192 linjer |
| Menneskelig inngripen | Ingen rapportert |
| Verktøykall over lang horisont | Nesten 1,000 |
Dette er Xiaomis rapporterte demonstrasjoner snarere enn standardiserte benchmarkscore.
MiMo-V2.5-Pro vs MiMo-V2.5
De to modellene tilhører samme generasjon, men retter seg mot ulike arbeidslaster.
| Spesifikasjon | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Totalt antall parametere | 310B | 1.02T |
| Aktive parametere | 15B | 42B |
| Kontekst | 1M | 1M |
| Lag | 48 | 70 |
| Dirigerte eksperter | 256 | 384 |
| Eksperter per token | 8 | 8 |
| Lag med full oppmerksomhet | 9 | 10 |
| SWA-lag | 39 | 60 |
| Hovedfokus | Omnimodale agenter | Komplekse agenter/koding |
| Forståelse av video/lyd/bilde | Ja | Primært språk-/agentfokusert |
| Agentytelse over lang horisont | Sterk | Flaggskip |
Valget er derfor ikke enkelt «Pro er bedre».
Hvis en applikasjon trenger native bilde-, video- og lydforståelse, er MiMo-V2.5 det mer naturlige valget. Hvis arbeidslasten dreier seg om komplekst resonnement, programvareutvikling, terminalinteraksjon og langvarige agenter, er MiMo-V2.5-Pro et sterkere valg.
Begrensninger ved MiMo-V2.5-Pro
1. Kun tekst som modellinput
I motsetning til mimo-v2.5 oppgir Pro-modellens offisielle spesifikasjon Tekst som inndatamodalitet. Den bør ikke markedsføres som den multimodale modellen i V2.5-familien.
2. Høye beregningskrav for selvhosting
Modellen har omtrent 1T totalparametere / 42B aktive parametere, noe som gjør lokal utrulling vesentlig mer krevende enn konvensjonelle små åpne modeller.
3. Agentytelse avhenger av rammeverket
Xiaomis påstand om nær 1,000 verktøykall er eksplisitt knyttet til bruk av et passende agentrammeverk. Modellen alene garanterer ikke at en applikasjon vil oppnå samme langhorisont-ytelse.
4. Håndtering av resonnementinnhold
Agentapplikasjoner over flere turer som bruker tenkemodus og verktøykall må bevare reasoning_content korrekt. Feil håndtering kan gi API-feil.
Beste bruksområder
Storskala programvareutvikling
- Migrering av kodelager
- Refaktorisering
- Feilsøking
- Testgenerering
- Kompilatorutvikling
- Fullstack applikasjonsutvikling
Autonome kodeagenter
MiMo-V2.5-Pro passer spesielt godt for agenter som gjentatte ganger trenger å:
inspisere → endre → kjøre → teste → diagnostisere → endre
Langdokument-resonnement
Dets 1M kontekst gjør den nyttig for:
- Juridiske kontrakter
- Tekniske spesifikasjoner
- Store forskningssamlinger
- Bedriftsdokumentasjon
Komplekse forretningsagenter
Verktøykall + nettsøk + strukturert utdata kan støtte:
- Forskningsagenter
- Databehandlingsagenter
- Automatisering av bedriftsarbeidsflyt
- Flertrinns beslutningssystemer
Slik bruker du MiMo-V2.5-Pro API på CometAPI
Relevant CometAPI-modell-ID er:
mimo-v2.5-pro
For utviklere er et API-aggregasjonslag særlig nyttig for å teste MiMo-V2.5-Pro opp mot andre høytytende resonnement- og agentmodeller uten å vedlikeholde uavhengige leverandørintegrasjoner.
Trinn 1: Hent en CometAPI API-nøkkel
Opprett eller logg inn på CometAPI-kontoen din og hent API-nøkkelen fra API-konsollen.
Sett den som en miljøvariabel:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Trinn 2: Konfigurer API-klienten
Xiaomi tilbyr en API som er kompatibel med både OpenAI- og Anthropic-protokoller, noe som gjør migrering relativt enkel. For produksjonsintegrasjon, bruk gjeldende CometAPI-endepunkt/-skjema for mimo-v2.5-pro, spesielt hvis du trenger avanserte funksjoner som verktøykall, strømming, strukturerte utdata eller forespørsler med lang kontekst.
Trinn 3: Koble MiMo-V2.5-Pro til verktøy
Modellen blir vesentlig mer nyttig når den kobles til eksterne verktøy.
For eksempel:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Denne arkitekturen samsvarer langt bedre med modellens tiltenkte bruk enn en enkel chatbot-integrasjon.