Specifiche tecniche di MiMo-V2.5-Pro
| Specifica | MiMo-V2.5-Pro |
|---|---|
| Model ID | mimo-v2.5-pro |
| Provider | Xiaomi MiMo |
| Model type | Modello linguistico di grandi dimensioni per agenti |
| Architecture | Mixture-of-Experts sparsa |
| Total parameters | 1.02T |
| Activated parameters | 42B |
| Context window | 1M token |
| Output | Testo |
| Attention architecture | SWA ibrida + attenzione globale |
| Training tokens | 27T |
| Maximum base-model context | 256K |
| Maximum Pro context | 1M |
| License | MIT |
La distinzione tra 1.02T di parametri totali e 42B di parametri attivi è importante. MiMo-V2.5-Pro è un modello MoE: ogni token attiva solo un sottoinsieme dei parametri disponibili. Questo cambia in modo sostanziale il profilo di calcolo in inferenza rispetto a un modello denso da 1T di parametri, sebbene il modello completo mantenga comunque enormi requisiti di memoria e di deployment.
Quali sono le caratteristiche principali di MiMo-V2.5-Pro?
1. Architettura MoE sparsa su scala trilione
MiMo-V2.5-Pro contiene 1.02T di parametri totali e 42B di parametri attivi.
La sua architettura include 384 esperti instradati, con otto esperti attivati per ciascun token. Il modello ha 70 layer transformer, costituiti da un layer denso e 69 layer MoE.
Questo fornisce una capacità rappresentazionale sostanzialmente maggiore rispetto allo standard MiMo-V2.5, evitando il costo computazionale di attivare tutti i 1.02T parametri per ogni token.
Il punto pratico è:
MiMo-V2.5-Pro è un modello da un trilione di parametri per capacità totale, ma il suo calcolo per token è governato dal percorso a 42B parametri attivi.
2. Contesto da 1 milione di token
Il modello supporta fino a 1M token di contesto.
Questa è una delle capacità più importanti per gli agenti autonomi perché i workflow di lunga durata possono accumulare:
- Output degli strumenti
- Codice sorgente
- Risultati di ricerca
- Documentazione
- Stato di ragionamento intermedio
- Istruzioni utente
- Log di esecuzione
Invece di riassumere ripetutamente e scartare il contesto storico, un agente può potenzialmente mantenere una cronologia di lavoro molto più ampia.
La valutazione long-context di Xiaomi testa specificamente il modello da 32K fino a 1M token di input.
3. Attenzione ibrida a finestra scorrevole e globale
MiMo-V2.5-Pro usa un rapporto 6:1 tra Sliding Window Attention (SWA) e attenzione globale, con una finestra scorrevole di 128 token.
L’architettura contiene:
- 60 layer SWA
- 10 layer di attenzione globale
- Finestra SWA da 128 token
Xiaomi riporta che questo design riduce l’archiviazione della KV-cache di quasi 7× preservando le prestazioni sul lungo contesto tramite un bias di attention-sink apprendibile.
Questa è una delle parti tecnicamente più significative del modello.
Una finestra di contesto da 1M è costosa se ogni layer esegue attenzione completa sull’intera sequenza. L’attenzione ibrida riduce la quantità di informazioni a cui ogni layer deve prestare attenzione globalmente, mantenendo al contempo layer dedicati all’attenzione globale per le relazioni a lungo raggio.
4. Previsione multi-token
MiMo-V2.5-Pro contiene tre moduli MTP leggeri.
La Previsione Multi-Token consente al modello di prevedere più token futuri in un modo utilizzabile per una decodifica in stile speculativo e l’accelerazione dell’inferenza.
Xiaomi riporta che la sua architettura MTP può triplicare la velocità di output durante l’inferenza nella configurazione di deployment descritta.
Ciò è particolarmente rilevante per gli agenti, poiché un agente può generare grandi quantità di output intermedio su una lunga traiettoria. Migliorare la velocità di generazione dei token può quindi avere un impatto significativo sulla latenza totale del task.
5. Apprendimento per rinforzo agentico
La pipeline di post-addestramento di MiMo-V2.5-Pro include:
- Messa a punto supervisionata
- Apprendimento per rinforzo su larga scala orientato agli agenti
- Multi-Teacher On-Policy Distillation (MOPD)
L’obiettivo di addestramento è esplicitamente orientato a comportamenti agentici complessi, non solo al question answering statico su benchmark.
Questo spiega perché le valutazioni più forti del modello sono concentrate su coding, interazione da terminale, ragionamento su lungo contesto e benchmark per agenti.
6. Pre-addestramento su 27T token
MiMo-V2.5-Pro è stato pre-addestrato su circa 27 trilioni di token, usando precisione mista FP8 e una lunghezza di sequenza nativa di 32K prima di supportare la finestra di contesto estesa a 1M.
La scala del pre-addestramento, combinata con l’architettura MoE da trilione di parametri, colloca MiMo-V2.5-Pro a pieno titolo nella classe dei modelli d’avanguardia.
Come si comporta MiMo-V2.5-Pro sui benchmark?
I risultati di valutazione pubblicati sono particolarmente utili perché includono sia benchmark di ragionamento generale sia valutazioni pratiche su coding/agenti.
| Benchmark | Risultato MiMo-V2.5-Pro | Tipo di valutazione |
|---|---|---|
| SWE-Bench Verified | 78.9 | Ingegneria del software |
| SWE-Bench Pro | 57.2 | Ingegneria del software |
| Terminal-Bench 2.0 | 68.4 | Agente da terminale |
| GSM8K | 99.6 | Ragionamento matematico |
| GPQA Diamond | 66.7 | Ragionamento di livello graduate |
| MMLU-Pro | 68.5 | Ragionamento generale |
| MMLU | 89.4 | Conoscenza/ragionamento generale |
| MMLU-Redux | 92.8 | Conoscenza/ragionamento generale |
| HumanEval+ | 75.6 | Generazione di codice |
| MBPP+ | 74.1 | Programmazione Python |
| LiveCodeBench v6 | 39.6 | Coding competitivo |
| ARC-Challenge | 97.2 | Ragionamento |
| AIME 2024/2025 | 37.3 | Matematica da competizione |
I risultati mostrano un profilo particolarmente forte in ingegneria del software e ragionamento matematico. I valori riportati di 78.9 su SWE-Bench Verified e 68.4 su Terminal-Bench 2.0 sono particolarmente rilevanti per gli sviluppatori che costruiscono sistemi di coding autonomo.
Prestazioni sul lungo contesto
I risultati sul lungo contesto sono forse più interessanti dei benchmark standard.
Sulla valutazione GraphWalks, MiMo-V2.5-Pro mantiene prestazioni misurabili a lunghezze di contesto estreme:
| Context | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi riporta che il precedente MiMo-V2-Pro si deteriora rapidamente oltre 128K e raggiunge 0.00 a 1M su entrambi i sotto-task, mentre V2.5-Pro conserva prestazioni non nulle all’intera finestra da 1M.
Questa è una distinzione significativa: il contesto da 1M di MiMo-V2.5-Pro non è solo un massimo teorico; la valutazione long-context pubblicata dimostra prestazioni utili in profondità entro quella finestra.
Esempi reali di agenti
| Task | Risultato riportato |
|---|---|
| PKU SysY Compiler | 4.3 ore |
| Chiamate a tool durante il task del compilatore | 672 |
| Test del compilatore superati | 233/233 |
| Editor video full-stack | 11.5 ore |
| Codice generato per l’editor video | 8.192 righe |
| Intervento umano | Nessuno riportato |
| Chiamate a tool su lungo orizzonte | Quasi 1.000 |
Queste sono dimostrazioni riportate da Xiaomi piuttosto che punteggi di benchmark standardizzati.
MiMo-V2.5-Pro vs MiMo-V2.5
I due modelli condividono la stessa generazione ma puntano a carichi di lavoro differenti.
| Specifica | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Parametri totali | 310B | 1.02T |
| Parametri attivi | 15B | 42B |
| Contesto | 1M | 1M |
| Layer | 48 | 70 |
| Esperti instradati | 256 | 384 |
| Esperti/token | 8 | 8 |
| Layer a attenzione completa | 9 | 10 |
| Layer SWA | 39 | 60 |
| Focus principale | Agenti omni-modali | Agenti complessi/coding |
| Comprensione video/audio/immagini | Sì | Principalmente focalizzato su linguaggio/agenti |
| Prestazioni agente su lungo orizzonte | Forti | Flagship |
La scelta quindi non è semplicemente “Pro è migliore”.
Se un’applicazione necessita di comprensione nativa di immagini, video e audio, MiMo-V2.5 è la scelta più naturale. Se il carico di lavoro è incentrato su ragionamento complesso, ingegneria del software, interazione da terminale e agenti di lunga durata, MiMo-V2.5-Pro è l’opzione più forte.
Limitazioni di MiMo-V2.5-Pro
1. Input del modello solo testuale
Diversamente da mimo-v2.5, le specifiche ufficiali del modello Pro indicano Testo come modalità di input. Non dovrebbe essere presentato come il modello multimodale della famiglia V2.5.
2. Requisiti computazionali elevati per l’hosting autonomo
Il modello ha circa 1T di parametri totali / 42B di parametri attivi, rendendo il deployment locale notevolmente più impegnativo rispetto ai piccoli modelli aperti convenzionali.
3. Le prestazioni dell’agente dipendono dal framework
L’affermazione di Xiaomi sulle quasi 1.000 chiamate a tool è esplicitamente associata all’uso di un framework per agenti adeguato. Il solo modello non garantisce che un’applicazione raggiunga la stessa performance a lungo orizzonte.
4. Gestione dei contenuti di ragionamento
Le applicazioni agent multi-turn che usano la modalità di pensiero e le chiamate a strumenti devono preservare correttamente reasoning_content. Una gestione non corretta può produrre errori API.
Casi d’uso migliori
Ingegneria del software su larga scala
- Migrazione di repository
- Refactoring
- Debug
- Generazione di test
- Sviluppo di compilatori
- Sviluppo di applicazioni full-stack
Agenti di coding autonomi
MiMo-V2.5-Pro è particolarmente adatto ad agenti che devono ripetutamente:
ispezionare → modificare → eseguire → testare → diagnosticare → modificare
Ragionamento su documenti lunghi
Il suo contesto da 1M lo rende utile per:
- Contratti legali
- Specifiche tecniche
- Ampie collezioni di ricerca
- Documentazione aziendale
Agenti aziendali complessi
Chiamate a strumenti + ricerca web + output strutturati possono supportare:
- Agenti di ricerca
- Agenti di elaborazione dati
- Automazione di workflow aziendali
- Sistemi decisionali multi-step
Come usare l’API di MiMo-V2.5-Pro su CometAPI
L’ID modello rilevante su CometAPI è:
mimo-v2.5-pro
Per gli sviluppatori, uno strato di aggregazione API è particolarmente utile per testare MiMo-V2.5-Pro rispetto ad altri modelli di ragionamento e agenti di fascia alta senza mantenere integrazioni con provider indipendenti.
Passaggio 1: Ottieni una API Key di CometAPI
Crea o accedi al tuo account CometAPI e ottieni la tua API key dalla console API.
Impostala come variabile d’ambiente:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Passaggio 2: Configura il client API
Xiaomi fornisce un’API compatibile con entrambi i protocolli OpenAI e Anthropic, rendendo la migrazione relativamente semplice. Per l’integrazione in produzione, usa l’endpoint/schema corrente di CometAPI per mimo-v2.5-pro, in particolare se hai bisogno di funzionalità avanzate come chiamate a strumenti, streaming, output strutturati o richieste con contesti lunghi.
Passaggio 3: Collega MiMo-V2.5-Pro agli strumenti
Il modello diventa sostanzialmente più utile quando è collegato a strumenti esterni.
Per esempio:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Questa architettura è molto più allineata all’uso previsto del modello rispetto a una semplice integrazione da chatbot.