TL;DR
Il modello standard V2.5 di Xiaomi combina comprensione nativa di testo, immagini, video e audio con una finestra di contesto da 1 milione di token, uso di strumenti e l’efficienza di una Mixture-of-Experts sparsa. È la scelta migliore quando contano input multimodali e costo per task completato. La variante Pro è più grande e più forte in compiti di coding impegnativi e nel lavoro agentico a lungo orizzonte, ma è focalizzata su input testuale e costa circa tre volte tanto per token secondo le tariffe pubblicate da Xiaomi.
La decisione pratica è semplice: scegliere il modello standard per agenti multimodali, analisi di documenti e media e automazione ad alto volume; scegliere Pro quando il collo di bottiglia è l’ingegneria software difficile o l’esecuzione autonoma prolungata.
Punti chiave
- Il modello standard utilizza 310B parametri totali attivandone 15B per token.
- Accetta testo, immagini, video e audio, quindi restituisce testo.
- La sua API supporta contesto da 1M, fino a 128K di output, chiamate a strumenti, ricerca web, streaming, output strutturato e caching del contesto.
- Risultati riportati dal publisher includono 65.8 su Terminal-Bench 2.0 e 56.1 su SWE-Bench Pro.
- L’attuale scheda modello MiMo-V2.5-Pro di Xiaomi elenca 1.02T parametri totali e 42B attivi. I punteggi SWE-Bench Pro indicati dal publisher sono 56.1 per MiMo-V2.5 e 57.2 per Pro; sono confronti datati e riportati dal publisher, non una garanzia per uno specifico workflow di coding.
- Alle attuali tariffe Xiaomi, i costi input/output dello standard sono $0.14/$0.28 per milione di token; Pro costa $0.435/$0.87.
- Entrambe le API in CometAPI hanno un prezzo inferiore del 20% rispetto alle coppie ufficiali non in cache.
Informazioni verificate: 28 settembre 2026. Prezzi, benchmark, limiti, disponibilità e formati delle richieste possono cambiare. Xiaomi ha annunciato che i nomi modello API ufficiali mimo-v2.5 e mimo-v2.5-pro saranno deprecati alle 10:00 ora di Pechino del 21 ottobre 2026, senza sostituzione automatica. Pianificare la migrazione e confermare il percorso live prima del deployment.
Nota sul ciclo di vita dell’API: la piattaforma ufficiale Xiaomi prevede di ritirare entrambi gli ID modello V2.5 il 21 ottobre 2026. Questo avviso riguarda la piattaforma API di Xiaomi; verificare separatamente eventuali gateway di terze parti. Avviso di deprecazione del modello Xiaomi
Che cos’è il modello Standard
MiMo-V2.5 è il modello foundation orientato all’efficienza di Xiaomi MiMo per percezione multimodale e lavoro agentico. Fornisce input nativi di testo, immagini, video e audio all’interno di un’unica architettura e produce output testuale.
Il registro di rilascio del modello di Xiaomi data la beta pubblica della serie MiMo-V2.5 al 23 aprile 2026. I pesi sono stati successivamente rilasciati sotto licenza MIT. MiMo-V2.5 ha 310B parametri totali, ma ne attiva solo circa 15B per ciascun token; utilizza un ampio pool di specialisti senza eseguirli tutti contemporaneamente.
MiMo-V2.5-Pro è mirato a un diverso carico di lavoro. È un modello da un trilione di parametri, con input testuale, progettato per i compiti di coding più difficili, il terminale e i task agentici di lunga durata. Le due varianti condividono un contesto massimo di 1M, ma differiscono nettamente per modalità, calcolo attivo e prezzo.
Specifiche e funzionalità di MiMo-V2.5
| Dettagli ufficiali dell’architettura | Valore | Perché è importante |
|---|---|---|
| Architettura | Sparse MoE | Ampia capacità di esperti con attivazione selettiva |
| Parametri totali / attivi | 310B / 15B | Il calcolo attivo è molto inferiore alla capacità totale |
| Strati del transformer | 48: 1 denso + 47 MoE | La maggior parte degli strati usa esperti instradati |
| Esperti instradati | 256; 8 attivi per token | Specializzazione senza esecuzione densa da 310B |
| Attenzione | 39 strati SWA + 9 globali | Bilancia efficienza locale e flusso a lungo raggio |
| Finestra SWA | 128 token | Riduce la pressione della cache su lunghi contesti |
| Contesto / output massimo | 1M / 128K token | Supporta documenti lunghi e tracce estese |
| Input / output | Testo, immagini, video, audio / testo | Percezione nativa su quattro tipi di input |
| Vision encoder | ViT da 729M; 28 strati | Comprensione di immagini e video |
| Audio encoder | Transformer da 261M; 24 strati | Comprensione audio nativa |
| Multi-Token Prediction | 3 moduli; circa 329M parametri | Supporta l’efficienza della decodifica speculativa |
| Scala di addestramento | Circa 48T token | Ampia pipeline di training testuale e multimodale |
| Capacità API | Strumenti, web, streaming, output strutturato, caching | Primitive agentiche orientate alla produzione |
| Licenza | MIT | Uso commerciale e modifica consentiti |
Il perimetro operativo include un contesto da 1M e output da 128K, oltre a limiti pubblicati di 100 richieste al minuto e 10 milioni di token al minuto. I limiti a livello di provider possono differire per account e percorso di integrazione.
Diagramma ufficiale dell’architettura di Xiaomi MiMo. Asset ufficiale dell’architettura.
Come funziona l’architettura di MiMo-V2.5
Esperti sparsi: la capacità totale non è il calcolo attivo
Il fatto centrale in termini di efficienza è il design 310B totali, 15B attivi. L’instradatore seleziona otto dei 256 esperti per ciascun token. Ciò offre al modello accesso a un pool di parametri molto più ampio rispetto a un modello denso da 15B convenzionale, senza eseguire ogni volta tutti i 310B parametri.
Questo non rende l’auto-hosting banale. I pesi completi devono comunque essere archiviati e distribuiti, quindi capacità di memoria, banda dell’interconnessione, instradamento degli esperti e software di serving restano vincoli materiali.
Attenzione ibrida per contesti lunghi
Lo scheletro alterna attenzione a finestra scorrevole e globale con un rapporto SWA-globale di 5:1. Trentanove strati locali controllano la crescita della cache, mentre nove strati globali preservano il flusso di informazione a lunga distanza. Xiaomi riporta una riduzione della KV-cache quasi di sei volte rispetto a un design totalmente globale.
Un massimo di 1M token è capacità, non accuratezza garantita. Qualità del recupero, latenza, crescita dello stato degli strumenti e attenzione su evidenze distanti richiedono comunque una valutazione specifica per il carico di lavoro.
Encoder nativi e funzioni per agenti
Un vision transformer da 729M parametri gestisce input di immagini e video; un transformer da 261M parametri gestisce l’audio. I proiettori mappano entrambi i flussi nel backbone linguistico, consentendo a un singolo agente di combinare uno screenshot, un segmento video, una traccia audio, istruzioni testuali e risultati degli strumenti.
Tre moduli di Multi-Token Prediction supportano la decodifica speculativa e l’efficienza dell’apprendimento per rinforzo. Il modello è stato addestrato su circa 48T token, con il contesto esteso progressivamente a 1M durante il post-training.
I pesi open source usano una licenza MIT. Il deployment commerciale è consentito, ma i costi infrastrutturali e le dipendenze di terze parti richiedono comunque una revisione separata.
Benchmark di MiMo-V2.5: coding, agenti e risultati multimodali
Nota sui benchmark:
le cifre sottostanti sono riportate dal publisher. Sono evidenza direzionale, non una garanzia per uno specifico repository, formato media, stack di strumenti, target di latenza o policy di safety.
Risultati su coding e agent

Grafico ufficiale dei benchmark di coding e agent di Xiaomi MiMo.
| Benchmark ufficiale di coding | Punteggio riportato | Segnale decisionale |
|---|---|---|
| MiMo Coding Bench | 71.8 | Ampia capacità degli agent di coding |
| Claw-Eval Text | 62.3 | Completamento generale di agent testuali |
| Terminal-Bench 2.0 | 65.8 | Esecuzione interattiva da terminal |
| SWE-Bench Pro | 56.1 | Ingegneria software nel mondo reale |
| Claw-Eval Multi-Turn | 63.2 | Lavoro agentico multi-step più lungo |
| ResearchClawBench | 16.91 | Workflow di ricerca autonoma |
Risultato: il caso più forte è l’uso pratico degli strumenti piuttosto che il completamento di codice isolato. Un risultato di 65.8 su Terminal-Bench supporta agenti orientati al terminale, mentre 56.1 su SWE-Bench Pro suggerisce capacità utile a livello di repository. Il punteggio di ricerca molto più basso ricorda di testare separatamente il recupero di evidenze e il comportamento di citazione.
Risultati multimodali

Grafico ufficiale dei benchmark di immagine, video e agent multimodali di Xiaomi MiMo.
| Benchmark ufficiale multimodale | Punteggio riportato | Capacità testata |
|---|---|---|
| CharXiv RQ | 81.0 | Ragionamento su grafici e documenti |
| MMMU-Pro | 77.9 | Ragionamento multimodale di livello esperto |
| HR-Bench 4K | 88.5 | Comprensione di immagini ad alta risoluzione |
| OmniDocBench | 87.2 | Comprensione dei documenti |
| Claw-Eval Multimodale | 23.8 | Completamento agent multimodale |
| Video-MME | 87.7 | Comprensione video |
| DailyOmni | 83.5 | Ragionamento audiovisivo quotidiano |
| VideoHolmes | 64.0 | Ragionamento temporale su video |
Risultato: comprensione di documenti, immagini ad alta risoluzione e video sono i punti di forza più evidenti. Il punteggio 23.8 negli agent multimodali è molto più basso dei punteggi di percezione, quindi un sistema che deve sia comprendere i media sia operare strumenti in modo affidabile dovrebbe essere valutato end-to-end.
MiMo-V2.5 vs MiMo-V2.5-Pro: confronto multidimensionale
| Confronto ufficiale dell’architettura | MiMo-V2.5 | MiMo-V2.5-Pro Specifiche ufficiali Pro Benchmark ufficiali Pro | Implicazione pratica |
|---|---|---|---|
| Parametri totali | 310B | 1.02T | Pro ha oltre 3× la capacità totale |
| Parametri attivati | 15B | 42B | Pro usa circa 2.8× più parametri attivi |
| Strati / esperti instradati | 48 / 256 | 70 / 384 | Pro è un target di serving più grande |
| Tetto di contesto della scheda modello | 1M | 1M | Entrambi elencano fino a 1M token; testare recupero e latenza alla dimensione del proprio workload |
| Output massimo API ufficiale | 128K | 128K | Le attuali pagine API Xiaomi elencano 128K per entrambi; i limiti specifici dei provider possono variare |
| Input nativo | Testo, immagini, video, audio | Testo | MiMo-V2.5 è la scelta multimodale documentata; verificare l’endpoint Pro esatto prima di inviare media |
| SWE-Bench Pro | 56.1 | 57.2 | Pro è avanti di 1.1 punti |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro è avanti di 2.6 punti |
| Fit primario | Agenti multimodali efficienti | Coding complesso e agent a lungo orizzonte | Scegliere in base al carico testato; i margini a livello di modello non provano un vantaggio generale |
Risultato del confronto: il vantaggio di Pro nei benchmark condivisi di coding-agent è modesto, mentre la variante standard aggiunge input nativi di immagini, video e audio e utilizza molti meno parametri attivi. Pro è giustificato quando piccoli incrementi nel completamento di task difficili valgono più dell’input multimodale e del minor costo unitario.
Quanto costano MiMo-V2.5 e MiMo-V2.5-Pro?
| Base prezzi: 27 maggio 2026 | API ufficiale standard | API ufficiale Pro | API MiMo-V2.5 in CometAPI | API MiMo-V2.5-Pro in CometAPI |
|---|---|---|---|---|
| Input, cache miss / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| Output / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| Input, cache hit / MTok | $0.0028 | $0.0036 | Verificare fatturazione live | Verificare fatturazione live |
| Sconto vs tariffa ufficiale non in cache | Baseline | Baseline | 20% | 20% |
Alle tariffe ufficiali, Pro costa circa 3.1× rispetto allo standard sia per input sia per output non in cache. I prezzi del provider mostrati sopra riducono ciascuna coppia non in cache del 20%, ma il divario relativo tra le varianti resta sostanzialmente invariato.
Il prezzo per token non è il costo totale. Retry degli strumenti, dimensione del contesto, lunghezza dell’output, latenza, recupero da task falliti e revisione umana determinano il costo per task completato. Eseguire un campione rappresentativo del carico prima di selezionare un modello di produzione predefinito.
A cosa è più adatto MiMo-V2.5?
- Agenti multimodali: combinare screenshot, documenti, video, audio, istruzioni e strumenti in un unico workflow.
- Analisi di documenti lunghi: elaborare repository, contratti, archivi di ricerca, log e storici di supporto.
- Comprensione dei media: riassumere video, estrarre eventi, interpretare grafici e rispondere a domande audiovisive.
- Agenti di coding e terminale: ispezionare file, eseguire comandi, modificare codice e iterare sui risultati dei test.
- Automazione ad alto volume: usare attivazione sparsa e prezzi per token più bassi per task ripetuti in produzione.
Limitazioni e rischi
- Solo 15B parametri sono attivi per token, ma l’auto-hosting richiede comunque l’intero sistema di pesi da 310B.
- L’output multimodale è testuale; la generazione di immagini, parlato e video richiede altri modelli.
- Un tetto di contesto da 1M non garantisce accuratezza uniforme su tutta la finestra.
- I benchmark del publisher possono non trasferirsi a strumenti, repository, prompt o vincoli di safety personalizzati.
- L’esposizione di modalità a livello di provider può differire dalle capacità complete del modello open-weight sottostante.
Gate di produzione:
validare accuratezza, completamento delle chiamate a strumenti, latenza, consumo di token, gestione delle modalità e comportamento di fallback su task rappresentativi prima di indirizzare traffico.
Esempio di API
Il seguente esempio in Python utilizza un endpoint CometAPI compatibile con OpenAI e l’ID del modello standard. Confermare l’endpoint corrente e lo schema di richiesta supportato prima del deployment.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Guida decisionale
| Segnale del carico di lavoro | Partire con | Passare quando |
|---|---|---|
| Immagini, video o audio sono input di prima classe | Standard | Non passare, a meno che un preprocessing multimodale sia accettabile |
| Volume di documenti o media misti | Standard | Pro solo se i fallimenti di ragionamento dominano i costi |
| Ingegneria di repository difficile | Testare entrambi | Scegliere Pro se il guadagno di completamento compensa il costo unitario 3.1× |
| Traiettorie autonome lunghe da terminale | Pro | Tornare allo standard se i guadagni non sono misurabili |
| Automazione di routine ad alto volume | Standard | Escalare solo i task falliti o ad alto valore |
Instradamento consigliato:
usare lo standard come default per lavoro multimodale e ad alto volume, quindi instradare alla Pro solo i compiti testuali difficili o a lungo orizzonte. Questo preserva la capacità controllando il costo totale.
Conclusione
Il modello standard non è semplicemente una Pro più piccola. È un punto di ottimizzazione distinto: input multimodale nativo, contesto da 1M, solidi benchmark orientati agli strumenti e 15B parametri attivi a un prezzo per token molto più basso.
Pro è l’opzione specialistica per ingegneria software difficile ed esecuzione autonoma sostenuta. La capacità extra produce guadagni misurabili ma non universali, quindi il pattern di deployment più efficace è l’instradamento in base al carico di lavoro anziché selezionare una sola variante per ogni richiesta.
FAQ
Il modello standard è open source?
I suoi pesi sono rilasciati sotto licenza MIT, consentendo uso commerciale, modifica, fine-tuning e ridistribuzione secondo i termini della licenza.
Quanti parametri utilizza?
La MoE sparsa contiene 310B parametri totali e ne attiva 15B per ciascun token. I parametri attivi descrivono il calcolo per token, non la dimensione di archiviazione del modello completo.
Supporta immagini, video e audio?
Sì. La variante standard accetta input di testo, immagini, video e audio e restituisce testo. La specifica ufficiale della variante Pro elenca input testuale.
Qual è la finestra di contesto massima?
Entrambe le schede modello specificano una finestra di contesto fino a 1M token. Le attuali pagine API di Xiaomi elencano un output massimo di 128K per MiMo-V2.5 e MiMo-V2.5-Pro. I limiti effettivi utilizzabili possono variare in base a endpoint, provider, account e formato di richiesta; verificare il percorso distribuito prima di fare affidamento su tali soglie.
L’attuale pagina API ufficiale Pro conferma separatamente il contesto da 1M e l’output massimo di 128K: Specifiche API MiMo-V2.5-Pro
Quale variante è migliore per agent di coding?
Pro riporta risultati più elevati sui benchmark condivisi di coding e terminale, ma il margine è modesto. Testare entrambi sul repository target e scegliere in base a completamento dei task, latenza e costo totale.
Quale variante è migliore per agent multimodali?
La variante standard è la scelta naturale perché accetta nativamente input di immagini, video e audio. Pro è focalizzata su input testuale.
Come dovrebbe scegliere un team di produzione?
Partire dallo standard, misurare i fallimenti e instradare solo i compiti testuali difficili che traggono beneficio dalla Pro. Confrontare il costo per task completato, non solo il prezzo per token.
