GPT-6.1 Sol are now live on CometAPI →
ai-model/Ricerca CometAPI

Che cos'è MiMo-V2.5? Specifiche tecniche, benchmark, funzionalità, prezzi e accesso alle API

Esplora le specifiche di Xiaomi MiMo‑V2.5, l'architettura, i benchmark ufficiali, i prezzi, il confronto con MiMo‑V2.5‑Pro, i casi d'uso, le limitazioni e l'accesso a CometAPI.

CometAPI
Deon GoodwinTeam di ricerca su modelli AI e API
Aggiornato Oct 5, 2026 13 min di lettura
Che cos'è MiMo-V2.5? Specifiche tecniche, benchmark, funzionalità, prezzi e accesso alle API
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Il modello standard V2.5 di Xiaomi combina comprensione nativa di testo, immagini, video e audio con una finestra di contesto da 1 milione di token, uso di strumenti e l’efficienza di una Mixture-of-Experts sparsa. È la scelta migliore quando contano input multimodali e costo per task completato. La variante Pro è più grande e più forte in compiti di coding impegnativi e nel lavoro agentico a lungo orizzonte, ma è focalizzata su input testuale e costa circa tre volte tanto per token secondo le tariffe pubblicate da Xiaomi.

La decisione pratica è semplice: scegliere il modello standard per agenti multimodali, analisi di documenti e media e automazione ad alto volume; scegliere Pro quando il collo di bottiglia è l’ingegneria software difficile o l’esecuzione autonoma prolungata.

Punti chiave

  • Il modello standard utilizza 310B parametri totali attivandone 15B per token.
  • Accetta testo, immagini, video e audio, quindi restituisce testo.
  • La sua API supporta contesto da 1M, fino a 128K di output, chiamate a strumenti, ricerca web, streaming, output strutturato e caching del contesto.
  • Risultati riportati dal publisher includono 65.8 su Terminal-Bench 2.0 e 56.1 su SWE-Bench Pro.
  • L’attuale scheda modello MiMo-V2.5-Pro di Xiaomi elenca 1.02T parametri totali e 42B attivi. I punteggi SWE-Bench Pro indicati dal publisher sono 56.1 per MiMo-V2.5 e 57.2 per Pro; sono confronti datati e riportati dal publisher, non una garanzia per uno specifico workflow di coding.
  • Alle attuali tariffe Xiaomi, i costi input/output dello standard sono $0.14/$0.28 per milione di token; Pro costa $0.435/$0.87.
  • Entrambe le API in CometAPI hanno un prezzo inferiore del 20% rispetto alle coppie ufficiali non in cache.
    Informazioni verificate: 28 settembre 2026. Prezzi, benchmark, limiti, disponibilità e formati delle richieste possono cambiare. Xiaomi ha annunciato che i nomi modello API ufficiali mimo-v2.5 e mimo-v2.5-pro saranno deprecati alle 10:00 ora di Pechino del 21 ottobre 2026, senza sostituzione automatica. Pianificare la migrazione e confermare il percorso live prima del deployment.

Nota sul ciclo di vita dell’API: la piattaforma ufficiale Xiaomi prevede di ritirare entrambi gli ID modello V2.5 il 21 ottobre 2026. Questo avviso riguarda la piattaforma API di Xiaomi; verificare separatamente eventuali gateway di terze parti. Avviso di deprecazione del modello Xiaomi

Che cos’è il modello Standard

MiMo-V2.5 è il modello foundation orientato all’efficienza di Xiaomi MiMo per percezione multimodale e lavoro agentico. Fornisce input nativi di testo, immagini, video e audio all’interno di un’unica architettura e produce output testuale.

Il registro di rilascio del modello di Xiaomi data la beta pubblica della serie MiMo-V2.5 al 23 aprile 2026. I pesi sono stati successivamente rilasciati sotto licenza MIT. MiMo-V2.5 ha 310B parametri totali, ma ne attiva solo circa 15B per ciascun token; utilizza un ampio pool di specialisti senza eseguirli tutti contemporaneamente.

MiMo-V2.5-Pro è mirato a un diverso carico di lavoro. È un modello da un trilione di parametri, con input testuale, progettato per i compiti di coding più difficili, il terminale e i task agentici di lunga durata. Le due varianti condividono un contesto massimo di 1M, ma differiscono nettamente per modalità, calcolo attivo e prezzo.

Specifiche e funzionalità di MiMo-V2.5

Dettagli ufficiali dell’architetturaValorePerché è importante
ArchitetturaSparse MoEAmpia capacità di esperti con attivazione selettiva
Parametri totali / attivi310B / 15BIl calcolo attivo è molto inferiore alla capacità totale
Strati del transformer48: 1 denso + 47 MoELa maggior parte degli strati usa esperti instradati
Esperti instradati256; 8 attivi per tokenSpecializzazione senza esecuzione densa da 310B
Attenzione39 strati SWA + 9 globaliBilancia efficienza locale e flusso a lungo raggio
Finestra SWA128 tokenRiduce la pressione della cache su lunghi contesti
Contesto / output massimo1M / 128K tokenSupporta documenti lunghi e tracce estese
Input / outputTesto, immagini, video, audio / testoPercezione nativa su quattro tipi di input
Vision encoderViT da 729M; 28 stratiComprensione di immagini e video
Audio encoderTransformer da 261M; 24 stratiComprensione audio nativa
Multi-Token Prediction3 moduli; circa 329M parametriSupporta l’efficienza della decodifica speculativa
Scala di addestramentoCirca 48T tokenAmpia pipeline di training testuale e multimodale
Capacità APIStrumenti, web, streaming, output strutturato, cachingPrimitive agentiche orientate alla produzione
LicenzaMITUso commerciale e modifica consentiti

Il perimetro operativo include un contesto da 1M e output da 128K, oltre a limiti pubblicati di 100 richieste al minuto e 10 milioni di token al minuto. I limiti a livello di provider possono differire per account e percorso di integrazione.

Che cos'è MiMo-V2.5? Specifiche tecniche, benchmark, funzionalità, prezzi e accesso alle API

Diagramma ufficiale dell’architettura di Xiaomi MiMo. Asset ufficiale dell’architettura.

Come funziona l’architettura di MiMo-V2.5

Esperti sparsi: la capacità totale non è il calcolo attivo

Il fatto centrale in termini di efficienza è il design 310B totali, 15B attivi. L’instradatore seleziona otto dei 256 esperti per ciascun token. Ciò offre al modello accesso a un pool di parametri molto più ampio rispetto a un modello denso da 15B convenzionale, senza eseguire ogni volta tutti i 310B parametri.

Questo non rende l’auto-hosting banale. I pesi completi devono comunque essere archiviati e distribuiti, quindi capacità di memoria, banda dell’interconnessione, instradamento degli esperti e software di serving restano vincoli materiali.

Attenzione ibrida per contesti lunghi

Lo scheletro alterna attenzione a finestra scorrevole e globale con un rapporto SWA-globale di 5:1. Trentanove strati locali controllano la crescita della cache, mentre nove strati globali preservano il flusso di informazione a lunga distanza. Xiaomi riporta una riduzione della KV-cache quasi di sei volte rispetto a un design totalmente globale.

Un massimo di 1M token è capacità, non accuratezza garantita. Qualità del recupero, latenza, crescita dello stato degli strumenti e attenzione su evidenze distanti richiedono comunque una valutazione specifica per il carico di lavoro.

Encoder nativi e funzioni per agenti

Un vision transformer da 729M parametri gestisce input di immagini e video; un transformer da 261M parametri gestisce l’audio. I proiettori mappano entrambi i flussi nel backbone linguistico, consentendo a un singolo agente di combinare uno screenshot, un segmento video, una traccia audio, istruzioni testuali e risultati degli strumenti.

Tre moduli di Multi-Token Prediction supportano la decodifica speculativa e l’efficienza dell’apprendimento per rinforzo. Il modello è stato addestrato su circa 48T token, con il contesto esteso progressivamente a 1M durante il post-training.

I pesi open source usano una licenza MIT. Il deployment commerciale è consentito, ma i costi infrastrutturali e le dipendenze di terze parti richiedono comunque una revisione separata.

Benchmark di MiMo-V2.5: coding, agenti e risultati multimodali

Nota sui benchmark:

le cifre sottostanti sono riportate dal publisher. Sono evidenza direzionale, non una garanzia per uno specifico repository, formato media, stack di strumenti, target di latenza o policy di safety.

Risultati su coding e agent

Che cos'è MiMo-V2.5? Specifiche tecniche, benchmark, funzionalità, prezzi e accesso alle API

Grafico ufficiale dei benchmark di coding e agent di Xiaomi MiMo.

Benchmark ufficiale di codingPunteggio riportatoSegnale decisionale
MiMo Coding Bench71.8Ampia capacità degli agent di coding
Claw-Eval Text62.3Completamento generale di agent testuali
Terminal-Bench 2.065.8Esecuzione interattiva da terminal
SWE-Bench Pro56.1Ingegneria software nel mondo reale
Claw-Eval Multi-Turn63.2Lavoro agentico multi-step più lungo
ResearchClawBench16.91Workflow di ricerca autonoma

Risultato: il caso più forte è l’uso pratico degli strumenti piuttosto che il completamento di codice isolato. Un risultato di 65.8 su Terminal-Bench supporta agenti orientati al terminale, mentre 56.1 su SWE-Bench Pro suggerisce capacità utile a livello di repository. Il punteggio di ricerca molto più basso ricorda di testare separatamente il recupero di evidenze e il comportamento di citazione.

Risultati multimodali

Che cos'è MiMo-V2.5? Specifiche tecniche, benchmark, funzionalità, prezzi e accesso alle API

Grafico ufficiale dei benchmark di immagine, video e agent multimodali di Xiaomi MiMo.

Benchmark ufficiale multimodalePunteggio riportatoCapacità testata
CharXiv RQ81.0Ragionamento su grafici e documenti
MMMU-Pro77.9Ragionamento multimodale di livello esperto
HR-Bench 4K88.5Comprensione di immagini ad alta risoluzione
OmniDocBench87.2Comprensione dei documenti
Claw-Eval Multimodale23.8Completamento agent multimodale
Video-MME87.7Comprensione video
DailyOmni83.5Ragionamento audiovisivo quotidiano
VideoHolmes64.0Ragionamento temporale su video

Risultato: comprensione di documenti, immagini ad alta risoluzione e video sono i punti di forza più evidenti. Il punteggio 23.8 negli agent multimodali è molto più basso dei punteggi di percezione, quindi un sistema che deve sia comprendere i media sia operare strumenti in modo affidabile dovrebbe essere valutato end-to-end.

MiMo-V2.5 vs MiMo-V2.5-Pro: confronto multidimensionale

Confronto ufficiale dell’architetturaMiMo-V2.5MiMo-V2.5-Pro
Specifiche ufficiali Pro
Benchmark ufficiali Pro
Implicazione pratica
Parametri totali310B1.02TPro ha oltre 3× la capacità totale
Parametri attivati15B42BPro usa circa 2.8× più parametri attivi
Strati / esperti instradati48 / 25670 / 384Pro è un target di serving più grande
Tetto di contesto della scheda modello1M1MEntrambi elencano fino a 1M token; testare recupero e latenza alla dimensione del proprio workload
Output massimo API ufficiale128K128KLe attuali pagine API Xiaomi elencano 128K per entrambi; i limiti specifici dei provider possono variare
Input nativoTesto, immagini, video, audioTestoMiMo-V2.5 è la scelta multimodale documentata; verificare l’endpoint Pro esatto prima di inviare media
SWE-Bench Pro56.157.2Pro è avanti di 1.1 punti
Terminal-Bench 2.065.868.4Pro è avanti di 2.6 punti
Fit primarioAgenti multimodali efficientiCoding complesso e agent a lungo orizzonteScegliere in base al carico testato; i margini a livello di modello non provano un vantaggio generale

Risultato del confronto: il vantaggio di Pro nei benchmark condivisi di coding-agent è modesto, mentre la variante standard aggiunge input nativi di immagini, video e audio e utilizza molti meno parametri attivi. Pro è giustificato quando piccoli incrementi nel completamento di task difficili valgono più dell’input multimodale e del minor costo unitario.

Quanto costano MiMo-V2.5 e MiMo-V2.5-Pro?

Base prezzi: 27 maggio 2026API ufficiale standardAPI ufficiale ProAPI MiMo-V2.5 in CometAPIAPI MiMo-V2.5-Pro in CometAPI
Input, cache miss / MTok$0.14$0.435$0.112$0.348
Output / MTok$0.28$0.87$0.224$0.696
Input, cache hit / MTok$0.0028$0.0036Verificare fatturazione liveVerificare fatturazione live
Sconto vs tariffa ufficiale non in cacheBaselineBaseline20%20%

Alle tariffe ufficiali, Pro costa circa 3.1× rispetto allo standard sia per input sia per output non in cache. I prezzi del provider mostrati sopra riducono ciascuna coppia non in cache del 20%, ma il divario relativo tra le varianti resta sostanzialmente invariato.

Il prezzo per token non è il costo totale. Retry degli strumenti, dimensione del contesto, lunghezza dell’output, latenza, recupero da task falliti e revisione umana determinano il costo per task completato. Eseguire un campione rappresentativo del carico prima di selezionare un modello di produzione predefinito.

A cosa è più adatto MiMo-V2.5?

  • Agenti multimodali: combinare screenshot, documenti, video, audio, istruzioni e strumenti in un unico workflow.
  • Analisi di documenti lunghi: elaborare repository, contratti, archivi di ricerca, log e storici di supporto.
  • Comprensione dei media: riassumere video, estrarre eventi, interpretare grafici e rispondere a domande audiovisive.
  • Agenti di coding e terminale: ispezionare file, eseguire comandi, modificare codice e iterare sui risultati dei test.
  • Automazione ad alto volume: usare attivazione sparsa e prezzi per token più bassi per task ripetuti in produzione.

Limitazioni e rischi

  • Solo 15B parametri sono attivi per token, ma l’auto-hosting richiede comunque l’intero sistema di pesi da 310B.
  • L’output multimodale è testuale; la generazione di immagini, parlato e video richiede altri modelli.
  • Un tetto di contesto da 1M non garantisce accuratezza uniforme su tutta la finestra.
  • I benchmark del publisher possono non trasferirsi a strumenti, repository, prompt o vincoli di safety personalizzati.
  • L’esposizione di modalità a livello di provider può differire dalle capacità complete del modello open-weight sottostante.

Gate di produzione:

validare accuratezza, completamento delle chiamate a strumenti, latenza, consumo di token, gestione delle modalità e comportamento di fallback su task rappresentativi prima di indirizzare traffico.

Esempio di API

Il seguente esempio in Python utilizza un endpoint CometAPI compatibile con OpenAI e l’ID del modello standard. Confermare l’endpoint corrente e lo schema di richiesta supportato prima del deployment.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Guida decisionale

Segnale del carico di lavoroPartire conPassare quando
Immagini, video o audio sono input di prima classeStandardNon passare, a meno che un preprocessing multimodale sia accettabile
Volume di documenti o media mistiStandardPro solo se i fallimenti di ragionamento dominano i costi
Ingegneria di repository difficileTestare entrambiScegliere Pro se il guadagno di completamento compensa il costo unitario 3.1×
Traiettorie autonome lunghe da terminaleProTornare allo standard se i guadagni non sono misurabili
Automazione di routine ad alto volumeStandardEscalare solo i task falliti o ad alto valore

Instradamento consigliato:

usare lo standard come default per lavoro multimodale e ad alto volume, quindi instradare alla Pro solo i compiti testuali difficili o a lungo orizzonte. Questo preserva la capacità controllando il costo totale.

Conclusione

Il modello standard non è semplicemente una Pro più piccola. È un punto di ottimizzazione distinto: input multimodale nativo, contesto da 1M, solidi benchmark orientati agli strumenti e 15B parametri attivi a un prezzo per token molto più basso.

Pro è l’opzione specialistica per ingegneria software difficile ed esecuzione autonoma sostenuta. La capacità extra produce guadagni misurabili ma non universali, quindi il pattern di deployment più efficace è l’instradamento in base al carico di lavoro anziché selezionare una sola variante per ogni richiesta.

FAQ

Il modello standard è open source?

I suoi pesi sono rilasciati sotto licenza MIT, consentendo uso commerciale, modifica, fine-tuning e ridistribuzione secondo i termini della licenza.

Quanti parametri utilizza?

La MoE sparsa contiene 310B parametri totali e ne attiva 15B per ciascun token. I parametri attivi descrivono il calcolo per token, non la dimensione di archiviazione del modello completo.

Supporta immagini, video e audio?

Sì. La variante standard accetta input di testo, immagini, video e audio e restituisce testo. La specifica ufficiale della variante Pro elenca input testuale.

Qual è la finestra di contesto massima?

Entrambe le schede modello specificano una finestra di contesto fino a 1M token. Le attuali pagine API di Xiaomi elencano un output massimo di 128K per MiMo-V2.5 e MiMo-V2.5-Pro. I limiti effettivi utilizzabili possono variare in base a endpoint, provider, account e formato di richiesta; verificare il percorso distribuito prima di fare affidamento su tali soglie.

L’attuale pagina API ufficiale Pro conferma separatamente il contesto da 1M e l’output massimo di 128K: Specifiche API MiMo-V2.5-Pro

Quale variante è migliore per agent di coding?

Pro riporta risultati più elevati sui benchmark condivisi di coding e terminale, ma il margine è modesto. Testare entrambi sul repository target e scegliere in base a completamento dei task, latenza e costo totale.

Quale variante è migliore per agent multimodali?

La variante standard è la scelta naturale perché accetta nativamente input di immagini, video e audio. Pro è focalizzata su input testuale.

Come dovrebbe scegliere un team di produzione?

Partire dallo standard, misurare i fallimenti e instradare solo i compiti testuali difficili che traggono beneficio dalla Pro. Confrontare il costo per task completato, non solo il prezzo per token.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Oct 5, 2026
Ultimo aggiornamento Oct 5, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Leggi di più