TL;DR
O modelo padrão V2.5 da Xiaomi combina compreensão nativa de texto, imagem, vídeo e áudio com uma janela de contexto de 1 milhão de tokens, uso de ferramentas e eficiência de uma Mixture-of-Experts esparsa. É a melhor escolha quando entrada multimodal e custo por tarefa concluída importam. A variante Pro é maior e mais forte para codificação exigente e trabalho de agentes de longo horizonte, mas é focada em entrada de texto e custa aproximadamente três vezes mais por token nas tarifas publicadas pela Xiaomi.
A decisão prática é simples: escolha o modelo padrão para agentes multimodais, análise de documentos e mídias, e automação em alto volume; escolha o Pro quando engenharia de software difícil ou execução autônoma sustentada forem o gargalo.
Principais conclusões
- O modelo padrão usa 310B parâmetros totais, ativando 15B por token.
- Aceita texto, imagens, vídeo e áudio, retornando texto.
- Sua API suporta contexto de 1M, até 128K de saída, chamadas de ferramentas, busca na web, streaming, saída estruturada e cache de contexto.
- Resultados informados pelo publicador incluem 65,8 no Terminal-Bench 2.0 e 56,1 no SWE-Bench Pro.
- O cartão do modelo MiMo-V2.5-Pro atual da Xiaomi lista 1,02T de parâmetros totais e 42B ativos. As pontuações do SWE-Bench Pro listadas pelo publicador são 56,1 para o MiMo-V2.5 e 57,2 para o Pro; são comparações datadas, informadas pelo publicador, não uma garantia para um fluxo de trabalho específico de codificação.
- Nas tarifas atuais da Xiaomi, os custos de entrada/saída do padrão são $0,14/$0,28 por milhão de tokens; o Pro custa $0,435/$0,87.
- Ambas as APIs no CometAPI têm preços 20% abaixo dos pares oficiais sem cache.
Informação verificada: 28 de setembro de 2026. Preços, benchmarks, limites, disponibilidade e formatos de requisição podem mudar. A Xiaomi anunciou que os nomes oficiais dos modelos de API mimo-v2.5 e mimo-v2.5-pro serão descontinuados às 10:00 no horário de Pequim em 21 de outubro de 2026, sem substituição automática. Planeje a migração e confirme a rota ativa antes da implantação.
Nota sobre o ciclo de vida da API: a plataforma oficial da Xiaomi planeja retirar ambos os IDs de modelo V2.5 em 21 de outubro de 2026. Este aviso diz respeito à plataforma de API da Xiaomi; verifique separadamente qualquer gateway de terceiros. Xiaomi model deprecation notice
O que é o modelo padrão
MiMo-V2.5 é o modelo base do Xiaomi MiMo orientado à eficiência para percepção multimodal e trabalho de agentes. Ele oferece entrada nativa de texto, imagem, vídeo e áudio em uma única arquitetura e produz saída em texto.
O registro de lançamentos do modelo da Xiaomi data o beta público da série MiMo-V2.5 em 23 de abril de 2026. Os pesos foram posteriormente lançados sob a licença MIT. O MiMo-V2.5 tem 310B parâmetros no total, mas ativa apenas cerca de 15B por token; ele usa um grande conjunto de especialistas sem executar todos de uma vez.
MiMo-V2.5-Pro atende a uma carga de trabalho diferente. É um modelo com um trilhão de parâmetros, com entrada de texto, projetado para as tarefas mais difíceis de codificação, terminal e agentes de longa duração. As duas variantes compartilham um contexto máximo de 1M, mas diferem fortemente em modalidade, computação ativa e preço.
Especificações e recursos do MiMo-V2.5
| Detalhes oficiais da arquitetura | Valor | Por que isso importa |
|---|---|---|
| Arquitetura | MoE esparso | Grande capacidade de especialistas com ativação seletiva |
| Parâmetros total / ativos | 310B / 15B | A computação ativa é muito abaixo da capacidade total |
| Camadas do transformer | 48: 1 densa + 47 MoE | A maioria das camadas usa especialistas roteados |
| Especialistas roteados | 256; 8 ativos por token | Especialização sem execução densa de 310B |
| Atenção | 39 camadas SWA + 9 globais | Equilibra eficiência local e fluxo de longa distância |
| Janela SWA | 128 tokens | Reduz a pressão de cache em contexto longo |
| Contexto / saída máxima | 1M / 128K tokens | Suporta documentos longos e trilhas estendidas |
| Entrada / saída | Texto, imagem, vídeo, áudio / texto | Percepção nativa em quatro tipos de entrada |
| Codificador de visão | ViT de 729M; 28 camadas | Compreensão de imagem e vídeo |
| Codificador de áudio | Transformer de 261M; 24 camadas | Compreensão nativa de áudio |
| Previsão de múltiplos tokens | 3 módulos; cerca de 329M parâmetros | Suporta eficiência de decodificação especulativa |
| Escala de treinamento | Cerca de 48T tokens | Pipeline amplo de treinamento de texto e multimodal |
| Capacidades da API | Ferramentas, web, streaming, saída estruturada, cache | Primitivas orientadas à produção para agentes |
| Licença | MIT | Uso comercial e modificação permitidos |
O envelope operacional inclui contexto de 1M e saída de 128K, além de limites publicados de 100 requisições por minuto e 10 milhões de tokens por minuto. Limites no nível do provedor podem diferir por conta e rota de integração.
Diagrama oficial de arquitetura do Xiaomi MiMo. Recurso oficial de arquitetura.
Como funciona a arquitetura do MiMo-V2.5
Especialistas esparsos: a capacidade total não é computação ativa
O fato central de eficiência é o design 310B total, 15B ativos. O roteador seleciona oito de 256 especialistas para cada token. Isso dá ao modelo acesso a um pool de parâmetros muito maior do que um modelo denso convencional de 15B sem executar todos os 310B parâmetros todas as vezes.
Isso não torna a hospedagem própria trivial. Os pesos completos ainda precisam ser armazenados e distribuídos, então capacidade de memória, largura de banda de interconexão, roteamento de especialistas e software de serving permanecem como restrições materiais.
Atenção híbrida para contexto longo
A espinha dorsal intercala atenção de janela deslizante e global em uma proporção SWA para global de 5:1. Trinta e nove camadas locais controlam o crescimento do cache, enquanto nove camadas globais preservam o fluxo de informação de longa distância. A Xiaomi relata quase uma redução de seis vezes no cache KV versus um design totalmente global.
Um máximo de 1M tokens é capacidade, não acurácia garantida. Qualidade de recuperação, latência, crescimento do estado de ferramentas e atenção sobre evidências distantes ainda exigem avaliação específica ao workload.
Codificadores nativos e recursos de agente
Um transformer de visão com 729M parâmetros lida com entradas de imagens e vídeos; um transformer de áudio com 261M parâmetros lida com áudio. Os projetores mapeiam ambos os fluxos para a espinha dorsal de linguagem, permitindo que um único agente combine uma captura de tela, um segmento de vídeo, uma trilha de áudio, instruções em texto e resultados de ferramentas.
Três módulos de Previsão de múltiplos tokens suportam decodificação especulativa e eficiência de aprendizado por reforço. O modelo foi treinado em cerca de 48T tokens, com o contexto sendo estendido progressivamente para 1M durante o pós-treinamento.
Os pesos abertos usam uma licença MIT. A implantação comercial é permitida, mas o custo de infraestrutura e dependências de terceiros ainda precisam de revisão separada.
Benchmarks do MiMo-V2.5: codificação, agentes e resultados multimodais
Nota sobre benchmark:
os números abaixo são informados pelo publicador. Eles são evidência direcional, não uma garantia para um repositório específico, formato de mídia, stack de ferramentas, meta de latência ou política de segurança.
Resultados de codificação e agentes

Gráfico oficial de benchmarks de codificação e agentes do Xiaomi MiMo.
| Benchmark oficial de codificação | Pontuação informada | Sinal para decisão |
|---|---|---|
| MiMo Coding Bench | 71,8 | Ampla capacidade de agentes de código |
| Claw-Eval Text | 62,3 | Conclusão geral de agentes de texto |
| Terminal-Bench 2.0 | 65,8 | Execução interativa em terminal |
| SWE-Bench Pro | 56,1 | Engenharia de software no mundo real |
| Claw-Eval Multi-Turn | 63,2 | Trabalho de agentes multi-etapas mais longos |
| ResearchClawBench | 16,91 | Fluxos de trabalho de pesquisa autônoma |
Resultado: o caso mais forte é o uso prático de ferramentas em vez de conclusão de código isolada. Um resultado de 65,8 no Terminal-Bench apoia agentes orientados a terminal, enquanto 56,1 no SWE-Bench Pro sugere capacidade útil em nível de repositório. A pontuação de pesquisa muito mais baixa é um lembrete para testar separadamente a coleta de evidências e o comportamento de citação.
Resultados multimodais

Gráfico oficial de benchmarks de imagem, vídeo e agentes multimodais do Xiaomi MiMo.
| Benchmark multimodal oficial | Pontuação informada | Capacidade testada |
|---|---|---|
| CharXiv RQ | 81,0 | Raciocínio sobre gráficos e documentos |
| MMMU-Pro | 77,9 | Raciocínio multimodal em nível de especialista |
| HR-Bench 4K | 88,5 | Compreensão de imagens de alta resolução |
| OmniDocBench | 87,2 | Compreensão de documentos |
| Claw-Eval Multimodal | 23,8 | Conclusão de agentes multimodais |
| Video-MME | 87,7 | Compreensão de vídeo |
| DailyOmni | 83,5 | Raciocínio audiovisual cotidiano |
| VideoHolmes | 64,0 | Raciocínio temporal em vídeo |
Resultado: compreensão de documentos, imagens de alta resolução e vídeos são os pontos fortes mais claros. A pontuação de 23,8 em agente multimodal é muito inferior às pontuações de percepção, portanto um sistema que precise tanto entender mídias quanto operar ferramentas de forma confiável deve ser avaliado de ponta a ponta.
MiMo-V2.5 vs MiMo-V2.5-Pro: comparação multidimensional
| Comparação oficial de arquitetura | MiMo-V2.5 | MiMo-V2.5-Pro Especificações oficiais do Pro Benchmarks oficiais do Pro | Implicação prática |
|---|---|---|---|
| Parâmetros totais | 310B | 1,02T | O Pro tem mais de 3× a capacidade total |
| Parâmetros ativados | 15B | 42B | O Pro usa cerca de 2,8× mais parâmetros ativos |
| Camadas / especialistas roteados | 48 / 256 | 70 / 384 | O Pro é um alvo de serving maior |
| Teto de contexto no cartão do modelo | 1M | 1M | Ambos listam até 1M tokens; teste recuperação e latência no tamanho do seu workload |
| Saída máxima oficial da API | 128K | 128K | As páginas atuais de API da Xiaomi listam 128K; limites específicos do provedor podem diferir |
| Entrada nativa | Texto, imagem, vídeo, áudio | Texto | O MiMo-V2.5 é a escolha multimodal documentada; verifique o endpoint exato do Pro antes de enviar mídia |
| SWE-Bench Pro | 56,1 | 57,2 | O Pro lidera por 1,1 pontos |
| Terminal-Bench 2.0 | 65,8 | 68,4 | O Pro lidera por 2,6 pontos |
| Encaixe principal | Agentes multimodais eficientes | Codificação complexa e agentes de longo horizonte | Escolha pelo workload testado; as margens no nível do modelo não provam uma liderança geral |
Resultado da comparação: a vantagem do Pro nos dois testes compartilhados de agentes de codificação é modesta, enquanto a variante padrão adiciona entrada nativa de imagem, vídeo e áudio e usa bem menos parâmetros ativos. O Pro se justifica quando pequenos ganhos na conclusão de tarefas difíceis valem mais do que entrada multimodal e menor preço por unidade.
Quanto custam MiMo-V2.5 e MiMo-V2.5-Pro?
| Base de preço: 27 de maio de 2026 | API oficial do padrão | API oficial do Pro | API do MiMo-V2.5 no CometAPI | API do MiMo-V2.5-Pro no CometAPI |
|---|---|---|---|---|
| Entrada, falha de cache / MTok | $0,14 | $0,435 | $0,112 | $0,348 |
| Saída / MTok | $0,28 | $0,87 | $0,224 | $0,696 |
| Entrada, acerto de cache / MTok | $0,0028 | $0,0036 | Verificar faturamento ao vivo | Verificar faturamento ao vivo |
| Desconto vs tarifa oficial sem cache | Baseline | Baseline | 20% | 20% |
Nas tarifas oficiais, o Pro custa cerca de 3,1× mais do que o padrão tanto para entrada quanto para saída sem cache. Os preços do provedor mostrados acima reduzem cada par sem cache em 20%, mas a diferença relativa entre as variantes permanece essencialmente inalterada.
Preço por token não é custo total. Repetições de ferramentas, tamanho de contexto, comprimento da saída, latência, recuperação de falhas e revisão humana determinam o custo por tarefa concluída. Execute uma amostra representativa de workload antes de selecionar um modelo padrão para produção.
Para que o MiMo-V2.5 é melhor?
- Agentes multimodais: combine capturas de tela, documentos, vídeo, áudio, instruções e ferramentas em um único fluxo de trabalho.
- Análise de documentos longos: processe repositórios, contratos, arquivos de pesquisa, logs e históricos de suporte.
- Compreensão de mídia: resuma vídeos, extraia eventos, interprete gráficos e responda a perguntas audiovisuais.
- Agentes de codificação e terminal: inspecione arquivos, execute comandos, modifique código e itere sobre resultados de testes.
- Automação em alto volume: use ativação esparsa e preços de token mais baixos para tarefas de produção repetidas.
Limitações e riscos
- Apenas 15B parâmetros são ativos por token, mas a hospedagem própria ainda exige o sistema completo com pesos de 310B.
- A saída multimodal é texto; geração de imagem, fala e vídeo exige outros modelos.
- Um teto de contexto de 1M não garante acurácia uniforme em toda a janela.
- Benchmarks do publicador podem não se transferir para ferramentas, repositórios, prompts ou restrições de segurança personalizados.
- A exposição de modalidades pelo provedor pode diferir da capacidade completa do modelo de pesos abertos subjacente.
Gate de produção:
valide acurácia, conclusão de chamadas de ferramenta, latência, consumo de tokens, tratamento de modalidades e comportamento de fallback em tarefas representativas antes de direcionar tráfego.
Exemplo de API
O exemplo Python a seguir usa um endpoint do CometAPI compatível com OpenAI e o ID do modelo padrão. Confirme o endpoint atual e o esquema de requisição suportado antes da implantação.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Guia de decisão
| Sinal de workload | Comece com | Troque quando |
|---|---|---|
| Imagens, vídeo ou áudio são entradas centrais | Padrão | Não troque, a menos que pré-processamento multimodal seja aceitável |
| Grande volume de documentos ou mídia mista | Padrão | Pro somente se falhas de raciocínio dominarem o custo |
| Engenharia de repositório difícil | Teste ambos | Escolha o Pro se o ganho de conclusão compensar 3,1× o custo unitário |
| Trajetórias autônomas longas em terminal | Pro | Volte ao padrão se os ganhos não forem mensuráveis |
| Automação rotineira em alto volume | Padrão | Escale apenas tarefas falhas ou de alto valor |
Roteamento recomendado:
use o padrão como default para trabalho multimodal e de alto volume, e encaminhe apenas tarefas difíceis de texto primeiro ou de longo horizonte para o Pro. Isso preserva a capacidade enquanto controla o custo total.
Conclusão
O modelo padrão não é apenas um Pro menor. É um ponto de otimização distinto: entrada multimodal nativa, contexto de 1M, benchmarks fortes orientados a ferramentas e 15B parâmetros ativos a um preço de token muito menor.
O Pro é a opção especialista para engenharia de software difícil e execução autônoma sustentada. Sua capacidade extra produz ganhos mensuráveis, mas não universais, então o padrão de implantação mais forte é o roteamento baseado no workload, em vez de selecionar uma única variante para toda requisição.
FAQ
O modelo padrão é open source?
Seus pesos são lançados sob a licença MIT, permitindo uso comercial, modificação, fine-tuning e redistribuição, sujeitos aos termos da licença.
Quantos parâmetros ele usa?
A MoE esparsa contém 310B parâmetros totais e ativa 15B para cada token. Parâmetros ativos descrevem a computação por token, não o tamanho de armazenamento do modelo completo.
Ele suporta imagens, vídeo e áudio?
Sim. A variante padrão aceita entrada de texto, imagens, vídeo e áudio e retorna texto. A especificação oficial da variante Pro lista entrada de texto.
Qual é a janela de contexto máxima?
Ambos os cartões de modelo especificam uma janela de contexto de até 1M tokens. As páginas atuais da API da Xiaomi listam uma saída máxima de 128K para MiMo-V2.5 e MiMo-V2.5-Pro. Limites utilizáveis reais podem variar por endpoint, provedor, conta e formato de requisição; verifique a rota implantada antes de depender desses tetos.
A página oficial atual da API do Pro confirma separadamente o contexto de 1M e a saída máxima de 128K: MiMo-V2.5-Pro API specifications
Qual variante é melhor para agentes de codificação?
O Pro relata resultados mais altos nos testes compartilhados de codificação e terminal, mas a margem é modesta. Teste ambos no repositório-alvo e escolha com base em conclusão de tarefas, latência e custo total.
Qual variante é melhor para agentes multimodais?
A variante padrão é a escolha natural porque aceita nativamente entrada de imagem, vídeo e áudio. O Pro é focado em entrada de texto.
Como uma equipe de produção deve escolher?
Comece com o padrão, meça falhas e encaminhe apenas as tarefas difíceis de texto primeiro que se beneficiem do Pro. Compare o custo por tarefa concluída, não apenas o preço por token.
