GPT-6.1 Sol are now live on CometAPI →
ai-model/Pesquisa CometAPI

O que é o MiMo-V2.5? Especificações, Benchmarks, Recursos, Preços e Acesso à API

Explore as especificações do Xiaomi MiMo-V2.5, a arquitetura, os benchmarks oficiais, os preços, a comparação com o MiMo-V2.5-Pro, os casos de uso, as limitações e o acesso ao CometAPI.

CometAPI
Deon GoodwinEquipe de pesquisa de modelos e API de IA
Atualizado Oct 5, 2026 14 min de leitura
O que é o MiMo-V2.5? Especificações, Benchmarks, Recursos, Preços e Acesso à API
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

O modelo padrão V2.5 da Xiaomi combina compreensão nativa de texto, imagem, vídeo e áudio com uma janela de contexto de 1 milhão de tokens, uso de ferramentas e eficiência de uma Mixture-of-Experts esparsa. É a melhor escolha quando entrada multimodal e custo por tarefa concluída importam. A variante Pro é maior e mais forte para codificação exigente e trabalho de agentes de longo horizonte, mas é focada em entrada de texto e custa aproximadamente três vezes mais por token nas tarifas publicadas pela Xiaomi.

A decisão prática é simples: escolha o modelo padrão para agentes multimodais, análise de documentos e mídias, e automação em alto volume; escolha o Pro quando engenharia de software difícil ou execução autônoma sustentada forem o gargalo.

Principais conclusões

  • O modelo padrão usa 310B parâmetros totais, ativando 15B por token.
  • Aceita texto, imagens, vídeo e áudio, retornando texto.
  • Sua API suporta contexto de 1M, até 128K de saída, chamadas de ferramentas, busca na web, streaming, saída estruturada e cache de contexto.
  • Resultados informados pelo publicador incluem 65,8 no Terminal-Bench 2.0 e 56,1 no SWE-Bench Pro.
  • O cartão do modelo MiMo-V2.5-Pro atual da Xiaomi lista 1,02T de parâmetros totais e 42B ativos. As pontuações do SWE-Bench Pro listadas pelo publicador são 56,1 para o MiMo-V2.5 e 57,2 para o Pro; são comparações datadas, informadas pelo publicador, não uma garantia para um fluxo de trabalho específico de codificação.
  • Nas tarifas atuais da Xiaomi, os custos de entrada/saída do padrão são $0,14/$0,28 por milhão de tokens; o Pro custa $0,435/$0,87.
  • Ambas as APIs no CometAPI têm preços 20% abaixo dos pares oficiais sem cache.
    Informação verificada: 28 de setembro de 2026. Preços, benchmarks, limites, disponibilidade e formatos de requisição podem mudar. A Xiaomi anunciou que os nomes oficiais dos modelos de API mimo-v2.5 e mimo-v2.5-pro serão descontinuados às 10:00 no horário de Pequim em 21 de outubro de 2026, sem substituição automática. Planeje a migração e confirme a rota ativa antes da implantação.

Nota sobre o ciclo de vida da API: a plataforma oficial da Xiaomi planeja retirar ambos os IDs de modelo V2.5 em 21 de outubro de 2026. Este aviso diz respeito à plataforma de API da Xiaomi; verifique separadamente qualquer gateway de terceiros. Xiaomi model deprecation notice

O que é o modelo padrão

MiMo-V2.5 é o modelo base do Xiaomi MiMo orientado à eficiência para percepção multimodal e trabalho de agentes. Ele oferece entrada nativa de texto, imagem, vídeo e áudio em uma única arquitetura e produz saída em texto.

O registro de lançamentos do modelo da Xiaomi data o beta público da série MiMo-V2.5 em 23 de abril de 2026. Os pesos foram posteriormente lançados sob a licença MIT. O MiMo-V2.5 tem 310B parâmetros no total, mas ativa apenas cerca de 15B por token; ele usa um grande conjunto de especialistas sem executar todos de uma vez.

MiMo-V2.5-Pro atende a uma carga de trabalho diferente. É um modelo com um trilhão de parâmetros, com entrada de texto, projetado para as tarefas mais difíceis de codificação, terminal e agentes de longa duração. As duas variantes compartilham um contexto máximo de 1M, mas diferem fortemente em modalidade, computação ativa e preço.

Especificações e recursos do MiMo-V2.5

Detalhes oficiais da arquiteturaValorPor que isso importa
ArquiteturaMoE esparsoGrande capacidade de especialistas com ativação seletiva
Parâmetros total / ativos310B / 15BA computação ativa é muito abaixo da capacidade total
Camadas do transformer48: 1 densa + 47 MoEA maioria das camadas usa especialistas roteados
Especialistas roteados256; 8 ativos por tokenEspecialização sem execução densa de 310B
Atenção39 camadas SWA + 9 globaisEquilibra eficiência local e fluxo de longa distância
Janela SWA128 tokensReduz a pressão de cache em contexto longo
Contexto / saída máxima1M / 128K tokensSuporta documentos longos e trilhas estendidas
Entrada / saídaTexto, imagem, vídeo, áudio / textoPercepção nativa em quatro tipos de entrada
Codificador de visãoViT de 729M; 28 camadasCompreensão de imagem e vídeo
Codificador de áudioTransformer de 261M; 24 camadasCompreensão nativa de áudio
Previsão de múltiplos tokens3 módulos; cerca de 329M parâmetrosSuporta eficiência de decodificação especulativa
Escala de treinamentoCerca de 48T tokensPipeline amplo de treinamento de texto e multimodal
Capacidades da APIFerramentas, web, streaming, saída estruturada, cachePrimitivas orientadas à produção para agentes
LicençaMITUso comercial e modificação permitidos

O envelope operacional inclui contexto de 1M e saída de 128K, além de limites publicados de 100 requisições por minuto e 10 milhões de tokens por minuto. Limites no nível do provedor podem diferir por conta e rota de integração.

O que é o MiMo-V2.5? Especificações, Benchmarks, Recursos, Preços e Acesso à API

Diagrama oficial de arquitetura do Xiaomi MiMo. Recurso oficial de arquitetura.

Como funciona a arquitetura do MiMo-V2.5

Especialistas esparsos: a capacidade total não é computação ativa

O fato central de eficiência é o design 310B total, 15B ativos. O roteador seleciona oito de 256 especialistas para cada token. Isso dá ao modelo acesso a um pool de parâmetros muito maior do que um modelo denso convencional de 15B sem executar todos os 310B parâmetros todas as vezes.

Isso não torna a hospedagem própria trivial. Os pesos completos ainda precisam ser armazenados e distribuídos, então capacidade de memória, largura de banda de interconexão, roteamento de especialistas e software de serving permanecem como restrições materiais.

Atenção híbrida para contexto longo

A espinha dorsal intercala atenção de janela deslizante e global em uma proporção SWA para global de 5:1. Trinta e nove camadas locais controlam o crescimento do cache, enquanto nove camadas globais preservam o fluxo de informação de longa distância. A Xiaomi relata quase uma redução de seis vezes no cache KV versus um design totalmente global.

Um máximo de 1M tokens é capacidade, não acurácia garantida. Qualidade de recuperação, latência, crescimento do estado de ferramentas e atenção sobre evidências distantes ainda exigem avaliação específica ao workload.

Codificadores nativos e recursos de agente

Um transformer de visão com 729M parâmetros lida com entradas de imagens e vídeos; um transformer de áudio com 261M parâmetros lida com áudio. Os projetores mapeiam ambos os fluxos para a espinha dorsal de linguagem, permitindo que um único agente combine uma captura de tela, um segmento de vídeo, uma trilha de áudio, instruções em texto e resultados de ferramentas.

Três módulos de Previsão de múltiplos tokens suportam decodificação especulativa e eficiência de aprendizado por reforço. O modelo foi treinado em cerca de 48T tokens, com o contexto sendo estendido progressivamente para 1M durante o pós-treinamento.

Os pesos abertos usam uma licença MIT. A implantação comercial é permitida, mas o custo de infraestrutura e dependências de terceiros ainda precisam de revisão separada.

Benchmarks do MiMo-V2.5: codificação, agentes e resultados multimodais

Nota sobre benchmark:

os números abaixo são informados pelo publicador. Eles são evidência direcional, não uma garantia para um repositório específico, formato de mídia, stack de ferramentas, meta de latência ou política de segurança.

Resultados de codificação e agentes

O que é o MiMo-V2.5? Especificações, Benchmarks, Recursos, Preços e Acesso à API

Gráfico oficial de benchmarks de codificação e agentes do Xiaomi MiMo.

Benchmark oficial de codificaçãoPontuação informadaSinal para decisão
MiMo Coding Bench71,8Ampla capacidade de agentes de código
Claw-Eval Text62,3Conclusão geral de agentes de texto
Terminal-Bench 2.065,8Execução interativa em terminal
SWE-Bench Pro56,1Engenharia de software no mundo real
Claw-Eval Multi-Turn63,2Trabalho de agentes multi-etapas mais longos
ResearchClawBench16,91Fluxos de trabalho de pesquisa autônoma

Resultado: o caso mais forte é o uso prático de ferramentas em vez de conclusão de código isolada. Um resultado de 65,8 no Terminal-Bench apoia agentes orientados a terminal, enquanto 56,1 no SWE-Bench Pro sugere capacidade útil em nível de repositório. A pontuação de pesquisa muito mais baixa é um lembrete para testar separadamente a coleta de evidências e o comportamento de citação.

Resultados multimodais

O que é o MiMo-V2.5? Especificações, Benchmarks, Recursos, Preços e Acesso à API

Gráfico oficial de benchmarks de imagem, vídeo e agentes multimodais do Xiaomi MiMo.

Benchmark multimodal oficialPontuação informadaCapacidade testada
CharXiv RQ81,0Raciocínio sobre gráficos e documentos
MMMU-Pro77,9Raciocínio multimodal em nível de especialista
HR-Bench 4K88,5Compreensão de imagens de alta resolução
OmniDocBench87,2Compreensão de documentos
Claw-Eval Multimodal23,8Conclusão de agentes multimodais
Video-MME87,7Compreensão de vídeo
DailyOmni83,5Raciocínio audiovisual cotidiano
VideoHolmes64,0Raciocínio temporal em vídeo

Resultado: compreensão de documentos, imagens de alta resolução e vídeos são os pontos fortes mais claros. A pontuação de 23,8 em agente multimodal é muito inferior às pontuações de percepção, portanto um sistema que precise tanto entender mídias quanto operar ferramentas de forma confiável deve ser avaliado de ponta a ponta.

MiMo-V2.5 vs MiMo-V2.5-Pro: comparação multidimensional

Comparação oficial de arquiteturaMiMo-V2.5MiMo-V2.5-Pro
Especificações oficiais do Pro
Benchmarks oficiais do Pro
Implicação prática
Parâmetros totais310B1,02TO Pro tem mais de 3× a capacidade total
Parâmetros ativados15B42BO Pro usa cerca de 2,8× mais parâmetros ativos
Camadas / especialistas roteados48 / 25670 / 384O Pro é um alvo de serving maior
Teto de contexto no cartão do modelo1M1MAmbos listam até 1M tokens; teste recuperação e latência no tamanho do seu workload
Saída máxima oficial da API128K128KAs páginas atuais de API da Xiaomi listam 128K; limites específicos do provedor podem diferir
Entrada nativaTexto, imagem, vídeo, áudioTextoO MiMo-V2.5 é a escolha multimodal documentada; verifique o endpoint exato do Pro antes de enviar mídia
SWE-Bench Pro56,157,2O Pro lidera por 1,1 pontos
Terminal-Bench 2.065,868,4O Pro lidera por 2,6 pontos
Encaixe principalAgentes multimodais eficientesCodificação complexa e agentes de longo horizonteEscolha pelo workload testado; as margens no nível do modelo não provam uma liderança geral

Resultado da comparação: a vantagem do Pro nos dois testes compartilhados de agentes de codificação é modesta, enquanto a variante padrão adiciona entrada nativa de imagem, vídeo e áudio e usa bem menos parâmetros ativos. O Pro se justifica quando pequenos ganhos na conclusão de tarefas difíceis valem mais do que entrada multimodal e menor preço por unidade.

Quanto custam MiMo-V2.5 e MiMo-V2.5-Pro?

Base de preço: 27 de maio de 2026API oficial do padrãoAPI oficial do ProAPI do MiMo-V2.5 no CometAPIAPI do MiMo-V2.5-Pro no CometAPI
Entrada, falha de cache / MTok$0,14$0,435$0,112$0,348
Saída / MTok$0,28$0,87$0,224$0,696
Entrada, acerto de cache / MTok$0,0028$0,0036Verificar faturamento ao vivoVerificar faturamento ao vivo
Desconto vs tarifa oficial sem cacheBaselineBaseline20%20%

Nas tarifas oficiais, o Pro custa cerca de 3,1× mais do que o padrão tanto para entrada quanto para saída sem cache. Os preços do provedor mostrados acima reduzem cada par sem cache em 20%, mas a diferença relativa entre as variantes permanece essencialmente inalterada.

Preço por token não é custo total. Repetições de ferramentas, tamanho de contexto, comprimento da saída, latência, recuperação de falhas e revisão humana determinam o custo por tarefa concluída. Execute uma amostra representativa de workload antes de selecionar um modelo padrão para produção.

Para que o MiMo-V2.5 é melhor?

  • Agentes multimodais: combine capturas de tela, documentos, vídeo, áudio, instruções e ferramentas em um único fluxo de trabalho.
  • Análise de documentos longos: processe repositórios, contratos, arquivos de pesquisa, logs e históricos de suporte.
  • Compreensão de mídia: resuma vídeos, extraia eventos, interprete gráficos e responda a perguntas audiovisuais.
  • Agentes de codificação e terminal: inspecione arquivos, execute comandos, modifique código e itere sobre resultados de testes.
  • Automação em alto volume: use ativação esparsa e preços de token mais baixos para tarefas de produção repetidas.

Limitações e riscos

  • Apenas 15B parâmetros são ativos por token, mas a hospedagem própria ainda exige o sistema completo com pesos de 310B.
  • A saída multimodal é texto; geração de imagem, fala e vídeo exige outros modelos.
  • Um teto de contexto de 1M não garante acurácia uniforme em toda a janela.
  • Benchmarks do publicador podem não se transferir para ferramentas, repositórios, prompts ou restrições de segurança personalizados.
  • A exposição de modalidades pelo provedor pode diferir da capacidade completa do modelo de pesos abertos subjacente.

Gate de produção:

valide acurácia, conclusão de chamadas de ferramenta, latência, consumo de tokens, tratamento de modalidades e comportamento de fallback em tarefas representativas antes de direcionar tráfego.

Exemplo de API

O exemplo Python a seguir usa um endpoint do CometAPI compatível com OpenAI e o ID do modelo padrão. Confirme o endpoint atual e o esquema de requisição suportado antes da implantação.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Guia de decisão

Sinal de workloadComece comTroque quando
Imagens, vídeo ou áudio são entradas centraisPadrãoNão troque, a menos que pré-processamento multimodal seja aceitável
Grande volume de documentos ou mídia mistaPadrãoPro somente se falhas de raciocínio dominarem o custo
Engenharia de repositório difícilTeste ambosEscolha o Pro se o ganho de conclusão compensar 3,1× o custo unitário
Trajetórias autônomas longas em terminalProVolte ao padrão se os ganhos não forem mensuráveis
Automação rotineira em alto volumePadrãoEscale apenas tarefas falhas ou de alto valor

Roteamento recomendado:

use o padrão como default para trabalho multimodal e de alto volume, e encaminhe apenas tarefas difíceis de texto primeiro ou de longo horizonte para o Pro. Isso preserva a capacidade enquanto controla o custo total.

Conclusão

O modelo padrão não é apenas um Pro menor. É um ponto de otimização distinto: entrada multimodal nativa, contexto de 1M, benchmarks fortes orientados a ferramentas e 15B parâmetros ativos a um preço de token muito menor.

O Pro é a opção especialista para engenharia de software difícil e execução autônoma sustentada. Sua capacidade extra produz ganhos mensuráveis, mas não universais, então o padrão de implantação mais forte é o roteamento baseado no workload, em vez de selecionar uma única variante para toda requisição.

FAQ

O modelo padrão é open source?

Seus pesos são lançados sob a licença MIT, permitindo uso comercial, modificação, fine-tuning e redistribuição, sujeitos aos termos da licença.

Quantos parâmetros ele usa?

A MoE esparsa contém 310B parâmetros totais e ativa 15B para cada token. Parâmetros ativos descrevem a computação por token, não o tamanho de armazenamento do modelo completo.

Ele suporta imagens, vídeo e áudio?

Sim. A variante padrão aceita entrada de texto, imagens, vídeo e áudio e retorna texto. A especificação oficial da variante Pro lista entrada de texto.

Qual é a janela de contexto máxima?

Ambos os cartões de modelo especificam uma janela de contexto de até 1M tokens. As páginas atuais da API da Xiaomi listam uma saída máxima de 128K para MiMo-V2.5 e MiMo-V2.5-Pro. Limites utilizáveis reais podem variar por endpoint, provedor, conta e formato de requisição; verifique a rota implantada antes de depender desses tetos.

A página oficial atual da API do Pro confirma separadamente o contexto de 1M e a saída máxima de 128K: MiMo-V2.5-Pro API specifications

Qual variante é melhor para agentes de codificação?

O Pro relata resultados mais altos nos testes compartilhados de codificação e terminal, mas a margem é modesta. Teste ambos no repositório-alvo e escolha com base em conclusão de tarefas, latência e custo total.

Qual variante é melhor para agentes multimodais?

A variante padrão é a escolha natural porque aceita nativamente entrada de imagem, vídeo e áudio. O Pro é focado em entrada de texto.

Como uma equipe de produção deve escolher?

Comece com o padrão, meça falhas e encaminhe apenas as tarefas difíceis de texto primeiro que se beneficiem do Pro. Compare o custo por tarefa concluída, não apenas o preço por token.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Oct 5, 2026
Última atualização Oct 5, 2026
0 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Leia Mais