Especificações Técnicas do MiMo-V2.5
| Especificação | MiMo-V2.5 |
|---|---|
| ID do modelo | mimo-v2.5 |
| Fornecedor | Xiaomi MiMo |
| Tipo de modelo | Modelo fundamental onimodal nativo |
| Arquitetura | Mixture-of-Experts esparso |
| Parâmetros totais | 310B |
| Parâmetros ativados | 15B |
| Janela de contexto | 1M tokens |
| Saída máxima | 128K tokens |
| Modalidades de entrada | Texto, Imagem, Vídeo, Áudio |
| Saída | Texto |
| Codificador de visão | ViT com 729M de parâmetros |
| Codificador de áudio | Transformer de Áudio com 261M de parâmetros |
| Chamada de ferramentas, Pesquisa na Web, Saída estruturada, Streaming, Cache de contexto | Sim |
| Licença | MIT |
A arquitetura 310B/15B é especialmente importante. MiMo-V2.5 não é um modelo de 15B no sentido convencional; 15B é o número de parâmetros ativados para cada token, enquanto o MoE completo contém 310B parâmetros. O modelo usa 256 especialistas roteados e ativa oito especialistas por token.
O que é o MiMo-V2.5?
MiMo-V2.5 é o modelo multimodal de próxima geração da Xiaomi, criado especificamente em torno da percepção onimodal e de aplicações baseadas em agentes.
Ao contrário de uma LLM convencional somente de texto, MiMo-V2.5 compreende nativamente imagens, vídeos, áudio e texto. A Xiaomi o posiciona para cenários de agentes com contexto longo e multimodais, nos quais o modelo precisa perceber informações, raciocinar sobre elas e, em seguida, usar ferramentas ou executar ações.
Há também uma consideração importante para a versão atual dirigida a desenvolvedores: a Xiaomi descontinuou os modelos MiMo-V2 mais antigos em 30 de junho de 2026, recomendando a migração para a série V2.5.
Isso torna mimo-v2.5 o ID de modelo relevante para novas integrações, em vez dos antigos mimo-v2-pro, mimo-v2-omni ou mimo-v2-flash.
Quais são os principais recursos do MiMo-V2.5?
Compreensão Onimodal Nativa
A característica definidora do MiMo-V2.5 é que a multimodalidade é integrada diretamente ao modelo.
Ele aceita:
- Texto
- Imagens
- Vídeo
- Áudio
Isso permite que desenvolvedores criem aplicações que raciocinam entre múltiplos tipos de informação em vez de processar cada modalidade de forma independente e repassar os resultados a uma LLM de texto. A Xiaomi descreve isso como percepção onimodal nativa.
Um exemplo prático é um agente de análise de vídeo que recebe um vídeo longo junto com uma trilha de áudio e uma pergunta textual, então identifica eventos, explica o que aconteceu e produz uma resposta estruturada.
Janela de Contexto de 1M Tokens
MiMo-V2.5 suporta 1 milhão de tokens de contexto e até 128K tokens de saída.
Isso torna o modelo particularmente interessante para:
- Análise de documentos grandes
- Compreensão de vídeos longos
- Codificação em nível de repositório
- Sessões de pesquisa longas
- Agentes de múltiplas etapas
- Conversas estendidas
- Grandes bases de conhecimento corporativas
Os 1M de contexto não são meramente um número de marketing. A Xiaomi identifica especificamente o rastreamento de vídeos longos, a análise de documentos extensos e o raciocínio temporal prolongado como cargas de trabalho-alvo.
Uso de Ferramentas por Agentes
MiMo-V2.5 oferece suporte a chamadas de função, pesquisa na Web, saída estruturada e streaming.
Isso o torna substancialmente mais útil para aplicações de agentes do que um modelo limitado à geração de texto.
Um fluxo de trabalho típico pode ser:
Perceber → Raciocinar → Pesquisar → Chamar ferramenta → Analisar resultado → Continuar
Isso é particularmente útil para agentes de pesquisa, assistentes de programação, agentes de suporte ao cliente e automação multimodal.
Eficiência de MoE Esparso
MiMo-V2.5 usa uma arquitetura MoE esparsa de 310B parâmetros, com apenas 15B parâmetros ativados por token.
Seu backbone contém 48 camadas, incluindo 39 camadas de atenção de janela deslizante e nove camadas de atenção completa. O design híbrido visa tornar o contexto muito longo mais administrável computacionalmente.
A distinção importante para desenvolvedores é que a contagem de parâmetros ativados não deve ser interpretada como os requisitos totais de memória. Hospedar localmente um modelo de 310B parâmetros continua sendo um empreendimento de infraestrutura substancial.
Atenção Híbrida de Janela Deslizante
MiMo-V2.5 combina atenção de janela deslizante com atenção global.
Sua arquitetura usa uma janela SWA de 128 tokens, com 39 camadas de SWA e nove camadas de atenção completa.
Essa escolha arquitetural é particularmente relevante para a capacidade de contexto de 1M tokens do modelo porque manter atenção completa em todas as camadas tornaria a inferência de contexto longo significativamente mais cara.
Previsão de Múltiplos Tokens
MiMo-V2.5 inclui três camadas MTP com aproximadamente 329M parâmetros. O design MTP visa melhorar a eficiência de inferência por meio de decodificação especulativa e suportar um treinamento de aprendizado por reforço mais eficiente.
Como o MiMo-V2.5 se sai em benchmarks?
MiMo-V2.5 publicou resultados de benchmark que abrangem programação, agentes de terminal, agentes de pesquisa e tarefas de agentes multimodais. O model card atual no Hugging Face relata os seguintes resultados:
| Benchmark | MiMo-V2.5 | Foco da avaliação |
|---|---|---|
| SWE-Bench Pro | 56.1 | Engenharia de software |
| Terminal-Bench 2.0 | 65.8 | Tarefas de terminal/agente |
| Claw-Eval General | 62.1 Pass³% | Capacidade geral de agente |
| Claw-Eval Multimodal | 23.8 Pass³% | Capacidade de agente multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass³% | Agentes multiturno |
| ResearchClawBench | 16.91 | Tarefas de agente de pesquisa |
Esses números precisam ser interpretados com cuidado.
O resultado de 56.1 no SWE-Bench Pro indica uma capacidade significativa de engenharia de software, enquanto o resultado de 65.8 no Terminal-Bench 2.0 é particularmente relevante para agentes que interagem com terminais e ambientes de desenvolvimento.
Ao mesmo tempo, a diferença entre a pontuação geral do Claw-Eval (62.1) e a pontuação multimodal (23.8) é um alerta útil: forte desempenho geral de agente não significa automaticamente desempenho igualmente forte em toda tarefa de agente multimodal.
Para avaliação em produção, os desenvolvedores devem, portanto, testar sua própria carga de trabalho em vez de depender de um único número de ranking.
Como o MiMo-V2.5 se compara ao MiMo-V2.5-Pro?
MiMo-V2.5 e MiMo-V2.5-Pro pertencem à mesma geração V2.5, mas têm alvos de otimização diferentes.
| Especificação | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Parâmetros totais | 310B | 1.02T |
| Parâmetros ativados | 15B | 42B |
| Contexto | 1M | 1M |
| Entrada multimodal | Texto/Imagem/Vídeo/Áudio | Focado em agentes |
| Posicionamento principal | Agentes onimodais | Agentes complexos e programação |
| Especialistas roteados | 256 | 384 |
| Especialistas por token | 8 | 8 |
| Camadas da LLM | 48 | 70 |
| Camadas MTP | 3 | 3 |
A distinção é direta:
Escolha MiMo-V2.5 para compreensão multimodal nativa e agentes gerais eficientes. Escolha MiMo-V2.5-Pro para as cargas de trabalho mais difíceis de raciocínio, programação e agentes de longo horizonte.
O próprio guia de seleção de modelos da Xiaomi recomenda mimo-v2.5 especificamente para compreensão de conteúdo de imagem, áudio e vídeo, enquanto recomenda mimo-v2.5-pro para raciocínio complexo e processamento de documentos longos.
Casos de uso do MiMo-V2.5
Agentes de IA Multimodais
MiMo-V2.5 pode servir como o modelo central para agentes que precisam inspecionar documentos, imagens, vídeos e áudio antes de decidir que ação tomar.
Análise de Documentos com Contexto Longo
O contexto de 1M tokens o torna adequado para analisar:
- Grandes coleções de documentos jurídicos
- Documentação técnica
- Arquivos de pesquisa
- Grandes bases de código
- Bases de conhecimento corporativas
Agentes de Programação
Os benchmarks de agentes do modelo e as capacidades de uso de ferramentas o tornam adequado para assistentes de programação que precisam inspecionar repositórios, raciocinar sobre bugs, executar ferramentas e iterar soluções.
Compreensão de Vídeo
Em vez de tratar a geração de vídeo como seu propósito principal, MiMo-V2.5 usa vídeo como uma modalidade de entrada para compreensão.
Aplicações potenciais incluem:
- Resumo de vídeo
- Perguntas e respostas sobre vídeos longos
- Busca em vídeo
- Detecção de eventos
- Análise de vídeos educacionais
- Análise de filmagens de segurança
Assistentes Audiovisuais
Como o modelo aceita tanto informações de áudio quanto visuais, os desenvolvedores podem criar assistentes capazes de interpretar instruções faladas junto com o contexto visual.
Agentes Autônomos de Longa Duração
A combinação de contexto longo e treinamento orientado a agentes torna MiMo-V2.5 adequado para fluxos de trabalho em que o modelo deve manter estado ao longo de muitos passos intermediários, em vez de concluir uma tarefa em uma única resposta.
Limitações do MiMo-V2.5
As especificações do MiMo-V2.5 são impressionantes, mas várias limitações práticas merecem atenção.
Primeiro, 1M de contexto não significa que toda aplicação alcançará desempenho ideal na janela máxima. A inferência com contexto longo ainda envolve considerações significativas de memória, largura de banda e latência.
Segundo, o modelo é um sistema MoE muito grande. Embora apenas 15B parâmetros sejam ativados por token, o modelo completo contém aproximadamente 310B parâmetros, tornando a hospedagem própria consideravelmente mais exigente do que executar um pequeno modelo denso.
Terceiro, o desempenho em benchmarks multimodais pode variar significativamente por tarefa. Os resultados do Claw-Eval mostram uma pontuação multimodal muito menor do que a pontuação de agente geral, reforçando a necessidade de testes específicos por aplicação.
Por fim, o ecossistema do modelo ainda é mais novo do que os ecossistemas maduros em torno de GPT, Claude e Gemini. Portanto, os desenvolvedores devem avaliar ferramentas, compatibilidade com provedores, comportamento de saída estruturada e confiabilidade de chamadas de ferramentas antes de usá-lo em sistemas de produção críticos para o negócio.
Como usar a API do MiMo-V2.5 no CometAPI
MiMo-V2.5 é particularmente adequado para uma plataforma de agregação de API porque segue padrões de API compatíveis com ecossistemas de LLM estabelecidos. A própria Xiaomi fornece acesso à API compatível com OpenAI e Anthropic.
Com o CometAPI, a integração pode seguir o mesmo fluxo de trabalho básico usado para outros modelos suportados.
Etapa 1: Obter uma chave de API do CometAPI
Crie ou acesse sua conta no CometAPI e obtenha sua chave de API.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
Etapa 2: Configurar o modelo MiMo-V2.5
Defina o modelo como:
mimo-v2.5
e use o endpoint de API compatível do CometAPI.
O endpoint exato e o esquema de requisição devem ser verificados na documentação atual de modelos/APIs do CometAPI antes da implantação.
Etapa 3: Criar fluxos de trabalho multimodais e de agentes
O uso mais interessante de mimo-v2.5 não é um chat de texto comum. Os desenvolvedores podem combinar seu raciocínio multimodal com ferramentas externas para criar fluxos de trabalho como:
Entrada do usuário → compreensão de imagem/vídeo/áudio → raciocínio → chamada de ferramenta → análise de resultados → próxima ação
Isso torna o modelo particularmente atraente para agentes autônomos de pesquisa, agentes de programação, sistemas de suporte ao cliente multimodais e assistentes corporativos com contexto longo.
Por que usar o MiMo-V2.5 por meio do CometAPI?
MiMo-V2.5 é especialmente útil em um ambiente de API multimodelo porque os desenvolvedores podem querer compará-lo com GPT, Claude, Gemini, DeepSeek ou outros modelos de agentes sem construir uma pilha de infraestrutura separada para cada provedor.
O CometAPI pode ser útil quando sua aplicação precisa de:
- Uma camada de API unificada
- Acesso a múltiplas famílias de modelos de IA
- Troca de modelos mais fácil
- Gerenciamento centralizado de chaves de API
- Comparação rápida de modelos
- Uma única camada de integração para experimentação e produção
Para equipes que avaliam desempenho de agentes versus custo de inferência, vale a pena testar MiMo-V2.5 ao lado dos modelos principais mais caros, em vez de assumir que o maior modelo proprietário será automaticamente a melhor escolha.