Especificações técnicas do MiMo-V2.5-Pro
| Especificação | MiMo-V2.5-Pro |
|---|---|
| ID do modelo | mimo-v2.5-pro |
| Provedor | Xiaomi MiMo |
| Tipo de modelo | Modelo de linguagem de grande porte orientado a agentes |
| Arquitetura | Mistura esparsa de especialistas |
| Parâmetros totais | 1.02T |
| Parâmetros ativados | 42B |
| Janela de contexto | 1M tokens |
| Saída | Texto |
| Arquitetura de atenção | SWA híbrida + Atenção global |
| Tokens de treinamento | 27T |
| Contexto máximo do modelo base | 256K |
| Contexto máximo Pro | 1M |
| Licença | MIT |
A distinção entre 1.02T de parâmetros totais e 42B de parâmetros ativos é importante. MiMo-V2.5-Pro é um modelo MoE: cada token ativa apenas um subconjunto dos parâmetros disponíveis. Isso altera substancialmente seu perfil de computação de inferência em comparação com um modelo denso de 1T de parâmetros, embora o modelo completo ainda tenha enormes requisitos de memória e implantação.
Quais são os principais recursos do MiMo-V2.5-Pro?
1. Arquitetura MoE esparsa em escala de trilhão
MiMo-V2.5-Pro contém 1.02T de parâmetros totais e 42B de parâmetros ativados.
Sua arquitetura contém 384 especialistas roteados, com oito especialistas ativados para cada token. O modelo tem 70 camadas Transformer, consistindo em uma camada densa e 69 camadas MoE.
Isso fornece substancialmente mais capacidade de representação do que o MiMo-V2.5 padrão, ao mesmo tempo em que evita o custo computacional de ativar todos os 1.02T de parâmetros para cada token.
A conclusão prática é:
MiMo-V2.5-Pro é um modelo de trilhão de parâmetros por capacidade total, mas sua computação por token é regida por seu caminho de 42B de parâmetros ativos.
2. Contexto de 1 milhão de tokens
O modelo suporta até 1M tokens de contexto.
Esta é uma de suas capacidades mais importantes para agentes autônomos, porque fluxos de trabalho de longa duração podem acumular:
- Saídas de ferramentas
- Código-fonte
- Resultados de pesquisa
- Documentação
- Estado intermediário de raciocínio
- Instruções do usuário
- Logs de execução
Em vez de resumir repetidamente e descartar o contexto antigo, um agente pode potencialmente reter um histórico de trabalho muito maior.
A avaliação de contexto longo da Xiaomi testa especificamente o modelo de 32K até 1M tokens de entrada.
3. Atenção híbrida de janela deslizante e global
MiMo-V2.5-Pro usa uma proporção de 6:1 de Atenção de Janela Deslizante (SWA) para Atenção Global, com uma janela deslizante de 128 tokens.
A arquitetura contém:
- 60 camadas SWA
- 10 camadas de atenção global
- Janela SWA de 128 tokens
A Xiaomi relata que esse design reduz o armazenamento do cache KV em quase 7×, preservando o desempenho em contexto longo por meio de um viés de sumidouro de atenção treinável.
Esta é uma das partes tecnicamente mais significativas do modelo.
Uma janela de contexto de 1M é cara se cada camada realizar atenção completa sobre toda a sequência. A atenção híbrida reduz a quantidade de informação à qual cada camada precisa atender globalmente, mantendo camadas dedicadas de atenção global para relacionamentos de longo alcance.
4. Previsão de múltiplos tokens
MiMo-V2.5-Pro contém três módulos MTP leves.
A Previsão de Múltiplos Tokens permite ao modelo prever múltiplos tokens futuros de uma maneira que pode ser usada para decodificação estilo especulativo e aceleração da inferência.
A Xiaomi relata que sua arquitetura MTP pode triplicar a velocidade de geração durante a inferência sob sua configuração de implantação descrita.
Isso é especialmente importante para agentes, pois um agente pode gerar grandes quantidades de saída intermediária ao longo de uma longa trajetória. Melhorar a velocidade de geração de tokens pode, portanto, ter um impacto significativo na latência total da tarefa.
5. Aprendizado por reforço orientado a agentes
O pipeline de pós-treinamento do MiMo-V2.5-Pro inclui:
- Fine-tuning supervisionado
- Aprendizado por reforço de grande escala orientado a agentes
- Multi-Teacher On-Policy Distillation (MOPD)
O objetivo de treinamento é explicitamente orientado a comportamento de agente complexo, e não apenas a perguntas e respostas de benchmarks estáticos.
É por isso que as avaliações mais fortes do modelo estão concentradas em codificação, interação com terminal, raciocínio de longo contexto e benchmarks de agentes.
6. Pré-treinamento com 27T tokens
MiMo-V2.5-Pro foi pré-treinado em aproximadamente 27 trilhões de tokens, usando precisão mista FP8 e comprimento de sequência nativo de 32K antes de suportar a janela de contexto estendida de 1M.
A escala do pré-treinamento, combinada com a arquitetura MoE de trilhão de parâmetros, coloca o MiMo-V2.5-Pro firmemente na classe atual de modelos de ponta.
Como o MiMo-V2.5-Pro se sai em benchmarks?
Os resultados de avaliação publicados são particularmente úteis porque incluem tanto benchmarks de raciocínio geral quanto avaliações práticas de codificação/agentes.
| Benchmark | Resultado de MiMo-V2.5-Pro | Tipo de avaliação |
|---|---|---|
| SWE-Bench Verified | 78.9 | Engenharia de software |
| SWE-Bench Pro | 57.2 | Engenharia de software |
| Terminal-Bench 2.0 | 68.4 | Agente de terminal |
| GSM8K | 99.6 | Raciocínio matemático |
| GPQA Diamond | 66.7 | Raciocínio em nível de pós-graduação |
| MMLU-Pro | 68.5 | Raciocínio geral |
| MMLU | 89.4 | Conhecimento geral/raciocínio |
| MMLU-Redux | 92.8 | Conhecimento geral/raciocínio |
| HumanEval+ | 75.6 | Geração de código |
| MBPP+ | 74.1 | Programação em Python |
| LiveCodeBench v6 | 39.6 | Programação competitiva |
| ARC-Challenge | 97.2 | Raciocínio |
| AIME 2024/2025 | 37.3 | Matemática de competição |
Os resultados mostram um perfil particularmente forte em engenharia de software e raciocínio matemático. Os reportados 78.9 no SWE-Bench Verified e 68.4 no Terminal-Bench 2.0 são especialmente relevantes para desenvolvedores que constroem sistemas autônomos de codificação.
Desempenho em contexto longo
Os resultados de contexto longo são, talvez, mais interessantes do que os benchmarks padrão.
Na avaliação GraphWalks, o MiMo-V2.5-Pro mantém desempenho mensurável em comprimentos de contexto extremos:
| Contexto | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
A Xiaomi relata que o MiMo-V2-Pro anterior se deteriora rapidamente além de 128K e chega a 0.00 em 1M em ambas as subtarefas, ao passo que o V2.5-Pro retém desempenho diferente de zero no contexto completo de 1M.
Esta é uma distinção significativa: o contexto de 1M do MiMo-V2.5-Pro não é apenas um máximo teórico; a avaliação publicada de contexto longo demonstra desempenho útil profundamente nessa janela.
Exemplos de agentes no mundo real
| Tarefa | Resultado reportado |
|---|---|
| PKU SysY Compiler | 4.3 horas |
| Chamadas de ferramenta durante a tarefa do compilador | 672 |
| Casos de teste do compilador aprovados | 233/233 |
| Editor de vídeo full-stack | 11.5 horas |
| Código gerado para o editor de vídeo | 8.192 linhas |
| Intervenção humana | Nenhuma reportada |
| Chamadas de ferramenta de longo horizonte | Quase 1.000 |
Estas são demonstrações reportadas pela Xiaomi, e não pontuações de benchmarks padronizados.
MiMo-V2.5-Pro vs MiMo-V2.5
Os dois modelos compartilham a mesma geração, mas visam cargas de trabalho diferentes.
| Especificação | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Parâmetros totais | 310B | 1.02T |
| Parâmetros ativos | 15B | 42B |
| Contexto | 1M | 1M |
| Camadas | 48 | 70 |
| Especialistas roteados | 256 | 384 |
| Especialistas por token | 8 | 8 |
| Camadas de atenção completa | 9 | 10 |
| Camadas SWA | 39 | 60 |
| Foco principal | Agentes multimodais | Agentes complexos/codificação |
| Entendimento de vídeo/áudio/imagem | Sim | Foco principalmente em linguagem/agentes |
| Desempenho de agente de longo horizonte | Forte | Topo de linha |
A escolha, portanto, não é simplesmente "o Pro é melhor".
Se uma aplicação precisa de compreensão nativa de imagem, vídeo e áudio, o MiMo-V2.5 é a escolha mais natural. Se a carga de trabalho se concentra em raciocínio complexo, engenharia de software, interação com terminal e agentes de longa duração, o MiMo-V2.5-Pro é a opção mais forte.
Limitações do MiMo-V2.5-Pro
1. Entrada apenas de texto
Ao contrário de mimo-v2.5, a especificação oficial do modelo Pro lista Texto como sua modalidade de entrada. Ele não deve ser comercializado como o modelo multimodal da família V2.5.
2. Altos requisitos de computação para hospedagem própria
O modelo tem aproximadamente 1T de parâmetros totais / 42B de parâmetros ativos, tornando a implantação local consideravelmente mais exigente do que modelos abertos pequenos convencionais.
3. Desempenho do agente depende do framework
A alegação da Xiaomi de quase 1.000 chamadas de ferramenta está explicitamente associada ao uso de um framework de Agente apropriado. O modelo sozinho não garante que uma aplicação alcançará o mesmo desempenho de longo horizonte.
4. Manipulação de conteúdo de raciocínio
Aplicações de Agente multi-turno que usam modo de pensamento e chamadas de ferramenta precisam preservar corretamente reasoning_content. O manuseio incorreto pode produzir erros de API.
Melhores casos de uso
Engenharia de software em grande escala
- Migração de repositórios
- Refatoração
- Depuração
- Geração de testes
- Desenvolvimento de compiladores
- Desenvolvimento de aplicações full-stack
Agentes autônomos de codificação
MiMo-V2.5-Pro é especialmente adequado para Agentes que precisam repetidamente:
inspecionar → modificar → executar → testar → diagnosticar → modificar
Raciocínio com documentos longos
Seu contexto de 1M o torna útil para:
- Contratos jurídicos
- Especificações técnicas
- Grandes coleções de pesquisa
- Documentação corporativa
Agentes de negócios complexos
Chamadas de ferramentas + pesquisa na web + saída estruturada podem suportar:
- Agentes de pesquisa
- Agentes de processamento de dados
- Automação de fluxos de trabalho corporativos
- Sistemas de decisão em múltiplas etapas
Como usar a API do MiMo-V2.5-Pro no CometAPI
O ID de modelo relevante no CometAPI é:
mimo-v2.5-pro
Para desenvolvedores, uma camada de agregação de API é particularmente útil para testar o MiMo-V2.5-Pro em comparação com outros modelos de raciocínio e agentes de alto nível sem manter integrações de provedores independentes.
Passo 1: Obtenha uma chave de API da CometAPI
Crie ou entre em sua conta CometAPI e obtenha sua chave de API no console de API.
Defina-a como uma variável de ambiente:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Passo 2: Configure o cliente de API
A Xiaomi fornece uma API compatível com os protocolos OpenAI e Anthropic, tornando a migração relativamente simples. Para integração em produção, use o endpoint/esquema atual do CometAPI para mimo-v2.5-pro, particularmente se você precisar de recursos avançados, como chamadas de ferramentas, streaming, saídas estruturadas ou solicitações de contexto longo.
Passo 3: Conecte o MiMo-V2.5-Pro a ferramentas
O modelo se torna substancialmente mais útil quando conectado a ferramentas externas.
Por exemplo:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Essa arquitetura se alinha muito mais ao uso pretendido do modelo do que uma simples integração tipo chatbot.