Especificações técnicas do Kimi k2.5
| Item | Valor / observações |
|---|---|
| Nome do modelo / fornecedor | Kimi-K2.5 (v1.0) — Moonshot AI (pesos abertos). |
| Família de arquitetura | Modelo de raciocínio híbrido Mistura de Especialistas (MoE) (MoE no estilo DeepSeek). |
| Parâmetros (total / ativos) | ≈ 1 trilhão de parâmetros no total; ~32B ativos por token (384 especialistas, 8 selecionados por token, conforme relatado). |
| Modalidades (entrada / saída) | Entrada: texto, imagens, vídeo (multimodal). Saída: principalmente texto (rastros de raciocínio detalhados), opcionalmente chamadas de ferramentas estruturadas / saídas em múltiplas etapas. |
| Janela de contexto | 256k tokens |
| Dados de treinamento | Pré-treinamento contínuo em ~15 trilhões de tokens mistos visuais + texto (informado pelo fornecedor). Rótulos de treinamento/composição do conjunto de dados: não divulgados. |
| Modos | Thinking mode (retorna rastros internos de raciocínio; temperatura recomendada=1.0) e Instant mode (sem rastros de raciocínio; temperatura recomendada=0.6). |
| Recursos de agente | Agent Swarm / subagentes paralelos: o orquestrador pode criar até ~100 subagentes e executar grandes quantidades de chamadas de ferramentas (o fornecedor afirma até ~1.500 chamadas; execução paralela reduz o tempo de execução). |
O que é Kimi K2.5?
Kimi K2.5 é o modelo carro-chefe de pesos abertos da Moonshot AI, projetado como um sistema nativamente multimodal e orientado a agentes, e não apenas um LLM de texto com componentes adicionais. Ele integra raciocínio em linguagem, compreensão de visão e processamento de contexto longo em uma única arquitetura, possibilitando tarefas complexas de múltiplas etapas que envolvem documentos, imagens, vídeos, ferramentas e agentes.
Ele foi projetado para fluxos de trabalho de longo horizonte com suporte a ferramentas (codificação, busca em múltiplas etapas, entendimento de documentos/vídeos) e oferece dois modos de interação (Thinking e Instant) e quantização nativa INT4 para inferência eficiente.
Recursos principais do Kimi K2.5
- Raciocínio multimodal nativo
Visão e linguagem são treinadas conjuntamente desde o pré-treinamento. Kimi K2.5 consegue raciocinar sobre imagens, capturas de tela, diagramas e quadros de vídeo sem depender de adaptadores de visão externos. - Janela de contexto ultralonga (256K tokens)
Permite raciocínio persistente sobre bases de código inteiras, artigos de pesquisa longos, documentos legais ou conversas estendidas de várias horas sem truncamento do contexto. - Modelo de execução Agent Swarm
Suporta criação e coordenação dinâmicas de até ~100 subagentes especializados, permitindo planejamento paralelo, uso de ferramentas e decomposição de tarefas para fluxos de trabalho complexos. - Múltiplos modos de inferência
- Instant mode para respostas de baixa latência
- Thinking mode para raciocínio profundo em múltiplas etapas
- Agent / Swarm mode para execução autônoma de tarefas e orquestração
- Capacidade robusta de visão para código
Capaz de converter mockups de UI, capturas de tela ou demonstrações em vídeo em código front-end funcional e depurar software usando contexto visual. - Escalonamento MoE eficiente
A arquitetura MoE ativa apenas um subconjunto de especialistas por token, permitindo capacidade de trilhões de parâmetros com custo de inferência administrável em comparação a modelos densos.
Desempenho em benchmarks do Kimi K2.5
Resultados de benchmarks relatados publicamente (principalmente em cenários focados em raciocínio):
Benchmarks de raciocínio e conhecimento
| Benchmark | Kimi K2.5 | GPT-5.2 (xhigh) | Claude Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|---|
| HLE-Full (com ferramentas) | 50.2 | 45.5 | 43.2 | 45.8 |
| AIME 2025 | 96.1 | 100 | 92.8 | 95.0 |
| GPQA-Diamond | 87.6 | 92.4 | 87.0 | 91.9 |
| IMO-AnswerBench | 81.8 | 86.3 | 78.5 | 83.1 |
Benchmarks de visão e vídeo
| Benchmark | Kimi K2.5 | GPT-5.2 | Claude Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|---|
| MMMU-Pro | 78.5 | 79.5* | 74.0 | 81.0 |
| MathVista (Mini) | 90.1 | 82.8* | 80.2* | 89.8* |
| VideoMMMU | 87.4 | 86.0 | — | 88.4 |
As pontuações marcadas refletem diferenças nas configurações de avaliação relatadas pelas fontes originais.
De modo geral, o Kimi K2.5 demonstra forte competitividade em raciocínio multimodal, tarefas de contexto longo e fluxos de trabalho no estilo de agentes, especialmente quando avaliado além de QA de formato curto.
Kimi K2.5 vs Outros Modelos de Ponta
| Dimensão | Kimi K2.5 | GPT-5.2 | Gemini 3 Pro |
|---|---|---|---|
| Multimodalidade | Nativa (visão + texto) | Módulos integrados | Módulos integrados |
| Comprimento de contexto | 256K tokens | Longo (limite exato não divulgado) | Longo (<256K típico) |
| Orquestração de agentes | Enxame multiagente | Foco em agente único | Foco em agente único |
| Acesso ao modelo | Pesos abertos | Proprietário | Proprietário |
| Implantação | Local / nuvem / personalizado | Apenas API | Apenas API |
Orientação para seleção de modelo:
- Escolha Kimi K2.5 para implantação com pesos abertos, pesquisa, raciocínio com contexto longo ou fluxos de trabalho complexos com agentes.
- Escolha GPT-5.2 para inteligência geral em produção com ecossistemas de ferramentas robustos.
- Escolha Gemini 3 Pro para integração profunda com o stack de produtividade e busca do Google.
Casos de uso representativos
- Análise de documentos e código em larga escala
Processar repositórios inteiros, corpora legais ou arquivos de pesquisa em uma única janela de contexto. - Fluxos de trabalho de engenharia de software visual
Gerar, refatorar ou depurar código usando capturas de tela, designs de UI ou interações gravadas. - Pipelines de agentes autônomos
Executar fluxos de ponta a ponta envolvendo planejamento, recuperação, chamadas de ferramentas e síntese por meio de enxames de agentes. - Automação do conhecimento corporativo
Analisar documentos internos, planilhas, PDFs e apresentações para produzir relatórios estruturados e insights. - Pesquisa e personalização de modelos
Fine-tuning, pesquisa de alinhamento e experimentação possibilitados por pesos de modelo abertos.
Limitações e considerações
- Requisitos de hardware elevados: a implantação em precisão total requer memória de GPU substancial; o uso em produção normalmente depende de quantização (por exemplo, INT4).
- Maturidade do Agent Swarm: comportamentos avançados de múltiplos agentes ainda estão evoluindo e podem exigir um design cuidadoso de orquestração.
- Complexidade de inferência: o desempenho ideal depende do mecanismo de inferência, estratégia de quantização e configuração de roteamento.
Como acessar a API Kimi k2.5 via CometAPI
Etapa 1: Cadastre-se para obter a chave de API
Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro. Acesse seu console do CometAPI. Obtenha a chave de API de credenciais de acesso da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a token key: sk-xxxxx e envie.

Etapa 2: Envie requisições para a API Kimi k2.5
Selecione o endpoint “kimi-k2.5” para enviar a requisição de API e defina o corpo da requisição. O método e o corpo da requisição são obtidos na documentação da API em nosso site. Nosso site também fornece teste Apifox para sua conveniência. Substitua pela sua chave CometAPI real da sua conta. A URL base é Chat Completions.
Insira sua pergunta ou solicitação no campo content — é isso que o modelo irá responder. Processe a resposta da API para obter a resposta gerada.
Etapa 3: Recuperar e verificar os resultados
Processe a resposta da API para obter a resposta gerada. Após o processamento, a API responde com o status da tarefa e os dados de saída.