TL;DR: A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026 – um modelo de pesos abertos revolucionário com 2.8 trilhões de parâmetros (o primeiro na classe 3T), multimodalidade nativa, contexto de 1 milhão de tokens e desempenho de fronteira que rivaliza ou supera modelos proprietários de ponta como Claude Fable 5 e GPT-5.6 Sol em programação, tarefas orientadas a agentes, desenvolvimento de front-end e trabalho de conhecimento.
Principais destaques
- Escala e inovação: 2.8T de parâmetros, MoE com 16/896 experts ativos, Kimi Delta Attention (KDA), Attention Residuals – ~2.5x de eficiência de escala em relação ao K2, Kimi K3 - Kimi API Platform
- Desempenho: Artificial Analysis Intelligence Index ~57 (top 4, à frente do Claude Opus 4.8), lidera o Frontend Code Arena, forte no Terminal-Bench (88.3%), BrowseComp (91.2%), GPQA-Diamond (93.5%). Fica atrás do Fable 5/Sol no geral, mas supera a maioria dos demais; #1 no Arena.ai Frontend Code Arena (1,679 Elo, superando o Fable 5), post da Arena no X e cobertura do Tom's Hardware.
- Capacidades: Visão/vídeo nativos, contexto de 1M para repositórios/códigos massivos, codificação orientada a agentes, raciocínio 3D, edição de vídeo, painéis de pesquisa.
- Acesso: Imediato via kimi.com, API (modelo kimi-k3, guia de acesso); pesos abertos em breve. A Moonshot pausou temporariamente novas assinaturas do Kimi K3 após um pico de demanda. Integração fácil via CometAPI.
- Valor: Menor custo por tarefa (~$0.94 em algumas avaliações), menos recusas, ideal para fluxos de trabalho de programação/Visão.
O Kimi K3 Tech Blog descreve o Kimi K3 como "Open Frontier Intelligence, Kimi K3 marks a pivotal moment in AI democratization. As Chinese AI labs like Moonshot push boundaries despite compute constraints, this open model challenges the dominance of closed U.S. frontiers and empowers developers worldwide.
O que é o Kimi K3? Um modelo aberto de classe 3T da Moonshot AI
A Moonshot AI, startup baseada em Pequim, lançou o Kimi K3 em 16 de julho de 2026 como seu modelo carro-chefe. Ele é explicitamente posicionado como o primeiro modelo aberto na classe de aproximadamente 3 trilhões de parâmetros, com 2.8 trilhões de parâmetros totais em uma arquitetura esparsa de Mixture-of-Experts (MoE). Apenas 16 de 896 experts são ativados por token, equilibrando escala massiva com eficiência.
Isso se baseia na série Kimi K2 (K2.5, K2.6, etc.), que já ganhou tração em programação e multimodalidade. O K3 introduz inovações arquitetônicas: Kimi Delta Attention (KDA) e Attention Residuals (AttnRes), além de Stable LatentMoE e treinamento ciente de quantização (pesos MXFP4, ativações MXFP8 desde a fase SFT). Isso resulta em ~2.5x melhor eficiência de escala e até 6.3x mais velocidade de decodificação em comparação aos predecessores.
Especificações principais ( Kimi K3 Technical Specifications):
- Parâmetros: 2.8T totais (MoE esparso).
- Janela de contexto: 1,048,576 tokens (~1M).
- Modalidades: Compreensão nativa de texto + imagem + vídeo; saída em texto.
- Saída máxima: Padrão de 131k tokens, até o limite de contexto.
- Raciocínio: Esforço máximo por padrão no lançamento; modos mais baixos/altos a caminho.
- Pesos abertos: Prometidos até 27 de julho de 2026 (estilo MIT modificado, conforme precedente do K2).
O K3 mira tarefas de longo prazo — não apenas respostas rápidas, mas concluir fluxos complexos de engenharia, pesquisa ou agentes com feedback visual ("Vision in the Loop"). Demos incluem construção autônoma de um compilador de GPU (rivalizando o Triton), design de chip em processo de 45nm e pesquisa rápida em astrofísica.
A demanda já pressionou a capacidade
A recepção inicial do modelo foi forte o suficiente para criar pressão de capacidade. A Moonshot publicou no X que a demanda nas 48 horas anteriores havia chegado perto dos limites atuais de GPU e que novas assinaturas seriam temporariamente pausadas enquanto a empresa adicionava capacidade. A Business Insider relatou a mesma pausa de capacidade e observou que assinantes existentes não foram afetados.
Isso importa para o planejamento de produção. Um modelo pode ser excelente e ainda assim enfrentar limitações de disponibilidade se a demanda superar o compute. Equipes que avaliam o Kimi K3 devem evitar dependência de um único provedor, monitorar latência e taxas de erro e usar roteamento de fallback por meio de um provedor unificado como a CometAPI sempre que possível.
Benchmarks de programação: onde o Kimi K3 parece mais forte
O perfil de programação do Kimi K3 é o principal motivo pelo qual os desenvolvedores estão prestando atenção. Ele está quase empatado com o GPT-5.6 Sol no Terminal-Bench 2.1, supera o GPT-5.6 Sol e o Claude Fable 5 no Program Bench, e lidera o GPT-5.6 Sol por uma margem significativa no FrontierSWE. Também supera os modelos comparados no SWE Marathon na tabela do OpenLM.
O resultado no Arena de front-end adiciona outro sinal prático. A Arena reportou o Kimi K3 com 1679 pontos no Frontend Code Arena, à frente do Claude Fable 5. Esse benchmark importa porque o trabalho de front-end muitas vezes é julgado por preferência humana, não apenas por testes automatizados. Um assistente de codificação que consegue produzir UI limpa e visualmente coerente a partir de um prompt é valioso para equipes de produto, agências, construtores de SaaS e ferramentas internas.
Rankings gerais
- Artificial Analysis AI Leaderboard: Estreou em #3. Os scores do Intelligence Index o colocam de forma competitiva (por exemplo, ~57.1 em algumas avaliações).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 em relação ao K2.6), atrás apenas do Fable 5.
Benchmarks de programação e agentes (auto-relatados e independentes)
O K3 brilha aqui, alavancando sua escala e arquitetura para desempenho sustentado em cenários orientados a agentes.
- Frontend Code Arena (Arena.ai): #1 com 1,679 pontos, superando Fable 5 e GPT-5.6 Sol. Se destaca na preferência cega de desenvolvedores para web.
- DeepSWE: 67.3–67.5 (forte, com harness KimiCode).
- Program Bench: #1 com 77.8.
- SWE Marathon: #1 com 42.0 (em alguns harnesses).
- Terminal-Bench 2.1: Competitivo, próximo ao GPT-5.6 Sol.
Visão e multimodalidade
Treinamento nativo (não acoplado posteriormente) gera resultados sólidos:
- MMMU-Pro: 81.6%
- MathVision: Competitivo/na casa dos 90 em alguns relatos.
- OmniDocBench: 91.1% (lidera).
Suporta capturas de tela, diagramas, vídeo para tarefas em ciclo fechado como refinamento de UI ou desenvolvimento de jogos.
Tabela de comparação: Kimi K3 vs. modelos líderes (Aproximado/Compilado de relatórios; Max Effort onde indicado)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Notas/Fonte |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Inferior | Inferior | Arena.ai |
| DeepSWE | 67.3–67.5 | Competitivo | - | Moonshot/KimiCode |
| Program Bench | 77.8 (#1) | - | Próximo | Vals.ai |
| Intelligence Index (AA) | ~57.1 | ~59.9 | ~58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Maior | - | Interno Moonshot |
| Custo por tarefa (Evals) | ~$0.94 | Maior | Maior | Independente |
Dados provenientes do blog técnico da Moonshot, de rankings independentes e análises. Resultados podem variar por harness/esforço; sempre verifique os mais recentes.
O K3 mostra menos recusas em tópicos sensíveis e forte consistência em fluxos orientados a agentes. Testes independentes (por exemplo, avaliações no YouTube, Vals AI) o confirmam como um dos modelos abertos mais fortes para programação no mundo real.
O que o Kimi K3 pode fazer? Capacidades em programação, visão e além
Codificação e engenharia orientadas a agentes
O K3 sustenta sessões longas com supervisão mínima: navega por repositórios massivos, usa ferramentas, depura via capturas de tela ("vision in the loop").
Exemplos:
- Otimização de kernel e desenvolvimento de compilador: Construiu o MiniTriton (compilador semelhante ao Triton) do zero, rivalizando stacks otimizados. Otimizou kernels de GPU de forma competitiva com o Fable 5.
- Desenvolvimento de jogos: Converte conceitos/imagens/vídeos em experiências 3D/multiplayer jogáveis com refinamento iterativo.
- Design de chip: Execução autônoma de 48 horas projetando um chip nano-modelo.
- Front-end: Topos de rankings para apps web e tarefas full-stack.
Visão e multimodalidade
A compreensão nativa de imagens/vídeo possibilita:
- Edição de vídeo: Editou seu próprio teaser a partir de 56 clipes (seleção, cortes, sincronização, revisões) – horas de trabalho em minutos.
- Raciocínio 3D, motion graphics, painéis interativos.
- "Vision in the loop" para iteração de código via capturas de tela.
A documentação da Kimi API mostra entrada de imagem via data URLs base64 e entrada de vídeo via arquivos enviados referenciados por ms://. Eles também alertam que URLs de imagem públicas não são suportadas na entrada de visão, então os desenvolvedores devem enviar base64 ou referências a arquivos enviados e tornar o conteúdo da mensagem um array de objetos. Esse é um detalhe importante de implementação: não serializar uma mensagem mista de imagem e texto em uma única string simples.
Trabalho de conhecimento e pesquisa
Para empresas, é aqui que o Kimi K3 pode ser mais valioso do que um chatbot comum. O modelo é projetado para trabalho "orientado a agentes", em que pode manter um plano, chamar ferramentas, processar resultados intermediários e produzir um artefato final. Exemplos incluem relatórios de pesquisa de mercado, assistentes de limpeza de dados, resumos de conformidade, manutenção de bases de conhecimento de suporte ao cliente e copilotos internos de engenharia.
- Gera relatórios em nível de consultoria, visualizações interativas, painéis (por exemplo, análise de 42 anos da indústria de ASIC a partir de milhares de fontes).
- Pipelines científicos: Reproduziu relações em astrofísica, analisou ondas gravitacionais com subagentes.
- Widgets/Painéis no Kimi Work para visões persistentes baseadas em dados.
O K3 faz a ponte entre literatura e código executável, produzindo resultados em qualidade de publicação com eficiência.
Kimi K3 vs outros modelos de fronteira: comparação prática
| Modelo | Melhor uso | Pontos fortes | Atenções | Recomendação da CometAPI |
|---|---|---|---|---|
| Kimi K3 | Contexto longo para código, trabalho de conhecimento, agentes, raciocínio visual | Escala MoE de 2.8T, contexto de 1M, benchmarks fortes em código e agentes, roteiro de pesos abertos | Pressão de capacidade na semana de lançamento, sensibilidade ao histórico de pensamento, suporte a visão pode variar por rota | Teste como modelo carro-chefe para código e contexto longo |
| GPT-5.6 Sol | Raciocínio difícil, programação, pesquisa, tarefas amplas em produção | Perfil de benchmark muito forte e tooling maduro | Preço mais alto em muitas rotas | Use como comparação e modelo de escalonamento |
| Claude Fable 5 | Escrita, programação, fluxos orientados a agentes, tarefas com preferência humana | UX forte e desempenho amplo de fronteira | Custo mais alto e possíveis fallbacks de política em algumas tarefas | Compare para agentes voltados ao usuário e apps de escrita |
| Claude Opus 4.8 | Raciocínio profundo e trabalho profissional confiável | Comportamento de assistente estável de alto nível | Mais antigo que os lançamentos carro-chefe mais recentes | Mantenha como fallback ou baseline de benchmark |
| GLM-5.2 | Avaliação de modelos abertos sensível a custo | Alternativa competitiva de modelo aberto | Mais fraco em várias comparações listadas com o K3 | Inclua em testes de roteamento custo/desempenho |
Como acessar o Kimi K3: guia passo a passo
- Web/App: Visite kimi.com ou baixe o app Kimi (iOS/Android). Selecione K3 (K3 Max ou Swarm Max).
- Kimi Code: Focado em Terminal/IDE para desenvolvedores. Ótimo para agentes de programação.
- Acesso via API:
- Base URL: https://api.moonshot.ai/v1
- Modelo: kimi-k3
- Obtenha a chave de API em platform.moonshot.ai/console.
- Exemplo de SDK compatível com OpenAI (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Suporta ferramentas, modo JSON, cache de contexto. Preços: $3 input, $15 output por M tokens (cache $0.30).
- Agregadores: Use a CometAPI (cometapi.com) para acesso unificado ao Kimi K3 + 500+ modelos com uma única chave, menores custos (economia de 20–40%) e troca fácil. Perfeito para produção — compatível com OpenAI plug-and-play, baixa latência.
- Self-Hosting: Após o lançamento dos pesos em 27 de julho no Hugging Face. Espere necessidades de hardware pesadas (supernodes, 64+ aceleradores recomendados). Ferramentas da comunidade como vLLM virão na sequência.
Recomendação do CometAPI: Integre o Kimi K3 via CometAPI para evitar múltiplas chaves/faturamentos. Teste ao lado de Claude/GPT para A/B, otimize custos e escale com confiabilidade. O dashboard deles rastreia o uso entre modelos — ideal para monitorar experimentos com o K3. Inscreva-se em cometapi.com para créditos gratuitos e acesso unificado.
Veredito final
O Kimi K3 é um dos lançamentos de modelo mais importantes de 2026 até agora. Ele combina grande escala, uma estratégia séria de pesos abertos, uma janela de contexto de 1M de tokens, compreensão visual nativa e resultados de benchmark que o colocam próximo ao topo dos atuais sistemas de IA para programação e agentes. Ele não elimina a necessidade de GPT, Claude, Gemini, DeepSeek, Qwen ou outros modelos, mas dá aos desenvolvedores uma nova opção crível para os fluxos de trabalho mais difíceis de contexto longo.
Comece hoje em kimi.com ou via CometAPI para integração sem esforço. Experimente seus pontos fortes em programação e visão – os resultados falam por si.
