Resposta em primeiro lugar
Kimi K4 ainda não foi oficialmente lançado, e a Moonshot AI não publicou suas especificações finais, resultados de benchmark, preços de API ou data de lançamento. O sinal público mais forte até agora vem de reportagens de que a Moonshot está buscando capacidade adicional Nvidia Blackwell para um sucessor esperado significativamente maior do que o Kimi K3. Isso é uma evidência significativa de que um modelo de próxima geração está sendo preparado, mas não é um anúncio oficial de produto.
O que pode ser discutido de forma responsável é a direção que o K4 pode tomar. O atual Kimi K3 de 2,8 trilhões de parâmetros já combina escala com MoE esparso, visão nativa, uma janela de contexto de um milhão de tokens e capacidades de agentes de longo horizonte. Portanto, é mais provável que o Kimi K4 seja avaliado por execução orientada a agentes confiável, profundidade em codificação, raciocínio multimodal e eficiência de escala do que apenas pela contagem de parâmetros.
A conclusão central é simples: Kimi K4 parece estar em desenvolvimento, mas quase todas as especificações numéricas que circulam fora da empresa permanecem não confirmadas. Qualquer prévia crível deve separar fatos verificados do K3, reportagens sobre o K4 e inferências prospectivas.
O que é Kimi K4?4
Kimi K4 é o nome público usado para o sucessor esperado do Kimi K3. Atualmente deve ser tratado como um modelo em desenvolvimento, e não como um produto de API anunciado. A Moonshot AI não publicou um model card do K4, relatório técnico, identificador de API, página de preços, licença ou tabela de benchmarks.
O The Information relata que a Moonshot AI está discutindo planos para o Kimi K4. Citando duas pessoas com conhecimento do assunto, o relatório descreve o K4 como significativamente maior do que o K3 e diz que a Moonshot busca acesso a chips Nvidia Blackwell adicionais para preparar o modelo. No entanto, não confirma cinco trilhões, seis trilhões ou qualquer outra contagem exata de parâmetros, nem estabelece se o K4 será lançado com pesos abertos, oferecido apenas por meio de produtos hospedados ou dividido em múltiplas variantes.
Essa incerteza importa porque os lançamentos do Kimi historicamente combinam pesos de modelo, APIs hospedadas, produtos de usuário final e sistemas de agentes especializados. Um anúncio futuro do K4 pode se referir a um modelo, a uma família de modelos ou a um sistema mais amplo construído em torno de roteamento, ferramentas, memória e componentes multimodais.
Por que o Kimi K4 está atraindo atenção tão cedo?
Kimi K3 elevou o teto de escala com pesos abertos
Kimi K3 estabeleceu uma base incomumente ambiciosa. Seu resumo oficial do modelo lista 2,8 trilhões de parâmetros totais, 104 bilhões de parâmetros ativados, 93 camadas, 896 especialistas roteados, 16 especialistas selecionados por token, dois especialistas compartilhados e um comprimento de contexto de 1.048.576 tokens. O modelo também inclui um codificador de visão MoonViT-V2 com 401 milhões de parâmetros.
Essa combinação torna o K3 importante por dois motivos diferentes. Primeiro, mostra que modelos com pesos abertos podem escalar para a mesma classe ampla de capacidades dos sistemas proprietários líderes. Segundo, seu design esparso demonstra que a contagem total de parâmetros e o custo de inferência não são a mesma coisa: apenas um subconjunto de especialistas é ativado para cada token.
Relatos apontam para um sucessor ainda maior
Relatos do setor dizem que a Moonshot AI está buscando mais capacidade de computação classe Blackwell para o K4 e descrevem o modelo planejado como significativamente maior que o K3. O relatório é a melhor evidência pública de que o K4 é mais do que especulação da comunidade, mas deixa a arquitetura final, cronograma de treinamento, tamanho do modelo e plano de implantação em aberto.
A discussão sobre computação é relevante porque a escala cria dois gargalos separados. O treinamento exige aceleradores suficientes, rede, armazenamento e estabilidade de engenharia para completar uma corrida de fronteira. O serviço (inferência) exige então uma estratégia separada que forneça latência e custo aceitáveis. Portanto, um K4 maior precisaria de melhorias arquiteturais e de sistemas, não apenas mais hardware.
A arquitetura do K3 foi projetada para escalar ainda mais
O blog técnico do Kimi K3 da Moonshot descreve o Kimi Delta Attention e Attention Residuals como a espinha dorsal de uma arquitetura projetada para escalar além do regime de trilhões de parâmetros. O Kimi Delta Attention fornece uma base de atenção eficiente, enquanto Attention Residuals recupera seletivamente representações através da profundidade do modelo em vez de acumulá-las uniformemente.
O K3 também utiliza Stable LatentMoE, ativando efetivamente 16 de 896 especialistas roteados. Quantile Balancing deriva a alocação de especialistas a partir de quantis da pontuação do roteador, e Per-Head Muon otimiza cabeças de atenção de forma independente. Essas escolhas apontam para os problemas que o K4 deve resolver: roteamento estável, utilização balanceada de especialistas, atenção eficiente para longos contextos e treinamento previsível em escala extrema.
Por que o Kimi K4 importaria se o Kimi K3 já é um modelo de 2,8T?
O Kimi K3 já opera em uma escala incomumente grande, então o K4 não pode ser avaliado simplesmente perguntando se tem mais parâmetros. A questão mais significativa é se computação adicional de treinamento produz melhor conclusão de tarefas, maior confiabilidade em horizontes longos e menor custo efetivo de inferência.
Uma avaliação útil do K4 deve, portanto, focar em quatro métricas:
- Taxa de conclusão de tarefas
- Confiabilidade de agentes de longo horizonte
- Taxa de sucesso em codificação
- Custo por tarefa concluída com sucesso
A última métrica é especialmente importante para desenvolvedores. Um modelo que custa menos por correção de repositório bem-sucedida pode ser mais valioso do que um modelo com pontuação de benchmark mais alta, mas significativamente mais trajetórias fracassadas.
Especificações esperadas do Kimi K4
A tabela abaixo distingue a base técnica confirmada do K3 da reportagem e inferência sobre o K4. Esperado não significa anunciado. Campos desconhecidos devem permanecer desconhecidos até que a Moonshot AI publique um model card ou documentação de API.
| base da especificação | Kimi K3 confirmado | Kimi K4 reportado publicamente | Confiança |
|---|---|---|---|
| Status do modelo | Lançado | Em desenvolvimento | Reportado |
| Arquitetura | MoE esparso | Não divulgado; provável evolução do MoE | Inferência |
| Parâmetros totais | 2,8T | Reportadamente significativamente maior que K3 | Reportado; valor exato desconhecido |
| Parâmetros ativados | 104B | Não divulgado | Desconhecido |
| Configuração de especialistas | 896 roteados; 16 selecionados; 2 compartilhados | Não divulgado | Desconhecido |
| Janela de contexto | 1.048.576 tokens | Provavelmente pelo menos 1M, mas não confirmado | Esperado |
| Atenção | KDA mais Gated MLA | Possível KDA de próxima geração | Inferência |
| Visão nativa | MoonViT-V2 | Continuidade multimodal provável | Esperado |
| Pesos abertos | Disponíveis | Não confirmado | Desconhecido |
| ID do modelo na API | kimi-k3 | Não anunciado | Desconhecido |
| Data de lançamento | Disponível | Não anunciado | Desconhecido |
A restrição mais importante é a linha de parâmetros. Significativamente maior não estabelece um tamanho exato. Da mesma forma, a janela de contexto de um milhão de tokens do K3, o design multimodal e o lançamento com pesos abertos não podem ser copiados na folha de especificações do K4 como fatos confirmados. São expectativas plausíveis, não compromissos de produto publicados.
Que recursos o Kimi K4 poderia introduzir?
-
Escalonamento MoE esparso maior, porém mais eficiente
A expectativa óbvia é um modelo Mixture-of-Experts maior. A questão mais importante é se o K4 melhora a relação entre capacidade total, capacidade ativada e custo de serviço. Aumentar o pool de especialistas sem melhorar o roteamento pode criar especialistas subutilizados, especialistas sobrecarregados, gargalos de comunicação e treinamento instável.
Um avanço crível do K4 combinaria capacidade adicional com melhor balanceamento de carga, especialistas mais especializados, menores razões de ativação ou coordenação mais forte entre especialistas. Nenhum desses detalhes foi divulgado, portanto um artigo deve descrevê-los como metas de engenharia, e não como recursos vazados.
Um Kimi Delta Attention mais avançado
Kimi Delta Attention é central para o design de longo contexto do K3. Uma versão de próxima geração poderia melhorar a recuperação em entradas de um milhão de tokens, reduzir a memória do estado de atenção e preservar informações importantes durante execuções de agentes longas. O teste prático não seria apenas o tamanho da janela de contexto, mas se o modelo consegue encontrar, combinar e agir sobre evidências distantes sem segmentação agressiva ou recuperação repetida.
Agentes de longo horizonte mais confiáveis
Kimi K3 já está posicionado para trabalhos técnicos e de conhecimento de longa duração. Suas demonstrações oficiais incluem desenvolvimento de compiladores, otimização de kernels de GPU, codificação científica, pesquisa interativa, desenvolvimento de jogos e fluxos de trabalho de design de chips. O K4 precisaria transformar essas demonstrações impressionantes em execução cotidiana mais consistente.
As métricas que importam são menos chamadas de ferramenta desnecessárias, maior retenção de objetivos, melhor recuperação após ações fracassadas, verificação mais confiável e menor variância entre execuções. Um modelo que completa um benchmark difícil uma vez, mas se comporta de forma imprevisível em produção, é menos útil do que um modelo ligeiramente mais fraco com execução confiável.
Codificação e engenharia de software mais fortes
É provável que o K4 permaneça fortemente focado em codificação, mas a fronteira já avançou além de gerar funções isoladas. Modelos competitivos de engenharia de software devem mapear repositórios, entender dependências, operar terminais, modificar múltiplos arquivos, executar testes, diagnosticar falhas e revisar sua abordagem.
O K3 já é forte no ProgramBench, SWE-Marathon, FrontierSWE e tarefas de terminal. A oportunidade mais clara do K4 é fechar a lacuna restante na correção profunda de repositórios, preservando a vantagem do K3 em trabalho sustentado de múltiplas etapas.
Multimodalidade nativa mais profunda
O K3 combina texto e visão no nível do modelo, e os exemplos de produto da Moonshot expandem essa capacidade para edição de vídeo e desenvolvimento com visão no loop. O K4 poderia melhorar fluxos de trabalho de screenshot-para-código, raciocínio sobre gráficos e documentos, compreensão temporal de vídeo, testes de interface e agentes que inspecionam resultados visuais antes de continuar.
A distinção-chave é entre aceitar imagens e usar percepção dentro de um loop fechado. Um agente multimodal deve observar um resultado renderizado, identificar a discrepância, editar seu trabalho e verificar a revisão. Isso é mais exigente do que responder a uma única pergunta de imagem.
Melhor eficiência de inferência e implantação
Um modelo maior que o K3 pode ser difícil de auto-hospedar mesmo que seus pesos sejam publicados. O K4 se beneficiaria de treinamento ciente de quantização, paralelismo de especialistas eficiente, decodificação especulativa, gestão otimizada de estado KV e variantes companheiras menores. Para a maioria das equipes, o acesso por API hospedada pode continuar sendo mais prático do que operar diretamente um modelo esparso de fronteira.
Que desempenho de benchmark o Kimi K4 precisaria?
O K4 não possui resultados de benchmark publicados. A abordagem responsável é estabelecer a base de desempenho criada pelo K3 e pelos concorrentes de fronteira atuais, e então identificar onde um sucessor precisaria melhorar. A base expandida abaixo cobre raciocínio, codificação, operação de terminal, pesquisa profunda, trabalho de conhecimento com agentes e tarefas de planilha. Todos os valores vêm do model card oficial do Kimi K3 vinculado no cabeçalho da tabela.
| suíte de benchmark oficial | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|---|
| GPQA Diamond | 93.5 | 94.1 | 92.6 | 91.0 |
| DeepSWE | 67.5 | 73.0 | 70.0 | 59.0 |
| ProgramBench | 77.8 | 77.6 | 76.8 | 71.9 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 88.0 | 84.6 |
| FrontierSWE | 81.2 | 71.3 | 86.6 | 66.7 |
| SWE-Marathon | 42.0 | 39.0 | 35.0 | 40.0 |
| Kimi Code Bench 2.0 | 72.9 | 64.8 | 76.9 | 71.7 |
| BrowseComp | 91.2 | 90.4 | 88.0 | 84.3 |
| DeepSearchQA (F1) | 95.0 | Not reported | 94.2 | 93.1 |
| ResearchRubrics | 76.2 | 73.8 | Not reported | 73.5 |
| GDPval-AA v2 (Elo) | 1686 | 1736 | 1747 | 1593 |
| SpreadsheetBench 2 | 34.8 | 32.4 | 34.7 | 31.6 |
Esses são resultados de comparação reportados pela Moonshot e não uma única tabela independente controlada. Alguns modelos foram avaliados através de diferentes estruturas de agentes, e as notas oficiais descrevem fallbacks, cyberguards, substituições de hardware, configurações de raciocínio e procedimentos específicos de benchmark. GDPval-AA v2 é uma classificação Elo e não deve ser comparada numericamente com linhas baseadas em porcentagem. Pequenas diferenças de pontuação não devem ser interpretadas como superioridade universal.
Snapshot oficial de benchmarks de codificação

Comparação oficial de codificação do Kimi K3. A imagem é um gráfico publicado pela Moonshot; consulte o model card atual e notas de rodapé para a tabela numérica mais recente e a metodologia de avaliação.
Resultados de benchmark e interpretação
GPT-5.6 Sol lidera o Kimi K3 no DeepSWE, indicando uma vantagem em reparo de software difícil em nível de repositório. Claude Fable 5 lidera o FrontierSWE, enquanto o K3 permanece confortavelmente à frente do GPT-5.6 Sol e do Claude Opus 4.8 nesse benchmark.
O perfil do K3 torna-se mais distinto em trabalho sustentado. Ele lidera ligeiramente o ProgramBench e registra o resultado mais forte no SWE-Marathon na comparação selecionada. Também lidera o BrowseComp e essencialmente empata com o Claude Fable 5 no SpreadsheetBench 2.
Para o K4, o objetivo não deve ser um aumento percentual fixo em todos os gráficos. O alvo mais útil é melhorar o reparo profundo de bases de código e a confiabilidade no uso de computador sem perder as forças do K3 em codificação de longo horizonte, navegação e trabalho de conhecimento com agentes.

Comparação oficial de agentes gerais e visuais do Kimi K3. Fonte: página do modelo Kimi K3 da Moonshot AI.
Kimi K4 vs Kimi K3, GPT-5.6 Sol e Claude Fable 5
Uma comparação pré-lançamento não pode atribuir ao K4 pontuações que não existem. No entanto, pode mostrar a posição competitiva que se espera que o K4 ocupe se estender a linha K3.
| Dimensão | Posição esperada do Kimi K4 | Kimi K3 confirmado | Referências fechadas: GPT-5.6 Sol e Claude Fable 5 |
|---|---|---|---|
| Disponibilidade | Em desenvolvimento | Disponível | Disponível |
| Abertura do modelo | Desconhecida | Pesos abertos | Proprietário |
| Contexto confirmado | Desconhecido | 1M tokens | Definido pelo provedor ou classe 1M |
| Força principal | Inteligência de fronteira em maior escala | Codificação e trabalho de conhecimento de longo horizonte | Raciocínio, codificação e uso de computador de fronteira |
| Multimodalidade | Esperada; não confirmada | Visão nativa | Multimodal |
| Auto-hospedagem | Desconhecida | Possível com infraestrutura substancial | Não disponível |
| Maturidade de agentes | Espera-se melhora | Forte | Forte |
| Custo de implantação | Desconhecido e potencialmente alto | Alto para auto-hospedagem; API hospedada disponível | Apenas API hospedada |
| Principal motivo para observar | Escala mais possível abertura | Base de fronteira aberta verificada | Capacidade máxima de modelos fechados |
Resultado da comparação
Kimi K3 se diferencia por pesos abertos, uma janela de contexto de um milhão de tokens e forte desempenho de longo horizonte. GPT-5.6 Sol permanece mais forte em algumas tarefas difíceis de raciocínio e reparo de repositório, enquanto o Claude Fable 5 é particularmente competitivo em engenharia de software e agentes de uso de computador.
Se o K4 permanecer aberto ou amplamente acessível enquanto fecha essas lacunas de capacidade, sua importância vai além de uma maior contagem de parâmetros. Mostraria que sistemas abertos ou semiabertos podem se aproximar da confiabilidade das mais fortes plataformas proprietárias de agentes. Se o K4 se tornar fechado e extremamente caro de servir, a distinção prática seria muito menor.
O que o Kimi K4 poderia significar para IA com pesos abertos?
O K3 já demonstra que o desenvolvimento com pesos abertos está entrando em uma escala antes associada quase exclusivamente a laboratórios proprietários. O K4 poderia empurrar ainda mais esse limite, mas abertura tem várias camadas: pesos baixáveis, código utilizável, licença viável, inferência reproduzível, requisitos de hardware acessíveis e APIs hospedadas acessíveis.
Um modelo pode ser tecnicamente aberto, mas economicamente inacessível. A escala de 2,8T do K3 significa que auto-hospedagem séria requer infraestrutura substancial, mesmo com ativação esparsa e quantização. Um K4 ainda maior poderia ampliar a lacuna entre pesquisadores que conseguem inspecionar os pesos e organizações que conseguem operar o modelo de forma eficiente.
Para o ecossistema mais amplo, o lançamento ideal do K4 combinaria pesos transparentes, receitas de inferência eficientes, comportamento forte de uso de ferramentas e uma API hospedada. Essa combinação permitiria que pesquisadores estudassem o modelo, empresas o implantassem via API e equipes especializadas o adaptassem para cargas de trabalho privadas ou reguladas.
Quando o Kimi K4 será lançado?
A Moonshot AI não anunciou uma data de lançamento do Kimi K4. Relatos públicos conectam o modelo à aquisição de computação e ao planejamento de desenvolvimento. Isso torna pouco confiável qualquer mês, trimestre ou contagem regressiva precisos.
Também é desconhecido se o K4 aparecerá simultaneamente no produto web Kimi, Kimi Code, Kimi Work, na API da Moonshot e em um repositório com pesos abertos. O K3 está disponível em várias dessas superfícies, mas o K4 pode seguir um lançamento escalonado ou uma estratégia de distribuição diferente.
Os sinais que valem a pena observar são um blog técnico oficial da Moonshot, um repositório de modelo verificado, documentação da Kimi Platform, uma licença publicada e um model card com detalhes de avaliação reproduzíveis. Postagens sociais e rumores sobre parâmetros devem permanecer secundários até que uma dessas fontes apareça.
Como acessar modelos Kimi enquanto aguarda o K4
O K4 não está atualmente chamável. Desenvolvedores podem, em vez disso, avaliar a arquitetura atual através do Kimi K3 no CometAPI. O ID atual do modelo é texto de código simples: kimi-k3. A requisição usa POST /v1/chat/completions. Não envie requisições de produção para um identificador kimi-k4 especulativo até que uma página de integração oficial o publique.
Crie uma conta no CometAPI e gere uma chave de API. Armazene a chave em uma variável de ambiente em vez de codificá-la diretamente no código-fonte da aplicação.
from openai import OpenAI client = OpenAI( api_key="YOUR_COMETAPI_KEY", base_url="https://api.cometapi.com/v1", ) response = client.chat.completions.create( model="kimi-k3", messages=[ { "role": "user", "content": "Analyze the architecture of this software project." } ], ) print(response.choices[0].message.content)
O bloco de código é Python. O endpoint, o ID do modelo, os nomes dos parâmetros e as palavras-chave do código são intencionalmente apresentados como código em vez de hyperlinks. Quando o K4 estiver disponível, desenvolvedores devem confirmar seu identificador real de modelo, compatibilidade de endpoint, modalidades suportadas e preços antes de alterar o roteamento em produção.
O que ainda não sabemos sobre o Kimi K4
Um artigo responsável pré-lançamento deve preservar as seguintes incógnitas em vez de preenchê-las com estimativas da comunidade:
- Contagens finais de parâmetros totais e ativados
- Número de especialistas, especialistas compartilhados e estratégia de roteamento
- Janela de contexto e comprimento máximo de saída
- Modalidades de entrada e saída suportadas
- Status de pesos abertos, repositório e licença
- ID do modelo na API, endpoints, modos de raciocínio e preços
- Resultados oficiais de benchmarks e estruturas de avaliação
- Formatos de quantização e requisitos de hardware para auto-hospedagem
- Disponibilidade do produto e data de lançamento
Manter esta seção explícita impede que especificações previstas sejam repetidas posteriormente como fatos oficiais. Também torna o artigo mais fácil de atualizar quando a Moonshot AI publicar documentação primária.
Perguntas frequentes
Kimi K4 já foi lançado?
Não. Não há model card oficial do Kimi K4, documentação de API ou anúncio público de lançamento. A discussão atual baseia-se principalmente em relatos de que a Moonshot AI está preparando um sucessor maior para o K3.
Qual será o tamanho do Kimi K4?
O tamanho exato é desconhecido. Relatos dizem que pode ser significativamente maior do que o K3, mas alegações específicas de múltiplos trilhões de parâmetros não foram confirmadas pela Moonshot AI.
O Kimi K4 será open source?
Isso não foi confirmado. O K3 possui pesos abertos sob a Kimi K3 License, mas uma estratégia de lançamento anterior não garante a mesma distribuição para o K4.
O Kimi K4 terá uma janela de contexto de um milhão de tokens?
É razoável esperar que o K4 mantenha ou melhore a capacidade de longo contexto do K3, mas a Moonshot AI não publicou um limite de contexto do K4.
Desenvolvedores podem usar o Kimi K4 via CometAPI agora?
Não há rota de modelo K4 confirmada. Os desenvolvedores podem atualmente testar o Kimi K3 e compará-lo com outros modelos de fronteira através da mesma camada de integração.
Conclusão
Kimi K4 não deve ser reduzido a uma contagem de parâmetros rumorada. O K3 já prova que a Moonshot AI pode combinar escala extrema com modelo esparso, contexto de um milhão de tokens, visão nativa, pesos abertos e comportamento de agentes de longo horizonte. A verdadeira questão é se o K4 pode transformar essa escala em engenharia de software mais confiável, uso de computador mais forte, melhores loops de feedback multimodais e inferência mais eficiente.
Os detalhes mais importantes permanecem desconhecidos: arquitetura exata, data de lançamento, pontuações de benchmark, licença, acesso à API e custo de serviço. Até a Moonshot publicar documentação primária, toda especificação do K4 além do sinal de desenvolvimento reportado deve ser rotulada como expectativa ou inferência.
Os desenvolvedores não precisam esperar para avaliar a direção atual da Moonshot AI. Kimi K3 já está disponível via CometAPI, fornecendo uma base prática para codificação, raciocínio de longo contexto, análise multimodal e fluxos de trabalho com agentes antes da chegada do Kimi K4.
