TL;DR
Grok 4.6 é a opção padrão mais robusta se você quer uma API frontier gerenciada para trabalho agentivo em código e conhecimento: ele marca 61 no Artificial Analysis Intelligence Index, gera mais rápido em medições independentes atuais e começa em $2/$6 por milhão de tokens de entrada/saída.
Kimi K3 é a escolha mais flexível quando comprimento de contexto e abertura do modelo importam. Ele combina 2,8 trilhões de parâmetros, 104B de parâmetros ativos e uma janela de contexto de aproximadamente 1M de tokens, além de pesos abertos e capacidades multimodais nativas. Seu preço de API hospedada é mais alto, em $3/$15 por milhão de tokens de entrada/saída, mas acertos de cache custam apenas $0,30 por milhão de tokens.
Conclusão: escolha o Grok 4.6 para uma API de agentes hospedada e econômica; escolha o Kimi K3 por 1M de contexto, pesos abertos e controle de infraestrutura. Para programação, teste ambos nos seus próprios repositórios porque os fornecedores publicam versões e harnesses de benchmark diferentes.
Principais pontos
- O Grok 4.6 foi lançado em 12 de agosto de 2026 com ênfase específica em agentes de longa duração, trabalho em bases de código, trabalho de conhecimento e projetos interativos ou visuais mais ambiciosos.
- O Kimi K3 é o modelo de pesos abertos com 2,8T de parâmetros da Moonshot AI, com Kimi Delta Attention, Attention Residuals, visão nativa e uma janela de contexto de 1M de tokens.
- A inteligência geral independente está quase empatada: 61 para Grok 4.6 versus 60 para Kimi K3.
- O Grok 4.6 tem o menor preço de tokens oficial: $2 entrada / $6 saída contra $3 entrada / $15 saída do Kimi K3.
- O Kimi K3 oferece aproximadamente o dobro da capacidade de contexto e pesos abertos; o Grok 4.6 é proprietário, mas é mais eficiente em custo e turnos em várias avaliações agentivas independentes.
Grok 4.6 vs Kimi K3: Comparação rápida
| Especificação | Grok 4.6 | Kimi K3 |
|---|---|---|
| Desenvolvedor | SpaceXAI / xAI | Moonshot AI / Kimi |
| Data de lançamento | 12 de agosto de 2026 | 16 de julho de 2026 |
| ID do modelo | grok-4.6 | kimi-k3 |
| Arquitetura | Não divulgada publicamente | MoE; KDA + AttnRes + Stable LatentMoE |
| Parâmetros totais | Não divulgados | 2,8T |
| Parâmetros ativos | Não divulgados | 104B |
| Experts | Não divulgados | 896 no total; 16 ativados/token |
| Janela de contexto | 500.000 tokens | 1.048.576 / cerca de 1M tokens |
| Entrada / saída | Texto + imagem → texto | Texto + imagem → texto |
| Raciocínio | Configurável | Sempre ativo; baixo / alto / máximo |
| Uso de funções/ferramentas | Function calling + structured outputs | ToolCalls, tool_choice, dynamic tool loading |
| Pesos abertos | Não | Sim |
| AA Intelligence Index | 61 | 60 |
| Preço oficial entrada/saída | $2 / $6 por MTok | $3 / $15 por MTok |
| Melhor ajuste | Agentes hospedados, código, conhecimento | Longo contexto, implantação com pesos abertos, código + raciocínio visual |
O que é o Grok 4.6?
Grok 4.6 é o modelo frontier da SpaceXAI para programação, tarefas agentivas e trabalho de conhecimento. A empresa diz que o lançamento foi construído em torno de agentes de longa duração e de trabalhos interativos e visuais mais ambiciosos, em vez de ser apenas uma atualização de benchmark estático. Na prática, isso significa que o modelo foi projetado para permanecer em uma tarefa ao longo de muitas etapas: pesquisar um tópico, navegar por uma base de código, analisar informações, chamar ferramentas e iterar em direção a um aplicativo ou artefato de trabalho finalizado.
O que mudou em relação ao Grok 4.5?
A SpaceXAI relata uma execução de treinamento suplementar mais longa usando dados de raciocínio gerados por modelo e curados, conceitos técnicos avançados, dados de engenharia de alta qualidade e um otimizador e receita de treinamento aprimorados. A equipe então regenerou trajetórias de SFT com o Grok 4.5 em esforços de raciocínio e harnesses de agentes, filtrou traços problemáticos e aplicou aprendizado por reforço agentivo em ambientes que abrangem programação geral, otimização de kernel, desenvolvimento web, CAD e trabalho de conhecimento.
O resultado prático é um modelo que não apenas pontua mais alto, mas também demonstra mais autoavaliação e verificação em trajetórias mais longas. Esse comportamento importa para agentes porque o custo de um pequeno erro se acumula quando um modelo pode editar arquivos, chamar ferramentas ou executar um plano de várias etapas sem intervenção humana constante.
Especificações do Grok 4.6
| Propriedade | Grok 4.6 |
|---|---|
| Contexto | 500.000 tokens |
| Modalidades | Entrada de texto e imagem; saída de texto |
| Raciocínio | Raciocínio configurável |
| Capacidades nativas API | Function calling e saídas estruturadas |
| Corte de conhecimento | 1º de fevereiro de 2026 |
| Preço contexto curto | $2 entrada / $0,50 cache / $6 saída por MTok |
| Limite contexto longo | ≥200K tokens de prompt; $4 / $1 / $12 |
O que é o Kimi K3?
Kimi K3 é o modelo agentivo multimodal de destaque da Moonshot AI com pesos abertos. Ele combina 2,8 trilhões de parâmetros totais com uma janela de contexto de 1M de tokens e visão nativa, posicionando-o para programação de longo horizonte, trabalho de conhecimento fim a fim, raciocínio e tarefas de software ancoradas em visão.
Ao contrário do Grok 4.6, o Kimi K3 expõe seus pesos de modelo. O card oficial atual identifica 104B de parâmetros ativos durante a inferência, então seu caminho de computação é muito menor que a contagem total de 2,8T de parâmetros, embora implantar o modelo completo ainda exija infraestrutura substancial.
KDA, AttnRes e um MoE mais esparso
A arquitetura é um dos maiores diferenciadores do K3. A Moonshot diz que o Kimi Delta Attention (KDA) e os Attention Residuals (AttnRes) foram projetados para melhorar o fluxo de informação em longas sequências e camadas profundas do modelo. O Stable LatentMoE aumenta a esparsidade para que 16 de 896 experts sejam ativados por token. Junto com mudanças de treinamento e de receita de dados, a Moonshot relata cerca de 2,5× melhor eficiência de escalonamento geral do que o Kimi K2.
Especificações do Kimi K3
| Propriedade | Kimi K3 |
|---|---|
| Parâmetros total/ativos | 2,8T / 104B |
| Arquitetura | MoE com KDA + AttnRes + Stable LatentMoE |
| Experts | 896; 16 ativados por token |
| Contexto | 1M tokens |
| Visão | Compreensão visual nativa |
| Raciocínio | Sempre habilitado; baixo / alto / máximo |
| Ferramentas | ToolCalls, constraints de tool_choice, dynamic tool loading |
| Pesos abertos | Disponíveis no Hugging Face |
| Preço oficial | $0,30 cache hit / $3 entrada / $15 saída por MTok |
Grok 4.6 vs Kimi K3: Comparação de benchmarks
A comparação direta mais limpa é o Artificial Analysis Intelligence Index independente porque ambos os modelos são avaliados sob o mesmo framework. As pontuações atuais são 61 para o Grok 4.6 (alta) e 60 para o Kimi K3 (máx). Uma diferença de um ponto é muito pequena para justificar a afirmação de que um modelo está categoricamente “uma geração à frente”. A pergunta mais útil é onde cada modelo obtém sua pontuação.
| Métrica independente | Grok 4.6 | Kimi K3 | Vantagem |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 por 1 ponto |
| Velocidade de saída | 65,8 tok/s | 40,7 tok/s | Grok 4.6 |
| Tempo até o primeiro token | ~32,3 s | 3,27 s | Kimi K3 |
| Janela de contexto | 500K | ~1,05M | Kimi K3 |
Desempenho em programação
A SpaceXAI publica vários resultados de programação e engenharia de software para o Grok 4.6: 69,9% no CursorBench 3.2, 65,9% no DeepSWE 1.1, 61,3% no FrontierCode 1.1 Extended, 56,4% no APEX-SWE e 26,0% no Terminal-Bench 3.0. Eles são significativos porque cobrem edição de repositórios, engenharia de software agentiva e trabalho em terminal, em vez de apenas trivia de autocompletar código.
| Benchmark de programação (fornecedor) | Pontuação |
|---|---|
| CursorBench 3.2 | 69,9% |
| DeepSWE 1.1 | 65,9% |
| FrontierCode 1.1 Extended | 61,3% |
| APEX-SWE | 56,4% |
| Terminal-Bench 3.0 | 26,0% |
Para o Kimi K3, a Moonshot publica um conjunto diferente, porém amplo, de programação. Seu material oficial de lançamento relata 67,5 no DeepSWE, 88,3 no Terminal-Bench 2.1, 81,2 no FrontierSWE, 77,8 no ProgramBench e 42,0 no SWE Marathon. A ressalva importante é que o Terminal-Bench 2.1 e o 3.0 são versões diferentes, e o FrontierSWE não é a mesma avaliação que o FrontierCode. Essas linhas não devem ser tratadas como vitórias equivalentes apenas pelo número bruto.

Fonte: Moonshot AI / Kimi
Trabalho agentivo e de conhecimento
Trabalho agentivo é onde o Grok 4.6 parece mais forte. A SpaceXAI relata 1753 de Elo no GDPVal-AA v2, 57,5% no APEX-Agents e 1577 de Elo no AA-Briefcase. O Artificial Analysis destaca independentemente o mesmo padrão: os maiores ganhos do Grok 4.6 estão em trabalhos de longo horizonte e uso de ferramentas, e não apenas em raciocínio estático.
O Kimi K3 também mira agentes de trabalho de conhecimento. O conjunto de lançamento da Moonshot mostra resultados fortes no BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 e avaliações de agentes visuais. Mais importante para desenvolvedores, a API do Kimi expõe constraints de tool choice e dynamic tool loading, que são controles práticos quando um agente deve usar sistemas corporativos ou recuperar fatos antes de responder.

Fonte: Moonshot AI / Kimi
Multimodal e raciocínio visual
O Kimi K3 tem uma narrativa de multimodalidade em nível de arquitetura mais clara: a Moonshot descreve capacidades de visão nativas e demonstra especificamente “visão no loop” para desenvolvimento de jogos, engenharia de frontend e CAD, onde o modelo pode inspecionar feedback visual e revisar código.
O Grok 4.6 também aceita entrada de texto e imagem e a SpaceXAI diz que o modelo produz primeiras passagens mais fortes em projetos visuais e interativos do que o Grok 4.5. A diferença é menos sobre se qualquer um dos modelos pode ver imagens e mais sobre filosofia de implantação: o Kimi expõe um modelo multimodal aberto, enquanto o Grok empacota compreensão visual dentro de uma API frontier gerenciada e um ecossistema de agentes.
Janela de contexto: 500K vs 1M
O Grok 4.6 suporta 500.000 tokens, enquanto o Kimi K3 suporta cerca de 1 milhão de tokens. Isso torna o Kimi a escolha óbvia quando a carga de trabalho realmente exige mais de 500K tokens em uma única requisição — por exemplo, repositórios muito grandes, coleções de pesquisa com vários livros ou rastros de agentes excepcionalmente longos.
No entanto, o tamanho do contexto é capacidade, não garantia de qualidade de recuperação ou raciocínio. Para sistemas de produção, teste o modelo nos seus reais modos de falha de longos contextos: rastreamento de dependências entre arquivos, recuperação de fatos distantes, detecção de contradições e persistência de instruções. Geração aumentada por recuperação ainda pode ser mais barata e controlável do que enviar um milhão de tokens em toda requisição.
Velocidade e latência
O Artificial Analysis atualmente mede o Grok 4.6 em 65,8 tokens de saída por segundo e o Kimi K3 em 40,7 tokens por segundo. Uma vez que a geração começa, o Grok é materialmente mais rápido nessa medição. Mas o padrão do primeiro token é o oposto: o Kimi K3 tem um TTFT medido de 3,27 segundos, enquanto a medição de provedor atual do Grok 4.6 é muito mais lenta para começar o streaming.
Isso cria uma distinção útil de produto. Para experiências de chat interativo ou IDE, um tempo rápido até o primeiro token pode fazer o Kimi parecer responsivo mesmo que a resposta completa leve mais tempo. Para gerações longas e execuções de agentes, a maior taxa de geração do Grok pode reduzir a cauda da requisição. Provedor, região, esforço de raciocínio, estado de cache e tamanho da requisição podem alterar esses números, então trate-os como um instantâneo atual e não uma propriedade permanente.
Preços da API: Grok 4.6 vs Kimi K3
Em comprimentos de contexto padrão, o Grok 4.6 custa $2 por milhão de tokens de entrada, $0,50 por milhão de tokens em cache e $6 por milhão de tokens de saída. Para prompts com 200K tokens ou mais, a xAI cobra toda a requisição a taxas de contexto longo de $4 entrada, $1 cache e $12 saída por milhão de tokens.
O Kimi usa preços pay-as-you-go planos em toda a sua janela de contexto de 1M. A API do Kimi lista $0,30 por milhão de tokens de cache-hit, $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. Isso significa que o Kimi é mais barato em acertos de cache, mas muito mais caro em tokens de saída novos; a vantagem de preço do Grok diminui quando requisições do Grok cruzam o limiar de contexto longo de 200K.

Preços oficiais de API por 1M de tokens. Requisições de contexto longo do Grok (≥200K tokens de prompt) usam taxas mais altas não mostradas no gráfico. Fonte: SpaceXAI e preços da API Kimi
| Preço / 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| Entrada oficial contexto curto | $2,00 | $3,00 |
| Cache hit oficial | $0,50 | $0,30 |
| Saída oficial | $6,00 | $15,00 |
| Preço contexto longo | ≥200K: $4 / $1 / $12 | Preço plano até 1M de contexto |
| Entrada na CometAPI | $1,60 | $2,40 |
| Saída na CometAPI | $4,80 | $12,00 |
Na CometAPI, o Grok 4.6 está atualmente listado a $1,60 entrada / $4,80 saída por milhão de tokens, enquanto o Kimi K3 está listado a $2,40 entrada / $12 saída. Ambos estão 20% abaixo dos preços de entrada/saída oficiais dos provedores mostrados em suas páginas de modelo da CometAPI no momento da escrita.
Pesos abertos vs modelo proprietário
O Kimi K3 é um modelo de pesos abertos com pesos para download. Isso habilita pesquisa, controle fino de infraestrutura, arquiteturas de inferência privadas e implantação via stacks de inferência de terceiros. Não significa que o K3 seja leve: um modelo de 2,8T de parâmetros é um projeto sério de sistemas mesmo com esparsidade MoE e formatos de baixa precisão.
O Grok 4.6 é proprietário. Sua arquitetura e contagem de parâmetros não são divulgadas publicamente e desenvolvedores o acessam como um serviço gerenciado. A troca é simplicidade operacional: você não precisa construir um cluster de inferência, gerenciar pesos de modelo ou otimizar kernels para obter desempenho agentivo de nível frontier.
Pontos fortes e trade-offs
| Modelo | Pontos fortes | Trade-offs |
|---|---|---|
| Grok 4.6 | Menor preço de API hospedada; 61 AA Intelligence; geração mais rápida medida; fortes resultados em agentes de longo horizonte; stack de ferramentas xAI integrada | Contexto de 500K; pesos fechados; preços dobram em contexto longo; TTFT medido mais lento |
| Kimi K3 | ~1M de contexto; pesos abertos; MoE de 2,8T; multimodalidade nativa; suite forte em código/agentes; custo de cache-hit muito baixo | Maior preço por tokens de saída; geração de tokens medida mais lenta; auto-hospedagem completa exige infraestrutura pesada |
Grok 4.6 vs Kimi K3: qual escolher?
| Caso de uso | Recomendado | Por quê |
|---|---|---|
| API frontier padrão | Grok 4.6 | Menor preço com leve vantagem de inteligência independente |
| Agente de trabalho de conhecimento de longa duração | Grok 4.6 | Evidência mais forte de GDPVal-AA e AA-Briefcase |
| Programação em escala de repositório | Teste ambos | Ambos são projetados para programação de longo horizonte; suites de benchmark diferem |
| Prompt >500K tokens | Kimi K3 | Aproximadamente 1M de contexto |
| Pesquisa com pesos abertos | Kimi K3 | Pesos e arquitetura disponíveis |
| Inferência privada/auto-gerenciada | Kimi K3 | Pesos abertos permitem implantação customizada |
| Baixo custo de cache-hit | Kimi K3 | $0,30/MTok em cache-hit |
| Menor custo de tokens de saída novos | Grok 4.6 | $6/MTok vs $15/MTok em contexto padrão |
| Primeira resposta visível mais rápida | Kimi K3 | TTFT muito menor medido |
| Geração longa mais rápida | Grok 4.6 | Maior taxa medida de tokens/s de saída |
| Workflows de código visual / CAD / jogos | Kimi K3 | Visão nativa + foco oficial em “visão no loop” |
Recomendação geral: o Grok 4.6 é a API hospedada padrão mais forte para a maioria dos desenvolvedores de agentes. O Kimi K3 é o modelo frontier mais flexível quando 1M de contexto, pesos abertos e controle de implantação fazem parte do requisito e não são extras opcionais.
Como acessar Grok 4.6 e Kimi K3 via CometAPI
Ambos os modelos estão ativos na CometAPI. A página do modelo Grok 4.6 lista o ID do modelo grok-4.6 e suporte para acesso estilo Chat Completions/Responses, enquanto a página do modelo Kimi K3 expõe kimi-k3 pelo endpoint unificado da CometAPI. Isso facilita A/B testing porque você pode alternar IDs de modelo mantendo autenticação e a maior parte da tubulação da aplicação constante.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Review this repository bug and propose a tested fix."}
],
)
print(model, response.choices[0].message.content)
Para uma avaliação de produção, mantenha o prompt, as ferramentas, o snapshot do repositório e os critérios de sucesso idênticos. Acompanhe não apenas a qualidade da resposta, mas também o sucesso das chamadas de ferramentas, número de turnos, total de tokens de entrada/saída, latência e recuperação de chamadas de ferramentas com falha. Isso é mais preditivo do custo real do agente do que uma única pontuação de benchmark.
Conclusão
O resultado mais importante da comparação entre Grok 4.6 e Kimi K3 é que sua inteligência de topo está muito mais próxima do que seus designs de produto. A avaliação independente atualmente os coloca em 61 versus 60, mas a economia e as escolhas de implantação ao redor são muito diferentes.
O Grok 4.6 é otimizado como um serviço frontier gerenciado: preços mais baixos para tokens novos, benchmarks agentivos fortes, geração mais rápida medida e um caminho de ferramenta/API maduro. O Kimi K3 é otimizado para flexibilidade: uma janela de contexto de 1M, escala MoE de 2,8T, multimodalidade nativa e pesos abertos.
Para a maioria dos desenvolvedores que simplesmente precisam do melhor modelo hospedado padrão para programação e agentes de longa duração, o Grok 4.6 é o ponto de partida mais seguro. Se seu sistema depende de >500K de contexto, implantação com pesos abertos, código visual ou controle sobre a stack de inferência, o Kimi K3 pode ser a melhor escolha arquitetural mesmo com um preço de tokens hospedado mais alto.
Perguntas frequentes
O Grok 4.6 é mais inteligente que o Kimi K3?
No Artificial Analysis Intelligence Index atual, o Grok 4.6 marca 61 e o Kimi K3 marca 60. É uma liderança estreita, não um gap decisivo. O desempenho em nível de tarefa pode se inverter dependendo da carga de trabalho.
Qual é melhor para programação?
Ambos são modelos credíveis para programação. O Grok 4.6 tem resultados agentivos fortes em programação e preços hospedados mais baixos; o Kimi K3 oferece uma janela de contexto maior, pesos abertos e resultados sólidos em código de repositório/visual. Use o benchmark do seu próprio repositório porque os fornecedores relatam versões de benchmark diferentes.
Qual modelo possui a maior janela de contexto?
O Kimi K3 suporta cerca de 1M de tokens, aproximadamente o dobro do contexto de 500K tokens do Grok 4.6.
Qual é mais barato?
Para tokens novos em contexto padrão, o Grok 4.6 é mais barato com $2 entrada / $6 saída por MTok contra $3 / $15 do Kimi K3. O Kimi tem taxa de cache-hit mais barata em $0,30/MTok, enquanto o Grok aplica taxas mais altas quando o prompt atinge 200K tokens.
Posso hospedar o Kimi K3 por conta própria?
O Kimi K3 tem pesos abertos disponíveis no Hugging Face, então implantação auto-gerenciada é possível. O modelo completo de 2,8T, contudo, é extremamente grande e requer infraestrutura de inferência multi-nó ou especializada para desempenho prático.
Posso hospedar o Grok 4.6 por conta própria?
Não há pesos públicos do Grok 4.6 disponíveis. O Grok 4.6 é entregue como um modelo proprietário gerenciado via SpaceXAI e APIs parceiras.
Posso acessar ambos a partir de uma única API?
Sim. A CometAPI atualmente lista o Grok 4.6 e o Kimi K3, permitindo que desenvolvedores os comparem por trás de uma API e camada de cobrança unificadas.
