DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 já está aqui: resultados de benchmark no nível do GPT-5.6 & desempenho em programação

CometAPI
AnnaAug 13, 2026
Grok 4.6 já está aqui: resultados de benchmark no nível do GPT-5.6 & desempenho em programação

TL; DR xAI lançou oficialmente o Grok 4.6 em 12 de agosto de 2026 e o disponibilizou via xAI API, Cursor e Grok Build. Ele tem uma janela de contexto de 500,000 tokens, aceita texto e imagens, oferece quatro níveis de esforço de raciocínio e tem corte de conhecimento em 1º de fevereiro de 2026. De acordo com o anúncio oficial do xAI sobre o Grok 4.6, ele iguala o GPT-5.6 Sol no Artificial Analysis Intelligence Index, um composto de nove avaliações. 

Os preços da API começam em $2 por milhão de tokens de entrada, $0.50 por milhão de tokens de entrada em cache e $6 por milhão de tokens de saída para prompts abaixo de 200,000 tokens. Quando um prompt atinge 200,000 tokens, toda a solicitação é cobrada nas tarifas de contexto longo de $4 de entrada, $1 de entrada em cache e $12 de saída por milhão de tokens. Para desenvolvedores que buscam acesso flexível a múltiplos modelos, plataformas como a CometAPI facilitam integrar o Grok 4.6 ao lado de outros modelos de ponta. O preço da API é 80% do preço do xAI.

Principais destaques

  • O xAI lansou oficialmente o Grok 4.6 em 12 de agosto de 2026; relatos anteriores da janela de lançamento agora estão obsoletos.
  • O ID do modelo na API é , e o modelo também está disponível no Cursor e no Grok Build.grok-4.6
  • Sua janela de contexto é de 500K tokens, com entrada de texto e imagem e saída apenas de texto.
  • A precificação padrão abaixo de 200K tokens no prompt é $2/M de entrada, $0.50/M de entrada em cache e $6/M de saída.
  • Um prompt de 200K tokens ou mais aciona tarifas mais altas para todos os tokens nessa solicitação, não apenas os acima do limite.
  • O esforço de raciocínio pode ser definido como low, medium, high ou xhigh; é o padrão documentado.
  • O Grok 4.6 iguala o GPT-5.6 Sol no Artificial Analysis Intelligence Index (pontuação de 61) e mostra grandes ganhos sobre o Grok 4.5 em codificação agêntica, trabalho de conhecimento e tarefas de longo horizonte.
  • Grok Imagine Image 2.0 é uma API separada de geração de imagens. O Grok 4.6 pode entender imagens, mas não retorna imagens geradas por si.

Especificações do Grok 4.6 e preço em um relance

As seguintes especificações estão confirmadas na documentação do modelo do xAI e nas notas de lançamento de 12 de agosto.

EspecificaçãoGrok 4.6
Data de lançamento oficialAugust 12, 2026
ID do modelo na APIgrok-4.6
PosicionamentoModelo carro-chefe para código, agentes e cargas gerais
Janela de contexto500,000 tokens
EntradasTexto e imagens
SaídaTexto
Limite documentado de saída de textoNenhum limite de saída de texto declarado pelo xAI
Controles de raciocínioLow, medium, high and xhigh
Esforço de raciocínio padrãoHigh
Corte de conhecimentoFebruary 1, 2026
Acesso nativo à APIDisponível
Acesso a ferramentas de códigoCursor e Grok Build
Acesso a eventos atuaisRequer as ferramentas Web Search ou X Search

Preços oficiais da xAI API

tabela de preços atual da API do xAI separa solicitações de contexto curto e de contexto longo.

Tamanho do promptEntrada por 1M tokensEntrada em cache por 1M tokensSaída por 1M tokens
Abaixo de 200,000 tokens$2.00$0.50$6.00
200,000 tokens ou mais$4.00$1.00$12.00

O limite é especialmente importante para agentes de bases de código. Quando o prompt da solicitação atinge 200,000 tokens, o xAI cobra a tarifa de contexto longo para todos os tokens nessa solicitação, não apenas a parcela acima do limite. Uma solicitação contendo 199,000 tokens de prompt pode, portanto, custar substancialmente menos do que uma contendo 200,000, mesmo que seus tamanhos sejam quase idênticos.

Nenhum desconto por lote está listado para o Grok 4.6 na documentação atual de preços do xAI. As equipes não devem presumir que trabalhos offline recebem os descontos disponíveis para certos outros modelos do xAI.

O que é o Grok 4.6?

Grok 4.6 é o mais recente modelo de linguagem de grande porte carro-chefe da SpaceXAI, lançado em 12 de agosto de 2026. Ele se baseia diretamente no Grok 4.5, aplicando uma execução de treinamento suplementar mais longa focada em dados curados gerados por modelos para raciocínio avançado e conceitos técnicos, conjuntos de dados de engenharia de alta qualidade, um otimizador aprimorado e RL expandido para cenários de codificação e trabalho de conhecimento.

O modelo mantém a mesma base subjacente de 1.5 trilhão de parâmetros de seu predecessor; os ganhos vêm principalmente do pós-treinamento, em vez de um aumento na escala de parâmetros. Ele é projetado especificamente para manter a eficácia ao longo de muitas etapas — seja pesquisando um tópico, analisando grandes quantidades de informação, navegando e editando um código que não conhece, ou transformando uma ideia de alto nível em um aplicativo ou artefato de trabalho polido. A SpaceXAI enfatiza um comportamento de autoverificação aprimorado em projetos de longo horizonte e desempenho mais forte em trabalhos interativos e visuais.

A diferença em relação a um chatbot tradicional é importante.

Um fluxo de trabalho convencional de LLM é:

Prompt → Gerar resposta

O Grok 4.6 é projetado para fluxos de trabalho mais próximos de:

Objetivo → Planejar → Pesquisar → Usar ferramentas → Modificar código → Testar → Avaliar → Continuar

o posicionamento atual do xAI enfatiza a capacidade do modelo de permanecer em projetos complexos por mais tempo, trabalhar em bases de código, pesquisar tópicos desconhecidos, construir aplicativos e verificar seu próprio trabalho.

Isso torna o Grok 4.6 particularmente relevante para o mercado em rápida expansão de agentes de codificação de IA e agentes autônomos.

Quais são os principais recursos do Grok 4.6?

Capacidade de agente de longa duração

A melhoria mais importante do Grok 4.6 é seu foco em tarefas de longa duração.

Em vez de otimizar apenas para respostas únicas, o modelo foi projetado para manter o progresso através de múltiplas etapas de um projeto.

Exemplos típicos incluem:

  • Construir um aplicativo
  • Depurar um repositório grande
  • Pesquisar um assunto desconhecido
  • Modificar vários componentes
  • Executar testes
  • Investigar falhas
  • Revisar a implementação
  • Verificar o resultado final

Este é um alvo fundamentalmente diferente dos benchmarks tradicionais de seguir instruções.

Desempenho avançado em codificação

Codificação é uma das áreas mais claras de melhoria do Grok 4.6.

Relatórios de benchmark atuais indicam:

  • 65.9% no DeepSWE 1.1
  • 69.9% no CursorBench 3.2
  • 61.3% no FrontierCode 1.1 Extended

Essas avaliações são particularmente relevantes porque visam o comportamento de agentes de codificação, em vez de simples preenchimento de código.

A melhoria do Grok 4.5 para o Grok 4.6 no DeepSWE 1.1 é especialmente notável, subindo de aproximadamente 54% para 65.9% na comparação relatada.

Entrada multimodal

O Grok 4.6 suporta entradas de texto e imagem, permitindo que desenvolvedores combinem informações visuais com raciocínio.

Aplicações potenciais incluem:

  • Depuração por captura de tela
  • Análise de UI
  • Interpretação de gráficos
  • Entendimento de documentos
  • Pesquisa visual
  • Tarefas de codificação baseadas em imagens

Isso torna o Grok 4.6 mais flexível do que um modelo de codificação puramente baseado em texto.

Pesquisa na Web e no X

O acesso do Grok à pesquisa é uma parte significativa do seu ecossistema.

A API suporta:

  • Pesquisa na Web
  • Pesquisa no X
  • Chamadas de função
  • Execução de código

A documentação atual da API do Grok 4.5 do xAI confirma essas capacidades de ferramentas no ambiente da API do Grok.

Para agentes de pesquisa, isso significa que o modelo pode potencialmente passar de conhecimento pré-treinado estático para recuperação de informações atuais mais raciocínio.

Raciocínio configurável

A API do Grok expõe o esforço de raciocínio configurável.

Isso permite aos desenvolvedores equilibrar:

velocidade / custo ↔ profundidade do raciocínio

Para tarefas simples, um raciocínio mais baixo pode reduzir computação desnecessária.

Para tarefas complexas de codificação ou pesquisa, um raciocínio mais alto pode oferecer uma solução de problemas mais deliberada.

Desempenho de fronteira com custo competitivo

A precificação do Grok 4.6 é, sem dúvida, uma de suas maiores vantagens comerciais.

O preço padrão de API relatado é:

  • $2 / 1M tokens de entrada
  • $6 / 1M tokens de saída

Esse é o mesmo preço relatado para o Grok 4.5, apesar das melhorias significativas de capacidade.

Isso cria uma proposta de custo/desempenho incomumente agressiva para um modelo de fronteira.


Como o Grok 4.6 se sai em benchmarks?

Os dados de benchmark mais úteis no momento estão concentrados em inteligência agêntica e codificação.

BenchmarkGrok 4.6O que mede
Artificial Analysis Intelligence Index61Inteligência ampla de modelos de fronteira
CursorBench 3.269.9%Desempenho de agentes de codificação
DeepSWE 1.165.9%Agentes de engenharia de software
FrontierCode 1.1 Extended61.3%Codificação avançada
GDPVal-AA v21,753 EloDesempenho em tarefas de trabalho do conhecimento

A pontuação de 61 no Artificial Analysis Intelligence Index coloca, segundo relatado, o Grok 4.6 no mesmo nível do GPT-5.6 Sol nesse índice.

A pontuação de 1,753 Elo no GDPVal-AA v2 também é significativa porque o GDPVal avalia tarefas profissionais de trabalho do conhecimento, em vez de simplesmente questões acadêmicas.

A principal conclusão dos benchmarks

A evidência mais forte para o Grok 4.6 não é uma única pontuação no estilo MMLU.

Seu perfil de benchmark aponta para:

codificação + agentes + trabalho do conhecimento + execução de longo prazo

É exatamente para onde o desenvolvimento de IA moderno está caminhando.

Para um site como a CometAPI, esta é uma distinção importante a preservar: o Grok 4.6 deve ser promovido principalmente como um modelo de fronteira orientado a agentes, em vez de outro modelo genérico de chatbot.

Como o Grok 4.6 se compara com seu antecessor e concorrentes?

Grok 4.6 vs Grok 4.5

RecursoGrok 4.5Grok 4.6
Foco principalRaciocínio geral + agentesAgentes de longa duração + codificação
ContextoImplantação classe 500K500K
EntradaTexto + imagemTexto + imagem
Pesquisa na WebSimSim
Pesquisa no XSimSim
Execução de códigoSimSim
Chamadas de funçãoSimSim
Preço de entrada$2/M$2/M
Preço de saída$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

O ponto importante é que o Grok 4.6 não parece ser uma simples substituição de faixa de preço para o Grok 4.5. É uma atualização de capacidade voltada mais fortemente para fluxos de trabalho de agentes de longo horizonte.

A documentação atual do Grok 4.5 do xAI lista o modelo a $2/$6 por milhão de tokens, com raciocínio configurável e suporte a ferramentas.

Tabela de comparação: Grok 4.6 vs principais concorrentes

AspectoGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notas
AA Intelligence Index616162 / 63Pontuação composta
Entrada / Saída $/1M$2 / $6~$5 / $30~$5 / $25Grok muito mais barato na saída
Janela de contexto500KAté 1M+Frequentemente 1M
Pontos fortesAgentes, eficiência em código, custoRaciocínio amplo, codificaçãoLongo horizonte, segurança
Integração com CursorNativa, forteDisponívelDisponívelGrok otimizado para o Cursor
Eficiência por turnoAlta (menos etapas)CompetitivaContagens de etapas mais altas relatadasImportante para agentes
DisponibilidadeAPI + Cursor + parceirosOficial + parceirosOficial + parceirosCometAPI unifica o acesso

Dados extraídos do anúncio da SpaceXAI, Artificial Analysis e cards públicos de modelos em 13 de agosto de 2026.

A comparação atual do Artificial Analysis é particularmente interessante.

O Grok 4.6 teria pontuação 61 no Intelligence Index, igualando o GPT-5.6 Sol. Mas a economia é muito diferente.

A precificação exata das variantes concorrentes do GPT deve ser verificada em relação aos preços atuais dos provedores antes da publicação, mas a observação-chave do mercado é clara: o Grok 4.6 está competindo em desempenho de nível de fronteira enquanto mantém um preço por token relativamente agressivo.

Isso torna o Grok 4.6 particularmente atraente para aplicações em que a execução de agentes em alto volume tornaria caros os modelos de fronteira premium.

Quais são as limitações do Grok 4.6?

Contexto de 500K é menor que alguns concorrentes de 1M

O contexto de 500K do Grok 4.6 é grande, mas não é a maior janela de contexto disponível no mercado de modelos de fronteira.

Para repositórios muito grandes ou coleções enormes de documentos, um modelo com contexto de 1M pode ter vantagem.

Modelo proprietário

Ao contrário do MiMo-V2.5-Pro, o Grok 4.6 não é um modelo de pesos abertos.

Os desenvolvedores não podem baixar o modelo e implantá-lo de forma independente.

Comparações de benchmark exigem cuidado

Diferentes benchmarks de codificação usam diferentes harnesses, prompts, ferramentas e procedimentos de avaliação.

Por exemplo, o SWE-Bench Pro é projetado especificamente em torno de problemas realistas de engenharia de software de longo horizonte, e os resultados de benchmark podem variar substancialmente dependendo do arcabouço do agente.

Portanto, 69.9% no CursorBench não deve ser interpretado como “o Grok 4.6 é 69.9% melhor do que outro modelo.”

A interpretação correta é que ele atingiu essa pontuação sob a configuração de avaliação particular do benchmark.

O custo de agentes pode ser maior do que o preço por token sugere

O preço de $2/$6 é atraente, mas um agente autônomo pode consumir números enormes de tokens por meio de:

  • Chamadas de ferramenta
  • Pesquisas repetidas
  • Execução de código
  • Tentativas fracassadas
  • Contexto longo
  • Autoverificação

A economia real da unidade, portanto, depende do custo por tarefa concluída com sucesso, não apenas do custo por milhão de tokens.

Preço e acesso

Preços oficiais (camada padrão, abaixo de ~200K tokens no prompt):

  • Entrada: $2.00 por 1M tokens
  • Entrada em cache: aproximadamente $0.50 por 1M tokens
  • Saída: $6.00 por 1M tokens

Uma variante mais rápida custa o dobro dessas taxas. As taxas podem dobrar para contextos muito longos (≥200K). O cache de prompt é fortemente recomendado para loops de agentes a fim de manter os custos baixos.

Disponibilidade:

  • Cursor e Grok Build (2× de uso incluído na primeira semana)
  • SpaceXAI API (grok-4.6)
  • Parceiros: OpenRouter, Vercel, Cloudflare e outros
  • SuperGrok chat/apps (via seletor de modelo)

Recomendação da CometAPI: Para desenvolvedores que já usam (ou planejam usar) vários modelos de fronteira, a CometAPI oferece acesso perfeito ao Grok 4.6 por meio de um único endpoint compatível com OpenAI (https://api.cometapi.com/v1). Você obtém faturamento unificado, análise de uso, taxas efetivas competitivas em mais de 500 modelos (incluindo GPT, Claude, Gemini, DeepSeek e variantes do Grok) e a capacidade de alternar modelos com uma mudança de uma linha. Isso é especialmente valioso ao fazer A/B testing do Grok 4.6 em comparação com outros modelos de codificação ou agentes, ou ao construir sistemas de produção que se beneficiam de roteamento de modelos e fallback. Inscreva-se em cometapi.com para obter uma chave de API gratuita e explorar o catálogo de modelos ao vivo.

Você deve migrar para o Grok 4.6?

Sim, se:

  • Você trabalha intensamente no Cursor ou constrói agentes de codificação/conhecimento de longa duração e deseja forte confiabilidade multietapas a um custo competitivo.
  • A economia de tokens importa — o Grok 4.6 entrega inteligência quase paritária com o GPT-5.6 Sol a aproximadamente um quinto do preço por token de saída das opções de fronteira mais caras.
  • Você valoriza a eficiência por turno (menos etapas e tokens para concluir tarefas complexas).
  • Você quer acesso imediato a um modelo treinado explicitamente para os fluxos de trabalho interativos, visuais e orientados a agentes comuns no desenvolvimento moderno.

Considere permanecer com ou misturar outros modelos se:

  • Sua carga principal é programação competitiva pura ou pontos fortes específicos de modelos fechados (por exemplo, certos cenários de contexto longo do Claude ou com tuning de segurança).
  • Você requer as pontuações mais altas absolutas em todos os benchmarks individuais de engenharia de software, independentemente do custo.
  • Você precisa de janelas de contexto maiores que 500K para cargas de trabalho de chamada única (alguns concorrentes oferecem 1M+).

A maioria das equipes se beneficiará ao avaliar o Grok 4.6 lado a lado com sua pilha atual. Como ele está disponível por meio de agregadores como a CometAPI, o custo de mudança é baixo — basta alterar o nome do modelo e medir taxas de conclusão de tarefas no mundo real, latência e custo em suas próprias cargas de trabalho.

Conclusão

O Grok 4.6 representa um avanço significativo para a SpaceXAI: inteligência de nível de fronteira em benchmarks compostos e agênticos chave, melhorias significativas em desempenho de codificação e trabalho de conhecimento de longa duração e precificação agressiva contínua que subcota muitos concorrentes de código fechado. Sua disponibilidade nativa no Cursor, combinada com forte confiabilidade multietapas, o torna particularmente atraente para desenvolvedores que constroem agentes de software do mundo real e aplicações interativas.

Quer você o acesse diretamente, pelo Cursor/Grok Build, ou via um gateway unificado como a CometAPI, o Grok 4.6 está pronto para avaliação de produção hoje. Visite o anúncio oficial em x.ai/news/grok-4-6 para ver todos os detalhes e o card do modelo, explore o catálogo ao vivo em cometapi.com para compará-lo lado a lado com outros modelos líderes e comece a construir com os novos recursos imediatamente.

Fontes primárias

Sempre verifique os preços mais recentes, limites de taxa e números de benchmark nas páginas oficiais, pois o cenário de IA evolui rapidamente.

0 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais