TL;DR Grok 4.7 é o modelo de fronteira da SpaceXAI para programação, fluxos de trabalho orientados a agentes e trabalho profissional de conhecimento, lançado em 21 de setembro de 2026. Ele combina uma janela de contexto de 500.000 tokens, entrada de texto e imagem, raciocínio configurável, chamada de função, pesquisa na Web e no X, e execução de código.
Para prompts abaixo de 200.000 tokens, a API oficial da xAI lista $2 por milhão de tokens de entrada, $0.50 por milhão de tokens de entrada em cache e $6 por milhão de tokens de saída. A CometAPI atualmente lista o Grok 4.7 a $1.60 de entrada, $0.40 de entrada em cache e $4.80 de saída por milhão de tokens para o mesmo nível — uma redução de 20% em relação às tarifas oficiais exibidas na sua página de modelo.
A proposta de valor prática não é liderança universal em benchmarks. O Grok 4.7 é mais atraente quando uma carga de trabalho combina tarefas de engenharia, loops longos de agentes, uso de ferramentas, grandes contextos de trabalho e sensibilidade ao custo por token de saída. As equipes devem validá-lo em seus próprios repositórios e fluxos de trabalho antes do roteamento para produção.
Principais pontos
- Grok 4.7 utiliza um modelo base maior que o Grok 4.6, treinamento por reforço mais longo em tarefas mais difíceis e autoverificação mais robusta.
- A API suporta uma janela de contexto de 500.000 tokens, entrada de texto e imagem, saída de texto, quatro níveis de raciocínio, saída estruturada, chamada de função, pesquisa na Web e no X, e execução de código.
- A SpaceXAI reporta 46.3% no CursorBench 4.0, 71.0% no DeepSWE v1.1 e 38.0% no Terminal-Bench 4.0. São resultados publicados pelo fornecedor, não prova de liderança universal.
- A CometAPI lista o Grok 4.7 como disponível, com endpoint compatível com OpenAI e preços 20% abaixo das tarifas oficiais da xAI mostradas em seu catálogo atual.
- Escolha o Grok 4.7 para agentes de engenharia sensíveis a custo e uso sustentado de ferramentas; escolha alternativas quando um contexto muito longo ou um domínio crítico de benchmark for mais importante que o preço unitário.
O que é o Grok 4.7?
Grok 4.7 é o mais recente modelo de linguagem de fronteira da SpaceXAI, posicionado para programação, tarefas autônomas de agentes e trabalho profissional de conhecimento. O lançamento foca em tarefas que exigem interação sustentada, uso de ferramentas, verificação e revisão, em vez de apenas respostas pontuais.
A SpaceXAI afirma que o Grok 4.7 foi treinado com um treinamento de reforço mais longo em um conjunto de tarefas mais difícil, com peso maior para problemas que podem levar muitas horas para serem concluídos. Essa direção de treinamento o torna particularmente relevante para engenharia de software em nível de repositório, depuração, pesquisa, criação de documentos, análise de engenharia e automação em múltiplas etapas.
Em que o Grok 4.7 é diferente — e melhor — do Grok 4.6?
Um modelo base maior
O Grok 4.7 migra para um modelo base maior que o Grok 4.6. A SpaceXAI não divulgou uma contagem de parâmetros pública finalizada, portanto a conclusão defensável é aumento da capacidade do modelo base — não uma estimativa específica de parâmetros.
Treinamento por reforço mais longo em tarefas mais difíceis
A etapa de treinamento por reforço foi estendida e direcionada para problemas mais difíceis e de horizonte mais longo. A SpaceXAI enfatiza tarefas que podem exigir horas de trabalho, alinhando o modelo com fluxos de trabalho autônomos de programação, pesquisa e agentes profissionais.
Autoverificação mais robusta
O Grok 4.7 é treinado para inspecionar seu próprio trabalho com mais cuidado. Isso importa em engenharia de software porque um agente confiável deve inspecionar, modificar, testar, diagnosticar falhas, revisar e validar repetidamente — não apenas gerar uma primeira resposta.
Melhorias mensuradas em relação ao Grok 4.6
| Dimensão | Grok 4.6 | Grok 4.7 | Mudança |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
No conjunto de lançamento publicado, o Grok 4.7 melhora em relação ao Grok 4.6 em todos os resultados listados. O maior ganho absoluto está no Terminal-Bench 4.0, consistente com a ênfase do lançamento em fluxos de trabalho de linha de comando e uso de ferramentas de longa duração. Esses números permanecem como resultados publicados pelo fornecedor e devem ser testados em tarefas reais antes de uma decisão de migração.
Quão bom é o Grok 4.7 em benchmarks?
A avaliação de lançamento da SpaceXAI cobre engenharia de software, trabalho em terminal, tarefas profissionais de escritório, trabalho jurídico, raciocínio clínico e engenharia elétrica. São resultados publicados pelo fornecedor e devem ser validados em cargas de trabalho de produção antes de decisões de compra ou roteamento.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Em seus resultados de lançamento do Grok 4.7, a SpaceXAI marca a pontuação de 71.0% no DeepSWE v1.1 como alto esforço de raciocínio.
O anúncio de lançamento não divulga todos os harnesses por benchmark, configuração de ferramentas, contagem de execuções ou ambiente de avaliação. Trate esses valores como resultados publicados pelo fornecedor e valide o modelo em seus próprios repositórios, ferramentas, metas de latência e critérios de falha antes de rotear trabalho de produção.
O que o perfil de benchmarks do Grok 4.7 mostra?
Engenharia de software
O CursorBench 4.0 sobe de 40.4% no Grok 4.6 para 46.3% no Grok 4.7, enquanto o DeepSWE v1.1 sobe de 65.2% para 71.0%. Isso sustenta o posicionamento do Grok 4.7 como um modelo para agentes de programação, e não apenas assistência conversacional de código.
Trabalho de terminal de longa duração
O Terminal-Bench 4.0 mostra uma das maiores mudanças geracionais: 20.3% para o Grok 4.6 versus 38.0% para o Grok 4.7. O ganho absoluto de 17.7 pontos é consistente com a ênfase da SpaceXAI em treinamento por reforço de horizonte mais longo e autoverificação.
Engenharia elétrica
No EEBench, o Grok 4.7 atinge 64.0%, comparado a 53.0% para o Grok 4.6. Entre as comparações publicadas, este é um dos resultados relativos mais fortes do Grok 4.7.
Trabalho profissional de conhecimento
O AA Briefcase v1.1 sobe de 1,546 para 1,657. Essas tarefas são projetadas para refletir trabalho profissional de múltiplas horas, envolvendo artefatos como documentos, apresentações, análises e outros entregáveis estruturados.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: como se comparam?
Verificação de preços nativos dos provedores: a OpenAI lista o GPT-5.6 Sol a $4 por milhão de tokens de entrada e $20 por milhão de tokens de saída, enquanto a Anthropic lista o Claude Fable 5.1 a $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída.
| Dimensão | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Posicionamento principal | Programação, tarefas orientadas a agentes, trabalho de conhecimento | Raciocínio profissional complexo e programação | Agentes de longa duração, programação e trabalho de conhecimento |
| Janela de contexto | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalidades | Entrada de texto e imagem; saída de texto | Entrada de texto e imagem; saída de texto | Entrada de texto e imagem; saída de texto |
| Controle de raciocínio | low, medium, high, xhigh | None through max | Raciocínio adaptativo com esforço configurável |
| Status da API do provedor | Disponível na API pública da xAI | Disponível via OpenAI Chat Completions and Responses | Disponível via Claude API e marketplaces em nuvem suportados |
| Preço de entrada / 1M tokens | $2 | $4 | $10 |
| Preço de saída / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Melhor adequação | Agentes de engenharia sensíveis a preço e uso sustentado de ferramentas | Raciocínio profissional amplo com contexto muito longo | Máxima performance de agentes de longa duração e fluxos de conhecimento |
Qual modelo você deve escolher?
- Escolha o Grok 4.7 quando cargas de trabalho de engenharia, uso sustentado de ferramentas, raciocínio configurável e menor custo por token de saída forem prioridade. É particularmente atraente para agentes de repositório, fluxos de trabalho em terminal e pesquisas com grande contexto que permaneçam abaixo do limite de 200K de preço.
- Escolha o GPT-5.6 Sol quando a tarefa precisar de raciocínio profissional mais amplo, uma janela de contexto acima de um milhão de tokens, ou quando seu resultado mais forte em uma avaliação crítica de negócios, como DeepSWE ou raciocínio clínico, tenha sido validado no seu próprio harness.
- Escolha o Claude Fable 5.1 quando a performance máxima de agentes de longa duração, qualidade de código, execução em terminal ou raciocínio clínico justificar seu preço por token mais alto.
- Use roteamento de modelos quando as cargas variam. Direcione etapas rotineiras de engenharia e passos de agentes de alto volume para o modelo qualificado mais eficiente em custo, e reserve um modelo mais caro para tarefas onde taxas de sucesso medidas justificam o prêmio.
A escolha correta depende do sucesso de ponta a ponta da tarefa, latência, tentativas, precisão de chamadas de ferramenta e retrabalho humano — não de um único benchmark ou da taxa de token em destaque.
Quanto custa a API do Grok 4.7?
A tabela abaixo compara as tarifas oficiais da xAI com os preços exibidos na página do modelo Grok 4.7 na CometAPI em 22 de setembro de 2026. A CometAPI informa um desconto de 20%; verifique os preços ao vivo antes da produção porque preços de gateways e termos promocionais podem mudar.
| Nível de prompt | Tipo de preço | xAI oficial | CometAPI | Diferença |
|---|---|---|---|---|
| Abaixo de 200K tokens de prompt | Entrada / 1M | $2.00 | $1.60 | 20% menor |
| Entrada em cache / 1M | $0.50 | $0.40 | 20% menor | |
| Saída / 1M | $6.00 | $4.80 | 20% menor | |
| Acima de 200K tokens de prompt | Entrada / 1M | $4.00 | $3.20 | 20% menor |
| Entrada em cache / 1M | $1.00 | $0.80 | 20% menor | |
| Saída / 1M | $12.00 | $9.60 | 20% menor |
Preços para contexto padrão em prompts até 200.000 tokens
Para solicitações cujo prompt não excede 200.000 tokens, o Grok 4.7 custa $2 por milhão de tokens de entrada, $0.50 por milhão de tokens de entrada em cache e $6 por milhão de tokens de saída. A entrada em cache é a categoria menos cara, portanto aplicações com instruções de sistema repetidas ou contexto reutilizável podem reduzir o custo quando esses tokens se qualificam para cache.
Como exemplo simples, uma solicitação usando 100.000 tokens de entrada não em cache e produzindo 10.000 tokens de saída custaria cerca de $0.26 antes de quaisquer outras tarifas de plataforma: $0.20 pela entrada mais $0.06 pela saída.
Preços para contexto longo acima de 200.000 tokens de prompt
Uma vez que o prompt excede 200.000 tokens, as tarifas dobram para $4 por milhão de tokens de entrada, $1 por milhão de tokens de entrada em cache e $12 por milhão de tokens de saída. O nível mais alto se aplica por causa do comprimento do prompt, portanto as equipes devem monitorar o histórico acumulado da conversa, rastros de ferramentas, documentos recuperados e contexto do repositório antes de enviar cada solicitação.
A decisão prática de custo, portanto, não é apenas quantos tokens uma tarefa usa, mas se o prompt cruza o limite de 200.000 tokens. Resumir o trabalho concluído, remover saídas de ferramentas obsoletas e recuperar apenas os arquivos mais relevantes pode manter cargas adequadas no nível padrão sem sacrificar o contexto necessário.
As notas de versão da SpaceXAI documentam esse limite. Orçamentos de produção também devem contabilizar tentativas, loops de agentes, chamadas de ferramenta fracassadas e comprimento da saída, em vez de comparar provedores apenas pelo preço de token de entrada em destaque.
O que torna o Grok 4.7 útil para agentes de IA?
- Janela de contexto de 500K: acomoda código-fonte substancial, especificações, saída de ferramentas, logs e histórico de conversas em um único contexto de trabalho. Isso é útil para programação em escala de repositório e análise multidocumento, embora o contexto ainda exija poda ativa.
- Raciocínio configurável: aplicações podem selecionar esforço low, medium, high ou xhigh, trocando latência e computação por raciocínio mais profundo conforme a dificuldade da tarefa.
- Chamada de função e saída estruturada: agentes podem consultar bancos de dados, executar testes, inspecionar documentos, chamar APIs internas e retornar resultados legíveis por máquina.
- Pesquisa na Web e no X: ferramentas de busca podem recuperar informações atuais quando os dados de treinamento do modelo forem insuficientes. Conteúdo recuperado ainda deve ser tratado como entrada não confiável e verificado.
- Execução de código: o modelo pode validar cálculos, transformar dados e testar soluções geradas em vez de confiar apenas na inferência de modelo de linguagem.
- Foco em fluxos de trabalho de longo horizonte: a ênfase do treinamento em tarefas de múltiplas horas, gestão de contexto e autoverificação mira loops de agentes que acumulam rastros de ferramentas e exigem recuperação após falha.
Como o Grok 4.7 melhora a segurança?
A SpaceXAI afirma que o Grok 4.7 introduz uma pilha de salvaguardas totalmente nova e reporta maior resistência a jailbreaks e segurança de uso duplo. No anúncio de lançamento, a empresa reporta 62.4% no benchmark de biossegurança da LatchBio e afirma que apenas 3.3% dos prompts arriscados de uso duplo foram aprovados no HackerBench v0.3.
Essas cifras são avaliações publicadas pelo fornecedor. São úteis para entender as alegações do lançamento, mas não devem ser tratadas como uma medida universal de performance de segurança no mundo real.
Como os desenvolvedores podem usar a API do Grok 4.7?
O Grok 4.7 está atualmente disponível via CometAPI sob o ID de modelo grok-4.7. A CometAPI fornece um endpoint compatível com OpenAI, uma única chave de API e fluxo de faturamento entre múltiplos provedores de modelos, testes e roteamento lado a lado mais fáceis de modelos, e preços atualmente listados 20% abaixo das tarifas oficiais da xAI. Antes do uso em produção, confirme a página atual do modelo, a saúde do endpoint, os parâmetros suportados, os preços e os requisitos de tratamento de dados.
Exemplo de requisição CometAPI:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Vale a pena migrar para o Grok 4.7?
Para usuários atuais do Grok 4.6 que dependem de agentes de programação ou fluxos profissionais de longa duração, o Grok 4.7 é um candidato a atualização significativo, pois o conjunto de benchmarks de lançamento melhora em todas as dimensões reportadas enquanto o preço padrão por token permanece no mesmo nível $2/$6 abaixo do limite de contexto longo.
Para usuários de outros modelos de fronteira, a decisão é específica da carga de trabalho. O Grok 4.7 é especialmente interessante quando custo por token de saída, cargas de engenharia, grandes contextos e uso sustentado de ferramentas importam. Onde outro modelo é mais forte em um domínio crítico, o roteamento de modelos pode ser mais racional do que substituir todos os modelos por um único provedor.
Conclusão
O Grok 4.7 é mais do que uma atualização numérica rotineira ao Grok 4.6. O lançamento é explicitamente orientado a trabalho de longa duração realizado por meio de ferramentas, verificação repetida, grandes contextos e múltiplas etapas de execução.
Os ganhos geracionais mais fortes aparecem onde essa direção de treinamento deve importar: o Terminal-Bench 4.0 sobe de 20.3% para 38.0%, o EEBench de 53.0% para 64.0%, e o CursorBench 4.0 de 40.4% para 46.3%, enquanto o preço padrão abaixo do limite de 200K tokens de prompt permanece em $2/M de entrada e $6/M de saída.
A proposta de valor prática não é “Grok 4.7 vence todo benchmark”. É que o Grok 4.7 estreita a lacuna entre capacidade de agente de classe de fronteira e inferência de menor custo, tornando-o especialmente relevante para agentes de programação, sistemas de pesquisa e fluxos profissionais que precisam operar por muitas etapas em vez de responder uma vez.
