A xAI descreve o Grok 4.7 como seu modelo de ponta para programação, tarefas agentivas e trabalho de conhecimento, com uma janela de contexto de 500 mil tokens. De acordo com a página de preços atual da xAI, as tarifas diretas da API para menos de 200.000 tokens de prompt são $2.00 por milhão de tokens de entrada, $0.50 por milhão de tokens em cache e $6.00 por milhão de tokens de saída. Quando um prompt atinge 200.000 tokens ou mais, a xAI lista $4.00, $1.00 e $12.00, respectivamente. Estas são tarifas diretas da xAI, não um preço universal em plataformas de terceiros.
O gasto real depende de mais do que a tarifa de entrada principal. Entrada nova, entrada em cache, saída, novas tentativas, chamadas de ferramentas e o número de chamadas de modelo em um fluxo agentivo podem alterar a fatura. O limite de 200 mil tokens de prompt é especialmente importante porque tanto a xAI quanto a CometAPI publicam tarifas mais altas de contexto longo quando esse limite é atingido.
Este guia primeiro define a linha de base de preços da xAI, depois compara com a lista atual do Grok 4.7 na CometAPI. Em 28 de setembro de 2026, a CometAPI lista $1.60 / $0.40 / $4.80 por milhão de tokens de entrada nova, entrada em cache e saída na camada padrão, e $3.20 / $0.80 / $9.60 na camada de contexto longo — 20% abaixo das tarifas diretas correspondentes da xAI. As seções a seguir explicam como calcular o custo de trabalho, reduzir desperdícios e acessar o modelo via CometAPI. Todos os preços são instantâneos datados e devem ser verificados novamente antes do uso em produção.
Preços xAI Direct vs. CometAPI Grok 4.7
Tarifas xAI direct (USD por 1M de tokens)
| Categoria de tokens | Abaixo de 200 mil tokens de prompt | Contexto longo (≥200K) |
|---|---|---|
| Entrada nova | $2.00 | $4.00 |
| Entrada em cache | $0.50 | $1.00 |
| Saída | $6.00 | $12.00 |
Tarifas CometAPI (USD por 1M de tokens)
| Categoria de tokens | CometAPI: abaixo de 200K tokens de prompt | CometAPI: camada de contexto longo |
|---|---|---|
| Entrada nova | $1.60 / 1M tokens | $3.20 / 1M tokens |
| Entrada em cache | $0.40 / 1M tokens | $0.80 / 1M tokens |
| Saída | $4.80 / 1M tokens | $9.60 / 1M tokens |
O limite de 200 mil tokens de prompt importa porque ambas as plataformas atualmente listam tarifas de contexto longo em dobro de suas tarifas da camada padrão para o Grok 4.7. Esta é uma regra de preço definida por cada plataforma de API, não uma mudança na capacidade do modelo. Uma solicitação se torna mais cara quando um aplicativo envia repetidamente prompts grandes ou permite que o histórico do agente cresça sem controle — não simplesmente porque o Grok 4.7 suporta uma janela de contexto de 500 mil.
Para orçamento, trate qualquer solicitação projetada para atingir o limite como contexto longo até que o comportamento de cobrança ativo seja verificado. A disponibilidade do modelo e os preços podem mudar, portanto calculadoras de produção devem verificar novamente tanto a tabela de preços direta da xAI quanto a página atual do modelo na CometAPI em vez de codificar valores permanentes.
A fórmula para estimar o custo do Grok 4.7
Estime uma solicitação precificando cada categoria de token separadamente:
request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000
Em seguida, converta a estimativa da solicitação em uma estimativa de carga de trabalho:
monthly cost = request cost × requests per user × active users × days in billing period
Use um percentil realista em vez de uma média única. Uma estimativa p50 descreve uma solicitação normal, mas os comprimentos p95 de entrada e saída expõem a cauda cara que frequentemente impulsiona a fatura. Para fluxos agentivos, multiplique pelo número esperado de chamadas de modelo por tarefa concluída. Um fluxo de cinco etapas são cinco chamadas faturáveis, não uma.
Exemplo 1: Um Copiloto de Suporte
Pressuponha que uma solicitação de suporte envie 6.000 tokens de entrada nova e gere 800 tokens de saída. Ela permanece abaixo do limite de 200 mil e não recebe desconto de cache.
- Entrada: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
- Saída: 800 × $4.80 ÷ 1,000,000 = $0.00384
- Total: $0.01344 por solicitação
Em 100.000 solicitações por mês, o custo estimado de tokens é $1,344. Se a avaliação mostrar que uma resposta de 400 tokens tem desempenho tão bom quanto uma resposta de 800 tokens, a estimativa cai para $0.01152 por solicitação, ou $1,152 por mês. Esse único teto de saída economiza cerca de $192 por mês, ou 14,3%, sem mudar o modelo.
É por isso que o controle de saída merece atenção. Na tarifa listada pela CometAPI, tokens de saída custam três vezes mais do que tokens de entrada nova na mesma camada.
Exemplo 2: Reutilizando um prefixo estável de 20 mil tokens
Suponha que cada solicitação contenha um manual de produto de 20.000 tokens, 2.000 tokens de novo contexto de conversa e uma resposta de 600 tokens.
Sem acerto de cache, a estimativa é:
- 22.000 tokens de entrada nova: $0.03520
- 600 tokens de saída: $0.00288
- Total: $0.03808 por solicitação
Se o prefixo estável de 20.000 tokens for faturado como entrada em cache enquanto apenas 2.000 tokens permanecem novos, a estimativa se torna:
- 20.000 tokens de entrada em cache: $0.00800
- 2.000 tokens de entrada nova: $0.00320
- 600 tokens de saída: $0.00288
- Total: $0.01408 por solicitação
Em 100.000 solicitações, isso é $1,408 em vez de $3,808 — uma economia estimada de $2,400, ou 63,0%. A economia não é automática: a primeira solicitação, um prefixo alterado ou uma rota que não produza acerto de cache ainda pode ser faturada à tarifa de entrada nova. Confirme a contagem de tokens em cache nos dados de uso reais antes de tratar a estimativa como economia alcançada.
Exemplo 3: O custo de ultrapassar 200 mil
Considere uma solicitação de agente de longa duração com 210.000 tokens de prompt e 2.000 tokens de saída. Usando as tarifas de contexto longo listadas:
- 210.000 tokens de entrada nova: $0.67200
- 2.000 tokens de saída: $0.01920
- Total: $0.69120 por execução
Se compactação de contexto, filtragem de recuperação e checkpoints de resumo reduzirem o prompt para 180.000 tokens enquanto preservam a mesma saída de 2.000 tokens, a estimativa da camada padrão é:
- 180.000 tokens de entrada nova: $0.28800
- 2.000 tokens de saída: $0.00960
- Total: $0.29760 por execução
A diferença é $0.39360 por execução, ou cerca de 56,9%. Em 10.000 execuções, a economia estimada é $3,936. A lição não é apagar contexto útil. É manter apenas o contexto que muda a resposta e resumir ou recuperar o restante antes que a solicitação cruze um limite de preço.
Um calculador em Python para estimativas pré-chamada
A função a seguir usa as tarifas atualmente listadas do Grok 4.7 na CometAPI. Ela aplica a camada de contexto longo de forma conservadora quando o prompt total atinge 200.000 tokens.
from dataclasses import dataclass
@dataclass(frozen=True)
class Rates:
input_per_million: float
cached_input_per_million: float
output_per_million: float
SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)
def estimate_grok_47_cost(
fresh_input_tokens: int,
cached_input_tokens: int,
max_output_tokens: int,
) -> float:
prompt_tokens = fresh_input_tokens + cached_input_tokens
rates = LONG if prompt_tokens >= 200_000 else SHORT
return (
fresh_input_tokens * rates.input_per_million
+ cached_input_tokens * rates.cached_input_per_million
+ max_output_tokens * rates.output_per_million
) / 1_000_000
estimate = estimate_grok_47_cost(
fresh_input_tokens=2_000,
cached_input_tokens=20_000,
max_output_tokens=600,
)
print(f"Estimated upper bound: ${estimate:.5f}")
Isto é um guarda de planejamento, não uma fatura. O custo final depende da entrada real, entrada em cache, saída, novas tentativas, chamadas de ferramentas e do preço ativo no momento da execução. Após cada resposta, armazene o uso de tokens retornado, o ID do modelo, o status da solicitação e o resultado da tarefa. Reconcilie esses valores com os registros de faturamento do provedor.
Cinco controles de custo do Grok 4.7, classificados por provável impacto
1. Mantenha o contexto repetido estável o suficiente para cache
Coloque instruções estáticas, documentação de produto, esquemas e exemplos reutilizáveis antes do conteúdo específico da solicitação. Evite alterar timestamps, IDs, espaços em branco ou ordenação dentro de um grande prefixo compartilhado, a menos que a mudança seja necessária. A orientação do Grok 4.7 da xAI recomenda identificadores de roteamento de cache estáveis para conversas; ao usar uma rota intermediária, verifique quais controles de cache e campos de uso são suportados antes de depender deles.
Meça tokens com acerto de cache e a taxa de acerto de cache por carga de trabalho. Um desconto de cache teórico não tem valor se o aplicativo altera constantemente o prefixo.
2. Trate 200 mil como um orçamento de engenharia, não como alvo
Reserve folga abaixo do limite para instruções de sistema, passagens recuperadas, resultados de ferramentas e a próxima interação do usuário. Para um agente, compacte turnos antigos em um resumo validado e retenha a transcrição bruta fora do contexto do modelo. Para recuperação, classifique e deduplicate passagens antes de inseri-las, em vez de enviar todas as correspondências.
Acompanhe distribuições do comprimento do prompt e alerte antes que o p95 se aproxime do limite. No cronograma oficial da xAI, uma vez que um prompt atinge 200 mil tokens, as tarifas de contexto longo se aplicam a todos os tokens nessa solicitação. A CometAPI também lista uma camada separada, mais alta, de contexto longo para o Grok 4.7. Estas são condições de preço da plataforma, não capacidades do modelo.
3. Faça teto de saída e ajuste o esforço de raciocínio com base em um conjunto de avaliação
Defina um teto de saída em nível de aplicação que corresponda ao produto. Um resultado de classificação pode precisar de dezenas de tokens; uma resposta de suporte pode precisar de algumas centenas; um relatório de pesquisa pode precisar de mais. Este teto é um controle de orçamento e de experiência do usuário, não um limite rígido do modelo Grok 4.7. As notas de versão de 21 de setembro da xAI afirmam que o Grok 4.7 não tem limite de saída de texto; isso não impede que um aplicativo ou uma rota específica da API imponha seu próprio limite de solicitação. Confirme qualquer limite imposto por endpoint ou SDK com a rota que você realmente usa.
O Grok 4.7 suporta múltiplos níveis de esforço de raciocínio. Use o nível mais baixo que passa em um conjunto de avaliação representativo e reserve esforço mais alto para tarefas em que ele produza uma melhoria mensurável. Reduzir raciocínio ou saída sem verificações de qualidade pode criar novas tentativas e apagar a economia.
4. Rejeite ou reformule solicitações caras antes da chamada à API
Estime um limite superior com base no tamanho da entrada e no teto de saída configurado. Se a solicitação excede o orçamento do produto, o aplicativo pode pedir ao usuário para reduzir a tarefa, resumir material enviado, reduzir o contexto recuperado ou mover o trabalho para um fluxo assíncrono aprovado. Isso é mais previsível do que descobrir o custo após a geração.
Uma aproximação grosseira de caracteres para tokens pode ser útil como guarda inicial, mas não deve substituir um tokenizador ou dados reais de uso. Idiomas, código, JSON e formatação podem produzir densidades de tokens muito diferentes.
5. Otimize custo por tarefa bem-sucedida, não custo por chamada
Uma chamada mais barata que falha na validação duas vezes pode custar mais do que uma chamada bem-sucedida. Acompanhe:
- custo por resposta aceita;
- custo por tarefa de agente concluída;
- custo de novas tentativas e fallback;
- taxa de acerto de cache e participação de tokens em cache;
- tokens de prompt e saída p50 e p95;
- pontuação de qualidade, latência e taxa de escalonamento humano.
Se o tráfego rotineiro não requer a qualidade ou a capacidade de contexto do Grok 4.7, o catálogo unificado de modelos da CometAPI pode facilitar uma troca de modelo gerenciada pelo aplicativo. Mantenha a regra de roteamento explícita, avalie cada modelo no mesmo conjunto de tarefas e envie apenas as solicitações que se beneficiam do Grok 4.7 para essa rota.
Uma revisão prática de custos mensais
Uma vez por semana, agrupe o tráfego por funcionalidade e compare o custo estimado com o uso real. Comece com os recursos responsáveis pelo maior número de tokens de saída, os maiores prompts e a menor taxa de acerto de cache. Em seguida, revise outliers caros em vez de otimizar às cegas a solicitação mediana.
| Sinal | Problema provável | Primeira ação |
|---|---|---|
| Baixa participação de tokens em cache | Prefixo compartilhado muda com muita frequência | Estabilize e versione o contexto reutilizável |
| Prompts se agrupam perto de 200K | Histórico ou recuperação sem limites | Compacte, classifique e reserve folga |
| Saída domina o gasto | Respostas são mais longas do que o produto precisa | Reduza o teto e teste a qualidade da resposta |
| Alto custo de novas tentativas | Validação, timeouts ou prompts instáveis | Corrija o modo de falha na primeira chamada |
| Baixo custo mas baixa conclusão de tarefas | A otimização reduziu qualidade útil | Meça custo por resultado aceito |
Onde a CometAPI se encaixa no modelo de custo do Grok 4.7
O papel da CometAPI nesse fluxo é no nível da plataforma de API: ela fornece acesso ao Grok 4.7, publica suas próprias tarifas de tokens e documenta um ponto de entrada compatível com OpenAI. Ela não altera as capacidades subjacentes do Grok 4.7. Equipes que já usam um cliente no estilo OpenAI podem manter o mesmo padrão de cliente ao alterar a chave de API, a base URL e o ID do modelo, sujeito à compatibilidade do endpoint.
Em 28 de setembro de 2026, as tarifas listadas da CometAPI para o Grok 4.7 são 20% abaixo das tarifas diretas correspondentes da xAI tanto na camada padrão quanto na camada de contexto longo. Esta é uma comparação de preço de plataforma, não uma afirmação sobre qualidade do modelo. Antes do rollout em produção, as equipes também devem verificar o ID de modelo ativo, parâmetros de endpoint, comportamento de cache, limites de taxa, confiabilidade, suporte e termos de faturamento.
Para testar o modelo, revise os preços e detalhes de acesso atuais na página do modelo Grok 4.7 na CometAPI. Mantenha a tabela de preços em configuração, registre o uso real após cada chamada e reexecute estimativas de carga de trabalho sempre que o modelo ou o comportamento do produto mudar.
FAQ
Qual é o preço por token do Grok 4.7 na CometAPI?
Para prompts abaixo de 200 mil tokens, a CometAPI atualmente lista $1.60 por milhão de tokens de entrada nova, $0.40 por milhão de tokens de entrada em cache e $4.80 por milhão de tokens de saída. As tarifas de contexto longo listadas são $3.20, $0.80 e $9.60 por milhão de tokens, respectivamente.
Quanto custa uma solicitação de API do Grok 4.7?
Depende da entrada nova, entrada em cache, saída e da camada de contexto ativa. Multiplique cada contagem de tokens por sua tarifa por milhão, some os resultados e divida por um milhão. Inclua também novas tentativas e cada chamada de modelo em um fluxo de várias etapas.
Qual é a maneira mais fácil de reduzir o custo da API do Grok 4.7?
Comece com o maior motor de custo medido. Instruções longas repetidas geralmente se beneficiam de cache; históricos de agentes em crescimento se beneficiam de compactação; respostas verbosas se beneficiam de um teto de saída menor. Confirme que a qualidade permanece aceitável após cada mudança.
Uma janela de contexto de 500 mil significa que devo enviar 500 mil tokens?
Não. A janela de contexto é um limite de capacidade, não uma recomendação. Tanto o preço direto da xAI quanto a listagem atual da CometAPI usam tarifas mais altas de contexto longo no limite de 200 mil tokens de prompt, então os aplicativos devem enviar apenas o contexto necessário para a tarefa.
Posso estimar o custo antes de chamar o Grok 4.7?
Sim. Estime tokens de entrada, escolha a camada de contexto correta, adicione um teto de saída realista e calcule o limite superior. Após a chamada, substitua a estimativa pelos dados de uso reais para relatórios e otimização.