Quanto custam GPT-5.6 Sol, Claude Sonnet 5 e Gemini 3.7 Flash?
Como comparar a precificação de modelos de IA entre diferentes provedores? Comece com o mesmo mix de entrada e saída, a mesma moeda e a mesma definição de resultado bem-sucedido. Um único “preço por 1M tokens” é incompleto porque tokens de entrada e de saída são cobrados a taxas diferentes, solicitações com contexto longo podem entrar em uma faixa superior, e novas tentativas ou respostas rejeitadas podem tornar o custo efetivo muito maior.
Em 26 de agosto de 2026, uma carga de trabalho contendo 800.000 tokens de entrada não armazenados em cache e 200.000 tokens de saída custaria cerca de $5.76 com GPT-5.6 Sol, $2.88 com Claude Sonnet 5 ou $1.08 com Gemini 3.7 Flash nas tarifas atuais da CometAPI. Esses modelos ocupam posições diferentes de velocidade e capacidade, portanto esta é uma comparação de cobrança — não uma afirmação de que entregam qualidade idêntica.
Como comparar preços de APIs de IA entre provedores
Este artigo usa dólares americanos por 1 milhão de tokens de texto faturáveis. O cenário trabalhado representa um fluxo de suporte ou conhecimento de alto volume com 800.000 tokens de entrada e 200.000 tokens de saída ao longo de muitas solicitações. Cada solicitação fica abaixo do limite de preço de contexto curto de 272.000 tokens do GPT-5.6 Terra.
A linha de base exclui cache de prompt, descontos de lote, taxas de ferramentas, imagens, áudio e chamadas com falha ou repetidas. Também pressupõe que uma resposta gerada seja aceita. A fórmula é:
cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)
Use as contagens reais de tokens retornadas em cada resposta, em vez de estimar a partir de caracteres. Os tokenizadores variam entre famílias de modelos, o que significa que o mesmo texto não produz necessariamente a mesma contagem de tokens faturáveis.
Preços da API de GPT-5.6 Sol, Claude Sonnet 5 e Gemini 3.7 Flash
Os três IDs de modelo e tarifas abaixo foram verificados novamente no diretório de modelos em tempo real da CometAPI em 26 de agosto de 2026. A tarifa da CometAPI é o valor usado nos cálculos demonstrados. A coluna oficial é incluída como referência.
Preços da API de GPT-5.6 Sol
GPT-5.6 Terra: a CometAPI lista $1.60 por 1M tokens de entrada e $9.60 por 1M tokens de saída, versus a taxa oficial de $2 / $12. Nota de atualização de preço: a tarifa ao vivo reflete uma redução de 20%; o registro de alterações da CometAPI documenta a redução do Terra em 31 de julho de 2026, e o valor foi verificado novamente após a revisão de preços de 22 de agosto.
Atualização verificada (26 de agosto de 2026): A nota comentada precedente é mantida para que sua âncora de revisão permaneça visível. Para os cálculos neste artigo, use GPT-5.6 Sol a $3.20 por 1M tokens de entrada e $16 por 1M tokens de saída, em comparação com a taxa oficial de $4 / $20. A CometAPI anunciou a promoção em 24 de agosto de 2026 e a lista até 21 de novembro de 2026.
Preços da API de Claude Sonnet 5
Claude Sonnet 5: Em 26 de agosto de 2026, a CometAPI lista $1.60 por 1M tokens de entrada e $8 por 1M tokens de saída, em comparação com o preço de tabela atual da Anthropic de $2 / $10. A Anthropic atualizou seu post de lançamento em 10 de agosto de 2026 para tornar $2 / $10 permanente; o aumento previamente anunciado para $3 / $15 em 1º de setembro não se aplica mais.
Preços da API de Gemini 3.7 Flash
Gemini 3.7 Flash: Em 26 de agosto de 2026, a CometAPI lista $0.60 por 1M tokens de entrada e $3 por 1M tokens de saída, em comparação com a taxa introdutória do Google de $0.75 / $3.75 até 31 de dezembro de 2026.
| ID do modelo | Entrada / saída na CometAPI | Entrada / saída oficial | 800K in + 200K out |
|---|---|---|---|
| gpt-5.6-sol | $3.20 / $16 | $4 / $20 | $5.76 |
| claude-sonnet-5 | $1.60 / $8 | $2 / $10 | $2.88 |
| gemini-3.7-flash | $0.60 / $3 | $0.75 / $3.75 | $1.08 |
Todos os preços são em USD por 1M tokens. Consulte as páginas datadas de modelos para GPT-5.6, Claude Sonnet 5 e Gemini 3.7 Flash, além do guia de preços da CometAPI. Claude Sonnet 5: a CometAPI lista $1.60 por 1M tokens de entrada e $8 por 1M tokens de saída, em comparação com o preço de tabela atual da Anthropic de $2 / $10. A Anthropic originalmente anunciou preços padrão de $3 / $15 para setembro de 2026, mas atualizou a precificação em 10 de agosto de 2026 e tornou a taxa de $2 / $10 permanente. GPT-5.6 Terra também tem uma faixa de contexto longo mais alta, portanto não aplique o número de contexto curto a solicitações acima do limite publicado.
Gemini 3.7 Flash tem a menor fatura de tokens neste cenário e é posicionado como um modelo Flash eficiente. Claude Sonnet 5 é um modelo de produção equilibrado, enquanto GPT-5.6 Sol é a opção flagship para cargas de trabalho mais difíceis de raciocínio e codificação. A decisão útil não é apenas “qual linha é mais barata?”, mas “qual modelo produz um resultado aceitável com o menor número total de tokens, repetições e reexecuções?”
Quanto custa 1M tokens para GPT, Claude e Gemini?
Para a linha de base de 800K de entrada e 200K de saída, o cálculo é direto. GPT-5.6 Sol custa 0.8 × $3.20 + 0.2 × $16 = $5.76. Claude Sonnet 5 custa 0.8 × $1.60 + 0.2 × $8 = $2.88. Gemini 3.7 Flash custa 0.8 × $0.60 + 0.2 × $3 = $1.08.
Essa aritmética é útil para orçamento, mas o custo por saída aceita é a melhor métrica de produção. A tabela abaixo mostra o que acontece quando a mesma carga de trabalho sofre sobrecargas operacionais comuns.
| Modelo | Linha de base | 5% com repetição | 10% com reexecução | 40% de saída |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.76 | $6.05 | $6.34 | $8.32 |
| Claude Sonnet 5 | $2.88 | $3.02 | $3.17 | $4.16 |
| Gemini 3.7 Flash | $1.08 | $1.13 | $1.19 | $1.56 |
“5% com repetição” pressupõe que 5% de toda a carga de tokens seja enviada novamente. “10% com reexecução” pressupõe que um em cada dez resultados falha em uma verificação de qualidade e é regenerado com o mesmo mix de tokens. “40% de saída” mantém o total em 1M tokens, mas muda o mix para 600K de entrada e 400K de saída. Como tokens de saída custam mais, verbosidade pode aumentar a fatura mais rapidamente do que o crescimento de tráfego.
Quanto adicionam as repetições e as saídas com falha?
Quanto custam repetições (retries) e reexecuções da API?
As repetições podem duplicar trabalho faturável. Na linha de base, repetir 5% da carga eleva GPT-5.6 Sol de $5.76 para cerca de $6.05, enquanto reexecutar 10% após uma falha de qualidade eleva para cerca de $6.34. Uma repetição repete uma solicitação após uma falha de transporte ou serviço; uma reexecução regenera uma resposta que foi entregue, mas rejeitada. Repita apenas limites de taxa, timeouts e falhas temporárias do servidor. O guia de erros e repetição da CometAPI recomenda backoff exponencial com jitter e nenhuma repetição automática para solicitações malformadas ou erros de autenticação. Limite as tentativas para que um incidente do provedor não crie uma tempestade de repetições.
Quanto o cache de prompt pode economizar?
A economia de cache depende da reutilização. A tarifa de contexto curto da CometAPI para GPT-5.6 Sol lista leituras de cache a $0.32/M e gravações de cache a $4/M. Se metade dos 800K de entrada for um prefixo reutilizável em cache, a primeira execução custa cerca de $6.08 porque gravar 400K tokens em cache adiciona um acréscimo de $0.32 sobre a entrada normal. Uma execução posterior com acerto de cache custa cerca de $4.61 em vez de $5.76, economizando aproximadamente $1.15. Ponto de equilíbrio: uma reutilização bem-sucedida já recupera o acréscimo inicial de gravação; ao longo das duas primeiras execuções, o caminho com cache custa cerca de $10.69 versus $11.52 sem cache. Outros modelos têm regras e mínimos de cache diferentes, portanto verifique-os antes de orçar.
Como o comprimento da saída afeta o custo da API de IA?
Respostas longas são caras. As tarifas de saída nas três linhas são cinco vezes as de entrada. Defina um limite de saída que corresponda à tarefa, peça formatos concisos e pare de gerar assim que a estrutura requerida estiver completa.
Quanto custam saídas de IA com falha?
Uma tarefa com falha ainda pode consumir tokens. Uma solicitação que retorna uma resposta inutilizável pode ser tecnicamente bem-sucedida e totalmente faturável. Acompanhe violações de formato, alucinações, falhas de ferramenta e rejeição humana separadamente de erros HTTP.
O preço do token não mede o custo de engenharia. SDKs específicos de provedores, faturas separadas, monitoramento duplicado e trabalho de migração adicionam custo operacional. Ao comparar as três famílias via CometAPI, as equipes podem usar a mesma base de URL compatível com OpenAI — https://api.cometapi.com/v1 — e trocar o ID do modelo mantendo uma única camada de cobrança e observabilidade. Capacidades específicas de cada modelo ainda precisam de testes.
Como reduzir custos de API de GPT, Claude e Gemini
Quanto Batch e Flex podem reduzir custos de API?
Batch e Flex são modos de processamento, não descontos automáticos em toda solicitação. O guia de preços do GPT-5.6 da CometAPI diz que as taxas de tokens elegíveis em Batch e Flex estão cerca de 50% abaixo do Standard, enquanto a Anthropic lista até 50% de economia para processamento em lote. Aplicando uma hipótese de 50% ao baseline de $5.76 do GPT-5.6 Sol, chega-se a cerca de $2.88, mas trate isso como ilustração até que o mesmo modo e a mesma tarifa apareçam na sua conta da CometAPI. Use Batch para jobs assíncronos; use Flex apenas quando latência variável for aceitável.
GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: qual é o mais barato?
Usando o mesmo workload de 800K de entrada e 200K de saída nas tarifas da CometAPI verificadas em 26 de agosto de 2026, Gemini 3.7 Flash custa $1.08, Claude Sonnet 5 custa $2.88 e GPT-5.6 Terra custa $3.20. Gemini é o mais barato em custo bruto por token nesta comparação. GPT-5.6 Terra ainda pode ser econômico para tarefas mais difíceis se sua capacidade reduzir repetições ou correção humana, então compare o custo por resultado aceito antes de escolher uma rota de produção.
Roteie pela dificuldade da tarefa. Use um modelo de baixo custo para classificação, extração e rascunhos rotineiros e escale apenas solicitações ambíguas ou de alto valor. Um fallback deve corresponder às modalidades requeridas, suporte a ferramentas e formato de saída — não apenas ter uma tarifa mais baixa.
Orce a saída antes da chamada. Defina um máximo de saída realista e registre tokens de entrada, saída e em cache reais a partir da resposta. O guia de estimativa de custos da CometAPI trata estimativas pré-chamada como limites de orçamento e uso real como a medição final.
Fazer cache de conteúdo estável, não de contexto que muda. Instruções de sistema, políticas de produto e documentos de referência longos são bons candidatos quando se repetem. Meça a taxa de acerto do cache e inclua o custo de gravação; caso contrário, um cache pode parecer mais barato na teoria enquanto economiza pouco na produção.
Repita seletivamente. Adicione backoff exponencial, jitter e um limite máximo de tentativas. Registre o ID do modelo, status, ID da solicitação, tokens e se a solicitação foi uma repetição. Isso torna o gasto duplicado visível.
Otimize o custo por resultado aceito. Execute um conjunto de avaliação fixo e calcule total API spend / accepted outputs. Um modelo mais caro pode sair mais barato no geral se precisar de menos repetições, prompts mais curtos ou menos correção humana.
Verifique novamente antes do lançamento. Disponibilidade de modelos, tarifas introdutórias, limites de faixas e descontos mudam. Consulte a Models API ou revise o diretório público de modelos no dia em que você publicar ou aprovar um orçamento.
Perguntas frequentes
O que “custo por 1M tokens” realmente significa?
É uma taxa normalizada, não o preço de toda solicitação. Multiplique as tarifas de entrada e saída do modelo pelos tokens que seu workload realmente usa. Mantenha tokens em cache, faixas de contexto longo e cobranças por tarefa separadas.
Qual é o mais barato: GPT, Claude ou Gemini?
Para os modelos específicos e o workload de 800K de entrada/200K de saída verificados em 26 de agosto de 2026, Gemini 3.7 Flash é a opção de menor custo a $1.08 via CometAPI, seguido por Claude Sonnet 5 a $2.88 e GPT-5.6 Sol a $5.76. Não é automaticamente a melhor escolha para toda tarefa; compare qualidade, latência e custo por saída aceita em seus próprios prompts.
Devo comparar preços oficiais ou de agregadores?
Compare o preço que você realmente pagará e mantenha a tarifa oficial como referência. Use a mesma data, moeda, mix de tokens, faixa e suposições de desconto para cada linha.
Repetições são sempre cobradas?
Não presuma que sejam gratuitas. Uma solicitação de transporte com falha pode não chegar à inferência, enquanto um resultado rejeitado ou com timeout pode já ter consumido trabalho do modelo. Use registros reais de uso e faturamento e evite repetições automáticas de erros não repetíveis.
Cache de prompt sempre reduz o custo?
Não. Gravações em cache podem custar mais do que a entrada normal, e a economia depende de leituras repetidas. Calcule o ponto de equilíbrio a partir das tarifas atuais de gravação e leitura do modelo e, depois, monitore acertos reais de cache.
Com que frequência a precificação deve ser verificada?
Verifique antes de publicar uma afirmação de preço, trocar um modelo em produção ou aprovar uma previsão. Armazene o ID do modelo e a data de verificação junto com o cálculo para que a estimativa possa ser reproduzida depois.
Conclusão: qual API de IA é mais barata para sua carga de trabalho?
Uma comparação justa de preços entre GPT, Claude e Gemini usa uma única fonte datada, um único mix de tokens e uma única definição de sucesso. As tarifas por token criam a linha de base; cache, repetições, comprimento da saída e falhas de qualidade determinam a fatura real. A CometAPI facilita testes entre provedores ao manter o endpoint e a camada de cobrança consistentes, mas o modelo de menor custo ainda é aquele que atende à sua meta de qualidade com o menor trabalho total.
