TL;DR
Preços atualizados: As tarifas de contexto curto do GPT-5.6 Standard agora são $5 de entrada / $30 de saída para Sol, $2 / $12 para Terra e $0.20 / $1.20 para Luna por 1 milhão de tokens.
Em 30 de julho de 2026, a OpenAI reduziu os preços do GPT-5.6 Terra em 20% e do Luna em 80%. Os preços do Sol permanecem inalterados.
Atenção aos fatores ocultos de custo: o alias genérico gpt-5.6 roteia para Sol, solicitações acima de 272K tokens de entrada usam tarifas mais altas de contexto longo, e tokens de saída ainda custam 6× mais do que tokens de entrada nas três camadas.
Para cargas de trabalho Sol sensíveis à latência, o novo Fast mode da OpenAI oferece até 2,5× mais rapidez por 2× o preço do Standard.
OpenAI API Pricing at a Glance
Para usuários pesquisando de forma ampla sobre OpenAI API pricing, a primeira pergunta geralmente é: por qual modelo atual estou realmente pagando? A tabela abaixo oferece uma visão compacta de vários modelos de texto atuais da OpenAI antes de olharmos mais de perto para o GPT-5.6.
(> Atualização de preços — 30 de julho de 2026: a OpenAI reduziu os preços da API do GPT-5.6 Terra em 20% e do Luna em 80%. Terra agora custa $2 por 1M tokens de entrada e $12 por 1M tokens de saída, enquanto Luna custa $0.20 de entrada e $1.20 de saída. Os preços do Sol permanecem inalterados.)
| Model | Input / 1M tokens | Cached input | Output / 1M tokens |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $30.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $12.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5.00 | $0.50 | $30.00 |
| gpt-5.4 | $2.50 | $0.25 | $15.00 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
No seu novo preço, Luna iguala a tarifa de entrada de $0.20 do GPT-5.4 nano, oferecendo uma tarifa de saída ligeiramente menor de $1.20 versus $1.25.
Fonte*:* OpenAI API pricing
O padrão mais importante é fácil de passar despercebido: tokens de saída do GPT-5.6 custam 6× mais do que tokens de entrada nas camadas Sol, Terra e Luna. Respostas longas, agentes prolixos e fluxos de trabalho com muito raciocínio podem, portanto, elevar os custos mais rapidamente do que pequenas mudanças no tamanho do prompt.
Para uma visão mais ampla da família GPT-5.6 — incluindo capacidades do modelo, posicionamento, benchmarks, acesso à API e recursos-chave de lançamento — veja o anúncio do GPT-5.6 da OpenAI ou o guia do GPT-5.6. da CometAPI. Este artigo foca especificamente em preços, cálculos de custo e fatores que podem afetar sua conta real da API.
GPT-5.6 Pricing: Sol vs Terra vs Luna
O GPT-5.6 introduz três camadas de preços. A OpenAI posiciona Sol como a rota principal, Terra como a opção equilibrada e Luna como a camada de menor custo para cargas de alto volume.
Para um exame mais detalhado das capacidades, de como acessar a API do GPT-5.6 e casos de uso de cada modelo, veja mais detalhes aqui sobre modelo GPT-5.6 .
Preços do GPT-5.6 Standard para solicitações com ≤272K tokens de entrada
| Model | Short input | Cached input | Cache write | Short output | Long input | Long cached input | Long cache write | Long output |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
Fonte*:* OpenAI API pricing
Preços de contexto longo: Solicitações com mais de 272K tokens de entrada usam tarifas mais altas. Entrada, entrada em cache e gravações de cache são cobradas a 2× a tarifa padrão, enquanto a saída é cobrada a 1,5×. As tarifas mais altas se aplicam à solicitação inteira.
Um ponto de partida razoável é testar Luna para tarefas mais simples e de alto volume, Terra para cargas de trabalho de aplicação equilibradas e Sol para as tarefas mais difíceis ou de alto impacto. Essas não são recomendações universais: precisão, tentativas, comportamento de ferramentas e revisão humana podem superar a diferença no preço de tabela.
Um detalhe importante sobre o alias
A orientação de modelos da OpenAI afirma que o alias genérico gpt-5.6 roteia para gpt-5.6-sol.
Isso significa que uma solicitação enviada para gpt-5.6 usa a camada de preço Sol. Se sua carga de trabalho funciona bem em Terra ou Luna, use o ID de modelo explícito em vez de supor que o alias genérico seleciona a camada adequada mais barata.
Exemplo 1: Uma solicitação típica de API
Comece com um formato de solicitação comum:
- 1,000 tokens de entrada
- 500 tokens de saída
| Model | Monthly input cost | Monthly output cost | Total |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $4,000 | $6,000 | $10,000 |
| gpt-5.6-luna | $400 | $600 | $1,000 |
Nesse cenário, o novo preço do Luna reduz a estimativa da conta mensal de tokens de $5,000 para $1,000, enquanto o Terra cai de $12,500 para $10,000.
Cálculo para Sol:
(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020
Este exemplo também mostra por que o comprimento da saída importa. Embora a solicitação contenha o dobro de tokens de entrada em relação à saída, a parte de saída representa 75% do custo de tokens do Sol porque a saída é precificada a seis vezes a tarifa de entrada.
Para chat, agentes e geração de código, controlar a verbosidade desnecessária às vezes pode economizar mais do que reduzir um pequeno prompt de sistema.
Exemplo 2: Custo mensal em escala
Agora suponha que um aplicativo manipule 1 milhão de solicitações por mês, em média:
- 2,000 tokens de entrada por solicitação
- 500 tokens de saída por solicitação
Isso equivale a 2 bilhões de tokens de entrada e 500 milhões de tokens de saída por mês.
| Model | Monthly input cost | Monthly output cost | Total |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $5,000 | $7,500 | $12,500 |
| gpt-5.6-luna | $2,000 | $3,000 | $5,000 |
A diferença é grande o suficiente para justificar testes de roteamento, mas a linha mais baixa não é automaticamente a melhor escolha de produção. Se um modelo mais barato causar mais tentativas, tarefas com falha ou revisão manual, o custo total do fluxo de trabalho pode ser maior.
Preços de contexto longo: o que acontece acima de 272K tokens?
Os modelos GPT-5.6 suportam uma janela de contexto de 1.05M tokens, mas a OpenAI aplica tarifas mais altas quando uma solicitação contém mais de 272,000 tokens de entrada.
Para essas solicitações de contexto longo:
- a entrada é cobrada a 2× a tarifa de contexto curto
- entrada em cache e gravações de cache também são cobradas a 2×
- a saída é cobrada a 1,5×
- As tarifas mais altas se aplicam à solicitação inteira, não apenas aos tokens acima de 272K
Para Sol, isso altera a entrada de $5 para $10 por 1M tokens e a saída de $30 para $45. A mesma estrutura de multiplicadores se aplica a Terra e Luna.
Isso cria um salto de custo próximo a 272K. Para cargas de trabalho próximas ao limite, reduza blocos de recuperação duplicados, histórico de conversa obsoleto, arquivos de repositório desnecessários ou saída verbosa de ferramentas antes de enviar a solicitação. Consulte o guia de otimização de custos da OpenAI para orientações adicionais de redução de tokens.
Standard, Batch, Flex e Priority Pricing
Para cargas de trabalho de texto elegíveis do GPT-5.6, a OpenAI oferece vários níveis de processamento.
| Tier | Sol input/output | Terra input/output | Luna input/output | Typical use |
|---|---|---|---|---|
| Standard | $5 / $30 | $2 / $12 | $0.20 / $1.20 | Normal synchronous traffic |
| Batch | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Offline asynchronous jobs |
| Flex | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Cost-sensitive workloads that can tolerate slower processing |
| Fast mode | $10 / $60 | $4 / $24 | $0.40 / $2.40 | Latency-sensitive short-context traffic |
Batch e Flex permanecem aproximadamente 50% mais baratos do que os preços Standard. Priority Processing foi renomeado para Fast mode em 30 de julho de 2026, embora solicitações existentes usando service_tier: "priority" permaneçam compatíveis.
Para o GPT-5.6 Sol, o Fast mode oferece até 2,5× mais rapidez do que o Standard a 2× o preço de tokens do Standard, sem alteração na inteligência do modelo. É mais apropriado quando a latência voltada ao usuário justifica o prêmio.
Cache de prompt: quando economiza dinheiro no GPT-5.6 ?
Para o GPT-5.6, gravações de cache custam 1,25× a tarifa normal de entrada, enquanto leituras em cache recebem o preço reduzido de entrada em cache.
Considere um prefixo de 100,000 tokens reutilizável no Sol:
| Action | Cost |
|---|---|
| Process once as normal uncached input | $0.50 |
| Write the prefix to cache | $0.63 |
| Read the cached prefix later | $0.05 |
Duas utilizações sem cache custam $1.00. Uma gravação de cache mais uma leitura em cache correspondente custa $0.675, economizando $0.325 neste exemplo simplificado.
Limite deste exemplo: Este cálculo compara apenas o custo de entrada do prefixo reutilizável. Ele não inclui tokens de saída, outra entrada não armazenada em cache, ferramentas ou tentativas. As economias reais dependem de o prefixo atender aos requisitos de cache e de quantas vezes ele é realmente reutilizado.
O cache é, portanto, mais útil para prefixos de prompt longos e estáveis que recebem solicitações repetidas correspondentes. Uma gravação de cache que nunca é reutilizada adiciona custo em vez de reduzi-lo.
O guia de cache de prompt da OpenAI documenta preços de gravação de cache, leituras em cache, breakpoints explícitos e comportamento de TTL.
Outros custos que podem alterar sua conta da OpenAI API
Tokens de raciocínio e modo Pro
Tokens de raciocínio são cobrados como tokens de saída mesmo quando não aparecem como texto de resposta visível. Configurações de raciocínio mais altas podem, portanto, aumentar o uso total de tokens de saída e a latência.
Onde suportado, reasoning.mode = "pro" deve ser tratado como uma configuração a ser benchmarkada, não como uma regra padrão de economia de custos ou qualidade. A OpenAI não lista uma sobretaxa Pro fixa separada para esse modo; o impacto no custo vem do uso resultante de tokens. Um ponto de partida razoável é testar Standard e Pro em tarefas representativas e comparar sucesso da tarefa, total de tokens de saída, latência e tentativas.
Pesquisa na web e outras ferramentas
A OpenAI atualmente lista a pesquisa web padrão em $10 por 1,000 chamadas, além de tokens do conteúdo da pesquisa cobrados à tarifa do modelo selecionado. Duas pesquisas na web em uma pequena solicitação no Luna podem, portanto, custar mais do que os tokens do modelo da solicitação.
A OpenAI também lista um preço separado de preview de pesquisa web para modelos sem raciocínio em $25 por 1,000 chamadas, com tokens de conteúdo de pesquisa gratuitos. Verifique a combinação exata de ferramenta e modelo na página oficial de preços em vez de aplicar uma tarifa de pesquisa web a cada endpoint.
Processamento regional
Endpoints elegíveis de processamento regional ou de residência de dados para modelos lançados em ou após 5 de março de 2026 têm um acréscimo de 10%, de acordo com a página de preços da OpenAI. Equipes corporativas com requisitos de residência devem incluir esse fator nas estimativas de orçamento.
Como calcular o custo da OpenAI API
Para uma solicitação básica:
Custo de tokens =
(input tokens / 1M × input rate)
- (output tokens / 1M × output rate)
Para planejamento de produção, expanda para incluir:
Custo total do fluxo de trabalho =
uncached input
- cached input
- cache writes
- output and reasoning tokens
- tool fees
- service-tier adjustments
- regional uplift, if applicable
- retries and fallback requests
O KPI mais útil costuma ser:
Custo por tarefa bem-sucedida = custo total do fluxo de trabalho / tarefas bem-sucedidas
Isso evita que uma tarifa de tokens mais barata pareça artificialmente atraente quando também produz mais falhas ou trabalho de revisão.
Como escolher o modelo certo sem pagar a mais
Use a tabela de preços como ponto de partida e teste em tarefas reais.
- Comece com o modelo de menor custo que parece capaz da tarefa. Luna pode ser um primeiro teste sensato para trabalho simples e de alto volume, mas não presuma que será o melhor para todas as cargas de extração ou sumarização.
- Meça o comprimento da saída. Tokens de saída do GPT-5.6 custam 6× tokens de entrada, então respostas prolixas merecem atenção.
- Observe o limite de 272K. Ultrapassá-lo altera as tarifas para a solicitação inteira.
- Use Batch ou Flex para trabalho não urgente elegível. Teste as restrições operacionais antes de mover o tráfego de produção.
- Faça cache apenas de prefixos reutilizáveis. Meça acertos reais de cache em vez de presumir que um prompt longo deve ser armazenado em cache.
- Acompanhe ferramentas e tentativas. Elas podem eliminar as economias de um modelo mais barato.
Para equipes comparando rotas entre provedores, o preço da CometAPI fornece uma visão cruzada ao vivo de modelos. O CometAPI Quickstart e o Cookbook podem ser usados para executar o mesmo conjunto de testes em várias rotas compatíveis com a OpenAI.
FAQ
Quanto custa o GPT-5.6 em 2026?
A precificação depende do modelo. As tarifas de contexto curto do GPT-5.6 Standard variam de $1 de entrada / $6 de saída por 1M tokens para o Luna a $5 / $30 para o Sol. Modelos de menor custo como GPT-5.4 mini e nano também estão disponíveis. Verifique o modelo exato na página de preços ao vivo da OpenAI.
O preço da API do ChatGPT é o mesmo do GPT-5.6?
“ChatGPT API pricing” é frequentemente usado informalmente para significar a precificação da OpenAI API para modelos compatíveis com chat, mas as assinaturas do ChatGPT e o faturamento da API são produtos separados. O uso da API é cobrado pelo modelo específico e tipo de uso.
Qual modelo GPT-5.6 é o mais barato?
gpt-5.6-luna é o modelo GPT-5.6 mais barato, com preço de $0.20 por 1M tokens de entrada e $1.20 por 1M tokens de saída. A OpenAI reduziu ambas as tarifas em 80% em 30 de julho, tornando o Luna substancialmente mais econômico para agentes de alto volume, classificação, processamento de documentos e fluxos de trabalho com ferramentas bem definidas.
Qual modelo o gpt-5.6 usa?
A orientação de modelos da OpenAI afirma que o alias gpt-5.6 roteia para gpt-5.6-sol. Use IDs de modelo explícitos Terra ou Luna quando quiser essas camadas.
Quando se aplica a precificação de contexto longo do GPT-5.6?
Quando a entrada excede 272,000 tokens, o GPT-5.6 usa tarifas mais altas de contexto longo para a solicitação inteira: 2× nas tarifas relacionadas à entrada e 1,5× nas tarifas de saída.
Batch e Flex são mais baratos que Standard para o GPT-5.6?
Para cargas de trabalho elegíveis do GPT-5.6, as tarifas de tokens listadas para Batch e Flex são cerca de 50% mais baixas do que as do Standard. Eles têm características de processamento diferentes, então confirme se a carga de trabalho pode tolerar essas restrições.
Gravações de cache custam extra no GPT-5.6?
Sim. As gravações de cache do GPT-5.6 são precificadas a 1,25× da entrada normal, enquanto leituras em cache correspondentes usam a tarifa com desconto de entrada em cache. As economias dependem da reutilização real.
Compare os custos do GPT-5.6 na sua própria carga de trabalho
Tabelas de preços são um ponto de partida. Seu custo real depende de prompts, comprimento da saída, taxa de acertos do cache, ferramentas, tentativas e sucesso da tarefa.
Com a CometAPI, você pode testar GPT-5.6 Sol, Terra, Luna e outros modelos por meio de uma única API compatível com a OpenAI usando a mesma carga de trabalho.
Próximos passos: compare os preços atuais dos modelos, siga o CometAPI Quickstart ou use o CometAPI Cookbook para criar avaliações de modelos reproduzíveis.
Escolha a rota de menor custo que ainda atenda aos seus requisitos de qualidade, latência e confiabilidade.
