Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Pesquisa CometAPI

Preços do GPT-5.6 em 2026: Custos da API de Sol, Terra & Luna

Compare os preços da API GPT-5.6 para Sol, Terra e Luna, com exemplos reais de custos, cache, tarifas para contexto longo, taxas de ferramentas e custos ocultos explicados.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 1, 2026 14 min de leitura
Preços do GPT-5.6 em 2026: Custos da API de Sol, Terra & Luna
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Preços atualizados: As tarifas de contexto curto do GPT-5.6 Standard agora são $5 de entrada / $30 de saída para Sol, $2 / $12 para Terra e $0.20 / $1.20 para Luna por 1 milhão de tokens.

Em 30 de julho de 2026, a OpenAI reduziu os preços do GPT-5.6 Terra em 20% e do Luna em 80%. Os preços do Sol permanecem inalterados.

Atenção aos fatores ocultos de custo: o alias genérico gpt-5.6 roteia para Sol, solicitações acima de 272K tokens de entrada usam tarifas mais altas de contexto longo, e tokens de saída ainda custam 6× mais do que tokens de entrada nas três camadas.

Para cargas de trabalho Sol sensíveis à latência, o novo Fast mode da OpenAI oferece até 2,5× mais rapidez por 2× o preço do Standard.

OpenAI API Pricing at a Glance

Para usuários pesquisando de forma ampla sobre OpenAI API pricing, a primeira pergunta geralmente é: por qual modelo atual estou realmente pagando? A tabela abaixo oferece uma visão compacta de vários modelos de texto atuais da OpenAI antes de olharmos mais de perto para o GPT-5.6.

(> Atualização de preços — 30 de julho de 2026: a OpenAI reduziu os preços da API do GPT-5.6 Terra em 20% e do Luna em 80%. Terra agora custa $2 por 1M tokens de entrada e $12 por 1M tokens de saída, enquanto Luna custa $0.20 de entrada e $1.20 de saída. Os preços do Sol permanecem inalterados.)

ModelInput / 1M tokensCached inputOutput / 1M tokens
gpt-5.6-sol$5.00$0.50$30.00
gpt-5.6-terra$2.00$0.20$12.00
gpt-5.6-luna$0.20$0.02$1.20
gpt-5.5$5.00$0.50$30.00
gpt-5.4$2.50$0.25$15.00
gpt-5.4-mini$0.75$0.075$4.50
gpt-5.4-nano$0.20$0.02$1.25

No seu novo preço, Luna iguala a tarifa de entrada de $0.20 do GPT-5.4 nano, oferecendo uma tarifa de saída ligeiramente menor de $1.20 versus $1.25.

Fonte*:* OpenAI API pricing

O padrão mais importante é fácil de passar despercebido: tokens de saída do GPT-5.6 custam 6× mais do que tokens de entrada nas camadas Sol, Terra e Luna. Respostas longas, agentes prolixos e fluxos de trabalho com muito raciocínio podem, portanto, elevar os custos mais rapidamente do que pequenas mudanças no tamanho do prompt.

Para uma visão mais ampla da família GPT-5.6 — incluindo capacidades do modelo, posicionamento, benchmarks, acesso à API e recursos-chave de lançamento — veja o anúncio do GPT-5.6 da OpenAI ou o guia do GPT-5.6. da CometAPI. Este artigo foca especificamente em preços, cálculos de custo e fatores que podem afetar sua conta real da API.

GPT-5.6 Pricing: Sol vs Terra vs Luna

O GPT-5.6 introduz três camadas de preços. A OpenAI posiciona Sol como a rota principal, Terra como a opção equilibrada e Luna como a camada de menor custo para cargas de alto volume.

Para um exame mais detalhado das capacidades, de como acessar a API do GPT-5.6 e casos de uso de cada modelo, veja mais detalhes aqui sobre modelo GPT-5.6 .

Preços do GPT-5.6 Standard para solicitações com ≤272K tokens de entrada

ModelShort inputCached inputCache writeShort outputLong inputLong cached inputLong cache writeLong output
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.00$0.20$2.50$12.00$4.00$0.40$5.00$18.00
gpt-5.6-luna$0.20$0.02$0.25$1.20$0.40$0.04$0.50$1.80

Fonte*:* OpenAI API pricing

Preços de contexto longo: Solicitações com mais de 272K tokens de entrada usam tarifas mais altas. Entrada, entrada em cache e gravações de cache são cobradas a a tarifa padrão, enquanto a saída é cobrada a 1,5×. As tarifas mais altas se aplicam à solicitação inteira.

Um ponto de partida razoável é testar Luna para tarefas mais simples e de alto volume, Terra para cargas de trabalho de aplicação equilibradas e Sol para as tarefas mais difíceis ou de alto impacto. Essas não são recomendações universais: precisão, tentativas, comportamento de ferramentas e revisão humana podem superar a diferença no preço de tabela.

Um detalhe importante sobre o alias

A orientação de modelos da OpenAI afirma que o alias genérico gpt-5.6 roteia para gpt-5.6-sol.

Isso significa que uma solicitação enviada para gpt-5.6 usa a camada de preço Sol. Se sua carga de trabalho funciona bem em Terra ou Luna, use o ID de modelo explícito em vez de supor que o alias genérico seleciona a camada adequada mais barata.

Exemplo 1: Uma solicitação típica de API

Comece com um formato de solicitação comum:

  • 1,000 tokens de entrada
  • 500 tokens de saída
ModelMonthly input costMonthly output costTotal
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$4,000$6,000$10,000
gpt-5.6-luna$400$600$1,000

Nesse cenário, o novo preço do Luna reduz a estimativa da conta mensal de tokens de $5,000 para $1,000, enquanto o Terra cai de $12,500 para $10,000.

Cálculo para Sol:

(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020

Este exemplo também mostra por que o comprimento da saída importa. Embora a solicitação contenha o dobro de tokens de entrada em relação à saída, a parte de saída representa 75% do custo de tokens do Sol porque a saída é precificada a seis vezes a tarifa de entrada.

Para chat, agentes e geração de código, controlar a verbosidade desnecessária às vezes pode economizar mais do que reduzir um pequeno prompt de sistema.

Exemplo 2: Custo mensal em escala

Agora suponha que um aplicativo manipule 1 milhão de solicitações por mês, em média:

  • 2,000 tokens de entrada por solicitação
  • 500 tokens de saída por solicitação

Isso equivale a 2 bilhões de tokens de entrada e 500 milhões de tokens de saída por mês.

ModelMonthly input costMonthly output costTotal
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$5,000$7,500$12,500
gpt-5.6-luna$2,000$3,000$5,000

A diferença é grande o suficiente para justificar testes de roteamento, mas a linha mais baixa não é automaticamente a melhor escolha de produção. Se um modelo mais barato causar mais tentativas, tarefas com falha ou revisão manual, o custo total do fluxo de trabalho pode ser maior.

Preços de contexto longo: o que acontece acima de 272K tokens?

Os modelos GPT-5.6 suportam uma janela de contexto de 1.05M tokens, mas a OpenAI aplica tarifas mais altas quando uma solicitação contém mais de 272,000 tokens de entrada.

Para essas solicitações de contexto longo:

  • a entrada é cobrada a a tarifa de contexto curto
  • entrada em cache e gravações de cache também são cobradas a
  • a saída é cobrada a 1,5×
  • As tarifas mais altas se aplicam à solicitação inteira, não apenas aos tokens acima de 272K

Para Sol, isso altera a entrada de $5 para $10 por 1M tokens e a saída de $30 para $45. A mesma estrutura de multiplicadores se aplica a Terra e Luna.

Isso cria um salto de custo próximo a 272K. Para cargas de trabalho próximas ao limite, reduza blocos de recuperação duplicados, histórico de conversa obsoleto, arquivos de repositório desnecessários ou saída verbosa de ferramentas antes de enviar a solicitação. Consulte o guia de otimização de custos da OpenAI para orientações adicionais de redução de tokens.

Standard, Batch, Flex e Priority Pricing

Para cargas de trabalho de texto elegíveis do GPT-5.6, a OpenAI oferece vários níveis de processamento.

TierSol input/outputTerra input/outputLuna input/outputTypical use
Standard$5 / $30$2 / $12$0.20 / $1.20Normal synchronous traffic
Batch$2.50 / $15$1 / $6$0.10 / $0.60Offline asynchronous jobs
Flex$2.50 / $15$1 / $6$0.10 / $0.60Cost-sensitive workloads that can tolerate slower processing
Fast mode$10 / $60$4 / $24$0.40 / $2.40Latency-sensitive short-context traffic

Batch e Flex permanecem aproximadamente 50% mais baratos do que os preços Standard. Priority Processing foi renomeado para Fast mode em 30 de julho de 2026, embora solicitações existentes usando service_tier: "priority" permaneçam compatíveis.

Para o GPT-5.6 Sol, o Fast mode oferece até 2,5× mais rapidez do que o Standard a 2× o preço de tokens do Standard, sem alteração na inteligência do modelo. É mais apropriado quando a latência voltada ao usuário justifica o prêmio.

Cache de prompt: quando economiza dinheiro no GPT-5.6 ?

Para o GPT-5.6, gravações de cache custam 1,25× a tarifa normal de entrada, enquanto leituras em cache recebem o preço reduzido de entrada em cache.

Considere um prefixo de 100,000 tokens reutilizável no Sol:

ActionCost
Process once as normal uncached input$0.50
Write the prefix to cache$0.63
Read the cached prefix later$0.05

Duas utilizações sem cache custam $1.00. Uma gravação de cache mais uma leitura em cache correspondente custa $0.675, economizando $0.325 neste exemplo simplificado.

Limite deste exemplo: Este cálculo compara apenas o custo de entrada do prefixo reutilizável. Ele não inclui tokens de saída, outra entrada não armazenada em cache, ferramentas ou tentativas. As economias reais dependem de o prefixo atender aos requisitos de cache e de quantas vezes ele é realmente reutilizado.

O cache é, portanto, mais útil para prefixos de prompt longos e estáveis que recebem solicitações repetidas correspondentes. Uma gravação de cache que nunca é reutilizada adiciona custo em vez de reduzi-lo.

O guia de cache de prompt da OpenAI documenta preços de gravação de cache, leituras em cache, breakpoints explícitos e comportamento de TTL.

Outros custos que podem alterar sua conta da OpenAI API

Tokens de raciocínio e modo Pro

Tokens de raciocínio são cobrados como tokens de saída mesmo quando não aparecem como texto de resposta visível. Configurações de raciocínio mais altas podem, portanto, aumentar o uso total de tokens de saída e a latência.

Onde suportado, reasoning.mode = "pro" deve ser tratado como uma configuração a ser benchmarkada, não como uma regra padrão de economia de custos ou qualidade. A OpenAI não lista uma sobretaxa Pro fixa separada para esse modo; o impacto no custo vem do uso resultante de tokens. Um ponto de partida razoável é testar Standard e Pro em tarefas representativas e comparar sucesso da tarefa, total de tokens de saída, latência e tentativas.

Pesquisa na web e outras ferramentas

A OpenAI atualmente lista a pesquisa web padrão em $10 por 1,000 chamadas, além de tokens do conteúdo da pesquisa cobrados à tarifa do modelo selecionado. Duas pesquisas na web em uma pequena solicitação no Luna podem, portanto, custar mais do que os tokens do modelo da solicitação.

A OpenAI também lista um preço separado de preview de pesquisa web para modelos sem raciocínio em $25 por 1,000 chamadas, com tokens de conteúdo de pesquisa gratuitos. Verifique a combinação exata de ferramenta e modelo na página oficial de preços em vez de aplicar uma tarifa de pesquisa web a cada endpoint.

Processamento regional

Endpoints elegíveis de processamento regional ou de residência de dados para modelos lançados em ou após 5 de março de 2026 têm um acréscimo de 10%, de acordo com a página de preços da OpenAI. Equipes corporativas com requisitos de residência devem incluir esse fator nas estimativas de orçamento.

Como calcular o custo da OpenAI API

Para uma solicitação básica:

Custo de tokens =

(input tokens / 1M × input rate)

  • (output tokens / 1M × output rate)

Para planejamento de produção, expanda para incluir:

Custo total do fluxo de trabalho =

uncached input

  • cached input
  • cache writes
  • output and reasoning tokens
  • tool fees
  • service-tier adjustments
  • regional uplift, if applicable
  • retries and fallback requests

O KPI mais útil costuma ser:

Custo por tarefa bem-sucedida = custo total do fluxo de trabalho / tarefas bem-sucedidas

Isso evita que uma tarifa de tokens mais barata pareça artificialmente atraente quando também produz mais falhas ou trabalho de revisão.

Como escolher o modelo certo sem pagar a mais

Use a tabela de preços como ponto de partida e teste em tarefas reais.

  1. Comece com o modelo de menor custo que parece capaz da tarefa. Luna pode ser um primeiro teste sensato para trabalho simples e de alto volume, mas não presuma que será o melhor para todas as cargas de extração ou sumarização.
  2. Meça o comprimento da saída. Tokens de saída do GPT-5.6 custam 6× tokens de entrada, então respostas prolixas merecem atenção.
  3. Observe o limite de 272K. Ultrapassá-lo altera as tarifas para a solicitação inteira.
  4. Use Batch ou Flex para trabalho não urgente elegível. Teste as restrições operacionais antes de mover o tráfego de produção.
  5. Faça cache apenas de prefixos reutilizáveis. Meça acertos reais de cache em vez de presumir que um prompt longo deve ser armazenado em cache.
  6. Acompanhe ferramentas e tentativas. Elas podem eliminar as economias de um modelo mais barato.

Para equipes comparando rotas entre provedores, o preço da CometAPI fornece uma visão cruzada ao vivo de modelos. O CometAPI Quickstart e o Cookbook podem ser usados para executar o mesmo conjunto de testes em várias rotas compatíveis com a OpenAI.

FAQ

Quanto custa o GPT-5.6 em 2026?

A precificação depende do modelo. As tarifas de contexto curto do GPT-5.6 Standard variam de $1 de entrada / $6 de saída por 1M tokens para o Luna a $5 / $30 para o Sol. Modelos de menor custo como GPT-5.4 mini e nano também estão disponíveis. Verifique o modelo exato na página de preços ao vivo da OpenAI.

O preço da API do ChatGPT é o mesmo do GPT-5.6?

“ChatGPT API pricing” é frequentemente usado informalmente para significar a precificação da OpenAI API para modelos compatíveis com chat, mas as assinaturas do ChatGPT e o faturamento da API são produtos separados. O uso da API é cobrado pelo modelo específico e tipo de uso.

Qual modelo GPT-5.6 é o mais barato?

gpt-5.6-luna é o modelo GPT-5.6 mais barato, com preço de $0.20 por 1M tokens de entrada e $1.20 por 1M tokens de saída. A OpenAI reduziu ambas as tarifas em 80% em 30 de julho, tornando o Luna substancialmente mais econômico para agentes de alto volume, classificação, processamento de documentos e fluxos de trabalho com ferramentas bem definidas.

Qual modelo o gpt-5.6 usa?

A orientação de modelos da OpenAI afirma que o alias gpt-5.6 roteia para gpt-5.6-sol. Use IDs de modelo explícitos Terra ou Luna quando quiser essas camadas.

Quando se aplica a precificação de contexto longo do GPT-5.6?

Quando a entrada excede 272,000 tokens, o GPT-5.6 usa tarifas mais altas de contexto longo para a solicitação inteira: 2× nas tarifas relacionadas à entrada e 1,5× nas tarifas de saída.

Batch e Flex são mais baratos que Standard para o GPT-5.6?

Para cargas de trabalho elegíveis do GPT-5.6, as tarifas de tokens listadas para Batch e Flex são cerca de 50% mais baixas do que as do Standard. Eles têm características de processamento diferentes, então confirme se a carga de trabalho pode tolerar essas restrições.

Gravações de cache custam extra no GPT-5.6?

Sim. As gravações de cache do GPT-5.6 são precificadas a 1,25× da entrada normal, enquanto leituras em cache correspondentes usam a tarifa com desconto de entrada em cache. As economias dependem da reutilização real.

Compare os custos do GPT-5.6 na sua própria carga de trabalho

Tabelas de preços são um ponto de partida. Seu custo real depende de prompts, comprimento da saída, taxa de acertos do cache, ferramentas, tentativas e sucesso da tarefa.

Com a CometAPI, você pode testar GPT-5.6 Sol, Terra, Luna e outros modelos por meio de uma única API compatível com a OpenAI usando a mesma carga de trabalho.

Próximos passos: compare os preços atuais dos modelos, siga o CometAPI Quickstart ou use o CometAPI Cookbook para criar avaliações de modelos reproduzíveis.

Escolha a rota de menor custo que ainda atenda aos seus requisitos de qualidade, latência e confiabilidade.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Jul 15, 2026
Última atualização Sep 1, 2026
605 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais