TL;DR
GPT-6.1 Sol é o modelo de raciocínio da OpenAI para programação complexa, uso de computador e fluxos de trabalho profissionais. Ele mantém as tarifas oficiais de Standard do GPT-6 Sol para entrada nova e saída em $2/$10 por milhão de tokens, enquanto reduz leituras de cache de contexto curto de $0.20 para $0.10. A reutilização bem-sucedida do cache pode reduzir custos de contexto repetido. Entradas acima de 272K tokens acionam tarifas mais altas para a solicitação inteira, portanto estime cada solicitação antes de agregar uma fatura. A CometAPI possui uma tabela de gateway separada.
Principais pontos
- Separe entrada nova, leituras de cache, gravações de cache e saída faturada; a saída inclui tokens de raciocínio.
- Use a faixa de contexto correta para cada solicitação. Uma capacidade de contexto de 1,05M não implica preço de contexto curto.
- Compare OpenAI e CometAPI usando a mesma composição de tokens e os termos de faturamento aplicáveis da conta.
- Escolha o modo de processamento de acordo com latência, disponibilidade e suporte de rota.
- Avalie a economia do agente pelo custo total por tarefa aceita, incluindo tentativas malsucedidas.
What Is the GPT-6.1 Sol Price at a Glance?
Todos os preços por token abaixo são em USD por milhão de tokens. A tabela oficial de preços por token fornece a referência da OpenAI; leituras e gravações de cache são categorias de cobrança separadas. As faixas de contexto referem-se a tokens de entrada em uma solicitação individual.
| Modo OpenAI / faixa de entrada | Entrada nova | Leitura de cache | Gravação de cache | Saída |
|---|---|---|---|---|
| Standard: no máximo 272K | $2.00 | $0.10 | $2.50 | $10.00 |
| Standard: acima de 272K | $4.00 | $0.20 | $5.00 | $15.00 |
| Batch/Flex: no máximo 272K | $1.00 | $0.05 | $1.25 | $5.00 |
| Batch/Flex: acima de 272K | $2.00 | $0.10 | $2.50 | $7.50 |
| Fast: no máximo 272K | $4.00 | $0.20 | $5.00 | $20.00 |
| Fast: acima de 272K | $8.00 | $0.40 | $10.00 | $30.00 |
| Ultrafast: no máximo 272K | $12.00 | $0.60 | $15.00 | $60.00 |
| Ultrafast: acima de 272K | $24.00 | $1.20 | $30.00 | $90.00 |
Tarifas por nível de processamento da OpenAI verificadas em 9 de outubro de 2026; a comparação da CometAPI mantém a tabela de gateway do artigo de origem.Estas são tarifas por nível de processamento da OpenAI, não uma garantia de que cada nível esteja exposto por um gateway. O processamento regional adiciona 10% quando aplicável. Confirme o serviço selecionado e os termos da conta antes de orçar.
Para desenvolvedores que acessam o GPT-6.1 Sol via CometAPI, a tarifa de contexto padrão é menor do que o preço Standard direto da OpenAI.
| Categoria de tokens | CometAPI | OpenAI Standard | Diferença |
|---|---|---|---|
| Entrada / 1M | $1.60 | $2.00 | 20% menor |
| Entrada em cache / 1M | $0.08 | $0.10 | 20% menor |
| Gravação de cache / 1M | $2.00 | $2.50 | 20% menor |
| Saída / 1M | $8.00 | $10.00 | 20% menor |
Para solicitações de contexto longo, a API GPT-6.1 Sol na CometAPI usa:
| Tokens de contexto longo | CometAPI | OpenAI |
|---|---|---|
| Entrada / 1M | $3.20 | $4.00 |
| Entrada em cache / 1M | $0.16 | $0.20 |
| Gravação de cache / 1M | $4.00 | $5.00 |
| Saída / 1M | $12.00 | $15.00 |
Isso preserva uma diferença de preço de aproximadamente 20% nas principais categorias de tokens. Para orçamentos, isso importa porque uma carga de trabalho de produção raramente consiste apenas em tokens de entrada nova. Quando contexto em cache, geração de saída e solicitações de contexto longo são incluídos, comparar apenas a tarifa de entrada anunciada pode subestimar significativamente a diferença entre rotas.
A tabela de preços por token da CometAPI fornece a referência do gateway. Com 100K de entrada nova e 10K de saída faturada, o Standard da OpenAI custa $0.30; a tabela correspondente da CometAPI custa $0.24. Em 10.000 solicitações idênticas, os totais apenas de tokens são $3,000 e $2,400. Esta comparação exclui ferramentas, gravações de cache, novas tentativas e adicionais.
GPT-6.1 Sol é posicionado para programação complexa, uso de computador e fluxos de trabalho profissionais. Sua janela de contexto de 1.050.000 tokens e saída máxima de 128.000 tokens são limites de capacidade, não uma promessa de faturamento de contexto curto: solicitações acima de 272K tokens de entrada usam tarifas mais altas. Ele aceita texto e imagens e produz texto; use a Responses API para chamadas de ferramentas, enquanto Chat Completions suporta solicitações sem ferramentas. Verifique separadamente o suporte a ferramentas do gateway e os níveis de processamento ao escolher uma rota.
Despesas adicionais do agente GPT-6.1 Sol
O orçamento de um agente também inclui ferramentas hospedadas, ambientes de execução, armazenamento e cobranças de serviços externos. A OpenAI lista chamadas de pesquisa na web a $10 por 1.000 chamadas. O conteúdo de pesquisa recuperado é cobrado às tarifas de tokens do modelo. Chamadas de pesquisa de arquivos custam $2.50 por 1.000; o armazenamento é $0.10 por GB por dia após a franquia gratuita de 1 GB.
Hosted Shell e Code Interpreter usam cobranças de contêiner separadas sob a mesma tabela de preços da OpenAI citada acima. A tarifa publicada de 1 GB é $0.03 por sessão de 20 minutos por contêiner; sessões elegíveis usam cobrança por minuto com um mínimo de cinco minutos. Use os termos reais de ferramentas e execução do gateway selecionado em vez de presumir que essas cobranças de serviço direto se aplicam inalteradas.
Esforço de raciocínio e gasto total com GPT-6.1 Sol
O esforço de raciocínio não é uma tarifa separada na tabela de tokens, mas pode alterar a saída faturada, o uso de ferramentas, o comprimento da trajetória e as novas tentativas. Compare esforços suportados de baixo até o máximo no mesmo conjunto de tarefas. Registre o uso em vez de estimar o custo de raciocínio apenas pelo comprimento visível da resposta.
How Does the 272K Threshold Change GPT-6.1 Sol Cost?
Quando a entrada excede 272K tokens, a OpenAI aplica tarifas de contexto longo à solicitação inteira: entrada e taxas de cache dobram, enquanto a saída aumenta 50%. O limite de entrada se aplica mesmo quando grande parte da entrada vem do cache.
| Carga de trabalho | Entrada nova | Saída faturada | OpenAI Standard | Catálogo CometAPI |
|---|---|---|---|---|
| Análise pequena | 20K | 2K | $0.06 | $0.048 |
| Revisão de documento | 100K | 10K | $0.30 | $0.24 |
| Abaixo do limite | 270K | 10K | $0.64 | $0.512 |
| Acima do limite | 280K | 10K | $1.27 | $1.016 |
| Análise de repositório | 300K | 20K | $1.50 | $1.20 |
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input grows about 3.7%; token cost grows about 98.4%.
Estas são solicitações independentes, sem cobranças de cache, ferramentas, novas tentativas ou adicionais. O efeito do limite é o motivo pelo qual a seleção de contexto importa mesmo quando o modelo tem capacidade suficiente para todo o repositório.
How Does Prompt Caching Change GPT-6.1 Sol Input Costs?
No Standard de contexto curto, leituras de cache custam $0.10/M versus $2/M de entrada nova. Uma leitura bem-sucedida é, portanto, 95% mais barata para essa categoria de tokens. Uma gravação de cache custa $2.50/M. As economias dependem da reutilização bem-sucedida do prefixo em cache, não simplesmente de repetir texto semelhante.
Considere dez solicitações que compartilham um prefixo de 100K tokens. Cada uma permanece na faixa de contexto curto. No caso controlado com cache, grava-se todo o prefixo uma vez e ele é lido com sucesso nove vezes, sem gravações adicionais.A entrada de 100K tokens do prefixo da primeira solicitação é cobrada apenas à tarifa de gravação de cache; esses mesmos tokens não são também cobrados como entrada nova.
| Custo de prefixo repetido | Sem cache | Uma gravação + nove leituras |
|---|---|---|
| Entrada nova de prefixo | 10 x 0.1 x $2 = $2.00 | $0.00 |
| Gravação de cache | $0.00 | 0.1 x $2.50 = $0.25 |
| Leituras de cache | $0.00 | 9 x 0.1 x $0.10 = $0.09 |
| Subtotal do prefixo | $2.00 | $0.34 |
A redução de $1.66 é 83% desse custo de prefixo repetido. Não é uma redução de 83% em uma fatura típica da API. Se cada solicitação também gerar 2K tokens de saída faturada, a saída adiciona $0.20 nas dez solicitações: os totais tornam-se $2.20 e $0.54, uma redução de cerca de 75,5%. Novas entradas, falhas, gravações extras, ferramentas e faixas de contexto longo alteram o resultado.
Sob essas suposições simplificadas de contexto curto, uma gravação única mais N-1 leituras custa 0.25 + 0.01(N-1) dólares para um prefixo de 100K, em comparação com 0.20N sem cache. Duas solicitações são suficientes para tornar o caso com cache mais barato, desde que a segunda solicitação realmente acerte e nenhum outro custo mude.
How Does GPT-6.1 Sol Pricing Compare with GPT-6 Sol and GPT-6 Astra?
A OpenAI documenta as especificações do GPT-6 Sol. A redução na leitura de cache é uma comparação de tarifa, não prova de menor custo total por tarefa.
| Comparação oficial Standard de contexto curto | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| Entrada nova / 1M tokens | $2.00 | $2.00 | $10.00 |
| Leitura de cache / 1M tokens | $0.10 | $0.20 | $1.00 |
| Gravação de cache / 1M tokens | $2.50 | $2.50 | $12.50 |
| Saída / 1M tokens | $10.00 | $10.00 | $50.00 |
| Janela de contexto / saída máxima | 1.05M / 128K | 1.05M / 128K | 1.05M / 128K |
GPT-6.1 Sol reduz pela metade a tarifa de leitura de cache em contexto curto. Entrada nova, gravações e saída permanecem inalteradas. O benefício máximo depende de quanto da sua fatura consiste em leituras de cache bem-sucedidas. Reavalie configurações de esforço, loops de ferramentas e resultados de tarefas ao migrar.
Em comparação com o GPT-6 Sol, o GPT-6.1 Sol mantém as mesmas tarifas de entrada nova, gravação de cache e saída, enquanto corta as tarifas de leitura de cache em 50%. Em comparação com o GPT-6 Astra, use as tarifas acima junto com a qualidade medida da tarefa e o custo total da trajetória.
A tabela de tarifas do GPT-6 Astra coloca o Astra em uma faixa de preço por token mais alta.
GPT-6.1 Sol é 80% mais barato para entrada nova, gravações de cache e saída, e 90% mais barato para leituras de cache nessa faixa. Essas proporções não estabelecem qualidade equivalente. Astra pode valer seu prêmio se melhores resultados aceitos compensarem o gasto adicional; GPT-6.1 Sol pode ser preferível quando atinge a mesma meta de aceitação a menor custo.
Compare patches de repositório, análise de documentos e tarefas de uso de computador separadamente. Mantenha constantes prompts, permissões de ferramentas, configurações de esforço, limites de novas tentativas e verificações de aceitação. Registre falhas não resolvidas, bem como resultados bem-sucedidos; não infira um ranking universal de programação ou pesquisa a partir dos preços por token.
What Does GPT-6.1 Sol Cost for Real API Workloads?
Calcule o custo por solicitação com sua faixa e modo de processamento reais e, em seguida, some os resultados. Entrada nova exclui leituras em cache; não cobre os mesmos tokens de entrada como tanto novos quanto em cache. Use os registros de uso do provedor para distinguir gravações de outras entradas.No fórmula abaixo, fresh_input exclui tanto cache_reads quanto cache_writes. Tokens cobrados à tarifa de gravação de cache não devem também ser contados como entrada nova. Trate as três quantidades como categorias de cobrança mutuamente exclusivas e reconcilie-as com os registros de uso do provedor.
request_token_cost =
fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate
period_total = sum(request_token_cost) + other_charges
Aggregate Usage Across Multiple Short Requests
Dez solicitações, cada uma usando 100K de entrada nova e 20K de saída faturada, agregam 1M de entrada e 200K de saída. Cada solicitação individual permanece abaixo de 272K de entrada e abaixo do limite de saída de 128K. O total do OpenAI Standard é $4.00; o da CometAPI é $3.20. A diferença de 20% aplica-se apenas a essas categorias de tokens modeladas. Isto não é uma única solicitação com 1M de entrada e 200K de saída.
A Cache-Heavy Period With Separately Billed Writes
Suponha que um período registre 1M de entrada nova, 5M de leituras de cache, 500K de saída faturada e 500K de gravações de cache. Todas as solicitações componentes permanecem na faixa Standard de contexto curto. OpenAI custa $2.00 + $0.50 + $5.00 + $1.25 = $8.75. CometAPI custa $1.60 + $0.40 + $4.00 + $1.00 = $7.00. Essas categorias são quantidades de cobrança distintas; o exemplo não presume que toda a entrada repetida seja um acerto de cache.
One Long-Context Request
Uma solicitação com 400K de entrada nova e 100K de saída faturada usa tarifas de contexto longo. OpenAI Standard custa 0.4 x $4 + 0.1 x $15 = $3.10. CometAPI custa 0.4 x $3.20 + 0.1 x $12 = $2.48. Ambas excluem novas gravações de cache e cobranças não relacionadas a tokens. A quantidade de 100K de saída inclui raciocínio e deve caber no orçamento de saída do modelo.
How Do Standard, Batch, Flex, Fast, and Ultrafast Change GPT-6.1 Sol Cost?
Para uma solicitação com 300K de entrada nova e 20K de saída faturada, use a faixa de contexto longo.
| Modo OpenAI | Custo de entrada | Custo de saída | Subtotal de tokens |
|---|---|---|---|
| Batch/Flex | $0.60 | $0.15 | $0.75 |
| Standard | $1.20 | $0.30 | $1.50 |
| Fast | $2.40 | $0.60 | $3.00 |
| Ultrafast | $7.20 | $1.80 | $9.00 |
Cálculo de Ultrafast: 0.30M de entrada nova x $24/M + 0.02M de saída faturada x $90/M = $7.20 + $1.80 = $9.00. Isso usa a faixa de contexto longo e exclui cache, ferramentas e cobranças regionais.
Batch serve avaliações offline, enriquecimento, backfills e processamento em lote de documentos. Flex oferece tarifas mais baixas para cargas de trabalho elegíveis que toleram processamento variável e disponibilidade ocasional. Standard é a base para solicitações interativas. Fast dobra as tarifas de tokens aplicáveis; selecione-o quando a redução de espera tiver valor mensurável.
Ultrafast prioriza latência a um preço de token mais alto. Para GPT-6.1 Sol, defina service_tier como ultrafast em solicitações de Responses. A OpenAI recomenda WebSockets para loops rápidos de ferramentas de agentes; verifique limites específicos por nível e suporte do gateway antes de direcionar tráfego de produção. As tarifas vêm da tabela oficial de preços da OpenAI.
Essas tarifas não provam que todo nível esteja habilitado para sua conta de gateway. Verifique o roteamento suportado e as restrições regionais antes da implantação. Não orce uma opção de processamento sem preço ou indisponível como se já tivesse a tarifa Standard.
Why Is Cost per Successful GPT-6.1 Sol Task the Better Metric?
Divida o gasto total medido com modelo, ferramentas e execução em um conjunto de avaliação por resultados aceitos. Inclua tentativas falhas no numerador. Relate o tempo de correção humana e falhas não resolvidas separadamente para que o custo não melhore apenas abandonando tarefas mais difíceis.
observed_cost_per_accepted_task =
all_evaluation_model_tool_execution_cost / accepted_tasks
Para ilustrar, uma tentativa de $0.40 com 60% de probabilidade de sucesso tem custo esperado de $0.40 / 0.60 = cerca de $0.67 até o sucesso. Uma tentativa de $0.55 com 85% de probabilidade custa cerca de $0.65 sob o mesmo modelo. Estas são cifras hipotéticas, não resultados de benchmark ou afirmações sobre um modelo específico.
Essa estimativa assume novas tentativas independentes com custo e probabilidade de sucesso inalterados, continuando até o sucesso. Não adicione uma segunda franquia de novas tentativas: a divisão já contabiliza repetições. Falhas correlacionadas, novas tentativas limitadas, diferentes dificuldades de tarefa, ferramentas e intervenção humana podem tornar esse modelo inadequado. Use o custo observado por tarefa aceita para decisões de produção.
How Can You Reduce GPT-6.1 Sol API Costs?
Maximize prefixes de prompt reutilizáveis. Coloque instruções de sistema estáveis, definições de ferramentas, esquemas e contexto de fundo em prefixes reutilizáveis. O preço de $0.10/M de entrada em cache do GPT-6.1 Sol torna contexto repetido barato em relação à entrada nova.
Mantenha solicitações abaixo de 272K quando o contexto completo não for necessário. Ultrapassar 272K tokens de entrada altera as tarifas para a solicitação inteira. Recuperação, compressão de contexto e carregamento seletivo de arquivos podem reduzir custo mesmo quando o modelo tecnicamente suporta uma janela de contexto de 1,05M.
Use Batch para fluxos de trabalho assíncronos em lote. Avaliações offline, enriquecimento, backfills e processamento em lote de documentos podem usar Batch quando os resultados não precisam voltar imediatamente.
Use Flex para solicitações de baixa prioridade que toleram respostas mais lentas e indisponibilidade ocasional de recursos. Planeje atrasos e novas tentativas; verifique cargas de trabalho elegíveis e suporte de rota. Batch e Flex usam as tarifas mais baixas mostradas acima, mas atendem a necessidades de processamento diferentes.
Meça o custo por tarefa aceita. Registre tokens de entrada nova, tokens de entrada em cache, gravações de cache, tokens de saída, modo de processamento, cobranças de ferramentas, novas tentativas e sucesso da tarefa. Em seguida, calcule o custo real por conclusão bem-sucedida.
Direcione tarefas mais simples para modelos mais baratos. Nem toda solicitação requer raciocínio nível Sol. Classificação, roteamento, extração simples e outras tarefas altamente verificáveis podem se encaixar em um modelo de menor custo, enquanto o GPT-6.1 Sol lida com as tarefas nas quais um raciocínio mais forte melhora materialmente a taxa de conclusão.
Isso é especialmente importante para agentes porque uma execução malsucedida de $0.50 seguida de duas novas tentativas pode ser mais cara do que uma única execução de $1.00 bem-sucedida.
Use limites explícitos de conclusão, limites de loops de ferramentas e orçamentos de novas tentativas. Revise os registros de uso para entrada nova, leituras de cache, gravações, saída de raciocínio, nível, faixa de contexto e cobranças de ferramentas. Compare as economias com a qualidade de tarefas aceitas após cada mudança.
Conclusion
GPT-6.1 Sol é atraente quando um fluxo de trabalho precisa de raciocínio complexo a preços do nível Sol e pode reutilizar contexto estável. Ele mantém as tarifas Standard de $2/$10 do GPT-6 Sol enquanto reduz leituras de cache de contexto curto para $0.10/M. Astra tem tarifas por token mais altas, mas a escolha deve seguir a qualidade da carga de trabalho e o custo por tarefa aceita.
Comece com estimativas por solicitação, separe gravações de cache de leituras e observe o limite de 272K. Em seguida, meça toda a trajetória do agente e escolha um nível de processamento que se ajuste à latência e à disponibilidade. CometAPI fornece uma tabela de preços separada; confirme os termos reais da conta e das ferramentas antes de escalar.
FAQ
Como os orçamentos do GPT-6.1 Sol devem lidar com solicitações falhas ou canceladas?
Acompanhe separadamente o uso do provedor para solicitações concluídas, incompletas, falhas e canceladas. Não presuma que toda solicitação malsucedida seja gratuita ou que todo cancelamento do cliente impeça o trabalho no servidor. Reconcilie identificadores de solicitação e uso com os registros de faturamento e inclua trabalho malsucedido faturado no cálculo de tarefa aceita. Confirme regras específicas de cobrança e reembolso do provedor em vez de inferi-las a partir de um status HTTP.
Como as equipes devem projetar custos do GPT-6.1 Sol para tráfego variável?
Segmente o tráfego por faixa de entrada, nível de processamento, composição de cache e carga de trabalho. Use distribuições medidas de tokens e conclusões em vez de um único prompt médio. Crie uma previsão de base e cenários para taxas de acerto menores, mais novas tentativas e saídas mais longas; também monitore a parcela que cruza 272K. Atualize a previsão conforme a mistura de tarefas muda.
Como as equipes podem reconciliar previsões do GPT-6.1 Sol com faturas?
Escolha um período de faturamento concluído e agrupe solicitações por rota, nível de processamento e faixa de entrada. Reconcilie o uso registrado com categorias de fatura e créditos, incluindo ajustes, cobranças de ferramentas e quaisquer impostos ou conversões de moeda aplicáveis. Investigue discrepâncias usando identificadores de solicitação e carimbos de data/hora de faturamento em vez de aplicar um fator de correção não explicado. Confirme relatórios atrasados e regras de arredondamento do provedor antes de alterar a previsão.
