GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/Pesquisa CometAPI

Como usar a API GPT-6 Astra: guia completo para desenvolvedores

Como usar a API GPT-6 Astra por meio da CometAPI, com exemplos da Responses API, controles de raciocínio, entrada de imagem, saída estruturada, ferramentas, preços e migração.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 9, 2026 14 min de leitura
Como usar a API GPT-6 Astra: guia completo para desenvolvedores
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GPT-6 Astra API na CometAPI é mais indicado para fluxos de trabalho difíceis e ricos em ferramentas, nos quais a qualidade da conclusão importa mais do que o menor preço por token. O modelo suporta uma janela de contexto de 1.050.000 tokens, 128.000 tokens de saída, entrada de imagem, saídas estruturadas, streaming, chamadas de função e cinco níveis de raciocínio. Comece com a Responses API, raciocínio medium, um conjunto de ferramentas enxuto e uma avaliação que meça o custo por tarefa aceita. As tarifas-base atuais de tokens da CometAPI são 20% abaixo das correspondentes tarifas da OpenAI.

Principais pontos

  • Astra é otimizado para trabalhos difíceis de ponta a ponta, incluindo programação, uso de computador, pesquisa e automação profissional.
  • Use a Responses API para novas integrações orientadas a ferramentas.
  • Escolha o menor esforço de raciocínio que passa na avaliação do seu workload; none não é suportado.
  • Sempre que possível, mantenha prompts abaixo do limite de long context de 272K, pois a tabela mais alta se aplica à solicitação inteira.
  • Avaliações públicas mostram pontuações mais altas e menor custo estimado de API por tarefa em vários workloads difíceis, mas o roteamento em produção deve se basear na sua própria taxa de tarefas aceitas.

GPT-6 Astra API: Guia Rápido

  1. Crie uma chave CometAPI e armazene-a em uma variável de ambiente.
  2. Instale o SDK da OpenAI.
  3. Envie uma solicitação à Responses API com model="gpt-6-astra".
  4. Adicione um contrato de saída estrito e valide o resultado.
  5. Conecte apenas as ferramentas exigidas pelo fluxo de trabalho.
  6. Teste a integração em tarefas representativas antes de ir para produção.

O que é a GPT-6 Astra API?

O modelo mais capaz da OpenAI para os trabalhos mais difíceis de ponta a ponta foi projetado para raciocínio complexo, programação, uso de computador, pesquisa e criação de documentos. Em uma aplicação de API, o valor do Astra vem de manter a intenção ao longo de fluxos longos, chamar ferramentas, interpretar resultados e continuar até que os critérios de conclusão da aplicação sejam atendidos.

Especificações da GPT-6 Astra API

Especificação OpenAIGPT-6 Astra
Model IDgpt-6-astra
Janela de contexto1.050.000 tokens
Saída máxima128.000 tokens
Knowledge cutoff30 de abril de 2026
Entrada e saídaEntrada de texto e imagem; saída de texto
Esforço de raciocíniolow, medium, high, xhigh, max
Recursos suportadosStreaming, function calling, structured outputs
Ferramentas da Responses APIWeb search, file search, image generation, code interpreter, hosted shell, Apply Patch, computer use, MCP e tool search
Fine-tuningNão suportado

O desafio de integração é a orquestração: fornecer o contexto correto, executar as ferramentas solicitadas, inspecionar seus resultados e parar quando os critérios de conclusão da aplicação forem atendidos.

GPT-6 Astra API vs GPT-5.6 Sol: O que há de novo?

A orientação atual de modelos da OpenAI descreve Astra como mais forte em fluxos de trabalho multietapas difíceis, frequentemente usando menos tokens de saída. Ele também adiciona controles que importam para agentes de longa execução: chamadas de ferramenta assíncronas, steering no meio do turno, mudanças de raciocínio durante uma conversa e monitoramento de desalinhamento.

DimensãoGPT-6 AstraGPT-5.6 Sol
Função principalTrabalho mais difícil de ponta a pontaTrabalho profissional complexo com menor custo por token
Contexto / saída máx.1,05M / 128K1,05M / 128K
Knowledge cutoff30 de abril de 202616 de fevereiro de 2026
Chamadas de ferramenta assíncronasSuportadoUse coordenação convencional de resultado de ferramenta
Steering no meio do turnoSuportado via Responses WebSocketUse um turno subsequente ou reinício gerenciado pela aplicação
Alterar raciocínio na conversaconfiguration_update em fluxos compatíveisDefina o esforço no nível da requisição
none reasoningNão suportadoSuportado
OpenAI Standard input / output$10 / $50 por 1M$4 / $20 por 1M
Melhor função de roteamentoEscalação para trabalho de alta complexidadeDefault para tráfego complexo mais amplo

A atualização não é um substituto universal. Use Sol quando ele passar a tarefa de forma confiável; faça o roteamento para Astra quando profundidade de ferramentas, contexto longo, novas tentativas ou correção humana tornarem o modelo mais barato mais caro na prática.

Por que usar GPT-6 Astra via CometAPI?

A GPT-6 Astra API na CometAPI usa a rota compatível com OpenAI /v1/responses. Suas tarifas de curto contexto de $8/M para entrada e $40/M para saída são 20% abaixo das tarifas OpenAI Standard correspondentes de $10/M e $50/M.

Uma integração existente com o SDK da OpenAI pode manter sua biblioteca cliente, alterando apenas a chave, base_url e o ID do modelo. Use o mesmo gateway ao rotear trabalho adequado para GPT-5.6 Sol.

Passo 1: Obtenha uma chave da CometAPI

Crie uma chave no dashboard da CometAPI e armazene-a fora do código-fonte. Em produção, use um gerenciador de segredos de implantação.

export COMETAPI_KEY="your_api_key"
$env:COMETAPI_KEY = "your_api_key"

Passo 2: Instale o SDK da OpenAI

Instale o SDK atual para a linguagem da sua aplicação.

python -m pip install -U openai
npm install openai

Passo 3: Faça sua primeira requisição

Use /v1/responses para novas integrações, especialmente quando o fluxo de trabalho posteriormente adicionará ferramentas ou saídas estruturadas.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    timeout=120.0,
    max_retries=2,
)

response = client.responses.create(
    model="gpt-6-astra",
    input="Give three practical ways to reduce API latency.",
    reasoning={"effort": "medium"},
)

if response.status != "completed":
    raise RuntimeError(f"Unexpected status: {response.status}")

print(response.output_text)

Passo 4: Teste antes da produção

Execute tarefas representativas em ambas as rotas, candidata e de fallback. Registre taxa de tarefas aceitas, latência, novas tentativas, tokens de entrada e saída, falhas de ferramenta e tempo de correção humana. Promova Astra apenas onde o resultado melhora a economia real de conclusão do fluxo de trabalho.

Não trate um prompt de demonstração bem-sucedido como validação de produção. Inclua entradas ambíguas, falhas de ferramentas, dados ausentes e solicitações de longa duração no conjunto de testes.

Como escolher o esforço de raciocínio

Os níveis suportados de raciocínio são low, medium, high, xhigh e max. Use o menor nível que atenda consistentemente aos seus critérios de aceitação.

EsforçoPonto de partida prático
lowClassificação, reescrita e extração direta
mediumDesenvolvimento geral, análise e a maioria das primeiras avaliações
highDepuração complexa, arquitetura e síntese de múltiplas fontes
xhighPesquisa difícil e trabalho de programação longo e multietapas
maxUm pequeno número das tarefas mais difíceis após avaliação

Como usar entrada de imagem

Use uma URL de imagem acessível ou um arquivo enviado compatível. Combine a imagem com uma tarefa de inspeção específica em vez de pedir uma descrição genérica.

vision = client.responses.create(
    model="gpt-6-astra",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "Identify one UI defect and propose a fix."},
            {"type": "input_image", "image_url": os.environ["SCREENSHOT_URL"]}
        ]
    }]
)

print(vision.output_text)

Como usar saídas estruturadas e transmitir respostas

Saídas estruturadas fornecem um contrato legível por máquina; streaming melhora a responsividade percebida. Eles resolvem problemas diferentes e podem ser usados juntos. Eventos de ciclo de vida e deltas de texto devem ser tratados separadamente.

stream = client.responses.create(
    model="gpt-6-astra",
    input="Create a deployment checklist.",
    stream=True,
)

completed = False
for event in stream:
    if event.type == "response.output_text.delta":
        print(event.delta, end="", flush=True)
    elif event.type == "response.completed":
        completed = True
    elif event.type in {"response.failed", "response.incomplete", "error"}:
        raise RuntimeError(event.type)

if not completed:
    raise RuntimeError("Stream closed before completion")

Como manter conversas com estado

Para histórico portátil, reenvie as entradas do usuário e os itens de saída do modelo exigidos pelo próximo turno. Onde suportado pelo provedor, previous_response_id pode fazer referência a uma resposta armazenada.

history = [{"role": "user", "content": "Give three latency improvements."}]
history.extend(
    item.model_dump(exclude={"id"}, exclude_none=True)
    for item in response.output
)
history.append({"role": "user", "content": "Turn them into a checklist."})

follow_up = client.responses.create(
    model="gpt-6-astra",
    input=history,
)
print(follow_up.output_text)

Como usar Function Calling

Um loop completo de função tem quatro partes: definir o esquema, receber uma chamada de ferramenta, executá-la na sua aplicação e retornar um item function_call_output com o call_id original. Mantenha as permissões de ferramentas mínimas e valide cada argumento antes da execução.

import json

history = [{"role": "user", "content": "Check order A-1042."}]
turn = client.responses.create(model="gpt-6-astra", input=history, tools=tools)
history.extend(item.model_dump(exclude={"id"}, exclude_none=True) for item in turn.output)

for item in turn.output:
    if item.type == "function_call" and item.name == "get_order_status":
        args = json.loads(item.arguments)
        tool_result = {"order_id": args["order_id"], "status": "shipped"}
        history.append({
            "type": "function_call_output",
            "call_id": item.call_id,
            "output": json.dumps(tool_result),
        })

final = client.responses.create(model="gpt-6-astra", input=history, tools=tools)
print(final.output_text)

Como usar chamadas de ferramenta assíncronas

Chamadas de ferramenta assíncronas permitem que Astra continue trabalho independente enquanto uma função ou ferramenta personalizada de longa execução está pendente. Defina async: true na definição da ferramenta, retenha o call_id original e retorne o resultado quando o trabalho externo terminar. Sua aplicação permanece responsável pela fila de jobs, política de timeout, idempotência e recuperação.

Não envie o mesmo job de longa duração novamente apenas porque uma janela de polling expirou. Salve o ID do job e retome a recuperação.

Como criar prompts para a GPT-6 Astra API

A orientação de prompt da OpenAI enfatiza iniciativa, prioridade das instruções, estilo, delegação e verificação calibrada. Um prompt de produção útil deve declarar a tarefa, os recursos disponíveis, o teste de conclusão, os limites, o formato esperado e como lidar com informações ausentes.

Componente do promptO que especificar
TarefaO resultado concreto a produzir
RecursosArquivos, ferramentas, dados e contexto que podem ser usados
Teste de conclusãoCondições que definem o trabalho como concluído
LimitesAções permitidas, proibidas ou que exigem aprovação
Estilo e formatoExtensão, estrutura, tom e esquema de saída
IncertezaO que pode ser inferido e o que deve ser esclarecido
VerificaçãoQuais verificações são necessárias e quando parar de testar
Task: Review this API design and identify the three highest-impact migration risks.
Resources: Use the attached schema and deployment notes.
Completion test: Return three risks, evidence for each, and one acceptance test per risk.
Boundaries: Do not change production systems. Infer routine implementation details.
Clarification rule: Ask only if a missing requirement would materially change the result.
Style: Use concise prose and a final three-row table.
Verification: Check that every risk has an executable acceptance test.

Benchmarks do GPT-6 Astra: Pontuações mais altas, menos tokens

Avaliações públicas são mais úteis quando qualidade e economia da tarefa são consideradas juntas. As pontuações de benchmark abaixo mostram onde os ganhos do Astra são grandes; as economias relatadas são estimativas específicas de configuração, não garantias para todo workload.

Avaliação publicadaAstraSolDiferença
AutomationBench41,4%18,1%+23,3 pontos
OSWorld 2.072,6%65,7%+6,9 pontos
Terminal-Bench 4.057,9%37,3%+20,6 pontos
MRCR v2, 512K-1M96,3%73,8%+22,5 pontos

Como usar a API GPT-6 Astra: guia completo para desenvolvedores

Gráfico oficial do OpenAI AutomationBench: acurácia traçada contra o custo estimado de API.

Comparação de custo por tarefaConfiguração de qualidadeEconomia de custo da API vs Sol
DeepSWE v1.174,1% vs 72,7%; configurações com maior pontuaçãoCerca de 32%
Migração de banco de dados63,4% vs 42,7%; configuração Astra de menor custoCerca de 38%
Terminal-Bench 4.057,9% vs 37,3%; configurações relatadasCerca de 9%

A conexão com preços é dupla. Primeiro, menos tokens de saída e menos tentativas fracassadas podem reduzir o custo estimado de API por tarefa concluída, mesmo quando Astra tem um preço por token mais alto. Segundo, as tarifas listadas da CometAPI estão 20% abaixo das tarifas correspondentes do provedor. Esses efeitos são separados: não some as porcentagens e não presuma que uma economia de benchmark será reproduzida em produção.

Preços da GPT-6 Astra API

A cobrança é medida por milhão de tokens. Quando a entrada excede 272K tokens, a tabela de long context se aplica à solicitação inteira.

Preços atuaisCometAPI short contextCometAPI long contextOpenAI Standard
Input$8$16$10 short / $20 long
Cache read$0.80$1.60$1 short / $2 long
Cache write$10$20$12.50 short / $25 long
Output$40$60$50 short / $75 long

Preços e políticas do gateway podem mudar. Verifique a configuração de preços vigente antes de orçar ou fixar tarifas no código.

Como reduzir custos de API

  • Mantenha prefixos estáveis amigáveis ao cache. Coloque instruções compartilhadas e esquemas de ferramentas antes do conteúdo específico da requisição.
  • Evite cruzar 272K sem intenção. Recupere e deduplicate apenas o contexto que pode mudar a resposta.
  • Use o menor esforço de raciocínio que passa. Escale apenas quando a taxa de aceitação melhorar.
  • Direcione tráfego fácil para outro lugar. Reserve Astra para trabalho que se beneficie de sua confiabilidade de conclusão.
  • Meça custo por tarefa aceita. Inclua novas tentativas, taxas de ferramentas e esforço de revisão humana monetizado.

Como migrar para GPT-6 Astra

Ao migrar de GPT-5.6 Sol, faça a menor mudança compatível e reexecute o mesmo conjunto de avaliação.

  1. Defina o modelo como gpt-6-astra.
  2. Se a rota antiga usava none ou minimal reasoning, comece em low.
  3. Use Responses para fluxos de trabalho com chamadas de ferramenta.
  4. Remova parâmetros de amostragem não suportados: temperature, top_p e top_logprobs; remova também logprobs do Chat Completions.
  5. Reteste saída estruturada, cache, streaming, loops de ferramentas e comportamento específico do provedor.
  6. Compare taxa de tarefas aceitas, latência, novas tentativas, tokens e correção humana antes de mudar a rota padrão.
prompt = "Review this API design and identify migration risks."

baseline = client.responses.create(
    model="gpt-5.6-sol",
    input=prompt,
)

candidate = client.responses.create(
    model="gpt-6-astra",
    input=prompt,
    reasoning={"effort": "medium"},
)

Quando você deve usar GPT-6 Astra?

Use Astra quando a falha da tarefa é cara e o fluxo de trabalho combina raciocínio com ferramentas, contexto longo ou execução multietapas.

  • Depuração em escala de repositório, migração e ciclos de teste e nova tentativa.
  • Agentes de navegador ou de uso de computador.
  • Pesquisa profunda em múltiplas fontes e ferramentas.
  • Análise de documentos ou bases de código muito longos.
  • Fluxos científicos e técnicos que usam código ou software externo.
  • Automação profissional em que uma execução com falha cria custo significativo de recuperação.

Use uma rota mais barata para reescrita simples, resumos curtos, classificação e extração rotineira quando ela já atende à meta de qualidade.

Erros comuns de API

401 Authentication Error

Confirme que a requisição envia Authorization: Bearer <COMETAPI_KEY> e que o processo lê a variável de ambiente correta.

400 Bad Request

Verifique parâmetros de amostragem não suportados, um esquema inválido ou um valor de raciocínio não suportado como none.

404 Model or Endpoint Error

Confirme model="gpt-6-astra" e a rota /v1/responses.

429 Rate Limit

Use backoff exponencial com jitter e contagem de tentativas limitada.

1 s -> 2 s -> 4 s -> 8 s -> janela de nova tentativa com limite

5xx Server Error

Tente novamente falhas transitórias do servidor, mas não repita requisições 4xx malformadas sem alterações. Registre identificadores de requisição sem armazenar desnecessariamente conteúdo sensível do prompt.

FAQ

Qual ID de modelo devo usar?

Use gpt-6-astra.

Devo usar Responses API ou Chat Completions?

Use Responses para novas integrações, especialmente para ferramentas, saídas estruturadas, streaming, estado e fluxos de agentes. Mantenha Chat Completions apenas onde requisitos de compatibilidade o justificarem.

Com qual esforço de raciocínio devo começar?

Comece com medium, depois avalie low para tráfego rotineiro e high ou acima para tarefas que se beneficiam de forma mensurável de raciocínio mais profundo.

Astra aceita imagens?

Sim. Ele aceita entrada de texto e imagem e retorna saída de texto.

A rota CometAPI é sempre 20% mais barata por tarefa concluída?

Não. As tarifas de tokens listadas estão 20% abaixo das tarifas correspondentes do provedor, mas o custo total da tarefa também depende do tamanho do contexto, comprimento da saída, chamadas de ferramentas, novas tentativas e esforço de revisão.

Astra deve substituir Sol em todos os lugares?

Não. Sol continua sendo a escolha de menor custo para muitos workloads delimitados. Use Astra onde execução mais forte, confiabilidade com contexto longo ou menos tentativas fracassadas mudam a economia total.

Conclusão

Astra é mais valioso quando uma chamada de API é um passo em um fluxo de trabalho difícil, e não o final dele. Seu contexto longo, cinco níveis de raciocínio, saídas estruturadas, streaming, chamadas de função e novos controles de agente dão aos desenvolvedores mais maneiras de levar trabalhos complexos até a conclusão.

Comece com Responses, raciocínio medium, critérios claros de conclusão e o acesso mínimo de ferramentas necessário. Meça a taxa de tarefas aceitas e o custo por tarefa aceita, então aumente o raciocínio ou roteie mais tráfego para Astra apenas quando as evidências o justificarem.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 9, 2026
Última atualização Sep 9, 2026
14 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais