Responder primeiro
GPT-6 Astra é o novo modelo carro-chefe da OpenAI para trabalhos difíceis de ponta a ponta. A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, posicionando-o em raciocínio complexo, uso do computador, programação, pesquisa, trabalho científico e criação de artefatos profissionais. O modelo da API tem uma janela de contexto de 1,05M tokens e saída máxima de 128K, aceita entrada de texto e imagem, e suporta esforço de raciocínio de baixo até máximo. A precificação padrão da API começa em $10 entrada / $50 saída por milhão de tokens. A mudança prática mais importante não é um salto uniforme em todos os benchmarks de inteligência geral: os maiores ganhos do Astra aparecem em execução orientada a agentes, uso do computador, recuperação em contexto longo, fluxos de trabalho de programação, ciência e cibersegurança.
Isso é importante porque o artigo mais antigo da CometAPI GPT-6 Is Coming Soon — What Will It Look Like? era necessariamente especulativo. Agora que o Astra é público, este guia foca no comportamento confirmado do modelo, nos trade-offs de benchmarks, na economia da API e nos casos em que o modelo é realmente uma escolha melhor do que alternativas de fronteira mais baratas.
O que é o GPT-6 Astra?
O GPT-6 Astra é o sucessor do carro-chefe GPT-5.6 Sol da OpenAI. A OpenAI descreve o Astra como seu modelo mais capaz para o trabalho mais difícil de ponta a ponta, com ênfase em fluxos de trabalho que exigem que o modelo raciocine, use ferramentas, interaja com software, revise trabalho intermediário e leve uma tarefa de um pedido inicial a um resultado final. Esse posicionamento é importante: o Astra não é simplesmente um modelo de chat maior. Ele foi projetado para atuar como o motor de raciocínio dentro de agentes que trabalham em navegadores, terminais, documentos, planilhas, ambientes de desenvolvimento e software corporativo.
A postagem de lançamento destaca resultados de estado da arte em uso do computador, navegação, engenharia de software, cibersegurança, ciência e trabalho profissional. Ela reporta 97,6% / 99,9% / 100% no FrontierMath Tier 4, ARC-AGI-3 e ExploitBench, respectivamente. Essas pontuações de manchete são marcantes, mas não devem ser interpretadas como “o Astra vence todos os benchmarks”. No Artificial Analysis Intelligence Index usado na própria tabela de comparação da OpenAI, o Astra marca 61,2 enquanto o Claude Fable 5.1 marca 65,7. Portanto, o lançamento deve ser entendido como uma mudança de patamar em execução e trabalho orientado a agentes, em vez de uma varredura limpa de todas as medidas de inteligência.
O que mudou em relação ao GPT-5.6 Sol?
O uso do computador tornou-se uma capacidade de primeira ordem
O ganho geracional mais claro do Astra é o uso do computador. No OSWorld 2.0, a OpenAI reporta 72,6% para o Astra versus 65,7% para o GPT-5.6 Sol. Na mesma simulação de latência, o Astra concluiu tarefas em cerca de 40 minutos, em comparação com aproximadamente 75 minutos para o Sol, uma redução de cerca de 47%. Combinado com um harness do Codex atualizado, a OpenAI reporta conclusão 1,9× mais rápida no Mind2Web. O ponto prático não é apenas que o Astra consegue ver uma tela; ele consegue manter uma tarefa de software multietapas coerente por mais tempo, fazendo menos desvios custosos.
A criação de artefatos profissionais é mais deliberada
A OpenAI treinou explicitamente o Astra para fluxos de trabalho profissionais que terminam em artefatos utilizáveis, em vez de prosa bruta. Os materiais de lançamento descrevem desempenho mais forte em documentos, planilhas, apresentações, análise de dados, trabalho de design e adesão a templates. O Astra também é melhor em manter-se orientado quando requisitos mudam no meio da tarefa, de modo que uma mensagem de direcionamento é menos propensa a sobrescrever o objetivo original. Isso é particularmente útil em agentes corporativos de longa duração, nos quais novas instruções frequentemente chegam após o início do fluxo de trabalho.
Sessões longas retêm mais contexto de trabalho útil
Para sessões longas de programação, o Astra introduz uma nova forma de o Codex preservar e recuperar anotações depois que o contexto ativo se enche. Abordagens anteriores dependiam fortemente de compactação, o que pode omitir por que uma tentativa de correção falhou ou quais restrições já foram testadas. A OpenAI diz que o Astra pode manter anotações entre janelas de contexto, melhorando a continuidade durante grandes refatorações e sessões de depuração.
O esforço de raciocínio agora vai até o máximo
Os desenvolvedores podem escolher esforço de raciocínio baixo, médio, alto, xhigh ou máximo. Isso cria uma curva qualidade-custo mais ampla do que tratar o Astra como um único ponto operacional fixo. A orientação oficial do modelo recomenda selecionar o menor esforço que atenda à sua meta de avaliação, porque a melhor economia do modelo muitas vezes vem da eficiência de tokens em vez de sempre rodar no raciocínio máximo.
Desempenho do GPT-6 Astra em benchmarks
A OpenAI publicou uma comparação ampla abrangendo uso do computador, trabalho profissional, programação, raciocínio acadêmico, saúde, cibersegurança, contexto longo e alinhamento. A maneira mais útil de ler a tabela é separar “inteligência geral” de “capacidade de concluir trabalho com uso de ferramentas”. O Astra está apenas marginalmente acima do Sol no Artificial Analysis Intelligence Index na tabela da OpenAI, mas está dramaticamente à frente em vários benchmarks orientados a agentes e operacionais.
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | O que a diferença sugere |
|---|---|---|---|
| AutomationBench | 41,4% | 18,1% | Grande ganho em fluxos de trabalho de negócios E2E |
| OSWorld 2.0 | 72,6% | 65,7% | Melhor interação com computador e conclusão de tarefas |
| Terminal-Bench 4.0 | 57,9% | 37,3% | Grande ganho em programação agêntica baseada em terminal |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | Grande ganho em fluxos científicos com código/ferramentas |
| FrontierMath Tier 4 v2 | 97,6% | 83,0% | Raciocínio matemático de fronteira mais forte |
| ExploitBench | 100,0% | 78,5% | Capacidade crítica em cibersegurança |
| SRE-Bench, uma tentativa | 88,0% | 55,9% | Engenharia reversa / SRE muito mais forte |
| MRCR v2, 512K-1M | 96,3% | 73,8% | Melhor recuperação em contexto muito longo |
| AA Intelligence Index v4.1.1 | 61,2 | 60,9 | Inteligência geral essencialmente estável vs Sol |
O padrão é incomumente claro. A vantagem do Astra é maior quando um benchmark exige interação sustentada com uma ferramenta ou ambiente. O AutomationBench sobe de 18,1% para 41,4%; o Terminal-Bench Science aumenta de 22,4% para 64,6%; e o MRCR de contexto longo melhora de 73,8% para 96,3% na faixa de 512K–1M. Em contraste, o Artificial Analysis Intelligence Index vai de 60,9 para 61,2. É por isso que descrever o Astra como “2,5× mais caro, mas ligeiramente mais inteligente” perde a proposta de valor real do produto.
Fonte: gráfico do OpenAI AutomationBench (imagem original, não redesenhada)
Benchmarks independentes: o GPT-6 Astra é um salto geracional?
Testes independentes adicionam um importante controle de realidade. A Artificial Analysis reporta uma pontuação de 61 no Intelligence Index, igual ao GPT-5.6 Sol no esforço máximo. Ao mesmo tempo, o Astra melhora fortemente no Coding Agent Index e usa substancialmente menos tokens em programação orientada a agentes. A Artificial Analysis mediu aproximadamente uma redução de três vezes no uso de tokens versus o GPT-5.6 Sol no esforço máximo em seu harness do Codex, permitindo que o Astra pontuasse mais a aproximadamente o mesmo custo por tarefa de agente de programação.
A economia parece menos favorável em inteligência geral. O Astra usa cerca de 10% menos tokens de saída do que o Sol no Intelligence Index no esforço máximo, mas o aumento de 2,5× no preço por token domina esse ganho de eficiência; a Artificial Analysis estima que o Astra seja cerca de 75% mais caro por tarefa no esforço máximo. Ela também reporta uma redução da taxa de alucinação de 92% para 51% no AA-Omniscience enquanto a acurácia aumentou em quatro pontos.
A conclusão útil é específica ao tipo de workload: o GPT-6 Astra parece mais geracional onde um agente precisa agir, iterar, usar ferramentas e finalizar um trabalho complicado. Para raciocínio comum ou geração de texto em alto volume, o prêmio de preço pode ser muito mais difícil de recuperar.
GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash
Uma comparação prática de seleção de modelos deve incluir capacidade, multimodalidade, contexto, execução orientada a agentes e preço. Os modelos abaixo não são intercambiáveis: o Astra otimiza para execução difícil de ponta a ponta, o Claude Fable 5.1 lidera algumas medidas de inteligência geral, e o Gemini 3.8 Flash oferece preços por token muito mais baixos com modalidades de entrada nativas mais amplas.

| Métrica | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Janela de contexto | 1,05M | 1,05M | 1M | 1,048M |
| Saída máxima | 128K | 128K | 128K | 65,5K |
| Modalidades de entrada | Texto, imagem | Texto, imagem | Texto, imagem/PDF | Texto, imagem, áudio, vídeo, PDF |
| AA Intelligence Index | 61,2 | 60,9 | 65,7 | 58,7 |
| AutomationBench | 41,4% | 18,1% | 31,4% | — |
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 19,1% |
| DeepSWE 1.1 | 74,1% | 72,7% | 67,4% | 73,8% |
| FrontierMath Tier 4 v2 | 97,6% | 83,0% | 87,8% | — |
| HLE with tools | 57,2% | — | 65,0% | — |
| HealthBench Professional | 63,4% | 60,5% | 58,1% | 52,1% |
| Preço oficial padrão (entrada) | $10/M | $4/M | $10/M | $0,75/M |
| Preço oficial padrão (saída) | $50/M | $20/M | $50/M | $3,75/M |
Quando o GPT-6 Astra é a melhor escolha
Escolha o Astra quando a tarefa é cara porque humanos precisam resgatar execuções de agente fracassadas: mudanças longas de código, automação de navegador/desktop, pesquisa profunda que envolve ferramentas, criação de artefatos técnicos ou fluxos de trabalho científicos e operacionais complexos. Seu prêmio é mais fácil de justificar quando menos tentativas, menos correções manuais e menor uso de tokens de saída importam mais do que o preço por token bruto.
Quando o Claude Fable 5.1 é a melhor escolha
O Claude Fable 5.1 continua sendo um concorrente de fronteira sério. Na própria tabela de lançamento da OpenAI, ele marca 65,7 no Artificial Analysis Intelligence Index versus 61,2 do Astra, e 65,0 no Humanity’s Last Exam com ferramentas versus 57,2 do Astra. Isso significa que o Astra não deve ser comercializado como um vencedor universal de inteligência. Se seu conjunto de avaliação se assemelha mais a raciocínio de longa forma do que a execução de uso do computador, o Claude Fable 5.1 pode ainda ser o encaixe mais forte.
Quando o Gemini 3.8 Flash é a melhor escolha
O Gemini 3.8 Flash mira um ponto diferente na fronteira. Ele suporta entrada de texto, imagem, áudio, vídeo e PDF com uma janela de contexto de cerca de 1M de tokens, enquanto a precificação oficial introdutória é muito inferior à do Astra. Para extração multimodal de alto volume, entendimento de vídeo/áudio, agentes de rotina ou workloads em que a economia de tokens $10/$50 é difícil de justificar, o Gemini 3.8 Flash costuma ser a escolha de produção mais econômica.
Por que a classificação de cibersegurança do GPT-6 Astra importa
O Astra é o primeiro modelo amplamente implantado da OpenAI a atingir o limiar de capacidade crítica em cibersegurança sob o Preparedness Framework da empresa. A OpenAI diz que o modelo pode identificar falhas de segurança anteriormente desconhecidas e desenvolver estratégias de exploração em sistemas endurecidos quando dadas as ferramentas e o acesso corretos. Nas avaliações de lançamento, o Astra marcou 100% no ExploitBench, 42,4% no ExploitGym e 88,0% no SRE-Bench em uma tentativa.
Essa capacidade vem com controles de implantação mais rígidos. A OpenAI diz que proteções de produção podem desacelerar, pausar ou interromper trabalho legítimo, particularmente em contextos cibernéticos de maior risco. O ChatGPT ou o Codex podem solicitar que um usuário revise uma ação antes de continuar, enquanto uma tarefa de API pode parar. A implantação padrão do Astra também recusa solicitações mais avançadas de criação de exploits; o programa Daybreak da OpenAI fornece acesso separado e validado para alguns fluxos de trabalho defensivos.
O system card documenta um trade-off de monitorabilidade: o Astra está melhor alinhado no geral do que o Sol, mas seu raciocínio escrito pode ser mais difícil de monitorar sob condições de avaliação adversária. Portanto, a OpenAI implanta uma monitoração de desalinhamento mais ampla em torno da inferência do Astra que usa ferramentas. Equipes corporativas devem tratar permissões de agente, limites de aprovação, logs de auditoria e acesso a ferramentas com privilégio mínimo como parte da arquitetura do modelo, e não como complementos opcionais.

Fonte: OpenAI official ExploitGym honeypot safety chart (imagem original, não redesenhada)
Preços do GPT-6 Astra
A página atual de preços da API da OpenAI separa solicitações de contexto curto e longo. Para processamento Standard, as tarifas de contexto curto são $10 de entrada, $1 de entrada em cache, $12,50 para gravações de cache e $50 de saída por milhão de tokens. Solicitações acima de 272K tokens de entrada usam a tabela de contexto longo: $20 de entrada, $2 de entrada em cache, $25 para gravações de cache e $75 de saída por milhão de tokens.
| Processamento / contexto | Entrada | Entrada em cache / gravação em cache | Saída |
|---|---|---|---|
| Standard, contexto curto | $10/M | $1/M / $12,50/M | $50/M |
| Standard, contexto longo (>272K entrada) | $20/M | $2/M / $25/M | $75/M |
| Batch / Flex, contexto curto | $5/M | $0,50/M / $6,25/M | $25/M |
| Batch / Flex, contexto longo | $10/M | $1/M / $12,50/M | $37,50/M |
| Fast mode, contexto curto | $20/M | $2/M / $25/M | $100/M |
| Fast mode, contexto longo | $40/M | $4/M / $50/M | $150/M |
Em comparação com o GPT-5.6 Sol, os preços por token Standard de contexto curto do Astra são 2,5× mais altos ($10/$50 versus $4/$20). Esse prêmio não significa automaticamente um custo de tarefa concluída 2,5× maior. Em programação orientada a agentes, a OpenAI e a Artificial Analysis reportam menor uso de tokens de saída para o Astra em algumas configurações. A unidade correta para avaliação é, portanto, o custo por tarefa bem-sucedida, não apenas o custo por token.
Como acessar o GPT-6 Astra
A OpenAI iniciou um rollout em fases em 3 de setembro de 2026. O Astra está programado para chegar aos usuários do ChatGPT Plus, Pro, Business e Enterprise, à API da OpenAI e à AWS nos dias seguintes. Administradores corporativos podem habilitar o Astra por workspace, e o acesso vem desativado por padrão no lançamento.
Chame o GPT-6 Astra com a Responses API da OpenAI
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "high"},
input=(
"Analise a arquitetura deste repositório. Identifique o problema de design de maior risco, explique as evidências e proponha um plano de migração."
),
)
print(response.output_text)
O ID do modelo é gpt-6-astra. Para fluxos de trabalho com muitas ferramentas, a Responses API é o ponto de partida natural porque o Astra suporta function calling, structured outputs, web search, file search, code interpreter, hosted shell, apply patch, computer use, MCP e tool search. Fine-tuning não é suportado no momento.
Casos de uso reais do GPT-6 Astra
Desenvolvimento de jogos e fluxos de trabalho de software visual
A Playco testou o Astra dentro do Playbot, um IDE com IA que funciona diretamente no Unity e no Godot. A OpenAI reporta 50% menos correções manuais do que com o modelo anterior, e três protótipos temáticos construídos a partir de uma única base grey-box. Esse exemplo é importante porque a tarefa exige mais do que geração de código-fonte: o modelo precisa raciocinar sobre layout espacial, jogar o jogo, testar mudanças, identificar bugs e iterar dentro de um ambiente visual.
Revisão de documentos jurídicos e financeiros
A OpenAI posiciona o Astra para fluxos de trabalho profissionais multietapas que produzem documentos, planilhas e análises polidos. Em revisão jurídica e financeira, seu valor prático é manter o estado da tarefa em muitos arquivos, conferir evidências e retornar um artefato finalizado em vez de responder a uma única pergunta isolada. Validação por especialistas, controles de aprovação e acesso a dados com privilégio mínimo continuam necessários.
Agentes de engenharia de longo horizonte
A combinação de resultados em Terminal-Bench, DeepSWE, migração de banco de dados, uso do computador e contexto longo torna o Astra especialmente relevante para engenharia em escala de repositório. Um padrão de implantação útil é dar ao Astra um ambiente de desenvolvimento restrito, um objetivo de issue ou migração, testes e acesso a ferramentas; depois avaliar o sucesso pela qualidade das tarefas mescladas, número de iterações fracassadas, tempo de revisão humana e custo total. Essa é uma métrica de produção melhor do que uma única pontuação de benchmark de código.
Limitações do GPT-6 Astra
- Preço premium por token. O Astra custa 2,5× o GPT-5.6 Sol por token na precificação Standard de contexto curto, então chat rotineiro, classificação, extração e redação simples costumam ser antieconômicos.
- Contexto longo tem sobretaxa. Solicitações com mais de 272K tokens de entrada passam para tarifas mais altas para toda a solicitação, então “contexto de 1,05M” não deve ser interpretado como memória de preço plano.
- Sem entrada nativa de áudio ou vídeo no modelo. O Astra aceita texto e imagens e produz texto; o Gemini 3.8 Flash é mais flexível quando entendimento nativo de áudio/vídeo é central ao workload.
- Sem fine-tuning. A página oficial do modelo atualmente lista fine-tuning como não suportado, então a personalização depende de prompting, ferramentas, recuperação e design de fluxo de trabalho.
- Salvaguardas de cibersegurança podem interromper fluxos de trabalho. A OpenAI alerta explicitamente que verificações adicionais de segurança podem pausar ou parar trabalho legítimo em contextos de maior risco.
- Não é vencedora universal de benchmarks. O Claude Fable 5.1 lidera o Astra no Artificial Analysis Intelligence Index e nas métricas HLE-with-tools incluídas na comparação de lançamento publicada pela OpenAI.
Perguntas frequentes
O GPT-6 Astra foi lançado oficialmente?
Sim. A OpenAI iniciou o rollout em 3 de setembro de 2026. A disponibilidade é em fases entre organizações, planos pagos do ChatGPT, acesso à API e AWS, em vez de aparecer para todas as contas ao mesmo tempo.
Qual é a janela de contexto do GPT-6 Astra?
A página oficial do modelo lista uma janela de contexto de 1,05M tokens e saída máxima de 128K tokens. Solicitações acima de 272K tokens de entrada usam a tabela de preços de contexto longo.
Quanto custa o GPT-6 Astra?
A precificação Standard de contexto curto é de $10 entrada / $50 saída por milhão de tokens, com $1 para entrada em cache e $12,50 para gravações de cache. Contexto longo, Batch/Flex e Fast mode têm tarifas diferentes, então estimativas de produção devem usar o nível que corresponda à solicitação real.
O GPT-6 Astra é melhor que o Claude Fable 5.1?
Depende do workload. O Astra lidera em várias avaliações de uso do computador, agentes de programação, ciência, ciber e trabalho profissional, enquanto o Claude Fable 5.1 lidera o Astra no Artificial Analysis Intelligence Index e no HLE com ferramentas na comparação publicada pela OpenAI. Use suas próprias avaliações de agentes/tarefas em vez de assumir que um modelo domina todas as categorias.
O GPT-6 Astra é AGI?
As páginas oficiais de produto da OpenAI descrevem o Astra como uma nova geração de inteligência e seu modelo mais capaz amplamente implantado, mas não definem o produto em si como “AGI”. A saturação de benchmarks em algumas tarefas não é equivalente a uma definição universal e consolidada de AGI.
Conclusão
O GPT-6 Astra é melhor entendido como um modelo de fronteira focado em execução. Sua evidência mais forte de progresso não é o pequeno movimento de 60,9 para 61,2 versus o GPT-5.6 Sol no Artificial Analysis Intelligence Index; é a melhoria muito maior em uso do computador, programação orientada a agentes, fluxos de trabalho científicos, recuperação em contexto longo, conclusão de tarefas profissionais e cibersegurança. A janela de contexto de 1,05M e o stack profundo de ferramentas dão aos desenvolvedores mais espaço para construir agentes que permanecem úteis além de uma única resposta.
O trade-off é o preço. A precificação Standard de $10/$50 é premium, solicitações de contexto longo custam mais, e testes independentes mostram que o Astra pode ser significativamente mais caro do que o Sol em workloads de inteligência geral. O modelo justifica esse prêmio quando melhores taxas de conclusão e menor correção humana superam o custo de tokens. Para workloads mais simples ou de alto volume, GPT-5.6, Claude Fable 5.1 e especialmente o Gemini 3.8 Flash continuam sendo alternativas relevantes, e não predecessores obsoletos.
