GPT-5.6 Luna price down 80%, Terra down 20% →

A onda de modelos de julho de 2026: GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3 etc.

CometAPI
AnnaAug 1, 2026
A onda de modelos de julho de 2026: GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3 etc.

TL;DR: Seis grandes lançamentos de modelos chegaram em um intervalo de cerca de três semanas em julho de 2026: a família GPT-5.6 de três níveis da OpenAI (Sol/Terra/Luna), o Gemini 3.6 Flash do Google, o Grok 4.5 da xAI, o Kimi K3 da Moonshot AI, o Claude Opus 5 da Anthropic e o GLM-5.2 da Zhipu. Nenhum é a melhor escolha universal. A decisão prática depende de profundidade de raciocínio, desempenho em programação, custo por token, requisitos de contexto e de a implantação com pesos abertos importar ou não. Esta comparação usa informações oficiais atuais dos provedores e listagens da CometAPI, com alegações de benchmark identificadas pela fonte em vez de tratadas como um ranking universal único.

Principais pontos:

  • GPT-5.6 não é um único modelo — são três (Sol, Terra, Luna) com três faixas de preço, e escolher o nível errado é um erro de custo maior do que escolher a família de modelos errada.
  • Gemini 3.6 Flash e GLM-5.2 ambos publicam uma janela de contexto de 1.000.000 de tokens; Kimi K3 também iguala esse número — o tamanho de contexto deixou de ser um diferenciador entre os modelos líderes desta geração.
  • GLM-5.2 e Kimi K3 ambos suportam implantação com pesos abertos, mas não usam a mesma licença. GLM-5.2 é lançado sob a MIT License; Kimi K3 usa a Kimi K3 License, cujos termos comerciais devem ser revisados antes de auto-hospedar ou oferecer acesso a modelo como serviço.
  • Claude Opus 5 foi oficialmente lançado. A Anthropic o anunciou em 24 de julho de 2026 com uma janela de contexto de 1M de tokens, até 128K de saída síncrona, e preço oficial de $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída; a CometAPI atualmente lista a $4/$20.

O que de fato foi lançado este mês

Julho de 2026 foi um mês incomumente denso para lançamentos de modelos de fronteira e de quase-fronteira. Em cerca de três semanas, a OpenAI lançou a família GPT-5.6 (9 de jul.), a xAI lançou o Grok 4.5 (8 de jul.), a Moonshot AI lançou o Kimi K3 (16 de jul.), o Google lançou o Gemini 3.6 Flash (21 de jul.) e a Anthropic lançou oficialmente o Claude Opus 5 (24 de jul.). O GLM-5.2 da Zhipu chegou um pouco antes, em junho, mas seu contexto de 1M de tokens e o lançamento aberto sob MIT o tornam relevante para a mesma decisão de compra e implantação.

A questão prática para quem constrói sobre esses modelos não é qual é o melhor em abstrato, mas qual opção confirmada se encaixa em um trabalho específico. Os seis diferem de forma significativa em custo, contexto, comportamento em programação, licenciamento e flexibilidade de implantação.

Preços e especificações, lado a lado

Todos os preços abaixo são por milhão de tokens. Quando um modelo tem vários níveis, cada um é listado separadamente.

ModeloEntradaSaídaJanela de contextoLicençaLançado
GPT-5.6 Sol$5.00$30.00Not publicly specifiedProprietaryJul 9, 2026
GPT-5.6 Terra$2.50$15.00Not publicly specifiedProprietaryJul 9, 2026
GPT-5.6 Luna$1.00$6.00Not publicly specifiedProprietaryJul 9, 2026
Grok 4.5$2.00$4.00Not publicly specifiedProprietaryJul 8, 2026
Kimi K3$3.00$15.001,048,576 tokensOpen weights (Kimi K3 License)Jul 16, 2026
Gemini 3.6 Flash$1.50$7.501,048,576 tokens (65,536 output)ProprietaryJul 21, 2026
GLM-5.2$1.40$4.411,000,000 tokensOpen (MIT license)Jun 13, 2026
Claude Opus 5$5.00$25.001,000,000 tokens (128K output)ProprietaryJul 24, 2026

*As tarifas oficiais dos provedores mostradas acima; uma API unificada aplicando um desconto padrão reduziria cada uma proporcionalmente — o objetivo da tabela é a diferença relativa entre modelos, não o preço de checkout de um fornecedor específico.

Algumas coisas se destacam na tabela de preços e especificações. Sol, o nível superior do GPT-5.6, tem preço voltado a raciocínio de fronteira e trabalho agêntico, não a uso cotidiano, enquanto o preço de saída do Grok 4.5 é relativamente baixo para seu posicionamento. GLM-5.2 tem o menor preço de saída listado neste grupo e usa a permissiva MIT License. Kimi K3 também oferece pesos baixáveis e contexto de 1M de tokens, mas sob a Kimi K3 License em vez de MIT. Gemini 3.6 Flash, Kimi K3, GLM-5.2 e Claude Opus 5 todos publicam janelas de contexto de aproximadamente 1M de tokens, então capacidade de contexto sozinha não é mais suficiente para escolher entre eles. As tarifas listadas na CometAPI são geralmente inferiores aos preços de tabela dos provedores, mas a avaliação no nível do workload continua mais útil do que comparar preços por token isoladamente.

Para que cada uma está de fato ajustada

GPT-5.6 Sol é posicionado para raciocínio de fronteira, codificação agêntica e trabalho técnico de longo horizonte — suporta um modo "Max Reasoning Effort" e um "Ultra Mode" que aciona subagentes em paralelo. Este é o nível para problemas difíceis e multietapas, não tarefas rotineiras, dado o diferencial de preço em relação a Terra e Luna.

GPT-5.6 Terra é o nível intermediário equilibrado — produtividade do dia a dia, documentação, suporte à programação e automação de negócios. Para a maioria dos backends de aplicação que não precisam especificamente da profundidade de raciocínio de Sol, Terra é o padrão mais defensável.

GPT-5.6 Luna mira uso leve e de alto volume: classificação, fluxos de suporte ao cliente, onboarding, geração repetida de conteúdo. A $1.00/$6.00 por milhão de tokens (antes de qualquer desconto do gateway), tem preço exatamente para esse tipo de workload de alto volume de chamadas e baixa complexidade — e também oferece preço de entrada em cache com desconto de 90% sobre a tarifa padrão de entrada, o que importa mais aqui do que nos níveis superiores, dado quão repetitivos tendem a ser esses workloads.

Grok 4.5 não publica uma especialização declarada como os níveis do GPT-5.6, mas seu preço o coloca entre uma opção econômica e intermediária — vale uma comparação direta de benchmark com Terra ou Kimi K3 para um workload específico, em vez de assumir o posicionamento apenas pelo preço.

Kimi K3 é um modelo de Mistura de Especialistas com 2,8 trilhões de parâmetros, criado para programação de longo horizonte, trabalho multimodal de conhecimento e análise extensa de documentos ou repositórios dentro de um contexto de 1M de tokens. A Moonshot AI liberou os pesos completos, então é possível auto-hospedar, mas o lançamento usa a Kimi K3 License, que inclui condições comerciais diferentes de um lançamento padrão MIT.

Gemini 3.6 Flash é o lançamento focado em eficiência do Google: é explicitamente apresentado como um avanço incremental, otimizado em custo e latência, em relação ao 3.5 Flash, não um novo modelo de fronteira, com ganhos reais em benchmarks de programação e agentes junto a um preço por token de saída menor do que seu antecessor. É a escolha para workloads baseados em agentes nos quais eficiência de tokens e custo por tarefa concluída importam tanto quanto capacidade bruta.

GLM-5.2 é a opção aberta mais permissiva nesta comparação. A Z.ai o lançou sob a MIT License com contexto de 1M de tokens e ênfase explícita em programação de longo horizonte, uso de ferramentas e esforço de raciocínio ajustável. As equipes podem acessá-lo via API ou executar os pesos publicados localmente, sujeitos à própria infraestrutura e requisitos de avaliação.

Comparação de capacidade em programação

Os seis lançamentos miram padrões de engenharia diferentes, então habilidade em programação é melhor entendida como ajuste ao workload do que como um único ranking.

  • Claude Opus 5 é o melhor ajuste aqui para depuração difícil, análise de causa raiz, grandes refatorações e agentes de software de longa duração; a Anthropic destaca comportamento mais forte de verificação e iteração.
  • GPT-5.6 Sol, Terra e Luna oferecem um caminho escalonado desde programação e raciocínio complexos até trabalho de desenvolvimento equilibrado e assistência de código em alto volume.
  • Gemini 3.6 Flash é ajustado para loops de codificação baseados em agentes rápidos, onde latência e custo por iteração importam.
  • Kimi K3 é projetado para programação de longo horizonte sobre repositórios muito grandes, com contexto de 1M de tokens e pesos baixáveis.
  • GLM-5.2 combina programação de longo horizonte, uso de ferramentas, esforço de raciocínio ajustável e implantação local sob a MIT License.
  • Grok 4.5 deve ser tratado como candidato à avaliação direta contra os demais, pois seu posicionamento oficial não fornece o mesmo detalhamento de especialização em programação que a família GPT em níveis.

O trade-off de comparar (e alternar entre) modelos com essa frequência

Nada disso é um argumento para perseguir todo novo lançamento. Alternar workloads de produção para um novo modelo toda vez que um é lançado tem custos reais: retestar prompts, revalidar a qualidade de saída e rever a matemática de custo por tarefa no seu tráfego real, não no sintético de um benchmark. Uma API unificada não remove esse trabalho de avaliação, mas remove a sobrecarga de contas e faturamento separados de realmente rodar a comparação — poder chamar GPT-5.6 Terra, Gemini 3.6 Flash, Kimi K3 e GLM-5.2 com o mesmo formato de requisição e uma fatura torna realista testar mais de um candidato antes de se comprometer, em vez de padronizar no provedor para o qual você já tinha uma chave.

Isso é uma vantagem real, não uma solução completa — não substitui ler a documentação de cada modelo, e não torna a escolha de modelo livre dos custos de mudança descritos acima. O que faz é reduzir o custo de descobrir qual modelo é realmente certo para um dado workload, o que é uma afirmação diferente (e mais honesta) de “este modelo é o melhor”.

Perguntas frequentes

Qual é o melhor modelo de IA lançado em julho de 2026? Não há uma única melhor resposta. GPT-5.6 Sol e Claude Opus 5 são voltados a trabalho exigente de raciocínio e programação; Gemini 3.6 Flash enfatiza loops agênticos eficientes; Kimi K3 combina contexto longo com pesos abertos; e GLM-5.2 combina capacidade de longo horizonte com MIT License. A escolha certa depende do workload e das restrições de implantação.

GPT-5.6 é um modelo ou vários? Três: Sol (flagship, raciocínio de fronteira), Terra (equilibrado, uso cotidiano) e Luna (rápido e de baixo custo, tarefas de alto volume) — cada um com preço separado, de $0.80/$4.80 por milhão de tokens para o Luna até $4.00/$24.00 para o Sol.

Claude Opus 5 foi oficialmente lançado? Sim. A Anthropic anunciou o Claude Opus 5 em 24 de julho de 2026. O lançamento oficial descreve uma janela de contexto de 1M de tokens e posiciona o modelo para programação agêntica complexa e trabalho de conhecimento; o preço oficial de API é $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída.

Qual desses modelos é mais barato para rodar em escala? Pelos preços de saída listados pelos provedores na tabela, GLM-5.2 é a opção de menor custo e está disponível sob a MIT License. Kimi K3 também tem pesos abertos, mas sua Kimi K3 License e o tamanho muito maior do modelo mudam a economia de auto-hospedagem. GPT-5.6 Luna é a opção proprietária mais barata, apenas via API, coberta aqui.

Preciso escolher um modelo e me comprometer, ou posso testar vários? Testar mais de um contra seus prompts e tráfego reais geralmente vale o custo de configuração antes do comprometimento em produção — uma API unificada (CometAPI entre outras) torna isso especificamente mais barato, já que remove a sobrecarga de contas separadas para rodar a comparação, embora não substitua a leitura da documentação de cada modelo.

Conclusão

A onda de lançamentos de julho de 2026 não produziu um vencedor claro. Produziu seis opções confirmadas que fazem trade-offs diferentes em profundidade de raciocínio, desempenho em programação, custo por token, contexto e licenciamento. GPT-5.6 Sol e Claude Opus 5 miram o trabalho mais difícil em raciocínio e engenharia de software; Gemini 3.6 Flash e GPT-5.6 Luna enfatizam eficiência; Kimi K3 traz pesos abertos e um contexto multimodal de 1M sob sua própria licença; e GLM-5.2 oferece uma alternativa com 1M de tokens sob MIT License. Todos são acessíveis via CometAPI sob uma única chave, o que facilita testes controlados, mas a seleção de modelo ainda deve se basear nos prompts, ferramentas, metas de latência e critérios de sucesso do workload real.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais