FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/Pesquisa CometAPI

GLM-5.3 vs GLM-5.2: benchmarks e testes nos dizem o que mudou

GLM-5.3 vs GLM-5.2: Mesmo modelo base, o pós-treinamento por si só proporciona um salto de ~50% em programação (Terminal-Bench 3.0 4.6→28.3) e CyberGym emergente 84.5% SOTA.

CometAPI
AnnaEquipe de pesquisa de modelos e API de IA
Atualizado Aug 17, 2026 14 min de leitura
GLM-5.3 vs GLM-5.2: benchmarks e testes nos dizem o que mudou
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR A Z.ai lançou o GLM-5.3 em 14 de agosto de 2026, sobre o mesmo modelo base Mixture-of-Experts com ~743–753B parâmetros do GLM-5.2. Todo ganho veio de pós-treinamento escalado em ambientes de horizonte longo. O resultado é uma melhoria relativa de ~50% no Code Bench interno da Z.ai, SOTA open-source no Terminal-Bench 3.0 (4.6 → 28.3) e no Agents’ Last Exam, notas agentic dramaticamente melhores e desempenho emergente estado da arte em cibersegurança (CyberGym 84.5%). A eficiência de tokens também melhorou.

Espera-se que os pesos sejam disponibilizados cerca de duas semanas após o lançamento, após reforço de segurança. Desenvolvedores já podem acessar modelos GLM relacionados e testar fluxos de trabalho de forma eficiente por meio de plataformas unificadas como a CometAPI.

Principais pontos

  • Mesmo modelo base que o GLM-5.2; todos os avanços vieram do pós-treinamento (IndexShare, SAO, framework slime + mais ambientes e computação).
  • Codificação: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench interno da Z.ai ~50% melhor com menos tokens de saída.
  • Agentic: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Cyber: CyberGym 77.2 → 84.5 (SOTA, à frente de Mythos 5 e GPT-5.6 Sol); ExploitBench mais que dobrou (24.4 → 54.4). Achados no mundo real: 2.436 vulnerabilidades em 269 projetos.
  • Especificações inalteradas na arquitetura central: 1M de contexto, até 128K tokens de saída, pensamento sempre ativo com níveis low/high/max.
  • Acesso: Ao vivo via GLM Coding Plan e ZCode; API geral e pesos abertos (esperado estilo MIT) após revisão de segurança. A CometAPI oferece acesso conveniente compatível com OpenAI para a família GLM, permitindo testes lado a lado e roteamento em produção.

GLM-5.3 vs GLM-5.2 em resumo

DimensãoGLM-5.3GLM-5.2Vencedor / Observações
Modelo baseMesmo ~743–753B MoEMesmoIdêntico
Pós-treinamentoAmbientes fortemente escaladosStack anterior5.3
Terminal-Bench 3.028.34.65.3 (grande)
DeepSWE v1.166.946.25.3
Code Bench interno (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (desempenho + eficiência)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Contexto / Saída máxima1M / 128K1M / similarMesmo
PensamentoSempre ativo (low/high/max)Mais flexível anteriormente5.3 (sempre ativo)
Pesos abertos~2 semanas pós-lançamento (planejado)Disponível (MIT)5.2 atualmente
Acesso primário agoraCoding Plan / ZCodeAPI + pesos + Coding Plan5.2 mais maduro

Introdução: Pós-treinamento entrega um salto geracional

Em meados de agosto de 2026, a comunidade de IA testemunhou outra iteração rápida na corrida de pesos abertos. A Z.ai (o rosto internacional da antiga equipe Zhipu AI / ChatGLM) lançou o GLM-5.3 apenas 59 dias após o GLM-5.2. O anúncio foi incomum pela clareza: o modelo base subjacente permaneceu idêntico. “Escalar o pós-treinamento foi tudo o que fizemos para o GLM-5.3,” declarou a empresa.

Essa afirmação é importante. Por anos, a narrativa dominante foi “modelos maiores vencem”. O GLM-5.3 demonstra que a escalada agressiva de ambientes de aprendizado por reforço, diversidade de tarefas de horizonte longo e infraestrutura de sistemas pode produzir ganhos desproporcionais em workloads difíceis de codificação, agentic e até cibersegurança sem uma nova rodada de pré-treinamento. Os números são grandes o suficiente em vários benchmarks difíceis para que observadores independentes descrevam o salto como qualitativamente diferente, em vez de incremental. Visão geral de recursos, benchmarks e notas de acesso do GLM-5.3.

GLM-5.3 vs GLM-5.2: O que realmente mudou?

O maior equívoco seria pensar que o GLM-5.3 é simplesmente “GLM-5.2 porém maior.”

Não é.

O modelo base permanece essencialmente o mesmo, segundo a Z.ai. A principal inovação é a escala do pós-treinamento. A Z.ai enfatiza três pilares:

  1. Melhorias de sistemas dentro do slime — Treinamento melhor
  2. Escalonamento de ambientes — Pipelines que sintetizam ambientes executáveis, verificáveis e de horizonte longo a partir de fluxos de trabalho profissionais reais. Agentes de pesquisa extraem padrões de tarefas; agentes juízes verificam a solucionabilidade; verificadores são construídos sem acesso a soluções de referência para reduzir “reward hacking”.
  3. Uso contínuo de SAO + compactação — Ajuda os ganhos a persistirem em trajetórias longas, em vez de colapsarem em curtas. –consistência de rollout (diferenças de log-prob controladas em ~1e-7), cache hierárquico, suporte a múltiplos professores, agendamento sensível ao workload e ganhos relatados de >2.3× em throughput ponta a ponta em tarefas de RL de codificação de horizonte longo.

Essas mudanças produziram melhorias mensuráveis em suítes de codificação, agentic e cibersegurança. Importante: os maiores ganhos relativos aparecem nos testes mais difíceis e com baseline mais baixo — exatamente o padrão esperado quando um modelo é empurrado para regimes que antes não conseguia lidar de forma confiável.

O resultado é uma atualização de modelo que trata principalmente de comportamento e capacidade, em vez de simplesmente arquitetura.

GLM-5.3 vs GLM-5.2: Comparação de recursos

1. Pós-treinamento escalado em vez de um novo modelo base

A Z.ai descreve o pós-treinamento escalado como toda a receita do GLM-5.3. Agentes de pesquisa transformam padrões do trabalho real em tarefas executáveis com estado oculto e dependências multietapas. Um agente juiz verifica que cada tarefa é solucionável. Verificadores são criados sem ver a solução de referência e, em seguida, testados contra estados oracle, no-op e não resolvidos para reduzir atalhos de recompensa.

O sistema ainda requer revisão humana, e a Z.ai afirma explicitamente que a geração e verificação de ambientes mais autônomas permanecem trabalho futuro. Essa ressalva aumenta a credibilidade da afirmação: trata-se de um pipeline de treinamento grande, não de uma alegação de que ambientes sintéticos se tornaram totalmente autogeridos.

2. Codificação de horizonte longo mais forte

O GLM-5.3 melhora em trabalho de repositório, tarefas de terminal, infraestrutura de machine learning, otimização de performance e entrega de software multietapas. No Z.ai Code Bench, a avaliação interna privada destinada a refletir cenários realistas de usuários, a Z.ai reporta aproximadamente 50% melhor desempenho de codificação do que o GLM-5.2.

O resultado de eficiência é tão importante quanto a pontuação. No nível Max de esforço, o GLM-5.3 atingiu 34.5% com cerca de 75K tokens de saída por tarefa, comparado com 23.4% e 96K do GLM-5.2. Isso é um ganho de qualidade de 11.1 pontos produzindo cerca de 22% menos tokens de saída. No nível High de esforço, o GLM-5.3 alcançou 31.4% usando cerca de 50K tokens, à frente do Claude Opus 4.8 com 29.5% e 120K no mesmo gráfico de primeira parte. O Claude Fable 5 permaneceu mais alto com 39.5% sob Max.

3. Capacidade emergente de cibersegurança

A Z.ai adicionou ambientes de descoberta de vulnerabilidades durante o pós-treinamento. Segundo o relatório de lançamento, a capacidade cresceu além de encontrar falhas isoladas: o modelo passou a raciocinar em múltiplos estágios de uma cadeia de exploração.

As pontuações públicas mostram progresso e limites. O GLM-5.3 lidera a tabela de comparação da Z.ai no CyberGym com 84.5, contra 77.2 do GLM-5.2. No ExploitBench, mais do que dobra o GLM-5.2, alcançando 54.4 contra 24.4, mas permanece bem atrás do Fable 5 em 78.0 e do GPT-5.6 Sol em 76.5. No ExploitGym, completa 105 tarefas em um orçamento normalizado de duas horas e 130 em seis horas, comparado a 29 e 39 do GLM-5.2; GPT-5.6 Sol e Fable 5 permanecem substancialmente à frente.

Essas capacidades são de uso dual. As organizações devem limitar o acesso ao modelo, isolar ferramentas (sandbox), registrar ações, exigir autorização para varreduras e manter um humano na revisão para validação e divulgação de vulnerabilidades.

4. Pensamento sempre ativo com três níveis de esforço

O GLM-5.3 suporta esforços de raciocínio low, high e max. Diferente do GLM-5.2, não é possível desativar o pensamento. Integrações existentes que enviam thinking.type: "disabled" devem alterar o valor para enabled antes de trocar o ID do modelo, ou a Z.ai diz que a solicitação falhará.

Use low para edições interativas e transformações de baixo risco, high para tarefas substanciais de repositório e max para codificação difícil ou análise de segurança. Esforços mais altos devem ser avaliados quanto a latência e custo porque uma resposta mais forte não é automaticamente a mais econômica.

5. Maior throughput de treinamento via slime

O GLM-5.3 continua a usar o slime, o framework open-source da Z.ai com Megatron no lado de treinamento e SGLang no lado de rollout. A Z.ai relata adições para top-p masking, destilação on-policy com top-k e vocabulário completo, troca de professores, caching e alinhamento numérico mais rígido entre treinamento e rollout. O relatório de lançamento afirma que diferenças médias de log-probabilidade foram controladas no nível 1e-7, mais de 99.99% menores do que configurações anteriores.

Agendamento e balanceamento de carga sensíveis ao workload teriam melhorado o throughput de aprendizado por reforço ponta a ponta em mais de 2.3 vezes em tarefas de codificação de horizonte longo. São melhorias de infraestrutura de treinamento, não garantias de inferência para usuários finais, mas explicam como a Z.ai escalou trajetórias mais longas e diversas em um mês.

6. Pesos abertos adiados para revisão de segurança

A Z.ai chama o GLM-5.3 de modelo de pesos abertos, mas os pesos não estavam disponíveis para download no dia do lançamento. A empresa diz que serão liberados duas semanas depois, após avaliação e reforço de segurança. Isso difere do GLM-5.2, cujos pesos com licença MIT já estão no Hugging Face.

Para a maioria das equipes, testes hospedados via API ainda são o primeiro passo prático. O modelo é grande, e pesos abertos não removem o custo de hardware de inferência, quantização, serving, monitoramento ou controles de segurança.

GLM-5.3 vs GLM-5.2: Melhorias em benchmarks

A tabela a seguir usa dados oficiais do lançamento da Z.ai. “Mudança” é um cálculo simples a partir das pontuações reportadas. Percentuais relativos podem parecer dramáticos quando o baseline do GLM-5.2 é baixo, então a mudança absoluta também é mostrada.

BenchmarkGLM-5.2GLM-5.3Mudança absolutaMudança relativa
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, tarefas 2 horas29105+76+262.1%
ExploitGym, tarefas 6 horas39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE com ferramentas54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Melhorias de benchmarks: GLM-5.3 vs GLM-5.2 e concorrentes

Todos os números abaixo são reportados pelo fornecedor no blog oficial da Z.ai (com notas de metodologia sobre harnesses, comprimentos de contexto e amostragem). Verificação independente seguirá quando pesos e acesso mais amplo estiverem disponíveis.

Benchmarks de codificação

BenchmarkGLM-5.3GLM-5.2Notas / Concorrentes
Terminal Bench 2.188.281.0Competitivo com os principais modelos fechados
Terminal Bench 3.028.34.6SOTA open-source; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Salto forte
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (interno, esforço Max)~34.5% conclusão @ ~75K tokens~23.4% @ ~96K tokens~50% de melhoria geral em codificação; maior eficiência

Em esforço High, o GLM-5.3 atingiu 31.4% de conclusão com ~50K tokens, superando o Claude Opus 4.8 (29.5% com 120K tokens) no bench interno, ainda atrás do Claude Fable 5 (39.5% em Max).

Benchmarks de cibersegurança

BenchmarkGLM-5.3GLM-5.2Concorrentes (aprox.)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Mais que dobra o anterior; modelos fechados mais altos (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 ainda à frente (181/247)

Os ganhos são maiores mais acima na cadeia de exploração. Em testes no mundo real com equipes chinesas de segurança, o modelo (com base no trabalho do GLM-5.2) identificou 2.436 vulnerabilidades em 269 projetos, incluindo 1.097 questões de gravidade média a alta. Algumas falhas datam de ~40 anos atrás (a mais antiga ~1981). Os achados são rastreados no registro público Z.ai Security Disclosure Ledger.

Agentic e outros benchmarks

BenchmarkGLM-5.3GLM-5.2Observações
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Ganho grande
Agents’ Last Exam (ALE-CLI)28.523.8Competitivo open-source
HLE c/ ferramentas62.554.7
GDPval-AA v217691508Cobre 44 profissões

Esses resultados demonstram progresso claro em tarefas profissionais de horizonte longo e múltiplas etapas.

Eficiência de tokens, modos de pensamento e comportamento prático

Uma melhoria silenciosa porém importante é a eficiência de tokens. No Code Bench interno, taxas de conclusão mais altas chegam com menos tokens de saída. Isso importa para custo e latência em loops de agentes de produção.

O GLM-5.3 sempre habilita o pensamento. Três níveis de esforço são suportados: low, high e max (padrão e recomendado para codificação é max). Desativar o pensamento não é mais suportado; aplicações que anteriormente definiam thinking.type: "disabled" devem migrar.

O contexto permanece em 1M tokens com saída máxima de até 128K. A arquitetura é inalterada em relação ao GLM-5.2, então dimensionamento de hardware para futura hospedagem própria pode ser estimado a partir da experiência com o GLM-5.2 (pegadas quantizadas ainda grandes dado o total de parâmetros).

Para desenvolvedores que querem experimentar imediatamente ou manter flexibilidade entre modelos, gateways unificados são úteis. A CometAPI lista modelos da série GLM (incluindo GLM-5.3 sob o ID de modelo glm-5.3 conforme se torna disponível) com endpoints compatíveis com OpenAI, tarifas competitivas, cobrança por uso e capacidade de alternar entre GLM-5.2, GLM-5.3 e dezenas de outros modelos de fronteira e abertos sem reescrever o código de integração. Isso é particularmente prático para testar agentes de codificação A/B, medir custo real por tarefa bem-sucedida e rotear tráfego com base no workload.

Quem deve migrar para o GLM-5.3 e como avaliar

Equipes que constroem agentes de codificação, automação de horizonte longo, fluxos de engenharia em escala de repositório ou ferramentas de segurança defensiva devem priorizar a avaliação. A combinação de maiores taxas de conclusão, melhor eficiência de tokens em tarefas complexas e agência multietapas mais forte é material.

Caminho recomendado de avaliação:

  1. Execute as mesmas tarefas internas (ou um harness fixo) no GLM-5.2 e GLM-5.3 (ou via Coding Plan) em níveis de esforço combinados.
  2. Meça não apenas taxa de aprovação mas tokens, tempo de relógio e taxa de intervenção humana.
  3. Use uma camada de API unificada como a CometAPI para manter a comparação sem atritos e reter a opção de fallback ou roteamento seletivo.
  4. Para workloads sensíveis à segurança, aguarde os pesos abertos totalmente reforçados e revise práticas de divulgação.

Hospedagem própria se tornará atraente quando os pesos forem liberados, especialmente para organizações que já rodam infraestrutura do GLM-5.2.

Conclusão: Pós-treinamento como a nova fronteira de escala

O GLM-5.3 é uma das demonstrações mais claras recentes de que a escala do pós-treinamento — ambientes mais realistas, melhor infraestrutura de RL e computação sustentada em trajetórias longas — pode produzir saltos de capacidade que antes pareciam exigir novos modelos base. Os ganhos de codificação e agentic são grandes; os resultados em cyber foram em grande parte emergentes e já competitivos ou líderes em benchmarks orientados a descoberta.

Para profissionais, a conclusão prática é direta: teste o modelo em seus workloads reais, meça custo por resultado bem-sucedido em vez de posição bruta em leaderboard e mantenha a integração flexível. Plataformas como a CometAPI simplificam esse processo ao oferecer uma única chave, interface compatível com OpenAI e troca fácil entre a série GLM e modelos concorrentes enquanto você decide quão agressivamente adotar as novas capacidades.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Aug 15, 2026
Última atualização Aug 17, 2026
0 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais