FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/Recherche CometAPI

GLM-5.3 vs GLM-5.2 : Les benchmarks et les tests nous disent ce qui a changé

GLM-5.3 vs GLM-5.2: Même modèle de base, le post-entraînement seul apporte un bond de ~50% en programmation (Terminal-Bench 3.0 4.6→28.3) & CyberGym émergent à 84.5% SOTA.

CometAPI
AnnaÉquipe de recherche sur les modèles IA et API
Mis à jour Aug 17, 2026 15 min de lecture
GLM-5.3 vs GLM-5.2 : Les benchmarks et les tests nous disent ce qui a changé
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Z.ai a lancé GLM-5.3 le 14 août 2026, sur exactement le même modèle de base Mixture-of-Experts d’environ ~743–753B paramètres que GLM-5.2. Tous les gains proviennent d’un post-entraînement mis à l’échelle sur des environnements à long horizon. Il en résulte une amélioration relative d’environ ~50 % sur le banc de code interne de Z.ai, un SOTA open source sur Terminal-Bench 3.0 (4.6 → 28.3) et Agents’ Last Exam, des scores agentiques nettement supérieurs, et une performance de cybersécurité à l’état de l’art émergente (CyberGym 84.5%). L’efficacité en tokens s’est également améliorée.

Les poids sont attendus environ deux semaines après le lancement, après durcissement de sécurité. Les développeurs peuvent déjà accéder aux modèles GLM associés et tester des workflows efficacement via des plateformes unifiées telles que CometAPI.

Points clés

  • Même modèle de base que GLM-5.2 ; tous les progrès proviennent du post-entraînement (IndexShare, SAO, framework slime + plus d’environnements et de compute).
  • Codage : Terminal-Bench 3.0 4.6 → 28.3 ; DeepSWE v1.1 46.2 → 66.9 ; banc de code interne Z.ai ~50 % mieux avec moins de tokens de sortie.
  • Agentique : AutomationBench 26.2 → 48.2 ; Agents’ Last Exam 23.8 → 28.5 ; GDPval-AA v2 1508 → 1769.
  • Cyber : CyberGym 77.2 → 84.5 (SOTA, devant Mythos 5 et GPT-5.6 Sol) ; ExploitBench plus que doublé (24.4 → 54.4). Découvertes réelles : 2,436 vulnérabilités sur 269 projets.
  • Spécifications inchangées dans l’architecture de base : 1M de contexte, jusqu’à 128K tokens de sortie, raisonnement toujours activé avec des niveaux d’effort low/high/max.
  • Accès : Disponible via GLM Coding Plan et ZCode ; API générale et poids ouverts (style MIT attendu) à venir après revue de sécurité. CometAPI offre un accès pratique compatible OpenAI à la famille GLM pour des tests côte à côte et un routage en production.

GLM-5.3 vs GLM-5.2 en un coup d’œil

DimensionGLM-5.3GLM-5.2Gagnant / Remarques
Modèle de baseMême ~743–753B MoEMêmeIdentique
Post-entraînementEnvironnements fortement scalésPile antérieure5.3
Terminal-Bench 3.028.34.65.3 (important)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (perf + efficacité)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Contexte / Sortie max1M / 128K1M / similaireIdentique
RaisonnementToujours activé (low/high/max)Plus flexible auparavant5.3 (toujours activé)
Poids ouverts~2 semaines post-lancement (prévu)Disponibles (MIT)5.2 actuellement
Accès principal maintenantCoding Plan / ZCodeAPI + poids + Coding Plan5.2 plus mature

Introduction : le post-entraînement apporte un saut générationnel

À la mi-août 2026, la communauté IA a assisté à une nouvelle itération rapide dans la course aux poids ouverts. Z.ai (la vitrine internationale de l’ex-équipes Zhipu AI / ChatGLM) a lancé GLM-5.3 seulement 59 jours après GLM-5.2. L’annonce était inhabituelle par sa clarté : le modèle de base sous-jacent est resté identique. « Nous n’avons fait qu’augmenter l’échelle du post-entraînement pour GLM-5.3 », l’entreprise a déclaré.

Cette affirmation est importante. Pendant des années, le récit dominant a été « les modèles plus gros gagnent ». GLM-5.3 montre que l’augmentation agressive des environnements d’apprentissage par renforcement, de la diversité des tâches à long horizon et de l’infrastructure système peut produire des gains disproportionnés sur des charges de travail difficiles en codage, agentique et même cybersécurité, sans nouveau pré-entraînement. Les chiffres sont suffisamment élevés sur plusieurs benchmarks ardus pour que des observateurs indépendants décrivent le bond comme qualitativement différent plutôt qu’incrémental. Aperçu des fonctionnalités, benchmarks et modalités d’accès de GLM-5.3.

GLM-5.3 vs GLM-5.2 : qu’est-ce qui a vraiment changé ?

La plus grande idée reçue serait de penser que GLM-5.3 est simplement « GLM-5.2 en plus gros ».

Ce n’est pas le cas.

Le modèle de base reste essentiellement le même, selon Z.ai. La grande innovation est la mise à l’échelle du post-entraînement. Z.ai met en avant trois piliers :

  1. Améliorations systèmes dans slime — Meilleur entraînement
  2. Mise à l’échelle des environnements — Des pipelines qui synthétisent des environnements exécutables, vérifiables et à long horizon à partir de workflows professionnels réels. Des agents de recherche extraient des motifs de tâches ; des agents juges vérifient la solvabilité ; les vérificateurs sont construits sans accès aux solutions de référence pour réduire le détournement de récompense.
  3. Poursuite de l’usage de SAO + compaction — Aide les gains à persister sur de longues trajectoires plutôt que de s’effondrer sur des courtes. –cohérence des rollouts (différences de log-prob contrôlées à ~1e-7), cache hiérarchique, support multi-enseignants, planification sensible à la charge de travail, et gains rapportés >2.3× de débit bout en bout sur les tâches RL de codage à long horizon.

Ces changements ont produit des améliorations mesurables sur les suites de codage, d’agentique et de cybersécurité. Fait important, les gains relatifs les plus élevés apparaissent sur les tests les plus difficiles et aux baselines les plus basses — exactement le schéma attendu lorsqu’un modèle est poussé dans des régimes qu’il ne pouvait auparavant pas gérer de manière fiable.

Le résultat est une mise à niveau du modèle qui porte avant tout sur le comportement et la capacité, plutôt que simplement sur l’architecture.

GLM-5.3 vs GLM-5.2 : comparaison des fonctionnalités

1. Post-entraînement à l’échelle au lieu d’un nouveau modèle de base

Z.ai décrit le post-entraînement mis à l’échelle comme l’intégralité de la recette pour GLM-5.3. Des agents de recherche transforment des motifs issus du travail réel en tâches exécutables avec état caché et dépendances multi-étapes. Un agent juge vérifie que chaque tâche est solvable. Les vérificateurs sont créés sans voir la solution de référence, puis testés contre des états oracle, no-op et non résolus pour réduire les raccourcis de récompense.

Le système exige toujours une revue humaine, et Z.ai précise que la génération et la vérification d’environnements plus autonomes restent des travaux futurs. Cette réserve renforce la crédibilité de l’affirmation : il s’agit d’une grande chaîne d’entraînement, pas d’un prétendu basculement vers des environnements synthétiques pleinement auto-gouvernés.

2. Codage à long horizon plus robuste

GLM-5.3 progresse sur le travail au niveau dépôt, les tâches terminal, l’infrastructure de machine learning, l’optimisation des performances et la livraison logicielle multi-étapes. Sur Z.ai Code Bench, l’évaluation interne privée destinée à refléter des scénarios utilisateurs réalistes, Z.ai rapporte environ 50 % de performance en plus que GLM-5.2.

Le résultat en efficacité est aussi important que le score. En effort Max, GLM-5.3 atteint 34.5 % avec environ 75K tokens de sortie par tâche, contre 23.4 % et 96K pour GLM-5.2. Cela représente un gain qualitatif de 11,1 points tout en produisant ~22 % de tokens de sortie en moins. En effort High, GLM-5.3 atteint 31.4 % avec ~50K tokens, devant Claude Opus 4.8 à 29.5 % avec 120K dans le même graphique de première main. Claude Fable 5 restait plus haut à 39.5 % en effort Max.

3. Capacité de cybersécurité émergente

Z.ai a ajouté des environnements de découverte de vulnérabilités durant le post-entraînement. Selon le rapport de lancement, la capacité a dépassé la simple détection de failles isolées : le modèle a commencé à raisonner sur plusieurs étapes d’une chaîne d’exploitation.

Les scores publics montrent à la fois des progrès et des limites. GLM-5.3 mène le tableau comparatif de Z.ai sur CyberGym à 84.5, contre 77.2 pour GLM-5.2. Sur ExploitBench, il plus que double GLM-5.2, atteignant 54.4 contre 24.4, mais reste bien derrière Fable 5 à 78.0 et GPT-5.6 Sol à 76.5. Sur ExploitGym, il complète 105 tâches en budget normalisé de deux heures et 130 en six heures, contre 29 et 39 pour GLM-5.2 ; GPT-5.6 Sol et Fable 5 restent nettement devant.

Ces capacités sont duales. Les organisations devraient limiter l’accès au modèle, isoler les outils (sandbox), journaliser les actions, exiger une autorisation pour le scanning et garder un humain dans la boucle pour la validation et la divulgation des vulnérabilités.

4. Raisonnement toujours activé avec trois niveaux d’effort

GLM-5.3 supporte les efforts de raisonnement low, high et max. Contrairement à GLM-5.2, il ne supporte pas le raisonnement désactivé. Les intégrations existantes qui envoient thinking.type: "disabled" doivent changer la valeur en enabled avant de basculer l’ID de modèle, sinon, selon Z.ai, la requête échouera.

Utilisez low pour les éditions interactives et les transformations à faible risque, high pour des tâches significatives au niveau dépôt, et max pour le codage difficile ou l’analyse de sécurité. Les niveaux d’effort plus élevés doivent être évalués en termes de latence et de coût, car une réponse plus forte n’est pas automatiquement la plus économique.

5. Meilleur débit d’entraînement grâce à slime

GLM-5.3 continue d’utiliser slime, le framework open source de Z.ai avec Megatron côté entraînement et SGLang côté rollout. Z.ai signale des ajouts pour le masquage top-p, la distillation on-policy top-k et plein vocabulaire, le basculement d’enseignant, la mise en cache, et un alignement numérique plus serré entre entraînement et rollout. Le rapport de lancement indique que les différences moyennes de log-probabilité ont été contrôlées au niveau 1e-7, plus de 99.99 % plus bas que les configurations antérieures.

La planification et l’équilibrage sensibles à la charge de travail auraient amélioré le débit de RL bout en bout de plus de 2.3 fois sur les tâches de codage à long horizon. Il s’agit d’améliorations d’infrastructure d’entraînement plutôt que de garanties d’inférence côté utilisateur final, mais elles expliquent comment Z.ai a pu mettre à l’échelle des trajectoires plus longues et plus variées en un mois.

6. Poids ouverts retardés pour revue de sécurité

Z.ai qualifie GLM-5.3 de modèle à poids ouverts, mais les poids n’étaient pas téléchargeables le jour du lancement. L’entreprise indique qu’ils seront publiés deux semaines après le lancement, après évaluation et durcissement de sécurité. C’est une différence notable avec GLM-5.2, dont les poids sous licence MIT sont déjà sur Hugging Face.

Pour la plupart des équipes, le test via API hébergée reste la première étape pratique. Le modèle est grand, et des poids ouverts n’éliminent pas le coût du matériel d’inférence, de la quantification, du service, de la supervision ou des contrôles de sécurité.

GLM-5.3 vs GLM-5.2 : améliorations sur les benchmarks

Le tableau suivant utilise les données officielles de lancement de Z.ai. « Changement » est un calcul simple à partir des scores rapportés. Les pourcentages relatifs peuvent sembler spectaculaires lorsque la baseline GLM-5.2 est basse ; le changement absolu est donc également affiché.

BenchmarkGLM-5.2GLM-5.3Changement absoluChangement relatif
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, tâches 2 heures29105+76+262.1%
ExploitGym, tâches 6 heures39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE with tools54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Améliorations sur benchmarks : GLM-5.3 vs GLM-5.2 et concurrents

Tous les nombres ci-dessous sont fournis par le vendeur dans le billet officiel de Z.ai (avec des notes méthodologiques sur les harnais, longueurs de contexte et échantillonnage). Une vérification indépendante suivra une fois les poids et un accès plus large disponibles.

Benchmarks de codage

BenchmarkGLM-5.3GLM-5.2Notes / Concurrents
Terminal Bench 2.188.281.0Compétitif avec les meilleurs modèles fermés
Terminal Bench 3.028.34.6SOTA open source ; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Fort bond
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (interne, effort Max)~34.5% @ ~75K tokens~23.4% @ ~96K tokens~50 % d’amélioration globale en ressenti codage ; plus efficace

En effort High, GLM-5.3 a atteint 31.4 % de complétion avec ~50K tokens, dépassant Claude Opus 4.8 (29.5 % avec 120K tokens) sur le banc interne, tout en restant derrière Claude Fable 5 (39.5 % en Max).

Benchmarks de cybersécurité

BenchmarkGLM-5.3GLM-5.2Concurrents (approx.)
CyberGym84.5%77.2%Mythos 5 : 83.8 %, GPT-5.6 Sol : 83.6 % (SOTA)
ExploitBench54.4%24.4%Plus du double par rapport à avant ; modèles fermés plus hauts (Mythos 5 ~78 %, GPT-5.6 Sol ~76.5 %)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 toujours devant (181/247)

Les gains sont les plus importants plus haut dans la chaîne d’exploitation. En tests réels avec des équipes de sécurité chinoises, le modèle (sur la base des travaux de GLM-5.2) a identifié 2,436 vulnérabilités sur 269 projets, dont 1,097 de sévérité moyenne à élevée. Certaines failles remontaient à ~40 ans (la plus ancienne ~1981). Les découvertes sont suivies dans le registre public Z.ai Security Disclosure Ledger.

Benchmarks agentiques et autres

BenchmarkGLM-5.3GLM-5.2Notes
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Gain important
Agents’ Last Exam (ALE-CLI)28.523.8Compétitif open source
HLE w/ Tools62.554.7
GDPval-AA v217691508Couvre 44 professions

Ces résultats démontrent des progrès clairs sur des tâches professionnelles multi-étapes à long horizon.

Efficacité en tokens, modes de raisonnement et comportement pratique

Une amélioration discrète mais importante est l’efficacité en tokens. Sur le banc interne de code, des taux de complétion plus élevés arrivent avec moins de tokens de sortie. Cela compte pour le coût et la latence dans les boucles d’agents en production.

GLM-5.3 active toujours le raisonnement. Trois niveaux d’effort sont supportés : low, high et max (par défaut et recommandé pour le codage : max). La désactivation du raisonnement n’est plus supportée ; les applications qui fixaient auparavant thinking.type: "disabled" doivent migrer.

Le contexte reste solide à 1M tokens avec une sortie maximale jusqu’à 128K. L’architecture est inchangée par rapport à GLM-5.2, donc le dimensionnement matériel pour un futur auto-hébergement peut être estimé à partir de l’expérience GLM-5.2 (les empreintes quantifiées restent importantes étant donné le nombre total de paramètres).

Pour les développeurs souhaitant expérimenter immédiatement ou conserver de la flexibilité entre modèles, les passerelles unifiées sont utiles. CometAPI liste les modèles de la série GLM (y compris GLM-5.3 sous l’ID de modèle glm-5.3 au fur et à mesure de sa disponibilité) avec des points de terminaison compatibles OpenAI, des tarifs compétitifs, une facturation à l’usage, et la possibilité de basculer entre GLM-5.2, GLM-5.3 et des dizaines d’autres modèles ouverts et de pointe sans réécrire le code d’intégration. C’est particulièrement pratique pour l’A/B testing d’agents de codage, mesurer le coût réel par tâche réussie, et router le trafic selon la charge de travail.

Qui devrait passer à GLM-5.3 et comment évaluer

Les équipes construisant des agents de codage, de l’automatisation à long horizon, des workflows d’ingénierie à l’échelle dépôt, ou des outils de sécurité défensifs devraient prioriser l’évaluation. La combinaison de taux de complétion plus élevés, d’une meilleure efficacité en tokens sur des tâches complexes et d’une agenticité multi-étapes plus forte est significative.

Parcours d’évaluation recommandé :

  1. Exécutez les mêmes tâches internes (ou un harnais fixe) sur GLM-5.2 et GLM-5.3 (ou via Coding Plan) à niveaux d’effort équivalents.
  2. Mesurez non seulement le taux de réussite mais aussi les tokens, le temps mur et le taux d’intervention humaine.
  3. Utilisez une couche d’API unifiée telle que CometAPI pour garder la comparaison fluide et conserver l’option de repli ou de routage sélectif.
  4. Pour les charges sensibles à la sécurité, attendez les poids ouverts entièrement durcis et revoyez les pratiques de divulgation.

L’auto-hébergement deviendra attractif une fois les poids disponibles, en particulier pour les organisations qui exploitent déjà l’infrastructure GLM-5.2.

Conclusion : le post-entraînement comme nouveau front de mise à l’échelle

GLM-5.3 est l’une des démonstrations les plus nettes récentes montrant que l’échelle du post-entraînement — des environnements plus réalistes, une meilleure infrastructure RL et un compute soutenu sur de longues trajectoires — peut produire des bonds de capacité qui semblaient auparavant exiger de nouveaux modèles de base. Les gains en codage et agentique sont importants ; les résultats en cyber sont largement émergents et déjà compétitifs ou leaders sur les benchmarks orientés découverte.

Pour les praticiens, l’enseignement pratique est simple : testez le modèle sur vos charges réelles, mesurez le coût par résultat réussi plutôt que la position brute au leaderboard, et gardez l’intégration flexible. Des plateformes telles que CometAPI simplifient ce processus en offrant une clé unique, une interface compatible OpenAI, et une commutation facile à travers la série GLM et les modèles concurrents pendant que vous décidez du degré d’adoption des nouvelles capacités.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Aug 15, 2026
Dernière mise à jour Aug 17, 2026
1 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus