Spécifications techniques de GLM-5.3
| Spécification | GLM-5.3 |
|---|---|
| Développeur | Z.ai / Zhipu AI |
| Publication | 14 août 2026 |
| Type de modèle | Modèle fondamental phare |
| Entrée | Texte |
| Sortie | Texte |
| Fenêtre de contexte | 1,000,000 tokens |
| Sortie maximale | 128,000 tokens |
| Raisonnement | Modes multiples |
| Diffusion en continu | Oui |
| Appel de fonctions | Oui |
| Sortie structurée | Oui |
| Mise en cache du contexte | Oui |
| MCP | Oui |
| Applications principales | Programmation, agents, ingénierie, cybersécurité |
Les dépôts publics de modèles de Z.ai affichent toujours de manière bien visible GLM-5.2, et non un artefact GLM-5.3 téléchargeable, de sorte que les spécifications qui n'ont pas encore été publiées doivent rester explicitement marquées comme non confirmées.
Qu'est-ce que GLM-5.3 ?
GLM-5.3 est la dernière génération de la famille GLM de Z.ai et marque une évolution vers des systèmes d'IA capables d'exécuter de manière autonome des tâches complexes de sécurité et d'ingénierie.
L'annonce est particulièrement notable car la cybersécurité n'est pas simplement présentée comme une autre catégorie de benchmark. Z.ai utilise GLM-5.3 pour démontrer un système d'IA capable de découvrir des vulnérabilités logicielles et de participer à des workflows de développement d'attaques.
Reuters rapporte que Z.ai prévoit de publier le modèle publiquement après avoir achevé les évaluations de sécurité, tandis que des capacités plus avancées seront initialement restreintes via un mécanisme d'accès de confiance.
Ceci constitue un changement d'accent significatif par rapport à GLM-5.2.
GLM-5.2 était principalement positionné autour de l'ingénierie logicielle à long horizon et du codage agentique. La page de recherche de Z.ai de juin décrit GLM-5.2 comme « Conçu pour les tâches à long horizon ».
GLM-5.3 transpose cette philosophie agentique dans un domaine nettement plus sensible :
ingénierie logicielle → découverte de vulnérabilités → cyberdéfense → sécurité offensive contrôlée
Quelles sont les principales fonctionnalités de GLM-5.3 ?
Raisonnement centré sur la cybersécurité
La capacité phare est la cybersécurité.
GLM-5.3 a atteint :
84.5 % sur CyberGym
CyberGym évalue la capacité d'un système d'IA à identifier des vulnérabilités logicielles. Le résultat dépasse légèrement les 83.8 % rapportés de Mythos 5.
C'est important, car la cybersécurité exige plus que la génération de code syntaxiquement correct.
Un agent de sécurité compétent doit :
- Comprendre du code inconnu.
- Identifier les surfaces d'attaque.
- Formuler des hypothèses sur des vulnérabilités.
- Tracer les flux de données et de contrôle.
- Valider l'hypothèse.
- Développer une preuve de concept appropriée.
- Déterminer si la vulnérabilité est effectivement exploitable.
Le score CyberGym de GLM-5.3 suggère des progrès significatifs sur la première partie de cette chaîne.
Solide découverte de vulnérabilités
Le score CyberGym de 84.5 % est sans doute le résultat précoce le plus impressionnant.
Il place GLM-5.3 légèrement devant Mythos 5 sur l'identification des vulnérabilités :
| Modèle | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
La marge n'est que de 0.7 point de pourcentage, il serait donc trompeur de décrire GLM-5.3 comme nettement supérieur.
Le point le plus intéressant est qu'un modèle à poids ouverts de Z.ai entre dans le même ordre de grandeur de performances qu'un système de cybersécurité fortement restreint.
Le développement d'exploits reste une faiblesse
GLM-5.3 ne domine pas toutes les tâches de cybersécurité.
Sur ExploitBench :
| Modèle | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
C'est un écart de 23.6 points.
Cela révèle une distinction importante :
Trouver une vulnérabilité n'est pas la même chose que l'exploiter de manière fiable.
GLM-5.3 semble très performant pour identifier des faiblesses, mais les premiers résultats indiquent que convertir ces constats en un développement d'exploits fiable reste nettement plus difficile.
Pour les équipes de sécurité d'entreprise, cela rend en fait le modèle intéressant en tant qu'assistant d'analyse de vulnérabilités à des fins défensives, plutôt que simplement un moteur d'automatisation offensive.
GLM-5.3 vs GLM-5.2
GLM-5.2 fournit la référence confirmée la plus utile.
| Fonctionnalité | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Statut | Publié | Annoncé |
| Positionnement principal | Agents à long horizon | Cybersécurité + agents |
| Programmation | Excellent | Devrait rester solide |
| Cybersécurité | Fort potentiel | Focalisation phare explicite |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Contexte | 1M | Non confirmé |
| Paramètres | ~753B | Non confirmé |
| Licence | MIT | Poids ouverts annoncés |
| Tarification API | Publiée | Pas encore publiée |
| Poids publics | Disponibles | Prévus |
L'architecture confirmée de GLM-5.2 est d'environ 753B paramètres, et son catalogue public de modèles répertorie toujours le modèle 753B et la version FP8.
GLM-5.2 a également atteint 81.0 sur Terminal-Bench 2.1 et 62.1 sur SWE-bench Pro selon des rapports de tiers se fondant sur les documents d'évaluation de modèles de Z.ai.
Mais ces chiffres doivent rester des benchmarks de GLM-5.2, et ne pas être attribués à GLM-5.3.
GLM-5.3 vs Mythos 5
C'est actuellement la comparaison de benchmark la plus significative.
| Benchmark | GLM-5.3 | Mythos 5 | Différence |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Le résultat conduit à une conclusion nuancée.
GLM-5.3 l'emporte sur l'identification des vulnérabilités.
Mais :
Mythos 5 reste nettement plus fort sur le développement d'exploits.
Par conséquent, dire "GLM-5.3 bat Mythos 5" serait une interprétation inexacte des données disponibles.
Une meilleure description est :
GLM-5.3 atteint un niveau de performances proche de Mythos 5 sur la découverte de vulnérabilités tout en restant derrière sur le développement d'exploits.
C'est bien plus défendable et plus utile pour les développeurs.