En bref
GLM-5.3-Flash est le modèle multimodal natif de Z.ai, priorisant l’efficacité, pour les agents de codage, les workflows visuels, les documents professionnels et les applications à long contexte. Son architecture hybride est conçue pour réduire le coût d’inférence tout en conservant de fortes capacités agentiques.
Z.ai annonce d’importants gains sur DeepSWE, Toolathlon, AutomationBench et GDPval-AA v2. Les poids ouverts sous licence MIT rendent également possible un déploiement privé pour les équipes disposant de l’infrastructure nécessaire.
Cas d'utilisation privilégiés : agents multimodaux à fort volume, travail sur des dépôts, usage du navigateur ou de l’ordinateur, codage visuel, production de documents, et autres workflows où de longues invites et des appels d’outils répétés rendent le coût des tokens déterminant.
Qu’est-ce que GLM-5.3-Flash ?
GLM-5.3-Flash est un modèle mixture-of-experts open-weight de Z.ai. Il contient 320B de paramètres au total et en active 18B par token, conservant un large pool d’experts sans payer le coût de calcul d’un modèle dense à chaque token.
« Flash » ne signifie pas une simple quantification ou distillation d’une autre version. Le modèle part d’une base multimodale nouvellement entraînée et adopte une architecture ainsi qu’une recette d’entraînement repensées. La compréhension visuelle native, un service long-contexte efficace et un coût de déploiement réduit sont des objectifs de conception fondamentaux.
Spécifications clés
| Spécification officielle | GLM-5.3-Flash |
|---|---|
| Type de modèle | Modèle multimodal natif mixture-of-experts |
| Paramètres totaux/actifs | 320B / 18B |
| Fenêtre de contexte | 1,048,576 tokens |
| Sortie maximale | Jusqu’à 131,072 tokens sur les routes API prises en charge |
| Entrée | Texte, images, vidéo et fichiers |
| Sortie | Texte |
| Attention | Attention hybride clairsemée et linéaire avec IndexPool |
| Raisonnement | Toujours activé ; niveaux d’effort faible, élevé et maximal |
| Poids ouverts | Oui, sous licence MIT |
| ID de modèle API | glm-5.3-flash |
Comment fonctionne GLM-5.3-Flash ?
Attention hybride clairsemée + linéaire
L’attention linéaire modélise efficacement les dépendances locales, tandis que l’attention clairsemée utilise un indexeur léger pour récupérer le contexte globalement pertinent. IndexPool compresse quatre vecteurs-clés d’indexeur en un avant la récupération clairsemée, réduisant la mémoire et la latence aux grandes longueurs de contexte.
Z.ai indique un calcul d’attention par couche plus faible et un cache KV plus petit par rapport à son architecture phare. Ces économies aident le modèle à supporter une fenêtre de contexte d’un million de tokens à des prix de token inhabituellement bas.

Image officielle : comparaison d’architecture et d’efficacité. Source : documentation officielle Z.ai
mHC et pré-entraînement multimodal
Le modèle adopte les Manifold-Constrained Hyper-Connections (mHC), une amélioration d’efficacité d’échelle qui complète la refonte de l’attention. L’entraînement utilise un corpus multimodal de 30T tokens, en faisant une nouvelle branche de modèle de base multimodal plutôt qu’une simple mise à jour post-entraînement.
Vision native dans la boucle agent
Le modèle peut utiliser un retour visuel dans un workflow itératif : observer une interface ou un artefact rendu, agir dessus, inspecter le résultat et réviser. Cela rend la vision utile pour l’implémentation frontend, l’usage du navigateur et de l’ordinateur, les livrables bureautiques, les workflows vidéo, les scènes 3D, la reconstruction CAO et le développement de jeux, et pas seulement pour une description d’image ponctuelle.
Performances de benchmark
Note méthodologique : les résultats ci-dessous sont rapportés par Z.ai. Les harnais d’évaluation, l’instrumentation d’agent, les politiques d’outils, la gestion du contexte et les délais peuvent modifier les résultats, de sorte que les scores représentent des tâches spécifiques plutôt qu’un classement universel des modèles.
Benchmarks officiels de Z.ai pour le code et les agents
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| AutomationBench | 48.8 | 26.2 | 41.0 |
| Agents' Last Exam | 26.3 | 20.4 | 27.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| GDPval-AA v2 | 1773 | 1504 | 1582 |

Image officielle : comparaison des benchmarks de codage et d’agents.
Les gains les plus importants par rapport à GLM-5.2 apparaissent sur DeepSWE, Toolathlon, AutomationBench et GDPval-AA v2. La matrice de lancement montre un gain de 22,6 points sur AutomationBench et de 269 Elo sur GDPval-AA v2. GLM-5.3-Flash est proche de Claude Opus 4.8 sur Terminal-Bench, le dépasse sur plusieurs tâches agentiques et est derrière sur HLE with Tools.
GLM-5.3-Flash vs GLM-5.3 vs GLM-5.2
Cette comparaison distingue GLM-5.3-Flash, axé en premier lieu sur l’efficacité, GLM-5.3, centré sur les capacités, et l’ancien modèle pour le code et les agents GLM-5.2.
| Dimension | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Stratégie principale | Modèle multimodal axé sur l’efficacité | Vaisseau amiral axé sur les capacités | Modèle antérieur pour le code et les agents |
| Lignée du modèle de base | Nouvelle base multimodale | Mise à niveau post-entraînement par rapport à la base précédente | Base de génération GLM-5 plus ancienne |
| Entrée multimodale native | Oui | Pas l’axe principal de la version | Pas l’axe principal de la version |
| Accent architectural | Attention hybride clairsemée + linéaire | Capacités maximales en texte, code et agents | Codage et agents à long horizon |
| Poids ouverts | Oui, MIT | Oui | Oui |
| Cas d’usage idéal | Agents multimodaux à fort volume | Capacités GLM maximales | Workflows de codage GLM établis |
Le choix pragmatique dépend de la charge de travail. GLM-5.3 reste l’option au plafond plus élevé lorsque la qualité de raisonnement ou d’ingénierie logicielle prime sur le prix. GLM-5.3-Flash est le choix par défaut le plus attractif lorsque la vision native, le déploiement ouvert et un coût d’exploitation réduit importent conjointement.
Tarification API : Z.ai vs CometAPI
| Usage | Prix catalogue Z.ai | Promotion de lancement Z.ai | Prix actuel CometAPI |
|---|---|---|---|
| Entrée | $0.15 / 1M | $0.075 / 1M | $0.06 / 1M |
| Entrée mise en cache | $0.03 / 1M | $0.015 / 1M | Non listé séparément |
| Sortie | $0.50 / 1M | $0.25 / 1M | $0.20 / 1M |
Tarification sensible au temps : la promotion de lancement à -50 % de Z.ai se termine à 24:00 le 9 septembre 2026 (UTC+8, heure de Singapour). Les prix CometAPI ci-dessus ont été vérifiés le 27 août 2026 et peuvent changer. Confirmez les prix en temps réel avant de budgéter en production.
Pendant la fenêtre de lancement, les prix d’entrée et de sortie listés par CometAPI sont inférieurs de 20 % aux tarifs promotionnels de Z.ai. La différence devient significative pour les agents longue durée qui appellent des outils à répétition, inspectent des sorties visuelles ou conservent de longues invites.
Que peut faire GLM-5.3-Flash ?
Codage visuel et développement frontend
Le modèle peut analyser des captures d’écran, inférer des composants partagés et des règles de design system, implémenter une application, la rendre, comparer le résultat à la référence, puis réviser la mise en page, la typographie, l’espacement, les couleurs, le recadrage et les interactions.
Utilisation du navigateur et de l’ordinateur
Lorsqu’une API structurée est indisponible, un agent peut raisonner sur des interfaces logicielles visibles, décider où cliquer ou taper, vérifier si l’action a réussi et adapter sa prochaine étape.
Documents bureautiques et professionnels
Z.ai met en avant des workflows PPTX, PDF, DOCX et XLSX. La boucle visuelle aide à détecter les débordements, les désalignements, les éléments qui se chevauchent, les styles incohérents et d’autres défauts que la génération uniquement textuelle ne peut pas fiablement capter.
Recherche et analyse financière
De vastes corpus de preuves peuvent être reliés à des rapports auditables, des conclusions sourcées, des modèles éditables et des hypothèses structurées. Les utilisateurs doivent néanmoins exiger la traçabilité des sources et distinguer les divulgations de l’analyse.
Vidéo, 3D, CAO et workflows de jeu
La multimodalité native prend en charge l’ingénierie visuelle itérative dans le montage vidéo, les scènes Blender, la CAO paramétrique et le développement de jeux. La valeur vient des rendus et inspections répétés plutôt que d’une étape de génération unique.
Poids ouverts et déploiement local
GLM-5.3-Flash dispose de poids officiels sur Hugging Face sous licence MIT. Les chemins de service pris en charge dans la fiche du modèle incluent SGLang, vLLM, TokenSpeed, Transformers, KTransformers et Unsloth.
Des poids ouverts ne rendent pas le déploiement trivial. Le point de contrôle publié fait environ 321B de paramètres, donc l’auto-hébergement requiert une mémoire d’accélérateur substantielle, un service distribué, une quantification ou une infrastructure d’inférence spécialisée. L’accès API hébergé peut rester plus économique sauf si la confidentialité, la personnalisation ou le contrôle de l’infrastructure justifient la charge.
Comment accéder à GLM-5.3-Flash
API Z.ai
L’ID de modèle officiel est glm-5.3-flash. Z.ai recommande temperature 1, top_p 0.95, reasoning_effort max et thinking activé. Les images sont transmises sous forme de blocs de contenu image_url.
CometAPI
GLM-5.3-Flash est disponible via CometAPI avec un workflow de chat-completions compatible OpenAI, permettant aux équipes de le tester aux côtés d’autres fournisseurs sans maintenir une intégration séparée pour chaque vendeur.
curl https://api.cometapi.com/v1/chat/completions \\ -H "Content-Type: application/json" \\ -H "Authorization: Bearer YOUR_COMETAPI_KEY" \\ -d '{ "model": "glm-5.3-flash", "messages": [ {"role": "user", "content": "Explain hybrid attention in three bullets."} ] }'
Prochaine étape : ouvrez la page du modèle GLM-5.3-Flash, confirmez le prix et la disponibilité actuels, et testez une charge de travail représentative avant de modifier l’acheminement de production.
Verdict final
GLM-5.3-Flash modifie davantage le compromis coût-capacité que le plafond absolu des benchmarks. La multimodalité native, le support long-contexte, des poids ouverts, de solides résultats d’agent et des prix de token bas en font une option convaincante pour des systèmes à fort volume restant actifs sur de nombreuses étapes.
Choisissez un modèle phare plus haut de gamme lorsque la qualité de raisonnement maximale importe quel qu’en soit le coût. Testez un modèle multimodal concurrent lorsque la perception large d’images ou de vidéos est l’exigence principale. Choisissez GLM-5.3-Flash lorsque des agents multimodaux, un déploiement ouvert et une efficacité opérationnelle doivent coexister.
FAQ
GLM-5.3-Flash est-il open source ?
La description précise est open-weight. GLM-5.3-Flash a des poids publiés sous licence MIT, permettant un déploiement auto-hébergé et une large réutilisation.
GLM-5.3-Flash est-il adapté aux agents de codage ?
GLM-5.3-Flash affiche de bons résultats de lancement sur Terminal-Bench 2.1, DeepSWE, Toolathlon, AutomationBench et GDPval-AA v2. Les équipes devraient le valider dans leur propre pile d’agents, car les outils et l’orchestration affectent le résultat final.
Combien coûte GLM-5.3-Flash ?
GLM-5.3-Flash est listé par Z.ai à $0.15 par million de tokens d’entrée, $0.03 par million de tokens d’entrée mis en cache et $0.50 par million de tokens de sortie. Des tarifs promotionnels temporaires et revendeurs figurent dans la section tarification ci-dessus.
GLM-5.3-Flash peut-il être déployé localement ?
Oui. GLM-5.3-Flash dispose de poids publics et d’un support sur plusieurs frameworks de service, mais le point de contrôle requiert une infrastructure d’inférence conséquente. L’accès API hébergé peut rester plus économique, sauf si la confidentialité, la personnalisation ou le contrôle de l’infrastructure justifient la charge.
