Spécifications techniques de GLM-4.6V-Flash
| Élément | |
|---|---|
| Famille de modèles | Famille de modèles multimodaux GLM-4.6V |
| Positionnement | Modèle multimodal gratuit et léger |
| Modèle | GLM-4.6V-Flash |
| Nom dans CometAPI | glm-4.6v-flash-free |
| Types d'entrée | Vidéo, image, texte, fichier |
| Type de sortie | Texte |
| Fenêtre de contexte | 128K tokens |
| Réflexion | Peut être activée ou désactivée |
| Appels de fonctions | Prise en charge native des appels de fonctions |
| Langues | Chinois et anglais |
| Modèle open source | zai-org/GLM-4.6V-Flash sur Hugging Face ; licence MIT |
Qu’est-ce que GLM-4.6V-Flash(Free) ?
GLM-4.6V-Flash est la version gratuite de GLM-4.6V de Z.ai. CometAPI propose également un accès gratuit ; l’ID est glm-4.6v-flash-free. Il s’agit d’un modèle multimodal léger conçu pour combiner compréhension visuelle, raisonnement et utilisation d’outils. Le modèle accepte des vidéos, des images, du texte et des fichiers, produit du texte, prend en charge une fenêtre de contexte de 128K tokens et permet d’activer ou de désactiver le mode de réflexion approfondie. Z.ai décrit également la prise en charge native des appels de fonctions comme une caractéristique architecturale clé permettant de relier la perception visuelle à des actions exécutables.
Principales fonctionnalités de GLM-4.6V Flash(Free)
- Contexte multimodal 128K : Le modèle est entraîné pour une fenêtre de contexte de 128K tokens et peut traiter de longues entrées multimodales, comme des documents et des vidéos, en plus du texte.
- Compréhension d’images, de vidéos, de fichiers et de texte : Les entrées ne se limitent pas au texte ; GLM-4.6V-Flash est conçu pour comprendre conjointement les informations visuelles et textuelles.
- Appels de fonctions natifs : Les appels de fonctions sont intégrés au modèle de vision, permettant aux entrées visuelles de participer à des workflows orientés outils plutôt que d’être uniquement traitées comme du contenu descriptif.
- Réflexion configurable : Le mode de réflexion approfondie peut être activé ou désactivé, offrant un compromis pratique entre profondeur de raisonnement et comportement de réponse.
- Compréhension multimodale de documents : Le modèle peut interpréter des pages richement formatées, incluant texte, mises en page, graphiques, tableaux et figures, dans des workflows à long contexte.
- Codage visuel et workflows d’agents : La famille GLM-4.6V prend en charge la reconstruction/l’édition de front-end pilotée par des captures d’écran et des scénarios d’agents multimodaux ; la variante Flash est positionnée comme le membre léger de la famille.
Performances de référence de GLM-4.6V-Flash (Free)
La fiche modèle publiée indique les résultats d’évaluation suivants : MMBench V1.1 86,9, MMStar 74,7, MMMU (Val) 71,1, MMMU-Pro 60,6, VideoMMU 70,1, MathVista 82,7, AI2D 89,2, OCRBench 84,7, Design2Code 69,8 et MMLongBench-128K 63,4. Ces chiffres sont rapportés par l’éditeur/la fiche modèle et doivent être interprétés conjointement avec les versions spécifiques des benchmarks et les paramètres d’évaluation.
Z.ai indique que le GLM-4.6V-Flash de 9B dépasse globalement Qwen3-VL-8B dans sa comparaison d’évaluations multimodales rapportée. La même documentation présente le modèle GLM-4.6V complet comme un modèle plus grand de 106B, tandis que GLM-4.6V-Flash est la variante légère/gratuite.
GLM-4.6V-Flash vs GLM-4.6V vs GLM-4.6V-FlashX
| Modèle | Positionnement | Contexte | Cas d’utilisation recommandés |
|---|---|---|---|
| GLM-4.6V-Flash | Gratuit, léger | 128K | Applications multimodales sensibles aux coûts, prototypage, workflows locaux/open-model |
| GLM-4.6V-FlashX | Léger, haute vitesse | 128K | Workloads multimodaux de production à plus grande vitesse |
| GLM-4.6V | Porte-étendard haute performance | 128K | Workloads d’agents et de raisonnement multimodal plus exigeants |
Cas d’usage de GLM-4.6V-Flash
GLM-4.6V-Flash est particulièrement pertinent pour les applications qui nécessitent une compréhension visuelle sans s’appuyer sur un modèle uniquement textuel : analyse de documents et de graphiques, workflows orientés OCR, compréhension de captures d’écran, questions-réponses vidéo, ancrage visuel, assistance au codage multimodal et agents activés par des outils.
Limitations et considérations de GLM-4.6V-Flash
Ce modèle est le membre léger de 9B de la famille GLM-4.6V, il ne doit donc pas être automatiquement considéré comme équivalent au porte-étendard GLM-4.6V plus grand. Les scores de benchmark varient également selon la tâche et le protocole d’évaluation. Pour les décisions de production, testez les entrées exactes, le flux d’appels d’outils, la latence et les contraintes de sortie de l’application visée, plutôt que de vous fier uniquement à des classements agrégés de benchmarks.
Comment utiliser l’API GLM-4.6V-Flash sur CometAPI
Comme CometAPI utilise une interface compatible avec OpenAI, vous pouvez appeler glm-4.6v-flash-free avec le même schéma de base que le SDK OpenAI. L’URL de base documentée de CometAPI est https://api.cometapi.com/v1, et son endpoint REST est /v1/chat/completions.
Étape 1 : Obtenir une clé API CometAPI
Connectez-vous d’abord à votre compte CometAPI. Si vous n’en avez pas encore, inscrivez-vous sur CometAPI. Après connexion, ouvrez la page de gestion des jetons API et créez une nouvelle clé API. Copiez la clé générée et conservez-la en sécurité, car elle servira à authentifier vos requêtes API.
Étape 2 : Sélectionner le modèle GLM-4.6V-Flash
Lors de la création d’une requête API, spécifiez l’ID de modèle CometAPI glm-4.6v-flash-free. Il s’agit de l’identifiant spécifique à CometAPI pour la version gratuite de GLM-4.6V-Flash.
Le modèle prend en charge les requêtes multimodales ; vous pouvez donc l’utiliser pour des tâches impliquant du texte, des images et d’autres entrées visuelles prises en charge.
Étape 3 : Configurer la requête API
Envoyez votre requête à l’endpoint de complétions de chat de CometAPI. Authentifiez la requête avec votre clé API CometAPI et définissez le champ model sur glm-4.6v-flash-free.
Dans le contenu de la requête, fournissez l’instruction que vous voulez que GLM-4.6V-Flash traite. Pour une requête uniquement textuelle, fournissez un prompt texte normal. Pour une analyse visuelle, incluez l’image avec votre instruction textuelle afin que le modèle puisse comprendre à la fois l’information visuelle et la question.
Étape 4 : Envoyer la requête
Soumettez la requête configurée à CometAPI. CometAPI transmet la requête à GLM-4.6V-Flash et renvoie la réponse du modèle via l’API.
La réponse contient le contenu généré et les informations associées. Votre application peut ensuite extraire la réponse du modèle et l’afficher à l’utilisateur ou poursuivre son traitement par programmation.
Étape 5 : Traiter et vérifier la réponse
Après réception de la réponse, analysez le contenu renvoyé et utilisez-le dans votre application. Pour les applications multimodales, vérifiez que l’interprétation par le modèle de l’image fournie ou d’un autre contenu visuel correspond aux exigences de votre workflow.
Pour des applications en production, gérez également les erreurs d’API, les délais d’expiration des requêtes et les réponses invalides, afin que votre application puisse se rétablir correctement lorsqu’une requête ne peut pas être complétée.
Pour les requêtes CometAPI, utilisez :
glm-4.6v-flash-free
Cet ID de modèle est différent du nom du modèle sous-jacent chez le fournisseur. Assurez-vous que votre requête utilise exactement l’ID de modèle CometAPI tel qu’indiqué.