Especificações técnicas do GLM-4.6V-Flash
| Item | |
|---|---|
| Model family | Família de modelos GLM-4.6V multimodal |
| Positioning | Modelo multimodal gratuito e leve |
| Model | GLM-4.6V-Flash |
| CometAPI listing name | glm-4.6v-flash-free |
| Input types | Vídeo, imagem, texto, arquivo |
| Output type | Texto |
| Context window | 128K tokens |
| Thinking | Pode ser ativado ou desativado |
| Function calling | Suporte nativo a chamadas de função |
| Languages | Chinês e inglês |
| Open-source model | zai-org/GLM-4.6V-Flash no Hugging Face; licença MIT |
O que é o GLM-4.6V-Flash (Gratuito)?
GLM-4.6V-Flash é a versão gratuita do GLM-4.6V da Z.ai. A CometAPI também oferece uso gratuito; o ID é glm-4.6v-flash-free. É um modelo multimodal leve, projetado para combinar compreensão visual com raciocínio e uso de ferramentas. O modelo aceita vídeo, imagens, texto e arquivos, produz texto, suporta uma janela de contexto de 128K tokens e pode alternar o modo de pensamento profundo ligado ou desligado. A Z.ai também descreve o suporte nativo a Function Call como um recurso arquitetural chave para conectar a percepção visual a ações executáveis.
Principais recursos do GLM-4.6V Flash(Gratuito)
- Contexto multimodal de 128K: O modelo foi treinado para uma janela de contexto de 128K tokens e pode processar entradas longas e multimodais, como documentos e vídeos, juntamente com texto.
- Compreensão de imagem, vídeo, arquivo e texto: As entradas não se limitam a texto comum; o GLM-4.6V-Flash foi projetado para entender conjuntamente informações visuais e textuais.
- Chamada de função nativa: A chamada de função está integrada ao modelo de visão, permitindo que entradas visuais participem de fluxos de trabalho orientados a ferramentas, em vez de serem tratadas apenas como conteúdo descritivo.
- Pensamento configurável: O modo de pensamento profundo pode ser ativado ou desativado, oferecendo um equilíbrio prático entre profundidade de raciocínio e comportamento de resposta.
- Compreensão multimodal de documentos: O modelo pode interpretar páginas ricamente formatadas, incluindo texto, layouts, gráficos, tabelas e figuras, dentro de fluxos de trabalho de longo contexto.
- Codificação visual e fluxos de agentes: A família GLM-4.6V suporta reconstrução/edição de front-end orientada por capturas de tela e cenários de agentes multimodais; a variante Flash é posicionada como o membro leve da família.
Desempenho em benchmarks do GLM-4.6V-Flash (Gratuito)
O model card publicado relata os seguintes resultados de avaliação: MMBench V1.1 86.9, MMStar 74.7, MMMU (Val) 71.1, MMMU-Pro 60.6, VideoMMU 70.1, MathVista 82.7, AI2D 89.2, OCRBench 84.7, Design2Code 69.8 e MMLongBench-128K 63.4. Esses valores são relatados pelo publicador/model card do modelo e devem ser interpretados juntamente com as versões específicas dos benchmarks e configurações de avaliação.
A Z.ai afirma que o GLM-4.6V-Flash de 9B supera o Qwen3-VL-8B no geral em sua comparação relatada de avaliação multimodal. A mesma documentação posiciona o GLM-4.6V completo como um modelo maior de 106B, enquanto o GLM-4.6V-Flash é a variante leve/gratuita.
GLM-4.6V-Flash vs GLM-4.6V vs GLM-4.6V-FlashX
| Model | Positioning | Context | Best fit |
|---|---|---|---|
| GLM-4.6V-Flash | Gratuito, leve | 128K | Aplicações multimodais sensíveis a custo, prototipagem, fluxos de trabalho com modelos locais/abertos |
| GLM-4.6V-FlashX | Leve, alta velocidade | 128K | Cargas de produção multimodais com maior velocidade |
| GLM-4.6V | Carro-chefe de alto desempenho | 128K | Cargas de trabalho de raciocínio multimodal e agentes mais exigentes |
Casos de uso do GLM-4.6V-Flash
GLM-4.6V-Flash é particularmente relevante para aplicações que precisam de compreensão visual sem depender de um modelo apenas de texto: análise de documentos e gráficos, fluxos de trabalho orientados a OCR, compreensão de capturas de tela, perguntas e respostas sobre vídeo, grounding visual, assistência de codificação multimodal e agentes habilitados por ferramentas.
Limitações e considerações do GLM-4.6V-Flash
O modelo é o membro leve de 9B da família GLM-4.6V, portanto, não deve ser automaticamente tratado como equivalente ao maior GLM-4.6V carro-chefe. As pontuações de benchmarks também variam por tarefa e protocolo de avaliação. Para decisões de produção, teste as entradas exatas, o fluxo de chamadas de ferramentas, a latência e as restrições de saída da aplicação pretendida, em vez de depender apenas de classificações agregadas de benchmarks.
Como usar a API do GLM-4.6V-Flash na CometAPI
Como a CometAPI usa uma interface compatível com OpenAI, você pode chamar glm-4.6v-flash-free com o mesmo padrão básico do SDK da OpenAI. A URL base documentada da CometAPI é https://api.cometapi.com/v1, e seu endpoint REST é /v1/chat/completions.
Step 1: Get a CometAPI API Key
Primeiro, faça login na sua conta da CometAPI. Se você ainda não tem uma conta, registre-se na CometAPI. Após fazer login, abra a página de gerenciamento de tokens de API e crie uma nova chave de API. Copie a chave gerada e mantenha-a segura, pois ela será usada para autenticar suas requisições de API.
Step 2: Select the GLM-4.6V-Flash Model
Ao criar uma requisição de API, especifique o ID de modelo da CometAPI glm-4.6v-flash-free. Este é o identificador específico da CometAPI para a versão gratuita do GLM-4.6V-Flash.
O modelo suporta requisições multimodais, portanto, você pode usá-lo para tarefas envolvendo texto, imagens e outras entradas visuais suportadas.
Step 3: Configure the API Request
Envie sua requisição para o endpoint de chat completions da CometAPI. Autentique a requisição com sua chave de API da CometAPI e defina o campo model como glm-4.6v-flash-free.
No conteúdo da requisição, forneça a instrução que você deseja que o GLM-4.6V-Flash processe. Para uma requisição apenas de texto, forneça um prompt de texto normal. Para análise visual, inclua a imagem junto com sua instrução em texto, para que o modelo possa entender tanto as informações visuais quanto a pergunta.
Step 4: Send the Request
Envie a requisição configurada para a CometAPI. A CometAPI encaminha a requisição para o GLM-4.6V-Flash e retorna a resposta do modelo pela API.
A resposta contém o conteúdo gerado e as informações associadas à resposta. Seu aplicativo pode então extrair a resposta do modelo e exibi-la ao usuário ou continuar processando-a programaticamente.
Step 5: Process and Verify the Response
Após receber a resposta, analise o conteúdo retornado e use-o em seu aplicativo. Para aplicações multimodais, verifique se a interpretação do modelo da imagem fornecida ou de outro conteúdo visual corresponde aos requisitos do seu fluxo de trabalho.
Para aplicações em produção, trate também erros de API, timeouts de requisição e respostas inválidas, para que seu aplicativo possa se recuperar graciosamente quando uma requisição não puder ser concluída.
Para requisições na CometAPI, use:
glm-4.6v-flash-free
Este ID de modelo é diferente do nome do modelo subjacente do provedor. Certifique-se de que sua requisição usa exatamente o ID de modelo da CometAPI conforme fornecido.