
GLM-5, lançado em 11 de fevereiro de 2026 pela Zhipu AI (Z.ai), representa um grande salto arquitetural em relação ao GLM-4.7: escala de MoE maior (≈744B vs ~355B parâmetros totais), maior capacidade de parâmetros ativos, menor alucinação mensurada e ganhos claros em benchmarks de agentes e de codificação — ao custo de complexidade de inferência e (às vezes) latência.

GLM-4.7-Flash é um membro 30B A3B MoE leve e de alto desempenho da família GLM-4.7, projetado para viabilizar a implantação local e de baixo custo para programação, fluxos de trabalho baseados em agentes e raciocínio geral. Você pode executá-lo localmente de três maneiras práticas: (1) via Ollama (simples, ambiente de execução local gerenciado), (2) via Hugging Face / Transformers / vLLM / SGLang (implantação de servidor com foco em GPU) ou (3) via GGUF + llama.cpp / llama-cpp-python (adequado para CPU/dispositivos de borda).

Em 22 de dezembro de 2025, Zhipu AI (Z.ai) lançou oficialmente o GLM-4.7, a versão mais recente de sua família de Modelos de Linguagem Geral (GLM) — atraindo a atenção global no mundo dos modelos de IA de código aberto. Este modelo não apenas aprimora as capacidades em tarefas de programação e raciocínio, como também desafia o domínio de modelos proprietários como GPT-5.2 e Claude Sonnet 4.5 nos principais benchmarks.