
GLM-5, выпущенная 11 февраля 2026 года компанией Zhipu AI (Z.ai), представляет собой крупный архитектурный скачок по сравнению с GLM-4.7: более крупный масштаб MoE (≈744B против ~355B общего числа параметров), более высокая емкость активных параметров, ниже измеренный уровень галлюцинаций и заметные улучшения на агентных и программных бенчмарках — ценой усложнения инференса и (иногда) задержки.

GLM-4.7-Flash — легковесная, высокопроизводительная MoE-модель 30B A3B из семейства GLM-4.7, предназначенная для локального и малозатратного развертывания при решении задач программирования, агентных рабочих процессов и общих рассуждений. Ее можно запускать локально тремя практичными способами: (1) через Ollama (простой управляемый локальный рантайм), (2) через Hugging Face / Transformers / vLLM / SGLang (серверное развертывание, ориентированное на GPU) или (3) через GGUF + llama.cpp / llama-cpp-python (подходит для CPU и edge).

22 декабря 2025 года компания Zhipu AI (Z.ai) официально выпустила GLM-4.7 — новейшую итерацию своего семейства General Language Model (GLM), привлекшую мировой интерес в сфере моделей ИИ с открытым исходным кодом. Эта модель не только улучшает возможности в задачах программирования и рассуждения, но и бросает вызов доминированию проприетарных моделей, таких как GPT-5.2 и Claude Sonnet 4.5, в ключевых эталонных тестах.