
GLM-5, dirilis pada 11 Februari 2026 oleh Zhipu AI (Z.ai), mewakili lompatan arsitektural besar dari GLM-4.7: skala MoE lebih besar (≈744B vs ~355B jumlah parameter total), kapasitas parameter aktif lebih tinggi, halusinasi terukur lebih rendah, dan peningkatan jelas pada benchmark agentic dan pemrograman — dengan biaya pada kompleksitas inferensi dan (kadang-kadang) latensi.

GLM-4.7-Flash adalah anggota 30B A3B MoE yang ringan dan berkinerja tinggi dari keluarga GLM-4.7, dirancang untuk memungkinkan penyebaran lokal dan berbiaya rendah untuk pemrograman, alur kerja berbasis agen, dan penalaran umum. Anda dapat menjalankannya secara lokal dengan tiga cara praktis: (1) melalui Ollama (mudah, runtime lokal terkelola), (2) melalui Hugging Face / Transformers / vLLM / SGLang (penyebaran server yang mengutamakan GPU), atau (3) melalui GGUF + llama.cpp / llama-cpp-python (ramah CPU/perangkat tepi).

Pada 22 Desember 2025, Zhipu AI (Z.ai) secara resmi merilis GLM-4.7, iterasi terbaru dalam keluarga General Language Model (GLM) — menarik perhatian global di dunia model AI sumber terbuka. Model ini tidak hanya meningkatkan kemampuan dalam tugas pemrograman dan penalaran, tetapi juga menantang dominasi model berpemilik seperti GPT-5.2 dan Claude Sonnet 4.5 dalam tolok ukur kunci.