Thông số kỹ thuật của GLM-5.1
| Thông số | Chi tiết |
|---|---|
| Nhà phát triển | Z.ai (Zhipu AI) |
| Phiên bản mô hình | GLM-5.1 (tinh chỉnh sau huấn luyện của GLM-5) |
| Kiến trúc | Mixture-of-Experts (MoE); ~744–754 tỷ tham số tổng, ~40 tỷ hoạt động trên mỗi token; tích hợp Multi-head Latent Attention và DeepSeek Sparse Attention để hiệu quả với ngữ cảnh dài |
| Độ dài ngữ cảnh | 200K–203K token (tối đa 202,752–204.8K trong một số cấu hình) |
| Số token đầu ra tối đa | 128K token |
| Chế độ dữ liệu | Chỉ văn bản (vào/ra); không hỗ trợ thị giác hoặc âm thanh gốc |
| Khả năng chính | Chế độ tư duy, phát trực tuyến đầu ra, gọi hàm/sử dụng công cụ (tích hợp MCP), lưu đệm ngữ cảnh, đầu ra JSON có cấu trúc |
| Giấy phép | MIT (trọng số mã nguồn mở hoàn toàn) |
| Tùy chọn triển khai | API chính thức, suy luận cục bộ (vLLM, SGLang), Hugging Face / ModelScope |
| Phần cứng huấn luyện | Chip Huawei Ascend (không phụ thuộc Nvidia) |
GLM-5.1 là gì
GLM-5.1 là mô hình ngôn ngữ đẳng cấp tiên phong của Z.ai, được tối ưu cho các nhiệm vụ tự động dài hạn. Không giống các LLM truyền thống vốn mạnh ở tương tác ngắn, một lượt, mô hình này được thiết kế cho các vòng lặp thực thi bền vững—lập kế hoạch, viết mã, kiểm thử, benchmarking, gỡ lỗi và tối ưu hóa lặp—trong thời gian dài mà không cần can thiệp của con người.
Tính năng chính của GLM-5.1
1. Công việc tự động dài hạn
Thực thi liên tục trong 8 giờ: GLM-5.1 là mô hình chủ lực mới nhất của Z.AI cho các nhiệm vụ dài hạn, và tài liệu chính thức cho biết mô hình có thể làm việc liên tục và tự động trên một tác vụ trong tối đa 8 giờ. Mô hình được định vị để xử lý toàn bộ vòng lặp từ lập kế hoạch và thực thi đến tối ưu hóa lặp và bàn giao cuối cùng.
Tối ưu hóa vòng kín: Một tính năng cốt lõi của GLM-5.1 là khả năng liên tục lặp qua chu trình “thử nghiệm → phân tích → tối ưu hóa” thay vì dừng ở đầu ra một lần. Z.AI mô tả đây là một bước tiến lớn hướng tới kỹ thuật tự động và các tác nhân lập trình dài hạn.
2. Khả năng lập trình và lập luận mạnh
Cân bằng năng lực rộng: GLM-5.1 nhìn chung tương đồng với Claude Opus 4.6 về năng lực tổng thể và hiệu năng lập trình, đồng thời thể hiện hồ sơ cân bằng trên các benchmark về lập luận, lập trình, tác nhân, sử dụng công cụ và duyệt web.
Quy trình kỹ thuật nâng cao: GLM-5.1 được thiết kế cho quy trình phát triển thực tế, bao gồm tối ưu hóa kỹ thuật phức tạp, gỡ lỗi và bàn giao cấp độ sản xuất. Z.AI định vị nó như nền tảng cho các tác nhân tự động và tác nhân lập trình dài hạn.
3. Hỗ trợ tốt hơn cho các tác vụ phức tạp
Ngữ cảnh và đầu ra lớn hơn: Hướng dẫn di trú liệt kê độ dài ngữ cảnh tối đa của GLM-5.1 là 200K và đầu ra tối đa là 128K, giúp phù hợp hơn với các tác vụ lớn và phiên làm việc kéo dài.
Suy nghĩ sâu và phát trực tuyến công cụ: GLM-5.1 hỗ trợ chế độ suy nghĩ sâu, và Z.AI cũng bổ sung phát trực tuyến đầu ra trong khi gọi công cụ với tool_stream=true, giúp hiển thị tham số cuộc gọi công cụ theo thời gian thực.
4. Xây dựng cho Agentic Engineering
Từ tạo mã đến bàn giao tự động: Định vị của Z.AI đối với GLM-5.1 không chỉ là “tạo mã” mà là “bàn giao công việc kỹ thuật”. Tài liệu mô tả đây là mô hình chủ lực thế hệ mới cho “Agentic Engineering”, nhấn mạnh lập kế hoạch, thực thi, tối ưu hóa và bàn giao trong một quy trình.
Độ ổn định cao hơn cho tác vụ dài: Ghi chú phát hành cho biết GLM-5.1 cải thiện độ ổn định, tính nhất quán và khả năng dùng công cụ trong các tác vụ kéo dài, được hỗ trợ bởi SFT nhiều lượt, RL và đánh giá chất lượng quy trình.
GLM-5.1 so với các mô hình khác
GLM-5.1 nổi bật như một trong những lựa chọn mã nguồn mở mạnh nhất và là đối thủ trực tiếp của các mô hình tiên phong đóng trong các kịch bản lập trình và tác nhân:
- so với Claude Opus 4.6: ~94–100% hiệu năng lập trình trên SWE-Bench Pro (58.4 so với 57.3); khả năng tự chủ dài hạn vượt trội và chi phí thấp hơn nhờ trọng số mở/bộ tổng hợp.
- so với GPT-5.4: Vượt trội trên SWE-Bench Pro (58.4 so với 57.7); cạnh tranh hoặc hơi kém hơn ở một số tác vụ lập luận thuần túy.
- so với GLM-5 (tiền nhiệm): Tăng 28% về lập trình và cải thiện đáng kể khả năng thực thi bền vững.
- so với Llama 3.1 / Qwen / DeepSeek: Kết quả tốt hơn về tác nhân và dài hạn; giấy phép MIT mở mang lại tự do tùy biến lớn hơn so với nhiều lựa chọn khác.
Các lợi thế chính của nó là khả năng tiếp cận mã nguồn mở, hiệu quả chi phí ở quy mô lớn và tối ưu hóa chuyên biệt cho các tác nhân kỹ thuật trong thực tế.
Trường hợp sử dụng
GLM-5.1 vượt trội ở bất cứ nơi nào cần trí tuệ lặp đi lặp lại, chạy lâu:
- Kỹ thuật phần mềm tự động: Phát triển tính năng full-stack, di trú mã, tái cấu trúc quy mô lớn và kiểm thử end-to-end với giám sát tối thiểu.
- Tối ưu hiệu năng: Cải tiến ở mức kernel, tinh chỉnh cơ sở dữ liệu và benchmarking nhiều vòng lặp (ví dụ, tăng tốc truy vấn vector 6.9×).
- Quy trình tác nhân: Tích hợp vào các tác nhân lập trình (Claude Code, OpenClaw) cho tác vụ quy mô kho mã hoặc xây dựng hệ thống phức tạp.
- Năng suất doanh nghiệp: Phân tích tài liệu dài, tạo báo cáo và các hiện vật văn phòng có cấu trúc.
- Nghiên cứu & nguyên mẫu: Lặp nhanh trên các vấn đề mơ hồ đòi hỏi hàng trăm bước tự hiệu chỉnh.
Cách truy cập GLM-5.1 qua CometAPI
CometAPI, một bộ tổng hợp mô hình AI hợp nhất, cung cấp quyền truy cập tức thì, tương thích OpenAI tới GLM-5.1 (và GLM-5) cùng hơn 500+ mô hình khác. Nhà phát triển chỉ cần đăng ký tại cometapi.com, lấy khóa API và định tuyến yêu cầu đến endpoint(glm-5.1) bằng các SDK OpenAI chuẩn hoặc Chat Completions. Không cần thiết lập hạ tầng—CometAPI xử lý định tuyến suy luận, cân bằng tải và dự phòng lỗi.
Bảng giá CometAPI hiện tại (xấp xỉ, tính đến giữa tháng 4/2026):
- Đầu vào: $0.8 mỗi triệu token
- Đầu ra: $3.2 mỗi triệu token
Mức này thấp hơn đáng kể so với giá trực tiếp của Z.ai (~$1.4 / $4.4) và chỉ bằng một phần so với các mô hình tiên phong tương đương ở phương Tây.