Tóm tắt Z.ai ra mắt GLM-5.3 vào ngày 14 tháng 8 năm 2026, dựa trên đúng cùng mô hình nền Mixture-of-Experts ~743–753B tham số như GLM-5.2. Mọi cải thiện đều đến từ hậu huấn luyện được mở rộng trên các môi trường dài-hạn. Kết quả là cải thiện tương đối ~50% trên Code Bench nội bộ của Z.ai, đạt SOTA nguồn mở trên Terminal-Bench 3.0 (4.6 → 28.3) và Agents’ Last Exam, điểm tác tử tốt hơn rõ rệt, cùng hiệu năng an ninh mạng đạt trạng thái tiên tiến nổi bật (CyberGym 84.5%). Hiệu suất token cũng được cải thiện.
Trọng số dự kiến phát hành khoảng hai tuần sau khi ra mắt, sau khi gia cố an toàn. Nhà phát triển đã có thể truy cập các mô hình GLM liên quan và thử nghiệm quy trình hiệu quả qua các nền tảng hợp nhất như CometAPI.
Điểm chính
- Cùng mô hình nền như GLM-5.2; mọi tiến bộ đến từ hậu huấn luyện (IndexShare, SAO, khung slime + nhiều môi trường và tài nguyên tính toán hơn).
- Lập trình: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench nội bộ của Z.ai tốt hơn ~50% với ít token đầu ra hơn.
- Tính tác tử: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- An ninh mạng: CyberGym 77.2 → 84.5 (SOTA, vượt Mythos 5 và GPT-5.6 Sol); ExploitBench hơn gấp đôi (24.4 → 54.4). Phát hiện thực tế: 2.436 lỗ hổng trên 269 dự án.
- Thông số không đổi trong kiến trúc lõi: ngữ cảnh 1M, tối đa 128K token đầu ra, tư duy luôn bật với effort thấp/cao/tối đa.
- Truy cập: Trực tiếp qua GLM Coding Plan và ZCode; API chung và trọng số mở (dự kiến kiểu MIT) sẽ có sau rà soát an toàn. CometAPI cung cấp truy cập tiện lợi, tương thích OpenAI cho họ GLM để thử nghiệm song song và định tuyến sản xuất.
GLM-5.3 so với GLM-5.2 – Tổng quan nhanh
| Hạng mục | GLM-5.3 | GLM-5.2 | Bên vượt trội / Ghi chú |
|---|---|---|---|
| Mô hình nền | Cùng MoE ~743–753B | Cùng | Giống hệt |
| Hậu huấn luyện | Môi trường mở rộng mạnh | Ngăn xếp trước đó | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (rất lớn) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Code Bench nội bộ (Max) | 34.5% @ ~75K token | 23.4% @ ~96K token | 5.3 (hiệu năng + hiệu suất) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Ngữ cảnh / Đầu ra tối đa | 1M / 128K | 1M / tương tự | Như nhau |
| Tư duy | Luôn bật (low/high/max) | Trước đó linh hoạt hơn | 5.3 (luôn bật) |
| Trọng số mở | ~2 tuần sau ra mắt (dự kiến) | Có sẵn (MIT) | 5.2 hiện tại |
| Kênh truy cập chính hiện tại | Coding Plan / ZCode | API + trọng số + Coding Plan | 5.2 chín muồi hơn |
Giới thiệu: Hậu huấn luyện mang lại bước nhảy thế hệ
Giữa tháng 8/2026, cộng đồng AI chứng kiến thêm một vòng lặp nhanh trong cuộc đua trọng số mở. Z.ai (bộ mặt quốc tế của đội Zhipu AI / ChatGLM trước đây) ra mắt GLM-5.3 chỉ 59 ngày sau GLM-5.2. Thông báo đi thẳng vào trọng tâm: mô hình nền giữ nguyên. “Quy mô hóa hậu huấn luyện là tất cả những gì chúng tôi làm cho GLM-5.3,” công ty cho biết.
Điều đó quan trọng. Trong nhiều năm, câu chuyện chủ đạo là “mô hình lớn hơn sẽ thắng.” GLM-5.3 cho thấy việc mở rộng mạnh môi trường học tăng cường, đa dạng nhiệm vụ dài-hạn và hạ tầng hệ thống có thể tạo ra các bước nhảy lớn trên bài toán lập trình khó, tác tử và cả an ninh mạng mà không cần lượt tiền huấn luyện mới. Các con số lớn đến mức trên vài benchmark khó, nhà quan sát độc lập mô tả đây là bước nhảy khác biệt về chất, không chỉ tăng dần. Tổng quan tính năng, benchmark và ghi chú truy cập GLM-5.3.
GLM-5.3 vs GLM-5.2: Thực sự đã thay đổi gì?
Ngộ nhận lớn nhất là nghĩ GLM-5.3 đơn giản là “GLM-5.2 nhưng lớn hơn.”
Không phải vậy.
Theo Z.ai, mô hình nền về cơ bản giữ nguyên. Đổi mới chính là quy mô hóa hậu huấn luyện. Z.ai nhấn mạnh ba trụ cột:
- Cải tiến hệ thống bên trong slime — Huấn luyện tốt hơn
- Mở rộng môi trường — Pipeline tổng hợp môi trường dài-hạn có thể thực thi, kiểm chứng từ quy trình công việc chuyên nghiệp thực. Tác tử nghiên cứu trích xuất mẫu nhiệm vụ; tác tử đánh giá xác minh khả năng giải; bộ thẩm định được xây mà không truy cập nghiệm tham chiếu để giảm lách phần thưởng.
- Tiếp tục dùng SAO + compaction — Giúp lợi ích bền vững trên quỹ đạo dài thay vì sụt trên quỹ đạo ngắn. Tính nhất quán rollout (khống chế chênh lệch log-prob ở mức ~1e-7), caching phân cấp, hỗ trợ đa teacher, lập lịch nhận biết tải, và báo cáo tăng thông lượng đầu-cuối >2.3× trên tác vụ RL lập trình dài-hạn.
Những thay đổi này tạo ra cải thiện đo được trên các bộ lập trình, tác tử và an ninh mạng. Đáng chú ý, mức tăng tương đối lớn nhất xuất hiện trên các bài khó nhất, baseline thấp nhất—đúng mẫu hình khi mô hình được đẩy vào các chế độ mà trước đó không xử lý ổn định.
Kết quả là bản nâng cấp mô hình thiên về hành vi và năng lực, hơn là kiến trúc.
GLM-5.3 vs GLM-5.2: So sánh tính năng
1. Hậu huấn luyện được quy mô hóa thay cho mô hình nền mới
Z.ai mô tả quy mô hóa hậu huấn luyện là toàn bộ công thức của GLM-5.3. Tác tử nghiên cứu biến mẫu từ công việc thực thành nhiệm vụ có thể chạy với trạng thái ẩn và phụ thuộc đa bước. Một tác tử đánh giá xác minh từng nhiệm vụ là giải được. Bộ thẩm định được tạo mà không thấy nghiệm tham chiếu, rồi được kiểm tra đối chiếu với trạng thái oracle, no-op và chưa giải để giảm đường tắt phần thưởng.
Hệ thống vẫn cần con người duyệt, và Z.ai nói rõ việc tự động hóa hơn nữa khâu tạo môi trường và thẩm định là việc cho tương lai. Ràng buộc này làm tăng độ tin cậy của tuyên bố: đây là pipeline huấn luyện lớn, không phải tuyên bố rằng môi trường tổng hợp đã tự quản hoàn toàn.
2. Năng lực lập trình dài-hạn mạnh hơn
GLM-5.3 cải thiện ở công việc kho mã, tác vụ terminal, hạ tầng máy học, tối ưu hiệu năng và quy trình giao phần mềm nhiều bước. Trên Z.ai Code Bench, phép đánh giá nội bộ phản ánh kịch bản người dùng thực, Z.ai báo cáo hiệu năng lập trình tốt hơn khoảng 50% so với GLM-5.2.
Hiệu suất cũng quan trọng không kém điểm số. Ở mức Max effort, GLM-5.3 đạt 34.5% với khoảng 75K token đầu ra mỗi nhiệm vụ, so với 23.4% và 96K của GLM-5.2. Đó là tăng 11,1 điểm chất lượng trong khi tạo ra ít hơn khoảng 22% token đầu ra. Ở mức High effort, GLM-5.3 đạt 31.4% với khoảng 50K token, vượt Claude Opus 4.8 ở 29.5% với 120K trong cùng biểu đồ nội bộ. Claude Fable 5 vẫn cao hơn ở 39.5% dưới Max effort.
3. Năng lực an ninh mạng mang tính trỗi dậy
Z.ai bổ sung môi trường phát hiện lỗ hổng trong giai đoạn hậu huấn luyện. Theo báo cáo ra mắt, năng lực tăng vượt việc tìm lỗi đơn lẻ: mô hình bắt đầu suy luận qua nhiều giai đoạn của chuỗi khai thác.
Điểm công khai cho thấy cả tiến bộ lẫn giới hạn. GLM-5.3 dẫn đầu bảng so sánh của Z.ai trên CyberGym với 84.5, so với 77.2 của GLM-5.2. Trên ExploitBench, điểm của GLM-5.3 hơn gấp đôi GLM-5.2, đạt 54.4 so với 24.4, nhưng vẫn kém Fable 5 ở 78.0 và GPT-5.6 Sol ở 76.5. Trên ExploitGym, mô hình hoàn thành 105 tác vụ trong ngân sách 2 giờ chuẩn hóa và 130 trong 6 giờ, so với 29 và 39 của GLM-5.2; GPT-5.6 Sol và Fable 5 vẫn vượt xa.
Những năng lực này có tính hai mục đích. Tổ chức nên hạn chế truy cập mô hình, sandbox công cụ, ghi nhật ký hành động, yêu cầu ủy quyền khi quét, và luôn có con người kiểm chứng và công bố lỗ hổng.
4. Tư duy luôn bật với ba mức effort
GLM-5.3 hỗ trợ effort suy luận low, high và max. Khác GLM-5.2, nó không hỗ trợ tắt tư duy. Các tích hợp hiện tại đang gửi thinking.type: "disabled" phải đổi giá trị thành enabled trước khi chuyển ID mô hình, nếu không yêu cầu sẽ lỗi theo Z.ai.
Dùng low cho chỉnh sửa tương tác và biến đổi rủi ro thấp, high cho tác vụ kho mã đáng kể, và max cho lập trình khó hoặc phân tích bảo mật. Cần cân nhắc độ trễ và chi phí với effort cao hơn vì câu trả lời mạnh hơn không tự động là phương án kinh tế nhất.
5. Thông lượng huấn luyện tốt hơn nhờ slime
GLM-5.3 tiếp tục dùng slime, khung nguồn mở của Z.ai với Megatron phía huấn luyện và SGLang phía rollout. Z.ai báo cáo bổ sung top-p masking, chưng cất on-policy top-k và full-vocabulary, chuyển đổi teacher, caching, và căn chỉnh số học chặt chẽ hơn giữa huấn luyện và rollout. Báo cáo ra mắt cho biết chênh lệch log-prob trung bình được khống chế ở mức 1e-7, thấp hơn hơn 99.99% so với thiết lập trước.
Lập lịch nhận biết tải và cân bằng tải được cho là đã cải thiện thông lượng RL đầu-cuối hơn 2.3 lần trên tác vụ lập trình dài-hạn. Đây là cải tiến hạ tầng huấn luyện chứ không phải bảo đảm suy luận phía người dùng, nhưng chúng giải thích cách Z.ai mở rộng quỹ đạo dài và đa dạng trong một tháng.
6. Trọng số mở phát hành chậm để rà soát an toàn
Z.ai gọi GLM-5.3 là mô hình trọng số mở, nhưng trọng số không tải được trong ngày ra mắt. Công ty nói sẽ phát hành sau hai tuần sau khi đánh giá và gia cố an toàn. Đây là khác biệt đáng kể so với GLM-5.2, vốn đã có trọng số theo giấy phép MIT trên Hugging Face.
Với hầu hết đội ngũ, thử nghiệm API lưu trữ vẫn là bước thực tế đầu tiên. Mô hình lớn, và trọng số mở không loại bỏ chi phí phần cứng suy luận, lượng tử hóa, phục vụ, giám sát hay kiểm soát bảo mật.
GLM-5.3 vs GLM-5.2: Cải thiện benchmark
Bảng sau dùng dữ liệu ra mắt chính thức của Z.ai. “Thay đổi” chỉ là phép tính từ điểm báo cáo. Tỷ lệ tương đối có thể trông ấn tượng khi baseline GLM-5.2 thấp, vì vậy cũng hiển thị thay đổi tuyệt đối.
| Benchmark | GLM-5.2 | GLM-5.3 | Thay đổi tuyệt đối | Thay đổi tương đối |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262.1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
Cải thiện benchmark: GLM-5.3 vs GLM-5.2 và đối thủ
Tất cả số liệu bên dưới do nhà cung cấp báo cáo từ blog chính thức của Z.ai (kèm ghi chú phương pháp về harness, độ dài ngữ cảnh và sampling). Xác minh độc lập sẽ theo sau khi có trọng số và quyền truy cập rộng.
Benchmark lập trình
| Benchmark | GLM-5.3 | GLM-5.2 | Ghi chú / Đối thủ |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | Cạnh tranh với mô hình đóng hàng đầu |
| Terminal Bench 3.0 | 28.3 | 4.6 | SOTA nguồn mở; so với Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Tăng mạnh |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (nội bộ, Max effort) | ~34.5% hoàn thành @ ~75K token | ~23.4% @ ~96K token | ~50% cải thiện tổng thể về lập trình; hiệu suất cao hơn |
Ở High effort, GLM-5.3 đạt 31.4% hoàn thành với ~50K token, vượt Claude Opus 4.8 (29.5% với 120K token) trên bench nội bộ, nhưng vẫn sau Claude Fable 5 (39.5% ở Max).
Benchmark an ninh mạng
| Benchmark | GLM-5.3 | GLM-5.2 | Đối thủ (xấp xỉ) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | Hơn gấp đôi so với trước; mô hình đóng cao hơn (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 vẫn dẫn (181/247) |
Mức tăng lớn nhất xuất hiện sâu hơn trong chuỗi khai thác. Trong thử nghiệm thực tế với các đội an ninh Trung Quốc, mô hình (kế thừa từ công việc GLM-5.2) xác định được 2.436 lỗ hổng trên 269 dự án, gồm 1.097 vấn đề mức trung bình-đến-cao. Một số lỗi có tuổi đời ~40 năm (cũ nhất ~1981). Phát hiện được theo dõi trong Z.ai Security Disclosure Ledger công khai.
Benchmark về tác tử & khác
| Benchmark | GLM-5.3 | GLM-5.2 | Ghi chú |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Tăng lớn |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Cạnh tranh nguồn mở |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | Bao phủ 44 nghề nghiệp |
Những kết quả này cho thấy tiến bộ rõ rệt trên các nhiệm vụ chuyên nghiệp dài-hạn, đa bước.
Hiệu suất token, chế độ tư duy và hành vi thực tế
Một cải thiện âm thầm nhưng quan trọng là hiệu suất token. Trên Code Bench nội bộ, tỷ lệ hoàn thành cao hơn đi kèm ít token đầu ra hơn. Điều này quan trọng cho chi phí và độ trễ trong vòng lặp tác tử sản xuất.
GLM-5.3 luôn bật tư duy. Hỗ trợ ba mức effort: low, high và max (mặc định và khuyến nghị cho lập trình là max). Không còn hỗ trợ tắt tư duy; ứng dụng trước đây đặt thinking.type: "disabled" phải chuyển đổi.
Ngữ cảnh vẫn vững ở 1M token với đầu ra tối đa tới 128K. Kiến trúc không đổi so với GLM-5.2, vì vậy việc ước lượng quy mô phần cứng cho tự lưu trữ sau này có thể dựa vào kinh nghiệm GLM-5.2 (dấu chân sau lượng tử hóa vẫn lớn với tổng số tham số).
Với nhà phát triển muốn thử nghiệm ngay hoặc giữ linh hoạt giữa các mô hình, cổng hợp nhất rất hữu ích. CometAPI liệt kê các mô hình dòng GLM (bao gồm GLM-5.3 dưới ID mô hình glm-5.3 khi sẵn sàng) với điểm cuối tương thích OpenAI, mức giá cạnh tranh, thanh toán theo mức sử dụng và khả năng chuyển đổi giữa GLM-5.2, GLM-5.3 và hàng chục mô hình tiên phong/ngỏ khác mà không phải viết lại tích hợp. Điều này đặc biệt thực dụng cho A/B test tác tử lập trình, đo chi phí trên mỗi nhiệm vụ thành công, và định tuyến lưu lượng theo tải công việc.
Ai nên chuyển sang GLM-5.3 và cách đánh giá
Nhóm xây dựng tác tử lập trình, tự động hóa dài-hạn, quy trình kỹ thuật ở quy mô kho mã, hoặc công cụ bảo mật phòng thủ nên ưu tiên đánh giá. Sự kết hợp giữa tỷ lệ hoàn thành cao hơn, hiệu suất token tốt hơn trên tác vụ phức tạp và năng lực tác tử đa bước mạnh hơn là đáng kể.
Lộ trình đánh giá khuyến nghị:
- Chạy cùng tác vụ nội bộ (hoặc một harness cố định) trên GLM-5.2 và GLM-5.3 (hoặc qua Coding Plan) với mức effort khớp nhau.
- Đo không chỉ tỷ lệ pass mà cả token, thời gian thực và tỷ lệ can thiệp của con người.
- Dùng lớp API hợp nhất như CometAPI để so sánh ít ma sát và giữ tùy chọn fallback hoặc định tuyến chọn lọc.
- Với khối lượng việc nhạy cảm bảo mật, chờ trọng số mở đã gia cố an toàn và rà soát quy trình công bố.
Tự lưu trữ sẽ hấp dẫn khi trọng số được phát hành, nhất là với tổ chức đã vận hành hạ tầng GLM-5.2.
Kết luận: Hậu huấn luyện như biên giới mở rộng mới
GLM-5.3 là một ví dụ rõ ràng gần đây cho thấy quy mô hóa hậu huấn luyện—môi trường thực tế hơn, hạ tầng RL tốt hơn và compute bền bỉ trên quỹ đạo dài—có thể tạo ra bước nhảy năng lực vốn tưởng cần mô hình nền mới. Lợi ích ở lập trình và tác tử là lớn; kết quả an ninh mạng phần nhiều mang tính trỗi dậy và đã cạnh tranh hoặc dẫn đầu trên benchmark khám phá.
Với người thực hành, thông điệp rất thực tế: thử mô hình trên khối lượng công việc của bạn, đo chi phí trên mỗi kết quả thành công thay vì vị trí bảng xếp hạng thuần túy, và giữ tích hợp linh hoạt. Các nền tảng như CometAPI đơn giản hóa quá trình này bằng việc cung cấp một khóa, giao diện tương thích OpenAI, và chuyển đổi dễ dàng trong dòng GLM và mô hình cạnh tranh trong khi bạn quyết định mức độ áp dụng năng lực mới.
