GLM-5.3 的技術規格
| 規格 | GLM-5.3 |
|---|---|
| 開發者 | Z.ai |
| 模型家族 | GLM-5 |
| 版本 | 5.3 |
| 宣布 | August 14, 2026 |
| 模型類型 | 前沿代理式 LLM |
| 主要重點 | 資安、程式設計、自主代理 |
| 開放權重 | 是 / 已宣布 |
| 參數量 | 尚未披露 |
| 有效參數 | 尚未披露 |
| 架構 | 尚未披露 |
| 上下文視窗 | 尚未披露 |
| 最大輸出 | 尚未披露 |
| 原生視覺 | 尚未確認 |
| CyberGym | 84.5% |
| ExploitBench | 54.4% |
| 公開權重 | 規劃中 |
| 公開發布 | 約在宣布後兩週 |
| API 模型 ID | 尚未公開確認 |
| API 價格 | 尚未公布 |
| 進階存取 | 受信/已驗證用戶 |
| 最佳使用案例 | 資安、程式代理、漏洞研究 |
Z.ai 的公開模型倉庫仍然顯著展示著 GLM-5.2,而非可下載的 GLM-5.3 工件,因此尚未發布的規格應明確標註為未確認。
什麼是 GLM-5.3?
GLM-5.3 是 Z.ai 之 GLM 家族的最新一代,代表著向能夠自主執行複雜安全與工程任務的 AI 系統轉變。
此次宣布之所以特別,是因為資安不僅被當作另一個基準分類。Z.ai 正以 GLM-5.3 展示一個能夠發現軟體漏洞並參與攻擊開發工作流程的 AI 系統。
路透社報導,Z.ai 計劃在完成安全評估後公開發布該模型,而更進階的能力將先透過「受信存取機制」加以限制。
這與 GLM-5.2 的重點有顯著差異。
GLM-5.2 主要定位於「長期軟體工程與代理式程式設計」。Z.ai 六月的研究頁面將 GLM-5.2 描述為 "Built for Long-Horizon Tasks"。
GLM-5.3 則將這種代理式理念推進到一個更為敏感的領域:
軟體工程 → 漏洞發現 → 網路防禦 → 受控的攻擊性安全
GLM-5.3 的主要特性是什麼?
以資安為中心的推理
核心亮點能力是資安。
GLM-5.3 取得:
CyberGym 成績 84.5%
CyberGym 評估 AI 系統識別軟體漏洞的能力。該成績略高於 Mythos 5 報告的 83.8%。
這很重要,因為資安不僅僅是產生語法正確的程式碼。
一個有能力的安全代理需要:
- 理解不熟悉的程式碼。
- 識別攻擊面。
- 形成關於漏洞的假設。
- 追蹤資料與控制流程。
- 驗證該假設。
- 開發合適的概念驗證。
- 判定該漏洞是否實際可被利用。
GLM-5.3 在 CyberGym 的分數顯示其在此鏈條前半段已有實質進展。
強大的漏洞發現能力
這項 84.5% 的 CyberGym 成績 可以說是最令人印象深刻的早期結果。
它使 GLM-5.3 在漏洞識別上略勝於 Mythos 5:
| 模型 | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
差距僅 0.7 個百分點,因此把 GLM-5.3 描述為決定性領先會有誤導之嫌。
更有趣的是,來自 Z.ai 的一個開放權重模型正在進入與高度受限的資安系統相近的表現區間。
漏洞利用開發仍是弱項
GLM-5.3 並未在每項資安任務上稱霸。
在 ExploitBench 上:
| 模型 | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
相差 23.6 個百分點。
這揭示了一個重要區別:
發現一個漏洞不等於能可靠地加以利用。
GLM-5.3 在識別弱點方面似乎能力很強,但早期結果顯示,將這些發現轉化為可靠的漏洞利用開發仍然相當困難。
對企業安全團隊而言,這反而使該模型作為防禦性的漏洞分析助手更具吸引力,而非僅僅是進攻型自動化引擎。
GLM-5.3 與 GLM-5.2
GLM-5.2 提供了最有用且已確認的基準。
| 功能 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 狀態 | 已發布 | 已宣布 |
| 主要定位 | 長期任務代理 | 資安 + 代理 |
| 程式設計 | 表現優異 | 預期仍將強勁 |
| 資安 | 潛力強 | 明確的旗艦重點 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| 上下文 | 1M | 尚未確認 |
| 參數量 | ~753B | 尚未確認 |
| 授權 | MIT | 已宣布開放權重 |
| API 價格 | 已公布 | 尚未公布 |
| 公開權重 | 可用 | 規劃中 |
GLM-5.2 的已確認架構約為 753B 參數,其公開模型目錄仍列出 753B 模型與 FP8 版本。
根據第三方基於 Z.ai 模型評估資料的報導,GLM-5.2 亦在 Terminal-Bench 2.1 取得 81.0、在 SWE-bench Pro 取得 62.1。
但這些數據應仍歸於 GLM-5.2 的基準,不應歸因於 GLM-5.3。
GLM-5.3 與 Mythos 5
這目前是最有意義的基準對比。
| 基準 | GLM-5.3 | Mythos 5 | 差異 |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 個百分點 |
| ExploitBench | 54.4% | 78.0% | −23.6 個百分點 |
這一結果帶來一個細緻的結論。
GLM-5.3 在漏洞識別上勝出。
但:
Mythos 5 在漏洞利用開發上仍顯著更強。
因此,說 "GLM-5.3 beats Mythos 5" 會是對現有數據的不精確解讀。
更好的描述是:
GLM-5.3 在漏洞發現方面達到接近 Mythos 5 的水準,但在漏洞利用開發上仍然落後。