GLM-5.3 的技術規格
| 規格 | GLM-5.3 |
|---|---|
| 開發者 | Z.ai / Zhipu AI |
| 發佈 | August 14, 2026 |
| 模型類型 | 旗艦級基礎模型 |
| 輸入 | 文字 |
| 輸出 | 文字 |
| 上下文窗口 | 1,000,000 tokens |
| 最大輸出 | 128,000 tokens |
| 思考 | 多種模式 |
| 串流 | 是 |
| 函式呼叫 | 是 |
| 結構化輸出 | 是 |
| 上下文快取 | 是 |
| MCP | 是 |
| 主要應用 | 程式設計、代理、工程、網路安全 |
Z.ai 的公開模型倉庫仍然顯著展示著 GLM-5.2,而非可下載的 GLM-5.3 構件,因此,尚未發佈的規格應明確標註為未確證。
什麼是 GLM-5.3?
GLM-5.3 是 Z.ai 的 GLM 家族的最新一代,代表著正向能夠自主執行複雜安全與工程任務的 AI 系統轉型。
此項宣佈尤為引人注目,因為網路安全並非僅被當作另一個基準分類。Z.ai 正以 GLM-5.3 展示一個能夠發現軟體漏洞並參與攻擊開發工作流程的 AI 系統。
路透社報導,Z.ai 計畫在完成安全評估後公開釋出該模型,而更先進的能力將初期透過一種「受信任存取機制」加以限制。
這與 GLM-5.2 的重點相比是顯著的轉變。
GLM-5.2 主要定位於「長期軌跡的軟體工程與代理式編碼」。Z.ai 六月的研究頁面將 GLM-5.2 描述為「為 Long-Horizon Tasks 而建」。
GLM-5.3 將這一代理式理念帶入敏感得多的領域:
軟體工程 → 漏洞發掘 → 網路防禦 → 受控攻擊性安全
GLM-5.3 的主要特性是什麼?
以網路安全為核心的推理
主打能力是網路安全。
GLM-5.3 取得:
CyberGym 84.5%
CyberGym 用於評估 AI 系統識別軟體漏洞的能力。該結果略高於 Mythos 5 報告的 83.8%。
這很重要,因為網路安全不僅僅是產生語法正確的程式碼。
一個有能力的安全代理需要能夠:
- 理解不熟悉的程式碼。
- 識別攻擊面。
- 對漏洞形成假設。
- 追蹤資料與控制流程。
- 驗證該假設。
- 開發適當的概念驗證。
- 判定該漏洞是否實際可被利用。
GLM-5.3 在 CyberGym 的成績顯示,該模型在這條鏈的前半段已有實質進展。
強大的漏洞發掘能力
這個 84.5% 的 CyberGym 成績 可以說是最令人印象深刻的早期結果。
這使 GLM-5.3 在漏洞識別方面略勝 Mythos 5 一籌:
| 模型 | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
差距僅有 0.7 個百分點,因此將 GLM-5.3 描述為決定性領先會有誤導之嫌。
更有趣的是,Z.ai 的開放權重模型正進入與一個高度受限的資安系統相近的表現區間。
漏洞利用開發仍是弱項
GLM-5.3 並未在所有網路安全任務中占優。
在 ExploitBench 上:
| 模型 | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
差距為 23.6 個百分點。
這揭示了一個重要的區別:
發現漏洞並不等同於能夠可靠地加以利用。
GLM-5.3 似乎在識別弱點方面能力很強,但早期結果顯示,將這些發現轉化為可靠的漏洞利用開發要困難得多。
對企業安全團隊而言,這反而使該模型作為一個「防禦性漏洞分析助理」更具吸引力,而不僅僅是單純的攻擊自動化引擎。
GLM-5.3 對比 GLM-5.2
GLM-5.2 提供了最有用且已確認的基準。
| 特性 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 狀態 | 已發佈 | 已宣佈 |
| 主要定位 | 長期軌跡的代理 | 網路安全 + 代理 |
| 程式設計 | 表現優異 | 預期依然強勁 |
| 網路安全 | 具備強勁潛力 | 明確的旗艦重點 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| 上下文 | 1M | 未確證 |
| 參數 | ~753B | 未確證 |
| 授權條款 | MIT | 已宣佈開放權重 |
| API 定價 | 已公佈 | 尚未公佈 |
| 公開權重 | 可用 | 已規劃 |
GLM-5.2 經確認的架構約為 753B 參數,其公開模型目錄仍列示 753B 模型與 FP8 版本。
根據第三方基於 Z.ai 模型評測材料的報導,GLM-5.2 還在 Terminal-Bench 2.1 取得 81.0,並在 SWE-bench Pro 取得 62.1。
但這些數據應保留為 GLM-5.2 的基準,不應歸因於 GLM-5.3。
GLM-5.3 對比 Mythos 5
這目前是最具意義的基準比較。
| 基準測試 | GLM-5.3 | Mythos 5 | 差異 |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 個百分點 |
| ExploitBench | 54.4% | 78.0% | −23.6 個百分點 |
這帶來一個更為細緻的結論。
GLM-5.3 在漏洞識別上勝出。
但是:
Mythos 5 在漏洞利用開發上仍顯著更強。
因此,說 「GLM-5.3 擊敗 Mythos 5」 會是對現有資料的不準確解讀。
更好的描述是:
GLM-5.3 在漏洞發掘方面達到接近 Mythos 5 的水準,但在漏洞利用開發上仍然落後。