TL;DR GLM-5.3 是 Z.ai 最新的旗艦 AI 模型,於 2026 年 8 月 14 日發佈,重點聚焦於軟體工程、自主代理、長時程任務與資安。
不同於傳統的模型升級,GLM-5.3 與 GLM-5.2 保持相同的底層基座模型。Z.ai 表示主要收益來自於大規模的後訓練,使用真實世界的專家工作流程,而非單純擴大模型規模。
重點結果相當顯著。Z.ai 報告在其內部 Code Bench 上,相較 GLM-5.2 的程式碼表現提升 50%;公開基準方面,DeepSWE v1.1 得分 66.9,較 GLM-5.2 的 46.2 提升,Agents’ Last Exam(CLI)達到 28.5,較 23.8 提升。資安方面,GLM-5.3 在 CyberGym 上取得 84.5%,略高於 Anthropic 的 Mythos 5 的 83.8%,而 ExploitBench 從 24.4% 提升至 54.4%。
Key Takeaways
- GLM-5.3 與 GLM-5.2 使用相同的基座模型;所有改進來自於在長時程環境上的大規模後訓練。
- 程式碼表現大幅躍升:Terminal-Bench 3.0 從 4.6 → 28.3;DeepSWE v1.1 從 46.2 → 66.9;在 Z.ai 內部 Code Bench 約提升 50%,且 token 效率更高。
- 湧現的資安能力: CyberGym 84.5%(SOTA),ExploitBench 提升逾倍(24.4% → 54.4%)。在 269 個專案中實際發現 2,436 個弱點(1,097 個為中至高嚴重等級)。
- 規格:僅文字、1M 上下文、最多 128K 輸出 token、始終開啟的思考模式,提供低/高/最大努力等級。
- 可用性:現已於 GLM Coding Plan 與 ZCode 上線;API 與類 MIT 開放權重將在發佈後約 2 週於安全審查後提供。
- 對代理型工程、長時程編碼與防禦性安全研究具有強大定位。
- CometAPI 透過單一相容 OpenAI 的 API 提供更廣泛 GLM 系列(及 500+ 模型)的便捷且折扣的存取——在等待原生 GLM-5.3 端點期間尤為理想。
What Is GLM-5.3?
GLM-5.3 是 Z.ai(原 Zhipu AI)於 2026 年 8 月發佈的最新旗艦大型語言模型。它屬於 GLM(General Language Model)家族,從早期的 ChatGLM 演進為一系列強大的開放權重模型,針對編碼、推理與代理型工作流程進行了優化。
不同於完整的前訓練革新,GLM-5.3 建立在與前代 GLM-5.2 完全相同的基座模型上(大型 Mixture-of-Experts 架構,總參數約 743–7440 億,每個 token 啟用約 400 億)。所有性能提升來自極端擴大的後訓練:多數倍的長時程任務環境、更多元的環境、以及在強化學習(RL)與相關技術上投入顯著更多算力。
Z.ai 表示 其目標是超越「vibe coding」,邁向真正的「代理型工程」——模型不只是產生孤立的程式片段,而是能承擔實質、跨數日的專業工作單元。訓練環境現在包含真實的生產情境(例如:診斷 ML 訓練堆疊中的瓶頸、實作最佳化、執行實驗,並在保持正確性的前提下交付可量化的端到端加速)。
從 GLM-5.2 延續並擴大的核心技術棧包括:
- 用於高效長上下文處理的 IndexShare
- 用於長時程任務 RL 的 SAO(含壓縮)
- 用於大規模訓練的 slime(開源非同步 RL 框架)
該模型僅支援文字(輸入/輸出皆為文字),提供穩固的 100 萬 token 上下文視窗,並允許最多 128K 輸出 token。思考模式始終啟用,並可調整努力等級:low、high 與 max(預設且建議於編碼使用 max)。不再支援關閉思考。
Core Features of GLM-5.3
- 前沿的編碼與代理能力:專為複雜軟體工程、終端操作、多步驟代理任務與可跨時/日的長時程工作流程設計。
- 1M 無損上下文:對專案級程式碼庫、文件與多檔推理具有強勁保留力。
- 多種思考模式:始終開啟的推理,可透過低/高/最大努力在深度與延遲/成本間取得平衡。
- 串流、函式呼叫、結構化輸出與上下文快取:面向生產的代理工具支援。
- 新興的資安強項:強勁的白箱弱點發掘能力,並持續提升多階段利用規劃(主要面向防禦用途)。
- token 效率提升:在等同或更高的表現下,較 GLM-5.2 以更少的輸出 token 取得更好結果。
- 開放權重路線圖:在發佈後約 2 週,於完成針對新資安能力的安全評估與強化後,以寬鬆授權(延續 GLM-5.x 的 MIT 範式)釋出權重。
這些特性使 GLM-5.3 成為打造編碼代理、自主工程系統與安全研究工具的強勢競爭者。
GLM-5.3 Benchmark Improvements: GLM-5.3 vs GLM-5.2
評估 GLM-5.3 最有用的方式,是查看 Z.ai 提供的前後對照基準。
來源 x
What the Benchmark Data Actually Says
首先,相較於 GLM-5.2 的升級相當全面。Z.ai 的對照表中,GLM-5.3 在每一項都更好。相對變化最大的出現在基線較低但難度高的任務,例如 Terminal-Bench 3.0、ExploitGym 與 ExploitBench。這與 Z.ai 的說法一致:更先進的長時程環境將能力推升至更高難度曲線。
其次,GLM-5.3 具競爭力,但並非在所有領域都領先。它在 CyberGym(84.5)、AutomationBench(48.2)與 GDPval-AA v2(1769 Elo)領先全表;在 Agents’ Last Exam CLI 上與 GPT-5.6 Sol 幾乎持平,28.5 對 28.6。然而,GPT-5.6 Sol 在 Terminal-Bench 3.0 得分 34.6、DeepSWE 72.7,Fable 5 則為 33.7 與 69.7。在 ExploitBench 上,兩者皆領先 GLM-5.3 逾 20 分。
第三,框架與預算細節很重要。Z.ai 在不同基準上的設定各異:上下文從 30 萬到 100 萬 token、最大輸出從 64K 到 163,840 token、逾時最長達 10 小時。數個測試使用 Claude Code 2.1.207 作為代理框架。ExploitGym 的時間預算也依各模型吞吐量進行標準化。這些選擇都有記錄,但意味著分數衡量的是模型加框架的系統,而非抽象的智力本身。
How to Access GLM-5.3
在發佈時,存取仍在逐步開放中。
Z.ai 的官方文件目前表示:
“The GLM-5.3 API is coming soon.”
同時,GLM-5.3 已提供給 GLM Coding Plan 使用者。
Z.ai 的 Coding Plan 文件 表示該服務支援 GLM-5.3 與其他 GLM 模型,並可搭配 Claude Code、Cline、OpenCode 及相關工具的編碼環境使用。
官方的 ZCode 文件也描述了透過 Z.ai 與 BigModel 帳戶整合 GLM-5.3。
GLM-5.3 Pricing
定價是開發者需要留意的一環。
在本文發佈時,因 API 仍標示為「即將推出」,Z.ai 尚未在官方 GLM-5.3 API 文件中公佈一般的 GLM-5.3 API 定價。
目前開發者可透過 GLM Coding Plan 存取該模型。
Z.ai 現行方案頁面標示以下起始價格:
| Plan | Advertised price | Positioning |
|---|---|---|
| Lite | $12.60/month promotional / $18 standard | Lightweight development |
| Pro | $56/month promotional / $80 standard | Professional workloads |
| Max | Higher tier | High-volume workloads |
*價格與促銷可能變動;購買前請查核 Z.ai 即時定價頁面。
重要的是,以上為「編碼訂閱價格」,並不等同於每 token 計價的 API 定價。
一旦一般 GLM-5.3 API 可用,開發者應比較:
- 輸入 token 成本
- 輸出 token 成本
- 推理 token 成本
- 快取輸入定價
- 上下文視窗定價
- 速率限制
- 工具呼叫成本
- 批次定價
- 企業條款
而非僅比較訂閱價格。
GLM-5.3 Comparison Table: Which Model Fits Which Workload?
| Model | Strong signals in Z.ai's table | Relative weakness in the same table | Practical fit |
|---|---|---|---|
| GLM-5.3 | 在 CyberGym、AutomationBench 與 GDPval-AA v2 領先;相較 5.2 有大幅提升 | 在若干原始編碼與利用測試上落後於 Fable 5 與 GPT-5.6 Sol | 成本敏感的編碼代理、自動化、防禦性安全評估、長時程工程 |
| GLM-5.2 | 成熟的開放權重、MIT 授權、1M 上下文 | 在最新的高難度基準上遠遜於 5.3 | 目前可自託管、可重現的開放部署、較低風險的遷移路徑 |
| Kimi K3 | DeepSWE 略高;Toolathlon 表現強 | 在 CyberGym、AutomationBench 與 GDPval-AA v2 低於 GLM-5.3 | 在 Kimi 已適配之堆疊下的長上下文編碼與代理評估 |
| Claude Fable 5 | Terminal-Bench 3.0、DeepSWE、ExploitBench 與 ExploitGym 得分更高 | 在 AutomationBench、CyberGym 與 GDPval-AA v2 較低 | 當價格次要、追求最高難度編碼與利用研究 |
| GPT-5.6 Sol | Terminal-Bench 3.0、DeepSWE、HLE with tools 與 ExploitGym 得分最高 | 在 AutomationBench、CyberGym 與 GDPval-AA v2 較低 | 以高端路線面向前沿通用編碼與長時程代理 |
這並非通用排名。正確的生產指標是你自身任務上每個可接受結果的成本,包含重試、延遲、工具失敗與人工修正。
Should You Use GLM-5.3?
若你的工作負載包含版本庫規模的編碼、自動化、長時間工具使用或防禦性安全,GLM-5.3 值得嚴肅評估。相較 GLM-5.2 的升級過於廣泛,不能僅以基準噪音解釋;而在 Z.ai 私有編碼測試上的 token 效率結果,重要性可能與原始分數同等。
它並非自動取代所有模型。Z.ai 自身的對照表顯示,在若干高難度的編碼與利用基準上,Fable 5 與 GPT-5.6 Sol 仍領先。GLM-5.2 目前仍較易自託管。互動式、延遲敏感的功能也可能更偏好更快、可選或可關閉推理的模型。
對多數企業而言,務實路徑是先透過託管 API 測試 GLM-5.3,在真實任務上比較,並進行選擇性路由。當你需要依用量計費、20% 的標示折扣,以及能在同一作業層取得替代模型時,CometAPI 尤其相關。在行動前請先查看即時目錄,因為本文反映的是發佈當天的產品狀態,可能快速變動。
The Bottom Line
GLM-5.3 是 2026 年 8 月最具代表性的開放權重 AI 發佈之一,因為它改變了「模型改進」的意涵。Z.ai 並未宣佈更大的模型,而是保留 GLM-5.2 的基座,並更大力度地在真實工程工作流程上進行後訓練。
結果令人印象深刻:
- 在 Z.ai 的 Code Bench 上,程式碼表現提升 50%
- DeepSWE v1.1 從 46.2 → 66.9
- Agents’ Last Exam 從 23.8 → 28.5
- ExploitBench 從 24.4 → 54.4
- CyberGym 達到 84.5%
- 1M-token 上下文
- 128K 最大輸出
- 更強的代理與工具使用能力
目前可透過 Z.ai 的 Coding Plan 存取該模型,而一般 API 仍在路上。開放權重預計在進一步的安全評估後釋出。對開發者而言,最大的機會不僅是問 GLM-5.3 是否在排行榜上勝過其他模型。
更好的問題是:
GLM-5.3 能否以更少的人為介入、更低的總成本與可接受的延遲,完成你真實的工程工作流程?
這才是重要的基準。
對已在嘗試 GLM 模型的團隊而言,CometAPI 透過既有的 GLM-5.2 API 整合提供了實用的起點。隨著 GLM-5.3 在第三方平台上線,統一的 API 方式可讓你更容易在不重建整個應用堆疊的情況下,將 GLM-5.3 與其他推理與編碼模型進行比較。
Explore GLM models on CometAPI
FAQs About GLM-5.3
What is GLM-5.3?
GLM-5.3 是 Z.ai 於 2026 年 8 月推出的推理模型,面向複雜編碼、長時程代理、自動化與資安。它使用與 GLM-5.2 相同的基座模型,性能提升歸因於在更多、且更困難的可執行環境上進行擴尺度後訓練。
Is GLM-5.3 better than GLM-5.2?
在 Z.ai 的 GLM-5.3 發佈對照表中,每個基準上都是。例子包括 Terminal-Bench 3.0 從 4.6 升至 28.3、DeepSWE 從 46.2 升至 66.9、AutomationBench 從 26.2 升至 48.2、ExploitBench 從 24.4 升至 54.4。
Is GLM-5.3 open source?
Z.ai 稱其為開放權重模型,但發佈日未提供權重。官方表示將在 8 月 14 日發佈後兩週釋出權重,待完成安全評估與強化。
Why is GLM-5.3 notable for cybersecurity?
Z.ai 報告在 CyberGym 得分 84.5、ExploitBench 54.4,並在標準化的 2 小時/6 小時預算下完成 ExploitGym 105/130 項任務。該模型相較 GLM-5.2 有大幅提升,但安全相關輸出仍需授權、沙盒化、專家審查與協調式揭露。
How can I access the GLM-5.3 API?
Z.ai 透過其 Coding Plan 與 ZCode 提供 GLM-5.3。CometAPI 列出模型 ID glm-5.3,並提供相容 OpenAI 的生產端點。
Does GLM-5.3 support a 1M-token context window?
Z.ai 在部分 GLM-5.3 基準中以 1M 上下文進行評估,且 GLM-5.3 與 GLM-5.2 共用基座模型,其主打特性即為 1M 上下文。
Does GLM-5.3 support vision or image input?
官方發佈文未確認視覺能力。CometAPI 目前列示為文字輸入與文字輸出,因此除非 Z.ai 或 API 提供方公佈多模態規格,開發者應將 GLM-5.3 視為僅文字。
Is GLM-5.3 the best model for coding?
它是 Z.ai 發佈對照中最強的模型之一,且相較 GLM-5.2 有大幅改善,但並非在每個編碼基準上居首。GPT-5.6 Sol 與 Fable 5 在 Terminal-Bench 3.0 與 DeepSWE 得分更高,因此最佳模型取決於工作負載、延遲、價格與可接受結果率。
