TLDR Z.ai 於 2026 年 8 月 14 日發佈了 GLM-5.3,其所基於的 ~743–753B 參數 Mixture-of-Experts 基礎模型與 GLM-5.2 完全相同。所有提升均來自於在長期(long-horizon)環境上的擴大量後訓練。結果是在 Z.ai 的內部 Code Bench 上相對提升約 50%,在 Terminal-Bench 3.0(4.6 → 28.3)與 Agents’ Last Exam 上達到開源 SOTA,代理能力得分顯著提升,並湧現出最先進的資安表現(CyberGym 84.5%)。Token 效率也有所提升。
權重預計在發佈後約兩週於安全加固後提供。開發者已可透過如 CometAPI 等統一平台高效存取相關 GLM 模型並測試工作流程。
Key Takeaways
- 與 GLM-5.2 相同的基礎模型;所有進步來自後訓練(IndexShare、SAO、slime 框架 + 更多環境與算力)。
- 程式設計:Terminal-Bench 3.0 4.6 → 28.3;DeepSWE v1.1 46.2 → 66.9;Z.ai 內部 Code Bench 約提升 50%,且輸出 Token 更少。
- 代理:AutomationBench 26.2 → 48.2;Agents’ Last Exam 23.8 → 28.5;GDPval-AA v2 1508 → 1769。
- 資安:CyberGym 77.2 → 84.5(SOTA,領先 Mythos 5 與 GPT-5.6 Sol);ExploitBench 超過翻倍(24.4 → 54.4)。真實世界發現:269 個專案共 2,436 個漏洞。
- 核心架構規格未變: 1M context、最多 128K 輸出 Token、始終開啟的思考(low/high/max)。
- 存取:透過 GLM Coding Plan 與 ZCode 即可使用;一般 API 與開放權重(預期 MIT 風格)將於安全審查後釋出。CometAPI 提供方便的 OpenAI 相容存取以便並排測試與生產導流。
GLM-5.3 vs GLM-5.2 at a Glance
| Dimension | GLM-5.3 | GLM-5.2 | Winner / Notes |
|---|---|---|---|
| Base model | Same ~743–753B MoE | Same | Identical |
| Post-training | Heavily scaled environments | Earlier stack | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (large) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K tokens | 23.4% @ ~96K tokens | 5.3 (perf + efficiency) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Context / Max output | 1M / 128K | 1M / similar | Same |
| Thinking | Always on (low/high/max) | More flexible previously | 5.3 (always-on) |
| Open weights | ~2 weeks post-launch (planned) | Available (MIT) | 5.2 currently |
| Primary access now | Coding Plan / ZCode | API + weights + Coding Plan | 5.2 more mature |
Introduction: Post-Training Delivers a Generational Jump
2026 年 8 月中旬,AI 社群見證了開放權重競賽中的又一次快速迭代。Z.ai(前 Zhipu AI / ChatGLM 團隊的國際品牌)在 GLM-5.2 發佈後僅 59 天便推出 GLM-5.3。該公告異常明確:底層基礎模型保持不變。“GLM-5.3 我們只做了後訓練規模化,”公司聲稱。
這一點很重要。多年來主流敘事是「更大的模型取勝」。GLM-5.3 證明,在無需重新進行預訓練的情況下,通過強化學習環境的積極擴展、長期任務多樣性與系統基礎設施建設,亦能在艱難的程式設計、代理與資安工作負載上取得超額增益。在多項高難度基準上的數字大到足以讓觀察者形容這次躍升是質變而非漸進。GLM-5.3 功能、基準與存取概覽。
GLM-5.3 vs GLM-5.2: What Actually Changed?
最大的誤解是把 GLM-5.3 當成「更大的 GLM-5.2」。
並不是。
據 Z.ai 表示,基礎模型基本相同。核心創新是「後訓練規模化」。Z.ai 強調三大支柱:
- slime 內部的系統改進 — 更好的訓練
- 環境擴展 — 從真實專業工作流程中合成可執行、可驗證、具長期依賴的環境。研究型代理抽取任務模式;評審代理驗證可解性;驗證器在看不到參考解的情況下構建,以降低獎勵取巧。
- 持續使用 SAO + 壓縮 — 使增益在長軌跡上保持,而非在短軌跡上崩塌。– rollout 一致性(log-prob 差異控制至 ~1e-7)、分層快取、多教師支援、工作負載感知排程,並據報在長期程式設計 RL 任務上帶來 >2.3× 的端到端吞吐提升。
這些變化在程式設計、代理與資安套件中產生了可衡量的改進。重要的是,相對提升最大的是那些最難、基線最低的測試——正是模型被推向其先前無法穩定處理的區域時應有的模式。
因此,這次升級主要關乎「行為與能力」,而不只是架構。
GLM-5.3 vs GLM-5.2: Features Comparison
1. 以擴大量後訓練取代新基礎模型
Z.ai 將擴大量後訓練描述為 GLM-5.3 的全部配方。研究型代理把真實工作中的模式轉為具隱藏狀態與多步依賴的可執行任務。評審代理驗證每個任務可解。驗證器在不見參考解的前提下建立,並對照 oracle、no-op 與未解狀態測試,以降低獎勵捷徑。
該系統仍需人工審核,Z.ai 明確表示更自動化的環境生成與驗證仍是未來工作。這一保留增強了主張的可信度:這是一個大型訓練管線,而非宣稱合成環境已完全自我治理。
2. 更強的長期程式設計能力
GLM-5.3 在倉庫級工作、終端任務、機器學習基礎設施、效能優化與多步軟體交付上有所提升。在 Z.ai 的內部評測 Code Bench(旨在反映真實使用情境)中,GLM-5.3 相較 GLM-5.2 約提升 50%。
效率與分數同等重要。在 Max 努力等級下,GLM-5.3 以約 75K 輸出 Token 達到 34.5%,而 GLM-5.2 以 96K 達到 23.4%。也就是品質提升 11.1 個百分點,輸出 Token 約減少 22%。在 High 努力等級下,GLM-5.3 以約 50K Token 達到 31.4%,在相同第一方圖表中,領先 Claude Opus 4.8 的 29.5%(使用 120K)。Claude Fable 5 在 Max 下仍以 39.5% 領先。
3. 湧現的資安能力
Z.ai 在後訓練中加入了漏洞發現環境。據發佈報告,能力不再侷限於發現孤立缺陷:模型開始能跨越利用鏈的多個階段進行推理。
公開分數展現進步亦顯示限制。GLM-5.3 在 Z.ai 的比較表上於 CyberGym 取得 84.5,GLM-5.2 為 77.2。於 ExploitBench 超過翻倍至 54.4(GLM-5.2 為 24.4),但仍落後 Fable 5 的 78.0 與 GPT-5.6 Sol 的 76.5。在 ExploitGym 中,於標準化兩小時預算完成 105 項任務、六小時完成 130 項,相比 GLM-5.2 的 29 與 39;GPT-5.6 Sol 與 Fable 5 仍明顯領先。
這些能力具雙重用途。組織應限制模型存取、沙箱化工具、記錄操作、要求掃描授權,並在人類介入下進行漏洞驗證與揭露。
4. 三檔力度的「始終開啟」思考
GLM-5.3 支援 low、high 與 max 三種思考力度。不同於 GLM-5.2,GLM-5.3 不再支援關閉思考。既有整合若傳送 thinking.type: "disabled",需先改為 enabled 再切換模型 ID,否則請求將失敗(據 Z.ai 說明)。
互動式編輯與低風險轉換用 low,大型倉庫任務用 high,困難的程式設計或安全分析用 max。較高力度需在延遲與成本上權衡,因為更強的答案不必然是最經濟的答案。
5. 透過 slime 提升訓練吞吐
GLM-5.3 繼續使用 Z.ai 的開源框架 slime,訓練端基於 Megatron,rollout 端基於 SGLang。Z.ai 報告新增了 top-p 遮罩、top-k 與全詞彙的在軌蒸餾、教師切換、快取,以及訓練與 rollout 間更緊密的數值對齊。發佈報告稱平均 log-prob 差異控制在 1e-7 等級,比早期設置低 99.99% 以上。
工作負載感知排程與負載均衡 reportedly 使長期程式設計強化學習的端到端吞吐提升超過 2.3 倍。這些屬於訓練基礎設施改進,而非最終用戶的推理保證,但說明了 Z.ai 如何在一個月內擴展更長且更多樣的軌跡。
6. 為安全審查延後開放權重
Z.ai 將 GLM-5.3 定位為開放權重模型,但發佈當天無法下載。公司表示將在發佈兩週後,經安全評估與加固後釋出。這與 GLM-5.2 的差異不小,後者的 MIT 授權權重已在 Hugging Face 上提供。
對多數團隊而言,託管 API 測試仍是務實的第一步。模型龐大,開放權重並不會移除推理硬體、量化、服務、監控或安全控制的成本。
GLM-5.3 vs GLM-5.2: Benchmark Improvements
以下表格使用 Z.ai 的官方發佈數據。“Change” 為簡單的分數差計算。當 GLM-5.2 的基線較低時,相對百分比可能顯得誇張,故同時展示絕對變化。
| Benchmark | GLM-5.2 | GLM-5.3 | Absolute change | Relative change |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262.1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
Benchmark Improvements: GLM-5.3 vs GLM-5.2 and Competitors
以下數據均為廠商在 Z.ai 官方部落格披露(包含對測試工具、context 長度與採樣的說明)。待權重與更廣泛存取開放後,獨立驗證將隨之而來。
Coding Benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Notes / Competitors |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 與頂尖閉源模型具競爭力 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 開源 SOTA;對比 Fable 5 約 33.7、GPT-5.6 Sol 約 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 強勁躍升 |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (internal, Max effort) | ~34.5% completion @ ~75K tokens | ~23.4% @ ~96K tokens | 約 50% 的整體程式設計體感提升;效率更高 |
在 High 努力等級下,GLM-5.3 以約 50K Token 達到 31.4% 完成率,超過 Claude Opus 4.8(29.5%,120K Token),但仍落後於 Claude Fable 5(Max 下 39.5%)。
Cybersecurity Benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Competitors (approx.) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%,GPT-5.6 Sol: 83.6%(SOTA) |
| ExploitBench | 54.4% | 24.4% | 較前代超過翻倍;閉源模型更高(Mythos 5 約 78%,GPT-5.6 Sol 約 76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 仍領先(181/247) |
增益在利用鏈較上游的環節最大。與中國安全團隊的真實測試中,該模型(建立在 GLM-5.2 工作之上)在 269 個專案中識別出 2,436 個漏洞,其中包含 1,097 個中高嚴重級別問題。部分缺陷可追溯至約 40 年前(最早約 1981 年)。發現記錄於公開的 Z.ai Security Disclosure Ledger 。
Agentic & Other Benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Notes |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 大幅提升 |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | 開源具競爭力 |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | 涵蓋 44 個職業 |
這些結果展示了在長期、多步專業任務上的明顯進步。
Token Efficiency, Thinking Modes, and Practical Behavior
一項低調但重要的改進是 Token 效率。在內部 Code Bench 上,更高的完成率伴隨更少的輸出 Token。對生產環路中的成本與延遲至關重要。
GLM-5.3 始終啟用思考。支援三種力度:low、high 與 max(預設且建議用於程式設計為 max)。不再支援關閉思考;先前設定 thinking.type: "disabled" 的應用需遷移。
Context 仍為穩健的 1M Token,最大輸出至 128K。架構與 GLM-5.2 相同,因此未來自託管的硬體規模可參考既有 GLM-5.2 經驗(在總參數量下,量化後體積仍然可觀)。
對希望立即試驗或在模型之間保持彈性的開發者而言,統一的閘道很實用。CometAPI 列出了 GLM 系列模型(包括 GLM-5.3 在可用時的模型 ID glm-5.3),提供 OpenAI 相容端點、具競爭力的費率、依用量計費,並能在 GLM-5.2、GLM-5.3 與其他眾多前沿與開源模型間切換,無需重寫整合程式碼。這對於進行程式設計代理的 A/B 測試、衡量每個成功任務的實際成本,以及依工作負載導流特別實用。
Who Should Move to GLM-5.3 and How to Evaluate
打造程式設計代理、長期自動化、倉庫級工程流程或防禦性安全工具的團隊應優先評估。更高的完成率、在複雜任務上的更佳 Token 效率與更強的多步代理能力,具有實質意義。
建議的評估路徑:
- 在 GLM-5.2 與 GLM-5.3(或透過 Coding Plan)上,以相同力度等級執行相同內部任務(或固定測試工具)。
- 不僅衡量通過率,還衡量 Token、實際耗時與人類介入率。
- 使用如 CometAPI 的統一 API 層,保持對比低摩擦,並保留回退或選擇性導流的選項。
- 對安全敏感的工作負載,等待完整安全加固後的開放權重,並檢視揭露實務。
一旦權重釋出,對已運行 GLM-5.2 基礎設施的組織而言,自託管將更具吸引力。
Conclusion: Post-Training as the New Scaling Frontier
GLM-5.3 清楚展示了後訓練規模化——更真實的環境、更好的強化學習基礎設施,以及在長軌跡上持續投入算力——能帶來過去看似需要新基礎模型才能達成的能力躍升。程式設計與代理的增益顯著;資安成果多屬湧現,且在偏向發現導向的基準上已具競爭力或領先。
對實務者而言,最務實的結論很直接:在你的實際工作負載上測試模型,以每個成功結果的成本而非榜單名次做權衡,並保持整合的彈性。在你決定多積極採用這些新能力之前,像 CometAPI 這類平台以單一金鑰、OpenAI 相容介面,並能輕鬆在 GLM 系列與競品間切換,能大幅簡化流程。
