FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-model/CometAPI 研究

GLM-5.3 解析:功能、基準測試、定價 & 存取

GLM-5.3 是什麼?探索 Z.ai 最新的 AI 編碼模型,包括功能、基準測試、定價、API 存取與資安能力。

CometAPI
AnnaAI 模型與 API 研究團隊
更新於 Aug 15, 2026 5 分鐘閱讀
GLM-5.3 解析:功能、基準測試、定價 & 存取
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR GLM-5.3 是 Z.ai 最新的旗艦 AI 模型,於 2026 年 8 月 14 日發佈,重點聚焦於軟體工程、自主代理、長時程任務與資安。

不同於傳統的模型升級,GLM-5.3 與 GLM-5.2 保持相同的底層基座模型。Z.ai 表示主要收益來自於大規模的後訓練,使用真實世界的專家工作流程,而非單純擴大模型規模。

重點結果相當顯著。Z.ai 報告在其內部 Code Bench 上,相較 GLM-5.2 的程式碼表現提升 50%;公開基準方面,DeepSWE v1.1 得分 66.9,較 GLM-5.2 的 46.2 提升,Agents’ Last Exam(CLI)達到 28.5,較 23.8 提升。資安方面,GLM-5.3 在 CyberGym 上取得 84.5%,略高於 Anthropic 的 Mythos 5 的 83.8%,而 ExploitBench 從 24.4% 提升至 54.4%。

Key Takeaways

  • GLM-5.3 與 GLM-5.2 使用相同的基座模型;所有改進來自於在長時程環境上的大規模後訓練。
  • 程式碼表現大幅躍升:Terminal-Bench 3.0 從 4.6 → 28.3;DeepSWE v1.1 從 46.2 → 66.9;在 Z.ai 內部 Code Bench 約提升 50%,且 token 效率更高。
  • 湧現的資安能力: CyberGym 84.5%(SOTA),ExploitBench 提升逾倍(24.4% → 54.4%)。在 269 個專案中實際發現 2,436 個弱點(1,097 個為中至高嚴重等級)。
  • 規格:僅文字、1M 上下文、最多 128K 輸出 token、始終開啟的思考模式,提供低/高/最大努力等級。
  • 可用性:現已於 GLM Coding Plan 與 ZCode 上線;API 與類 MIT 開放權重將在發佈後約 2 週於安全審查後提供。
  • 對代理型工程、長時程編碼與防禦性安全研究具有強大定位。
  • CometAPI 透過單一相容 OpenAI 的 API 提供更廣泛 GLM 系列(及 500+ 模型)的便捷且折扣的存取——在等待原生 GLM-5.3 端點期間尤為理想。

What Is GLM-5.3?

GLM-5.3 是 Z.ai(原 Zhipu AI)於 2026 年 8 月發佈的最新旗艦大型語言模型。它屬於 GLM(General Language Model)家族,從早期的 ChatGLM 演進為一系列強大的開放權重模型,針對編碼、推理與代理型工作流程進行了優化。

不同於完整的前訓練革新,GLM-5.3 建立在與前代 GLM-5.2 完全相同的基座模型上(大型 Mixture-of-Experts 架構,總參數約 743–7440 億,每個 token 啟用約 400 億)。所有性能提升來自極端擴大的後訓練:多數倍的長時程任務環境、更多元的環境、以及在強化學習(RL)與相關技術上投入顯著更多算力。

Z.ai 表示 其目標是超越「vibe coding」,邁向真正的「代理型工程」——模型不只是產生孤立的程式片段,而是能承擔實質、跨數日的專業工作單元。訓練環境現在包含真實的生產情境(例如:診斷 ML 訓練堆疊中的瓶頸、實作最佳化、執行實驗,並在保持正確性的前提下交付可量化的端到端加速)。

從 GLM-5.2 延續並擴大的核心技術棧包括:

  • 用於高效長上下文處理的 IndexShare
  • 用於長時程任務 RL 的 SAO(含壓縮)
  • 用於大規模訓練的 slime(開源非同步 RL 框架)

該模型僅支援文字(輸入/輸出皆為文字),提供穩固的 100 萬 token 上下文視窗,並允許最多 128K 輸出 token。思考模式始終啟用,並可調整努力等級:lowhighmax(預設且建議於編碼使用 max)。不再支援關閉思考。

Core Features of GLM-5.3

  • 前沿的編碼與代理能力:專為複雜軟體工程、終端操作、多步驟代理任務與可跨時/日的長時程工作流程設計。
  • 1M 無損上下文:對專案級程式碼庫、文件與多檔推理具有強勁保留力。
  • 多種思考模式:始終開啟的推理,可透過低/高/最大努力在深度與延遲/成本間取得平衡。
  • 串流、函式呼叫、結構化輸出與上下文快取:面向生產的代理工具支援。
  • 新興的資安強項:強勁的白箱弱點發掘能力,並持續提升多階段利用規劃(主要面向防禦用途)。
  • token 效率提升:在等同或更高的表現下,較 GLM-5.2 以更少的輸出 token 取得更好結果。
  • 開放權重路線圖:在發佈後約 2 週,於完成針對新資安能力的安全評估與強化後,以寬鬆授權(延續 GLM-5.x 的 MIT 範式)釋出權重。

這些特性使 GLM-5.3 成為打造編碼代理、自主工程系統與安全研究工具的強勢競爭者。

GLM-5.3 Benchmark Improvements: GLM-5.3 vs GLM-5.2

評估 GLM-5.3 最有用的方式,是查看 Z.ai 提供的前後對照基準。

GLM-5.3 解析:功能、基準測試、定價 & 存取

來源 x

What the Benchmark Data Actually Says

首先,相較於 GLM-5.2 的升級相當全面。Z.ai 的對照表中,GLM-5.3 在每一項都更好。相對變化最大的出現在基線較低但難度高的任務,例如 Terminal-Bench 3.0、ExploitGym 與 ExploitBench。這與 Z.ai 的說法一致:更先進的長時程環境將能力推升至更高難度曲線。

其次,GLM-5.3 具競爭力,但並非在所有領域都領先。它在 CyberGym(84.5)、AutomationBench(48.2)與 GDPval-AA v2(1769 Elo)領先全表;在 Agents’ Last Exam CLI 上與 GPT-5.6 Sol 幾乎持平,28.5 對 28.6。然而,GPT-5.6 Sol 在 Terminal-Bench 3.0 得分 34.6、DeepSWE 72.7,Fable 5 則為 33.7 與 69.7。在 ExploitBench 上,兩者皆領先 GLM-5.3 逾 20 分。

第三,框架與預算細節很重要。Z.ai 在不同基準上的設定各異:上下文從 30 萬到 100 萬 token、最大輸出從 64K 到 163,840 token、逾時最長達 10 小時。數個測試使用 Claude Code 2.1.207 作為代理框架。ExploitGym 的時間預算也依各模型吞吐量進行標準化。這些選擇都有記錄,但意味著分數衡量的是模型加框架的系統,而非抽象的智力本身。

How to Access GLM-5.3

在發佈時,存取仍在逐步開放中。

Z.ai 的官方文件目前表示:

“The GLM-5.3 API is coming soon.”

同時,GLM-5.3 已提供給 GLM Coding Plan 使用者。

Z.ai 的 Coding Plan 文件 表示該服務支援 GLM-5.3 與其他 GLM 模型,並可搭配 Claude Code、Cline、OpenCode 及相關工具的編碼環境使用。

官方的 ZCode 文件也描述了透過 Z.ai 與 BigModel 帳戶整合 GLM-5.3。

GLM-5.3 Pricing

定價是開發者需要留意的一環。

在本文發佈時,因 API 仍標示為「即將推出」,Z.ai 尚未在官方 GLM-5.3 API 文件中公佈一般的 GLM-5.3 API 定價。

目前開發者可透過 GLM Coding Plan 存取該模型。

Z.ai 現行方案頁面標示以下起始價格:

PlanAdvertised pricePositioning
Lite$12.60/month promotional / $18 standardLightweight development
Pro$56/month promotional / $80 standardProfessional workloads
MaxHigher tierHigh-volume workloads

*價格與促銷可能變動;購買前請查核 Z.ai 即時定價頁面。

重要的是,以上為「編碼訂閱價格」,並不等同於每 token 計價的 API 定價。

一旦一般 GLM-5.3 API 可用,開發者應比較:

  • 輸入 token 成本
  • 輸出 token 成本
  • 推理 token 成本
  • 快取輸入定價
  • 上下文視窗定價
  • 速率限制
  • 工具呼叫成本
  • 批次定價
  • 企業條款

而非僅比較訂閱價格。


GLM-5.3 Comparison Table: Which Model Fits Which Workload?

ModelStrong signals in Z.ai's tableRelative weakness in the same tablePractical fit
GLM-5.3在 CyberGym、AutomationBench 與 GDPval-AA v2 領先;相較 5.2 有大幅提升在若干原始編碼與利用測試上落後於 Fable 5 與 GPT-5.6 Sol成本敏感的編碼代理、自動化、防禦性安全評估、長時程工程
GLM-5.2成熟的開放權重、MIT 授權、1M 上下文在最新的高難度基準上遠遜於 5.3目前可自託管、可重現的開放部署、較低風險的遷移路徑
Kimi K3DeepSWE 略高;Toolathlon 表現強在 CyberGym、AutomationBench 與 GDPval-AA v2 低於 GLM-5.3在 Kimi 已適配之堆疊下的長上下文編碼與代理評估
Claude Fable 5Terminal-Bench 3.0、DeepSWE、ExploitBench 與 ExploitGym 得分更高在 AutomationBench、CyberGym 與 GDPval-AA v2 較低當價格次要、追求最高難度編碼與利用研究
GPT-5.6 SolTerminal-Bench 3.0、DeepSWE、HLE with tools 與 ExploitGym 得分最高在 AutomationBench、CyberGym 與 GDPval-AA v2 較低以高端路線面向前沿通用編碼與長時程代理

這並非通用排名。正確的生產指標是你自身任務上每個可接受結果的成本,包含重試、延遲、工具失敗與人工修正。

Should You Use GLM-5.3?

若你的工作負載包含版本庫規模的編碼、自動化、長時間工具使用或防禦性安全,GLM-5.3 值得嚴肅評估。相較 GLM-5.2 的升級過於廣泛,不能僅以基準噪音解釋;而在 Z.ai 私有編碼測試上的 token 效率結果,重要性可能與原始分數同等。

它並非自動取代所有模型。Z.ai 自身的對照表顯示,在若干高難度的編碼與利用基準上,Fable 5 與 GPT-5.6 Sol 仍領先。GLM-5.2 目前仍較易自託管。互動式、延遲敏感的功能也可能更偏好更快、可選或可關閉推理的模型。

對多數企業而言,務實路徑是先透過託管 API 測試 GLM-5.3,在真實任務上比較,並進行選擇性路由。當你需要依用量計費、20% 的標示折扣,以及能在同一作業層取得替代模型時,CometAPI 尤其相關。在行動前請先查看即時目錄,因為本文反映的是發佈當天的產品狀態,可能快速變動。

The Bottom Line

GLM-5.3 是 2026 年 8 月最具代表性的開放權重 AI 發佈之一,因為它改變了「模型改進」的意涵。Z.ai 並未宣佈更大的模型,而是保留 GLM-5.2 的基座,並更大力度地在真實工程工作流程上進行後訓練。

結果令人印象深刻:

  • 在 Z.ai 的 Code Bench 上,程式碼表現提升 50%
  • DeepSWE v1.1 從 46.2 → 66.9
  • Agents’ Last Exam 從 23.8 → 28.5
  • ExploitBench 從 24.4 → 54.4
  • CyberGym 達到 84.5%
  • 1M-token 上下文
  • 128K 最大輸出
  • 更強的代理與工具使用能力

目前可透過 Z.ai 的 Coding Plan 存取該模型,而一般 API 仍在路上。開放權重預計在進一步的安全評估後釋出。對開發者而言,最大的機會不僅是問 GLM-5.3 是否在排行榜上勝過其他模型。

更好的問題是:

GLM-5.3 能否以更少的人為介入、更低的總成本與可接受的延遲,完成你真實的工程工作流程?

這才是重要的基準。

對已在嘗試 GLM 模型的團隊而言,CometAPI 透過既有的 GLM-5.2 API 整合提供了實用的起點。隨著 GLM-5.3 在第三方平台上線,統一的 API 方式可讓你更容易在不重建整個應用堆疊的情況下,將 GLM-5.3 與其他推理與編碼模型進行比較。

Explore GLM models on CometAPI

FAQs About GLM-5.3

What is GLM-5.3?

GLM-5.3 是 Z.ai 於 2026 年 8 月推出的推理模型,面向複雜編碼、長時程代理、自動化與資安。它使用與 GLM-5.2 相同的基座模型,性能提升歸因於在更多、且更困難的可執行環境上進行擴尺度後訓練。

Is GLM-5.3 better than GLM-5.2?

在 Z.ai 的 GLM-5.3 發佈對照表中,每個基準上都是。例子包括 Terminal-Bench 3.0 從 4.6 升至 28.3、DeepSWE 從 46.2 升至 66.9、AutomationBench 從 26.2 升至 48.2、ExploitBench 從 24.4 升至 54.4。

Is GLM-5.3 open source?

Z.ai 稱其為開放權重模型,但發佈日未提供權重。官方表示將在 8 月 14 日發佈後兩週釋出權重,待完成安全評估與強化。

Why is GLM-5.3 notable for cybersecurity?

Z.ai 報告在 CyberGym 得分 84.5、ExploitBench 54.4,並在標準化的 2 小時/6 小時預算下完成 ExploitGym 105/130 項任務。該模型相較 GLM-5.2 有大幅提升,但安全相關輸出仍需授權、沙盒化、專家審查與協調式揭露。

How can I access the GLM-5.3 API?

Z.ai 透過其 Coding Plan 與 ZCode 提供 GLM-5.3。CometAPI 列出模型 ID glm-5.3,並提供相容 OpenAI 的生產端點。

Does GLM-5.3 support a 1M-token context window?

Z.ai 在部分 GLM-5.3 基準中以 1M 上下文進行評估,且 GLM-5.3 與 GLM-5.2 共用基座模型,其主打特性即為 1M 上下文。

Does GLM-5.3 support vision or image input?

官方發佈文未確認視覺能力。CometAPI 目前列示為文字輸入與文字輸出,因此除非 Z.ai 或 API 提供方公佈多模態規格,開發者應將 GLM-5.3 視為僅文字。

Is GLM-5.3 the best model for coding?

它是 Z.ai 發佈對照中最強的模型之一,且相較 GLM-5.2 有大幅改善,但並非在每個編碼基準上居首。GPT-5.6 Sol 與 Fable 5 在 Terminal-Bench 3.0 與 DeepSWE 得分更高,因此最佳模型取決於工作負載、延遲、價格與可接受結果率。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Aug 14, 2026
最後更新 Aug 15, 2026
10 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多