GLM-5.3-Flash 的技術規格
| 規格 | GLM-5.3-Flash |
|---|---|
| 提供方 | Z.ai (Zhipu AI) |
| 模型家族 | GLM-5 |
| 模型類型 | 原生多模態的 Mixture-of-Experts 模型 |
| 總參數量 | 320B |
| 活躍參數量 | 18B |
| 架構 | 混合稀疏 + 線性注意力 |
| 上下文視窗 | 1,048,576 tokens (1M) |
| 最大輸出 | 131,072 tokens |
| 輸入模態 | 文字、圖片、影片 |
| 輸出模態 | 文字 |
| 推理 | 支援 |
| 視覺 | 支援 |
| 函式呼叫 | 支援 |
| 工具使用 | 支援 |
| 網路搜尋 | 透過支援的 API 整合支援 |
| 開放權重 | 是 |
| 授權條款 | MIT |
| 發佈 | 2026 年 8 月 26 日 |
Z.ai 將 GLM-5.3-Flash 描述為 GLM-5 家族中首個原生多模態模型。它擁有 320B 的總參數量,但每個推論步驟僅啟用 18B 參數。該模型引入結合稀疏與線性注意力的混合架構,並使用 mHC 以提升擴展效率。
什麼是 GLM-5.3-Flash?
GLM-5.3-Flash 是 Z.ai 在 GLM-5 世代中定位為效率導向的成員,旨在以顯著更低的推論成本,結合前沿級推理與代理型編碼能力。
其與傳統「Flash」模型最重要的區別在於,Flash 並不代表小模型。GLM-5.3-Flash 具有 320B 的總參數量,但其 MoE 架構在每個 token 僅啟用 18B 參數。這使 Z.ai 能在保留大型參數池以維持模型容量的同時,將推論計算降至更低水準。
它同時也是首個具備原生多模態能力的 GLM-5 模型。該模型在文字之外支援視覺輸入,並面向編碼、瀏覽器互動、文件理解、視覺編碼與代理型工作流程而設計。
Z.ai 表示 GLM-5.3-Flash 並非 GLM-5.2 的簡單壓縮版,而是從新訓練的基礎模型出發。其訓練使用了30 兆 token 的多模態預訓練語料庫,同時在架構上圍繞能力與推論效率進行了重新設計。
GLM-5.3-Flash 的主要特性
- **320B MoE,18B 活躍參數:**GLM-5.3-Flash 將極大的總參數容量與相對較小的活躍參數規模結合,使其相比稠密的 320B 模型在服務上顯著更高效。
- **原生多模態理解:**與早期 GLM-5 模型不同,GLM-5.3-Flash 原生處理視覺輸入。其模型卡提供了圖像理解範例,並將該模型標識為多模態。
- **1M-token 上下文:**該模型面向長上下文應用,如大型代碼庫、龐大文件、漫長的代理歷程與複雜的多步工作流程。Cloudflare 與 Vercel 均列出 1,048,576-token 的上下文視窗。
- **混合稀疏 + 線性注意力:**GLM-5.3-Flash 是首個結合稀疏注意力與線性注意力的 GLM 模型。Z.ai 表示此架構在保留精確長上下文能力的同時,降低長上下文服務成本。
- **代理型編碼與工具使用:**該模型針對軟體工程、終端任務、瀏覽器互動與工具驅動的工作流程進行了優化。其通報的 Terminal-Bench 2.1 分數為 84.3。
- **開放權重部署:**MIT 授權的權重可配合 Transformers、vLLM、SGLang、TokenSpeed 與 KTransformers 部署,為開發者提供自我託管與推論優化的多種選項。
GLM-5.3-Flash 的基準測試表現
GLM-5.3-Flash 在編碼與代理型基準測試上表現尤為強勁。
| 基準測試 | GLM-5.3-Flash | GLM-5.2 | 備註 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | 終端/代理型編碼 |
| DeepSWE v1.1 | 63.4 | 46.2 | 軟體工程 |
| AutomationBench | 48.8 | 26.2 | 電腦使用自動化 |
| Toolathlon-Verified | 78.4 | 59.9 | 工具使用能力 |
| NL2Repo-Bench | 56.3 | 48.9 | 自然語言到程式碼倉庫的編碼 |
| Agent's Last Exam | 26.3 | 20.4 | 代理型推理 |
| Humanity's Last Exam | 55.3 | — | 搭配工具 |
| GDPval-AA v2 | 1773 Elo | 1504 Elo | 生產力/知識型工作 |
| OfficeQA-Pro | 62.4 | — | 多模態生產力 |
| CharXiv RQ | 89.4 | — | 多模態推理 |
Hugging Face 官方評估區段列出 Terminal-Bench 2.1 為 84.3、DeepSWE 為 63.4、HLE 為 55.3。Z.ai 的發佈材料另報告了 AutomationBench、Toolathlon、NL2Repo 與 GDPval 等結果。
Independent Artificial Analysis 目前給予 GLM-5.3-Flash 的智力指數為 57,在其當前的 108 個模型比較集中位列第 3。
這些數據仍應搭配特定基準的注意事項來解讀:部分結果由供應商通報,評估工具鏈各異,基準分數不應被視為模型品質的通用排名。
GLM-5.3-Flash vs GLM-5.3 vs GLM-5.2
| 特性 | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| 模型世代 | GLM-5 | GLM-5 | GLM-5 |
| 定位 | 高效的多模態/代理型模型 | 高端通用推理模型 | 上一代通用模型 |
| 原生視覺 | 是 | 否 | 視模型而定 |
| 總參數量 | 320B | 更大的旗艦配置 | 大規模模型 |
| 活躍參數量 | 18B | — | — |
| 上下文 | 1M | 200K 級部署 | 200K 級部署 |
| 混合稀疏/線性注意力 | 是 | 否 | 否 |
| 代理型編碼 | 極佳 | 極佳 | 強 |
| 開放權重 | 是 | 視部署而定 | 視部署而定 |
| 主要優勢 | 每單位推論計算的能力 | 最大化的 GLM-5 推理能力 | 成熟且成本較低的 GLM 世代 |
關鍵區別在於,GLM-5.3-Flash 並非僅僅是更小的 GLM-5.3。Z.ai 表示其從新訓練的基礎模型出發,並引入重新設計的混合注意力架構、mHC 與多模態預訓練。
GLM-5.3-Flash vs DeepSeek V4 Flash — 比較摘要
| 維度 | GLM-5.3-Flash (Z.ai / Zhipu) | DeepSeek V4 Flash (DeepSeek) | 優勢 |
|---|---|---|---|
| 發佈日期 | 2026 年 8 月 26 日 | 預覽 2026 年 4 月;主要 checkpoint (0731) 2026 年 7 月 31 日 | — |
| 總參數/活躍參數 | 320B / 18B | 284B / 13B | GLM 略大 |
| 上下文視窗 | 1M tokens | 1M tokens | 平手 |
| 最大輸出 | ~131K 個 token | 最多 384K 個 token | DeepSeek |
| 模態 | 原生多模態(文字 + 圖像 + 影片輸入) | 以文字為主(具實驗性視覺變體) | GLM |
| 架構亮點 | 混合稀疏 + 線性注意力(~3× 更低注意力計算,~4.4× 更小 KV cache,相較於完整 GLM-5.3) | Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) | 各有優勢 |
| 授權 | MIT(權重於 Hugging Face 提供) | MIT(權重可用) | 平手 |
| 標準 API 定價($/每 1M token) | 輸入 $0.15 / 輸出 $0.50(快取輸入 ~$0.03) | 常見範圍 輸入 $0.14–$0.44 / 輸出 $0.28–$1.32(尖峰/離峰有所變動) | GLM 更便宜 |
| 上市促銷定價 | ~$0.075 輸入 / $0.25 輸出(限時,約 2026 年 9 月上旬) | 無對等促銷 | GLM |
| AA 智力指數 | 57(供應商通報) | ~50(獨立測量) | GLM |
| Terminal-Bench 2.1 | 84.3 | 82.7 | GLM |
| DeepSWE | 63.4 | 54.4 | GLM |
| SWE-bench Verified | 獨立數據尚有限 | ~79%(獨立結果強勁) | DeepSeek |
| 主要優勢 | 更低價格、原生多模態、在多項代理型/編碼分數領先、長上下文更高效 | 更成熟的獨立驗證、出色的編碼/代理表現、高效的長上下文設計、強大的生態 | — |
| 主要弱點 | 新近發佈(部分分數仍為供應商通報);速度中等 | 多模態支援較弱;多數路徑下的實際價格較高 | — |
| 最適用於 | 一般用途、多模態工作負載、成本敏感專案、均衡的代理能力 | 純編碼代理、長上下文文字推理、需要經過充分獨立基準驗證的場景 | — |
一句話總結:
截至 2026 年 8 月下旬,GLM-5.3-Flash 目前在價格、多模態能力與多個重疊基準上領先,整體性價比更佳。DeepSeek V4 Flash 憑藉更強的獨立驗證與長上下文效率,仍是偏重編碼代理的可靠之選。請在您的特定工作負載上測試兩者後再決定。
GLM-5.3-Flash 使用情境
1. 代理型軟體工程
GLM-5.3-Flash 尤其適合需要檢視代碼庫、修改多個檔案、執行終端命令、運行測試並迭代實作的編碼代理。
其 84.3 的 Terminal-Bench 2.1 與 63.4 的 DeepSWE 成績顯示,軟體工程是其最強的應用領域之一。
2. 視覺編碼
由於 GLM-5.3-Flash 原生支援多模態,開發者可在編碼指示旁提供截圖、圖表與其他視覺輸入。這對於 UI 實作、視覺除錯與設計到代碼的流程十分有用。
3. 長上下文文件分析
1M-token 的上下文視窗使該模型適用於龐大的技術文件集、代碼庫、冗長報告與多階段代理歷史。
4. 瀏覽器與電腦操作代理
模型的工具使用與多模態能力,適合涉及瀏覽器、圖形介面與外部工具的工作流程。
5. 企業知識型工作
GLM-5.3-Flash 能處理大量結構化與非結構化資訊,並藉由工具執行多步任務,適用於文件分析、研究輔助與流程自動化。
6. 自我託管的 AI 基礎設施
MIT 授權與公開權重使 GLM-5.3-Flash 對需要掌控部署、資料處理與推論基礎設施的組織具吸引力。
GLM-5.3-Flash API 參數
| 參數 | 說明 |
|---|---|
| model | 提供者特定的模型識別符 |
| messages | 結構化的對話輸入 |
| prompt | 在支援的 API 上的單一提示輸入 |
| max_tokens / max_completion_tokens | 輸出 token 限制 |
| temperature | 控制取樣隨機性 |
| tools | 工具/函式定義 |
| stream | 啟用串流輸出 |
| reasoning | 在支援的閘道上控制推理強度 |
| Image content | 支援 |
| Function calling | 支援 |
| Context | 最多 1M tokens |
Vercel AI Gateway 目前記載的最大輸出為131,000 個 token,其中推理 token 也會計入輸出上限。
如何在 CometAPI 中使用 GLM-5.3-Flash API
步驟 1:取得 API 存取權
登入 cometAPI。若您尚未成為使用者,請先註冊。登入您的 CometAPI console。取得介面的存取認證 API key。在個人中心的 API token 處點擊「Add Token」,取得 token key:sk-xxxxx 並提交。

步驟 2:向 GLM-5.3-Flash API 發送請求
選擇「GLM-5.3-Flash」端點發送 API 請求並設定請求體。請求方法與請求體可從我們網站的 API 文件取得。我們的網站亦提供 Apifox 測試以利使用。將 <YOUR_API_KEY> 替換為您帳號中的實際 CometAPI key。
將您的問題或請求插入 content 欄位——模型將對此做出回應。處理 API 回應以取得生成的答案。
步驟 3:處理回應
API 會回傳結構化的候選回應,包括生成文字、引文、風險控制中介資料與可選的工具輸出。對於多模態請求,當選定的 CometAPI 端點開放模型的視覺能力時,訊息內容可同時包含文字與圖像輸入。
具體的 CometAPI 端點、支援參數與當前可用性,應以即時的 CometAPI API 文件為準,不應從 Z.ai 的原生 API 推斷。
對於 CometAPI,整合時應使用即時 CometAPI 模型端點上顯示的 model ID,而非直接複製 Z.ai、Cloudflare 或 Vercel 的供應商特定 ID。
GLM-5.3-Flash 的限制
- **模型體量大:**雖然僅有 18B 參數處於活躍,但釋出的模型約含 321B 參數,使自我託管的需求遠高於部署一般的 7B–70B 模型。
- **就絕對速度而言未必是「flash」:**Artificial Analysis 目前在其比較環境中測得每秒約 50 個輸出 token,顯著慢於最快的小型模型。
- **超長上下文提升基礎設施要求:**1M-token 的上下文雖然實用,但會增加記憶體與服務複雜度。
- **基準表現依任務而異:**GLM-5.3-Flash 在代理型編碼與工具使用的基準上表現突出,但沒有任何單一基準能對專有前沿模型建立普適性的優越性結論。
- **多模態輸出受限:**模型的原生多模態能力主要體現在輸入端;其標準輸出為文字,而非生成圖像或影片。