GLM-5.3-Flash 的技術規格
| 規格 | GLM-5.3-Flash |
|---|---|
| 供應商 | Z.ai (Zhipu AI) |
| 模型家族 | GLM-5 |
| 模型類型 | 原生多模態的專家混合(MoE)模型 |
| 總參數量 | 320B |
| 啟用參數量 | 18B |
| 架構 | 混合稀疏 + 線性注意力 |
| 上下文長度 | 1,048,576 tokens (1M) |
| 最大輸出 | 131,072 tokens |
| 輸入模態 | 文字、圖片、影片 |
| 輸出模態 | 文字 |
| 推理 | 支援 |
| 視覺 | 支援 |
| 函式呼叫 | 支援 |
| 工具使用 | 支援 |
| 網路搜尋 | 透過支援的 API 整合提供支援 |
| 開放權重 | 是 |
| 授權條款 | MIT |
| 發佈 | 2026 年 8 月 26 日 |
Z.ai 將 GLM-5.3-Flash 描述為 GLM-5 家族中第一個原生多模態模型。它包含 320B 的總參數,但每個推論步驟僅啟用 18B 參數。該模型引入結合稀疏與線性注意力的混合架構,並使用 mHC 以提升擴展效率。
GLM-5.3-Flash 是什麼?
GLM-5.3-Flash 是 Z.ai 的效率導向 GLM-5 成員,旨在以顯著較低的推論成本,結合前沿級推理與代理型程式設計能力。
其與傳統「Flash」模型的最重要差異在於,Flash 並不代表小模型。GLM-5.3-Flash 具有 320B 的總參數,但其 MoE 架構每個 token 只啟用 18B 參數。這讓 Z.ai 能在保留大型參數池以維持模型容量的同時,將推論計算成本降得更低。
它也是首個具原生多模態能力的 GLM-5 模型。該模型在文字之外支援視覺輸入,定位於程式設計、瀏覽器互動、文件理解、視覺輔助程式設計與代理型工作流程。
Z.ai 表示 GLM-5.3-Flash 是基於新訓練的基礎模型所打造,而非 GLM-5.2 的簡單壓縮版。其訓練使用了30 兆 token 的多模態預訓練語料庫,同時圍繞能力與推論效率重新設計了架構。
GLM-5.3-Flash 的主要特性
- 320B MoE,啟用 18B 參數: GLM-5.3-Flash 結合了極大的總參數容量與相對較小的啟用參數占比,使其比稠密的 320B 模型在部署上顯著更高效。
- 原生多模態理解: 與較早的 GLM-5 模型不同,GLM-5.3-Flash 原生處理視覺輸入。其 model card 提供了圖像理解範例,並明確標示該模型為多模態。
- 1M-token 上下文: 該模型面向大型倉庫、海量文件、長代理軌跡與複雜多步工作流程等長上下文應用。Cloudflare 與 Vercel 均標示 1,048,576-token 的上下文視窗。
- 混合稀疏 + 線性注意力: GLM-5.3-Flash 是首個結合稀疏注意力與線性注意力的 GLM 模型。Z.ai 指出此架構在保留精確長上下文能力的同時,降低長上下文的服務成本。
- 代理型程式設計與工具使用: 該模型針對軟體工程、終端機任務、瀏覽器互動與工具驅動的工作流程進行優化。其在 Terminal-Bench 2.1 的分數為 84.3。
- 開放權重部署: MIT 授權的權重可搭配 Transformers、vLLM、SGLang、TokenSpeed 與 KTransformers 部署,為開發者提供自託管與推論最佳化選項。
GLM-5.3-Flash 的基準測試表現
GLM-5.3-Flash 在程式設計與代理型基準測試上表現尤為強勁。
| 基準測試 | GLM-5.3-Flash | GLM-5.2 | 備註 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | 終端機/代理型程式設計 |
| DeepSWE v1.1 | 63.4 | 46.2 | 軟體工程 |
| AutomationBench | 48.8 | 26.2 | 電腦操作自動化 |
| Toolathlon-Verified | 78.4 | 59.9 | 工具使用能力 |
| NL2Repo-Bench | 56.3 | 48.9 | 自然語言到程式庫的程式設計 |
| Agent's Last Exam | 26.3 | 20.4 | 代理型推理 |
| Humanity's Last Exam | 55.3 | — | 搭配工具 |
| GDPval-AA v2 | 1773 Elo | 1504 Elo | 生產力/知識工作 |
| OfficeQA-Pro | 62.4 | — | 多模態生產力 |
| CharXiv RQ | 89.4 | — | 多模態推理 |
官方 Hugging Face 評測部分列出 Terminal-Bench 2.1 的 84.3、DeepSWE 的 63.4,以及 HLE 的 55.3。Z.ai 的發佈材料還報告了包括 AutomationBench、Toolathlon、NL2Repo 與 GDPval 等額外結果。
獨立的 Artificial Analysis 目前給予 GLM-5.3-Flash Intelligence Index 為 57,在其當前的 108 個模型比較集中排名第 3。
這些數字仍應搭配基準測試特定的注意事項解讀:多項結果為廠商報告,評測工具存在差異,且基準分數不應被視為模型品質的通用排名。
GLM-5.3-Flash 對比 GLM-5.3 與 GLM-5.2
| 特性 | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| 模型世代 | GLM-5 | GLM-5 | GLM-5 |
| 定位 | 高效多模態/代理型模型 | 高端通用推理模型 | 上一代通用模型 |
| 原生視覺 | 是 | 否 | 視模型而定 |
| 總參數量 | 320B | 更大旗艦配置 | 大規模模型 |
| 啟用參數量 | 18B | — | — |
| 上下文 | 1M | 200K 級部署 | 200K 級部署 |
| 混合稀疏/線性注意力 | 是 | 否 | 否 |
| 代理型程式設計 | 極佳 | 極佳 | 強 |
| 開放權重 | 是 | 取決於部署 | 取決於部署 |
| 主要優勢 | 每單位推論計算的能力 | 最大化 GLM-5 的推理能力 | 成熟且成本較低的一代 GLM |
關鍵差異在於,GLM-5.3-Flash 並非僅是縮小版的 GLM-5.3。Z.ai 表示它從新訓練的基礎模型出發,並引入重新設計的混合注意力架構、mHC 與多模態預訓練。
GLM-5.3-Flash vs DeepSeek V4 Flash — 摘要對比
| 面向 | GLM-5.3-Flash (Z.ai / Zhipu) | DeepSeek V4 Flash (DeepSeek) | 優勢 |
|---|---|---|---|
| 發佈日期 | August 26, 2026 | Preview April 2026; major checkpoint (0731) July 31, 2026 | — |
| 總參數/啟用參數 | 320B / 18B | 284B / 13B | GLM 略大 |
| 上下文視窗 | 1M tokens | 1M tokens | 平手 |
| 最大輸出 | ~131K tokens | Up to 384K tokens | DeepSeek |
| 模態 | 原生多模態(文字 + 圖片 + 影片輸入) | 以文字為主(提供實驗性視覺變體) | GLM |
| 架構亮點 | 混合稀疏 + 線性注意力(相較完整 GLM-5.3,注意力計算約降 3×,KV 快取約小 4.4×) | Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) | 各有優勢 |
| 授權 | MIT(權重於 Hugging Face 提供) | MIT(提供權重) | 平手 |
| 標準 API 價格($ / 1M tokens) | 輸入 $0.15 / 輸出 $0.50(快取輸入約 $0.03) | 常見範圍 輸入 $0.14–$0.44 / 輸出 $0.28–$1.32(尖峰/離峰因時段而異) | GLM 較便宜 |
| 上市促銷價格 | 約 $0.075 輸入 / $0.25 輸出(限時,約 2026 年 9 月上旬) | 無對等促銷 | GLM |
| AA 智慧指數 | 57(廠商報告) | 約 50(獨立量測) | GLM |
| Terminal-Bench 2.1 | 84.3 | 82.7 | GLM |
| DeepSWE | 63.4 | 54.4 | GLM |
| SWE-bench Verified | 獨立資料尚有限 | 約 79%(獨立結果強勁) | DeepSeek |
| 主要優勢 | 價格更低、原生多模態、在多項代理/程式設計分數領先、長上下文效率佳 | 獨立驗證更成熟、優秀的程式設計/代理紀錄、長上下文設計高效、生態強 | — |
| 主要弱點 | 新版發佈(部分分數仍為廠商報告);速度屬平均 | 多模態支援較弱;多數路徑的實際價格偏高 | — |
| 最適用於 | 通用用途、多模態工作負載、注重成本的專案、均衡的代理能力 | 純程式設計代理、長上下文文字推理、需要成熟獨立基準的情境 | — |
一句話總結:
截至 2026 年 8 月下旬,GLM-5.3-Flash 目前在價格、多模態能力與多項重疊基準上領先,整體性價比更佳;DeepSeek V4 Flash 憑藉更強的獨立驗證與長上下文效率,仍是偏重程式代理的可靠選擇。建議在您的具體工作負載上同場測試後再行決策。
GLM-5.3-Flash 使用情境
1. 代理型軟體工程
GLM-5.3-Flash 特別適合需要檢視程式庫、修改多個檔案、執行終端機指令、運行測試並迭代實作的程式代理。
其 84.3 的 Terminal-Bench 2.1 與 63.4 的 DeepSWE 成績顯示,軟體工程是其最強的應用領域之一。
2. 視覺程式設計
由於 GLM-5.3-Flash 原生多模態,開發者可在程式指示旁提供螢幕截圖、示意圖與其他視覺輸入。這對 UI 實作、視覺除錯與設計到程式流程十分有用。
3. 長上下文文件分析
1M-token 的上下文視窗讓該模型適合大型技術文件集、程式庫、長篇報告與多階段代理歷程。
4. 瀏覽器與電腦操作代理
模型的工具使用與多模態能力,使其適合涉及瀏覽器、圖形介面與外部工具的工作流程。
5. 企業知識型工作
GLM-5.3-Flash 能處理大量結構化與非結構化資訊,並透過工具執行多步任務,適用於文件分析、研究輔助與流程自動化。
6. 自建 AI 基礎設施
MIT 授權與公開權重,使 GLM-5.3-Flash 對需要掌控部署、資料處理與推論基礎設施的組織具吸引力。
GLM-5.3-Flash API 參數
| 參數 | 說明 |
|---|---|
| model | 供應商特定的模型識別符 |
| messages | 結構化對話輸入 |
| prompt | 在支援的 API 上的單一提示輸入 |
| max_tokens / max_completion_tokens | 輸出 token 上限 |
| temperature | 控制採樣隨機性 |
| tools | 工具/函式定義 |
| stream | 啟用串流輸出 |
| reasoning | 在支援的閘道上控制推理投入 |
| Image content | 支援 |
| Function calling | 支援 |
| Context | 最多 1M tokens |
Vercel AI Gateway 目前文件標示最大全131,000 個輸出 tokens,推理 tokens 會計入輸出上限。
如何在 CometAPI 中使用 GLM-5.3-Flash API
步驟 1:取得 API 存取權
登入 cometAPI。若您尚未成為使用者,請先註冊。登入您的 CometAPI console。取得介面的存取憑證 API key。在個人中心的 API token 項點擊 “Add Token”,取得 token key:sk-xxxxx 並提交。

步驟 2:向 GLM-5.3-Flash API 發送請求
選擇 “GLM-5.3-Flash” 端點發送 API 請求並設定請求主體。請求方法與請求主體可從我們網站的 API 文件取得。我們的網站也提供 Apifox 測試以供方便。將 <YOUR_API_KEY> 替換為您帳戶中的實際 CometAPI key。
將您的問題或請求插入 content 欄位——模型將對其進行回應。處理 API 回應以獲取生成的答案。
步驟 3:處理回應
API 會回傳結構化的候選回應,包括生成文字、引文、安規中繼資料,以及可選的工具輸出。對於多模態請求,當選用的 CometAPI 端點開放模型的視覺能力時,訊息內容可同時包含文字與圖像輸入。
具體的 CometAPI 端點、支援的參數與當前可用性應以即時的 CometAPI API 文件為準,而非從 Z.ai 的原生 API 推測。
在 CometAPI 中,整合時應使用即時 CometAPI 模型端點顯示的 model ID,而不要直接複製 Z.ai、Cloudflare 或 Vercel 的供應商特定 ID。
GLM-5.3-Flash 的限制
- 模型體量龐大: 雖然僅有 18B 參數會被啟用,但釋出的模型約含 321B 參數,較 7B–70B 的常規模型自託管成本顯著更高。
- 推論速度未必「閃電」: Artificial Analysis 目前在其比較環境中量測約每秒 50 個輸出 token,低於最快的小型模型。
- 超長上下文增加基礎設施需求: 1M-token 的上下文固然實用,但可能提高記憶體與服務複雜度。
- 基準表現依任務而異: GLM-5.3-Flash 在代理型程式設計與工具使用基準上尤其強,但沒有單一基準能證明其對所有前沿閉源模型具普遍優勢。
- 多模態輸出受限: 模型的原生多模態主要體現在輸入側;標準輸出為文字,並非生成圖像或影片。