重點速覽
GLM-5.3-FlashX 是 Z.ai 的 GLM-5.3-Flash 高速服務變體。於 2026 年 9 月 18 日發佈,目標峰值生成速度最高可達每秒 200 tokens(為供應商報稱的峰值,而非保證或經獨立驗證的倍率),同時保留 GLM-5.3-Flash 的能力基底。 GLM-5.3-FlashX 現已可透過 CometAPI 的與 OpenAI 相容的 chat-completions 端點使用。
關鍵在於,FlashX 主要是服務與推理層面的升級,而非另行文檔化的智能檢查點。其能力基底為 320B-總參數 / 18B-活躍參數的 GLM-5.3-Flash 模型,具備原生多模態輸入、100 萬 tokens 的上下文視窗、混合稀疏 + 線性注意力、工具使用,以及長時程的代理式工作流程。
所報稱的速度與價格倍數係發佈時的主張,並非對所有供應商或請求的保證。生產環境評估應比較首個 token 時間、持續吞吐、p95 延遲、任務完成時間與當前供應商定價。
最後驗證時間:2026 年 9 月 20 日
關鍵要點
- 速度:Z.ai 報稱峰值生成最高可達 200 tokens/s;未提供官方基線或通用倍率,團隊應對自身路由與工作負載進行基準測試。
- 能力基底:FlashX 承襲 320B-總參數 / 18B-活躍參數的 MoE 設計、原生多模態、混合稀疏 + 線性注意力,以及 100 萬上下文的 GLM-5.3-Flash。
- 基準測試:公佈的智能分數屬於 GLM-5.3-Flash;非獨立的 FlashX 基準測試。
- 最佳適配:互動式程式設計代理、瀏覽器/電腦操控循環、視覺編碼、企業助理與其他延遲易累積的多步驟工作流程。
- CometAPI 可用性:GLM-5.3-FlashX 已在 CometAPI 上線,模型 ID 為
glm-5.3-flashx,端點為/v1/chat/completions。
什麼是 GLM-5.3-FlashX?
GLM-5.3-FlashX 可視為 GLM-5.3-Flash 的延遲優化交付層。Z.ai 的發佈訊息著重更快、更順暢的推理,底層 Flash 模型仍是能力基礎。因此,FlashX 有別於新一代模型、蒸餾檢查點或獨立釋出的權重集。
基礎的 GLM-5.3-Flash 模型圍繞高效推理設計。Z.ai 指稱其自新的多模態基礎進行訓練,使用 30 兆 tokens 的多模態語料,並結合 Mixture-of-Experts 路由與混合注意力。FlashX 進一步推動服務層面,建立在為 GLM-5.3-Flash 打造的推理基礎設施之上。
對開發者而言,「什麼是 GLM-5.3-FlashX?」的務實答案是:它是 Z.ai 提供、並現已可透過 CometAPI 統一 API 使用的高吞吐 GLM-5.3-Flash 服務選項。其價值主張是降低互動延遲,而非宣稱模型智能出現新一跳升級。
根據 IT Home 報導的 Zhipu 發佈聲明,GLM-5.3-Flash 最初以匿名名稱「Ox Alpha」面向海外開發者亮相,且用量持續增長。為滿足需求,Zhipu 在約 10 萬片國產加速器晶片的生產基礎上,加大基礎設施投資並優化推理,進而推出 FlashX。該服務保留 GLM-5.3-Flash 的能力基底,同時將供應商報稱的峰值輸出提升至 200 tokens/s。Zhipu 將此發佈定位於智能、價格與速度;對企業與開發者工作負載而言,即一個高吞吐、低延遲的選項,其商業價值應在實際併發下,以持續吞吐、p95 延遲、任務品質與成本加以驗證。
GLM-5.3-FlashX 規格
由於 FlashX 是高速服務變體,其規格表應將繼承自模型的特性與 FlashX 特有的服務特性區分開來。
| 規格 | GLM-5.3-FlashX |
|---|---|
| 供應商 | Z.ai / Zhipu AI |
| 產品定位 | GLM-5.3-Flash 的高速服務選項 |
| 總參數 / 活躍參數 | 約 320B / 每 token 18B,承襲自基礎模型 |
| 架構 | 專家混合(Mixture-of-Experts);混合稀疏 + 線性注意力;mHC |
| 上下文視窗 | 最多 1,048,576 tokens |
| 輸入 / 輸出 | 生產前應針對供應商端點核實精確的模態支援、檔案限制、影片約束與路由特定參數 |
| 推理 | 由底層 GLM-5.3-Flash 模型支援 |
| 推理強度 | 在支援的路由上可設為 low / high / max |
| Thinking | 依路由 / API 而定 |
| 工具 / 函式呼叫 | 支援 |
| 開源權重 | 底層 GLM-5.3-Flash:MIT 授權;FlashX 以託管式服務選項呈現 |
| 宣稱峰值速度 | 最高 200 tokens/s |
| 宣稱相對速度 | 無官方基線或保證倍率;請基準測試所選供應商路由 |
| CometAPI 價格 | 每 100 萬輸入 tokens $60、每 100 萬輸出 tokens $60,於 2026 年 9 月 20 日驗證;請再次確認即時價格 |
| 發佈日期 | 2026 年 9 月 18 日 |
| Z.ai 模型鍵 | GLM-5.3-FlashX / glm-5.3-flashx |
| CometAPI 模型 ID | glm-5.3-flashx |
| CometAPI 端點 | POST /v1/chat/completions |
為何 GLM-5.3-FlashX 比 GLM-5.3-Flash 更快?
速度背後有兩層優化:承襲自 GLM-5.3-Flash 的高效架構,以及圍繞其優化的服務基礎設施。
混合稀疏 + 線性注意力
GLM-5.3-Flash 將用於本地依賴的線性注意力,與用於從更廣上下文檢索相關資訊的稀疏注意力相結合。Z.ai 亦描述了 IndexPool,通過加權池化將四個已快取的 indexer key 向量壓縮為一個。依 Z.ai 公佈的對比,與 GLM-5.3 在長上下文下相比,這些改動大約將注意力計算降低約 3.0×,將 KV 快取大小降低約 4.4×。
Z.ai 的 GLM-5.3-Flash 架構章節。
推理基礎設施
Z.ai 表示生產中的 GLM-5.3-Flash 流量運行於逾 10 萬片中國製 AI 加速器的叢集上。其服務棧包含張量並行、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 快取量化、Layer Split,以及 Encode–Prefill–Decode 解耦架構。該公司報告相較於其初始基線,在同一硬體上端到端服務約有 3× 的改進。
因此,FlashX 可視為持續推理優化的產品化:模型端降低計算與快取成本,而 FlashX 在此之上增加更具進取性的低延遲服務層。
GLM-5.3-FlashX 有多快?
Z.ai 報稱峰值生成速度最高可達 200 tokens/s。應將此視為服務最大值主張,而非保證的持續速率:請在生產路由上驗證首個 token 時間、持續輸出速度、p95 延遲、任務完成與錯誤率。
“Up to 200 tokens/s” 是峰值服務數據,並非對每個請求的保證。實際吞吐取決於提示長度、推理強度、輸出長度、多模態前處理、併發、工具呼叫、區域與供應商負載。
實用的生產度量包括首個 token 時間、持續輸出 tokens 每秒、p95 延遲與端到端任務完成時間。任務完成時間對代理尤為重要,因為一個 20 步的工作流程可能需要支付 20 次的生成延遲。
GLM-5.3-FlashX 在基準測試上的表現如何?
發佈時未公佈 FlashX 特有的智能基準測試套件。FlashX 被文檔為推理與服務的優化,因此其經過驗證的差異點在於吞吐,而非新的任務品質分數。
相關結果屬於底層的 GLM-5.3-Flash 模型,可作為能力背景參考;但它們並非 FlashX 測量,因為 FlashX 並未單獨公佈檢查點、評測工具與任務品質跑分。
做出部署決策時,請在相同提示、推理強度與工具設定下,分別測試 FlashX 與 Flash,並比較任務成功率、首個 token 時間、持續吞吐、p95 延遲與每個完成工作流程的總成本。
GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3
| 維度 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 定位 | 高速服務層 | 以效率為先的多模態模型 | 旗艦能力層 |
| 上下文 | 最多 1M | 1M | 在支援的路由上為 1M 級別 |
| 總參數 / 活躍參數 | 承襲 320B / 18B 基底 | 320B / 18B | 更大的旗艦組態 |
| 峰值輸出速度 | 報稱最高 200 tokens/s | 依供應商而定的基線 | 依供應商而定 |
| 相對於 Flash 的價格 | 約 2.5×(宣稱) | 1× | 高於 Flash |
| 開源權重 | 服務層;基礎權重為開源 | 是,MIT | 視發佈而定 |
| 推理與工具 | 承襲自 Flash;請確認路由控制 | 支援 | 旗艦級推理層 |
| CometAPI 可用性 | 可用 | 可用 | 可用 |
| 最適用 | 互動式低延遲代理 | 高量、成本敏感的多模態工作 | 追求最高能力的 GLM 工作負載 |
CometAPI 現已同時提供 GLM-5.3-FlashX API、GLM-5.3-Flash API 與 GLM-5.3 API。這使得透過單一整合比較延遲、成本與任務品質成為可能。
基於工作負載的比較
| 情境 | Flash | FlashX |
|---|---|---|
| 批次處理 | ✓ | |
| 成本敏感的高量工作負載 | ✓ | |
| 互動式聊天 | ✓ | |
| 程式設計代理 | ✓ | |
| 瀏覽器代理 | ✓ | |
| 人在回路 | ✓ | |
| 長時間自動化任務 | ✓ | 視情況而定 |
| 對延遲敏感的 API | ✓ | |
| 高輸出體量 | ✓ | |
| 最大化回應速度 | ✓ |
GLM-5.3-FlashX 費用是多少?
CometAPI 將 GLM-5.3-FlashX 列為每 100 萬輸入 tokens $60、每 100 萬輸出 tokens $60。其比較表顯示官方參考價格為每 100 萬輸入 tokens $75、每 100 萬輸出 tokens $75。價格可能變動,預算前請確認即時模型頁面。
| 用量 | CometAPI 價格 | 官方參考價格 |
|---|---|---|
| 輸入 | $60 / 1M tokens | $75 / 1M tokens |
| 輸出 | $60 / 1M tokens | $75 / 1M tokens |
範例成本計算
對於使用 100M 輸入 tokens 與 20M 輸出 tokens 的工作負載,目前 CometAPI 估算為:100 × $60 + 20 × $60 = $7,200。按官方參考價,則為 100 × $75 + 20 × $75 = $9,000。
在上述顯示的費率下,FlashX 應保留用於延遲對收入、用戶體驗或序列式代理完成時間造成實質影響的工作流程。批次處理與成本敏感的高體量任務,應與較便宜的 Flash 路由進行基準比較。
依供應商政策,推理 tokens 也可能計入計費的輸出用量;請根據實際使用日誌估算成本,而非僅依可見答案長度。
GLM-5.3-FlashX 的最佳使用情境
即時程式設計代理
程式設計代理會反覆生成文字、呼叫工具、檢視結果、修改檔案、執行測試並迭代。更快的生成可降低動作之間的閒置時間。
瀏覽器與電腦操控代理
多模態輸入使模型能在推理循環中利用螢幕截圖與介面狀態。由於瀏覽器自動化在觀察、決策、行動與再觀察之間快速切換,低延遲至關重要。
視覺編碼與 UI 疊代
模型可檢視渲染後的介面、與需求比對、編輯程式碼並再次檢視結果。更快的推理能縮短視覺回饋迴路。
互動式企業助理
面向客戶的助理、內部副駕、研究代理與文件代理往往每輪都有真人在等待。相較於夜間批次處理,此處更容易為延遲溢價找到理由。
長上下文的互動工作
100 萬 tokens 的上下文視窗有利於大型程式庫、長報告與長期代理歷史,而這些情境通常仍需要即時回應性。
GLM-5.3-FlashX 是否可在 CometAPI 使用?
是。GLM-5.3-FlashX 已在 CometAPI 上線。模型頁面顯示其可透過生產 /v1/chat/completions 端點使用,且文件化的模型 ID 為 glm-5.3-flashx。開發者可使用與其他 CometAPI 文字模型相同、與 OpenAI 相容的整合方式。
訪問細節、價格、限制與支援的模態可能變動。CometAPI 即時模型頁是當前路由的權威來源。
何時不值得選用 FlashX
- 離線或批次工作負載:當無人等待回應時,成本更低的 Flash 服務可能提供更好的經濟性。
- 成本敏感的高體量生成:即便作業更快完成,FlashX 顯示的 token 價格也可能主導總工作流程成本。
- 受模型品質而非延遲限制的任務:FlashX 並無獨立的官方智能基準,因此不應作為已被證實的能力升級購買。
- 瓶頸在其他環節的工作流程:檢索、工具、瀏覽器、資料庫與人工審批可能主導端到端延遲,從而降低更快生成帶來的價值。
- 自託管或開源權重需求:FlashX 作為託管式服務層呈現;若需部署控制,請使用底層 GLM-5.3-Flash 權重。
- 嚴格的吞吐保證:
GLM-5.3-FlashX 的限制
- 200 tokens/s 為最大廣告速度,並非保證的持續速率。
- 報稱價格高於 Flash,且會隨供應商而異。
- 尚無獨立的 FlashX 智能基準測試套件。
- 標準輸出為文字,而非原生圖片或影片生成。
- 100 萬 tokens 的上限並不消除對檢索、上下文選擇與延遲治理的需求。
- 供應商特定的頻率限制、輸出限制、模態與實際吞吐可能與 Z.ai 的服務不同。
是否應該使用 GLM-5.3-FlashX?
當 GLM-5.3-Flash 的能力已足夠、但對互動式工作流程而言過慢時,GLM-5.3-FlashX 最具吸引力。此次發佈改變的是延遲經濟學,而非核心能力敘事。
當 token 成本佔主導且可接受較慢生成時,選擇 GLM-5.3-Flash。當人的等待時間或代理循環的延遲成本高於服務溢價時,選擇 FlashX。若更看重旗艦能力而非成本或延遲,則考慮 GLM-5.3。
對已使用統一閘道的團隊,務實的下一步是將同一具代表性的工作負載分別在 CometAPI 的 GLM-5.3-FlashX 與 GLM-5.3-Flash 上跑一遍,然後比較 p95 延遲、任務成功率與每個完成工作流程的總成本。
GLM-5.3-FlashX 常見問題
什麼是 GLM-5.3-FlashX?
GLM-5.3-FlashX 是 Z.ai 基於 GLM-5.3-Flash 能力基底的高速服務選項。其重點在於降低延遲與提升輸出吞吐,而非另行宣佈的模型智能躍升。
GLM-5.3-FlashX 是新檢查點嗎?
Z.ai 對外資料強調推理與基礎設施優化。FlashX 未公佈獨立的參數規模、權重釋出或智能基準套件。
GLM-5.3-FlashX 是否支援多模態輸入?
底層的 GLM-5.3-Flash 能力基底為多模態。實際支援的模態與路由請於部署前向供應商確認。
GLM-5.3-FlashX 的權重是否開源?
底層 GLM-5.3-Flash 權重以 MIT 授權提供。FlashX 作為高速託管服務選項呈現,並非獨立釋出的權重檢查點。
是否有獨立的 GLM-5.3-FlashX 基準分數?
發佈時沒有單獨的智能基準測試。當前任務品質基準屬於 GLM-5.3-Flash。
