GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPI 研究

GLM-5.3-FlashX 是什麼?規格、速度、定價、基準測試與功能

GLM-5.3-FlashX 是什麼,包括 200 tokens 的速度、GLM-5.3-Flash 的能力基礎、1M 的上下文、基準測試、定價、限制以及 CometAPI 存取。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 20, 2026 5 分鐘閱讀
GLM-5.3-FlashX 是什麼?規格、速度、定價、基準測試與功能
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

重點速覽

GLM-5.3-FlashX 是 Z.ai 的 GLM-5.3-Flash 高速服務變體。於 2026 年 9 月 18 日發佈,目標峰值生成速度最高可達每秒 200 tokens(為供應商報稱的峰值,而非保證或經獨立驗證的倍率),同時保留 GLM-5.3-Flash 的能力基底。 GLM-5.3-FlashX 現已可透過 CometAPI 的與 OpenAI 相容的 chat-completions 端點使用。

關鍵在於,FlashX 主要是服務與推理層面的升級,而非另行文檔化的智能檢查點。其能力基底為 320B-總參數 / 18B-活躍參數的 GLM-5.3-Flash 模型,具備原生多模態輸入、100 萬 tokens 的上下文視窗、混合稀疏 + 線性注意力、工具使用,以及長時程的代理式工作流程。

所報稱的速度與價格倍數係發佈時的主張,並非對所有供應商或請求的保證。生產環境評估應比較首個 token 時間、持續吞吐、p95 延遲、任務完成時間與當前供應商定價。

最後驗證時間:2026 年 9 月 20 日

關鍵要點

  • 速度:Z.ai 報稱峰值生成最高可達 200 tokens/s;未提供官方基線或通用倍率,團隊應對自身路由與工作負載進行基準測試。
  • 能力基底:FlashX 承襲 320B-總參數 / 18B-活躍參數的 MoE 設計、原生多模態、混合稀疏 + 線性注意力,以及 100 萬上下文的 GLM-5.3-Flash。
  • 基準測試:公佈的智能分數屬於 GLM-5.3-Flash;非獨立的 FlashX 基準測試。
  • 最佳適配:互動式程式設計代理、瀏覽器/電腦操控循環、視覺編碼、企業助理與其他延遲易累積的多步驟工作流程。
  • CometAPI 可用性:GLM-5.3-FlashX 已在 CometAPI 上線,模型 ID 為 glm-5.3-flashx,端點為 /v1/chat/completions

什麼是 GLM-5.3-FlashX?

GLM-5.3-FlashX 可視為 GLM-5.3-Flash 的延遲優化交付層。Z.ai 的發佈訊息著重更快、更順暢的推理,底層 Flash 模型仍是能力基礎。因此,FlashX 有別於新一代模型、蒸餾檢查點或獨立釋出的權重集。

基礎的 GLM-5.3-Flash 模型圍繞高效推理設計。Z.ai 指稱其自新的多模態基礎進行訓練,使用 30 兆 tokens 的多模態語料,並結合 Mixture-of-Experts 路由與混合注意力。FlashX 進一步推動服務層面,建立在為 GLM-5.3-Flash 打造的推理基礎設施之上。

對開發者而言,「什麼是 GLM-5.3-FlashX?」的務實答案是:它是 Z.ai 提供、並現已可透過 CometAPI 統一 API 使用的高吞吐 GLM-5.3-Flash 服務選項。其價值主張是降低互動延遲,而非宣稱模型智能出現新一跳升級。

根據 IT Home 報導的 Zhipu 發佈聲明,GLM-5.3-Flash 最初以匿名名稱「Ox Alpha」面向海外開發者亮相,且用量持續增長。為滿足需求,Zhipu 在約 10 萬片國產加速器晶片的生產基礎上,加大基礎設施投資並優化推理,進而推出 FlashX。該服務保留 GLM-5.3-Flash 的能力基底,同時將供應商報稱的峰值輸出提升至 200 tokens/s。Zhipu 將此發佈定位於智能、價格與速度;對企業與開發者工作負載而言,即一個高吞吐、低延遲的選項,其商業價值應在實際併發下,以持續吞吐、p95 延遲、任務品質與成本加以驗證。

GLM-5.3-FlashX 規格

由於 FlashX 是高速服務變體,其規格表應將繼承自模型的特性與 FlashX 特有的服務特性區分開來。

規格GLM-5.3-FlashX
供應商Z.ai / Zhipu AI
產品定位GLM-5.3-Flash 的高速服務選項
總參數 / 活躍參數約 320B / 每 token 18B,承襲自基礎模型
架構專家混合(Mixture-of-Experts);混合稀疏 + 線性注意力;mHC
上下文視窗最多 1,048,576 tokens
輸入 / 輸出生產前應針對供應商端點核實精確的模態支援、檔案限制、影片約束與路由特定參數
推理由底層 GLM-5.3-Flash 模型支援
推理強度在支援的路由上可設為 low / high / max
Thinking依路由 / API 而定
工具 / 函式呼叫支援
開源權重底層 GLM-5.3-Flash:MIT 授權;FlashX 以託管式服務選項呈現
宣稱峰值速度最高 200 tokens/s
宣稱相對速度無官方基線或保證倍率;請基準測試所選供應商路由
CometAPI 價格每 100 萬輸入 tokens $60、每 100 萬輸出 tokens $60,於 2026 年 9 月 20 日驗證;請再次確認即時價格
發佈日期2026 年 9 月 18 日
Z.ai 模型鍵GLM-5.3-FlashX / glm-5.3-flashx
CometAPI 模型 IDglm-5.3-flashx
CometAPI 端點POST /v1/chat/completions

為何 GLM-5.3-FlashX 比 GLM-5.3-Flash 更快?

速度背後有兩層優化:承襲自 GLM-5.3-Flash 的高效架構,以及圍繞其優化的服務基礎設施。

混合稀疏 + 線性注意力

GLM-5.3-Flash 將用於本地依賴的線性注意力,與用於從更廣上下文檢索相關資訊的稀疏注意力相結合。Z.ai 亦描述了 IndexPool,通過加權池化將四個已快取的 indexer key 向量壓縮為一個。依 Z.ai 公佈的對比,與 GLM-5.3 在長上下文下相比,這些改動大約將注意力計算降低約 3.0×,將 KV 快取大小降低約 4.4×。

GLM-5.3-FlashX 是什麼?規格、速度、定價、基準測試與功能

Z.ai 的 GLM-5.3-Flash 架構章節

推理基礎設施

Z.ai 表示生產中的 GLM-5.3-Flash 流量運行於逾 10 萬片中國製 AI 加速器的叢集上。其服務棧包含張量並行、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 快取量化、Layer Split,以及 Encode–Prefill–Decode 解耦架構。該公司報告相較於其初始基線,在同一硬體上端到端服務約有 3× 的改進。

因此,FlashX 可視為持續推理優化的產品化:模型端降低計算與快取成本,而 FlashX 在此之上增加更具進取性的低延遲服務層。

GLM-5.3-FlashX 有多快?

Z.ai 報稱峰值生成速度最高可達 200 tokens/s。應將此視為服務最大值主張,而非保證的持續速率:請在生產路由上驗證首個 token 時間、持續輸出速度、p95 延遲、任務完成與錯誤率。

“Up to 200 tokens/s” 是峰值服務數據,並非對每個請求的保證。實際吞吐取決於提示長度、推理強度、輸出長度、多模態前處理、併發、工具呼叫、區域與供應商負載。

實用的生產度量包括首個 token 時間、持續輸出 tokens 每秒、p95 延遲與端到端任務完成時間。任務完成時間對代理尤為重要,因為一個 20 步的工作流程可能需要支付 20 次的生成延遲。

GLM-5.3-FlashX 在基準測試上的表現如何?

發佈時未公佈 FlashX 特有的智能基準測試套件。FlashX 被文檔為推理與服務的優化,因此其經過驗證的差異點在於吞吐,而非新的任務品質分數。

相關結果屬於底層的 GLM-5.3-Flash 模型,可作為能力背景參考;但它們並非 FlashX 測量,因為 FlashX 並未單獨公佈檢查點、評測工具與任務品質跑分。

做出部署決策時,請在相同提示、推理強度與工具設定下,分別測試 FlashX 與 Flash,並比較任務成功率、首個 token 時間、持續吞吐、p95 延遲與每個完成工作流程的總成本。

GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3

維度GLM-5.3-FlashXGLM-5.3-FlashGLM-5.3
定位高速服務層以效率為先的多模態模型旗艦能力層
上下文最多 1M1M在支援的路由上為 1M 級別
總參數 / 活躍參數承襲 320B / 18B 基底320B / 18B更大的旗艦組態
峰值輸出速度報稱最高 200 tokens/s依供應商而定的基線依供應商而定
相對於 Flash 的價格約 2.5×(宣稱)高於 Flash
開源權重服務層;基礎權重為開源是,MIT視發佈而定
推理與工具承襲自 Flash;請確認路由控制支援旗艦級推理層
CometAPI 可用性可用可用可用
最適用互動式低延遲代理高量、成本敏感的多模態工作追求最高能力的 GLM 工作負載

CometAPI 現已同時提供 GLM-5.3-FlashX API、GLM-5.3-Flash API 與 GLM-5.3 API。這使得透過單一整合比較延遲、成本與任務品質成為可能。

基於工作負載的比較

情境FlashFlashX
批次處理
成本敏感的高量工作負載
互動式聊天
程式設計代理
瀏覽器代理
人在回路
長時間自動化任務視情況而定
對延遲敏感的 API
高輸出體量
最大化回應速度

GLM-5.3-FlashX 費用是多少?

CometAPI 將 GLM-5.3-FlashX 列為每 100 萬輸入 tokens $60、每 100 萬輸出 tokens $60。其比較表顯示官方參考價格為每 100 萬輸入 tokens $75、每 100 萬輸出 tokens $75。價格可能變動,預算前請確認即時模型頁面。

用量CometAPI 價格官方參考價格
輸入$60 / 1M tokens$75 / 1M tokens
輸出$60 / 1M tokens$75 / 1M tokens

範例成本計算

對於使用 100M 輸入 tokens 與 20M 輸出 tokens 的工作負載,目前 CometAPI 估算為:100 × $60 + 20 × $60 = $7,200。按官方參考價,則為 100 × $75 + 20 × $75 = $9,000。

在上述顯示的費率下,FlashX 應保留用於延遲對收入、用戶體驗或序列式代理完成時間造成實質影響的工作流程。批次處理與成本敏感的高體量任務,應與較便宜的 Flash 路由進行基準比較。

依供應商政策,推理 tokens 也可能計入計費的輸出用量;請根據實際使用日誌估算成本,而非僅依可見答案長度。

GLM-5.3-FlashX 的最佳使用情境

即時程式設計代理

程式設計代理會反覆生成文字、呼叫工具、檢視結果、修改檔案、執行測試並迭代。更快的生成可降低動作之間的閒置時間。

瀏覽器與電腦操控代理

多模態輸入使模型能在推理循環中利用螢幕截圖與介面狀態。由於瀏覽器自動化在觀察、決策、行動與再觀察之間快速切換,低延遲至關重要。

視覺編碼與 UI 疊代

模型可檢視渲染後的介面、與需求比對、編輯程式碼並再次檢視結果。更快的推理能縮短視覺回饋迴路。

互動式企業助理

面向客戶的助理、內部副駕、研究代理與文件代理往往每輪都有真人在等待。相較於夜間批次處理,此處更容易為延遲溢價找到理由。

長上下文的互動工作

100 萬 tokens 的上下文視窗有利於大型程式庫、長報告與長期代理歷史,而這些情境通常仍需要即時回應性。

GLM-5.3-FlashX 是否可在 CometAPI 使用?

是。GLM-5.3-FlashX 已在 CometAPI 上線。模型頁面顯示其可透過生產 /v1/chat/completions 端點使用,且文件化的模型 ID 為 glm-5.3-flashx。開發者可使用與其他 CometAPI 文字模型相同、與 OpenAI 相容的整合方式。

訪問細節、價格、限制與支援的模態可能變動。CometAPI 即時模型頁是當前路由的權威來源。

何時不值得選用 FlashX

  • 離線或批次工作負載:當無人等待回應時,成本更低的 Flash 服務可能提供更好的經濟性。
  • 成本敏感的高體量生成:即便作業更快完成,FlashX 顯示的 token 價格也可能主導總工作流程成本。
  • 受模型品質而非延遲限制的任務:FlashX 並無獨立的官方智能基準,因此不應作為已被證實的能力升級購買。
  • 瓶頸在其他環節的工作流程:檢索、工具、瀏覽器、資料庫與人工審批可能主導端到端延遲,從而降低更快生成帶來的價值。
  • 自託管或開源權重需求:FlashX 作為託管式服務層呈現;若需部署控制,請使用底層 GLM-5.3-Flash 權重。
  • 嚴格的吞吐保證:

GLM-5.3-FlashX 的限制

  • 200 tokens/s 為最大廣告速度,並非保證的持續速率。
  • 報稱價格高於 Flash,且會隨供應商而異。
  • 尚無獨立的 FlashX 智能基準測試套件。
  • 標準輸出為文字,而非原生圖片或影片生成。
  • 100 萬 tokens 的上限並不消除對檢索、上下文選擇與延遲治理的需求。
  • 供應商特定的頻率限制、輸出限制、模態與實際吞吐可能與 Z.ai 的服務不同。

是否應該使用 GLM-5.3-FlashX?

當 GLM-5.3-Flash 的能力已足夠、但對互動式工作流程而言過慢時,GLM-5.3-FlashX 最具吸引力。此次發佈改變的是延遲經濟學,而非核心能力敘事。

當 token 成本佔主導且可接受較慢生成時,選擇 GLM-5.3-Flash。當人的等待時間或代理循環的延遲成本高於服務溢價時,選擇 FlashX。若更看重旗艦能力而非成本或延遲,則考慮 GLM-5.3。

對已使用統一閘道的團隊,務實的下一步是將同一具代表性的工作負載分別在 CometAPI 的 GLM-5.3-FlashX 與 GLM-5.3-Flash 上跑一遍,然後比較 p95 延遲、任務成功率與每個完成工作流程的總成本。

GLM-5.3-FlashX 常見問題

什麼是 GLM-5.3-FlashX?

GLM-5.3-FlashX 是 Z.ai 基於 GLM-5.3-Flash 能力基底的高速服務選項。其重點在於降低延遲與提升輸出吞吐,而非另行宣佈的模型智能躍升。

GLM-5.3-FlashX 是新檢查點嗎?

Z.ai 對外資料強調推理與基礎設施優化。FlashX 未公佈獨立的參數規模、權重釋出或智能基準套件。

GLM-5.3-FlashX 是否支援多模態輸入?

底層的 GLM-5.3-Flash 能力基底為多模態。實際支援的模態與路由請於部署前向供應商確認。

GLM-5.3-FlashX 的權重是否開源?

底層 GLM-5.3-Flash 權重以 MIT 授權提供。FlashX 作為高速託管服務選項呈現,並非獨立釋出的權重檢查點。

是否有獨立的 GLM-5.3-FlashX 基準分數?

發佈時沒有單獨的智能基準測試。當前任務品質基準屬於 GLM-5.3-Flash。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 20, 2026
最後更新 Sep 20, 2026
25 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多