TL;DR
GLM-5.3-FlashX は Z.ai による GLM-5.3-Flash の高速サービング版です。2026年9月18日にローンチされ、最大毎秒200トークンのピーク生成速度(保証値や独立検証済みの倍率ではなく、プロバイダ報告のピーク)を目標としつつ、GLM-5.3-Flash の能力基盤を維持しています。OpenAI 互換の chat-completions エンドポイント経由で、GLM-5.3-FlashX は CometAPI で利用可能です。
重要な違いは、FlashX が主にサービングと推論のアップグレードであり、別個に文書化された知能のチェックポイントではないことです。その能力基盤は 320B-total / 18B-active の GLM-5.3-Flash モデルで、ネイティブなマルチモーダル入力、1M トークンのコンテキストウィンドウ、ハイブリッドなスパース+線形アテンション、ツール使用、長期的なエージェントワークフローを備えています。
報告されている速度と価格の倍率は、各プロバイダや各リクエストに対する保証ではなく、ローンチ時点の主張です。本番評価では、ファーストトークンまでの時間、持続的スループット、p95 レイテンシ、タスク完了時間、現行プロバイダ価格を比較してください。
最終確認: 2026年9月20日
Key Takeaways
- 速度: Z.ai は最大毎秒200トークンのピーク生成を報告。公式なベースライン測定や普遍的な倍率は提示されていないため、各チームは自分たちのルートとワークロードでベンチマークすべき。
- 能力基盤: FlashX は合計320B/アクティブ18Bの MoE 設計、ネイティブなマルチモーダル、ハイブリッドなスパース+線形アテンション、1M コンテキストを GLM-5.3-Flash から継承。
- ベンチマーク: 公開された知能スコアは GLM-5.3-Flash に属するものであり、FlashX の個別ベンチマーク走行ではない。
- 適合領域: インタラクティブなコーディングエージェント、ブラウザ/コンピュータ操作ループ、ビジュアルコーディング、エンタープライズアシスタントなど、レイテンシが累積しやすい多段ワークフロー。
- CometAPI 提供状況: GLM-5.3-FlashX は CometAPI のモデル ID
glm-5.3-flashxと/v1/chat/completionsエンドポイントで稼働中。
What Is GLM-5.3-FlashX?
GLM-5.3-FlashX は、GLM-5.3-Flash のレイテンシ最適化版サービングティアとして理解するのが最適です。Z.ai のローンチメッセージは、より高速で滑らかな推論に重点を置いており、基盤となる Flash モデルが能力の土台であり続けます。したがって FlashX は、新しいモデル世代、蒸留チェックポイント、別途リリースされた重みセットとは異なります。
ベースの GLM-5.3-Flash モデルは、高効率な推論を中心に設計されました。Z.ai によれば、新しいマルチモーダル基盤から訓練され、30 兆トークンのマルチモーダルコーパスを使用し、Mixture-of-Experts ルーティングとハイブリッドアテンションを組み合わせています。FlashX はこれをさらにサービング面で前進させ、GLM-5.3-Flash のために開発された推論インフラの上に構築されています。
開発者にとって「GLM-5.3-FlashX とは何か?」の実務的な答えは、Z.ai が提供し、現在はCometAPI の統合 APIでも利用可能な、高スループットな GLM-5.3-Flash のサービングオプションということです。価値提案は、モデル知能の新たな飛躍ではなく、対話のレイテンシ低減です。
IT Home によって報じられた Zhipu のローンチ声明によれば、GLM-5.3-Flash は最初、海外の開発者に匿名名「Ox Alpha」として現れ、利用が継続的に拡大しました。その需要を捌くために、Zhipu は約10万枚の国内製アクセラレータチップを基盤とするインフラ投資と推論最適化を強化し、FlashX を導入しました。サービスは GLM-5.3-Flash の能力基盤を維持しつつ、プロバイダ報告のピーク出力を毎秒200トークンへと引き上げています。Zhipu はリリースを知能・価格・速度の観点で位置付けており、エンタープライズや開発者のワークロードでは、現実的な並行性下での持続スループット、p95 レイテンシ、タスク品質、コストによって商業価値を検証すべきものとなります。
GLM-5.3-FlashX Specifications
FlashX は高速サービング版であるため、仕様シートでは継承されたモデル特性と FlashX 固有のサービング特性を分けて記載すべきです。
| Specification | GLM-5.3-FlashX |
|---|---|
| Provider | Z.ai / Zhipu AI |
| Product positioning | GLM-5.3-Flash の高速サービングオプション |
| Total / active parameters | ベースモデルから継承される約 320B / 18B per token |
| Architecture | Mixture-of-Experts; ハイブリッドなスパース+線形アテンション; mHC |
| Context window | 最大 1,048,576 トークン |
| Inputs / output | 正確なモダリティ対応、ファイル上限、動画制約、ルート固有パラメータは本番投入前にプロバイダのエンドポイントで確認すること |
| Reasoning | 基盤となる GLM-5.3-Flash モデルによってサポート |
| Reasoning effort | 対応ルートで low / high / max |
| Thinking | ルート/API 依存 |
| Tool / function calling | サポート |
| Open weights | 基盤 GLM-5.3-Flash: MIT ライセンス; FlashX はホスト型サービングオプションとして提供 |
| Reported peak speed | 最大毎秒 200 トークン |
| Reported relative speed | 公式ベースラインや保証された倍率はなし; 選択ルートでのベンチマークが必要 |
| CometAPI price | 1M 入力トークンあたり $60、1M 出力トークンあたり $60(2026年9月20日検証済み);最新価格を再確認 |
| Launch date | 2026年9月18日 |
| Z.ai model key | GLM-5.3-FlashX / glm-5.3-flashx |
| CometAPI model ID | glm-5.3-flashx |
| CometAPI endpoint | POST /v1/chat/completions |
Why Is GLM-5.3-FlashX Faster Than GLM-5.3-Flash?
速度の背景には 2 つの最適化層があります。GLM-5.3-Flash から継承した効率的なアーキテクチャと、それを基盤に最適化されたサービングインフラです。
ハイブリッドなスパース+線形アテンション
GLM-5.3-Flash は、局所依存には線形アテンション、広いコンテキストから関連情報を取得するためにはスパースアテンションを組み合わせています。Z.ai は IndexPool についても記述しており、4 つのキャッシュ済みインデクサキー・ベクトルを重み付きプーリングで 1 つに圧縮します。Z.ai の公開比較では、これらの変更により、長コンテキストにおけるアテンション計算が約 3.0 倍、KV キャッシュサイズが約 4.4 倍、GLM-5.3 対比で削減されます。
Z.ai による GLM-5.3-Flash の公式アーキテクチャ解説セクション。
推論インフラ
Z.ai は、プロダクションの GLM-5.3-Flash トラフィックが 10 万枚超の中国製 AI アクセラレータによるクラスタで稼働していると述べています。サービングスタックにはテンソル並列、ReplaySSM、W8A8 量子化、INT8/FP8/BF16 の混合キャッシュ量子化、Layer Split、Encode–Prefill–Decode の分離アーキテクチャが含まれます。同社は、同一ハードウェア上で初期ベースライン比約 3 倍のエンドツーエンドサービング改善を報告しています。
したがって FlashX は、継続的な推論最適化のプロダクト化として読むべきでしょう。モデル側で計算とキャッシュコストを削減し、FlashX がより攻めた低レイテンシのサービング層を追加します。
How Fast Is GLM-5.3-FlashX?
Z.ai は最大毎秒 200 トークンのピーク生成速度を報告しています。これは最大サービス主張であり、保証された持続速度ではないため、ファーストトークンまでの時間、持続出力速度、p95 レイテンシ、タスク完了、エラー率を本番ルートで検証してください。
「最大毎秒 200 トークン」はピークサービング値であり、すべてのリクエストに対する保証ではありません。実スループットは、プロンプト長、推論努力、出力長、マルチモーダル前処理、並行性、ツール呼び出し、リージョン、プロバイダ負荷に依存します。
有用な本番メトリクスには、ファーストトークンまでの時間、持続的な毎秒出力トークン数、p95 レイテンシ、エンドツーエンドのタスク完了時間が含まれます。エージェントではタスク完了時間が特に重要で、20 ステップのワークフローでは生成の遅延を 20 回支払う可能性があります。
How Does GLM-5.3-FlashX Perform on Benchmarks?
ローンチ時点では、FlashX 固有の知能ベンチマークスイートは公開されていません。FlashX は推論とサービングの最適化として文書化されているため、検証済みの差別化要因はスループットであり、新たなタスク品質スコアではありません。
これらの結果は基盤となる GLM-5.3-Flash モデルに属するもので、能力の文脈として参照可能ですが、FlashX の測定ではありません。チェックポイント、評価ハーネス、タスク品質の走行は FlashX について別途報告されていません。
導入判断では、同一プロンプト、同一の推論努力、ツール構成で FlashX と Flash をテストし、タスク成功、ファーストトークンまでの時間、持続スループット、p95 レイテンシ、完了ワークフローあたりの総コストを比較してください。
GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3
| Dimension | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Positioning | 高速サービングティア | 効率重視のマルチモーダルモデル | フラッグシップ能力ティア |
| Context | 最大 1M | 1M | 対応ルートで 1M クラス |
| Total / active parameters | 320B / 18B の基盤を継承 | 320B / 18B | より大きいフラッグシップ構成 |
| Peak output speed | 最大毎秒 200 トークンが報告 | プロバイダ依存のベースライン | プロバイダ依存 |
| Relative price vs Flash | 約 2.5× が報告 | 1× | Flash より高価 |
| Open weights | サービングティア; ベース重みはオープン | はい、MIT | リリース依存 |
| Reasoning and tools | Flash から継承; ルート制御は要確認 | サポート | フラッグシップの推論ティア |
| CometAPI availability | 利用可能 | 利用可能 | 利用可能 |
| Best fit | インタラクティブな低レイテンシエージェント | コスト重視の高ボリューム・マルチモーダル業務 | 最大能力を要する GLM ワークロード |
CometAPI は現在、GLM-5.3-Flash API と GLM-5.3 API に加えて、GLM-5.3-FlashX API を提供しています。これにより、単一の統合でレイテンシ、コスト、タスク品質を比較できます。
Workload-based comparison
| Scenario | Flash | FlashX |
|---|---|---|
| バッチ処理 | ✓ | |
| コスト重視の高ボリューム | ✓ | |
| インタラクティブなチャット | ✓ | |
| コーディングエージェント | ✓ | |
| ブラウザエージェント | ✓ | |
| 人間参加(ヒューマンインザループ) | ✓ | |
| 長時間の自動ジョブ | ✓ | 場合による |
| レイテンシ重視の API | ✓ | |
| 高い出力量 | ✓ | |
| 最大の応答性 | ✓ |
How Much Does GLM-5.3-FlashX Cost?
CometAPI は GLM-5.3-FlashX を、1M 入力トークンあたり $60、1M 出力トークンあたり $60 と掲示しています。比較表では、公式参考価格として 1M 入力トークンあたり $75、1M 出力トークンあたり $75 が示されています。価格は変更され得るため、予算化前にモデルページの最新情報を確認してください。
| Usage | CometAPI price | Official reference price |
|---|---|---|
| Input | $60 / 1M tokens | $75 / 1M tokens |
| Output | $60 / 1M tokens | $75 / 1M tokens |
Worked Cost Example
100M 入力トークンと 20M 出力トークンを使用するワークロードでは、現在の CometAPI の試算は: 100 × $60 + 20 × $60 = $7,200。公式参考レートでは、同一ワークロードが 100 × $75 + 20 × $75 = $9,000。
この表示レートでは、FlashX はレイテンシが収益、ユーザー体験、あるいは逐次エージェントの完了時間に実質的な影響を与えるワークフローに限定して使うのが望ましいでしょう。バッチ処理やコスト重視の高ボリュームジョブは、より安価な Flash ルートでのベンチマークを推奨します。
プロバイダのポリシー次第では、推論トークンが課金対象の出力使用量に含まれる場合があります。見える回答長だけでなく、実際の使用ログに基づいてコストを見積もってください。
What Are the Best Use Cases for GLM-5.3-FlashX?
リアルタイムのコーディングエージェント
コーディングエージェントは、テキスト生成、ツール呼び出し、結果検査、ファイル修正、テスト実行を繰り返します。より速い生成は、アクション間の待機時間を短縮します。
ブラウザ/コンピュータ操作エージェント
マルチモーダル入力により、モデルはスクリーンショットやインターフェース状態を推論ループで利用できます。ブラウザ自動化は観察・意思決定・実行・再観察が高速に交互するため、低レイテンシが重要です。
ビジュアルコーディングと UI イテレーション
モデルはレンダリングされたインターフェースを検査し、要件と比較し、コードを編集し、結果を再検査できます。より速い推論は、ビジュアルなフィードバックループを短縮します。
インタラクティブなエンタープライズアシスタント
顧客向けアシスタント、社内コパイロット、リサーチエージェント、ドキュメントエージェントでは、各ターンで人が待っていることが多いです。ここでは、夜間のバッチ処理よりもレイテンシのプレミアムが正当化しやすくなります。
長コンテキストのインタラクティブ作業
1M トークンのコンテキストウィンドウは、大規模リポジトリ、長尺レポート、拡張エージェント履歴に役立ちます。これらのコンテキストが応答性の高いインタラクションを必要とする場合に特に有効です。
Is GLM-5.3-FlashX Available in CometAPI?
はい。 GLM-5.3-FlashX は CometAPI で稼働中です。モデルページには本番の /v1/chat/completions エンドポイントで利用可能と記載され、モデル ID は glm-5.3-flashx と文書化されています。開発者は他の CometAPI のテキストモデルと同じ OpenAI 互換の統合パターンを使用できます。
アクセス詳細、価格、上限、対応モダリティは変更され得ます。最新のルートについてはCometAPI のライブモデルページが権威ソースです。
When FlashX May Not Be Worth It
- オフライン/バッチ系ワークロード: 誰も応答を待っていない場合、低コストな Flash サービングのほうが経済性に優れる可能性が高い。
- コスト重視の高ボリューム生成: 表示されている FlashX のトークン単価は、ジョブが早く終わっても総コストを支配し得る。
- モデル品質がボトルネックなタスク: FlashX には独立した知能ベンチマークスイートがないため、能力の実証的な上振れとして購入すべきではない。
- ほかの要素がボトルネックなワークフロー: 取得、ツール、ブラウザ、データベース、人手承認がエンドツーエンドのレイテンシを支配する場合、より速いトークン生成の価値は薄れる。
- セルフホスティングやオープン重み要件: FlashX はホスト型サービングティアとして提示されているため、デプロイ制御が重要な場合は基盤の GLM-5.3-Flash の重みを使用する。
- 厳格なスループット保証:
What Are the GLM-5.3-FlashX Limitations?
- 毎秒 200 トークンという数値は最大広告速度であり、持続率の保証ではない。
- 報告価格は Flash より高く、プロバイダにより変動する。
- FlashX 固有の知能ベンチマークスイートは現時点で存在しない。
- 標準出力はテキストであり、ネイティブな画像・動画生成ではない。
- 1M トークン上限が、取得やコンテキスト選択、レイテンシ管理の必要性をなくすわけではない。
- プロバイダ固有のレート制限、出力上限、モダリティ、実スループットは Z.ai のサービスと異なる場合がある。
Should You Use GLM-5.3-FlashX?
GLM-5.3-FlashX は、GLM-5.3-Flash の能力で十分だが、インタラクティブなワークフローには遅すぎる場合に最も魅力的です。今回のローンチは、能力の物語よりもレイテンシの経済性を変えます。
トークンコストが支配的で、より遅い生成が許容可能なら GLM-5.3-Flash を選択。人の待ち時間やエージェントループのレイテンシがサービングのプレミアムより高価なら FlashX を選択。コストやレイテンシよりもフラッグシップ能力ティアが重要なら GLM-5.3 を検討。
すでに統一ゲートウェイを使用しているチームは、代表的な同一ワークロードを CometAPI 上の GLM-5.3-FlashX と GLM-5.3-Flash に流し、p95 レイテンシ、タスク成功、完了ワークフローあたりの総コストを比較するのが実務的な次のステップです。
GLM-5.3-FlashX FAQ
What is GLM-5.3-FlashX?
GLM-5.3-FlashX は GLM-5.3-Flash の能力基盤に対する Z.ai の高速サービングオプションです。モデル知能の新規な飛躍ではなく、レイテンシ低減と出力スループット向上を狙います。
Is GLM-5.3-FlashX a new checkpoint?
Z.ai の公開ローンチ資料は、推論とインフラ最適化を強調しています。FlashX について別個のパラメータ数、重みリリース、知能ベンチマークスイートは公開されていません。
Does GLM-5.3-FlashX support multimodal input?
基盤となる GLM-5.3-Flash の能力基盤はマルチモーダルです。プロバイダやルート固有のモダリティは導入前に確認してください。
Are the GLM-5.3-FlashX weights open source?
基盤の GLM-5.3-Flash の重みは MIT ライセンスで利用可能です。FlashX は高速ホスト型サービングオプションとして提示されており、別個の重みチェックポイントとしては公開されていません。
Are there separate GLM-5.3-FlashX benchmark scores?
ローンチ時点では個別の知能ベンチマークスイートは公開されていません。現行のタスク品質ベンチマークは GLM-5.3-Flash に属します。
