GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPIリサーチ

GLM-5.3-FlashXとは? 仕様、速度、価格、ベンチマーク、機能

翻訳する原文をご提供ください。

CometAPI
Mia MarenAIモデルとAPIの調査チーム
更新日 Sep 20, 2026 5 分読み
GLM-5.3-FlashXとは? 仕様、速度、価格、ベンチマーク、機能
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GLM-5.3-FlashX は Z.ai による GLM-5.3-Flash の高速サービング版です。2026年9月18日にローンチされ、最大毎秒200トークンのピーク生成速度(保証値や独立検証済みの倍率ではなく、プロバイダ報告のピーク)を目標としつつ、GLM-5.3-Flash の能力基盤を維持しています。OpenAI 互換の chat-completions エンドポイント経由で、GLM-5.3-FlashX は CometAPI で利用可能です

重要な違いは、FlashX が主にサービングと推論のアップグレードであり、別個に文書化された知能のチェックポイントではないことです。その能力基盤は 320B-total / 18B-active の GLM-5.3-Flash モデルで、ネイティブなマルチモーダル入力、1M トークンのコンテキストウィンドウ、ハイブリッドなスパース+線形アテンション、ツール使用、長期的なエージェントワークフローを備えています。

報告されている速度と価格の倍率は、各プロバイダや各リクエストに対する保証ではなく、ローンチ時点の主張です。本番評価では、ファーストトークンまでの時間、持続的スループット、p95 レイテンシ、タスク完了時間、現行プロバイダ価格を比較してください。

最終確認: 2026年9月20日

Key Takeaways

  • 速度: Z.ai は最大毎秒200トークンのピーク生成を報告。公式なベースライン測定や普遍的な倍率は提示されていないため、各チームは自分たちのルートとワークロードでベンチマークすべき。
  • 能力基盤: FlashX は合計320B/アクティブ18Bの MoE 設計、ネイティブなマルチモーダル、ハイブリッドなスパース+線形アテンション、1M コンテキストを GLM-5.3-Flash から継承。
  • ベンチマーク: 公開された知能スコアは GLM-5.3-Flash に属するものであり、FlashX の個別ベンチマーク走行ではない。
  • 適合領域: インタラクティブなコーディングエージェント、ブラウザ/コンピュータ操作ループ、ビジュアルコーディング、エンタープライズアシスタントなど、レイテンシが累積しやすい多段ワークフロー。
  • CometAPI 提供状況: GLM-5.3-FlashX は CometAPI のモデル ID glm-5.3-flashx/v1/chat/completions エンドポイントで稼働中。

What Is GLM-5.3-FlashX?

GLM-5.3-FlashX は、GLM-5.3-Flash のレイテンシ最適化版サービングティアとして理解するのが最適です。Z.ai のローンチメッセージは、より高速で滑らかな推論に重点を置いており、基盤となる Flash モデルが能力の土台であり続けます。したがって FlashX は、新しいモデル世代、蒸留チェックポイント、別途リリースされた重みセットとは異なります。

ベースの GLM-5.3-Flash モデルは、高効率な推論を中心に設計されました。Z.ai によれば、新しいマルチモーダル基盤から訓練され、30 兆トークンのマルチモーダルコーパスを使用し、Mixture-of-Experts ルーティングとハイブリッドアテンションを組み合わせています。FlashX はこれをさらにサービング面で前進させ、GLM-5.3-Flash のために開発された推論インフラの上に構築されています。

開発者にとって「GLM-5.3-FlashX とは何か?」の実務的な答えは、Z.ai が提供し、現在はCometAPI の統合 APIでも利用可能な、高スループットな GLM-5.3-Flash のサービングオプションということです。価値提案は、モデル知能の新たな飛躍ではなく、対話のレイテンシ低減です。

IT Home によって報じられた Zhipu のローンチ声明によれば、GLM-5.3-Flash は最初、海外の開発者に匿名名「Ox Alpha」として現れ、利用が継続的に拡大しました。その需要を捌くために、Zhipu は約10万枚の国内製アクセラレータチップを基盤とするインフラ投資と推論最適化を強化し、FlashX を導入しました。サービスは GLM-5.3-Flash の能力基盤を維持しつつ、プロバイダ報告のピーク出力を毎秒200トークンへと引き上げています。Zhipu はリリースを知能・価格・速度の観点で位置付けており、エンタープライズや開発者のワークロードでは、現実的な並行性下での持続スループット、p95 レイテンシ、タスク品質、コストによって商業価値を検証すべきものとなります。

GLM-5.3-FlashX Specifications

FlashX は高速サービング版であるため、仕様シートでは継承されたモデル特性と FlashX 固有のサービング特性を分けて記載すべきです。

SpecificationGLM-5.3-FlashX
ProviderZ.ai / Zhipu AI
Product positioningGLM-5.3-Flash の高速サービングオプション
Total / active parametersベースモデルから継承される約 320B / 18B per token
ArchitectureMixture-of-Experts; ハイブリッドなスパース+線形アテンション; mHC
Context window最大 1,048,576 トークン
Inputs / output正確なモダリティ対応、ファイル上限、動画制約、ルート固有パラメータは本番投入前にプロバイダのエンドポイントで確認すること
Reasoning基盤となる GLM-5.3-Flash モデルによってサポート
Reasoning effort対応ルートで low / high / max
Thinkingルート/API 依存
Tool / function callingサポート
Open weights基盤 GLM-5.3-Flash: MIT ライセンス; FlashX はホスト型サービングオプションとして提供
Reported peak speed最大毎秒 200 トークン
Reported relative speed公式ベースラインや保証された倍率はなし; 選択ルートでのベンチマークが必要
CometAPI price1M 入力トークンあたり $60、1M 出力トークンあたり $60(2026年9月20日検証済み);最新価格を再確認
Launch date2026年9月18日
Z.ai model keyGLM-5.3-FlashX / glm-5.3-flashx
CometAPI model IDglm-5.3-flashx
CometAPI endpointPOST /v1/chat/completions

Why Is GLM-5.3-FlashX Faster Than GLM-5.3-Flash?

速度の背景には 2 つの最適化層があります。GLM-5.3-Flash から継承した効率的なアーキテクチャと、それを基盤に最適化されたサービングインフラです。

ハイブリッドなスパース+線形アテンション

GLM-5.3-Flash は、局所依存には線形アテンション、広いコンテキストから関連情報を取得するためにはスパースアテンションを組み合わせています。Z.ai は IndexPool についても記述しており、4 つのキャッシュ済みインデクサキー・ベクトルを重み付きプーリングで 1 つに圧縮します。Z.ai の公開比較では、これらの変更により、長コンテキストにおけるアテンション計算が約 3.0 倍、KV キャッシュサイズが約 4.4 倍、GLM-5.3 対比で削減されます。

GLM-5.3-FlashXとは? 仕様、速度、価格、ベンチマーク、機能

Z.ai による GLM-5.3-Flash の公式アーキテクチャ解説セクション

推論インフラ

Z.ai は、プロダクションの GLM-5.3-Flash トラフィックが 10 万枚超の中国製 AI アクセラレータによるクラスタで稼働していると述べています。サービングスタックにはテンソル並列、ReplaySSM、W8A8 量子化、INT8/FP8/BF16 の混合キャッシュ量子化、Layer Split、Encode–Prefill–Decode の分離アーキテクチャが含まれます。同社は、同一ハードウェア上で初期ベースライン比約 3 倍のエンドツーエンドサービング改善を報告しています。

したがって FlashX は、継続的な推論最適化のプロダクト化として読むべきでしょう。モデル側で計算とキャッシュコストを削減し、FlashX がより攻めた低レイテンシのサービング層を追加します。

How Fast Is GLM-5.3-FlashX?

Z.ai は最大毎秒 200 トークンのピーク生成速度を報告しています。これは最大サービス主張であり、保証された持続速度ではないため、ファーストトークンまでの時間、持続出力速度、p95 レイテンシ、タスク完了、エラー率を本番ルートで検証してください。

「最大毎秒 200 トークン」はピークサービング値であり、すべてのリクエストに対する保証ではありません。実スループットは、プロンプト長、推論努力、出力長、マルチモーダル前処理、並行性、ツール呼び出し、リージョン、プロバイダ負荷に依存します。

有用な本番メトリクスには、ファーストトークンまでの時間、持続的な毎秒出力トークン数、p95 レイテンシ、エンドツーエンドのタスク完了時間が含まれます。エージェントではタスク完了時間が特に重要で、20 ステップのワークフローでは生成の遅延を 20 回支払う可能性があります。

How Does GLM-5.3-FlashX Perform on Benchmarks?

ローンチ時点では、FlashX 固有の知能ベンチマークスイートは公開されていません。FlashX は推論とサービングの最適化として文書化されているため、検証済みの差別化要因はスループットであり、新たなタスク品質スコアではありません。

これらの結果は基盤となる GLM-5.3-Flash モデルに属するもので、能力の文脈として参照可能ですが、FlashX の測定ではありません。チェックポイント、評価ハーネス、タスク品質の走行は FlashX について別途報告されていません。

導入判断では、同一プロンプト、同一の推論努力、ツール構成で FlashX と Flash をテストし、タスク成功、ファーストトークンまでの時間、持続スループット、p95 レイテンシ、完了ワークフローあたりの総コストを比較してください。

GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3

DimensionGLM-5.3-FlashXGLM-5.3-FlashGLM-5.3
Positioning高速サービングティア効率重視のマルチモーダルモデルフラッグシップ能力ティア
Context最大 1M1M対応ルートで 1M クラス
Total / active parameters320B / 18B の基盤を継承320B / 18Bより大きいフラッグシップ構成
Peak output speed最大毎秒 200 トークンが報告プロバイダ依存のベースラインプロバイダ依存
Relative price vs Flash約 2.5× が報告Flash より高価
Open weightsサービングティア; ベース重みはオープンはい、MITリリース依存
Reasoning and toolsFlash から継承; ルート制御は要確認サポートフラッグシップの推論ティア
CometAPI availability利用可能利用可能利用可能
Best fitインタラクティブな低レイテンシエージェントコスト重視の高ボリューム・マルチモーダル業務最大能力を要する GLM ワークロード

CometAPI は現在、GLM-5.3-Flash API と GLM-5.3 API に加えて、GLM-5.3-FlashX API を提供しています。これにより、単一の統合でレイテンシ、コスト、タスク品質を比較できます。

Workload-based comparison

ScenarioFlashFlashX
バッチ処理
コスト重視の高ボリューム
インタラクティブなチャット
コーディングエージェント
ブラウザエージェント
人間参加(ヒューマンインザループ)
長時間の自動ジョブ場合による
レイテンシ重視の API
高い出力量
最大の応答性

How Much Does GLM-5.3-FlashX Cost?

CometAPI は GLM-5.3-FlashX を、1M 入力トークンあたり $60、1M 出力トークンあたり $60 と掲示しています。比較表では、公式参考価格として 1M 入力トークンあたり $75、1M 出力トークンあたり $75 が示されています。価格は変更され得るため、予算化前にモデルページの最新情報を確認してください。

UsageCometAPI priceOfficial reference price
Input$60 / 1M tokens$75 / 1M tokens
Output$60 / 1M tokens$75 / 1M tokens

Worked Cost Example

100M 入力トークンと 20M 出力トークンを使用するワークロードでは、現在の CometAPI の試算は: 100 × $60 + 20 × $60 = $7,200。公式参考レートでは、同一ワークロードが 100 × $75 + 20 × $75 = $9,000。

この表示レートでは、FlashX はレイテンシが収益、ユーザー体験、あるいは逐次エージェントの完了時間に実質的な影響を与えるワークフローに限定して使うのが望ましいでしょう。バッチ処理やコスト重視の高ボリュームジョブは、より安価な Flash ルートでのベンチマークを推奨します。

プロバイダのポリシー次第では、推論トークンが課金対象の出力使用量に含まれる場合があります。見える回答長だけでなく、実際の使用ログに基づいてコストを見積もってください。

What Are the Best Use Cases for GLM-5.3-FlashX?

リアルタイムのコーディングエージェント

コーディングエージェントは、テキスト生成、ツール呼び出し、結果検査、ファイル修正、テスト実行を繰り返します。より速い生成は、アクション間の待機時間を短縮します。

ブラウザ/コンピュータ操作エージェント

マルチモーダル入力により、モデルはスクリーンショットやインターフェース状態を推論ループで利用できます。ブラウザ自動化は観察・意思決定・実行・再観察が高速に交互するため、低レイテンシが重要です。

ビジュアルコーディングと UI イテレーション

モデルはレンダリングされたインターフェースを検査し、要件と比較し、コードを編集し、結果を再検査できます。より速い推論は、ビジュアルなフィードバックループを短縮します。

インタラクティブなエンタープライズアシスタント

顧客向けアシスタント、社内コパイロット、リサーチエージェント、ドキュメントエージェントでは、各ターンで人が待っていることが多いです。ここでは、夜間のバッチ処理よりもレイテンシのプレミアムが正当化しやすくなります。

長コンテキストのインタラクティブ作業

1M トークンのコンテキストウィンドウは、大規模リポジトリ、長尺レポート、拡張エージェント履歴に役立ちます。これらのコンテキストが応答性の高いインタラクションを必要とする場合に特に有効です。

Is GLM-5.3-FlashX Available in CometAPI?

はい。 GLM-5.3-FlashX は CometAPI で稼働中です。モデルページには本番の /v1/chat/completions エンドポイントで利用可能と記載され、モデル ID は glm-5.3-flashx と文書化されています。開発者は他の CometAPI のテキストモデルと同じ OpenAI 互換の統合パターンを使用できます。

アクセス詳細、価格、上限、対応モダリティは変更され得ます。最新のルートについてはCometAPI のライブモデルページが権威ソースです。

When FlashX May Not Be Worth It

  • オフライン/バッチ系ワークロード: 誰も応答を待っていない場合、低コストな Flash サービングのほうが経済性に優れる可能性が高い。
  • コスト重視の高ボリューム生成: 表示されている FlashX のトークン単価は、ジョブが早く終わっても総コストを支配し得る。
  • モデル品質がボトルネックなタスク: FlashX には独立した知能ベンチマークスイートがないため、能力の実証的な上振れとして購入すべきではない。
  • ほかの要素がボトルネックなワークフロー: 取得、ツール、ブラウザ、データベース、人手承認がエンドツーエンドのレイテンシを支配する場合、より速いトークン生成の価値は薄れる。
  • セルフホスティングやオープン重み要件: FlashX はホスト型サービングティアとして提示されているため、デプロイ制御が重要な場合は基盤の GLM-5.3-Flash の重みを使用する。
  • 厳格なスループット保証:

What Are the GLM-5.3-FlashX Limitations?

  • 毎秒 200 トークンという数値は最大広告速度であり、持続率の保証ではない。
  • 報告価格は Flash より高く、プロバイダにより変動する。
  • FlashX 固有の知能ベンチマークスイートは現時点で存在しない。
  • 標準出力はテキストであり、ネイティブな画像・動画生成ではない。
  • 1M トークン上限が、取得やコンテキスト選択、レイテンシ管理の必要性をなくすわけではない。
  • プロバイダ固有のレート制限、出力上限、モダリティ、実スループットは Z.ai のサービスと異なる場合がある。

Should You Use GLM-5.3-FlashX?

GLM-5.3-FlashX は、GLM-5.3-Flash の能力で十分だが、インタラクティブなワークフローには遅すぎる場合に最も魅力的です。今回のローンチは、能力の物語よりもレイテンシの経済性を変えます。

トークンコストが支配的で、より遅い生成が許容可能なら GLM-5.3-Flash を選択。人の待ち時間やエージェントループのレイテンシがサービングのプレミアムより高価なら FlashX を選択。コストやレイテンシよりもフラッグシップ能力ティアが重要なら GLM-5.3 を検討。

すでに統一ゲートウェイを使用しているチームは、代表的な同一ワークロードを CometAPI 上の GLM-5.3-FlashX と GLM-5.3-Flash に流し、p95 レイテンシ、タスク成功、完了ワークフローあたりの総コストを比較するのが実務的な次のステップです。

GLM-5.3-FlashX FAQ

What is GLM-5.3-FlashX?

GLM-5.3-FlashX は GLM-5.3-Flash の能力基盤に対する Z.ai の高速サービングオプションです。モデル知能の新規な飛躍ではなく、レイテンシ低減と出力スループット向上を狙います。

Is GLM-5.3-FlashX a new checkpoint?

Z.ai の公開ローンチ資料は、推論とインフラ最適化を強調しています。FlashX について別個のパラメータ数、重みリリース、知能ベンチマークスイートは公開されていません。

Does GLM-5.3-FlashX support multimodal input?

基盤となる GLM-5.3-Flash の能力基盤はマルチモーダルです。プロバイダやルート固有のモダリティは導入前に確認してください。

Are the GLM-5.3-FlashX weights open source?

基盤の GLM-5.3-Flash の重みは MIT ライセンスで利用可能です。FlashX は高速ホスト型サービングオプションとして提示されており、別個の重みチェックポイントとしては公開されていません。

Are there separate GLM-5.3-FlashX benchmark scores?

ローンチ時点では個別の知能ベンチマークスイートは公開されていません。現行のタスク品質ベンチマークは GLM-5.3-Flash に属します。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Sep 20, 2026
最終更新 Sep 20, 2026
19 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む