GLM-5.3-Flash の技術仕様
| 仕様 | GLM-5.3-Flash |
|---|---|
| プロバイダー | Z.ai (Zhipu AI) |
| モデルファミリー | GLM-5 |
| モデルタイプ | ネイティブ多モーダル Mixture-of-Experts モデル |
| 総パラメータ数 | 320B |
| アクティブパラメータ数 | 18B |
| アーキテクチャ | ハイブリッド(スパース + 線形アテンション) |
| コンテキストウィンドウ | 1,048,576 tokens (1M) |
| 最大出力 | 131,072 tokens |
| 入力モダリティ | テキスト、画像、動画 |
| 出力モダリティ | テキスト |
| 推論 | 対応 |
| ビジョン | 対応 |
| 関数呼び出し | 対応 |
| ツール使用 | 対応 |
| ウェブ検索 | 対応 API 連携を通じて対応 |
| オープンウェイト | あり |
| ライセンス | MIT |
| リリース | 2026年8月26日 |
Z.ai は GLM-5.3-Flash を、GLM-5 ファミリーで初のネイティブ多モーダルモデルと説明しています。総パラメータは 320B ですが、推論ステップごとに有効化されるのは 18B のみです。同モデルはスパースと線形アテンションを組み合わせたハイブリッドアーキテクチャを導入し、mHC を用いてスケーリング効率を改善しています。
GLM-5.3-Flash とは?
GLM-5.3-Flash は Z.ai の GLM-5 世代における効率志向のモデルで、最先端レベルの推論能力とエージェント型コーディング能力を、著しく低い推論コストと両立するよう設計されています。
従来の「Flash」モデルとの最も重要な違いは、Flash は小型モデルを意味しないという点です。GLM-5.3-Flash は総パラメータ 320B を有しますが、MoE アーキテクチャによりトークン当たり 18B のみがアクティブ化されます。これにより、Z.ai は大規模なパラメータプールによる容量を維持しつつ、推論計算量を大幅に抑えることができます。
また、GLM-5 で初めてネイティブな多モーダル機能を持つモデルでもあります。テキストに加えて視覚入力をサポートし、コーディング、ブラウザ操作、文書理解、ビジュアルコーディング、エージェントワークフローに適しています。
Z.ai によれば、GLM-5.3-Flash は GLM-5.2 を単純圧縮したものではなく、新たに学習したベースモデルから訓練されています。学習には30 兆トークンの多モーダル事前学習コーパスを用い、アーキテクチャは能力と推論効率を中心に再設計されています。
GLM-5.3-Flash の主な特長
- 320B MoE(18B アクティブパラメータ): 総パラメータ容量は非常に大きい一方で、アクティブなパラメータは比較的少なく、密な 320B モデルに比べて提供が大幅に効率的です。
- ネイティブな多モーダル理解: 先行する GLM-5 モデルと異なり、GLM-5.3-Flash は視覚入力をネイティブに処理します。モデルカードには画像理解の例が掲載され、多モーダルモデルとして位置付けられています。
- 1M トークンのコンテキスト: 大規模リポジトリ、広範なドキュメント、長いエージェント軌跡、複雑な多段ワークフローなど長文コンテキスト用途に対応します。Cloudflare と Vercel は 1,048,576 トークンのコンテキストウィンドウを掲載しています。
- ハイブリッド(スパース + 線形)アテンション: GLM で初めてスパースアテンションと線形アテンションを組み合わせています。Z.ai によれば、このアーキテクチャは正確な長文コンテキスト能力を保ったままサービングコストを削減します。
- エージェント型コーディングとツール使用: ソフトウェアエンジニアリング、ターミナル作業、ブラウザ操作、ツール駆動のワークフローに最適化されています。Terminal-Bench 2.1 のスコアは 84.3 です。
- オープンウェイトでのデプロイ: MIT ライセンスのウェイトは Transformers、vLLM、SGLang、TokenSpeed、KTransformers でデプロイ可能で、セルフホスティングや推論最適化の選択肢を提供します。
GLM-5.3-Flash のベンチマーク性能
GLM-5.3-Flash は、特にコーディングやエージェント系ベンチマークで強みを示します。
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 | 注記 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | ターミナル / エージェント型コーディング |
| DeepSWE v1.1 | 63.4 | 46.2 | ソフトウェアエンジニアリング |
| AutomationBench | 48.8 | 26.2 | コンピュータ操作の自動化 |
| Toolathlon-Verified | 78.4 | 59.9 | ツール使用能力 |
| NL2Repo-Bench | 56.3 | 48.9 | 自然言語からリポジトリへのコーディング |
| Agent's Last Exam | 26.3 | 20.4 | エージェント型推論 |
| Humanity's Last Exam | 55.3 | — | ツール併用 |
| GDPval-AA v2 | 1773 Elo | 1504 Elo | 生産性 / ナレッジワーク |
| OfficeQA-Pro | 62.4 | — | 多モーダル生産性 |
| CharXiv RQ | 89.4 | — | 多モーダル推論 |
Hugging Face の公式評価セクションには、Terminal-Bench 2.1 で 84.3、DeepSWE で 63.4、HLE で 55.3 と記載されています。Z.ai のローンチ資料では、AutomationBench、Toolathlon、NL2Repo、GDPval などの追加結果も報告されています。
Independent Artificial Analysis は現在、GLM-5.3-Flash にインテリジェンス指数 57を付与しており、現行の比較セット 108 モデル中で第 3 位としています。
これらの数値は依然としてベンチマーク固有の留意点を踏まえて解釈すべきです。いくつかの結果はベンダー報告であり、評価ハーネスは異なり、スコアを普遍的なモデル品質のランキングとして扱うべきではありません。
GLM-5.3-Flash と GLM-5.3 と GLM-5.2 の比較
| 機能 | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| モデル世代 | GLM-5 | GLM-5 | GLM-5 |
| ポジショニング | 効率的な多モーダル / エージェントモデル | ハイエンド汎用推論モデル | 先代の汎用モデル |
| ネイティブビジョン | あり | なし | モデルに依存 |
| 総パラメータ数 | 320B | フラッグシップ構成はより大規模 | 大規模モデル |
| アクティブパラメータ数 | 18B | — | — |
| コンテキスト | 1M | 200K クラスのデプロイ | 200K クラスのデプロイ |
| ハイブリッド スパース/線形アテンション | あり | なし | なし |
| エージェント型コーディング | 優秀 | 優秀 | 強力 |
| オープンウェイト | あり | デプロイに依存 | デプロイに依存 |
| 主な優位性 | 推論計算当たりの能力 | GLM-5 の最大推論能力 | 実績があり低コストな GLM 世代 |
重要な相違点は、GLM-5.3-Flash が単に小型化した GLM-5.3 ではないことです。Z.ai によれば、新規ベースモデルから再学習され、ハイブリッドアテンション、mHC、多モーダル事前学習を導入した再設計となっています。
GLM-5.3-Flash と DeepSeek V4 Flash — 比較サマリー
| 比較軸 | GLM-5.3-Flash (Z.ai / Zhipu) | DeepSeek V4 Flash (DeepSeek) | 優位 |
|---|---|---|---|
| リリース日 | 2026年8月26日 | プレビュー 2026年4月;主要チェックポイント (0731) 2026年7月31日 | — |
| 総/アクティブパラメータ | 320B / 18B | 284B / 13B | GLM の方がやや大きい |
| コンテキストウィンドウ | 1M tokens | 1M tokens | 引き分け |
| 最大出力 | ~131K tokens | 最大 384K tokens | DeepSeek |
| モダリティ | ネイティブ多モーダル(テキスト + 画像 + 動画入力) | 主にテキスト(実験的なビジョンバリアントあり) | GLM |
| アーキテクチャのハイライト | ハイブリッド(スパース + 線形アテンション)(フル GLM-5.3 比でアテンション計算 ~3× 低減、KV キャッシュ ~4.4× 小型化) | Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) | それぞれ強みあり |
| ライセンス | MIT(ウェイト公開) | MIT(ウェイト提供) | 引き分け |
| 標準 API 料金($ / 1M tokens) | 入力 $0.15 / 出力 $0.50(キャッシュ済み入力 ~ $0.03) | 入力 $0.14–$0.44 / 出力 $0.28–$1.32(ピーク/オフピークで変動) | GLM の方が安価 |
| ローンチプロモ料金 | 入力 ~ $0.075 / 出力 ~ $0.25(期間限定、~2026年初秋) | 同等のプロモなし | GLM |
| AA インテリジェンス指数 | 57(ベンダー報告) | ~50(独立測定) | GLM |
| Terminal-Bench 2.1 | 84.3 | 82.7 | GLM |
| DeepSWE | 63.4 | 54.4 | GLM |
| SWE-bench Verified | 独立データは限定的 | ~79%(強力な独立結果) | DeepSeek |
| 主な強み | 低価格、ネイティブ多モーダル、複数のエージェント/コーディング系で優位、効率的な長文コンテキスト | 独立検証がより成熟、優れたコーディング/エージェント実績、高効率な長文コンテキスト設計、強いエコシステム | — |
| 主な弱み | 新しいリリース(いくつかはベンダー報告のスコア)、平均的な速度 | 多モーダル対応が弱い、実効価格が多くのルートで高め | — |
| 最適な用途 | 汎用、多モーダルワークロード、コスト重視案件、バランスの取れたエージェント能力 | 純粋なコーディングエージェント、長文テキスト推論、独立ベンチでの実績重視のシナリオ | — |
一文サマリー:
2026年8月下旬時点で、GLM-5.3-Flash は価格、多モーダル機能、重複ベンチマークの一部で優位に立ち、総合的な価値が高いといえます。DeepSeek V4 Flash は、独立検証の強さと長文効率により、コーディング重視のエージェント用途で引き続き有力な選択肢です。最終判断前に自身のワークロードで両者をテストしてください。
GLM-5.3-Flash のユースケース
1. エージェント型ソフトウェアエンジニアリング
GLM-5.3-Flash は、リポジトリの調査、複数ファイルの変更、ターミナルコマンドの実行、テストの実行、実装の反復が必要なコーディングエージェントに特に適しています。
Terminal-Bench 2.1 の 84.3、および DeepSWE の 63.4 は、ソフトウェアエンジニアリングが最も得意な領域の一つであることを示しています。
2. ビジュアルコーディング
GLM-5.3-Flash はネイティブに多モーダルであるため、開発者はコーディング指示とともにスクリーンショットや図表などの視覚入力を提供できます。これは UI 実装、ビジュアルデバッグ、デザインからコードへのワークフローに有用です。
3. 長文コンテキストのドキュメント分析
100万トークンのコンテキストウィンドウにより、大規模な技術文書セット、リポジトリ、長いレポート、多段のエージェント履歴に適しています。
4. ブラウザ/コンピュータ操作エージェント
ツール使用と多モーダル機能により、ブラウザや GUI、外部ツールを含むワークフローに適しています。
5. エンタープライズのナレッジワーク
GLM-5.3-Flash は、構造化/非構造化情報の大容量処理とツール連携による多段タスクの実行が可能で、文書分析、リサーチ支援、ワークフロー自動化に適しています。
6. セルフホスト型 AI インフラ
MIT ライセンスおよび公開ウェイトにより、デプロイ、データ処理、推論インフラのコントロールを求める組織にとって魅力的です。
GLM-5.3-Flash API のパラメータ
| パラメータ | 説明 |
|---|---|
| model | プロバイダー固有のモデル識別子 |
| messages | 構造化会話入力 |
| prompt | 対応 API での単一プロンプト入力 |
| max_tokens / max_completion_tokens | 出力トークン上限 |
| temperature | サンプリングのランダム性制御 |
| tools | ツール/関数定義 |
| stream | ストリーミング出力の有効化 |
| reasoning | 対応ゲートウェイでの推論努力の制御 |
| Image content | 対応 |
| Function calling | 対応 |
| Context | 最大 1M トークン |
Vercel AI Gateway は現在、最大131,000 出力トークンを文書化しており、推論トークンは出力上限に算入されます。
CometAPI で GLM-5.3-Flash API を使う方法
ステップ 1: API アクセスを取得
cometAPI にログインします。まだユーザーでない場合は、まず登録してください。CometAPI コンソール にサインインします。インターフェースのアクセス認証 API キーを取得します。個人センターの API token で「Add Token」をクリックし、トークンキー: sk-xxxxx を取得して送信します。

ステップ 2: GLM-5.3-Flash API にリクエストを送信
「GLM-5.3-Flash」エンドポイントを選び、API リクエストを送信してリクエストボディを設定します。リクエストメソッドとリクエストボディは当社ウェブサイトの API ドキュメントから取得できます。便利のため、当社ウェブサイトは Apifox テストも提供しています。アカウントの CometAPI キーで <YOUR_API_KEY> を実際の値に置き換えてください。
質問や依頼内容を content フィールドに挿入します—モデルはこの内容に応答します。API レスポンスを処理して生成結果を取得します。
ステップ 3: レスポンスを処理
API は、生成テキスト、引用、セーフティメタデータ、任意のツール出力を含む構造化候補レスポンスを返します。多モーダルリクエストでは、選択した CometAPI エンドポイントがモデルのビジョン機能を公開している場合、メッセージコンテンツをテキストと画像入力で構成できます。
正確な CometAPI エンドポイント、対応パラメータ、現在の可用性は、Z.ai のネイティブ API から類推するのではなく、ライブの CometAPI API ドキュメントを参照してください。
CometAPI では、統合時に Z.ai、Cloudflare、Vercel のプロバイダー固有 ID を安易に流用せず、ライブの CometAPI モデルエンドポイントに表示されるモデル ID を使用してください。
GLM-5.3-Flash の制限事項
- モデルフットプリントが大きい: アクティブなのは 18B であっても、公開モデルは約 321B のパラメータを含み、セルフホスティングは一般的な 7B〜70B モデルのデプロイより大幅に負荷が高くなります。
- 推論速度が絶対的に「フラッシュ」とは限らない: Artificial Analysis は比較環境で秒速約 50 出力トークンと測定しており、最速の小型モデルには及びません。
- 超長文コンテキストはインフラ要件を増大: 1M トークンのコンテキストは有用ですが、メモリやサービングの複雑性を高める可能性があります。
- ベンチマーク性能はタスクで変動: GLM-5.3-Flash はエージェント型コーディングやツール使用ベンチマークに強みがありますが、単一のベンチマークで専有的な優位性を断定できるわけではありません。
- 多モーダル出力は限定的: ネイティブの多モーダル機能は主に入力側であり、標準の出力はテキストで、画像や動画の生成は対象外です。