TL;DR: 高速・低レイテンシなテキスト自動化には DeepSeek-V4-Flash、マルチモーダル機能・優れたエージェント系ベンチマーク・高効率な長文脈のプライベートサーバー運用には GLM-5.3-Flash を選択。両モデルは MIT License**** の下でオープンウェイトを提供し、寛容な MIT License の下でリリースされています。
DeepSeek-V4-Flash**** は、従来型のコーディングループや大規模バッチ処理に適した超高速・高スループットのテキスト専用 API を求める場合に最適です。Artificial Analysis Intelligence Index で 50 を記録し、統合された DSpark 推測デコーディングエンジンにより最大 122+ tokens/sec を生成します。さらに 非ピーク時の API 料金(入力/出力 100 万トークンあたり $0.22/$0.66) を提供します。
GLM-5.3-Flash は、ネイティブなマルチモーダリティ、視覚フィードバックを取り入れたプログラミング、そして高効率なセルフマネージド・スケーリングが必要な場合に、より多用途な選択肢です。Artificial Analysis Intelligence Index で 57 を記録し、ハイブリッドな線形・スパース注意機構(KDA + NoPE Sparse MLA)により 1M コンテキストで KV Cache メモリを 4.44× 削減し、ネイティブな視覚推論を備えています。API 料金は標準で $0.15/$0.50(プロモで $0.075/$0.25)と競争力があります。
重要ポイント
- DeepSeek-V4-Flash は DeepSeek API News Announcement での初期プレビューから Hugging Face での正式リリースへと移行し、Token-wise Compression、DeepSeek Sparse Attention (DSA)、および DSpark 推測デコーディングを取り入れて生成速度を向上させました。
- GLM-5.3-Flash は 2026年8月26日** にリリースされ、OpenRouter で「Ox Alpha」というコードネームで匿名テスト中に広く人気を博しました。
- GLM-5.3-Flash は Artificial Analysis Intelligence Index 全体で 57 点を獲得し、DeepSeek-V4-Flash-0731 の 50 点を上回っており、複雑な推論やエージェントタスクにおける総合力が高いことを示しています。
- どちらのアーキテクチャも Mixture-of-Experts (MoE) で、推論時の計算負荷は非常にスリムです。DeepSeek はトークンあたり 284B 中 13B のパラメータを、GLM は 320B 中 18B を活性化します。
- いずれも完全なオープンウェイトで MIT License の下に配布されており、エンタープライズでの商用利用、カスタム微調整、オンプレミス展開に最大限の自由度を提供します。
DeepSeek-V4-Flash vs GLM-5.3-Flash: クイック比較
| Specification | DeepSeek-V4-Flash-0731 | GLM-5.3-Flash |
|---|---|---|
| Developer | DeepSeek-ai | Z.ai (Zhipu AI) |
| Release date | July 31, 2026 | August 26, 2026 |
| Model ID | deepseek-v4-flash | glm-5.3-flash |
| Hugging Face Repository | deepseek-ai/DeepSeek-V4-Flash | zai-org/GLM-5.3-Flash |
| Architecture | MoE; DSA + Token-wise Compression | MoE; KDA + NoPE Sparse MLA + mHC |
| Total parameters | 284B (304B with DSpark module) | 320B |
| Active parameters | 13B per token | 18B per token |
| Context window | 1,000,000 tokens | 1,048,576 / about 1M tokens |
| Input / output | Text → Text | Text + Image + Video + File → Text |
| Reasoning | Configurable (Thinking / Non-Thinking) | Three-level (Low / High / Max) |
| Function / tool use | JSON Schema / Tool Calls | ToolCalls, constraints, dynamic tool loading |
| Open weights | Yes (MIT License) | Yes (MIT License) |
| AA Intelligence Index | 50 | 57 |
| Official Price (1M Tokens) | Peak: $0.44 / $1.32 <br> Off-peak: $0.22 / $0.66 | List: $0.15 / $0.50 <br> Promo: $0.075 / $0.25 |
| Best fit | High-throughput agents, fast text generation | Visual programming, custom on-prem deployments |
DeepSeek-V4-Flash とは?
DeepSeek-V4-Flash は、自律型開発エージェントと大規模テキスト処理パイプラインを支援するために設計された軽量・超高速の MoE モデルです。もともと DeepSeek API News Announcement でプレビューされ、Hugging Face 上で DeepSeek-V4-Flash-0731 として正式リリースされる際に、ポストトレーニングの大幅なアップグレードが行われました。
このモデルは純粋なテキスト処理スループット、構造化 API コール、迅速なプログラムコード実行に最適化されています。レイテンシとトークンごとの推論コストを最小化し、速度と実行コストが最優先となるマルチターンのソフトウェア開発ループを対象としています。
プレビューからの変更点は?
公式の 0731 バージョンにはオプションの共同学習済み推測ドラフティングモデルが含まれており、ローカルのパラメータ総数は 304B になります。ホスティング時には、この推測デコーディングフレームワーク(DSpark)がアクティブな 13B パスと並行して動作し、生成速度を 122.7 tokens/sec まで加速します。
さらに、アラインメントプロセスはサンドボックス化された実行環境で強化学習(RL)により広範に再学習され、マルチステップのターミナル作業、シェルスクリプティング、構造化ツール使用における信頼性が大幅に向上しました。
DeepSeek-V4-Flash 仕様
| Property | DeepSeek-V4-Flash-0731 |
|---|---|
| Context | 1,000,000 tokens |
| Modalities | Text input; text output (standard model) |
| Reasoning | Supports Non-thinking and Thinking modes |
| Native API capabilities | JSON Output, Tool Calls, Responses API |
| Knowledge cutoff | Undisclosed |
| Standard Pricing (per MTok) | Peak: $0.44 Input / $0.014 Cached / $1.32 Output <br> Off-peak: $0.22 Input / $0.007 Cached / $0.66 Output |
GLM-5.3-Flash とは?
GLM-5.3-Flash は Z.ai のオープンウェイト・マルチモーダル MoE フラッグシップモデルです。Z.ai Blog で 2026年8月26日 に正式発表され、複雑なエージェント実行、自動化されたウェブナビゲーション、視覚ドキュメント推論を標準の「Flash」料金帯で実行するよう設計されています。ウェイトは Hugging Face で公開されています。
このモデルは 30 兆トークン級の巨大なマルチモーダルデータセットで事前学習されており、視覚入力を後付けではなくネイティブなモダリティとして扱います。ソフトウェアエンジニアリング、ロボティックプロセスオートメーション、マルチモーダルなデータベースクエリを主な対象としています。
ハイブリッド注意機構、mHC とスパース MoE スケーリング
GLM-5.3-Flash は次の 3 つのアーキテクチャ的柱で差別化されています。
- ハイブリッド注意機構: Z.ai Blog で説明されているように、Kimi Delta Attention (KDA) と NoPE Sparse MLA(位置情報なしの Multi-head Latent Attention)を組み合わせています。このハイブリッド注意層はキーとバリューの射影サイズを圧縮し、1M コンテキスト評価時の KV Cache ストレージを 4.44×、注意計算を 3.01× 削減します。
- Stable LatentMoE: 合計 896 のエキスパートを運用し、トークンごとに正確に 16 を活性化します。これによりエキスパートルーティングの崩壊を回避し、長いマルチステップ推論トレースでも安定性を維持します。
- Manifold-Constrained Hyper-Connections (mHC): 45 層構造全体で深い勾配を安定化し、分散 GPU クラスタやローカル AI チップでの実行時にハードウェア性能を最適化します。

GLM-5.3-Flash: Architecture for Extreme Efficacy Sourcing: z.ai
GLM-5.3-Flash 仕様
| Property | GLM-5.3-Flash |
|---|---|
| Total / active parameters | 320B / 18B |
| Architecture | MoE with Hybrid Sparse & Linear Attention |
| Experts | 896 total; 16 activated per token |
| Context | 1,048,576 tokens (~1M) |
| Vision | Native Multimodal (Text, Image, Video, Doc File) |
| Reasoning | Supports Low, High, Max thinking modes |
| Tools | ToolCalls, constraints, dynamic tool loading |
| Open weights | Available on Hugging Face (MIT License) |
| Official Pricing (per MTok) | List: $0.15 Input / $0.03 Cached / $0.50 Output <br> Promo (ends Sept 9): $0.075 Input / $0.015 Cached / $0.25 Output |
DeepSeek-V4-Flash vs GLM-5.3-Flash: 機能比較
アーキテクチャとパラメータ効率
DeepSeek-V4-Flash は 284B の総パラメータ(13B アクティブ)に、共同学習された推測ドラフティングモデルを備えており(ローカル展開時は 304B)。GLM-5.3-Flash は 320B(18B アクティブ)を非常にスパースな 45 層レイアウトで使用します。どちらもトークンあたりに活性化されるパラメータを少数に抑え、小型モデル並みの高速性を保ちながら、巨大モデルの豊富な知識表現を維持します。
注意機構とメモリ最適化
DeepSeek-V4-Flash は DeepSeek Sparse Attention (DSA) と Token-wise Compression を採用。長いプロンプト処理時にシーケンス構造を動的に分析し、冗長なトークン(定型的なコード構造や繰り返しのシステムヘッダなど)を圧縮します。
GLM-5.3-Flash は線形 KDA と潜在射影(NoPE Sparse MLA)を組み合わせ、キー/バリュー圧縮ブロックから明示的な位置エンコーディングを取り除きます。これにより物理的 KV キャッシュのメモリフットプリントを従来レイアウト比で 22.5% にまで削減し、メモリ制約のあるクラスタでも長文脈ワークロードで大幅に高い同時実行性を確保できます。
モダリティとマルチモーダル深度
DeepSeek-V4-Flash-0731 はテキスト専用モデルです。技術ファイル、JSON スキーマ、構造化マークダウンの解析に優れます。視覚解析タスクには、別のマルチモーダル実験モデル(deepseek-v4-flash-vision-exp)を使用する必要があります。
GLM-5.3-Flash はネイティブにマルチモーダルです。高解像度の画像、動画、複雑なオフィスドキュメント(PDF、PPTX、スプレッドシート)を直接受け付けます。これにより「visual-in-the-loop」なソフトウェア開発が可能になり、モデルがレンダリングされた UI レイアウトを検査し、整列の問題を発見し、開発者の手動介入なしにコードを反復修正できます。
ライセンスとオープン性
両モデルとも非常に寛容な MIT License の下でリリースされています。これによりエンタープライズ開発者は、モデルウェイトの改変・配布・サブライセンス・商用展開をローカル、プライベート VPC、またはエアギャップされたオンプレミスクラウドで自由に行えます。
DeepSeek-V4-Flash vs GLM-5.3-Flash: ベンチマーク比較
同一データセット・同一テストハーネスで評価した場合、両モデルはソフトウェアエンジニアリングおよびエージェント自動化タスクで競合力のある性能を示します。
コーディング&エージェント性能
| Benchmark | GLM-5.3-Flash (Z.ai) | DeepSeek-V4-Flash-0731 |
|---|---|---|
| Artificial Analysis Index v4.1.1 | 57 | 50 |
| Terminal Bench 2.1 (Acc) | 84.3 | 82.7 |
| DeepSWE v1.1 (GitHub Issues) | 63.4 | 54.4 |
| Toolathlon (Verified / Pass@1) | 78.4 | 70.3 |
| NL2Repo (Acc) | 56.3 | 54.2 |
| Automation Bench (Acc) | 48.8 | 25.1 |
| GDPval-AA v2 (Agent Elo) | 1773 | 1554 |
GLM-5.3-Flash は大半のエージェント系およびソフトウェアエンジニアリングベンチマークで優位を維持し、DeepSWE v1.1 で 63.4%、Terminal Bench 2.1 で 84.3 を記録しています。18B のアクティブパラメータ経路とマルチターンのポストトレーニングアラインメントにより、複雑なリポジトリ追跡や OS とのインタラクションをうまく処理します。

GLM-5.3-Flash Benchmark: scoring 84.3 on Terminal Bench 2.1 Sourcing: z.ai
DeepSeek-V4-Flash-0731 も非常に有能で、Terminal Bench 2.1 で 82.7、Toolathlon で 70.3 を記録しています。決定論的な API 構造や厳密な関数呼び出しにおいて安定した性能を発揮します。

DeepSeek-V4-Flash Benchmark 0731: scoring 82.7 on Terminal Bench 2.1 Sourcing: Hugging Face
マルチモーダルと視覚推論
GLM-5.3-Flash のネイティブなマルチモーダル学習は、視覚推論タスクで明確な優位性をもたらします。
- OfficeQA Pro: 62.4(GLM-5.3-Flash)対 57.9(DeepSeek-V4-Vision 実験ブランチ)。GLM は埋め込み画像、構造化 PDF テーブル、スライドデッキのネイティブ解析で優れた性能を示します。
- Chartography with Tools: 78.0(GLM-5.3-Flash)。システムフローチャート、ワイヤーフレーム、請求書スキャンを取り込み、実行可能なシステムロジックへ直接変換する能力に優れています。
速度とレイテンシ
- 生成速度: DeepSeek-V4-Flash-0731 はより高速で、推測デコーディングフレームワークにより標準的なエンタープライズクラウドエンドポイントで平均 122.7 tokens/sec を達成します。
- Time to First Token (TTFT): GLM-5.3-Flash は 1.21 秒と低い TTFT を特徴としており、DeepSeek-V4-Flash の 3.0 秒超と比べ、リアルタイムのユーザー向けチャットアプリケーションでより応答性が高く感じられます。
DeepSeek-V4-Flash vs GLM-5.3-Flash: API 料金
両モデルは非常にコスト効率の高い料金モデルを提供しており、従来の密なアーキテクチャと強く競合します。
公式 API リスト価格(100 万トークンあたり)
| Price Layer | DeepSeek-V4-Flash-0731 (Peak) | DeepSeek-V4-Flash-0731 (Off-Peak) | GLM-5.3-Flash (Standard) | GLM-5.3-Flash (Promo - to Sep 9) |
|---|---|---|---|---|
| Input Price (Cache Miss) | $0.44 | $0.22 | $0.15 | $0.075 |
| Input Price (Cache Hit) | $0.014 | $0.007 | $0.03 | $0.015 |
| Output Price | $1.32 | $0.66 | $0.50 | $0.25 |
非ピーク時間帯では、DeepSeek-V4-Flash-0731 は非常に経済的で、入力コストは $0.22/MTok、出力は $0.66/MTok、キャッシュ済み入力は $0.007/MTok に低下します。
GLM-5.3-Flash は標準でフラットなレート($0.15 入力 / $0.50 出力)を提供し、ピーク時の追加料金はありません。2026年9月9日までのプロモ期間では入力/出力がそれぞれ $0.075 と $0.25 に下がり、大規模移行やバルク処理に最適です。
長所と短所
DeepSeek-V4-Flash-0731
- 長所:
- 卓越した生成速度: 共同学習済みの推測ドラフティングモデル(DSpark)により、最大 122.7 tokens/sec を生成。
- 非ピーク時のコスト優位: 入力 $0.22、出力 $0.66(いずれも 100 万トークンあたり)という非常に低廉な非ピーク料金。
- 強力な CPU 量子化サポート: 成熟した GGUF 統合経路により、CPU ベースのローカルランタイムや個人環境のメモリ制約に最適化。
- トレードオフ:
- ピーク時料金の変動: ピーク時間帯には API 料金が倍増(0.44/1.32 per MTok)。
- テキスト専用のコアウェイト: 標準ウェイトでは視覚推論・画像・動画をネイティブにサポートしない。
- TTFT のオーバーヘッド: GLM と比べて Time to First Token が長い。
GLM-5.3-Flash
- 長所:
- ハイレベルなインテリジェンス: Artificial Analysis Index で 57 点という競争力の高いスコア。
- ネイティブな Vision-in-the-Loop: 画像・動画処理をポストトレーニングアラインメントに直接統合し、フロントエンドコードの視覚評価が可能。
- 優れたキャッシュ削減: ハイブリッド線形 KDA と NoPE MLA によりメモリ使用量を 4.44× 削減し、ローカル同時実行性を向上。
- フラットな長文脈料金: 標準料金は 1M トークンまでフラットで、業界最低水準のキャッシュヒット料金($0.03 標準、$0.015 プロモ)。
- トレードオフ:
- トークン出力の相対的低速: 生の生成速度は、DeepSeek の専用推測デコーディングエンジンよりわずかに遅い。
- ハードウェア要件: 高いスパース性にもかかわらず、320B パラメータの MoE 全体をローカルでホスティングするにはマルチノード GPU 環境が必要。
| Model | Strengths | Trade-offs |
|---|---|---|
| DeepSeek-V4-Flash | Fast generation (122.7 tok/s in Artificial Analysis”); very cheap off-peak pricing; mature text quantization ecosystem; highly optimized for CPU-based local GGUF. | Peak hour rate variance; text-only base model (no native vision); slower TTFT. |
| GLM-5.3-Flash | 57 points on AA Intelligence; native multimodal parsing; 4.44× KV cache compression; flat pricing; fast TTFT (1.21s); MIT license. | Slightly slower raw token generation speed than DeepSeek; local multi-node deployments are hardware-intensive. |
DeepSeek-V4-Flash vs GLM-5.3-Flash: どちらを選ぶべきか?
| Use case | Recommended | Why |
|---|---|---|
| Default frontier API | GLM-5.3-Flash | Scores higher on the intelligence index (57) and dominates multi-step agent benchmarks. |
| Long-running text agent | DeepSeek-V4-Flash | Blazing generation speed (122+ tok/s) makes it highly efficient for massive text/code generation. |
| Visual coding / UI workflows | GLM-5.3-Flash | Native multimodal design supports visual-in-the-loop debugging and UI rendering analysis. |
| Private/self-managed VPC | GLM-5.3-Flash | MIT licensed with KDA + NoPE MLA compression, which cuts hardware VRAM requirements by 4.44×. |
| Local CPU-only run | DeepSeek-V4-Flash | Stronger local GGUF quant support (92GB Unified Memory for extreme 1-bit or 3-bit runs). |
| Lower peak output cost | GLM-5.3-Flash | Standard output price of $0.50/MTok remains flat and is cheaper than DeepSeek's $1.32 peak output rate. |
| Heavy Prompt Caching | DeepSeek-V4-Flash | Off-peak cache hits cost an exceptionally low $0.007 per million tokens. |
Cometapi で DeepSeek-V4-Flash と GLM-5.3-Flash にアクセスする理由
両モデルは CometAPI に完全統合されています。開発者は DeepSeek-V4-Flash にアクセスでき、Chat Completions / Responses スタイルのアクセスをサポートし、GLM-5.3-Flash model page は統一された CometAPI エンドポイントを通じて GLM-5.3-Flash を公開します。これにより、認証やアプリケーションの大半の配線をそのままにモデル ID を切り替えるだけで A/B テストが容易になります。
結論
DeepSeek-V4-Flash-0731 と GLM-5.3-Flash の登場は、長文脈・スパース MoE モデル展開の経済性を一変させました。両アーキテクチャは、非常に低い価格帯で高いインテリジェンスを提供します。
DeepSeek-V4-Flash-0731 は、生成スループット、推測デコーディング、ローカル CPU ベース量子化で優れた、テキストとコード向けに高度に最適化されたエンジンです。GLM-5.3-Flash は、低レイテンシの視覚推論とハイブリッド注意機構を組み合わせ、オンプレミスホスティングを高効率化した、マルチモーダルおよびエージェントベースのワークフローにおける大きな前進です。
FAQs
GLM-5.3-Flash の匿名テスト名は?
正式リリース前、GLM-5.3-Flash は OpenRouter および OpenCode 上で「Ox Alpha」というコードネームで匿名テストされ、開発者の間で素早く人気モデルとなりました。
これらのモデルは一般的な個人用コンピュータでローカル実行できますか?
はい。両モデルはオープンウェイトで Hugging Face に公開されています。ただしパラメータ規模のため、ローカルホスティングには大きなユニファイドメモリが必要です。
- DeepSeek-V4-Flash-0731: 極端な 1-bit 量子化には約 92GB RAM が必要。推奨の 3-bit 量子化では 110–135GB RAM が必要。
- GLM-5.3-Flash: 極端な 1-bit 量子化には約 100GB RAM、3-bit 走行では 128–150GB のユニファイドシステムメモリが最適。
DeepSeek-V4-Flash は視覚や動画処理に対応していますか?
いいえ。標準の DeepSeek-V4-Flash-0731 はテキスト専用モデルです。視覚タスクには、別のマルチモーダル実験モデル(deepseek-v4-flash-vision-exp)を使用する必要があります。
GLM-5.3-Flash における「visual-in-the-loop」プログラミングはどのように機能しますか?
このモデルはネイティブな視覚・画像理解を備えているため、フロントエンドコードを作成し、レンダリングされた視覚出力をレビューし、レイアウトやスタイルの誤りを特定し、人間がレイアウト問題をテキストで説明しなくてもコードを書き直して修正できます。
プロンプトキャッシングはどのようにコストを節約しますか?
同じ大きなコンテキスト(コードベースや文書コレクションなど)を複数の API コールで送る場合、両モデルともこのプロンプトをキャッシュできます。以後のコールでは「キャッシュヒット」料金のみ課金され、DeepSeek-V4-Flash(非ピーク)で $0.007/MTok、GLM-5.3-Flash(プロモ)で $0.015/MTok に低下し、API コストを大幅に削減します。
