要約
DeepSeek V4.1 Flash は、従来の V4 Flash 世代を、552B-parameter の因果型エンコーダ・デコーダ MoE モデル、ネイティブな画像理解、1M トークンのコンテキストウィンドウ、そして大幅に低い提供コストへと置き換えます。DeepSeek の公式比較では、V4.1 Flash は V4 Pro 0813 に対してコーディング、ターミナル、セキュリティ、エージェント系のほとんどのベンチマークで改善を示す一方、GPQA Diamond と HLE(ツールなし)では依然として V4 Pro が優位にあります。
DeepSeek の現在の API 料金ページでは、deepseek-flash と deepseek-v4-pro が別個のルートとして掲載されており、それぞれ V4.1 Flash と V4-Pro-0813 を提供しています。両者は価格、同時実行上限、ビジョン対応が異なります。したがって、新規統合では過去のエイリアス挙動に頼らず、意図するワークロードに合致するモデル ID を選択してください。
重要なポイント
- V4.1 Flash と V4 Pro は現時点で別個の公式 API 選択肢です:V4.1 Flash には deepseek-flash、V4-Pro-0813 には deepseek-v4-pro を使用してください。
- 最大の改善は、ターミナル作業、コーディングエージェント、オートメーション、セキュリティ指向の実行などに見られ、すべてのクローズドブック推論ベンチマークで一様に見られるわけではありません。
- V4.1 Flash は、キャッシュヒット入力、キャッシュミス入力、出力トークンのいずれにおいても、現在掲載の V4 Pro ルートより実質的に安価です。
- V4.1 Flash はネイティブなビジョンを追加し、ドキュメント上の同時実行数を 500 から 2,500 に引き上げ、グローバル KV キャッシュのストレージをトークンあたり 890 バイトに削減します。
- エイリアスが機能していても移行は明示的に行うべきです:モデル ID を更新し、Thinking/Non-thinking の動作を検証し、ツール呼び出しと画像入力を再テストし、トークン使用量とレイテンシを監視してください。
現在のルーティング注記:公式の料金ページは deepseek-v4-pro を V4-Pro-0813 として示しており、V4.1 Flash とは別です。
DeepSeek V4.1 Flash と V4 Pro の仕様比較
アーキテクチャは、V4 Pro の非常に大規模なスパース MoE デザインから、V4.1 Flash の非対称な因果型エンコーダ・デコーダ設計へと変わりました。新しいモデルは、入力処理時に有効化するパラメータ数を生成時より少なくし、プリフィルのコストを抑えつつ、生成能力を維持します。
| 仕様 | DeepSeek V4.1 Flash | DeepSeek V4 Pro 0813 |
|---|---|---|
| アーキテクチャ | 因果型エンコーダ・デコーダ MoE | スパース MoE |
| 総パラメータ バックボーンパラメータ / リポジトリのウェイト数 | バックボーン 552B パラメータ;Hugging Face では 763B のモデルサイズを記載 | バックボーン 1.6T パラメータ;Hugging Face では約 1.7T のモデルサイズを記載 |
| アクティブパラメータ | 入力で 8B、出力で 16B | トークンあたり 49B |
| コンテキストウィンドウ | 1M トークン | 1M トークン |
| 最大出力 | 384K トークン | 384K トークン |
| Thinking / Non-thinking モード | 対応 | 対応 |
| ネイティブ画像理解 | 対応 | 非対応 |
| ドキュメント上の同時実行数 | 2,500 | 現行構成で 500 |
| 現在の公式 API ステータス | deepseek-flash として稼働中 | deepseek-v4-pro(V4-Pro-0813)として稼働中 |
パラメータ数に関する補足:DeepSeek の V4.1 Flash モデルカードは 552B のバックボーンパラメータを記載していますが、Hugging Face のリポジトリは 763B のモデルサイズを示しています。これらは異なる算定範囲を指しており、互換的な合計として扱うべきではありません。
出力長に関する補足:V4.1 Flash のモデルカードはローカル推論において max_tokens ≥ 256K を推奨していますが、DeepSeek の現在の API 料金ページでは両 API モデルとも最大出力を明示的に 384K としています。推奨推論設定は API が強制する上限と同一ではありません。
V4.1 Flash が V4 Pro より改善している点
DeepSeek の公式ベンチマーク表では、実行負荷の高いワークロードで最も明確な改善が示されています。以下の百分率は公開スコアから算出しています。指標がレーティングであるなど単純な百分率が不適切な場合は割合比較を省略しています。
| ベンチマーク | V4.1 Flash | V4 Pro 0813 | 差分 | 解釈 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 | +2.7 ポイント;+3.1% | ターミナル実行の信頼性向上 |
| Terminal-Bench 3.0 | 30.0 | 11.8 | +18.2 ポイント;+154.2% | 難度の高いターミナルタスクで大幅な伸び |
| Terminal-Bench 4.0 | 31.2 | 12.4 | +18.8 ポイント;+151.6% | 新しいターミナルタスクで大幅な伸び |
| DeepSWE v1.1 | 74.2 | 62.7 | +11.5 ポイント;+18.3% | リポジトリレベルのソフトウェア作業が強化 |
| ProgramBench | 20.3 | 15.5 | +4.8 ポイント;+31.0% | プログラム合成の改善 |
| NL2Repo-Bench | 64.0 | 61.5 | +2.5 ポイント;+4.1% | 自然言語からリポジトリへの変換が改善 |
| CyberGym | 88.1 | 83.3 | +4.8 ポイント;+5.8% | サイバー系タスク実行が強化 |
| HLE with tools | 63.9 | 60.0 | +3.9 ポイント;+6.5% | ツール併用時の推論が向上 |
| Automation-Bench | 54.8 | 43.2 | +11.6 ポイント;+26.9% | オートメーションで実質的な向上 |
| Agents’ Last Exam | 31.8 | 25.7 | +6.1 ポイント;+23.7% | 一般的なエージェント振る舞いが強化 |
| Codeforces rating | 3,471 | 3,348 | +123 レーティングポイント | 競技プログラミングの改善 |
| GPQA Diamond | 90.9 | 92.4 | −1.5 ポイント | V4 Pro が優位を維持 |
| HLE without tools | 36.8;テキストサブセットで 39.1 | テキストサブセットで 42.7 | 比較可能なテキストサブセットで −3.6 ポイント | V4 Pro が優位を維持 |
結果は多面的です。V4.1 Flash は、コーディングエージェント、ターミナル操作、オートメーション、セキュリティタスク、ツール使用、ビジョン、同時実行性、コストで決定的に優れています。V4 Pro に残る優位性は、特定の純粋推論テストに集中しています。したがって、ワークロードは単一の総合主張ではなく、タスク構成によって評価すべきです。
V4.1 Flash が V4 Pro より高効率な理由
入力と出力の非対称な計算
V4.1 Flash は、入力処理時に 8B、出力生成時に 16B のパラメータを有効化します。この非対称設計は、プリフィルとデコードで異なる計算需要を狙っており、両段階に同じアクティブパラメータ予算を強いることなくコストを削減します。
KV キャッシュのフットプリント縮小
DeepSeek は、V4.1 Flash が、前世代の KV キャッシュに比べて HBM 使用量を 1/4、SSD 容量を 1/8 に抑えると報告しています。公開されたチャートでは、グローバル KV キャッシュがトークンあたり 890 バイトであるのに対し、V4 Flash は 3,514 バイトとされています。

ネイティブなマルチモーダル入力と高い同時実行性
V4.1 Flash は画像をネイティブに解釈でき、ドキュメント上の同時実行上限は 2,500 と、現在の V4 Pro の 500 に対して 5 倍です。これらの変更は、スクリーンショットベースのエージェント、ドキュメント抽出、ビジュアルトラブルシューティング、高ボリュームの本番キューにとって重要です。
V4 Pro と比較した V4.1 Flash のコストは?
現在の公式 API 料金表では、両ルートが個別に価格設定されています。1M トークンあたり、V4.1 Flash はキャッシュヒット入力が $0.003/$0.006、キャッシュミス入力が $0.15/$0.30、出力が $0.60/$1.20(オフピーク/ピーク)です。V4 Pro はそれぞれ $0.022/$0.044、$0.66/$1.32、$1.98/$3.96 です。価格は変更される可能性があるため、本番の予算は最新の料金ページを参照してください。
DeepSeek V4 Pro または V4 Flash から V4.1 Flash にどう移行すべきか?
本番で明示的なモデル ID を使用する
V4.1 Flash を使いたい場合は deepseek-flash を使用してください。古い deepseek-v4-flash と deepseek-v4-flash-vision-exp の名称は引き続き V4.1 Flash に解決され、新しい Flash の価格で課金されますが、明示的な命名のほうが監視や将来のロールバックの監査に有利です。意図的に現在掲載の V4-Pro-0813 バックエンドを使う場合は deepseek-v4-pro を使用してください。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # or "deepseek-v4-pro"
messages=[{"role": "user", "content": "Review this migration plan."}],
)
print(response.choices[0].message.content)
エンドポイント互換性だけでなく挙動を再検証する
- Thinking と Non-thinking の両モードで代表的なプロンプトを実行し、タスク成功率、トークン数、レイテンシを比較します。
- ツールスキーマ、JSON 出力、Responses API の挙動、プレフィックス補完、FIM を使用している場合は再テストします。
- 新しいネイティブビジュアル機能を使う製品であれば、画像入力のテストを追加します。
- 既存の V4 Pro 前提を持ち越さず、ピークとオフピーク料金で予算を再ベースラインします。
- スケール時には入力コストがキャッシュヒット率に大きく左右されるため、プロンプトキャッシュのヒット率を追跡します。
意図するバックエンドを明示的に選ぶ
現在の deepseek-v4-pro ルートは V4-Pro-0813 を選択します。チームは、解決されたモデルバージョン、評価日、プロンプトセット、料金期間を記録し、ルーティングが再度変更された場合でも比較が再現可能になるようにしてください。
V4.1 Flash に最適なワークロードは?
| ワークロード | 推奨選択 | 理由 |
|---|---|---|
| コーディングエージェントとリポジトリ保守 | V4.1 Flash | DeepSWE、ProgramBench、NL2Repo、ターミナルのスコアが高い |
| ツール駆動のオートメーション | V4.1 Flash | Automation-Bench、HLE-with-tools、エージェントのスコアが高い |
| 画像対応アシスタント | V4.1 Flash | ネイティブな画像理解 |
| 高スループットまたはコスト重視の提供 | V4.1 Flash | 同時実行性が高く、トークン単価が大幅に低い |
| V4 Pro の過去再現と現行の V4 Pro へのアクセスおよび評価 | V4 Pro | 公式ルートは現在 V4-Pro-0813 を指しています |
| 純粋なクローズドブック推論 | ドメインデータで検証 | GPQA Diamond と HLE(ツールなし)では V4 Pro が依然優位 |
DeepSeek V4.1 Flash と V4 Pro の FAQ
DeepSeek V4.1 Flash は V4 Pro より優れていますか?
コーディングエージェント、ターミナルタスク、オートメーション、ツール使用、ビジョン、スループット、価格といった多くの本番観点では、はい。GPQA Diamond と HLE(ツールなし)では V4 Pro の公開スコアが高いため、純粋推論のワークロードはドメイン固有のプロンプトで検証してください。
deepseek-v4-pro はまだ呼び出せますか?
はい。現在の公式 API ページは deepseek-v4-pro を V4-Pro-0813 として掲載しており、独自の価格と同時実行上限を持ちます。
新しい統合ではどのモデル ID を使うべきですか?
V4.1 Flash には deepseek-flash、V4-Pro-0813 には deepseek-v4-pro を使用してください。両者をエイリアスとして扱わないでください。
旧来の V4 Flash のモデル ID はまだ使えますか?
DeepSeek は、deepseek-v4-flash と deepseek-v4-flash-vision-exp のリクエストが自動的に V4.1 Flash にルーティングされ、新しい Flash の料金で課金されると述べています。とはいえ、明確化のために設定済みのモデル ID を更新することを推奨します。
DeepSeek V4.1 Flash は画像に対応していますか?
はい。ネイティブな画像理解は V4.1 Flash の一部です。従来の V4 Pro API にはこの機能はありませんでした。
DeepSeek V4.1 Flash は現在の V4 Pro より安価ですか?
はい。現在の公式料金表では、V4.1 Flash のキャッシュヒット入力、キャッシュミス入力、出力の価格が V4 Pro より低く設定されています。
移行後に同一の出力を期待できますか?
いいえ。エンドポイントの互換性は、同一の推論経路、ツール選択、トークン使用量、フォーマットを保証しません。本番の評価は再実行してください。
