先に結論
Kimi K4 は正式発表されておらず、Moonshot AI も最終仕様、ベンチマーク結果、API 価格、リリース日を公開していません。これまでで最も強い公開情報は、Moonshot が Nvidia Blackwell の追加キャパシティを調達しようとしている という報道であり、これは Kimi K3 よりも大幅に大きい後継モデルを準備していると伝えています。次世代モデルが準備中であることを示す重要な証拠ですが、これは公式な製品発表ではありません。
責任ある議論として触れられるのは、K4 が取り得る方向性です。Moonshot の現在の 2.8 兆パラメータの Kimi K3 は、スパースな Mixture-of-Experts のスケーリング、ネイティブなビジョン、100 万トークンのコンテキストウィンドウ、長期ホライゾンのエージェント能力をすでに組み合わせています。したがって Kimi K4 は、単なるパラメータ数ではなく、信頼できるエージェント実行、コーディングの深さ、マルチモーダル推論、スケーリング効率で評価される可能性が高いでしょう。
中心的な結論は単純です。Kimi K4 は開発中であると見られますが、社外で流通しているほぼすべての数値仕様は未確認です。信頼に足るプレビューは、確認済みの K3 の事実、K4 に関する報道、そして将来に向けた推測を明確に分ける必要があります。
Kimi K4 とは?4
Kimi K4 は、Kimi K3 の後継として期待されている Moonshot AI のモデルに対して使われている公称です。現在は、発表済みの API 製品ではなく、開発中のモデルとして扱うべきです。Moonshot AI は K4 のモデルカード、技術レポート、API 識別子、価格ページ、ライセンス、ベンチマーク表を公開していません。
The Information は、Moonshot AI が Kimi K4 の計画を議論している と報じています。事情に詳しい 2 人の情報源を引用し、K4 は K3 よりも大幅に大きく、Moonshot がモデル準備のために追加の Nvidia Blackwell チップへのアクセスを求めていると記しています。しかし、5 兆や 6 兆といった正確なパラメータ数は確認せず、K4 をオープンウェイトで公開するのか、ホスト型プロダクトのみで提供するのか、複数バリアントに分けるのかも不明です。
この不確実性は重要です。というのも、Kimi のリリースは歴史的に、モデルウェイト、ホスト型 API、エンドユーザー製品、特化したエージェントシステムを組み合わせてきたからです。将来の K4 発表が指す対象は、単一モデル、モデル群、あるいはルーティング、ツール、メモリ、マルチモーダル要素を中心に構築されたより広いシステムのいずれにもなり得ます。
なぜ Kimi K4 はこんなに早く注目されているのか?
Kimi K3 がオープンウェイトのスケーリング上限を引き上げた
Kimi K3 は、例外的に野心的なベースラインを確立しました。その 公式モデル概要 には、総パラメータ数 2.8 兆、アクティブ化パラメータ 1040 億、93 層、896 のルーティングされたエキスパート、トークンごとに選択される 16 エキスパート、共有エキスパート 2、コンテキスト長 1,048,576 トークンが記載されています。モデルには 401M パラメータの MoonViT-V2 ビジョンエンコーダも含まれます。
この組み合わせが重要である理由は二つあります。第一に、オープンウェイトのモデルが、主要なクローズドシステムと同等の広範な能力クラスへスケールできることを示した点。第二に、そのスパース設計が、総パラメータ数と推論コストが同一ではないこと、すなわち各トークンでアクティブ化されるのはエキスパートの一部に過ぎないことを実証した点です。
さらに大きい後継を示唆する報道
業界報道によれば、Moonshot AI は K4 のために Blackwell クラスのコンピュートをさらに求めている とされ、計画されているモデルは K3 よりも大幅に大きいと説明されています。この報道は K4 が単なるコミュニティの憶測ではないことを示す最善の公開証拠ですが、最終的なアーキテクチャ、学習スケジュール、モデルサイズ、デプロイ計画は依然として未確定です。
コンピュートの話は、スケールが二つの別個のボトルネックを生むために重要です。学習には、最先端のランを完了するために十分なアクセラレータ、ネットワーキング、ストレージ、エンジニアリングの安定性が必要です。一方でサービングには、許容可能なレイテンシとコストを実現できる別個の推論戦略が必要です。より大きな K4 は、単なるハードウェア増強だけではなく、アーキテクチャとシステム両面の改善を必要とするでしょう。
K3 のアーキテクチャはさらなるスケールを念頭に設計された
Moonshot の Kimi K3 テクニカルブログ は、Kimi Delta Attention と Attention Residuals を、兆規模を超えてスケールするよう設計されたモデルのアーキテクチャ上の背骨だと説明しています。Kimi Delta Attention は効率的なアテンションの基盤を提供し、Attention Residuals は表現を深さ方向に一様に蓄積するのではなく、選択的に再取得します。
K3 はまた Stable LatentMoE を採用し、896 のルーティングされたエキスパートのうち 16 を有効化します。Quantile Balancing はルーター・スコアの分位点からエキスパート割当を導出し、Per-Head Muon はアテンションヘッドを独立に最適化します。これらの選択は、K4 が解決すべき課題を示しています。すなわち、安定したルーティング、バランスの取れたエキスパート利用、効率的な長コンテキスト・アテンション、極端なスケールでの予測可能な学習です。
なぜ Kimi K3 がすでに 2.8T モデルなのに Kimi K4 は重要なのか?
Kimi K3 はすでに異例の大規模で動作しているため、K4 をパラメータ数の多寡だけで評価することはできません。より意味のある問いは、追加の学習コンピュートが、タスク完了、長期ホライゾンの信頼性、そして実効的な推論コストを向上させるかどうかです。
有用な K4 の評価は、次の四つの指標に焦点を当てるべきです。
- タスク完了率
- 長期ホライゾン・エージェントの信頼性
- コーディング成功率
- 成功裏に完了したタスクあたりのコスト
最後の指標は、開発者にとって特に重要です。成功裏にリポジトリ修正を完了するコストが低いモデルは、高いベンチマーク・スコアでも失敗トラジェクトリが大幅に多いモデルより価値が高い場合があります。
予想される Kimi K4 の仕様
以下の表は、K3 の確認済み技術ベースラインと、K4 に関する報道および推測を区別します。「予想」は「発表済み」を意味しません。Moonshot AI がモデルカードまたは API ドキュメントを公開するまでは、不明な項目は不明のままにすべきです。
| Specification basis | Kimi K3 confirmed | Kimi K4 public reporting | Confidence |
|---|---|---|---|
| Model status | リリース済み | 開発中 | 報道 |
| Architecture | スパース MoE | 非公開;スパース MoE の発展形が有力 | 推測 |
| Total parameters | 2.8T | K3 より大幅に大きいと報じられている | 報道;正確な値は不明 |
| Activated parameters | 104B | 非公開 | 不明 |
| Expert configuration | 896 ルーティング;16 選択;2 共有 | 非公開 | 不明 |
| Context window | 1,048,576 tokens | 少なくとも 1M と見込まれるが未確認 | 期待 |
| Attention | KDA と Gated MLA | 次世代 KDA の可能性 | 推測 |
| Native vision | MoonViT-V2 | マルチモーダル継続が見込まれる | 期待 |
| Open weights | 利用可能 | 未確認 | 不明 |
| API model ID | kimi-k3 | 未発表 | 不明 |
| Release date | 利用可能 | 未発表 | 不明 |
最も重要な抑制線はパラメータの行です。「大幅に大きい」は正確なサイズを確定しません。同様に、K3 の 100 万トークン・コンテキスト、マルチモーダル設計、オープンウェイト公開を、K4 の仕様表に確認済みの事実として写すことはできません。これらは方向性としては妥当な期待に過ぎず、公表された製品コミットメントではありません。
Kimi K4 はどんな機能を導入し得るか?
-
より大きく、しかしより効率的なスパース MoE スケーリング
明白な期待は、より大規模な Mixture-of-Experts モデルです。より重要なのは、K4 が総容量、有効化容量、サービングコストの関係を改善できるかどうかです。ルーティングを改善せずにエキスパートプールを増やすと、未活用のスペシャリスト、ホットなエキスパート、通信ボトルネック、不安定な学習を招き得ます。
信頼できる K4 の前進は、追加容量を、より良い負荷分散、より特化したエキスパート、低いアクティベーション比率、強いエキスパート間調整と組み合わせるはずです。これらの詳細は何も開示されていないため、記事では「リークされた機能」ではなく「エンジニアリングの目標」として記述すべきです。
進化した Kimi Delta Attention
Kimi Delta Attention は K3 の長コンテキスト設計の中核です。次世代版は、100 万トークン入力におけるリトリーバルを改善し、アテンション状態メモリを削減し、長時間のエージェント実行中に重要情報を保持できるかもしれません。実用上のテストは、コンテキストウィンドウのサイズだけではなく、攻めたチャンク分割や繰り返しリトリーバルに頼ることなく、遠くの証拠を見つけ、結び付け、行動できるかどうかです。
より信頼できる長期ホライゾン・エージェント
Kimi K3 はすでに長時間の技術・知識作業に位置付けられています。公式デモ には、コンパイラ開発、GPU カーネル最適化、科学コーディング、インタラクティブ・リサーチ、ゲーム開発、チップ設計ワークフローが含まれます。K4 は、これらの印象的なデモをより一貫した日常の実行に昇華させる必要があります。
重要な指標は、不要なツール呼び出しの減少、ゴール保持の強化、失敗後のリカバリー向上、より信頼できる検証、そしてラン間の分散低下です。難しいベンチマークを一度だけ完了できても、本番で挙動が不安定なモデルは、わずかに弱くても実行が確実なモデルより価値が低くなります。
より強いコーディングとソフトウェア工学
K4 は引き続きコーディングに強く焦点を当てる可能性が高いですが、フロンティアは単体関数の生成を超えています。競争力のあるソフトウェア工学モデルは、リポジトリをマッピングし、依存関係を理解し、ターミナルを操作し、複数ファイルを変更し、テストを実行し、失敗を診断し、アプローチを改訂できなければなりません。
K3 はすでに ProgramBench、SWE-Marathon、FrontierSWE、ターミナルタスクで強力です。K4 の明確な機会は、深いリポジトリ修復で残るギャップを埋めつつ、長期的なマルチステップ作業における K3 の強みを維持することです。
さらに深いネイティブ・マルチモーダリティ
K3 はモデルレベルでテキストとビジョンを組み合わせ、Moonshot のプロダクト例はその能力を動画編集や vision-in-the-loop 開発へ拡張しています。K4 は、スクリーンショットからコードへのワークフロー、チャートや文書の推論、動画の時間理解、インタフェーステスト、そして視覚的結果を確認してから続行するエージェントを改善し得ます。
重要なのは、画像を受け付けることと、閉ループ内で知覚を使うことの区別です。マルチモーダル・エージェントは、描画結果を観察し、ミスマッチを特定し、作業を編集し、改訂を検証する必要があります。これは単一の画像質問に答えるよりも厳しい要件です。
より良い推論およびデプロイ効率
K3 より大きいモデルは、たとえウェイトが公開されても自前ホスティングが難しい可能性があります。K4 は、量子化対応学習、効率的なエキスパート並列、スペキュレイティブ・デコーディング、最適化された KV 状態管理、小型の相棒バリアントから恩恵を受けるでしょう。多くのチームにとって、フロンティア級のスパースモデルを直接運用するより、ホスト型 API アクセスの方が現実的であり続ける可能性があります。
Kimi K4 に必要なベンチマーク性能は?
K4 の公開ベンチマーク結果はありません。責任あるアプローチは、K3 と現在のフロンティア競合が作る性能基準を確立し、後継がどこで改善すべきかを明らかにすることです。以下の拡張ベースラインは、推論、コーディング、ターミナル操作、深いリサーチ、エージェント的知識作業、スプレッドシート作業を網羅します。すべての値は表ヘッダーでリンクした公式の Kimi K3 モデルカードに由来します。
| Official benchmark suite | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|---|
| GPQA Diamond | 93.5 | 94.1 | 92.6 | 91.0 |
| DeepSWE | 67.5 | 73.0 | 70.0 | 59.0 |
| ProgramBench | 77.8 | 77.6 | 76.8 | 71.9 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 88.0 | 84.6 |
| FrontierSWE | 81.2 | 71.3 | 86.6 | 66.7 |
| SWE-Marathon | 42.0 | 39.0 | 35.0 | 40.0 |
| Kimi Code Bench 2.0 | 72.9 | 64.8 | 76.9 | 71.7 |
| BrowseComp | 91.2 | 90.4 | 88.0 | 84.3 |
| DeepSearchQA (F1) | 95.0 | Not reported | 94.2 | 93.1 |
| ResearchRubrics | 76.2 | 73.8 | Not reported | 73.5 |
| GDPval-AA v2 (Elo) | 1686 | 1736 | 1747 | 1593 |
| SpreadsheetBench 2 | 34.8 | 32.4 | 34.7 | 31.6 |
これらは単一の統制された独立リーダーボードではなく、Moonshot が報告した比較結果です。いくつかのモデルは異なるエージェント・ハーネスで評価され、公式の脚注には、フォールバック、サイバーガード、ハードウェア代替、推論設定、ベンチマーク固有の手順が記載されています。GDPval-AA v2 は Elo レーティングであり、パーセンテージ行と数値的に比較すべきではありません。小さなスコア差を普遍的な優位性と解釈すべきではありません。
公式のコーディング・ベンチマークのスナップショット

公式の Kimi K3 コーディング比較。画像は Moonshot の公開グラフィックです。最新の数値表と評価方法は 現行のモデルカードと脚注 を参照してください。
ベンチマーク結果と解釈
GPT-5.6 Sol は DeepSWE で Kimi K3 を上回っており、難しいリポジトリレベルのソフトウェア修復で優位を示しています。Claude Fable 5 は FrontierSWE で優勢で、一方で K3 はそのベンチマークで GPT-5.6 Sol と Claude Opus 4.8 を明確に上回っています。
K3 のプロファイルは持続的な作業でより特徴的になります。ProgramBench でわずかに先行し、選択された比較の中で SWE-Marathon で最強の結果を記録しています。BrowseComp でもリードし、SpreadsheetBench 2 では実質的に Claude Fable 5 と同等です。
K4 にとって目標は、すべてのチャートで一定割合の増加ではありません。より有用なターゲットは、深いコードベース修復とコンピュータ利用の信頼性を改善しつつ、長期的なコーディング、ブラウジング、エージェント的知識作業における K3 の強みを失わないことです。

公式の Kimi K3 一般およびビジュアル・エージェント比較。出典: Moonshot AI Kimi K3 モデルページ。
Kimi K4 と Kimi K3、GPT-5.6 Sol、Claude Fable 5 の比較
プレリリースの比較では、存在しない K4 のスコアを割り当てることはできません。しかし、K3 ラインを拡張するなら K4 が占めると期待される競争上の位置付けは示せます。
| Dimension | Kimi K4 expected position | Kimi K3 confirmed | Closed references: GPT-5.6 Sol and Claude Fable 5 |
|---|---|---|---|
| Availability | 開発中 | 利用可能 | 利用可能 |
| Model openness | 不明 | 公開ウェイト | プロプライエタリ |
| Confirmed context | 不明 | 1M tokens | 事業者定義または 1M クラス |
| Primary strength | より大規模なフロンティア知能が期待 | 長期ホライゾンのコーディングと知識作業 | フロンティア級の推論、コーディング、コンピュータ利用 |
| Multimodality | 期待されるが未確認 | ネイティブ・ビジョン | マルチモーダル |
| Self-hosting | 不明 | 十分なインフラがあれば可能 | 不可 |
| Agent maturity | 改善が期待 | 強力 | 強力 |
| Deployment cost | 不明かつ高コストの可能性 | 自前では高コスト;ホスト型 API あり | ホスト型 API のみ |
| Main reason to watch | スケール+公開性の可能性 | 検証済みのオープン・フロンティア・ベースライン | 最大のクローズドモデル能力 |
比較結果
Kimi K3 は、公開ウェイト、100 万トークンのコンテキストウィンドウ、長期ホライゾンでの強力な性能で差別化されています。GPT-5.6 Sol は、難しい推論とリポジトリ修復の一部で依然として強く、Claude Fable 5 はソフトウェア工学とコンピュータ利用のエージェントで特に競争力があります。
もし K4 が公開または広くアクセス可能なまま、これらの能力ギャップを埋めるなら、その意義は単なるパラメータ増よりも大きくなります。オープンまたはセミオープンなシステムが、最強のクローズドなエージェント・プラットフォームに迫る信頼性を示すことになるからです。逆に K4 がクローズドかつ提供コストが極めて高い場合、その実用上の差異ははるかに小さくなるでしょう。
オープンウェイト AI にとって Kimi K4 は何を意味し得るか?
K3 はすでに、オープンウェイト開発が、かつてはほぼ専らプロプライエタリな研究所に結び付けられていた規模へと入っていることを示しています。K4 はその境界をさらに押し広げる可能性がありますが、「オープン」にはいくつかの層があります。ダウンロード可能なウェイト、実用的なコード、現実的なライセンス、再現可能な推論、手頃なハードウェア要件、アクセス可能なホスト型 API です。
モデルは技術的にはオープンでも、経済的にはアクセス不能であり得ます。K3 の 2.8T 規模は、スパースなアクティベーションと量子化があっても、真剣な自前ホスティングには相当なインフラを要することを意味します。さらに大きな K4 は、ウェイトを検証できる研究者と、モデルを効率的に運用できる組織とのギャップを広げる可能性があります。
より広いエコシステムにとって理想的な K4 の公開は、透明なウェイト、効率的な推論レシピ、強いツール利用行動、そしてホスト型 API を組み合わせることです。その組み合わせにより、研究者はモデルを研究し、企業は API を通じてデプロイし、特化チームはプライベートまたは規制対象のワークロード向けに適応できます。
Kimi K4 はいつリリースされるのか?
Moonshot AI は Kimi K4 のリリース日を発表していません。公開報道は、モデルを コンピュート調達 と開発計画に結び付けています。したがって、具体的な月や四半期、カウントダウンは信頼できません。
また、K4 が Kimi の Web プロダクト、Kimi Code、Kimi Work、Moonshot API、オープンウェイトのリポジトリに同時に現れるかどうかも不明です。K3 はそれらの複数面で利用可能ですが、K4 は段階的なロールアウトや異なる配布戦略に従う可能性があります。
注視すべきシグナルは、公式の Moonshot テクニカルブログ、検証済みのモデルリポジトリ、Kimi Platform ドキュメント、公開されたライセンス、再現可能な評価詳細を含むモデルカードです。SNS 投稿やパラメータの噂は、これらの一次情報が出るまでは二次的であるべきです。
K4 を待つ間に Kimi モデルへアクセスする方法
K4 は現在呼び出せません。開発者は代わりに、CometAPI 上の Kimi K3 を通じて現行アーキテクチャを評価できます。現在のモデル ID はコードのプレーンテキスト: kimi-k3 です。リクエストは POST /v1/chat/completions を使用します。公式の統合ページで公開されるまで、推測的な kimi-k4 識別子に本番リクエストを送らないでください。
CometAPI アカウントを作成し、API キーを生成 します。アプリケーションのソースにハードコードするのではなく、環境変数にキーを保存してください。
from openai import OpenAI client = OpenAI( api_key="YOUR_COMETAPI_KEY", base_url="https://api.cometapi.com/v1", ) response = client.chat.completions.create( model="kimi-k3", messages=[ { "role": "user", "content": "Analyze the architecture of this software project." } ], ) print(response.choices[0].message.content)
コードブロックは Python です。エンドポイント、モデル ID、パラメータ名、コードのキーワードは、ハイパーリンクではなく意図的にコードとして提示されています。K4 が利用可能になったら、実際のモデル識別子、エンドポイント互換性、対応モダリティ、価格を確認した上で本番のルーティングを変更してください。
Kimi K4 について依然として不明な点
責任あるプレリリース記事は、コミュニティの推定で埋めるのではなく、次の不明点を明示的に保持すべきです。
- 最終的な総パラメータ数と有効化パラメータ数
- エキスパート数、共有エキスパート、ルーティング戦略
- コンテキストウィンドウと最大出力長
- 入出力でサポートされるモダリティ
- オープンウェイトの状態、リポジトリ、ライセンス
- API モデル ID、エンドポイント、推論モード、価格
- 公式ベンチマーク結果と評価ハーネス
- 量子化形式と自前ホスティングのハードウェア要件
- 製品の可用性とリリース日
このセクションを明確に保つことは、予測仕様が後に「公式な事実」として繰り返されるのを防ぎます。また、Moonshot AI が一次ドキュメントを公開した際に、記事を更新しやすくします。
FAQ
Kimi K4 はリリース済みですか?
いいえ。Kimi K4 のモデルカード、API ドキュメント、公的なリリース告知はありません。現在の議論は主に、Moonshot AI が K3 の後継を準備している という報道に基づいています。
Kimi K4 の規模はどのくらいですか?
正確なサイズは不明です。報道では K3 よりも大幅に大きい可能性があるとされていますが、複数兆パラメータに関する具体的な主張は Moonshot AI によって確認されていません。
Kimi K4 はオープンソースになりますか?
未確認です。K3 は Kimi K3 License の下で公開ウェイトですが、過去の公開戦略が K4 に同様の配布を保証するものではありません。
Kimi K4 は 100 万トークンのコンテキストウィンドウを持ちますか?
K4 が K3 の長コンテキスト能力を維持または改善することは合理的に期待できますが、Moonshot AI は K4 のコンテキスト上限を公表していません。
開発者は今 CometAPI 経由で Kimi K4 を使えますか?
確認済みの K4 モデル経路はありません。開発者は現在、Kimi K3 をテストし、同じ統合レイヤーで他のフロンティアモデルと比較できます。
結論
Kimi K4 を噂のパラメータ数に矮小化すべきではありません。K3 はすでに、Moonshot AI が極端なスパースモデル・スケール、100 万トークン・コンテキスト、ネイティブ・ビジョン、公開ウェイト、長期ホライゾンのエージェント挙動を組み合わせられることを証明しています。本当の問いは、K4 がそのスケールを、より信頼できるソフトウェア工学、より強力なコンピュータ利用、より良いマルチモーダルのフィードバックループ、より効率的な推論へと転化できるかどうかです。
最も重要な詳細は依然として不明です。正確なアーキテクチャ、リリース日、ベンチマークスコア、ライセンス、API アクセス、サービングコストです。Moonshot が一次ドキュメントを公表するまでは、報道された開発シグナル以外のあらゆる K4 仕様を「期待」または「推測」とラベル付けすべきです。
開発者は Moonshot AI の現在の方向性を評価するために待つ必要はありません。CometAPI ですでに Kimi K3 が利用可能 であり、Kimi K4 の到来前に、コーディング、長コンテキスト推論、マルチモーダル分析、エージェント・ワークフローの実用的なベースラインを提供します。
