TL;DR
Grok 4.6 は、エージェント型コーディングとナレッジワーク向けに管理型の最先端 API を求める場合の、より強力なデフォルトです。Artificial Analysis Intelligence Index で 61 を記録し、現在の独立測定でより高速に生成し、料金は入力/出力 100 万トークンあたり $2/$6 から開始します。
Kimi K3 は、コンテキスト長とモデルのオープン性が重要な場合に、より柔軟な選択肢です。2.8 兆パラメータ、104B のアクティブパラメータ、およそ 1M トークンのコンテキストウィンドウ、オープンウェイト、ネイティブなマルチモーダル機能を組み合わせています。ホスト型 API の公称価格は入力/出力 100 万トークンあたり $3/$15 と高めですが、キャッシュヒットは 100 万トークンあたり $0.30 に過ぎません。
結論として、コスト効率の良いホスト型エージェント API を求めるなら Grok 4.6、1M コンテキスト、オープンウェイト、インフラ制御を重視するなら Kimi K3 を選びましょう。コーディング用途では、ベンダーが異なるベンチマーク版やハーネスを公開しているため、自社リポジトリで両方をテストしてください。
Key Takeaways
- Grok 4.6 は 2026 年 8 月 12 日にリリース され、長時間稼働のエージェント、コードベース作業、ナレッジワーク、より野心的なインタラクティブ/ビジュアルプロジェクトに特化しています。
- Kimi K3 は Moonshot AI の 2.8 兆パラメータ のオープンウェイト旗艦モデルで、Kimi Delta Attention、Attention Residuals、ネイティブなビジョン、約 1M トークンのコンテキストウィンドウを備えています。
- 独立した総合インテリジェンスはほぼ同点で、Grok 4.6 が 61、Kimi K3 が 60。
- Grok 4.6 はヘッドラインのトークン価格が低く、入力 $2 / 出力 $6 に対し、Kimi K3 は入力 $3 / 出力 $15。
- Kimi K3 はコンテキスト容量が約 2 倍でオープンウェイトを提供。Grok 4.6 はクローズドだが、複数の独立エージェント評価でターン効率とコスト効率が高い。
Grok 4.6 vs Kimi K3: Quick Comparison
| Specification | Grok 4.6 | Kimi K3 |
|---|---|---|
| Developer | SpaceXAI / xAI | Moonshot AI / Kimi |
| Release date | August 12, 2026 | July 16, 2026 |
| Model ID | grok-4.6 | kimi-k3 |
| Architecture | Not publicly disclosed | MoE; KDA + AttnRes + Stable LatentMoE |
| Total parameters | Not disclosed | 2.8T |
| Active parameters | Not disclosed | 104B |
| Experts | Not disclosed | 896 total; 16 activated/token |
| Context window | 500,000 tokens | 1,048,576 / about 1M tokens |
| Input / output | Text + image → text | Text + image → text |
| Reasoning | Configurable | Always-on; low / high / max |
| Function / tool use | Function calling + structured outputs | ToolCalls, tool_choice, dynamic tool loading |
| Open weights | No | Yes |
| AA Intelligence Index | 61 | 60 |
| Official input / output price | $2 / $6 per MTok | $3 / $15 per MTok |
| Best fit | Hosted agents, coding, knowledge work | Long context, open-weight deployment, coding + visual reasoning |
What Is Grok 4.6?
Grok 4.6 は、コーディング、エージェント型タスク、ナレッジワーク向けの SpaceXAI の最先端モデルです。このリリースは、単なる静的ベンチマーク更新ではなく、長時間稼働のエージェントや、より野心的なインタラクティブ/ビジュアル作業を中心に構築されたとされています。実際には、テーマのリサーチ、コードベースのナビゲーション、情報分析、ツール呼び出し、最終的なアプリや成果物に向けた反復など、多段のステップにわたってタスクを継続することを意図しています。
What Changed From Grok 4.5?
SpaceXAI は、厳選したモデル生成の推論データ、高度な技術概念、高品質なエンジニアリングデータ、改良されたオプティマイザとトレーニングレシピを用いた、より長い 補助的トレーニング を実施したと報告しています。その後、推論とエージェントハーネス全般で Grok 4.5 による SFT 軌跡を再生成し、問題のあるトレースをフィルタリングし、一般的なコーディング、カーネル最適化、Web 開発、CAD、ナレッジワークにまたがる環境でエージェント強化学習を適用しました。
実務上の結果として、スコアが向上しただけでなく、より長い軌跡での自己テストと検証が強化されています。エージェントにとってこの挙動は重要で、モデルがファイルの編集、ツールの呼び出し、複数ステップの計画の実行を人間の継続的介入なしで行う場合、小さなミスのコストが累積するためです。
Grok 4.6 Specifications
| Property | Grok 4.6 |
|---|---|
| Context | 500,000 tokens |
| Modalities | Text and image input; text output |
| Reasoning | Configurable reasoning |
| Native API capabilities | Function calling and structured outputs |
| Knowledge cutoff | February 1, 2026 |
| Short-context pricing | $2 input / $0.50 cached / $6 output per MTok |
| Long-context threshold | ≥200K prompt tokens; $4 / $1 / $12 |
What Is Kimi K3?
Kimi K3 は、Moonshot AI のオープンウェイトのマルチモーダル・エージェント型旗艦モデルです。総 2.8 兆パラメータ、1M トークンのコンテキストウィンドウ、ネイティブなビジョンを組み合わせ、長期的なコーディング、エンドツーエンドのナレッジワーク、推論、視覚に基づくソフトウェアタスクに適しています。
Grok 4.6 と異なり、Kimi K3 はモデル重みを公開しています。現在の公式モデルカードでは、推論時に 104B のアクティブパラメータ が特定されているため、計算経路は総 2.8 兆パラメータよりはるかに小さいものの、完全なモデルのデプロイには依然として相当なインフラが必要です。
KDA, AttnRes and a More Sparse MoE
アーキテクチャは K3 の大きな差別化要因の一つです。Moonshot は、Kimi Delta Attention (KDA) と Attention Residuals (AttnRes) が、長いシーケンスと深いモデル層にわたる情報フローの改善を目的としていると述べています。Stable LatentMoE はスパース性を高め、トークンごとに 896 のうち 16 のエキスパートが活性化されます。トレーニングとデータレシピの変更と合わせ、Kimi K2 と比べて全体のスケーリング効率が約 2.5 倍向上したと報告しています。
Kimi K3 Specifications
| Property | Kimi K3 |
|---|---|
| Total / active parameters | 2.8T / 104B |
| Architecture | MoE with KDA + AttnRes + Stable LatentMoE |
| Experts | 896; 16 activated per token |
| Context | 1M tokens |
| Vision | Native visual understanding |
| Reasoning | Always enabled; low / high / max |
| Tools | ToolCalls, tool_choice constraints, dynamic tool loading |
| Open weights | Available on Hugging Face |
| Official pricing | $0.30 cache hit / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: Benchmark Comparison
最もクリーンな直接比較は、両モデルが同一フレームワークで評価される独立指標である Artificial Analysis Intelligence Index です。現在のスコアは Grok 4.6 が 61(高)、Kimi K3 が 60(max)。1 ポイント差は、一方が「世代が進んでいる」と断言するには小さすぎます。より有用なのは、それぞれがどこでスコアを稼いでいるかです。
| Independent metric | Grok 4.6 | Kimi K3 | Edge |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 by 1 point |
| Output speed | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| Time to first token | ~32.3 s | 3.27 s | Kimi K3 |
| Context window | 500K | ~1.05M | Kimi K3 |
Coding Performance
SpaceXAI は Grok 4.6 のコーディング/ソフトウェアエンジニアリング結果を複数公表しています:CursorBench 3.2 で 69.9%、DeepSWE 1.1 で 65.9%、FrontierCode 1.1 Extended で 61.3%、APEX-SWE で 56.4%、Terminal-Bench 3.0 で 26.0%。これらは、リポジトリ編集、エージェント型ソフトウェアエンジニアリング、ターミナル作業を扱い、単なるコード補完のトリビアに留まらないため、有意義です。
| Grok 4.6 vendor-reported coding benchmark | Score |
|---|---|
| CursorBench 3.2 | 69.9% |
| DeepSWE 1.1 | 65.9% |
| FrontierCode 1.1 Extended | 61.3% |
| APEX-SWE | 56.4% |
| Terminal-Bench 3.0 | 26.0% |
Kimi K3 については、Moonshot が異なるが広範なコーディングスイートを公表しています。公式発表資料では、DeepSWE で 67.5、Terminal-Bench 2.1 で 88.3、FrontierSWE で 81.2、ProgramBench で 77.8、SWE Marathon で 42.0 と報告しています。重要な注意点は、Terminal-Bench 2.1 と 3.0 は別バージョンであり、FrontierSWE は FrontierCode と同一評価ではないことです。これらの行を、生の数値だけで「同条件の勝利」として扱うべきではありません。

Agentic and Knowledge Work
エージェント型作業は Grok 4.6 が最も強く見える領域です。SpaceXAI は GDPVal-AA v2 で 1753 Elo、APEX-Agents で 57.5%、AA-Briefcase で 1577 Elo を報告しています。Artificial Analysis も同様のパターンを強調しており、Grok 4.6 の最大の伸びは、静的な推論だけでなく、長期的・ツール使用の作業にあります。
Kimi K3 もナレッジワーク・エージェントをターゲットにしています。Moonshot のローンチスイートは、BrowseComp、GDPval-AA v2、JobBench、SpreadsheetBench 2、ビジュアルエージェント評価での強い結果を示しています。開発者にとってさらに重要なのは、Kimi API がツール選択の制約や動的ツール読み込みを公開していることで、エージェントが企業システムを使用したり、回答前に事実を取得すべき場合に実用的な制御が可能です。

Multimodal and Visual Reasoning
Kimi K3 は、アーキテクチャレベルのマルチモーダル面でより明確です。Moonshot はネイティブなビジョン機能を説明し、ゲーム開発、フロントエンドエンジニアリング、CAD において「ループ内ビジョン」、すなわちモデルがビジュアルフィードバックを検査してコードを修正するデモを具体的に示しています。
Grok 4.6 もテキストと画像の入力を受け付け、Grok 4.5 よりもビジュアルやインタラクティブなプロジェクトで初回の出来が強化されたと SpaceXAI は述べています。違いは両モデルが画像を認識できるかどうかではなく、デプロイ哲学にあります。Kimi はオープンなマルチモーダルモデルを公開する一方、Grok はビジュアル理解を管理型の最先端 API とエージェントエコシステム内にパッケージ化しています。
Context Window: 500K vs 1M
Grok 4.6 は 500,000 トークン をサポートし、Kimi K3 は約 1M トークン をサポートします。これは、1 回のリクエストで 500K を超えるトークンが真に必要なワークロード(非常に大きなリポジトリ、複数冊の研究コレクション、非常に長いエージェントトレースなど)では、Kimi が明白な選択肢であることを意味します。
ただし、コンテキストサイズは容量であり、検索や推論品質の保証ではありません。本番システムでは、長いコンテキストで実際に発生する失敗モード(ファイル間依存の追跡、遠い事実の取得、矛盾検出、指示の持続)でモデルをテストしてください。RAG は、毎回 100 万トークンを送るよりも、依然として安価で制御しやすい場合があります。
Speed and Latency
Artificial Analysis は現在、Grok 4.6 の出力速度を 65.8 トークン/秒、Kimi K3 を 40.7 トークン/秒 と測定しています。生成が始まれば、この測定では Grok の方が実質的に高速です。しかし、最初のトークンに関しては逆で、Kimi K3 の TTFT は 3.27 秒と測定される一方、Grok 4.6 は現時点のプロバイダ測定ではストリーミング開始までが大幅に遅いです。
これは有用な製品上の違いを生みます。インタラクティブなチャットや IDE では、最初のトークンまでが速いと、最終的な回答に時間がかかっても Kimi の方が応答性が高く感じられます。長い生成やエージェントの実行では、Grok の高い生成スループットがリクエストの末尾を短縮できます。プロバイダ、リージョン、推論設定、キャッシュ状態、リクエストサイズにより、これらの数値は変わりうるため、恒久的な特性ではなく現時点のスナップショットとして扱ってください。
Grok 4.6 vs Kimi K3: API Pricing
標準的なコンテキスト長では、Grok 4.6 は 入力 100 万トークンあたり $2、キャッシュ 100 万トークンあたり $0.50、出力 100 万トークンあたり $6 です。プロンプトが 200K トークン以上の場合、xAI はリクエスト全体を長コンテキスト料金(入力 $4、キャッシュ $1、出力 $12/100 万トークン)で請求します。
Kimi は 1M コンテキストウィンドウ全体でフラットな従量課金を採用しています。Kimi API はキャッシュヒット 100 万トークンあたり $0.30、入力 100 万トークンあたり $3、出力 100 万トークンあたり $15 を掲示しています。つまり、Kimi はキャッシュヒットが安価ですが、新規の出力トークンは大幅に高価です。Grok の料金優位は、Grok のリクエストが 200K の長コンテキスト閾値を超えると縮小します。

ヘッドラインの公式 API 価格(100 万トークンあたり)。Grok の長コンテキストリクエスト(プロンプトが ≥200K トークン)は、図に表示されていない高い料金が適用されます。出典: SpaceXAI and Kimi API pricing
| Price / 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| Official short-context input | $2.00 | $3.00 |
| Official cache hit | $0.50 | $0.30 |
| Official output | $6.00 | $15.00 |
| Long-context pricing | ≥200K: $4 / $1 / $12 | Flat pricing through 1M context |
| CometAPI input | $1.60 | $2.40 |
| CometAPI output | $4.80 | $12.00 |
CometAPI では、Grok 4.6 は現在 100 万トークンあたり入力 $1.60 / 出力 $4.80、Kimi K3 は入力 $2.40 / 出力 $12 と表示されています。いずれも、執筆時点の CometAPI モデルページに掲載されたプロバイダのヘッドライン入力/出力価格から 20% 低い設定です。
Open Weights vs Proprietary Model
Kimi K3 はダウンロード可能なオープンウェイトモデルです。これにより、研究、きめ細かなインフラ制御、プライベート推論アーキテクチャ、サードパーティの推論スタックでのデプロイが可能になります。とはいえ K3 は軽量というわけではありません。MoE のスパース化や低精度形式があっても、2.8 兆パラメータのモデルは、実用的な性能を得るには本格的なシステムプロジェクトです。
Grok 4.6 はプロプライエタリです。アーキテクチャやパラメータ数は公開されておらず、開発者は管理型サービスとしてアクセスします。トレードオフは運用の簡便さで、最先端レベルのエージェント性能を得るために推論クラスターを構築したり、モデル重みを管理したり、カーネルを最適化する必要がありません。
Strengths and Weaknesses
| Model | Strengths | Trade-offs |
|---|---|---|
| Grok 4.6 | 低いホスト型 API 価格;AA Intelligence で 61;測定上の生成が速い;長期エージェントで強力;xAI の統合ツールスタック | 500K コンテキスト;クローズドウェイト;長コンテキスト料金は倍増;測定上の TTFT が遅い |
| Kimi K3 | 約 1M コンテキスト;オープンウェイト;2.8T MoE;ネイティブなマルチモーダル;強力なコーディング/エージェントスイート | 出力トークン価格が高い;測定上のトークン生成が遅い;完全なセルフホスティングはインフラ負荷が大きい |
Grok 4.6 vs Kimi K3: Which Should You Choose?
| Use case | Recommended | Why |
|---|---|---|
| Default frontier API | Grok 4.6 | わずかな独立インテリジェンス優位と低価格 |
| Long-running knowledge-work agent | Grok 4.6 | GDPVal-AA と AA-Briefcase で最も強い証拠 |
| Repository-scale coding | Test both | 両者とも長期的コーディングに設計;ベンチマークスイートが異なる |
| Prompt >500K tokens | Kimi K3 | 約 1M のコンテキスト |
| Open-weight research | Kimi K3 | 重みとアーキテクチャが利用可能 |
| Private/self-managed inference | Kimi K3 | オープンウェイトによりカスタムデプロイが可能 |
| Low cache-hit cost | Kimi K3 | キャッシュヒット $0.30/MTok |
| Lower fresh output-token cost | Grok 4.6 | 標準コンテキストで $6/MTok 対 $15/MTok |
| Fast first visible response | Kimi K3 | 測定上の TTFT が大幅に低い |
| Faster long generation | Grok 4.6 | 測定上の出力トークン/秒が高い |
| Visual coding / CAD / game workflows | Kimi K3 | ネイティブビジョン+公式の vision-in-the-loop に注力 |
全体としての推奨: Grok 4.6 は、ほとんどのエージェント開発者にとって、より強力なデフォルトのホスト型 API です。Kimi K3 は、1M コンテキスト、オープンウェイト、デプロイ制御が必須要件である場合に、より柔軟な最先端モデルです。
How to Access Grok 4.6 and Kimi K3 Through CometAPI
両モデルは CometAPI で利用可能です。Grok 4.6 のモデルページにはモデル ID grok-4.6 と Chat Completions / Responses 形式のサポートが記載され、Kimi K3 のモデルページでは kimi-k3 が統一された CometAPI エンドポイント経由で公開されています。これにより、認証やアプリの配管の大半を保ったまま、モデル ID を切り替えるだけで A/B テストが容易になります。
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "このリポジトリのバグをレビューし、テスト済みの修正案を提案してください。"}
],
)
print(model, response.choices[0].message.content)
本番評価では、プロンプト、ツール、リポジトリのスナップショット、成功基準を同一に保ってください。回答品質だけでなく、ツールコールの成功、ターン数、総入力/出力トークン、レイテンシ、失敗したツールコールからの回復も追跡しましょう。これは単一のベンチマークスコアよりも、実際のエージェントコストを予測するうえで有用です。
Conclusion
Grok 4.6 と Kimi K3 の比較で最も重要なのは、トップラインのインテリジェンスが製品設計ほどには離れていないことです。独立評価では現状 61 対 60 ですが、周辺の経済性とデプロイ選択は大きく異なります。
Grok 4.6 は管理型サービスとして最適化され、新規トークンの低価格、強力なエージェントベンチマーク、より高速な生成、成熟したツール/API パスを備えています。Kimi K3 は柔軟性に最適化され、1M コンテキスト、2.8T MoE 規模、ネイティブなマルチモーダル、オープンウェイトを提供します。
単に最善のデフォルトホスト型モデルを求める大多数の開発者にとっては、Grok 4.6 がより安全な起点です。>500K のコンテキスト、オープンウェイトのデプロイ、ビジュアルコーディング、推論スタックの制御がシステム要件である場合は、ホスト型のトークン価格が高くても Kimi K3 がより良いアーキテクチャ選択になりえます。
FAQs
Is Grok 4.6 smarter than Kimi K3?
現在の Artificial Analysis Intelligence Index では、Grok 4.6 が 61、Kimi K3 が 60。これは僅差であり、決定的な差ではありません。タスクレベルでは、ワークロードにより結果が逆転することがあります。
Which is better for coding?
両者ともコーディングモデルとして有力です。Grok 4.6 はエージェント型コーディングで強い結果と低いホスト型価格を持ち、Kimi K3 はより大きなコンテキスト、オープンウェイト、強力なリポジトリ/ビジュアルコーディング能力を提供します。ベンダーが異なるベンチマーク版を報告しているため、自社リポジトリでのベンチマークを推奨します。
Which model has the larger context window?
Kimi K3 は約 1M トークンをサポートし、Grok 4.6 の 500K トークンの約 2 倍です。
Which is cheaper?
標準コンテキストの新規トークンでは、Grok 4.6 が入力 $2/出力 $6 と Kimi K3 の $3/$15 より安価です。Kimi はキャッシュヒットが $0.30/MTok と安価で、一方 Grok はプロンプトが 200K に達すると長コンテキスト料金が適用されます。
Can I self-host Kimi K3?
Kimi K3 は Hugging Face にオープンウェイトがあり、自己管理のデプロイが可能です。とはいえ、総 2.8T モデルは非常に巨大で、MoE のスパース性や低精度でも、実用的な性能には複数ノードや専門的な推論インフラが必要です。
Can I self-host Grok 4.6?
Grok 4.6 の公開ウェイトはありません。Grok 4.6 は SpaceXAI およびパートナー API を通じて提供されるプロプライエタリな管理型モデルです。
Can I access both from one API?
はい。CometAPI は現在 Grok 4.6 と Kimi K3 の両方を掲載しており、統一 API と課金レイヤーの背後で両者を比較できます。
