DeepSeek Vision and Grok Imagine models are now live on CometAPI →
ai-comparisons/CometAPIリサーチ

Grok 4.6 vs Kimi K3: 包括的な比較

コスト効率の高いホスト型エージェント API には Grok 4.6 を選ぶ; 1M コンテキスト、オープンウェイトおよびインフラ制御には Kimi K3 を選ぶ。

CometAPI
AnnaAIモデルとAPIの調査チーム
更新日 Aug 25, 2026 8 分読み
Grok 4.6 vs Kimi K3: 包括的な比較
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Grok 4.6 は、エージェント型コーディングとナレッジワーク向けに管理型の最先端 API を求める場合の、より強力なデフォルトです。Artificial Analysis Intelligence Index で 61 を記録し、現在の独立測定でより高速に生成し、料金は入力/出力 100 万トークンあたり $2/$6 から開始します。

Kimi K3 は、コンテキスト長とモデルのオープン性が重要な場合に、より柔軟な選択肢です。2.8 兆パラメータ、104B のアクティブパラメータ、およそ 1M トークンのコンテキストウィンドウ、オープンウェイト、ネイティブなマルチモーダル機能を組み合わせています。ホスト型 API の公称価格は入力/出力 100 万トークンあたり $3/$15 と高めですが、キャッシュヒットは 100 万トークンあたり $0.30 に過ぎません。

結論として、コスト効率の良いホスト型エージェント API を求めるなら Grok 4.6、1M コンテキスト、オープンウェイト、インフラ制御を重視するなら Kimi K3 を選びましょう。コーディング用途では、ベンダーが異なるベンチマーク版やハーネスを公開しているため、自社リポジトリで両方をテストしてください。

Key Takeaways

  • Grok 4.62026 年 8 月 12 日にリリース され、長時間稼働のエージェント、コードベース作業、ナレッジワーク、より野心的なインタラクティブ/ビジュアルプロジェクトに特化しています。
  • Kimi K3 は Moonshot AI の 2.8 兆パラメータ のオープンウェイト旗艦モデルで、Kimi Delta Attention、Attention Residuals、ネイティブなビジョン、約 1M トークンのコンテキストウィンドウを備えています。
  • 独立した総合インテリジェンスはほぼ同点で、Grok 4.6 が 61、Kimi K3 が 60。
  • Grok 4.6 はヘッドラインのトークン価格が低く、入力 $2 / 出力 $6 に対し、Kimi K3 は入力 $3 / 出力 $15。
  • Kimi K3 はコンテキスト容量が約 2 倍でオープンウェイトを提供。Grok 4.6 はクローズドだが、複数の独立エージェント評価でターン効率とコスト効率が高い。

Grok 4.6 vs Kimi K3: Quick Comparison

SpecificationGrok 4.6Kimi K3
DeveloperSpaceXAI / xAIMoonshot AI / Kimi
Release dateAugust 12, 2026July 16, 2026
Model IDgrok-4.6kimi-k3
ArchitectureNot publicly disclosedMoE; KDA + AttnRes + Stable LatentMoE
Total parametersNot disclosed2.8T
Active parametersNot disclosed104B
ExpertsNot disclosed896 total; 16 activated/token
Context window500,000 tokens1,048,576 / about 1M tokens
Input / outputText + image → textText + image → text
ReasoningConfigurableAlways-on; low / high / max
Function / tool useFunction calling + structured outputsToolCalls, tool_choice, dynamic tool loading
Open weightsNoYes
AA Intelligence Index6160
Official input / output price$2 / $6 per MTok$3 / $15 per MTok
Best fitHosted agents, coding, knowledge workLong context, open-weight deployment, coding + visual reasoning

What Is Grok 4.6?

Grok 4.6 は、コーディング、エージェント型タスク、ナレッジワーク向けの SpaceXAI の最先端モデルです。このリリースは、単なる静的ベンチマーク更新ではなく、長時間稼働のエージェントや、より野心的なインタラクティブ/ビジュアル作業を中心に構築されたとされています。実際には、テーマのリサーチ、コードベースのナビゲーション、情報分析、ツール呼び出し、最終的なアプリや成果物に向けた反復など、多段のステップにわたってタスクを継続することを意図しています。

What Changed From Grok 4.5?

SpaceXAI は、厳選したモデル生成の推論データ、高度な技術概念、高品質なエンジニアリングデータ、改良されたオプティマイザとトレーニングレシピを用いた、より長い 補助的トレーニング を実施したと報告しています。その後、推論とエージェントハーネス全般で Grok 4.5 による SFT 軌跡を再生成し、問題のあるトレースをフィルタリングし、一般的なコーディング、カーネル最適化、Web 開発、CAD、ナレッジワークにまたがる環境でエージェント強化学習を適用しました。

実務上の結果として、スコアが向上しただけでなく、より長い軌跡での自己テストと検証が強化されています。エージェントにとってこの挙動は重要で、モデルがファイルの編集、ツールの呼び出し、複数ステップの計画の実行を人間の継続的介入なしで行う場合、小さなミスのコストが累積するためです。

Grok 4.6 Specifications

PropertyGrok 4.6
Context500,000 tokens
ModalitiesText and image input; text output
ReasoningConfigurable reasoning
Native API capabilitiesFunction calling and structured outputs
Knowledge cutoffFebruary 1, 2026
Short-context pricing$2 input / $0.50 cached / $6 output per MTok
Long-context threshold≥200K prompt tokens; $4 / $1 / $12

What Is Kimi K3?

Kimi K3 は、Moonshot AI のオープンウェイトのマルチモーダル・エージェント型旗艦モデルです。総 2.8 兆パラメータ、1M トークンのコンテキストウィンドウ、ネイティブなビジョンを組み合わせ、長期的なコーディング、エンドツーエンドのナレッジワーク、推論、視覚に基づくソフトウェアタスクに適しています。

Grok 4.6 と異なり、Kimi K3 はモデル重みを公開しています。現在の公式モデルカードでは、推論時に 104B のアクティブパラメータ が特定されているため、計算経路は総 2.8 兆パラメータよりはるかに小さいものの、完全なモデルのデプロイには依然として相当なインフラが必要です。

KDA, AttnRes and a More Sparse MoE

アーキテクチャは K3 の大きな差別化要因の一つです。Moonshot は、Kimi Delta Attention (KDA) と Attention Residuals (AttnRes) が、長いシーケンスと深いモデル層にわたる情報フローの改善を目的としていると述べています。Stable LatentMoE はスパース性を高め、トークンごとに 896 のうち 16 のエキスパートが活性化されます。トレーニングとデータレシピの変更と合わせ、Kimi K2 と比べて全体のスケーリング効率が約 2.5 倍向上したと報告しています。

Kimi K3 Specifications

PropertyKimi K3
Total / active parameters2.8T / 104B
ArchitectureMoE with KDA + AttnRes + Stable LatentMoE
Experts896; 16 activated per token
Context1M tokens
VisionNative visual understanding
ReasoningAlways enabled; low / high / max
ToolsToolCalls, tool_choice constraints, dynamic tool loading
Open weightsAvailable on Hugging Face
Official pricing$0.30 cache hit / $3 input / $15 output per MTok

Grok 4.6 vs Kimi K3: Benchmark Comparison

最もクリーンな直接比較は、両モデルが同一フレームワークで評価される独立指標である Artificial Analysis Intelligence Index です。現在のスコアは Grok 4.6 が 61(高)、Kimi K3 が 60(max)。1 ポイント差は、一方が「世代が進んでいる」と断言するには小さすぎます。より有用なのは、それぞれがどこでスコアを稼いでいるかです。

Independent metricGrok 4.6Kimi K3Edge
Artificial Analysis Intelligence Index6160Grok 4.6 by 1 point
Output speed65.8 tok/s40.7 tok/sGrok 4.6
Time to first token~32.3 s3.27 sKimi K3
Context window500K~1.05MKimi K3

Coding Performance

SpaceXAI は Grok 4.6 のコーディング/ソフトウェアエンジニアリング結果を複数公表しています:CursorBench 3.2 で 69.9%、DeepSWE 1.1 で 65.9%、FrontierCode 1.1 Extended で 61.3%、APEX-SWE で 56.4%、Terminal-Bench 3.0 で 26.0%。これらは、リポジトリ編集、エージェント型ソフトウェアエンジニアリング、ターミナル作業を扱い、単なるコード補完のトリビアに留まらないため、有意義です。

Grok 4.6 vendor-reported coding benchmarkScore
CursorBench 3.269.9%
DeepSWE 1.165.9%
FrontierCode 1.1 Extended61.3%
APEX-SWE56.4%
Terminal-Bench 3.026.0%

Kimi K3 については、Moonshot が異なるが広範なコーディングスイートを公表しています。公式発表資料では、DeepSWE で 67.5、Terminal-Bench 2.1 で 88.3、FrontierSWE で 81.2、ProgramBench で 77.8、SWE Marathon で 42.0 と報告しています。重要な注意点は、Terminal-Bench 2.1 と 3.0 は別バージョンであり、FrontierSWE は FrontierCode と同一評価ではないことです。これらの行を、生の数値だけで「同条件の勝利」として扱うべきではありません。

Grok 4.6 vs Kimi K3: 包括的な比較

出典: Moonshot AI / Kimi

Agentic and Knowledge Work

エージェント型作業は Grok 4.6 が最も強く見える領域です。SpaceXAI は GDPVal-AA v2 で 1753 Elo、APEX-Agents で 57.5%、AA-Briefcase で 1577 Elo を報告しています。Artificial Analysis も同様のパターンを強調しており、Grok 4.6 の最大の伸びは、静的な推論だけでなく、長期的・ツール使用の作業にあります。

Kimi K3 もナレッジワーク・エージェントをターゲットにしています。Moonshot のローンチスイートは、BrowseComp、GDPval-AA v2、JobBench、SpreadsheetBench 2、ビジュアルエージェント評価での強い結果を示しています。開発者にとってさらに重要なのは、Kimi API がツール選択の制約や動的ツール読み込みを公開していることで、エージェントが企業システムを使用したり、回答前に事実を取得すべき場合に実用的な制御が可能です。

Grok 4.6 vs Kimi K3: 包括的な比較

出典: Moonshot AI / Kimi

Multimodal and Visual Reasoning

Kimi K3 は、アーキテクチャレベルのマルチモーダル面でより明確です。Moonshot はネイティブなビジョン機能を説明し、ゲーム開発、フロントエンドエンジニアリング、CAD において「ループ内ビジョン」、すなわちモデルがビジュアルフィードバックを検査してコードを修正するデモを具体的に示しています。

Grok 4.6テキストと画像の入力を受け付け、Grok 4.5 よりもビジュアルやインタラクティブなプロジェクトで初回の出来が強化されたと SpaceXAI は述べています。違いは両モデルが画像を認識できるかどうかではなく、デプロイ哲学にあります。Kimi はオープンなマルチモーダルモデルを公開する一方、Grok はビジュアル理解を管理型の最先端 API とエージェントエコシステム内にパッケージ化しています。

Context Window: 500K vs 1M

Grok 4.6500,000 トークン をサポートし、Kimi K3 は約 1M トークン をサポートします。これは、1 回のリクエストで 500K を超えるトークンが真に必要なワークロード(非常に大きなリポジトリ、複数冊の研究コレクション、非常に長いエージェントトレースなど)では、Kimi が明白な選択肢であることを意味します。

ただし、コンテキストサイズは容量であり、検索や推論品質の保証ではありません。本番システムでは、長いコンテキストで実際に発生する失敗モード(ファイル間依存の追跡、遠い事実の取得、矛盾検出、指示の持続)でモデルをテストしてください。RAG は、毎回 100 万トークンを送るよりも、依然として安価で制御しやすい場合があります。

Speed and Latency

Artificial Analysis は現在、Grok 4.6 の出力速度を 65.8 トークン/秒、Kimi K3 を 40.7 トークン/秒 と測定しています。生成が始まれば、この測定では Grok の方が実質的に高速です。しかし、最初のトークンに関しては逆で、Kimi K3 の TTFT は 3.27 秒と測定される一方、Grok 4.6 は現時点のプロバイダ測定ではストリーミング開始までが大幅に遅いです。

これは有用な製品上の違いを生みます。インタラクティブなチャットや IDE では、最初のトークンまでが速いと、最終的な回答に時間がかかっても Kimi の方が応答性が高く感じられます。長い生成やエージェントの実行では、Grok の高い生成スループットがリクエストの末尾を短縮できます。プロバイダ、リージョン、推論設定、キャッシュ状態、リクエストサイズにより、これらの数値は変わりうるため、恒久的な特性ではなく現時点のスナップショットとして扱ってください。

Grok 4.6 vs Kimi K3: API Pricing

標準的なコンテキスト長では、Grok 4.6 は 入力 100 万トークンあたり $2、キャッシュ 100 万トークンあたり $0.50、出力 100 万トークンあたり $6 です。プロンプトが 200K トークン以上の場合、xAI はリクエスト全体を長コンテキスト料金(入力 $4、キャッシュ $1、出力 $12/100 万トークン)で請求します。

Kimi は 1M コンテキストウィンドウ全体でフラットな従量課金を採用しています。Kimi API はキャッシュヒット 100 万トークンあたり $0.30、入力 100 万トークンあたり $3、出力 100 万トークンあたり $15 を掲示しています。つまり、Kimi はキャッシュヒットが安価ですが、新規の出力トークンは大幅に高価です。Grok の料金優位は、Grok のリクエストが 200K の長コンテキスト閾値を超えると縮小します。

Grok 4.6 vs Kimi K3: 包括的な比較

ヘッドラインの公式 API 価格(100 万トークンあたり)。Grok の長コンテキストリクエスト(プロンプトが ≥200K トークン)は、図に表示されていない高い料金が適用されます。出典: SpaceXAI and Kimi API pricing

Price / 1M tokensGrok 4.6Kimi K3
Official short-context input$2.00$3.00
Official cache hit$0.50$0.30
Official output$6.00$15.00
Long-context pricing≥200K: $4 / $1 / $12Flat pricing through 1M context
CometAPI input$1.60$2.40
CometAPI output$4.80$12.00

CometAPI では、Grok 4.6 は現在 100 万トークンあたり入力 $1.60 / 出力 $4.80、Kimi K3 は入力 $2.40 / 出力 $12 と表示されています。いずれも、執筆時点の CometAPI モデルページに掲載されたプロバイダのヘッドライン入力/出力価格から 20% 低い設定です。

Open Weights vs Proprietary Model

Kimi K3ダウンロード可能なオープンウェイトモデルです。これにより、研究、きめ細かなインフラ制御、プライベート推論アーキテクチャ、サードパーティの推論スタックでのデプロイが可能になります。とはいえ K3 は軽量というわけではありません。MoE のスパース化や低精度形式があっても、2.8 兆パラメータのモデルは、実用的な性能を得るには本格的なシステムプロジェクトです。

Grok 4.6 はプロプライエタリです。アーキテクチャやパラメータ数は公開されておらず、開発者は管理型サービスとしてアクセスします。トレードオフは運用の簡便さで、最先端レベルのエージェント性能を得るために推論クラスターを構築したり、モデル重みを管理したり、カーネルを最適化する必要がありません。

Strengths and Weaknesses

ModelStrengthsTrade-offs
Grok 4.6低いホスト型 API 価格;AA Intelligence で 61;測定上の生成が速い;長期エージェントで強力;xAI の統合ツールスタック500K コンテキスト;クローズドウェイト;長コンテキスト料金は倍増;測定上の TTFT が遅い
Kimi K3約 1M コンテキスト;オープンウェイト;2.8T MoE;ネイティブなマルチモーダル;強力なコーディング/エージェントスイート出力トークン価格が高い;測定上のトークン生成が遅い;完全なセルフホスティングはインフラ負荷が大きい

Grok 4.6 vs Kimi K3: Which Should You Choose?

Use caseRecommendedWhy
Default frontier APIGrok 4.6わずかな独立インテリジェンス優位と低価格
Long-running knowledge-work agentGrok 4.6GDPVal-AA と AA-Briefcase で最も強い証拠
Repository-scale codingTest both両者とも長期的コーディングに設計;ベンチマークスイートが異なる
Prompt >500K tokensKimi K3約 1M のコンテキスト
Open-weight researchKimi K3重みとアーキテクチャが利用可能
Private/self-managed inferenceKimi K3オープンウェイトによりカスタムデプロイが可能
Low cache-hit costKimi K3キャッシュヒット $0.30/MTok
Lower fresh output-token costGrok 4.6標準コンテキストで $6/MTok 対 $15/MTok
Fast first visible responseKimi K3測定上の TTFT が大幅に低い
Faster long generationGrok 4.6測定上の出力トークン/秒が高い
Visual coding / CAD / game workflowsKimi K3ネイティブビジョン+公式の vision-in-the-loop に注力

全体としての推奨: Grok 4.6 は、ほとんどのエージェント開発者にとって、より強力なデフォルトのホスト型 API です。Kimi K3 は、1M コンテキスト、オープンウェイト、デプロイ制御が必須要件である場合に、より柔軟な最先端モデルです。

How to Access Grok 4.6 and Kimi K3 Through CometAPI

両モデルは CometAPI で利用可能です。Grok 4.6 のモデルページにはモデル ID grok-4.6 と Chat Completions / Responses 形式のサポートが記載され、Kimi K3 のモデルページでは kimi-k3 が統一された CometAPI エンドポイント経由で公開されています。これにより、認証やアプリの配管の大半を保ったまま、モデル ID を切り替えるだけで A/B テストが容易になります。

from openai import OpenAI
 import os

 client = OpenAI(
    base_url="https://api.cometapi.com/v1",
    api_key=os.environ["COMETAPI_KEY"],
 )

 for model in ["grok-4.6", "kimi-k3"]:
    response = client.chat.completions.create(
        model=model,
        messages=[
            {"role": "user", "content": "このリポジトリのバグをレビューし、テスト済みの修正案を提案してください。"}
        ],
    )
    print(model, response.choices[0].message.content)

本番評価では、プロンプト、ツール、リポジトリのスナップショット、成功基準を同一に保ってください。回答品質だけでなく、ツールコールの成功、ターン数、総入力/出力トークン、レイテンシ、失敗したツールコールからの回復も追跡しましょう。これは単一のベンチマークスコアよりも、実際のエージェントコストを予測するうえで有用です。

Conclusion

Grok 4.6Kimi K3 の比較で最も重要なのは、トップラインのインテリジェンスが製品設計ほどには離れていないことです。独立評価では現状 61 対 60 ですが、周辺の経済性とデプロイ選択は大きく異なります。

Grok 4.6 は管理型サービスとして最適化され、新規トークンの低価格、強力なエージェントベンチマーク、より高速な生成、成熟したツール/API パスを備えています。Kimi K3 は柔軟性に最適化され、1M コンテキスト、2.8T MoE 規模、ネイティブなマルチモーダル、オープンウェイトを提供します。

単に最善のデフォルトホスト型モデルを求める大多数の開発者にとっては、Grok 4.6 がより安全な起点です。>500K のコンテキスト、オープンウェイトのデプロイ、ビジュアルコーディング、推論スタックの制御がシステム要件である場合は、ホスト型のトークン価格が高くても Kimi K3 がより良いアーキテクチャ選択になりえます。

FAQs

Is Grok 4.6 smarter than Kimi K3?

現在の Artificial Analysis Intelligence Index では、Grok 4.6 が 61、Kimi K3 が 60。これは僅差であり、決定的な差ではありません。タスクレベルでは、ワークロードにより結果が逆転することがあります。

Which is better for coding?

両者ともコーディングモデルとして有力です。Grok 4.6 はエージェント型コーディングで強い結果と低いホスト型価格を持ち、Kimi K3 はより大きなコンテキスト、オープンウェイト、強力なリポジトリ/ビジュアルコーディング能力を提供します。ベンダーが異なるベンチマーク版を報告しているため、自社リポジトリでのベンチマークを推奨します。

Which model has the larger context window?

Kimi K3 は約 1M トークンをサポートし、Grok 4.6 の 500K トークンの約 2 倍です。

Which is cheaper?

標準コンテキストの新規トークンでは、Grok 4.6 が入力 $2/出力 $6 と Kimi K3 の $3/$15 より安価です。Kimi はキャッシュヒットが $0.30/MTok と安価で、一方 Grok はプロンプトが 200K に達すると長コンテキスト料金が適用されます。

Can I self-host Kimi K3?

Kimi K3 は Hugging Face にオープンウェイトがあり、自己管理のデプロイが可能です。とはいえ、総 2.8T モデルは非常に巨大で、MoE のスパース性や低精度でも、実用的な性能には複数ノードや専門的な推論インフラが必要です。

Can I self-host Grok 4.6?

Grok 4.6 の公開ウェイトはありません。Grok 4.6 は SpaceXAI およびパートナー API を通じて提供されるプロプライエタリな管理型モデルです。

Can I access both from one API?

はい。CometAPI は現在 Grok 4.6Kimi K3 の両方を掲載しており、統一 API と課金レイヤーの背後で両者を比較できます。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Aug 23, 2026
最終更新 Aug 25, 2026
2 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む