DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 が登場: GPT-5.6 レベルのベンチマーク結果 & コーディングパフォーマンス

CometAPI
AnnaAug 13, 2026
Grok 4.6 が登場: GPT-5.6 レベルのベンチマーク結果 & コーディングパフォーマンス

TL; DR xAI は 2026年8月12日に Grok 4.6 を正式リリースし、xAI API、Cursor、Grok Build で利用可能にしました。コンテキストウィンドウは 500,000 トークン、テキストと画像を受け付け、4 段階の推論努力レベルを提供し、知識カットオフは 2026年2月1日です。xAI の公式 Grok 4.6 発表によると、Artificial Analysis Intelligence Index(9 つの評価の合成)でGPT-5.6 Solと同等とされています。

API の料金は、200,000 トークン未満のプロンプトについて、入力 100 万トークンあたり $2、キャッシュ入力 100 万トークンあたり $0.50、出力 100 万トークンあたり $6 から開始します。プロンプトが 200,000 トークンに達すると、そのリクエスト全体が長コンテキスト料金(入力 $4、キャッシュ入力 $1、出力 $12/100 万トークン)で課金されます。柔軟なマルチモデルアクセスを求める開発者向けに、CometAPI のようなプラットフォームは Grok 4.6 を他のフロンティアモデルと並べて統合しやすくしており、API 価格は xAI の価格の 80% です。

重要ポイント

  • xAI は2026年8月12日に Grok 4.6 を正式リリースしました。以前のリリースウィンドウ報道は現在は無効です。
  • API モデル ID は grok-4.6 で、Cursor と Grok Build でも利用できます。
  • コンテキストウィンドウは50 万(500K)トークンで、入力はテキストと画像、出力はテキストのみです。
  • 200K トークン未満の標準料金は、入力 $2/M、キャッシュ入力 $0.50/M、出力 $6/M です。
  • プロンプトが 200K トークン以上になると、しきい値超過分だけでなく、そのリクエスト内のすべてのトークンに高レートが適用されます。
  • 推論努力は lowmediumhighxhigh に設定可能で、既定値は high です。
  • Grok 4.6 は Artificial Analysis Intelligence Index(スコア 61)で GPT-5.6 Sol と同等であり、エージェント的コーディング、ナレッジワーク、長期タスクで Grok 4.5 から大幅な向上を示しています。
  • Grok Imagine Image 2.0 は別の画像生成 API です。Grok 4.6 は画像の理解が可能ですが、画像生成結果を返すわけではありません。

Grok 4.6 の仕様と価格(概要)

以下の仕様は、xAI のモデルドキュメント8月12日のリリースノートで確認されています。

SpecificationGrok 4.6
Official release dateAugust 12, 2026
API model IDgrok-4.6
PositioningFlagship model for coding, agents and general workloads
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitNo text-output limit stated by xAI
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoffFebruary 1, 2026
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

公式 xAI API 料金

xAI の現行 API 料金表は、短コンテキストと長コンテキストのリクエストを区別しています。

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

このしきい値は、とりわけコードベースエージェントにとって重要です。リクエストのプロンプトが 200,000 トークンに達すると、xAI はそのリクエストのすべてのトークンに長コンテキスト料金を適用します。したがって、プロンプトが 199,000 トークンのリクエストは、サイズがほぼ同じでも 200,000 トークンのリクエストより大幅に安くなる可能性があります。

現行の xAI 料金ドキュメントには、Grok 4.6 のバッチ割引は記載されていません。特定の他モデルで利用可能な割引が、オフラインジョブに適用されるとチームが想定すべきではありません。

Grok 4.6 とは?

Grok 4.6 は SpaceXAI の最新フラッグシップ大規模言語モデルで、2026年8月12日にリリースされました。Grok 4.5 を直接的に発展させ、先進的な推論や技術概念に向けた厳選のモデル生成データ、品質の高いエンジニアリングデータセット、改良されたオプティマイザ、さらに拡張されたコーディングおよびナレッジワーク向けの強化学習を用いた、より長い補助トレーニングを適用しています。

基盤は前世代と同じ 1.5 兆パラメータのファウンデーションを維持し、改善は主にポストトレーニングに由来しており、パラメータ規模の拡大によるものではありません。リサーチ、膨大な情報の分析、未知のコードベースの理解・編集、高レベルのアイデアから完成度の高いアプリケーションや成果物への落とし込みなど、多段階にわたるステップで有効に機能するよう設計されています。SpaceXAI は、長期プロジェクトにおける自己チェック行動の強化と、対話的かつビジュアルな作業での性能向上を強調しています。

これは従来型のチャットボットとの重要な違いです。

従来の LLM ワークフローは次のようになります:

Prompt → Generate answer

Grok 4.6 はむしろ次のようなワークフロー向けに設計されています:

Goal → Plan → Research → Use tools → Modify code → Test → Evaluate → Continue

xAI の現在のポジショニングは、モデルが複雑なプロジェクトに長く取り組み、コードベースを横断し、未知のトピックをリサーチし、アプリケーションを構築し、自身の作業を検証できる能力を強調しています。

これにより、Grok 4.6 は急速に拡大するAI コーディングエージェント/自律エージェント市場に特に適したモデルとなっています。

Grok 4.6 の主な特徴は?

長時間稼働エージェント能力

Grok 4.6 の最も重要な改善点は、長時間稼働タスクへのフォーカスです。

一回限りの応答だけを最適化するのではなく、プロジェクトの複数段階を通じて進捗を維持するよう設計されています。

典型例:

  • アプリケーションの構築
  • 大規模リポジトリのデバッグ
  • 不慣れなテーマのリサーチ
  • 複数コンポーネントの修正
  • テストの実行
  • 障害の調査
  • 実装の改訂
  • 最終結果のチェック

これは従来の指示追従型ベンチマークとは根本的に異なる目標です。

先進的なコーディング性能

コーディングは Grok 4.6 の最も明確な改善領域の一つです。

現在のベンチマーク報告では:

  • DeepSWE 1.1 で 65.9%
  • CursorBench 3.2 で 69.9%
  • FrontierCode 1.1 Extended で 61.3%

これらの評価は、単純なコード補完ではなく、コーディングエージェントの挙動を対象としている点で特に関連性があります。

DeepSWE 1.1 における Grok 4.5 から Grok 4.6 への改善は特に顕著で、報告比較では約**54% から 65.9%**へ上昇しています。

マルチモーダル入力

Grok 4.6 はテキストと画像入力をサポートし、視覚情報と推論を組み合わせることができます。

想定ユースケース:

  • スクリーンショットのデバッグ
  • UI 分析
  • グラフの解釈
  • ドキュメント理解
  • ビジュアルリサーチ
  • 画像ベースのコーディングタスク

これにより、純テキストのコーディングモデルより柔軟性が高まります。

Web と X の検索

Grok の検索アクセスはそのエコシステムの重要な部分です。

API は以下をサポートします:

  • Web Search
  • X Search
  • 関数呼び出し(Function calling)
  • コード実行(Code execution)

xAI の現行 Grok 4.5 API ドキュメントは、Grok API 環境でのこれらのツール機能を確認しています。

リサーチエージェントにとって、これはモデルが静的な事前学習知識から最新情報の取得と推論へと移行できる可能性を意味します。

設定可能な推論

Grok の API は、推論努力の設定を公開しています。

これにより、次のトレードオフが可能になります:

速度/コスト ↔ 推論の深さ

単純なタスクでは、低い推論努力が不要な計算を減らします。

複雑なコーディングやリサーチタスクでは、高い推論努力がより熟慮的な問題解決をもたらします。

コスト競争力のあるフロンティア性能

Grok 4.6 の料金は、商業面で最も強力なアドバンテージの一つといえます。

報告されている標準 API 価格は:

  • 入力 100 万トークンあたり $2
  • 出力 100 万トークンあたり $6

これは Grok 4.5 と同じ価格でありながら、能力は大幅に向上しています。

これにより、フロンティアモデルとしては異例に攻めたコスト/性能比が生まれます。


Grok 4.6 はベンチマークでどうか?

現時点で最も有用なベンチマークデータは、エージェント的インテリジェンスとコーディングに集中しています。

BenchmarkGrok 4.6What It Measures
Artificial Analysis Intelligence Index61Broad frontier-model intelligence
CursorBench 3.269.9%Coding-agent performance
DeepSWE 1.165.9%Software engineering agents
FrontierCode 1.1 Extended61.3%Advanced coding
GDPVal-AA v21,753 EloKnowledge-work task performance

Artificial Analysis Intelligence Index の61というスコアは、その指数において Grok 4.6 が GPT-5.6 Sol と同じレベルにあることを示しています。

また、1,753 Elo の GDPVal-AA v2 のスコアも重要です。GDPVal は、単なるアカデミックな質問応答ではなく、プロフェッショナルなナレッジワークのタスクを評価します。

重要なベンチマークの示唆

Grok 4.6 の強みは、単一の MMLU 系スコアではありません

そのベンチマークプロファイルが示すのは:

コーディング+エージェント+ナレッジワーク+長期実行

まさに現代の AI 開発が向かう方向性です。

CometAPI のようなウェブサイトにとって、これは重要な違いとして維持すべき点です。Grok 4.6 は、汎用チャットボットではなく、主にエージェント的フロンティアモデルとして訴求すべきです。

先代や競合との比較は?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focusGeneral reasoning + agentsLong-running agents + coding
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

重要な点は、Grok 4.6 が単なる価格帯置き換えではなさそうだということです。より長期のエージェントワークフローを重点対象にした能力アップグレードです。

xAI の現行 Grok 4.5 ドキュメントでも、モデルは $2/$6/100 万トークン、推論設定とツール対応が可能と記載されています。

比較表:Grok 4.6 と主要競合

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok far cheaper on output
Context Window500KUp to 1M+Often 1M
StrengthsAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Cursor IntegrationNative, strongAvailableAvailableGrok optimized for Cursor
Turn EfficiencyHigh (fewer steps)CompetitiveHigher step counts reportedImportant for agents
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI unifies access

データは、SpaceXAI の発表、Artificial Analysis、および 2026年8月13日現在の公開モデルカードに基づきます。

現行の Artificial Analysis 比較は特に興味深いものです。

Grok 4.6 は reportedly Intelligence Index で 61を記録し、GPT-5.6 Sol に並びました。しかし経済性は大きく異なります。

競合する GPT 系の正確な価格設定は、公開前に各プロバイダの現行価格で確認すべきですが、市場の重要な観察点は明確です。Grok 4.6 は、フロンティア級のベンチマーク性能を維持しながら、比較的攻めたトークンプライシングを維持しています。

そのため、膨大なエージェント実行がコスト面でプレミアムなフロンティアモデルを高価にしがちなアプリケーションに、Grok 4.6 は特に魅力的です。

Grok 4.6 の制約は?

500K コンテキストは 1M コンテキストの競合より小さい

Grok 4.6 の500K コンテキストは大きいものの、フロンティア市場で最大というわけではありません。

非常に大規模なリポジトリや膨大なドキュメント集合では、1M コンテキストモデルが有利な場合があります。

プロプライエタリモデル

MiMo-V2.5-Pro とは異なり、Grok 4.6 はオープンウェイトモデルではありません。

開発者がモデルをダウンロードして独自にデプロイすることはできません。

ベンチマーク比較には注意が必要

コーディング系の各ベンチマークは、ハーネス、プロンプト、ツール、評価手順が異なります。

例えば SWE-Bench Pro は、現実的な長期ソフトウェア工学問題に特化しており、エージェントの足場(scaffold)に大きく依存して結果が変わり得ます。

したがって、CursorBench 69.9% を「Grok 4.6 が他モデルより 69.9% 優れている」と解釈すべきではありません。

正しい解釈は、そのベンチマークの特定の評価設定の下で、そのスコアを達成したということです。

エージェントコストはトークン価格が示すより高くなり得る

$2/$6 のトークン価格は魅力的ですが、自律エージェントは以下により膨大なトークンを消費し得ます:

  • ツール呼び出し
  • 反復的な検索
  • コード実行
  • 失敗した試行
  • 長いコンテキスト
  • 自己検証

したがって実際の単位経済は、100 万トークンあたりのコストではなく、タスクの成功完了あたりのコストに依存します。

価格とアクセス

公式価格(標準ティア、約 200K プロンプトトークン未満):

  • 入力:100 万トークンあたり $2.00
  • キャッシュ入力:100 万トークンあたり約 $0.50
  • 出力:100 万トークンあたり $6.00

高速バリアントはこれらの 2 倍の価格です。非常に長いコンテキスト(≥200K)の場合、レートが倍になる可能性があります。エージェントループではコスト抑制のためプロンプトキャッシングを強く推奨します。

提供状況

  • Cursor と Grok Build(最初の 1 週間は 2 倍の利用枠が含まれます)
  • SpaceXAI API(grok-4.6)
  • パートナー:OpenRouter、Vercel、Cloudflare ほか
  • SuperGrok チャット/アプリ(モデルピッカー経由)

CometAPI の推奨:すでに複数のフロンティアモデルを利用している(または利用予定の)開発者には、CometAPI を通じて、単一の OpenAI 互換エンドポイント(https://api.cometapi.com/v1)で Grok 4.6 にシームレスにアクセスできます。500 以上のモデル(GPT、Claude、Gemini、DeepSeek、Grok 系を含む)にまたがる統合課金、利用分析、競争力のある実効レート、そして 1 行の変更でモデルを切り替えられる柔軟性を提供します。これは、Grok 4.6 を他のコーディング/エージェントモデルと A/B テストしたり、ルーティングやフォールバックが有効な本番システムを構築したりする際に特に有用です。無料の API キー取得とライブモデルカタログの閲覧は cometapi.com から。

Grok 4.6 に乗り換えるべき?

はい、以下に該当する場合は特に

  • Cursor を日常的に使う、または長時間稼働のコーディング/ナレッジエージェントを構築しており、競争力のあるコストで強い多段階の信頼性がほしい。
  • トークン経済性が重要——Grok 4.6 は、最も高価なフロンティアの一部と比べて出力トークン価格が約 1/5 でありながら、GPT-5.6 Sol に近い知能を提供。
  • ターン効率(複雑なタスクを完了するまでのステップ数とトークン)が重要。
  • 現代的な開発で一般的な対話・ビジュアル・エージェントワークフローに明示的に最適化されたモデルへ即時アクセスしたい。

継続利用や混用を検討すべき場合

  • 主な作業が純粋な競技プログラミング、または特定のクローズドモデルの強み(例:特定の Claude 長コンテキストやセーフティ調整シナリオ)に依存。
  • コストに関係なく、あらゆる個別のソフトウェア工学ベンチマークで絶対的な最高スコアを要求。
  • 単発コールで 500K を超えるコンテキストが必要(競合の一部は 1M+ を提供)。

ほとんどのチームにとって、現在のスタックと並行評価するのが有益でしょう。CometAPI のようなアグリゲータ経由で利用できるため、スイッチングコストは低く、モデル名を変更するだけで、実ワークロードでのタスク完了率、レイテンシ、コストを測定できます。

結論

Grok 4.6 は SpaceXAI にとって大きな前進を示します。主要な合成・エージェント系ベンチマークでフロンティアレベルの知能、長期のコーディングおよびナレッジワーク性能の有意な向上、そして多くのクローズドソース競合を下回る攻めた価格設定を継続しています。Cursor でのネイティブ提供に加え、多段階の高い信頼性により、現実世界のソフトウェアエージェントや対話型アプリケーションを構築する開発者にとって特に魅力的です。

直接、Cursor/Grok Build 経由、あるいは CometAPI のような統一ゲートウェイ経由のいずれでアクセスするにせよ、Grok 4.6 は今日から本番評価が可能です。詳細とモデルカードは公式発表 x.ai/news/grok-4-6 を、他の主要モデルとの横比較は cometapi.com のライブカタログを参照し、新機能を今すぐ活用してください。

一次情報源

最新の価格、レート制限、ベンチマーク数値は常に公式ページで検証してください。AI の状況は急速に変化しています。

0 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む