Grok 4.6 の技術仕様
| 項目 | Grok 4.6 |
|---|---|
| 提供元 | xAI |
| モデル ID | grok-4.6 |
| モデルタイプ | フロンティア級マルチモーダル推論・エージェントモデル |
| 主な強み | 長時間稼働エージェント、コーディング、ナレッジワーク、インタラクティブ/ビジュアルなアプリ構築 |
| 入力モダリティ | テキストと画像 |
| 出力モダリティ | テキスト |
| コンテキストウィンドウ | 500,000 トークン |
| ナレッジカットオフ | 2026年2月1日 |
| 出力上限 | xAI によるテキスト出力上限の公開なし |
| 推論 | low, medium, high (default), xhigh |
| API | Responses API、Chat Completions |
| ツール | 関数呼び出し、ウェブ検索、X 検索、コード実行 |
| API 料金 | $2 / 1M 入力トークン; $6 / 1M 出力トークン |
| 高速版 | 標準価格の2倍で利用可能 |
| リリース日 | 2026年8月12日 |
Grok 4.6 とは?
Grok 4.6 は、エージェント知能に特化した xAI の最新フロンティアモデルです。
従来のチャットボットとは重要な違いがあります。
xAI は、複雑なプロジェクトに長期間取り組み、コードベースを横断して作業し、未知のトピックを調査し、アプリケーションを構築し、自らの作業を検証できる能力を重視しています。
これにより、Grok 4.6 は急速に拡大するAI コーディングエージェント/自律エージェント市場に特に適合します。
Grok 4.6 の主な機能
- 長時間稼働エージェントの実行: Grok 4.6 は、単一ターンの回答最適化にとどまらず、多数のステップにわたる複雑な作業を持続できるように訓練されています。
- エージェント型コーディング: リポジトリレベルのソフトウェアエンジニアリング、コード生成、デバッグ、反復的テスト、ドメイン固有のコーディング環境を対象とします。
- ナレッジワークのリサーチ: モデルは未知の領域を調査し、情報を整理し、複雑な要件を推論し、所見を具体的な成果物へと転換できます。
- ビジュアルかつインタラクティブなアプリ構築: xAI は、製品アイデアを動作するアプリへと変換し、フィードバックループで洗練するなど、ビジュアル/インタラクティブ案件での初回パスの強化を報告しています。
- 自己テストと検証: 長い軌跡では、継続前に自らの作業を確認する挙動が増えたと xAI は観察しています。
- ネイティブなツール使用: Grok 4.6 は API 経由で関数呼び出し、ウェブ検索、X 検索、コード実行をサポートします。
- 設定可能な推論: 開発者は
low、medium、high、xhighの推論負荷を選択でき、レイテンシ重視と深い推論のワークロードに適応します。
Grok 4.6 のベンチマーク性能
xAI は、Grok 4.6 が Artificial Analysis Intelligence Index(9つのベンチマークの複合)で GPT-5.6 Sol に匹敵すると報告しています。公表された最も強い結果には次が含まれます:
| ベンチマーク | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
これらの数値は xAI の8月12日のローンチ発表からのものです。xAI は、サードパーティの数値が開発者のシステムカードや公開ベンチマークのリーダーボードから取得されていると注記しており、モデル間の結果は評価手法とモデル設定を踏まえて解釈すべきだとしています。
Grok 4.6 と Grok 4.5、GPT-5.6 Sol、Claude Fable 5 の比較
| モデル | 主なポジショニング | コンテキスト | AA インテリジェンス | コーディング/エージェント特性 |
|---|---|---|---|---|
| Grok 4.6 | 長時間稼働エージェント、コーディング、ナレッジワーク | 500K | 61 | エージェント型コーディングとインタラクティブなプロジェクトワークフローに強み |
| Grok 4.5 | 高速フロンティア汎用・コーディングモデル | 500K | 56 | コーディングおよびエージェントのワークフローに強力なベースライン |
| GPT-5.6 Sol | フロンティアな一般推論とエージェント作業 | 公開されている競合のコンテキストはデプロイによって異なる | 61 | DeepSWE と Terminal-Bench の結果が強力 |
| Claude Fable 5 | フロンティアなナレッジワークとコーディング | 公開されている競合のコンテキストはデプロイによって異なる | 62 | CursorBench、FrontierCode、APEX-SWE で非常に強力 |
単一の高品質応答ではなく持続的な実行を要するワークロードにおいて、Grok 4.6 は最も魅力的です。特に、調査、ツール呼び出し、コード編集、結果のテストを繰り返し、蓄積されたコンテキストから継続するエージェントを構築する開発者に適しています。Claude Fable 5 は公開された複数のコーディング/エージェント系ベンチマークで優位を維持し、GPT-5.6 Sol は xAI の比較において DeepSWE と Terminal-Bench で Grok 4.6 を上回ります。
制限事項と考慮点
- ベンチマーク結果はタスク依存: Grok 4.6 が常に最高スコアというわけではありません。公表値はエージェント系評価での明確な強みと弱みを示しています。
- 長時間のワークロードは大量のトークンを消費し得る: 大きなコンテキストウィンドウと反復的なツール使用は、トークン単価が競争力がある場合でも総推論消費を増加させる可能性があります。
- ツール構成が重要: ウェブ検索、X 検索、コード実行、関数呼び出しは、ツールの権限と返却データを安全に扱えるアプリケーションアーキテクチャを要します。
- ナレッジカットオフ: 記載されたカットオフは2026年2月1日です。より新しい情報については、モデルの静的知識に依存せず、適切なリトリーバルやウェブ検索ツールを使用してください。
- キャッシュには意図的な設定が必要: xAI は Responses API の
prompt_cache_keyと Chat Completions のx-grok-conv-idを推奨し、キャッシュヒットの信頼性を高めます。
Grok 4.6 のユースケース
- 自律型コーディングエージェント — リポジトリ解析、実装、デバッグ、テスト、反復的修正。
- プロダクトのプロトタイピング — 広範な製品要件を機能するインタラクティブなアプリへ。
- 技術調査エージェント — 未知の技術領域を調査し、構造化された成果物を作成。
- 開発者コパイロット — コード生成、レビュー、デバッグ、マルチステップ開発ワークフロー。
- ナレッジワークの自動化 — 文書分析、情報統合、計画、構造化出力生成。
- ツール活用アシスタント — モデル推論とウェブ検索、X 検索、コード実行、カスタム関数呼び出しを組み合わせたアプリケーション。
Grok 4.6 API へのアクセス方法
すでに CometAPI の統合 API レイヤーを利用しているアプリケーションでは、CometAPI が公開する Grok 4.6 のモデル ID を使用し、CometAPI の API ドキュメントにある現行のエンドポイント/スキーマに従ってください。これは、アプリケーションがフロンティア LLM 間で切り替える必要がある場合のプロバイダ固有の統合作業を削減できます。
一般的なワークフローは次のとおりです:
- CometAPI アカウントを作成するかサインインします。
- CometAPI コンソールで API トークンを作成します。
grok-4.6モデルエンドポイントを選択します。- モデル用に文書化されたリクエストスキーマを用いて、CometAPI のエンドポイント経由でリクエストを送信します。
- 返されたテキスト、ツール呼び出し、または構造化出力をアプリケーションで処理します。