TL;DR
Grok 4.7 は、SpaceXAI のフロンティアモデルで、コーディング、エージェント型ワークフロー、プロフェッショナルな知識業務向けに 2026 年 9 月 21 日にリリースされたモデルです。500,000 トークンのコンテキストウィンドウ、テキストと画像入力、構成可能な推論、関数呼び出し、Web と X 検索、コード実行を組み合わせています。
200,000 トークン未満のプロンプトについて、公式の xAI API は入力トークン 100 万あたり $2、キャッシュ済み入力 100 万あたり $0.50、出力トークン 100 万あたり $6 を提示しています。CometAPI は同じティアで Grok 4.7 を入力 $1.60、キャッシュ済み入力 $0.40、出力 $4.80 と掲載しており、モデルページに表示されている公式レートから 20% 引きになっています。
実用上の価値提案は、普遍的なベンチマーク首位であることではありません。Grok 4.7 は、エンジニアリングタスク、長いエージェントループ、ツール使用、大きな作業コンテキスト、出力トークンコストへの感度が組み合わさるワークロードで最も魅力的です。チームは本番ルーティング前に、自身のリポジトリとワークフローで検証すべきです。
Key Takeaways
- Grok 4.7 は、Grok 4.6 より大きなベースモデル、より長い強化学習(複数時間に及ぶ難度の高いタスク)および強化された自己検証を採用しています。
- API は 500,000 トークンのコンテキストウィンドウ、テキストと画像入力、テキスト出力、4 段階の推論レベル、構造化出力、関数呼び出し、Web と X 検索、コード実行をサポートします。
- SpaceXAI は CursorBench 4.0 で 46.3%、DeepSWE v1.1 で 71.0%、Terminal-Bench 4.0 で 38.0% を報告しています。これはベンダー公表値であり、普遍的な首位の証明ではありません。
- CometAPI は Grok 4.7 を OpenAI 互換エンドポイントで提供し、現在掲載の価格は現行の xAI 公開レートより 20% 低く表示されています。
- 出力トークンコストに敏感なエンジニアリングエージェントや継続的なツール使用には Grok 4.7 を選び、非常に長いコンテキストやベンチマーク重視の領域では他の選択肢を検討してください。
What Is Grok 4.7?
Grok 4.7 は、SpaceXAI の最新フロンティア大規模言語モデルで、特に「コーディング、自律型エージェントタスク、プロフェッショナルな知識業務」に位置づけられています。このリリースは、一度の回答だけでなく、持続的な対話、ツール使用、検証、改稿を必要とするタスクに焦点を当てています。
SpaceXAI は、より難度の高いタスク混在での強化学習を長期間実施したと述べており、多時間を要する問題に重み付けしています。この方向性は、リポジトリ規模のソフトウェアエンジニアリング、デバッグ、リサーチ、ドキュメント作成、エンジニアリング解析、多段の自動化に特に関連します。
How Is Grok 4.7 Different From—and Better Than—Grok 4.6?
A Larger Base Model
Grok 4.7 は、Grok 4.6 より大きなベースモデルへ移行しました。SpaceXAI は確定的な公開パラメータ数を開示していないため、妥当な結論はベースモデルの容量増加であり、特定のパラメータ推定ではありません。
Longer Reinforcement Learning on Harder Tasks
強化学習の段階は延長され、より難しく、長期的な問題へとシフトしました。SpaceXAI は、数時間を要する可能性のあるタスクを強調しており、自律型コーディング、リサーチ、プロフェッショナルなエージェントワークフローに合致します。
Stronger Self-Verification
Grok 4.7 は、自身の成果物をより慎重に点検するように訓練されています。ソフトウェアエンジニアリングでは、信頼できるエージェントは最初の回答を生成するだけでなく、繰り返し点検、修正、テスト、障害診断、改稿、検証を行う必要があるため、これは重要です。
Measured Improvements Over Grok 4.6
| Dimension | Grok 4.6 | Grok 4.7 | Change |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
公開されたローンチスイート全体で、Grok 4.7 は挙げられたすべての結果で Grok 4.6 を上回っています。絶対値で最大の伸びは Terminal-Bench 4.0 で、長時間のコマンドラインやツール使用ワークフローに重点を置いたリリース内容と一致します。これらの数値はベンダー公表値であり、移行判断の前に実務タスクでの検証が必要です。
How Good Is Grok 4.7 on Benchmarks?
SpaceXAI のローンチ評価は、ソフトウェアエンジニアリング、ターミナル作業、プロフェッショナルなオフィスタスク、法律業務、臨床推論、電気工学をカバーしています。これらはベンダー公表値であり、調達やルーティング判断の前に本番ワークロードで検証する必要があります。
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
ローンチ結果において、SpaceXAI は DeepSWE v1.1 の 71.0% を高い推論努力でのスコアとして示しています。
ローンチ発表では、各ベンチマークのハーネス、ツール設定、実行回数、評価環境のすべてが開示されているわけではありません。これらの値はベンダー公表値として扱い、自社のリポジトリ、ツール、レイテンシ目標、失敗基準で検証したうえで本番ルーティングを行ってください。
What Does the Grok 4.7 Benchmark Profile Show?
Software Engineering
CursorBench 4.0 は Grok 4.6 の 40.4% から Grok 4.7 の 46.3% に上昇し、DeepSWE v1.1 は 65.2% から 71.0% に上昇しています。これは、Grok 4.7 が会話的なコーディング支援にとどまらず、コーディングエージェント向けのモデルであるという位置づけを裏付けます。
Long-Running Terminal Work
Terminal-Bench 4.0 は世代間の大きな変化の一つを示します。Grok 4.6 の 20.3% に対し、Grok 4.7 は 38.0% です。この 17.7 ポイントの絶対的な伸びは、長期的強化学習と自己検証への重点という SpaceXAI の強調点と一致します。
Electrical Engineering
EEBench において、Grok 4.7 は 64.0% に到達し、Grok 4.6 の 53.0% と比較して大きく向上しています。公表された比較の中で、これは Grok 4.7 の最も強い相対結果の一つです。
Professional Knowledge Work
AA Briefcase v1.1 は 1,546 から 1,657 に上昇しました。これらのタスクは、ドキュメント、プレゼンテーション、分析、その他の構造化成果物など、複数時間に及ぶプロフェッショナルな業務を反映するよう設計されています。
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: How Do They Compare?
プロバイダー純正の価格確認: OpenAI は GPT-5.6 Sol を入力トークン 100 万あたり $4、出力トークン 100 万あたり $20 と掲示し、Anthropic は Claude Fable 5.1 を入力 $10、出力 $50 と掲示しています。
| Dimension | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primary positioning | コーディング、エージェント型タスク、知識業務 | 複雑なプロフェッショナル推論とコーディング | 長時間エージェント、コーディング、知識業務 |
| Context window | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalities | テキスト・画像入力、テキスト出力 | テキスト・画像入力、テキスト出力 | テキスト・画像入力、テキスト出力 |
| Reasoning control | Low、medium、high、xhigh | None through max | 努力量を調整可能な適応的思考 |
| Provider API status | 公開 xAI API で利用可能 | OpenAI Chat Completions と Responses で提供 | Claude API および対応クラウドマーケットプレイスで提供 |
| Input price / 1M tokens | $2 | $4 | $10 |
| Output price / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Best fit | 価格重視のエンジニアリングエージェントと継続的ツール使用 | 非常に長いコンテキストを要する幅広いプロ推論 | 最大能力の長時間エージェントと知識ワークフロー |
Which Model Should You Choose?
- Grok 4.7 を選ぶ: エンジニアリングワークロード、継続的なツール使用、構成可能な推論、低い出力トークンコストを優先する場合。特に、リポジトリエージェント、ターミナルワークフロー、200K 未満の価格帯に収まる大規模コンテキストのリサーチに魅力的です。
- GPT-5.6 Sol を選ぶ: より広範なプロフェッショナル推論、100 万トークンを超えるコンテキストウィンドウが必要、または DeepSWE や臨床推論などビジネスクリティカルな評価で優位が自環境で検証できている場合。
- Claude Fable 5.1 を選ぶ: 長時間エージェントの性能、コーディング品質、ターミナル実行、または臨床推論での優位性が高いトークン価格を正当化する場合。
- モデルルーティングを使用: ワークロードが多様な場合。日常的なエンジニアリングや大量のエージェントステップは最も費用対効果の高い適格モデルへルートし、成功率がプレミアムを正当化するタスクにのみ高価なモデルを割り当てます。
正しい選択は、単一のベンチマークや表面的なトークン単価ではなく、エンドツーエンドのタスク成功、レイテンシ、リトライ、ツール呼び出し精度、人手での手戻りに依存します。
How Much Does the Grok 4.7 API Cost?
以下の表は、2026 年 9 月 22 日時点で CometAPI の Grok 4.7 モデルページに表示されている価格と、公式 xAI レートを比較したものです。CometAPI は 20% 割引を掲示しています。本番利用前にライブ価格を確認してください。ゲートウェイ価格やプロモーション条件は変動する可能性があります。
| Prompt tier | Price type | xAI official | CometAPI | Difference |
|---|---|---|---|---|
| Below 200K prompt tokens | Input / 1M | $2.00 | $1.60 | 20% lower |
| Cached input / 1M | $0.50 | $0.40 | 20% lower | |
| Output / 1M | $6.00 | $4.80 | 20% lower | |
| Above 200K prompt tokens | Input / 1M | $4.00 | $3.20 | 20% lower |
| Cached input / 1M | $1.00 | $0.80 | 20% lower | |
| Output / 1M | $12.00 | $9.60 | 20% lower |
Standard Context Pricing for Prompts Up to 200,000 Tokens
プロンプトが 200,000 トークンを超えないリクエストでは、Grok 4.7 のコストは「入力トークン 100 万あたり $2」「キャッシュ済み入力 100 万あたり $0.50」「出力トークン 100 万あたり $6」です。キャッシュ済み入力が最も安価なカテゴリであるため、同一のシステム命令や再利用可能なコンテキストを持ち、キャッシュ対象となるトークンを含むアプリケーションではコストを削減できます。
単純な例として、100,000 の未キャッシュ入力トークンを使用し、10,000 の出力トークンを生成するリクエストは、他のプラットフォーム手数料等を除いて約 $0.26 です。内訳は入力 $0.20、出力 $0.06 です。
Long-Context Pricing Above 200,000 Prompt Tokens
プロンプトが 200,000 トークンを超えると、レートは「入力トークン 100 万あたり $4」「キャッシュ済み入力 100 万あたり $1」「出力トークン 100 万あたり $12」に倍増します。この高レートはプロンプト長に基づいて適用されるため、各リクエスト送信前に、会話履歴、ツールトレース、取得ドキュメント、リポジトリコンテキストの累積を監視すべきです。
実用上のコスト判断は、タスクのトークン使用量だけでなく、プロンプトが 200,000 トークンの境界を超えるかどうかにも左右されます。完了済み作業の要約、不要なツール出力の削除、最も関連性の高いファイルのみの取得により、必要なコンテキストを損なうことなく適切なワークロードを標準ティアに維持できます。
SpaceXAI のリリースノートは、この閾値を文書化しています。生産予算では、リトライ、エージェントループ、失敗したツール呼び出し、出力長も考慮に入れるべきであり、プロバイダーを入力トークンの見出し単価だけで比較すべきではありません。
What Makes Grok 4.7 Useful for AI Agents?
- 500K コンテキストウィンドウ: ソースコード、仕様、ツール出力、ログ、会話履歴を一つの作業コンテキストに保持できます。リポジトリ規模のコーディングや複数ドキュメントの分析に有用ですが、コンテキストの積極的な刈り込みは依然として必要です。
- 構成可能な推論: 低・中・高・超高の努力レベルを選択でき、タスク難易度に応じてレイテンシと計算資源をトレードオフできます。
- 関数呼び出しと構造化出力: データベース照会、テスト実行、ドキュメント検査、内部 API 呼び出し、機械可読な結果の返却が可能です。
- Web と X 検索: モデルの学習データが不十分な場合に最新情報を取得できます。取得したコンテンツは信頼されない入力として扱い、検証が必要です。
- コード実行: 計算の検証、データ変換、生成した解のテストを、言語モデルの推論に頼るだけでなく実行で裏付けできます。
- 長期ワークフローへの注力: 複数時間のタスク、コンテキスト管理、自己検証に重点を置いた訓練により、ツールトレースが蓄積し、失敗からの回復が必要なエージェントループを狙っています。
How Does Grok 4.7 Improve Safety?
SpaceXAI は、Grok 4.7 に全く新しい安全保障スタックを導入し、脱獄耐性とデュアルユース安全性の向上を報告しています。ローンチ発表では、LatchBio のバイオセーフティベンチマークで 62.4%、HackerBench v0.3 におけるリスクのあるデュアルユースプロンプトの通過率が 3.3% にとどまったとしています。
これらの数値はベンダー公表の評価です。リリースの主張を理解するには有用ですが、実世界の安全性能を普遍的に示すものではありません。
How Can Developers Use the Grok 4.7 API?
Grok 4.7 は現在 CometAPI で利用可能で、モデル ID は「grok-4.7」です。CometAPI は OpenAI 互換エンドポイント、複数プロバイダー横断の単一 API キーと課金、モデル横比較とルーティングの容易化を提供し、現在掲載のトークン価格は xAI 公開レートより 20% 低く表示されています。本番利用前に、ライブのモデルページ、エンドポイントの健全性、対応パラメータ、価格、データ取り扱い要件を確認してください。
CometAPI request example:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Is Grok 4.7 Worth Switching To?
コーディングエージェントや長時間のプロフェッショナル業務に依存する既存の Grok 4.6 ユーザーにとって、Grok 4.7 は有力なアップグレード候補です。ローンチのベンチマークセットは報告された全次元で改善し、長コンテキスト閾値未満では標準トークン価格が $2/$6 のままだからです。
他のフロンティアモデルのユーザーにとっては、判断はワークロード次第です。Grok 4.7 は、出力トークンコスト、エンジニアリングワークロード、大きなコンテキスト、継続的ツール使用が重要な場合に特に興味深い選択です。別のモデルがクリティカル領域で強い場合は、すべてを一つのプロバイダーに置き換えるより、モデルルーティングの方が合理的でしょう。
Conclusion
Grok 4.7 は、Grok 4.6 の単なる数値的な更新以上の存在です。このリリースは明確に、「ツールを通じて実行される長時間の作業、繰り返しの検証、大きなコンテキスト、複数の実行ステップ」に向けられています。
世代間で最も大きな伸びは、その訓練方向が効くべき領域に表れています。Terminal-Bench 4.0 は 20.3% から 38.0%、EEBench は 53.0% から 64.0%、CursorBench 4.0 は 40.4% から 46.3% に上昇しつつ、200K プロンプト閾値未満の標準価格は入力 $2/M、出力 $6/M に据え置かれています。
実用上の価値提案は「Grok 4.7 がすべてのベンチマークで勝つ」ことではありません。むしろ、Grok 4.7 はフロンティア級エージェント能力と低コスト推論のギャップを狭め、一次回答ではなく多段で動作するコーディングエージェント、リサーチシステム、プロフェッショナルなワークフローに特に関連性を持つという点にあります。
