概要
Grok 4.7 は、最も明確なプレリリースのシグナルとして、9月2日の10日間カウントダウンが発表され、2026年9月12日前後のリリースが見込まれます。これまでの発言では、およそ2.1兆パラメータのモデルであり、SpaceX の企業データを大規模に用いた補助学習が行われたと説明されています。ただし、xAI はまだ Grok 4.7 のモデルカード、ベンチマークスイート、最終的な API 識別子、コンテキストウィンドウ、正式価格を公開していません。これらの詳細が出るまでは、リリース済みの Grok 4.6 が測定可能な本番ベースラインのままです。
重要なポイント
- 9月12日の予想日は、Musk の10日間カウントダウンから推測したものであり、xAI が別途公開したカレンダー発表ではありません。
- 2.1T 規模や SpaceX データに関する発言はプレリリースの主張であり、アクティブパラメータ、ルーティング、アーキテクチャ、学習手法は未公表です。
- Grok 4.6 は、FrontierCode v1.1(Extended)での 61.3% を含め、知識ワークとエージェント分野で強力な結果を示していますが、難易度の高いコーディング評価のいくつかでは最強の比較モデルに劣ります。
- Grok 4.7 は、パラメータ数だけでなく、受理タスク率、長期的信頼性、トークン効率、レイテンシ、成功あたりのコストで評価すべきです。
- CometAPI は、xAI が公式にモデルをリリースし本番エンドポイントへのアクセスが可能になり次第、Grok 4.7 を統合します。移行前にライブのモデル ID、価格、応答挙動を必ず検証してください。
Grok 4.7 とは?
Grok 4.7 は Grok 4.6 の後継としてアナウンスされており、コーディング、エンジニアリング、長時間動作するエージェント、プロフェッショナルな知識ワークに焦点を当てる xAI の路線を継続することが期待されています。現在の公開情報は、完全な技術ローンチパッケージではなく、創業者の発言とリリースのカウントダウンに限られています。
最も重要な区別は次の3つです。発表された Grok 4.7 モデル、その規模や学習内容を示すプレリリースのシグナル、そしてライブのGroK 4.6 の本番ベースラインです。開発者は、xAI が最終ドキュメントを公開し、リリース済みエンドポイントに対するリクエストが成功するまで、Grok 4.7 を評価候補として扱うべきです。
Grok 4.7 のリリース日とタイムライン
Grok 4.7 はいつリリースされる見込みですか?
Musk が9月2日にモデルが10日後に到着すると述べたため、約2026年9月12日が示唆されます。
Grok 4.7 リリースタイムライン
| 日付 | 公開シグナル | 解釈 |
|---|---|---|
| 2026年7月下旬 | およそ 2.1T のモデル、トークン効率の改善、やや低速なサービングについて Musk が説明。 | 創業者が述べたモデル規模と効率に関する期待。 |
| 2026年8月12日 | 初期学習の完了が示され、補助学習には SpaceX の企業データが相当量含まれたと伝えられる。 | 学習進捗の更新であり、リリース確定ではない。 |
| 2026年9月2日 | “Grok 4.7 comes out in 10 days.” | これまでで最も明確な公開リリースカウントダウン。 |
| 2026年9月12日 | カウントダウンから導かれたカレンダー日。 | 期待されるターゲット。最終的な利用可能性には xAI のリリース通知と動作するエンドポイントが必要。 |
Grok 4.7 の仕様:確認情報と未確認情報
現在の Grok 4.7 情報を読むうえで有用なのは、創業者の直接的な発言と、xAI が公表していない仕様を分けて考えることです。最新の投稿で確認されたのはモデル名とリリースのカウントダウンのみであり、技術パラメータやベンチマーク結果は追加されていません。
| 仕様 | 現在の Grok 4.7 の状況 | エビデンスレベル |
|---|---|---|
| リリース時期 | 9月2日の10日間カウントダウンから 9月12日前後と推定 | 創業者が示した目標 |
| モデル規模 | 約 2.1T パラメータ | 創業者の発言 |
| 初期学習 | 8月12日までに完了と説明 | 創業者の発言 |
| 補助学習 | SpaceX の企業データを相当量含む | 創業者の発言 |
| 相対的な品質 | Grok 4.6 より大幅に優れると主張 | 未検証の主張 |
| トークン効率 | Grok 4.6 からの改善を主張 | 未検証の主張 |
| サービング速度 | やや低速になる見込み | 創業者の発言 |
| コンテキストウィンドウ | xAI から未公表 | 不明 |
| 入出力モダリティ | xAI から未公表 | 不明 |
| 最終 API モデル ID | xAI ドキュメントで未確認 | 不明 |
| 正式価格 | xAI から未公表 | 不明 |
| 公式ベンチマーク | Grok 4.7 については未公開 | 不明 |
およそ 2.1T パラメータという主張は、アクティブパラメータ、スパース性、エキスパートルーティング、推論コスト、実効学習計算量を開示していません。パラメータ数だけでは本番品質は判断できません。
2.1T よりも SpaceX の学習シグナルが重要かもしれない理由
より重要な開示は、SpaceX の企業データによる補助学習かもしれません。高品質なエンジニアリングコーパスは、技術的推論、設計、デバッグ、最適化、長期のエージェント作業を向上させる可能性があり、ここではタスク分配や学習後の品質が生の規模以上に効くことが多い領域です。
この方向性は、xAI の公開済みモデル戦略と整合しています。Grok 4.6 の学習レポートは、高品質なエンジニアリングデータを用いたより長い補助学習、その後の教師あり微調整および強化学習(コーディング、STEM、ウェブ開発、カーネル最適化、CAD を横断)を説明しています。
これは Grok 4.7 の主張を技術的にもっともらしいものにしますが、証明にはなりません。本当の優位性は、リリース後に再現可能なエンジニアリングテスト、タスク完了率、レイテンシ、成功あたりのコストで可視化されるべきです。
Grok 4.7 vs Grok 4.6 のパフォーマンス:ベースラインが示すもの
Grok 4.7 の公式スコアはまだ存在しません。責任ある比較対象は、xAI がリリースした Grok 4.6 の評価です。モデル全体の概要は CometAPI の Grok 4.6 詳細解説にあります。以下の表は意思決定に最も関係するベンチマークの行のみを残しています。
| 公式評価 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
ベースラインの結果:Grok 4.6 は、ここに示したすべての行で Grok 4.5 を上回っています。総合インテリジェンス指標で GPT-5.6 Sol に匹敵し、GDPVal-AA v2 ではこのグループをリードし、FrontierCode では GPT-5.6 Sol をわずかに上回ります。公表された主なギャップは DeepSWE と Terminal-Bench に残ります。
これらの結果は Grok 4.7 の具体的な基準を設定します。より大きなモデルとエンジニアリング志向の補助学習が本番に転移すれば、期待されるブレークスルーは、Grok 4.6 の知識ワークの強みを失わずに、より強力なリポジトリレベルのコーディングとターミナルタスクの完了に現れるはずです。妥当なストレッチ目標は、リリース済みの Claude Fable 5.1 とコーディングおよび長時間のエージェントワークフローで競争力を持つことです。これは検証すべき予測であり、現時点のベンチマーク主張ではありません。
Grok 4.7 vs Grok 4.6:期待されるブレークスルーとアップグレード指針
リークおよび創業者の発言が示唆するのは、Grok 4.7 が改善しうる5つの領域です。xAI が最終的な評価データを公表していないため、各期待は測定可能な受け入れテストに落とし込むべきです。
リポジトリレベルのコーディング
Grok 4.6 は CursorBench と FrontierCode で既に強力ですが、DeepSWE と Terminal-Bench の結果には改善の余地が見えます。Grok 4.7 は、Grok 4.6 に置き換える前に、同じリポジトリでのパッチ受理率の向上、リグレッションの減少、コマンドラインでのリカバリの改善を示すべきです。
長期エージェントの信頼性
SpaceX データのシグナルと xAI の既存のエージェント学習の方向性は、多段のエンジニアリング作業への注力を示唆します。完了したワークフロー、失敗したツール呼び出し、再試行、人手介入、エラー後のリカバリを測定し、最終的な文章の品質だけに注目しないでください。
ナレッジワークと技術的推論
Grok 4.6 は GDPVal-AA v2 で比較セットをリードしています。Grok 4.7 はその優位性を維持しつつ、設計レビュー、研究の統合、デバッグ、最適化、その他の複雑な技術タスクへの転移を改善すべきです。
トークン効率
より大きなモデルでも、より少ないステップで正解に到達できれば、タスク成功あたりのコストは安くなり得ます。同一の受理結果に対して、総入力、キャッシュされた入力、出力トークン、再試行、コストを比較してください。
サービングのトレードオフ
Grok 4.7 が遅くなる場合、品質向上がレイテンシを上回る必要があります。第一トークンまでの時間、持続スループット、タスク完了までの壁時計時間、エラー率、現実的な並行度下でのコストを記録してください。
Grok 4.7 のベンチマーク:Grok 4.6 を実際に上回ることを検証する5つのテスト
- ソフトウェアエンジニアリングの成功:代表的なリポジトリで、解決された課題、合格テスト、リグレッション率、パッチ受理を測定。
- 長期エージェントの信頼性:複数段階の実行で、完了ワークフロー、ツール呼び出し失敗、再試行、リカバリ、人手介入を追跡。
- 実世界のエンジニアリング転移:設計、デバッグ、最適化、科学的推論、CAD 関連タスクを、採点基準を開示した上でテスト。
- 成功タスクあたりのトークン効率:同一の受理結果に到達するまでに必要な総トークン数と支出を比較。
- 本番負荷下のレイテンシとコスト:現実的な並行度で、第一トークンまでの時間、スループット、壁時計時間、エラー率、コストを評価。
9月12日までに開発者がやるべきこと—そして CometAPI の役割
プレローンチ開発者チェックリスト
- 実際のコーディング、リサーチ、エンジニアリング、エージェントワークフローから固定の評価セットを作成。
- それを Grok 4.6 に対して実行し、成功率、再試行、ツール呼び出し、レイテンシ、トークン、総コストを記録。
- モデル選択を設定可能に保ち、暫定的な Grok 4.7 識別子のハードコードを避ける。
- xAI のリリースノートと CometAPI のモデルページで、利用可能性の確定情報を監視。
- ローンチ後、コンテキスト、モダリティ、推論コントロール、価格、レート制限、ロールアウト範囲を検証。
- 本番トラフィックを切り替える前に、同じ評価セットを再実行。
CometAPI は、複数の AI モデルプロバイダへ単一のアカウントと統合パターンでアクセスできる統合 API レイヤーを提供します。Grok 4.7 のトラッキングページはすでに利用可能です。xAI がモデルを正式リリースし本番アクセスが可能になり次第、CometAPI は Grok 4.7 を統合します。
それまでは、プレリリースの識別子、価格、機能フィールドはすべて暫定的なものとして扱ってください。本番トラフィックを送る前に、ルートが稼働していること、実リクエストが成功すること、返却されるモデルが意図したバージョンであること、そして現行価格がコンソールに表示されていることを確認してください。
Grok 4.7 の価格見通し vs Grok 4.6
公開されている Grok 4.6 の標準料金は、長文脈のしきい値未満で入力 100万トークンあたり $2、出力 100万トークンあたり $6 です。xAI のリリースノートでは、プロンプトが 200,000 トークンを超えるリクエストに対して高い料金が記載されています。Grok 4.7 の価格はまだ正式に発表されていません。
| 公開された料金基準 | 入力 / 100万 | 出力 / 100万 | ステータス |
|---|---|---|---|
| Grok 4.6、プロンプト < 200K | $2 | $6 | 公開済み |
| Grok 4.6、プロンプト > 200K | $4 | $12 | 公開済みの長文脈ティア |
| Grok 4.7 | 未発表 | 未発表 | 公式リリース後に確認 |
価格の方向性としては3つが考えられます:Grok 4.6 と同水準にして採用を加速する、提供コストが大きければプレミアムティアにする、コンテキスト長や速度でレートを分ける。これらは計画シナリオであり、xAI の予測ではありません。
プレローンチ開発者チェックリスト
- 実際のコーディング、リサーチ、エンジニアリング、エージェントワークフローから固定の評価セットを作成。
- それを Grok 4.6 に対して実行し、成功率、再試行、ツール呼び出し、レイテンシ、トークン、総コストを記録。
- モデル選択を設定可能に保ち、暫定的な Grok 4.7 識別子のハードコードを避ける。
- xAI のリリースノートと CometAPI のモデルページで、利用可能性の確定情報を監視。
- ローンチ後、コンテキスト、モダリティ、推論コントロール、価格、レート制限、ロールアウト範囲を検証。
- 本番トラフィックを切り替える前に、同じ評価セットを再実行。
Grok 4.7:次に注目すべき点
現在のカウントダウンを検証可能な製品ローンチへと変えるには、4つの出来事が必要です。公式の xAI リリース投稿、コンテキスト・モダリティ・推論コントロールをカバーするモデルドキュメント、最終的な API 価格とモデル識別子、そして再現可能なベンチマークまたは本番評価です。
最も有用なローンチ時の問いは、2.1T が大きく聞こえるかどうかではありません。Grok 4.7 が、リリース済みのベースラインよりも難しいエンジニアリングやエージェントタスクをより確実に完了し、成功あたりのコストがより良いかどうかです。
FAQ
Grok 4.7 はいつリリースされる見込みですか?
Musk の9月2日の10日間カウントダウンから、2026年9月12日前後が示唆されます。これは推定ターゲットであり、xAI が別途公開したカレンダー日ではありません。
Grok 4.7 は既にローンチされていますか?
Grok 4.7 は公開上のティーズ/アナウンスはあるものの、完全な公式 API/モデルドキュメントのリリースには至っていません。
Grok 4.7 は 2.1 兆パラメータのモデルですか?
Musk はおよそ 2.1T パラメータと述べています。xAI はアクティブパラメータやルーティングの詳細を確定するアーキテクチャ文書をまだ公開していません。
Grok 4.7 は Grok 4.6 より優れていますか?
Musk は大幅な改善を主張していますが、Grok 4.7 の公式ベンチマーク表は存在しません。再現可能な結果が得られるまで未検証の主張として扱ってください。
Grok 4.7 は CometAPI 経由で利用できますか?
Grok 4.7 の CometAPI トラッキングページは既に存在しますが、最終的な利用可能性、識別子、価格、対応フォーマットは公式ローンチ後に確認してください。
結論
Grok 4.7 のストーリーは、漠然とした9月上旬の見込みから具体的なカウントダウンへ移行しました。Musk の最新の発言は2026年9月12日前後を指し示し、以前の投稿ではおよそ 2.1T のモデルと、SpaceX の企業データを用いた補助学習が説明されています。
これらは非常に具体的なプレリリースのシグナルですが、モデルカード、ベンチマークスイート、API 契約ではありません。開発者は、Grok 4.6 を測定可能なベースラインとして維持し、いま制御された評価を準備し、xAI と CometAPI が本番アクセスを確認するまで、移行や予算判断を保留すべきです。
