TL;DR
Grok 4.7 と Claude Fable 5.1 は同じフロンティアモデル層で競合するものの、展開時の経済性最適化は異なる。Grok 4.7 はコーディング、エージェント作業、価格対性能に焦点を当て、500K トークンのコンテキストウィンドウを持ち、公式価格は入力 $2/M、出力 $6/M から。Claude Fable 5.1 はコンテキスト容量を 1M トークンへ倍増し、高度な推論と長期のエージェント作業向けに設計され、入力 $10/M、出力 $50/M。
ベンチマークの結果は一方的ではなく混在している。xAI の公式ローンチ評価 では CursorBench 4.0 と Terminal-Bench 4.0 で Fable 5.1 が上回り、DeepSWE v1.1、EEBench、Harvey Legal Agent Benchmark では Grok 4.7 がリードしている。実運用では、普遍的な勝者を選ぶよりも、受理率あたりのコスト、タスク時間、コンテキスト要件、ツール利用、リトライ挙動が重要になる。
Key Takeaways
- Grok 4.7 は高コンテキスト料金閾値未満で入力 $2/M、出力 $6/M。キャッシュ済み入力は $0.50/M。
- Claude Fable 5.1 は入力 $10/M、出力 $50/M、キャッシュ読み取りは $0.25/M。
- Claude Fable 5.1 は 1M トークンのコンテキストウィンドウ、Grok 4.7 は 500K トークン。
- ベンチマークの優位性はタスク依存:Fable 5.1 は長期コーディング系で優位、Grok 4.7 は xAI 比較で特定のエンジニアリングやドメインエージェントで優位。
- 生産で最も有用な指標は、単独の 1M トークンあたり価格ではなく、成功タスクあたりのコスト。
What Are Grok 4.7 and Claude Fable 5.1?
Grok 4.7 Overview
Grok 4.7 は xAI のフロンティアモデルで、コーディング、エージェント作業、ナレッジワーク向けに 2026 年 9 月 21 日にリリース。xAI によれば、Grok 4.6 より大きい新しいベースモデルと、数時間かかるタスクに重み付けした長い強化学習を使用。リリースでは自己検証と長コンテキスト管理の改善も強調されている。
公式開発者ドキュメントは、モデル ID grok-4.7、500,000 トークンのコンテキストウィンドウ、テキストと画像入力、テキスト出力、Low/Medium/High/xhigh の 4 段階推論レベル、関数呼び出し、Web 検索、X 検索、コード実行といったツールを明記。
Grok 4.7 公式ローンチビジュアル - SpaceXAI
Claude Fable 5.1 Overview
Claude Fable 5.1 は 2026 年 9 月 1 日にリリース。Anthropic は、要求の高い推論、長時間のコーディング、マルチステップのリサーチ、ドキュメント中心のプロフェッショナル業務、長時間のセッションでも動き続けるエージェント向けに位置づけている。
モデルドキュメントは、1M トークンのコンテキストウィンドウ、最大 128K 出力トークン、テキストと画像入力、アダプティブ思考、2026 年 6 月の信頼できる知識カットオフを明記。
Claude Fable 5.1 公式ローンチビジュアル - Anthropic
Grok 4.7 vs Claude Fable 5.1 at a Glance
| 仕様 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| リリース日 | September 21, 2026 | September 1, 2026 |
| 提供元 | xAI / SpaceXAI | Anthropic |
| モデルID | grok-4.7 | claude-fable-5-1 |
| 主な位置づけ | コーディング、エージェント、ナレッジワーク | 高難度の推論と長期運用のエージェント |
| コンテキストウィンドウ | 500K tokens | 1M tokens |
| 最大出力 | 固定のテキスト出力上限は未記載 | Up to 128K tokens |
| 入力モダリティ | Text + image | Text + image |
| 出力 | Text | Text |
| 知識カットオフ | May 2026 | June 2026 |
| 推論 | Low / Medium / High / xhigh | Adaptive thinking + effort controls |
| Web/検索ツール | Web search + X search | Environment/tool dependent |
| 関数/ツール呼び出し | Yes | Yes |
| モデル重み | Closed | Closed |
| CursorBench 4.0 コーディング性能 | 46.3% | 51.8% |
| DeepSWE v1.1 エージェント性能 | 71.0% (high effort) | 70.0% |
| Terminal-Bench 4.0 エージェント性能 | 38.0% | 57.9% |
| 代表的ユースケース | コスト重視のコーディングと Web/X 連携エージェント | 長期コーディングと失敗に敏感なプロフェッショナル業務 |
最大の構造的差異はコンテキスト容量とトークン経済性。Grok 4.7 の公式 API ドキュメント は 500K コンテキストと $2/$6 のベース価格を確認し、Anthropic の Fable 5.1 ドキュメント は 1M コンテキストと $10/$50 のベース価格を確認している。
Head-to-Head Benchmark Results
現時点でもっともクリーンな直接比較は、xAI の Grok 4.7 ローンチ・ベンチマーク表で、両モデルが同じ公開評価で報告されている。
以下の数値はベンダー報告であり、独自再現ではない。xAI の公開表では、Grok 4.7 は xhigh エフォート、Claude Fable 5.1 は max エフォートで評価され、別途 Grok 4.7 の DeepSWE 結果は high エフォートと注記されている。ワークロードの傾向把握に用い、その後は自分たちのプロンプト、ツール、リポジトリ、受入基準で両モデルを検証すべき。
| ベンチマーク | Grok 4.7 | Claude Fable 5.1 | 観測差 |
|---|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% | Fable +5.5 pts |
| DeepSWE v1.1 | 71.0%* | 70.0% | Grok +1.0 pt |
| AA Briefcase v1.1 | 1,657 | 1,678 | Fable +21 |
| Terminal-Bench 4.0 | 38.0% | 57.9% | Fable +19.9 pts |
| Harvey Legal Agent Benchmark | 19.6% | 6.7% | Grok +12.9 pts |
| HealthBench Professional | 56.7% | 62.1% | Fable +5.4 pts |
| EEBench | 64.0% | 56.4% | Grok +7.6 pts |
* xAI は Grok 4.7 の DeepSWE 結果を high エフォートと注記。より広い見立ては普遍的な序列ではなくタスク特化:Fable は複数の長期コーディングやプロフェッショナル系で強く、Grok は同一ベンダー表の一部エンジニアリングやドメインエージェントで強い。
Professional Knowledge Work
xAI のヘッド・トゥ・ヘッド表では、Fable 5.1 は AA Briefcase v1.1 でわずかにリードし、Grok 4.7 は EEBench と Harvey Legal Agent Benchmark でリード。Fable 5.1 は HealthBench Professional でリード。分割は単純な点を補強する:ナレッジワークは単一の能力ではない。エンジニアリング、医療、法務、金融、リサーチ、オフィス自動化は異なるツールと推論要件を課す。
Coding Performance
コーディングは最もニュアンスのある比較領域。CursorBench 4.0 では Fable 5.1 が 51.8%、Grok 4.7 は 46.3%。DeepSWE v1.1 では Grok 4.7 が 71.0%、Fable 5.1 は 70.0%。最大の差は Terminal-Bench 4.0 に見られ、Fable 5.1 は 57.9%、Grok 4.7 は 38.0%。
| コーディングの側面 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| リポジトリエンジニアリング | 非常に強い | 非常に強い |
| DeepSWE | xAI 表では僅差でリード | ほぼ同等 |
| CursorBench 4.0 | 46.3% | 51.8% |
| ターミナル自律性 | 強い | 主要な強み |
| 長コンテキストのコード作業 | 500K コンテキスト | 1M コンテキスト |
| 繰り返し呼び出し時のコスト | かなり低い | プレミアム |
| xAI ネイティブのコード実行 | 対応 | Claude の環境/ツールに依存 |
| 長時間の無人実行 | 明示的な学習重点 | コアな製品ポジショニング |
配備上の含意として、Fable 5.1 はターミナル重視・長時間のコーディングエージェントで注目に値し、Grok 4.7 はソフトウェアエンジニアリング品質が十分でトークンコストが単位経済に大きく効く場面で魅力的。
Agentic Workflows
両モデルとも、単発のプロンプト応答ではなくエージェント型ワークフロー向けに設計。xAI は Grok 4.7 がより困難な長時間タスクと自己検証を強化したと述べ、Anthropic は Fable 5.1 を、数時間動作し多くのアプリに跨る作業向けのモデルとする。
| エージェント要件 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| 長時間の推論 | 強い | 非常に強い |
| コンテキスト容量 | 500K | 1M |
| 自己検証 | 明示的な学習重点 | 明示的な長期志向 |
| ツール利用 | 強い | 強い |
| 検索ネイティブなワークフロー | Web + X 検索 | 環境依存 |
| 長期の繰り返しコンテキスト | プロンプトキャッシュ + 圧縮 | 1M コンテキスト + 低コストのキャッシュ読み取り |
| 素のトークンコスト | 低い | 高い |
Pricing and Deployment Economics
| 公式ベース価格 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| 入力 / 1M トークン | $2 | $10 |
| キャッシュ済み入力 / 読み取り | $0.50 below 200K prompt | $0.25 |
| 出力 / 1M トークン | $6 | $50 |
| 10M 入力トークン | $20 | $100 |
| 10M 出力トークン | $60 | $500 |
| 米国地域エンドポイント上乗せ | +10% | Platform dependent |
標準の未キャッシュ・トークン料金では、Grok 4.7 の入力価格は Fable 5.1 より 80% 低く、出力価格は 88% 低い。ただし、Anthropic のキャッシュ読み取り料金は、繰り返しの多いエージェント型ワークロードで Fable 5.1 の実効コストを大きく下げうる。
価格に関する注記: Grok 4.7 の $2/M 入力と $6/M 出力はベースレート。SpaceXAI は 200K コンテキストを超えるリクエストに別の高コンテキスト料金を文書化している。以下の計算は、リクエストがベース料金層内に収まり、ツール料金、地域上乗せ、キャッシュ書き込みコストを除外する前提。
例のワークロード: 10M 入力トークン + 2M 出力トークン。
- Grok 4.7: $20 入力 + $12 出力 = $32。
- Claude Fable 5.1: $100 入力 + $100 出力 = $200。
- キャッシュ影響前の名目差: $168。
より良いプロダクション指標は「成功したタスクあたりのコスト」。 高価なモデルでも、リトライ、失敗、人手修正を減らせば経済的になりうる。逆に、安価なモデルは両者が同じ合格基準を満たすなら優位に立てる。
Context and Reasoning Controls
Fable 5.1 は 1M トークンのコンテキストウィンドウを提供し、Grok 4.7 は 500K トークン。この差は、非常に大きなリポジトリ、ドキュメントセット、法務ディスカバリー、科学研究、長い履歴を保持するエージェントで重要になりうる。
Grok 4.7 は Low、Medium、High、xhigh の推論設定を公開。Fable 5.1 はエフォートコントロール付きのアダプティブ思考を採用。ラベルは直接比較可能ではないため、公平なテストでは設定名を合わせるのではなく、タスクと受入基準を一定にすべき。
Multimodal and Tool Capabilities
両モデルともテキストと画像を受け付ける。Grok 4.7 の API は関数呼び出し、Web 検索、X 検索、コード実行を含む。Claude Fable 5.1 はドキュメント、スプレッドシート、スライド、リサーチ、長時間のエージェント・ワークフローに最適化され、ツール挙動は Claude の環境やアプリケーションスタックに依存。
| 機能 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| テキスト入力 | Yes | Yes |
| 画像入力 | Yes | Yes |
| 関数/ツール呼び出し | Yes | Yes |
| Web 検索 | xAI ネイティブのツール | 環境依存 |
| X 検索 | ネイティブ | 同等の専用 X 連携はなし |
| コード実行 | xAI ネイティブのツール | 環境依存 |
| ドキュメント/スプレッドシート/スライド | 一般的なナレッジワーク志向 | 明確な製品フォーカス |
Decision Summary
| 観点 | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| コーディング品質 | 最先端 | 最先端 |
| CursorBench 4.0 | 46.3% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 70.0% |
| Terminal-Bench 4.0 | 38.0% | 57.9% |
| EEBench | 64.0% | 56.4% |
| Harvey Legal Agent | 19.6% | 6.7% |
| HealthBench Professional | 56.7% | 62.1% |
| コンテキスト | 500K | 1M |
| 入力価格 | $2/M | $10/M |
| 出力価格 | $6/M | $50/M |
| 検索 | Web + X | ツール/環境依存 |
| 長時間エージェント | 強い | 主要な強み |
| 価格性能比 | 大きな優位 | プレミアム機能層 |
| 代表的適合領域 | 規模重視のフロンティア・ワークロード | 長期価値の高い長期タスク |
Can You Use Grok 4.7 and Claude Fable 5.1 Through CometAPI?
はい。CometAPI の Grok 4.7 API と CometAPI の Claude Fable 5.1 API は、マルチモデル・ルーティング戦略の一部として利用可能。最適な本番アーキテクチャは、単一のフロンティアモデルだけを選ばない場合があるため重要。
実用的なルーティングパターン:
- デフォルトルート: コスト重視のフロンティアタスクには Grok 4.7。
- エスカレーションルート: 評価に失敗、コンテキスト要件超過、または長時間のエージェントでより強いターミナル実行が必要な場合に Claude Fable 5.1。
これにより、公開リーダーボードではなく、受理率、総トークン、レイテンシ、リトライ、成功タスクあたりコストを比較できる。
Grok 4.7 vs Claude Fable 5.1: How to choose
コスト重視・検索ネイティブなワークロードには Grok 4.7
- トークンコストが単位経済に大きく影響する高ボリュームのコーディングアシスタント。
- Grok のドメイン結果がワークロードと整合するエンジニアリングや技術系エージェント。
- ネイティブな Web および X 検索の恩恵があるリサーチ。
- バッチのナレッジ処理や繰り返しのバックグラウンド自動化。
- 両モデルが同じ受入閾値を通過し、コストが決定要因となるワークロード。
マルチモデル・ゲートウェイを利用する開発者向けに、CometAPI の Grok 4.7 API は、単一の統合レイヤーで他のフロンティアモデルと並行評価できる。
長期/失敗コスト重視のワークロードには Claude Fable 5.1
- 数時間の自律コーディングやターミナル重視のワークフロー。
- 1M トークンのコンテキストウィンドウが有利な非常に大きなリポジトリやドキュメントセット。
- 多数ステップにわたり状態を維持する必要がある高度なプロフェッショナル・エージェント。
- リトライや失敗コストが生のトークンコストを上回る高価値ビジネスワークフロー。
- Anthropic の長期エージェント系ベンチが実運用ニーズに近いリサーチや自動化。
CometAPI の Claude Fable 5.1 API はモデル ID claude-fable-5-1 を使用。ゲートウェイ料金は Anthropic のリスト価格と独立して変動しうるため、デプロイ時に価格とルーティングを確認すべき。
Conclusion
トークンコスト、Web/X 連携ツール、規模重視のエージェント・ワークフローが意思決定を支配する場合、Grok 4.7 は優れた出発点。1M トークンのコンテキストウィンドウ、要求の高い長時間のコーディングやプロフェッショナル業務がベースのトークン価格より重要な場合、Claude Fable 5.1 が有力候補。ベンダー報告のベンチ結果は混在しており、普遍的な勝者はいない。
選択前に、同じ本番タスク、ツール、時間予算、受入基準で両者をテスト。公開スコアに加え、受理率あたりコスト、レイテンシ、リトライ、ツール失敗、人手修正時間を比較すること。
FAQ
チームは Grok 4.7 と Claude Fable 5.1 をどのように公平に評価すべき?
汎用リーダーボードではなく、本番代表タスクから始める。同じリポジトリ状態、ツール権限、時間予算、受入基準を両モデルで統一。受理率、エンドツーエンドのレイテンシ、入力/出力トークン、キャッシュ挙動、ツール失敗、リトライ、人手修正時間を記録。タスクばらつきとモデル挙動を分離できるだけの反復を行う。
どのような場合に、Grok 4.7 の受理タスクあたりコストが Claude Fable 5.1 より高くなる?
低いトークンレートでも、リトライ増、プロンプトの肥大化、ツール呼び出しの失敗、人手レビュー増を招くと高くなる。一方、プレミアムモデルも自動的に経済的ではない。その高い完了率が追加の推論コストを相殺する必要がある。トークン単価ではなく、受理タスクあたりコストを比較すべき。
ルーターはいつ Grok 4.7 から Claude Fable 5.1 にエスカレートすべき?
測定可能なトリガーを用いる。コスト重視のデフォルトルートは検証を素早く通過するタスクを処理し、エスカレーションはタスクが好ましいコンテキスト範囲を超える、自動評価に失敗する、長いターミナル実行が必要、または高い誤りコストを伴う場合に発火。トリガーと結果をログし、本番の証拠でルーティング方針を調整できるようにする。
Grok 4.7 vs Claude Fable 5.1 のベンチマークで最重要の注意点は?
ベンチマークのバージョン、推論エフォート、エージェントハーネス、ツールアクセス、セーフガード、そして結果がベンダー報告か独自再現か。例えば、CursorBench 3.2.0 と 4.0 は同一テストではないのに同列比較されるべきでない。公開スコアは仮説形成には有用だが、導入判断は統制された内部評価に依拠すべき。
