Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-comparisons/CometAPIリサーチ

Grok 4.7 対 Claude Fable 5.1:ベンチマーク、料金、コーディング、エージェント、API の比較

Grok 4.7 と Claude Fable 5.1 を、ベンチマーク、コーディング、AI エージェント、コンテキストウィンドウ、API 料金、ツール、CometAPI アクセスの観点から比較してください。

CometAPI
Deon GoodwinAIモデルとAPIの調査チーム
更新日 Oct 8, 2026 6 分読み
Grok 4.7 対 Claude Fable 5.1:ベンチマーク、料金、コーディング、エージェント、API の比較
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Grok 4.7 と Claude Fable 5.1 は同じフロンティアモデル層で競合するものの、展開時の経済性最適化は異なる。Grok 4.7 はコーディング、エージェント作業、価格対性能に焦点を当て、500K トークンのコンテキストウィンドウを持ち、公式価格は入力 $2/M、出力 $6/M から。Claude Fable 5.1 はコンテキスト容量を 1M トークンへ倍増し、高度な推論と長期のエージェント作業向けに設計され、入力 $10/M、出力 $50/M。

ベンチマークの結果は一方的ではなく混在している。xAI の公式ローンチ評価 では CursorBench 4.0 と Terminal-Bench 4.0 で Fable 5.1 が上回り、DeepSWE v1.1、EEBench、Harvey Legal Agent Benchmark では Grok 4.7 がリードしている。実運用では、普遍的な勝者を選ぶよりも、受理率あたりのコスト、タスク時間、コンテキスト要件、ツール利用、リトライ挙動が重要になる。

Key Takeaways

  • Grok 4.7 は高コンテキスト料金閾値未満で入力 $2/M、出力 $6/M。キャッシュ済み入力は $0.50/M。
  • Claude Fable 5.1 は入力 $10/M、出力 $50/M、キャッシュ読み取りは $0.25/M。
  • Claude Fable 5.1 は 1M トークンのコンテキストウィンドウ、Grok 4.7 は 500K トークン。
  • ベンチマークの優位性はタスク依存:Fable 5.1 は長期コーディング系で優位、Grok 4.7 は xAI 比較で特定のエンジニアリングやドメインエージェントで優位。
  • 生産で最も有用な指標は、単独の 1M トークンあたり価格ではなく、成功タスクあたりのコスト。

What Are Grok 4.7 and Claude Fable 5.1?

Grok 4.7 Overview

Grok 4.7 は xAI のフロンティアモデルで、コーディング、エージェント作業、ナレッジワーク向けに 2026 年 9 月 21 日にリリース。xAI によれば、Grok 4.6 より大きい新しいベースモデルと、数時間かかるタスクに重み付けした長い強化学習を使用。リリースでは自己検証と長コンテキスト管理の改善も強調されている。

公式開発者ドキュメントは、モデル ID grok-4.7、500,000 トークンのコンテキストウィンドウ、テキストと画像入力、テキスト出力、Low/Medium/High/xhigh の 4 段階推論レベル、関数呼び出し、Web 検索、X 検索、コード実行といったツールを明記。

Grok 4.7 対 Claude Fable 5.1:ベンチマーク、料金、コーディング、エージェント、API の比較

Grok 4.7 公式ローンチビジュアル - SpaceXAI

Claude Fable 5.1 Overview

Claude Fable 5.1 は 2026 年 9 月 1 日にリリース。Anthropic は、要求の高い推論、長時間のコーディング、マルチステップのリサーチ、ドキュメント中心のプロフェッショナル業務、長時間のセッションでも動き続けるエージェント向けに位置づけている。

モデルドキュメントは、1M トークンのコンテキストウィンドウ、最大 128K 出力トークン、テキストと画像入力、アダプティブ思考、2026 年 6 月の信頼できる知識カットオフを明記。

Grok 4.7 対 Claude Fable 5.1:ベンチマーク、料金、コーディング、エージェント、API の比較

Claude Fable 5.1 公式ローンチビジュアル - Anthropic

Grok 4.7 vs Claude Fable 5.1 at a Glance

仕様Grok 4.7Claude Fable 5.1
リリース日September 21, 2026September 1, 2026
提供元xAI / SpaceXAIAnthropic
モデルIDgrok-4.7claude-fable-5-1
主な位置づけコーディング、エージェント、ナレッジワーク高難度の推論と長期運用のエージェント
コンテキストウィンドウ500K tokens1M tokens
最大出力固定のテキスト出力上限は未記載Up to 128K tokens
入力モダリティText + imageText + image
出力TextText
知識カットオフMay 2026June 2026
推論Low / Medium / High / xhighAdaptive thinking + effort controls
Web/検索ツールWeb search + X searchEnvironment/tool dependent
関数/ツール呼び出しYesYes
モデル重みClosedClosed
CursorBench 4.0 コーディング性能46.3%51.8%
DeepSWE v1.1 エージェント性能71.0% (high effort)70.0%
Terminal-Bench 4.0 エージェント性能38.0%57.9%
代表的ユースケースコスト重視のコーディングと Web/X 連携エージェント長期コーディングと失敗に敏感なプロフェッショナル業務

最大の構造的差異はコンテキスト容量とトークン経済性。Grok 4.7 の公式 API ドキュメント は 500K コンテキストと $2/$6 のベース価格を確認し、Anthropic の Fable 5.1 ドキュメント は 1M コンテキストと $10/$50 のベース価格を確認している。

Head-to-Head Benchmark Results

現時点でもっともクリーンな直接比較は、xAI の Grok 4.7 ローンチ・ベンチマーク表で、両モデルが同じ公開評価で報告されている。

以下の数値はベンダー報告であり、独自再現ではない。xAI の公開表では、Grok 4.7 は xhigh エフォート、Claude Fable 5.1 は max エフォートで評価され、別途 Grok 4.7 の DeepSWE 結果は high エフォートと注記されている。ワークロードの傾向把握に用い、その後は自分たちのプロンプト、ツール、リポジトリ、受入基準で両モデルを検証すべき。

ベンチマークGrok 4.7Claude Fable 5.1観測差
CursorBench 4.046.3%51.8%Fable +5.5 pts
DeepSWE v1.171.0%*70.0%Grok +1.0 pt
AA Briefcase v1.11,6571,678Fable +21
Terminal-Bench 4.038.0%57.9%Fable +19.9 pts
Harvey Legal Agent Benchmark19.6%6.7%Grok +12.9 pts
HealthBench Professional56.7%62.1%Fable +5.4 pts
EEBench64.0%56.4%Grok +7.6 pts

* xAI は Grok 4.7 の DeepSWE 結果を high エフォートと注記。より広い見立ては普遍的な序列ではなくタスク特化:Fable は複数の長期コーディングやプロフェッショナル系で強く、Grok は同一ベンダー表の一部エンジニアリングやドメインエージェントで強い。

Professional Knowledge Work

xAI のヘッド・トゥ・ヘッド表では、Fable 5.1 は AA Briefcase v1.1 でわずかにリードし、Grok 4.7 は EEBench と Harvey Legal Agent Benchmark でリード。Fable 5.1 は HealthBench Professional でリード。分割は単純な点を補強する:ナレッジワークは単一の能力ではない。エンジニアリング、医療、法務、金融、リサーチ、オフィス自動化は異なるツールと推論要件を課す。

Coding Performance

コーディングは最もニュアンスのある比較領域。CursorBench 4.0 では Fable 5.1 が 51.8%、Grok 4.7 は 46.3%。DeepSWE v1.1 では Grok 4.7 が 71.0%、Fable 5.1 は 70.0%。最大の差は Terminal-Bench 4.0 に見られ、Fable 5.1 は 57.9%、Grok 4.7 は 38.0%。

コーディングの側面Grok 4.7Claude Fable 5.1
リポジトリエンジニアリング非常に強い非常に強い
DeepSWExAI 表では僅差でリードほぼ同等
CursorBench 4.046.3%51.8%
ターミナル自律性強い主要な強み
長コンテキストのコード作業500K コンテキスト1M コンテキスト
繰り返し呼び出し時のコストかなり低いプレミアム
xAI ネイティブのコード実行対応Claude の環境/ツールに依存
長時間の無人実行明示的な学習重点コアな製品ポジショニング

配備上の含意として、Fable 5.1 はターミナル重視・長時間のコーディングエージェントで注目に値し、Grok 4.7 はソフトウェアエンジニアリング品質が十分でトークンコストが単位経済に大きく効く場面で魅力的。

Agentic Workflows

両モデルとも、単発のプロンプト応答ではなくエージェント型ワークフロー向けに設計。xAI は Grok 4.7 がより困難な長時間タスクと自己検証を強化したと述べ、Anthropic は Fable 5.1 を、数時間動作し多くのアプリに跨る作業向けのモデルとする。

エージェント要件Grok 4.7Claude Fable 5.1
長時間の推論強い非常に強い
コンテキスト容量500K1M
自己検証明示的な学習重点明示的な長期志向
ツール利用強い強い
検索ネイティブなワークフローWeb + X 検索環境依存
長期の繰り返しコンテキストプロンプトキャッシュ + 圧縮1M コンテキスト + 低コストのキャッシュ読み取り
素のトークンコスト低い高い

Pricing and Deployment Economics

公式ベース価格Grok 4.7Claude Fable 5.1
入力 / 1M トークン$2$10
キャッシュ済み入力 / 読み取り$0.50 below 200K prompt$0.25
出力 / 1M トークン$6$50
10M 入力トークン$20$100
10M 出力トークン$60$500
米国地域エンドポイント上乗せ+10%Platform dependent

標準の未キャッシュ・トークン料金では、Grok 4.7 の入力価格は Fable 5.1 より 80% 低く、出力価格は 88% 低い。ただし、Anthropic のキャッシュ読み取り料金は、繰り返しの多いエージェント型ワークロードで Fable 5.1 の実効コストを大きく下げうる。

価格に関する注記: Grok 4.7 の $2/M 入力と $6/M 出力はベースレート。SpaceXAI は 200K コンテキストを超えるリクエストに別の高コンテキスト料金を文書化している。以下の計算は、リクエストがベース料金層内に収まり、ツール料金、地域上乗せ、キャッシュ書き込みコストを除外する前提。

例のワークロード: 10M 入力トークン + 2M 出力トークン。

  • Grok 4.7: $20 入力 + $12 出力 = $32。
  • Claude Fable 5.1: $100 入力 + $100 出力 = $200。
  • キャッシュ影響前の名目差: $168。

より良いプロダクション指標は「成功したタスクあたりのコスト」。 高価なモデルでも、リトライ、失敗、人手修正を減らせば経済的になりうる。逆に、安価なモデルは両者が同じ合格基準を満たすなら優位に立てる。

Context and Reasoning Controls

Fable 5.1 は 1M トークンのコンテキストウィンドウを提供し、Grok 4.7 は 500K トークン。この差は、非常に大きなリポジトリ、ドキュメントセット、法務ディスカバリー、科学研究、長い履歴を保持するエージェントで重要になりうる。

Grok 4.7 は Low、Medium、High、xhigh の推論設定を公開。Fable 5.1 はエフォートコントロール付きのアダプティブ思考を採用。ラベルは直接比較可能ではないため、公平なテストでは設定名を合わせるのではなく、タスクと受入基準を一定にすべき。

Multimodal and Tool Capabilities

両モデルともテキストと画像を受け付ける。Grok 4.7 の API は関数呼び出し、Web 検索、X 検索、コード実行を含む。Claude Fable 5.1 はドキュメント、スプレッドシート、スライド、リサーチ、長時間のエージェント・ワークフローに最適化され、ツール挙動は Claude の環境やアプリケーションスタックに依存。

機能Grok 4.7Claude Fable 5.1
テキスト入力YesYes
画像入力YesYes
関数/ツール呼び出しYesYes
Web 検索xAI ネイティブのツール環境依存
X 検索ネイティブ同等の専用 X 連携はなし
コード実行xAI ネイティブのツール環境依存
ドキュメント/スプレッドシート/スライド一般的なナレッジワーク志向明確な製品フォーカス

Decision Summary

観点Grok 4.7Claude Fable 5.1
コーディング品質最先端最先端
CursorBench 4.046.3%51.8%
DeepSWE v1.171.0%*70.0%
Terminal-Bench 4.038.0%57.9%
EEBench64.0%56.4%
Harvey Legal Agent19.6%6.7%
HealthBench Professional56.7%62.1%
コンテキスト500K1M
入力価格$2/M$10/M
出力価格$6/M$50/M
検索Web + Xツール/環境依存
長時間エージェント強い主要な強み
価格性能比大きな優位プレミアム機能層
代表的適合領域規模重視のフロンティア・ワークロード長期価値の高い長期タスク

Can You Use Grok 4.7 and Claude Fable 5.1 Through CometAPI?

はい。CometAPI の Grok 4.7 API と CometAPI の Claude Fable 5.1 API は、マルチモデル・ルーティング戦略の一部として利用可能。最適な本番アーキテクチャは、単一のフロンティアモデルだけを選ばない場合があるため重要。

実用的なルーティングパターン:

  • デフォルトルート: コスト重視のフロンティアタスクには Grok 4.7。
  • エスカレーションルート: 評価に失敗、コンテキスト要件超過、または長時間のエージェントでより強いターミナル実行が必要な場合に Claude Fable 5.1。

これにより、公開リーダーボードではなく、受理率、総トークン、レイテンシ、リトライ、成功タスクあたりコストを比較できる。

Grok 4.7 vs Claude Fable 5.1: How to choose

コスト重視・検索ネイティブなワークロードには Grok 4.7

  • トークンコストが単位経済に大きく影響する高ボリュームのコーディングアシスタント。
  • Grok のドメイン結果がワークロードと整合するエンジニアリングや技術系エージェント。
  • ネイティブな Web および X 検索の恩恵があるリサーチ。
  • バッチのナレッジ処理や繰り返しのバックグラウンド自動化。
  • 両モデルが同じ受入閾値を通過し、コストが決定要因となるワークロード。

マルチモデル・ゲートウェイを利用する開発者向けに、CometAPI の Grok 4.7 API は、単一の統合レイヤーで他のフロンティアモデルと並行評価できる。

長期/失敗コスト重視のワークロードには Claude Fable 5.1

  • 数時間の自律コーディングやターミナル重視のワークフロー。
  • 1M トークンのコンテキストウィンドウが有利な非常に大きなリポジトリやドキュメントセット。
  • 多数ステップにわたり状態を維持する必要がある高度なプロフェッショナル・エージェント。
  • リトライや失敗コストが生のトークンコストを上回る高価値ビジネスワークフロー。
  • Anthropic の長期エージェント系ベンチが実運用ニーズに近いリサーチや自動化。

CometAPI の Claude Fable 5.1 API はモデル ID claude-fable-5-1 を使用。ゲートウェイ料金は Anthropic のリスト価格と独立して変動しうるため、デプロイ時に価格とルーティングを確認すべき。

Conclusion

トークンコスト、Web/X 連携ツール、規模重視のエージェント・ワークフローが意思決定を支配する場合、Grok 4.7 は優れた出発点。1M トークンのコンテキストウィンドウ、要求の高い長時間のコーディングやプロフェッショナル業務がベースのトークン価格より重要な場合、Claude Fable 5.1 が有力候補。ベンダー報告のベンチ結果は混在しており、普遍的な勝者はいない。

選択前に、同じ本番タスク、ツール、時間予算、受入基準で両者をテスト。公開スコアに加え、受理率あたりコスト、レイテンシ、リトライ、ツール失敗、人手修正時間を比較すること。

FAQ

チームは Grok 4.7 と Claude Fable 5.1 をどのように公平に評価すべき?

汎用リーダーボードではなく、本番代表タスクから始める。同じリポジトリ状態、ツール権限、時間予算、受入基準を両モデルで統一。受理率、エンドツーエンドのレイテンシ、入力/出力トークン、キャッシュ挙動、ツール失敗、リトライ、人手修正時間を記録。タスクばらつきとモデル挙動を分離できるだけの反復を行う。

どのような場合に、Grok 4.7 の受理タスクあたりコストが Claude Fable 5.1 より高くなる?

低いトークンレートでも、リトライ増、プロンプトの肥大化、ツール呼び出しの失敗、人手レビュー増を招くと高くなる。一方、プレミアムモデルも自動的に経済的ではない。その高い完了率が追加の推論コストを相殺する必要がある。トークン単価ではなく、受理タスクあたりコストを比較すべき。

ルーターはいつ Grok 4.7 から Claude Fable 5.1 にエスカレートすべき?

測定可能なトリガーを用いる。コスト重視のデフォルトルートは検証を素早く通過するタスクを処理し、エスカレーションはタスクが好ましいコンテキスト範囲を超える、自動評価に失敗する、長いターミナル実行が必要、または高い誤りコストを伴う場合に発火。トリガーと結果をログし、本番の証拠でルーティング方針を調整できるようにする。

Grok 4.7 vs Claude Fable 5.1 のベンチマークで最重要の注意点は?

ベンチマークのバージョン、推論エフォート、エージェントハーネス、ツールアクセス、セーフガード、そして結果がベンダー報告か独自再現か。例えば、CursorBench 3.2.0 と 4.0 は同一テストではないのに同列比較されるべきでない。公開スコアは仮説形成には有用だが、導入判断は統制された内部評価に依拠すべき。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Oct 8, 2026
最終更新 Oct 8, 2026
0 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

もっと読む