TLDR Claude Fable 5.1 は主としてエージェント的実行のアップグレードです。最大の伸びは科学研究、ビジネス自動化、ターミナル・コーディングなど、計画、ツール使用、検証、復旧を多段で要するワークフローに見られます。閉じた設問型の推論や短い IDE スタイルのコーディング課題での改善は小さく、単一の見出しスコアではなくワークロードに応じて最適な導入判断が変わります。
Key Takeaways
- Fable 5.1 は Anthropic の評価で Terminal-Bench-Science 0.1 にて 52.6% を記録。Fable 5 の 24.7% の2倍超。
- AutomationBench は 17.1% から 31.4% に上昇し、エンドツーエンドのビジネス・ワークフローで大幅な改善。
- CursorBench やツール併用の Humanity's Last Exam での伸びは控えめで、すべての推論が等しく伸びたというより、持続的な実行の改善が大きいことを示唆。
- Fable 5.1 は Fable 5 と同じ標準トークン価格を維持する一方、キャッシュ読み取りの低価格化によりコンテキスト重視のエージェント・ワークフローの実効コストを低減。
- GPT-6 Astra は現在の OpenAI 側の比較対象だが、Anthropic の 9 月 1 日のベンチマーク表には含まれていない。直接比較には同一ハーネスでの制御評価が必要。
Anthropic は 2026 年 9 月 1 日に Claude Fable 5.1 をリリースしました。高難度の推論、長期的(ロングホライズン)エージェント、ソフトウェア工学、研究、プロフェッショナルな知識労働向けです。Claude Fable 5.1 は CometAPI でも提供され、統一エンドポイントで他の最先端モデルと並行評価したい開発者が利用できます。
見出しの結果は強力ですが、平均値よりも改善の分布が示唆的です。Fable 5.1 は、エージェントが目標を維持し、ツールと対話し、エラーから復旧し、最終状態を検証する必要がある場合に最も伸びます。本稿ではベンチマーク結果の意味、まだ弱い部分、そして新しい代替モデルに対する評価方法に焦点を当てます。
Claude Fable 5.1 at a Glance
Anthropic のモデルドキュメントでは、100万トークンのコンテキストウィンドウ、最大 128K 出力、テキストと画像の入力、常時オンのアダプティブ思考、そして 2026 年 6 月の知識カットオフが明記されています。Claude API のモデル ID は claude-fable-5-1 です。
| Official specification | Claude Fable 5.1 |
|---|---|
| Provider | Anthropic |
| Release date | September 1, 2026 |
| Model ID | claude-fable-5-1 |
| Context window | 1,000,000 tokens |
| Maximum output | 128,000 tokens |
| Input / output | Text and images → text |
| Thinking | Adaptive, always on |
| Default effort | High |
| Knowledge cutoff | June 2026 |
| Anthropic input price | $10 / MTok |
| Anthropic output price | $50 / MTok |
| Cache read | $0.25 / MTok |
| Comparative latency | Slower |
| Primary positioning | Demanding reasoning and long-horizon agentic work |
標準の入力・出力価格は Fable 5 と同じですが、キャッシュ読み取りは百万トークンあたり $0.25 に低下しました。入力/出力トークンの見出し価格は低くなっていません。実効コスト低減は主にキャッシュ読み取り料金の 75% 引き下げによります。Anthropic は、典型的なワークロードで約 25%、高度にエージェント的なワークロードでは約 45% のコスト低減を見積もっています。
これは、長時間走るエージェントがリポジトリのコンテキスト、指示、ツール定義、過去状態を繰り返し再利用するためです。見出しの入力/出力価格が変わらなくても、タスク完了あたりのコストは改善し得ます。
Anthropic は Claude Mythos 5.1 の Terminal-Bench 4.0 のスコアとして 60.9% も報告しています。Mythos 5.1 は別配備版であり、セーフガードが異なるため、一般提供の Fable 5.1 のスコアと同一視すべきではありません。
What Do Claude Fable 5.1 Benchmarks Show?
以下の値は Anthropic の 2026 年 9 月の評価に基づきます。これはモデルとハーネスの特定構成を記述するもので、モデルの不変の特性ではありません。
| Benchmark | What it measures | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | エージェント的な科学研究 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | エージェント的ターミナル・コーディング | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | プロフェッショナル知識労働(Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | 長期的なコンピュータ操作(部分評価) | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | 完全完了したコンピュータタスク | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | ツール未使用の専門的多分野推論 | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | ツール使用の専門的推論 | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | エンドツーエンドのビジネス・ワークフロー | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | エージェント的 IDE コーディング | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 は、報告された 9 行すべてで Fable 5 と Opus 5 を上回ります。世代間で最も大きな伸びは、科学研究、ビジネス・ワークフロー自動化、ターミナル・コーディングに見られます。一方で、Humanity's Last Exam や CursorBench での差は小さく、改善がすべてのワークロードで均一ではないことを示します。
Where Does Claude Fable 5.1 Improve the Most?
Terminal-Bench-Science 0.1: 際立った結果
Fable 5.1 は 52.6% を記録し、Claude Fable 5 の 24.7%、Claude Opus 5 の 29.0%、Anthropic の実行での GPT-5.6 Sol の 22.4% を上回ります。27.9 ポイントという大幅な世代差は、モデルごとの標準誤差の報告値よりも明確に大きい一方で、例えば Terminal-Bench 4.0 における Fable 5.1 と Opus 5 の 3.5 ポイント差のような小差は慎重に解釈すべきです。
Terminal-Bench-Science は科学・工学領域での完全な研究ワークフローを評価します。エージェントは孤立した設問に答えるのではなく、コード、分析、証明、シミュレーション、データ生成物を作る必要があります。Anthropic はモデルごとの標準誤差を概ね ±3.5–4.5 ポイントと報告しており、小差が能力差を意味するとは限りません。
Terminal-Bench 4.0: より強い自律コーディング
Fable 5.1 は 55.8% に到達し、Fable 5 の 42.0%、Opus 5 の 52.3%、GPT-5.6 Sol の 37.3% を上回ります。Fable 5 に対する 13.8 ポイントの改善は大きい一方、Opus 5 に対する 3.5 ポイントの優位は相対的に小さいといえます。
このベンチマークはエージェントを実行環境に置くため、環境のナビゲーション、コードの変更、結果検証の能力が成否を左右します。Terminal-Bench 4.0 は以前の版とは異なる課題セットを用いるため、同一ベンチマーク版内でのみ比較すべきです。
AutomationBench: 大幅な伸びと残る余地
AutomationBench は Fable 5 の 17.1% から Fable 5.1 の 31.4% に上昇しました。これは絶対値で 14.3 ポイント、相対で約 84% の増加です。
このベンチマークは、最終的な環境状態を検査することで、営業、マーケティング、オペレーション、サポート、財務、人事にわたるワークフローを評価します。つまり、エージェントが提案だけでなく実際にワークフローを完了したかを測る有用な指標です。同時に、報告構成下では約 3 分の 2 のタスクが未完了であったという制約も明らかにします。
CursorBench 3.2.0: 小さめのコーディング改善
Fable 5.1 は 73.4%、Fable 5 は 70.5%、Opus 5 は 70.0%、GPT-5.6 Sol は 67.2% です。Fable 5 に対する伸びは 2.9 ポイントにとどまります。
したがって、このリリースは、計画・実行・検証・復旧を伴う長いワークフローに比べ、短い IDE スタイルのコーディング課題では変革的とは言い難い印象です。評価スイートは、コード生成品質だけでなく、リポジトリ規模の変更や失敗テストからの復旧を含むべきです。
OSWorld 2.0: コンピュータ操作は依然難しい
Fable 5.1 は部分評価で 77.9%、厳格完了で 41.7% を記録。Opus 5 は 75.4% と 39.6%、Fable 5 は 72.9% と 36.1% でした。
本番に近いシグナルとしては厳格完了の方が示唆的です。半数未満のタスクしか完全には完了しておらず、コンピュータ操作での進歩があってもチェックポイント、許可、モニタリング、復旧ロジックの必要性は依然として残ります。
CursorBench と Humanity's Last Exam: 小さな伸び
Fable 5.1 は CursorBench 3.2.0 で 73.4% と、Fable 5 に対して 2.9 ポイント上昇。Humanity's Last Exam では、ツール未使用で 3.1 ポイント、ツール使用で 1.2 ポイントの伸びにとどまります。
これらの小差は、中心的な解釈を裏付けます。すなわち、Fable 5.1 は、計画・実行・検証・復旧を伴う長いワークフローにおいてより変革的であり、短い IDE タスクや閉じた学術推論ではそうではない、ということです。
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
短い結論: Fable 5.1 は、Anthropic が公開した長期ワークフローベンチマーク表において最有力。性能差が受容可能ならコスト面で Opus 5 が出発点として有利。Fable 5 はレガシー基準。GPT-6 Astra は同一ハーネスでの比較がない限り直接順位付け不可。
Fable 5.1 は、Anthropic が報告する長期エージェント系ベンチマークで Fable 5 に対する明確な世代アップグレードです。GPT-6 Astra は OpenAI のより新しい比較対象ですが、Anthropic の 9 月 1 日の評価には含まれておらず、同一ハーネスでの比較が必要です。
| Dimension | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Context window | 1M tokens | 1M tokens | 1.05M tokens |
| Maximum output | 128K | 128K | 128K |
| Standard input / output | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Cache read | $0.25 / MTok | $1 / MTok | Verify current provider terms |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Not included in Anthropic’s launch table |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Not included in Anthropic’s launch table |
| AutomationBench | 31.4% | 17.1% | Not included in Anthropic’s launch table |
| Primary positioning | Demanding reasoning and long-horizon agents | Previous Fable-class baseline | Difficult end-to-end professional work |
Fable 5 に対して、Fable 5.1 は科学研究、ビジネス自動化、ターミナル・コーディングで最大の測定上の伸びを示しつつ、標準トークン価格は据え置きです。キャッシュ読み取りの低価格化は、繰り返しコンテキストを利用するエージェントの経済性をさらに高めます。
選定ルール: コストを優先するなら Opus 5 から開始。長期的な完了と復旧が最重要なら Fable 5.1 へ拡張。互換性重視のワークロードでは Fable 5 を継続。GPT-6 Astra は本番採用前に同一ハーネスの制御テストで評価。
What Does Benchmark Performance Look Like by Workload?
| Capability | Fable 5.1 result | Change vs Fable 5 | Interpretation |
|---|---|---|---|
| エージェント的科学研究 | 52.6% | +27.9 pts | 非常に大きな伸び |
| ビジネス・ワークフロー自動化 | 31.4% | +14.3 pts | 非常に大きな伸び |
| ターミナル・コーディング | 55.8% | +13.8 pts | 大きな伸び |
| コンピュータ操作(厳格) | 41.7% | +5.6 pts | 中程度の伸び |
| コンピュータ操作(部分) | 77.9% | +5.0 pts | 中程度の伸び |
| 専門的推論(ツールなし) | 60.9% | +3.1 pts | 小さな伸び |
| IDE エージェント・コーディング | 73.4% | +2.9 pts | 小さな伸び |
| 専門的推論(ツールあり) | 65.0% | +1.2 pts | 小さな伸び |
| プロフェッショナル知識労働 | 1853 Elo | +130 Elo | 強力だが構成依存 |
パターンは一貫しています。すなわち、持久力、計画、環境との相互作用、ツール使用、時間をかけた復旧が成否を分ける場合に、改善が最大になります。
What Do the Benchmarks Not Tell You?
ベンチマーク表は挙動を単一の数値に圧縮します。自律エージェントが解決されたことの証明にはならず、すべての本番ワークロードを予測するものでもありません。
- 主要比較表はベンダー実行です。
- Effort 設定は品質、レイテンシ、コストに影響します。
- エージェント・ベンチマークはモデル、ハーネス、ツール、許可の合成を測ります。
- Fable 5.1 では本番用セーフガードが有効で、結果に影響しました。
- ベンチマーク版は変わるため、異なる課題リリースの値は互換でない可能性があります。
- AutomationBench は 31.4%、OSWorld の厳格完了は 41.7% に留まり、相当な失敗率が残っています。
実務的な評価では、公表スコアで候補を絞り、同一設定で小規模な再現比較を行い、その後に実際の本番ワークフローでテストするのが望ましいでしょう。
Is Claude Fable 5.1 the best Claude model?
困難な長時間の業務における最大能力という観点では、Claude Fable 5.1 を推すベンチマーク証拠は強いといえます。ただし、すべてのワークロードで最適とは限りません。
Anthropic は、Fable 5.1 を百万入力トークンあたり $10、百万出力トークンあたり $50 に価格設定しています(Opus 5 は $5 と $25)。プレミアムは、Fable 5.1 が成功率の向上、再試行の削減、受理タスクあたりのトークン削減、または十分な人間のレビュー時間短縮をもたらす場合にのみ正当化されます。
キャッシュ読み取りの低価格化は、エージェントにおける実効コスト差を縮小し得ます。受理結果あたりのコストは、トークン単価だけよりも有用な指標です。
How Should You Benchmark Claude Fable 5.1?
評価は想定する本番ワークロードに近づけるべきです。
- コーディング: 完全な課題でテストし、パッチ採用率、通過テスト数、再試行回数、ツール呼び出し、経過時間、人間による修正時間を記録。
- 研究: ソース品質、事実精度、エビデンス網羅、サブタスク完了、長時間実行での目標保持を評価。
- ビジネス・エージェント: 個々の正しい行動数ではなく、最終的な環境状態で採点。
- コンピュータ操作: ポップアップ、遅いページ、中断セッション、不整合なアプリ状態からの復旧を測定。
- モデル比較: プロンプト、ハーネス、ツール、許可、Effort 設定、採点規則を一定に維持。
- 経済性: トークン単価だけでなく、受理タスクあたりのコストを測定。
Conclusion
ベンチマークの証拠は、Fable 5.1 が単発の応答ではなく持続的な実行を要するタスクで最も価値を発揮することを示しています。最も強い用途は、科学研究、自律コーディング、複雑なビジネス自動化、繰り返しの検証と復旧を伴うワークフローです。
普遍的な優位性を示すものではありません。いくつかのベンチマークでの差が小さいこと、厳格なコンピュータ操作タスクで意味のある失敗率が残ること、Anthropic の発表表に GPT-6 Astra が含まれていないことは、ワークロード固有のテストの必要性を裏付けます。
CometAPI ユーザーにとっての実務的な導入ルールは、ロングホライズンでの成功がプレミアム推論を正当化し得る場面で Fable 5.1 を試し、その後 Opus 5、GPT-5.6 Sol、GPT-6 Astra と同じ代表的タスクで比較してから本番ルートを選ぶことです。
FAQs
Claude Fable 5.1 の最高ベンチマークスコアは?
Anthropic が報告したパーセンテージ指標の中では、Fable 5.1 は OSWorld 2.0 の部分評価で 77.9%、CursorBench 3.2.0 で 73.4% を記録しました。最大の世代間改善は Terminal-Bench-Science で、Fable 5 の 24.7% に対して 52.6% です。
Claude Fable 5.1 は Fable 5 よりどのくらい優れている?
ワークロードごとの差が大きく異なります。Terminal-Bench-Science で 27.9 ポイント、AutomationBench で 14.3、Terminal-Bench 4.0 で 13.8。一方、CursorBench では 2.9、ツール併用の Humanity’s Last Exam では 1.2 にとどまります。
Claude Fable 5.1 は Claude Opus 5 より優れている?
報告表では全項目で上回っていますが、多くの差は小さいです。Anthropic は、まず Opus 5 から始め、より長期能力が必要になった段階でエスカレートすることを推奨しています。
Claude Fable 5.1 は GPT-5.6 Sol を上回る?
Anthropic は共有された 5 つの指標で Fable 5.1 の方が高いと報告しています。ただし、これはベンダー実行の他社評価であり構成も異なるため、安全な結論は「Fable 5.1 は非常に競争力がある」のであって「常に優れている」ではありません。
結果は独立検証されている?
一部のみです。いくつかのベンチマークには公開リーダーボードがありますが、Effort、ハーネス、フォールバック挙動、タスク版を揃えなければ、Anthropic のローンチ時実行と直接比較はできません。
Claude Fable 5.1 は何に最適?
長時間にわたる科学研究、自律コーディング、複雑なエージェント・ワークフロー、ビジネス自動化、計画・ツール・検証・復旧を要するタスクで最も強みを示します。
Claude Fable 5.1 へのアクセス方法は?
Claude Fable 5.1 は CometAPI に掲載されており、モデル ID は claude-fable-5-1 です。統一エンドポイントにより、本番前に同一の評価ワークロードを複数モデルに対して実行することが容易になります。
