GPT-6 Astra と Claude Fable 5.1 はわずか2日差で登場しました。Astraは9月3日にローンチ、Fable 5.1は9月1日にローンチ。登場時期は近いものの、最も重要な差はベンチマークの形、ツール実行、そしてキャッシュの経済性に現れます。
類似性はワークロードが始まると途切れます。OpenAIのローンチ評価では、Astraが複数のコーディング、科学、コンピュータ使用、プロフェッショナル業務のテストで優位に立ち、一方でAnthropicの公開ベンチマークでは、Fable 5.1が Humanity’s Last Exam でリードしています。さらにFable 5.1は公式のキャッシュ読み取り価格が低く、長時間稼働するエージェントの経済性を実質的に変え得ます。
したがって、有用な問いは単にどちらのモデルがベンチマークスコアで高いかではありません。実務的な問いは「あなたのワークロードを、より確実かつ経済的に完了するのはどちらか」です。
短い回答: Astraは実行中心のエージェント、コーディング、コンピュータ使用、ツール駆動の科学ワークフローでより強力なデフォルトです。Fable 5.1は広範で困難な推論、長時間の非同期作業、そして非常に大きなキャッシュ済みコンテキストを繰り返し再利用するアプリケーションで特に魅力的です。
GPT-6 Astra と Claude Fable 5.1 の概要比較
| Specification | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Developer | OpenAI | Anthropic |
| Release date | 2026年9月3日 | 2026年9月1日 |
| API model ID | gpt-6-astra | claude-fable-5-1 |
| Context window | 1,050,000 tokens | 1,000,000 tokens |
| Maximum output | 128,000 tokens | 128,000 tokens |
| Input modalities | Text, images | Text, images |
| Output modality | Text | Text |
| Knowledge cutoff | 2026年4月30日 | 2026年6月 |
| Reasoning | low / medium / high / xhigh / max | Adaptive, always on |
| Default effort | — | high |
| Official input / output | $10 / $50 per MTok | $10 / $50 per MTok |
| Official cache read | $1 / MTok | $0.25 / MTok |
| Long-context pricing | 入力272K超で上位料金適用 | 1Mコンテキスト範囲で標準レート |
| Primary positioning | エンドツーエンド実行、コーディング、PC操作 | 高度推論、長期視点エージェント |
情報と価格は2026年9月7日に検証済み。提供者の仕様と価格は掲載後に変更される可能性があります。
出典: OpenAI公式ベンチマーク
GPT-6 Astra とは?
OpenAIは2026年9月3日に、難易度の高いエンドツーエンドのプロフェッショナル業務に最も適したモデルとして GPT-6 Astra を発表しました。単独のQAに焦点を当てるのではなく、Astraは推論、コーディング、リサーチ、コンピュータ操作、ドキュメント作成を組み合わせた複雑なワークフローを完了するよう設計されています。複数ステップにわたり、提供されたツールやコンテキストを使い、ユーザーが要件を修正したりタスク途中で方向転換しても適応できます。OpenAIのリリースノートは、特定の指示やテンプレートに従うドキュメント、スプレッドシート、プレゼンテーションの作成などの用途を強調しています。
このモデルは1,050,000トークンのコンテキストウィンドウと最大128,000トークンの出力を提供し、大規模なコードベース、広範な文書コレクション、または長く続くエージェント履歴を単一のワークフローで処理できます。推論エフォートは low、medium、high、xhigh、max に設定可能で、タスク難易度に応じて応答速度と計算の深さのバランスを取れます。
Claude Fable 5.1 とは?
Anthropic は2026年9月1日に、要求の厳しい推論と長期のエージェント的作業向けの最上位モデルとして Claude Fable 5.1 をリリースしました。これは Claude Fable 5 を基盤に、長時間のコーディングタスク、マルチステップのリサーチ、ドキュメント・スプレッドシート・プレゼンテーションの作成や分析における改善を加えています。Anthropic は、推論の持続性や確実な実行が生の応答速度より重要なワークロード、特に高いエフォート設定の Claude Opus 5 でも性能が十分でない場合に推奨しています。
公式の Claude Fable 5.1 仕様によると、このモデルは100万トークンのコンテキストウィンドウと最大128,000トークンの出力を備えています。これにより、大規模なリポジトリ、長大な業務記録、研究コレクション、または拡張されたエージェントの軌跡を、リクエストを細分化しすぎずに検査できる容量を持ちます。入力はテキストと画像、出力はテキストで、知識カットオフは2026年6月です。

ベンチマーク比較: Astraは多くの行で勝つが、重要なすべてではない
競合ベンダー間のベンチマーク比較は、世代間比較より慎重さが必要です。OpenAIはFable 5.1を複数のAstraローンチ評価でテストし、一方でAnthropicは独自のハーネスを用い、場合によってはより新しいタスクリリースを使っています。したがって、最もクリーンな比較は、定義と報告設定が十分に揃って直接の意思決定を支えられるテストです。
GPT-6 Astra vs Claude Fable 5.1 :which is better for Coding and Agentic Software
コーディングはAstraの最も明確な強みの一つです。OpenAIの公開ローンチ表では、Astraは Terminal-Bench 4.0 で57.9%対55.8%、DeepSWE v1.1 で74.1%対67.4%、内部のデータベース移行評価で63.9%対57.8%を記録しています。
| Coding benchmark | GPT-6 Astra | Claude Fable 5.1 | Result |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 55.8% | Astra +2.1ポイント |
| DeepSWE v1.1 | 74.1% | 67.4% | Astra +6.7ポイント |
| FrontierCode 1.1 Extended | 64.5% | 63.6% | Astra +0.9ポイント |
| FrontierCode 1.1 Main | 53.3% | 50.9% | Astra +2.4ポイント |
| Database migration, internal | 63.9% | 57.8% | Astra +6.1ポイント |
Astraは実行中心モデルにおける実質的なブレークスルーを示しています。公開結果は Terminal-Bench 4.0、DeepSWE v1.1、データベース移行評価でFable 5.1を上回り、コードがツールを跨いで実行・テスト・検証される必要がある場面での優位性を裏付けます。
結論はFable 5.1がコーディングに弱いということではありません。Anthropicはこれを野心的なコーディングプロジェクトに最も適したモデルと説明し、自社の CursorBench 3.2.0 では73.4%を記録しています。差はワークロードの形にあります。シェル実行、リポジトリのナビゲーション、検証、その他のツールが混在する場合、Astraの優位はより説得力を増します。
実行中心のソフトウェアエンジニアリングでの勝者: Astra。長期稼働のリポジトリエージェントはより微妙な判断で、持続的な一貫性、キャッシュ挙動、トークン効率が単一のベンチマークスコアと同じくらい重要になり得ます。

GPT-6 Astra vs Fable 5.1 :which is better for Reasoning and Science
推論比較は、横一線ではないためより興味深いものです。OpenAIの公開評価は、Astraが FrontierMath Tier 4 で97.6%、GPQA Diamondで96.0%、Terminal-Bench Science 0.1で64.6%と報告しています。同じ比較でFable 5.1はそれぞれ87.8%、93.7%、52.6%を記録します。
Fable 5.1はツール使用時の Humanity’s Last Exam で結果を逆転し、Astraの57.2%に対して65.0%を記録。Anthropicの公式ベンチマーク表でも、Fable 5.1の同じ65.0%が独立に報告されています。
| Reasoning / science benchmark | GPT-6 Astra | Claude Fable 5.1 | Winner |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 97.6% | 87.8% | Astra |
| GPQA Diamond | 96.0% | 93.7% | Astra |
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | Astra |
| Humanity's Last Exam, with tools | 57.2% | 65.0% | Fable 5.1 |
| Artificial Analysis Intelligence Index | 61.2 | 65.7 | Fable 5.1 |
この区別は重要です。FrontierMath と Terminal-Bench Science は、特に推論がツールや外部環境と相互作用する際の専門的な数学・科学的問題解決を強調します。Humanity’s Last Exam はより広範で学際的です。実務的に読むなら、Astraは深く技術的でツール実行を伴う推論で強く、Fable 5.1はより広いフロンティア推論評価で優位を保ちます。
コンピュータ使用とプロフェッショナル業務は GPT-6 Astra に軍配
Astra対Fable 5.1のOSWorld比較を直接行うのは誤解を招きます。Anthropicのベンチマーク注記は、Fable 5.1が著者の2026年8月のタスクリリースを用いると述べています。同社のチャートは部分一致77.9%、厳密一致41.7%を報告していますが、これらの数値はOpenAIの72.6%結果と同等ではありません。
| Professional benchmark | GPT-6 Astra | Claude Fable 5.1 | Result |
|---|---|---|---|
| AutomationBench | 41.4% | 31.4% | Astra +10.0ポイント |
| BenchCAD | 95.9% | 84.3% | Astra +11.6ポイント |
| Terminal-Bench Science | 64.6% | 52.6% | Astra +12.0ポイント |
OpenAIはまた、Astraをドキュメント・スプレッドシート・プレゼンテーションの生成に特化して訓練しており、単にテキスト生成にとどまらず、複数ステップのプロフェッショナルワークフローの遂行に設計されていると述べています。Fable 5.1も長期稼働のエージェント、ブラウザ操作、リサーチ、コーディング、プロフェッショナルなドキュメントワークフロー向けに構築されていますが、Astraはコンピュータ媒介の実行と成果物生成に関する公開エビデンスがより強いのが現状です。
コンピュータ使用エージェントと業務自動化の勝者: Astra。
長文コンテキスト比較: 1.05M vs 1M は重要な比較軸ではない
Astraは技術的にはより大きなコンテキストウィンドウ(105万トークン)を持ち、Fable 5.1は100万トークンです。この5%の差が本番アーキテクチャを左右する可能性は低いでしょう。重要なのはコンテキスト内の価格設定です。
OpenAIの長文コンテキスト価格ルールは、リクエストの入力が272Kトークンを超える場合に適用され、入力とキャッシュ料金が倍、出力料金はリクエスト全体で1.5倍になります。Astraの実効レートは、入力$20、キャッシュ済み入力$2、出力$75/MTok となります。
Fable 5.1の仕様は、100万トークンのコンテキストウィンドウに対して入力$10、出力$50、キャッシュ読み取り$0.25/MTok を記載しています。300K、500K、900Kトークンをリクエストに常時読み込むようなアプリケーションでは、名目上のコンテキストウィンドウサイズだけでは話の半分にすぎません。
非常に大きなコンテキストでは、Fable 5.1はよりクリーンなレートカードの経済性を持ち、特にコンテキストの多くがキャッシュ可能な場合に有利です。
価格比較: 見出し価格は同じ、しかしエージェント経済性は大きく異なる
公式の標準レートでは、両モデルは未キャッシュのテキスト入力・出力で完全に同点から始まります。
| Price component | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Input / MTok | $10.00 | $10.00 |
| Output / MTok | $50.00 | $50.00 |
| 5-minute cache write / MTok | $12.50 | $12.50 |
| Cache read / MTok | $1.00 | $0.25 |
| Batch input/output discount | 50% | 50% |
| Long-context surcharge | 入力272K超で適用 | 標準1Mコンテキスト範囲ではなし |
重要な数値は$10でも$50でもありません。重要なのは$0.25です。AnthropicはFable 5.1のキャッシュ読み取りレートを100万トークンあたり$0.25に引き下げ、Astraの標準$1/MTok(長文コンテキスト時は$2/MTok)の4分の1(長文時は8分の1)としました。
これはエージェントループに非常に大きな影響を与え得ます。長時間稼働するアプリケーションでは、大きなシステムプロンプト、ツール定義、リポジトリコンテキスト、参照文書を多数のターンにわたり繰り返し持ち運ぶことがあります。安定したプレフィックスがキャッシュから繰り返し読み込まれる場合、キャッシュ価格は単一ターンのベンチマークでは捉えられない形で複利的に効いてきます。
Anthropicのワークロード見積もりでは、低いキャッシュ価格により典型的なFable 5.1のワークロードコストが約25%削減、高度にエージェント的なワークロードでは最大約45%削減され得るとしています。これはベンダーの推計であり普遍的保証ではありませんが、キャッシュ経済性が比較軸として独立に重要である理由を示しています。
それでFable 5.1の方が安いのか?
自動的にはそうなりません。トークン単価が高いモデルでも、より少ないトークン、より少ないリトライ、失敗するツール呼び出しの削減、または短い壁時計時間でタスクを解決できれば、請求額を下げられます。だからこそ「成功したタスクあたりのコスト」が「100万トークンあたりの価格」より情報価値が高いのです。
実務的な価格の結論は分かれます。キャッシュを多用する非常に長いコンテキストのワークロードではFable 5.1がレートカードで優位。Astraは、実行の優位がリトライ、トークン使用、ランタイムを実質的に減らす場合、完了済みタスクあたりコストで勝ち得ます。
CometAPIの価格は、判断をワークロード品質に絞り込む
両モデルはCometAPIから利用可能です。CometAPIにおける GPT-6 Astra のAPIは入力100万トークンあたり$8からで、Claude Fable 5.1 のAPIも同じ$8から始まります。これは提供者の基本入力レートから20%引きです。
| API pricing | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Official input / output | $10 / $50 | $10 / $50 |
| CometAPI input / output | $8 / $40 | $8 / $40 |
| Reduction vs official base rate | 20% | 20% |
これにより有用な本番環境が構築できます。公開ベンチマーク表だけで決めるのではなく、同一API環境で同じワークロードを両モデルIDに対して評価し、受理率、トークン消費、レイテンシ、ツールの失敗、総支出を比較できます。価格や課金ルールは変わり得るため、本番の予算策定はこの記事の値をハードコードせず、ライブのAPI設定に基づいて行ってください。
ツール利用とエージェント設計: 目標は似ていても哲学が異なる
両モデルはエージェント向けに設計されていますが、APIは異なる哲学を露出させています。GPT-6 Astra はツールが豊富な Responses API 環境をサポートします。OpenAIのサポートツールセットには、Web検索、ファイル検索、画像生成、コードインタプリタ、ホストシェル、Apply Patch、コンピュータ使用、MCP、ツール検索が含まれます。推論エフォートはアプリケーション側で難易度に応じて計算量を調整可能です。
Fable 5.1の推論モデルは異なります。アダプティブな思考が常時有効で、エフォートは深さを操舵するために使われます。Anthropicはさらに、メッセージ単位のエフォート、ターン単位のシステムメッセージ、ツール呼び出し間の可読な進捗更新を追加しており、特に長い自律セッションで有用です。
したがってGPT-6 Astraは「ツールの幅とエンドツーエンドの環境制御」に最適化されている印象で、Fable 5.1は「持続的な長期推論とエージェントの連続性」に最適化されている印象です。どちらのアーキテクチャスタイルも普遍的に優れているわけではなく、オーケストレーション層が生のモデルと同じくらい重要です。
なぜ安全性とデプロイ制約が重要か
OpenAIはAstraを同社のCriticalサイバーセキュリティ閾値に初めて到達したモデルとし、高能力なワークフロー周りに追加のセーフガードをデプロイしています。同じ発表は、本番監視と、エージェントが許可された範囲を超えそうな場合のタスク中断について述べています。
Fable 5.1は異なるセーフガードアーキテクチャを用います。Anthropicは、一部のサイバーセキュリティやバイオロジーのリクエストがセーフガードによりより能力の低いモデルへルーティングされ得ると述べています。つまり、本番のスコアは基礎となるモデルだけでなく、それを取り巻くセーフガードを反映し得ます。
これもまた、クロスベンダーのベンチマーク表を完全に制御された実験室比較として扱うべきではない理由です。エンタープライズ評価には、拒否、フォールバック挙動、タスク中断、監査要件、データ保持、プライバシー制御を含め、モデル選定後ではなく選定時に考慮すべきです。
GPT-6 Astra vs Claude Fable 5.1: どちらを選ぶべきか?
| Workload | Recommended model | Why |
|---|---|---|
| Autonomous computer-use agent | Astra | コンピュータ使用とプロフェッショナル実行に関する公開エビデンスが強い |
| Agentic terminal / software engineering | Astra | Terminal-Bench、DeepSWE、データベース移行の結果でリード |
| Scientific tool workflows | Astra | FrontierMath、GPQA、Terminal-Bench Science の結果が強い |
| Broad frontier reasoning | Fable 5.1 | HLE(ツールあり)と Intelligence Index でリード |
| Long-running asynchronous agent | Fable 5.1 | 長期視点のエージェント的作業と進捗更新に基づいて設計 |
| 300K–1M-token requests | Fable 5.1 | Astraの入力272K超サーチャージを標準価格内で回避 |
| Heavy prompt-cache reuse | Fable 5.1 | $0.25/MTok の公式キャッシュ読み取り |
| Document / spreadsheet / presentation automation | Astra | プロフェッショナル業務と成果物生成のポジショニングが強い |
| Large repository with repeated cached context | Fable 5.1 | 繰り返すエージェントループではキャッシュ経済性が支配的になり得る |
| Mixed production workloads | Test both | 強みが異なるため、単一モデルよりワークロードルーティングの方が有益 |
アプリケーションがモデルに「行動」を求めるなら、Astraは通常最初にテストすべきモデルです。アプリケーションが「非常に大きく繰り返し再利用されるコンテキストの上で長時間“考えること”」を求めるなら、Fable 5.1は同等かそれ以上に検討に値します。
GPT-6 Astra と Claude Fable 5.1 の総合評価は?
10–0の明快な結果はありません。Astraは公開ベンダー比較の多くで勝ち、特にコーディング実行、科学ツール、コンピュータ使用、プロフェッショナル自動化で一貫した優位を示します。ソフトウェアの操作が必要で、何をすべきかの議論だけでは済まないエージェントを構築する開発者にとって、これは大きな利点です。
Fable 5.1の勝ちはより狭いものの戦略的に重要です。Humanity’s Last Exam の65.0%と Intelligence Index の高得点は、Astraが一般的推論を単純に支配しているわけではないことを示します。さらに、Fable 5.1はキャッシュ多用のエージェントや100万トークンコンテキストの大半を使うリクエストで構造的な価格優位を持ちます。
より深い変化は、フロンティアモデル選定が「どのチャットボットが最も賢い答えを出すか?」から「どのシステムが最も低コストで正しく仕事を終わらせるか?」へと移っていることです。
自分のアプリケーションで比較する方法
公開リーダーボードは候補絞り込みには役立ちますが、本番の意思決定を代替すべきではありません。実際のタスクから固定評価セットを作り、同一入力素材を両モデルに対して実行し、同等のツール権限を維持し、最終回答の見栄えだけでなくタスクが実際に成功したかを測定してください。
エージェント的アプリケーションでは、有用な指標として、総タスク成功、人間による受理率、ツール呼び出し失敗、リトライ、完了までの時間、未キャッシュ入力、キャッシュ読み取り、出力トークン、API総支出があります。
単純なデプロイ指標は「総API支出 ÷ 受理された完了タスク数」です。
この数値はベンチマークに基づく決定を覆し得ます。トークン単価が高いモデルでもリトライが少なければ安くなり得ます。キャッシュが安いモデルは50ターンのエージェントループでは劇的に安くなり得ます。孤立した環境でスコアが高いモデルでも、あなたのツール、検索レイヤー、実際の受理基準が導入されると負け得ます。
Astra と Fable 5.1 は CometAPI から利用可能であり、最も強い本番戦略は必ずしも一つの提供者に永久にコミットすることではありません。モデルを設定可能に保ち、同じ受理基準で両者を評価し、実際に最も性能が良いモデルへワークロードをルーティングしてください。
FAQs
GPT-6 Astra は Claude Fable 5.1 より優れている?
AstraはTerminal-Bench、DeepSWE、FrontierMath、AutomationBenchなど、直接比較可能な複数のコーディング・科学・プロフェッショナル業務ベンチマークで強く、Fable 5.1はツールありの Humanity’s Last Exam と Artificial Analysis Intelligence Index でリードしています。どちらもすべての次元で勝っているわけではありません。
コーディングにより適しているモデルは?
GPT-6 Astra は、特にエージェント的コーディングと実行において、より適したモデルです。 OpenAIの公開比較では、Terminal-Bench 4.0 で Astra が57.9%、Fable 5.1 が55.8%で、DeepSWEとデータベース移行評価でAstraのリードはさらに大きくなります。Claude Fable 5.1も長期のリポジトリ作業では非常に競争力がありますが、総合的なコーディングのエビデンスではAstraが強いです。
長文コンテキストにより適しているモデルは?
Claude Fable 5.1 は、非常に大きなリクエストやプロンプトキャッシュの繰り返し利用を伴う長文コンテキストのワークロードに適した選択です。 両モデルは概ね100万トークンのコンテキストを提供しますが、GPT-6 Astraは入力272Kトークン超で高いレートが適用されるのに対し、Fable 5.1はより単純なレート構造を維持し、プロンプトキャッシュ読み取りが大幅に安価です。
どちらが安い?
標準の基本レートではどちらも安くはなく同点です。 ただし、Claude Fable 5.1 はキャッシュ多用や非常に長いコンテキストのワークロードで安価になります。 公式の基本価格は両モデルとも入力$10/MTok、出力$50/MTokです。CometAPIでは、GPT-6 Astra と Fable 5.1 は現時点で入力$8/MTok、出力$40/MTokから開始します。プロンプトキャッシュ読み取りやAstraの長文コンテキストサーチャージが顕著になると、Fable 5.1がコスト優位を得ます。
開発者はどちらか一方だけを使うべき?
必ずしもそうではありません。両者の強みは十分に補完的であり、単一モデルをすべてのリクエストに使うより、マルチモデル評価やルーティング戦略の方が高い性能を発揮し得ます。実際の本番ワークロードをテストし、単一のベンチマークスコアに頼るのではなく、受理済み完了タスクあたりコストで比較してください。
