TLDR Claude Fable 5.1 主要是一次「代理式執行」升級。最大的提昇出現在科學研究、商務自動化、終端機編碼,以及其他需要在多步驟中進行規劃、工具使用、驗證與恢復的工作流。對封閉式推理與較短的 IDE 風格編碼任務,改進較小,因此最佳部署決策取決於實際工作負載,而非單一總分。
關鍵要點
- Fable 5.1 在 Terminal-Bench-Science 0.1 的得分為 52.6%,在 Anthropic 的評測中超過 Fable 5 的 24.7% 一倍以上。
- AutomationBench 由 17.1% 提升至 31.4%,顯示端到端商務工作流有大幅改進。
- 在 CursorBench 與輔以工具的 Humanity's Last Exam 上的提升較為溫和,表示本次發佈更側重於持續執行能力,而非平均改善所有推理形式。
- Fable 5.1 與 Fable 5 維持相同的標準 token 單價,但更低的快取讀取定價可降低重度上下文代理工作流的有效成本。
- GPT-6 Astra 現為更近的 OpenAI 對照,但未納入 Anthropic 9 月 1 日的基準表。任何直接性能主張都需要在相同測試框架下的對照評估。
Anthropic 於 2026 年 9 月 1 日發佈 Claude Fable 5.1,面向高要求推理、長期任務代理、軟體工程、研究與專業知識工作。Claude Fable 5.1 亦可透過 CometAPI 取得,方便開發者透過統一端點與其他前沿模型一同評測。
整體結果亮眼,但改進的分佈比平均更具資訊量。當代理需要保持目標、與工具互動、從錯誤恢復並驗證最終狀態時,Fable 5.1 的收益最大。本文聚焦這些基準結果意味著什麼、模型仍然的不足,以及如何對比更新的替代方案。
Claude Fable 5.1 一覽
Anthropic 的模型文件標示 100 萬 token 上下文窗口、128K 最大輸出、支援文字與影像輸入、始終開啟的自適應思考,以及 2026 年 6 月的知識截止。Claude API 模型 ID 為 claude-fable-5-1。
| Official specification | Claude Fable 5.1 |
|---|---|
| Provider | Anthropic |
| Release date | September 1, 2026 |
| Model ID | claude-fable-5-1 |
| Context window | 1,000,000 tokens |
| Maximum output | 128,000 tokens |
| Input / output | Text and images → text |
| Thinking | Adaptive, always on |
| Default effort | High |
| Knowledge cutoff | June 2026 |
| Anthropic input price | $10 / MTok |
| Anthropic output price | $50 / MTok |
| Cache read | $0.25 / MTok |
| Comparative latency | Slower |
| Primary positioning | Demanding reasoning and long-horizon agentic work |
標準輸入與輸出單價與 Fable 5 相同,但快取讀取降至每百萬 token $0.25。Fable 5.1 並未降低輸入/輸出 token 的標題單價;其有效成本主要來自快取讀取定價下調 75%。Anthropic 估計典型工作負載可降低約 25% 成本,高度代理化的工作負載最多可降低約 45%。
這很重要,因為長時間運行的代理會反覆重用倉庫上下文、指令、工具定義與先前狀態。即使標題輸入與輸出單價不變,完成任務的成本也可能下降。
Anthropic 亦報告 Claude Mythos 5.1 在 Terminal-Bench 4.0 的成績為 60.9%。Mythos 5.1 為獨立部署、具不同防護措施的版本,不應視為一般可用的 Fable 5.1 分數。
Claude Fable 5.1 的基準測試顯示了什麼?
以下數值來自 Anthropic 2026 年 9 月的評估。它們描述的是模型與測試框架的組合,而非模型的不可變屬性。
| Benchmark | What it measures | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Agentic scientific research | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Agentic terminal coding | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Professional knowledge work, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Long-horizon computer use | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | Fully completed computer tasks | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | Expert multidisciplinary reasoning | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | Expert reasoning with tools | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | End-to-end business workflows | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Agentic IDE coding | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 在上述九行中皆領先 Fable 5 與 Opus 5。其世代性最大進步出現在科學研究、商務工作流自動化與終端機編碼。Humanity's Last Exam 與 CursorBench 上較小的差距同樣重要,因為它們顯示改進並非在每種工作負載上都一致。
Claude Fable 5.1 的最大改進在哪裡?
Terminal-Bench-Science 0.1:最突出的結果
Fable 5.1 取得 52.6%,相較之下,Claude Fable 5 為 24.7%、Claude Opus 5 為 29.0%,GPT-5.6 Sol 為 22.4%(Anthropic 的執行)。27.9 個百分點的世代差距遠大於每個模型所報告的標準誤差;相對地,較小的差距——如 Fable 5.1 與 Opus 5 在 Terminal-Bench 4.0 上 3.5 個百分點的差距——應更謹慎解讀。
Terminal-Bench-Science 評估跨科學與工程領域的完整研究工作流。代理必須產出程式碼、分析、證明、模擬或資料產品,而非僅回答孤立問題。Anthropic 報告每個模型約 ±3.5–4.5 個百分點的標準誤差,因此小幅差距不應自動解讀為有意義的能力差異。
Terminal-Bench 4.0:更強的自主編碼
Fable 5.1 達到 55.8%,領先 Fable 5 的 42.0%、Opus 5 的 52.3%,以及 GPT-5.6 Sol 的 37.3%。相較 Fable 5 的 13.8 個百分點進步相當可觀,而與 Opus 5 的 3.5 個百分點領先則相對較小。
該基準將代理置於執行環境中,因此成功仰賴於導航環境、修改程式碼與驗證結果。由於 Terminal-Bench 4.0 使用與早期版本不同的任務集,分數僅應在相同版本中比較。
AutomationBench:大幅提升但仍有空間
AutomationBench 由 Fable 5 的 17.1% 提升至 Fable 5.1 的 31.4%。這是 14.3 個百分點的絕對提升,約等於 84% 的相對增幅。
此基準透過檢查最終環境狀態來評估銷售、行銷、營運、支援、財務與人資等工作流。這使其成為判斷代理是否「實際完成」工作流的實用測試,而不僅是提出正確動作。分數也揭示限制:在 Anthropic 報告的配置下,約三分之二的任務仍未完成。
CursorBench 3.2.0:較小的編碼提升
Fable 5.1 達到 73.4%,相較 Fable 5 的 70.5%、Opus 5 的 70.0% 與 GPT-5.6 Sol 的 67.2%。相對 Fable 5 僅提升 2.9 個百分點。
因此,相較於涉及規劃、執行、驗證與恢復的長流程,本次對較短的 IDE 式編碼任務的改變看起來不那麼「改天換地」。評估套件應納入倉庫層級變更與失敗測試恢復,而非僅看程式碼生成品質。
OSWorld 2.0:電腦操作仍然困難
Fable 5.1 的部分得分為 77.9%,嚴格完成為 41.7%。Opus 5 分別為 75.4% 與 39.6%,Fable 5 為 72.9% 與 36.1%。
嚴格完成分數更能反映生產情境。未滿一半的任務完全完成,顯示在電腦操作方面的進展並未消除檢查點、權限、監控與恢復邏輯的必要性。
CursorBench 與 Humanity's Last Exam:較小的提升
Fable 5.1 在 CursorBench 3.2.0 為 73.4%,僅比 Fable 5 高 2.9 個百分點。在 Humanity's Last Exam 上,無工具提升 3.1 個百分點、使用工具提升 1.2 個百分點。
這些較小的差距支撐中心觀點:Fable 5.1 在需要規劃、執行、驗證與恢復的長流程上更具變革性,而非在較短的 IDE 任務或封閉式學術推理上全面領先。
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
簡短回答:Fable 5.1 在 Anthropic 公佈的長期任務基準表中最強;當能接受較小性能差距時,Opus 5 是更經濟的起點;Fable 5 為舊版基準;GPT-6 Astra 需在相同測試框架下評估後方可直接排名。
在 Anthropic 發佈的長期代理基準上,Fable 5.1 明顯優於 Fable 5。GPT-6 Astra 是更近期的 OpenAI 對照,但其發佈在 Anthropic 9 月 1 日評估之後,未納入相同測試框架。
| Dimension | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Context window | 1M tokens | 1M tokens | 1.05M tokens |
| Maximum output | 128K | 128K | 128K |
| Standard input / output | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Cache read | $0.25 / MTok | $1 / MTok | Verify current provider terms |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Not included in Anthropic’s launch table |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Not included in Anthropic’s launch table |
| AutomationBench | 31.4% | 17.1% | Not included in Anthropic’s launch table |
| Primary positioning | Demanding reasoning and long-horizon agents | Previous Fable-class baseline | Difficult end-to-end professional work |
相較 Fable 5,Fable 5.1 在科學研究、商務自動化與終端機編碼的測得增幅最大,同時維持相同的標準 token 單價。更低的快取讀取定價進一步改善重複上下文代理的經濟性。
選型規則:成本優先先用 Opus 5;當長期完成率與恢復能力最重要時升級到 Fable 5.1;Fable 5 僅在相容性敏感的工作負載保留;在生產採用前,應以相同測試框架對 GPT-6 Astra 進行對照評測。
各工作負載下的基準表現如何?
| Capability | Fable 5.1 result | Change vs Fable 5 | Interpretation |
|---|---|---|---|
| Agentic scientific research | 52.6% | +27.9 pts | Very large gain |
| Business workflow automation | 31.4% | +14.3 pts | Very large gain |
| Terminal coding | 55.8% | +13.8 pts | Large gain |
| Computer use, strict | 41.7% | +5.6 pts | Moderate gain |
| Computer use, partial | 77.9% | +5.0 pts | Moderate gain |
| Expert reasoning, no tools | 60.9% | +3.1 pts | Small gain |
| IDE agentic coding | 73.4% | +2.9 pts | Small gain |
| Expert reasoning, tools | 65.0% | +1.2 pts | Small gain |
| Professional knowledge work | 1853 Elo | +130 Elo | Strong, configuration-sensitive |
模式一致:當成功取決於持續性、規劃、與環境互動、工具使用與隨時間的恢復時,改進幅度最大。
基準測試沒有告訴你什麼?
基準表將行為壓縮為單一數字。它們不能證明自主代理已被解決,也無法預測所有生產工作負載。
- 主表為廠商執行。
- 努力度設定會影響品質、延遲與成本。
- 代理基準衡量的是模型、測試框架、工具與權限的組合。
- Fable 5.1 啟用了生產級防護,並影響部分結果。
- 基準版本會變動,不同任務版本的分數未必可直接比較。
- AutomationBench 仍為 31.4%,OSWorld 嚴格完成仍為 41.7%;失敗率仍然可觀。
實際評估應使用公開分數篩選候選、以相同設定重現小規模對比,然後測試實際的生產工作流。
Claude Fable 5.1 是最好的 Claude 模型嗎?
對於需要長時間運行、難度高的工作,基準證據對 Claude Fable 5.1 的支持很強。對於所有工作負載,答案是否定的。
Anthropic 的定價為每百萬輸入 token $10、每百萬輸出 token $50,而 Opus 5 分別為 $5 與 $25。只有當 Fable 5.1 帶來更高的成功率、更少的重試、每個被接受任務的 token 更少,或足夠降低人工審查時間時,溢價才合理。
更低的快取讀取定價可縮小代理的有效成本差距。因此,每個被接受結果的成本比單看每 token 價格更有用。
應該如何為 Claude Fable 5.1 做基準測試?
你的評估應與預期的生產工作負載相似。
- 編碼:測試完整議題並記錄補丁被接受率、通過測試數、重試次數、工具調用、耗時與人工修正時間。
- 研究:評估來源品質、事實正確性、證據覆蓋、子任務完成度與長程目標保持。
- 商務代理:以最終環境狀態計分,而非逐一計數正確動作。
- 電腦使用:衡量從彈出視窗、頁面變慢、中斷的工作階段與不一致應用狀態的恢復能力。
- 模型比較:保持提示、測試框架、工具、權限、努力設定與計分規則一致。
- 經濟性:衡量每個被接受任務的成本,而不僅是每 token 成本。
結論
基準證據顯示,當任務需要持續執行而非單次回應時,Fable 5.1 的價值最大。最強的使用場景包括科學研究、自主編碼、複雜代理工作流、商務自動化,以及需要規劃、工具、驗證與恢復的工作流。
證據並不支持「全面優越」。在若干基準上的小幅差距、在嚴格電腦操作任務中的顯著失敗率,以及 Anthropic 發佈表中缺少 GPT-6 Astra,都強化了基於工作負載的測試必要性。
對 CometAPI 使用者而言,務實的部署規則是:在長期成功可支撐較高推理成本的地方測試 Fable 5.1,並在相同代表性任務上與 Opus 5、GPT-5.6 Sol 與 GPT-6 Astra 做對比後再選擇生產路線。
常見問題
Claude Fable 5.1 的最高基準測試分數是什麼?
在 Anthropic 報告的百分比分項中,Fable 5.1 在 OSWorld 2.0 的部分得分達到 77.9%,在 CursorBench 3.2.0 為 73.4%。其世代最大提升是 Terminal-Bench-Science,52.6% 對比 Fable 5 的 24.7%。
Claude Fable 5.1 比 Fable 5 好多少?
視工作負載差異很大:Terminal-Bench-Science 提升 27.9 個百分點、AutomationBench 提升 14.3、Terminal-Bench 4.0 提升 13.8,但在 CursorBench 僅 2.9、在使用工具的 Humanity’s Last Exam 僅 1.2。
Claude Fable 5.1 是否優於 Claude Opus 5?
在 Anthropic 報告的表格中分數較高,但許多差距很小。Anthropic 建議先用 Opus 5,當需要額外的長程能力時再升級。
Claude Fable 5.1 是否擊敗 GPT-5.6 Sol?
Anthropic 在五項共有指標上報告 Fable 5.1 分數更高。由於這些是廠商執行的競品評測且配置各異,較安全的結論是 Fable 5.1 競爭力很強,而非在所有方面全面優越。
這些結果是否經過獨立驗證?
只有部分。數個基準有公開排行榜,但必須對齊努力等級、測試框架、回退行為與任務版本,才能與 Anthropic 的發佈執行直接可比。
Claude Fable 5.1 最擅長什麼?
其基準側寫在長時間科學研究、自主編碼、複雜代理工作流、商務自動化,以及需要規劃、工具、驗證與恢復的任務上最強。
我如何存取 Claude Fable 5.1?
Claude Fable 5.1 已在 CometAPI 上架,模型 ID 為 claude-fable-5-1。統一端點讓你能在相同評測工作負載上同時跑多個模型,再決定生產方案。
