GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/CometAPI 研究

Claude Fable 5.1 基準測試:這些分數告訴我什麼

探索 Claude Fable 5.1 的基準測試、關鍵提升、限制,以及與 Fable 5、Opus 5、GPT-5.6 Sol、GPT-6 Astra 的比較。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 17, 2026 6 分鐘閱讀
Claude Fable 5.1 基準測試:這些分數告訴我什麼
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 主要是一次「代理式執行」升級。最大的提昇出現在科學研究、商務自動化、終端機編碼,以及其他需要在多步驟中進行規劃、工具使用、驗證與恢復的工作流。對封閉式推理與較短的 IDE 風格編碼任務,改進較小,因此最佳部署決策取決於實際工作負載,而非單一總分。

關鍵要點

  • Fable 5.1 在 Terminal-Bench-Science 0.1 的得分為 52.6%,在 Anthropic 的評測中超過 Fable 5 的 24.7% 一倍以上。
  • AutomationBench 由 17.1% 提升至 31.4%,顯示端到端商務工作流有大幅改進。
  • 在 CursorBench 與輔以工具的 Humanity's Last Exam 上的提升較為溫和,表示本次發佈更側重於持續執行能力,而非平均改善所有推理形式。
  • Fable 5.1 與 Fable 5 維持相同的標準 token 單價,但更低的快取讀取定價可降低重度上下文代理工作流的有效成本。
  • GPT-6 Astra 現為更近的 OpenAI 對照,但未納入 Anthropic 9 月 1 日的基準表。任何直接性能主張都需要在相同測試框架下的對照評估。

Anthropic 於 2026 年 9 月 1 日發佈 Claude Fable 5.1,面向高要求推理、長期任務代理、軟體工程、研究與專業知識工作。Claude Fable 5.1 亦可透過 CometAPI 取得,方便開發者透過統一端點與其他前沿模型一同評測。

整體結果亮眼,但改進的分佈比平均更具資訊量。當代理需要保持目標、與工具互動、從錯誤恢復並驗證最終狀態時,Fable 5.1 的收益最大。本文聚焦這些基準結果意味著什麼、模型仍然的不足,以及如何對比更新的替代方案。

Claude Fable 5.1 一覽

Anthropic 的模型文件標示 100 萬 token 上下文窗口、128K 最大輸出、支援文字與影像輸入、始終開啟的自適應思考,以及 2026 年 6 月的知識截止。Claude API 模型 ID 為 claude-fable-5-1

Official specificationClaude Fable 5.1
ProviderAnthropic
Release dateSeptember 1, 2026
Model IDclaude-fable-5-1
Context window1,000,000 tokens
Maximum output128,000 tokens
Input / outputText and images → text
ThinkingAdaptive, always on
Default effortHigh
Knowledge cutoffJune 2026
Anthropic input price$10 / MTok
Anthropic output price$50 / MTok
Cache read$0.25 / MTok
Comparative latencySlower
Primary positioningDemanding reasoning and long-horizon agentic work

標準輸入與輸出單價與 Fable 5 相同,但快取讀取降至每百萬 token $0.25。Fable 5.1 並未降低輸入/輸出 token 的標題單價;其有效成本主要來自快取讀取定價下調 75%。Anthropic 估計典型工作負載可降低約 25% 成本,高度代理化的工作負載最多可降低約 45%。

這很重要,因為長時間運行的代理會反覆重用倉庫上下文、指令、工具定義與先前狀態。即使標題輸入與輸出單價不變,完成任務的成本也可能下降。

Anthropic 亦報告 Claude Mythos 5.1 在 Terminal-Bench 4.0 的成績為 60.9%。Mythos 5.1 為獨立部署、具不同防護措施的版本,不應視為一般可用的 Fable 5.1 分數。

Claude Fable 5.1 的基準測試顯示了什麼?

以下數值來自 Anthropic 2026 年 9 月的評估。它們描述的是模型與測試框架的組合,而非模型的不可變屬性。

BenchmarkWhat it measuresFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Agentic scientific research52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Agentic terminal coding55.8%42.0%52.3%37.3%
GDPval-AA v2Professional knowledge work, Elo1853172318241711
OSWorld 2.0, partialLong-horizon computer use77.9%72.9%75.4%
OSWorld 2.0, strictFully completed computer tasks41.7%36.1%39.6%
Humanity’s Last Exam, no toolsExpert multidisciplinary reasoning60.9%57.8%56.6%
Humanity’s Last Exam, with toolsExpert reasoning with tools65.0%63.8%63.6%
AutomationBenchEnd-to-end business workflows31.4%17.1%26.9%19.6%
CursorBench 3.2.0Agentic IDE coding73.4%70.5%70.0%67.2%

Fable 5.1 在上述九行中皆領先 Fable 5 與 Opus 5。其世代性最大進步出現在科學研究、商務工作流自動化與終端機編碼。Humanity's Last Exam 與 CursorBench 上較小的差距同樣重要,因為它們顯示改進並非在每種工作負載上都一致。

Claude Fable 5.1 的最大改進在哪裡?

Terminal-Bench-Science 0.1:最突出的結果

Fable 5.1 取得 52.6%,相較之下,Claude Fable 5 為 24.7%、Claude Opus 5 為 29.0%,GPT-5.6 Sol 為 22.4%(Anthropic 的執行)。27.9 個百分點的世代差距遠大於每個模型所報告的標準誤差;相對地,較小的差距——如 Fable 5.1 與 Opus 5 在 Terminal-Bench 4.0 上 3.5 個百分點的差距——應更謹慎解讀。

Terminal-Bench-Science 評估跨科學與工程領域的完整研究工作流。代理必須產出程式碼、分析、證明、模擬或資料產品,而非僅回答孤立問題。Anthropic 報告每個模型約 ±3.5–4.5 個百分點的標準誤差,因此小幅差距不應自動解讀為有意義的能力差異。

Terminal-Bench 4.0:更強的自主編碼

Fable 5.1 達到 55.8%,領先 Fable 5 的 42.0%、Opus 5 的 52.3%,以及 GPT-5.6 Sol 的 37.3%。相較 Fable 5 的 13.8 個百分點進步相當可觀,而與 Opus 5 的 3.5 個百分點領先則相對較小。

該基準將代理置於執行環境中,因此成功仰賴於導航環境、修改程式碼與驗證結果。由於 Terminal-Bench 4.0 使用與早期版本不同的任務集,分數僅應在相同版本中比較。

AutomationBench:大幅提升但仍有空間

AutomationBench 由 Fable 5 的 17.1% 提升至 Fable 5.1 的 31.4%。這是 14.3 個百分點的絕對提升,約等於 84% 的相對增幅。

此基準透過檢查最終環境狀態來評估銷售、行銷、營運、支援、財務與人資等工作流。這使其成為判斷代理是否「實際完成」工作流的實用測試,而不僅是提出正確動作。分數也揭示限制:在 Anthropic 報告的配置下,約三分之二的任務仍未完成。

CursorBench 3.2.0:較小的編碼提升

Fable 5.1 達到 73.4%,相較 Fable 5 的 70.5%、Opus 5 的 70.0% 與 GPT-5.6 Sol 的 67.2%。相對 Fable 5 僅提升 2.9 個百分點。

因此,相較於涉及規劃、執行、驗證與恢復的長流程,本次對較短的 IDE 式編碼任務的改變看起來不那麼「改天換地」。評估套件應納入倉庫層級變更與失敗測試恢復,而非僅看程式碼生成品質。

OSWorld 2.0:電腦操作仍然困難

Fable 5.1 的部分得分為 77.9%,嚴格完成為 41.7%。Opus 5 分別為 75.4% 與 39.6%,Fable 5 為 72.9% 與 36.1%。

嚴格完成分數更能反映生產情境。未滿一半的任務完全完成,顯示在電腦操作方面的進展並未消除檢查點、權限、監控與恢復邏輯的必要性。

CursorBench 與 Humanity's Last Exam:較小的提升

Fable 5.1 在 CursorBench 3.2.0 為 73.4%,僅比 Fable 5 高 2.9 個百分點。在 Humanity's Last Exam 上,無工具提升 3.1 個百分點、使用工具提升 1.2 個百分點。

這些較小的差距支撐中心觀點:Fable 5.1 在需要規劃、執行、驗證與恢復的長流程上更具變革性,而非在較短的 IDE 任務或封閉式學術推理上全面領先。

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

簡短回答:Fable 5.1 在 Anthropic 公佈的長期任務基準表中最強;當能接受較小性能差距時,Opus 5 是更經濟的起點;Fable 5 為舊版基準;GPT-6 Astra 需在相同測試框架下評估後方可直接排名。

在 Anthropic 發佈的長期代理基準上,Fable 5.1 明顯優於 Fable 5。GPT-6 Astra 是更近期的 OpenAI 對照,但其發佈在 Anthropic 9 月 1 日評估之後,未納入相同測試框架。

DimensionClaude Fable 5.1Claude Fable 5GPT-6 Astra
Context window1M tokens1M tokens1.05M tokens
Maximum output128K128K128K
Standard input / output$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Cache read$0.25 / MTok$1 / MTokVerify current provider terms
Terminal-Bench-Science 0.152.6%24.7%Not included in Anthropic’s launch table
Terminal-Bench 4.055.8%42.0%Not included in Anthropic’s launch table
AutomationBench31.4%17.1%Not included in Anthropic’s launch table
Primary positioningDemanding reasoning and long-horizon agentsPrevious Fable-class baselineDifficult end-to-end professional work

相較 Fable 5,Fable 5.1 在科學研究、商務自動化與終端機編碼的測得增幅最大,同時維持相同的標準 token 單價。更低的快取讀取定價進一步改善重複上下文代理的經濟性。

選型規則:成本優先先用 Opus 5;當長期完成率與恢復能力最重要時升級到 Fable 5.1;Fable 5 僅在相容性敏感的工作負載保留;在生產採用前,應以相同測試框架對 GPT-6 Astra 進行對照評測。

各工作負載下的基準表現如何?

CapabilityFable 5.1 resultChange vs Fable 5Interpretation
Agentic scientific research52.6%+27.9 ptsVery large gain
Business workflow automation31.4%+14.3 ptsVery large gain
Terminal coding55.8%+13.8 ptsLarge gain
Computer use, strict41.7%+5.6 ptsModerate gain
Computer use, partial77.9%+5.0 ptsModerate gain
Expert reasoning, no tools60.9%+3.1 ptsSmall gain
IDE agentic coding73.4%+2.9 ptsSmall gain
Expert reasoning, tools65.0%+1.2 ptsSmall gain
Professional knowledge work1853 Elo+130 EloStrong, configuration-sensitive

模式一致:當成功取決於持續性、規劃、與環境互動、工具使用與隨時間的恢復時,改進幅度最大。

基準測試沒有告訴你什麼?

基準表將行為壓縮為單一數字。它們不能證明自主代理已被解決,也無法預測所有生產工作負載。

  • 主表為廠商執行。
  • 努力度設定會影響品質、延遲與成本。
  • 代理基準衡量的是模型、測試框架、工具與權限的組合。
  • Fable 5.1 啟用了生產級防護,並影響部分結果。
  • 基準版本會變動,不同任務版本的分數未必可直接比較。
  • AutomationBench 仍為 31.4%,OSWorld 嚴格完成仍為 41.7%;失敗率仍然可觀。

實際評估應使用公開分數篩選候選、以相同設定重現小規模對比,然後測試實際的生產工作流。

Claude Fable 5.1 是最好的 Claude 模型嗎?

對於需要長時間運行、難度高的工作,基準證據對 Claude Fable 5.1 的支持很強。對於所有工作負載,答案是否定的。

Anthropic 的定價為每百萬輸入 token $10、每百萬輸出 token $50,而 Opus 5 分別為 $5 與 $25。只有當 Fable 5.1 帶來更高的成功率、更少的重試、每個被接受任務的 token 更少,或足夠降低人工審查時間時,溢價才合理。

更低的快取讀取定價可縮小代理的有效成本差距。因此,每個被接受結果的成本比單看每 token 價格更有用。

應該如何為 Claude Fable 5.1 做基準測試?

你的評估應與預期的生產工作負載相似。

  • 編碼:測試完整議題並記錄補丁被接受率、通過測試數、重試次數、工具調用、耗時與人工修正時間。
  • 研究:評估來源品質、事實正確性、證據覆蓋、子任務完成度與長程目標保持。
  • 商務代理:以最終環境狀態計分,而非逐一計數正確動作。
  • 電腦使用:衡量從彈出視窗、頁面變慢、中斷的工作階段與不一致應用狀態的恢復能力。
  • 模型比較:保持提示、測試框架、工具、權限、努力設定與計分規則一致。
  • 經濟性:衡量每個被接受任務的成本,而不僅是每 token 成本。

結論

基準證據顯示,當任務需要持續執行而非單次回應時,Fable 5.1 的價值最大。最強的使用場景包括科學研究、自主編碼、複雜代理工作流、商務自動化,以及需要規劃、工具、驗證與恢復的工作流。

證據並不支持「全面優越」。在若干基準上的小幅差距、在嚴格電腦操作任務中的顯著失敗率,以及 Anthropic 發佈表中缺少 GPT-6 Astra,都強化了基於工作負載的測試必要性。

對 CometAPI 使用者而言,務實的部署規則是:在長期成功可支撐較高推理成本的地方測試 Fable 5.1,並在相同代表性任務上與 Opus 5、GPT-5.6 Sol 與 GPT-6 Astra 做對比後再選擇生產路線。

常見問題

Claude Fable 5.1 的最高基準測試分數是什麼?

在 Anthropic 報告的百分比分項中,Fable 5.1 在 OSWorld 2.0 的部分得分達到 77.9%,在 CursorBench 3.2.0 為 73.4%。其世代最大提升是 Terminal-Bench-Science,52.6% 對比 Fable 5 的 24.7%。

Claude Fable 5.1 比 Fable 5 好多少?

視工作負載差異很大:Terminal-Bench-Science 提升 27.9 個百分點、AutomationBench 提升 14.3、Terminal-Bench 4.0 提升 13.8,但在 CursorBench 僅 2.9、在使用工具的 Humanity’s Last Exam 僅 1.2。

Claude Fable 5.1 是否優於 Claude Opus 5?

在 Anthropic 報告的表格中分數較高,但許多差距很小。Anthropic 建議先用 Opus 5,當需要額外的長程能力時再升級。

Claude Fable 5.1 是否擊敗 GPT-5.6 Sol?

Anthropic 在五項共有指標上報告 Fable 5.1 分數更高。由於這些是廠商執行的競品評測且配置各異,較安全的結論是 Fable 5.1 競爭力很強,而非在所有方面全面優越。

這些結果是否經過獨立驗證?

只有部分。數個基準有公開排行榜,但必須對齊努力等級、測試框架、回退行為與任務版本,才能與 Anthropic 的發佈執行直接可比。

Claude Fable 5.1 最擅長什麼?

其基準側寫在長時間科學研究、自主編碼、複雜代理工作流、商務自動化,以及需要規劃、工具、驗證與恢復的任務上最強。

我如何存取 Claude Fable 5.1?

Claude Fable 5.1 已在 CometAPI 上架,模型 ID 為 claude-fable-5-1。統一端點讓你能在相同評測工作負載上同時跑多個模型,再決定生產方案。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 17, 2026
最後更新 Sep 17, 2026
0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多