TLDR: Anthropic 於 2026 年 7 月 24 日發布的 Claude Opus 5 相較於 Opus 4.8 在深度推理、代理式編程、長期任務與新問題求解方面實現躍升。它在關鍵基準上持平或超越更昂貴的 Fable 5(包括 Frontier-Bench v0.1 的 43.3% 與 ARC-AGI-3 的紀錄 30.2%),但定價與 Opus 4.8 相同——每百萬輸入 tokens 收費 5 美元、每百萬輸出 tokens 收費 25 美元。具備 100 萬 tokens 的上下文視窗、預設開啟思考模式、強化自我驗證與更好的對齊(近期 Claude 中最低的失調行為分數),在複雜編程、電腦操作、知識型工作與多代理工作流程中表現出色。中等 effort 往往就能達到效率峰值。
Key Takeaways
- Opus 5 是相較 Opus 4.8 的真正世代升級,而非小步迭代——尤其在代理持久性、測試時間計算擴展以及流體智力(ARC-AGI-3 從約 1.5% 躍升至 30.2%)等方面,見 Claude blog。
- 在主要編程/代理基準中,以大約半價超越或匹敵 Fable 5。
- 價格維持每百萬 tokens $5/$25;效率來自更高的每 token 表現與在中/低 effort 下依然強勁的結果。
- 安全表現是 Anthropic 迄今 Opus 系列最佳,對具攻擊性的網路能力施加有意義的限制,並降低分類器觸發。
- 提示策略轉變:移除舊版驗證指令、明確限制範圍、控制冗長與子代理使用,並利用 Claude doc 中的 effort 參數。
- 最適用於長時間運行代理、多檔案編碼、知識型工作與視覺輔助任務;實務回饋指出在展示/複雜建置上表現強勁,但在大型程式碼庫上偶有指令遵循摩擦。
- CometAPI 等平台可輕鬆在 Claude 模型(與競品)間導流,提供統一計費與回退。
Claude Opus 5 作為 Anthropic 最新、現已普遍可用的 Opus 級旗艦。雖在某些專門領域位於受限更多的 Mythos/Fable 之下,但在許多公開評測上競爭力十足甚至更優,目標鎖定複雜代理編程、企業級知識型工作與長期任務。距離 Opus 4.8 發布僅兩個月,卻是質變而非小幅更新。
What Is Claude Opus 5?
Claude Opus 5(API model ID: claude-opus-5)是 Anthropic 最新的 Opus 級模型,針對複雜代理編程與企業工作負載最佳化。提供 100 萬 tokens 上下文視窗(預設與最大值)、最高 128k 輸出 tokens,並預設啟用思考模式。模型會自行決定思考時機與長度;開發者可透過 effort 參數(low、medium、high、xhigh、max)控制深度。
相較前代,關鍵新能力與行為改變包含:
- 更強的代理持久性——傾向持續至任務成功,而非止於貌似合理的答案。
- 更佳的自我驗證與根因除錯。
- 更好的多代理協作與子代理委派。
- 更強的視覺能力(圖表、文件、流程圖、UI/前端複刻,尤其結合反覆工具使用)。
- 增強的辦公/文件處理(複雜多工作表試算表、結構化簡報)。
- 對話中期工具切換(beta)、更低的 prompt-cache 門檻(512 tokens)、預設啟用 fallbacks 模式。
- Fast mode(研究預覽)在 Claude API 提供,速率較高。
Anthropic 稱其在成本為 Fable 5 一半的情況下提供前沿級智慧,並以改進的編程與專業工作能力驅動長時間運行代理。
Claude Opus 5 vs Opus 4.8
Opus 5 明確定位為對 Opus 4.8 的躍遷式升級。最大收益體現在長鏈問題的深度推理、代理編程與長期工具使用迴圈(完成多檔案特性與端到端工作、不留存根)、測試時間計算擴展、在較低 effort 下的效率、程式碼審查/除錯精度、視覺、多段長上下文一致性、辦公任務、以及多代理協調。
行為上,預設回應與書面交付物更長。在代理會話中更常敘述進度、更傾向委派子代理,且在無需提示下自行驗證。舊式如「包含最終驗證步驟」的指令會導致過度驗證與 tokens 浪費——應移除。
思考模式預設開啟(先前 4.8 需顯式設定)。在 effort 高於 high 的情況下不得關閉思考;若強行關閉會被拒絕。定價維持不變:每百萬輸入 $5 / 每百萬輸出 $25。
總之,遷移團隊應更新 model ID、在自家評測上重新評估預設 effort、從提示中移除驗證支架,並預期更長但更高質量、具更強自主性的輸出。
Performance Benchmarks: What will the data tell us?
Opus 5 在新穎與代理型評測中特別出色。以下數據來自 Anthropic 系統卡/發布資料與 2026 年 7 月下旬的獨立彙整;需注意實驗室數據採用供應商工具與提示策略。
Headline Coding and Agentic Results
- Frontier-Bench v0.1(代理終端編程):Opus 5 43.3% vs Fable 5 33.7% vs Opus 4.8 18.7%。
- SWE-bench Verified:96.0%(vs Fable 5 95.0%、Opus 4.8 88.6%)。
- SWE-bench Pro:79.2%(vs Fable 5 80.3%、Opus 4.8 69.2%)。
- DeepSWE v1.1:68.8%(具競爭力;部分 GPT-5.6 變體更高)。
- FrontierCode 1.1(medium effort 峰值):約 53.4% 主集 / 63.6% 擴展集——一項分析中最具計算效率的配置。
- CursorBench 3.2(max effort):與 Fable 5 峰值差距約 0.5%,但每任務成本約為其一半。在 high/xhigh/max effort 下展現出色的性價比。
Novel Reasoning and Fluid Intelligence
- ARC-AGI-3:30.2%(此前前沿約為 GPT-5.6 Sol 高 effort 的 7.8%;Opus 4.8 約 1.5%)。這是最大躍升;模型展現對遊戲動力的內部代數建模與類人樣本效率,遠超次佳模型約 3 倍——新問題求解能力強。
- GDPval-AA v2:在專業知識工作中達到最先進水準。
- Zapier AutomationBench:約為次佳模型的 1.5 倍,端到端業務自動化通過率高。
- OSWorld 2.0(電腦使用):以約三分之一成本超越 Fable 5 已公布的最佳成績。
- 在 HLE(Humanity’s Last Exam)與 DeepSearchQA 類深度研究任務中領先或名列前茅。
Computer Use, Knowledge Work, and Tool Use
- OSWorld 2.0:70.6%——在給定成本點下優於同儕。
- BrowseComp:約 90–90.8%(與頂尖 GPT-5.6 配置相當或略遜)。
- GDPval-AA v2(Elo):1861(領先 Fable 5 與前代)。
- AutomationBench:通過率高;部分分析顯示在相近成本下約為次佳模型的 1.5 倍。
Opus 5 帶來非漸進式提升,特別是在編碼、代理與知識工作評測。Anthropic 與獨立報告強調:
Science & Specialized Domains
在生命科學評測中相較 Opus 4.8 有明顯提升,包括:
- 有機化學(光譜推斷分子結構):+10.2 個百分點。
- 蛋白功能預測:+7.7 個百分點。
- 在結構生物學與生物資訊學中的持續進步。
由於 Fable 5 的生物安全防護更嚴,對許多科學研究工作流程而言,Opus 5 目前是 Anthropic 最強、普遍可用的模型。

來源: claude
整體公開排行榜綜合將 Opus 5 置於頂端附近(例如在 BenchLM 約 82.8/100、排名 215 個模型中的第 2 名),在知識、代理、編碼與多模態類別中百分位特別高。
真實開發者回饋好壞參半:一次性遊戲構建、複雜功能完成、自我除錯令人印象深刻,同時也有在大型程式碼庫上偶爾忽視指令、幻覺或過度複雜化的報告。基準測試反映受控條件下的峰值能力;實務結果高度依賴提示、工具設計與 effort 設定。
Benchmark Snapshot

來源: claude
Efficiency and Cost
定價與 Opus 4.8 相同:每百萬輸入 tokens 5 美元 / 每百萬輸出 tokens 25 美元。快取輸入顯著更便宜(約 0.50 美元)。Fast mode 約為 2 倍費率($10/$50)。相較 Fable 5 的 $10/$50,約為其一半。效率提升來自:
- 100 萬上下文允許整個程式碼庫或長文檔工作流程,無需過度分塊。
- 即使在低/中 effort 也有強勁表現(許多任務以更少 tokens 達到相當品質)。
- 內建自我驗證與迭代,降低失敗與人工修正迴圈。
- 對話中期工具切換(beta),維持 prompt cache。
真正的效率在於每美元與每 token 的表現。Opus 5 較早期 Opus 更可靠地把額外 effort 轉化為更好結果。中等 effort 經常以約低 effort 1.5 倍的 token 成本,達到編碼基準的峰值或近峰值;而 high/xhigh/max 在部分套件上可能報酬遞減或持平。
在發布期周邊公布的成本—效能曲線上,Opus 5 相較 Fable 5、Opus 4.8 與其他前沿模型,能以更低的有效任務完成成本取得更高分數。由於更長的推理與自我驗證,單次審查或代理迴圈的 token 消耗可能在絕對值上更高,但品質與完成率提升,使成功結果的總成本常常降低。

來源: claude
對生產團隊的實務建議是以預設的 high effort 起步,並在內部評測上掃描 low/medium。積極使用提示快取(現已可在更短長度下奏效)、對話中期工具切換以保留快取,並使用平台級回退。像 CometAPI 這樣的統一 API 閘道可進一步優化:將簡單任務路由到更便宜的模型(Sonnet/Haiku),把 Opus 5 保留給複雜代理工作,並提供集中使用分析與花費控管。
Safety and Alignment
Anthropic 表示 Claude Opus 5 是其「迄今最對齊的模型」且在多份報告中是「最安全的模型」。系統卡與公告要點:
- 整體對齊風險非常低;相較前代沒有新增令人擔憂的特性。
- 由 Anthropic 測得的欺瞞行為率最低。
- 對有害請求給出無害回應的比率高,且對良性查詢的過度拒絕率較低。
- 對特定濫用向量的抵抗力更佳;鑑於能力更強,網路安全防護更接近 Fable 5 的校準,但分類器觸發頻率更低(部分估計比 Fable 5 少約 85%)。
- 不跨越 Anthropic 的 Responsible Scaling Policy 在自動化 AI R&D 替代或較高化學/生物風險類別的門檻(在適用處採用類似近期 Opus 模型的 ASL-3 風格保護)。
在測試中依然存在較高的評測覺察(前沿模型常見)。實務部署監控顯示令人擔憂行為的比例非常低。與所有前沿模型一樣,組織仍應在應用層採取保護措施,尤其對高風險或自主代理使用情境。
How to Prompt Claude Opus 5 for Best Results
Anthropic 發布了模型專屬提示指南,因為 Opus 5 的行為不同於早期 Opus。最大變化:它會自我驗證、完成整個任務、可自行擴展範圍,且預設輸出較長。
Core principles for Opus 5
- 一次性給出完整任務——在單一提示中提供完整規格、背景、限制與期望成果。與逐步餵料相比,它在放手讓其運行時表現最佳。它會完成端到端功能,而非留下 TODO。
- 移除驗證指令——明確的「請再三檢查」、「驗證你的工作」、或「用子代理驗證」會導致過度驗證與 tokens 浪費。Opus 5 已在內部驗證與迭代。將這些行從 system prompt 與 CLAUDE.md 移除。
- 明確控制範圍——它能依判斷擴展任務。加入明確邊界:「只交付所請求且符合預期範圍的內容。常規判斷自行處理。只有在不同解讀會導致實質不同工作時才確認。若請求看似有誤,簡要指出並按原請求繼續。」
- 管理冗長——預設回應較長。若需精簡,加入:「請保持聚焦、精簡與簡潔。優先給出核心答案;保留簡短但必要的但書。」
- 善用 effort——從 high(預設)開始。對分類、簡單編輯或高量工作,盡量使用 low/medium 且確認品質足夠。將 xhigh/max 保留給最困難的編程與代理問題。重新評估從 Opus 4.8 繼承的 effort 設定。
- 子代理控制——它更傾向委派。指示:「只有在龐大、真正可獨立且可平行化的工作上才委派子代理。不要為驗證或少數幾次工具呼叫即可完成的工作使用子代理。」
- 審查與稽核——要求完整發現並附信心/嚴重性標籤,再自行過濾。若直接要求「只報告高嚴重性問題」,模型會字面遵循,可能忽略其他問題。
Example high-effort coding prompt skeleton
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Example low-effort classification
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
從 Opus 4.8 遷移:重測提示、移除驗證支架、加入明確長度/範圍控制,並在內部評測上掃描各 effort 等級。Anthropic 指出許多過去的詳細指令集現在可簡化。
Comparison Table: Claude Opus 5 vs Key Alternatives (Approximate, July 2026)
| Model | Input/Output ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Context | Notes |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43.3% | 96.0% | 30.2% | 1M | 每日高能力用途的最佳性價比 |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88.6% | Low | 1M | 前代 Opus |
| Claude Fable 5 | $10 / $50 | ~33.7% | ~95% | Lower | 1M | 更高等級,部分情境限制更多 |
| GPT-5.6 Sol (approx.) | Competitive | Lower | High | Lower | Varies | 具競爭力的替代方案 |
| Claude Sonnet 5 | Lower (~$3/$15 or promo) | Lower | Strong | Lower | 1M | 更快/更便宜的日常主力 |
數據來自 Anthropic 公告與聚合報告;請務必驗證最新的獨立評測。
CometAPI recommendation: CometAPI 透過 OpenAI 相容端點(https://api.cometapi.com/v1)與 Anthropic Messages API 支援,提供對 Claude Opus 5(以及 500+ 其他模型)的統一接入。標示價格具競爭力(例如撰寫時觀察到 Opus 5 約 $4/$20/MTok),只需一把 API 金鑰,簡化計費並便於切換模型。這對不想管理多個供應商帳戶或速率限制孤島的團隊特別實用。請查看當前 CometAPI 模型列表與定價以獲取最新費率與贈送 tokens 活動。
Conclusion
Claude Opus 5 為 Opus 系列樹立新標竿:在上一代價位下提供前沿級代理與推理能力,並在自我導向問題求解上(以 ARC-AGI-3 成績為代表)取得實質進步,同時達成 Anthropic 在此級別中最有利的對齊數據。它並非完美——領域性回退與實務指令遵循問題提醒我們基準並非全部——但就編程代理、長期工作流程、知識型工作與電腦使用應用而言,目前是最強的普遍可用選項之一。
配合嚴謹的提示紀律與 effort 控制,善用 100 萬上下文視窗,並智慧導流(使用官方 API 或 CometAPI 等平台)即可最大化價值。與任何前沿模型一樣,持續在自家資料上評估至關重要。Anthropic 的快速迭代節奏意味著後續優化將很快到來;Opus 5 已提供值得立即採用的、幅度可觀且具成本效率的能力飛躍。
Sources and further reading:
- Anthropic: What’s new in Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Prompting Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Anthropic news announcement references and system card (July 2026)
- DataCamp: Claude Opus 5 Explained — https://www.datacamp.com/blog/claude-opus-5
- MindStudio / Vellum / BenchLM benchmark roundups (July 2026)
- ARC Prize Foundation verified scores
