Claude Opus 5 API 概覽
Claude Opus 5 API 是 Anthropic 的 Opus 級模型,面向複雜的智能體式編碼、企業自動化、深度推理、長上下文分析與高價值知識工作。Anthropic 於 2026 年 7 月 24 日發佈 Claude Opus 5,API 模型 ID 為 claude-opus-5,提供 1M-token 上下文視窗、128k 的同步最大发电生輸出、預設啟用自適應思考,並新增 effort、fallback、提示快取與工具變更等控制項。
技術規格
| 項目 | 規格 |
|---|---|
| 模型名稱 | Claude Opus 5 |
| API 模型 ID | claude-opus-5 |
| 供應商 | Anthropic |
| 原生 CometAPI 端點 | POST /v1/messages |
| OpenAI 相容的 CometAPI 端點 | POST /v1/chat/completions |
| 輸入型別 | 文字與圖片輸入 |
| 輸出型別 | 文字輸出 |
| 上下文視窗 | 1M tokens |
| 最大輸出 tokens | 在同步 Messages API 上為 128k tokens;在支援的 Message Batches API 要求上,搭配 Anthropic 的 output-300k-2026-03-24 beta 標頭可達 300k 輸出 tokens |
| 自適應思考 | 是;預設開啟 |
| Effort 控制 | low、medium、high、xhigh 與 max;在 Claude API 與 Claude Code 上預設為 high |
| Anthropic 官方定價 | 每百萬輸入 tokens $5、每百萬輸出 tokens $25 |
| 提示快取定價 | 每百萬 5 分鐘快取寫入 $6.25、每百萬 1 小時快取寫入 $10、每百萬快取命中 $0.50 |
| CometAPI 列示定價 | 每百萬輸入 tokens $4、每百萬輸出 tokens $20,依 2026 年 7 月 26 日查詢之 CometAPI Claude Opus 5 模型頁面 |
| 可靠的知識截斷點 | 2026 年 5 月 |
什麼是 Claude Opus 5,有哪些新變化?
Claude Opus 5 是繼 Claude Opus 4.8 之後的下一代 Opus 模型。Anthropic 將其定位為複雜的智能體式編碼與企業工作首選,而 Claude Fable 5 則在對智慧峰值要求較高、願意以價格或延遲換取能力的工作負載中更具優勢。實務差異主要在於性價比:Anthropic 表示,Opus 5 以官方 token 價格的一半,能力逼近 Fable 5,並在相同官方價格下較 Opus 4.8 大幅提升。
對開發者而言,最大變化不僅是更強的模型字串。其 API 行為也改變,將影響生產整合。自適應思考預設啟用,而 effort 參數成為在深度、速度與 token 使用之間取捨的主要手段。該模型同時支援更低的提示快取下限(512 tokens)、測試中的對話中途工具變更、測試中的伺服器端回退行為,以及在 Claude API 上的快速模式。此外,在 xhigh 或 max effort 下停用思考會返回 400 錯誤;若應用必須停用思考,應使用 high 或以下的 effort。
Claude Opus 5 的基準表現
Claude Opus 5 擁有來自 Anthropic、ARC Prize 與 Artificial Analysis 的強力基準數據支持。Anthropic 報告顯示,Opus 5 在 Frontier-Bench v0.1 上的成績較 Claude Opus 4.8 提升逾一倍,且每任務成本更低;在最大 effort 下,其 CursorBench 3.2 分數僅比 Claude Fable 5 的峰值低 0.5%,並在特定知識工作與電腦操作的性價比比較上表現優異。
獨立基準提供者則帶來更具體的數字。ARC Prize 報告顯示,Claude Opus 5 High 在 ARC-AGI-3 上取得 30.16%;Opus 5 Max 在 ARC-AGI-1 上取得 97.5%,在 ARC-AGI-2 Semi-Private 上取得 90.4%。Artificial Analysis 報告 Claude Opus 5 Max 的 Intelligence Index 得分為 61,在最大 effort 下的 Terminal-Bench v2.1 得分為 89%,GDPval-AA v2 的 Elo 為 1861,AA-Briefcase 的 Elo 為 1720。
| 基準或指標 | Claude Opus 5 成績 |
|---|---|
| ARC-AGI-3 Public Demo,High effort | 30.16% |
| ARC-AGI-1,Max effort | 97.5% |
| ARC-AGI-2 Semi-Private,Max effort | 90.4% |
| Artificial Analysis Intelligence Index,Max effort | 61 |
| Terminal-Bench v2.1,Max effort | 89% |
| GDPval-AA v2,Max effort | 1861 Elo |
| AA-Briefcase,Max effort | 1720 Elo |
| 輸出速度,Max effort | 每秒 52.6 tokens |
| 第一個答案 token 的時間,Max effort | 68.04 秒 |
這些結果表明,當工作流程重視規劃、驗證、工具使用、多步驟完成與長上下文推理時,Claude Opus 5 表現最為強勁。同時也顯示高推理設定下的延遲取捨,因此生產團隊應以每個成功任務的成本為準,而不僅是基準排名。
Claude Opus 5 的功能與亮點
1M-Token 上下文以應對大型工作負載
Claude Opus 5 支援 1M-token 的上下文視窗,且同時是預設與最大值。這使其適用於倉庫規模的程式碼處理、冗長法律合約、多文件研究、財務活頁簿、事件時間線、客服歷史以及企業知識庫分析。
預設啟用自適應思考
不同於需要明確啟用自適應思考的 Claude Opus 4.8,Claude Opus 5 預設即啟用自適應思考。模型會自行決定每回合的思考投入量,開發者則以 effort 來調整行為。
Effort 等級用於成本與品質控制
Claude Opus 5 支援 low、medium、high、xhigh 與 max effort 等級。Anthropic 建議從預設的 high 開始,若品質維持則下調,需要應對最艱難且長時程的編碼或智能體任務時再上調。
更強的智能體式編碼與驗證
Anthropic 表示,Opus 5 在智能體式編碼、長時程任務、程式碼審查與錯誤偵測方面相較 Opus 4.8 有躍升。在實務中,當 AI 智能體需要檢查檔案、呼叫工具、執行檢查、修正錯誤,並完成多檔案工作,而非僅撰寫程式碼片段時,這是值得測試的模型級別。
短上下文的更佳提示快取經濟性
最小可快取提示長度由 Claude Opus 4.8 的 1,024 tokens 降至 Claude Opus 5 的 512 tokens。對於重複的智能體會話、共用的 system 提示、工具描述或長專案上下文,提示快取能降低重複輸入成本,因為快取命中的價格低於新鮮輸入 tokens。
對話中途的工具變更
Claude Opus 5 支援測試中的對話中途工具變更。開發者可在回合之間新增或移除可用工具,同時保留提示快取。當智能體從研究轉向編碼、從編碼轉向測試、或從分析轉向部署時,這特別有用。
伺服器端回退以應對拒絕情形
Anthropic 測試中的 fallbacks 參數可用於安全分類器的拒絕類別,套用預設回退模式。這不是一般可用的或針對速率限制的重試系統;其設計用於 Anthropic 針對特定拒絕類別所建議的回退模型情境。
Claude Opus 5 vs Claude Sonnet 5 vs Opus 4.8 vs Fable 5
| 維度 | Claude Opus 5 | Claude Sonnet 5 | Claude Opus 4.8 | Claude Fable 5 |
|---|---|---|---|---|
| 最佳角色 | 複雜的智能體式編碼與企業工作 | 更快速的高智慧生產工作 | 先前的 Opus 基準與遷移回退 | 最強大的廣泛發布 Claude 能力 |
| API 模型 ID | claude-opus-5 | claude-sonnet-5 | claude-opus-4-8 | claude-fable-5 |
| Anthropic 官方價格 | $5/M 輸入、$25/M 輸出 | 2026-08-31 前 $2/M 輸入與 $10/M 輸出;2026-09-01 起 $3/M 輸入與 $15/M 輸出 | $5/M 輸入、$25/M 輸出 | $10/M 輸入、$50/M 輸出 |
| 相對延遲 | 中等 | 快速 | 未列於當前最新模型比較表;先前 Opus 階的基準 | 較慢 |
| 自適應思考 | 預設開啟 | 預設開啟 | 可用但非預設,除非在請求中指定 | 永遠開啟 |
| Effort 支援 | low、medium、high、xhigh、max | low、medium、high、xhigh、max | low、medium、high、xhigh、max | low、medium、high、xhigh、max |
| 知識截斷點 | 2026 年 5 月 | 2026 年 1 月 | 未顯示於 Anthropic 的當前最新模型表 | 2026 年 1 月 |
| 適用時機 | 當需要 Opus 等級的準確度,但 Fable 5 過於昂貴或緩慢時使用 | 用於高流量的編碼、支援、文件與智能體工作流程 | 保留作為固定的舊行為、回退或遷移對照 | 當最高可用的 Claude 能力可抵銷較高成本時使用 |
此外,它們的最大輸入與上下文視窗相同。
在這組模型中,Claude Opus 5 是最均衡的高階選擇。Claude Sonnet 5 更適合對量敏感的生產流量;Claude Opus 4.8 在 Opus 5 上線後主要作為舊版基準;Claude Fable 5 則是在成本次要時追求更高能力的選擇。
如何在 CometAPI 上使用 Claude Opus 5 API
第 1 步:建立 CometAPI 金鑰
登入 CometAPI,開啟 API 金鑰頁面,建立金鑰,並將其儲存在例如 COMETAPI_KEY 的環境變數中。不要將生產用 API 金鑰放在用戶端程式碼、公共版本庫、螢幕截圖或技術支援單中。
第 2 步:呼叫原生 Anthropic Messages 端點
當你需要 Claude 特有行為(如自適應思考、effort 控制、提示快取、工具使用、網路搜尋、串流,以及 Anthropic 風格的回應內容區塊)時,使用原生的 /v1/messages 路由。
第 3 步:使用 OpenAI 相容端點以實現可移植路由
當應用程式已使用 OpenAI 相容 SDK,或你想在同一層路由下比較 Claude Opus 5 與 GPT、Gemini、DeepSeek、Kimi、Qwen 等模型時,使用 /v1/chat/completions。
在生產環境中,請以真實提示同時測試兩個端點,並記錄輸入 tokens、輸出 tokens、快取行為、effort 等級、延遲、拒絕行為與最終任務成功率。針對 Claude 特定參數以 Anthropic 官方文件為準,並參考 CometAPI 文件了解該請求結構如何被轉送。
使用 Claude Opus 5 可以做什麼
Claude Opus 5 最適合正確性與執行力比一次性便宜答案更重要的應用。開發者可以構建倉庫規模的編碼智能體、遷移助手、錯誤調查工具、程式碼審查系統、長上下文研究助手、法律與財務文件分析器、科學文獻工作流、技術支援升級機器人、試算表與投影片生成工具,以及自主運營助手。
它也適合作為多模型架構中的升級模型。產品可以將一般支援或抽取流量路由至 Claude Sonnet 5 或更低成本模型,而在遇到模糊、有風險或高價值回合時再升級到 Claude Opus 5。此模式能讓高階模型聚焦在更深度推理會影響結果的工作上。
在艱難的編碼智能體、根因除錯、多檔案重構、程式碼審查、企業文件分析、財務建模、法律審查、科學推理、長上下文研究、專業報告生成與營運自動化等情境中使用 Claude Opus 5 API。於 CometAPI 上,最強的部署模式是選擇性升級:將 Claude Opus 5 與 Claude Sonnet 5、Claude Fable 5 及非 Claude 替代方案進行測試,然後依每個被接受結果的成本而非僅依模型名聲來路由各種工作負載。
為何在 CometAPI 上使用 Claude Opus 5?
當團隊需要單一 API 金鑰、統一計費、模型比較,以及更容易在供應商間遷移時,CometAPI 對 Claude Opus 5 很有用。CometAPI 同時提供原生的 Anthropic Messages 端點與 OpenAI 相容的 Chat Completions 端點,因此團隊可以在進階工作流程中選擇 Claude 原生控制項,或維持可移植的整合形態以支援多模型路由。
侷限
Claude Opus 5 是高階推理模型,並非每個請求的預設選擇。在較高 effort 設定下,模型可能消耗更多 tokens,且第一個 token 的輸出時間較輕量模型更長。Artificial Analysis 報告在最大 effort 測量下第一個答案 token 的時間為 68.04 秒,這使得路由與 effort 選擇對使用者導向應用尤為重要。
開發者也不應假設不受支援的行為。Anthropic 未披露模型參數量,且模型權重為專有。快速模式在 Claude API 上處於研究預覽階段,並非所有雲平台皆可用。伺服器端回退與對話中途工具變更屬於測試中的功能。針對安全工作流程,Anthropic 表示 Opus 5 能支援有益的漏洞發現用例,但對於風險較高的任務(如基於二進位的漏洞掃描、滲透測試與漏洞利用生成)會套用防護措施。