TLDR: Claude Opus 5 API sử dụng ID mô hình claude-opus-5 và hỗ trợ cả yêu cầu Messages kiểu Anthropic lẫn chat completions tương thích OpenAI thông qua CometAPI. Với ứng dụng Claude-native mới, dùng endpoint Messages. Với ứng dụng đang dùng SDK OpenAI, dùng endpoint chat completions. Thêm kiểm soát effort, bộ nhớ đệm, streaming và định tuyến để mô hình cao cấp chỉ xử lý phần việc cần thiết.
Điểm chính
- Phát hành ngày 24 tháng 7, 2026; API ID claude-opus-5.
- Năng lực gần Fable 5 với mức giá Opus ($5 input / $25 output mỗi MTok).
- Tăng mạnh trên Frontier-Bench (hơn gấp đôi Opus 4.8), CursorBench (cách Fable 5 ~0,5%), ARC-AGI-3 (gấp 3 lần mô hình kế tiếp), OSWorld 2.0 (vượt Fable 5 với chi phí ~1/3), và các benchmark công việc tri thức.
- Ngữ cảnh 1M, đầu ra tối đa 128K (lên đến 300K qua Batch API beta), tư duy thích ứng bật mặc định, Fast mode (~2,5× tốc độ với giá 2×).
- Tính năng API mới: thay đổi tool giữa cuộc hội thoại (beta), fallback mặc định, giảm tối thiểu prompt-cache (512 tokens).
- Phù hợp cho nhà phát triển, doanh nghiệp và nhóm cần năng lực cao mà không chịu chi phí hay ràng buộc lưu giữ dữ liệu của Fable 5.
- Có trên Claude API, claude.ai (Pro/Max/Team/Enterprise), Amazon Bedrock, Google Cloud, Microsoft Foundry — và qua các cổng hợp nhất như CometAPI.
Claude Opus 5 là gì?
Claude Opus 5 là phiên bản mới nhất thuộc hạng Opus trong dòng Claude—kích cỡ “mạnh nhất” dành cho tác vụ chuyên nghiệp đòi hỏi tác tử. Nó kế nhiệm Claude Opus 4.8 (phát hành ngày 28 tháng 5, 2026) và nằm dưới các mô hình lớp Mythos bị hạn chế (Mythos 5 và đối ứng công khai Fable 5) nhưng trên các hạng Sonnet và Haiku.
Anthropic mô tả đây là “một mô hình chu đáo, chủ động, tiệm cận trí tuệ biên của Claude Fable 5 với nửa mức giá.” Nó được thiết kế rõ ràng như mô hình trí tuệ cao dùng hằng ngày, thay vì một chuyên gia chỉ dành cho các dự án tác tử siêu dài hạn (nơi Fable 5 hoặc Mythos 5 vẫn có lợi thế, đặc biệt ở một số đánh giá liên quan an ninh mạng).
Đặc điểm chính gồm:
- Hành vi tác tử mạnh hơn: tự xác minh công việc, lặp cẩn thận, chẩn đoán nguyên nhân gốc thay vì chắp vá, và kiên trì qua nhiều bước.
- Hiệu quả cao hơn: báo cáo dùng ít token hơn cho kết quả tương đương hoặc tốt hơn so với Opus đời trước (ví dụ, ~26% ít token hơn trong một số công việc chuyên nghiệp).
- An toàn và căn chỉnh tăng cường: Anthropic gọi đây là “mô hình được căn chỉnh tốt nhất tới nay,” tỷ lệ hành vi đánh lừa thấp nhất và ít can thiệp an toàn không cần thiết hơn trên các tác vụ coding và rà soát bảo mật hợp lệ (bộ phân loại dự kiến can thiệp ít hơn ~85% so với Fable 5 trong nhiều quy trình dành cho developer).
- Hỗ trợ đa phương thức đầu vào (văn bản + hình ảnh/PDF) với đầu ra văn bản, phù hợp với các mô hình Claude gần đây.
- Hỗ trợ native cho tool, sử dụng máy tính và suy luận ngữ cảnh dài trong toàn cửa sổ 1M token ở mức giá tiêu chuẩn (không phụ phí ngữ cảnh dài).
Tóm lại, Claude Opus 5 thu hẹp phần lớn khoảng cách thực tế giữa thế hệ Opus trước và các sản phẩm biên thực thụ của Anthropic trong khi vẫn giữ cấu trúc chi phí làm Opus phổ biến trong sản xuất.
Tổng quan nhanh về Claude Opus 5
| Tính năng | Chi tiết |
|---|---|
| Ngày phát hành | 24 tháng 7, 2026 |
| API Model ID | claude-opus-5 |
| Định vị | Mô hình cao cấp hằng ngày cho coding tác tử phức tạp & công việc doanh nghiệp |
| Giá | $5 / MTok input, $25 / MTok output (như Opus 4.8) |
| Fast Mode | ~2,5× tốc độ ở $10 / $50 mỗi MTok (chỉ Claude API, nghiên cứu thử nghiệm) |
| Cửa sổ ngữ cảnh | 1M tokens (mặc định & tối đa) |
| Đầu ra tối đa | 128K tokens (lên đến 300K qua Message Batches API beta) |
| Mốc kiến thức | Tháng 5, 2026 (mô hình Claude cập nhật nhất) |
| Tư duy | Tư duy thích ứng bật mặc định |
| Mức nỗ lực | low / medium / high (mặc định) / xhigh / max |
| Khả dụng | Claude API, claude.ai, Bedrock, Vertex AI, Microsoft Foundry |
| Lưu giữ dữ liệu | Hỗ trợ zero data retention (không như ràng buộc của Fable 5) |
Có gì mới trong API?
Claude Opus 5 giới thiệu nhiều cải tiến thực tế và thay đổi hành vi ảnh hưởng tới triển khai sản xuất.
Thông số cốt lõi
- Model ID: claude-opus-5
- Ngữ cảnh: 1M tokens (không có biến thể nhỏ hơn)
- Đầu ra tối đa: 128K tokens (đồng bộ); lên đến 300K qua Message Batches API với beta header output-300k-2026-03-24
- Tư duy thích ứng bật mặc định
- Tham số effort có tác động mạnh hơn (low → max)
Tính năng mới
- Thay đổi tool giữa hội thoại (beta) Thêm hoặc gỡ tool giữa các lượt trong khi vẫn giữ prompt cache. Dùng beta header mid-conversation-tool-changes-2026-07-01. Điều này giảm chi phí và cải thiện bảo mật bằng cách tắt tool khi không còn cần.
- Chế độ fallback mặc định (beta) Tham số fallbacks mới hỗ trợ chế độ "default" ở beta với header server-side-fallback-2026-07-01. Nếu bộ phân loại an toàn từ chối yêu cầu và Anthropic có mô hình fallback khuyến nghị cho hạng mục từ chối đó, API có thể thử lại trên mô hình fallback và trả về một phản hồi. Áp dụng cho từ chối do bộ phân loại an toàn, không áp dụng cho giới hạn tần suất, quá tải hoặc lỗi máy chủ.
- Giảm tối thiểu prompt-cache Độ dài prompt có thể cache giảm còn 512 tokens (từ 1.024 trên Opus 4.8).
- Fast mode (nghiên cứu thử nghiệm) Chỉ có trên Claude API. Cho tốc độ khoảng 2,5× mặc định với giá gấp đôi ($10/$50 mỗi MTok).
Thay đổi hành vi (Quan trọng khi chuyển đổi)
- Không thể tắt Thinking ở xhigh hoặc max. Đây là thay đổi phá vỡ tương thích. Trên Opus 5, thinking: {"type": "disabled"} chỉ được chấp nhận ở high hoặc thấp hơn. Nếu bạn tắt thinking với xhigh hoặc max, yêu cầu sẽ trả về lỗi 400. Anthropic khuyến nghị giữ thinking bật khi có thể và kiểm soát chi phí bằng effort thấp hơn.
- Thinking bật mặc định: Opus 5 chạy với tư duy thích ứng mặc định. Nghĩa là mô hình quyết định chi phí suy luận ẩn cho mỗi lượt, chủ yếu được điều khiển bởi tham số effort. Vì max_tokens là trần cứng cho cả thinking và đầu ra hiển thị, ứng dụng sản xuất nên xem lại max_tokens khi chuyển từ Opus 4.8 sang Opus 5.
- Mô hình tường thuật tiến trình nhiều hơn trong phiên tác tử, sẵn sàng giao việc cho tiểu tác tử hơn, xác minh công việc kỹ hơn, và tạo phản hồi mặc định dài hơn.
- Loại bỏ các hướng dẫn xác minh cũ trong prompt — chúng có thể gây quá xác minh.
Việc chuyển đổi rất đơn giản: đổi model ID từ claude-opus-4-8 (hoặc cũ hơn) sang claude-opus-5 và rà soát thiết lập effort/thinking cùng max_tokens (vì token thinking nay cũng tính vào giới hạn).
Nguồn: What’s New in Claude Opus 5, Models Overview.
Hướng dẫn từng bước: Dùng Claude Opus 5 API với CometAPI
Bước 1: Đăng ký và lấy API Key
- Truy cập https://www.cometapi.com/ và tạo tài khoản miễn phí (không cần thẻ tín dụng cho tín dụng thử).
- Điều hướng tới mục token / bảng điều khiển API.
- Tạo API key mới (thường có dạng bắt đầu bằng sk-).
- Lưu trữ an toàn dưới dạng biến môi trường: export COMETAPI_KEY="your-key-here"
Không bao giờ hardcode key trong mã phía client hoặc kho công cộng.
Bước 2: Chọn kiểu endpoint
- Tương thích OpenAI (/v1/chat/completions): Phù hợp cho mã dễ chuyển đổi và định tuyến đa mô hình.
- Messages gốc Anthropic (/v1/messages): Truy cập đầy đủ tham số đặc thù Claude (effort, kiểm soát thinking, tool, thay đổi giữa hội thoại).
Base URL cho cả hai: https://api.cometapi.com/v1
Bước 3: Cài đặt SDK
Python (khuyến nghị cho hầu hết ví dụ):
Bash
pip install openai
hoặc SDK chính thức của Anthropic nếu dùng định dạng Messages gốc nhiều.
JavaScript/TypeScript:
Bash
npm install openai
Bước 4: Gọi thử đầu tiên
Ví dụ Messages gốc Anthropic:
Dùng route Messages gốc khi bạn muốn hành vi Claude-native và kiểm soát tốt hơn các tham số đặc thù Claude.
import os
import anthropic
client = anthropic.Anthropic(
base_url="https://api.cometapi.com",
api_key=os.environ["COMETAPI_KEY"],
)
message = client.messages.create(
model="claude-opus-5",
max_tokens=2000,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Review this rollout plan and list the top three technical risks."
}
],
)
print(message.content[0].text)
Vì sao đây là mặc định tốt:
- Giữ hành vi Claude sát với API gốc nhất.
- Hoạt động tốt cho quy trình nặng tool.
- Dễ suy luận về effort và ngân sách đầu ra.
Ví dụ Chat Completions tương thích OpenAI:
Nếu ứng dụng của bạn đã dùng SDK OpenAI, cách này giảm công sức chuyển đổi.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-opus-5",
messages=[
{
"role": "system",
"content": "You are a precise assistant. Be concise and verify claims."
},
{
"role": "user",
"content": "Summarize this incident and propose the next three actions."
}
],
max_tokens=1200,
)
print(response.choices[0].message.content)
Dùng route này khi tính di động quan trọng hơn các tinh chỉnh đặc thù Claude.
Để hỗ trợ đầy đủ API Messages gốc, hãy tham khảo tài liệu CometAPI và tham chiếu API Messages của Anthropic. Effort có thể điều khiển qua output_config hoặc tham số tương đương (low → max). Effort cao hơn tăng chất lượng và lượng token trên tác vụ khó.
Bước 6: Streaming phản hồi
Streaming hữu ích cho câu trả lời dài, trợ lý và công cụ viết mã.
const response = await fetch("https://api.cometapi.com/v1/messages", {
method: "POST",
headers: {
Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "claude-opus-5",
max_tokens: 2500,
stream: true,
messages: [
{
role: "user",
content: "Draft a root-cause analysis from these incident notes.",
},
],
}),
});
if (!response.ok) {
throw new Error(await response.text());
}
Trong sản xuất, hãy parse stream dưới dạng sự kiện thay vì chunk thô. Thêm hủy, retry và xử lý phản hồi một phần.
Bước 7: Sử dụng công cụ và quy trình tác tử
Claude Opus 5 đặc biệt mạnh ở gọi tool, lập kế hoạch nhiều bước, tự xác minh và hành vi tác tử dài hạn. Định nghĩa tool trong yêu cầu, để mô hình quyết định khi nào gọi, và triển khai vòng lặp thực thi trong ứng dụng của bạn. Tính năng thay đổi tool giữa hội thoại (beta) cho phép tập tool động mà không làm mất hiệu lực prompt cache.
Bước 8: Bộ nhớ đệm prompt và tối ưu chi phí
- Cache system prompt, định nghĩa tool và ngữ cảnh lớn (tối thiểu cache giảm xuống 512 tokens trên Opus 5).
- Dùng effort thấp hơn cho tác vụ đơn giản.
- Kết hợp xử lý batch nơi có để tiết kiệm thêm.
- Theo dõi sử dụng qua bảng điều khiển CometAPI.
Tính năng nâng cao và thực hành tốt nhất
Mức nỗ lực (Effort Levels)
Bắt đầu ở high mặc định. Giảm xuống medium hoặc low khi chất lượng vẫn chấp nhận được. Dành xhigh/max cho tác vụ tác tử hoặc nghiên cứu khó nhất. Effort cao hơn cải thiện lập kế hoạch, xác minh và tỷ lệ thành công trong công việc phức tạp nhưng tăng token và độ trễ.
Effort là một trong các núm điều chỉnh chính của Claude Opus 5.
| Effort | Phù hợp cho | Đánh đổi |
|---|---|---|
| low | trích xuất, định tuyến, tóm tắt đơn giản | chi phí thấp nhất, độ sâu suy luận thấp nhất |
| medium | phân tích thường lệ và coding | cân bằng |
| high | công việc phức tạp và mặc định cao cấp | chất lượng mạnh, chi phí vừa phải |
| xhigh | vòng lặp tác tử khó và tổng hợp sâu | chậm hơn và tốn kém hơn |
| max | bài toán cao cấp khó nhất | tiềm năng chất lượng cao nhất, chi phí & độ trễ cao nhất |
Nếu tác vụ đơn giản, đừng ép effort cao cấp. Nếu tác vụ khó, đừng đặt ngân sách đầu ra quá thấp.
Hướng dẫn nhắc lệnh
Opus 5 hưởng lợi từ phạm vi nhiệm vụ rõ ràng, tiêu chí thành công cụ thể và chỉ dẫn tự xác minh công việc. Nó chủ động và kỹ lưỡng hơn các đời Opus trước. Xem hướng dẫn prompting của Anthropic cho Opus 5 để biết các mẫu cụ thể.
Khuyến nghị định tuyến đa mô hình (lợi thế CometAPI)
Định tuyến lưu lượng thường lệ hoặc khối lượng lớn tới Claude Sonnet 5 (hoặc mô hình rẻ hơn). Nâng cấp các tác vụ coding phức tạp, phân tích sâu hoặc nhiệm vụ hệ trọng lên Claude Opus 5. Mẫu này tối ưu chi phí trong khi giữ chất lượng ở nơi quan trọng.
Tích hợp
CometAPI làm việc với Claude Code, Cursor, n8n, Zapier, Dify, Open WebUI và nhiều tác tử coding. Cập nhật base URL và key một lần để truy cập toàn bộ danh mục mô hình.
Hạn chế và khi nên chọn phương án thay thế
- Effort cao làm tăng độ trễ và chi phí — không lý tưởng cho chat siêu thấp độ trễ.
- Vẫn kém lớp Mythos/Fable ở một số đánh giá năng lực hai mục đích theo thiết kế.
- Có thể verbose hơn ở một số tác vụ; hướng dẫn rõ ràng giúp ích.
- Với tác vụ đơn giản khối lượng lớn, Sonnet 5 hoặc mô hình nhẹ hơn kinh tế hơn.
Luôn đánh giá trên workload cụ thể của bạn thay vì chỉ dựa vào benchmark công khai.
Trường hợp sử dụng thực tế và dữ liệu hỗ trợ
- Coding tác tử & debug: Kết quả mạnh trên Frontier-Bench và CursorBench; người dùng sớm báo cáo phân tích nguyên nhân gốc và nhất quán đa file tốt hơn.
- Tự động hóa doanh nghiệp: Tỷ lệ vượt qua cao trên Zapier AutomationBench.
- Khoa học & công việc tri thức: Nâng cao hiệu suất ở sinh học, hóa học và tác vụ phân tích phức tạp.
- Phân tích ngữ cảnh dài: Cửa sổ 1M đầy đủ cho phép quy trình ở quy mô repository hoặc đa tài liệu mà không phải cắt giảm mạnh.
- Sử dụng máy tính & tác tử: Cạnh tranh trên các đánh giá kiểu OSWorld với tỷ lệ chi phí-hiệu năng thuận lợi.
Nhận xét khách hàng Anthropic và benchmark độc lập (Artificial Analysis, ARC Prize) nhất quán cho thấy cải thiện đáng kể so với Opus 4.8 cùng mức giá, với Opus 5 tiệm cận mức Fable ở nhiều workload thực tế với nửa chi phí.
Lỗi thường gặp
Quá ít ngữ cảnh
Nếu bạn chỉ nói “sửa bug,” mô hình có thể đoán sai. Hãy cung cấp hành vi lỗi, file liên quan và tiêu chí chấp nhận.
Quá nhiều ngữ cảnh
Đổ cả repository vào mọi prompt tốn kém và nhiễu. Dùng truy xuất, cache hoặc chọn file có mục tiêu.
Quá ít ngân sách đầu ra
Thiết lập max_tokens thấp có thể cắt suy luận hoặc đầu ra hiển thị. Tăng ngân sách cho tác vụ khó.
Bỏ qua Effort
Nếu không điều chỉnh effort theo lớp tác vụ, bạn có thể trả quá cho việc đơn giản và thiếu lực cho việc khó.
Bảng so sánh phương thức API
| Endpoint | Phù hợp nhất cho | Ưu điểm | Nhược điểm |
|---|---|---|---|
| Messages gốc | Quy trình Claude-native | truy cập tính năng Claude tốt nhất | tích hợp tốn công hơn một chút |
| Chat tương thích OpenAI | Ứng dụng & router sẵn có | dễ chuyển đổi | có thể ẩn một số tinh chỉnh riêng của Claude |
| Streaming | UX tương tác | giảm độ trễ cảm nhận | phức tạp client cao hơn |
Ma trận định tuyến đề xuất
| Workload | Mô hình chính khuyến nghị | Mô hình nâng cấp | Lý do |
|---|---|---|---|
| Chat và hỗ trợ thường lệ | Claude Sonnet 5 hoặc Gemini Flash | Claude Opus 5 | Giữ độ trễ và chi phí thấp; nâng cấp ca khó |
| Tác tử coding phức tạp | Claude Opus 5 | Claude Fable 5 | Opus 5 hiệu năng tác tử coding mạnh với nửa giá Fable |
| Phân loại sơ bộ codebase lớn | Claude Sonnet 5 | Claude Opus 5 | Sonnet quét rộng; Opus xử lý nguyên nhân gốc và bản vá |
| Phân tích pháp lý hoặc tài chính | Claude Opus 5 | Claude Fable 5 | Phù hợp cho tài liệu dài cần độ chính xác cao |
| Xử lý tài liệu batch ngoại tuyến | Claude Opus 5 Batch API hoặc quy trình batch CometAPI | Claude Sonnet 5 cho lượt rẻ hơn | Batch và cache có thể tạo ra tiết kiệm lớn |
| Trợ lý UI thời gian thực | Claude Sonnet 5, Haiku, hoặc mô hình nhanh | Opus 5 fast mode | Opus 5 có thể quá chậm ở effort max cho tương tác đơn giản |
Kết luận
Claude Opus 5 nên được coi là mặc định cao cấp mới cho các quy trình Claude phức tạp, đặc biệt nếu bạn đã dùng Opus 4.8. Nó là lộ trình nâng cấp sạch nhất: cùng mức giá chính thức, suy luận mạnh hơn, hành vi tác tử tốt hơn, cửa sổ ngữ cảnh 1M token, và kiểm soát phong phú cho effort, fallback, cache và tốc độ.
Các bước tiếp theo được đề xuất:
- Tạo tài khoản CometAPI miễn phí và lấy key.
- Thử Claude Opus 5 so với mô hình hiện tại trong playground.
- Triển khai client tương thích OpenAI với cấu hình dựa trên biến môi trường.
- Thêm kiểm soát effort và theo dõi.
- Xây dựng định tuyến đa mô hình để tối ưu chi phí/hiệu năng.
Bắt đầu xây dựng hôm nay tại CometAPI. Để biết chi tiết mô hình và giá mới nhất, luôn đối chiếu tài liệu chính thức của Anthropic và trang mô hình CometAPI.
Câu hỏi thường gặp
Claude Opus 5 đã có sẵn chưa?
Có. Anthropic công bố Claude Opus 5 ngày 24 tháng 7, 2026 và liệt kê là có trên Claude API, AWS, Google Cloud và Microsoft Foundry.
Claude Opus 5 giá bao nhiêu?
Giá chính thức của Anthropic là $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra. Fast mode có giá $10 mỗi triệu token đầu vào và $50 mỗi triệu token đầu ra.
Claude Opus 5 có tốt hơn Claude Opus 4.8 không?
Với hầu hết công việc phức tạp, có. Nó giữ cùng giá token như Opus 4.8 nhưng tăng hiệu năng benchmark, khả năng mở rộng effort tốt hơn, thinking bật mặc định, hành vi tác tử tốt hơn, và cải tiến API.
Nên dùng Claude Opus 5 hay Claude Sonnet 5?
Dùng Opus 5 cho coding khó, tác tử dài hạn, phân tích doanh nghiệp và suy luận giá trị cao. Dùng Sonnet 5 cho quy trình sản xuất khối lượng lớn nơi tốc độ và chi phí quan trọng hơn.
Tôi có thể dùng Claude Opus 5 với CometAPI không?
Trang chủ CometAPI liệt kê Claude Opus 5 trong các mô hình hỗ trợ và cung cấp base URL API tương thích OpenAI. Trước khi triển khai sản xuất, hãy xác nhận tính sẵn sàng của mô hình, endpoint và giá trong bảng điều khiển CometAPI.
