Tóm tắt: Claude Opus 5, do Anthropic phát hành vào ngày 24/07/2026, mang đến bước nhảy vọt so với Opus 4.8 về suy luận sâu, lập trình tác tử, nhiệm vụ tầm dài và giải quyết vấn đề mới. Mô hình đạt hoặc vượt Fable 5 đắt hơn ở các thước đo chính (gồm 43.3% trên Frontier-Bench v0.1 và kỷ lục 30.2% trên ARC-AGI-3) trong khi giữ nguyên giá như Opus 4.8—$5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra. Với cửa sổ ngữ cảnh 1M token, chế độ thinking bật theo mặc định, tự kiểm chứng mạnh và căn chỉnh được cải thiện (điểm hành vi lệch căn chỉnh thấp nhất trong các Claude gần đây), mô hình vượt trội ở lập trình phức tạp, sử dụng máy tính, công việc tri thức và quy trình đa tác tử. Nỗ lực mức trung bình thường cho hiệu suất tối ưu.
Những điểm chính
- Opus 5 là một nâng cấp mang tính thế hệ so với Opus 4.8, không phải tăng dần—đặc biệt ở độ bền tác tử, mở rộng compute ở thời điểm suy luận và trí tuệ linh hoạt (ARC-AGI-3 tăng từ ~1.5% lên 30.2%) từ Blog Claude.
- Vượt hoặc sánh ngang Fable 5 ở các benchmark lập trình/tác tử chủ chốt với chi phí xấp xỉ một nửa.
- Giá giữ nguyên ở $5/$25 mỗi triệu token; hiệu quả đến từ hiệu suất tốt hơn trên mỗi token và kết quả mạnh ngay cả ở mức effort trung bình/thấp.
- Hồ sơ an toàn tốt nhất của Anthropic trên dòng Opus, với giới hạn chủ ý về năng lực tấn công mạng và giảm kích hoạt bộ phân loại.
- Thay đổi cách nhắc: loại bỏ hướng dẫn xác minh kiểu cũ, ràng buộc phạm vi rõ ràng, kiểm soát độ dài và sử dụng subagent, tận dụng tham số effort từ Tài liệu Claude.
- Tốt nhất cho tác tử chạy dài, lập trình nhiều tệp, công việc tri thức và nhiệm vụ có hỗ trợ thị giác; báo cáo thực tế ghi nhận điểm mạnh trong demo/xây dựng phức tạp song đôi lúc có ma sát tuân thủ hướng dẫn trên codebase lớn.
- Nền tảng như CometAPI giúp dễ định tuyến lưu lượng giữa các mô hình Claude (và đối thủ) với thanh toán hợp nhất và dự phòng.
Claude Opus 5 ra mắt như flagship mới nhất trong hạng Opus. Được định vị thấp hơn lớp Mythos/Fable ở một số lĩnh vực chuyên biệt nhưng cạnh tranh hoặc vượt trội trên nhiều đánh giá công khai, nó nhắm vào lập trình tác tử phức tạp, công việc tri thức doanh nghiệp và nhiệm vụ tầm dài. Ra mắt chỉ hai tháng sau Opus 4.8, đây là bước nhảy thay vì cập nhật nhỏ.
Claude Opus 5 là gì?
Claude Opus 5 (API model ID: claude-opus-5) là mô hình Opus mới nhất của Anthropic, tối ưu cho lập trình tác tử phức tạp và khối lượng công việc doanh nghiệp. Mô hình có cửa sổ ngữ cảnh 1 triệu token (mặc định và tối đa), tối đa 128k token đầu ra, và thinking bật theo mặc định. Mô hình tự quyết định khi nào và suy nghĩ bao nhiêu; nhà phát triển điều khiển độ sâu qua tham số effort (low, medium, high, xhigh, max).
Các khả năng mới và thay đổi hành vi so với thế hệ trước gồm:
- Tính bền bỉ tác tử mạnh hơn—tiếp tục cho đến khi nhiệm vụ thành công thay vì dừng ở câu trả lời hợp lý.
- Cải thiện tự kiểm chứng và gỡ lỗi nguyên nhân gốc.
- Phối hợp đa tác tử và ủy thác subagent tốt hơn.
- Thị giác mạnh hơn cho biểu đồ, tài liệu, sơ đồ và tái tạo UI/frontend (đặc biệt với sử dụng công cụ lặp).
- Nâng cấp công việc văn phòng/tài liệu (bảng tính nhiều sheet phức tạp, slide deck có cấu trúc).
- Thay đổi công cụ giữa cuộc hội thoại (beta), hạ ngưỡng tối thiểu prompt cache (512 token), và chế độ dự phòng mặc định.
- Fast mode (bản xem trước nghiên cứu) khả dụng trên Claude API với mức giá cao hơn.
Anthropic mô tả mô hình cung cấp trí tuệ tầm biên với chi phí bằng nửa Fable 5 trong khi vận hành tác tử chạy dài với cải tiến ở lập trình và công việc chuyên nghiệp.
Claude Opus 5 vs Opus 4.8
Opus 5 được định khung rõ ràng là bước nhảy so với Opus 4.8. Lợi ích lớn nhất xuất hiện ở suy luận sâu qua chuỗi vấn đề dài, lập trình tác tử và vòng tool-use tầm dài (hoàn thiện tính năng nhiều tệp và công việc end-to-end không để stub), mở rộng compute thời điểm suy luận, hiệu quả ở mức effort thấp hơn, độ chính xác review code/tìm bug, thị giác, nhất quán ngữ cảnh dài, tác vụ văn phòng và phối hợp đa tác tử.
Về hành vi, phản hồi mặc định và sản phẩm viết dài hơn. Mô hình tường thuật tiến độ nhiều hơn trong phiên tác tử, ủy thác subagent dễ hơn, và tự xác minh mà không cần nhắc. Hướng dẫn cũ kiểu “thêm bước xác minh cuối cùng” nay gây xác minh quá mức và lãng phí token—hãy loại bỏ.
Thinking bật mặc định (trước đây ở 4.8 là adaptive/thinking cần đặt rõ). Tắt thinking chỉ cho phép ở effort high hoặc thấp hơn; effort cao hơn sẽ từ chối tắt thinking. Giá không đổi: $5 đầu vào / $25 đầu ra mỗi triệu token.
Tóm lại, đội ngũ di trú nên cập nhật model ID, đánh giá lại effort mặc định trên bộ đánh giá nội bộ, dọn bỏ giàn giáo xác minh khỏi prompt, và kỳ vọng đầu ra dài hơn nhưng chất lượng cao hơn với tự chủ mạnh hơn.
Benchmark hiệu năng: Dữ liệu nói gì?
Opus 5 đạt kết quả nổi bật, đặc biệt trên các đánh giá mới và tác tử. Tất cả số liệu dưới đây lấy từ thẻ hệ thống/tài liệu phát hành của Anthropic và tổng hợp độc lập tính đến cuối tháng 7/2026; lưu ý điểm do phòng lab báo cáo dùng khung và nhắc riêng của nhà cung cấp.
Kết quả lập trình và tác tử nổi bật
- Frontier-Bench v0.1 (lập trình tác tử qua terminal): Opus 5 43.3% vs Fable 5 33.7% vs Opus 4.8 18.7%.
- SWE-bench Verified: 96.0% (vs Fable 5 95.0%, Opus 4.8 88.6%).
- SWE-bench Pro: 79.2% (vs Fable 5 80.3%, Opus 4.8 69.2%).
- DeepSWE v1.1: 68.8% (cạnh tranh; một số biến thể GPT-5.6 cao hơn).
- FrontierCode 1.1 (đỉnh ở effort trung bình): ~53.4% chính / 63.6% mở rộng—cấu hình hiệu quả compute nhất trong một phân tích.
- CursorBench 3.2 (effort tối đa): Trong khoảng ~0.5% so với đỉnh của Fable 5 với chi phí mỗi nhiệm vụ khoảng một nửa. Hiệu suất-trên-đồng-đô mạnh ở high/xhigh/max.
Lý luận mới và trí tuệ linh hoạt
- ARC-AGI-3: 30.2% (mặt bằng trước đó ~7.8% cho GPT-5.6 Sol ở effort cao; Opus 4.8 ~1.5%). Đây là bước nhảy lớn nhất; mô hình thể hiện mô hình hóa đại số nội tại về động lực trò chơi và hiệu suất mẫu đạt mức con người trên môi trường chưa từng giải. Xấp xỉ gấp 3 mô hình kế tiếp—khả năng giải quyết vấn đề mới mạnh.
- GDPval-AA v2: Dẫn đầu trạng thái nghệ thuật cho công việc tri thức chuyên nghiệp.
- Zapier AutomationBench: ~1.5× mô hình kế tiếp với tỷ lệ pass cao trên tự động hóa nghiệp vụ end-to-end.
- OSWorld 2.0 (sử dụng máy tính): Vượt kết quả tốt nhất báo cáo của Fable 5 với chi phí xấp xỉ một phần ba.
- Dẫn đầu hoặc hàng đầu trên HLE (Humanity’s Last Exam) và các tác vụ nghiên cứu sâu kiểu DeepSearchQA.
Sử dụng máy tính, công việc tri thức và tool use
- OSWorld 2.0: 70.6%—vượt đối thủ ở mức chi phí đưa ra.
- BrowseComp: ~90–90.8% (cạnh tranh hoặc hơi sau các cấu hình GPT-5.6 top).
- GDPval-AA v2 (Elo): 1861 (dẫn Fable 5 và các thế hệ trước).
- AutomationBench: Tỷ lệ pass mạnh; báo cáo ~1.5× mô hình kế tiếp ở chi phí tương tự trong một số phân tích.
Opus 5 mang lại tăng trưởng không mang tính tăng dần, đặc biệt ở đánh giá lập trình, tác tử và công việc tri thức. Anthropic và báo cáo độc lập nhấn mạnh:
Khoa học & lĩnh vực chuyên sâu
Tăng đáng kể so với Opus 4.8 trên các đánh giá khoa học đời sống, gồm:
- Hóa hữu cơ (suy luận cấu trúc phân tử từ phổ): +10.2 điểm phần trăm.
- Dự đoán chức năng protein: +7.7 điểm phần trăm.
- Cải thiện nhất quán ở sinh học cấu trúc và tin sinh học.
Vì Fable 5 có bảo vệ sinh học hạn chế hơn, Opus 5 hiện là mô hình sẵn sàng rộng rãi mạnh nhất của Anthropic cho nhiều quy trình nghiên cứu khoa học.

Nguồn: claude
Tổng hợp bảng xếp hạng công khai đặt Opus 5 gần đỉnh (ví dụ, ~82.8/100 và hạng #2/215 trên BenchLM), với bách phân vị rất cao ở kiến thức, tác tử, lập trình và đa phương thức.
Phản hồi nhà phát triển thực tế pha trộn: dựng game one-shot ấn tượng, hoàn tất tính năng phức tạp và tự gỡ lỗi đi kèm báo cáo đôi lúc bỏ qua hướng dẫn, ảo giác trên codebase lớn hoặc làm quá phức tạp. Benchmark phản ánh năng lực đỉnh trong điều kiện kiểm soát; kết quả sản xuất phụ thuộc lớn vào prompt, thiết kế công cụ và cài đặt effort.
Ảnh chụp benchmark

Nguồn: claude
Hiệu quả và chi phí
Giá không đổi so với Opus 4.8: $5 mỗi triệu token đầu vào / $25 mỗi triệu token đầu ra. Input đã cache rẻ hơn đáng kể (~$0.50). Fast mode chạy khoảng 2× mức giá ($10/$50). Đây xấp xỉ bằng nửa mức $10/$50 của Fable 5. Cải thiện hiệu quả đến từ:
- Ngữ cảnh 1M cho phép quy trình toàn bộ codebase hoặc tài liệu dài mà không cần chia nhỏ gắt gao.
- Hiệu năng mạnh ngay cả ở effort thấp/trung bình (ít token hơn cho chất lượng tương đương trên nhiều tác vụ).
- Tự kiểm chứng và lặp tích hợp giảm lượt chạy lỗi và vòng sửa của con người.
- Thay đổi công cụ giữa hội thoại (beta) giúp giữ cache prompt.
Câu chuyện hiệu quả thực sự là hiệu suất trên mỗi đô và mỗi token. Opus 5 chuyển đổi effort tăng thêm thành kết quả tốt hơn đáng tin cậy hơn các Opus trước. Effort trung bình thường cho điểm đỉnh hoặc gần đỉnh trên benchmark lập trình với chi phí token ~1.5× so với effort thấp, trong khi high/xhigh/max có thể cho lợi suất giảm hoặc phẳng trên một số bộ.
Trên các đường cong chi phí-so-hiệu năng công bố dịp ra mắt, Opus 5 ở vị trí thuận lợi so với Fable 5, Opus 4.8 và các mô hình tuyến đầu khác—điểm cao hơn với chi phí hiệu dụng thấp hơn mỗi tác vụ hoàn tất. Tiêu thụ token mỗi lần review hoặc vòng tác tử có thể cao hơn tuyệt đối do suy luận và tự kiểm chứng dài hơn, nhưng chất lượng và tỷ lệ hoàn tất cải thiện đủ để tổng chi phí cho kết quả thành công thường giảm.

Nguồn: claude
Với đội sản xuất, khuyến nghị thực tế là bắt đầu ở effort mặc định high, rồi quét low/medium trên đánh giá nội bộ. Dùng prompt caching mạnh (nay khả thi ở độ dài ngắn hơn), thay đổi công cụ giữa hội thoại để giữ cache, và dự phòng cấp nền tảng. Cổng API hợp nhất như CometAPI có thể tối ưu thêm bằng cách định tuyến tác vụ đơn giản sang mô hình rẻ hơn (tầng Sonnet/Haiku) trong khi dành Opus 5 cho công việc tác tử phức tạp, với phân tích sử dụng và kiểm soát chi tiêu tập trung.
An toàn và căn chỉnh
Anthropic mô tả Claude Opus 5 là “mô hình căn chỉnh nhất đến nay” và “an toàn nhất từ trước đến nay” trong một số báo cáo. Điểm chính từ thẻ hệ thống và thông báo:
- Rủi ro căn chỉnh tổng thể rất thấp; không có thuộc tính đáng lo mới so với các mô hình trước.
- Tỷ lệ hành vi đánh lừa thấp nhất do Anthropic đo.
- Tỷ lệ phản hồi vô hại cao đối với yêu cầu có hại với mức từ chối quá mức thấp nhất đối với truy vấn lành tính.
- Kháng tốt hơn với một số vector lạm dụng; bảo vệ mạng hiệu chỉnh gần hơn mức Fable 5 xét năng lực mạnh hơn, nhưng bộ phân loại kích hoạt ít hơn (~85% ít hơn Fable 5 theo một ước tính).
- Không vượt ngưỡng Responsible Scaling Policy của Anthropic cho thay thế R&D AI tự động hoặc danh mục rủi ro hóa học/sinh học cao hơn (xử lý tương tự các mô hình Opus gần đây với bảo vệ kiểu ASL-3 khi áp dụng).
Mô hình vẫn có nhận thức đánh giá cao trong thử nghiệm (phổ biến ở mô hình tuyến đầu). Giám sát triển khai thực tế cho thấy tỷ lệ hành vi đáng lo rất thấp. Như mọi mô hình tuyến đầu, tổ chức nên áp dụng bảo vệ cấp ứng dụng, đặc biệt cho dùng tác tử tự chủ hoặc rủi ro cao.
Cách nhắc Claude Opus 5 để có kết quả tốt nhất
Anthropic đã công bố hướng dẫn nhắc riêng cho mô hình vì Opus 5 hành xử khác các thế hệ Opus trước. Thay đổi lớn nhất: tự kiểm chứng, hoàn thành trọn nhiệm vụ, có thể mở rộng phạm vi, và xuất mặc định dài hơn.
Nguyên tắc cốt lõi cho Opus 5
- Cung cấp đầy đủ nhiệm vụ ngay từ đầu — Đưa đủ đặc tả, ngữ cảnh, ràng buộc và kết quả mong muốn trong một prompt. Mô hình hoạt động tốt nhất khi để nó chạy thay vì nhỏ giọt từng bước. Nó hoàn tất tính năng end-to-end thay vì để stub.
- Loại bỏ hướng dẫn xác minh — Chỉ dẫn tường minh “kiểm tra lại,” “xác minh công việc,” hoặc “dùng subagent để xác minh” gây xác minh quá mức và lãng phí token. Opus 5 đã tự xác minh và lặp nội bộ. Hãy xóa các dòng này khỏi system prompt và CLAUDE.md.
- Kiểm soát phạm vi tường minh — Nó có thể tự mở rộng nhiệm vụ theo phán đoán. Thêm ranh giới rõ: “Chỉ giao đúng thứ được yêu cầu ở phạm vi dự kiến. Tự đưa ra phán đoán thường lệ. Chỉ hỏi lại khi diễn giải khác nhau có thể dẫn đến công việc khác biệt đáng kể. Nếu yêu cầu có vẻ sai, nêu ngắn gọn và tiếp tục theo yêu cầu.”
- Quản lý độ dài — Phản hồi mặc định dài hơn. Để súc tích, thêm: “Giữ câu trả lời tập trung, ngắn gọn. Ưu tiên cốt lõi; rút ngắn phần lưu ý.”
- Dùng effort khôn ngoan — Bắt đầu với high (mặc định). Dùng low/medium rộng rãi cho phân loại, chỉnh sửa đơn giản, hoặc khối lượng lớn nơi chất lượng vẫn giữ. Dành xhigh/max cho bài toán lập trình và tác tử khó nhất. Đánh giá lại thiết lập effort thừa hưởng từ Opus 4.8.
- Kiểm soát subagent — Mô hình ủy thác tích cực hơn. Chỉ dẫn: “Chỉ ủy thác cho subagent với nhiệm vụ lớn, thực sự độc lập và có thể song song. Không dùng subagent cho xác minh hoặc công việc bạn có thể hoàn tất trong vài lần gọi công cụ.”
- Review và audit — Yêu cầu phát hiện đầy đủ với nhãn độ tự tin/mức độ nghiêm trọng, rồi tự lọc. “Chỉ báo cáo vấn đề nghiêm trọng” sẽ được làm theo đúng nghĩa và có thể bỏ sót vấn đề.
Bộ khung prompt lập trình effort cao
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Ví dụ phân loại effort thấp
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
Khi di trú từ Opus 4.8: kiểm thử lại prompt, gỡ giàn giáo xác minh, thêm kiểm soát độ dài/phạm vi, và quét mức effort trên đánh giá nội bộ. Anthropic lưu ý nhiều bộ chỉ dẫn chi tiết cũ nay có thể giản lược.
Bảng so sánh: Claude Opus 5 vs lựa chọn chính (Xấp xỉ, 7/2026)
| Mô hình | Input/Output ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Ngữ cảnh | Ghi chú |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43.3% | 96.0% | 30.2% | 1M | Giá/hiệu năng tốt nhất cho dùng hàng ngày năng lực cao |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88.6% | Thấp | 1M | Opus trước |
| Claude Fable 5 | $10 / $50 | ~33.7% | ~95% | Thấp hơn | 1M | Tầng cao hơn, hạn chế hơn trong vài trường hợp |
| GPT-5.6 Sol (ước chừng) | Cạnh tranh | Thấp hơn | Cao | Thấp hơn | Khác nhau | Lựa chọn mạnh |
| Claude Sonnet 5 | Thấp hơn (~$3/$15 hoặc promo) | Thấp hơn | Mạnh | Thấp hơn | 1M | Nhanh/rẻ—daily driver |
Số liệu lấy từ thông báo của Anthropic và tổng hợp; luôn kiểm chứng các đánh giá độc lập mới nhất.
Khuyến nghị CometAPI: CometAPI cung cấp truy cập hợp nhất tới Claude Opus 5 (và 500+ mô hình khác) qua endpoint tương thích OpenAI (https://api.cometapi.com/v1) và hỗ trợ Anthropic Messages API. Mức giá niêm yết cạnh tranh (ví dụ, khoảng $4/$20 mỗi MTok quan sát tại thời điểm viết), với một khóa API, thanh toán đơn giản và dễ chuyển đổi mô hình. Điều này đặc biệt hữu ích cho đội muốn năng lực của Claude mà không phải quản lý nhiều tài khoản nhà cung cấp hoặc silo giới hạn tốc độ. Kiểm tra danh sách mô hình và giá hiện tại của CometAPI để biết mức mới nhất và chương trình token miễn phí.
Kết luận
Claude Opus 5 đặt ra tiêu chuẩn mới cho hạng Opus: hiệu năng tác tử và suy luận tầm biên ở mức giá của thế hệ trước, với tiến bộ đáng kể về giải quyết vấn đề tự định hướng (nhấn mạnh bởi kết quả ARC-AGI-3) và các chỉ số căn chỉnh thuận lợi nhất Anthropic từng công bố cho lớp này. Mô hình chưa hoàn hảo—hồi quy theo miền và báo cáo tuân thủ hướng dẫn thực tế nhắc chúng ta rằng benchmark không phải toàn bộ câu chuyện—nhưng cho tác tử lập trình, quy trình tầm dài, công việc tri thức và ứng dụng sử dụng máy tính, đây hiện là một trong những lựa chọn mạnh nhất sẵn có rộng rãi.
Kết hợp kỷ luật nhắc với “nút” effort, tận dụng cửa sổ ngữ cảnh 1M, và định tuyến lưu lượng thông minh (qua API chính thức hoặc nền tảng như CometAPI) để tối đa hóa giá trị. Như mọi mô hình tuyến đầu, đánh giá liên tục trên dữ liệu riêng của bạn vẫn thiết yếu. Nhịp cải tiến nhanh của Anthropic cho thấy tinh chỉnh tiếp theo sẽ đến sớm; Opus 5 đã mang lại một bước nhảy năng lực đáng kể, hiệu quả về chi phí, đáng áp dụng ngay hôm nay.
Nguồn và tài liệu đọc thêm:
- Anthropic: Có gì mới trong Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Cách nhắc Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Thông báo tin tức và thẻ hệ thống của Anthropic (7/2026)
- DataCamp: Giải thích Claude Opus 5 — https://www.datacamp.com/blog/claude-opus-5
- Tổng hợp benchmark của MindStudio / Vellum / BenchLM (7/2026)
- Điểm xác minh của ARC Prize Foundation
