GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Nghiên cứu CometAPI

Điểm chuẩn Claude Fable 5.1: Điểm số cho tôi biết điều gì

Tìm hiểu các điểm chuẩn của Claude Fable 5.1, các cải tiến chính, các hạn chế và các so sánh với Fable 5, Opus 5, GPT-5.6 Sol và GPT-6 Astra.

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 17, 2026 16 phút đọc
Điểm chuẩn Claude Fable 5.1: Điểm số cho tôi biết điều gì
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 chủ yếu là một nâng cấp về khả năng thực thi mang tính tác nhân. Mức cải thiện lớn nhất xuất hiện ở nghiên cứu khoa học, tự động hóa nghiệp vụ, lập trình trên terminal và các quy trình đòi hỏi lên kế hoạch, dùng công cụ, kiểm chứng và phục hồi qua nhiều bước. Cải thiện nhỏ hơn ở lập luận dạng đóng và các tác vụ mã hóa ngắn kiểu IDE, vì vậy quyết định triển khai tốt nhất phụ thuộc vào khối lượng công việc thay vì một điểm số tiêu đề duy nhất.

Điểm chính rút ra

  • Fable 5.1 đạt 52.6% trên Terminal-Bench-Science 0.1, hơn gấp đôi mức 24.7% của Fable 5 trong đánh giá của Anthropic.
  • AutomationBench tăng từ 17.1% lên 31.4%, cho thấy cải thiện lớn ở các quy trình nghiệp vụ đầu-cuối.
  • Mức tăng khiêm tốn hơn trên CursorBench và Humanity's Last Exam có hỗ trợ công cụ, gợi ý rằng bản phát hành này cải thiện thực thi bền bỉ hơn là mọi dạng lập luận ở mức ngang nhau.
  • Fable 5.1 giữ nguyên giá token tiêu chuẩn như Fable 5, trong khi giá đọc cache thấp hơn có thể giảm chi phí hiệu dụng cho các tác vụ tác nhân nặng ngữ cảnh.
  • GPT-6 Astra hiện là đối sánh mới hơn từ OpenAI, nhưng không được đưa vào bảng benchmark ngày 1/9 của Anthropic. Bất kỳ tuyên bố so sánh trực tiếp nào đều cần một đánh giá cùng bộ khung kiểm soát.

Anthropic phát hành Claude Fable 5.1 vào ngày 1 tháng 9, 2026 cho các tác vụ lập luận đòi hỏi cao, tác nhân dài hạn, kỹ nghệ phần mềm, nghiên cứu và công việc tri thức chuyên nghiệp. Claude Fable 5.1 cũng khả dụng qua CometAPI cho nhà phát triển muốn đánh giá song song với các mô hình tuyến đầu khác qua một endpoint hợp nhất.

Kết quả tiêu đề rất mạnh, nhưng phân bố mức cải thiện còn giàu thông tin hơn mức trung bình. Fable 5.1 tăng mạnh nhất khi một tác nhân phải giữ mục tiêu, tương tác công cụ, phục hồi lỗi và kiểm chứng trạng thái cuối. Bài viết này tập trung vào ý nghĩa của kết quả benchmark, những chỗ mô hình còn thiếu và cách đánh giá nó so với các lựa chọn mới hơn.

Claude Fable 5.1 trong nháy mắt

Tài liệu mô hình của Anthropic nêu cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128K, đầu vào văn bản và hình ảnh, tư duy thích ứng luôn bật và mốc kiến thức tháng 6/2026. Mã mô hình trên Claude API là claude-fable-5-1.

Thông số chính thứcClaude Fable 5.1
Nhà cung cấpAnthropic
Ngày phát hành1 tháng 9, 2026
Mã mô hìnhclaude-fable-5-1
Cửa sổ ngữ cảnh1,000,000 token
Đầu ra tối đa128,000 token
Nhập / xuấtVăn bản và hình ảnh → văn bản
Tư duyThích ứng, luôn bật
Mức nỗ lực mặc địnhCao
Mốc kiến thứcTháng 6, 2026
Giá input Anthropic$10 / MTok
Giá output Anthropic$50 / MTok
Đọc cache$0.25 / MTok
Độ trễ so sánhChậm hơn
Định vị chínhLập luận đòi hỏi cao và tác vụ tác nhân dài hạn

Giá input và output tiêu chuẩn giữ nguyên như Fable 5, trong khi giá đọc cache giảm xuống $0.25 mỗi triệu token. Fable 5.1 không có giá token input/output tiêu đề thấp hơn. Chi phí hiệu dụng thấp hơn chủ yếu đến từ mức giảm 75% của giá đọc cache. Anthropic ước tính khoảng 25% giảm chi phí cho khối lượng công việc điển hình và lên tới xấp xỉ 45% cho tác vụ tác nhân nặng.

Điều đó quan trọng vì một tác nhân chạy lâu sẽ lặp lại việc dùng ngữ cảnh kho mã, chỉ dẫn, định nghĩa công cụ và trạng thái trước đó. Chi phí mỗi tác vụ hoàn tất có thể cải thiện ngay cả khi giá token input và output tiêu đề không đổi.

Anthropic cũng báo cáo 60.9% cho Claude Mythos 5.1 trên Terminal-Bench 4.0. Mythos 5.1 là bản triển khai riêng với các biện pháp bảo vệ khác và không nên coi là điểm số Fable 5.1 bản phổ biến rộng rãi.

Các benchmark của Claude Fable 5.1 cho thấy gì?

Các giá trị dưới đây đến từ đánh giá tháng 9/2026 của Anthropic. Chúng mô tả một cấu hình mô hình–bộ khung, không phải thuộc tính bất biến của mô hình.

BenchmarkĐo lường điều gìFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Nghiên cứu khoa học mang tính tác nhân52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Lập trình terminal tự chủ55.8%42.0%52.3%37.3%
GDPval-AA v2Công việc tri thức chuyên nghiệp, Elo1853172318241711
OSWorld 2.0, partialSử dụng máy tính dài hạn77.9%72.9%75.4%
OSWorld 2.0, strictNhiệm vụ máy tính hoàn tất hoàn toàn41.7%36.1%39.6%
Humanity’s Last Exam, no toolsLập luận đa ngành cấp chuyên gia60.9%57.8%56.6%
Humanity’s Last Exam, with toolsLập luận chuyên gia có công cụ65.0%63.8%63.6%
AutomationBenchQuy trình nghiệp vụ đầu-cuối31.4%17.1%26.9%19.6%
CursorBench 3.2.0Mã hóa kiểu IDE mang tính tác nhân73.4%70.5%70.0%67.2%

Fable 5.1 dẫn trước Fable 5 và Opus 5 trên cả chín hàng được báo cáo. Mức tăng thế hệ lớn nhất xuất hiện ở nghiên cứu khoa học, tự động hóa quy trình nghiệp vụ và lập trình terminal. Các khác biệt nhỏ hơn trên Humanity's Last Exam và CursorBench cũng quan trọng vì cho thấy mức cải thiện không đồng đều ở mọi khối lượng công việc.

Fable 5.1 cải thiện mạnh nhất ở đâu?

Terminal-Bench-Science 0.1: kết quả nổi bật

Fable 5.1 đạt 52.6%, so với 24.7% của Claude Fable 5, 29.0% của Claude Opus 5 và 22.4% của GPT-5.6 Sol trong lần chạy của Anthropic. Khoảng cách thế hệ lớn 27.9 điểm lớn hơn đáng kể so với sai số chuẩn báo cáo trên mỗi mô hình, trong khi các khoảng cách nhỏ hơn—như 3.5 điểm giữa Fable 5.1 và Opus 5 trên Terminal-Bench 4.0—nên được diễn giải thận trọng hơn.

Terminal-Bench-Science đánh giá các quy trình nghiên cứu hoàn chỉnh trong các lĩnh vực khoa học và kỹ thuật. Tác nhân phải tạo ra mã, phân tích, chứng minh, mô phỏng hoặc sản phẩm dữ liệu thay vì chỉ trả lời các câu hỏi đơn lẻ. Anthropic báo cáo sai số chuẩn xấp xỉ ±3.5–4.5 điểm mỗi mô hình, vì vậy các chênh lệch nhỏ không nên tự động được coi là khác biệt năng lực có ý nghĩa.

Terminal-Bench 4.0: mã hóa tự chủ mạnh hơn

Fable 5.1 đạt 55.8%, vượt Fable 5 ở 42.0%, Opus 5 ở 52.3% và GPT-5.6 Sol ở 37.3%. Mức tăng 13.8 điểm so với Fable 5 là đáng kể, trong khi khoảng cách 3.5 điểm so với Opus 5 tương đối hẹp.

Benchmark đặt tác nhân trong môi trường thực thi, nên thành công phụ thuộc vào việc điều hướng môi trường, thay đổi mã và xác thực kết quả. Do Terminal-Bench 4.0 dùng tập nhiệm vụ khác với các bản trước, điểm số chỉ nên so sánh trong cùng phiên bản benchmark.

AutomationBench: mức tăng lớn nhưng còn nhiều dư địa

AutomationBench tăng từ 17.1% trên Fable 5 lên 31.4% trên Fable 5.1. Đó là tăng tuyệt đối 14.3 điểm, tương đương khoảng 84% theo tỷ lệ tương đối.

Benchmark đánh giá các quy trình trong bán hàng, marketing, vận hành, hỗ trợ, tài chính và nhân sự bằng cách kiểm tra trạng thái môi trường cuối. Điều này giúp đo được việc tác nhân thực sự hoàn tất quy trình thay vì chỉ đề xuất các hành động đúng. Điểm số cũng hé lộ hạn chế còn lại: khoảng hai phần ba nhiệm vụ vẫn chưa được hoàn thành dưới cấu hình báo cáo của Anthropic.

CursorBench 3.2.0: mức tăng mã hóa nhỏ hơn

Fable 5.1 đạt 73.4%, so với 70.5% của Fable 5, 70.0% của Opus 5 và 67.2% của GPT-5.6 Sol. Mức tăng so với Fable 5 chỉ 2.9 điểm.

Vì vậy bản phát hành có vẻ ít mang tính “lột xác” hơn trên các tác vụ mã hóa ngắn kiểu IDE so với những quy trình dài cần lên kế hoạch, thực thi, kiểm chứng và phục hồi. Bộ đánh giá nên bao gồm thay đổi ở quy mô kho mã và phục hồi sau test hỏng thay vì chỉ chất lượng sinh mã.

OSWorld 2.0: sử dụng máy tính vẫn khó

Fable 5.1 đạt 77.9% với tính điểm từng phần và 41.7% dưới tiêu chí hoàn tất nghiêm ngặt. Opus 5 đạt 75.4% và 39.6%, trong khi Fable 5 đạt 72.9% và 36.1%.

Điểm “strict” mang tính gợi ý sản xuất nhiều hơn. Chưa đến một nửa số nhiệm vụ được hoàn tất hoàn toàn, cho thấy tiến bộ trong sử dụng máy tính không loại bỏ nhu cầu về checkpoint, quyền hạn, giám sát và logic phục hồi.

CursorBench và Humanity's Last Exam: mức tăng nhỏ hơn

Fable 5.1 đạt 73.4% trên CursorBench 3.2.0, chỉ cao hơn Fable 5 2.9 điểm. Trên Humanity's Last Exam, mô hình tăng 3.1 điểm không dùng công cụ và 1.2 điểm có công cụ.

Các khoảng cách hẹp hơn này củng cố diễn giải trung tâm: Fable 5.1 mang tính đổi mới hơn ở các quy trình dài có lên kế hoạch, thực thi, kiểm chứng và phục hồi so với các tác vụ IDE ngắn hay lập luận học thuật dạng đóng.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Câu trả lời ngắn: Fable 5.1 là lựa chọn mạnh nhất trong bảng benchmark tầm nhìn dài do Anthropic công bố; Opus 5 là điểm khởi đầu kinh tế hơn khi chênh lệch hiệu năng nhỏ là chấp nhận được; Fable 5 vẫn là chuẩn cũ; GPT-6 Astra cần thử nghiệm cùng bộ khung trước khi xếp hạng trực tiếp.

Fable 5.1 là nâng cấp thế hệ rõ rệt so với Fable 5 trên các benchmark tác nhân dài hạn do Anthropic báo cáo. GPT-6 Astra là đối sánh cập nhật hơn từ OpenAI, nhưng được phát hành sau đánh giá ngày 1/9 của Anthropic và không nằm trong cùng bộ khung benchmark.

Chiều so sánhClaude Fable 5.1Claude Fable 5GPT-6 Astra
Cửa sổ ngữ cảnh1M token1M token1.05M token
Đầu ra tối đa128K128K128K
Giá input / output chuẩn$10 / $50 mỗi MTok$10 / $50 mỗi MTok$10 / $50 mỗi MTok
Đọc cache$0.25 / MTok$1 / MTokKiểm tra điều khoản nhà cung cấp hiện tại
Terminal-Bench-Science 0.152.6%24.7%Không có trong bảng ra mắt của Anthropic
Terminal-Bench 4.055.8%42.0%Không có trong bảng ra mắt của Anthropic
AutomationBench31.4%17.1%Không có trong bảng ra mắt của Anthropic
Định vị chínhLập luận đòi hỏi cao và tác nhân dài hạnChuẩn Fable-class trước đâyCông việc chuyên nghiệp đầu-cuối khó

So với Fable 5, Fable 5.1 cho thấy mức tăng đo được lớn nhất ở nghiên cứu khoa học, tự động hóa nghiệp vụ và lập trình terminal trong khi giữ nguyên giá token tiêu chuẩn. Giá đọc cache thấp hơn tiếp tục cải thiện hiệu kinh tế cho tác nhân tái sử dụng ngữ cảnh.

Quy tắc lựa chọn: Bắt đầu với Opus 5 khi chi phí là ưu tiên, nâng cấp lên Fable 5.1 khi mức hoàn tất dài hạn và khả năng phục hồi là quan trọng nhất, giữ Fable 5 chỉ cho các khối lượng công việc cần tương thích, và đánh giá GPT-6 Astra trong thử nghiệm cùng bộ khung trước khi áp dụng sản xuất.

Hiệu năng benchmark theo loại công việc?

Năng lựcKết quả Fable 5.1So với Fable 5Diễn giải
Nghiên cứu khoa học tác nhân52.6%+27.9 điểmMức tăng rất lớn
Tự động hóa quy trình nghiệp vụ31.4%+14.3 điểmMức tăng rất lớn
Lập trình terminal55.8%+13.8 điểmMức tăng lớn
Sử dụng máy tính, strict41.7%+5.6 điểmMức tăng vừa phải
Sử dụng máy tính, partial77.9%+5.0 điểmMức tăng vừa phải
Lập luận chuyên gia, không công cụ60.9%+3.1 điểmMức tăng nhỏ
Mã hóa IDE mang tính tác nhân73.4%+2.9 điểmMức tăng nhỏ
Lập luận chuyên gia, có công cụ65.0%+1.2 điểmMức tăng nhỏ
Công việc tri thức chuyên nghiệp1853 Elo+130 EloMạnh, nhạy với cấu hình

Mẫu hình nhất quán: cải thiện lớn nhất xuất hiện khi thành công phụ thuộc vào kiên trì, lên kế hoạch, tương tác môi trường, dùng công cụ và phục hồi theo thời gian.

Các benchmark không cho bạn biết điều gì?

Bảng benchmark nén hành vi thành các con số đơn lẻ. Chúng không chứng minh tác nhân tự chủ đã được giải quyết, và không dự đoán mọi khối lượng công việc sản xuất.

  • Bảng so sánh chính do nhà cung cấp chạy.
  • Thiết lập mức nỗ lực ảnh hưởng chất lượng, độ trễ và chi phí.
  • Benchmark tác nhân đo tổng hợp mô hình, bộ khung, công cụ và quyền hạn.
  • Biện pháp bảo vệ sản xuất được bật cho Fable 5.1 và ảnh hưởng một số kết quả.
  • Phiên bản benchmark thay đổi, vì vậy giá trị từ các bản nhiệm vụ khác nhau có thể không so sánh trực tiếp.
  • AutomationBench vẫn ở 31.4%, trong khi OSWorld strict vẫn ở 41.7%; tỷ lệ thất bại đáng kể vẫn tồn tại.

Một đánh giá thực tế nên dùng điểm công khai để rút gọn danh sách, tái lập so sánh nhỏ với thiết lập giống hệt, rồi kiểm thử quy trình sản xuất thực tế.

Claude Fable 5.1 có phải là mô hình Claude tốt nhất?

Đối với năng lực tối đa trên công việc dài hơi khó, bằng chứng benchmark tạo cơ sở vững cho Claude Fable 5.1. Cho mọi khối lượng công việc thì không.

Anthropic định giá $10 mỗi triệu token input và $50 mỗi triệu token output, so với $5 và $25 cho Opus 5. Mức chênh chỉ đáng nếu Fable 5.1 cho tỷ lệ thành công cao hơn, ít thử lại hơn, ít token mỗi tác vụ được chấp nhận hơn, hoặc giảm đủ thời gian rà soát của con người.

Giá đọc cache thấp hơn có thể thu hẹp khoảng cách chi phí hiệu dụng cho tác nhân. Chi phí mỗi kết quả được chấp nhận vì vậy hữu ích hơn đơn thuần giá mỗi token.

Nên benchmark Claude Fable 5.1 như thế nào?

Đánh giá của bạn nên giống với khối lượng công việc sản xuất dự định.

  • Mã hóa: Kiểm thử issue hoàn chỉnh và ghi nhận tỷ lệ bản vá được chấp nhận, bài test qua, số lần thử lại, lượt gọi công cụ, thời gian thực hiện và thời gian chỉnh sửa của con người.
  • Nghiên cứu: Đánh giá chất lượng nguồn, độ chính xác thực tế, độ bao phủ bằng chứng, hoàn thành tiểu nhiệm vụ và khả năng giữ mục tiêu trong chạy dài.
  • Tác nhân nghiệp vụ: Chấm theo trạng thái môi trường cuối thay vì đếm từng hành động đúng riêng lẻ.
  • Sử dụng máy tính: Đo phục hồi trước pop-up, trang chậm, phiên gián đoạn và trạng thái ứng dụng không nhất quán.
  • So sánh mô hình: Giữ nguyên prompt, bộ khung, công cụ, quyền hạn, thiết lập nỗ lực và quy tắc chấm.
  • Kinh tế: Đo chi phí mỗi tác vụ được chấp nhận, không chỉ chi phí mỗi token.

Kết luận

Bằng chứng benchmark gợi ý Fable 5.1 có giá trị nhất khi tác vụ cần thực thi bền bỉ thay vì một phản hồi đơn lẻ. Các trường hợp sử dụng mạnh nhất gồm nghiên cứu khoa học, mã hóa tự chủ, tự động hóa nghiệp vụ phức tạp và quy trình có kiểm chứng và phục hồi lặp lại.

Bằng chứng không ủng hộ sự vượt trội toàn diện. Các khoảng cách nhỏ trên một số benchmark, tỷ lệ thất bại đáng kể ở nhiệm vụ sử dụng máy tính strict và việc GPT-6 Astra vắng mặt trong bảng của Anthropic đều củng cố nhu cầu thử nghiệm theo khối lượng công việc cụ thể.

Với người dùng CometAPI, quy tắc triển khai thực tế là thử Fable 5.1 ở nơi thành công dài hạn có thể biện minh chi phí suy luận cao cấp, rồi so sánh với Opus 5, GPT-5.6 Sol và GPT-6 Astra trên cùng tác vụ đại diện trước khi chọn đường đi sản xuất.

Câu hỏi thường gặp

Điểm benchmark cao nhất của Claude Fable 5.1 là gì?

Trong các chỉ số phần trăm do Anthropic báo cáo, Fable 5.1 đạt 77.9% tính điểm từng phần trên OSWorld 2.0 và 73.4% trên CursorBench 3.2.0. Mức cải thiện thế hệ lớn nhất là Terminal-Bench-Science, ở 52.6% so với 24.7% của Fable 5.

Claude Fable 5.1 tốt hơn Fable 5 bao nhiêu?

Mức tăng khác biệt mạnh theo khối lượng công việc: 27.9 điểm trên Terminal-Bench-Science, 14.3 trên AutomationBench và 13.8 trên Terminal-Bench 4.0, nhưng chỉ 2.9 trên CursorBench và 1.2 trên Humanity’s Last Exam có công cụ.

Claude Fable 5.1 có tốt hơn Claude Opus 5 không?

Mô hình có điểm cao hơn trên bảng Anthropic báo cáo, nhưng nhiều chênh lệch là nhỏ. Anthropic khuyến nghị bắt đầu với Opus 5 và nâng cấp khi cần thêm năng lực dài hạn.

Claude Fable 5.1 có vượt GPT-5.6 Sol không?

Anthropic báo cáo Fable 5.1 cao hơn trên năm chỉ số chung. Vì đây là đánh giá đối thủ do nhà cung cấp thực hiện và cấu hình khác nhau, kết luận an toàn là Fable 5.1 rất cạnh tranh hơn là vượt trội ở mọi mặt.

Các kết quả có được xác minh độc lập không?

Chỉ một phần. Một số benchmark có bảng xếp hạng công khai, nhưng nỗ lực, bộ khung, hành vi dự phòng và phiên bản nhiệm vụ phải được căn chỉnh trước khi có thể so sánh trực tiếp với lần chạy ra mắt của Anthropic.

Claude Fable 5.1 mạnh nhất cho việc gì?

Hồ sơ benchmark của nó mạnh nhất cho nghiên cứu khoa học chạy dài, mã hóa tự chủ, quy trình tác nhân phức tạp, tự động hóa nghiệp vụ và các tác vụ yêu cầu lên kế hoạch, công cụ, kiểm chứng và phục hồi.

Tôi có thể truy cập Claude Fable 5.1 như thế nào?

Claude Fable 5.1 được liệt kê trên CometAPI với mã mô hình claude-fable-5-1. Endpoint hợp nhất giúp dễ dàng chạy cùng một khối lượng đánh giá trên nhiều mô hình trước khi chọn đường đi sản xuất.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 17, 2026
Cập nhật lần cuối Sep 17, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm