Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-comparisons/Nghiên cứu CometAPI

Grok 4.7 vs Claude Fable 5.1: Điểm chuẩn, giá, lập trình, Agent và so sánh API

请提供需要翻译的原文内容(目标语言:Tiếng Việt)。

CometAPI
Deon GoodwinĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Oct 8, 2026 17 phút đọc
Grok 4.7 vs Claude Fable 5.1: Điểm chuẩn, giá, lập trình, Agent và so sánh API
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Grok 4.7 và Claude Fable 5.1 cạnh tranh trong cùng một phân khúc mô hình frontier, nhưng được tối ưu cho kinh tế triển khai khác nhau. Grok 4.7 tập trung vào lập trình, công việc tác tử và giá-hiệu năng, với cửa sổ ngữ cảnh 500K token và giá chính thức từ $2/M token đầu vào và $6/M token đầu ra. Claude Fable 5.1 tăng gấp đôi dung lượng ngữ cảnh lên 1M token, được thiết kế cho lập luận đòi hỏi cao và công việc tác tử tầm nhìn dài, với $10/M token đầu vào và $50/M token đầu ra.

Bức tranh điểm chuẩn là pha trộn thay vì một chiều. đánh giá ra mắt chính thức của xAI báo cáo Fable 5.1 dẫn trước trên CursorBench 4.0 và Terminal-Bench 4.0, trong khi Grok 4.7 dẫn trên DeepSWE v1.1, EEBench và Harvey Legal Agent Benchmark. Trên thực tế, lựa chọn ít về kẻ thắng tuyệt đối hơn và nhiều hơn về chi phí trên mỗi kết quả được chấp nhận, thời lượng tác vụ, yêu cầu ngữ cảnh, sử dụng công cụ và hành vi thử lại.

Điểm chính

  • Grok 4.7 có giá $2/M token đầu vào và $6/M token đầu ra dưới ngưỡng giá cao cho ngữ cảnh lớn; đầu vào đã cache là $0.50/M.
  • Claude Fable 5.1 có giá $10/M token đầu vào và $50/M token đầu ra, với đọc cache $0.25/M.
  • Claude Fable 5.1 cung cấp cửa sổ ngữ cảnh 1M token; Grok 4.7 cung cấp 500K token.
  • Ngôi đầu điểm chuẩn phụ thuộc vào tác vụ: Fable 5.1 dẫn ở một số kiểm thử lập trình tầm nhìn dài, trong khi Grok 4.7 dẫn ở các đánh giá kỹ thuật và tác tử theo miền trong so sánh của xAI.
  • Chỉ số sản xuất hữu ích nhất là chi phí trên mỗi tác vụ thành công, không phải giá trên mỗi triệu token một cách cô lập.

Grok 4.7 và Claude Fable 5.1 là gì?

Tổng quan Grok 4.7

Grok 4.7 là mô hình frontier của xAI cho lập trình, tác vụ tác tử và công việc tri thức, phát hành ngày September 21, 2026. xAI cho biết mô hình sử dụng một mô hình nền mới, lớn hơn Grok 4.6 và một giai đoạn RL dài hơn, nhấn mạnh các tác vụ có thể mất nhiều giờ để hoàn thành. Bản phát hành cũng nhấn mạnh khả năng tự kiểm chứng tốt hơn và quản lý ngữ cảnh dài.

Tài liệu nhà phát triển chính thức chỉ rõ model ID grok-4.7, cửa sổ ngữ cảnh 500,000 token, đầu vào văn bản và hình ảnh, đầu ra văn bản, bốn mức lập luận—low, medium, high và xhigh—và các công cụ bao gồm gọi hàm, tìm kiếm web, X search và thực thi mã.

Grok 4.7 vs Claude Fable 5.1: Điểm chuẩn, giá, lập trình, Agent và so sánh API

Hình ảnh ra mắt chính thức của Grok 4.7 - SpaceXAI

Tổng quan Claude Fable 5.1

Claude Fable 5.1 phát hành ngày September 1, 2026. Anthropic định vị mô hình cho lập luận đòi hỏi cao, lập trình chạy dài, nghiên cứu nhiều bước, công việc chuyên môn nặng tài liệu và tác tử hoạt động qua các phiên kéo dài.

Tài liệu mô hình của Anthropic chỉ rõ cửa sổ ngữ cảnh 1M token, tối đa 128K token đầu ra, đầu vào văn bản và hình ảnh, tư duy thích ứng và mốc kiến thức đáng tin cậy đến June 2026.

Grok 4.7 vs Claude Fable 5.1: Điểm chuẩn, giá, lập trình, Agent và so sánh API

Hình ảnh ra mắt chính thức của Claude Fable 5.1 - Anthropic

So sánh nhanh Grok 4.7 và Claude Fable 5.1

SpecificationGrok 4.7Claude Fable 5.1
Release dateSeptember 21, 2026September 1, 2026
ProviderxAI / SpaceXAIAnthropic
Model IDgrok-4.7claude-fable-5-1
Primary positioningLập trình, tác tử, công việc tri thứcLập luận đòi hỏi cao và tác tử tầm nhìn dài
Context window500K tokens1M tokens
Max outputKhông có giới hạn đầu ra văn bản cố định được ghi nhậnTối đa 128K tokens
Input modalitiesVăn bản + hình ảnhVăn bản + hình ảnh
OutputVăn bảnVăn bản
Knowledge cutoffMay 2026June 2026
ReasoningLow / Medium / High / xhighTư duy thích ứng + điều khiển mức nỗ lực
Web/search toolsTìm kiếm web + X searchPhụ thuộc môi trường/công cụ
Function/tool callingCóCó
Model weightsĐóngĐóng
CursorBench 4.0 coding performance46.3%51.8%
DeepSWE v1.1 agent performance71.0% (high effort)70.0%
Terminal-Bench 4.0 agent performance38.0%57.9%
Typical use caseTrợ lý lập trình nhạy cảm chi phí và tác tử web/XLập trình tầm nhìn dài và công việc chuyên môn nhạy cảm lỗi

Sự khác biệt cấu trúc lớn nhất là dung lượng ngữ cảnh và kinh tế token. Tài liệu API chính thức của Grok 4.7 xác nhận ngữ cảnh 500K và giá cơ bản $2/$6, trong khi tài liệu Fable 5.1 của Anthropic xác nhận ngữ cảnh 1M và giá cơ bản $10/$50.

Kết quả điểm chuẩn đối đầu

So sánh trực tiếp rõ ràng nhất hiện tại đến từ bảng điểm chuẩn ra mắt Grok 4.7 của xAI, trong đó báo cáo cả hai mô hình trong cùng một đánh giá đã công bố.

Các con số dưới đây do nhà cung cấp báo cáo, không phải tái lập độc lập. Trong bảng đã công bố của xAI, Grok 4.7 được đánh giá ở mức xhigh effort và Claude Fable 5.1 ở mức max effort; xAI ghi chú riêng kết quả DeepSWE của Grok 4.7 là high effort. Hãy dùng chúng để nhận diện mẫu hình khối lượng công việc, rồi tự xác thực cả hai mô hình trên prompt, công cụ, kho mã và tiêu chí chấp nhận của chính bạn.

BenchmarkGrok 4.7Claude Fable 5.1Chênh lệch quan sát
CursorBench 4.046.3%51.8%Fable +5.5 điểm
DeepSWE v1.171.0%*70.0%Grok +1.0 điểm
AA Briefcase v1.11,6571,678Fable +21
Terminal-Bench 4.038.0%57.9%Fable +19.9 điểm
Harvey Legal Agent Benchmark19.6%6.7%Grok +12.9 điểm
HealthBench Professional56.7%62.1%Fable +5.4 điểm
EEBench64.0%56.4%Grok +7.6 điểm
  • xAI ghi chú kết quả DeepSWE của Grok 4.7 là high effort. Điểm cốt lõi là chuyên môn theo tác vụ thay vì thứ bậc chung: Fable mạnh hơn ở một số quy trình lập trình tầm nhìn dài và công việc chuyên môn, trong khi Grok mạnh hơn ở các bài kiểm tra kỹ thuật và tác tử theo miền trong cùng bảng của nhà cung cấp.

Công việc tri thức chuyên nghiệp

Trong bảng đối đầu của xAI, Fable 5.1 nhỉnh hơn nhẹ ở AA Briefcase v1.1, trong khi Grok 4.7 dẫn ở EEBench và Harvey Legal Agent Benchmark. Fable 5.1 dẫn ở HealthBench Professional. Sự phân hóa này nhấn mạnh một điểm đơn giản: công việc tri thức không phải một năng lực duy nhất. Kỹ thuật, y khoa, pháp lý, tài chính, nghiên cứu và tự động hóa văn phòng đòi hỏi công cụ và lập luận khác nhau.

Hiệu năng lập trình

Lập trình là nơi so sánh tinh tế nhất. Trên CursorBench 4.0, Fable 5.1 đạt 51.8% so với 46.3% của Grok 4.7. Trên DeepSWE v1.1, Grok 4.7 đạt 71.0% so với 70.0% của Fable 5.1. Khác biệt lớn nhất xuất hiện trên Terminal-Bench 4.0, nơi Fable 5.1 đạt 57.9% so với Grok 4.7 ở 38.0%.

Coding dimensionGrok 4.7Claude Fable 5.1
Repository engineeringRất mạnhRất mạnh
DeepSWENhỉnh hơn nhẹ trong bảng xAIRất sát nhau
CursorBench 4.046.3%51.8%
Terminal autonomyMạnhThế mạnh lớn
Long-context codebase work500K ngữ cảnh1M ngữ cảnh
Repeated-call token costThấp hơn nhiềuCao cấp
Native xAI code executionHỗ trợPhụ thuộc môi trường/công cụ Claude
Long unattended executionTrọng tâm huấn luyện rõĐịnh vị sản phẩm cốt lõi

Hàm ý triển khai có thể là Fable 5.1 đáng chú ý cho các tác tử lập trình nặng terminal chạy dài, trong khi Grok 4.7 hấp dẫn khi chất lượng kỹ nghệ phần mềm đạt yêu cầu và chi phí token ảnh hưởng đáng kể đến kinh tế đơn vị.

Quy trình tác tử

Cả hai mô hình đều được thiết kế cho quy trình tác tử thay vì các phiên hỏi-đáp đơn lẻ. xAI cho biết Grok 4.7 được huấn luyện trên tập tác vụ khó hơn, kéo dài hơn và cải thiện tự kiểm chứng. Anthropic mô tả Fable 5.1 là mô hình cho công việc có thể chạy hàng giờ và trải rộng nhiều ứng dụng.

Agent requirementGrok 4.7Claude Fable 5.1
Long-running reasoningMạnhRất mạnh
Context capacity500K1M
Self-verificationTrọng tâm huấn luyện rõTrọng tâm tầm nhìn dài
Tool useMạnhMạnh
Search-native workflowWeb + X searchPhụ thuộc môi trường
Long repeated contextBộ nhớ đệm prompt + nén1M ngữ cảnh + đọc cache giá thấp
Raw token costThấp hơnCao hơn

Giá và kinh tế triển khai

Official base pricingGrok 4.7Claude Fable 5.1
Input / 1M tokens$2$10
Cached input / cache read$0.50 dưới 200K prompt$0.25
Output / 1M tokens$6$50
10M input tokens$20$100
10M output tokens$60$500
US regional endpoint premium+10%Phụ thuộc nền tảng

Ở mức token tiêu chuẩn không cache, giá token đầu vào của Grok 4.7 thấp hơn 80% so với Fable 5.1 và giá token đầu ra thấp hơn 88%. Tuy nhiên, giá đọc cache của Anthropic có thể giảm đáng kể chi phí hiệu dụng của Fable 5.1 trong các khối lượng tác tử lặp lại.

Lưu ý về giá: Con số $2/M đầu vào và $6/M đầu ra của Grok 4.7 là mức cơ bản. SpaceXAI ghi nhận mức giá ngữ cảnh cao hơn cho các yêu cầu vượt quá ngưỡng 200K ngữ cảnh. Các phép tính dưới đây giả định yêu cầu nằm trong tầng giá cơ bản và không bao gồm phí công cụ, phụ phí khu vực và chi phí ghi cache.

Ví dụ khối lượng công việc: 10M token đầu vào + 2M token đầu ra.

  • Grok 4.7: $20 đầu vào + $12 đầu ra = $32.
  • Claude Fable 5.1: $100 đầu vào + $100 đầu ra = $200.
  • Chênh lệch danh nghĩa trước hiệu ứng cache: $168.

Chỉ số sản xuất tốt hơn là chi phí trên mỗi tác vụ hoàn thành thành công. Một mô hình đắt hơn vẫn có thể kinh tế nếu nó giảm lượt thử lại, thất bại hoặc cần sửa của con người. Một mô hình rẻ hơn có thể vượt trội khi cả hai đều vượt qua cùng bài kiểm định chấp nhận.

Kiểm soát ngữ cảnh và lập luận

Fable 5.1 cung cấp cửa sổ ngữ cảnh 1M token, so với 500K token của Grok 4.7. Khác biệt này có thể quan trọng với kho mã rất lớn, tập tài liệu, khám phá pháp lý, nghiên cứu khoa học hoặc tác tử mang lịch sử dài.

Grok 4.7 cung cấp các mức lập luận low, medium, high và xhigh. Fable 5.1 dùng tư duy thích ứng với điều khiển mức nỗ lực. Các nhãn này không trực tiếp tương đương, vì vậy thử nghiệm công bằng nên giữ tác vụ và tiêu chí chấp nhận cố định thay vì đối chiếu tên cài đặt.

Năng lực đa phương thức và công cụ

Cả hai mô hình đều chấp nhận văn bản và hình ảnh. API của Grok 4.7 bao gồm gọi hàm, tìm kiếm web, X search và thực thi mã. Claude Fable 5.1 được tối ưu cho tài liệu, bảng tính, trình chiếu, nghiên cứu và quy trình tác tử chạy dài, với hành vi công cụ phụ thuộc vào môi trường Claude hoặc ngăn xếp ứng dụng.

CapabilityGrok 4.7Claude Fable 5.1
Text inputCóCó
Image inputCóCó
Function/tool callingCóCó
Web searchCông cụ gốc của xAIPhụ thuộc môi trường
X searchGốcKhông có tích hợp X độc quyền tương đương
Code executionCông cụ gốc của xAIPhụ thuộc môi trường
Documents / spreadsheets / slidesTrọng tâm công việc tri thức chungTrọng tâm sản phẩm rõ ràng

Tóm tắt quyết định

DimensionGrok 4.7Claude Fable 5.1
Coding qualityTiên phongTiên phong
CursorBench 4.046.3%51.8%
DeepSWE v1.171.0%*70.0%
Terminal-Bench 4.038.0%57.9%
EEBench64.0%56.4%
Harvey Legal Agent19.6%6.7%
HealthBench Professional56.7%62.1%
Context500K1M
Input price$2/M$10/M
Output price$6/M$50/M
SearchWeb + XPhụ thuộc công cụ/môi trường
Long-running agentsMạnhThế mạnh lớn
Price-performanceLợi thế lớnTầng năng lực cao cấp
Typical fitKhối lượng frontier nhạy cảm mở rộngTác vụ tầm nhìn dài giá trị cao

Có thể dùng Grok 4.7 và Claude Fable 5.1 qua CometAPI không?

Có. Grok 4.7 API trong CometAPI và Claude Fable 5.1 API trong CometAPI có thể dùng như một phần của chiến lược định tuyến đa mô hình. Điều này quan trọng vì kiến trúc sản xuất tốt nhất có thể không cần chỉ chọn một mô hình frontier.

Một mẫu định tuyến thực tế là:

  • Tuyến mặc định: Grok 4.7 cho các tác vụ frontier nhạy cảm chi phí.
  • Tuyến leo thang: Claude Fable 5.1 khi đánh giá thất bại, tác vụ vượt yêu cầu ngữ cảnh, hoặc tác tử chạy dài cần thực thi terminal mạnh hơn.

Cách này cho phép đội ngũ so sánh tỷ lệ kết quả được chấp nhận, tổng token, độ trễ, lượt thử lại và chi phí trên mỗi kết quả được chấp nhận thay vì dựa vào một bảng xếp hạng công khai.

Grok 4.7 vs Claude Fable 5.1: Cách lựa chọn

Chọn Grok 4.7 cho khối lượng việc nhạy cảm chi phí và tích hợp tìm kiếm gốc

  • Trợ lý lập trình khối lượng lớn nơi chi phí token ảnh hưởng đáng kể đến kinh tế đơn vị.
  • Tác tử kỹ thuật hoặc chuyên môn nơi kết quả theo miền của Grok phù hợp với khối lượng công việc.
  • Nghiên cứu hưởng lợi từ tìm kiếm web và X search gốc.
  • Xử lý tri thức theo lô và tự động hóa nền lặp lại.
  • Khối lượng công việc nơi cả hai mô hình đều vượt qua ngưỡng chấp nhận như nhau và chi phí trở thành yếu tố quyết định.

Đối với nhà phát triển dùng cổng đa mô hình, Grok 4.7 API trong CometAPI có thể được đánh giá cùng các mô hình frontier khác qua một lớp tích hợp.

Chọn Claude Fable 5.1 cho khối lượng việc tầm nhìn dài và nhạy cảm thất bại

  • Lập trình tự chủ nhiều giờ và quy trình nặng terminal.
  • Kho mã hoặc tập tài liệu rất lớn hưởng lợi từ cửa sổ ngữ cảnh 1M token.
  • Tác tử chuyên môn phức tạp cần duy trì trạng thái qua nhiều bước.
  • Quy trình kinh doanh giá trị cao nơi chi phí thử lại hoặc thất bại lớn hơn chi phí suy luận thô.
  • Nghiên cứu và tự động hóa nơi các điểm chuẩn tác tử tầm nhìn dài của Anthropic khớp chặt với nhu cầu sản xuất.

Claude Fable 5.1 API trong CometAPI dùng model ID claude-fable-5-1; giá và định tuyến nên được xác minh tại thời điểm triển khai vì mức giá qua cổng có thể thay đổi độc lập với bảng giá của Anthropic.

Kết luận

Grok 4.7 là điểm khởi đầu mạnh hơn khi chi phí token, công cụ web/X gốc và quy trình tác tử nhạy cảm quy mô chi phối quyết định. Claude Fable 5.1 là ứng viên mạnh hơn khi cửa sổ ngữ cảnh 1M token và các tác vụ lập trình hoặc công việc chuyên môn chạy dài đòi hỏi nhiều hơn giá token cơ bản. Kết quả điểm chuẩn do nhà cung cấp báo cáo là pha trộn, vì vậy không có mô hình nào thắng tuyệt đối.

Trước khi chọn, hãy kiểm thử cả hai trên cùng các tác vụ sản xuất, công cụ, ngân sách thời gian và tiêu chí chấp nhận. So sánh chi phí trên mỗi kết quả được chấp nhận, độ trễ, lượt thử lại, lỗi công cụ và thời gian chỉnh sửa của con người cùng với điểm số đã công bố.

Câu hỏi thường gặp

Các đội ngũ nên đánh giá Grok 4.7 vs Claude Fable 5.1 như thế nào cho công bằng?

Bắt đầu với tác vụ sản xuất đại diện thay vì bảng xếp hạng chung. Dùng cùng trạng thái kho mã, quyền công cụ, ngân sách thời gian và tiêu chí chấp nhận cho cả hai. Ghi nhận tỷ lệ kết quả được chấp nhận, độ trễ đầu-cuối, token đầu vào và đầu ra, hành vi cache, lỗi công cụ, lượt thử lại và thời gian chỉnh sửa của con người. Chạy đủ số lần lặp để tách hành vi mô hình khỏi biến thiên tác vụ.

Khi nào Grok 4.7 có thể tốn hơn Claude Fable 5.1 trên mỗi tác vụ được chấp nhận?

Giá token thấp có thể trở nên đắt hơn khi nó gây thêm lượt thử lại, prompt dài hơn, lỗi gọi công cụ hoặc cần nhiều rà soát thủ công. Ngược lại, mô hình cao cấp không tự động kinh tế: tỷ lệ hoàn thành cao hơn của nó phải bù được chi phí suy luận tăng thêm. Hãy so sánh chi phí trên mỗi tác vụ được chấp nhận, không chỉ chi phí trên mỗi token.

Khi nào bộ định tuyến nên leo thang từ Grok 4.7 sang Claude Fable 5.1?

Dùng các kích hoạt đo lường được. Tuyến mặc định nhạy cảm chi phí có thể xử lý tác vụ vượt kiểm định nhanh chóng, trong khi leo thang có thể kích hoạt khi tác vụ vượt phạm vi ngữ cảnh ưa thích, trượt đánh giá tự động, cần thực thi terminal kéo dài hoặc có chi phí sai sót cao. Ghi log kích hoạt và kết quả để điều chỉnh chính sách định tuyến bằng bằng chứng sản xuất.

Những lưu ý điểm chuẩn nào quan trọng nhất trong so sánh Grok 4.7 vs Claude Fable 5.1?

Quan trọng nhất là phiên bản điểm chuẩn, mức nỗ lực lập luận, khung tác tử, quyền công cụ, lớp bảo vệ và việc kết quả do nhà cung cấp báo cáo hay được tái lập độc lập. Ví dụ, CursorBench 3.2.0 và 4.0 không nên so sánh như cùng một bài kiểm tra. Điểm số công khai hữu ích để hình thành giả thuyết, nhưng quyết định triển khai nên dựa trên đánh giá nội bộ có kiểm soát.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Oct 8, 2026
Cập nhật lần cuối Oct 8, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Đọc thêm