GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Nghiên cứu CometAPI

Grok 4.7: Điểm chuẩn, định giá, tính năng và truy cập API

Tìm hiểu Grok 4.7 là gì, bao gồm cửa sổ ngữ cảnh 500K, các điểm chuẩn, giá, các chế độ lập luận, khả năng của tác nhân, so sánh với Grok 4.6 và cách truy cập.

CometAPI
Deon GoodwinĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 22, 2026 16 phút đọc
Grok 4.7: Điểm chuẩn, định giá, tính năng và truy cập API
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 là mô hình tuyến đầu của SpaceXAI dành cho lập trình, quy trình tác tử và công việc tri thức chuyên nghiệp, phát hành ngày 21 tháng 9, 2026. Nó kết hợp cửa sổ ngữ cảnh 500.000 token, đầu vào văn bản và hình ảnh, suy luận có thể cấu hình, gọi hàm, tìm kiếm web và X, và thực thi mã.

Với prompt dưới 200.000 token, API chính thức của xAI niêm yết $2 mỗi triệu token đầu vào, $0,50 mỗi triệu token đầu vào được bộ nhớ đệm, và $6 mỗi triệu token đầu ra. CometAPI hiện liệt kê Grok 4.7 ở mức $1,60 đầu vào, $0,40 đầu vào được bộ nhớ đệm, và $4,80 đầu ra mỗi triệu token cho cùng hạng—giảm 20% so với mức giá chính thức hiển thị trên trang mô hình của nhà cung cấp.

Giá trị thực tế không nằm ở vị trí dẫn đầu mọi benchmark. Grok 4.7 nổi bật nhất khi khối lượng công việc kết hợp các tác vụ kỹ thuật, vòng lặp tác tử dài, sử dụng công cụ, ngữ cảnh làm việc lớn, và nhạy cảm với chi phí token đầu ra. Các nhóm nên kiểm chứng trên chính kho mã và quy trình của mình trước khi định tuyến vào sản xuất.

Các điểm chính

  • Grok 4.7 dùng mô hình nền lớn hơn Grok 4.6, học tăng cường lâu hơn trên các tác vụ khó kéo dài nhiều giờ, và tự kiểm chứng mạnh hơn.
  • API hỗ trợ cửa sổ ngữ cảnh 500.000 token, đầu vào văn bản và hình ảnh, đầu ra văn bản, bốn mức suy luận, đầu ra có cấu trúc, gọi hàm, tìm kiếm web và X, và thực thi mã.
  • SpaceXAI báo cáo 46,3% trên CursorBench 4.0, 71,0% trên DeepSWE v1.1, và 38,0% trên Terminal-Bench 4.0. Đây là kết quả do nhà cung cấp công bố, không phải bằng chứng về vị trí dẫn đầu phổ quát.
  • CometAPI liệt kê Grok 4.7 sẵn có, với điểm cuối tương thích OpenAI và giá thấp hơn 20% so với mức xAI chính thức hiện hiển thị trong danh mục.
  • Chọn Grok 4.7 cho các tác tử kỹ thuật nhạy về giá và sử dụng công cụ bền bỉ; chọn mô hình khác khi ngữ cảnh rất dài hoặc một lĩnh vực then chốt về benchmark quan trọng hơn giá đơn vị.

Grok 4.7 là gì?

Grok 4.7 là mô hình ngôn ngữ lớn tuyến đầu mới nhất của SpaceXAI, định vị cho lập trình, tác vụ tác tử tự chủ và công việc tri thức chuyên nghiệp. Bản phát hành tập trung vào các tác vụ cần tương tác bền bỉ, sử dụng công cụ, kiểm chứng và chỉnh sửa thay vì chỉ câu trả lời một lần.

SpaceXAI cho biết Grok 4.7 được huấn luyện với chạy học tăng cường dài hơn trên phối trộn tác vụ khó hơn, được thiên về các vấn đề có thể mất nhiều giờ để hoàn thành. Hướng huấn luyện này khiến nó đặc biệt phù hợp với kỹ thuật phần mềm ở cấp kho, gỡ lỗi, nghiên cứu, tạo tài liệu, phân tích kỹ thuật, và tự động hóa nhiều bước.

Grok 4.7 khác gì—và tốt hơn—Grok 4.6?

Mô hình nền lớn hơn

Grok 4.7 chuyển sang mô hình nền lớn hơn so với Grok 4.6. SpaceXAI chưa công bố số tham số công khai cuối cùng, nên kết luận phòng thủ là tăng dung lượng mô hình nền—không phải một ước lượng tham số cụ thể.

Học tăng cường dài hơn trên tác vụ khó hơn

Giai đoạn học tăng cường được kéo dài và dịch chuyển về các vấn đề khó hơn, có tầm dài. SpaceXAI nhấn mạnh các tác vụ có thể cần hàng giờ làm việc, phù hợp với lập trình tự chủ, nghiên cứu, và quy trình tác tử chuyên nghiệp.

Tự kiểm chứng mạnh hơn

Grok 4.7 được huấn luyện để kiểm tra kỹ lưỡng sản phẩm của chính mình. Điều này quan trọng trong kỹ thuật phần mềm vì một tác tử đáng tin cậy phải liên tục kiểm tra, sửa đổi, kiểm thử, chẩn đoán lỗi, chỉnh sửa và xác nhận—không chỉ tạo ra câu trả lời đầu tiên.

Cải thiện đo lường so với Grok 4.6

Khía cạnhGrok 4.6Grok 4.7Thay đổi
CursorBench 4.040,4%46,3%+5,9 điểm
DeepSWE v1.165,2%71,0%+5,8 điểm
EEBench53,0%64,0%+11,0 điểm
AA Briefcase v1.11.5461.657+111
Terminal-Bench 4.020,3%38,0%+17,7 điểm
Harvey Legal Agent Benchmark15,8%19,6%+3,8 điểm
HealthBench Professional48,5%56,7%+8,2 điểm

Trên bộ kết quả công bố khi ra mắt, Grok 4.7 cải thiện so với Grok 4.6 ở mọi mục liệt kê. Mức tăng tuyệt đối lớn nhất là trên Terminal-Bench 4.0, phù hợp với trọng tâm phát hành về quy trình dòng lệnh và sử dụng công cụ kéo dài. Những con số này vẫn là kết quả do nhà cung cấp công bố và nên được kiểm thử đối với tác vụ thực tế trước khi quyết định chuyển đổi.

Grok 4.7 đạt mức nào trên các benchmark?

Đánh giá khi ra mắt của SpaceXAI bao trùm kỹ thuật phần mềm, công việc terminal, tác vụ văn phòng chuyên nghiệp, pháp lý, suy luận lâm sàng và kỹ thuật điện. Đây là kết quả do nhà cung cấp công bố và nên được xác thực với khối lượng công việc sản xuất trước khi ra quyết định mua sắm hoặc định tuyến.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046,3%40,4%41,7%51,8%
DeepSWE v1.171,0%*65,2%72,7%70,0%
EEBench64,0%53,0%39,4%56,4%
AA Briefcase v1.11.6571.5461.4871.678
Terminal-Bench 4.038,0%20,3%37,3%57,9%
Harvey Legal Agent Benchmark19,6%15,8%2,5%6,7%
HealthBench Professional56,7%48,5%60,5%62,1%

Trong kết quả ra mắt Grok 4.7, SpaceXAI ghi chú điểm 71,0% trên DeepSWE v1.1 là mức nỗ lực suy luận cao.

Thông báo ra mắt không tiết lộ đầy đủ từng bộ dây harness của benchmark, cấu hình công cụ, số lần chạy, hoặc môi trường đánh giá. Hãy coi các giá trị này là kết quả do nhà cung cấp công bố và xác thực mô hình trên chính kho mã, công cụ, mục tiêu độ trễ và tiêu chí lỗi của bạn trước khi định tuyến công việc sản xuất.

Hồ sơ benchmark của Grok 4.7 cho thấy gì?

Kỹ thuật phần mềm

CursorBench 4.0 tăng từ 40,4% trên Grok 4.6 lên 46,3% trên Grok 4.7, trong khi DeepSWE v1.1 tăng từ 65,2% lên 71,0%. Điều này hỗ trợ định vị Grok 4.7 như một mô hình cho tác tử lập trình thay vì chỉ trợ giúp lập trình hội thoại.

Công việc terminal kéo dài

Terminal-Bench 4.0 cho thấy một trong những thay đổi thế hệ lớn nhất: 20,3% cho Grok 4.6 so với 38,0% cho Grok 4.7. Mức tăng tuyệt đối 17,7 điểm phù hợp với nhấn mạnh của SpaceXAI về học tăng cường tầm dài và tự kiểm chứng.

Kỹ thuật điện

Trên EEBench, Grok 4.7 đạt 64,0%, so với 53,0% của Grok 4.6. Trong số các so sánh được công bố, đây là một trong những kết quả tương đối mạnh nhất của Grok 4.7.

Công việc tri thức chuyên nghiệp

AA Briefcase v1.1 tăng từ 1.546 lên 1.657. Các tác vụ này được thiết kế phản ánh công việc chuyên nghiệp kéo dài nhiều giờ liên quan đến hiện vật như tài liệu, bài thuyết trình, phân tích và các sản phẩm có cấu trúc khác.

Grok 4.7 so với GPT-5.6 Sol và Fable 5.1: So sánh thế nào?

Kiểm tra giá gốc từ nhà cung cấp: OpenAI liệt kê GPT-5.6 Sol ở mức $4 mỗi triệu token đầu vào và $20 mỗi triệu token đầu ra, trong khi Anthropic liệt kê Claude Fable 5.1 ở mức $10 mỗi triệu token đầu vào và $50 mỗi triệu token đầu ra.

Khía cạnhGrok 4.7GPT-5.6 SolClaude Fable 5.1
Định vị chínhLập trình, tác vụ tác tử, công việc tri thứcSuy luận chuyên nghiệp phức tạp và lập trìnhTác tử chạy dài, lập trình, và công việc tri thức
Cửa sổ ngữ cảnh500.000 token1.050.000 token1.000.000 token
Đa phương thứcĐầu vào văn bản và hình ảnh; đầu ra văn bảnĐầu vào văn bản và hình ảnh; đầu ra văn bảnĐầu vào văn bản và hình ảnh; đầu ra văn bản
Kiểm soát suy luậnLow, medium, high, xhighNone through maxTư duy thích ứng với mức nỗ lực có thể cấu hình
Trạng thái API nhà cung cấpSẵn có trên API công khai của xAISẵn có qua OpenAI Chat Completions và ResponsesSẵn có qua Claude API và các marketplace đám mây được hỗ trợ
Giá đầu vào / 1M token$2$4$10
Giá đầu ra / 1M token$6$20$50
CursorBench 4.046,3%41,7%51,8%
DeepSWE v1.171,0%72,7%70,0%
Phù hợp nhấtTác tử kỹ thuật nhạy giá và sử dụng công cụ bền bỉSuy luận chuyên nghiệp rộng với ngữ cảnh rất dàiTác tử chạy dài tối đa, chất lượng lập trình và suy luận lâm sàng

Nên chọn mô hình nào?

  • Chọn Grok 4.7 khi khối lượng công việc kỹ thuật, sử dụng công cụ bền bỉ, suy luận có thể cấu hình và chi phí token đầu ra thấp hơn là ưu tiên. Đặc biệt hấp dẫn cho tác tử ở cấp kho mã, quy trình terminal, và nghiên cứu ngữ cảnh lớn dưới ngưỡng định giá 200K.
  • Chọn GPT-5.6 Sol khi tác vụ cần suy luận chuyên nghiệp rộng, cửa sổ ngữ cảnh trên một triệu token, hoặc khi kết quả mạnh hơn của nó trên một đánh giá then chốt như DeepSWE hay suy luận lâm sàng đã được xác thực trong bộ đo của bạn.
  • Chọn Claude Fable 5.1 khi hiệu năng tác tử chạy dài tối đa, chất lượng lập trình, thực thi terminal, hoặc suy luận lâm sàng biện minh cho mức giá token cao hơn.
  • Sử dụng định tuyến mô hình khi khối lượng công việc đa dạng. Định tuyến các bước tác tử kỹ thuật thường lệ và khối lượng lớn tới mô hình hiệu quả chi phí nhất đủ điều kiện, và dành mô hình đắt hơn cho tác vụ mà tỷ lệ thành công đo được biện minh cho mức giá cao.

Lựa chọn đúng phụ thuộc vào thành công tác vụ đầu-cuối, độ trễ, số lần thử lại, độ chính xác gọi công cụ, và công sức chỉnh sửa của con người—không phải một benchmark đơn lẻ hay mức giá token tiêu đề.

API Grok 4.7 có giá bao nhiêu?

Bảng dưới so sánh mức xAI chính thức với giá hiển thị trên trang mô hình Grok 4.7 của CometAPI ngày 22 tháng 9, 2026. CometAPI nêu mức giảm 20%; hãy xác minh giá trực tiếp trước khi đưa vào sản xuất vì giá cổng và điều khoản khuyến mại có thể thay đổi.

Bậc promptLoại giáxAI chính thứcCometAPIChênh lệch
Dưới 200K token promptĐầu vào / 1M$2,00$1,60Thấp hơn 20%
Đầu vào được bộ nhớ đệm / 1M$0,50$0,40Thấp hơn 20%
Đầu ra / 1M$6,00$4,80Thấp hơn 20%
Trên 200K token promptĐầu vào / 1M$4,00$3,20Thấp hơn 20%
Đầu vào được bộ nhớ đệm / 1M$1,00$0,80Thấp hơn 20%
Đầu ra / 1M$12,00$9,60Thấp hơn 20%

Định giá ngữ cảnh chuẩn cho prompt tới 200.000 token

Với yêu cầu có prompt không vượt quá 200.000 token, Grok 4.7 có giá $2 mỗi triệu token đầu vào, $0,50 mỗi triệu token đầu vào được bộ nhớ đệm, và $6 mỗi triệu token đầu ra. Đầu vào được bộ nhớ đệm là hạng mục rẻ nhất, nên các ứng dụng có hướng dẫn hệ thống lặp lại hoặc ngữ cảnh tái sử dụng có thể giảm chi phí khi các token đó đủ điều kiện lưu bộ nhớ đệm.

Ví dụ đơn giản, một yêu cầu dùng 100.000 token đầu vào chưa được bộ nhớ đệm và tạo 10.000 token đầu ra sẽ tốn khoảng $0,26 trước các phí nền tảng khác: $0,20 cho đầu vào và $0,06 cho đầu ra.

Định giá ngữ cảnh dài trên 200.000 token prompt

Khi prompt vượt 200.000 token, mức giá tăng gấp đôi lên $4 mỗi triệu token đầu vào, $1 mỗi triệu token đầu vào được bộ nhớ đệm, và $12 mỗi triệu token đầu ra. Hạng cao hơn áp dụng vì độ dài prompt, nên các nhóm nên theo dõi lịch sử hội thoại tích lũy, dấu vết công cụ, tài liệu truy xuất và ngữ cảnh kho mã trước khi gửi mỗi yêu cầu.

Do đó, quyết định chi phí thực tế không chỉ là bao nhiêu token một tác vụ sử dụng, mà còn là liệu prompt có vượt ranh giới 200.000 token hay không. Tóm tắt công việc đã hoàn thành, loại bỏ đầu ra công cụ lỗi thời, và chỉ truy xuất tệp liên quan nhất có thể giữ khối lượng công việc phù hợp trong hạng chuẩn mà không hi sinh ngữ cảnh cần thiết.

SpaceXAI release notes ghi nhận ngưỡng này. Ngân sách sản xuất cũng nên tính tới số lần thử lại, vòng lặp tác tử, gọi công cụ thất bại và độ dài đầu ra thay vì chỉ so sánh nhà cung cấp theo giá token đầu vào tiêu đề.

Điều gì khiến Grok 4.7 hữu ích cho tác tử AI?

  • Cửa sổ ngữ cảnh 500K: Chứa nhiều mã nguồn, đặc tả, đầu ra công cụ, nhật ký và lịch sử hội thoại trong một ngữ cảnh làm việc. Hữu ích cho lập trình cấp kho và phân tích đa tài liệu, dù ngữ cảnh vẫn cần cắt tỉa chủ động.
  • Suy luận có thể cấu hình: Ứng dụng có thể chọn mức low, medium, high, hoặc xhigh, đánh đổi độ trễ và tính toán để suy luận sâu hơn theo độ khó của tác vụ.
  • Gọi hàm và đầu ra có cấu trúc: Tác tử có thể truy vấn cơ sở dữ liệu, chạy kiểm thử, kiểm tra tài liệu, gọi API nội bộ, và trả kết quả có thể đọc bởi máy.
  • Tìm kiếm web và X: Công cụ tìm kiếm có thể truy xuất thông tin hiện thời khi dữ liệu huấn luyện của mô hình không đủ. Nội dung truy xuất vẫn nên coi là đầu vào không đáng tin và được xác minh.
  • Thực thi mã: Mô hình có thể xác thực phép tính, biến đổi dữ liệu, và kiểm thử giải pháp sinh ra thay vì chỉ dựa vào suy diễn ngôn ngữ.
  • Trọng tâm quy trình tầm dài: Nhấn mạnh huấn luyện trên tác vụ kéo dài nhiều giờ, quản lý ngữ cảnh và tự kiểm chứng hướng tới các vòng lặp tác tử tích lũy dấu vết công cụ và cần khả năng phục hồi sau lỗi.

Grok 4.7 cải thiện an toàn như thế nào?

SpaceXAI cho biết Grok 4.7 giới thiệu một ngăn xếp bảo vệ hoàn toàn mới và báo cáo khả năng chống jailbreak và an toàn lưỡng dụng mạnh hơn. Trong thông báo ra mắt, công ty báo cáo 62,4% trên benchmark an toàn sinh học của LatchBio và chỉ 3,3% prompt lưỡng dụng rủi ro được cho qua trên HackerBench v0.3.

Các con số này là đánh giá do nhà cung cấp công bố. Chúng hữu ích để hiểu tuyên bố phát hành nhưng không nên coi là thước đo phổ quát về hiệu năng an toàn thực tế.

Nhà phát triển có thể sử dụng API Grok 4.7 như thế nào?

Grok 4.7 hiện sẵn có qua CometAPI dưới model ID grok-4.7. CometAPI cung cấp điểm cuối tương thích OpenAI, một khóa API và quy trình thanh toán cho nhiều nhà cung cấp mô hình, dễ thử nghiệm và định tuyến song song giữa các mô hình, và hiện niêm yết giá token thấp hơn 20% so với mức xAI chính thức. Trước khi dùng trong sản xuất, hãy xác nhận trang mô hình trực tiếp, tình trạng điểm cuối, tham số hỗ trợ, giá, và yêu cầu xử lý dữ liệu.

Ví dụ yêu cầu CometAPI:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Có đáng chuyển sang Grok 4.7 không?

Với người dùng Grok 4.6 hiện tại phụ thuộc vào tác tử lập trình hoặc quy trình chuyên nghiệp chạy dài, Grok 4.7 là ứng viên nâng cấp đáng kể vì bộ benchmark ra mắt cải thiện trên mọi chiều được báo cáo trong khi giá token chuẩn dưới ngưỡng ngữ cảnh dài vẫn ở mức $2/$6.

Với người dùng các mô hình tuyến đầu khác, quyết định phụ thuộc vào khối lượng công việc. Grok 4.7 đặc biệt đáng chú ý khi chi phí token đầu ra, khối lượng kỹ thuật, ngữ cảnh lớn và sử dụng công cụ bền bỉ là quan trọng. Ở nơi mô hình khác mạnh hơn trên lĩnh vực then chốt, định tuyến mô hình có thể hợp lý hơn là thay thế mọi mô hình bằng một nhà cung cấp.

Kết luận

Grok 4.7 không chỉ là cập nhật số học thông thường so với Grok 4.6. Bản phát hành định hướng rõ ràng tới công việc chạy dài thông qua công cụ, kiểm chứng lặp lại, ngữ cảnh lớn và nhiều bước thực thi.

Các mức tăng thế hệ mạnh nhất xuất hiện ở nơi hướng huấn luyện đó nên có tác dụng: Terminal-Bench 4.0 tăng từ 20,3% lên 38,0%, EEBench từ 53,0% lên 64,0%, và CursorBench 4.0 từ 40,4% lên 46,3%, trong khi giá chuẩn dưới ngưỡng prompt 200K vẫn ở mức $2/M đầu vào và $6/M đầu ra.

Giá trị thực tế vì thế không phải là “Grok 4.7 thắng mọi benchmark.” Mà là Grok 4.7 thu hẹp khoảng cách giữa năng lực tác tử hạng tuyến đầu và suy luận chi phí thấp, khiến nó đặc biệt phù hợp với tác tử lập trình, hệ thống nghiên cứu và quy trình chuyên nghiệp cần vận hành qua nhiều bước thay vì trả lời một lần.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 22, 2026
Cập nhật lần cuối Sep 22, 2026
19 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm