xAI mô tả Grok 4.7 là mô hình tuyến đầu cho lập trình, tác vụ dạng agent và công việc tri thức, với cửa sổ ngữ cảnh 500K token. Theo trang giá hiện tại của xAI, mức giá API trực tiếp dưới 200.000 token prompt là $2.00 trên mỗi triệu token đầu vào, $0.50 trên mỗi triệu token đầu vào được cache, và $6.00 trên mỗi triệu token đầu ra. Khi một prompt đạt từ 200.000 token trở lên, xAI lần lượt niêm yết $4.00, $1.00 và $12.00. Đây là mức giá trực tiếp của xAI, không phải mức giá phổ quát trên các nền tảng bên thứ ba.
Chi tiêu thực tế phụ thuộc vào nhiều yếu tố ngoài mức giá đầu vào tiêu đề. Đầu vào mới, đầu vào được cache, đầu ra, số lần thử lại, lời gọi công cụ, và số lượng lời gọi mô hình trong một quy trình agent đều có thể thay đổi hóa đơn. Ngưỡng prompt 200K đặc biệt quan trọng vì cả xAI và CometAPI đều công bố mức giá ngữ cảnh dài cao hơn khi vượt qua mốc đó.
Hướng dẫn này trước hết thiết lập đường cơ sở giá của xAI, sau đó so sánh với mục Grok 4.7 hiện tại trên CometAPI. Tính đến ngày 28 tháng 9, 2026, CometAPI niêm yết $1.60 / $0.40 / $4.80 trên mỗi triệu token đầu vào mới, đầu vào cache và đầu ra trong bậc tiêu chuẩn, và $3.20 / $0.80 / $9.60 trong bậc ngữ cảnh dài—thấp hơn 20% so với mức giá trực tiếp tương ứng của xAI. Các phần sau giải thích cách tính chi phí khối lượng công việc, giảm lãng phí và truy cập mô hình qua CometAPI. Tất cả mức giá là ảnh chụp theo thời điểm và nên được kiểm tra lại trước khi dùng cho sản xuất.
xAI Direct vs. CometAPI Grok 4.7 Pricing
Mức giá xAI trực tiếp (USD trên 1M token)
| Hạng mục token | Dưới 200K token prompt | Ngữ cảnh dài (≥200K) |
|---|---|---|
| Đầu vào mới | $2.00 | $4.00 |
| Đầu vào cache | $0.50 | $1.00 |
| Đầu ra | $6.00 | $12.00 |
Mức giá CometAPI (USD trên 1M token)
| Hạng mục token | CometAPI: dưới 200K token prompt | CometAPI: bậc ngữ cảnh dài |
|---|---|---|
| Đầu vào mới | $1.60 / 1M token | $3.20 / 1M token |
| Đầu vào cache | $0.40 / 1M token | $0.80 / 1M token |
| Đầu ra | $4.80 / 1M token | $9.60 / 1M token |
Giới hạn 200K cho prompt rất quan trọng vì cả hai nền tảng hiện đang niêm yết mức giá ngữ cảnh dài gấp đôi mức giá bậc tiêu chuẩn cho Grok 4.7. Đây là quy tắc định giá do mỗi nền tảng API đặt ra, không phải thay đổi về năng lực của mô hình. Một yêu cầu trở nên đắt hơn khi ứng dụng liên tục gửi các prompt lớn hoặc để lịch sử agent phình to không kiểm soát—không đơn giản chỉ vì Grok 4.7 hỗ trợ cửa sổ ngữ cảnh 500K.
Để lập ngân sách, hãy coi bất kỳ yêu cầu nào được dự đoán sẽ đến gần ngưỡng là ngữ cảnh dài cho đến khi xác minh hành vi tính phí thực tế. Tính sẵn có của mô hình và giá có thể thay đổi, vì vậy các bộ tính toán sản xuất nên kiểm tra lại cả giá trực tiếp của xAI và trang mô hình CometAPI hiện tại thay vì cố định giá trị vĩnh viễn.
The Formula for Estimating Grok 4.7 Cost
Ước tính một yêu cầu bằng cách định giá từng hạng mục token riêng biệt:
request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000
Sau đó chuyển ước tính yêu cầu thành ước tính khối lượng công việc:
monthly cost = request cost × requests per user × active users × days in billing period
Sử dụng một bách phân vị thực tế thay vì một giá trị trung bình. Ước tính p50 mô tả một yêu cầu bình thường, nhưng độ dài đầu vào và đầu ra p95 phơi bày đuôi chi phí cao vốn thường chi phối hóa đơn. Đối với quy trình agent, nhân với số lần gọi mô hình dự kiến cho mỗi tác vụ hoàn thành. Một quy trình 5 bước là 5 lần gọi tính phí, không phải một.
Worked Example 1: A Support Copilot
Giả sử một yêu cầu hỗ trợ gửi 6.000 token đầu vào mới và tạo 800 token đầu ra. Nó vẫn dưới ngưỡng 200K và không nhận được giảm giá cache.
- Đầu vào: 6.000 × $1.60 ÷ 1.000.000 = $0.00960
- Đầu ra: 800 × $4.80 ÷ 1.000.000 = $0.00384
- Tổng: $0.01344 mỗi yêu cầu
Với 100.000 yêu cầu mỗi tháng, chi phí token ước tính là $1.344. Nếu đánh giá cho thấy một câu trả lời 400 token hiệu quả tương đương câu trả lời 800 token, ước tính giảm xuống $0.01152 mỗi yêu cầu, hoặc $1.152 mỗi tháng. Chỉ riêng việc giới hạn đầu ra đó tiết kiệm khoảng $192 mỗi tháng, tương đương 14,3%, mà không cần đổi mô hình.
Đây là lý do kiểm soát đầu ra đáng được chú ý. Ở mức giá CometAPI đã niêm yết, token đầu ra đắt gấp ba lần token đầu vào mới trong cùng bậc.
Worked Example 2: Reusing a Stable 20K-Token Prefix
Giả sử mỗi yêu cầu chứa một hướng dẫn sản phẩm 20.000 token, 2.000 token ngữ cảnh hội thoại mới và phản hồi 600 token.
Không có cache hit, ước tính là:
- 22.000 token đầu vào mới: $0.03520
- 600 token đầu ra: $0.00288
- Tổng: $0.03808 mỗi yêu cầu
Nếu phần tiền tố 20.000 token ổn định được tính phí như đầu vào cache trong khi chỉ còn 2.000 token là mới, ước tính trở thành:
- 20.000 token đầu vào cache: $0.00800
- 2.000 token đầu vào mới: $0.00320
- 600 token đầu ra: $0.00288
- Tổng: $0.01408 mỗi yêu cầu
Với 100.000 yêu cầu, đó là $1.408 thay vì $3.808—tiết kiệm ước tính $2.400, hay 63,0%. Khoản tiết kiệm này không tự động: yêu cầu đầu tiên, một tiền tố thay đổi, hoặc tuyến không tạo cache hit vẫn có thể bị tính ở mức đầu vào mới. Xác nhận số lượng token cache-hit trong dữ liệu sử dụng thực tế trước khi coi ước tính là tiết kiệm đạt được.
Worked Example 3: The Cost of Crossing 200K
Xem xét một yêu cầu agent chạy lâu với 210.000 token prompt và 2.000 token đầu ra. Sử dụng mức giá ngữ cảnh dài đã niêm yết:
- 210.000 token đầu vào mới: $0.67200
- 2.000 token đầu ra: $0.01920
- Tổng: $0.69120 mỗi lần chạy
Nếu nén ngữ cảnh, lọc truy xuất và các checkpoint tóm tắt giảm prompt xuống 180.000 token trong khi vẫn giữ 2.000 token đầu ra, ước tính bậc tiêu chuẩn là:
- 180.000 token đầu vào mới: $0.28800
- 2.000 token đầu ra: $0.00960
- Tổng: $0.29760 mỗi lần chạy
Chênh lệch là $0.39360 mỗi lần chạy, khoảng 56,9%. Trên 10.000 lần chạy, tiết kiệm ước tính là $3.936. Bài học không phải là xóa bỏ ngữ cảnh hữu ích. Đó là chỉ giữ ngữ cảnh làm thay đổi câu trả lời và tóm tắt hoặc truy xuất phần còn lại trước khi yêu cầu vượt qua một ranh giới giá.
A Python Calculator for Pre-Call Estimates
Chức năng sau sử dụng các mức giá Grok 4.7 mà CometAPI hiện niêm yết. Nó áp dụng bậc ngữ cảnh dài một cách thận trọng khi tổng prompt đạt 200.000 token.
from dataclasses import dataclass
@dataclass(frozen=True)
class Rates:
input_per_million: float
cached_input_per_million: float
output_per_million: float
SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)
def estimate_grok_47_cost(
fresh_input_tokens: int,
cached_input_tokens: int,
max_output_tokens: int,
) -> float:
prompt_tokens = fresh_input_tokens + cached_input_tokens
rates = LONG if prompt_tokens >= 200_000 else SHORT
return (
fresh_input_tokens * rates.input_per_million
+ cached_input_tokens * rates.cached_input_per_million
+ max_output_tokens * rates.output_per_million
) / 1_000_000
estimate = estimate_grok_47_cost(
fresh_input_tokens=2_000,
cached_input_tokens=20_000,
max_output_tokens=600,
)
print(f"Estimated upper bound: ${estimate:.5f}")
Đây là một bộ chắn lập kế hoạch, không phải hóa đơn. Chi phí cuối cùng phụ thuộc vào đầu vào thực tế, đầu vào cache, đầu ra, số lần thử lại, lời gọi công cụ và mức giá đang hoạt động tại thời điểm thực thi. Sau mỗi phản hồi, lưu lại số liệu sử dụng token trả về, ID mô hình, trạng thái yêu cầu và kết quả tác vụ. Đối chiếu các giá trị đó với bản ghi tính phí của nhà cung cấp.
Five Grok 4.7 Cost Controls, Ranked by Likely Impact
1. Giữ ngữ cảnh lặp lại đủ ổn định để cache
Đặt hướng dẫn tĩnh, tài liệu sản phẩm, schema và ví dụ tái sử dụng trước nội dung đặc thù từng yêu cầu. Tránh thay đổi dấu thời gian, ID, khoảng trắng hoặc thứ tự bên trong một tiền tố dùng chung lớn trừ khi bắt buộc. Hướng dẫn của xAI cho Grok 4.7 khuyến nghị các định danh định tuyến cache ổn định cho hội thoại; khi sử dụng tuyến trung gian, hãy xác minh những điều khiển cache và trường sử dụng nào được hỗ trợ trước khi phụ thuộc vào chúng.
Đo số token cache-hit và tỷ lệ cache-hit theo khối lượng công việc. Một giảm giá cache lý thuyết vô giá trị nếu ứng dụng liên tục biến đổi tiền tố.
2. Xem 200K như ngân sách kỹ thuật, không phải mục tiêu
Dành khoảng trống dưới ngưỡng cho hệ thống hướng dẫn, đoạn truy xuất, kết quả công cụ và lượt người dùng tiếp theo. Đối với agent, nén các lượt cũ thành một bản tóm tắt đã xác thực và lưu transcript thô bên ngoài ngữ cảnh mô hình. Đối với truy xuất, xếp hạng và khử trùng lặp các đoạn trước khi chèn thay vì gửi mọi kết quả khớp.
Theo dõi phân phối độ dài prompt và cảnh báo trước khi p95 tiến gần ngưỡng. Theo lịch chính thức của xAI, khi một prompt đạt 200K token, mức giá ngữ cảnh dài áp dụng cho tất cả token trong yêu cầu đó. CometAPI cũng liệt kê một bậc ngữ cảnh dài riêng, cao hơn cho Grok 4.7. Đây là điều khoản định giá của nền tảng, không phải năng lực của mô hình.
3. Giới hạn đầu ra và hiệu chỉnh mức nỗ lực suy luận dựa trên bộ đánh giá
Đặt giới hạn đầu ra ở cấp ứng dụng phù hợp với sản phẩm. Kết quả phân loại có thể cần vài chục token; câu trả lời hỗ trợ có thể cần vài trăm; báo cáo nghiên cứu có thể cần nhiều hơn. Giới hạn này là công cụ kiểm soát ngân sách và trải nghiệm người dùng, không phải giới hạn cứng của Grok 4.7. Ghi chú phát hành ngày 21 tháng 9 của xAI nêu rằng Grok 4.7 không có giới hạn đầu ra văn bản; điều đó không ngăn một ứng dụng hoặc một tuyến API cụ thể áp đặt giới hạn yêu cầu riêng. Xác nhận bất kỳ giới hạn yêu cầu do endpoint hoặc SDK áp đặt với tuyến bạn thực sự dùng.
Grok 4.7 hỗ trợ nhiều mức nỗ lực suy luận. Dùng mức thấp nhất vượt qua một bộ đánh giá đại diện, và dành mức cao hơn cho các tác vụ mà nó mang lại cải thiện đo lường được. Giảm nỗ lực suy luận hoặc đầu ra mà không kiểm tra chất lượng có thể tạo lần thử lại và xóa sạch khoản tiết kiệm.
4. Từ chối hoặc tái định hình các yêu cầu đắt đỏ trước khi gọi API
Ước tính giới hạn trên từ kích thước đầu vào và giới hạn đầu ra đã cấu hình. Nếu yêu cầu vượt ngân sách sản phẩm, ứng dụng có thể yêu cầu người dùng thu hẹp tác vụ, tóm tắt tài liệu tải lên, giảm ngữ cảnh truy xuất hoặc chuyển công việc sang quy trình bất đồng bộ đã được phê duyệt. Điều này dự đoán được hơn so với phát hiện chi phí sau khi sinh.
Một xấp xỉ ký tự–token thô có thể hữu ích như một lớp chắn sớm, nhưng không nên thay thế bộ tách token hoặc dữ liệu sử dụng thực tế. Ngôn ngữ, mã, JSON và định dạng có thể tạo mật độ token rất khác nhau.
5. Tối ưu chi phí trên mỗi tác vụ thành công, không phải chi phí mỗi lần gọi
Một lần gọi rẻ hơn nhưng trượt xác thực hai lần có thể tốn nhiều hơn một lần gọi thành công. Theo dõi:
- chi phí trên mỗi câu trả lời được chấp nhận;
- chi phí trên mỗi tác vụ agent hoàn tất;
- chi phí thử lại và dự phòng;
- tỷ lệ cache-hit và tỷ trọng token cache;
- token prompt và đầu ra p50 và p95;
- điểm chất lượng, độ trễ và tỷ lệ leo thang cho con người.
Nếu lưu lượng thường nhật không cần chất lượng hoặc dung lượng ngữ cảnh của Grok 4.7, danh mục mô hình hợp nhất của CometAPI có thể giúp chuyển đổi mô hình do ứng dụng quản lý dễ hơn. Giữ quy tắc định tuyến rõ ràng, đánh giá mỗi mô hình trên cùng bộ tác vụ, và chỉ gửi các yêu cầu hưởng lợi từ Grok 4.7 tới tuyến này.
A Practical Monthly Cost Review
Mỗi tuần, nhóm lưu lượng theo tính năng và so sánh chi phí ước tính với sử dụng thực tế. Bắt đầu với các tính năng chịu trách nhiệm cho nhiều token đầu ra nhất, prompt lớn nhất và tỷ lệ cache-hit thấp nhất. Sau đó xem xét các ngoại lệ đắt đỏ thay vì tối ưu mù quáng theo yêu cầu trung vị.
| Tín hiệu | Vấn đề có khả năng | Hành động đầu tiên |
|---|---|---|
| Tỷ trọng token cache thấp | Tiền tố dùng chung thay đổi quá thường xuyên | Ổn định và phiên bản hóa ngữ cảnh tái sử dụng |
| Prompt cụm quanh 200K | Lịch sử hoặc truy xuất không bị giới hạn | Nén, xếp hạng và giữ khoảng trống |
| Đầu ra chi phối chi tiêu | Phản hồi dài hơn nhu cầu sản phẩm | Hạ giới hạn và kiểm thử chất lượng câu trả lời |
| Chi phí thử lại cao | Xác thực, timeout hoặc prompt không ổn định | Sửa chế độ lỗi ở lần gọi đầu tiên |
| Chi phí thấp nhưng hoàn tất kém | Tối ưu hóa làm giảm chất lượng hữu ích | Đo chi phí trên mỗi kết quả được chấp nhận |
Where CometAPI Fits in the Grok 4.7 Cost Model
Vai trò của CometAPI trong quy trình này nằm ở cấp nền tảng API: nó cung cấp quyền truy cập Grok 4.7, công bố mức giá token riêng và tài liệu một điểm vào tương thích OpenAI. Nó không thay đổi năng lực mô hình cơ bản của Grok 4.7. Các nhóm đã dùng client kiểu OpenAI có thể giữ cùng mẫu client trong khi thay khóa API, base URL và ID mô hình, tùy thuộc vào khả năng tương thích endpoint.
Tính đến ngày 28 tháng 9, 2026, mức giá Grok 4.7 mà CometAPI niêm yết thấp hơn 20% so với các mức giá trực tiếp tương ứng của xAI ở cả bậc tiêu chuẩn và ngữ cảnh dài. Đây là so sánh giá nền tảng, không phải tuyên bố về chất lượng mô hình. Trước khi triển khai sản xuất, các nhóm cũng nên xác minh ID mô hình đang hoạt động, tham số endpoint, hành vi cache, giới hạn tốc độ, độ tin cậy, hỗ trợ và điều khoản thanh toán.
Để kiểm thử mô hình, xem xét bảng giá và chi tiết truy cập hiện tại trên trang mô hình Grok 4.7 của CometAPI. Giữ bảng giá trong cấu hình, ghi lại sử dụng thực tế sau mỗi lần gọi và chạy lại ước tính khối lượng công việc bất cứ khi nào mô hình hoặc hành vi sản phẩm thay đổi.
FAQ
Giá mỗi token của Grok 4.7 trên CometAPI là bao nhiêu?
Đối với prompt dưới 200K token, CometAPI hiện niêm yết $1.60 trên mỗi triệu token đầu vào mới, $0.40 trên mỗi triệu token đầu vào cache và $4.80 trên mỗi triệu token đầu ra. Mức giá ngữ cảnh dài đã niêm yết lần lượt là $3.20, $0.80 và $9.60 trên mỗi triệu token.
Một yêu cầu API Grok 4.7 tốn bao nhiêu?
Tùy thuộc vào đầu vào mới, đầu vào cache, đầu ra và bậc ngữ cảnh đang hoạt động. Nhân từng số token với mức giá trên mỗi triệu tương ứng, cộng lại và chia cho một triệu. Cũng tính cả số lần thử lại và mọi lần gọi mô hình trong một quy trình nhiều bước.
Cách dễ nhất để giảm chi phí API Grok 4.7 là gì?
Bắt đầu với động lực chi phí đo được lớn nhất. Hướng dẫn dài lặp lại thường hưởng lợi từ cache; lịch sử agent phình to hưởng lợi từ nén; câu trả lời dài hưởng lợi từ giới hạn đầu ra thấp hơn. Xác nhận rằng chất lượng vẫn chấp nhận được sau mỗi thay đổi.
Cửa sổ ngữ cảnh 500K có nghĩa là tôi nên gửi 500K token không?
Không. Cửa sổ ngữ cảnh là giới hạn dung lượng, không phải khuyến nghị. Cả giá trực tiếp của xAI và niêm yết hiện tại của CometAPI đều dùng mức giá ngữ cảnh dài cao hơn tại ngưỡng prompt 200K, vì vậy ứng dụng chỉ nên gửi ngữ cảnh cần thiết cho tác vụ.
Tôi có thể ước tính chi phí trước khi gọi Grok 4.7 không?
Có. Ước tính token đầu vào, chọn bậc ngữ cảnh đúng, thêm giới hạn đầu ra thực tế và tính giới hạn trên. Sau cuộc gọi, thay thế ước tính bằng dữ liệu sử dụng thực tế để báo cáo và tối ưu hóa.