xAI menerangkan Grok 4.7 sebagai model frontier untuk pengaturcaraan, tugasan agentik, dan kerja berasaskan pengetahuan, dengan tetingkap konteks 500K token. Menurut halaman harga semasa xAI, kadar API terus di bawah 200,000 token prompt ialah $2.00 per sejuta token input, $0.50 per sejuta token cache, dan $6.00 per sejuta token output. Apabila prompt mencapai 200,000 token atau lebih, xAI menyenaraikan $4.00, $1.00, dan $12.00 masing-masing. Ini ialah kadar terus xAI, bukan harga universal merentas platform pihak ketiga.
Perbelanjaan sebenar bergantung pada lebih daripada kadar input tajuk utama. Input baharu, input cache, output, percubaan semula, panggilan alat, dan bilangan panggilan model dalam aliran kerja agen semuanya boleh mengubah bil. Ambang 200K prompt amat penting kerana xAI dan CometAPI kedua-duanya menerbitkan kadar konteks panjang yang lebih tinggi apabila sempadan itu dicapai.
Panduan ini terlebih dahulu menetapkan garis dasar harga xAI, kemudian membandingkan Penyenaraian CometAPI Grok 4.7 semasa. Setakat 28 September 2026, CometAPI menyenaraikan $1.60 / $0.40 / $4.80 per sejuta token input baharu, input cache, dan output dalam peringkat standard, dan $3.20 / $0.80 / $9.60 dalam peringkat konteks panjang—20% lebih rendah daripada kadar terus xAI yang sepadan. Seksyen berikut menerangkan cara mengira kos beban kerja, mengurangkan pembaziran, dan mengakses model melalui CometAPI. Semua harga ialah petikan bertarikh dan perlu disemak semula sebelum penggunaan produksi.
Harga xAI Direct vs. CometAPI Grok 4.7
Kadar xAI direct (USD per 1M token)
| Kategori token | Di bawah 200K token prompt | Konteks panjang (≥200K) |
|---|---|---|
| Input baharu | $2.00 | $4.00 |
| Input cache | $0.50 | $1.00 |
| Output | $6.00 | $12.00 |
Kadar CometAPI (USD per 1M token)
| Kategori token | CometAPI: di bawah 200K token prompt | CometAPI: peringkat konteks panjang |
|---|---|---|
| Input baharu | $1.60 / 1M token | $3.20 / 1M token |
| Input cache | $0.40 / 1M token | $0.80 / 1M token |
| Output | $4.80 / 1M token | $9.60 / 1M token |
Sempadan 200K prompt penting kerana kedua-dua platform pada masa ini menyenaraikan kadar konteks panjang pada dua kali ganda kadar peringkat standard mereka untuk Grok 4.7. Ini ialah peraturan harga yang ditetapkan oleh setiap platform API, bukan perubahan pada keupayaan model. Sesuatu permintaan menjadi lebih mahal apabila aplikasi berulang kali menghantar prompt besar atau membiarkan sejarah agen berkembang tanpa kawalan—bukan semata-mata kerana Grok 4.7 menyokong tetingkap konteks 500K.
Untuk belanjawan, anggap mana-mana permintaan yang diramalkan mencapai sempadan sebagai konteks panjang sehingga tingkah laku pengebilan aktif disahkan. Ketersediaan model dan harga boleh berubah, jadi kalkulator produksi harus menyemak semula harga terus xAI dan halaman model CometAPI semasa dan bukannya mengekod nilai kekal.
Formula untuk Menganggar Kos Grok 4.7
Anggar satu permintaan dengan menetapkan harga setiap kategori token secara berasingan:
request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000
Kemudian tukarkan anggaran permintaan kepada anggaran beban kerja:
monthly cost = request cost × requests per user × active users × days in billing period
Gunakan peratusil realistik dan bukannya satu purata. Anggaran p50 menerangkan permintaan biasa, tetapi panjang input dan output p95 mendedahkan buntut mahal yang sering memacu bil. Untuk aliran kerja agen, gandakan mengikut bilangan panggilan model yang dijangka per tugas siap. Aliran kerja lima langkah ialah lima panggilan yang dibil, bukan satu.
Contoh Bekerja 1: Copilot Sokongan
Anggap satu permintaan sokongan menghantar 6,000 token input baharu dan menghasilkan 800 token output. Ia kekal di bawah ambang 200K dan tidak menerima diskaun cache.
- Input: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
- Output: 800 × $4.80 ÷ 1,000,000 = $0.00384
- Jumlah: $0.01344 per permintaan
Pada 100,000 permintaan sebulan, anggaran kos token ialah $1,344. Jika penilaian menunjukkan bahawa jawapan 400 token berprestasi sama baik dengan jawapan 800 token, anggaran turun kepada $0.01152 per permintaan, atau $1,152 sebulan. Had output tunggal itu menjimatkan kira-kira $192 sebulan, atau 14.3%, tanpa menukar model.
Inilah sebab kawalan output wajar diberi perhatian. Pada kadar CometAPI yang disenaraikan, token output berharga tiga kali ganda berbanding token input baharu dalam peringkat yang sama.
Contoh Bekerja 2: Mengguna Semula Awalan Stabil 20K Token
Andaikan setiap permintaan mengandungi manual produk 20,000 token, 2,000 token konteks perbualan baharu, dan respons 600 token.
Tanpa hit cache, anggarannya ialah:
- 22,000 token input baharu: $0.03520
- 600 token output: $0.00288
- Jumlah: $0.03808 per permintaan
Jika awalan stabil 20,000 token dibil sebagai input cache manakala hanya 2,000 token kekal sebagai input baharu, anggaran menjadi:
- 20,000 token input cache: $0.00800
- 2,000 token input baharu: $0.00320
- 600 token output: $0.00288
- Jumlah: $0.01408 per permintaan
Pada 100,000 permintaan, itu ialah $1,408 berbanding $3,808—penjimatan dianggar $2,400, atau 63.0%. Penjimatan ini tidak automatik: permintaan pertama, awalan yang berubah, atau laluan yang tidak menghasilkan hit cache masih boleh dibil pada kadar input baharu. Sahkan kiraan token cache-hit dalam data penggunaan sebenar sebelum menganggap anggaran sebagai penjimatan yang dicapai.
Contoh Bekerja 3: Kos Melintasi 200K
Pertimbangkan permintaan agen jangka panjang dengan 210,000 token prompt dan 2,000 token output. Menggunakan kadar konteks panjang yang disenaraikan:
- 210,000 token input baharu: $0.67200
- 2,000 token output: $0.01920
- Jumlah: $0.69120 per larian
Jika pemadatan konteks, penapisan pengambilan, dan titik semakan ringkasan mengurangkan prompt kepada 180,000 token sambil mengekalkan output 2,000 token yang sama, anggaran peringkat standard ialah:
- 180,000 token input baharu: $0.28800
- 2,000 token output: $0.00960
- Jumlah: $0.29760 per larian
Perbezaannya ialah $0.39360 per larian, atau kira-kira 56.9%. Merentas 10,000 larian, penjimatan dianggarkan $3,936. Pengajarannya bukan untuk memadam konteks yang berguna. Ia adalah untuk mengekalkan hanya konteks yang mengubah jawapan dan meringkaskan atau mengambil selebihnya sebelum permintaan melintasi sempadan harga.
Kalkulator Python untuk Anggaran Pra-Panggilan
Fungsi berikut menggunakan kadar Grok 4.7 yang disenaraikan CometAPI pada masa ini. Ia menggunakan peringkat konteks panjang secara konservatif apabila jumlah prompt mencapai 200,000 token.
from dataclasses import dataclass
@dataclass(frozen=True)
class Rates:
input_per_million: float
cached_input_per_million: float
output_per_million: float
SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)
def estimate_grok_47_cost(
fresh_input_tokens: int,
cached_input_tokens: int,
max_output_tokens: int,
) -> float:
prompt_tokens = fresh_input_tokens + cached_input_tokens
rates = LONG if prompt_tokens >= 200_000 else SHORT
return (
fresh_input_tokens * rates.input_per_million
+ cached_input_tokens * rates.cached_input_per_million
+ max_output_tokens * rates.output_per_million
) / 1_000_000
estimate = estimate_grok_47_cost(
fresh_input_tokens=2_000,
cached_input_tokens=20_000,
max_output_tokens=600,
)
print(f"Estimated upper bound: ${estimate:.5f}")
Ini ialah pengawal perancangan, bukan invois. Kos akhir bergantung pada input sebenar, input cache, output, percubaan semula, panggilan alat, dan harga aktif pada masa pelaksanaan. Selepas setiap respons, simpan penggunaan token yang dipulangkan, ID model, status permintaan, dan hasil tugas. Padankan nilai tersebut dengan rekod pengebilan penyedia.
Lima Kawalan Kos Grok 4.7, Disusun Mengikut Kesan yang Mungkin
1. Pastikan Konteks Berulang Cukup Stabil untuk Cache
Letakkan arahan statik, dokumentasi produk, skema, dan contoh boleh guna semula sebelum kandungan khusus permintaan. Elakkan menukar cap masa, ID, jarak kosong, atau susunan di dalam awalan besar yang dikongsi melainkan perubahan itu diperlukan. Panduan Grok 4.7 oleh xAI mengesyorkan pengenal penghalaan cache yang stabil untuk perbualan; apabila menggunakan laluan perantara, sahkan kawalan cache dan medan penggunaan yang disokong sebelum bergantung padanya.
Ukur token hit cache dan kadar hit cache mengikut beban kerja. Diskaun cache teoritikal tidak bernilai jika aplikasi sentiasa mengubah awalan.
2. Anggap 200K sebagai Bajet Kejuruteraan, Bukan Sasaran
Peruntukkan ruang lega di bawah ambang untuk arahan sistem, petikan yang diambil, hasil alat, dan giliran pengguna seterusnya. Untuk agen, padatkan giliran lama ke dalam ringkasan yang disahkan dan kekalkan transkrip mentah di luar konteks model. Untuk pengambilan, isih pangkat dan nyahpendua petikan sebelum dimasukkan dan bukannya menghantar setiap padanan.
Jejak taburan panjang prompt dan beri amaran sebelum p95 menghampiri ambang. Di bawah jadual rasmi xAI, sebaik sahaja prompt mencapai 200K token, kadar konteks panjang dikenakan kepada semua token dalam permintaan tersebut. CometAPI juga menyenaraikan peringkat konteks panjang yang berbeza dan lebih tinggi untuk Grok 4.7. Ini ialah terma harga platform, bukan keupayaan model.
3. Tetapkan Had Output dan Tala Usaha Penaakulan terhadap Set Penilaian
Tetapkan had output pada peringkat aplikasi yang sepadan dengan produk. Keputusan klasifikasi mungkin memerlukan puluhan token; jawapan sokongan mungkin memerlukan beberapa ratus; laporan penyelidikan mungkin memerlukan lebih banyak. Had ini ialah kawalan bajet dan pengalaman pengguna, bukan had keras model Grok 4.7. Nota keluaran xAI pada 21 September menyatakan bahawa Grok 4.7 tiada had output teks; itu tidak menghalang aplikasi atau laluan API tertentu daripada menguatkuasakan had permintaan tersendiri. Sahkan sebarang had permintaan yang dikuatkuasakan oleh titik akhir atau SDK dengan laluan yang anda gunakan.
Grok 4.7 menyokong pelbagai tahap usaha penaakulan. Gunakan tahap terendah yang lulus set penilaian perwakilan, dan simpan usaha lebih tinggi untuk tugas yang menunjukkan peningkatan yang boleh diukur. Mengurangkan penaakulan atau output tanpa semakan kualiti boleh menghasilkan percubaan semula dan menghapuskan penjimatan.
4. Tolak atau Bentuk Semula Permintaan Mahal Sebelum Panggilan API
Anggar had atas daripada saiz input dan had output yang dikonfigurasi. Jika permintaan melepasi bajet produk, aplikasi boleh meminta pengguna mempersempit tugas, meringkaskan bahan yang dimuat naik, mengurangkan konteks yang diambil, atau memindahkan kerja ke aliran kerja berkelulusan secara asinkron. Ini lebih boleh diramal daripada mengetahui kos selepas generasi.
Anggaran kasar aksara-ke-token boleh berguna sebagai pengawal awal, tetapi ia tidak sepatutnya menggantikan pen-token atau data penggunaan sebenar. Bahasa, kod, JSON, dan pemformatan boleh menghasilkan ketumpatan token yang sangat berbeza.
5. Optimumkan Kos per Tugas Berjaya, Bukan Kos per Panggilan
Panggilan lebih murah yang gagal pengesahan dua kali boleh menelan kos lebih daripada satu panggilan berjaya. Jejak:
- kos per jawapan diterima;
- kos per tugas agen yang disiapkan;
- kos percubaan semula dan jatuh balik;
- kadar hit cache dan bahagian token cache;
- p50 dan p95 token prompt dan output;
- skor kualiti, kependaman, dan kadar eskalasi manusia.
Jika trafik rutin tidak memerlukan kualiti atau kapasiti konteks Grok 4.7, katalog model bersatu CometAPI boleh memudahkan pertukaran model yang diurus aplikasi. Kekalkan peraturan penghalaan secara jelas, nilai setiap model pada set tugas yang sama, dan hantar hanya permintaan yang mendapat manfaat daripada Grok 4.7 ke laluan ini.
Ulasan Kos Bulanan Praktikal
Sekali seminggu, kumpulkan trafik mengikut ciri dan bandingkan anggaran kos dengan penggunaan sebenar. Mulakan dengan ciri yang bertanggungjawab terhadap token output paling banyak, prompt terbesar, dan kadar hit cache terendah. Kemudian semak outlier mahal dan bukannya mengoptimumkan permintaan median secara membuta tuli.
| Isyarat | Masalah berkemungkinan | Tindakan pertama |
|---|---|---|
| Bahagian token cache rendah | Awalan dikongsi berubah terlalu kerap | Stabilkan dan versikan konteks boleh guna semula |
| Prompt berkumpul hampir 200K | Sejarah atau pengambilan tidak dibatasi | Padatkan, isih kedudukan, dan rizabkan ruang lega |
| Output mendominasi perbelanjaan | Respons lebih panjang daripada keperluan produk | Turunkan had dan uji kualiti jawapan |
| Kos cuba semula tinggi | Pengesahan, tamat masa, atau prompt tidak stabil | Baiki mod kegagalan panggilan pertama |
| Kos rendah tetapi penyiapan tugas lemah | Pengoptimuman mengurangkan kualiti berguna | Ukur kos per hasil diterima |
Peranan CometAPI dalam Model Kos Grok 4.7
Peranan CometAPI dalam aliran kerja ini berada pada peringkat platform API: ia menyediakan akses kepada Grok 4.7, menerbitkan kadar tokennya sendiri, dan mendokumenkan titik masuk serasi OpenAI. Ia tidak mengubah keupayaan asas model Grok 4.7. Pasukan yang sudah menggunakan klien gaya OpenAI mungkin boleh mengekalkan corak klien yang sama sambil menukar kunci API, URL asas, dan ID model, tertakluk kepada keserasian titik akhir.
Setakat 28 September 2026, kadar Grok 4.7 yang disenaraikan CometAPI adalah 20% lebih rendah daripada kadar terus xAI yang sepadan dalam kedua-dua peringkat standard dan konteks panjang. Ini ialah perbandingan harga platform, bukan tuntutan kualiti model. Sebelum pelancaran produksi, pasukan juga harus mengesahkan ID model aktif, parameter titik akhir, tingkah laku cache, had kadar, kebolehpercayaan, sokongan, dan terma pengebilan.
Untuk menguji model, semak butiran harga dan akses semasa pada halaman model Grok 4.7 CometAPI. Kekalkan jadual harga dalam konfigurasi, rekod penggunaan sebenar selepas setiap panggilan, dan jalankan semula anggaran beban kerja apabila model atau tingkah laku produk berubah.
Soalan Lazim
Berapakah harga per token Grok 4.7 di CometAPI?
Untuk prompt di bawah 200K token, CometAPI pada masa ini menyenaraikan $1.60 per sejuta token input baharu, $0.40 per sejuta token input cache, dan $4.80 per sejuta token output. Kadar konteks panjang yang disenaraikan masing-masing ialah $3.20, $0.80, dan $9.60 per sejuta token.
Berapakah kos satu permintaan API Grok 4.7?
Ia bergantung pada input baharu, input cache, output, dan peringkat konteks aktif. Darabkan setiap bilangan token dengan kadar per sejuta masing-masing, jumlahkan hasilnya, dan bahagikan dengan satu juta. Sertakan juga percubaan semula dan setiap panggilan model dalam aliran kerja berbilang langkah.
Apakah cara paling mudah untuk mengurangkan kos API Grok 4.7?
Mulakan dengan pemacu kos yang diukur paling besar. Arahan panjang berulang biasanya mendapat manfaat daripada cache; sejarah agen yang berkembang mendapat manfaat daripada pemadatan; jawapan bertele-tele mendapat manfaat daripada had output yang lebih rendah. Sahkan bahawa kualiti kekal boleh diterima selepas setiap perubahan.
Adakah tetingkap konteks 500K bermakna saya patut menghantar 500K token?
Tidak. Tetingkap konteks ialah had kapasiti, bukan cadangan. Kedua-dua harga terus xAI dan penyenaraian CometAPI semasa menggunakan kadar konteks panjang yang lebih tinggi pada ambang 200K prompt, jadi aplikasi harus menghantar hanya konteks yang diperlukan untuk tugas.
Bolehkah saya menganggar kos sebelum memanggil Grok 4.7?
Ya. Anggar token input, pilih peringkat konteks yang betul, tambah had output realistik, dan kira had atas. Selepas panggilan, gantikan anggaran dengan data penggunaan sebenar untuk pelaporan dan pengoptimuman.