xAI menggambarkan Grok 4.7 sebagai model frontier untuk pengodean, tugas agen, dan pekerjaan berbasis pengetahuan, dengan jendela konteks 500K token. Menurut halaman harga xAI saat ini, tarif API langsung di bawah 200.000 token prompt adalah $2.00 per 1M token input, $0.50 per 1M token di-cache, dan $6.00 per 1M token output. Ketika sebuah prompt mencapai 200.000 token atau lebih, xAI mencantumkan masing-masing $4.00, $1.00, dan $12.00. Ini adalah tarif langsung xAI, bukan harga universal di seluruh platform pihak ketiga.
Pengeluaran aktual bergantung pada lebih dari sekadar tarif input utama. Input baru, input di-cache, output, percobaan ulang, panggilan alat, dan jumlah panggilan model dalam alur kerja agen semuanya dapat mengubah tagihan. Ambang 200K prompt sangat penting karena xAI dan CometAPI sama-sama memublikasikan tarif konteks panjang yang lebih tinggi setelah batas tersebut tercapai.
Panduan ini terlebih dahulu menetapkan patokan harga xAI, lalu membandingkan daftar CometAPI Grok 4.7 saat ini. Per 28 September 2026, CometAPI mencantumkan $1.60 / $0.40 / $4.80 per 1M token input baru, input di-cache, dan token output di tier standar, serta $3.20 / $0.80 / $9.60 di tier konteks panjang—20% di bawah tarif langsung xAI yang sesuai. Bagian-bagian berikut menjelaskan cara menghitung biaya beban kerja, mengurangi pemborosan, dan mengakses model melalui CometAPI. Semua harga adalah cuplikan bertanggal dan harus diperiksa ulang sebelum digunakan di produksi.
Harga xAI Langsung vs. CometAPI Grok 4.7
Tarif xAI langsung (USD per 1M token)
| Kategori token | Di bawah 200K token prompt | Konteks panjang (≥200K) |
|---|---|---|
| Input baru | $2.00 | $4.00 |
| Input di-cache | $0.50 | $1.00 |
| Output | $6.00 | $12.00 |
Tarif CometAPI (USD per 1M token)
| Kategori token | CometAPI: di bawah 200K token prompt | CometAPI: tier konteks panjang |
|---|---|---|
| Input baru | $1.60 / 1M token | $3.20 / 1M token |
| Input di-cache | $0.40 / 1M token | $0.80 / 1M token |
| Output | $4.80 / 1M token | $9.60 / 1M token |
Batas 200K prompt penting karena kedua platform saat ini mencantumkan tarif konteks panjang sebesar dua kali lipat dari tarif tier standar untuk Grok 4.7. Ini adalah aturan harga yang ditetapkan oleh masing-masing platform API, bukan perubahan kemampuan model. Permintaan menjadi lebih mahal ketika aplikasi berulang kali mengirim prompt besar atau membiarkan riwayat agen tumbuh tanpa kendali—bukan semata-mata karena Grok 4.7 mendukung jendela konteks 500K.
Untuk penganggaran, perlakukan setiap permintaan yang diproyeksikan mencapai batas sebagai konteks panjang hingga perilaku penagihan aktif terverifikasi. Ketersediaan model dan harga dapat berubah, jadi kalkulator produksi harus memeriksa ulang harga langsung xAI dan halaman model CometAPI saat ini alih-alih meng-hard-code nilai permanen.
Rumus Perkiraan Biaya Grok 4.7
Perkirakan satu permintaan dengan memberi harga setiap kategori token secara terpisah:
request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000
Lalu ubah perkiraan permintaan menjadi perkiraan beban kerja:
monthly cost = request cost × requests per user × active users × days in billing period
Gunakan persentil realistis, bukan satu rata-rata. Estimasi p50 menggambarkan permintaan normal, tetapi panjang input dan output p95 membuka ekor mahal yang sering mendorong tagihan. Untuk alur kerja agen, kalikan dengan jumlah panggilan model yang diharapkan per tugas yang selesai. Alur kerja lima langkah berarti lima panggilan yang ditagih, bukan satu.
Contoh Perhitungan 1: Copilot Dukungan
Asumsikan satu permintaan dukungan mengirim 6,000 token input baru dan menghasilkan 800 token output. Ini tetap di bawah ambang 200K dan tidak menerima diskon cache.
- Input: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
- Output: 800 × $4.80 ÷ 1,000,000 = $0.00384
- Total: $0.01344 per permintaan
Pada 100,000 permintaan per bulan, perkiraan biaya token adalah $1,344. Jika evaluasi menunjukkan bahwa jawaban 400 token berkinerja sama baiknya dengan jawaban 800 token, perkiraan turun menjadi $0.01152 per permintaan, atau $1,152 per bulan. Batas output tunggal itu menghemat sekitar $192 per bulan, atau 14.3%, tanpa mengubah model.
Inilah mengapa kendali output layak mendapat perhatian. Pada tarif CometAPI yang tercantum, token output berharga tiga kali lipat token input baru di tier yang sama.
Contoh Perhitungan 2: Menggunakan Kembali Prefix Stabil 20K Token
Misalkan setiap permintaan berisi manual produk 20,000 token, 2,000 token konteks percakapan baru, dan respons 600 token.
Tanpa hit cache, perkiraannya adalah:
- 22,000 token input baru: $0.03520
- 600 token output: $0.00288
- Total: $0.03808 per permintaan
Jika prefix 20,000 token yang stabil ditagih sebagai input di-cache sementara hanya 2,000 token yang tetap baru, perkiraannya menjadi:
- 20,000 token input di-cache: $0.00800
- 2,000 token input baru: $0.00320
- 600 token output: $0.00288
- Total: $0.01408 per permintaan
Pada 100,000 permintaan, itu adalah $1,408 alih-alih $3,808—perkiraan penghematan $2,400, atau 63.0%. Penghematan tidak otomatis: permintaan pertama, prefix yang berubah, atau rute yang tidak menghasilkan hit cache masih dapat ditagih pada tarif input baru. Konfirmasikan jumlah token di-cache dalam data penggunaan aktual sebelum memperlakukan perkiraan sebagai penghematan yang tercapai.
Contoh Perhitungan 3: Biaya Melampaui 200K
Pertimbangkan permintaan agen yang berjalan lama dengan 210,000 token prompt dan 2,000 token output. Menggunakan tarif konteks panjang yang tercantum:
- 210,000 token input baru: $0.67200
- 2,000 token output: $0.01920
- Total: $0.69120 per run
Jika pemadatan konteks, penyaringan retrieval, dan ringkasan checkpoint mengurangi prompt menjadi 180,000 token sambil mempertahankan output 2,000 token yang sama, perkiraan tier standar adalah:
- 180,000 token input baru: $0.28800
- 2,000 token output: $0.00960
- Total: $0.29760 per run
Perbedaannya adalah $0.39360 per run, atau sekitar 56.9%. Pada 10,000 run, perkiraan penghematannya $3,936. Pelajarannya bukan menghapus konteks yang berguna. Pelajarannya adalah menyimpan hanya konteks yang mengubah jawaban dan merangkum atau mengambil sisanya sebelum permintaan melewati batas harga.
Kalkulator Python untuk Perkiraan Pra-Panggilan
Fungsi berikut menggunakan tarif Grok 4.7 CometAPI yang saat ini tercantum. Fungsi ini secara konservatif menerapkan tier konteks panjang ketika total prompt mencapai 200,000 token.
from dataclasses import dataclass
@dataclass(frozen=True)
class Rates:
input_per_million: float
cached_input_per_million: float
output_per_million: float
SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)
def estimate_grok_47_cost(
fresh_input_tokens: int,
cached_input_tokens: int,
max_output_tokens: int,
) -> float:
prompt_tokens = fresh_input_tokens + cached_input_tokens
rates = LONG if prompt_tokens >= 200_000 else SHORT
return (
fresh_input_tokens * rates.input_per_million
+ cached_input_tokens * rates.cached_input_per_million
+ max_output_tokens * rates.output_per_million
) / 1_000_000
estimate = estimate_grok_47_cost(
fresh_input_tokens=2_000,
cached_input_tokens=20_000,
max_output_tokens=600,
)
print(f"Perkiraan batas atas: ${estimate:.5f}")
Ini adalah pengaman perencanaan, bukan tagihan. Biaya akhir bergantung pada input aktual, input di-cache, output, percobaan ulang, panggilan alat, dan harga aktif saat eksekusi. Setelah setiap respons, simpan penggunaan token yang dikembalikan, ID model, status permintaan, dan hasil tugas. Rekonsiliasikan nilai-nilai tersebut dengan catatan penagihan penyedia.
Lima Kendali Biaya Grok 4.7, Diurutkan berdasarkan Dampak yang Mungkin
1. Jaga Konteks Berulang Cukup Stabil untuk Di-cache
Letakkan instruksi statis, dokumentasi produk, skema, dan contoh yang dapat digunakan kembali sebelum konten spesifik permintaan. Hindari mengubah stempel waktu, ID, whitespace, atau pengurutan di dalam prefix bersama yang besar kecuali perubahan tersebut diperlukan. Panduan Grok 4.7 dari xAI merekomendasikan pengidentifikasi perutean cache yang stabil untuk percakapan; saat menggunakan rute perantara, verifikasi kontrol cache dan kolom penggunaan mana yang didukung sebelum mengandalkannya.
Ukur token hit cache dan rasio hit cache berdasarkan beban kerja. Diskon cache teoretis tidak bernilai jika aplikasi terus-menerus memutasi prefix.
2. Perlakukan 200K sebagai Anggaran Rekayasa, Bukan Target
Sediakan ruang di bawah ambang untuk instruksi sistem, bagian hasil retrieval, hasil alat, dan giliran pengguna berikutnya. Untuk sebuah agen, padatkan percakapan lama menjadi ringkasan tervalidasi dan simpan transkrip mentah di luar konteks model. Untuk retrieval, peringkatkan dan deduplikasi bagian sebelum dimasukkan alih-alih mengirim setiap kecocokan.
Lacak distribusi panjang prompt dan beri peringatan sebelum p95 mendekati ambang. Di bawah jadwal resmi xAI, setelah sebuah prompt mencapai 200K token, tarif konteks panjang berlaku untuk semua token dalam permintaan tersebut. CometAPI juga mencantumkan tier konteks panjang yang terpisah dan lebih tinggi untuk Grok 4.7. Ini adalah ketentuan harga platform, bukan kemampuan model.
3. Batasi Output dan Setel Upaya Penalaran terhadap Set Evaluasi
Tetapkan batas output tingkat aplikasi yang sesuai dengan produk. Hasil klasifikasi mungkin hanya membutuhkan puluhan token; jawaban dukungan mungkin membutuhkan beberapa ratus; laporan riset mungkin membutuhkan lebih banyak. Batas ini adalah kendali anggaran dan pengalaman pengguna, bukan batas keras pada model Grok 4.7. Catatan rilis 21 September xAI menyatakan bahwa Grok 4.7 tidak memiliki batas output teks; itu tidak mencegah aplikasi atau rute API tertentu menerapkan batas permintaan sendiri. Konfirmasikan batas permintaan yang diterapkan endpoint atau SDK dengan rute yang benar-benar Anda gunakan.
Grok 4.7 mendukung beberapa tingkat upaya penalaran. Gunakan tingkat terendah yang lulus set evaluasi representatif, dan cadangkan upaya lebih tinggi untuk tugas di mana ia menghasilkan peningkatan yang terukur. Mengurangi penalaran atau output tanpa pemeriksaan kualitas dapat menciptakan percobaan ulang dan menghapus penghematan.
4. Tolak atau Bentuk Ulang Permintaan Mahal Sebelum Panggilan API
Perkirakan batas atas dari ukuran input dan batas output yang dikonfigurasi. Jika permintaan melebihi anggaran produk, aplikasi dapat meminta pengguna mempersempit tugas, merangkum materi yang diunggah, mengurangi konteks yang diambil, atau memindahkan pekerjaan ke alur kerja asinkron yang disetujui. Ini lebih dapat diprediksi daripada mengetahui biayanya setelah generasi.
Perkiraan karakter-ke-token yang kasar dapat berguna sebagai pengaman awal, tetapi tidak boleh menggantikan tokenizer atau data penggunaan aktual. Bahasa, kode, JSON, dan pemformatan dapat menghasilkan kepadatan token yang sangat berbeda.
5. Optimalkan Biaya per Tugas yang Berhasil, Bukan Biaya per Panggilan
Panggilan yang lebih murah tetapi gagal validasi dua kali bisa lebih mahal daripada satu panggilan yang berhasil. Lacak:
- biaya per jawaban yang diterima;
- biaya per tugas agen yang selesai;
- biaya percobaan ulang dan fallback;
- rasio hit cache dan proporsi token di-cache;
- p50 dan p95 token prompt dan output;
- skor kualitas, latensi, dan tingkat eskalasi manusia.
Jika lalu lintas rutin tidak memerlukan kualitas atau kapasitas konteks Grok 4.7, katalog model terpadu CometAPI dapat memudahkan pergantian model yang dikelola aplikasi. Jaga aturan perutean tetap eksplisit, evaluasi setiap model pada set tugas yang sama, dan kirim hanya permintaan yang mendapat manfaat dari Grok 4.7 ke rute ini.
Tinjauan Biaya Bulanan yang Praktis
Seminggu sekali, kelompokkan lalu lintas berdasarkan fitur dan bandingkan biaya perkiraan dengan penggunaan aktual. Mulailah dengan fitur yang bertanggung jawab atas token output terbanyak, prompt terbesar, dan rasio hit cache terendah. Lalu tinjau outlier mahal alih-alih mengoptimalkan permintaan median secara membabi buta.
| Sinyal | Masalah yang mungkin | Tindakan pertama |
|---|---|---|
| Proporsi token di-cache rendah | Prefix bersama terlalu sering berubah | Stabilkan dan versikan konteks yang bisa dipakai ulang |
| Prompt mengelompok dekat 200K | Riwayat atau retrieval tidak dibatasi | Padatkan, peringkatkan, dan sediakan ruang |
| Output mendominasi pengeluaran | Respons lebih panjang dari kebutuhan produk | Turunkan batas dan uji kualitas jawaban |
| Biaya percobaan ulang tinggi | Validasi, time-out, atau prompt tidak stabil | Perbaiki mode kegagalan pada panggilan pertama |
| Biaya rendah tapi penyelesaian buruk | Optimisasi mengurangi kualitas yang berguna | Ukur biaya per hasil yang diterima |
Peran CometAPI dalam Model Biaya Grok 4.7
Peran CometAPI dalam alur kerja ini berada di tingkat platform API: menyediakan akses ke Grok 4.7, memublikasikan tarif tokennya sendiri, dan mendokumentasikan titik masuk yang kompatibel dengan OpenAI. Ini tidak mengubah kemampuan model dasar Grok 4.7. Tim yang sudah menggunakan klien gaya OpenAI mungkin dapat mempertahankan pola klien yang sama sambil mengganti kunci API, URL dasar, dan ID model, tergantung kompatibilitas endpoint.
Per 28 September 2026, tarif Grok 4.7 yang tercantum CometAPI adalah 20% di bawah tarif langsung xAI yang sesuai di tier standar dan konteks panjang. Ini adalah perbandingan harga platform, bukan klaim kualitas model. Sebelum peluncuran produksi, tim juga harus memverifikasi ID model aktif, parameter endpoint, perilaku cache, batas laju, keandalan, dukungan, dan ketentuan penagihan.
Untuk menguji model, tinjau detail harga dan akses saat ini di halaman model Grok 4.7 CometAPI. Simpan tabel harga dalam konfigurasi, catat penggunaan aktual setelah setiap panggilan, dan jalankan ulang perkiraan beban kerja kapan pun perilaku model atau produk berubah.
FAQ
Berapa harga per token Grok 4.7 di CometAPI?
Untuk prompt di bawah 200K token, CometAPI saat ini mencantumkan $1.60 per 1M token input baru, $0.40 per 1M token input di-cache, dan $4.80 per 1M token output. Tarif konteks panjang yang tercantum masing-masing adalah $3.20, $0.80, dan $9.60 per 1M token.
Berapa biaya satu permintaan API Grok 4.7?
Tergantung pada input baru, input di-cache, output, dan tier konteks yang aktif. Kalikan setiap jumlah token dengan tarif per juta masing-masing, jumlahkan hasilnya, dan bagi satu juta. Sertakan juga percobaan ulang dan setiap panggilan model dalam alur kerja multi-langkah.
Apa cara termudah untuk mengurangi biaya API Grok 4.7?
Mulailah dari penggerak biaya terbesar yang terukur. Instruksi panjang yang berulang biasanya mendapat manfaat dari cache; riwayat agen yang tumbuh mendapat manfaat dari pemadatan; jawaban verbose mendapat manfaat dari batas output yang lebih rendah. Konfirmasikan bahwa kualitas tetap dapat diterima setelah setiap perubahan.
Apakah jendela konteks 500K berarti saya harus mengirim 500K token?
Tidak. Jendela konteks adalah batas kapasitas, bukan rekomendasi. Baik harga langsung xAI maupun daftar CometAPI saat ini menggunakan tarif konteks panjang yang lebih tinggi pada ambang 200K prompt, jadi aplikasi sebaiknya hanya mengirim konteks yang diperlukan untuk tugas.
Bisakah saya memperkirakan biaya sebelum memanggil Grok 4.7?
Bisa. Perkirakan token input, pilih tier konteks yang benar, tambahkan batas output realistis, dan hitung batas atas. Setelah panggilan, gantikan perkiraan dengan data penggunaan aktual untuk pelaporan dan optimisasi.