GPT-6.1 Sol are now live on CometAPI →
technology/Riset CometAPI

Harga API Grok 4.7 di CometAPI: Acuan Resmi, Perkiraan Biaya, dan Penghematan

Bandingkan tarif API Grok 4.7 dengan harga CometAPI, perkirakan pengeluaran bulanan, dan kurangi biaya aplikasi AI dengan caching, kontrol konteks, serta batas keluaran di tingkat aplikasi.

CometAPI
Bobby SpencerTim riset model AI dan API
Diperbarui Oct 1, 2026 11 menit baca
Harga API Grok 4.7 di CometAPI: Acuan Resmi, Perkiraan Biaya, dan Penghematan
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

xAI menggambarkan Grok 4.7 sebagai model frontier untuk pengodean, tugas agen, dan pekerjaan berbasis pengetahuan, dengan jendela konteks 500K token. Menurut halaman harga xAI saat ini, tarif API langsung di bawah 200.000 token prompt adalah $2.00 per 1M token input, $0.50 per 1M token di-cache, dan $6.00 per 1M token output. Ketika sebuah prompt mencapai 200.000 token atau lebih, xAI mencantumkan masing-masing $4.00, $1.00, dan $12.00. Ini adalah tarif langsung xAI, bukan harga universal di seluruh platform pihak ketiga.

Pengeluaran aktual bergantung pada lebih dari sekadar tarif input utama. Input baru, input di-cache, output, percobaan ulang, panggilan alat, dan jumlah panggilan model dalam alur kerja agen semuanya dapat mengubah tagihan. Ambang 200K prompt sangat penting karena xAI dan CometAPI sama-sama memublikasikan tarif konteks panjang yang lebih tinggi setelah batas tersebut tercapai.

Panduan ini terlebih dahulu menetapkan patokan harga xAI, lalu membandingkan daftar CometAPI Grok 4.7 saat ini. Per 28 September 2026, CometAPI mencantumkan $1.60 / $0.40 / $4.80 per 1M token input baru, input di-cache, dan token output di tier standar, serta $3.20 / $0.80 / $9.60 di tier konteks panjang—20% di bawah tarif langsung xAI yang sesuai. Bagian-bagian berikut menjelaskan cara menghitung biaya beban kerja, mengurangi pemborosan, dan mengakses model melalui CometAPI. Semua harga adalah cuplikan bertanggal dan harus diperiksa ulang sebelum digunakan di produksi.

Harga xAI Langsung vs. CometAPI Grok 4.7

Tarif xAI langsung (USD per 1M token)

Kategori tokenDi bawah 200K token promptKonteks panjang (≥200K)
Input baru$2.00$4.00
Input di-cache$0.50$1.00
Output$6.00$12.00

Tarif CometAPI (USD per 1M token)

Kategori tokenCometAPI: di bawah 200K token promptCometAPI: tier konteks panjang
Input baru$1.60 / 1M token$3.20 / 1M token
Input di-cache$0.40 / 1M token$0.80 / 1M token
Output$4.80 / 1M token$9.60 / 1M token

Batas 200K prompt penting karena kedua platform saat ini mencantumkan tarif konteks panjang sebesar dua kali lipat dari tarif tier standar untuk Grok 4.7. Ini adalah aturan harga yang ditetapkan oleh masing-masing platform API, bukan perubahan kemampuan model. Permintaan menjadi lebih mahal ketika aplikasi berulang kali mengirim prompt besar atau membiarkan riwayat agen tumbuh tanpa kendali—bukan semata-mata karena Grok 4.7 mendukung jendela konteks 500K.

Untuk penganggaran, perlakukan setiap permintaan yang diproyeksikan mencapai batas sebagai konteks panjang hingga perilaku penagihan aktif terverifikasi. Ketersediaan model dan harga dapat berubah, jadi kalkulator produksi harus memeriksa ulang harga langsung xAI dan halaman model CometAPI saat ini alih-alih meng-hard-code nilai permanen.

Rumus Perkiraan Biaya Grok 4.7

Perkirakan satu permintaan dengan memberi harga setiap kategori token secara terpisah:

request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000

Lalu ubah perkiraan permintaan menjadi perkiraan beban kerja:

monthly cost = request cost × requests per user × active users × days in billing period

Gunakan persentil realistis, bukan satu rata-rata. Estimasi p50 menggambarkan permintaan normal, tetapi panjang input dan output p95 membuka ekor mahal yang sering mendorong tagihan. Untuk alur kerja agen, kalikan dengan jumlah panggilan model yang diharapkan per tugas yang selesai. Alur kerja lima langkah berarti lima panggilan yang ditagih, bukan satu.

Contoh Perhitungan 1: Copilot Dukungan

Asumsikan satu permintaan dukungan mengirim 6,000 token input baru dan menghasilkan 800 token output. Ini tetap di bawah ambang 200K dan tidak menerima diskon cache.

  • Input: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
  • Output: 800 × $4.80 ÷ 1,000,000 = $0.00384
  • Total: $0.01344 per permintaan

Pada 100,000 permintaan per bulan, perkiraan biaya token adalah $1,344. Jika evaluasi menunjukkan bahwa jawaban 400 token berkinerja sama baiknya dengan jawaban 800 token, perkiraan turun menjadi $0.01152 per permintaan, atau $1,152 per bulan. Batas output tunggal itu menghemat sekitar $192 per bulan, atau 14.3%, tanpa mengubah model.

Inilah mengapa kendali output layak mendapat perhatian. Pada tarif CometAPI yang tercantum, token output berharga tiga kali lipat token input baru di tier yang sama.

Contoh Perhitungan 2: Menggunakan Kembali Prefix Stabil 20K Token

Misalkan setiap permintaan berisi manual produk 20,000 token, 2,000 token konteks percakapan baru, dan respons 600 token.

Tanpa hit cache, perkiraannya adalah:

  • 22,000 token input baru: $0.03520
  • 600 token output: $0.00288
  • Total: $0.03808 per permintaan

Jika prefix 20,000 token yang stabil ditagih sebagai input di-cache sementara hanya 2,000 token yang tetap baru, perkiraannya menjadi:

  • 20,000 token input di-cache: $0.00800
  • 2,000 token input baru: $0.00320
  • 600 token output: $0.00288
  • Total: $0.01408 per permintaan

Pada 100,000 permintaan, itu adalah $1,408 alih-alih $3,808—perkiraan penghematan $2,400, atau 63.0%. Penghematan tidak otomatis: permintaan pertama, prefix yang berubah, atau rute yang tidak menghasilkan hit cache masih dapat ditagih pada tarif input baru. Konfirmasikan jumlah token di-cache dalam data penggunaan aktual sebelum memperlakukan perkiraan sebagai penghematan yang tercapai.

Contoh Perhitungan 3: Biaya Melampaui 200K

Pertimbangkan permintaan agen yang berjalan lama dengan 210,000 token prompt dan 2,000 token output. Menggunakan tarif konteks panjang yang tercantum:

  • 210,000 token input baru: $0.67200
  • 2,000 token output: $0.01920
  • Total: $0.69120 per run

Jika pemadatan konteks, penyaringan retrieval, dan ringkasan checkpoint mengurangi prompt menjadi 180,000 token sambil mempertahankan output 2,000 token yang sama, perkiraan tier standar adalah:

  • 180,000 token input baru: $0.28800
  • 2,000 token output: $0.00960
  • Total: $0.29760 per run

Perbedaannya adalah $0.39360 per run, atau sekitar 56.9%. Pada 10,000 run, perkiraan penghematannya $3,936. Pelajarannya bukan menghapus konteks yang berguna. Pelajarannya adalah menyimpan hanya konteks yang mengubah jawaban dan merangkum atau mengambil sisanya sebelum permintaan melewati batas harga.

Kalkulator Python untuk Perkiraan Pra-Panggilan

Fungsi berikut menggunakan tarif Grok 4.7 CometAPI yang saat ini tercantum. Fungsi ini secara konservatif menerapkan tier konteks panjang ketika total prompt mencapai 200,000 token.

from dataclasses import dataclass

@dataclass(frozen=True)
class Rates:
    input_per_million: float
    cached_input_per_million: float
    output_per_million: float

SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)

def estimate_grok_47_cost(
    fresh_input_tokens: int,
    cached_input_tokens: int,
    max_output_tokens: int,
) -> float:
    prompt_tokens = fresh_input_tokens + cached_input_tokens
    rates = LONG if prompt_tokens >= 200_000 else SHORT

    return (
        fresh_input_tokens * rates.input_per_million
        + cached_input_tokens * rates.cached_input_per_million
        + max_output_tokens * rates.output_per_million
    ) / 1_000_000

estimate = estimate_grok_47_cost(
    fresh_input_tokens=2_000,
    cached_input_tokens=20_000,
    max_output_tokens=600,
)
print(f"Perkiraan batas atas: ${estimate:.5f}")

Ini adalah pengaman perencanaan, bukan tagihan. Biaya akhir bergantung pada input aktual, input di-cache, output, percobaan ulang, panggilan alat, dan harga aktif saat eksekusi. Setelah setiap respons, simpan penggunaan token yang dikembalikan, ID model, status permintaan, dan hasil tugas. Rekonsiliasikan nilai-nilai tersebut dengan catatan penagihan penyedia.

Lima Kendali Biaya Grok 4.7, Diurutkan berdasarkan Dampak yang Mungkin

1. Jaga Konteks Berulang Cukup Stabil untuk Di-cache

Letakkan instruksi statis, dokumentasi produk, skema, dan contoh yang dapat digunakan kembali sebelum konten spesifik permintaan. Hindari mengubah stempel waktu, ID, whitespace, atau pengurutan di dalam prefix bersama yang besar kecuali perubahan tersebut diperlukan. Panduan Grok 4.7 dari xAI merekomendasikan pengidentifikasi perutean cache yang stabil untuk percakapan; saat menggunakan rute perantara, verifikasi kontrol cache dan kolom penggunaan mana yang didukung sebelum mengandalkannya.

Ukur token hit cache dan rasio hit cache berdasarkan beban kerja. Diskon cache teoretis tidak bernilai jika aplikasi terus-menerus memutasi prefix.

2. Perlakukan 200K sebagai Anggaran Rekayasa, Bukan Target

Sediakan ruang di bawah ambang untuk instruksi sistem, bagian hasil retrieval, hasil alat, dan giliran pengguna berikutnya. Untuk sebuah agen, padatkan percakapan lama menjadi ringkasan tervalidasi dan simpan transkrip mentah di luar konteks model. Untuk retrieval, peringkatkan dan deduplikasi bagian sebelum dimasukkan alih-alih mengirim setiap kecocokan.

Lacak distribusi panjang prompt dan beri peringatan sebelum p95 mendekati ambang. Di bawah jadwal resmi xAI, setelah sebuah prompt mencapai 200K token, tarif konteks panjang berlaku untuk semua token dalam permintaan tersebut. CometAPI juga mencantumkan tier konteks panjang yang terpisah dan lebih tinggi untuk Grok 4.7. Ini adalah ketentuan harga platform, bukan kemampuan model.

3. Batasi Output dan Setel Upaya Penalaran terhadap Set Evaluasi

Tetapkan batas output tingkat aplikasi yang sesuai dengan produk. Hasil klasifikasi mungkin hanya membutuhkan puluhan token; jawaban dukungan mungkin membutuhkan beberapa ratus; laporan riset mungkin membutuhkan lebih banyak. Batas ini adalah kendali anggaran dan pengalaman pengguna, bukan batas keras pada model Grok 4.7. Catatan rilis 21 September xAI menyatakan bahwa Grok 4.7 tidak memiliki batas output teks; itu tidak mencegah aplikasi atau rute API tertentu menerapkan batas permintaan sendiri. Konfirmasikan batas permintaan yang diterapkan endpoint atau SDK dengan rute yang benar-benar Anda gunakan.

Grok 4.7 mendukung beberapa tingkat upaya penalaran. Gunakan tingkat terendah yang lulus set evaluasi representatif, dan cadangkan upaya lebih tinggi untuk tugas di mana ia menghasilkan peningkatan yang terukur. Mengurangi penalaran atau output tanpa pemeriksaan kualitas dapat menciptakan percobaan ulang dan menghapus penghematan.

4. Tolak atau Bentuk Ulang Permintaan Mahal Sebelum Panggilan API

Perkirakan batas atas dari ukuran input dan batas output yang dikonfigurasi. Jika permintaan melebihi anggaran produk, aplikasi dapat meminta pengguna mempersempit tugas, merangkum materi yang diunggah, mengurangi konteks yang diambil, atau memindahkan pekerjaan ke alur kerja asinkron yang disetujui. Ini lebih dapat diprediksi daripada mengetahui biayanya setelah generasi.

Perkiraan karakter-ke-token yang kasar dapat berguna sebagai pengaman awal, tetapi tidak boleh menggantikan tokenizer atau data penggunaan aktual. Bahasa, kode, JSON, dan pemformatan dapat menghasilkan kepadatan token yang sangat berbeda.

5. Optimalkan Biaya per Tugas yang Berhasil, Bukan Biaya per Panggilan

Panggilan yang lebih murah tetapi gagal validasi dua kali bisa lebih mahal daripada satu panggilan yang berhasil. Lacak:

  • biaya per jawaban yang diterima;
  • biaya per tugas agen yang selesai;
  • biaya percobaan ulang dan fallback;
  • rasio hit cache dan proporsi token di-cache;
  • p50 dan p95 token prompt dan output;
  • skor kualitas, latensi, dan tingkat eskalasi manusia.

Jika lalu lintas rutin tidak memerlukan kualitas atau kapasitas konteks Grok 4.7, katalog model terpadu CometAPI dapat memudahkan pergantian model yang dikelola aplikasi. Jaga aturan perutean tetap eksplisit, evaluasi setiap model pada set tugas yang sama, dan kirim hanya permintaan yang mendapat manfaat dari Grok 4.7 ke rute ini.

Tinjauan Biaya Bulanan yang Praktis

Seminggu sekali, kelompokkan lalu lintas berdasarkan fitur dan bandingkan biaya perkiraan dengan penggunaan aktual. Mulailah dengan fitur yang bertanggung jawab atas token output terbanyak, prompt terbesar, dan rasio hit cache terendah. Lalu tinjau outlier mahal alih-alih mengoptimalkan permintaan median secara membabi buta.

SinyalMasalah yang mungkinTindakan pertama
Proporsi token di-cache rendahPrefix bersama terlalu sering berubahStabilkan dan versikan konteks yang bisa dipakai ulang
Prompt mengelompok dekat 200KRiwayat atau retrieval tidak dibatasiPadatkan, peringkatkan, dan sediakan ruang
Output mendominasi pengeluaranRespons lebih panjang dari kebutuhan produkTurunkan batas dan uji kualitas jawaban
Biaya percobaan ulang tinggiValidasi, time-out, atau prompt tidak stabilPerbaiki mode kegagalan pada panggilan pertama
Biaya rendah tapi penyelesaian burukOptimisasi mengurangi kualitas yang bergunaUkur biaya per hasil yang diterima

Peran CometAPI dalam Model Biaya Grok 4.7

Peran CometAPI dalam alur kerja ini berada di tingkat platform API: menyediakan akses ke Grok 4.7, memublikasikan tarif tokennya sendiri, dan mendokumentasikan titik masuk yang kompatibel dengan OpenAI. Ini tidak mengubah kemampuan model dasar Grok 4.7. Tim yang sudah menggunakan klien gaya OpenAI mungkin dapat mempertahankan pola klien yang sama sambil mengganti kunci API, URL dasar, dan ID model, tergantung kompatibilitas endpoint.

Per 28 September 2026, tarif Grok 4.7 yang tercantum CometAPI adalah 20% di bawah tarif langsung xAI yang sesuai di tier standar dan konteks panjang. Ini adalah perbandingan harga platform, bukan klaim kualitas model. Sebelum peluncuran produksi, tim juga harus memverifikasi ID model aktif, parameter endpoint, perilaku cache, batas laju, keandalan, dukungan, dan ketentuan penagihan.

Untuk menguji model, tinjau detail harga dan akses saat ini di halaman model Grok 4.7 CometAPI. Simpan tabel harga dalam konfigurasi, catat penggunaan aktual setelah setiap panggilan, dan jalankan ulang perkiraan beban kerja kapan pun perilaku model atau produk berubah.

FAQ

Berapa harga per token Grok 4.7 di CometAPI?

Untuk prompt di bawah 200K token, CometAPI saat ini mencantumkan $1.60 per 1M token input baru, $0.40 per 1M token input di-cache, dan $4.80 per 1M token output. Tarif konteks panjang yang tercantum masing-masing adalah $3.20, $0.80, dan $9.60 per 1M token.

Berapa biaya satu permintaan API Grok 4.7?

Tergantung pada input baru, input di-cache, output, dan tier konteks yang aktif. Kalikan setiap jumlah token dengan tarif per juta masing-masing, jumlahkan hasilnya, dan bagi satu juta. Sertakan juga percobaan ulang dan setiap panggilan model dalam alur kerja multi-langkah.

Apa cara termudah untuk mengurangi biaya API Grok 4.7?

Mulailah dari penggerak biaya terbesar yang terukur. Instruksi panjang yang berulang biasanya mendapat manfaat dari cache; riwayat agen yang tumbuh mendapat manfaat dari pemadatan; jawaban verbose mendapat manfaat dari batas output yang lebih rendah. Konfirmasikan bahwa kualitas tetap dapat diterima setelah setiap perubahan.

Apakah jendela konteks 500K berarti saya harus mengirim 500K token?

Tidak. Jendela konteks adalah batas kapasitas, bukan rekomendasi. Baik harga langsung xAI maupun daftar CometAPI saat ini menggunakan tarif konteks panjang yang lebih tinggi pada ambang 200K prompt, jadi aplikasi sebaiknya hanya mengirim konteks yang diperlukan untuk tugas.

Bisakah saya memperkirakan biaya sebelum memanggil Grok 4.7?

Bisa. Perkirakan token input, pilih tier konteks yang benar, tambahkan batas output realistis, dan hitung batas atas. Setelah panggilan, gantikan perkiraan dengan data penggunaan aktual untuk pelaporan dan optimisasi.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Oct 1, 2026
Terakhir diperbarui Oct 1, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya