GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Riset CometAPI

Grok 4.7: Benchmark, Harga, Fitur, dan Akses API

Pelajari apa itu Grok 4.7, termasuk jendela konteks 500K, tolok ukur, harga, mode penalaran, kemampuan agen, perbandingan dengan Grok 4.6, dan akses.

CometAPI
Deon GoodwinTim riset model AI dan API
Diperbarui Sep 22, 2026 12 menit baca
Grok 4.7: Benchmark, Harga, Fitur, dan Akses API
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 adalah model frontier milik SpaceXAI untuk pengodean, alur kerja agen, dan kerja pengetahuan profesional, dirilis pada 21 September 2026. Model ini menggabungkan jendela konteks 500,000 token, masukan teks dan gambar, penalaran yang dapat dikonfigurasi, pemanggilan fungsi, penelusuran web dan X, serta eksekusi kode.

Untuk prompt di bawah 200,000 token, xAI API resmi mencantumkan $2 per juta token input, $0.50 per juta token input yang di-cache, dan $6 per juta token output. CometAPI saat ini mencantumkan Grok 4.7 pada $1.60 input, $0.40 input yang di-cache, dan $4.80 output per juta token untuk tier yang sama—pengurangan 20% dari tarif resmi yang ditampilkan pada halaman modelnya.

Proposisi nilai praktisnya bukan kepemimpinan universal pada benchmark. Grok 4.7 paling menarik ketika beban kerja menggabungkan tugas rekayasa, loop agen panjang, penggunaan alat, konteks kerja besar, dan sensitivitas terhadap biaya token output. Tim sebaiknya memvalidasi model ini pada repositori dan alur kerja mereka sendiri sebelum perutean produksi.

Pokok-Pokok Utama

  • Grok 4.7 menggunakan model dasar yang lebih besar daripada Grok 4.6, reinforcement learning yang lebih lama pada tugas multi-jam yang lebih sulit, dan verifikasi diri yang lebih kuat.
  • API mendukung jendela konteks 500,000 token, masukan teks dan gambar, keluaran teks, empat tingkat penalaran, output terstruktur, pemanggilan fungsi, penelusuran web dan X, serta eksekusi kode.
  • SpaceXAI melaporkan 46.3% pada CursorBench 4.0, 71.0% pada DeepSWE v1.1, dan 38.0% pada Terminal-Bench 4.0. Ini adalah hasil yang dipublikasikan vendor, bukan bukti kepemimpinan universal.
  • CometAPI mencantumkan Grok 4.7 sebagai tersedia, dengan endpoint yang kompatibel dengan OpenAI dan harga 20% di bawah tarif xAI resmi yang ditampilkan dalam katalog saat ini.
  • Pilih Grok 4.7 untuk agen rekayasa yang sensitif biaya dan penggunaan alat berkelanjutan; pilih alternatif ketika konteks sangat panjang atau domain kritis-benchmark lebih penting daripada harga per unit.

Apa Itu Grok 4.7?

Grok 4.7 adalah model besar frontier terbaru dari SpaceXAI, diposisikan untuk pengodean, tugas agen otonom, dan kerja pengetahuan profesional. Rilis ini berfokus pada tugas yang memerlukan interaksi berkelanjutan, penggunaan alat, verifikasi, dan revisi alih-alih hanya jawaban satu kali.

SpaceXAI mengatakan Grok 4.7 dilatih dengan run reinforcement learning yang lebih lama pada campuran tugas yang lebih sulit, dengan bobot pada masalah yang bisa membutuhkan banyak jam untuk diselesaikan. Arah pelatihan ini membuatnya sangat relevan untuk rekayasa perangkat lunak tingkat repositori, debugging, riset, pembuatan dokumen, analisis rekayasa, dan otomasi multi-langkah.

Apa Bedanya Grok 4.7 Dengan—dan Lebih Baik Dari—Grok 4.6?

Model Dasar yang Lebih Besar

Grok 4.7 beralih ke model dasar yang lebih besar daripada Grok 4.6. SpaceXAI belum mengungkapkan jumlah parameter publik final, sehingga kesimpulan yang defensif adalah peningkatan kapasitas model dasar—bukan estimasi parameter spesifik.

Reinforcement Learning Lebih Lama pada Tugas Lebih Sulit

Tahap reinforcement learning diperpanjang dan digeser ke arah masalah yang lebih sulit dan berjangka panjang. SpaceXAI menekankan tugas yang mungkin membutuhkan jam kerja, menyelaraskan model ini dengan pengodean otonom, riset, dan alur kerja agen profesional.

Verifikasi Diri yang Lebih Kuat

Grok 4.7 dilatih untuk memeriksa hasil kerjanya sendiri dengan lebih saksama. Hal ini penting dalam rekayasa perangkat lunak karena agen yang andal harus berulang kali memeriksa, memodifikasi, menguji, mendiagnosis kegagalan, merevisi, dan memvalidasi—bukan sekadar menghasilkan jawaban pertama.

Peningkatan Terukur Dibanding Grok 4.6

DimensiGrok 4.6Grok 4.7Perubahan
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

Di seluruh suite peluncuran yang dipublikasikan, Grok 4.7 meningkat dibanding Grok 4.6 pada setiap hasil yang dicantumkan. Peningkatan absolut terbesar ada pada Terminal-Bench 4.0, konsisten dengan penekanan rilis pada alur kerja baris perintah dan penggunaan alat yang berjalan lama. Angka-angka ini tetap merupakan hasil yang dipublikasikan vendor dan harus diuji terhadap tugas nyata sebelum keputusan migrasi.

Seberapa Baik Grok 4.7 pada Benchmark?

Evaluasi peluncuran SpaceXAI mencakup rekayasa perangkat lunak, pekerjaan terminal, tugas kantor profesional, pekerjaan hukum, penalaran klinis, dan rekayasa listrik. Ini adalah hasil yang dipublikasikan vendor dan harus divalidasi terhadap beban kerja produksi sebelum keputusan pengadaan atau perutean.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

Dalam hasil peluncuran Grok 4.7, SpaceXAI menandai skor DeepSWE v1.1 71.0% sebagai upaya penalaran tinggi.

Pengumuman peluncuran tidak mengungkapkan setiap harness per-benchmark, konfigurasi alat, jumlah run, atau lingkungan evaluasi. Perlakukan nilai-nilai ini sebagai hasil yang dipublikasikan vendor dan validasi model pada repositori, alat, target latensi, dan kriteria kegagalan Anda sendiri sebelum merutekan pekerjaan produksi.

Apa yang Ditunjukkan Profil Benchmark Grok 4.7?

Rekayasa Perangkat Lunak

CursorBench 4.0 naik dari 40.4% pada Grok 4.6 menjadi 46.3% pada Grok 4.7, sementara DeepSWE v1.1 naik dari 65.2% menjadi 71.0%. Ini mendukung positioning Grok 4.7 sebagai model untuk agen pengodean alih-alih hanya asisten pengodean percakapan.

Pekerjaan Terminal Berkepanjangan

Terminal-Bench 4.0 menunjukkan salah satu perubahan generasional terbesar: 20.3% untuk Grok 4.6 versus 38.0% untuk Grok 4.7. Kenaikan absolut 17.7 poin ini konsisten dengan penekanan SpaceXAI pada reinforcement learning berjangka lebih panjang dan verifikasi diri.

Rekayasa Listrik

Pada EEBench, Grok 4.7 mencapai 64.0%, dibandingkan 53.0% untuk Grok 4.6. Di antara perbandingan yang dipublikasikan, ini adalah salah satu hasil relatif terkuat Grok 4.7.

Kerja Pengetahuan Profesional

AA Briefcase v1.1 naik dari 1,546 menjadi 1,657. Tugas-tugas ini dirancang untuk mencerminkan pekerjaan profesional multi-jam yang melibatkan artefak seperti dokumen, presentasi, analisis, dan deliverable terstruktur lainnya.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Bagaimana Perbandingan Mereka?

Pemeriksaan harga native penyedia: OpenAI mencantumkan GPT-5.6 Sol pada $4 per juta token input dan $20 per juta token output, sementara Anthropic mencantumkan Claude Fable 5.1 pada $10 per juta token input dan $50 per juta token output.

DimensiGrok 4.7GPT-5.6 SolClaude Fable 5.1
Positioning utamaPengodean, tugas agen, kerja pengetahuanPenalaran profesional kompleks dan pengodeanAgen berjalan lama, pengodean, dan alur kerja pengetahuan
Jendela konteks500,000 tokens1,050,000 tokens1,000,000 tokens
ModalitasMasukan teks dan gambar; keluaran teksMasukan teks dan gambar; keluaran teksMasukan teks dan gambar; keluaran teks
Kontrol penalaranLow, medium, high, xhighNone through maxAdaptive thinking dengan upaya yang dapat dikonfigurasi
Status API penyediaTersedia di xAI API publikTersedia melalui OpenAI Chat Completions and ResponsesTersedia melalui Claude API dan marketplace cloud yang didukung
Harga input / 1M tokens$2$4$10
Harga output / 1M tokens$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
Kecocokan terbaikAgen rekayasa sensitif harga dan penggunaan alat berkelanjutanPenalaran profesional luas dengan konteks sangat panjangPerforma maksimum agen berjalan lama dan alur kerja pengetahuan

Model Mana yang Harus Anda Pilih?

  • Pilih Grok 4.7 ketika beban kerja rekayasa, penggunaan alat berkelanjutan, penalaran yang dapat dikonfigurasi, dan biaya token output yang lebih rendah menjadi prioritas. Model ini sangat menarik untuk agen repositori, alur kerja terminal, dan riset berkonteks besar yang tetap di bawah ambang harga 200K.
  • Pilih GPT-5.6 Sol ketika tugas memerlukan penalaran profesional yang lebih luas, jendela konteks di atas satu juta token, atau ketika hasilnya yang lebih kuat pada evaluasi kritis bisnis seperti DeepSWE atau penalaran klinis telah divalidasi dalam harness Anda sendiri.
  • Pilih Claude Fable 5.1 ketika performa agen berjalan lama, kualitas pengodean, eksekusi terminal, atau penalaran klinis yang maksimum membenarkan harga token yang lebih tinggi.
  • Gunakan perutean model ketika beban kerja bervariasi. Rute langkah agen rekayasa rutin dan volume tinggi ke model berkualifikasi paling efisien biaya, dan cadangkan model yang lebih mahal untuk tugas di mana tingkat keberhasilan terukur membenarkan premi.

Pilihan yang benar bergantung pada keberhasilan tugas end-to-end, latensi, retry, akurasi pemanggilan alat, dan rework manusia—bukan pada satu benchmark atau tarif token utama.

Berapa Biaya API Grok 4.7?

Tabel di bawah membandingkan tarif xAI resmi dengan harga yang ditampilkan pada halaman model Grok 4.7 CometAPI pada 22 September 2026. CometAPI menyatakan diskon 20%; verifikasi harga langsung sebelum produksi karena harga gateway dan ketentuan promosi dapat berubah.

Tier promptJenis hargaxAI resmiCometAPIPerbedaan
Di bawah 200K token promptInput / 1M$2.00$1.6020% lebih rendah
Cached input / 1M$0.50$0.4020% lebih rendah
Output / 1M$6.00$4.8020% lebih rendah
Di atas 200K token promptInput / 1M$4.00$3.2020% lebih rendah
Cached input / 1M$1.00$0.8020% lebih rendah
Output / 1M$12.00$9.6020% lebih rendah

Harga Standar untuk Prompt hingga 200,000 Token

Untuk permintaan yang prompt-nya tidak melebihi 200,000 token, Grok 4.7 berharga $2 per juta token input, $0.50 per juta token input yang di-cache, dan $6 per juta token output. Input yang di-cache adalah kategori paling murah, sehingga aplikasi dengan instruksi sistem yang berulang atau konteks yang dapat digunakan kembali dapat mengurangi biaya ketika token tersebut memenuhi syarat caching.

Sebagai contoh sederhana, sebuah permintaan yang menggunakan 100,000 token input non-cache dan menghasilkan 10,000 token output akan berbiaya sekitar $0.26 sebelum biaya platform lainnya: $0.20 untuk input ditambah $0.06 untuk output.

Harga Konteks Panjang di Atas 200,000 Token Prompt

Setelah prompt melebihi 200,000 token, tarifnya menjadi dua kali lipat menjadi $4 per juta token input, $1 per juta token input yang di-cache, dan $12 per juta token output. Tier yang lebih tinggi berlaku karena panjang prompt, jadi tim harus memantau riwayat percakapan yang terakumulasi, jejak alat, dokumen yang diambil, dan konteks repositori sebelum mengirim setiap permintaan.

Keputusan biaya praktis karenanya bukan hanya berapa banyak token yang digunakan tugas, tetapi apakah prompt melewati batas 200,000 token. Merangkum pekerjaan yang sudah selesai, menghapus output alat yang usang, dan hanya mengambil file yang paling relevan dapat menjaga beban kerja yang sesuai tetap berada dalam tier standar tanpa mengorbankan konteks yang diperlukan.

Catatan rilis SpaceXAI mendokumentasikan ambang ini. Anggaran produksi juga harus memperhitungkan retry, loop agen, panggilan alat yang gagal, dan panjang output alih-alih membandingkan penyedia hanya berdasarkan harga token input utama mereka.

Apa yang Membuat Grok 4.7 Berguna untuk Agen AI?

  • Jendela konteks 500K: Menampung sejumlah besar kode sumber, spesifikasi, output alat, log, dan riwayat percakapan dalam satu konteks kerja. Ini berguna untuk pengodean skala repositori dan analisis multi-dokumen, meskipun konteks masih perlu pemangkasan aktif.
  • Penalaran yang dapat dikonfigurasi: Aplikasi dapat memilih upaya low, medium, high, atau xhigh, menukar latensi dan komputasi untuk penalaran yang lebih dalam sesuai kesulitan tugas.
  • Pemanggilan fungsi dan output terstruktur: Agen dapat melakukan query database, menjalankan tes, memeriksa dokumen, memanggil API internal, dan mengembalikan hasil yang bisa dibaca mesin.
  • Penelusuran web dan X: Alat penelusuran dapat mengambil informasi terbaru ketika data pelatihan model tidak mencukupi. Konten yang diambil tetap harus diperlakukan sebagai masukan yang tidak dipercaya dan diverifikasi.
  • Eksekusi kode: Model dapat memvalidasi perhitungan, mentransformasi data, dan menguji solusi yang dihasilkan alih-alih hanya mengandalkan inferensi model bahasa.
  • Fokus alur kerja berjangka panjang: Penekanan pelatihan pada tugas multi-jam, manajemen konteks, dan verifikasi diri menargetkan loop agen yang mengakumulasi jejak alat dan memerlukan pemulihan setelah kegagalan.

Bagaimana Grok 4.7 Meningkatkan Keamanan?

SpaceXAI mengatakan Grok 4.7 memperkenalkan tumpukan pengamanan yang sepenuhnya baru dan melaporkan ketahanan jailbreak yang lebih kuat serta keamanan dual-use. Dalam pengumuman peluncuran, perusahaan melaporkan 62.4% pada benchmark biosafety LatchBio dan mengatakan hanya 3.3% prompt dual-use berisiko yang lolos pada HackerBench v0.3.

Angka-angka ini adalah evaluasi yang dipublikasikan vendor. Angka tersebut berguna untuk memahami klaim rilis tetapi tidak boleh dianggap sebagai ukuran universal kinerja keamanan di dunia nyata.

Bagaimana Pengembang Dapat Menggunakan API Grok 4.7?

Grok 4.7 saat ini tersedia melalui CometAPI dengan ID model grok-4.7. CometAPI menyediakan endpoint yang kompatibel dengan OpenAI, satu kunci API dan alur penagihan di berbagai penyedia model, pengujian dan perutean model berdampingan yang lebih mudah, serta harga token yang saat ini tercantum 20% di bawah tarif xAI resmi. Sebelum penggunaan produksi, konfirmasikan halaman model live, kesehatan endpoint, parameter yang didukung, harga, dan persyaratan penanganan data.

Contoh permintaan CometAPI:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Apakah Grok 4.7 Layak untuk Beralih?

Bagi pengguna Grok 4.6 yang bergantung pada agen pengodean atau alur kerja profesional jangka panjang, Grok 4.7 adalah kandidat peningkatan material karena set benchmark peluncuran meningkat di setiap dimensi yang dilaporkan sementara harga token standar tetap pada level $2/$6 di bawah ambang konteks panjang.

Bagi pengguna model frontier lain, keputusan bersifat spesifik beban kerja. Grok 4.7 sangat menarik ketika biaya token output, beban kerja rekayasa, konteks besar, dan penggunaan alat berkelanjutan penting. Di mana model lain lebih kuat pada domain kritis, perutean model bisa lebih rasional daripada mengganti setiap model dengan satu penyedia.

Kesimpulan

Grok 4.7 lebih dari sekadar pembaruan numerik rutin untuk Grok 4.6. Rilis ini secara eksplisit berorientasi pada pekerjaan yang berjalan lama melalui alat, verifikasi berulang, konteks besar, dan beberapa langkah eksekusi.

Peningkatan generasional terkuat muncul di tempat di mana arah pelatihan itu seharusnya penting: Terminal-Bench 4.0 naik dari 20.3% menjadi 38.0%, EEBench dari 53.0% menjadi 64.0%, dan CursorBench 4.0 dari 40.4% menjadi 46.3%, sementara harga standar di bawah ambang prompt 200K tetap pada $2/M input dan $6/M output.

Proposisi nilai praktisnya karenanya bukan “Grok 4.7 memenangkan setiap benchmark.” Melainkan Grok 4.7 mempersempit kesenjangan antara kapabilitas agen kelas frontier dan inferensi berbiaya lebih rendah, menjadikannya sangat relevan untuk agen pengodean, sistem riset, dan alur kerja profesional yang perlu berjalan dalam banyak langkah alih-alih menjawab sekali.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 22, 2026
Terakhir diperbarui Sep 22, 2026
19 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya