TL;DR Grok 4.7 adalah model frontier milik SpaceXAI untuk pengodean, alur kerja agen, dan kerja pengetahuan profesional, dirilis pada 21 September 2026. Model ini menggabungkan jendela konteks 500,000 token, masukan teks dan gambar, penalaran yang dapat dikonfigurasi, pemanggilan fungsi, penelusuran web dan X, serta eksekusi kode.
Untuk prompt di bawah 200,000 token, xAI API resmi mencantumkan $2 per juta token input, $0.50 per juta token input yang di-cache, dan $6 per juta token output. CometAPI saat ini mencantumkan Grok 4.7 pada $1.60 input, $0.40 input yang di-cache, dan $4.80 output per juta token untuk tier yang sama—pengurangan 20% dari tarif resmi yang ditampilkan pada halaman modelnya.
Proposisi nilai praktisnya bukan kepemimpinan universal pada benchmark. Grok 4.7 paling menarik ketika beban kerja menggabungkan tugas rekayasa, loop agen panjang, penggunaan alat, konteks kerja besar, dan sensitivitas terhadap biaya token output. Tim sebaiknya memvalidasi model ini pada repositori dan alur kerja mereka sendiri sebelum perutean produksi.
Pokok-Pokok Utama
- Grok 4.7 menggunakan model dasar yang lebih besar daripada Grok 4.6, reinforcement learning yang lebih lama pada tugas multi-jam yang lebih sulit, dan verifikasi diri yang lebih kuat.
- API mendukung jendela konteks 500,000 token, masukan teks dan gambar, keluaran teks, empat tingkat penalaran, output terstruktur, pemanggilan fungsi, penelusuran web dan X, serta eksekusi kode.
- SpaceXAI melaporkan 46.3% pada CursorBench 4.0, 71.0% pada DeepSWE v1.1, dan 38.0% pada Terminal-Bench 4.0. Ini adalah hasil yang dipublikasikan vendor, bukan bukti kepemimpinan universal.
- CometAPI mencantumkan Grok 4.7 sebagai tersedia, dengan endpoint yang kompatibel dengan OpenAI dan harga 20% di bawah tarif xAI resmi yang ditampilkan dalam katalog saat ini.
- Pilih Grok 4.7 untuk agen rekayasa yang sensitif biaya dan penggunaan alat berkelanjutan; pilih alternatif ketika konteks sangat panjang atau domain kritis-benchmark lebih penting daripada harga per unit.
Apa Itu Grok 4.7?
Grok 4.7 adalah model besar frontier terbaru dari SpaceXAI, diposisikan untuk pengodean, tugas agen otonom, dan kerja pengetahuan profesional. Rilis ini berfokus pada tugas yang memerlukan interaksi berkelanjutan, penggunaan alat, verifikasi, dan revisi alih-alih hanya jawaban satu kali.
SpaceXAI mengatakan Grok 4.7 dilatih dengan run reinforcement learning yang lebih lama pada campuran tugas yang lebih sulit, dengan bobot pada masalah yang bisa membutuhkan banyak jam untuk diselesaikan. Arah pelatihan ini membuatnya sangat relevan untuk rekayasa perangkat lunak tingkat repositori, debugging, riset, pembuatan dokumen, analisis rekayasa, dan otomasi multi-langkah.
Apa Bedanya Grok 4.7 Dengan—dan Lebih Baik Dari—Grok 4.6?
Model Dasar yang Lebih Besar
Grok 4.7 beralih ke model dasar yang lebih besar daripada Grok 4.6. SpaceXAI belum mengungkapkan jumlah parameter publik final, sehingga kesimpulan yang defensif adalah peningkatan kapasitas model dasar—bukan estimasi parameter spesifik.
Reinforcement Learning Lebih Lama pada Tugas Lebih Sulit
Tahap reinforcement learning diperpanjang dan digeser ke arah masalah yang lebih sulit dan berjangka panjang. SpaceXAI menekankan tugas yang mungkin membutuhkan jam kerja, menyelaraskan model ini dengan pengodean otonom, riset, dan alur kerja agen profesional.
Verifikasi Diri yang Lebih Kuat
Grok 4.7 dilatih untuk memeriksa hasil kerjanya sendiri dengan lebih saksama. Hal ini penting dalam rekayasa perangkat lunak karena agen yang andal harus berulang kali memeriksa, memodifikasi, menguji, mendiagnosis kegagalan, merevisi, dan memvalidasi—bukan sekadar menghasilkan jawaban pertama.
Peningkatan Terukur Dibanding Grok 4.6
| Dimensi | Grok 4.6 | Grok 4.7 | Perubahan |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
Di seluruh suite peluncuran yang dipublikasikan, Grok 4.7 meningkat dibanding Grok 4.6 pada setiap hasil yang dicantumkan. Peningkatan absolut terbesar ada pada Terminal-Bench 4.0, konsisten dengan penekanan rilis pada alur kerja baris perintah dan penggunaan alat yang berjalan lama. Angka-angka ini tetap merupakan hasil yang dipublikasikan vendor dan harus diuji terhadap tugas nyata sebelum keputusan migrasi.
Seberapa Baik Grok 4.7 pada Benchmark?
Evaluasi peluncuran SpaceXAI mencakup rekayasa perangkat lunak, pekerjaan terminal, tugas kantor profesional, pekerjaan hukum, penalaran klinis, dan rekayasa listrik. Ini adalah hasil yang dipublikasikan vendor dan harus divalidasi terhadap beban kerja produksi sebelum keputusan pengadaan atau perutean.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Dalam hasil peluncuran Grok 4.7, SpaceXAI menandai skor DeepSWE v1.1 71.0% sebagai upaya penalaran tinggi.
Pengumuman peluncuran tidak mengungkapkan setiap harness per-benchmark, konfigurasi alat, jumlah run, atau lingkungan evaluasi. Perlakukan nilai-nilai ini sebagai hasil yang dipublikasikan vendor dan validasi model pada repositori, alat, target latensi, dan kriteria kegagalan Anda sendiri sebelum merutekan pekerjaan produksi.
Apa yang Ditunjukkan Profil Benchmark Grok 4.7?
Rekayasa Perangkat Lunak
CursorBench 4.0 naik dari 40.4% pada Grok 4.6 menjadi 46.3% pada Grok 4.7, sementara DeepSWE v1.1 naik dari 65.2% menjadi 71.0%. Ini mendukung positioning Grok 4.7 sebagai model untuk agen pengodean alih-alih hanya asisten pengodean percakapan.
Pekerjaan Terminal Berkepanjangan
Terminal-Bench 4.0 menunjukkan salah satu perubahan generasional terbesar: 20.3% untuk Grok 4.6 versus 38.0% untuk Grok 4.7. Kenaikan absolut 17.7 poin ini konsisten dengan penekanan SpaceXAI pada reinforcement learning berjangka lebih panjang dan verifikasi diri.
Rekayasa Listrik
Pada EEBench, Grok 4.7 mencapai 64.0%, dibandingkan 53.0% untuk Grok 4.6. Di antara perbandingan yang dipublikasikan, ini adalah salah satu hasil relatif terkuat Grok 4.7.
Kerja Pengetahuan Profesional
AA Briefcase v1.1 naik dari 1,546 menjadi 1,657. Tugas-tugas ini dirancang untuk mencerminkan pekerjaan profesional multi-jam yang melibatkan artefak seperti dokumen, presentasi, analisis, dan deliverable terstruktur lainnya.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Bagaimana Perbandingan Mereka?
Pemeriksaan harga native penyedia: OpenAI mencantumkan GPT-5.6 Sol pada $4 per juta token input dan $20 per juta token output, sementara Anthropic mencantumkan Claude Fable 5.1 pada $10 per juta token input dan $50 per juta token output.
| Dimensi | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Positioning utama | Pengodean, tugas agen, kerja pengetahuan | Penalaran profesional kompleks dan pengodean | Agen berjalan lama, pengodean, dan alur kerja pengetahuan |
| Jendela konteks | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalitas | Masukan teks dan gambar; keluaran teks | Masukan teks dan gambar; keluaran teks | Masukan teks dan gambar; keluaran teks |
| Kontrol penalaran | Low, medium, high, xhigh | None through max | Adaptive thinking dengan upaya yang dapat dikonfigurasi |
| Status API penyedia | Tersedia di xAI API publik | Tersedia melalui OpenAI Chat Completions and Responses | Tersedia melalui Claude API dan marketplace cloud yang didukung |
| Harga input / 1M tokens | $2 | $4 | $10 |
| Harga output / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Kecocokan terbaik | Agen rekayasa sensitif harga dan penggunaan alat berkelanjutan | Penalaran profesional luas dengan konteks sangat panjang | Performa maksimum agen berjalan lama dan alur kerja pengetahuan |
Model Mana yang Harus Anda Pilih?
- Pilih Grok 4.7 ketika beban kerja rekayasa, penggunaan alat berkelanjutan, penalaran yang dapat dikonfigurasi, dan biaya token output yang lebih rendah menjadi prioritas. Model ini sangat menarik untuk agen repositori, alur kerja terminal, dan riset berkonteks besar yang tetap di bawah ambang harga 200K.
- Pilih GPT-5.6 Sol ketika tugas memerlukan penalaran profesional yang lebih luas, jendela konteks di atas satu juta token, atau ketika hasilnya yang lebih kuat pada evaluasi kritis bisnis seperti DeepSWE atau penalaran klinis telah divalidasi dalam harness Anda sendiri.
- Pilih Claude Fable 5.1 ketika performa agen berjalan lama, kualitas pengodean, eksekusi terminal, atau penalaran klinis yang maksimum membenarkan harga token yang lebih tinggi.
- Gunakan perutean model ketika beban kerja bervariasi. Rute langkah agen rekayasa rutin dan volume tinggi ke model berkualifikasi paling efisien biaya, dan cadangkan model yang lebih mahal untuk tugas di mana tingkat keberhasilan terukur membenarkan premi.
Pilihan yang benar bergantung pada keberhasilan tugas end-to-end, latensi, retry, akurasi pemanggilan alat, dan rework manusia—bukan pada satu benchmark atau tarif token utama.
Berapa Biaya API Grok 4.7?
Tabel di bawah membandingkan tarif xAI resmi dengan harga yang ditampilkan pada halaman model Grok 4.7 CometAPI pada 22 September 2026. CometAPI menyatakan diskon 20%; verifikasi harga langsung sebelum produksi karena harga gateway dan ketentuan promosi dapat berubah.
| Tier prompt | Jenis harga | xAI resmi | CometAPI | Perbedaan |
|---|---|---|---|---|
| Di bawah 200K token prompt | Input / 1M | $2.00 | $1.60 | 20% lebih rendah |
| Cached input / 1M | $0.50 | $0.40 | 20% lebih rendah | |
| Output / 1M | $6.00 | $4.80 | 20% lebih rendah | |
| Di atas 200K token prompt | Input / 1M | $4.00 | $3.20 | 20% lebih rendah |
| Cached input / 1M | $1.00 | $0.80 | 20% lebih rendah | |
| Output / 1M | $12.00 | $9.60 | 20% lebih rendah |
Harga Standar untuk Prompt hingga 200,000 Token
Untuk permintaan yang prompt-nya tidak melebihi 200,000 token, Grok 4.7 berharga $2 per juta token input, $0.50 per juta token input yang di-cache, dan $6 per juta token output. Input yang di-cache adalah kategori paling murah, sehingga aplikasi dengan instruksi sistem yang berulang atau konteks yang dapat digunakan kembali dapat mengurangi biaya ketika token tersebut memenuhi syarat caching.
Sebagai contoh sederhana, sebuah permintaan yang menggunakan 100,000 token input non-cache dan menghasilkan 10,000 token output akan berbiaya sekitar $0.26 sebelum biaya platform lainnya: $0.20 untuk input ditambah $0.06 untuk output.
Harga Konteks Panjang di Atas 200,000 Token Prompt
Setelah prompt melebihi 200,000 token, tarifnya menjadi dua kali lipat menjadi $4 per juta token input, $1 per juta token input yang di-cache, dan $12 per juta token output. Tier yang lebih tinggi berlaku karena panjang prompt, jadi tim harus memantau riwayat percakapan yang terakumulasi, jejak alat, dokumen yang diambil, dan konteks repositori sebelum mengirim setiap permintaan.
Keputusan biaya praktis karenanya bukan hanya berapa banyak token yang digunakan tugas, tetapi apakah prompt melewati batas 200,000 token. Merangkum pekerjaan yang sudah selesai, menghapus output alat yang usang, dan hanya mengambil file yang paling relevan dapat menjaga beban kerja yang sesuai tetap berada dalam tier standar tanpa mengorbankan konteks yang diperlukan.
Catatan rilis SpaceXAI mendokumentasikan ambang ini. Anggaran produksi juga harus memperhitungkan retry, loop agen, panggilan alat yang gagal, dan panjang output alih-alih membandingkan penyedia hanya berdasarkan harga token input utama mereka.
Apa yang Membuat Grok 4.7 Berguna untuk Agen AI?
- Jendela konteks 500K: Menampung sejumlah besar kode sumber, spesifikasi, output alat, log, dan riwayat percakapan dalam satu konteks kerja. Ini berguna untuk pengodean skala repositori dan analisis multi-dokumen, meskipun konteks masih perlu pemangkasan aktif.
- Penalaran yang dapat dikonfigurasi: Aplikasi dapat memilih upaya low, medium, high, atau xhigh, menukar latensi dan komputasi untuk penalaran yang lebih dalam sesuai kesulitan tugas.
- Pemanggilan fungsi dan output terstruktur: Agen dapat melakukan query database, menjalankan tes, memeriksa dokumen, memanggil API internal, dan mengembalikan hasil yang bisa dibaca mesin.
- Penelusuran web dan X: Alat penelusuran dapat mengambil informasi terbaru ketika data pelatihan model tidak mencukupi. Konten yang diambil tetap harus diperlakukan sebagai masukan yang tidak dipercaya dan diverifikasi.
- Eksekusi kode: Model dapat memvalidasi perhitungan, mentransformasi data, dan menguji solusi yang dihasilkan alih-alih hanya mengandalkan inferensi model bahasa.
- Fokus alur kerja berjangka panjang: Penekanan pelatihan pada tugas multi-jam, manajemen konteks, dan verifikasi diri menargetkan loop agen yang mengakumulasi jejak alat dan memerlukan pemulihan setelah kegagalan.
Bagaimana Grok 4.7 Meningkatkan Keamanan?
SpaceXAI mengatakan Grok 4.7 memperkenalkan tumpukan pengamanan yang sepenuhnya baru dan melaporkan ketahanan jailbreak yang lebih kuat serta keamanan dual-use. Dalam pengumuman peluncuran, perusahaan melaporkan 62.4% pada benchmark biosafety LatchBio dan mengatakan hanya 3.3% prompt dual-use berisiko yang lolos pada HackerBench v0.3.
Angka-angka ini adalah evaluasi yang dipublikasikan vendor. Angka tersebut berguna untuk memahami klaim rilis tetapi tidak boleh dianggap sebagai ukuran universal kinerja keamanan di dunia nyata.
Bagaimana Pengembang Dapat Menggunakan API Grok 4.7?
Grok 4.7 saat ini tersedia melalui CometAPI dengan ID model grok-4.7. CometAPI menyediakan endpoint yang kompatibel dengan OpenAI, satu kunci API dan alur penagihan di berbagai penyedia model, pengujian dan perutean model berdampingan yang lebih mudah, serta harga token yang saat ini tercantum 20% di bawah tarif xAI resmi. Sebelum penggunaan produksi, konfirmasikan halaman model live, kesehatan endpoint, parameter yang didukung, harga, dan persyaratan penanganan data.
Contoh permintaan CometAPI:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Apakah Grok 4.7 Layak untuk Beralih?
Bagi pengguna Grok 4.6 yang bergantung pada agen pengodean atau alur kerja profesional jangka panjang, Grok 4.7 adalah kandidat peningkatan material karena set benchmark peluncuran meningkat di setiap dimensi yang dilaporkan sementara harga token standar tetap pada level $2/$6 di bawah ambang konteks panjang.
Bagi pengguna model frontier lain, keputusan bersifat spesifik beban kerja. Grok 4.7 sangat menarik ketika biaya token output, beban kerja rekayasa, konteks besar, dan penggunaan alat berkelanjutan penting. Di mana model lain lebih kuat pada domain kritis, perutean model bisa lebih rasional daripada mengganti setiap model dengan satu penyedia.
Kesimpulan
Grok 4.7 lebih dari sekadar pembaruan numerik rutin untuk Grok 4.6. Rilis ini secara eksplisit berorientasi pada pekerjaan yang berjalan lama melalui alat, verifikasi berulang, konteks besar, dan beberapa langkah eksekusi.
Peningkatan generasional terkuat muncul di tempat di mana arah pelatihan itu seharusnya penting: Terminal-Bench 4.0 naik dari 20.3% menjadi 38.0%, EEBench dari 53.0% menjadi 64.0%, dan CursorBench 4.0 dari 40.4% menjadi 46.3%, sementara harga standar di bawah ambang prompt 200K tetap pada $2/M input dan $6/M output.
Proposisi nilai praktisnya karenanya bukan “Grok 4.7 memenangkan setiap benchmark.” Melainkan Grok 4.7 mempersempit kesenjangan antara kapabilitas agen kelas frontier dan inferensi berbiaya lebih rendah, menjadikannya sangat relevan untuk agen pengodean, sistem riset, dan alur kerja profesional yang perlu berjalan dalam banyak langkah alih-alih menjawab sekali.
