Spesifikasi Teknis Grok 4.6
| Item | Grok 4.6 |
|---|---|
| Provider | xAI |
| Model ID | grok-4.6 |
| Model type | Model penalaran multimodal frontier dan agenik |
| Primary strengths | Agen berjalan lama, pemrograman, pekerjaan pengetahuan, pembuatan aplikasi interaktif/visual |
| Input modalities | Teks dan gambar |
| Output modality | Teks |
| Context window | 500,000 tokens |
| Knowledge cutoff | February 1, 2026 |
| Output limit | Tidak ada batas keluaran teks yang dipublikasikan oleh xAI |
| Reasoning | low, medium, high (default), xhigh |
| APIs | Responses API, Chat Completions |
| Tools | Pemanggilan fungsi, penelusuran web, penelusuran X, eksekusi kode |
| API pricing | $2 / 1M input tokens; $6 / 1M output tokens |
| Fast variant | Tersedia dengan harga 2× standar |
| Released | August 12, 2026 |
Apa Itu Grok 4.6?
Grok 4.6 adalah model frontier terbaru dari xAI yang berfokus pada kecerdasan agenik.
Perbedaannya dari chatbot tradisional itu penting.
xAI menekankan kemampuan model untuk bertahan pada proyek kompleks lebih lama, bekerja lintas basis kode, meneliti topik yang tidak dikenal, membangun aplikasi, dan memverifikasi pekerjaannya sendiri.
Hal ini membuat Grok 4.6 sangat relevan bagi pasar agen pemrograman AI dan agen otonom yang berkembang pesat.
Fitur Utama Grok 4.6
- Eksekusi agen jangka panjang: Grok 4.6 dilatih untuk mempertahankan pekerjaan kompleks dalam banyak langkah alih-alih hanya mengoptimalkan jawaban satu putaran.
- Pemrograman agenik: Menargetkan rekayasa perangkat lunak tingkat repositori, pembuatan kode, debug, pengujian iteratif, dan lingkungan pemrograman spesifik domain.
- Riset pekerjaan pengetahuan: Model dapat meneliti domain yang tidak dikenal, mengatur informasi, menalar persyaratan kompleks, dan mengubah temuan menjadi keluaran yang konkret.
- Pembuatan aplikasi visual dan interaktif: xAI melaporkan hasil percobaan pertama yang lebih kuat untuk proyek visual dan interaktif, termasuk mengubah ide produk menjadi aplikasi yang berfungsi dan menyempurnakannya melalui siklus umpan balik.
- Pengujian dan verifikasi mandiri: Dalam alur yang lebih panjang, xAI mengamati lebih banyak perilaku di mana model memeriksa pekerjaannya sendiri sebelum melanjutkan.
- Penggunaan alat bawaan: Grok 4.6 mendukung pemanggilan fungsi, penelusuran web, penelusuran X, dan eksekusi kode melalui API.
- Penalaran yang dapat dikonfigurasi: Pengembang dapat memilih upaya penalaran
low,medium,high, atauxhigh, sehingga model dapat beradaptasi dengan beban kerja yang sensitif terhadap latensi dan penalaran mendalam.
Kinerja Tolok Ukur Grok 4.6
xAI melaporkan bahwa Grok 4.6 menyamai GPT-5.6 Sol pada Artificial Analysis Intelligence Index, komposit dari sembilan tolok ukur. Hasil terkuat yang dipublikasikan meliputi:
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
Angka-angka ini berasal dari pengumuman peluncuran xAI tanggal 12 Agustus. xAI mencatat bahwa angka pihak ketiga diambil dari kartu sistem pengembang atau papan peringkat tolok ukur publik, sehingga hasil lintas model sebaiknya diinterpretasikan dengan mempertimbangkan metodologi evaluasi dan pengaturan model.
Grok 4.6 vs Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5
| Model | Posisi utama | Konteks | AA Intelligence | Profil pemrograman/agenik |
|---|---|---|---|---|
| Grok 4.6 | Agen jangka panjang, pemrograman, kerja pengetahuan | 500K | 61 | Pemrograman agenik dan alur kerja proyek interaktif yang kuat |
| Grok 4.5 | Model generalis frontier yang cepat dan pemrograman | 500K | 56 | Landasan kuat untuk pemrograman dan alur kerja agen |
| GPT-5.6 Sol | Penalaran umum frontier dan kerja agenik | Konteks kompetitor yang dipublikasikan bervariasi per penerapan | 61 | Hasil DeepSWE dan Terminal-Bench yang kuat |
| Claude Fable 5 | Kerja pengetahuan frontier dan pemrograman | Konteks kompetitor yang dipublikasikan bervariasi per penerapan | 62 | CursorBench, FrontierCode, APEX-SWE sangat kuat |
Grok 4.6 paling menarik ketika beban kerja memerlukan eksekusi berkelanjutan alih-alih satu respons berkualitas tinggi. Ini sangat menarik bagi pengembang yang membangun agen yang berulang kali meneliti, memanggil alat, mengedit kode, menguji hasil, dan melanjutkan dari konteks yang terakumulasi. Claude Fable 5 tetap memiliki keunggulan pada beberapa tolok ukur pemrograman dan agen yang dipublikasikan, sementara GPT-5.6 Sol memimpin Grok 4.6 pada DeepSWE dan Terminal-Bench dalam perbandingan xAI.
Keterbatasan dan Pertimbangan
- Hasil tolok ukur bergantung pada tugas: Grok 4.6 tidak selalu menjadi model dengan skor tertinggi secara seragam. Hasil yang dipublikasikan menunjukkan kekuatan dan kelemahan yang jelas di berbagai evaluasi agenik.
- Beban kerja jangka panjang dapat mengonsumsi token dalam jumlah besar: Jendela konteks besar dan penggunaan alat iteratif dapat meningkatkan total konsumsi inferensi meskipun harga per token kompetitif.
- Konfigurasi alat sangat berpengaruh: Penelusuran web, penelusuran X, eksekusi kode, dan pemanggilan fungsi memerlukan arsitektur aplikasi yang dapat menangani izin alat dan data yang dikembalikan dengan aman.
- Batas pengetahuan: Batas yang didokumentasikan adalah February 1, 2026. Untuk informasi yang lebih baru, pengembang harus menggunakan alat pencarian web atau pengambilan yang sesuai alih-alih mengandalkan pengetahuan statis model.
- Caching memerlukan konfigurasi yang matang: xAI merekomendasikan
prompt_cache_keyuntuk Responses API danx-grok-conv-iduntuk Chat Completions guna meningkatkan keandalan hit cache.
Kasus Penggunaan Grok 4.6
- Agen pemrograman otonom — analisis repositori, implementasi, debug, pengujian, dan perbaikan iteratif.
- Prototipe produk — mengubah persyaratan produk yang luas menjadi aplikasi interaktif yang fungsional.
- Agen riset teknis — meneliti domain teknis yang tidak dikenal dan menghasilkan keluaran terstruktur.
- Copilot pengembang — pembuatan kode, tinjauan, debug, dan alur kerja pengembangan multi-langkah.
- Otomatisasi kerja pengetahuan — analisis dokumen, sintesis informasi, perencanaan, dan pembuatan keluaran terstruktur.
- Asisten pengguna alat — aplikasi yang menggabungkan penalaran model dengan penelusuran web, penelusuran X, eksekusi kode, dan pemanggilan fungsi kustom.
Cara Mengakses API Grok 4.6
Untuk aplikasi yang sudah menggunakan lapisan API terpadu CometAPI, gunakan model ID Grok 4.6 yang diekspos oleh CometAPI dan ikuti endpoint/skema saat ini dalam dokumentasi API CometAPI. Ini dapat mengurangi pekerjaan integrasi spesifik penyedia ketika aplikasi perlu beralih antar LLM frontier.
Alur kerja khas:
- Buat atau masuk ke akun CometAPI.
- Buat token API di konsol CometAPI.
- Pilih endpoint model
grok-4.6. - Kirim permintaan melalui endpoint CometAPI menggunakan skema permintaan yang didokumentasikan untuk model tersebut.
- Proses teks yang dikembalikan, panggilan alat, atau keluaran terstruktur dalam aplikasi Anda.