DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 Telah Hadir: Hasil Benchmark Setingkat GPT-5.6 & Performa Penulisan Kode

CometAPI
AnnaAug 13, 2026
Grok 4.6 Telah Hadir: Hasil Benchmark Setingkat GPT-5.6 & Performa Penulisan Kode

TL; DR xAI secara resmi merilis Grok 4.6 pada 12 Agustus 2026 dan membuatnya tersedia melalui xAI API, Cursor, dan Grok Build. Model ini memiliki jendela konteks 500.000 token, menerima teks dan gambar, menawarkan empat tingkat upaya penalaran, dan memiliki batas pengetahuan 1 Februari 2026. Menurut pengumuman resmi Grok 4.6 dari xAI, model ini menyamai GPT-5.6 Sol pada Artificial Analysis Intelligence Index, gabungan dari sembilan evaluasi.

Harga API dimulai dari $2 per sejuta token input, $0,50 per sejuta token input cache, dan $6 per sejuta token output untuk prompt di bawah 200.000 token. Ketika sebuah prompt mencapai 200.000 token, seluruh permintaan ditagihkan dengan tarif konteks panjang sebesar $4 input, $1 input cache, dan $12 output per sejuta token. Bagi pengembang yang mencari akses multi-model yang fleksibel, platform seperti CometAPI memudahkan integrasi Grok 4.6 berdampingan dengan model frontier lain. Harga API adalah 80% dari harga xAI.

Poin Utama

  • xAI secara resmi merilis Grok 4.6 pada 12 Agustus 2026; laporan jendela rilis sebelumnya kini usang.
  • The API model ID is , and the model is also available in Cursor and Grok Build.grok-4.6
  • Jendela konteksnya 500K token, dengan input teks dan gambar serta output hanya teks.
  • Harga standar di bawah 200K token prompt adalah $2/M input, $0,50/M input cache, dan $6/M output.
  • Prompt berukuran 200K token atau lebih memicu tarif lebih tinggi untuk semua token dalam permintaan itu, bukan hanya yang melampaui ambang.
  • Upaya penalaran dapat diatur ke low, medium, high, atau xhigh; adalah default yang didokumentasikan.
  • Grok 4.6 menyamai GPT-5.6 Sol pada Artificial Analysis Intelligence Index (skor 61) dan menunjukkan peningkatan besar atas Grok 4.5 pada pengodean agen, pekerjaan pengetahuan, dan tugas berjangka panjang.
  • Grok Imagine Image 2.0 adalah API pembuatan gambar yang terpisah. Grok 4.6 dapat memahami gambar namun tidak menghasilkan gambar sendiri.

Spesifikasi dan Harga Grok 4.6 Sekilas

Spesifikasi berikut dikonfirmasi dalam dokumentasi model xAI dan catatan rilis 12 Agustus.

SpesifikasiGrok 4.6
Tanggal rilis resmiAugust 12, 2026
ID model APIgrok-4.6
Posisi produkModel andalan untuk pengodean, agen, dan beban kerja umum
Jendela konteks500,000 tokens
InputText and images
OutputText
Batas keluaran teks yang didokumentasikanNo text-output limit stated by xAI
Kontrol penalaranLow, medium, high and xhigh
Upaya penalaran defaultHigh
Batas pengetahuanFebruary 1, 2026
Akses API nativeAvailable
Akses alat pengodeanCursor and Grok Build
Akses peristiwa terkiniRequires Web Search or X Search tools

Harga resmi xAI API

Tabel harga API xAI saat ini memisahkan permintaan konteks pendek dan konteks panjang.

Ukuran promptInput per 1M tokenInput cache per 1M tokenOutput per 1M token
Di bawah 200,000 token$2.00$0.50$6.00
200,000 token atau lebih$4.00$1.00$12.00

Ambang ini sangat penting untuk agen basis kode. Ketika prompt permintaan mencapai 200.000 token, xAI menagih tarif konteks panjang untuk semua token dalam permintaan itu, bukan hanya bagian yang melampaui ambang. Permintaan yang berisi 199.000 token prompt karenanya bisa berbiaya jauh lebih rendah daripada yang berisi 200.000, meski ukurannya hampir identik.

Tidak ada diskon batch yang tercantum untuk Grok 4.6 dalam dokumentasi harga xAI saat ini. Tim sebaiknya tidak berasumsi bahwa pekerjaan offline menerima diskon yang tersedia untuk model xAI tertentu lainnya.

Apa itu Grok 4.6?

Grok 4.6 adalah model bahasa besar andalan terbaru dari SpaceXAI, dirilis pada 12 Agustus 2026. Model ini dibangun langsung di atas Grok 4.5 dengan menerapkan putaran pelatihan tambahan yang lebih panjang, berfokus pada data terkurasi yang dihasilkan model untuk penalaran tingkat lanjut dan konsep teknis, kumpulan data rekayasa berkualitas tinggi, optimizer yang ditingkatkan, dan reinforcement learning yang diperluas untuk skenario pengodean dan pekerjaan berbasis pengetahuan.

Model ini mempertahankan fondasi 1,5 triliun parameter yang sama dengan pendahulunya; peningkatan utamanya berasal dari pascapelatihan alih-alih peningkatan skala parameter. Model ini dirancang khusus agar tetap efektif di banyak langkah—baik saat meneliti sebuah topik, menganalisis informasi dalam jumlah besar, menavigasi dan menyunting basis kode yang tidak dikenal, atau mengubah ide tingkat tinggi menjadi aplikasi atau artefak kerja yang matang. SpaceXAI menekankan perilaku pemeriksaan mandiri yang lebih baik pada proyek berjangka panjang dan kinerja yang lebih kuat pada pekerjaan interaktif dan visual.

Perbedaan dari chatbot tradisional itu penting.

Alur kerja LLM konvensional terlihat seperti:

Prompt → Menghasilkan jawaban

Grok 4.6 dirancang untuk alur kerja yang lebih mendekati:

Tujuan → Rencana → Riset → Gunakan alat → Modifikasi kode → Uji → Evaluasi → Lanjutkan

posisioning xAI saat ini menekankan kemampuan model untuk bertahan lebih lama pada proyek kompleks, bekerja lintas basis kode, meneliti topik yang tidak dikenal, membangun aplikasi, dan memverifikasi pekerjaannya sendiri.

Ini membuat Grok 4.6 sangat relevan bagi pasar yang berkembang pesat untuk agen pengodean AI dan agen otonom.

Apa Fitur Utama Grok 4.6?

Kemampuan Agen untuk Tugas Panjang

Peningkatan terpenting Grok 4.6 adalah fokus pada tugas berdurasi panjang.

Alih-alih hanya dioptimalkan untuk respons satu kali, model ini dirancang untuk mempertahankan kemajuan melalui banyak tahap sebuah proyek.

Contoh tipikal meliputi:

  • Membangun aplikasi
  • Men-debug repositori besar
  • Meneliti subjek yang tidak dikenal
  • Memodifikasi beberapa komponen
  • Menjalankan pengujian
  • Menyelidiki kegagalan
  • Merevisi implementasi
  • Memeriksa hasil akhir

Ini adalah sasaran yang secara fundamental berbeda dari tolok ukur instruksi tradisional.

Performa Pengodean Lanjutan

Pengodean adalah salah satu area peningkatan paling jelas pada Grok 4.6.

Laporan tolok ukur saat ini menunjukkan:

  • 65,9% pada DeepSWE 1.1
  • 69,9% pada CursorBench 3.2
  • 61,3% pada FrontierCode 1.1 Extended

Evaluasi ini sangat relevan karena menargetkan perilaku agen pengodean alih-alih sekadar pelengkapan kode sederhana.

Peningkatan dari Grok 4.5 ke Grok 4.6 pada DeepSWE 1.1 sangat menonjol, naik dari sekitar 54% menjadi 65,9% dalam perbandingan yang dilaporkan.

Input Multimodal

Grok 4.6 mendukung input teks dan gambar, memungkinkan pengembang menggabungkan informasi visual dengan penalaran.

Aplikasi potensial meliputi:

  • Debugging tangkapan layar
  • Analisis UI
  • Interpretasi grafik
  • Pemahaman dokumen
  • Riset visual
  • Tugas pengodean berbasis gambar

Ini membuat Grok 4.6 lebih fleksibel daripada model pengodean yang murni berbasis teks.

Akses Grok ke pencarian merupakan bagian penting dari ekosistemnya.

API mendukung:

  • Web search
  • X search
  • Function calling
  • Code execution

Dokumentasi Grok 4.5 API xAI saat ini mengonfirmasi kapabilitas alat ini di lingkungan Grok API.

Bagi agen riset, ini berarti model berpotensi bergerak dari pengetahuan prapelatihan statis menuju pengambilan informasi terkini plus penalaran.

Penalaran yang Dapat Dikonfigurasi

API Grok mengekspos upaya penalaran yang dapat dikonfigurasi.

Ini memungkinkan pengembang melakukan trade-off antara:

kecepatan/biaya ↔ kedalaman penalaran

Untuk tugas sederhana, penalaran lebih rendah dapat mengurangi komputasi yang tidak perlu.

Untuk tugas pengodean atau riset yang kompleks, penalaran lebih tinggi dapat memberikan pemecahan masalah yang lebih matang.

Performa Frontier yang Kompetitif dari Sisi Biaya

Harga Grok 4.6 bisa dibilang merupakan salah satu keunggulan komersial terkuatnya.

Harga API standar yang dilaporkan adalah:

  • $2 / 1M token input
  • $6 / 1M token output

Itu adalah harga yang sama yang dilaporkan untuk Grok 4.5, meskipun ada peningkatan kapabilitas yang signifikan.

Ini menciptakan proposisi biaya/kinerja yang sangat agresif untuk sebuah model frontier.


Seberapa Baik Kinerja Grok 4.6 pada Benchmark?

Data tolok ukur yang paling berguna saat ini terkonsentrasi di sekitar kecerdasan agen dan pengodean.

BenchmarkGrok 4.6Apa yang Diukur
Artificial Analysis Intelligence Index61Kecerdasan model frontier yang luas
CursorBench 3.269,9%Performa agen pengodean
DeepSWE 1.165,9%Agen rekayasa perangkat lunak
FrontierCode 1.1 Extended61,3%Pengodean tingkat lanjut
GDPVal-AA v21.753 EloKinerja tugas pekerjaan pengetahuan

Skor Artificial Analysis Intelligence Index sebesar 61 dilaporkan menempatkan Grok 4.6 pada level yang sama dengan GPT-5.6 Sol pada indeks tersebut.

Skor GDPVal-AA v2 sebesar 1.753 Elo juga signifikan karena GDPVal mengevaluasi tugas pekerjaan profesional berbasis pengetahuan, bukan sekadar tanya-jawab akademis.

Intisari Penting dari Benchmark

Bukti terkuat untuk Grok 4.6 bukan skor gaya MMLU tunggal.

Profil tolok ukurnya mengarah ke:

pengodean + agen + pekerjaan pengetahuan + eksekusi berdurasi panjang

Itulah persis arah pengembangan AI modern bergerak.

Bagi situs seperti CometAPI, ini adalah pembedaan penting yang perlu dijaga: Grok 4.6 seharusnya dipasarkan terutama sebagai model frontier berorientasi agen, bukan sekadar model chatbot generik.

Bagaimana Perbandingan Grok 4.6 dengan Pendahulunya dan Para Pesaing?

Grok 4.6 vs Grok 4.5

FiturGrok 4.5Grok 4.6
Fokus utamaPenalaran umum + agenAgen berjangka panjang + pengodean
KonteksDeploy kelas 500K500K
InputTeks + gambarTeks + gambar
Web searchYaYa
X searchYaYa
Eksekusi kodeYaYa
Function callingYaYa
Harga input$2/M$2/M
Harga output$6/M$6/M
DeepSWE 1.1~54%65,9%
Intelligence Index~5661

Poin pentingnya adalah Grok 4.6 tidak terlihat sebagai pengganti tingkat harga sederhana untuk Grok 4.5. Ini adalah peningkatan kapabilitas yang lebih diarahkan pada alur kerja agen berjangka panjang.

Dokumentasi Grok 4.5 saat ini dari xAI mencantumkan model pada $2/$6 per sejuta token, dengan penalaran yang dapat dikonfigurasi dan dukungan alat.

Tabel Perbandingan: Grok 4.6 vs Pesaing Utama

AspekGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Catatan
AA Intelligence Index616162 / 63Skor komposit
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok jauh lebih murah untuk output
Jendela Konteks500KHingga 1M+Sering 1M
KekuatanAgen, efisiensi pengodean, biayaPenalaran luas, pengodeanJangka panjang, keamanan
Integrasi CursorNative, kuatTersediaTersediaGrok dioptimalkan untuk Cursor
Efisiensi langkahTinggi (lebih sedikit langkah)KompetitifLangkah lebih banyak dilaporkanPenting untuk agen
KetersediaanAPI + Cursor + mitraResmi + mitraResmi + mitraCometAPI menyatukan akses

Data diambil dari pengumuman SpaceXAI, Artificial Analysis, dan kartu model publik per 13 Agustus 2026.

Perbandingan Artificial Analysis saat ini sangat menarik.

Grok 4.6 dilaporkan meraih 61 pada Intelligence Index, menyamai GPT-5.6 Sol. Namun ekonominya sangat berbeda.

Harga tepat varian GPT yang bersaing sebaiknya diperiksa terhadap harga penyedia mereka saat ini sebelum publikasi, tetapi pengamatan pasar kunci jelas: Grok 4.6 bersaing pada kinerja tolok ukur tingkat frontier sambil mempertahankan harga token yang relatif agresif.

Itu membuat Grok 4.6 sangat menarik untuk aplikasi di mana eksekusi agen ber-volume tinggi akan membuat model frontier premium menjadi mahal.

Apa Keterbatasan Grok 4.6?

Konteks 500K Lebih Kecil daripada Beberapa Pesaing Berkonteks 1M

500K konteks Grok 4.6 itu besar, tetapi bukan jendela konteks terbesar di pasar model frontier.

Untuk repositori yang sangat besar atau koleksi dokumen yang sangat masif, model ber-konteks 1M mungkin memiliki keunggulan.

Model Proprietary

Berbeda dengan MiMo-V2.5-Pro, Grok 4.6 bukan model open-weight.

Pengembang tidak dapat mengunduh model dan menerapkannya secara mandiri.

Perbandingan Benchmark Perlu Kehati-hatian

Benchmark pengodean yang berbeda menggunakan harness, prompt, alat, dan prosedur evaluasi yang berbeda.

Sebagai contoh, SWE-Bench Pro dirancang khusus di sekitar masalah rekayasa perangkat lunak berjangka panjang yang realistis, dan hasil benchmark dapat bervariasi secara substansial tergantung pada kerangka agen.

Oleh karena itu, 69,9% pada CursorBench tidak boleh ditafsirkan sebagai "Grok 4.6 69,9% lebih baik daripada model lain."

Interpretasi yang benar adalah bahwa model mencapai skor tersebut di bawah setup evaluasi tertentu milik benchmark itu.

Biaya Agen Bisa Lebih Tinggi daripada yang Disiratkan oleh Harga Token

Harga token $2/$6 itu menarik, tetapi agen otonom dapat mengonsumsi jumlah token yang sangat besar melalui:

  • Panggilan alat
  • Pencarian berulang
  • Eksekusi kode
  • Upaya yang gagal
  • Konteks panjang
  • Verifikasi mandiri

Ekonomi unit yang nyata karenanya bergantung pada biaya per tugas yang berhasil diselesaikan, bukan sekadar biaya per sejuta token.

Harga dan Akses

Harga Resmi (tingkat standar, di bawah ~200K token prompt):

  • Input: $2,00 per 1M token
  • Input cache: sekitar $0,50 per 1M token
  • Output: $6,00 per 1M token

Varian yang lebih cepat dihargai dua kali lipat tarif ini. Tarif dapat berlipat ganda untuk konteks yang sangat panjang (≥200K). Prompt caching sangat direkomendasikan untuk loop agen demi menjaga biaya tetap rendah.

Ketersediaan:

  • Cursor dan Grok Build (penggunaan termasuk 2× untuk minggu pertama)
  • SpaceXAI API (grok-4.6)
  • Mitra: OpenRouter, Vercel, Cloudflare, dan lainnya
  • SuperGrok chat/apps (via pemilih model)

Rekomendasi CometAPI: Bagi pengembang yang sudah menggunakan (atau berencana menggunakan) banyak model frontier, CometAPI menyediakan akses mulus ke Grok 4.6 melalui satu endpoint yang kompatibel OpenAI (https://api.cometapi.com/v1). Anda mendapatkan penagihan terpadu, analitik penggunaan, tarif efektif yang kompetitif di 500+ model (termasuk GPT, Claude, Gemini, DeepSeek, dan varian Grok), serta kemampuan mengganti model dengan satu baris perubahan. Ini sangat berharga saat A/B testing Grok 4.6 melawan model pengodean atau agen lain, atau saat membangun sistem produksi yang diuntungkan oleh perutean dan fallback model. Daftar di cometapi.com untuk memperoleh kunci API gratis dan menjelajah katalog model live.

Haruskah Anda Beralih ke Grok 4.6?

Ya, jika:

  • Anda banyak bekerja di Cursor atau membangun agen pengodean/pengetahuan berjangka panjang dan menginginkan reliabilitas multi-langkah yang kuat dengan biaya kompetitif.
  • Ekonomi token penting—Grok 4.6 menghadirkan kecerdasan mendekati paritas dengan GPT-5.6 Sol pada harga token output sekitar seperlima dari opsi frontier termahal.
  • Anda menghargai efisiensi langkah (lebih sedikit langkah dan token untuk menyelesaikan tugas kompleks).
  • Anda ingin akses segera ke model yang secara eksplisit dilatih untuk alur kerja interaktif, visual, dan berorientasi agen yang umum dalam pengembangan modern.

Pertimbangkan tetap menggunakan atau mencampur model lain jika:

  • Beban kerja utama Anda adalah pemrograman kompetitif murni atau keunggulan model tertutup tertentu (misalnya, beberapa skenario konteks panjang atau penyesuaian keamanan Claude).
  • Anda memerlukan skor tertinggi absolut pada setiap benchmark rekayasa perangkat lunak individual tanpa memedulikan biaya.
  • Anda membutuhkan jendela konteks lebih besar daripada 500K untuk beban kerja satu panggilan (beberapa pesaing menawarkan 1M+).

Kebanyakan tim akan diuntungkan dengan mengevaluasi Grok 4.6 berdampingan dengan tumpukan mereka saat ini. Karena tersedia melalui agregator seperti CometAPI, biaya peralihan rendah—cukup ganti nama modelnya dan ukur tingkat penyelesaian tugas dunia nyata, latensi, dan biaya pada beban kerja Anda sendiri.

Kesimpulan

Grok 4.6 merepresentasikan langkah maju yang signifikan bagi SpaceXAI: kecerdasan tingkat frontier pada tolok ukur komposit dan agen, peningkatan berarti pada kinerja pengodean dan pekerjaan pengetahuan berjangka panjang, serta harga yang tetap agresif yang mengungguli banyak pesaing tertutup. Ketersediaannya secara native di Cursor, dikombinasikan dengan reliabilitas multi-langkah yang kuat, membuatnya sangat menarik bagi pengembang yang membangun agen perangkat lunak dan aplikasi interaktif dunia nyata.

Baik Anda mengaksesnya langsung, melalui Cursor/Grok Build, atau melalui gateway terpadu seperti CometAPI, Grok 4.6 siap untuk evaluasi produksi hari ini. Kunjungi pengumuman resmi di x.ai/news/grok-4-6 untuk detail lengkap dan kartu model, jelajahi katalog live di cometapi.com untuk membandingkannya berdampingan dengan model terkemuka lainnya, dan mulai membangun dengan kapabilitas baru tersebut sekarang juga.

Sumber Utama

Selalu verifikasi harga, batasan tarif, dan angka benchmark terbaru di halaman resmi, karena lanskap AI berkembang sangat cepat.

0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya