TL;DR
Grok 4.6 adalah pilihan default yang lebih kuat jika Anda menginginkan API frontier terkelola untuk pengodean berbasis agen dan pekerjaan pengetahuan: model ini mencetak 61 pada Artificial Analysis Intelligence Index, menghasilkan keluaran lebih cepat dalam pengukuran independen saat ini, dan mulai dari $2/$6 per satu juta token input/output.
Kimi K3 lebih fleksibel ketika panjang konteks dan keterbukaan model penting. Ia menggabungkan 2,8 triliun parameter, 104B parameter aktif dan jendela konteks sekitar 1M token, plus bobot terbuka dan kemampuan multimodal native. Harga API terhosting utamanya lebih tinggi di $3/$15 per satu juta token input/output, tetapi hit cache hanya $0,30 per satu juta token.
Intinya: pilih Grok 4.6 untuk API agen yang hemat biaya; pilih Kimi K3 untuk konteks 1M, bobot terbuka dan kendali infrastruktur. Untuk pengodean, uji keduanya pada repositori Anda sendiri karena vendor menerbitkan versi benchmark dan harness yang berbeda.
Poin Utama
- Grok 4.6 dirilis pada 12 Agustus 2026 dengan penekanan spesifik pada agen jangka panjang, pekerjaan kodebase, pekerjaan pengetahuan, dan proyek interaktif atau visual yang lebih ambisius.
- Kimi K3 adalah flagship bobot terbuka 2,8T-parameter milik Moonshot AI dengan Kimi Delta Attention, Attention Residuals, visi native dan jendela konteks 1M token.
- Kecerdasan keseluruhan independen hampir seri: 61 untuk Grok 4.6 versus 60 untuk Kimi K3.
- Grok 4.6 memiliki harga token utama yang lebih rendah: $2 input / $6 output versus $3 input / $15 output untuk Kimi K3.
- Kimi K3 menawarkan kapasitas konteks sekitar dua kali lipat dan bobot terbuka; Grok 4.6 bersifat proprietary namun lebih efisien langkah dan biaya dalam beberapa evaluasi agen independen.
Grok 4.6 vs Kimi K3: Perbandingan Singkat
| Spesifikasi | Grok 4.6 | Kimi K3 |
|---|---|---|
| Pengembang | SpaceXAI / xAI | Moonshot AI / Kimi |
| Tanggal rilis | 12 Agustus 2026 | 16 Juli 2026 |
| ID model | grok-4.6 | kimi-k3 |
| Arsitektur | Tidak dipublikasikan | MoE; KDA + AttnRes + Stable LatentMoE |
| Total parameter | Tidak diungkapkan | 2.8T |
| Parameter aktif | Tidak diungkapkan | 104B |
| Pakar | Tidak diungkapkan | 896 total; 16 diaktifkan/token |
| Jendela konteks | 500.000 token | 1.048.576 / sekitar 1M token |
| Masukan / keluaran | Teks + gambar โ teks | Teks + gambar โ teks |
| Penalaran | Dapat dikonfigurasi | Selalu aktif; rendah / tinggi / maksimum |
| Fungsi / penggunaan alat | Panggilan fungsi + keluaran terstruktur | ToolCalls, tool_choice, dynamic tool loading |
| Bobot terbuka | Tidak | Ya |
| Indeks Kecerdasan AA | 61 | 60 |
| Harga resmi input / output | $2 / $6 per MTok | $3 / $15 per MTok |
| Kecocokan terbaik | Agen terhosting, pengodean, pekerjaan pengetahuan | Konteks panjang, deployment bobot terbuka, pengodean + penalaran visual |
Apa itu Grok 4.6?
Grok 4.6 adalah model frontier milik SpaceXAI untuk pengodean, tugas agenik dan pekerjaan pengetahuan. Perusahaan menyatakan rilis ini dibangun mengelilingi agen jangka panjang dan pekerjaan interaktif serta visual yang lebih ambisius, bukan sekadar penyegaran benchmark statis. Dalam praktiknya, itu berarti model ini dimaksudkan untuk tetap pada satu tugas di banyak langkah: meneliti topik, menavigasi kodebase, menganalisis informasi, memanggil alat, dan beriterasi menuju aplikasi atau artefak kerja yang selesai.
Apa yang Berubah dari Grok 4.5?
SpaceXAI melaporkan pelatihan tambahan yang lebih panjang menggunakan data penalaran yang dihasilkan model yang terkurasi, konsep teknis tingkat lanjut, data rekayasa berkualitas tinggi, serta optimizer dan resep pelatihan yang ditingkatkan. Tim kemudian meregenerasi trajektori SFT dengan Grok 4.5 melintasi upaya penalaran dan harness agen, menyaring jejak bermasalah, dan menerapkan reinforcement learning agenik dalam lingkungan yang mencakup pengodean umum, optimasi kernel, pengembangan web, CAD dan pekerjaan pengetahuan.
Hasil praktisnya adalah model yang tidak hanya mencetak lebih tinggi tetapi juga menunjukkan lebih banyak pengujian diri dan verifikasi pada trajektori yang lebih panjang. Perilaku itu penting untuk agen karena biaya kesalahan kecil berlipat ganda saat model diizinkan mengedit file, memanggil alat, atau mengeksekusi rencana multi-langkah tanpa intervensi manusia konstan.
Spesifikasi Grok 4.6
| Properti | Grok 4.6 |
|---|---|
| Konteks | 500.000 token |
| Modalitas | Masukan teks dan gambar; keluaran teks |
| Penalaran | Penalaran yang dapat dikonfigurasi |
| Kemampuan API native | Panggilan fungsi dan keluaran terstruktur |
| Batas pengetahuan | 1 Februari 2026 |
| Harga konteks pendek | $2 input / $0,50 cache / $6 output per MTok |
| Ambang konteks panjang | โฅ200K token prompt; $4 / $1 / $12 |
Apa itu Kimi K3?
Kimi K3 adalah model agenik multimodal flagship bobot terbuka milik Moonshot AI. Ia menggabungkan total 2,8 triliun parameter dengan jendela konteks 1M token dan visi native, menempatkannya untuk pengodean horizon panjang, pekerjaan pengetahuan end-to-end, penalaran dan tugas perangkat lunak yang berlandas visual.
Berbeda dengan Grok 4.6, Kimi K3 membuka bobot modelnya. Kartu model resmi saat ini mengidentifikasi 104B parameter aktif selama inferensi, sehingga jalur komputasinya jauh lebih kecil daripada jumlah 2,8T parameter penuh meskipun menerapkan model lengkap tetap membutuhkan infrastruktur substansial.
KDA, AttnRes, dan MoE yang Lebih Sparse
Arsitektur adalah salah satu pembedaan terbesar K3. Moonshot menyebut Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes) dirancang untuk meningkatkan aliran informasi di sepanjang urutan panjang dan lapisan model yang dalam. Stable LatentMoE meningkatkan sparsitas sehingga 16 dari 896 pakar diaktifkan untuk setiap token. Bersama dengan perubahan pelatihan dan resep data, Moonshot melaporkan sekitar 2,5ร efisiensi penskalaan keseluruhan yang lebih baik daripada Kimi K2.
Spesifikasi Kimi K3
| Properti | Kimi K3 |
|---|---|
| Total / parameter aktif | 2.8T / 104B |
| Arsitektur | MoE dengan KDA + AttnRes + Stable LatentMoE |
| Pakar | 896; 16 diaktifkan per token |
| Konteks | 1M token |
| Visual | Pemahaman visual native |
| Penalaran | Selalu aktif; rendah / tinggi / maksimum |
| Alat | ToolCalls, tool_choice constraints, dynamic tool loading |
| Bobot terbuka | Tersedia di Hugging Face |
| Harga resmi | $0,30 hit cache / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: Perbandingan Benchmark
Perbandingan langsung terbersih adalah Artificial Analysis Intelligence Index independen karena kedua model dievaluasi di bawah kerangka yang sama. Skor saat ini adalah 61 untuk Grok 4.6 (tinggi) dan 60 untuk Kimi K3 (maks). Kesenjangan satu poin terlalu kecil untuk membenarkan klaim bahwa satu model secara kategoris โsatu generasi di depan.โ Pertanyaan yang lebih berguna adalah di mana masing-masing model memperoleh skornya.
| Metrik independen | Grok 4.6 | Kimi K3 | Keunggulan |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 unggul 1 poin |
| Kecepatan output | 65,8 tok/s | 40,7 tok/s | Grok 4.6 |
| Waktu ke token pertama | ~32,3 s | 3,27 s | Kimi K3 |
| Jendela konteks | 500K | ~1,05M | Kimi K3 |
Performa Pengodean
SpaceXAI memublikasikan beberapa hasil pengodean dan rekayasa perangkat lunak untuk Grok 4.6: 69,9% pada CursorBench 3.2, 65,9% pada DeepSWE 1.1, 61,3% pada FrontierCode 1.1 Extended, 56,4% pada APEX-SWE dan 26,0% pada Terminal-Bench 3.0. Ini bermakna karena mencakup pengeditan repositori, rekayasa perangkat lunak berbasis agen dan pekerjaan terminal alih-alih hanya trivia pelengkapan kode.
| Benchmark pengodean yang dilaporkan vendor Grok 4.6 | Skor |
|---|---|
| CursorBench 3.2 | 69,9% |
| DeepSWE 1.1 | 65,9% |
| FrontierCode 1.1 Extended | 61,3% |
| APEX-SWE | 56,4% |
| Terminal-Bench 3.0 | 26,0% |
Untuk Kimi K3, Moonshot memublikasikan suite pengodean yang berbeda namun luas. Materi peluncuran resminya melaporkan 67,5 pada DeepSWE, 88,3 pada Terminal-Bench 2.1, 81,2 pada FrontierSWE, 77,8 pada ProgramBench dan 42,0 pada SWE Marathon. Catatan pentingnya adalah bahwa Terminal-Bench 2.1 dan 3.0 adalah versi berbeda, dan FrontierSWE bukan evaluasi yang sama dengan FrontierCode. Baris-baris tersebut tidak boleh diperlakukan sebagai kemenangan apel-ke-apel hanya berdasarkan angka mentahnya.

Sumber: Moonshot AI / Kimi
Pekerjaan Berbasis Agen dan Pengetahuan
Pekerjaan berbasis agen adalah area di mana Grok 4.6 terlihat paling kuat. SpaceXAI melaporkan 1753 Elo pada GDPVal-AA v2, 57,5% pada APEX-Agents dan 1577 Elo pada AA-Briefcase. Artificial Analysis secara independen menyoroti pola yang sama: peningkatan terkuat Grok 4.6 ada pada pekerjaan horizon panjang yang menggunakan alat alih-alih hanya penalaran statis.
Kimi K3 juga menargetkan agen pekerjaan pengetahuan. Suite peluncuran Moonshot menunjukkan hasil kuat pada BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 dan evaluasi agen visual. Lebih penting bagi pengembang, API Kimi mengekspos batasan pilihan alat dan dynamic tool loading, yang merupakan kontrol praktis saat agen harus menggunakan sistem perusahaan atau mengambil fakta sebelum menjawab.

Sumber: Moonshot AI / Kimi
Multimodal dan Penalaran Visual
Kimi K3 memiliki cerita multimodal tingkat arsitektur yang lebih jelas: Moonshot menggambarkan kemampuan visi native dan secara spesifik mendemonstrasikan โvisi dalam loopโ untuk pengembangan gim, rekayasa frontend dan CAD, di mana model dapat memeriksa umpan balik visual dan merevisi kode.
Grok 4.6 juga menerima masukan teks dan gambar dan SpaceXAI mengatakan model menghasilkan lintasan pertama yang lebih kuat pada proyek visual dan interaktif dibandingkan Grok 4.5. Perbedaannya kurang tentang apakah masing-masing model dapat melihat gambar dan lebih tentang filosofi deployment: Kimi mengekspos model multimodal terbuka, sementara Grok mengemas pemahaman visual di dalam API frontier terkelola dan ekosistem agen.
Jendela Konteks: 500K vs 1M
Grok 4.6 mendukung 500.000 token, sementara Kimi K3 mendukung sekitar 1 juta token. Itu membuat Kimi menjadi pilihan yang jelas saat beban kerja benar-benar membutuhkan lebih dari 500K token dalam satu permintaanโmisalnya, repositori yang sangat besar, koleksi riset multi-buku, atau jejak agen yang sangat panjang.
Namun, ukuran konteks adalah kapasitas, bukan jaminan kualitas pengambilan atau penalaran. Untuk sistem produksi, uji model pada mode kegagalan konteks panjang aktual Anda: pelacakan dependensi lintas file, pengambilan fakta yang jauh, deteksi kontradiksi, dan persistensi instruksi. Retrieval-augmented generation tetap bisa lebih murah dan lebih terkendali daripada mengirim satu juta token pada setiap permintaan.
Kecepatan dan Latensi
Artificial Analysis saat ini mengukur Grok 4.6 pada 65,8 token output per detik dan Kimi K3 pada 40,7 token per detik. Setelah generasi dimulai, Grok secara material lebih cepat dalam pengukuran ini. Namun pola token pertama berjalan sebaliknya: Kimi K3 memiliki TTFT terukur 3,27 detik, sementara pengukuran penyedia saat ini untuk Grok 4.6 jauh lebih lambat untuk mulai melakukan streaming.
Itu menciptakan pembedaan produk yang berguna. Untuk pengalaman chat atau IDE interaktif, waktu ke token pertama yang cepat dapat membuat Kimi terasa responsif meski jawaban penuh memakan waktu lebih lama. Untuk generasi panjang dan lintasan agen, throughput generasi Grok yang lebih tinggi dapat mengurangi ekor permintaan. Penyedia, wilayah, upaya penalaran, status cache dan ukuran permintaan semuanya dapat mengubah angka ini, jadi perlakukan sebagai snapshot saat ini alih-alih properti permanen.
Grok 4.6 vs Kimi K3: Harga API
Pada panjang konteks standar, Grok 4.6 berharga $2 per satu juta token input, $0,50 per satu juta token hit cache dan $6 per satu juta token output. Untuk prompt pada atau di atas 200K token, xAI menagih seluruh permintaan pada tarif konteks panjang sebesar $4 input, $1 cache dan $12 output per satu juta token.
Kimi menggunakan harga pay-as-you-go datar di seluruh jendela konteks 1M. API Kimi mencantumkan $0,30 per satu juta token hit cache, $3 per satu juta token input dan $15 per satu juta token output. Itu berarti Kimi lebih murah pada hit cache tetapi jauh lebih mahal pada token output baru; keunggulan harga Grok menyempit saat permintaan Grok melampaui ambang konteks panjang 200K.

Harga API resmi utama per 1M token. Permintaan konteks panjang Grok (โฅ200K token prompt) menggunakan tarif lebih tinggi yang tidak ditampilkan pada grafik. Sumber: SpaceXAI dan harga API Kimi
| Harga / 1M token | Grok 4.6 | Kimi K3 |
|---|---|---|
| Input konteks pendek resmi | $2,00 | $3,00 |
| Hit cache resmi | $0,50 | $0,30 |
| Output resmi | $6,00 | $15,00 |
| Harga konteks panjang | โฅ200K: $4 / $1 / $12 | Harga datar hingga konteks 1M |
| Input CometAPI | $1,60 | $2,40 |
| Output CometAPI | $4,80 | $12,00 |
Di CometAPI, Grok 4.6 saat ini tercantum di $1,60 input / $4,80 output per satu juta token, sementara Kimi K3 tercantum di $2,40 input / $12 output. Keduanya 20% di bawah harga input/output utama penyedia yang ditampilkan pada halaman model CometAPI mereka pada saat penulisan.
Bobot Terbuka vs Model Proprietary
Kimi K3 adalah model bobot terbuka dengan bobot yang dapat diunduh. Itu memungkinkan riset, kendali infrastruktur yang sangat halus, arsitektur inferensi privat dan deployment melalui tumpukan inferensi pihak ketiga. Itu tidak berarti K3 ringan: model 2,8T-parameter adalah proyek sistem serius bahkan dengan sparsitas MoE dan format presisi rendah.
Grok 4.6 bersifat proprietary. Arsitektur dan jumlah parameter tidak dipublikasikan, dan pengembang mengaksesnya sebagai layanan terkelola. Trade-off-nya adalah kesederhanaan operasional: Anda tidak harus membangun klaster inferensi, mengelola bobot model atau mengoptimalkan kernel untuk mendapatkan performa agen tingkat frontier.
Kekuatan dan Trade-off
| Model | Kekuatan | Trade-off |
|---|---|---|
| Grok 4.6 | Harga API terhosting lebih rendah; 61 AA Intelligence; generasi terukur lebih cepat; hasil agen horizon panjang yang kuat; tumpukan alat xAI terintegrasi | Konteks 500K; bobot tertutup; harga konteks panjang menjadi dua kali lipat; TTFT terukur lebih lambat |
| Kimi K3 | ~1M konteks; bobot terbuka; MoE 2,8T; multimodalitas native; suite pengodean/agen yang kuat; harga hit cache sangat rendah | Harga output lebih tinggi; generasi token terukur lebih lambat; hosting mandiri penuh berat infrastruktur |
Grok 4.6 vs Kimi K3: Mana yang Harus Anda Pilih?
| Use case | Rekomendasi | Alasan |
|---|---|---|
| API frontier default | Grok 4.6 | Harga lebih rendah dengan sedikit keunggulan kecerdasan independen |
| Agen pekerjaan pengetahuan jangka panjang | Grok 4.6 | Bukti terkuat dari GDPVal-AA dan AA-Briefcase |
| Pengodean skala repositori | Uji keduanya | Keduanya dirancang untuk pengodean horizon panjang; suite benchmark berbeda |
| Prompt >500K token | Kimi K3 | Sekitar 1M konteks |
| Riset bobot terbuka | Kimi K3 | Bobot dan arsitektur tersedia |
| Inferensi privat/dikelola sendiri | Kimi K3 | Bobot terbuka memungkinkan deployment kustom |
| Biaya hit cache rendah | Kimi K3 | Harga $0,30/MTok untuk hit cache |
| Biaya token output baru lebih rendah | Grok 4.6 | $6/MTok vs $15/MTok pada konteks standar |
| Respons pertama yang cepat | Kimi K3 | TTFT terukur jauh lebih rendah |
| Generasi panjang lebih cepat | Grok 4.6 | Token output per detik terukur lebih tinggi |
| Alur kerja pengodean visual / CAD / gim | Kimi K3 | Visi native + fokus resmi โvision in the loopโ |
Rekomendasi keseluruhan: Grok 4.6 adalah API terhosting default yang lebih kuat untuk sebagian besar pengembang agen. Kimi K3 adalah model frontier yang lebih fleksibel ketika konteks 1M, bobot terbuka dan kendali deployment adalah bagian dari kebutuhan daripada ekstra opsional.
Cara Mengakses Grok 4.6 dan Kimi K3 Melalui CometAPI
Kedua model aktif di CometAPI. Halaman model Grok 4.6 mencantumkan ID model grok-4.6 dan dukungan untuk akses gaya Chat Completions / Responses, sementara halaman model Kimi K3 mengekspos kimi-k3 melalui endpoint CometAPI yang terpadu. Itu membuat A/B testing lebih mudah karena Anda dapat mengganti ID model sambil menjaga autentikasi dan sebagian besar pipa aplikasi tetap konstan.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Tinjau bug pada repositori ini dan usulkan perbaikan yang telah diuji."}
],
)
print(model, response.choices[0].message.content)
Untuk evaluasi produksi, pertahankan prompt, alat, snapshot repositori dan kriteria keberhasilan tetap identik. Lacak bukan hanya kualitas jawaban tetapi juga keberhasilan panggilan alat, jumlah giliran, total token input/output, latensi dan pemulihan dari panggilan alat yang gagal. Itu lebih prediktif terhadap biaya agen nyata daripada satu skor benchmark.
Kesimpulan
Hasil paling penting dari perbandingan Grok 4.6 vs Kimi K3 adalah bahwa kecerdasan garis atas mereka jauh lebih dekat daripada desain produk mereka. Evaluasi independen saat ini menempatkan mereka di 61 versus 60, tetapi ekonomi sekitar dan pilihan deployment sangat berbeda.
Grok 4.6 dioptimalkan sebagai layanan frontier terkelola: harga token baru lebih rendah, benchmark agenik kuat, generasi terukur lebih cepat dan jalur alat/API yang matang. Kimi K3 dioptimalkan untuk fleksibilitas: jendela konteks 1M, skala MoE 2,8T, multimodalitas native dan bobot terbuka.
Untuk sebagian besar pengembang yang hanya membutuhkan model terhosting default terbaik untuk pengodean dan agen jangka panjang, Grok 4.6 adalah titik awal yang lebih aman. Jika sistem Anda bergantung pada konteks >500K, deployment bobot terbuka, pengodean visual atau kendali atas tumpukan inferensi, Kimi K3 bisa menjadi pilihan arsitektural yang lebih baik meski harga token terhostingnya lebih tinggi.
FAQs
Apakah Grok 4.6 lebih cerdas daripada Kimi K3?
Pada Artificial Analysis Intelligence Index saat ini, Grok 4.6 mencetak 61 dan Kimi K3 mencetak 60. Itu adalah keunggulan sempit, bukan kesenjangan yang menentukan. Performa pada tingkat tugas dapat berbalik tergantung beban kerja.
Mana yang lebih baik untuk pengodean?
Keduanya adalah model pengodean yang kredibel. Grok 4.6 memiliki hasil pengodean agenik saat ini yang kuat dan harga terhosting lebih rendah; Kimi K3 menawarkan jendela konteks yang lebih besar, bobot terbuka dan hasil pengodean repositori/visual yang kuat. Gunakan benchmark repositori Anda sendiri karena vendor melaporkan versi benchmark yang berbeda.
Model mana yang memiliki jendela konteks lebih besar?
Kimi K3 mendukung sekitar 1M token, kira-kira dua kali konteks 500K token milik Grok 4.6.
Mana yang lebih murah?
Untuk token baru konteks standar, Grok 4.6 lebih murah di $2 input / $6 output per MTok dibandingkan $3 / $15 untuk Kimi K3. Kimi memiliki tarif hit cache lebih murah di $0,30/MTok, sementara Grok menerapkan tarif lebih tinggi setelah prompt mencapai 200K token.
Bisakah saya melakukan hosting mandiri Kimi K3?
Kimi K3 memiliki bobot terbuka yang tersedia di Hugging Face, jadi deployment yang dikelola sendiri dimungkinkan. Model 2,8T penuh tetap sangat besar dan membutuhkan infrastruktur inferensi multi-node atau spesialis untuk performa praktis.
Bisakah saya melakukan hosting mandiri Grok 4.6?
Tidak ada bobot Grok 4.6 yang tersedia publik. Grok 4.6 disajikan sebagai model proprietari terkelola melalui SpaceXAI dan API mitra.
Bisakah saya mengakses keduanya dari satu API?
Ya. CometAPI saat ini mencantumkan Grok 4.6 dan Kimi K3, memungkinkan pengembang membandingkannya di balik API dan lapisan penagihan yang terpadu.
