DeepSeek Vision and Grok Imagine models are now live on CometAPI โ†’
ai-comparisons/Riset CometAPI

Grok 4.6 vs Kimi K3: Perbandingan komprehensif

pilih Grok 4.6 untuk API agen hosted yang hemat biaya; pilih Kimi K3 untuk konteks 1M, bobot terbuka, dan kontrol infrastruktur.

CometAPI
AnnaTim riset model AI dan API
Diperbarui Aug 25, 2026 15 menit baca
Grok 4.6 vs Kimi K3: Perbandingan komprehensif
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Grok 4.6 adalah pilihan default yang lebih kuat jika Anda menginginkan API frontier terkelola untuk pengodean berbasis agen dan pekerjaan pengetahuan: model ini mencetak 61 pada Artificial Analysis Intelligence Index, menghasilkan keluaran lebih cepat dalam pengukuran independen saat ini, dan mulai dari $2/$6 per satu juta token input/output.

Kimi K3 lebih fleksibel ketika panjang konteks dan keterbukaan model penting. Ia menggabungkan 2,8 triliun parameter, 104B parameter aktif dan jendela konteks sekitar 1M token, plus bobot terbuka dan kemampuan multimodal native. Harga API terhosting utamanya lebih tinggi di $3/$15 per satu juta token input/output, tetapi hit cache hanya $0,30 per satu juta token.

Intinya: pilih Grok 4.6 untuk API agen yang hemat biaya; pilih Kimi K3 untuk konteks 1M, bobot terbuka dan kendali infrastruktur. Untuk pengodean, uji keduanya pada repositori Anda sendiri karena vendor menerbitkan versi benchmark dan harness yang berbeda.

Poin Utama

  • Grok 4.6 dirilis pada 12 Agustus 2026 dengan penekanan spesifik pada agen jangka panjang, pekerjaan kodebase, pekerjaan pengetahuan, dan proyek interaktif atau visual yang lebih ambisius.
  • Kimi K3 adalah flagship bobot terbuka 2,8T-parameter milik Moonshot AI dengan Kimi Delta Attention, Attention Residuals, visi native dan jendela konteks 1M token.
  • Kecerdasan keseluruhan independen hampir seri: 61 untuk Grok 4.6 versus 60 untuk Kimi K3.
  • Grok 4.6 memiliki harga token utama yang lebih rendah: $2 input / $6 output versus $3 input / $15 output untuk Kimi K3.
  • Kimi K3 menawarkan kapasitas konteks sekitar dua kali lipat dan bobot terbuka; Grok 4.6 bersifat proprietary namun lebih efisien langkah dan biaya dalam beberapa evaluasi agen independen.

Grok 4.6 vs Kimi K3: Perbandingan Singkat

SpesifikasiGrok 4.6Kimi K3
PengembangSpaceXAI / xAIMoonshot AI / Kimi
Tanggal rilis12 Agustus 202616 Juli 2026
ID modelgrok-4.6kimi-k3
ArsitekturTidak dipublikasikanMoE; KDA + AttnRes + Stable LatentMoE
Total parameterTidak diungkapkan2.8T
Parameter aktifTidak diungkapkan104B
PakarTidak diungkapkan896 total; 16 diaktifkan/token
Jendela konteks500.000 token1.048.576 / sekitar 1M token
Masukan / keluaranTeks + gambar โ†’ teksTeks + gambar โ†’ teks
PenalaranDapat dikonfigurasiSelalu aktif; rendah / tinggi / maksimum
Fungsi / penggunaan alatPanggilan fungsi + keluaran terstrukturToolCalls, tool_choice, dynamic tool loading
Bobot terbukaTidakYa
Indeks Kecerdasan AA6160
Harga resmi input / output$2 / $6 per MTok$3 / $15 per MTok
Kecocokan terbaikAgen terhosting, pengodean, pekerjaan pengetahuanKonteks panjang, deployment bobot terbuka, pengodean + penalaran visual

Apa itu Grok 4.6?

Grok 4.6 adalah model frontier milik SpaceXAI untuk pengodean, tugas agenik dan pekerjaan pengetahuan. Perusahaan menyatakan rilis ini dibangun mengelilingi agen jangka panjang dan pekerjaan interaktif serta visual yang lebih ambisius, bukan sekadar penyegaran benchmark statis. Dalam praktiknya, itu berarti model ini dimaksudkan untuk tetap pada satu tugas di banyak langkah: meneliti topik, menavigasi kodebase, menganalisis informasi, memanggil alat, dan beriterasi menuju aplikasi atau artefak kerja yang selesai.

Apa yang Berubah dari Grok 4.5?

SpaceXAI melaporkan pelatihan tambahan yang lebih panjang menggunakan data penalaran yang dihasilkan model yang terkurasi, konsep teknis tingkat lanjut, data rekayasa berkualitas tinggi, serta optimizer dan resep pelatihan yang ditingkatkan. Tim kemudian meregenerasi trajektori SFT dengan Grok 4.5 melintasi upaya penalaran dan harness agen, menyaring jejak bermasalah, dan menerapkan reinforcement learning agenik dalam lingkungan yang mencakup pengodean umum, optimasi kernel, pengembangan web, CAD dan pekerjaan pengetahuan.

Hasil praktisnya adalah model yang tidak hanya mencetak lebih tinggi tetapi juga menunjukkan lebih banyak pengujian diri dan verifikasi pada trajektori yang lebih panjang. Perilaku itu penting untuk agen karena biaya kesalahan kecil berlipat ganda saat model diizinkan mengedit file, memanggil alat, atau mengeksekusi rencana multi-langkah tanpa intervensi manusia konstan.

Spesifikasi Grok 4.6

PropertiGrok 4.6
Konteks500.000 token
ModalitasMasukan teks dan gambar; keluaran teks
PenalaranPenalaran yang dapat dikonfigurasi
Kemampuan API nativePanggilan fungsi dan keluaran terstruktur
Batas pengetahuan1 Februari 2026
Harga konteks pendek$2 input / $0,50 cache / $6 output per MTok
Ambang konteks panjangโ‰ฅ200K token prompt; $4 / $1 / $12

Apa itu Kimi K3?

Kimi K3 adalah model agenik multimodal flagship bobot terbuka milik Moonshot AI. Ia menggabungkan total 2,8 triliun parameter dengan jendela konteks 1M token dan visi native, menempatkannya untuk pengodean horizon panjang, pekerjaan pengetahuan end-to-end, penalaran dan tugas perangkat lunak yang berlandas visual.

Berbeda dengan Grok 4.6, Kimi K3 membuka bobot modelnya. Kartu model resmi saat ini mengidentifikasi 104B parameter aktif selama inferensi, sehingga jalur komputasinya jauh lebih kecil daripada jumlah 2,8T parameter penuh meskipun menerapkan model lengkap tetap membutuhkan infrastruktur substansial.

KDA, AttnRes, dan MoE yang Lebih Sparse

Arsitektur adalah salah satu pembedaan terbesar K3. Moonshot menyebut Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes) dirancang untuk meningkatkan aliran informasi di sepanjang urutan panjang dan lapisan model yang dalam. Stable LatentMoE meningkatkan sparsitas sehingga 16 dari 896 pakar diaktifkan untuk setiap token. Bersama dengan perubahan pelatihan dan resep data, Moonshot melaporkan sekitar 2,5ร— efisiensi penskalaan keseluruhan yang lebih baik daripada Kimi K2.

Spesifikasi Kimi K3

PropertiKimi K3
Total / parameter aktif2.8T / 104B
ArsitekturMoE dengan KDA + AttnRes + Stable LatentMoE
Pakar896; 16 diaktifkan per token
Konteks1M token
VisualPemahaman visual native
PenalaranSelalu aktif; rendah / tinggi / maksimum
AlatToolCalls, tool_choice constraints, dynamic tool loading
Bobot terbukaTersedia di Hugging Face
Harga resmi$0,30 hit cache / $3 input / $15 output per MTok

Grok 4.6 vs Kimi K3: Perbandingan Benchmark

Perbandingan langsung terbersih adalah Artificial Analysis Intelligence Index independen karena kedua model dievaluasi di bawah kerangka yang sama. Skor saat ini adalah 61 untuk Grok 4.6 (tinggi) dan 60 untuk Kimi K3 (maks). Kesenjangan satu poin terlalu kecil untuk membenarkan klaim bahwa satu model secara kategoris โ€œsatu generasi di depan.โ€ Pertanyaan yang lebih berguna adalah di mana masing-masing model memperoleh skornya.

Metrik independenGrok 4.6Kimi K3Keunggulan
Artificial Analysis Intelligence Index6160Grok 4.6 unggul 1 poin
Kecepatan output65,8 tok/s40,7 tok/sGrok 4.6
Waktu ke token pertama~32,3 s3,27 sKimi K3
Jendela konteks500K~1,05MKimi K3

Performa Pengodean

SpaceXAI memublikasikan beberapa hasil pengodean dan rekayasa perangkat lunak untuk Grok 4.6: 69,9% pada CursorBench 3.2, 65,9% pada DeepSWE 1.1, 61,3% pada FrontierCode 1.1 Extended, 56,4% pada APEX-SWE dan 26,0% pada Terminal-Bench 3.0. Ini bermakna karena mencakup pengeditan repositori, rekayasa perangkat lunak berbasis agen dan pekerjaan terminal alih-alih hanya trivia pelengkapan kode.

Benchmark pengodean yang dilaporkan vendor Grok 4.6Skor
CursorBench 3.269,9%
DeepSWE 1.165,9%
FrontierCode 1.1 Extended61,3%
APEX-SWE56,4%
Terminal-Bench 3.026,0%

Untuk Kimi K3, Moonshot memublikasikan suite pengodean yang berbeda namun luas. Materi peluncuran resminya melaporkan 67,5 pada DeepSWE, 88,3 pada Terminal-Bench 2.1, 81,2 pada FrontierSWE, 77,8 pada ProgramBench dan 42,0 pada SWE Marathon. Catatan pentingnya adalah bahwa Terminal-Bench 2.1 dan 3.0 adalah versi berbeda, dan FrontierSWE bukan evaluasi yang sama dengan FrontierCode. Baris-baris tersebut tidak boleh diperlakukan sebagai kemenangan apel-ke-apel hanya berdasarkan angka mentahnya.

Grok 4.6 vs Kimi K3: Perbandingan komprehensif

Sumber: Moonshot AI / Kimi

Pekerjaan Berbasis Agen dan Pengetahuan

Pekerjaan berbasis agen adalah area di mana Grok 4.6 terlihat paling kuat. SpaceXAI melaporkan 1753 Elo pada GDPVal-AA v2, 57,5% pada APEX-Agents dan 1577 Elo pada AA-Briefcase. Artificial Analysis secara independen menyoroti pola yang sama: peningkatan terkuat Grok 4.6 ada pada pekerjaan horizon panjang yang menggunakan alat alih-alih hanya penalaran statis.

Kimi K3 juga menargetkan agen pekerjaan pengetahuan. Suite peluncuran Moonshot menunjukkan hasil kuat pada BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 dan evaluasi agen visual. Lebih penting bagi pengembang, API Kimi mengekspos batasan pilihan alat dan dynamic tool loading, yang merupakan kontrol praktis saat agen harus menggunakan sistem perusahaan atau mengambil fakta sebelum menjawab.

Grok 4.6 vs Kimi K3: Perbandingan komprehensif

Sumber: Moonshot AI / Kimi

Multimodal dan Penalaran Visual

Kimi K3 memiliki cerita multimodal tingkat arsitektur yang lebih jelas: Moonshot menggambarkan kemampuan visi native dan secara spesifik mendemonstrasikan โ€œvisi dalam loopโ€ untuk pengembangan gim, rekayasa frontend dan CAD, di mana model dapat memeriksa umpan balik visual dan merevisi kode.

Grok 4.6 juga menerima masukan teks dan gambar dan SpaceXAI mengatakan model menghasilkan lintasan pertama yang lebih kuat pada proyek visual dan interaktif dibandingkan Grok 4.5. Perbedaannya kurang tentang apakah masing-masing model dapat melihat gambar dan lebih tentang filosofi deployment: Kimi mengekspos model multimodal terbuka, sementara Grok mengemas pemahaman visual di dalam API frontier terkelola dan ekosistem agen.

Jendela Konteks: 500K vs 1M

Grok 4.6 mendukung 500.000 token, sementara Kimi K3 mendukung sekitar 1 juta token. Itu membuat Kimi menjadi pilihan yang jelas saat beban kerja benar-benar membutuhkan lebih dari 500K token dalam satu permintaanโ€”misalnya, repositori yang sangat besar, koleksi riset multi-buku, atau jejak agen yang sangat panjang.

Namun, ukuran konteks adalah kapasitas, bukan jaminan kualitas pengambilan atau penalaran. Untuk sistem produksi, uji model pada mode kegagalan konteks panjang aktual Anda: pelacakan dependensi lintas file, pengambilan fakta yang jauh, deteksi kontradiksi, dan persistensi instruksi. Retrieval-augmented generation tetap bisa lebih murah dan lebih terkendali daripada mengirim satu juta token pada setiap permintaan.

Kecepatan dan Latensi

Artificial Analysis saat ini mengukur Grok 4.6 pada 65,8 token output per detik dan Kimi K3 pada 40,7 token per detik. Setelah generasi dimulai, Grok secara material lebih cepat dalam pengukuran ini. Namun pola token pertama berjalan sebaliknya: Kimi K3 memiliki TTFT terukur 3,27 detik, sementara pengukuran penyedia saat ini untuk Grok 4.6 jauh lebih lambat untuk mulai melakukan streaming.

Itu menciptakan pembedaan produk yang berguna. Untuk pengalaman chat atau IDE interaktif, waktu ke token pertama yang cepat dapat membuat Kimi terasa responsif meski jawaban penuh memakan waktu lebih lama. Untuk generasi panjang dan lintasan agen, throughput generasi Grok yang lebih tinggi dapat mengurangi ekor permintaan. Penyedia, wilayah, upaya penalaran, status cache dan ukuran permintaan semuanya dapat mengubah angka ini, jadi perlakukan sebagai snapshot saat ini alih-alih properti permanen.

Grok 4.6 vs Kimi K3: Harga API

Pada panjang konteks standar, Grok 4.6 berharga $2 per satu juta token input, $0,50 per satu juta token hit cache dan $6 per satu juta token output. Untuk prompt pada atau di atas 200K token, xAI menagih seluruh permintaan pada tarif konteks panjang sebesar $4 input, $1 cache dan $12 output per satu juta token.

Kimi menggunakan harga pay-as-you-go datar di seluruh jendela konteks 1M. API Kimi mencantumkan $0,30 per satu juta token hit cache, $3 per satu juta token input dan $15 per satu juta token output. Itu berarti Kimi lebih murah pada hit cache tetapi jauh lebih mahal pada token output baru; keunggulan harga Grok menyempit saat permintaan Grok melampaui ambang konteks panjang 200K.

Grok 4.6 vs Kimi K3: Perbandingan komprehensif

Harga API resmi utama per 1M token. Permintaan konteks panjang Grok (โ‰ฅ200K token prompt) menggunakan tarif lebih tinggi yang tidak ditampilkan pada grafik. Sumber: SpaceXAI dan harga API Kimi

Harga / 1M tokenGrok 4.6Kimi K3
Input konteks pendek resmi$2,00$3,00
Hit cache resmi$0,50$0,30
Output resmi$6,00$15,00
Harga konteks panjangโ‰ฅ200K: $4 / $1 / $12Harga datar hingga konteks 1M
Input CometAPI$1,60$2,40
Output CometAPI$4,80$12,00

Di CometAPI, Grok 4.6 saat ini tercantum di $1,60 input / $4,80 output per satu juta token, sementara Kimi K3 tercantum di $2,40 input / $12 output. Keduanya 20% di bawah harga input/output utama penyedia yang ditampilkan pada halaman model CometAPI mereka pada saat penulisan.

Bobot Terbuka vs Model Proprietary

Kimi K3 adalah model bobot terbuka dengan bobot yang dapat diunduh. Itu memungkinkan riset, kendali infrastruktur yang sangat halus, arsitektur inferensi privat dan deployment melalui tumpukan inferensi pihak ketiga. Itu tidak berarti K3 ringan: model 2,8T-parameter adalah proyek sistem serius bahkan dengan sparsitas MoE dan format presisi rendah.

Grok 4.6 bersifat proprietary. Arsitektur dan jumlah parameter tidak dipublikasikan, dan pengembang mengaksesnya sebagai layanan terkelola. Trade-off-nya adalah kesederhanaan operasional: Anda tidak harus membangun klaster inferensi, mengelola bobot model atau mengoptimalkan kernel untuk mendapatkan performa agen tingkat frontier.

Kekuatan dan Trade-off

ModelKekuatanTrade-off
Grok 4.6Harga API terhosting lebih rendah; 61 AA Intelligence; generasi terukur lebih cepat; hasil agen horizon panjang yang kuat; tumpukan alat xAI terintegrasiKonteks 500K; bobot tertutup; harga konteks panjang menjadi dua kali lipat; TTFT terukur lebih lambat
Kimi K3~1M konteks; bobot terbuka; MoE 2,8T; multimodalitas native; suite pengodean/agen yang kuat; harga hit cache sangat rendahHarga output lebih tinggi; generasi token terukur lebih lambat; hosting mandiri penuh berat infrastruktur

Grok 4.6 vs Kimi K3: Mana yang Harus Anda Pilih?

Use caseRekomendasiAlasan
API frontier defaultGrok 4.6Harga lebih rendah dengan sedikit keunggulan kecerdasan independen
Agen pekerjaan pengetahuan jangka panjangGrok 4.6Bukti terkuat dari GDPVal-AA dan AA-Briefcase
Pengodean skala repositoriUji keduanyaKeduanya dirancang untuk pengodean horizon panjang; suite benchmark berbeda
Prompt >500K tokenKimi K3Sekitar 1M konteks
Riset bobot terbukaKimi K3Bobot dan arsitektur tersedia
Inferensi privat/dikelola sendiriKimi K3Bobot terbuka memungkinkan deployment kustom
Biaya hit cache rendahKimi K3Harga $0,30/MTok untuk hit cache
Biaya token output baru lebih rendahGrok 4.6$6/MTok vs $15/MTok pada konteks standar
Respons pertama yang cepatKimi K3TTFT terukur jauh lebih rendah
Generasi panjang lebih cepatGrok 4.6Token output per detik terukur lebih tinggi
Alur kerja pengodean visual / CAD / gimKimi K3Visi native + fokus resmi โ€œvision in the loopโ€

Rekomendasi keseluruhan: Grok 4.6 adalah API terhosting default yang lebih kuat untuk sebagian besar pengembang agen. Kimi K3 adalah model frontier yang lebih fleksibel ketika konteks 1M, bobot terbuka dan kendali deployment adalah bagian dari kebutuhan daripada ekstra opsional.

Cara Mengakses Grok 4.6 dan Kimi K3 Melalui CometAPI

Kedua model aktif di CometAPI. Halaman model Grok 4.6 mencantumkan ID model grok-4.6 dan dukungan untuk akses gaya Chat Completions / Responses, sementara halaman model Kimi K3 mengekspos kimi-k3 melalui endpoint CometAPI yang terpadu. Itu membuat A/B testing lebih mudah karena Anda dapat mengganti ID model sambil menjaga autentikasi dan sebagian besar pipa aplikasi tetap konstan.

from openai import OpenAI
 import os

 client = OpenAI(
    base_url="https://api.cometapi.com/v1",
    api_key=os.environ["COMETAPI_KEY"],
 )

 for model in ["grok-4.6", "kimi-k3"]:
    response = client.chat.completions.create(
        model=model,
        messages=[
            {"role": "user", "content": "Tinjau bug pada repositori ini dan usulkan perbaikan yang telah diuji."}
        ],
    )
    print(model, response.choices[0].message.content)

Untuk evaluasi produksi, pertahankan prompt, alat, snapshot repositori dan kriteria keberhasilan tetap identik. Lacak bukan hanya kualitas jawaban tetapi juga keberhasilan panggilan alat, jumlah giliran, total token input/output, latensi dan pemulihan dari panggilan alat yang gagal. Itu lebih prediktif terhadap biaya agen nyata daripada satu skor benchmark.

Kesimpulan

Hasil paling penting dari perbandingan Grok 4.6 vs Kimi K3 adalah bahwa kecerdasan garis atas mereka jauh lebih dekat daripada desain produk mereka. Evaluasi independen saat ini menempatkan mereka di 61 versus 60, tetapi ekonomi sekitar dan pilihan deployment sangat berbeda.

Grok 4.6 dioptimalkan sebagai layanan frontier terkelola: harga token baru lebih rendah, benchmark agenik kuat, generasi terukur lebih cepat dan jalur alat/API yang matang. Kimi K3 dioptimalkan untuk fleksibilitas: jendela konteks 1M, skala MoE 2,8T, multimodalitas native dan bobot terbuka.

Untuk sebagian besar pengembang yang hanya membutuhkan model terhosting default terbaik untuk pengodean dan agen jangka panjang, Grok 4.6 adalah titik awal yang lebih aman. Jika sistem Anda bergantung pada konteks >500K, deployment bobot terbuka, pengodean visual atau kendali atas tumpukan inferensi, Kimi K3 bisa menjadi pilihan arsitektural yang lebih baik meski harga token terhostingnya lebih tinggi.

FAQs

Apakah Grok 4.6 lebih cerdas daripada Kimi K3?

Pada Artificial Analysis Intelligence Index saat ini, Grok 4.6 mencetak 61 dan Kimi K3 mencetak 60. Itu adalah keunggulan sempit, bukan kesenjangan yang menentukan. Performa pada tingkat tugas dapat berbalik tergantung beban kerja.

Mana yang lebih baik untuk pengodean?

Keduanya adalah model pengodean yang kredibel. Grok 4.6 memiliki hasil pengodean agenik saat ini yang kuat dan harga terhosting lebih rendah; Kimi K3 menawarkan jendela konteks yang lebih besar, bobot terbuka dan hasil pengodean repositori/visual yang kuat. Gunakan benchmark repositori Anda sendiri karena vendor melaporkan versi benchmark yang berbeda.

Model mana yang memiliki jendela konteks lebih besar?

Kimi K3 mendukung sekitar 1M token, kira-kira dua kali konteks 500K token milik Grok 4.6.

Mana yang lebih murah?

Untuk token baru konteks standar, Grok 4.6 lebih murah di $2 input / $6 output per MTok dibandingkan $3 / $15 untuk Kimi K3. Kimi memiliki tarif hit cache lebih murah di $0,30/MTok, sementara Grok menerapkan tarif lebih tinggi setelah prompt mencapai 200K token.

Bisakah saya melakukan hosting mandiri Kimi K3?

Kimi K3 memiliki bobot terbuka yang tersedia di Hugging Face, jadi deployment yang dikelola sendiri dimungkinkan. Model 2,8T penuh tetap sangat besar dan membutuhkan infrastruktur inferensi multi-node atau spesialis untuk performa praktis.

Bisakah saya melakukan hosting mandiri Grok 4.6?

Tidak ada bobot Grok 4.6 yang tersedia publik. Grok 4.6 disajikan sebagai model proprietari terkelola melalui SpaceXAI dan API mitra.

Bisakah saya mengakses keduanya dari satu API?

Ya. CometAPI saat ini mencantumkan Grok 4.6 dan Kimi K3, memungkinkan pengembang membandingkannya di balik API dan lapisan penagihan yang terpadu.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Aug 23, 2026
Terakhir diperbarui Aug 25, 2026
1 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya