TL;DR
Grok 4.6 ialah lalai yang lebih kukuh jika anda mahukan API barisan hadapan terurus untuk pengkodan berorientasikan agen dan kerja pengetahuan: ia memperoleh skor 61 pada Artificial Analysis Intelligence Index, menjana lebih pantas dalam pengukuran bebas semasa, dan bermula pada $2/$6 per juta token input/output.
Kimi K3 ialah pilihan yang lebih fleksibel apabila panjang konteks dan keterbukaan model penting. Ia menggabungkan 2.8 trilion parameter, 104B parameter aktif dan tetingkap konteks kira-kira 1M token, serta weights terbuka dan keupayaan multimodal natif. Harga API dihos utamanya lebih tinggi pada $3/$15 per juta token input/output, tetapi cache hit hanya $0.30 per juta token.
Kesimpulan: pilih Grok 4.6 untuk API agen dihos yang kos efektif; pilih Kimi K3 untuk tetingkap konteks 1M, weights terbuka dan kawalan infrastruktur. Untuk pengkodan, uji kedua-duanya pada repositori anda sendiri kerana vendor menerbitkan versi dan harness penanda aras yang berbeza.
Intipati Utama
- Grok 4.6 dilancarkan pada 12 Ogos 2026 dengan penekanan khusus pada agen jangka panjang, kerja kod asas, kerja pengetahuan, dan projek interaktif atau visual yang lebih bercita-cita tinggi.
- Kimi K3 ialah model utama berat terbuka 2.8T Moonshot AI dengan Kimi Delta Attention, Attention Residuals, multimodal natif dan tetingkap konteks 1M token.
- Kecerdasan keseluruhan bebas hampir seri: 61 untuk Grok 4.6 berbanding 60 untuk Kimi K3.
- Grok 4.6 mempunyai harga token tajuk utama yang lebih rendah: $2 input / $6 output berbanding $3 input / $15 output untuk Kimi K3.
- Kimi K3 menawarkan kapasiti konteks kira-kira dua kali ganda dan weights terbuka; Grok 4.6 adalah proprietari tetapi lebih cekap giliran dan kos dalam beberapa penilaian agen bebas.
Grok 4.6 vs Kimi K3: Perbandingan Pantas
| Spesifikasi | Grok 4.6 | Kimi K3 |
|---|---|---|
| Pembangun | SpaceXAI / xAI | Moonshot AI / Kimi |
| Tarikh keluaran | 12 Ogos 2026 | 16 Julai 2026 |
| ID model | grok-4.6 | kimi-k3 |
| Seni bina | Tidak didedahkan secara awam | MoE; KDA + AttnRes + Stable LatentMoE |
| Jumlah parameter | Tidak didedahkan | 2.8T |
| Parameter aktif | Tidak didedahkan | 104B |
| Pakar | Tidak didedahkan | 896 jumlah; 16 diaktifkan/token |
| Tetingkap konteks | 500,000 token | 1,048,576 / kira-kira 1M token |
| Input / output | Teks + imej → teks | Teks + imej → teks |
| Penalaran | Boleh dikonfigurasikan | Sentiasa diaktifkan; rendah / tinggi / maksimum |
| Penggunaan fungsi / alat | Panggilan fungsi + output berstruktur | ToolCalls, tool_choice, pemuatan alat dinamik |
| Weights terbuka | Tidak | Ya |
| AA Intelligence Index | 61 | 60 |
| Harga input / output rasmi | $2 / $6 per MTok | $3 / $15 per MTok |
| Kesesuaian terbaik | Agen dihos, pengkodan, kerja pengetahuan | Konteks panjang, deployment weights terbuka, pengkodan + penaakulan visual |
Apakah Grok 4.6?
Grok 4.6 ialah model barisan hadapan SpaceXAI untuk pengkodan, tugas agenik dan kerja pengetahuan. Syarikat menyatakan keluaran ini dibina sekitar agen jangka panjang dan kerja interaktif serta visual yang lebih bercita-cita tinggi, bukannya hanya penyegaran penanda aras statik. Dalam praktiknya, ini bermakna model bertujuan kekal pada satu tugas merentasi banyak langkah: meneliti topik, menavigasi kod asas, menganalisis maklumat, memanggil alat, dan beriterasi ke arah aplikasi atau artifak kerja siap.
Apa yang Berubah daripada Grok 4.5?
SpaceXAI melaporkan latihan tambahan yang lebih panjang menggunakan data penalaran yang dihasilkan model dan dipilih susun, konsep teknikal lanjutan, data kejuruteraan berkualiti tinggi, serta pengoptimum dan resipi latihan yang dipertingkat. Pasukan kemudian menjana semula trajektori SFT dengan Grok 4.5 merentasi usaha penalaran dan rangka kerja agen, menapis jejak bermasalah, dan menerapkan pembelajaran pengukuhan berorientasikan agen dalam persekitaran yang merangkumi pengkodan umum, pengoptimuman kernel, pembangunan web, CAD dan kerja pengetahuan.
Hasil praktikalnya ialah model yang bukan sahaja memperoleh skor lebih tinggi tetapi juga menunjukkan lebih banyak pengujian kendiri dan pengesahan pada trajektori lebih panjang. Tingkah laku itu penting untuk agen kerana kos kesilapan kecil berganda apabila model dibenarkan mengedit fail, memanggil alat atau melaksanakan pelan berbilang langkah tanpa campur tangan manusia berterusan.
Spesifikasi Grok 4.6
| Sifat | Grok 4.6 |
|---|---|
| Konteks | 500,000 token |
| Modality | Input teks dan imej; output teks |
| Penalaran | Penalaran boleh dikonfigurasikan |
| Keupayaan API natif | Panggilan fungsi dan output berstruktur |
| Had pengetahuan | 1 Februari 2026 |
| Harga konteks pendek | $2 input / $0.50 cache / $6 output per MTok |
| Ambang konteks panjang | ≥200K token prompt; $4 / $1 / $12 |
Apakah Kimi K3?
Kimi K3 ialah model agenik multimodal utama Moonshot AI dengan weights terbuka. Ia menggabungkan jumlah parameter 2.8 trilion dengan tetingkap konteks 1M token dan penglihatan natif, memposisikannya untuk pengkodan jangka panjang, kerja pengetahuan hujung-ke-hujung, penalaran dan tugas perisian berasaskan visual.
Tidak seperti Grok 4.6, Kimi K3 mendedahkan weights modelnya. Kad model rasmi semasa mengenal pasti 104B parameter aktif semasa inferens, jadi laluan pengiraannya jauh lebih kecil daripada jumlah 2.8T parameter walaupun melancarkan keseluruhan model masih memerlukan infrastruktur yang besar.
KDA, AttnRes dan MoE yang Lebih Jarang
Seni bina ialah salah satu pembeza terbesar K3. Moonshot menyatakan Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes) direka untuk memperbaiki aliran maklumat merentasi urutan panjang dan lapisan model yang dalam. Stable LatentMoE meningkatkan kesparsian supaya 16 daripada 896 pakar diaktifkan bagi setiap token. Bersama perubahan latihan dan resipi data, Moonshot melaporkan kira-kira 2.5× kecekapan penskalaan keseluruhan yang lebih baik berbanding Kimi K2.
Spesifikasi Kimi K3
| Sifat | Kimi K3 |
|---|---|
| Jumlah / parameter aktif | 2.8T / 104B |
| Seni bina | MoE dengan KDA + AttnRes + Stable LatentMoE |
| Pakar | 896; 16 diaktifkan per token |
| Konteks | 1M token |
| Visi | Kefahaman visual natif |
| Penalaran | Sentiasa diaktifkan; rendah / tinggi / maksimum |
| Alat | ToolCalls, kekangan tool_choice, pemuatan alat dinamik |
| Weights terbuka | Tersedia di Hugging Face |
| Harga rasmi | $0.30 cache hit / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: Perbandingan Penanda Aras
Perbandingan langsung paling bersih ialah Artificial Analysis Intelligence Index bebas kerana kedua-dua model dinilai di bawah rangka kerja yang sama. Skor semasa ialah 61 untuk Grok 4.6 (tinggi) dan 60 untuk Kimi K3 (maks). Jurang satu mata terlalu kecil untuk membenarkan dakwaan bahawa satu model “mendahului satu generasi”. Soalan yang lebih berguna ialah di mana setiap model memperoleh skor tersebut.
| Metrik bebas | Grok 4.6 | Kimi K3 | Kelebihan |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 mendahului 1 mata |
| Kelajuan output | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| Masa ke token pertama | ~32.3 s | 3.27 s | Kimi K3 |
| Tetingkap konteks | 500K | ~1.05M | Kimi K3 |
Prestasi Pengkodan
SpaceXAI menerbitkan beberapa keputusan pengkodan dan kejuruteraan perisian untuk Grok 4.6: 69.9% pada CursorBench 3.2, 65.9% pada DeepSWE 1.1, 61.3% pada FrontierCode 1.1 Extended, 56.4% pada APEX-SWE dan 26.0% pada Terminal-Bench 3.0. Ini bermakna kerana ia merangkumi pengeditan repositori, kejuruteraan perisian agenik dan kerja terminal dan bukannya hanya trivia pelengkapan kod.
| Penanda aras pengkodan dilaporkan vendor Grok 4.6 | Skor |
|---|---|
| CursorBench 3.2 | 69.9% |
| DeepSWE 1.1 | 65.9% |
| FrontierCode 1.1 Extended | 61.3% |
| APEX-SWE | 56.4% |
| Terminal-Bench 3.0 | 26.0% |
Untuk Kimi K3, Moonshot menerbitkan suite pengkodan yang berbeza tetapi meluas. Bahan pelancaran rasminya melaporkan 67.5 pada DeepSWE, 88.3 pada Terminal-Bench 2.1, 81.2 pada FrontierSWE, 77.8 pada ProgramBench dan 42.0 pada SWE Marathon. Perkara penting ialah Terminal-Bench 2.1 dan 3.0 ialah versi berbeza, dan FrontierSWE bukan penilaian yang sama dengan FrontierCode. Baris tersebut tidak harus dianggap sebagai kemenangan satu-ke-satu berdasarkan nombor mentah semata-mata.

Sumber: Moonshot AI / Kimi
Kerja Agen dan Pengetahuan
Kerja agen ialah tempat Grok 4.6 kelihatan paling kukuh. SpaceXAI melaporkan 1753 Elo pada GDPVal-AA v2, 57.5% pada APEX-Agents dan 1577 Elo pada AA-Briefcase. Artificial Analysis secara bebas menonjolkan corak yang sama: peningkatan terkuat Grok 4.6 adalah pada kerja jangka panjang yang menggunakan alat dan bukannya hanya penalaran statik.
Kimi K3 juga menyasarkan agen kerja pengetahuan. Suite pelancaran Moonshot menunjukkan keputusan kukuh pada BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 dan penilaian agen visual. Lebih penting untuk pembangun, API Kimi mendedahkan kekangan pilihan alat dan pemuatan alat dinamik, yang merupakan kawalan praktikal apabila agen mesti menggunakan sistem perusahaan atau mendapatkan fakta sebelum menjawab.

Sumber: Moonshot AI / Kimi
Penalaran Multimodal dan Visual
Kimi K3 mempunyai naratif multimodal peringkat seni bina yang lebih jelas: Moonshot menerangkan keupayaan penglihatan natif dan secara khusus menunjukkan “vision in the loop” untuk pembangunan permainan, kejuruteraan frontend dan CAD, di mana model boleh memeriksa maklum balas visual dan menyemak semula kod.
Grok 4.6 juga menerima input teks dan imej dan SpaceXAI mengatakan model menghasilkan percubaan pertama yang lebih kukuh pada projek visual dan interaktif berbanding Grok 4.5. Perbezaannya kurang tentang sama ada mana-mana model boleh melihat imej dan lebih tentang falsafah deployment: Kimi mendedahkan model multimodal terbuka, manakala Grok membungkus kefahaman visual dalam API barisan hadapan terurus dan ekosistem agen.
Tetingkap Konteks: 500K vs 1M
Grok 4.6 menyokong 500,000 token, manakala Kimi K3 menyokong kira-kira 1 juta token. Itu menjadikan Kimi pilihan jelas apabila beban kerja benar-benar memerlukan lebih daripada 500K token dalam satu permintaan—contohnya, repositori yang sangat besar, koleksi penyelidikan berbilang buku, atau jejak agen yang luar biasa panjang.
Walau bagaimanapun, saiz konteks ialah kapasiti, bukannya jaminan kualiti pengambilan atau penalaran. Untuk sistem produksi, uji model pada mod kegagalan konteks panjang sebenar anda: penjejakan kebergantungan merentas fail, pengambilan fakta jauh, pengesanan percanggahan dan ketekalan arahan. Penjanaan beraugmentasi pengambilan masih boleh lebih murah dan lebih terkawal daripada menghantar sejuta token pada setiap permintaan.
Kelajuan dan Kependaman
Artificial Analysis pada masa ini mengukur Grok 4.6 pada 65.8 token output sesaat dan Kimi K3 pada 40.7 token sesaat. Setelah penjanaan bermula, Grok secara material lebih pantas dalam pengukuran ini. Tetapi pola token pertama pergi sebaliknya: Kimi K3 mempunyai TTFT yang diukur 3.27 saat, manakala pengukuran penyedia semasa Grok 4.6 jauh lebih perlahan untuk mula menstrim.
Itu mewujudkan perbezaan produk yang berguna. Untuk pengalaman sembang interaktif atau IDE, masa ke token pertama yang pantas boleh membuat Kimi rasa responsif walaupun jawapan penuh mengambil masa lebih lama. Untuk generasi panjang dan larian agen, throughput penjanaan lebih tinggi Grok boleh mengurangkan ekor permintaan. Penyedia, wilayah, usaha penalaran, keadaan cache dan saiz permintaan semuanya boleh mengubah nombor ini, jadi anggap ia sebagai gambaran semasa dan bukannya sifat kekal.
Harga API Grok 4.6 vs Kimi K3
Pada panjang konteks standard, Grok 4.6 berharga $2 per juta token input, $0.50 per juta token cache dan $6 per juta token output. Untuk prompt pada atau melebihi 200K token, xAI mengebil seluruh permintaan pada kadar konteks panjang $4 input, $1 cache dan $12 output per juta token.
Kimi menggunakan harga bayar mengikut penggunaan rata merentasi tetingkap konteks 1M. API Kimi menyenaraikan $0.30 per juta token cache-hit, $3 per juta token input dan $15 per juta token output. Itu bermakna Kimi lebih murah pada cache hit tetapi jauh lebih mahal pada token output baharu; kelebihan harga Grok mengecil apabila permintaan Grok merentasi ambang konteks panjang 200K.

Harga API rasmi utama per 1M token. Permintaan konteks panjang Grok (≥200K token prompt) menggunakan kadar lebih tinggi yang tidak ditunjukkan dalam carta. Sumber: SpaceXAI and Kimi API pricing
| Harga / 1M token | Grok 4.6 | Kimi K3 |
|---|---|---|
| Input konteks pendek rasmi | $2.00 | $3.00 |
| Cache hit rasmi | $0.50 | $0.30 |
| Output rasmi | $6.00 | $15.00 |
| Harga konteks panjang | ≥200K: $4 / $1 / $12 | Harga rata hingga konteks 1M |
| Input CometAPI | $1.60 | $2.40 |
| Output CometAPI | $4.80 | $12.00 |
Di CometAPI, Grok 4.6 kini disenaraikan pada $1.60 input / $4.80 output per juta token, manakala Kimi K3 disenaraikan pada $2.40 input / $12 output. Kedua-duanya 20% di bawah harga input/output tajuk penyedia yang ditunjukkan pada halaman model CometAPI mereka pada masa penulisan.
Weights Terbuka vs Model Proprietari
Kimi K3 ialah model weights terbuka dengan weights boleh dimuat turun. Itu membolehkan penyelidikan, kawalan infrastruktur berbutir halus, seni bina inferens peribadi dan deployment melalui tindan inferens pihak ketiga. Ia tidak bermakna K3 ringan: model 2.8T parameter ialah projek sistem yang serius walaupun dengan sparsiti MoE dan format ketepatan rendah.
Grok 4.6 ialah proprietari. Seni bina dan kiraan parameternya tidak didedahkan secara awam, dan pembangun mengaksesnya sebagai perkhidmatan terurus. Pertukarannya ialah kesederhanaan operasi: anda tidak perlu membina kluster inferens, mengurus weights model atau mengoptimumkan kernel untuk mendapatkan prestasi agen peringkat barisan hadapan.
Kekuatan dan Pertukaran
| Model | Kekuatan | Pertukaran |
|---|---|---|
| Grok 4.6 | Harga API dihos lebih rendah; 61 AA Intelligence; penjanaan diukur lebih pantas; keputusan agen jangka panjang yang kukuh; timbunan alat xAI bersepadu | 500K konteks; weights tertutup; harga konteks panjang berganda; TTFT diukur lebih perlahan |
| Kimi K3 | ~1M konteks; weights terbuka; 2.8T MoE; multimodal natif; suite pengkodan/agen yang kukuh | Harga output lebih tinggi; penjanaan token diukur lebih perlahan; self-hosting penuh memerlukan infrastruktur berat |
Grok 4.6 vs Kimi K3: Manakah Patut Anda Pilih?
| Kes penggunaan | Disyorkan | Sebab |
|---|---|---|
| API barisan hadapan lalai | Grok 4.6 | Harga lebih rendah dengan sedikit kelebihan kecerdasan bebas |
| Agen kerja pengetahuan jangka panjang | Grok 4.6 | Bukti terkuat daripada GDPVal-AA dan AA-Briefcase |
| Pengkodan skala repositori | Uji kedua-duanya | Kedua-duanya direka untuk pengkodan jangka panjang; suite penanda aras berbeza |
| Prompt >500K token | Kimi K3 | Kira-kira 1M konteks |
| Penyelidikan weights terbuka | Kimi K3 | Weights dan seni bina tersedia |
| Inferens persendirian/diurus sendiri | Kimi K3 | Weights terbuka membolehkan deployment tersuai |
| Kos cache hit rendah | Kimi K3 | Harga $0.30/MTok cache hit |
| Kos token output baharu lebih rendah | Grok 4.6 | $6/MTok vs $15/MTok pada konteks standard |
| Respons pertama yang kelihatan pantas | Kimi K3 | TTFT diukur jauh lebih rendah |
| Penjanaan panjang lebih pantas | Grok 4.6 | Token output/s yang diukur lebih tinggi |
| Aliran kerja pengkodan visual / CAD / permainan | Kimi K3 | Visi natif + fokus rasmi “vision in the loop” |
Secara keseluruhan: Grok 4.6 ialah API dihos lalai yang lebih kukuh untuk kebanyakan pembangun agen. Kimi K3 ialah model barisan hadapan yang lebih fleksibel apabila tetingkap konteks 1M, weights terbuka dan kawalan deployment adalah sebahagian daripada keperluan dan bukannya tambahan pilihan.
Cara Mengakses Grok 4.6 dan Kimi K3 Melalui CometAPI
Kedua-dua model tersedia di CometAPI. Halaman model Grok 4.6 menyenaraikan ID model grok-4.6 dan sokongan untuk akses gaya Chat Completions / Responses, manakala halaman model Kimi K3 mendedahkan kimi-k3 melalui titik akhir CometAPI bersatu. Itu memudahkan ujian A/B kerana anda boleh menukar ID model sambil mengekalkan pengesahan dan kebanyakan paip aplikasi yang sama.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Semak pepijat repositori ini dan cadangkan pembaikan yang diuji."}
],
)
print(model, response.choices[0].message.content)
Untuk penilaian produksi, kekalkan prompt, alat, snapshot repositori dan kriteria kejayaan yang sama. Jejaki bukan sahaja kualiti jawapan tetapi juga kejayaan panggilan alat, bilangan pusingan, jumlah token input/output, kependaman dan pemulihan daripada panggilan alat yang gagal. Itu lebih ramal terhadap kos agen sebenar berbanding satu skor penanda aras.
Kesimpulan
Hasil paling penting daripada perbandingan Grok 4.6 vs Kimi K3 ialah kecerdasan garis atas mereka jauh lebih dekat daripada reka bentuk produk mereka. Penilaian bebas kini meletakkan mereka pada 61 berbanding 60, tetapi ekonomi sekeliling dan pilihan deployment sangat berbeza.
Grok 4.6 dioptimumkan sebagai perkhidmatan barisan hadapan terurus: harga token baharu lebih rendah, penanda aras agen yang kukuh, penjanaan diukur lebih pantas dan laluan alat/API yang matang. Kimi K3 dioptimumkan untuk fleksibiliti: tetingkap konteks 1M, skala 2.8T MoE, multimodality natif dan weights terbuka.
Bagi kebanyakan pembangun yang hanya memerlukan model dihos lalai terbaik untuk pengkodan dan agen jangka panjang, Grok 4.6 ialah titik permulaan yang lebih selamat. Jika sistem anda bergantung pada >500K konteks, deployment weights terbuka, pengkodan visual atau kawalan ke atas tindan inferens, Kimi K3 boleh menjadi pilihan seni bina yang lebih baik walaupun harga token dihosnya lebih tinggi.
Soalan Lazim
Adakah Grok 4.6 lebih pintar daripada Kimi K3?
Pada Artificial Analysis Intelligence Index semasa, Grok 4.6 memperoleh 61 dan Kimi K3 memperoleh 60. Itu kelebihan kecil, bukan jurang penentu. Prestasi per tugas boleh berbalik bergantung pada beban kerja.
Yang mana lebih baik untuk pengkodan?
Kedua-duanya ialah model pengkodan yang boleh dipercayai. Grok 4.6 mempunyai keputusan pengkodan agenik semasa yang kukuh dan harga dihos lebih rendah; Kimi K3 menawarkan tetingkap konteks lebih besar, weights terbuka dan keputusan pengkodan repositori/visual yang kukuh. Gunakan penanda aras repositori anda sendiri kerana vendor melaporkan versi penanda aras yang berbeza.
Model yang mana mempunyai tetingkap konteks lebih besar?
Kimi K3 menyokong kira-kira 1M token, kira-kira dua kali ganda tetingkap konteks 500K token Grok 4.6.
Yang mana lebih murah?
Untuk token baharu konteks standard, Grok 4.6 lebih murah pada $2 input / $6 output per MTok berbanding $3 / $15 untuk Kimi K3. Kimi mempunyai kadar cache hit yang lebih murah pada $0.30/MTok, manakala Grok menerapkan kadar lebih tinggi sebaik prompt mencapai 200K token.
Bolehkah saya self-host Kimi K3?
Kimi K3 mempunyai weights terbuka yang tersedia di Hugging Face, jadi deployment diurus sendiri adalah mungkin. Namun model penuh 2.8T masih sangat besar dan memerlukan infrastruktur inferens berbilang nod atau khusus untuk prestasi praktikal.
Bolehkah saya self-host Grok 4.6?
Tiada weights Grok 4.6 awam tersedia. Grok 4.6 disampaikan sebagai model proprietari terurus melalui SpaceXAI dan API rakan kongsi.
Bolehkah saya mengakses kedua-duanya daripada satu API?
Ya. CometAPI kini menyenaraikan kedua-dua Grok 4.6 dan Kimi K3, membolehkan pembangun membandingkannya di belakang API dan lapisan bil yang bersatu.
