TLDR: Moonshot AI merilis Kimi K3 pada 16 Juli 2026 โ model open-weights terobosan dengan 2,8 triliun parameter (pertama di kelas 3T) dengan multimodalitas native, konteks 1 juta token, dan kinerja frontier yang menandingi atau mengungguli model proprietary teratas seperti Claude Fable 5 dan GPT-5.6 Sol dalam pengodean, tugas berbasis agen, pengembangan frontend, dan pekerjaan berbasis pengetahuan.
Pokok-Pokok Penting
- Skala & Inovasi: 2,8T parameter, MoE dengan 16/896 expert aktif, Kimi Delta Attention (KDA), Attention Residuals โ efisiensi penskalaan ~2,5x dibanding K2, Kimi K3 - Kimi API Platform
- Performa: Artificial Analysis Intelligence Index ~57 (peringkat 4 besar, di depan Claude Opus 4.8), memimpin Frontend Code Arena, kuat pada Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Secara keseluruhan sedikit di bawah Fable 5/Sol namun mengungguli sebagian besar lainnya; #1 di Arena.ai Frontend Code Arena (Elo 1.679, mengalahkan Fable 5), Arena post di X dan liputan Tom's Hardware.
- Kapabilitas: Vision/video native, konteks 1M untuk repo/kode besar, pengodean berbasis agen, penalaran 3D, pengeditan video, dasbor riset.
- Akses: Langsung via kimi.com, API (model kimi-k3, panduan akses); bobot terbuka segera. Moonshot sementara menghentikan pendaftaran baru Kimi K3 setelah lonjakan permintaan. Integrasi mudah via CometAPI.
- Nilai: Biaya per tugas lebih rendah (~$0,94 dalam beberapa evaluasi), lebih sedikit penolakan, ideal untuk alur kerja Coding/Vision.
Kimi K3 Tech Blog menggambarkan Kimi K3 sebagai "Open Frontier Intelligence, Kimi K3 menandai momen penting dalam demokratisasi AI. Saat lab AI Tiongkok seperti Moonshot mendorong batas meski dengan keterbatasan komputasi, model terbuka ini menantang dominasi frontier tertutup AS dan memberdayakan developer di seluruh dunia."
Apa itu Kimi K3? Model Kelas 3T Terbuka dari Moonshot AI
Moonshot AI, startup berbasis di Beijing, meluncurkan Kimi K3 pada 16 Juli 2026 sebagai model andalannya. Model ini secara eksplisit diposisikan sebagai model terbuka pertama di kisaran 3 triliun parameter, dengan total 2,8 triliun parameter dalam arsitektur sparse Mixture-of-Experts (MoE). Hanya 16 dari 896 expert yang aktif per token, menyeimbangkan skala masif dengan efisiensi.
Ini membangun dari seri Kimi K2 (K2.5, K2.6, dll.), yang sudah mendapatkan traksi untuk pengodean dan multimodalitas. K3 memperkenalkan inovasi arsitektur: Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes), ditambah Stable LatentMoE dan pelatihan sadar kuantisasi (bobot MXFP4, aktivasi MXFP8 dari tahap SFT). Ini menghasilkan efisiensi penskalaan ~2,5x lebih baik dan decoding hingga 6,3x lebih cepat dibanding pendahulunya.
Spesifikasi Kunci ( Kimi K3 Technical Specifications):
- Parameter: Total 2,8T (sparse MoE).
- Jendela Konteks: 1.048.576 token (~1M).
- Modalitas: Pemahaman teks + gambar + video native; keluaran teks.
- Output Maks: Default 131k token, hingga batas konteks.
- Penalaran: Upaya maksimum secara default saat peluncuran; mode lebih rendah/lebih tinggi akan hadir.
- Open Weights: Dijanjikan pada 27 Juli 2026 (lisensi gaya MIT yang dimodifikasi, mengikuti preseden K2).
K3 menargetkan tugas jangka panjang โ bukan hanya jawaban cepat, tetapi menyelesaikan rekayasa kompleks, riset, atau alur kerja agen dengan umpan balik visual ("Vision in the Loop"). Demo termasuk pembuatan compiler GPU otonom (menyaingi Triton), desain chip pada proses 45nm, dan riset astrofisika yang cepat.
Permintaan sudah menekan kapasitas
Respon awal model ini cukup kuat hingga menciptakan tekanan kapasitas. Moonshot memposting di X bahwa permintaan selama 48 jam sebelumnya telah mendorong hingga mendekati batas GPU saat ini dan bahwa langganan baru akan dijeda sementara selagi perusahaan menambah kapasitas. Business Insider melaporkan jeda kapasitas yang sama dan mencatat bahwa pelanggan yang sudah ada tidak terpengaruh.
Ini penting untuk perencanaan produksi. Sebuah model bisa unggul namun tetap mengalami kendala ketersediaan jika permintaan melampaui komputasi. Tim yang mengevaluasi Kimi K3 sebaiknya menghindari ketergantungan pada satu penyedia, memantau latensi dan tingkat error, serta menggunakan perutean fallback melalui penyedia terpadu seperti CometAPI bila memungkinkan.
Tolok Ukur Pengodean: Di mana Kimi K3 Terlihat Terkuat
Profil pengodean Kimi K3 adalah alasan utama developer memberi perhatian. Model ini hampir seri dengan GPT-5.6 Sol di Terminal-Bench 2.1, sedikit unggul atas GPT-5.6 Sol dan Claude Fable 5 pada Program Bench, dan memimpin GPT-5.6 Sol dengan margin berarti pada FrontierSWE. Ia juga melampaui model yang dibandingkan pada SWE Marathon dalam tabel OpenLM.
Hasil frontend di Arena menambah sinyal praktis lain. Arena melaporkan Kimi K3 di 1679 poin pada Frontend Code Arena, di depan Claude Fable 5. Tolok ukur itu penting karena pekerjaan frontend sering dinilai berdasarkan preferensi manusia, bukan hanya unit test. Asisten pengodean yang dapat menghasilkan UI yang bersih dan koheren secara visual dari prompt sangat berharga bagi tim produk, agensi, pembuat SaaS, dan alat internal.
Papan Peringkat Keseluruhan
- Artificial Analysis AI Leaderboard: Debut di #3. Skor Intelligence Index menempatkannya kompetitif (mis., ~57,1 dalam beberapa evaluasi).
- Evaluasi Kerja Pengetahuan Jangka Panjang Privat: Elo 1547 (+732 dari K2.6), hanya di belakang Fable 5.
Tolok Ukur Pengodean & Agen (Dilaporkan Sendiri & Independen)
K3 menonjol di sini, memanfaatkan skala dan arsitekturnya untuk performa agen yang berkelanjutan.
- Frontend Code Arena (Arena.ai): #1 dengan 1.679 poin, mengalahkan Fable 5 dan GPT-5.6 Sol. Unggul dalam preferensi developer buta untuk web dev.
- DeepSWE: 67,3โ67,5 (kuat, dengan harness KimiCode).
- Program Bench: #1 di 77,8.
- SWE Marathon: #1 di 42,0 (beberapa harness).
- Terminal-Bench 2.1: Kompetitif, mendekati GPT-5.6 Sol.
Visi & Multimodal
Pelatihan native (bukan tempelan) menghasilkan hasil yang solid:
- MMMU-Pro: 81,6%
- MathVision: Kompetitif/90-an tinggi dalam beberapa laporan.
- OmniDocBench: 91,1% (memimpin).
Mendukung tangkapan layar, diagram, video untuk tugas loop tertutup seperti penyempurnaan UI atau pengembangan gim.
Tabel Perbandingan: Kimi K3 vs. Model Terdepan (Perkiraan/Disusun dari Laporan; Max Effort Jika Tidak Disebutkan)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Catatan/Sumber |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Lebih rendah | Lebih rendah | Arena.ai |
| DeepSWE | 67,3โ67,5 | Kompetitif | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Dekat | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Lebih tinggi | - | Internal Moonshot |
| Cost per Task (Evals) | ~$0,94 | Lebih tinggi | Lebih tinggi | Independen |
Data bersumber dari blog teknis Moonshot, papan peringkat independen, dan analisis. Hasil dapat bervariasi menurut harness/upaya; selalu verifikasi yang terbaru.
K3 menunjukkan lebih sedikit penolakan pada topik sensitif dan konsistensi kuat dalam alur agen. Uji independen (mis., evaluasi YouTube, Vals AI) mengonfirmasi bahwa ini adalah salah satu model terbuka terkuat untuk pengodean dunia nyata.
Apa yang Bisa Dilakukan Kimi K3? Kapabilitas dalam Pengodean, Visi, dan Lainnya
Pengodean & Rekayasa Berbasis Agen
K3 mempertahankan sesi panjang dengan pengawasan minimal: menavigasi repo masif, menggunakan tool, debug melalui tangkapan layar ("vision in the loop").
Contoh:
- Optimisasi Kernel & Pengembangan Compiler: Membangun MiniTriton (compiler mirip Triton) dari nol, menyaingi stack yang dioptimalkan. Mengoptimalkan kernel GPU secara kompetitif dengan Fable 5.
- Pengembangan Gim: Mengubah konsep/gambar/video menjadi pengalaman 3D/multipemain yang dapat dimainkan dengan penyempurnaan iteratif.
- Desain Chip: Jalankan otonom 48 jam merancang chip nano-model.
- Frontend: Puncaki papan peringkat untuk aplikasi web, tugas full-stack.
Visi & Multimodal
Pemahaman gambar/video native memungkinkan:
- Pengeditan video: Mengedit teaser sendiri dari 56 klip (seleksi, potongan, sinkronisasi, revisi) โ jam kerja dalam hitungan menit.
- Penalaran 3D, motion graphics, dasbor interaktif.
- "Vision in the loop" untuk iterasi kode via tangkapan layar.
Dokumentasi Kimi API menunjukkan input gambar melalui data URL base64 dan input video melalui file yang diunggah yang direferensikan oleh ms://. Mereka juga memperingatkan bahwa URL gambar publik tidak didukung dalam input visi, jadi developer harus mengirim base64 atau referensi file yang diunggah dan membuat konten pesan berupa array objek. Ini adalah detail implementasi penting: jangan menyerialisasi pesan campuran gambar dan teks menjadi satu string biasa.
Kerja Pengetahuan & Riset
Bagi bisnis, inilah area di mana Kimi K3 mungkin lebih berharga daripada chatbot biasa. Model ini dirancang untuk pekerjaan "agen" di mana ia dapat mempertahankan rencana, memanggil alat, memproses hasil antara, dan menghasilkan artefak akhir. Contohnya termasuk laporan riset pasar, asisten pembersihan data, ringkasan kepatuhan, pemeliharaan basis pengetahuan dukungan pelanggan, dan copilot rekayasa internal.
- Menghasilkan laporan setara konsultan, visualisasi interaktif, dasbor (mis., analisis industri ASIC 42 tahun dari ribuan sumber).
- Pipeline ilmiah: Mereproduksi relasi astrofisika, menganalisis gelombang gravitasi dengan sub-agen.
- Widget/Dasbor di Kimi Work untuk tampilan persisten berbasis data.
K3 menjembatani literatur ke kode yang dapat dieksekusi, menghasilkan output setara publikasi secara efisien.
Kimi K3 vs Model Frontier Lain: Perbandingan Praktis
| Model | Kesesuaian terbaik | Kekuatan | Hal yang perlu diperhatikan | Rekomendasi CometAPI |
|---|---|---|---|---|
| Kimi K3 | Pengodean konteks panjang, kerja pengetahuan, agen, penalaran visual | Skala MoE 2,8T, konteks 1M, tolok ukur pengodean dan agen kuat, roadmap bobot terbuka | Tekanan kapasitas di minggu peluncuran, sensitivitas pada riwayat thinking, dukungan vision bervariasi menurut rute | Uji sebagai model andalan untuk pengodean dan konteks panjang |
| GPT-5.6 Sol | Penalaran sulit, pengodean, riset, tugas produksi luas | Profil tolok ukur sangat kuat dan tool yang matang | Harga lebih tinggi di banyak rute | Gunakan sebagai pembanding dan model eskalasi |
| Claude Fable 5 | Penulisan, pengodean, alur kerja agen, tugas berbasis preferensi manusia | UX kuat dan performa frontier luas | Biaya lebih tinggi dan kemungkinan fallback kebijakan pada beberapa tugas | Bandingkan untuk agen berorientasi pengguna dan aplikasi penulisan |
| Claude Opus 4.8 | Penalaran mendalam dan pekerjaan profesional yang andal | Perilaku asisten kelas atas yang stabil | Lebih lama dibanding rilis flagship terbaru | Simpan sebagai fallback atau baseline tolok ukur |
| GLM-5.2 | Evaluasi model terbuka yang sensitif biaya | Alternatif model terbuka yang kompetitif | Lebih lemah di beberapa perbandingan K3 yang disebutkan | Sertakan dalam uji perutean biaya/kinerja |
Cara Mengakses Kimi K3: Panduan Langkah demi Langkah
- Web/Aplikasi: Kunjungi kimi.com atau unduh aplikasi Kimi (iOS/Android). Pilih K3 (K3 Max atau Swarm Max).
- Kimi Code: Berfokus pada Terminal/IDE untuk developer. Hebat untuk agen pengodean.
- Akses API:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- Dapatkan API key di platform.moonshot.ai/console.
- Contoh SDK kompatibel OpenAI (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Mendukung tools, mode JSON, context caching. Harga: $3 input, $15 output per M token (cache $0,30).
- Aggregator: Gunakan CometAPI (cometapi.com) untuk akses terpadu ke Kimi K3 + 500+ model dengan satu key, biaya lebih rendah (hemat 20โ40%), dan switching yang mudah. Sempurna untuk produksi โ kompatibel OpenAI drop-in, latensi rendah.
- Self-Hosting: Setelah rilis bobot 27 Juli di Hugging Face. Harapkan kebutuhan hardware berat (supernode, 64+ akselerator direkomendasikan). Tool komunitas seperti vLLM akan menyusul.
Rekomendasi CometAPI: Integrasikan Kimi K3 via CometAPI untuk menghindari banyak key/penagihan. Uji berdampingan dengan Claude/GPT untuk A/B, optimalkan biaya, dan skala secara andal. Dasbor mereka melacak penggunaan lintas model โ ideal untuk memantau eksperimen K3. Daftar di cometapi.com untuk kredit gratis dan akses terpadu.
Putusan Akhir
Kimi K3 adalah salah satu peluncuran model terpenting tahun 2026 sejauh ini. Ia menggabungkan skala besar, strategi open-weight yang serius, jendela konteks 1M, pemahaman visual native, dan hasil tolok ukur yang menempatkannya di dekat puncak sistem AI pengodean dan agen saat ini. Ini tidak menghapus kebutuhan akan GPT, Claude, Gemini, DeepSeek, Qwen, atau model lain, tetapi memberi developer opsi baru yang kredibel untuk alur kerja konteks panjang yang paling sulit.
Mulai hari ini di kimi.com atau melalui CometAPI untuk integrasi tanpa repot. Eksperimenkan dengan kekuatan pengodean dan visinya โ hasilnya berbicara sendiri.
