TLDR: Moonshot AI merilis Kimi K3 pada 16 Juli 2026 – model open-weights terobosan dengan 2,8 triliun parameter (pertama di kelas 3T) yang mendukung multimodalitas native, konteks 1 juta token, dan kinerja frontier yang menandingi atau melampaui model proprietari teratas seperti Claude Fable 5 dan GPT-5.6 Sol dalam coding, tugas agentik, pengembangan frontend, dan pekerjaan berbasis pengetahuan.
Poin-Poin Utama
- Skala & Inovasi: 2,8T parameter, MoE dengan 16/896 expert aktif, Kimi Delta Attention (KDA), Attention Residuals – efisiensi penskalaan ~2,5x dibanding K2, Kimi K3 - Kimi API Platform
- Performa: Artificial Analysis Intelligence Index ~57 (peringkat 4 teratas, di depan Claude Opus 4.8), memimpin Frontend Code Arena, kuat di Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Masih di belakang Fable 5/Sol secara keseluruhan namun mengalahkan sebagian besar lainnya; peringkat 1 di Arena.ai Frontend Code Arena (Elo 1.679, mengungguli Fable 5), posting Arena di X dan liputan Tom's Hardware.
- Kapabilitas: Vision/video native, konteks 1M untuk repo/kode besar, agentic coding, penalaran 3D, penyuntingan video, dashboard riset.
- Akses: Langsung via kimi.com, API (model kimi-k3, panduan akses); bobot terbuka segera hadir. Moonshot sementara menghentikan langganan baru Kimi K3 setelah lonjakan permintaan. Integrasi mudah melalui CometAPI.
- Nilai: Biaya per tugas lebih rendah (~$0,94 pada beberapa evaluasi), lebih sedikit penolakan, ideal untuk alur kerja coding/Vision.
Kimi K3 Tech Blog menggambarkan Kimi K3 sebagai "Open Frontier Intelligence, Kimi K3 menandai momen penting dalam demokratisasi AI. Ketika lab AI Tiongkok seperti Moonshot mendorong batas meski ada kendala komputasi, model terbuka ini menantang dominasi frontier tertutup AS dan memberdayakan developer di seluruh dunia.
Apa itu Kimi K3? Model Kelas 3T Terbuka dari Moonshot AI
Moonshot AI, startup berbasis di Beijing, meluncurkan Kimi K3 pada 16 Juli 2026 sebagai model andalannya. Model ini secara eksplisit diposisikan sebagai model terbuka pertama di kisaran ~3 triliun parameter, dengan total 2,8 triliun parameter dalam arsitektur Mixture-of-Experts (MoE) sparse. Hanya 16 dari 896 expert yang aktif per token, menyeimbangkan skala masif dengan efisiensi.
Ini dibangun di atas seri Kimi K2 (K2.5, K2.6, dll.) yang telah mendapat perhatian untuk coding dan multimodalitas. K3 memperkenalkan inovasi arsitektural: Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes), plus Stable LatentMoE dan pelatihan yang menyadari kuantisasi (bobot MXFP4, aktivasi MXFP8 sejak tahap SFT). Hasilnya ~2,5x efisiensi penskalaan lebih baik dan hingga 6,3x decoding lebih cepat dibanding pendahulunya.
Spesifikasi Kunci (Spesifikasi Teknis Kimi K3):
- Parameter: Total 2,8T (sparse MoE).
- Jendela Konteks: 1.048.576 token (~1M).
- Modalitas: Pemahaman teks + gambar + video native; keluaran teks.
- Output Maks: Default 131k token, hingga batas konteks.
- Penalaran: Upaya maksimum secara default saat peluncuran; mode lebih rendah/lebih tinggi akan hadir.
- Bobot Terbuka: Dijanjikan sebelum 27 Juli 2026 (MIT-style yang dimodifikasi, mengikuti preseden K2).
K3 menargetkan tugas horizon panjang — bukan sekadar jawaban cepat, tetapi menyelesaikan rekayasa kompleks, riset, atau alur kerja agen dengan umpan balik visual ("Vision in the Loop"). Demo mencakup pembangunan compiler GPU otonom (menyaingi Triton), desain chip pada proses 45nm, dan riset astrofisika cepat.
Permintaan sudah menekan kapasitas
Respon awal model sangat kuat hingga menciptakan tekanan kapasitas. Moonshot memposting di X bahwa permintaan selama 48 jam sebelumnya mendorong ke batas GPU saat ini dan langganan baru akan dihentikan sementara sambil menambah kapasitas. Business Insider melaporkan jeda kapasitas yang sama dan mencatat bahwa pelanggan yang ada tidak terpengaruh.
Ini penting bagi perencanaan produksi. Sebuah model bisa sangat baik namun tetap menghadapi kendala ketersediaan jika permintaan melebihi komputasi. Tim yang mengevaluasi Kimi K3 sebaiknya menghindari ketergantungan pada satu penyedia, memantau latensi dan tingkat error, dan menggunakan rute fallback melalui penyedia terpadu seperti CometAPI bila memungkinkan.
Tolok Ukur Coding: Di Mana Kimi K3 Paling Menonjol
Profil coding Kimi K3 adalah alasan utama developer memberi perhatian. Model ini hampir setara dengan GPT-5.6 Sol di Terminal-Bench 2.1, unggul tipis atas GPT-5.6 Sol dan Claude Fable 5 di Program Bench, dan memimpin GPT-5.6 Sol dengan margin berarti di FrontierSWE. Ia juga melampaui model yang dibandingkan pada SWE Marathon di tabel OpenLM.
Hasil frontend di Arena menambah sinyal praktis lain. Arena melaporkan Kimi K3 pada 1.679 poin di Frontend Code Arena, di depan Claude Fable 5. Tolok ukur itu penting karena pekerjaan frontend sering dinilai berdasarkan preferensi manusia, bukan sekadar unit test. Asisten coding yang dapat menghasilkan UI yang bersih dan koheren secara visual dari sebuah prompt sangat berharga bagi tim produk, agensi, pembuat SaaS, dan alat internal.
Papan Peringkat Keseluruhan
- Artificial Analysis AI Leaderboard: Debut di #3. Skor Intelligence Index menempatkannya kompetitif (mis., ~57,1 pada beberapa evaluasi).
- Evaluasi Pekerjaan Pengetahuan Horizon Panjang Privat: Elo 1547 (+732 dari K2.6), hanya di belakang Fable 5.
Tolok Ukur Coding & Agentik (Self-Reported & Independen)
K3 bersinar di sini, memanfaatkan skala dan arsitekturnya untuk performa agentik berkelanjutan.
- Frontend Code Arena (Arena.ai): #1 dengan 1.679 poin, mengalahkan Fable 5 dan GPT-5.6 Sol. Unggul dalam preferensi developer buta untuk pengembangan web.
- DeepSWE: 67,3–67,5 (kuat, dengan harness KimiCode).
- Program Bench: #1 di 77,8.
- SWE Marathon: #1 di 42,0 (beberapa harness).
- Terminal-Bench 2.1: Kompetitif, dekat GPT-5.6 Sol.
Vision & Multimodal
Pelatihan native (bukan tempelan) menghasilkan hasil solid:
- MMMU-Pro: 81,6%
- MathVision: Kompetitif/90-an tinggi dalam beberapa laporan.
- OmniDocBench: 91,1% (memimpin).
Mendukung tangkapan layar, diagram, video untuk tugas loop tertutup seperti penyempurnaan UI atau pengembangan game.
Tabel Perbandingan: Kimi K3 vs. Model Terdepan (Perkiraan/Disusun dari Laporan; Max Effort jika disebut)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Catatan/Sumber |
|---|---|---|---|---|
| Frontend Code Arena | 1.679 (#1) | Lebih rendah | Lebih rendah | Arena.ai |
| DeepSWE | 67,3–67,5 | Kompetitif | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Dekat | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Lebih tinggi | - | Internal Moonshot |
| Cost per Task (Evals) | ~$0,94 | Lebih tinggi | Lebih tinggi | Independen |
Data diambil dari blog teknis Moonshot, papan peringkat independen, dan analisis. Hasil dapat bervariasi menurut harness/effort; selalu verifikasi yang terbaru.
K3 menunjukkan lebih sedikit penolakan pada topik sensitif dan konsistensi kuat dalam alur agentik. Uji independen (mis., evaluasi YouTube, Vals AI) mengonfirmasi bahwa ini adalah salah satu model terbuka terkuat untuk coding dunia nyata.
Apa yang Dapat Dilakukan Kimi K3? Kapabilitas di Coding, Vision, dan Lainnya
Coding & Rekayasa Agentik
K3 mempertahankan sesi panjang dengan pengawasan minimal: menavigasi repo besar, menggunakan tool, debugging via tangkapan layar ("vision in the loop").
Contoh:
- Optimisasi Kernel & Pengembangan Compiler: Membangun MiniTriton (compiler mirip Triton) dari nol, menandingi stack yang dioptimalkan. Mengoptimalkan kernel GPU secara kompetitif dengan Fable 5.
- Pengembangan Game: Mengubah konsep/gambar/video menjadi pengalaman 3D/multiplayer yang dapat dimainkan dengan penyempurnaan iteratif.
- Desain Chip: Run otonom 48 jam merancang chip nano-model.
- Frontend: Memuncaki papan untuk aplikasi web, tugas full-stack.
Vision & Multimodal
Pemahaman gambar/video native memungkinkan:
- Penyuntingan video: Mengedit teaser sendiri dari 56 klip (seleksi, potongan, sinkronisasi, revisi) – pekerjaan berjam-jam dalam hitungan menit.
- Penalaran 3D, motion graphics, dashboard interaktif.
- "Vision in the loop" untuk iterasi kode via tangkapan layar.
Dokumentasi Kimi API menunjukkan input gambar melalui data URL base64 dan input video melalui file yang diunggah yang direferensikan oleh skema ms://. Mereka juga memperingatkan bahwa URL gambar publik tidak didukung dalam input vision, sehingga developer harus mengirim base64 atau referensi file yang diunggah dan menjadikan konten pesan sebagai array objek. Ini detail implementasi penting: jangan serialisasi pesan yang mencampur gambar dan teks menjadi satu string biasa.
Pekerjaan Pengetahuan & Riset
Bagi bisnis, inilah area di mana Kimi K3 mungkin lebih berharga daripada chatbot biasa. Model ini dirancang untuk pekerjaan "agentik" di mana ia dapat mempertahankan rencana, memanggil tool, memproses hasil antara, dan menghasilkan artefak akhir. Contoh termasuk laporan riset pasar, asisten pembersihan data, ringkasan kepatuhan, pemeliharaan basis pengetahuan dukungan pelanggan, dan copilot rekayasa internal.
- Menghasilkan laporan setingkat konsultan, visualisasi interaktif, dashboard (mis., analisis industri ASIC 42 tahun dari ribuan sumber).
- Pipeline ilmiah: Mereproduksi relasi astrofisika, menganalisis gelombang gravitasi dengan sub-agent.
- Widget/Dashboard di Kimi Work untuk tampilan persisten berbasis data.
K3 menjembatani literatur ke kode yang dapat dieksekusi, menghasilkan output setara publikasi dengan efisien.
Kimi K3 vs Model Frontier Lain: Perbandingan Praktis
| Model | Kesesuaian terbaik | Kekuatan | Hal yang perlu diwaspadai | Rekomendasi CometAPI |
|---|---|---|---|---|
| Kimi K3 | Coding konteks panjang, pekerjaan pengetahuan, agen, visi | Skala MoE 2,8T, konteks 1M, tolok ukur coding dan agentik kuat, roadmap open-weight | Tekanan kapasitas saat minggu peluncuran, sensitif terhadap riwayat pemikiran, dukungan vision bisa bervariasi menurut rute | Uji sebagai model andalan untuk coding & konteks panjang |
| GPT-5.6 Sol | Penalaran berat, coding, riset, tugas produksi luas | Profil tolok ukur sangat kuat dan tooling matang | Harga lebih tinggi di banyak rute | Gunakan sebagai pembanding dan model eskalasi |
| Claude Fable 5 | Penulisan, coding, alur kerja agentik, tugas preferensi manusia | UX kuat dan performa frontier luas | Biaya lebih tinggi dan kemungkinan fallback kebijakan pada beberapa tugas | Bandingkan untuk agen berhadapan pengguna dan app berfokus penulisan |
| Claude Opus 4.8 | Penalaran mendalam dan kerja profesional yang andal | Perilaku asisten kelas atas yang stabil | Lebih lama dibanding rilis flagship terbaru | Simpan sebagai fallback atau baseline tolok ukur |
| GLM-5.2 | Evaluasi model terbuka yang sensitif biaya | Alternatif model terbuka yang kompetitif | Lebih lemah pada beberapa perbandingan K3 yang tercantum | Sertakan dalam uji rute biaya/kinerja |
Cara Mengakses Kimi K3: Panduan Langkah demi Langkah
Cara Mengakses Kimi K3
1. Akses Kimi K3 melalui produk Kimi
Rute non-developer termudah adalah melalui produk konsumen dan produktivitas Kimi: web Kimi, aplikasi, Kimi Work, dan Kimi Code. Ini cara tercepat untuk menguji perilaku model dalam penulisan, coding, riset, dan orientasi UI tanpa membangun integrasi terlebih dulu. Jeda langganan sementara yang dilaporkan pada 20 Juli berarti akses dapat bervariasi, jadi periksa halaman produk Kimi saat ini sebelum merencanakan peluncuran tim.
2. Akses Kimi K3 melalui Platform API Kimi
Developer dapat memanggil Kimi K3 melalui Platform API Kimi menggunakan klien gaya OpenAI. Dokumen Moonshot mencantumkan:
- base URL:
https://api.moonshot.ai/v1 - model ID:
kimi-k3 - environment variable dalam contoh:
MOONSHOT_API_KEY - Persyaratan SDK Python: OpenAI SDK 1.0 atau yang lebih baru
Contoh Python dasar:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 selalu mengaktifkan thinking mode dan mendukung nilai reasoning_effort low, high, dan max, dengan max sebagai default. API mendukung streaming, keluaran terstruktur dengan skema JSON ketat, Partial Mode, pemanggilan tool, pemuatan tool dinamis, caching konteks otomatis, dan integrasi tool resmi melalui Formula. Dokumen juga mencantumkan beberapa batas penting: max_completion_tokens default 131.072 dan dapat diatur hingga 1.048.576; temperature dan top-p tetap; developer harus mengembalikan pesan asisten lengkap dalam alur multi-turn dan tool-call; dan web search sedang diperbarui, sehingga tidak direkomendasikan untuk penggunaan produksi dalam waktu dekat.
3. Akses Kimi K3 melalui CometAPI
Bagi banyak tim, CometAPI adalah rute paling praktis karena menyediakan lapisan API terpadu di banyak penyedia model. Halaman Kimi K3 CometAPI mencantumkan model sebagai live dengan:
- model ID:
kimi-k3 - provider: Moonshot AI
- jendela konteks: hingga 1.000.000 token
- harga CometAPI: $2,4 input dan $12 output per 1M tokens
- harga resmi tercantum: $3 input dan $15 output per 1M tokens
- endpoint:
/v1/chat/completions - base URL:
https://api.cometapi.com/v1
Contoh Python CometAPI:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
Jika aplikasi Anda sudah menggunakan OpenAI SDK, quickstart CometAPI merekomendasikan hanya mengubah dua pengaturan: set base_url ke https://api.cometapi.com/v1 dan gunakan COMETAPI_KEY alih-alih kunci penyedia sebelumnya. Setelah itu, masukkan CometAPI model ID di field model.
4. Akses bobot terbuka Kimi K3 setelah rilis
Moonshot menyatakan bobot penuh Kimi K3 akan dirilis sebelum 27 Juli 2026. Setelah itu, peneliti, tim infrastruktur, dan pengguna enterprise tingkat lanjut dapat mengevaluasi self-hosting, optimisasi, atau deployment privat. Bagi sebagian besar perusahaan, pertanyaan kuncinya adalah ekonomi: modelnya terbuka, tetapi melayani sistem MoE 2,8T memerlukan infrastruktur GPU yang serius, rekayasa inference, dan pemantauan operasional.
Kesimpulan Akhir
Kimi K3 adalah salah satu peluncuran model terpenting tahun 2026 sejauh ini. Ia menggabungkan skala besar, strategi open-weight yang serius, jendela konteks 1M token, pemahaman visual native, dan hasil tolok ukur yang menempatkannya di dekat puncak sistem AI coding dan agentik saat ini. Ini tidak menghapus kebutuhan akan GPT, Claude, Gemini, DeepSeek, Qwen, atau model lain, tetapi memberi developer opsi baru yang kredibel untuk alur kerja konteks panjang yang paling sulit.
Mulai hari ini di kimi.com atau melalui CometAPI untuk integrasi yang mudah. Eksperimenlah dengan kekuatan coding dan vision-nya – hasilnya berbicara sendiri.
