TL;DR
Kimi K3 berharga $0.30 per 1M token input cache-hit, $3.00 per 1M token input cache-miss, dan $15.00 per 1M token output, dengan jendela konteks 1,048,576 token.
Dibandingkan dengan K2.7 Code, K3 secara signifikan lebih mahal per token, tetapi menawarkan jendela konteks 4ร lebih besar ditambah vision native dan dukungan yang lebih kuat untuk beban kerja agen berjangka panjang.
Intinya: K2.7 Code tetap menjadi pilihan yang lebih ekonomis untuk tugas pengkodean rutin dalam konteks 256K. Gunakan K3 saat Anda memerlukan konteks lebih besar, kemampuan multimodal, atau sebagai rute eskalasi untuk tugas yang tidak dapat diselesaikan K2.7 secara andal.
Sekilas Harga API Kimi K3
| Item | Kimi K3 |
|---|---|
| API model ID | kimi-k3 |
| Cache-hit input | $0.30 / 1M tokens |
| Cache-miss input | $3.00 / 1M tokens |
| Output | $15.00 / 1M tokens |
| Context window | 1,048,576 tokens |
| Reasoning | Selalu diaktifkan |
| Supported reasoning effort | hanya max |
| Default maximum completion | 131,072 tokens |
| Configurable maximum completion | Hingga 1,048,576 tokens, bergantung pada batas konteks total |
| Key capabilities | Vision native, pemanggilan tool, output terstruktur, Partial Mode, pemuatan tool dinamis, caching konteks otomatis |
| Batch API | K3 saat ini tidak tercantum di antara model Batch yang didukung |
Lihat Kimi K3 quickstart dari Moonshot untuk parameter API dan detail integrasi terbaru.
Apa yang Ditambahkan Kimi K3 Dibanding K2.7 Code
Peningkatan paling jelas adalah panjang konteks.
K2.7 Code mendukung 262,144 token, sedangkan K3 meningkatkan batas tersebut menjadi 1,048,576 token. Ini membuat K3 lebih praktis untuk repositori besar, riwayat agen panjang, dokumentasi ekstensif, dan alur kerja yang sebaliknya memerlukan pengurangan konteks.
K3 juga mendukung:
- pemahaman visual native
- output terstruktur yang ketat
tool_choice- pemuatan tool dinamis
- caching konteks otomatis
- alur kerja pengkodean dan knowledge-work jangka panjang
Blog teknis Kimi K3 dari Moonshot melaporkan 88.3 pada Terminal-Bench 2.1, 77.8 pada Program Bench, dan 81.2 pada FrontierSWE.
Ini adalah tolok ukur yang dilaporkan penyedia dan sebaiknya diperlakukan sebagai alasan untuk mengevaluasi K3โbukan jaminan bahwa model ini akan mengungguli K2.7 Code pada setiap beban kerja produksi.
Untuk latar belakang generasi sebelumnya, lihat panduan API Kimi K2 dari CometAPI.
Perbandingan Harga Kimi K3 vs Kimi K2.7 Code
| Model | Cache-hit input | Cache-miss input | Output | Context |
|---|---|---|---|---|
| kimi-k3 | $0.30 / 1M | $3.00 / 1M | $15.00 / 1M | 1,048,576 |
| kimi-k2.7-code | $0.19 / 1M | $0.95 / 1M | $4.00 / 1M | 262,144 |
| kimi-k2.7-code-highspeed | $0.38 / 1M | $1.90 / 1M | $8.00 / 1M | 262,144 |
Tarif K2.7 berasal dari dokumentasi harga resmi Kimi K2.7 Code milik Moonshot.
Dibandingkan K2.7 Code standar, K3 adalah:
- 1,58ร harga untuk input cache-hit
- 3,16ร harga untuk input cache-miss
- 3,75ร harga untuk output
Premium K3 lebih kecil relatif terhadap K2.7 Code HighSpeed, tetapi kedua model menargetkan prioritas berbeda: HighSpeed berfokus pada output pengkodean yang lebih cepat, sedangkan K3 ditujukan untuk beban kerja konteks panjang dan agen yang lebih menuntut.
Dokumentasi harga Batch API Moonshot saat ini tidak mencantumkan K3, jadi jangan mengasumsikan diskon Batch yang berlaku untuk model Kimi lainnya juga berlaku di sini.
Caching Konteks Kimi K3: Cara Kerja Diskon Input 90%
K3 mendukung caching konteks otomatis.
Pengembang tidak perlu membuat cache ID atau TTL secara manual. Menjaga prefiks besar tetap stabil di banyak permintaan memberi peluang permintaan berikutnya menerima tarif cache-hit.
Perbedaan harga adalah:
- Cache miss: $3.00 / 1M token input
- Cache hit: $0.30 / 1M token input
Jadi token input cache-hit berharga 90% lebih murah daripada token input cache-miss.
Namun, output tetap dihargai $15 per juta token, sehingga total biaya permintaan tidak turun 90%.
Sebagai contoh, asumsi:
- 600,000 token input
- 20,000 token output
| Status cache | Biaya input | Biaya output | Total |
|---|---|---|---|
| Semua input cache miss | $1.80 | $0.30 | $2.10 |
| Semua input cache hit | $0.18 | $0.30 | $0.48 |
Dalam kasus yang disederhanakan ini, total biaya turun sekitar 77%.
Penghematan aktual bergantung pada porsi token input yang menerima tarif cache-hit.
Contoh: Berapa Biaya Tugas Pengkodean di K3 vs K2.7
Asumsikan sebuah tugas pengkodean menggunakan:
- 200,000 token input
- 20,000 token output
| Rute | Total dingin | Total sepenuhnya cache |
|---|---|---|
| kimi-k3 | $0.90 | $0.36 |
| kimi-k2.7-code | $0.27 | $0.12 |
| kimi-k2.7-code-highspeed | $0.54 | $0.24 |
Untuk beban kerja ini, K3 berbiaya sekitar 3,33ร lebih mahal daripada K2.7 Code standar pada permintaan dingin.
Di dalam K3 sendiri, beralih dari seluruh input cache-miss ke input sepenuhnya cache mengurangi estimasi biaya permintaan dari $0.90 menjadi $0.36, penurunan 60% dalam contoh ini.
Namun biaya per permintaan hanyalah bagian dari persamaan.
Biaya per Tugas Berhasil = Total Pengeluaran Alur Kerja รท Tugas yang Lulus Pemeriksaan Penerimaan
Perbandingan produksi juga harus mencakup percobaan ulang, pemanggilan fallback, eksekusi tool, dan waktu tinjauan manusia.
Satu permintaan K3 yang langsung berhasil bisa lebih ekonomis daripada beberapa upaya yang lebih murah namun gagal.
Kasus Tepi Dunia Nyata: Biaya Token Penalaran
K3 selalu menggunakan penalaran, jadi konsumsi token output dapat menjadi bagian tagihan yang bermakna.
Dalam uji peluncuran hari pertama oleh Simon Willison, sebuah prompt yang meminta K3 menghasilkan SVG mengonsumsi 13,241 token penalaran sebelum menghasilkan 3,417 token respons, dengan total biaya sekitar $0.25.
Ini adalah uji satu prompt informal, bukan tolok ukur, tetapi menyoroti pertimbangan biaya penting: jawaban akhir yang terlihat mungkin hanya mewakili sebagian dari output yang ditagihkan.
Karena K3 saat ini hanya mendukung upaya penalaran maksimum, tim harus mengukur penggunaan token output aktual pada beban kerja mereka sendiri.
Default yang Lebih Baik: K2.7 Terlebih Dahulu, K3 Saat Eskalasi
Untuk beban kerja pengkodean campuran, perutean dapat lebih ekonomis daripada mengirim setiap permintaan langsung ke K3.
Strategi sederhana:
Start with K2.7 Code
โ
Task exceeds 256K context?
โ Yes: use K3
โ No
Run task and validation
โ
Validation failed?
โ Yes: escalate to K3
โ No
Return result
Menggunakan contoh sebelumnya:
- K2.7 Code berbiaya $0.27 per percobaan dingin
- K3 berbiaya $0.90
- K2.7 berhasil menyelesaikan 70% tugas
- 30% dicoba ulang sekali di K3
Rata-rata biaya menjadi:
$0.27 + (30% ร $0.90) = $0.54 per task
Mengirim setiap tugas langsung ke K3 akan berbiaya $0.90 per tugas dengan asumsi token yang sama.
Itu membuat strategi perutean 40% lebih murah dalam skenario yang disederhanakan ini.
Penghematan tepat akan bervariasi, tetapi prinsipnya berguna: rute pekerjaan rutin ke model yang lebih murah dan eskalasi saat kemampuan tambahan benar-benar diperlukan.
Kapan Kimi K3 Layak Di-upgrade?
K3 paling menarik saat:
- Kebutuhan konteks melebihi batas 262,144 token K2.7 Code.
- Tugas menggabungkan kode dengan input visual.
- Agen jangka panjang perlu bekerja di repositori besar dan tool eksternal.
- K2.7 memerlukan percobaan ulang atau panggilan fallback yang sering.
- Tugas cukup bernilai sehingga kualitas penyelesaian lebih penting daripada meminimalkan biaya panggilan pertama.
K2.7 Code tetap merupakan opsi kuat untuk tugas pengkodean yang repetitif dan terdefinisi dengan baik yang sudah mencapai tingkat keberhasilan tinggi dalam konteks 256K.
Untuk aplikasi pengkodean yang sensitif terhadap latensi, K2.7 Code HighSpeed juga harus diuji secara terpisah.
Migrasi dari K2.7 ke K3: Lima Pemeriksaan Teknis
-
Penalaran K3 Saat Ini Tidak Dapat Dikurangi
K3 selalu melakukan penalaran, dan API saat ini hanya mendukung:
reasoning_effort="max"
Karena max adalah default, parameter tersebut juga dapat dihilangkan.
-
Hapus Parameter
thinkingKhusus K2
Jangan gunakan parameter thinking K2.x dengan K3.
Gunakan field reasoning_effort di tingkat atas sebagai gantinya.
-
Abaikan Parameter Sampling Tetap
K3 saat ini menggunakan nilai tetap untuk parameter termasuk:
temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0
Moonshot merekomendasikan untuk menghilangkan field ini daripada menimpanya.
-
Pertahankan Pesan Asisten Secara Lengkap
Untuk percakapan multi-giliran dan loop pemanggilan tool, teruskan pesan asisten lengkap ke permintaan berikutnya daripada hanya mempertahankan content yang terlihat.
-
Validasi Vision dan Search Sebelum Produksi
API vision K3 saat ini tidak mendukung URL gambar publik secara langsung. Gunakan format gambar yang didukung seperti data base64 atau mekanisme referensi file dari Moonshot.
Moonshot juga menyarankan untuk tidak mengandalkan fungsionalitas Web Search saat ini untuk penggunaan produksi jangka pendek saat fitur tersebut sedang diperbarui.
Contoh API Kimi K3 dalam Python
K3 dapat dipanggil melalui antarmuka API yang kompatibel dengan OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are an expert software engineer.",
},
{
"role": "user",
"content": "Analyze this repository logic and identify potential issues.",
},
],
reasoning_effort="max", # Optional while "max" is the default
)
assistant_message = response.choices[0].message
print(assistant_message)
Hindari menimpa parameter sampling tetap milik K3. Untuk alur kerja multi-giliran dan pemanggilan tool, pertahankan pesan asisten secara lengkap.
Cara Mengevaluasi Kimi K3 Sebelum Upgrade
Uji K3 pada beban kerja nyata, bukan prompt tolok ukur saja.
Set evaluasi yang praktis dapat mencakup:
- penyuntingan repositori rutin
- tugas yang mendekati batas konteks 256K
- tugas yang melebihi 256K
- tugas rekayasa visual
- tugas agenik atau knowledge-work berjangka panjang
Bandingkan K3, K2.7 Code, dan K2.7 Code HighSpeed jika relevan.
Lacak:
- tingkat keberhasilan tugas
- token input yang ter-cache dan tidak ter-cache
- token output dan penalaran
- percobaan ulang dan panggilan fallback
- latensi p50 dan p95
- error pemanggilan tool
- waktu tinjauan manusia
- biaya per tugas yang berhasil
Lalu bandingkan tiga kebijakan:
- Semua K2.7 Code
- Semua K3
- K2.7 Code dengan eskalasi ke K3
Rute terbaik adalah yang memenuhi persyaratan kualitas dan latensi Anda pada biaya per tugas berhasil yang terendah.
Harga Kimi K3 di CometAPI
Perhitungan di atas menggunakan harga API resmi Moonshot AI untuk menjaga perbandingan K3 dan K2.7 tetap konsisten.
Pada saat publikasi, Kimi K3 di CometAPI dihargai 20% lebih rendah daripada tarif API standar Moonshot AI:
| Rute | Input | Output |
|---|---|---|
| Moonshot AI | $3.00 / 1M | $15.00 / 1M |
| CometAPI | $2.40 / 1M | $12.00 / 1M |
Karena harga API dapat berubah, periksa halaman model live sebelum menggunakan angka ini untuk penganggaran produksi.
API yang kompatibel dengan OpenAI dari CometAPI memudahkan pengujian kimi-k3 bersama rute model lainnya menggunakan prompt dan alur evaluasi yang sama.
Siap menguji Kimi K3? Lihat Kimi K3 di CometAPI dan bandingkan harga sebelum membawanya ke produksi.
Untuk contoh integrasi dan evaluasi, lihat CometAPI Cookbook di GitHub.
FAQ
Berapa biaya API Kimi K3?
Moonshot AI mencantumkan Kimi K3 pada $0.30 per 1 juta token input cache-hit, $3.00 per 1 juta token input cache-miss, dan $15.00 per 1 juta token output.
ID model API adalah kimi-k3.
Apakah Kimi K3 lebih murah daripada Kimi K2.7 Code?
Tidak. Berdasarkan tarif resmi Moonshot, K3 kira-kira 3,16ร harga untuk input cache-miss dan 3,75ร harga untuk output.
Model ini masih dapat menurunkan biaya alur kerja jika meningkatkan keberhasilan tugas atau mengurangi percobaan ulang.
Apakah Kimi K3 memiliki jendela konteks 1M token?
Ya. Kimi K3 mendukung jendela konteks 1,048,576 token, dibandingkan 262,144 token untuk Kimi K2.7 Code.
Apakah Kimi K3 mendukung caching konteks otomatis?
Ya. Caching konteks bersifat otomatis. Token input cache-hit berharga $0.30 per juta dibandingkan $3.00 per juta untuk token input cache-miss.
Bisakah saya mematikan penalaran Kimi K3 untuk mengurangi biaya?
Saat ini tidak bisa. K3 selalu menggunakan penalaran, dan reasoning_effort="max" adalah satu-satunya tingkat upaya penalaran yang didukung.
Penutup
Kimi K3 menawarkan konteks yang jauh lebih besar dan kemampuan lebih luas daripada K2.7 Code, namun dengan harga token yang lebih tinggi.
Untuk pengkodean rutin dalam konteks 256K, K2.7 Code biasanya pilihan yang lebih ekonomis. Untuk tugas konteks panjang, multimodal, atau agen yang sulit, K3 dapat membenarkan preminyaโterutama saat meningkatkan keberhasilan penyelesaian.
Bagi banyak sistem produksi, strategi paling efisien bukan mengganti K2.7 sepenuhnya, melainkan menggunakan K2.7 sebagai default dan K3 sebagai rute eskalasi.
Metrik yang paling penting pada akhirnya bukan biaya per panggilan API, melainkan biaya per tugas yang berhasil.
