TL;DR
Kimi K3 berharga $0.30 bagi setiap 1M token input cache hit, $3.00 bagi setiap 1M token input cache miss, dan $15.00 bagi setiap 1M token output, dengan tetingkap konteks 1,048,576 token.
Dibandingkan dengan K2.7 Code, K3 jauh lebih mahal setiap token, tetapi menawarkan tetingkap konteks 4ร lebih besar serta pemahaman visual asli dan sokongan yang lebih kukuh untuk beban kerja beragen jangka panjang.
Kesimpulan: K2.7 Code kekal pilihan yang lebih menjimatkan untuk tugas pengaturcaraan rutin dalam 256K konteks. Gunakan K3 apabila anda memerlukan konteks lebih besar, keupayaan multimodal, atau sebagai laluan eskalasi bagi tugasan yang K2.7 tidak dapat siapkan dengan boleh dipercayai.
Kimi K3 API Pricing at a Glance
| Perkara | Kimi K3 |
|---|---|
| API model ID | kimi-k3 |
| Cache-hit input | $0.30 / 1M tokens |
| Cache-miss input | $3.00 / 1M tokens |
| Output | $15.00 / 1M tokens |
| Context window | 1,048,576 tokens |
| Reasoning | Sentiasa didayakan |
| Supported reasoning effort | hanya maksimum |
| Default maximum completion | Had maksimum penjanaan lalai |
| Configurable maximum completion | Sehingga 1,048,576 token, tertakluk pada had konteks keseluruhan |
| Key capabilities | Pemahaman visual asli, panggilan alat, output berstruktur, Partial Mode, pemuatan alat dinamik, caching konteks automatik |
| Batch API | K3 kini tidak tersenarai dalam model Batch yang disokong |
Rujuk Kimi K3 quickstart Moonshot untuk parameter API semasa dan butiran integrasi.
What Kimi K3 Adds Over K2.7 Code
Peningkatan paling ketara ialah panjang konteks.
K2.7 Code menyokong 262,144 token, manakala K3 meningkatkan had tersebut kepada 1,048,576 token. Ini menjadikan K3 lebih praktikal untuk repositori besar, sejarah ejen yang panjang, dokumentasi yang meluas, dan aliran kerja yang jika tidak memerlukan pengurangan konteks.
K3 juga menyokong:
- pemahaman visual asli
- output berstruktur yang ketat
tool_choice- pemuatan alat dinamik
- caching konteks automatik
- aliran kerja pengaturcaraan dan kerja pengetahuan jangka panjang
Kimi K3 technical blog Moonshot melaporkan 88.3 pada Terminal-Bench 2.1, 77.8 pada Program Bench, dan 81.2 pada FrontierSWE.
Ini ialah penanda aras yang dilaporkan oleh penyedia dan harus dianggap sebagai sebab untuk menilai K3โbukan jaminan bahawa ia akan mengatasi K2.7 Code untuk setiap beban kerja produksi.
Untuk latar belakang generasi sebelumnya, lihat Kimi K2 API guide CometAPI.
Kimi K3 vs Kimi K2.7 Code Pricing
| Model | Cache-hit input | Cache-miss input | Output | Konteks |
|---|---|---|---|---|
| kimi-k3 | $0.30 / 1M | $3.00 / 1M | $15.00 / 1M | 1,048,576 |
| kimi-k2.7-code | $0.19 / 1M | $0.95 / 1M | $4.00 / 1M | 262,144 |
| kimi-k2.7-code-highspeed | $0.38 / 1M | $1.90 / 1M | $8.00 / 1M | 262,144 |
Kadar K2.7 diambil daripada dokumentasi harga rasmi Kimi K2.7 Code Moonshot.
Dibandingkan dengan K2.7 Code standard, K3 adalah:
- 1.58ร ganda harga untuk input cache hit
- 3.16ร ganda harga untuk input cache miss
- 3.75ร ganda harga untuk output
Premium K3 adalah lebih kecil berbanding K2.7 Code HighSpeed, tetapi kedua-dua model menyasarkan keutamaan yang berbeza: HighSpeed memberi tumpuan pada output pengaturcaraan yang lebih pantas, manakala K3 disasarkan pada beban kerja konteks panjang dan beragen yang lebih menuntut.
Ddokumentasi harga API Batch Moonshot pada masa ini tidak menyenaraikan K3, jadi jangan anggap diskaun Batch yang tersedia untuk model Kimi lain turut terpakai di sini.
Kimi K3 Context Caching: How the 90% Input Discount Works
K3 menyokong caching konteks automatik.
Pembangun tidak perlu mencipta ID cache atau TTL secara manual. Mengekalkan prefiks besar yang stabil merentas permintaan berulang memberi peluang kepada permintaan seterusnya untuk menerima kadar cache hit.
Perbezaan harga adalah:
- Cache miss: $3.00 / 1M input tokens
- Cache hit: $0.30 / 1M input tokens
Jadi token input cache hit berharga 90% lebih rendah daripada token input cache miss.
Walau bagaimanapun, output kekal pada harga $15 bagi setiap sejuta token, jadi jumlah kos permintaan tidak turun sebanyak 90%.
Sebagai contoh, andaikan:
- 600,000 input tokens
- 20,000 output tokens
| Keadaan cache | Kos input | Kos output | Jumlah |
|---|---|---|---|
| Semua input cache miss | $1.80 | $0.30 | $2.10 |
| Semua input cache hit | $0.18 | $0.30 | $0.48 |
Dalam kes yang dipermudah ini, jumlah kos turun sekitar 77%.
Penjimatan sebenar bergantung pada bahagian token input yang menerima kadar cache hit.
Example: What a Coding Task Costs on K3 vs K2.7
Anggap satu tugas pengaturcaraan menggunakan:
- 200,000 input tokens
- 20,000 output tokens
| Laluan | Jumlah (tanpa cache) | Jumlah (cache penuh) |
|---|---|---|
| kimi-k3 | $0.90 | $0.36 |
| kimi-k2.7-code | $0.27 | $0.12 |
| kimi-k2.7-code-highspeed | $0.54 | $0.24 |
Untuk beban kerja ini, K3 berharga kira-kira 3.33ร kos K2.7 Code standard pada permintaan tanpa cache.
Dalam K3 sendiri, beralih daripada input yang sepenuhnya cache miss kepada input yang sepenuhnya cached mengurangkan anggaran kos permintaan daripada $0.90 kepada $0.36, pengurangan 60% dalam contoh ini.
Namun, kos setiap permintaan hanyalah sebahagian daripada persamaan.
Kos per Tugasan Berjaya = Jumlah Perbelanjaan Aliran Kerja รท Tugasan yang Lulus Semakan Penerimaan
Perbandingan produksi juga harus merangkumi cubaan semula, panggilan jatuh-balik, pelaksanaan alat, dan masa semakan manusia.
Satu permintaan K3 yang berjaya sekali boleh lebih menjimatkan daripada beberapa cubaan lebih murah yang gagal.
A Real-World Edge Case: Reasoning Token Cost
K3 sentiasa menggunakan penaakulan, jadi penggunaan token output boleh menjadi bahagian bil yang ketara.
Dalam ujian hari pelancaran oleh Simon Willison, satu prompt yang meminta K3 menjana SVG menggunakan 13,241 token penaakulan sebelum menghasilkan 3,417 token respons, dengan jumlah kos kira-kira $0.25.
Ini adalah ujian satu prompt tidak formal, bukan penanda aras, tetapi ia menyerlahkan pertimbangan kos penting: jawapan akhir yang kelihatan mungkin hanya mewakili sebahagian daripada output yang dibilkan.
Kerana K3 pada masa ini hanya menyokong usaha penaakulan maksimum, pasukan harus mengukur penggunaan token output sebenar pada beban kerja mereka sendiri.
A Better Default: K2.7 First, K3 on Escalation
Untuk beban kerja pengaturcaraan bercampur, penghalaan boleh lebih menjimatkan daripada menghantar setiap permintaan terus ke K3.
Satu strategi ringkas ialah:
Start with K2.7 Code
โ
Task exceeds 256K context?
โ Yes: use K3
โ No
Run task and validation
โ
Validation failed?
โ Yes: escalate to K3
โ No
Return result
Menggunakan contoh sebelumnya:
- K2.7 Code berharga $0.27 bagi setiap cubaan tanpa cache
- K3 berharga $0.90
- K2.7 berjaya menyiapkan 70% tugasan
- 30% dicuba semula sekali pada K3
Kos purata menjadi:
$0.27 + (30% ร $0.90) = $0.54 per task
Menghantar setiap tugasan terus ke K3 akan menelan kos $0.90 setiap tugasan di bawah andaian token yang sama.
Ini menjadikan strategi penghalaan 40% lebih murah dalam senario yang dipermudah ini.
Penjimatan sebenar akan berbeza, tetapi prinsipnya berguna: hala kerja rutin ke model yang lebih murah dan eskalasi apabila keupayaan tambahan benar-benar diperlukan.
When Is Kimi K3 Worth the Upgrade?
K3 paling meyakinkan apabila:
- Keperluan konteks melebihi had 262,144 token K2.7 Code.
- Tugas menggabungkan kod dengan input visual.
- Ejen jangka panjang perlu bekerja merentas repositori besar dan alat luaran.
- K2.7 memerlukan cubaan semula atau panggilan jatuh-balik yang kerap.
- Tugas cukup bernilai sehingga kualiti penyempurnaan lebih penting daripada meminimumkan kos panggilan pertama.
K2.7 Code kekal pilihan yang kukuh untuk tugas pengaturcaraan berulang dan skop jelas yang sudah mencapai kadar kejayaan tinggi dalam 256K konteks.
Untuk aplikasi pengaturcaraan yang sensitif terhadap kependaman, K2.7 Code HighSpeed juga patut diuji secara berasingan.
Migrating from K2.7 to K3: Five Engineering Checks
-
Penaakulan K3 Buat Masa Ini Tidak Boleh Dikurangkan
K3 sentiasa melakukan penaakulan, dan API semasa hanya menyokong:
reasoning_effort="max"
Memandangkan max ialah nilai lalai, parameter ini juga boleh diabaikan.
-
Buang parameter
thinkingkhusus K2
Jangan gunakan parameter thinking K2.x dengan K3.
Sebaliknya gunakan medan reasoning_effort pada aras teratas.
-
Abaikan Parameter Pensampelan Tetap
K3 pada masa ini menggunakan nilai tetap untuk parameter termasuk:
temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0
Moonshot mengesyorkan mengabaikan medan ini dan tidak menindihnya.
-
Kekalkan Mesej Pembantu yang Lengkap
Untuk perbualan berbilang pusingan dan gelung panggilan alat, hantarkan keseluruhan mesej pembantu ke dalam permintaan seterusnya dan bukannya mengekalkan hanya content yang kelihatan.
-
Sahkan Vision dan Carian Sebelum Pengeluaran
API vision K3 semasa tidak menyokong URL imej awam secara langsung. Gunakan format imej yang disokong seperti data base64 atau mekanisme rujukan fail Moonshot.
Moonshot juga menasihatkan agar tidak bergantung pada fungsi Carian Webnya untuk penggunaan produksi jangka dekat sementara ciri ini sedang dikemas kini.
Kimi K3 API Example in Python
K3 boleh dipanggil melalui antara muka API serasi OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are an expert software engineer.",
},
{
"role": "user",
"content": "Analyze this repository logic and identify potential issues.",
},
],
reasoning_effort="max", # Optional while "max" is the default
)
assistant_message = response.choices[0].message
print(assistant_message)
Elakkan menindih parameter pensampelan tetap K3. Untuk aliran kerja berbilang pusingan dan panggilan alat, kekalkan mesej pembantu yang lengkap.
How to Evaluate Kimi K3 Before Upgrading
Uji K3 pada beban kerja sebenar dan bukannya prompt penanda aras semata-mata.
Set penilaian praktikal mungkin termasuk:
- suntingan repositori rutin
- tugasan yang hampir dengan had 256K konteks
- tugasan yang melebihi 256K
- tugasan kejuruteraan visual
- tugasan beragen atau kerja pengetahuan jangka panjang
Bandingkan K3, K2.7 Code, dan K2.7 Code HighSpeed jika berkenaan.
Pantau:
- kadar kejayaan tugasan
- token input yang cached dan tidak cached
- token output dan penaakulan
- cubaan semula dan panggilan jatuh-balik
- latensi p50 dan p95
- ralat panggilan alat
- masa semakan manusia
- kos per tugasan berjaya
Kemudian bandingkan tiga dasar:
- Semua K2.7 Code
- Semua K3
- K2.7 Code dengan eskalasi ke K3
Laluan terbaik ialah yang memenuhi keperluan kualiti dan kependaman anda pada kos terendah per tugasan berjaya.
Kimi K3 Pricing on CometAPI
Pengiraan di atas menggunakan harga API rasmi Moonshot AI untuk memastikan perbandingan K3 dan K2.7 konsisten.
Pada masa penerbitan, Kimi K3 di CometAPI berharga 20% lebih rendah daripada kadar API standard Moonshot AI:
| Laluan | Input | Output |
|---|---|---|
| Moonshot AI | $3.00 / 1M | $15.00 / 1M |
| CometAPI | $2.40 / 1M | $12.00 / 1M |
Memandangkan harga API boleh berubah, semak halaman model langsung sebelum menggunakan angka ini untuk pembajaan produksi.
API CometAPI yang serasi dengan OpenAI memudahkan pengujian kimi-k3 bersama laluan model lain menggunakan prompt dan aliran kerja penilaian yang sama.
Sedia menguji Kimi K3? Lihat Kimi K3 di CometAPI dan bandingkan harga sebelum membawanya ke produksi.
Untuk contoh integrasi dan penilaian, lihat CometAPI Cookbook di GitHub.
FAQ
Berapakah kos API Kimi K3?
Moonshot AI menyenaraikan Kimi K3 pada $0.30 bagi setiap 1 juta token input cache hit, $3.00 bagi setiap 1 juta token input cache miss, dan $15.00 bagi setiap 1 juta token output.
ID model API ialah kimi-k3.
Adakah Kimi K3 lebih murah daripada Kimi K2.7 Code?
Tidak. Berdasarkan kadar rasmi Moonshot, K3 adalah kira-kira 3.16ร harga untuk input cache miss dan 3.75ร harga untuk output.
Ia masih boleh mengurangkan kos aliran kerja jika ia meningkatkan kejayaan tugasan atau mengurangkan cubaan semula.
Adakah Kimi K3 mempunyai tetingkap konteks 1M token?
Ya. Kimi K3 menyokong tetingkap konteks 1,048,576 token, berbanding 262,144 token untuk Kimi K2.7 Code.
Adakah Kimi K3 menyokong caching konteks automatik?
Ya. Caching konteks adalah automatik. Token input cache hit berharga $0.30 bagi setiap sejuta berbanding $3.00 bagi setiap sejuta untuk token input cache miss.
Bolehkah saya mematikan penaakulan Kimi K3 untuk mengurangkan kos?
Buat masa ini tidak. K3 sentiasa menggunakan penaakulan, dan reasoning_effort="max" ialah satu-satunya tahap usaha penaakulan yang disokong.
Final Thoughts
Kimi K3 menawarkan konteks yang jauh lebih besar dan keupayaan lebih luas daripada K2.7 Code, tetapi pada harga token yang lebih tinggi.
Untuk pengaturcaraan rutin dalam 256K konteks, K2.7 Code biasanya pilihan yang lebih menjimatkan. Untuk tugasan konteks panjang, multimodal, atau beragen yang sukar, K3 boleh membenarkan premiumโterutamanya apabila ia meningkatkan penyempurnaan yang berjaya.
Bagi banyak sistem produksi, strategi paling cekap bukan menggantikan K2.7 sepenuhnya, tetapi menggunakan K2.7 sebagai lalai dan K3 sebagai laluan eskalasi.
Metrik yang paling penting bukan kos per panggilan API, tetapi kos per tugasan berjaya.
