Kimi K3 is now live on CometAPI โ†’

Harga API Kimi K3 (2026): Kosnya & Perbandingan Kod K2.7

CometAPI
Mia MarenJul 17, 2026
Harga API Kimi K3 (2026): Kosnya & Perbandingan Kod K2.7

TL;DR

Kimi K3 berharga $0.30 bagi setiap 1M token input cache hit, $3.00 bagi setiap 1M token input cache miss, dan $15.00 bagi setiap 1M token output, dengan tetingkap konteks 1,048,576 token.

Dibandingkan dengan K2.7 Code, K3 jauh lebih mahal setiap token, tetapi menawarkan tetingkap konteks 4ร— lebih besar serta pemahaman visual asli dan sokongan yang lebih kukuh untuk beban kerja beragen jangka panjang.

Kesimpulan: K2.7 Code kekal pilihan yang lebih menjimatkan untuk tugas pengaturcaraan rutin dalam 256K konteks. Gunakan K3 apabila anda memerlukan konteks lebih besar, keupayaan multimodal, atau sebagai laluan eskalasi bagi tugasan yang K2.7 tidak dapat siapkan dengan boleh dipercayai.

Kimi K3 API Pricing at a Glance

PerkaraKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningSentiasa didayakan
Supported reasoning efforthanya maksimum
Default maximum completionHad maksimum penjanaan lalai
Configurable maximum completionSehingga 1,048,576 token, tertakluk pada had konteks keseluruhan
Key capabilitiesPemahaman visual asli, panggilan alat, output berstruktur, Partial Mode, pemuatan alat dinamik, caching konteks automatik
Batch APIK3 kini tidak tersenarai dalam model Batch yang disokong

Rujuk Kimi K3 quickstart Moonshot untuk parameter API semasa dan butiran integrasi.

What Kimi K3 Adds Over K2.7 Code

Peningkatan paling ketara ialah panjang konteks.

K2.7 Code menyokong 262,144 token, manakala K3 meningkatkan had tersebut kepada 1,048,576 token. Ini menjadikan K3 lebih praktikal untuk repositori besar, sejarah ejen yang panjang, dokumentasi yang meluas, dan aliran kerja yang jika tidak memerlukan pengurangan konteks.

K3 juga menyokong:

  • pemahaman visual asli
  • output berstruktur yang ketat
  • tool_choice
  • pemuatan alat dinamik
  • caching konteks automatik
  • aliran kerja pengaturcaraan dan kerja pengetahuan jangka panjang

Kimi K3 technical blog Moonshot melaporkan 88.3 pada Terminal-Bench 2.1, 77.8 pada Program Bench, dan 81.2 pada FrontierSWE.

Ini ialah penanda aras yang dilaporkan oleh penyedia dan harus dianggap sebagai sebab untuk menilai K3โ€”bukan jaminan bahawa ia akan mengatasi K2.7 Code untuk setiap beban kerja produksi.

Untuk latar belakang generasi sebelumnya, lihat Kimi K2 API guide CometAPI.

Kimi K3 vs Kimi K2.7 Code Pricing

ModelCache-hit inputCache-miss inputOutputKonteks
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Kadar K2.7 diambil daripada dokumentasi harga rasmi Kimi K2.7 Code Moonshot.

Dibandingkan dengan K2.7 Code standard, K3 adalah:

  • 1.58ร— ganda harga untuk input cache hit
  • 3.16ร— ganda harga untuk input cache miss
  • 3.75ร— ganda harga untuk output

Premium K3 adalah lebih kecil berbanding K2.7 Code HighSpeed, tetapi kedua-dua model menyasarkan keutamaan yang berbeza: HighSpeed memberi tumpuan pada output pengaturcaraan yang lebih pantas, manakala K3 disasarkan pada beban kerja konteks panjang dan beragen yang lebih menuntut.

Ddokumentasi harga API Batch Moonshot pada masa ini tidak menyenaraikan K3, jadi jangan anggap diskaun Batch yang tersedia untuk model Kimi lain turut terpakai di sini.

Kimi K3 Context Caching: How the 90% Input Discount Works

K3 menyokong caching konteks automatik.

Pembangun tidak perlu mencipta ID cache atau TTL secara manual. Mengekalkan prefiks besar yang stabil merentas permintaan berulang memberi peluang kepada permintaan seterusnya untuk menerima kadar cache hit.

Perbezaan harga adalah:

  • Cache miss: $3.00 / 1M input tokens
  • Cache hit: $0.30 / 1M input tokens

Jadi token input cache hit berharga 90% lebih rendah daripada token input cache miss.

Walau bagaimanapun, output kekal pada harga $15 bagi setiap sejuta token, jadi jumlah kos permintaan tidak turun sebanyak 90%.

Sebagai contoh, andaikan:

  • 600,000 input tokens
  • 20,000 output tokens
Keadaan cacheKos inputKos outputJumlah
Semua input cache miss$1.80$0.30$2.10
Semua input cache hit$0.18$0.30$0.48

Dalam kes yang dipermudah ini, jumlah kos turun sekitar 77%.

Penjimatan sebenar bergantung pada bahagian token input yang menerima kadar cache hit.

Example: What a Coding Task Costs on K3 vs K2.7

Anggap satu tugas pengaturcaraan menggunakan:

  • 200,000 input tokens
  • 20,000 output tokens
LaluanJumlah (tanpa cache)Jumlah (cache penuh)
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Untuk beban kerja ini, K3 berharga kira-kira 3.33ร— kos K2.7 Code standard pada permintaan tanpa cache.

Dalam K3 sendiri, beralih daripada input yang sepenuhnya cache miss kepada input yang sepenuhnya cached mengurangkan anggaran kos permintaan daripada $0.90 kepada $0.36, pengurangan 60% dalam contoh ini.

Namun, kos setiap permintaan hanyalah sebahagian daripada persamaan.

Kos per Tugasan Berjaya = Jumlah Perbelanjaan Aliran Kerja รท Tugasan yang Lulus Semakan Penerimaan

Perbandingan produksi juga harus merangkumi cubaan semula, panggilan jatuh-balik, pelaksanaan alat, dan masa semakan manusia.

Satu permintaan K3 yang berjaya sekali boleh lebih menjimatkan daripada beberapa cubaan lebih murah yang gagal.

A Real-World Edge Case: Reasoning Token Cost

K3 sentiasa menggunakan penaakulan, jadi penggunaan token output boleh menjadi bahagian bil yang ketara.

Dalam ujian hari pelancaran oleh Simon Willison, satu prompt yang meminta K3 menjana SVG menggunakan 13,241 token penaakulan sebelum menghasilkan 3,417 token respons, dengan jumlah kos kira-kira $0.25.

Ini adalah ujian satu prompt tidak formal, bukan penanda aras, tetapi ia menyerlahkan pertimbangan kos penting: jawapan akhir yang kelihatan mungkin hanya mewakili sebahagian daripada output yang dibilkan.

Kerana K3 pada masa ini hanya menyokong usaha penaakulan maksimum, pasukan harus mengukur penggunaan token output sebenar pada beban kerja mereka sendiri.

A Better Default: K2.7 First, K3 on Escalation

Untuk beban kerja pengaturcaraan bercampur, penghalaan boleh lebih menjimatkan daripada menghantar setiap permintaan terus ke K3.

Satu strategi ringkas ialah:

Start with K2.7 Code
        โ†“
Task exceeds 256K context?
        โ†’ Yes: use K3
        โ†“ No
Run task and validation
        โ†“
Validation failed?
        โ†’ Yes: escalate to K3
        โ†“ No
Return result

Menggunakan contoh sebelumnya:

  • K2.7 Code berharga $0.27 bagi setiap cubaan tanpa cache
  • K3 berharga $0.90
  • K2.7 berjaya menyiapkan 70% tugasan
  • 30% dicuba semula sekali pada K3

Kos purata menjadi:

$0.27 + (30% ร— $0.90) = $0.54 per task

Menghantar setiap tugasan terus ke K3 akan menelan kos $0.90 setiap tugasan di bawah andaian token yang sama.

Ini menjadikan strategi penghalaan 40% lebih murah dalam senario yang dipermudah ini.

Penjimatan sebenar akan berbeza, tetapi prinsipnya berguna: hala kerja rutin ke model yang lebih murah dan eskalasi apabila keupayaan tambahan benar-benar diperlukan.

When Is Kimi K3 Worth the Upgrade?

K3 paling meyakinkan apabila:

  • Keperluan konteks melebihi had 262,144 token K2.7 Code.
  • Tugas menggabungkan kod dengan input visual.
  • Ejen jangka panjang perlu bekerja merentas repositori besar dan alat luaran.
  • K2.7 memerlukan cubaan semula atau panggilan jatuh-balik yang kerap.
  • Tugas cukup bernilai sehingga kualiti penyempurnaan lebih penting daripada meminimumkan kos panggilan pertama.

K2.7 Code kekal pilihan yang kukuh untuk tugas pengaturcaraan berulang dan skop jelas yang sudah mencapai kadar kejayaan tinggi dalam 256K konteks.

Untuk aplikasi pengaturcaraan yang sensitif terhadap kependaman, K2.7 Code HighSpeed juga patut diuji secara berasingan.

Migrating from K2.7 to K3: Five Engineering Checks

  1. Penaakulan K3 Buat Masa Ini Tidak Boleh Dikurangkan

K3 sentiasa melakukan penaakulan, dan API semasa hanya menyokong:

reasoning_effort="max"

Memandangkan max ialah nilai lalai, parameter ini juga boleh diabaikan.

  1. Buang parameter thinking khusus K2

Jangan gunakan parameter thinking K2.x dengan K3.

Sebaliknya gunakan medan reasoning_effort pada aras teratas.

  1. Abaikan Parameter Pensampelan Tetap

K3 pada masa ini menggunakan nilai tetap untuk parameter termasuk:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot mengesyorkan mengabaikan medan ini dan tidak menindihnya.

  1. Kekalkan Mesej Pembantu yang Lengkap

Untuk perbualan berbilang pusingan dan gelung panggilan alat, hantarkan keseluruhan mesej pembantu ke dalam permintaan seterusnya dan bukannya mengekalkan hanya content yang kelihatan.

  1. Sahkan Vision dan Carian Sebelum Pengeluaran

API vision K3 semasa tidak menyokong URL imej awam secara langsung. Gunakan format imej yang disokong seperti data base64 atau mekanisme rujukan fail Moonshot.

Moonshot juga menasihatkan agar tidak bergantung pada fungsi Carian Webnya untuk penggunaan produksi jangka dekat sementara ciri ini sedang dikemas kini.

Kimi K3 API Example in Python

K3 boleh dipanggil melalui antara muka API serasi OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Elakkan menindih parameter pensampelan tetap K3. Untuk aliran kerja berbilang pusingan dan panggilan alat, kekalkan mesej pembantu yang lengkap.

How to Evaluate Kimi K3 Before Upgrading

Uji K3 pada beban kerja sebenar dan bukannya prompt penanda aras semata-mata.

Set penilaian praktikal mungkin termasuk:

  • suntingan repositori rutin
  • tugasan yang hampir dengan had 256K konteks
  • tugasan yang melebihi 256K
  • tugasan kejuruteraan visual
  • tugasan beragen atau kerja pengetahuan jangka panjang

Bandingkan K3, K2.7 Code, dan K2.7 Code HighSpeed jika berkenaan.

Pantau:

  • kadar kejayaan tugasan
  • token input yang cached dan tidak cached
  • token output dan penaakulan
  • cubaan semula dan panggilan jatuh-balik
  • latensi p50 dan p95
  • ralat panggilan alat
  • masa semakan manusia
  • kos per tugasan berjaya

Kemudian bandingkan tiga dasar:

  1. Semua K2.7 Code
  2. Semua K3
  3. K2.7 Code dengan eskalasi ke K3

Laluan terbaik ialah yang memenuhi keperluan kualiti dan kependaman anda pada kos terendah per tugasan berjaya.

Kimi K3 Pricing on CometAPI

Pengiraan di atas menggunakan harga API rasmi Moonshot AI untuk memastikan perbandingan K3 dan K2.7 konsisten.

Pada masa penerbitan, Kimi K3 di CometAPI berharga 20% lebih rendah daripada kadar API standard Moonshot AI:

LaluanInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Memandangkan harga API boleh berubah, semak halaman model langsung sebelum menggunakan angka ini untuk pembajaan produksi.

API CometAPI yang serasi dengan OpenAI memudahkan pengujian kimi-k3 bersama laluan model lain menggunakan prompt dan aliran kerja penilaian yang sama.

Sedia menguji Kimi K3? Lihat Kimi K3 di CometAPI dan bandingkan harga sebelum membawanya ke produksi.

Untuk contoh integrasi dan penilaian, lihat CometAPI Cookbook di GitHub.

FAQ

Berapakah kos API Kimi K3?

Moonshot AI menyenaraikan Kimi K3 pada $0.30 bagi setiap 1 juta token input cache hit, $3.00 bagi setiap 1 juta token input cache miss, dan $15.00 bagi setiap 1 juta token output.

ID model API ialah kimi-k3.

Adakah Kimi K3 lebih murah daripada Kimi K2.7 Code?

Tidak. Berdasarkan kadar rasmi Moonshot, K3 adalah kira-kira 3.16ร— harga untuk input cache miss dan 3.75ร— harga untuk output.

Ia masih boleh mengurangkan kos aliran kerja jika ia meningkatkan kejayaan tugasan atau mengurangkan cubaan semula.

Adakah Kimi K3 mempunyai tetingkap konteks 1M token?

Ya. Kimi K3 menyokong tetingkap konteks 1,048,576 token, berbanding 262,144 token untuk Kimi K2.7 Code.

Adakah Kimi K3 menyokong caching konteks automatik?

Ya. Caching konteks adalah automatik. Token input cache hit berharga $0.30 bagi setiap sejuta berbanding $3.00 bagi setiap sejuta untuk token input cache miss.

Bolehkah saya mematikan penaakulan Kimi K3 untuk mengurangkan kos?

Buat masa ini tidak. K3 sentiasa menggunakan penaakulan, dan reasoning_effort="max" ialah satu-satunya tahap usaha penaakulan yang disokong.

Final Thoughts

Kimi K3 menawarkan konteks yang jauh lebih besar dan keupayaan lebih luas daripada K2.7 Code, tetapi pada harga token yang lebih tinggi.

Untuk pengaturcaraan rutin dalam 256K konteks, K2.7 Code biasanya pilihan yang lebih menjimatkan. Untuk tugasan konteks panjang, multimodal, atau beragen yang sukar, K3 boleh membenarkan premiumโ€”terutamanya apabila ia meningkatkan penyempurnaan yang berjaya.

Bagi banyak sistem produksi, strategi paling cekap bukan menggantikan K2.7 sepenuhnya, tetapi menggunakan K2.7 sebagai lalai dan K3 sebagai laluan eskalasi.

Metrik yang paling penting bukan kos per panggilan API, tetapi kos per tugasan berjaya.

Bersedia untuk mengurangkan kos pembangunan AI sebanyak 20%?

Mulakan secara percuma dalam beberapa minit. Kredit percubaan percuma disertakan. Tiada kad kredit diperlukan.

Baca Lagi