Kimi K3 is now live on CometAPI โ†’

Harga API Kimi K3 (2026): Biayanya & Perbandingan K2.7 Code

CometAPI
Mia MarenJul 17, 2026
Harga API Kimi K3 (2026): Biayanya & Perbandingan K2.7 Code

TL;DR

Kimi K3 berharga $0.30 per 1M token input cache-hit, $3.00 per 1M token input cache-miss, dan $15.00 per 1M token output, dengan jendela konteks 1,048,576 token.

Dibandingkan dengan K2.7 Code, K3 secara signifikan lebih mahal per token, tetapi menawarkan jendela konteks 4ร— lebih besar ditambah vision native dan dukungan yang lebih kuat untuk beban kerja agen berjangka panjang.

Intinya: K2.7 Code tetap menjadi pilihan yang lebih ekonomis untuk tugas pengkodean rutin dalam konteks 256K. Gunakan K3 saat Anda memerlukan konteks lebih besar, kemampuan multimodal, atau sebagai rute eskalasi untuk tugas yang tidak dapat diselesaikan K2.7 secara andal.

Sekilas Harga API Kimi K3

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningSelalu diaktifkan
Supported reasoning efforthanya max
Default maximum completion131,072 tokens
Configurable maximum completionHingga 1,048,576 tokens, bergantung pada batas konteks total
Key capabilitiesVision native, pemanggilan tool, output terstruktur, Partial Mode, pemuatan tool dinamis, caching konteks otomatis
Batch APIK3 saat ini tidak tercantum di antara model Batch yang didukung

Lihat Kimi K3 quickstart dari Moonshot untuk parameter API dan detail integrasi terbaru.

Apa yang Ditambahkan Kimi K3 Dibanding K2.7 Code

Peningkatan paling jelas adalah panjang konteks.

K2.7 Code mendukung 262,144 token, sedangkan K3 meningkatkan batas tersebut menjadi 1,048,576 token. Ini membuat K3 lebih praktis untuk repositori besar, riwayat agen panjang, dokumentasi ekstensif, dan alur kerja yang sebaliknya memerlukan pengurangan konteks.

K3 juga mendukung:

  • pemahaman visual native
  • output terstruktur yang ketat
  • tool_choice
  • pemuatan tool dinamis
  • caching konteks otomatis
  • alur kerja pengkodean dan knowledge-work jangka panjang

Blog teknis Kimi K3 dari Moonshot melaporkan 88.3 pada Terminal-Bench 2.1, 77.8 pada Program Bench, dan 81.2 pada FrontierSWE.

Ini adalah tolok ukur yang dilaporkan penyedia dan sebaiknya diperlakukan sebagai alasan untuk mengevaluasi K3โ€”bukan jaminan bahwa model ini akan mengungguli K2.7 Code pada setiap beban kerja produksi.

Untuk latar belakang generasi sebelumnya, lihat panduan API Kimi K2 dari CometAPI.

Perbandingan Harga Kimi K3 vs Kimi K2.7 Code

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Tarif K2.7 berasal dari dokumentasi harga resmi Kimi K2.7 Code milik Moonshot.

Dibandingkan K2.7 Code standar, K3 adalah:

  • 1,58ร— harga untuk input cache-hit
  • 3,16ร— harga untuk input cache-miss
  • 3,75ร— harga untuk output

Premium K3 lebih kecil relatif terhadap K2.7 Code HighSpeed, tetapi kedua model menargetkan prioritas berbeda: HighSpeed berfokus pada output pengkodean yang lebih cepat, sedangkan K3 ditujukan untuk beban kerja konteks panjang dan agen yang lebih menuntut.

Dokumentasi harga Batch API Moonshot saat ini tidak mencantumkan K3, jadi jangan mengasumsikan diskon Batch yang berlaku untuk model Kimi lainnya juga berlaku di sini.

Caching Konteks Kimi K3: Cara Kerja Diskon Input 90%

K3 mendukung caching konteks otomatis.

Pengembang tidak perlu membuat cache ID atau TTL secara manual. Menjaga prefiks besar tetap stabil di banyak permintaan memberi peluang permintaan berikutnya menerima tarif cache-hit.

Perbedaan harga adalah:

  • Cache miss: $3.00 / 1M token input
  • Cache hit: $0.30 / 1M token input

Jadi token input cache-hit berharga 90% lebih murah daripada token input cache-miss.

Namun, output tetap dihargai $15 per juta token, sehingga total biaya permintaan tidak turun 90%.

Sebagai contoh, asumsi:

  • 600,000 token input
  • 20,000 token output
Status cacheBiaya inputBiaya outputTotal
Semua input cache miss$1.80$0.30$2.10
Semua input cache hit$0.18$0.30$0.48

Dalam kasus yang disederhanakan ini, total biaya turun sekitar 77%.

Penghematan aktual bergantung pada porsi token input yang menerima tarif cache-hit.

Contoh: Berapa Biaya Tugas Pengkodean di K3 vs K2.7

Asumsikan sebuah tugas pengkodean menggunakan:

  • 200,000 token input
  • 20,000 token output
RuteTotal dinginTotal sepenuhnya cache
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Untuk beban kerja ini, K3 berbiaya sekitar 3,33ร— lebih mahal daripada K2.7 Code standar pada permintaan dingin.

Di dalam K3 sendiri, beralih dari seluruh input cache-miss ke input sepenuhnya cache mengurangi estimasi biaya permintaan dari $0.90 menjadi $0.36, penurunan 60% dalam contoh ini.

Namun biaya per permintaan hanyalah bagian dari persamaan.

Biaya per Tugas Berhasil = Total Pengeluaran Alur Kerja รท Tugas yang Lulus Pemeriksaan Penerimaan

Perbandingan produksi juga harus mencakup percobaan ulang, pemanggilan fallback, eksekusi tool, dan waktu tinjauan manusia.

Satu permintaan K3 yang langsung berhasil bisa lebih ekonomis daripada beberapa upaya yang lebih murah namun gagal.

Kasus Tepi Dunia Nyata: Biaya Token Penalaran

K3 selalu menggunakan penalaran, jadi konsumsi token output dapat menjadi bagian tagihan yang bermakna.

Dalam uji peluncuran hari pertama oleh Simon Willison, sebuah prompt yang meminta K3 menghasilkan SVG mengonsumsi 13,241 token penalaran sebelum menghasilkan 3,417 token respons, dengan total biaya sekitar $0.25.

Ini adalah uji satu prompt informal, bukan tolok ukur, tetapi menyoroti pertimbangan biaya penting: jawaban akhir yang terlihat mungkin hanya mewakili sebagian dari output yang ditagihkan.

Karena K3 saat ini hanya mendukung upaya penalaran maksimum, tim harus mengukur penggunaan token output aktual pada beban kerja mereka sendiri.

Default yang Lebih Baik: K2.7 Terlebih Dahulu, K3 Saat Eskalasi

Untuk beban kerja pengkodean campuran, perutean dapat lebih ekonomis daripada mengirim setiap permintaan langsung ke K3.

Strategi sederhana:

Start with K2.7 Code
        โ†“
Task exceeds 256K context?
        โ†’ Yes: use K3
        โ†“ No
Run task and validation
        โ†“
Validation failed?
        โ†’ Yes: escalate to K3
        โ†“ No
Return result

Menggunakan contoh sebelumnya:

  • K2.7 Code berbiaya $0.27 per percobaan dingin
  • K3 berbiaya $0.90
  • K2.7 berhasil menyelesaikan 70% tugas
  • 30% dicoba ulang sekali di K3

Rata-rata biaya menjadi:

$0.27 + (30% ร— $0.90) = $0.54 per task

Mengirim setiap tugas langsung ke K3 akan berbiaya $0.90 per tugas dengan asumsi token yang sama.

Itu membuat strategi perutean 40% lebih murah dalam skenario yang disederhanakan ini.

Penghematan tepat akan bervariasi, tetapi prinsipnya berguna: rute pekerjaan rutin ke model yang lebih murah dan eskalasi saat kemampuan tambahan benar-benar diperlukan.

Kapan Kimi K3 Layak Di-upgrade?

K3 paling menarik saat:

  • Kebutuhan konteks melebihi batas 262,144 token K2.7 Code.
  • Tugas menggabungkan kode dengan input visual.
  • Agen jangka panjang perlu bekerja di repositori besar dan tool eksternal.
  • K2.7 memerlukan percobaan ulang atau panggilan fallback yang sering.
  • Tugas cukup bernilai sehingga kualitas penyelesaian lebih penting daripada meminimalkan biaya panggilan pertama.

K2.7 Code tetap merupakan opsi kuat untuk tugas pengkodean yang repetitif dan terdefinisi dengan baik yang sudah mencapai tingkat keberhasilan tinggi dalam konteks 256K.

Untuk aplikasi pengkodean yang sensitif terhadap latensi, K2.7 Code HighSpeed juga harus diuji secara terpisah.

Migrasi dari K2.7 ke K3: Lima Pemeriksaan Teknis

  1. Penalaran K3 Saat Ini Tidak Dapat Dikurangi

K3 selalu melakukan penalaran, dan API saat ini hanya mendukung:

reasoning_effort="max"

Karena max adalah default, parameter tersebut juga dapat dihilangkan.

  1. Hapus Parameter thinking Khusus K2

Jangan gunakan parameter thinking K2.x dengan K3.

Gunakan field reasoning_effort di tingkat atas sebagai gantinya.

  1. Abaikan Parameter Sampling Tetap

K3 saat ini menggunakan nilai tetap untuk parameter termasuk:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot merekomendasikan untuk menghilangkan field ini daripada menimpanya.

  1. Pertahankan Pesan Asisten Secara Lengkap

Untuk percakapan multi-giliran dan loop pemanggilan tool, teruskan pesan asisten lengkap ke permintaan berikutnya daripada hanya mempertahankan content yang terlihat.

  1. Validasi Vision dan Search Sebelum Produksi

API vision K3 saat ini tidak mendukung URL gambar publik secara langsung. Gunakan format gambar yang didukung seperti data base64 atau mekanisme referensi file dari Moonshot.

Moonshot juga menyarankan untuk tidak mengandalkan fungsionalitas Web Search saat ini untuk penggunaan produksi jangka pendek saat fitur tersebut sedang diperbarui.

Contoh API Kimi K3 dalam Python

K3 dapat dipanggil melalui antarmuka API yang kompatibel dengan OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Hindari menimpa parameter sampling tetap milik K3. Untuk alur kerja multi-giliran dan pemanggilan tool, pertahankan pesan asisten secara lengkap.

Cara Mengevaluasi Kimi K3 Sebelum Upgrade

Uji K3 pada beban kerja nyata, bukan prompt tolok ukur saja.

Set evaluasi yang praktis dapat mencakup:

  • penyuntingan repositori rutin
  • tugas yang mendekati batas konteks 256K
  • tugas yang melebihi 256K
  • tugas rekayasa visual
  • tugas agenik atau knowledge-work berjangka panjang

Bandingkan K3, K2.7 Code, dan K2.7 Code HighSpeed jika relevan.

Lacak:

  • tingkat keberhasilan tugas
  • token input yang ter-cache dan tidak ter-cache
  • token output dan penalaran
  • percobaan ulang dan panggilan fallback
  • latensi p50 dan p95
  • error pemanggilan tool
  • waktu tinjauan manusia
  • biaya per tugas yang berhasil

Lalu bandingkan tiga kebijakan:

  1. Semua K2.7 Code
  2. Semua K3
  3. K2.7 Code dengan eskalasi ke K3

Rute terbaik adalah yang memenuhi persyaratan kualitas dan latensi Anda pada biaya per tugas berhasil yang terendah.

Harga Kimi K3 di CometAPI

Perhitungan di atas menggunakan harga API resmi Moonshot AI untuk menjaga perbandingan K3 dan K2.7 tetap konsisten.

Pada saat publikasi, Kimi K3 di CometAPI dihargai 20% lebih rendah daripada tarif API standar Moonshot AI:

RuteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Karena harga API dapat berubah, periksa halaman model live sebelum menggunakan angka ini untuk penganggaran produksi.

API yang kompatibel dengan OpenAI dari CometAPI memudahkan pengujian kimi-k3 bersama rute model lainnya menggunakan prompt dan alur evaluasi yang sama.

Siap menguji Kimi K3? Lihat Kimi K3 di CometAPI dan bandingkan harga sebelum membawanya ke produksi.

Untuk contoh integrasi dan evaluasi, lihat CometAPI Cookbook di GitHub.

FAQ

Berapa biaya API Kimi K3?

Moonshot AI mencantumkan Kimi K3 pada $0.30 per 1 juta token input cache-hit, $3.00 per 1 juta token input cache-miss, dan $15.00 per 1 juta token output.

ID model API adalah kimi-k3.

Apakah Kimi K3 lebih murah daripada Kimi K2.7 Code?

Tidak. Berdasarkan tarif resmi Moonshot, K3 kira-kira 3,16ร— harga untuk input cache-miss dan 3,75ร— harga untuk output.

Model ini masih dapat menurunkan biaya alur kerja jika meningkatkan keberhasilan tugas atau mengurangi percobaan ulang.

Apakah Kimi K3 memiliki jendela konteks 1M token?

Ya. Kimi K3 mendukung jendela konteks 1,048,576 token, dibandingkan 262,144 token untuk Kimi K2.7 Code.

Apakah Kimi K3 mendukung caching konteks otomatis?

Ya. Caching konteks bersifat otomatis. Token input cache-hit berharga $0.30 per juta dibandingkan $3.00 per juta untuk token input cache-miss.

Bisakah saya mematikan penalaran Kimi K3 untuk mengurangi biaya?

Saat ini tidak bisa. K3 selalu menggunakan penalaran, dan reasoning_effort="max" adalah satu-satunya tingkat upaya penalaran yang didukung.

Penutup

Kimi K3 menawarkan konteks yang jauh lebih besar dan kemampuan lebih luas daripada K2.7 Code, namun dengan harga token yang lebih tinggi.

Untuk pengkodean rutin dalam konteks 256K, K2.7 Code biasanya pilihan yang lebih ekonomis. Untuk tugas konteks panjang, multimodal, atau agen yang sulit, K3 dapat membenarkan preminyaโ€”terutama saat meningkatkan keberhasilan penyelesaian.

Bagi banyak sistem produksi, strategi paling efisien bukan mengganti K2.7 sepenuhnya, melainkan menggunakan K2.7 sebagai default dan K3 sebagai rute eskalasi.

Metrik yang paling penting pada akhirnya bukan biaya per panggilan API, melainkan biaya per tugas yang berhasil.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya