TL;DR
Kimi K3 costa $0.30 per 1M token di input cache hit, $3.00 per 1M token di input cache miss e $15.00 per 1M token di output, con una finestra di contesto da 1,048,576 token.
Rispetto a K2.7 Code, K3 รจ significativamente piรน costoso per token, ma offre una finestra di contesto 4ร piรน ampia, visione nativa e un supporto piรน solido per carichi di lavoro agentici a lungo termine.
In sintesi: K2.7 Code rimane la scelta piรน economica per le attivitร di coding di routine entro 256K di contesto. Usa K3 quando serve un contesto piรน grande, capacitร multimodali o come percorso di escalation per attivitร che K2.7 non completa in modo affidabile.
Panoramica dei prezzi dell'API Kimi K3
| Voce | Kimi K3 |
|---|---|
| ID del modello API | kimi-k3 |
| Input cache hit | $0.30 / 1M token |
| Input cache miss | $3.00 / 1M token |
| Output | $15.00 / 1M token |
| Finestra di contesto | 1,048,576 token |
| Ragionamento | Sempre attivo |
| Livello di ragionamento supportato | solo massimo |
| Completamento massimo predefinito | 131,072 token |
| Completamento massimo configurabile | Fino a 1,048,576 token, soggetto al limite di contesto totale |
| Funzionalitร principali | Visione nativa, chiamate a tool, output strutturato, Partial Mode, caricamento dinamico degli strumenti, caching automatico del contesto |
| Batch API | K3 non รจ attualmente elencato tra i modelli Batch supportati |
Consulta la Guida rapida Kimi K3 di Moonshot per i parametri API aggiornati e i dettagli di integrazione.
Cosa aggiunge Kimi K3 rispetto a K2.7 Code
Lโaggiornamento piรน evidente รจ la lunghezza del contesto.
K2.7 Code supporta 262,144 token, mentre K3 porta il limite a 1,048,576 token. Questo rende K3 piรน pratico per grandi repository, lunghe storie di agenti, documentazione estesa e workflow che altrimenti richiederebbero riduzione del contesto.
K3 supporta anche:
- comprensione visiva nativa
- output strutturato rigoroso
tool_choice- caricamento dinamico degli strumenti
- caching automatico del contesto
- workflow di coding e knowledge work di lunga durata
Il blog tecnico Kimi K3 di Moonshot riporta 88.3 su Terminal-Bench 2.1, 77.8 su Program Bench e 81.2 su FrontierSWE.
Si tratta di benchmark riportati dal provider e andrebbero considerati come motivi per valutare K3, non come garanzia che supererร K2.7 Code in ogni carico di lavoro di produzione.
Per informazioni sulla generazione precedente, vedi la Guida allโAPI Kimi K2 di CometAPI.
Prezzi: Kimi K3 vs Kimi K2.7 Code
| Modello | Input cache hit | Input cache miss | Output | Contesto |
|---|---|---|---|---|
| kimi-k3 | $0.30 / 1M | $3.00 / 1M | $15.00 / 1M | 1,048,576 |
| kimi-k2.7-code | $0.19 / 1M | $0.95 / 1M | $4.00 / 1M | 262,144 |
| kimi-k2.7-code-highspeed | $0.38 / 1M | $1.90 / 1M | $8.00 / 1M | 262,144 |
Le tariffe K2.7 provengono dalla documentazione ufficiale dei prezzi di Kimi K2.7 Code di Moonshot.
Rispetto a K2.7 Code standard, K3 รจ:
- 1,58ร il prezzo per lโinput cache hit
- 3,16ร il prezzo per lโinput cache miss
- 3,75ร il prezzo per lโoutput
Il premium di K3 รจ piรน contenuto rispetto a K2.7 Code HighSpeed, ma i due modelli hanno prioritร diverse: HighSpeed punta a output di coding piรน rapidi, mentre K3 รจ rivolto a carichi di lavoro piรน esigenti in termini di lungo contesto e agenticitร .
La documentazione attuale dei prezzi del Batch API di Moonshot non elenca K3, quindi non dare per scontato che gli sconti Batch disponibili per altri modelli Kimi si applichino anche qui.
Caching del contesto in Kimi K3: come funziona lo sconto del 90% sugli input
K3 supporta il caching automatico del contesto.
Gli sviluppatori non devono creare manualmente un ID di cache o un TTL. Mantenere stabili grandi prefissi tra richieste ripetute offre alle richieste successive la possibilitร di ottenere la tariffa di cache hit.
La differenza di prezzo รจ:
- Cache miss: $3.00 / 1M token di input
- Cache hit: $0.30 / 1M token di input
Quindi i token di input cache hit costano il 90% in meno rispetto ai token di input cache miss.
Tuttavia, lโoutput resta a $15 per milione di token, quindi il costo totale della richiesta non scende del 90%.
Ad esempio, supponiamo:
- 600,000 token di input
- 20,000 token di output
| Stato cache | Costo input | Costo output | Totale |
|---|---|---|---|
| Tutto lโinput cache miss | $1.80 | $0.30 | $2.10 |
| Tutto lโinput cache hit | $0.18 | $0.30 | $0.48 |
In questo caso semplificato, il costo totale scende di circa il 77%.
Il risparmio effettivo dipende dalla quota di token di input che ottiene la tariffa cache hit.
Esempio: quanto costa unโattivitร di coding su K3 vs K2.7
Supponiamo che unโattivitร di coding utilizzi:
- 200,000 token di input
- 20,000 token di output
| Percorso | Totale a freddo | Totale completamente in cache |
|---|---|---|
| kimi-k3 | $0.90 | $0.36 |
| kimi-k2.7-code | $0.27 | $0.12 |
| kimi-k2.7-code-highspeed | $0.54 | $0.24 |
Per questo carico, K3 costa circa 3,33ร rispetto a K2.7 Code standard su una richiesta a freddo.
Allโinterno di K3, passare da input interamente cache miss a input completamente in cache riduce il costo stimato della richiesta da $0.90 a $0.36, una riduzione del 60% in questo esempio.
Ma il costo per richiesta รจ solo una parte dellโequazione.
Costo per attivitร completata = Spesa totale del workflow รท Attivitร che superano i controlli di accettazione
Un confronto in produzione dovrebbe includere anche retry, chiamate di fallback, esecuzioni di tool e tempo di revisione umana.
Una richiesta K3 che riesce al primo tentativo puรฒ essere piรน economica di diversi tentativi piรน economici che falliscono.
Un caso limite reale: costo dei token di ragionamento
K3 usa sempre il ragionamento, quindi il consumo di token di output puรฒ diventare una parte significativa del conto.
In un test del giorno di lancio di Simon Willison, un prompt che chiedeva a K3 di generare un SVG ha consumato 13,241 token di ragionamento prima di produrre 3,417 token di risposta, per un costo totale di circa $0.25.
Questo รจ stato un test informale su un singolo prompt, non un benchmark, ma evidenzia unโimportante considerazione sui costi: la risposta finale visibile puรฒ rappresentare solo una parte dellโoutput fatturato.
Poichรฉ K3 attualmente supporta solo lo sforzo di ragionamento massimo, i team dovrebbero misurare lโuso reale dei token di output sui propri carichi di lavoro.
Una scelta predefinita migliore: prima K2.7, K3 in escalazione
Per carichi di lavoro di coding misti, il routing puรฒ essere piรน economico rispetto a inviare ogni richiesta direttamente a K3.
Una strategia semplice รจ:
Start with K2.7 Code
โ
Task exceeds 256K context?
โ Yes: use K3
โ No
Run task and validation
โ
Validation failed?
โ Yes: escalate to K3
โ No
Return result
Usando lโesempio precedente:
- K2.7 Code costa $0.27 per tentativo a freddo
- K3 costa $0.90
- K2.7 completa con successo il 70% delle attivitร
- Il 30% viene ritentato una volta su K3
Il costo medio diventa:
$0.27 + (30% ร $0.90) = $0.54 per task
Inviare ogni attivitร direttamente a K3 costerebbe $0.90 per task con le stesse ipotesi sui token.
Ciรฒ rende la strategia con routing piรน economica del 40% in questo scenario semplificato.
I risparmi esatti variano, ma il principio รจ utile: instrada il lavoro di routine al modello piรน economico ed esegui lโescalation quando serve davvero capacitร aggiuntiva.
Quando vale la pena passare a Kimi K3?
K3 รจ particolarmente convincente quando:
- Il contesto richiesto supera il limite di 262,144 token di K2.7 Code.
- Il compito combina codice con input visivi.
- Un agente di lunga durata deve lavorare su grandi repository e strumenti esterni.
- K2.7 richiede retry frequenti o chiamate di fallback.
- Il valore del compito รจ tale che la qualitร del completamento conta piรน del minimizzare il costo della prima chiamata.
K2.7 Code rimane unโottima opzione per attivitร di coding ripetitive e ben definite che giร raggiungono un alto tasso di successo entro 256K di contesto.
Per applicazioni di coding sensibili alla latenza, conviene testare separatamente anche K2.7 Code HighSpeed.
Migrare da K2.7 a K3: cinque verifiche tecniche
-
Il ragionamento di K3 al momento non puรฒ essere ridotto
K3 ragiona sempre e lโAPI attuale supporta solo:
reasoning_effort="max"
Poichรฉ max รจ il valore predefinito, il parametro puรฒ anche essere omesso.
-
Rimuovi i parametri
thinkingspecifici di K2
Non usare il parametro K2.x thinking con K3.
Usa invece il campo di primo livello reasoning_effort.
-
Ometti i parametri di campionamento fissi
Attualmente K3 usa valori fissi per parametri come:
temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0
Moonshot consiglia di omettere questi campi invece di sovrascriverli.
-
Conserva i messaggi completi dellโassistente
Per conversazioni multi-turn e loop di chiamata a tool, passa il messaggio completo dellโassistente nella richiesta successiva invece di conservare solo il content visibile.
-
Convalida Vision e Search prima della produzione
Lโattuale API di visione di K3 non supporta direttamente URL pubblici di immagini. Usa un formato immagine supportato come dati base64 o il meccanismo di riferimento a file di Moonshot.
Moonshot sconsiglia anche di fare affidamento sulla funzionalitร di Web Search attuale per lโuso in produzione a breve termine mentre la funzione รจ in aggiornamento.
Esempio di API Kimi K3 in Python
K3 puรฒ essere chiamato tramite unโinterfaccia API compatibile con OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are an expert software engineer.",
},
{
"role": "user",
"content": "Analyze this repository logic and identify potential issues.",
},
],
reasoning_effort="max", # Optional while "max" is the default
)
assistant_message = response.choices[0].message
print(assistant_message)
Evita di sovrascrivere i parametri di campionamento fissi di K3. Per workflow multi-turn e con chiamate a tool, conserva il messaggio completo dellโassistente.
Come valutare Kimi K3 prima dellโupgrade
Metti alla prova K3 su carichi di lavoro reali, non solo su prompt di benchmark.
Un set di valutazione pratico potrebbe includere:
- modifiche di routine ai repository
- attivitร vicine al limite di contesto 256K
- attivitร che superano 256K
- attivitร di ingegneria visiva
- attivitร agentiche o di knowledge work a lungo termine
Confronta K3, K2.7 Code e K2.7 Code HighSpeed dove applicabile.
Monitora:
- tasso di successo delle attivitร
- token di input in cache e non in cache
- token di output e di ragionamento
- retry e chiamate di fallback
- latenza p50 e p95
- errori nelle chiamate ai tool
- tempo di revisione umana
- costo per attivitร completata
Poi confronta tre politiche:
- Solo K2.7 Code
- Solo K3
- K2.7 Code con escalation su K3
La rotta migliore รจ quella che soddisfa i requisiti di qualitร e latenza al costo piรน basso per attivitร completata.
Prezzi di Kimi K3 su CometAPI
I calcoli sopra usano i prezzi ufficiali dellโAPI di Moonshot AI per mantenere coerente il confronto tra K3 e K2.7.
Al momento della pubblicazione, Kimi K3 su CometAPI รจ prezzato al 20% in meno rispetto alle tariffe API standard di Moonshot AI:
| Percorso | Input | Output |
|---|---|---|
| Moonshot AI | $3.00 / 1M | $15.00 / 1M |
| CometAPI | $2.40 / 1M | $12.00 / 1M |
Poichรฉ i prezzi API possono cambiare, verifica la pagina live del modello prima di usare queste cifre per il budgeting in produzione.
LโAPI compatibile con OpenAI di CometAPI facilita il test di kimi-k3 insieme ad altri percorsi modello usando gli stessi prompt e lo stesso workflow di valutazione.
Pronti a testare Kimi K3? Vedi Kimi K3 su CometAPI e confronta i prezzi prima di portarlo in produzione.
Per esempi di integrazione e valutazione, consulta il Cookbook di CometAPI su GitHub.
FAQ
Quanto costa lโAPI Kimi K3?
Moonshot AI indica Kimi K3 a $0.30 per 1 milione di token di input cache hit, $3.00 per 1 milione di token di input cache miss e $15.00 per 1 milione di token di output.
LโID del modello API รจ kimi-k3.
Kimi K3 รจ piรน economico di Kimi K2.7 Code?
No. In base alle tariffe ufficiali di Moonshot, K3 costa circa 3,16ร per lโinput cache miss e 3,75ร per lโoutput.
Puรฒ comunque ridurre i costi del workflow se migliora il tasso di successo o riduce i retry.
Kimi K3 ha una finestra di contesto da 1M token?
Sรฌ. Kimi K3 supporta una finestra di contesto da 1,048,576 token, rispetto ai 262,144 token di Kimi K2.7 Code.
Kimi K3 supporta il caching automatico del contesto?
Sรฌ. Il caching del contesto รจ automatico. I token di input cache hit costano $0.30 per milione rispetto a $3.00 per milione per i token di input cache miss.
Posso disattivare il ragionamento di Kimi K3 per ridurre i costi?
Al momento no. K3 usa sempre il ragionamento e reasoning_effort="max" รจ lโunico livello di sforzo di ragionamento supportato.
Considerazioni finali
Kimi K3 offre un contesto sostanzialmente piรน ampio e capacitร piรน estese rispetto a K2.7 Code, ma a un prezzo per token piรน alto.
Per il coding di routine entro 256K di contesto, K2.7 Code รจ di solito la scelta piรน economica. Per attivitร con lungo contesto, multimodali o agentiche difficili, K3 puรฒ giustificare il suo premiumโsoprattutto quando migliora il completamento con successo.
Per molti sistemi di produzione, la strategia piรน efficiente non รจ quindi sostituire completamente K2.7, ma usare K2.7 come predefinito e K3 come percorso di escalation.
La metrica che conta davvero non รจ il costo per chiamata API, ma il costo per attivitร completata.
