Kimi K3 is now live on CometAPI โ†’

Prezzi dell'API Kimi K3 (2026): quanto costa & confronto con K2.7 Code

CometAPI
Mia MarenJul 17, 2026
Prezzi dell'API Kimi K3 (2026): quanto costa & confronto con K2.7 Code

TL;DR

Kimi K3 costa $0.30 per 1M token di input cache hit, $3.00 per 1M token di input cache miss e $15.00 per 1M token di output, con una finestra di contesto da 1,048,576 token.

Rispetto a K2.7 Code, K3 รจ significativamente piรน costoso per token, ma offre una finestra di contesto 4ร— piรน ampia, visione nativa e un supporto piรน solido per carichi di lavoro agentici a lungo termine.

In sintesi: K2.7 Code rimane la scelta piรน economica per le attivitร  di coding di routine entro 256K di contesto. Usa K3 quando serve un contesto piรน grande, capacitร  multimodali o come percorso di escalation per attivitร  che K2.7 non completa in modo affidabile.

Panoramica dei prezzi dell'API Kimi K3

VoceKimi K3
ID del modello APIkimi-k3
Input cache hit$0.30 / 1M token
Input cache miss$3.00 / 1M token
Output$15.00 / 1M token
Finestra di contesto1,048,576 token
RagionamentoSempre attivo
Livello di ragionamento supportatosolo massimo
Completamento massimo predefinito131,072 token
Completamento massimo configurabileFino a 1,048,576 token, soggetto al limite di contesto totale
Funzionalitร  principaliVisione nativa, chiamate a tool, output strutturato, Partial Mode, caricamento dinamico degli strumenti, caching automatico del contesto
Batch APIK3 non รจ attualmente elencato tra i modelli Batch supportati

Consulta la Guida rapida Kimi K3 di Moonshot per i parametri API aggiornati e i dettagli di integrazione.

Cosa aggiunge Kimi K3 rispetto a K2.7 Code

Lโ€™aggiornamento piรน evidente รจ la lunghezza del contesto.

K2.7 Code supporta 262,144 token, mentre K3 porta il limite a 1,048,576 token. Questo rende K3 piรน pratico per grandi repository, lunghe storie di agenti, documentazione estesa e workflow che altrimenti richiederebbero riduzione del contesto.

K3 supporta anche:

  • comprensione visiva nativa
  • output strutturato rigoroso
  • tool_choice
  • caricamento dinamico degli strumenti
  • caching automatico del contesto
  • workflow di coding e knowledge work di lunga durata

Il blog tecnico Kimi K3 di Moonshot riporta 88.3 su Terminal-Bench 2.1, 77.8 su Program Bench e 81.2 su FrontierSWE.

Si tratta di benchmark riportati dal provider e andrebbero considerati come motivi per valutare K3, non come garanzia che supererร  K2.7 Code in ogni carico di lavoro di produzione.

Per informazioni sulla generazione precedente, vedi la Guida allโ€™API Kimi K2 di CometAPI.

Prezzi: Kimi K3 vs Kimi K2.7 Code

ModelloInput cache hitInput cache missOutputContesto
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Le tariffe K2.7 provengono dalla documentazione ufficiale dei prezzi di Kimi K2.7 Code di Moonshot.

Rispetto a K2.7 Code standard, K3 รจ:

  • 1,58ร— il prezzo per lโ€™input cache hit
  • 3,16ร— il prezzo per lโ€™input cache miss
  • 3,75ร— il prezzo per lโ€™output

Il premium di K3 รจ piรน contenuto rispetto a K2.7 Code HighSpeed, ma i due modelli hanno prioritร  diverse: HighSpeed punta a output di coding piรน rapidi, mentre K3 รจ rivolto a carichi di lavoro piรน esigenti in termini di lungo contesto e agenticitร .

La documentazione attuale dei prezzi del Batch API di Moonshot non elenca K3, quindi non dare per scontato che gli sconti Batch disponibili per altri modelli Kimi si applichino anche qui.

Caching del contesto in Kimi K3: come funziona lo sconto del 90% sugli input

K3 supporta il caching automatico del contesto.

Gli sviluppatori non devono creare manualmente un ID di cache o un TTL. Mantenere stabili grandi prefissi tra richieste ripetute offre alle richieste successive la possibilitร  di ottenere la tariffa di cache hit.

La differenza di prezzo รจ:

  • Cache miss: $3.00 / 1M token di input
  • Cache hit: $0.30 / 1M token di input

Quindi i token di input cache hit costano il 90% in meno rispetto ai token di input cache miss.

Tuttavia, lโ€™output resta a $15 per milione di token, quindi il costo totale della richiesta non scende del 90%.

Ad esempio, supponiamo:

  • 600,000 token di input
  • 20,000 token di output
Stato cacheCosto inputCosto outputTotale
Tutto lโ€™input cache miss$1.80$0.30$2.10
Tutto lโ€™input cache hit$0.18$0.30$0.48

In questo caso semplificato, il costo totale scende di circa il 77%.

Il risparmio effettivo dipende dalla quota di token di input che ottiene la tariffa cache hit.

Esempio: quanto costa unโ€™attivitร  di coding su K3 vs K2.7

Supponiamo che unโ€™attivitร  di coding utilizzi:

  • 200,000 token di input
  • 20,000 token di output
PercorsoTotale a freddoTotale completamente in cache
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Per questo carico, K3 costa circa 3,33ร— rispetto a K2.7 Code standard su una richiesta a freddo.

Allโ€™interno di K3, passare da input interamente cache miss a input completamente in cache riduce il costo stimato della richiesta da $0.90 a $0.36, una riduzione del 60% in questo esempio.

Ma il costo per richiesta รจ solo una parte dellโ€™equazione.

Costo per attivitร  completata = Spesa totale del workflow รท Attivitร  che superano i controlli di accettazione

Un confronto in produzione dovrebbe includere anche retry, chiamate di fallback, esecuzioni di tool e tempo di revisione umana.

Una richiesta K3 che riesce al primo tentativo puรฒ essere piรน economica di diversi tentativi piรน economici che falliscono.

Un caso limite reale: costo dei token di ragionamento

K3 usa sempre il ragionamento, quindi il consumo di token di output puรฒ diventare una parte significativa del conto.

In un test del giorno di lancio di Simon Willison, un prompt che chiedeva a K3 di generare un SVG ha consumato 13,241 token di ragionamento prima di produrre 3,417 token di risposta, per un costo totale di circa $0.25.

Questo รจ stato un test informale su un singolo prompt, non un benchmark, ma evidenzia unโ€™importante considerazione sui costi: la risposta finale visibile puรฒ rappresentare solo una parte dellโ€™output fatturato.

Poichรฉ K3 attualmente supporta solo lo sforzo di ragionamento massimo, i team dovrebbero misurare lโ€™uso reale dei token di output sui propri carichi di lavoro.

Una scelta predefinita migliore: prima K2.7, K3 in escalazione

Per carichi di lavoro di coding misti, il routing puรฒ essere piรน economico rispetto a inviare ogni richiesta direttamente a K3.

Una strategia semplice รจ:

Start with K2.7 Code
        โ†“
Task exceeds 256K context?
        โ†’ Yes: use K3
        โ†“ No
Run task and validation
        โ†“
Validation failed?
        โ†’ Yes: escalate to K3
        โ†“ No
Return result

Usando lโ€™esempio precedente:

  • K2.7 Code costa $0.27 per tentativo a freddo
  • K3 costa $0.90
  • K2.7 completa con successo il 70% delle attivitร 
  • Il 30% viene ritentato una volta su K3

Il costo medio diventa:

$0.27 + (30% ร— $0.90) = $0.54 per task

Inviare ogni attivitร  direttamente a K3 costerebbe $0.90 per task con le stesse ipotesi sui token.

Ciรฒ rende la strategia con routing piรน economica del 40% in questo scenario semplificato.

I risparmi esatti variano, ma il principio รจ utile: instrada il lavoro di routine al modello piรน economico ed esegui lโ€™escalation quando serve davvero capacitร  aggiuntiva.

Quando vale la pena passare a Kimi K3?

K3 รจ particolarmente convincente quando:

  • Il contesto richiesto supera il limite di 262,144 token di K2.7 Code.
  • Il compito combina codice con input visivi.
  • Un agente di lunga durata deve lavorare su grandi repository e strumenti esterni.
  • K2.7 richiede retry frequenti o chiamate di fallback.
  • Il valore del compito รจ tale che la qualitร  del completamento conta piรน del minimizzare il costo della prima chiamata.

K2.7 Code rimane unโ€™ottima opzione per attivitร  di coding ripetitive e ben definite che giร  raggiungono un alto tasso di successo entro 256K di contesto.

Per applicazioni di coding sensibili alla latenza, conviene testare separatamente anche K2.7 Code HighSpeed.

Migrare da K2.7 a K3: cinque verifiche tecniche

  1. Il ragionamento di K3 al momento non puรฒ essere ridotto

K3 ragiona sempre e lโ€™API attuale supporta solo:

reasoning_effort="max"

Poichรฉ max รจ il valore predefinito, il parametro puรฒ anche essere omesso.

  1. Rimuovi i parametri thinking specifici di K2

Non usare il parametro K2.x thinking con K3.

Usa invece il campo di primo livello reasoning_effort.

  1. Ometti i parametri di campionamento fissi

Attualmente K3 usa valori fissi per parametri come:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot consiglia di omettere questi campi invece di sovrascriverli.

  1. Conserva i messaggi completi dellโ€™assistente

Per conversazioni multi-turn e loop di chiamata a tool, passa il messaggio completo dellโ€™assistente nella richiesta successiva invece di conservare solo il content visibile.

  1. Convalida Vision e Search prima della produzione

Lโ€™attuale API di visione di K3 non supporta direttamente URL pubblici di immagini. Usa un formato immagine supportato come dati base64 o il meccanismo di riferimento a file di Moonshot.

Moonshot sconsiglia anche di fare affidamento sulla funzionalitร  di Web Search attuale per lโ€™uso in produzione a breve termine mentre la funzione รจ in aggiornamento.

Esempio di API Kimi K3 in Python

K3 puรฒ essere chiamato tramite unโ€™interfaccia API compatibile con OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Evita di sovrascrivere i parametri di campionamento fissi di K3. Per workflow multi-turn e con chiamate a tool, conserva il messaggio completo dellโ€™assistente.

Come valutare Kimi K3 prima dellโ€™upgrade

Metti alla prova K3 su carichi di lavoro reali, non solo su prompt di benchmark.

Un set di valutazione pratico potrebbe includere:

  • modifiche di routine ai repository
  • attivitร  vicine al limite di contesto 256K
  • attivitร  che superano 256K
  • attivitร  di ingegneria visiva
  • attivitร  agentiche o di knowledge work a lungo termine

Confronta K3, K2.7 Code e K2.7 Code HighSpeed dove applicabile.

Monitora:

  • tasso di successo delle attivitร 
  • token di input in cache e non in cache
  • token di output e di ragionamento
  • retry e chiamate di fallback
  • latenza p50 e p95
  • errori nelle chiamate ai tool
  • tempo di revisione umana
  • costo per attivitร  completata

Poi confronta tre politiche:

  1. Solo K2.7 Code
  2. Solo K3
  3. K2.7 Code con escalation su K3

La rotta migliore รจ quella che soddisfa i requisiti di qualitร  e latenza al costo piรน basso per attivitร  completata.

Prezzi di Kimi K3 su CometAPI

I calcoli sopra usano i prezzi ufficiali dellโ€™API di Moonshot AI per mantenere coerente il confronto tra K3 e K2.7.

Al momento della pubblicazione, Kimi K3 su CometAPI รจ prezzato al 20% in meno rispetto alle tariffe API standard di Moonshot AI:

PercorsoInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Poichรฉ i prezzi API possono cambiare, verifica la pagina live del modello prima di usare queste cifre per il budgeting in produzione.

Lโ€™API compatibile con OpenAI di CometAPI facilita il test di kimi-k3 insieme ad altri percorsi modello usando gli stessi prompt e lo stesso workflow di valutazione.

Pronti a testare Kimi K3? Vedi Kimi K3 su CometAPI e confronta i prezzi prima di portarlo in produzione.

Per esempi di integrazione e valutazione, consulta il Cookbook di CometAPI su GitHub.

FAQ

Quanto costa lโ€™API Kimi K3?

Moonshot AI indica Kimi K3 a $0.30 per 1 milione di token di input cache hit, $3.00 per 1 milione di token di input cache miss e $15.00 per 1 milione di token di output.

Lโ€™ID del modello API รจ kimi-k3.

Kimi K3 รจ piรน economico di Kimi K2.7 Code?

No. In base alle tariffe ufficiali di Moonshot, K3 costa circa 3,16ร— per lโ€™input cache miss e 3,75ร— per lโ€™output.

Puรฒ comunque ridurre i costi del workflow se migliora il tasso di successo o riduce i retry.

Kimi K3 ha una finestra di contesto da 1M token?

Sรฌ. Kimi K3 supporta una finestra di contesto da 1,048,576 token, rispetto ai 262,144 token di Kimi K2.7 Code.

Kimi K3 supporta il caching automatico del contesto?

Sรฌ. Il caching del contesto รจ automatico. I token di input cache hit costano $0.30 per milione rispetto a $3.00 per milione per i token di input cache miss.

Posso disattivare il ragionamento di Kimi K3 per ridurre i costi?

Al momento no. K3 usa sempre il ragionamento e reasoning_effort="max" รจ lโ€™unico livello di sforzo di ragionamento supportato.

Considerazioni finali

Kimi K3 offre un contesto sostanzialmente piรน ampio e capacitร  piรน estese rispetto a K2.7 Code, ma a un prezzo per token piรน alto.

Per il coding di routine entro 256K di contesto, K2.7 Code รจ di solito la scelta piรน economica. Per attivitร  con lungo contesto, multimodali o agentiche difficili, K3 puรฒ giustificare il suo premiumโ€”soprattutto quando migliora il completamento con successo.

Per molti sistemi di produzione, la strategia piรน efficiente non รจ quindi sostituire completamente K2.7, ma usare K2.7 come predefinito e K3 come percorso di escalation.

La metrica che conta davvero non รจ il costo per chiamata API, ma il costo per attivitร  completata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di piรน