GPT-6 Astra is now live on CometAPI →
ai-model/Ricerca CometAPI

Prezzi dell'API Kimi K3 (2026): quanto costa & confronto con K2.7 Code

Le tariffe dell'API Kimi K3 sono $0.30 per input memorizzato nella cache, $3 per input non memorizzato nella cache e $15 per output per 1M di token. Confronta K3 vs K2.7 Code, i costi della memorizzazione nella cache e l'economia dell'upgrade.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Sep 3, 2026 11 min di lettura
Prezzi dell'API Kimi K3 (2026): quanto costa & confronto con K2.7 Code
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Kimi K3 costa $0.30 per 1M token di input cache hit, $3.00 per 1M token di input cache miss e $15.00 per 1M token di output, con una finestra di contesto da 1,048,576 token.

Rispetto a K2.7 Code, K3 è significativamente più costoso per token, ma offre una finestra di contesto 4× più ampia, visione nativa e un supporto più solido per carichi di lavoro agentici a lungo termine.

In sintesi: K2.7 Code rimane la scelta più economica per le attività di coding di routine entro 256K di contesto. Usa K3 quando serve un contesto più grande, capacità multimodali o come percorso di escalation per attività che K2.7 non completa in modo affidabile.

Panoramica dei prezzi dell'API Kimi K3

VoceKimi K3
ID del modello APIkimi-k3
Input cache hit$0.30 / 1M token
Input cache miss$3.00 / 1M token
Output$15.00 / 1M token
Finestra di contesto1,048,576 token
RagionamentoSempre attivo
Livello di ragionamento supportatosolo massimo
Completamento massimo predefinito131,072 token
Completamento massimo configurabileFino a 1,048,576 token, soggetto al limite di contesto totale
Funzionalità principaliVisione nativa, chiamate a tool, output strutturato, Partial Mode, caricamento dinamico degli strumenti, caching automatico del contesto
Batch APIK3 non è attualmente elencato tra i modelli Batch supportati

Consulta la Guida rapida Kimi K3 di Moonshot per i parametri API aggiornati e i dettagli di integrazione.

Cosa aggiunge Kimi K3 rispetto a K2.7 Code

L’aggiornamento più evidente è la lunghezza del contesto.

K2.7 Code supporta 262,144 token, mentre K3 porta il limite a 1,048,576 token. Questo rende K3 più pratico per grandi repository, lunghe storie di agenti, documentazione estesa e workflow che altrimenti richiederebbero riduzione del contesto.

K3 supporta anche:

  • comprensione visiva nativa
  • output strutturato rigoroso
  • tool_choice
  • caricamento dinamico degli strumenti
  • caching automatico del contesto
  • workflow di coding e knowledge work di lunga durata

Il blog tecnico Kimi K3 di Moonshot riporta 88.3 su Terminal-Bench 2.1, 77.8 su Program Bench e 81.2 su FrontierSWE.

Si tratta di benchmark riportati dal provider e andrebbero considerati come motivi per valutare K3, non come garanzia che supererà K2.7 Code in ogni carico di lavoro di produzione.

Per informazioni sulla generazione precedente, vedi la Guida all’API Kimi K2 di CometAPI.

Prezzi: Kimi K3 vs Kimi K2.7 Code

ModelloInput cache hitInput cache missOutputContesto
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Le tariffe K2.7 provengono dalla documentazione ufficiale dei prezzi di Kimi K2.7 Code di Moonshot.

Rispetto a K2.7 Code standard, K3 è:

  • 1,58× il prezzo per l’input cache hit
  • 3,16× il prezzo per l’input cache miss
  • 3,75× il prezzo per l’output

Il premium di K3 è più contenuto rispetto a K2.7 Code HighSpeed, ma i due modelli hanno priorità diverse: HighSpeed punta a output di coding più rapidi, mentre K3 è rivolto a carichi di lavoro più esigenti in termini di lungo contesto e agenticità.

La documentazione attuale dei prezzi del Batch API di Moonshot non elenca K3, quindi non dare per scontato che gli sconti Batch disponibili per altri modelli Kimi si applichino anche qui.

Caching del contesto in Kimi K3: come funziona lo sconto del 90% sugli input

K3 supporta il caching automatico del contesto.

Gli sviluppatori non devono creare manualmente un ID di cache o un TTL. Mantenere stabili grandi prefissi tra richieste ripetute offre alle richieste successive la possibilità di ottenere la tariffa di cache hit.

La differenza di prezzo è:

  • Cache miss: $3.00 / 1M token di input
  • Cache hit: $0.30 / 1M token di input

Quindi i token di input cache hit costano il 90% in meno rispetto ai token di input cache miss.

Tuttavia, l’output resta a $15 per milione di token, quindi il costo totale della richiesta non scende del 90%.

Ad esempio, supponiamo:

  • 600,000 token di input
  • 20,000 token di output
Stato cacheCosto inputCosto outputTotale
Tutto l’input cache miss$1.80$0.30$2.10
Tutto l’input cache hit$0.18$0.30$0.48

In questo caso semplificato, il costo totale scende di circa il 77%.

Il risparmio effettivo dipende dalla quota di token di input che ottiene la tariffa cache hit.

Esempio: quanto costa un’attività di coding su K3 vs K2.7

Supponiamo che un’attività di coding utilizzi:

  • 200,000 token di input
  • 20,000 token di output
PercorsoTotale a freddoTotale completamente in cache
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Per questo carico, K3 costa circa 3,33× rispetto a K2.7 Code standard su una richiesta a freddo.

All’interno di K3, passare da input interamente cache miss a input completamente in cache riduce il costo stimato della richiesta da $0.90 a $0.36, una riduzione del 60% in questo esempio.

Ma il costo per richiesta è solo una parte dell’equazione.

Costo per attività completata = Spesa totale del workflow ÷ Attività che superano i controlli di accettazione

Un confronto in produzione dovrebbe includere anche retry, chiamate di fallback, esecuzioni di tool e tempo di revisione umana.

Una richiesta K3 che riesce al primo tentativo può essere più economica di diversi tentativi più economici che falliscono.

Un caso limite reale: costo dei token di ragionamento

K3 usa sempre il ragionamento, quindi il consumo di token di output può diventare una parte significativa del conto.

In un test del giorno di lancio di Simon Willison, un prompt che chiedeva a K3 di generare un SVG ha consumato 13,241 token di ragionamento prima di produrre 3,417 token di risposta, per un costo totale di circa $0.25.

Questo è stato un test informale su un singolo prompt, non un benchmark, ma evidenzia un’importante considerazione sui costi: la risposta finale visibile può rappresentare solo una parte dell’output fatturato.

Poiché K3 attualmente supporta solo lo sforzo di ragionamento massimo, i team dovrebbero misurare l’uso reale dei token di output sui propri carichi di lavoro.

Una scelta predefinita migliore: prima K2.7, K3 in escalazione

Per carichi di lavoro di coding misti, il routing può essere più economico rispetto a inviare ogni richiesta direttamente a K3.

Una strategia semplice è:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Usando l’esempio precedente:

  • K2.7 Code costa $0.27 per tentativo a freddo
  • K3 costa $0.90
  • K2.7 completa con successo il 70% delle attività
  • Il 30% viene ritentato una volta su K3

Il costo medio diventa:

$0.27 + (30% × $0.90) = $0.54 per task

Inviare ogni attività direttamente a K3 costerebbe $0.90 per task con le stesse ipotesi sui token.

Ciò rende la strategia con routing più economica del 40% in questo scenario semplificato.

I risparmi esatti variano, ma il principio è utile: instrada il lavoro di routine al modello più economico ed esegui l’escalation quando serve davvero capacità aggiuntiva.

Quando vale la pena passare a Kimi K3?

K3 è particolarmente convincente quando:

  • Il contesto richiesto supera il limite di 262,144 token di K2.7 Code.
  • Il compito combina codice con input visivi.
  • Un agente di lunga durata deve lavorare su grandi repository e strumenti esterni.
  • K2.7 richiede retry frequenti o chiamate di fallback.
  • Il valore del compito è tale che la qualità del completamento conta più del minimizzare il costo della prima chiamata.

K2.7 Code rimane un’ottima opzione per attività di coding ripetitive e ben definite che già raggiungono un alto tasso di successo entro 256K di contesto.

Per applicazioni di coding sensibili alla latenza, conviene testare separatamente anche K2.7 Code HighSpeed.

Migrare da K2.7 a K3: cinque verifiche tecniche

  1. Il ragionamento di K3 al momento non può essere ridotto

K3 ragiona sempre e l’API attuale supporta solo:

reasoning_effort="max"

Poiché max è il valore predefinito, il parametro può anche essere omesso.

  1. Rimuovi i parametri thinking specifici di K2

Non usare il parametro K2.x thinking con K3.

Usa invece il campo di primo livello reasoning_effort.

  1. Ometti i parametri di campionamento fissi

Attualmente K3 usa valori fissi per parametri come:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot consiglia di omettere questi campi invece di sovrascriverli.

  1. Conserva i messaggi completi dell’assistente

Per conversazioni multi-turn e loop di chiamata a tool, passa il messaggio completo dell’assistente nella richiesta successiva invece di conservare solo il content visibile.

  1. Convalida Vision e Search prima della produzione

L’attuale API di visione di K3 non supporta direttamente URL pubblici di immagini. Usa un formato immagine supportato come dati base64 o il meccanismo di riferimento a file di Moonshot.

Moonshot sconsiglia anche di fare affidamento sulla funzionalità di Web Search attuale per l’uso in produzione a breve termine mentre la funzione è in aggiornamento.

Esempio di API Kimi K3 in Python

K3 può essere chiamato tramite un’interfaccia API compatibile con OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Evita di sovrascrivere i parametri di campionamento fissi di K3. Per workflow multi-turn e con chiamate a tool, conserva il messaggio completo dell’assistente.

Come valutare Kimi K3 prima dell’upgrade

Metti alla prova K3 su carichi di lavoro reali, non solo su prompt di benchmark.

Un set di valutazione pratico potrebbe includere:

  • modifiche di routine ai repository
  • attività vicine al limite di contesto 256K
  • attività che superano 256K
  • attività di ingegneria visiva
  • attività agentiche o di knowledge work a lungo termine

Confronta K3, K2.7 Code e K2.7 Code HighSpeed dove applicabile.

Monitora:

  • tasso di successo delle attività
  • token di input in cache e non in cache
  • token di output e di ragionamento
  • retry e chiamate di fallback
  • latenza p50 e p95
  • errori nelle chiamate ai tool
  • tempo di revisione umana
  • costo per attività completata

Poi confronta tre politiche:

  1. Solo K2.7 Code
  2. Solo K3
  3. K2.7 Code con escalation su K3

La rotta migliore è quella che soddisfa i requisiti di qualità e latenza al costo più basso per attività completata.

Prezzi di Kimi K3 su CometAPI

I calcoli sopra usano i prezzi ufficiali dell’API di Moonshot AI per mantenere coerente il confronto tra K3 e K2.7.

Al momento della pubblicazione, Kimi K3 su CometAPI è prezzato al 20% in meno rispetto alle tariffe API standard di Moonshot AI:

PercorsoInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Poiché i prezzi API possono cambiare, verifica la pagina live del modello prima di usare queste cifre per il budgeting in produzione.

L’API compatibile con OpenAI di CometAPI facilita il test di kimi-k3 insieme ad altri percorsi modello usando gli stessi prompt e lo stesso workflow di valutazione.

Pronti a testare Kimi K3? Vedi Kimi K3 su CometAPI e confronta i prezzi prima di portarlo in produzione.

Per esempi di integrazione e valutazione, consulta il Cookbook di CometAPI su GitHub.

FAQ

Quanto costa l’API Kimi K3?

Moonshot AI indica Kimi K3 a $0.30 per 1 milione di token di input cache hit, $3.00 per 1 milione di token di input cache miss e $15.00 per 1 milione di token di output.

L’ID del modello API è kimi-k3.

Kimi K3 è più economico di Kimi K2.7 Code?

No. In base alle tariffe ufficiali di Moonshot, K3 costa circa 3,16× per l’input cache miss e 3,75× per l’output.

Può comunque ridurre i costi del workflow se migliora il tasso di successo o riduce i retry.

Kimi K3 ha una finestra di contesto da 1M token?

Sì. Kimi K3 supporta una finestra di contesto da 1,048,576 token, rispetto ai 262,144 token di Kimi K2.7 Code.

Kimi K3 supporta il caching automatico del contesto?

Sì. Il caching del contesto è automatico. I token di input cache hit costano $0.30 per milione rispetto a $3.00 per milione per i token di input cache miss.

Posso disattivare il ragionamento di Kimi K3 per ridurre i costi?

Al momento no. K3 usa sempre il ragionamento e reasoning_effort="max" è l’unico livello di sforzo di ragionamento supportato.

Considerazioni finali

Kimi K3 offre un contesto sostanzialmente più ampio e capacità più estese rispetto a K2.7 Code, ma a un prezzo per token più alto.

Per il coding di routine entro 256K di contesto, K2.7 Code è di solito la scelta più economica. Per attività con lungo contesto, multimodali o agentiche difficili, K3 può giustificare il suo premium—soprattutto quando migliora il completamento con successo.

Per molti sistemi di produzione, la strategia più efficiente non è quindi sostituire completamente K2.7, ma usare K2.7 come predefinito e K3 come percorso di escalation.

La metrica che conta davvero non è il costo per chiamata API, ma il costo per attività completata.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Jul 17, 2026
Ultimo aggiornamento Sep 3, 2026
1,522 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più