Kimi K3 is now live on CometAPI โ†’

Kimi K3 API-prijzen (2026): Wat kost het & K2.7-codevergelijking

CometAPI
Mia MarenJul 17, 2026
Kimi K3 API-prijzen (2026): Wat kost het & K2.7-codevergelijking

TL;DR

Kimi K3 kost $0.30 per 1M cache-treffer-invoertokens, $3.00 per 1M cache-miss-invoertokens en $15.00 per 1M uitvoertokens, met een 1,048,576-token contextvenster.

Vergeleken met K2.7 Code is K3 per token aanzienlijk duurder, maar biedt een 4ร— groter contextvenster plus native vision en sterkere ondersteuning voor langetermijn agentische workloads.

Kort gezegd: K2.7 Code blijft de meer economische keuze voor routinetaken in codering binnen 256K context. Gebruik K3 wanneer je grotere context, multimodale mogelijkheden nodig hebt, of als escalatieroute voor taken die K2.7 niet betrouwbaar kan afronden.

Kimi K3 API-prijzen in รฉรฉn oogopslag

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningAltijd ingeschakeld
Supported reasoning effortalleen "max"
Default maximum completion131,072 tokens
Configurable maximum completionTot 1,048,576 tokens, onder voorbehoud van de totale contextlimiet
Key capabilitiesNative vision, tool-calls, gestructureerde output, Partial Mode, dynamisch laden van tools, automatische contextcaching
Batch APIK3 staat momenteel niet vermeld bij de ondersteunde Batch-modellen

Zie Moonshot's Kimi K3 quickstart voor actuele API-parameters en integratiedetails.

Wat Kimi K3 toevoegt ten opzichte van K2.7 Code

De meest duidelijke upgrade is de contextlengte.

K2.7 Code ondersteunt 262,144 tokens, terwijl K3 die limiet verhoogt tot 1,048,576 tokens. Dit maakt K3 praktischer voor grote repositories, lange agentgeschiedenissen, uitgebreide documentatie en workflows die anders contextreductie zouden vereisen.

K3 ondersteunt ook:

  • native visuele interpretatie
  • strikt gestructureerde output
  • tool_choice
  • dynamisch laden van tools
  • automatische contextcaching
  • langlopende code- en kenniswerkworkflows

Moonshot's Kimi K3 technical blog rapporteert 88.3 op Terminal-Bench 2.1, 77.8 op Program Bench en 81.2 op FrontierSWE.

Dit zijn door de provider gerapporteerde benchmarks en moeten worden gezien als redenen om K3 te evaluerenโ€”niet als garanties dat het K2.7 Code bij elke productie-workload zal overtreffen.

Voor achtergrond over de vorige generatie, zie CometAPI's Kimi K2 API guide.

Kimi K3 vs Kimi K2.7 Code prijsstelling

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

De K2.7-tarieven komen uit Moonshot's officiรซle Kimi K2.7 Code prijsdocumentatie.

Vergeleken met standaard K2.7 Code is K3:

  • 1.58ร— de prijs voor cache-treffer-invoer
  • 3.16ร— de prijs voor cache-miss-invoer
  • 3.75ร— de prijs voor output

K3's premium is kleiner ten opzichte van K2.7 Code HighSpeed, maar de twee modellen richten zich op verschillende prioriteiten: HighSpeed focust op snellere code-output, terwijl K3 gericht is op veeleisende long-context en agentische workloads.

Moonshot's huidige Batch API prijsdocumentatie vermeldt K3 niet, dus ga er niet van uit dat Batch-kortingen die voor andere Kimi-modellen gelden hier ook van toepassing zijn.

Kimi K3 contextcaching: hoe de 90% invoerkorting werkt

K3 ondersteunt automatische contextcaching.

Ontwikkelaars hoeven niet handmatig een cache-ID of TTL aan te maken. Door grote prefixes stabiel te houden over herhaalde requests krijgen latere requests de kans om het cache-treffer-tarief te ontvangen.

Het prijsverschil is:

  • Cache-miss: $3.00 / 1M invoertokens
  • Cache-treffer: $0.30 / 1M invoertokens

Dus invoertokens bij cache-treffer kosten 90% minder dan invoertokens bij cache-miss.

Output blijft echter geprijsd op $15 per miljoen tokens, dus de totale requestkosten dalen niet met 90%.

Bijvoorbeeld, neem aan:

  • 600,000 invoertokens
  • 20,000 uitvoertokens
CachestatusInvoerkostenUitvoerkostenTotaal
Alle invoer cache-miss$1.80$0.30$2.10
Alle invoer cache-treffer$0.18$0.30$0.48

In dit vereenvoudigde geval daalt de totale kosten met ongeveer 77%.

De daadwerkelijke besparing hangt af van het aandeel invoertokens dat het cache-treffer-tarief krijgt.

Voorbeeld: wat een coderingstaak kost op K3 vs K2.7

Neem aan dat een coderingstaak gebruikt:

  • 200,000 invoertokens
  • 20,000 uitvoertokens
RouteTotaal (cold)Totaal (volledig gecached)
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Voor deze workload kost K3 ongeveer 3.33ร— zoveel als standaard K2.7 Code bij een cold request.

Binnen K3 zelf verlaagt het overschakelen van volledig cache-miss-invoer naar volledig gecachede invoer de geschatte requestkosten van $0.90 naar $0.36, een reductie van 60% in dit voorbeeld.

Maar de kosten per aanvraag zijn slechts een deel van de vergelijking.

Kosten per succesvolle taak = totale workflowuitgaven รท taken die de acceptatiecontroles halen

Een productievergelijking moet ook retries, fallback-calls, tool-executies en tijd voor menselijke review omvatten.

Een K3-aanroep die in รฉรฉn keer slaagt kan economischer zijn dan meerdere goedkopere pogingen die falen.

Een praktijkrandgeval: kosten van redeneertokens

K3 gebruikt altijd redeneren, dus verbruik van uitvoertokens kan een betekenisvol deel van de rekening worden.

In een launch-day test door Simon Willison verbruikte een prompt die K3 vroeg een SVG te genereren 13,241 redeneertokens voordat 3,417 responstokens werden geproduceerd, voor een totale kost van ongeveer $0.25.

Dit was een informele test met รฉรฉn prompt en geen benchmark, maar het benadrukt een belangrijke kostoverweging: het zichtbare eindantwoord kan slechts een deel van de gefactureerde output vertegenwoordigen.

Omdat K3 momenteel alleen maximale redeneerinspanning ondersteunt, moeten teams hun daadwerkelijke verbruik van uitvoertokens op eigen workloads meten.

Een betere standaard: eerst K2.7, naar K3 bij escalatie

Voor gemengde codeerworkloads kan routering economischer zijn dan elke request direct naar K3 sturen.

Een eenvoudige strategie is:

Start with K2.7 Code
        โ†“
Task exceeds 256K context?
        โ†’ Yes: use K3
        โ†“ No
Run task and validation
        โ†“
Validation failed?
        โ†’ Yes: escalate to K3
        โ†“ No
Return result

Gebruikmakend van het vorige voorbeeld:

  • K2.7 Code kost $0.27 per cold poging
  • K3 kost $0.90
  • K2.7 rondt 70% van de taken succesvol af
  • 30% wordt รฉรฉn keer opnieuw geprobeerd op K3

De gemiddelde kost wordt:

$0.27 + (30% ร— $0.90) = $0.54 per task

Elke taak direct naar K3 sturen zou $0.90 per taak kosten onder dezelfde tokenaannames.

Dat maakt de gerouteerde strategie 40% goedkoper in dit vereenvoudigde scenario.

De exacte besparing zal variรซren, maar het principe is nuttig: routeer routinewerk naar het goedkopere model en escaleer wanneer extra capaciteit daadwerkelijk nodig is.

Wanneer is Kimi K3 de upgrade waard?

K3 is het meest overtuigend wanneer:

  • De vereiste context de limiet van 262,144 tokens van K2.7 Code overschrijdt.
  • De taak code combineert met visuele input.
  • Een langlopende agent over grote repositories en externe tools moet werken.
  • K2.7 frequente retries of fallback-calls vereist.
  • De taak waardevol genoeg is dat afrondingskwaliteit belangrijker is dan het minimaliseren van de kosten van de eerste call.

K2.7 Code blijft een sterke optie voor repetitieve, goed afgebakende coderingstaken die al een hoge succesratio behalen binnen 256K context.

Voor latentiegevoelige codetoepassingen moet K2.7 Code HighSpeed ook afzonderlijk worden getest.

Migreren van K2.7 naar K3: vijf technische controles

  1. Redeneren in K3 kan momenteel niet worden teruggeschroefd

K3 redeneert altijd, en de huidige API ondersteunt alleen:

reasoning_effort="max"

Omdat max de standaard is, kan de parameter ook worden weggelaten.

  1. Verwijder K2-specifieke thinking-parameters

Gebruik de K2.x-parameter thinking niet met K3.

Gebruik in plaats daarvan het top-level veld reasoning_effort.

  1. Laat vaste samplingparameters weg

K3 gebruikt momenteel vaste waarden voor parameters zoals:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot raadt aan deze velden weg te laten in plaats van ze te overschrijven.

  1. Behoud volledige assistant-berichten

Voor multi-turn gesprekken en tool-call-lussen, geef het volledige assistant-bericht door aan de volgende request in plaats van alleen de zichtbare content te behouden.

  1. Valideer Vision en Search vรณรณr productie

K3's huidige vision-API ondersteunt openbare afbeeldings-URL's niet rechtstreeks. Gebruik een ondersteund afbeeldingsformaat zoals base64-data of Moonshot's mechanisme voor bestandsreferenties.

Moonshot raadt ook af om in de nabije toekomst voor productie te vertrouwen op de huidige Web Search-functionaliteit terwijl de feature wordt bijgewerkt.

Kimi K3 API-voorbeeld in Python

K3 kan worden aangeroepen via een OpenAI-compatibele API-interface:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Vermijd het overschrijven van K3's vaste samplingparameters. Voor multi-turn en tool-call-workflows, behoud het volledige assistant-bericht.

Hoe Kimi K3 te evalueren vรณรณr upgraden

Test K3 op echte workloads in plaats van alleen op benchmarkprompts.

Een praktische evaluatieset kan omvatten:

  • routinematige repository-edits
  • taken dicht bij de 256K-contextlimiet
  • taken die 256K overschrijden
  • visuele engineeringtaken
  • langetermijn agentische of kenniswerk-taken

Vergelijk waar van toepassing K3, K2.7 Code en K2.7 Code HighSpeed.

Volg:

  • taaksuccesratio
  • gecachete en niet-gecachete invoertokens
  • uitvoer- en redeneertokens
  • retries en fallback-calls
  • p50- en p95-latentie
  • tool-call-fouten
  • tijd voor menselijke review
  • kosten per succesvolle taak

Vergelijk vervolgens drie strategieรซn:

  1. Alles K2.7 Code
  2. Alles K3
  3. K2.7 Code met K3-escalatie

De beste route is degene die aan je kwaliteits- en latentie-eisen voldoet tegen de laagste kosten per succesvolle taak.

Kimi K3-prijzen op CometAPI

De bovenstaande berekeningen gebruiken de officiรซle API-prijzen van Moonshot AI om de vergelijking tussen K3 en K2.7 consistent te houden.

Ten tijde van publicatie wordt Kimi K3 op CometAPI geprijsd 20% lager dan de standaard API-tarieven van Moonshot AI:

RouteInvoerOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Omdat API-prijzen kunnen veranderen, controleer de live modelpagina voordat je deze cijfers gebruikt voor productie-budgettering.

CometAPI's OpenAI-compatibele API maakt het eenvoudig om kimi-k3 naast andere modelroutes te testen met dezelfde prompts en evaluatieworkflow.

Klaar om Kimi K3 te testen? Bekijk Kimi K3 op CometAPI en vergelijk prijzen voordat je het in productie neemt.

Voor integratie- en evaluatievoorbeelden, zie de CometAPI Cookbook op GitHub.

FAQ

Wat kost de Kimi K3 API?

Moonshot AI vermeldt Kimi K3 op $0.30 per 1 miljoen cache-treffer-invoertokens, $3.00 per 1 miljoen cache-miss-invoertokens en $15.00 per 1 miljoen uitvoertokens.

De API model ID is kimi-k3.

Is Kimi K3 goedkoper dan Kimi K2.7 Code?

Nee. Op basis van Moonshot's officiรซle tarieven is K3 ongeveer 3.16ร— de prijs voor cache-miss-invoer en 3.75ร— de prijs voor output.

Het kan de workflowkosten toch verlagen als het de taalsuccesratio verbetert of retries vermindert.

Heeft Kimi K3 een contextvenster van 1M tokens?

Ja. Kimi K3 ondersteunt een contextvenster van 1,048,576 tokens, vergeleken met 262,144 tokens voor Kimi K2.7 Code.

Ondersteunt Kimi K3 automatische contextcaching?

Ja. Contextcaching is automatisch. Invoertokens bij cache-treffer kosten $0.30 per miljoen vergeleken met $3.00 per miljoen voor invoertokens bij cache-miss.

Kan ik het redeneren van Kimi K3 uitschakelen om kosten te verlagen?

Momenteel niet. K3 gebruikt altijd redeneren, en reasoning_effort="max" is het enige ondersteunde niveau van redeneerinspanning.

Tot slot

Kimi K3 biedt aanzienlijk meer context en bredere mogelijkheden dan K2.7 Code, maar tegen een hogere tokenprijs.

Voor routinecodering binnen 256K context is K2.7 Code meestal de meer voordelige keuze. Voor long-context, multimodale of moeilijke agentische taken kan K3 zijn premium rechtvaardigenโ€”zeker wanneer het de succesvolle afronding verbetert.

Voor veel productiesystemen is de meest efficiรซnte strategie daarom niet om K2.7 volledig te vervangen, maar om K2.7 als standaard en K3 als escalatieroute te gebruiken.

De metriek die uiteindelijk telt is niet de kosten per API-call, maar kosten per succesvolle taak.

Klaar om de AI-ontwikkelingskosten met 20% te verlagen?

Start gratis in enkele minuten. Gratis proeftegoeden inbegrepen. Geen creditcard vereist.

Lees Meer