Kimi K3 is now live on CometAPI →

Kimi K3 API-priser (2026): Hvad det koster & K2.7-kode-sammenligning

CometAPI
Mia MarenJul 17, 2026
Kimi K3 API-priser (2026): Hvad det koster & K2.7-kode-sammenligning

TL;DR

Kimi K3 koster $0.30 pr. 1M cache-hit input-tokens, $3.00 pr. 1M cache-miss input-tokens og $15.00 pr. 1M output-tokens, med et kontekstvindue på 1,048,576 tokens.

Sammenlignet med K2.7 Code er K3 markant dyrere pr. token, men tilbyder 4× så stort kontekstvindue samt indbygget vision og stærkere støtte til agent-baserede arbejdsbelastninger med lang horisont.

Bottom line: K2.7 Code er fortsat det mere økonomiske valg til rutineprægede kodningsopgaver inden for 256K kontekst. Brug K3, når du har brug for større kontekst, multimodale funktioner, eller som en eskalationsrute for opgaver, som K2.7 ikke kan løse pålideligt.

Kimi K3 API-priser i overblik

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningAltid aktiveret
Supported reasoning effortkun max
Default maximum completion131,072 tokens
Configurable maximum completionOp til 1,048,576 tokens, underlagt den samlede kontekstgrænse
Key capabilitiesIndbygget vision, værktøjskald, struktureret output, Partial Mode, dynamisk værktøjsindlæsning, automatisk kontekstcaching
Batch APIK3 er ikke aktuelt listet blandt understøttede Batch-modeller

Se Moonshots Kimi K3 hurtigstart for aktuelle API-parametre og integrationsdetaljer.

Hvad Kimi K3 tilføjer i forhold til K2.7 Code

Den mest tydelige opgradering er kontekstens længde.

K2.7 Code understøtter 262,144 tokens, mens K3 øger denne grænse til 1,048,576 tokens. Dette gør K3 mere praktisk til store repositories, lange agent-historikker, omfattende dokumentation og workflows, der ellers ville kræve kontekstreduktion.

K3 understøtter også:

  • indfødt visuel forståelse
  • strengt struktureret output
  • tool_choice
  • dynamisk værktøjsindlæsning
  • automatisk kontekstcaching
  • langvarige kodnings- og vidensarbejds-workflows

Moonshots Kimi K3 tekniske blog rapporterer 88.3 på Terminal-Bench 2.1, 77.8 på Program Bench og 81.2 på FrontierSWE.

Disse er udbyder-rapporterede benchmarks og bør ses som grunde til at evaluere K3—ikke garantier for, at den vil overgå K2.7 Code i alle produktionsarbejdsbelastninger.

For baggrund om den forrige generation, se CometAPIs Kimi K2 API-vejledning.

Kimi K3 vs Kimi K2.7 Code-priser

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

K2.7-satserne kommer fra Moonshots officielle Kimi K2.7 Code-prisdokumentation.

Sammenlignet med standard K2.7 Code er K3:

  • 1.58× prisen for cache-hit input
  • 3.16× prisen for cache-miss input
  • 3.75× prisen for output

K3’s præmie er mindre i forhold til K2.7 Code HighSpeed, men de to modeller sigter mod forskellige prioriteter: HighSpeed fokuserer på hurtigere kodningsoutput, mens K3 er rettet mod mere krævende lang-kontekst og agentiske arbejdsbelastninger.

Moonshots aktuelle Batch API-prisdokumentation lister ikke K3, så antag ikke, at Batch-rabatter, der gælder for andre Kimi-modeller, også gælder her.

Kimi K3 kontekstcaching: Sådan fungerer 90 % rabatten på input

K3 understøtter automatisk kontekstcaching.

Udviklere behøver ikke manuelt at oprette et cache-ID eller TTL. Holdes store præfikser stabile på tværs af gentagne forespørgsler, får efterfølgende forespørgsler mulighed for at få cache-hit satsen.

Prisforskellen er:

  • Cache miss: $3.00 / 1M input tokens
  • Cache hit: $0.30 / 1M input tokens

Så cache-hit input-tokens koster 90 % mindre end cache-miss input-tokens.

Output er dog stadig prissat til $15 pr. million tokens, så den samlede forespørgselsomkostning falder ikke med 90 %.

For eksempel, antag:

  • 600,000 input tokens
  • 20,000 output tokens
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

I dette forsimplede tilfælde falder den samlede pris med omkring 77 %.

De faktiske besparelser afhænger af andelen af input-tokens, der får cache-hit satsen.

Eksempel: Hvad en kodningsopgave koster på K3 vs K2.7

Antag en kodningsopgave bruger:

  • 200,000 input tokens
  • 20,000 output tokens
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

For denne arbejdsbelastning koster K3 cirka 3,33× så meget som standard K2.7 Code på en kold forespørgsel.

Inden for K3 reducerer overgangen fra fuldt cache-miss input til fuldt cachet input den anslåede forespørgselspris fra $0.90 til $0.36, en reduktion på 60 % i dette eksempel.

Men prisen pr. forespørgsel er kun en del af ligningen.

Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks

En produktionssammenligning bør også omfatte retries, fallback-kald, værktøjsudførelser og menneskelig gennemgangstid.

En K3-forespørgsel, der lykkes én gang, kan være mere økonomisk end flere billigere forsøg, der mislykkes.

Et edge case i den virkelige verden: omkostning ved ræsonneringstokens

K3 bruger altid ræsonnering, så forbruget af output-tokens kan blive en væsentlig del af regningen.

I en test på lanceringsdagen af Simon Willison brugte en prompt, der bad K3 om at generere en SVG, 13,241 ræsonneringstokens, før den producerede 3,417 svartokens, for en samlet pris på cirka $0.25.

Dette var en uformel enkeltprompt-test og ikke en benchmark, men den fremhæver et vigtigt omkostningsforhold: det synlige endelige svar kan kun udgøre en del af det, der faktureres som output.

Da K3 i øjeblikket kun understøtter maksimal ræsonneringsindsats, bør teams måle faktisk forbrug af output-tokens på deres egne arbejdsbelastninger.

Et bedre standardvalg: K2.7 først, K3 ved eskalation

For blandede kodningsarbejdsbelastninger kan routing være mere økonomisk end at sende hver forespørgsel direkte til K3.

En simpel strategi er:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Med det forrige eksempel:

  • K2.7 Code koster $0.27 pr. koldt forsøg
  • K3 koster $0.90
  • K2.7 fuldfører 70 % af opgaverne
  • 30 % forsøges igen én gang på K3

Den gennemsnitlige pris bliver:

$0.27 + (30% × $0.90) = $0.54 per task

At sende hver opgave direkte til K3 ville koste $0.90 pr. opgave under de samme tokenantagelser.

Det gør den rutede strategi 40 % billigere i dette forsimplede scenarie.

De præcise besparelser vil variere, men princippet er nyttigt: send rutinearbejde til den billigere model og eskalér, når der faktisk er brug for ekstra kapabilitet.

Hvornår er Kimi K3 værd at opgradere til?

K3 er mest overbevisende, når:

  • Den krævede kontekst overstiger K2.7 Codes grænse på 262,144 tokens.
  • Opgaven kombinerer kode med visuel input.
  • En langvarig agent skal arbejde på tværs af store repositories og eksterne værktøjer.
  • K2.7 kræver hyppige retries eller fallback-kald.
  • Opgaven er så værdifuld, at kvaliteten af fuldførelsen vægter højere end at minimere førstekaldsomkostningen.

K2.7 Code er fortsat et stærkt valg til repetitive, velafgrænsede kodningsopgaver, der allerede har høj succesrate inden for 256K kontekst.

Til latensfølsomme kodningsapplikationer bør K2.7 Code HighSpeed også testes separat.

Migrering fra K2.7 til K3: Fem tekniske tjek

  1. K3-ræsonnering kan i øjeblikket ikke reduceres

K3 ræsonnerer altid, og den aktuelle API understøtter kun:

reasoning_effort="max"

Da max er standard, kan parameteren også udelades.

  1. Fjern K2-specifikke thinking-parametre

Brug ikke K2.x-parameteren thinking med K3.

Brug det overordnede felt reasoning_effort i stedet.

  1. Udelad faste sampling-parametre

K3 bruger i øjeblikket faste værdier for parametre, herunder:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot anbefaler at udelade disse felter i stedet for at overskrive dem.

  1. Bevar komplette assistant-beskeder

For flerturns-samtaler og værktøjskaldsløkker skal du sende den komplette assistant-besked med i næste forespørgsel i stedet for kun at bevare det synlige content.

  1. Validér vision og søgning før produktion

K3’s aktuelle vision-API understøtter ikke offentlige billed-URL’er direkte. Brug et understøttet billedformat som base64-data eller Moonshots filreferencemekanisme.

Moonshot anbefaler også ikke at stole på den nuværende websøgefunktionalitet til produktion på kort sigt, mens funktionen opdateres.

Kimi K3 API-eksempel i Python

K3 kan kaldes via et OpenAI-kompatibelt API-interface:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Undgå at overskrive K3’s faste sampling-parametre. For flerturns- og værktøjskalds-workflows skal du bevare den komplette assistant-besked.

Sådan evaluerer du Kimi K3 før opgradering

Test K3 på reelle arbejdsbelastninger i stedet for kun benchmark-prompter.

Et praktisk evalueringssæt kan omfatte:

  • rutinemæssige repository-ændringer
  • opgaver tæt på 256K kontekstgrænsen
  • opgaver, der overstiger 256K
  • visuelle ingeniøropgaver
  • agentiske eller vidensarbejdsopgaver med lang horisont

Sammenlign K3, K2.7 Code og K2.7 Code HighSpeed, hvor det er relevant.

Følg op på:

  • opgavesuccesrate
  • cached og ikke-cached input-tokens
  • output- og ræsonneringstokens
  • retries og fallback-kald
  • p50- og p95-latens
  • værktøjskaldsfejl
  • tid til menneskelig gennemgang
  • omkostning pr. vellykket opgave

Sammenlign derefter tre strategier:

  1. Alt K2.7 Code
  2. Alt K3
  3. K2.7 Code med K3-eskalation

Den bedste rute er den, der opfylder dine kvalitets- og latenstkrav til den laveste pris pr. vellykket opgave.

Kimi K3-priser på CometAPI

Beregningerne ovenfor bruger Moonshot AIs officielle API-priser for at holde sammenligningen mellem K3 og K2.7 konsistent.

På tidspunktet for offentliggørelsen er Kimi K3 på CometAPI prissat 20 % lavere end Moonshot AIs standard-API-satser:

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Da API-priser kan ændre sig, skal du tjekke den live modelside, før du bruger disse tal til produktionsbudgettering.

CometAPIs OpenAI-kompatible API gør det nemt at teste kimi-k3 sammen med andre modelruter ved hjælp af de samme prompter og evalueringsworkflow.

Klar til at teste Kimi K3? Se Kimi K3 på CometAPI og sammenlign priser, før du flytter den i produktion.

For integrations- og evaluerings-eksempler, se CometAPI Cookbook på GitHub.

FAQ

Hvor meget koster Kimi K3 API’et?

Moonshot AI angiver Kimi K3 til $0.30 pr. 1 million cache-hit input-tokens, $3.00 pr. 1 million cache-miss input-tokens og $15.00 pr. 1 million output-tokens.

API-model-ID’et er kimi-k3.

Er Kimi K3 billigere end Kimi K2.7 Code?

Nej. Baseret på Moonshots officielle satser er K3 cirka 3.16× prisen for cache-miss input og 3.75× prisen for output.

Den kan stadig reducere workflow-omkostninger, hvis den forbedrer opgavesucces eller reducerer retries.

Har Kimi K3 et 1M-token kontekstvindue?

Ja. Kimi K3 understøtter et kontekstvindue på 1,048,576 tokens, sammenlignet med 262,144 tokens for Kimi K2.7 Code.

Understøtter Kimi K3 automatisk kontekstcaching?

Ja. Kontekstcaching er automatisk. Cache-hit input-tokens koster $0.30 pr. million sammenlignet med $3.00 pr. million for cache-miss input-tokens.

Kan jeg slå Kimi K3-ræsonnering fra for at reducere omkostninger?

Ikke i øjeblikket. K3 bruger altid ræsonnering, og reasoning_effort="max" er det eneste understøttede niveau for ræsonneringsindsats.

Afsluttende bemærkninger

Kimi K3 tilbyder væsentligt mere kontekst og bredere kapabiliteter end K2.7 Code, men til en højere tokenpris.

Til rutinepræget kodning inden for 256K kontekst er K2.7 Code som regel det mere økonomiske valg. Til lang-kontekst, multimodale eller krævende agentiske opgaver kan K3 retfærdiggøre sin præmie—især når den forbedrer succesfuld fuldførelse.

For mange produktionssystemer er den mest effektive strategi derfor ikke at erstatte K2.7 helt, men at bruge K2.7 som standard og K3 som eskalationsrute.

Den vigtigste metrik er ikke prisen pr. API-kald, men prisen pr. vellykket opgave.

Klar til at skære AI-udviklingsomkostninger med 20%?

Kom gratis i gang på få minutter. Gratis prøvekreditter inkluderet. Intet kreditkort påkrævet.

Læs mere