Kimi K3 is now live on CometAPI →

Kimi K3 API-priser (2026): Hva det koster og K2.7 Code-sammenligning

CometAPI
Mia MarenJul 17, 2026
Kimi K3 API-priser (2026): Hva det koster og K2.7 Code-sammenligning

TL;DR

Kimi K3 koster $0.30 per 1M cache-treff inndatatoken, $3.00 per 1M cache-miss inndatatoken og $15.00 per 1M utdatastoken, med et 1,048,576-token kontekstvindu.

Sammenlignet med K2.7 Code er K3 betydelig dyrere per token, men tilbyr 4× kontekstvindu, i tillegg til innebygd visjon og sterkere støtte for agent-baserte arbeidsbelastninger med lang horisont.

Bottom line: K2.7 Code er fortsatt det mer økonomiske valget for rutinemessige kodeoppgaver innen 256K kontekst. Bruk K3 når du trenger større kontekst, multimodale evner, eller som eskaleringsvei for oppgaver K2.7 ikke kan fullføre pålitelig.

Kimi K3 API-priser i korte trekk

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningAlltid aktivert
Supported reasoning effortkun max
Default maximum completion131,072 tokens
Configurable maximum completionOpptil 1,048,576 tokens, med forbehold om total kontekstgrense
Key capabilitiesNative vision, verktøykall, strukturert utdata, Partial Mode, dynamisk innlasting av verktøy, automatisk kontekst-caching
Batch APIK3 er for øyeblikket ikke oppført blant støttede Batch-modeller

Se Moonshots Kimi K3 hurtigstart for gjeldende API-parametere og integrasjonsdetaljer.

Hva Kimi K3 tilfører utover K2.7 Code

Den mest åpenbare oppgraderingen er kontektslengden.

K2.7 Code støtter 262,144 tokens, mens K3 øker denne grensen til 1,048,576 tokens. Dette gjør K3 mer praktisk for store repositorier, lange agent-historikker, omfattende dokumentasjon og arbeidsflyter som ellers ville krevd kontekstreduksjon.

K3 støtter også:

  • innebygd visuell forståelse
  • strengt strukturert utdata
  • tool_choice
  • dynamisk innlasting av verktøy
  • automatisk kontekst-caching
  • langvarige kode- og kunnskapsarbeidsflyter

Moonshots Kimi K3 teknisk blogg rapporterer 88.3 på Terminal-Bench 2.1, 77.8 på Program Bench og 81.2 på FrontierSWE.

Disse er leverandørrapporterte benchmarker og bør ses som grunner til å evaluere K3—ikke garantier for at den vil overgå K2.7 Code på enhver produksjonsarbeidslast.

For bakgrunn om forrige generasjon, se CometAPIs Kimi K2 API-veiledning.

Kimi K3 vs Kimi K2.7 Code-prising

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

K2.7-satsene kommer fra Moonshots offisielle prising for Kimi K2.7 Code.

Sammenlignet med standard K2.7 Code er K3:

  • 1,58× prisen for cache-treff-inndata
  • 3,16× prisen for cache-miss-inndata
  • 3,75× prisen for utdata

K3s premium er mindre relativt til K2.7 Code HighSpeed, men de to modellene prioriterer ulike ting: HighSpeed fokuserer på raskere kodeutdata, mens K3 er rettet mot mer krevende langkonteksts- og agent-baserte arbeidsbelastninger.

Moonshots gjeldende prisdokumentasjon for Batch-API lister ikke K3, så ikke anta at Batch-rabatter tilgjengelige for andre Kimi-modeller også gjelder her.

Kimi K3 kontekst-caching: Slik fungerer 90% inputrabatten

K3 støtter automatisk kontekst-caching.

Utviklere trenger ikke manuelt å opprette en cache-ID eller TTL. Å holde store prefikser stabile på tvers av gjentatte forespørsler gir påfølgende forespørsler mulighet til å få cache-treff-sats.

Prisforskjellen er:

  • Cache-miss: $3.00 / 1M inndatatoken
  • Cache-treff: $0.30 / 1M inndatatoken

Dermed koster cache-treff-inndatatoken 90% mindre enn cache-miss-inndatatoken.

Utdata prises imidlertid fortsatt til $15 per million token, så den totale forespørselkostnaden faller ikke med 90%.

For eksempel, antatt:

  • 600,000 inndatatoken
  • 20,000 utdatastoken
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

I dette forenklede tilfellet faller totalkostnaden med omtrent 77%.

Faktisk besparelse avhenger av andelen inndatatoken som får cache-treff-satsen.

Eksempel: Hva en kodeoppgave koster på K3 vs K2.7

Anta at en kodeoppgave bruker:

  • 200,000 inndatatoken
  • 20,000 utdatastoken
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

For denne arbeidslasten koster K3 omtrent 3,33× så mye som standard K2.7 Code på en kald forespørsel.

Innenfor K3 reduserer overgangen fra helt cache-miss-inndata til fullt cachet inndata den estimerte forespørselkostnaden fra $0.90 til $0.36, en reduksjon på 60% i dette eksempelet.

Men kostnad per forespørsel er bare én del av ligningen.

Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks

En produksjonssammenligning bør også inkludere nye forsøk, fallback-kall, verktøykjøringer og tid til menneskelig gjennomgang.

En K3-forespørsel som lykkes én gang kan være mer økonomisk enn flere billigere forsøk som feiler.

Et reelt randtilfelle: kostnad for resonneringstoken

K3 bruker alltid resonnering, så forbruk av utdatastoken kan bli en merkbar del av regningen.

I en lanseringsdagstest av Simon Willison brukte en prompt som ba K3 generere en SVG 13,241 resonneringstoken før den produserte 3,417 responstoken, for en totalkostnad på omtrent $0.25.

Dette var en uformell enkeltprompt-test og ikke en benchmark, men den fremhever en viktig kostnadsvurdering: det synlige endelige svaret kan bare representere en del av de fakturerte utdataene.

Fordi K3 for øyeblikket bare støtter maksimal resonneringsinnsats, bør team måle faktisk utdatastoken-bruk på sine egne arbeidslaster.

En bedre standard: K2.7 først, K3 ved eskalering

For blandede kodearbeidslaster kan ruting være mer økonomisk enn å sende hver forespørsel direkte til K3.

En enkel strategi er:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Med det forrige eksempelet:

  • K2.7 Code koster $0.27 per kaldt forsøk
  • K3 koster $0.90
  • K2.7 fullfører 70% av oppgavene
  • 30% forsøkes på nytt én gang på K3

Gjennomsnittskostnaden blir:

$0.27 + (30% × $0.90) = $0.54 per task

Å sende hver oppgave direkte til K3 ville kostet $0.90 per oppgave under de samme token-forutsetningene.

Det gjør rutingstrategien 40% billigere i dette forenklede scenariet.

De eksakte besparelsene vil variere, men prinsippet er nyttig: ruter rutinearbeid til den billigere modellen og eskaler når ekstra kapasitet faktisk trengs.

Når er Kimi K3 verdt oppgraderingen?

K3 er mest overbevisende når:

  • Nødvendig kontekst overstiger K2.7 Codes grense på 262,144 token.
  • Oppgaven kombinerer kode med visuelt input.
  • En langvarig agent må arbeide på tvers av store repositorier og eksterne verktøy.
  • K2.7 krever hyppige nye forsøk eller fallback-kall.
  • Oppgaven er så verdifull at fullføringskvalitet betyr mer enn å minimere kostnaden ved første kall.

K2.7 Code er fortsatt et sterkt alternativ for repeterende, velavgrensede kodeoppgaver som allerede oppnår høy suksessrate innen 256K kontekst.

For latensfølsomme kodeapplikasjoner bør K2.7 Code HighSpeed også testes separat.

Migrering fra K2.7 til K3: Fem tekniske sjekkpunkter

  1. K3-resonnering kan for øyeblikket ikke reduseres

K3 resonerer alltid, og gjeldende API støtter bare:

reasoning_effort="max"

Fordi max er standard, kan parameteren også utelates.

  1. Fjern K2-spesifikke thinking-parametere

Ikke bruk K2.x-parameteren thinking med K3.

Bruk feltet reasoning_effort på toppnivå i stedet.

  1. Utelat faste sampling-parameter

K3 bruker for tiden faste verdier for parametere inkludert:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot anbefaler å utelate disse feltene i stedet for å overstyre dem.

  1. Bevar komplette assistentmeldinger

For fleromgangssamtaler og løkker med verktøykall, send hele assistentmeldingen inn i neste forespørsel i stedet for å beholde kun det synlige content.

  1. Valider visjon og søk før produksjon

K3s nåværende visjons-API støtter ikke offentlige bildeadresser direkte. Bruk et støttet bildeformat som base64-data eller Moonshots filreferanse-mekanisme.

Moonshot fraråder også å stole på nåværende Web Search-funksjonalitet for produksjonsbruk på kort sikt mens funksjonen oppdateres.

Kimi K3 API-eksempel i Python

K3 kan kalles via et OpenAI-kompatibelt API-grensesnitt:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Unngå å overstyre K3s faste sampling-parametere. For fleromgangs- og verktøykall-arbeidsflyter, bevar hele assistentmeldingen.

Hvordan evaluere Kimi K3 før oppgradering

Test K3 på reelle arbeidslaster i stedet for kun benchmark-prompt.

Et praktisk evalueringssett kan inkludere:

  • rutinemessige repo-endringer
  • oppgaver nær 256K-konsteksgrensen
  • oppgaver som overstiger 256K
  • visuelle ingeniøroppgaver
  • agentiske eller kunnskapsarbeidsoppgaver med lang horisont

Sammenlign K3, K2.7 Code og K2.7 Code HighSpeed der det er relevant.

Spor:

  • oppgavens suksessrate
  • cachet og ikke-cachet inndatatoken
  • utdata- og resonneringstoken
  • nye forsøk og fallback-kall
  • p50- og p95-latens
  • verktøykall-feil
  • tid til menneskelig gjennomgang
  • kostnad per vellykket oppgave

Sammenlign deretter tre policyer:

  1. Alt på K2.7 Code
  2. Alt på K3
  3. K2.7 Code med K3-eskalering

Den beste ruten er den som møter kvalitets- og latenskravene dine til lavest kostnad per vellykket oppgave.

Kimi K3-priser på CometAPI

Beregningene over bruker Moonshot AIs offisielle API-priser for å holde K3- og K2.7-sammenligningen konsistent.

På publiseringstidspunktet er Kimi K3 på CometAPI priset 20% lavere enn Moonshot AIs standard API-satser:

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Fordi API-priser kan endres, sjekk live-modellsiden før du bruker disse tallene til produksjonsbudsjettering.

CometAPIs OpenAI-kompatible API gjør det enkelt å teste kimi-k3 sammen med andre modellruter ved å bruke de samme promptene og evalueringsarbeidsflyten.

Klar til å teste Kimi K3? Se Kimi K3 på CometAPI og sammenlign priser før du tar den i produksjon.

For integrasjons- og evaluerings-eksempler, se CometAPI Cookbook på GitHub.

FAQ

Hvor mye koster Kimi K3-API-et?

Moonshot AI lister Kimi K3 til $0.30 per 1 million cache-treff inndatatoken, $3.00 per 1 million cache-miss inndatatoken, og $15.00 per 1 million utdatastoken.

API-modell-ID-en er kimi-k3.

Er Kimi K3 billigere enn Kimi K2.7 Code?

Nei. Basert på Moonshots offisielle satser er K3 omtrent 3,16× prisen for cache-miss-inndata og 3,75× prisen for utdata.

Den kan likevel redusere arbeidsflytkostnader hvis den forbedrer oppgavesuksess eller reduserer nye forsøk.

Har Kimi K3 et 1M-token kontekstvindu?

Ja. Kimi K3 støtter et 1,048,576-token kontekstvindu, sammenlignet med 262,144 token for Kimi K2.7 Code.

Støtter Kimi K3 automatisk kontekst-caching?

Ja. Kontekst-caching er automatisk. Cache-treff-inndatatoken koster $0.30 per million sammenlignet med $3.00 per million for cache-miss-inndatatoken.

Kan jeg slå av resonnering i Kimi K3 for å redusere kostnadene?

Ikke for øyeblikket. K3 bruker alltid resonnering, og reasoning_effort="max" er det eneste støttede resonneringsnivået.

Avsluttende tanker

Kimi K3 tilbyr betydelig mer kontekst og bredere kapabiliteter enn K2.7 Code, men til en høyere tokenpris.

For rutinemessig koding innen 256K kontekst er K2.7 Code vanligvis det mer økonomiske valget. For langkontekst, multimodale eller krevende agentiske oppgaver kan K3 rettferdiggjøre premiumen—spesielt når det forbedrer vellykket fullføring.

For mange produksjonssystemer er den mest effektive strategien derfor ikke å erstatte K2.7 helt, men å bruke K2.7 som standard og K3 som eskaleringsvei.

Metrikken som til slutt betyr noe er ikke kostnad per API-kall, men kostnad per vellykket oppgave.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer