Kimi K3 is now live on CometAPI →

Cennik API Kimi K3 (2026): Ile to kosztuje & porównanie kodu z K2.7

CometAPI
Mia MarenJul 17, 2026
Cennik API Kimi K3 (2026): Ile to kosztuje & porównanie kodu z K2.7

TL;DR

Kimi K3 kosztuje $0.30 za 1M tokenów wejściowych z trafieniem cache, $3.00 za 1M tokenów wejściowych bez trafienia cache oraz $15.00 za 1M tokenów wyjściowych, z oknem kontekstu wynoszącym 1,048,576 tokenów.

W porównaniu z K2.7 Code, K3 jest znacząco droższy w przeliczeniu na token, ale oferuje 4× większe okno kontekstu oraz natywne przetwarzanie wizualne i lepsze wsparcie dla długohoryzontowych obciążeń agentowych.

Sedno: K2.7 Code pozostaje bardziej ekonomicznym wyborem do rutynowych zadań programistycznych w ramach 256K kontekstu. Używaj K3, gdy potrzebujesz większego kontekstu, możliwości multimodalnych lub jako ścieżki eskalacji dla zadań, których K2.7 nie potrafi niezawodnie ukończyć.

Kimi K3 — szybki przegląd cen API

PozycjaKimi K3
Identyfikator modelu APIkimi-k3
Wejście z trafieniem cache$0.30 / 1M tokens
Wejście bez trafienia cache$3.00 / 1M tokens
Wyjście$15.00 / 1M tokens
Okno kontekstu1,048,576 tokens
RozumowanieZawsze włączone
Obsługiwany poziom rozumowaniatylko max
Domyślny maksymalny limit generacji131,072 tokens
Konfigurowalny maksymalny limit generacjiDo 1,048,576 tokens, z zastrzeżeniem łącznego limitu kontekstu
Kluczowe możliwościNatywne rozumienie wizualne, wywołania narzędzi, ustrukturyzowane wyjście, Partial Mode, dynamiczne ładowanie narzędzi, automatyczne buforowanie kontekstu
Batch APIK3 nie figuruje obecnie wśród obsługiwanych modeli Batch

Zobacz szybki start Kimi K3 od Moonshot, aby poznać bieżące parametry API i szczegóły integracji.

Co Kimi K3 dodaje względem K2.7 Code

Najbardziej oczywistym ulepszeniem jest długość kontekstu.

K2.7 Code obsługuje 262,144 tokeny, podczas gdy K3 zwiększa ten limit do 1,048,576 tokenów. Dzięki temu K3 jest praktyczniejszy w przypadku dużych repozytoriów, długich historii agentów, rozbudowanej dokumentacji oraz przepływów pracy, które w przeciwnym razie wymagałyby redukcji kontekstu.

K3 obsługuje również:

  • natywne rozumienie wizualne
  • ściśle ustrukturyzowane wyjście
  • tool_choice
  • dynamiczne ładowanie narzędzi
  • automatyczne buforowanie kontekstu
  • długotrwałe przepływy pracy programistyczne i wiedzochłonne

Techniczny blog Moonshot Kimi K3 podaje wyniki 88.3 na Terminal-Bench 2.1, 77.8 na Program Bench oraz 81.2 na FrontierSWE.

To są wyniki podane przez dostawcę i należy traktować je jako przesłankę do oceny K3 — a nie gwarancję, że przewyższy K2.7 Code w każdym produkcyjnym scenariuszu.

W tle generacji poprzedniej zobacz przewodnik po Kimi K2 API od CometAPI.

Porównanie cen: Kimi K3 vs Kimi K2.7 Code

ModelWejście z trafieniem cacheWejście bez trafienia cacheWyjścieKontekst
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Stawki K2.7 pochodzą z oficjalnej dokumentacji cen Kimi K2.7 Code od Moonshot.

W porównaniu ze standardowym K2.7 Code, K3 jest:

  • 1,58× droższy przy wejściu z trafieniem cache
  • 3,16× droższy przy wejściu bez trafienia cache
  • 3,75× droższy na wyjściu

Premia K3 jest mniejsza w stosunku do K2.7 Code HighSpeed, ale te dwa modele celują w inne priorytety: HighSpeed koncentruje się na szybszym generowaniu kodu, podczas gdy K3 jest skierowany do bardziej wymagających obciążeń o długim kontekście i z zachowaniem agentowości.

Aktualna dokumentacja cen Batch API Moonshot nie wymienia K3, więc nie zakładaj, że zniżki Batch dostępne dla innych modeli Kimi mają tu zastosowanie.

Buforowanie kontekstu w Kimi K3: jak działa 90% zniżki na wejście

K3 obsługuje automatyczne buforowanie kontekstu.

Deweloperzy nie muszą ręcznie tworzyć identyfikatora cache ani TTL. Utrzymywanie dużych prefiksów stabilnych w kolejnych żądaniach daje szansę na zastosowanie stawki za trafienie cache w kolejnych prośbach.

Różnica w cenie to:

  • Cache miss: $3.00 / 1M tokenów wejściowych
  • Cache hit: $0.30 / 1M tokenów wejściowych

Zatem tokeny wejściowe z trafieniem cache kosztują o 90% mniej niż tokeny bez trafienia cache.

Jednak wyjście nadal kosztuje $15 za milion tokenów, więc całkowity koszt żądania nie spada o 90%.

Na przykład, załóżmy:

  • 600,000 tokenów wejściowych
  • 20,000 tokenów wyjściowych
Stan pamięci podręcznejKoszt wejściaKoszt wyjściaSuma
Całe wejście bez trafienia cache$1.80$0.30$2.10
Całe wejście z trafieniem cache$0.18$0.30$0.48

W tym uproszczonym przypadku całkowity koszt spada o około 77%.

Rzeczywiste oszczędności zależą od udziału tokenów wejściowych rozliczonych po stawce za trafienie cache.

Przykład: Ile kosztuje zadanie kodowania na K3 vs K2.7

Załóżmy, że zadanie kodowania zużywa:

  • 200,000 tokenów wejściowych
  • 20,000 tokenów wyjściowych
WariantSuma (zimny start)Suma (w pełni z trafieniem cache)
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Dla tego obciążenia K3 kosztuje około 3,33× tyle co standardowy K2.7 Code przy zimnym żądaniu.

W samym K3, przejście z całkowitego cache-miss na w pełni zcache’owane wejście obniża szacowany koszt żądania z $0.90 do $0.36, czyli o 60% w tym przykładzie.

Ale koszt na żądanie to tylko część równania.

Koszt na pomyślne zadanie = Całkowite wydatki na przepływ pracy ÷ Zadania, które przeszły weryfikację

Porównanie produkcyjne powinno również uwzględniać ponowne próby, wywołania awaryjne, wykonania narzędzi i czas przeglądu ręcznego.

Pojedyncze żądanie do K3, które zakończy się sukcesem, może być bardziej opłacalne niż kilka tańszych prób, które kończą się niepowodzeniem.

Przypadek brzegowy z realnego świata: koszt tokenów rozumowania

K3 zawsze używa rozumowania, więc zużycie tokenów wyjściowych może stanowić istotną część rachunku.

W teście z dnia premiery autorstwa Simona Willisona prośba o wygenerowanie SVG zużyła 13,241 tokenów rozumowania przed wygenerowaniem 3,417 tokenów odpowiedzi, co dało łączny koszt około $0.25.

Był to nieformalny test pojedynczego promptu, a nie benchmark, ale podkreśla istotny aspekt kosztowy: widoczna finalna odpowiedź może stanowić tylko część rozliczanego wyjścia.

Ponieważ K3 obecnie obsługuje tylko maksymalny poziom rozumowania, zespoły powinny mierzyć rzeczywiste zużycie tokenów wyjściowych we własnych obciążeniach.

Lepsza domyślna ścieżka: najpierw K2.7, eskalacja do K3

W przypadku mieszanych obciążeń programistycznych trasowanie może być bardziej ekonomiczne niż wysyłanie każdego żądania bezpośrednio do K3.

Prosta strategia to:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Korzystając z poprzedniego przykładu:

  • K2.7 Code kosztuje $0.27 na zimną próbę
  • K3 kosztuje $0.90
  • K2.7 pomyślnie kończy 70% zadań
  • 30% jest ponawiane raz na K3

Średni koszt staje się:

$0.27 + (30% × $0.90) = $0.54 per task

Wysyłanie każdego zadania bezpośrednio do K3 kosztowałoby $0.90 za zadanie przy tych samych założeniach dotyczących tokenów.

To sprawia, że strategia trasowania jest o 40% tańsza w tym uproszczonym scenariuszu.

Dokładne oszczędności będą się różnić, ale zasada jest użyteczna: kieruj rutynową pracę do tańszego modelu i eskaluj, gdy dodatkowe możliwości są faktycznie potrzebne.

Kiedy warto przejść na Kimi K3?

K3 jest najbardziej przekonujący, gdy:

  • Wymagany kontekst przekracza limit 262,144 tokenów w K2.7 Code.
  • Zadanie łączy kod z danymi wizualnymi.
  • Długotrwale działający agent musi pracować na dużych repozytoriach i zewnętrznych narzędziach.
  • K2.7 wymaga częstych ponownych prób lub wywołań awaryjnych.
  • Zadanie jest na tyle wartościowe, że jakość ukończenia ma większe znaczenie niż minimalizacja kosztu pierwszego wywołania.

K2.7 Code pozostaje silną opcją dla powtarzalnych, dobrze zdefiniowanych zadań programistycznych, które już osiągają wysoki współczynnik sukcesu w ramach 256K kontekstu.

Dla aplikacji programistycznych wrażliwych na opóźnienia warto również osobno przetestować K2.7 Code HighSpeed.

Migracja z K2.7 do K3: pięć kontroli inżynierskich

  1. Nie można obecnie zredukować rozumowania w K3

K3 zawsze rozumuje, a obecne API obsługuje tylko:

reasoning_effort="max"

Ponieważ max jest domyślne, ten parametr można też pominąć.

  1. Usuń specyficzne dla K2 parametry thinking

Nie używaj parametru thinking z K3.

Zamiast tego użyj pola najwyższego poziomu reasoning_effort.

  1. Pomiń stałe parametry próbkowania

K3 obecnie używa stałych wartości dla parametrów, w tym:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot zaleca pominięcie tych pól zamiast ich nadpisywania.

  1. Zachowuj pełne wiadomości asystenta

Dla konwersacji wieloturnowych i pętli wywołań narzędzi przekaż pełną wiadomość asystenta w kolejnym żądaniu, a nie tylko widoczne content.

  1. Zweryfikuj Vision i Search przed produkcją

Aktualne API Vision K3 nie obsługuje bezpośrednio publicznych adresów URL obrazów. Użyj obsługiwanego formatu obrazu, np. danych base64 lub mechanizmu odwołań do plików Moonshot.

Moonshot odradza również poleganie na obecnej funkcji Web Search w zastosowaniach produkcyjnych w najbliższym czasie, ponieważ funkcja jest aktualizowana.

Przykład API Kimi K3 w Pythonie

K3 można wywołać poprzez interfejs API kompatybilny z OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Unikaj nadpisywania stałych parametrów próbkowania K3. W przepływach wieloturnowych i z wywołaniami narzędzi zachowuj pełną wiadomość asystenta.

Jak ocenić Kimi K3 przed aktualizacją

Testuj K3 na rzeczywistych obciążeniach, a nie tylko na promptach benchmarkowych.

Praktyczny zestaw ewaluacyjny może obejmować:

  • rutynowe edycje repozytoriów
  • zadania blisko limitu 256K
  • zadania przekraczające 256K
  • zadania inżynierskie z danymi wizualnymi
  • długohoryzontowe zadania agentowe lub wiedzochłonne

Porównaj K3, K2.7 Code i K2.7 Code HighSpeed tam, gdzie ma to zastosowanie.

Śledź:

  • wskaźnik powodzenia zadań
  • tokeny wejściowe w cache i poza cache
  • tokeny wyjściowe i tokeny rozumowania
  • ponowne próby i wywołania awaryjne
  • opóźnienia p50 i p95
  • błędy wywołań narzędzi
  • czas przeglądu ręcznego
  • koszt na pomyślnie zrealizowane zadanie

Następnie porównaj trzy polityki:

  1. Wyłącznie K2.7 Code
  2. Wyłącznie K3
  3. K2.7 Code z eskalacją do K3

Najlepsza ścieżka to ta, która spełnia wymagania jakości i opóźnień przy najniższym koszcie na pomyślnie zrealizowane zadanie.

Ceny Kimi K3 w CometAPI

Powyższe obliczenia używają oficjalnych cen API Moonshot AI, aby zachować spójność porównania K3 i K2.7.

W momencie publikacji Kimi K3 w CometAPI jest wyceniony o 20% niżej niż standardowe stawki API Moonshot AI:

WariantWejścieWyjście
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Ponieważ ceny API mogą się zmieniać, sprawdź aktualną stronę modelu przed wykorzystaniem tych wartości do planowania budżetu produkcyjnego.

Kompatybilne z OpenAI API CometAPI ułatwia testowanie kimi-k3 obok innych tras modeli przy użyciu tych samych promptów i przepływu ewaluacji.

Gotowy, by przetestować Kimi K3? Zobacz Kimi K3 w CometAPI i porównaj ceny przed wdrożeniem do produkcji.

Przykłady integracji i ewaluacji znajdziesz w CometAPI Cookbook na GitHubie.

FAQ

Ile kosztuje API Kimi K3?

Moonshot AI podaje, że Kimi K3 kosztuje $0.30 za 1 milion tokenów wejściowych z trafieniem cache, $3.00 za 1 milion tokenów wejściowych bez trafienia cache oraz $15.00 za 1 milion tokenów wyjściowych.

Identyfikator modelu API to kimi-k3.

Czy Kimi K3 jest tańszy niż Kimi K2.7 Code?

Nie. Na podstawie oficjalnych stawek Moonshot, K3 jest około 3,16× droższy za wejście bez trafienia cache i 3,75× droższy na wyjściu.

Może jednak obniżyć koszty przepływu pracy, jeśli poprawia skuteczność zadań lub ogranicza ponowne próby.

Czy Kimi K3 ma okno kontekstu 1M tokenów?

Tak. Kimi K3 obsługuje okno kontekstu 1,048,576 tokenów, w porównaniu do 262,144 tokenów dla Kimi K2.7 Code.

Czy Kimi K3 obsługuje automatyczne buforowanie kontekstu?

Tak. Buforowanie kontekstu jest automatyczne. Tokeny wejściowe z trafieniem cache kosztują $0.30 za milion, w porównaniu do $3.00 za milion dla tokenów bez trafienia cache.

Czy mogę wyłączyć rozumowanie Kimi K3, aby obniżyć koszty?

Obecnie nie. K3 zawsze wykorzystuje rozumowanie, a reasoning_effort="max" jest jedynym obsługiwanym poziomem wysiłku rozumowania.

Wnioski końcowe

Kimi K3 oferuje znacząco większy kontekst i szersze możliwości niż K2.7 Code, ale po wyższej cenie za token.

Do rutynowego kodowania w ramach 256K kontekstu K2.7 Code zwykle jest bardziej ekonomiczny. Do zadań z długim kontekstem, multimodalnych lub trudnych agentowo K3 może uzasadniać swoją premię — zwłaszcza gdy poprawia skuteczność zakończenia.

W wielu systemach produkcyjnych najbardziej efektywna strategia to nie zastępowanie K2.7 w całości, lecz używanie K2.7 jako domyślnego i K3 jako ścieżki eskalacji.

Metryką, która ostatecznie ma znaczenie, nie jest koszt pojedynczego wywołania API, lecz koszt na pomyślnie zrealizowane zadanie.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej