Kimi K3 is now live on CometAPI →

Kimi K3 API 가격(2026): 비용 & K2.7 코드 비교

CometAPI
Mia MarenJul 17, 2026
Kimi K3 API 가격(2026): 비용 & K2.7 코드 비교

요약

Kimi K3의 요금은 캐시 적중 입력 토큰 1M당 $0.30, 캐시 미스 입력 토큰 1M당 $3.00, 출력 토큰 1M당 $15.00이며, 1,048,576토큰컨텍스트 윈도우를 제공합니다.

K2.7 Code와 비교해 K3는 토큰당 비용이 상당히 높지만, 컨텍스트 윈도우가 4배로 늘고 네이티브 비전과 더 강력한 장기 지향 에이전트형 워크로드 지원을 제공합니다.

핵심 요약: 256K 컨텍스트 내의 일상적인 코딩 작업에는 K2.7 Code가 여전히 더 경제적입니다. 더 큰 컨텍스트, 멀티모달 기능이 필요하거나 K2.7로는 안정적으로 완료하기 어려운 작업의 에스컬레이션 경로로 K3를 사용하세요.

Kimi K3 API 요금 한눈에 보기

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
Reasoning항상 활성화
Supported reasoning effortmax만 지원
Default maximum completion131,072 tokens
Configurable maximum completion전체 컨텍스트 한도 내에서 최대 1,048,576 tokens
Key capabilities네이티브 비전, 도구 호출, 구조화 출력, Partial Mode, 동적 도구 로딩, 자동 컨텍스트 캐싱
Batch API현재 지원되는 Batch 모델에 K3는 포함되어 있지 않음

최신 API 파라미터와 통합 세부 정보는 Moonshot의 Kimi K3 빠른 시작을 참고하세요.

K2.7 Code 대비 Kimi K3의 추가 사항

가장 눈에 띄는 업그레이드는 컨텍스트 길이입니다.

K2.7 Code는 262,144 토큰을 지원하는 반면, K3는 이 한도를 1,048,576 토큰으로 늘립니다. 이는 대규모 리포지토리, 긴 에이전트 히스토리, 방대한 문서, 컨텍스트 축소가 필요한 워크플로에 대해 K3를 더 실용적으로 만듭니다.

K3는 다음도 지원합니다:

  • 네이티브 시각적 이해
  • 엄격한 구조화 출력
  • tool_choice
  • 동적 도구 로딩
  • 자동 컨텍스트 캐싱
  • 장시간 코딩 및 지식 작업 워크플로

Moonshot의 Kimi K3 기술 블로그는 Terminal-Bench 2.1에서 88.3, Program Bench에서 77.8, FrontierSWE에서 81.2를 보고합니다.

이는 제공업체가 보고한 벤치마크이므로 K3가 모든 프로덕션 워크로드에서 K2.7 Code보다 뛰어날 것이라고 보장하지는 않으며, K3를 평가할 이유로 받아들여야 합니다.

이전 세대에 대한 배경은 CometAPI의 Kimi K2 API 가이드를 참고하세요.

Kimi K3 vs Kimi K2.7 Code 요금

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

K2.7 요금은 Moonshot의 Kimi K2.7 Code 공식 요금 문서에서 가져왔습니다.

표준 K2.7 Code 대비 K3는:

  • 캐시 적중 입력에 대해 1.58배
  • 캐시 미스 입력에 대해 3.16배
  • 출력에 대해 3.75배 가격입니다

K3의 프리미엄은 K2.7 Code HighSpeed 대비로는 더 작지만, 두 모델은 우선순위가 다릅니다. HighSpeed는 더 빠른 코딩 출력을 지향하고, K3는 더 까다로운 장기 컨텍스트와 에이전트형 워크로드를 목표로 합니다.

Moonshot의 현재 Batch API 요금 문서에 K3는 나열되어 있지 않으므로, 다른 Kimi 모델에 적용되는 Batch 할인도 여기에 적용된다고 가정하지 마세요.

Kimi K3 컨텍스트 캐싱: 90% 입력 할인 작동 방식

K3는 자동 컨텍스트 캐싱을 지원합니다.

개발자는 캐시 ID나 TTL을 수동으로 생성할 필요가 없습니다. 여러 요청에서 큰 프리픽스를 안정적으로 유지하면 이후 요청이 캐시 적중 요금을 적용받을 기회를 얻습니다.

가격 차이는 다음과 같습니다:

  • 캐시 미스: 입력 토큰 1M당 $3.00
  • 캐시 적중: 입력 토큰 1M당 $0.30

즉, 캐시 적중 입력 토큰은 캐시 미스 입력 토큰보다 90% 저렴합니다.

다만 출력은 1M당 $15로 유지되므로, 전체 요청 비용이 90%까지 떨어지지는 않습니다.

예를 들어 다음과 같다고 가정하면:

  • 입력 토큰 600,000
  • 출력 토큰 20,000
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

이 단순화된 경우 총 비용은 약 77% 감소합니다.

실제 절감액은 캐시 적중 요금을 적용받는 입력 토큰 비중에 따라 달라집니다.

예시: K3 vs K2.7에서 코딩 작업 비용

코딩 작업이 다음을 사용한다고 가정합니다:

  • 입력 토큰 200,000
  • 출력 토큰 20,000
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

이 워크로드에서 냉(콜드) 요청 기준 K3는 표준 K2.7 Code보다 약 3.33배 비쌉니다.

K3 내에서 전부 캐시 미스 입력에서 전부 캐시 적중 입력으로 전환하면 추정 요청 비용은 $0.90에서 $0.36으로 감소하여, 이 예시에서는 60% 절감됩니다.

하지만 요청당 비용만이 전부는 아닙니다.

성공한 작업당 비용 = 전체 워크플로 지출 ÷ 승인 검사를 통과한 작업 수

프로덕션 비교에는 재시도, 폴백 호출, 도구 실행, 휴먼 리뷰 시간도 포함해야 합니다.

한 번에 성공하는 K3 요청이 여러 번의 실패하는 저가 시도보다 더 경제적일 수 있습니다.

실제 엣지 케이스: 추론 토큰 비용

K3는 항상 추론을 사용하므로, 출력 토큰 소비가 청구서의 의미 있는 부분이 될 수 있습니다.

Simon Willison의 출시일 테스트에서는 K3에 SVG 생성을 요청했을 때 응답 토큰 3,417개를 생성하기 전 13,241개의 추론 토큰을 소비했고, 총 비용은 약 $0.25였습니다.

이는 벤치마크가 아닌 단일 프롬프트의 비공식 테스트였지만, 중요한 비용 고려사항을 보여줍니다. 즉, 눈에 보이는 최종 답변이 청구되는 출력의 일부만을 나타낼 수 있다는 점입니다.

현재 K3는 최대 추론 강도만 지원하므로, 팀은 자신의 워크로드에서 실제 출력·추론 토큰 사용량을 측정해야 합니다.

더 나은 기본값: K2.7 우선, 필요 시 K3로 에스컬레이션

혼합 코딩 워크로드에서는 모든 요청을 곧바로 K3로 보내는 것보다 라우팅이 더 경제적일 수 있습니다.

간단한 전략은 다음과 같습니다:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

앞선 예시를 적용하면:

  • K2.7 Code는 콜드 시도당 $0.27
  • K3는 $0.90
  • K2.7이 작업의 70%를 성공적으로 완료
  • 30%는 K3에서 한 번 재시도

평균 비용은 다음과 같습니다:

$0.27 + (30% × $0.90) = $0.54 per task

동일한 토큰 가정에서 모든 작업을 K3로 직접 보내면 작업당 비용이 $0.90이 됩니다.

따라서 이 단순화된 시나리오에서 라우팅 전략이 40% 더 저렴합니다.

정확한 절감액은 달라질 수 있지만, 원칙은 유효합니다. 일상 업무는 더 저렴한 모델로 처리하고, 추가 능력이 실제로 필요할 때 에스컬레이션하세요.

Kimi K3로 업그레이드할 가치가 있는 경우

K3가 가장 설득력 있는 경우는 다음과 같습니다:

  • 필요한 컨텍스트가 K2.7 Code의 262,144토큰 한도를 초과할 때
  • 작업이 코드와 시각 입력을 결합할 때
  • 장시간 에이전트가 대규모 리포지토리와 외부 도구 전반에서 작업해야 할 때
  • K2.7에서 재시도나 폴백 호출이 빈번할 때
  • 작업의 가치가 충분히 높아 최초 호출 비용을 최소화하는 것보다 완성 품질이 중요할 때

K2.7 Code는 256K 컨텍스트 내에서 이미 높은 성공률을 보이는 반복적이고 범위가 명확한 코딩 작업에 여전히 강력한 선택지입니다.

지연에 민감한 코딩 애플리케이션이라면 K2.7 Code HighSpeed도 별도로 테스트해야 합니다.

K2.7에서 K3로 마이그레이션: 엔지니어링 체크 5가지

  1. K3의 추론은 현재 줄일 수 없음

K3는 항상 추론을 수행하며, 현재 API는 다음만 지원합니다:

reasoning_effort="max"

max가 기본값이므로, 이 파라미터는 생략해도 됩니다.

  1. K2 전용 thinking 파라미터 제거

K3에서는 K2.x의 thinking 파라미터를 사용하지 마세요.

최상위 reasoning_effort 필드를 대신 사용하세요.

  1. 고정 샘플링 파라미터 생략

K3는 현재 다음과 같은 파라미터에 대해 고정값을 사용합니다:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot는 이 필드를 재정의하지 말고 생략할 것을 권장합니다.

  1. Assistant 메시지를 완전하게 보존

멀티턴 대화 및 도구 호출 루프에서는 눈에 보이는 content만 유지하지 말고, 전체 assistant 메시지를 다음 요청으로 전달하세요.

  1. 프로덕션 전 Vision과 Search 검증

K3의 현재 비전 API는 공용 이미지 URL을 직접 지원하지 않습니다. base64 데이터나 Moonshot의 파일 참조 메커니즘 등 지원되는 이미지 형식을 사용하세요.

또한 Moonshot는 해당 기능이 업데이트되는 동안 현재 Web Search 기능에 대한 단기 프로덕션 의존을 권장하지 않습니다.

Kimi K3 API Python 예시

K3는 OpenAI 호환 API 인터페이스를 통해 호출할 수 있습니다:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

K3의 고정 샘플링 파라미터를 재정의하지 마세요. 멀티턴 및 도구 호출 워크플로에서는 전체 assistant 메시지를 보존하세요.

업그레이드 전 Kimi K3 평가 방법

벤치마크 프롬프트만이 아니라 실제 워크로드에서 K3를 테스트하세요.

실용적인 평가 세트에는 다음이 포함될 수 있습니다:

  • 일상적인 리포지토리 수정
  • 256K 컨텍스트 한계에 근접한 작업
  • 256K를 초과하는 작업
  • 시각 엔지니어링 작업
  • 장기 지향 에이전트형 또는 지식 작업

적용 가능한 경우 K3, K2.7 Code, K2.7 Code HighSpeed를 비교하세요.

추적 항목:

  • 작업 성공률
  • 캐시 적용·미적용 입력 토큰
  • 출력 및 추론 토큰
  • 재시도 및 폴백 호출
  • p50 및 p95 지연
  • 도구 호출 에러
  • 휴먼 리뷰 시간
  • 성공한 작업당 비용

그런 다음 세 가지 정책을 비교하세요:

  1. 전부 K2.7 Code
  2. 전부 K3
  3. K2.7 Code 기본 + K3 에스컬레이션

최선의 경로는 품질과 지연 요구사항을 충족하면서 성공한 작업당 비용이 가장 낮은 것입니다.

CometAPI의 Kimi K3 요금

위의 계산은 K3와 K2.7 비교의 일관성을 위해 Moonshot AI의 공식 API 요금을 사용했습니다.

게시 시점 기준, CometAPI의 Kimi K3는 Moonshot AI 표준 API 요금보다 20% 저렴합니다:

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

API 요금은 변경될 수 있으므로, 프로덕션 예산에 반영하기 전 라이브 모델 페이지를 확인하세요.

CometAPI의 OpenAI 호환 API를 사용하면 동일한 프롬프트와 평가 워크플로로 kimi-k3를 다른 모델 경로와 함께 쉽게 테스트할 수 있습니다.

Kimi K3를 테스트할 준비가 되셨나요? CometAPI의 Kimi K3 페이지를 확인하고 프로덕션 도입 전 요금을 비교하세요.

통합 및 평가 예시는 GitHub의 CometAPI Cookbook을 참고하세요.

FAQ

Kimi K3 API 비용은 얼마인가요?

Moonshot AI는 Kimi K3의 요금을 캐시 적중 입력 토큰 1M당 $0.30, 캐시 미스 입력 토큰 1M당 $3.00, 출력 토큰 1M당 $15.00으로 안내합니다.

API 모델 ID는 kimi-k3입니다.

Kimi K3가 Kimi K2.7 Code보다 저렴한가요?

아니요. Moonshot의 공식 요금 기준으로, K3는 캐시 미스 입력에서 약 3.16배, 출력에서 3.75배의 가격입니다.

그럼에도, 작업 성공률을 높이거나 재시도를 줄인다면 워크플로 비용을 낮출 수 있습니다.

Kimi K3는 1M 토큰 컨텍스트 윈도우를 지원하나요?

예. Kimi K3는 1,048,576 토큰컨텍스트 윈도우를 지원하며, Kimi K2.7 Code의 262,144 토큰과 비교됩니다.

Kimi K3는 자동 컨텍스트 캐싱을 지원하나요?

예. 컨텍스트 캐싱은 자동입니다. 캐시 적중 입력 토큰은 1M당 $0.30, 캐시 미스 입력 토큰은 1M당 $3.00입니다.

비용 절감을 위해 Kimi K3의 추론을 끌 수 있나요?

현재는 불가합니다. K3는 항상 추론을 사용하며, 지원되는 추론 강도는 reasoning_effort="max"뿐입니다.

마무리

Kimi K3는 K2.7 Code보다 토큰 가격이 높지만, 훨씬 긴 컨텍스트와 더 넓은 기능을 제공합니다.

256K 컨텍스트 내의 일상적 코딩에는 K2.7 Code가 보통 더 경제적입니다. 장기 컨텍스트, 멀티모달, 까다로운 에이전트형 작업에는 K3가 프리미엄을 정당화할 수 있으며, 특히 성공적 완료를 개선할 때 더욱 그렇습니다.

많은 프로덕션 시스템에서 가장 효율적인 전략은 K2.7을 완전히 대체하는 것이 아니라, 기본은 K2.7을 사용하고 필요 시 K3로 에스컬레이션하는 것입니다.

궁극적으로 중요한 지표는 API 호출당 비용이 아니라 성공한 작업당 비용입니다.

AI 개발 비용을 20% 절감할 준비가 되셨나요?

몇 분 안에 무료로 시작하세요. 무료 체험 크레딧 제공. 신용카드 불필요.

더 보기