Kimi K3 is now live on CometAPI →

Bảng giá API Kimi K3 (2026): Chi phí & So sánh mã K2.7

CometAPI
Mia MarenJul 17, 2026
Bảng giá API Kimi K3 (2026): Chi phí & So sánh mã K2.7

TL;DR

Kimi K3 có chi phí $0.30 cho mỗi 1M token input cache-hit, $3.00 cho mỗi 1M token input cache-miss, và $15.00 cho mỗi 1M token output, với cửa sổ ngữ cảnh 1,048,576 token.

So với K2.7 Code, K3 đắt hơn đáng kể trên mỗi token, nhưng cung cấp cửa sổ ngữ cảnh lớn gấp 4×, cộng với năng lực thị giác gốc và hỗ trợ mạnh hơn cho các khối lượng công việc tác tử dài hạn.

Bottom line: K2.7 Code vẫn là lựa chọn kinh tế hơn cho các tác vụ lập trình thường nhật trong phạm vi 256K ngữ cảnh. Hãy dùng K3 khi bạn cần ngữ cảnh lớn hơn, khả năng đa phương thức, hoặc như tuyến leo thang cho các tác vụ K2.7 không thể hoàn thành ổn định.

Kimi K3 API Pricing at a Glance

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningLuôn bật
Supported reasoning effortchỉ max
Default maximum completion131,072 tokens
Configurable maximum completionTối đa 1,048,576 tokens, tùy thuộc giới hạn tổng ngữ cảnh
Key capabilitiesThị giác gốc, gọi công cụ, đầu ra có cấu trúc, Partial Mode, nạp công cụ động, tự động lưu đệm ngữ cảnh
Batch APIK3 hiện chưa nằm trong danh sách các model được Batch hỗ trợ

Xem khởi động nhanh Kimi K3 của Moonshot để biết tham số API và chi tiết tích hợp mới nhất.

What Kimi K3 Adds Over K2.7 Code

Nâng cấp rõ ràng nhất là độ dài ngữ cảnh.

K2.7 Code hỗ trợ 262,144 token, trong khi K3 tăng giới hạn đó lên 1,048,576 token. Điều này khiến K3 thực tế hơn cho các kho mã lớn, lịch sử tác tử dài, tài liệu đồ sộ và các quy trình lẽ ra phải rút gọn ngữ cảnh.

K3 cũng hỗ trợ:

  • hiểu thị giác gốc
  • đầu ra có cấu trúc nghiêm ngặt
  • tool_choice
  • nạp công cụ động
  • tự động lưu đệm ngữ cảnh
  • quy trình lập trình và tri thức chạy dài

Kimi K3 technical blog của Moonshot báo cáo 88.3 trên Terminal-Bench 2.1, 77.8 trên Program Bench, và 81.2 trên FrontierSWE.

Đây là số liệu do nhà cung cấp báo cáo và nên được xem như lý do để đánh giá K3—không phải đảm bảo rằng nó sẽ vượt trội K2.7 Code trên mọi khối lượng công việc sản xuất.

Để tìm hiểu thế hệ trước, xem Kimi K2 API guide của CometAPI.

Kimi K3 vs Kimi K2.7 Code Pricing

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Các mức K2.7 lấy từ tài liệu giá chính thức của Kimi K2.7 Code của Moonshot.

So với K2.7 Code tiêu chuẩn, K3:

  • đắt hơn 1.58× cho input cache-hit
  • đắt hơn 3.16× cho input cache-miss
  • đắt hơn 3.75× cho output

Khoảng chênh của K3 nhỏ hơn nếu so với K2.7 Code HighSpeed, nhưng hai model này nhắm tới các ưu tiên khác nhau: HighSpeed tập trung vào tốc độ xuất mã, trong khi K3 hướng tới các khối lượng công việc dài ngữ cảnh và tác tử đòi hỏi khắt khe hơn.

Tài liệu giá Batch API hiện tại của Moonshot không liệt kê K3, vì vậy đừng giả định các mức giảm giá Batch áp dụng cho model Kimi khác cũng áp dụng ở đây.

Kimi K3 Context Caching: How the 90% Input Discount Works

K3 hỗ trợ lưu đệm ngữ cảnh tự động.

Nhà phát triển không cần tự tạo cache ID hoặc TTL. Giữ nguyên các tiền tố lớn trong nhiều yêu cầu liên tiếp sẽ tạo cơ hội để các yêu cầu sau nhận mức giá cache-hit.

Chênh lệch giá là:

  • Cache miss: $3.00 / 1M token input
  • Cache hit: $0.30 / 1M token input

Vì vậy, token input cache-hit rẻ hơn 90% so với token input cache-miss.

Tuy nhiên, output vẫn có giá $15 mỗi triệu token, nên tổng chi phí yêu cầu không giảm 90%.

Ví dụ, giả định:

  • 600,000 token input
  • 20,000 token output
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

Trong trường hợp đơn giản này, tổng chi phí giảm khoảng 77%.

Mức tiết kiệm thực tế phụ thuộc vào tỷ lệ token input nhận được mức giá cache-hit.

Example: What a Coding Task Costs on K3 vs K2.7

Giả định một tác vụ lập trình sử dụng:

  • 200,000 token input
  • 20,000 token output
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Với khối lượng công việc này, K3 đắt khoảng 3.33× so với K2.7 Code tiêu chuẩn cho yêu cầu “lạnh”.

Ngay trong K3, chuyển từ toàn bộ input cache-miss sang input hoàn toàn được cache giảm chi phí ước tính từ $0.90 xuống $0.36, tức giảm 60% trong ví dụ này.

Nhưng chi phí mỗi yêu cầu chỉ là một phần của bài toán.

Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks

So sánh trong môi trường sản xuất cũng nên tính đến các lần thử lại, cuộc gọi fallback, gọi công cụ và thời gian rà soát của con người.

Một yêu cầu K3 thành công ngay có thể kinh tế hơn nhiều lần thử rẻ hơn nhưng thất bại.

A Real-World Edge Case: Reasoning Token Cost

K3 luôn sử dụng suy luận, vì vậy tiêu thụ token output có thể trở thành một phần đáng kể của hóa đơn.

Trong bài thử ngày ra mắt của Simon Willison, một prompt yêu cầu K3 tạo SVG đã tiêu thụ 13,241 token suy luận trước khi tạo 3,417 token phản hồi, với tổng chi phí xấp xỉ $0.25.

Đây là thử nghiệm không chính thức với một prompt duy nhất chứ không phải benchmark, nhưng nêu bật một lưu ý chi phí quan trọng: câu trả lời hiển thị cuối cùng có thể chỉ là một phần của lượng output bị tính phí.

Vì hiện tại K3 chỉ hỗ trợ mức nỗ lực suy luận tối đa, các nhóm nên đo lường lượng token output thực tế trên chính khối lượng công việc của mình.

A Better Default: K2.7 First, K3 on Escalation

Với các khối lượng công việc lập trình hỗn hợp, định tuyến có thể kinh tế hơn so với gửi mọi yêu cầu trực tiếp tới K3.

Một chiến lược đơn giản là:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Dùng ví dụ trước:

  • K2.7 Code tốn $0.27 cho mỗi lần thử “lạnh”
  • K3 tốn $0.90
  • K2.7 hoàn thành thành công 70% tác vụ
  • 30% được thử lại một lần trên K3

Chi phí trung bình trở thành:

$0.27 + (30% × $0.90) = $0.54 per task

Gửi mọi tác vụ trực tiếp tới K3 sẽ tốn $0.90 mỗi tác vụ theo cùng giả định token.

Điều đó khiến chiến lược định tuyến rẻ hơn 40% trong kịch bản đơn giản này.

Mức tiết kiệm chính xác sẽ khác nhau, nhưng nguyên tắc chung hữu ích: định tuyến công việc thường lệ tới model rẻ hơn và chỉ leo thang khi thực sự cần thêm năng lực.

When Is Kimi K3 Worth the Upgrade?

K3 đặc biệt thuyết phục khi:

  • Ngữ cảnh yêu cầu vượt quá giới hạn 262,144 token của K2.7 Code.
  • Tác vụ kết hợp mã với đầu vào hình ảnh.
  • Một tác tử chạy dài cần làm việc trên các kho mã lớn và công cụ bên ngoài.
  • K2.7 thường xuyên cần thử lại hoặc gọi fallback.
  • Tác vụ đủ giá trị để chất lượng hoàn thành quan trọng hơn việc tối thiểu hóa chi phí lượt gọi đầu tiên.

K2.7 Code vẫn là lựa chọn mạnh cho các tác vụ lập trình lặp lại, phạm vi rõ ràng và đạt tỷ lệ thành công cao trong 256K ngữ cảnh.

Với các ứng dụng lập trình nhạy độ trễ, cũng nên thử riêng K2.7 Code HighSpeed.

Migrating from K2.7 to K3: Five Engineering Checks

  1. K3 Reasoning Cannot Currently Be Reduced

K3 luôn suy luận, và API hiện tại chỉ hỗ trợ:

reasoning_effort="max"

max là mặc định, tham số này cũng có thể được bỏ qua.

  1. Remove K2-Specific thinking Parameters

Không dùng tham số thinking của K2.x với K3.

Hãy dùng trường reasoning_effort ở cấp trên cùng.

  1. Omit Fixed Sampling Parameters

K3 hiện dùng các giá trị cố định cho các tham số bao gồm:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot khuyến nghị bỏ qua các trường này thay vì override.

  1. Preserve Complete Assistant Messages

Với hội thoại nhiều lượt và vòng lặp gọi công cụ, hãy truyền thông điệp assistant đầy đủ vào yêu cầu kế tiếp thay vì chỉ giữ content hiển thị.

  1. Validate Vision and Search Before Production

API vision hiện tại của K3 không hỗ trợ trực tiếp ảnh từ URL công khai. Hãy dùng định dạng ảnh được hỗ trợ như dữ liệu base64 hoặc cơ chế tham chiếu tệp của Moonshot.

Moonshot cũng khuyên không nên dựa vào chức năng Web Search hiện tại cho mục đích sản xuất trong ngắn hạn khi tính năng này đang được cập nhật.

Kimi K3 API Example in Python

K3 có thể được gọi qua giao diện API tương thích OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Tránh override các tham số lấy mẫu cố định của K3. Với quy trình nhiều lượt và gọi công cụ, hãy bảo toàn thông điệp assistant đầy đủ.

How to Evaluate Kimi K3 Before Upgrading

Hãy thử K3 trên khối lượng công việc thực tế thay vì chỉ các prompt benchmark.

Một bộ đánh giá thực tế có thể bao gồm:

  • các chỉnh sửa kho mã thường lệ
  • tác vụ gần giới hạn 256K ngữ cảnh
  • tác vụ vượt quá 256K
  • tác vụ kỹ thuật có yếu tố thị giác
  • tác vụ tác tử hoặc tri thức dài hạn

So sánh K3, K2.7 Code và K2.7 Code HighSpeed khi phù hợp.

Theo dõi:

  • tỷ lệ thành công tác vụ
  • token input được cache và không được cache
  • token output và suy luận
  • số lần thử lại và cuộc gọi fallback
  • độ trễ p50 và p95
  • lỗi gọi công cụ
  • thời gian rà soát của con người
  • chi phí trên mỗi tác vụ thành công

Sau đó so sánh ba chính sách:

  1. Tất cả K2.7 Code
  2. Tất cả K3
  3. K2.7 Code với leo thang sang K3

Tuyến tốt nhất là tuyến đáp ứng yêu cầu chất lượng và độ trễ với chi phí thấp nhất trên mỗi tác vụ thành công.

Kimi K3 Pricing on CometAPI

Các phép tính trên dùng giá API chính thức của Moonshot AI để giữ sự nhất quán khi so sánh K3 và K2.7.

Tại thời điểm công bố, Kimi K3 trên CometAPI có giá thấp hơn 20% so với mức API tiêu chuẩn của Moonshot AI:

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Vì giá API có thể thay đổi, hãy kiểm tra trang model trực tiếp trước khi dùng các con số này cho ngân sách sản xuất.

API tương thích OpenAI của CometAPI giúp bạn dễ dàng thử kimi-k3 cùng các tuyến model khác bằng cùng prompt và quy trình đánh giá.

Ready to test Kimi K3? Xem Kimi K3 trên CometAPI và so sánh giá trước khi đưa vào sản xuất.

Để xem ví dụ tích hợp và đánh giá, tham khảo CometAPI Cookbook trên GitHub.

FAQ

Kimi K3 API giá bao nhiêu?

Moonshot AI niêm yết Kimi K3 ở mức $0.30 cho mỗi 1 triệu token input cache-hit, $3.00 cho mỗi 1 triệu token input cache-miss, và $15.00 cho mỗi 1 triệu token output.

API model ID là kimi-k3.

Kimi K3 có rẻ hơn Kimi K2.7 Code không?

Không. Dựa trên mức giá chính thức của Moonshot, K3 đắt hơn khoảng 3.16× cho input cache-miss và 3.75× cho output.

Tuy nhiên, nó vẫn có thể giảm chi phí quy trình nếu cải thiện tỷ lệ thành công tác vụ hoặc giảm số lần thử lại.

Kimi K3 có cửa sổ ngữ cảnh 1M token không?

Có. Kimi K3 hỗ trợ cửa sổ ngữ cảnh 1,048,576 token, so với 262,144 token của Kimi K2.7 Code.

Kimi K3 có hỗ trợ lưu đệm ngữ cảnh tự động không?

Có. Lưu đệm ngữ cảnh là tự động. Token input cache-hit có giá $0.30 mỗi triệu so với $3.00 mỗi triệu cho token input cache-miss.

Tôi có thể tắt suy luận của Kimi K3 để giảm chi phí không?

Hiện không. K3 luôn suy luận, và reasoning_effort="max" là mức nỗ lực suy luận duy nhất được hỗ trợ.

Final Thoughts

Kimi K3 cung cấp ngữ cảnh lớn hơn đáng kể và năng lực rộng hơn so với K2.7 Code, nhưng với mức giá token cao hơn.

Với lập trình thường nhật trong 256K ngữ cảnh, K2.7 Code thường là lựa chọn kinh tế hơn. Với tác vụ dài ngữ cảnh, đa phương thức, hoặc tác tử khó, K3 có thể xứng đáng với phần bù—đặc biệt khi nó cải thiện khả năng hoàn thành thành công.

Với nhiều hệ thống sản xuất, chiến lược hiệu quả không phải thay thế hoàn toàn K2.7, mà là dùng K2.7 làm mặc định và K3 làm tuyến leo thang.

Chỉ số cuối cùng quan trọng không phải chi phí mỗi cuộc gọi API, mà là chi phí trên mỗi tác vụ thành công.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm