TL;DR
Kimi K3 стоит $0.30 за 1M входных токенов при попадании в кэш, $3.00 за 1M входных токенов при промахе кэша и $15.00 за 1M выходных токенов, с окном контекста в 1,048,576 токенов.
По сравнению с K2.7 Code, K3 значительно дороже на токен, но предлагает 4× большее окно контекста, а также нативное восприятие изображений и более сильную поддержку длительных агентных рабочих нагрузок.
Bottom line: K2.7 Code остаётся более экономичным выбором для рутинных задач кодирования в пределах 256K контекста. Используйте K3, когда нужен больший контекст, мультимодальные возможности или как путь эскалации для задач, которые K2.7 не может надёжно выполнить.
Цены Kimi K3 API вкратце
| Параметр | Kimi K3 |
|---|---|
| ID модели API | kimi-k3 |
| Вход при попадании в кэш | $0.30 / 1M токенов |
| Вход при промахе кэша | $3.00 / 1M токенов |
| Выход | $15.00 / 1M токенов |
| Окно контекста | 1,048,576 токенов |
| Рассуждение | Всегда включено |
| Поддерживаемый уровень рассуждения | только max |
| Максимальная длина завершения по умолчанию | 131,072 токенов |
| Настраиваемая максимальная длина завершения | До 1,048,576 токенов, при условии общего ограничения контекста |
| Ключевые возможности | Нативное понимание изображений, вызовы инструментов, структурированный вывод, Partial Mode, динамическая загрузка инструментов, автоматическое кэширование контекста |
| Batch API | K3 в настоящее время не указан среди поддерживаемых моделей Batch |
См. краткое руководство Kimi K3 quickstart от Moonshot для актуальных параметров API и деталей интеграции.
Что добавляет Kimi K3 по сравнению с K2.7 Code
Самое очевидное обновление — длина контекста.
K2.7 Code поддерживает 262,144 токена, тогда как K3 увеличивает этот предел до 1,048,576 токенов. Это делает K3 более практичным для больших репозиториев, длинной истории агента, обширной документации и рабочих процессов, которые иначе потребовали бы сокращения контекста.
K3 также поддерживает:
- нативное понимание изображений
- строгий структурированный вывод
tool_choice- динамическую загрузку инструментов
- автоматическое кэширование контекста
- длительные рабочие процессы по кодированию и работе со знаниями
Технический блог Moonshot Kimi K3 сообщает 88.3 на Terminal-Bench 2.1, 77.8 на Program Bench и 81.2 на FrontierSWE.
Это показатели, заявленные провайдером, и их следует рассматривать как повод оценить K3 — а не гарантии того, что он превзойдёт K2.7 Code на каждой производственной задаче.
Для справки по предыдущему поколению см. руководство Kimi K2 API от CometAPI.
Сравнение цен: Kimi K3 vs Kimi K2.7 Code
| Модель | Вход (кэш-хит) | Вход (кэш-мисс) | Выход | Контекст |
|---|---|---|---|---|
| kimi-k3 | $0.30 / 1M | $3.00 / 1M | $15.00 / 1M | 1,048,576 |
| kimi-k2.7-code | $0.19 / 1M | $0.95 / 1M | $4.00 / 1M | 262,144 |
| kimi-k2.7-code-highspeed | $0.38 / 1M | $1.90 / 1M | $8.00 / 1M | 262,144 |
Тарифы K2.7 взяты из официальной документации по ценообразованию Kimi K2.7 Code от Moonshot.
По сравнению со стандартным K2.7 Code, K3:
- дороже в 1.58× по входу при попадании в кэш
- дороже в 3.16× по входу при промахе кэша
- дороже в 3.75× по выходу
Премия K3 меньше относительно K2.7 Code HighSpeed, но эти две модели нацелены на разные приоритеты: HighSpeed ориентирован на более быстрое получение кода, тогда как K3 рассчитан на более требовательные нагрузки с длинным контекстом и агентностью.
Текущая документация по ценам Batch API от Moonshot не включает K3, поэтому не следует считать, что скидки Batch, доступные для других моделей Kimi, применимы и здесь.
Кэширование контекста Kimi K3: как работает скидка 90% на вход
K3 поддерживает автоматическое кэширование контекста.
Разработчикам не нужно вручную создавать cache ID или TTL. Сохранение крупных префиксов неизменными в повторяющихся запросах даёт последующим запросам возможность получить тариф при попадании в кэш.
Разница в цене:
- Промах кэша: $3.00 / 1M входных токенов
- Попадание в кэш: $0.30 / 1M входных токенов
Таким образом, входные токены при попадании в кэш стоят на 90% дешевле, чем при промахе кэша.
Однако стоимость выхода остаётся $15 за миллион токенов, поэтому общая стоимость запроса не уменьшается на 90%.
Например, предположим:
- 600,000 входных токенов
- 20,000 выходных токенов
| Состояние кэша | Стоимость входа | Стоимость выхода | Итого |
|---|---|---|---|
| Весь вход — промах кэша | $1.80 | $0.30 | $2.10 |
| Весь вход — кэш-хит | $0.18 | $0.30 | $0.48 |
В этом упрощённом случае общая стоимость падает примерно на 77%.
Фактическая экономия зависит от доли входных токенов, получающих тариф при попадании в кэш.
Пример: во что обходится задача по кодированию на K3 vs K2.7
Предположим, что задача по кодированию использует:
- 200,000 входных токенов
- 20,000 выходных токенов
| Вариант | Итог (cold) | Итог (полный кэш-хит) |
|---|---|---|
| kimi-k3 | $0.90 | $0.36 |
| kimi-k2.7-code | $0.27 | $0.12 |
| kimi-k2.7-code-highspeed | $0.54 | $0.24 |
Для этой нагрузки K3 стоит примерно в 3.33× дороже, чем стандартный K2.7 Code, при холодном запросе.
Внутри K3 переход от полностью кэш-мисс входа к полностью кэш-хиту снижает оценочную стоимость запроса с $0.90 до $0.36, что в этом примере даёт 60% сокращение.
Но стоимость одного запроса — лишь часть уравнения.
Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks
Производственное сравнение также должно учитывать повторные попытки, вызовы инструментов, выполнение запасных маршрутов и время ручной проверки.
Один успешный запрос K3 может оказаться экономичнее нескольких более дешёвых попыток, которые завершились неудачей.
Реальный крайний случай: стоимость токенов рассуждения
K3 всегда использует рассуждение, поэтому потребление выходных токенов может стать значимой частью счёта.
В тесте в день запуска от Simon Willison запрос к K3 на генерацию SVG потребил 13,241 токенов рассуждения до выдачи 3,417 токенов ответа, что дало общую стоимость примерно $0.25.
Это была не бенчмарк, а неформальная проверка одним запросом, но она подчёркивает важный фактор стоимости: видимый итоговый ответ может составлять лишь часть тарифицируемого выхода.
Поскольку K3 в настоящее время поддерживает только максимальные усилия рассуждения, командам следует измерять фактическое использование выходных токенов на своих рабочих нагрузках.
Лучший дефолт: сначала K2.7, K3 по эскалации
Для смешанных нагрузок по кодированию маршрутизация может быть экономичнее, чем отправлять каждый запрос напрямую в K3.
Простая стратегия:
Start with K2.7 Code
↓
Task exceeds 256K context?
→ Yes: use K3
↓ No
Run task and validation
↓
Validation failed?
→ Yes: escalate to K3
↓ No
Return result
Используя предыдущий пример:
- K2.7 Code стоит $0.27 за холодную попытку
- K3 стоит $0.90
- K2.7 успешно завершает 70% задач
- 30% повторно запускаются один раз на K3
Средняя стоимость становится:
$0.27 + (30% × $0.90) = $0.54 per task
Отправка каждой задачи напрямую в K3 стоила бы $0.90 за задачу при тех же предположениях о токенах.
Это делает стратегию маршрутизации на 40% дешевле в этом упрощённом сценарии.
Точные сбережения будут варьироваться, но принцип полезен: направляйте рутинную работу на более дешёвую модель и эскалируйте, когда действительно требуется дополнительная возможность.
Когда стоит переходить на Kimi K3?
K3 наиболее привлекателен, когда:
- Требуемый контекст превышает лимит K2.7 Code в 262,144 токена.
- Задача комбинирует код с визуальным вводом.
- Долговременный агент должен работать с большими репозиториями и внешними инструментами.
- K2.7 требует частых повторных попыток или откатов.
- Задача достаточно ценная, чтобы качество завершения было важнее минимизации стоимости первого вызова.
K2.7 Code остаётся сильным вариантом для повторяющихся, чётко ограниченных задач по кодированию, которые уже достигают высокой успешности в пределах 256K контекста.
Для чувствительных к задержкам приложений кодирования следует отдельно протестировать K2.7 Code HighSpeed.
Миграция с K2.7 на K3: пять инженерных проверок
-
Нельзя снизить уровень рассуждения в K3 на текущий момент
K3 всегда рассуждает, и текущий API поддерживает только:
reasoning_effort="max"
Поскольку max — значение по умолчанию, параметр можно также опустить.
-
Удалите специфичные для K2 параметры
thinking
Не используйте параметр K2.x thinking с K3.
Вместо этого используйте верхнеуровневое поле reasoning_effort.
-
Опустите фиксированные параметры сэмплирования
K3 в настоящее время использует фиксированные значения для параметров, включая:
temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0
Moonshot рекомендует опускать эти поля, а не переопределять их.
-
Сохраняйте полные сообщения ассистента
Для многотуровых диалогов и циклов вызова инструментов передавайте полное сообщение ассистента в следующий запрос, а не только видимый content.
-
Проверьте Vision и Search перед продакшеном
Текущий vision API K3 не поддерживает напрямую публичные URL-адреса изображений. Используйте поддерживаемый формат, например данные base64, или механизм ссылок на файлы (file-reference) от Moonshot.
Moonshot также рекомендует пока не полагаться на текущую функциональность Web Search в продакшен-сценариях, поскольку функция находится в процессе обновления.
Пример Kimi K3 API на Python
K3 можно вызывать через OpenAI-совместимый интерфейс API:
from openai import OpenAI
client = OpenAI(
base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are an expert software engineer.",
},
{
"role": "user",
"content": "Analyze this repository logic and identify potential issues.",
},
],
reasoning_effort="max", # Optional while "max" is the default
)
assistant_message = response.choices[0].message
print(assistant_message)
Избегайте переопределения фиксированных параметров сэмплирования K3. Для многотуровых сценариев и вызова инструментов сохраняйте полное сообщение ассистента.
Как оценить Kimi K3 перед апгрейдом
Тестируйте K3 на реальных рабочих нагрузках, а не только на бенчмарковых подсказках.
Практический набор для оценки может включать:
- рутинные правки репозитория
- задачи, близкие к лимиту 256K контекста
- задачи, превышающие 256K
- визуальные инженерные задачи
- долгосрочные агентные или задачи по работе со знаниями
Сравните K3, K2.7 Code и K2.7 Code HighSpeed там, где это применимо.
Отслеживайте:
- уровень успешности задач
- кэшированные и некэшированные входные токены
- выходные и токены рассуждения
- повторы и откатные вызовы
- p50 и p95 задержки
- ошибки вызовов инструментов
- время ручной проверки
- стоимость на успешную задачу
Затем сравните три политики:
- Все — K2.7 Code
- Все — K3
- K2.7 Code с эскалацией на K3
Лучший маршрут — тот, который соответствует вашим требованиям по качеству и задержке при минимальной стоимости на успешную задачу.
Цены Kimi K3 на CometAPI
Расчёты выше используют официальные цены API от Moonshot AI, чтобы сохранить сопоставимость K3 и K2.7.
На момент публикации Kimi K3 на CometAPI стоит на 20% дешевле стандартных тарифов Moonshot AI:
| Вариант | Вход | Выход |
|---|---|---|
| Moonshot AI | $3.00 / 1M | $15.00 / 1M |
| CometAPI | $2.40 / 1M | $12.00 / 1M |
Поскольку цены API могут меняться, перед использованием этих цифр для бюджетирования в продакшене проверяйте актуальную страницу модели.
OpenAI-совместимый API от CometAPI упрощает тестирование kimi-k3 наряду с другими маршрутами моделей, используя одни и те же подсказки и рабочий процесс оценки.
Готовы протестировать Kimi K3? Посмотрите Kimi K3 на CometAPI и сравните цены перед переносом в продакшен.
Для примеров интеграции и оценки см. CometAPI Cookbook на GitHub.
FAQ
Сколько стоит Kimi K3 API?
Moonshot AI указывает Kimi K3 по цене $0.30 за 1 миллион входных токенов при попадании в кэш, $3.00 за 1 миллион входных токенов при промахе кэша и $15.00 за 1 миллион выходных токенов.
ID модели API — kimi-k3.
Дешевле ли Kimi K3, чем Kimi K2.7 Code?
Нет. По официальным тарифам Moonshot, K3 примерно в 3.16× дороже по входу при промахе кэша и в 3.75× дороже по выходу.
Тем не менее, он может снизить стоимость рабочего процесса, если повышает успешность задач или уменьшает число повторных попыток.
Есть ли у Kimi K3 окно контекста в 1M токенов?
Да. Kimi K3 поддерживает окно контекста в 1,048,576 токенов, по сравнению с 262,144 токенами у Kimi K2.7 Code.
Поддерживает ли Kimi K3 автоматическое кэширование контекста?
Да. Кэширование контекста автоматическое. Входные токены при попадании в кэш стоят $0.30 за миллион против $3.00 за миллион при промахе кэша.
Могу ли я отключить рассуждение у Kimi K3, чтобы снизить стоимость?
Пока нет. K3 всегда использует рассуждение, и reasoning_effort="max" — единственный поддерживаемый уровень усилия рассуждения.
Заключение
Kimi K3 предлагает существенно больший контекст и более широкие возможности, чем K2.7 Code, но по более высокой цене за токен.
Для рутинного кодирования в пределах 256K контекста K2.7 Code обычно является более экономичным выбором. Для задач с длинным контекстом, мультимодальностью или сложной агентностью K3 может оправдать свою премию — особенно когда это повышает вероятность успешного завершения.
Для многих продакшен-систем наиболее эффективная стратегия — не полностью заменять K2.7, а использовать K2.7 по умолчанию и K3 как маршрут эскалации.
Ключевой показатель — не стоимость одного API-вызова, а стоимость на успешную задачу.
