Kimi K3 is now live on CometAPI →

Цены на Kimi K3 API (2026): сколько это стоит и сравнение с K2.7 Code

CometAPI
Mia MarenJul 17, 2026
Цены на Kimi K3 API (2026): сколько это стоит и сравнение с K2.7 Code

TL;DR

Kimi K3 стоит $0.30 за 1M входных токенов при попадании в кэш, $3.00 за 1M входных токенов при промахе кэша и $15.00 за 1M выходных токенов, с окном контекста в 1,048,576 токенов.

По сравнению с K2.7 Code, K3 значительно дороже на токен, но предлагает 4× большее окно контекста, а также нативное восприятие изображений и более сильную поддержку длительных агентных рабочих нагрузок.

Bottom line: K2.7 Code остаётся более экономичным выбором для рутинных задач кодирования в пределах 256K контекста. Используйте K3, когда нужен больший контекст, мультимодальные возможности или как путь эскалации для задач, которые K2.7 не может надёжно выполнить.

Цены Kimi K3 API вкратце

ПараметрKimi K3
ID модели APIkimi-k3
Вход при попадании в кэш$0.30 / 1M токенов
Вход при промахе кэша$3.00 / 1M токенов
Выход$15.00 / 1M токенов
Окно контекста1,048,576 токенов
РассуждениеВсегда включено
Поддерживаемый уровень рассуждениятолько max
Максимальная длина завершения по умолчанию131,072 токенов
Настраиваемая максимальная длина завершенияДо 1,048,576 токенов, при условии общего ограничения контекста
Ключевые возможностиНативное понимание изображений, вызовы инструментов, структурированный вывод, Partial Mode, динамическая загрузка инструментов, автоматическое кэширование контекста
Batch APIK3 в настоящее время не указан среди поддерживаемых моделей Batch

См. краткое руководство Kimi K3 quickstart от Moonshot для актуальных параметров API и деталей интеграции.

Что добавляет Kimi K3 по сравнению с K2.7 Code

Самое очевидное обновление — длина контекста.

K2.7 Code поддерживает 262,144 токена, тогда как K3 увеличивает этот предел до 1,048,576 токенов. Это делает K3 более практичным для больших репозиториев, длинной истории агента, обширной документации и рабочих процессов, которые иначе потребовали бы сокращения контекста.

K3 также поддерживает:

  • нативное понимание изображений
  • строгий структурированный вывод
  • tool_choice
  • динамическую загрузку инструментов
  • автоматическое кэширование контекста
  • длительные рабочие процессы по кодированию и работе со знаниями

Технический блог Moonshot Kimi K3 сообщает 88.3 на Terminal-Bench 2.1, 77.8 на Program Bench и 81.2 на FrontierSWE.

Это показатели, заявленные провайдером, и их следует рассматривать как повод оценить K3 — а не гарантии того, что он превзойдёт K2.7 Code на каждой производственной задаче.

Для справки по предыдущему поколению см. руководство Kimi K2 API от CometAPI.

Сравнение цен: Kimi K3 vs Kimi K2.7 Code

МодельВход (кэш-хит)Вход (кэш-мисс)ВыходКонтекст
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Тарифы K2.7 взяты из официальной документации по ценообразованию Kimi K2.7 Code от Moonshot.

По сравнению со стандартным K2.7 Code, K3:

  • дороже в 1.58× по входу при попадании в кэш
  • дороже в 3.16× по входу при промахе кэша
  • дороже в 3.75× по выходу

Премия K3 меньше относительно K2.7 Code HighSpeed, но эти две модели нацелены на разные приоритеты: HighSpeed ориентирован на более быстрое получение кода, тогда как K3 рассчитан на более требовательные нагрузки с длинным контекстом и агентностью.

Текущая документация по ценам Batch API от Moonshot не включает K3, поэтому не следует считать, что скидки Batch, доступные для других моделей Kimi, применимы и здесь.

Кэширование контекста Kimi K3: как работает скидка 90% на вход

K3 поддерживает автоматическое кэширование контекста.

Разработчикам не нужно вручную создавать cache ID или TTL. Сохранение крупных префиксов неизменными в повторяющихся запросах даёт последующим запросам возможность получить тариф при попадании в кэш.

Разница в цене:

  • Промах кэша: $3.00 / 1M входных токенов
  • Попадание в кэш: $0.30 / 1M входных токенов

Таким образом, входные токены при попадании в кэш стоят на 90% дешевле, чем при промахе кэша.

Однако стоимость выхода остаётся $15 за миллион токенов, поэтому общая стоимость запроса не уменьшается на 90%.

Например, предположим:

  • 600,000 входных токенов
  • 20,000 выходных токенов
Состояние кэшаСтоимость входаСтоимость выходаИтого
Весь вход — промах кэша$1.80$0.30$2.10
Весь вход — кэш-хит$0.18$0.30$0.48

В этом упрощённом случае общая стоимость падает примерно на 77%.

Фактическая экономия зависит от доли входных токенов, получающих тариф при попадании в кэш.

Пример: во что обходится задача по кодированию на K3 vs K2.7

Предположим, что задача по кодированию использует:

  • 200,000 входных токенов
  • 20,000 выходных токенов
ВариантИтог (cold)Итог (полный кэш-хит)
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Для этой нагрузки K3 стоит примерно в 3.33× дороже, чем стандартный K2.7 Code, при холодном запросе.

Внутри K3 переход от полностью кэш-мисс входа к полностью кэш-хиту снижает оценочную стоимость запроса с $0.90 до $0.36, что в этом примере даёт 60% сокращение.

Но стоимость одного запроса — лишь часть уравнения.

Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks

Производственное сравнение также должно учитывать повторные попытки, вызовы инструментов, выполнение запасных маршрутов и время ручной проверки.

Один успешный запрос K3 может оказаться экономичнее нескольких более дешёвых попыток, которые завершились неудачей.

Реальный крайний случай: стоимость токенов рассуждения

K3 всегда использует рассуждение, поэтому потребление выходных токенов может стать значимой частью счёта.

В тесте в день запуска от Simon Willison запрос к K3 на генерацию SVG потребил 13,241 токенов рассуждения до выдачи 3,417 токенов ответа, что дало общую стоимость примерно $0.25.

Это была не бенчмарк, а неформальная проверка одним запросом, но она подчёркивает важный фактор стоимости: видимый итоговый ответ может составлять лишь часть тарифицируемого выхода.

Поскольку K3 в настоящее время поддерживает только максимальные усилия рассуждения, командам следует измерять фактическое использование выходных токенов на своих рабочих нагрузках.

Лучший дефолт: сначала K2.7, K3 по эскалации

Для смешанных нагрузок по кодированию маршрутизация может быть экономичнее, чем отправлять каждый запрос напрямую в K3.

Простая стратегия:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

Используя предыдущий пример:

  • K2.7 Code стоит $0.27 за холодную попытку
  • K3 стоит $0.90
  • K2.7 успешно завершает 70% задач
  • 30% повторно запускаются один раз на K3

Средняя стоимость становится:

$0.27 + (30% × $0.90) = $0.54 per task

Отправка каждой задачи напрямую в K3 стоила бы $0.90 за задачу при тех же предположениях о токенах.

Это делает стратегию маршрутизации на 40% дешевле в этом упрощённом сценарии.

Точные сбережения будут варьироваться, но принцип полезен: направляйте рутинную работу на более дешёвую модель и эскалируйте, когда действительно требуется дополнительная возможность.

Когда стоит переходить на Kimi K3?

K3 наиболее привлекателен, когда:

  • Требуемый контекст превышает лимит K2.7 Code в 262,144 токена.
  • Задача комбинирует код с визуальным вводом.
  • Долговременный агент должен работать с большими репозиториями и внешними инструментами.
  • K2.7 требует частых повторных попыток или откатов.
  • Задача достаточно ценная, чтобы качество завершения было важнее минимизации стоимости первого вызова.

K2.7 Code остаётся сильным вариантом для повторяющихся, чётко ограниченных задач по кодированию, которые уже достигают высокой успешности в пределах 256K контекста.

Для чувствительных к задержкам приложений кодирования следует отдельно протестировать K2.7 Code HighSpeed.

Миграция с K2.7 на K3: пять инженерных проверок

  1. Нельзя снизить уровень рассуждения в K3 на текущий момент

K3 всегда рассуждает, и текущий API поддерживает только:

reasoning_effort="max"

Поскольку max — значение по умолчанию, параметр можно также опустить.

  1. Удалите специфичные для K2 параметры thinking

Не используйте параметр K2.x thinking с K3.

Вместо этого используйте верхнеуровневое поле reasoning_effort.

  1. Опустите фиксированные параметры сэмплирования

K3 в настоящее время использует фиксированные значения для параметров, включая:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot рекомендует опускать эти поля, а не переопределять их.

  1. Сохраняйте полные сообщения ассистента

Для многотуровых диалогов и циклов вызова инструментов передавайте полное сообщение ассистента в следующий запрос, а не только видимый content.

  1. Проверьте Vision и Search перед продакшеном

Текущий vision API K3 не поддерживает напрямую публичные URL-адреса изображений. Используйте поддерживаемый формат, например данные base64, или механизм ссылок на файлы (file-reference) от Moonshot.

Moonshot также рекомендует пока не полагаться на текущую функциональность Web Search в продакшен-сценариях, поскольку функция находится в процессе обновления.

Пример Kimi K3 API на Python

K3 можно вызывать через OpenAI-совместимый интерфейс API:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Избегайте переопределения фиксированных параметров сэмплирования K3. Для многотуровых сценариев и вызова инструментов сохраняйте полное сообщение ассистента.

Как оценить Kimi K3 перед апгрейдом

Тестируйте K3 на реальных рабочих нагрузках, а не только на бенчмарковых подсказках.

Практический набор для оценки может включать:

  • рутинные правки репозитория
  • задачи, близкие к лимиту 256K контекста
  • задачи, превышающие 256K
  • визуальные инженерные задачи
  • долгосрочные агентные или задачи по работе со знаниями

Сравните K3, K2.7 Code и K2.7 Code HighSpeed там, где это применимо.

Отслеживайте:

  • уровень успешности задач
  • кэшированные и некэшированные входные токены
  • выходные и токены рассуждения
  • повторы и откатные вызовы
  • p50 и p95 задержки
  • ошибки вызовов инструментов
  • время ручной проверки
  • стоимость на успешную задачу

Затем сравните три политики:

  1. Все — K2.7 Code
  2. Все — K3
  3. K2.7 Code с эскалацией на K3

Лучший маршрут — тот, который соответствует вашим требованиям по качеству и задержке при минимальной стоимости на успешную задачу.

Цены Kimi K3 на CometAPI

Расчёты выше используют официальные цены API от Moonshot AI, чтобы сохранить сопоставимость K3 и K2.7.

На момент публикации Kimi K3 на CometAPI стоит на 20% дешевле стандартных тарифов Moonshot AI:

ВариантВходВыход
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Поскольку цены API могут меняться, перед использованием этих цифр для бюджетирования в продакшене проверяйте актуальную страницу модели.

OpenAI-совместимый API от CometAPI упрощает тестирование kimi-k3 наряду с другими маршрутами моделей, используя одни и те же подсказки и рабочий процесс оценки.

Готовы протестировать Kimi K3? Посмотрите Kimi K3 на CometAPI и сравните цены перед переносом в продакшен.

Для примеров интеграции и оценки см. CometAPI Cookbook на GitHub.

FAQ

Сколько стоит Kimi K3 API?

Moonshot AI указывает Kimi K3 по цене $0.30 за 1 миллион входных токенов при попадании в кэш, $3.00 за 1 миллион входных токенов при промахе кэша и $15.00 за 1 миллион выходных токенов.

ID модели API — kimi-k3.

Дешевле ли Kimi K3, чем Kimi K2.7 Code?

Нет. По официальным тарифам Moonshot, K3 примерно в 3.16× дороже по входу при промахе кэша и в 3.75× дороже по выходу.

Тем не менее, он может снизить стоимость рабочего процесса, если повышает успешность задач или уменьшает число повторных попыток.

Есть ли у Kimi K3 окно контекста в 1M токенов?

Да. Kimi K3 поддерживает окно контекста в 1,048,576 токенов, по сравнению с 262,144 токенами у Kimi K2.7 Code.

Поддерживает ли Kimi K3 автоматическое кэширование контекста?

Да. Кэширование контекста автоматическое. Входные токены при попадании в кэш стоят $0.30 за миллион против $3.00 за миллион при промахе кэша.

Могу ли я отключить рассуждение у Kimi K3, чтобы снизить стоимость?

Пока нет. K3 всегда использует рассуждение, и reasoning_effort="max" — единственный поддерживаемый уровень усилия рассуждения.

Заключение

Kimi K3 предлагает существенно больший контекст и более широкие возможности, чем K2.7 Code, но по более высокой цене за токен.

Для рутинного кодирования в пределах 256K контекста K2.7 Code обычно является более экономичным выбором. Для задач с длинным контекстом, мультимодальностью или сложной агентностью K3 может оправдать свою премию — особенно когда это повышает вероятность успешного завершения.

Для многих продакшен-систем наиболее эффективная стратегия — не полностью заменять K2.7, а использовать K2.7 по умолчанию и K3 как маршрут эскалации.

Ключевой показатель — не стоимость одного API-вызова, а стоимость на успешную задачу.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее