Сколько стоят GPT-5.6 Sol, Claude Sonnet 5 и Gemini 3.7 Flash?
Как сравнивать цены на модели ИИ у разных провайдеров? Начните с одинаковой доли входных и выходных токенов, одинаковой валюты и одинакового определения успешного результата. Одного «цена за 1M токенов» недостаточно, потому что входные и выходные токены тарифицируются по разным ставкам, запросы с длинным контекстом могут попасть в более высокий тарифный уровень, а повторные попытки или отклонённые ответы могут значительно повысить фактическую стоимость.
По состоянию на 26 августа 2026 года нагрузка с 800,000 незакэшированных входных токенов и 200,000 выходных токенов будет стоить примерно $5.76 с GPT-5.6 Sol, $2.88 с Claude Sonnet 5 или $1.08 с Gemini 3.7 Flash по текущим тарифам CometAPI. Эти модели занимают разные позиции по скорости и возможностям, поэтому это сравнение по биллингу — а не утверждение, что они обеспечивают идентичное качество.
Как сравнивать цены API ИИ у разных провайдеров
В этой статье используются доллары США за 1 миллион биллингуемых текстовых токенов. Рассмотренный сценарий представляет высокообъёмный процесс поддержки или знаний с 800,000 входных токенов и 200,000 выходных токенов по множеству запросов. Каждый запрос остаётся ниже порога «короткого контекста» GPT-5.6 Terra в 272,000 токенов.
Базовая оценка исключает кэширование подсказок, пакетные скидки, оплату за инструменты, изображения, аудио, а также неуспешные или повторные вызовы. Также предполагается, что принимается один сгенерированный ответ. Формула:
cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)
Используйте фактическое количество токенов, возвращаемое в каждом ответе, а не оценку по символам. Токенизаторы различаются между семействами моделей, поэтому один и тот же текст не обязательно даёт одинаковое число биллингуемых токенов.
Цены API GPT-5.6 Sol, Claude Sonnet 5 и Gemini 3.7 Flash
Три приведённых ниже идентификатора моделей и ставки были перепроверены по живому каталогу моделей CometAPI 26 августа 2026 года. Тариф CometAPI используется в расчётах. Официальный столбец включён как справочная база.
Ценообразование API GPT-5.6 Sol
GPT-5.6 Terra: CometAPI указывает $1.60 за 1M входных токенов и $9.60 за 1M выходных токенов против официальных $2 / $12. Примечание об обновлении цены: текущая ставка отражает снижение на 20%; журнал изменений CometAPI фиксирует снижение для Terra 31 июля 2026 года, и цифра была перепроверена после ценового обзора от 22 августа.
Подтверждённое обновление (26 августа 2026): Предыдущая примечательная запись сохранена, чтобы сохранить привязку для обзора. Для расчётов в этой статье используйте GPT-5.6 Sol по $3.20 за 1M входных токенов и $16 за 1M выходных токенов по сравнению с официальными $4 / $20. CometAPI объявила промоакцию 24 августа 2026 года и указывает её до 21 ноября 2026 года.
Ценообразование API Claude Sonnet 5
Claude Sonnet 5: По состоянию на 26 августа 2026 года CometAPI указывает $1.60 за 1M входных токенов и $8 за 1M выходных токенов по сравнению с текущей ценой Anthropic $2 / $10. Anthropic обновила свою публикацию о запуске 10 августа 2026 года, сделав $2 / $10 постоянной ценой; ранее объявленное повышение до $3 / $15 с 1 сентября больше не применяется.
Ценообразование API Gemini 3.7 Flash
Gemini 3.7 Flash: По состоянию на 26 августа 2026 года CometAPI указывает $0.60 за 1M входных токенов и $3 за 1M выходных токенов по сравнению с вводной ставкой Google $0.75 / $3.75 до 31 декабря 2026 года.
| Идентификатор модели | CometAPI вход / выход | Официально вход / выход | 800K вход + 200K выход |
|---|---|---|---|
| gpt-5.6-sol | $3.20 / $16 | $4 / $20 | $5.76 |
| claude-sonnet-5 | $1.60 / $8 | $2 / $10 | $2.88 |
| gemini-3.7-flash | $0.60 / $3 | $0.75 / $3.75 | $1.08 |
Все цены — USD за 1M токенов. См. датированные страницы моделей для GPT-5.6, Claude Sonnet 5 и Gemini 3.7 Flash, а также руководство по ценообразованию CometAPI. Claude Sonnet 5: CometAPI указывает $1.60 за 1M входных токенов и $8 за 1M выходных токенов по сравнению с текущей ценой Anthropic $2 / $10. Изначально Anthropic объявляла стандартную цену $3 / $15 на сентябрь 2026 года, но 10 августа 2026 года обновила тариф и сделала ставку $2 / $10 постоянной. У GPT-5.6 Terra также есть более высокий уровень для длинного контекста, поэтому не применяйте «короткоконтекстную» ставку к запросам выше опубликованного порога.
Gemini 3.7 Flash имеет самую низкую стоимость токенов в этом сценарии и позиционируется как эффективная Flash-модель. Claude Sonnet 5 — сбалансированная продукционная модель, а GPT-5.6 Sol — флагманский вариант для более сложных задач по рассуждению и программированию. Полезный вопрос — не только «какая строка дешевле?», а «какая модель даёт приемлемый результат при наименьшем числе токенов, повторов и перезапусков?»
Сколько стоит 1M токенов для GPT, Claude и Gemini?
Для базового сценария с 800K входа и 200K выхода расчёт прямолинейный. GPT-5.6 Sol стоит 0.8 × $3.20 + 0.2 × $16 = $5.76. Claude Sonnet 5 стоит 0.8 × $1.60 + 0.2 × $8 = $2.88. Gemini 3.7 Flash стоит 0.8 × $0.60 + 0.2 × $3 = $1.08.
Эта арифметика полезна для бюджетирования, но стоимость принятого вывода — лучшая производственная метрика. В таблице ниже показано, что происходит, когда та же нагрузка испытывает типичные операционные накладные расходы.
| Модель | База | 5% повторов | 10% перезапусков | 40% выход |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.76 | $6.05 | $6.34 | $8.32 |
| Claude Sonnet 5 | $2.88 | $3.02 | $3.17 | $4.16 |
| Gemini 3.7 Flash | $1.08 | $1.13 | $1.19 | $1.56 |
«5% повторов» означает, что 5% всей токен-нагрузки отправляется снова. «10% перезапусков» предполагает, что один из десяти ответов не проходит проверку качества и генерируется повторно с той же токен-смесью. «40% выход» сохраняет общий объём 1M токенов, но меняет смесь на 600K вход и 400K выход. Поскольку выходные токены стоят дороже, многословие может увеличивать счёт быстрее, чем рост трафика.
Сколько добавляют повторы и неудачные результаты?
Сколько стоят повторные попытки и перезапуски API?
Повторы могут дублировать биллингуемую работу. В базовом сценарии повтор 5% нагрузки повышает стоимость GPT-5.6 Sol с $5.76 до примерно $6.05, а перезапуск 10% после отказа по качеству — до около $6.34. Повтор (retry) воспроизводит запрос после сбоя транспорта или сервиса; перезапуск (rerun) регенерирует ответ, который был доставлен, но отклонён. Повторяйте только при ограничениях скорости, тайм-аутах и временных сбоях сервера. Руководство CometAPI по ошибкам и ретраям рекомендует экспоненциальную задержку с джиттером и отсутствие автоматических повторов для некорректных запросов или ошибок аутентификации. Ограничивайте число попыток, чтобы инцидент у провайдера не создал «бурю повторов».
Сколько может сэкономить кэширование подсказок?
Экономия от кэша зависит от повторного использования. В тарифах «короткого контекста» GPT-5.6 Sol в CometAPI чтения из кэша указаны по $0.32/M, а записи в кэш — по $4/M. Если половина из 800K входа — это многократно используемый кэшируемый префикс, то первый прогон стоит около $6.08, поскольку запись 400K кэшируемых токенов добавляет премию $0.32 сверх обычного входа. Повторный прогон с попаданием в кэш стоит около $4.61 вместо $5.76, экономия примерно $1.15. «Точка безубыточности»: одно успешное повторное использование окупает стартовую премию за запись; по двум первым прогонам путь с кэшем обходится около $10.69 против $11.52 без кэширования. У других моделей действуют иные правила и минимумы по кэшу, поэтому проверьте их перед бюджетированием.
Как длина вывода влияет на стоимость API ИИ?
Длинные ответы дороги. Ставки на выходные токены во всех трёх строках в пять раз выше ставок на вход. Задавайте ограничение на объём вывода, соответствующее задаче, требуйте лаконичные форматы и останавливайте генерацию, когда требуемая структура готова.
Сколько стоит неудачный вывод ИИ?
Неудачное задание всё равно может потреблять токены. Запрос, который возвращает непригодный ответ, может быть технически успешным и полностью биллингуемым. Отслеживайте нарушения формата, галлюцинации, отказы инструментов и отклонение человеком отдельно от HTTP-ошибок.
Цена токена не измеряет инженерные затраты. Специфичные для провайдера SDK, отдельные счета, дублированный мониторинг и работы по миграции добавляют операционные расходы. При сравнении трёх семейств через CometAPI команды могут использовать один и тот же совместимый с OpenAI базовый URL — https://api.cometapi.com/v1 — и менять только идентификатор модели, сохраняя единую биллинговую и наблюдательную прослойку. Возможности, специфичные для модели, всё равно требуют тестирования.
Как снизить стоимость API GPT, Claude и Gemini
Насколько Batch и Flex могут снизить стоимость API?
Batch и Flex — это режимы обработки, а не автоматические скидки для каждого запроса. Руководство по ценам GPT-5.6 CometAPI говорит, что ставки для токенов в режимах Batch и Flex примерно на 50% ниже Standard, а Anthropic указывает экономию до 50% для пакетной обработки. Применение чувствительности 50% к базовому $5.76 для GPT-5.6 Sol даёт около $2.88, но рассматривайте это как иллюстрацию, пока тот же режим и ставка не появятся в вашем аккаунте CometAPI. Используйте Batch для асинхронных задач; используйте Flex только когда допустима переменная задержка.
GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: что дешевле?
Используя ту же нагрузку 800K входа и 200K выхода по тарифам CometAPI, проверенным 26 августа 2026 года, Gemini 3.7 Flash стоит $1.08, Claude Sonnet 5 стоит $2.88, а GPT-5.6 Terra стоит $3.20. В этом сравнении Gemini — самый дешёвый по «сырой» стоимости токенов. GPT-5.6 Terra всё ещё может быть экономичным для сложных задач, если его возможности сокращают повторы или человеческую доработку, поэтому сравнивайте стоимость на принятый результат перед выбором продукционного маршрута.
Используйте маршрутизацию по сложности задач. Применяйте недорогую модель для классификации, извлечения и рутинных черновиков, а повышайте уровень только для неоднозначных или высокоценных запросов. Резервный вариант должен соответствовать требуемым модальностям, поддержке инструментов и формату вывода — а не просто иметь более низкую ставку.
Планируйте объём вывода до вызова. Установите реалистичный максимум вывода и записывайте фактические входные, выходные и кэшированные токены из ответа. Руководство CometAPI по оценке стоимости рассматривает предвызовные оценки как ограничители бюджета, а фактическое использование — как окончательное измерение.
Кэшируйте стабильный контент, а не меняющийся контекст. Системные инструкции, продуктовые политики и длинные справочные документы — хорошие кандидаты, когда повторяются. Измеряйте долю попаданий в кэш и учитывайте стоимость записи в кэш; иначе кэш может казаться дешевле в теории, но мало экономить в продакшене.
Повторяйте выборочно. Добавьте экспоненциальную задержку, джиттер и максимальное число попыток. Логируйте идентификатор модели, статус, идентификатор запроса, токены и факт повтора. Это делает дублированные траты видимыми.
Оптимизируйте стоимость на принятый результат. Запустите фиксированное множество оценок и рассчитайте total API spend / accepted outputs. Более дорогая модель может быть дешевле в сумме, если ей нужно меньше повторов, более короткие подсказки или меньше человеческой правки.
Перепроверяйте перед запуском. Доступность моделей, вводные ставки, пороги тарифных уровней и скидки меняются. Запрашивайте Models API или просматривайте публичный каталог моделей в день публикации или утверждения бюджета.
FAQ
Что на самом деле значит «стоимость за 1M токенов»?
Это нормированная ставка, а не цена каждого запроса. Умножайте входные и выходные ставки модели на количество токенов, которое ваша нагрузка фактически использует. Держите кэшированные токены, тарифы для длинного контекста и плату за задачи отдельно.
Что дешевле: GPT, Claude или Gemini?
Для конкретных моделей и нагрузки 800K входа / 200K выхода, проверенных 26 августа 2026 года, Gemini 3.7 Flash — самый низкозатратный вариант с $1.08 через CometAPI, затем Claude Sonnet 5 с $2.88 и GPT-5.6 Sol с $5.76. Это не автоматически лучший выбор для каждой задачи; сравнивайте качество, задержку и стоимость принятого вывода на ваших собственных подсказках.
Стоит ли сравнивать официальные цены или цены агрегаторов?
Сравнивайте цену, которую вы реально заплатите, а официальную ставьте как справочную. Используйте одинаковые дату, валюту, смесь токенов, тарифный уровень и допущения по скидкам для каждой строки.
Всегда ли биллятся повторы?
Не предполагайте, что они бесплатны. Неудачный транспортный запрос может не дойти до инференса, в то время как результат с тайм-аутом или отклонённый приложением мог уже потребить работу модели. Используйте фактическое использование и биллинговые записи и предотвращайте автоматические повторы неретрайабельных ошибок.
Всегда ли кэширование подсказок снижает расходы?
Нет. Запись в кэш может стоить дороже обычного входа, и экономия зависит от повторных чтений. Рассчитайте точку безубыточности по текущим ставкам записи и чтения для модели и затем отслеживайте реальные попадания в кэш.
Как часто нужно проверять цены?
Перед публикацией ценового утверждения, сменой продукционной модели или утверждением прогноза. Сохраняйте идентификатор модели и дату верификации вместе с расчётом, чтобы оценку можно было воспроизвести позже.
Вывод: какой API ИИ дешевле для вашей нагрузки?
Корректное сравнение цен GPT vs Claude vs Gemini использует один датированный источник, одну смесь токенов и одно определение успеха. Ставки за токены формируют базу; кэширование, повторы, длина вывода и отказ по качеству определяют реальный счёт. CometAPI упрощает кросс-провайдерное тестирование, сохраняя единые конечную точку и биллинговую прослойку, но самая дешёвая модель — это та, что достигает вашей цели качества с наименьшим объёмом общей работы.
