TL;DR
Gemini 3.6 Flash стоит $1.50/M за ввод и $7.50/M за вывод, предлагает более низкую цену за вывод и, по заявлению Google, лучшую работу с кодом и агентами по сравнению с Gemini 3.5 Flash. В продакшене используйте 3.6 Flash для сложного рассуждения и агентов, а простые массовые задачи маршрутизируйте на более дешёвый Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash — это больше, чем очередное обновление идентификатора модели.
Для разработчиков, уже использующих Gemini 3.5 Flash, главное изменение — экономическое. Google сохранил цену за ввод на уровне $1.50 за миллион токенов, снизил цену за вывод с $9.00 до $7.50 и сообщает о лучшей производительности на нескольких бенчмарках по коду и агентному поведению.
Практический вопрос — достаточно ли велики эти улучшения, чтобы оправдать перенос продакшен-нагрузок.
Ответ зависит от типа нагрузки. Агентам для кода, мультимодальному анализу и многошаговому использованию инструментов это может помочь больше, чем простому извлечению или классификации. Миграция также требует нескольких проверок совместимости API, которые легко упустить, если просто сменить имя модели.
Это руководство охватывает цены API Gemini 3.6 Flash, доступ в бесплатном тарифе, результаты бенчмарков, изменения при миграции, примеры на Python и то, что стоит протестировать перед переключением продакшен-трафика.
What Is Gemini 3.6 Flash?
Gemini 3.6 Flash — это более новая модель Google из линейки Flash для программирования, мультимодального рассуждения и многошаговых агентных рабочих процессов. Выпущенная 21 июля 2026 года, она предназначена для продакшен-нагрузок, которым нужна более сильная способность к рассуждению и агентному выполнению при сохранении принадлежности к уровню моделей Flash Google.
Её основные спецификации включают:
| Параметр | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Стандартная цена за ввод | $1.50 / 1M токенов |
| Стандартная цена за вывод | $7.50 / 1M токенов |
| Стандартный кэшированный ввод | $0.15 / 1M токенов |
| Уровень рассуждения по умолчанию | medium |
| Контекст ввода | 1,048,576 токенов |
| Максимальный вывод | 65,536 токенов |
| Ввод | Текст, изображение, видео, аудио, PDF |
| Вывод | Текст |
| Наилучшее применение | Кодирование, мультимодальное рассуждение, сложные агенты |
Google позиционирует Gemini 3.6 Flash для таких нагрузок, как программирование, пространственное и мультимодальное рассуждение, а также многошаговые агентные задачи.
Модель также поддерживает функции, включая function calling, structured outputs, code execution, context caching, File Search, URL context, Google Search grounding и Google Maps grounding.
Актуальные спецификации и рекомендации по миграции вы можете посмотреть в последнем руководстве по моделям Gemini.
Для разработчиков, переходящих с предыдущего поколения, руководство по API CometAPI для Gemini 3.5 Flash может служить полезной базой интеграции.
How Much Does the Gemini 3.6 Flash API Cost?
Gemini 3.6 Flash стоит $1.50 за миллион входных токенов и $7.50 за миллион выходных токенов на стандартном платном уровне Google.
По сравнению с Gemini 3.5 Flash, цена за ввод не изменилась, тогда как цена за вывод снизилась с $9.00 до $7.50 за миллион токенов — сокращение на 16.7%.
Google также предлагает уровни Batch, Flex и Priority.
| Тариф Gemini 3.6 Flash | Ввод / 1M | Кэшированный ввод / 1M | Вывод / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Важно:** Токены размышления тарифицируются по ставке выходных токенов. Поэтому даже короткий видимый ответ может потребить больше оплачиваемых выходных токенов, чем кажется по длине финального ответа.
Кэширование контекста также может заметно повлиять на стоимость в приложениях, которые многократно отправляют один и тот же большой системный промпт, контекст репозитория, набор документов или историю разговора.
На стандартном платном уровне кэшированный ввод в Gemini 3.6 Flash стоит $0.15 за миллион токенов, по сравнению с $1.50 за обычный ввод.
Пример: 15,000 входных токенов + 8,000 выходных токенов
Рассмотрим задачу с 15,000 входных токенов и 8,000 выходных токенов.
| Модель | Оценочная стоимость |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash при том же объёме токенов | $0.0825 |
| Gemini 3.6 Flash с 17% меньшим числом выходных токенов | $0.0723 |
| Gemini 3.5 Flash-Lite при том же объёме токенов | $0.0245 |
При одинаковом использовании токенов, Gemini 3.6 Flash примерно на 12.7% дешевле, чем Gemini 3.5 Flash, в этом примере.
Google также сообщает, что Gemini 3.6 Flash использовал на 17% меньше выходных токенов на Artificial Analysis Index. Если продакшен-нагрузка воспроизведёт такое снижение, модельная экономия в этом примере увеличится примерно до 23.5%.
Отдельно Google сообщает о снижении числа выходных токенов до 65% на DeepSWE. Эти показатели относятся к разным нагрузкам и не должны считаться взаимозаменяемыми: 17% — это Artificial Analysis Index, а 65% — конкретный бенчмарк по программированию.
Базовая формула расчёта стоимости токенов:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Для агентов реальная стоимость шире:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Поэтому самая дешевая по токенам модель не всегда самая дешёвая для завершения задачи.
Is Gemini 3.6 Flash Free?
Да. Текущие цены Gemini Developer API от Google включают доступ к Free Tier для стандартного использования Gemini 3.6 Flash.
Наличие бесплатного тарифа не означает неограниченную продакшен-пропускную способность. Лимиты API зависят от проекта и уровня использования, поэтому разработчикам следует проверять ограничения по скорости, применённые к их проекту, а не полагаться на фиксированные значения запросов в минуту из сторонних статей.
Для планирования продакшена используйте актуальные разделы ценообразования Gemini API и документацию по rate-limit при оценке ёмкости.
Разработчики могут получить доступ к Gemini 3.6 Flash через Gemini API и Google AI Studio. Команды с унифицированным мультимодельным воркфлоу также могут протестировать модель через страницу модели CometAPI Gemini 3.6 Flash.
How Does Gemini 3.6 Flash Compare With Gemini 3.5 Flash?
Опубликованные Google результаты показывают наибольшие улучшения в кодинге, агентном выполнении, использовании компьютера и работе с знаниями.
| Бенчмарк | Gemini 3.6 Flash | Gemini 3.5 Flash | Изменение |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 п.п. |
| MLE-Bench | 63.90% | 49.70% | +14.2 п.п. |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 п.п. |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google также отмечает, что Gemini 3.6 Flash выполняет многошаговые воркфлоу с меньшим количеством шагов рассуждения, реплик и вызовов инструментов, чем Gemini 3.5 Flash.
Компания сообщает:
- На 17% меньше выходных токенов на Artificial Analysis Index.
- До 65% меньше выходных токенов на DeepSWE.
- Меньше нежелательных правок кода и циклов исполнения.
- Улучшенное мультимодальное и пространственное рассуждение.
Оригинальные результаты доступны в анонсе запуска Gemini 3.6 Flash от Google.
Эти бенчмарки делают 3.6 Flash сильным кандидатом для оценки, особенно для нагрузок, где один запрос превращается в несколько раундов рассуждений, вызовов инструментов и исправлений.
Однако они не должны заменять тестирование на вашем собственном приложении.
Google также отмечает, что 3.6 Flash может выполнять больше предварительной программной инспекции перед внесением изменений в код. На большом репозитории это может повысить точность. На узко ограниченной правке фронтенда это может просто добавить ненужное исследование.
Чёткие границы файлов, критерии приёмки и инструкции по реализации по‑прежнему имеют значение.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Which Should You Use?
После того как вы решили, что стоит протестировать Gemini 3.6 Flash, следующий вопрос — нужна ли она на каждый запрос.
Для многих продакшен‑систем ответ будет «нет».
Gemini 3.5 Flash-Lite существенно дешевле и может быть лучшим вариантом по умолчанию для предсказуемых, массовых нагрузок.
| Параметр | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Стандартная цена за ввод | $1.50 / 1M токенов | $0.30 / 1M токенов |
| Стандартная цена за вывод | $7.50 / 1M токенов | $2.50 / 1M токенов |
| Стандартный кэшированный ввод | $0.15 / 1M токенов | $0.03 / 1M токенов |
| Уровень рассуждения по умолчанию | medium | minimal |
| Наилучшее применение | Сложное рассуждение, кодинг, агенты | Извлечение, роутинг, классификация |
На стандартном тарифе Flash-Lite в 5 раз дешевле по вводу и в 3 раза дешевле по выводу, чем Gemini 3.6 Flash.
Начните с Gemini 3.5 Flash-Lite для:
- Классификации
- Маршрутизации запросов
- JSON и структурированного извлечения
- Обработки документов
- Преобразования данных
- Масштабного перевода
- Лёгких субагентов
- Массовых повторяемых задач
Практическая стратегия маршрутизации может выглядеть так:
| Нагрузка | Первая маршрутизация | Эскалация |
|---|---|---|
| Классификация или роутинг | Gemini 3.5 Flash-Lite | 3.6 Flash после провала валидации |
| Структурированное извлечение | Gemini 3.5 Flash-Lite | 3.6 Flash для сложных документов |
| Лёгкий субагент | Gemini 3.5 Flash-Lite | Повысить уровень рассуждения или 3.6 Flash |
| Многофайловый кодинг | Gemini 3.6 Flash | Более сильный фолбэк при нерешённости |
| Сложный воркфлоу с инструментами | Gemini 3.6 Flash | Фолбэк после ошибки инструмента/валидации |
| Мультимодальное рассуждение | Gemini 3.6 Flash | Фолбэк под задачу |
Для смешанного продакшен‑трафика более полезная метрика:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Дешёвый первый вызов менее привлекателен, если он многократно проваливается и в итоге требует более сильной модели.
Обратное также важно. Нет смысла отправлять миллионы предсказуемых задач классификации в Gemini 3.6 Flash, если Flash-Lite уже обеспечивает требуемую точность.
Для приложений, которым нужна такая маршрутизация, см. наше руководство по вызову нескольких ИИ-моделей через базовый URL, совместимый с OpenAI.
What Changes When Migrating to Gemini 3.6 Flash?
Переход с Gemini 3.5 Flash на Gemini 3.6 Flash — это больше, чем смена идентификатора модели.
Разработчикам стоит проверить пять областей перед переключением продакшен‑трафика: устаревшие параметры сэмплинга, управление «thinking», candidate_count, предзаполнение ответов модели и состояние вызовов функций.
1. Удалите temperature, top_p и top_k
Google объявил эти параметры сэмплинга устаревшими для Gemini 3.6 Flash и Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Новые модели в настоящее время игнорируют эти параметры. Google отмечает, что будущие поколения моделей Gemini могут возвращать ошибку HTTP 400 при их передаче.
Для предсказуемых форматов вывода используйте более чёткие системные инструкции и структурированные ответы.
2. Замените thinking_budget на thinking_level
По умолчанию в Gemini 3.6 Flash установлен уровень medium.
В руководстве по миграции Google рекомендует переходить от числовой настройки thinking_budget к thinking_level.
Для Gemini 3.5 Flash-Lite по умолчанию используется minimal, что подходит для многих массовых задач извлечения, классификации и маршрутизации.
Более высокие уровни рассуждения стоит тестировать, когда задача включает многошаговые рассуждения, исполнение кода или использование инструментов.
3. Удалите candidate_count
Google указывает, что candidate_count не поддерживается в Gemini 3.x.
Это легко упустить, если несколько моделей используют одну конфигурацию генерации. Удалите его перед миграцией продакшен‑запросов.
4. Прекратите предзаполнять ходы модели
Запросы больше не могут заканчиваться непустым ходом с ролью model.
Более старое приложение могло отправлять полезную нагрузку вроде:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Теперь такой паттерн может вернуть HTTP 400.
Если вы раньше использовали предзаполнение, чтобы форсировать формат ответа, перенесите требование в system_instruction или используйте структурированные ответы.
5. Перетестируйте вызовы функций и состояние в нескольких взаимодействиях
Агенты, использующие инструменты, требуют отдельного тестирования миграции.
Google рекомендует использовать previous_interaction_id для серверного состояния нескольких ходов в Interactions API.
При возврате результата функции сохраняйте и имя функции, и исходный идентификатор вызова:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Приложения, использующие generateContent, также должны проверить свои полезные нагрузки FunctionResponse и мониторить ошибки вызовов инструментов после миграции.
См. руководство по миграции на последние модели и документацию по вызову функций от Google для актуальных деталей реализации.
How Do You Call Gemini 3.6 Flash in Python?
Установите или обновите SDK Google GenAI:
pip install -U google-genai
Задайте ключ API:
export GEMINI_API_KEY="your-api-key"
Затем вызовите Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Для задач, требующих большего рассуждения, настройте уровень:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Главное отличие в конфигурации миграции можно суммировать так:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Не предполагаете, что более высокий уровень рассуждения всегда лучше. Измеряйте задержку, потребление токенов и долю успешных завершений на ваших собственных задачах.
How Should You Test Gemini 3.6 Flash Before Production?
Вам не нужен большой публичный набор бенчмарков, чтобы решить, подходит ли Gemini 3.6 Flash для вашего продакшен-стека.
Лучше начать с 30–50 недавних задач, похожих на ваш реальный трафик.
Включите смесь:
- Кодирования и отладки
- Многошагового использования инструментов
- Мультимодальных документов
- Извлечения данных
- Классификации и маршрутизации
Прогоните одни и те же входы через:
- Вашу текущую продакшен-модель
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Не меняйте промпты, инструменты, валидаторы и критерии приёмки.
Отслеживайте:
- Входные токены
- Выходные и «thinking» токены
- Задержку
- Вызовы инструментов
- Повторные попытки
- Ошибки вызовов функций
- Процент прохождения валидаторов
- Время исправления человеком
- Итоговый успех задачи
Затем сравните общую стоимость, необходимую для получения принятого результата.
Запрос по коду, который стоит $0.08 и успешен с первой попытки, может оказаться дешевле, чем запрос за $0.02, который дважды проваливается и в итоге эскалируется.
В то же время платить по ценам Gemini 3.6 Flash за простую задачу классификации мало смысла, если Flash-Lite справляется надёжно.
Цель — не найти одну модель для каждого запроса. Цель — использовать более сильную модель только там, где её дополнительные возможности действительно меняют результат.
Разработчики могут сравнить текущие маршруты Gemini 3.6 Flash и Gemini 3.5 Flash-Lite через CometAPI на одном и том же наборе оценивания.
FAQ
Сколько стоит API Gemini 3.6 Flash?
Стандартная платная ставка Google — $1.50 за миллион входных токенов и $7.50 за миллион выходных токенов. Стандартный кэшированный ввод стоит $0.15/М. Batch и Flex стоят $0.75/М за ввод и $3.75/М за вывод.
Бесплатен ли Gemini 3.6 Flash?
Да. Текущее ценообразование Gemini Developer API от Google включает бесплатный уровень Standard для Gemini 3.6 Flash. Бесплатный доступ по‑прежнему зависит от лимитов проекта и уровня использования.
Находится ли Gemini 3.6 Flash в общем доступе?
Да. Google выпустил gemini-3.6-flash 21 июля 2026 года и указывает его как продакшен‑модель в документации Gemini API.
Каков контекст Gemini 3.6 Flash?
Gemini 3.6 Flash поддерживает до 1,048,576 входных токенов и 65,536 выходных токенов. Принимает текст, изображения, видео, аудио и PDF, а на выходе выдаёт текст.
Дешевле ли Gemini 3.6 Flash, чем Gemini 3.5 Flash?
Да по выходным токенам. Обе модели стоят $1.50/М за стандартные входные токены, а Gemini 3.6 Flash снижает цену за вывод с $9.00/М до $7.50/М.
Что выбрать: Gemini 3.6 Flash или Gemini 3.5 Flash-Lite?
Используйте Gemini 3.6 Flash, когда качество кодинга, мультимодальное рассуждение или сложное агентное выполнение могут уменьшить число ошибок и повторных попыток. Начинайте с Flash-Lite для массового извлечения, классификации, маршрутизации и других предсказуемых задач, где ключевым является низкая стоимость.
Что нужно изменить перед миграцией на Gemini 3.6 Flash?
Удалить temperature, top_p, top_k и candidate_count; заменить thinking_budget на thinking_level; убрать предзаполнение ходов модели; и перетестировать вызов функций и управление состоянием в нескольких ходах.
Final Take
Gemini 3.6 Flash стоит включить в бенчмаркинг, если вы уже используете Gemini 3.5 Flash для задач по коду, мультимодальной работе или агентных воркфлоу.
Цена за вывод ниже, а ранние результаты Google предполагают, что для некоторых нагрузок может потребоваться меньше токенов и меньше шагов выполнения. Для агентов, которые многократно рассуждают, вызывают инструменты и повторяют неудачные действия, эта экономия может оказаться важнее разницы в прайс-листе.
Но это не значит, что каждый запрос должен перейти на 3.6 Flash.
Gemini 3.5 Flash-Lite существенно дешевле и может быть всем, что вам нужно для предсказуемых задач, таких как извлечение, классификация и маршрутизация.
Более правильная продакшен-стратегия — использовать каждую модель там, где это экономически оправдано: Flash-Lite для простых массовых задач; 3.6 Flash там, где более сильное рассуждение повышает шанс корректного завершения с первой попытки.
Затем измеряйте результат, который действительно важен — общую стоимость получения принятого ответа.
Чтобы сравнить обе модели в одном и том же воркфлоу, см. страницу модели Gemini 3.6 Flash и страницу модели Gemini 3.5 Flash-Lite на CometAPI или ознакомьтесь с текущими маршрутами моделей на странице цен CometAPI.
