Кратко Утечки бенчмарков и стелс-тесты на Arena.ai в середине сентября 2026 года позиционируют не выпущенный Google Gemini 4 Pro как нового лидера переднего края, опережающего GPT-6 Astra и Claude Fable 5.1 в разработке ПО, агентных задачах, интеллектуальной работе, рассуждении и мультимодальных бенчмарках.
Ключевые выводы
- Gemini 4 Pro лидирует в утекших оценках на DeepSWE v1.1 (88.7%), GDPval-AA v2 (2064 Elo), Terminal-bench 2.1 (95.3%), OSWorld-2.0 (86.8%) и множестве других наборов для агентных задач/рассуждения.
- Он дешевле по прайсу GPT-6 Astra ($12/$60) и Claude Fable 5.1 ($10/$50), при этом сопоставим или превосходит их по контекстным окнам класса 1M.
- Скрытое тестирование на Arena.ai под временными именами (например, gemini-3.8-flash) дало выдающиеся демо по SVG, Three.js и агентному кодированию.
- Ходят слухи о RSI (рекурсивном самоулучшении), но нет публичных доказательств замкнутого контура автономного улучшения для самого Gemini 4.
- Google подтвердил значительные инвестиции в более крупную базовую модель Gemini 4; сроки публичного запуска остаются неофициальными.
- Платформы вроде CometAPI уже агрегируют Gemini, GPT-6 Astra, Claude Fable/Opus и сотни других моделей за одним совместимым с OpenAI endpoint’ом по конкурентным тарифам — идеально для бенчмаркинга нового фронтира после релиза.
Что мы знаем о Gemini 4? (утечки, источники и проверенный контекст)
По состоянию на 20 сентября 2026 года Gemini 4 Pro не получил официального анонса Google, карточки модели или публичного API endpoint’а. Всё за пределами прежних заявлений Google о вложениях в «более крупную базовую модель Gemini 4» (отчёт за июль 2026) исходит из утечек сообщества, слепых тестов на Arena.ai и циркулирующих таблиц бенчмарков.
Ключевые источники и заявления:
- Инсайдер Pankaj Kumar и последовавшие посты (начало–середина сентября) ссылались на внутренний Pro-checkpoint с ожидаемым публичным релизом в октябре и возможным более ранним вариантом Flash-Lite.
- Несколько разработчиков сообщали о получении высокоспособной модели с меткой «gemini-3.8-flash» (или аналогичными псевдонимами) на Arena.ai. Выходы включали сложную генерацию SVG (например, пеликан на велосипеде, механические бабочки в Three.js), длинный нерепетитивный JSON и сильное агентное поведение. Некоторые пользователи заявляли о деталях бэкенда вроде многомиллионного контекста, потолков вывода 256k, межсессионной памяти и встроенных возможностей инструментов/интернета.
- Широко распространившаяся таблица сравнивает Gemini 4 Pro с Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 и GPT-5.6 Sol.
- Google не подтверждал тесты на Arena или эту таблицу. Исторически компания часто проводит скрытые оценки на публичных платформах за недели до официальных запусков.

Контекстное окно
Утёкшая таблица показывает максимум 2M входных токенов для семейства Gemini 4 — вдвое больше, чем 1M у GPT-6 Astra, и намного выше 200k у линейки Claude Fable/Opus 5 (некоторые версии Claude предлагали большие эффективные окна иными механизмами). Отдельные заявления о ghost-routing намекали на потолки в 10M; это остаётся непроверенным.
Цена Gemini 4 (утекшие цифры)
Циркулирующая таблица указывает:
- Gemini 4 Pro: $2.25 за вход / $11.25 за выход на 1M токенов (без кэширования).
- Gemini 4 Flash: $0.75 / $3.75.
- Gemini 4 Flash-Lite: $0.35 / $1.75.
Эти цифры существенно ниже заявленных $12/$60 у GPT-6 Astra и $10/$50 у Claude Fable 5.1 (у Fable 5.1 агрессивные скидки на чтение из кэша, что может снижать эффективную стоимость для агентных нагрузок). Текущие официальные цены Gemini 3.x Pro лежат в диапазоне $2–$4 за вход / $12–$18 за выход в зависимости от длины контекста, так что утекшие цены для Pro выглядят правдоподобной корректировкой следующего поколения.
Фактические публичные цены будут известны только при запуске. Исторически Google использует конкурентные расценки по токенам и бесплатные уровни для стимулирования адопшена.
Производительность Gemini 4 Pro: подробности утёкших бенчмарков
Циркулирующая таблица ставит Gemini 4 Pro на вершину почти во всех категориях. Эти числа — неофициальные и не подтверждены Google или независимыми лабораториями на момент публикации. Их следует рассматривать как ориентир, а не окончательный рейтинг.
Разработка ПО и агентное кодирование
- DeepSWE v1.1 (долгосрочная разработка ПО): 88.7% (против GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
- Terminal-bench 2.1 (агентное терминальное кодирование): 95.3% (против Astra 94.1%, Fable 92.8%).
- Terminal-bench 4.0 (общие агентные возможности): 69.7% (наибольший относительный разрыв над Flash и конкурентами).
Интеллектуальная работа и профессиональные задачи
- GDPval-AA v2 (Elo, интеллектуальная работа): 2064 (единственная модель выше 2000; Astra 1994, Fable 1853).
- Vals Finance Agent v2: 74.2%.
- Harvey’s Legal Agent Benchmark (сложные юридические рабочие процессы, показатель all-pass): 18.7%.
Рассуждение, мультимодальность и специализированные области
- CharXiv Reasoning (синтез информации из сложных диаграмм, без инструментов): 94.7%.
- LVBench (понимание длинного видео): 95.8% агентное / 95.0% статическое.
- HLE-Verified (междисциплинарное экспертное рассуждение): 72.1%.
- OSWorld-2.0 (агентное компьютерное использование, частичный балл, batch tool включён): 86.8%.
- BioMysteryBench и LABBench2 (биоинформатика и биологические исследовательские рабочие процессы): лидирующие показатели как на человечески-решаемых, так и на сложных поднаборах.
Если эти результаты верны хотя бы по направлению, они показывают особую силу на длинных горизонтах, многошаговых, инструментально-ориентированных агентных задачах — именно там, где GPT-6 Astra и Claude Fable 5.1 позиционировались лидерами после своих релизов в начале сентября.
Качественные тесты на Arena подтверждают картину: сложные генерации SVG и Three.js от стелс-модели оцениваются сообществом как превосходящие или крайне конкурентоспособные по сравнению с Astra в парных сравнениях.
Как будет работать Gemini 4?
Gemini 4 (Pro) ещё не выпущен, поэтому любое описание «как он будет работать» неизбежно основано на официальных заявлениях Google, ограниченных деталях утёкшего раннего внутреннего checkpoint’а и разумных инженерных предположениях по траектории серии Gemini 3.x. Нижеизложенное не следует считать подтверждёнными спецификациями.
Базовое обучение и масштаб
Google описывает Gemini 4 как «самый амбициозный претрейнинг», основанный на существенно более крупной базовой модели, чем предыдущие поколения. Заявленная цель — оставаться конкурентоспособными на фронтире, особенно в кодинге и автономных агентах.
Это подразумевает:
- Большее число параметров или более эффективную ёмкость (через mixture-of-experts, лучшую разреженность или более плотное масштабирование).
- Более крупные вычислительные затраты на претрейнинге.
- Продолжение упора на мультимодальные данные обучения (текст, изображение, видео, аудио, код, траектории использования инструментов).
Предполагается, что модель станет новой высокоспособной базой, от которой позже будут производны быстрые варианты в стиле Flash.
Вывод и стиль рассуждения
Утечки о раннем checkpoint’е «argon» упоминают режим высокого уровня размышлений, при котором один прогон занимал около 2.4 минуты и поддерживался резко повышенный лимит вывода (сообщалось о 256k токенов против прежних ~64k).
Это указывает на:
- Опциональные ресурсоёмкие пути рассуждения (по духу близкие расширенному мышлению или режимам «максимальных усилий» у конкурентов).
- Возможность тратить больше внутреннего вычисления на сложные задачи до выдачи ответа.
- Лучшую поддержку длинных, связных выходов, таких как полноценные кодовые базы, многошаговые планы или развёрнутые отчёты.
Вероятно, пользователи смогут управлять компромиссом между скоростью/стоимостью и глубиной рассуждения, как и сейчас в линейке Gemini Flash с низким/средним/высоким уровнями «thinking».
Ключевые направления возможностей
Опираясь на публичные remarks Сундара Пичая и траекторию развития:
- Кодинг и разработка ПО Усиление долгосрочной продуктивности: рефакторинг множества файлов, отладка по репозиториям, циклы самокоррекции и более высокие доли завершения реалистичных задач.
- Автономное / агентное поведение Улучшенное планирование, использование инструментов, наблюдение промежуточных результатов, восстановление после ошибок и продолжение движения к цели в течение многих шагов. Это строится поверх функций компьютерного использования и агентности, уже присутствующих в Gemini 3.5/3.8 Flash.
- Надёжность на длинном контексте Сообщества упоминают цели на уровне 1.5 млн токенов (или выше). Практическая цель — не только большие окна, но и лучшая точность извлечения и меньшее ухудшение при работе с очень длинными документами, кодовыми базами или многочасовыми трассами агентов.
- Мультимодальное понимание и генерация Нативная работа с текстом + изображением + видео + аудио, ожидаемые улучшения в пространственном рассуждении, понимании видео и взаимодействиях реального времени (voice/agent), опираясь на сентябрьские 2026 Gemini 3.8 Live.
- Использование инструментов и структурированные выходы Более надёжный function calling, выполнение кода, поиск с обоснованием и структурированные выходы JSON/XML для надёжной интеграции в приложения и агентов.
Чем отличается от Gemini 3.x
- Масштаб: Явно более крупная базовая модель, а не инкрементальная доработка.
- Ёмкость вывода: Утёкшие более высокие лимиты токенов позволяют длинные генерации за один проход.
- Глубина рассуждений: Более выраженные режимы высоких усилий для сложных задач.
- Агентный фокус: Больший акцент на устойчивую, многошаговую автономную работу, а не на одноходовые или короткие задачи.
- Позиционирование: Предназначен как новый Pro-уровень фронтира, в то время как линейка Flash продолжает быстрые итерации ради скорости и стоимости.
Отношение к рекурсивному самоулучшению (RSI)
Руководители Google публично связывали крупные капитальные затраты на ИИ с долгосрочной целью рекурсивного самоулучшения — систем, способных существенно улучшать себя или процессы, порождающие следующее поколение. Связанные исследования (например, Dream-RSI) показывают агентов, улучшающих собственные стратегии исследования без изменения весов модели.
Превзойдёт ли Gemini 4 Pro GPT-6 и Claude Fable 5.1?
| Категория | Gemini 4 Pro | GPT-6 Astra | Claude Fable 5.1 | Примечания |
|---|---|---|---|---|
| Цена вход/выход | $2.25 / $11.25 | $12.00 / $60.00 | $10.00 / $50.00 | Gemini 4 Pro примерно в 5× дешевле Astra |
| Контекстное окно | 2M | 1M | 200k | Существенное преимущество Gemini |
| DeepSWE v1.1 | 88.7% | 86.9% | 69.1% | Сильное лидерство в кодинге |
| GDPval-AA v2 (Elo) | 2064 | 1994 | 1853 | Лидер в интеллектуальной работе |
| Terminal-bench 4.0 | 69.7% | 66.4% | 57.9% | Общие агентные возможности |
| OSWorld-2.0 | 86.8% | 84.5% | 77.9% | Управление компьютером |
| HLE-Verified | 72.1% | 67.3% | 62.1% | Экспертное рассуждение |
| LVBench (видео) | 95.8% / 95.0% | 93.8% | 90.4% | Мультимодальные сильные стороны |
| Bio / LAB research | Наивысшие | Сильные | Конкурентные | Научные рабочие процессы |
Gemini 4 Pro возглавляет каждую ключевую строку в таблице, часто с заметным отрывом, при том что заявленная цена гораздо агрессивнее, чем у GPT-6 Astra или Claude Fable 5.1.
Важные оговорки
- Эта таблица не является официальным релизом Google. По состоянию на 20 сентября 2026 года Google всё ещё не публиковал карточку модели, API endpoint, цены или подтверждённые бенчмарки для Gemini 4 Pro. Цифры происходят из источников сообщества / наблюдений на Arena / утечек внутреннего checkpoint’а (связанного с кодовым именем «argon»).
- Некоторые ранние листы позднее были помечены как предсказанные или частично скопированные. Любой процент и цены следует считать непроверенными до подтверждения Google.
- Контекстное окно Claude Fable 5.1 указано здесь как 200k, что ниже 1M, обычно заявляемого в официальной документации Anthropic. Это может отражать конкретные условия оценки или ошибку в утекшем листе.
- GPT-6 Astra и Claude Fable 5.1 остаются единственными полностью публичными, независимо оценёнными моделями фронтира прямо сейчас. Artificial Analysis и другие сторонние трекеры всё ещё показывают их как близко сопоставимые в целом (с разными сильными сторонами).
Текущая практическая реальность (20 сентября 2026 года)
| Модель | Статус | Оптимально для | Уровень цены |
|---|---|---|---|
| Gemini 4 Pro | Не выпущен (заявлен сильным) | Длинный контекст, кодинг, агенты, мультимодальность, стоимость | Очень агрессивный (заявлен) |
| GPT-6 Astra | Выпущен | Математика, компьютерное управление, терминал, автоматизация, кибер | Премиум |
| Claude Fable 5.1 | Выпущен | Долгоживущие агенты, рассуждение, качество кода, эффективность кэша | Премиум |
| Gemini 4 Flash / Flash-Lite | Заявленные «родственники» | Скорость + чувствительные к стоимости нагрузки | Крайне низкий |
Короткие выводы
- Доминирование по всем направлениям: Gemini 4 Pro занимает 1-е место во всех перечисленных категориях, часто с явным отрывом.
- Особенно силён: Долгий горизонт кодинга/агентов (DeepSWE, Terminal-bench), интеллектуальная работа, мультимодальность (видео + диаграммы) и специализированные домены (финансы, юриспруденция, биология, управление компьютером).
- Ценовое позиционирование: Примерно в 5 раз дешевле GPT-6 Astra и Claude Fable 5.1 по входу и выходу при более высоких показателях.
Astra делает акцент на компьютерном использовании, порогах кибербезопасности и научных открытиях; Fable 5.1 — на длительной интеллектуальной работе и кодинге с отточенными мерами безопасности и низкой стоимостью чтения из кэша. По утёкшему профилю Gemini 4 Pro выглядит сильнейшим в широком агентном софтверном инжиниринге и мультимодальном рассуждении.
Как разработчикам подготовиться: рекомендации CometAPI
Ожидая официального доступа к Gemini 4 Pro, командам полезен унифицированный шлюз, который уже поддерживает текущий фронтир (серия Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5 и 500+ других моделей). CometAPI предоставляет именно это: единый endpoint, совместимый с OpenAI, один API-ключ, оплату по мере использования обычно на 20–40% ниже прямых тарифов поставщиков и возможность переключать модели одной сменой параметра.
Практический рабочий процесс:
- Прототипируйте агентные конвейеры на текущих Gemini Flash/Pro, GPT-6 Astra и Claude Fable 5.1 через CometAPI.
- Бенчмаркте одни и те же промпты на разных моделях для установления базовых линий.
- Когда Gemini 4 Pro (и его варианты Flash) появятся в каталоге CometAPI — исторически платформа быстро добавляет новые модели Google — замените идентификатор модели и повторно прогоните оценки с минимальными изменениями кода.
- Используйте дашборд стоимости для отслеживания расхода токенов у разных провайдеров и направляйте высокообъёмный или чувствительный к задержке трафик на наиболее экономичную способную модель.
Такой подход устраняет необходимость управления множеством ключей, снижает риск привязки к поставщику и позволяет принять Gemini 4 Pro в первый день публичной доступности.
Если утечки окажутся верны по направлению, Gemini 4 Pro — самое сильное предложение Google вернуть лидерство на фронтире в агентной разработке ПО и мультимодальном рассуждении на длинном контексте. Сочетание заявленной производительности, большого контекста и агрессивных цен сделает его выбором по умолчанию для многих продакшен-нагрузок. Пока не появятся официальный релиз и независимые оценки, разумный путь — непрерывный бенчмаркинг по существующим фронтирным моделям — это легко сделать через платформы, уже объединяющие доступ. Следите за официальным анонсом; ближайшие недели, вероятно, прояснят, какая часть хайпа перейдёт в производственную реальность.
Вопросы и ответы
Выпущен ли Gemini 4 Pro?
Нет. По последнему каталогу и заявлениям Google (середина — конец сентября 2026) он ещё не выпущен публично и не имеет официального идентификатора модели.
Когда ожидается дата релиза Gemini 4 Pro?
Инсайдеры указывают на октябрь 2026 (с некоторыми ожиданиями конца сентября). Google не давал официальной даты. Рассматривайте как ориентировочное окно до подтверждения через каталог API или блог-пост.
Достиг ли Google RSI с Gemini 4 Pro?
Публичные данные показывают продвинутые агентные циклы для доработки моделей и исследования стратегического уровня рекурсивного улучшения (например, Dream-RSI). Утверждения о полном RSI, породившем модель, не подтверждены независимо.
Как он сравнивается с GPT-6 Astra и Claude Fable 5.1 в бенчмарках?
Графики из сообщества утверждают лидерство на нескольких наборах для агентов/кодинга. Официальных независимых оценок для выпущенного Gemini 4 Pro пока нет. Текущие публичные данные предполагают оценивать живые модели (Astra и Fable 5.1) на ваших задачах.
Стоит ли ждать Gemini 4 Pro перед разработкой?
Нет. Выпускайте на сегодняшних сильнейших доступных моделях (через CometAPI или прямые API), держите наборы оценок наготове и переходите на новую модель, если и когда независимые и внутренние тесты оправдают смену.
Где проще всего получить доступ к текущим фронтирным моделям?
Унифицированные провайдеры вроде CometAPI предлагают совместимый с OpenAI доступ к классу GPT-6 Astra, Claude Fable 5.1, текущим моделям Gemini и другим — с упрощённой биллингом и переключением. Проверьте актуальный список моделей и документацию для последних идентификаторов и цен.
