GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Исследования CometAPI

Опередил ли Gemini 4 уже GPT-6 и Claude Fable 5.1? Объяснение утекших бенчмарков

Gemini 4 превзойдет OpenAI’s GPT-6 Astra и Anthropic’s Claude Fable 5.1 на ключевых бенчмарках для агентных систем и программирования, при этом некоторые связывают эти улучшения с RSI.

CometAPI
AnnaКоманда исследователей AI-моделей и API
Обновлено Sep 20, 2026 12 мин. чтения
Опередил ли Gemini 4 уже GPT-6  и Claude Fable 5.1? Объяснение утекших бенчмарков
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Кратко Утечки бенчмарков и стелс-тесты на Arena.ai в середине сентября 2026 года позиционируют не выпущенный Google Gemini 4 Pro как нового лидера переднего края, опережающего GPT-6 Astra и Claude Fable 5.1 в разработке ПО, агентных задачах, интеллектуальной работе, рассуждении и мультимодальных бенчмарках.

Ключевые выводы

  • Gemini 4 Pro лидирует в утекших оценках на DeepSWE v1.1 (88.7%), GDPval-AA v2 (2064 Elo), Terminal-bench 2.1 (95.3%), OSWorld-2.0 (86.8%) и множестве других наборов для агентных задач/рассуждения.
  • Он дешевле по прайсу GPT-6 Astra ($12/$60) и Claude Fable 5.1 ($10/$50), при этом сопоставим или превосходит их по контекстным окнам класса 1M.
  • Скрытое тестирование на Arena.ai под временными именами (например, gemini-3.8-flash) дало выдающиеся демо по SVG, Three.js и агентному кодированию.
  • Ходят слухи о RSI (рекурсивном самоулучшении), но нет публичных доказательств замкнутого контура автономного улучшения для самого Gemini 4.
  • Google подтвердил значительные инвестиции в более крупную базовую модель Gemini 4; сроки публичного запуска остаются неофициальными.
  • Платформы вроде CometAPI уже агрегируют Gemini, GPT-6 Astra, Claude Fable/Opus и сотни других моделей за одним совместимым с OpenAI endpoint’ом по конкурентным тарифам — идеально для бенчмаркинга нового фронтира после релиза.

Что мы знаем о Gemini 4? (утечки, источники и проверенный контекст)

По состоянию на 20 сентября 2026 года Gemini 4 Pro не получил официального анонса Google, карточки модели или публичного API endpoint’а. Всё за пределами прежних заявлений Google о вложениях в «более крупную базовую модель Gemini 4» (отчёт за июль 2026) исходит из утечек сообщества, слепых тестов на Arena.ai и циркулирующих таблиц бенчмарков.

Ключевые источники и заявления:

  • Инсайдер Pankaj Kumar и последовавшие посты (начало–середина сентября) ссылались на внутренний Pro-checkpoint с ожидаемым публичным релизом в октябре и возможным более ранним вариантом Flash-Lite.
  • Несколько разработчиков сообщали о получении высокоспособной модели с меткой «gemini-3.8-flash» (или аналогичными псевдонимами) на Arena.ai. Выходы включали сложную генерацию SVG (например, пеликан на велосипеде, механические бабочки в Three.js), длинный нерепетитивный JSON и сильное агентное поведение. Некоторые пользователи заявляли о деталях бэкенда вроде многомиллионного контекста, потолков вывода 256k, межсессионной памяти и встроенных возможностей инструментов/интернета.
  • Широко распространившаяся таблица сравнивает Gemini 4 Pro с Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 и GPT-5.6 Sol.
  • Google не подтверждал тесты на Arena или эту таблицу. Исторически компания часто проводит скрытые оценки на публичных платформах за недели до официальных запусков.

Опередил ли Gemini 4 уже GPT-6  и Claude Fable 5.1? Объяснение утекших бенчмарков

Контекстное окно

Утёкшая таблица показывает максимум 2M входных токенов для семейства Gemini 4 — вдвое больше, чем 1M у GPT-6 Astra, и намного выше 200k у линейки Claude Fable/Opus 5 (некоторые версии Claude предлагали большие эффективные окна иными механизмами). Отдельные заявления о ghost-routing намекали на потолки в 10M; это остаётся непроверенным.

Цена Gemini 4 (утекшие цифры)

Циркулирующая таблица указывает:

  • Gemini 4 Pro: $2.25 за вход / $11.25 за выход на 1M токенов (без кэширования).
  • Gemini 4 Flash: $0.75 / $3.75.
  • Gemini 4 Flash-Lite: $0.35 / $1.75.

Эти цифры существенно ниже заявленных $12/$60 у GPT-6 Astra и $10/$50 у Claude Fable 5.1 (у Fable 5.1 агрессивные скидки на чтение из кэша, что может снижать эффективную стоимость для агентных нагрузок). Текущие официальные цены Gemini 3.x Pro лежат в диапазоне $2–$4 за вход / $12–$18 за выход в зависимости от длины контекста, так что утекшие цены для Pro выглядят правдоподобной корректировкой следующего поколения.

Фактические публичные цены будут известны только при запуске. Исторически Google использует конкурентные расценки по токенам и бесплатные уровни для стимулирования адопшена.

Производительность Gemini 4 Pro: подробности утёкших бенчмарков

Циркулирующая таблица ставит Gemini 4 Pro на вершину почти во всех категориях. Эти числа — неофициальные и не подтверждены Google или независимыми лабораториями на момент публикации. Их следует рассматривать как ориентир, а не окончательный рейтинг.

Разработка ПО и агентное кодирование

  • DeepSWE v1.1 (долгосрочная разработка ПО): 88.7% (против GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
  • Terminal-bench 2.1 (агентное терминальное кодирование): 95.3% (против Astra 94.1%, Fable 92.8%).
  • Terminal-bench 4.0 (общие агентные возможности): 69.7% (наибольший относительный разрыв над Flash и конкурентами).

Интеллектуальная работа и профессиональные задачи

  • GDPval-AA v2 (Elo, интеллектуальная работа): 2064 (единственная модель выше 2000; Astra 1994, Fable 1853).
  • Vals Finance Agent v2: 74.2%.
  • Harvey’s Legal Agent Benchmark (сложные юридические рабочие процессы, показатель all-pass): 18.7%.

Рассуждение, мультимодальность и специализированные области

  • CharXiv Reasoning (синтез информации из сложных диаграмм, без инструментов): 94.7%.
  • LVBench (понимание длинного видео): 95.8% агентное / 95.0% статическое.
  • HLE-Verified (междисциплинарное экспертное рассуждение): 72.1%.
  • OSWorld-2.0 (агентное компьютерное использование, частичный балл, batch tool включён): 86.8%.
  • BioMysteryBench и LABBench2 (биоинформатика и биологические исследовательские рабочие процессы): лидирующие показатели как на человечески-решаемых, так и на сложных поднаборах.

Если эти результаты верны хотя бы по направлению, они показывают особую силу на длинных горизонтах, многошаговых, инструментально-ориентированных агентных задачах — именно там, где GPT-6 Astra и Claude Fable 5.1 позиционировались лидерами после своих релизов в начале сентября.

Качественные тесты на Arena подтверждают картину: сложные генерации SVG и Three.js от стелс-модели оцениваются сообществом как превосходящие или крайне конкурентоспособные по сравнению с Astra в парных сравнениях.

Как будет работать Gemini 4?

Gemini 4 (Pro) ещё не выпущен, поэтому любое описание «как он будет работать» неизбежно основано на официальных заявлениях Google, ограниченных деталях утёкшего раннего внутреннего checkpoint’а и разумных инженерных предположениях по траектории серии Gemini 3.x. Нижеизложенное не следует считать подтверждёнными спецификациями.

Базовое обучение и масштаб

Google описывает Gemini 4 как «самый амбициозный претрейнинг», основанный на существенно более крупной базовой модели, чем предыдущие поколения. Заявленная цель — оставаться конкурентоспособными на фронтире, особенно в кодинге и автономных агентах.

Это подразумевает:

  • Большее число параметров или более эффективную ёмкость (через mixture-of-experts, лучшую разреженность или более плотное масштабирование).
  • Более крупные вычислительные затраты на претрейнинге.
  • Продолжение упора на мультимодальные данные обучения (текст, изображение, видео, аудио, код, траектории использования инструментов).

Предполагается, что модель станет новой высокоспособной базой, от которой позже будут производны быстрые варианты в стиле Flash.

Вывод и стиль рассуждения

Утечки о раннем checkpoint’е «argon» упоминают режим высокого уровня размышлений, при котором один прогон занимал около 2.4 минуты и поддерживался резко повышенный лимит вывода (сообщалось о 256k токенов против прежних ~64k).

Это указывает на:

  • Опциональные ресурсоёмкие пути рассуждения (по духу близкие расширенному мышлению или режимам «максимальных усилий» у конкурентов).
  • Возможность тратить больше внутреннего вычисления на сложные задачи до выдачи ответа.
  • Лучшую поддержку длинных, связных выходов, таких как полноценные кодовые базы, многошаговые планы или развёрнутые отчёты.

Вероятно, пользователи смогут управлять компромиссом между скоростью/стоимостью и глубиной рассуждения, как и сейчас в линейке Gemini Flash с низким/средним/высоким уровнями «thinking».

Ключевые направления возможностей

Опираясь на публичные remarks Сундара Пичая и траекторию развития:

  1. Кодинг и разработка ПО Усиление долгосрочной продуктивности: рефакторинг множества файлов, отладка по репозиториям, циклы самокоррекции и более высокие доли завершения реалистичных задач.
  2. Автономное / агентное поведение Улучшенное планирование, использование инструментов, наблюдение промежуточных результатов, восстановление после ошибок и продолжение движения к цели в течение многих шагов. Это строится поверх функций компьютерного использования и агентности, уже присутствующих в Gemini 3.5/3.8 Flash.
  3. Надёжность на длинном контексте Сообщества упоминают цели на уровне 1.5 млн токенов (или выше). Практическая цель — не только большие окна, но и лучшая точность извлечения и меньшее ухудшение при работе с очень длинными документами, кодовыми базами или многочасовыми трассами агентов.
  4. Мультимодальное понимание и генерация Нативная работа с текстом + изображением + видео + аудио, ожидаемые улучшения в пространственном рассуждении, понимании видео и взаимодействиях реального времени (voice/agent), опираясь на сентябрьские 2026 Gemini 3.8 Live.
  5. Использование инструментов и структурированные выходы Более надёжный function calling, выполнение кода, поиск с обоснованием и структурированные выходы JSON/XML для надёжной интеграции в приложения и агентов.

Чем отличается от Gemini 3.x

  • Масштаб: Явно более крупная базовая модель, а не инкрементальная доработка.
  • Ёмкость вывода: Утёкшие более высокие лимиты токенов позволяют длинные генерации за один проход.
  • Глубина рассуждений: Более выраженные режимы высоких усилий для сложных задач.
  • Агентный фокус: Больший акцент на устойчивую, многошаговую автономную работу, а не на одноходовые или короткие задачи.
  • Позиционирование: Предназначен как новый Pro-уровень фронтира, в то время как линейка Flash продолжает быстрые итерации ради скорости и стоимости.

Отношение к рекурсивному самоулучшению (RSI)

Руководители Google публично связывали крупные капитальные затраты на ИИ с долгосрочной целью рекурсивного самоулучшения — систем, способных существенно улучшать себя или процессы, порождающие следующее поколение. Связанные исследования (например, Dream-RSI) показывают агентов, улучшающих собственные стратегии исследования без изменения весов модели.

Превзойдёт ли Gemini 4 Pro GPT-6 и Claude Fable 5.1?

КатегорияGemini 4 ProGPT-6 AstraClaude Fable 5.1Примечания
Цена вход/выход$2.25 / $11.25$12.00 / $60.00$10.00 / $50.00Gemini 4 Pro примерно в 5× дешевле Astra
Контекстное окно2M1M200kСущественное преимущество Gemini
DeepSWE v1.188.7%86.9%69.1%Сильное лидерство в кодинге
GDPval-AA v2 (Elo)206419941853Лидер в интеллектуальной работе
Terminal-bench 4.069.7%66.4%57.9%Общие агентные возможности
OSWorld-2.086.8%84.5%77.9%Управление компьютером
HLE-Verified72.1%67.3%62.1%Экспертное рассуждение
LVBench (видео)95.8% / 95.0%93.8%90.4%Мультимодальные сильные стороны
Bio / LAB researchНаивысшиеСильныеКонкурентныеНаучные рабочие процессы

Gemini 4 Pro возглавляет каждую ключевую строку в таблице, часто с заметным отрывом, при том что заявленная цена гораздо агрессивнее, чем у GPT-6 Astra или Claude Fable 5.1.

Важные оговорки

  • Эта таблица не является официальным релизом Google. По состоянию на 20 сентября 2026 года Google всё ещё не публиковал карточку модели, API endpoint, цены или подтверждённые бенчмарки для Gemini 4 Pro. Цифры происходят из источников сообщества / наблюдений на Arena / утечек внутреннего checkpoint’а (связанного с кодовым именем «argon»).
  • Некоторые ранние листы позднее были помечены как предсказанные или частично скопированные. Любой процент и цены следует считать непроверенными до подтверждения Google.
  • Контекстное окно Claude Fable 5.1 указано здесь как 200k, что ниже 1M, обычно заявляемого в официальной документации Anthropic. Это может отражать конкретные условия оценки или ошибку в утекшем листе.
  • GPT-6 Astra и Claude Fable 5.1 остаются единственными полностью публичными, независимо оценёнными моделями фронтира прямо сейчас. Artificial Analysis и другие сторонние трекеры всё ещё показывают их как близко сопоставимые в целом (с разными сильными сторонами).

Текущая практическая реальность (20 сентября 2026 года)

МодельСтатусОптимально дляУровень цены
Gemini 4 ProНе выпущен (заявлен сильным)Длинный контекст, кодинг, агенты, мультимодальность, стоимостьОчень агрессивный (заявлен)
GPT-6 AstraВыпущенМатематика, компьютерное управление, терминал, автоматизация, киберПремиум
Claude Fable 5.1ВыпущенДолгоживущие агенты, рассуждение, качество кода, эффективность кэшаПремиум
Gemini 4 Flash / Flash-LiteЗаявленные «родственники»Скорость + чувствительные к стоимости нагрузкиКрайне низкий

Короткие выводы

  • Доминирование по всем направлениям: Gemini 4 Pro занимает 1-е место во всех перечисленных категориях, часто с явным отрывом.
  • Особенно силён: Долгий горизонт кодинга/агентов (DeepSWE, Terminal-bench), интеллектуальная работа, мультимодальность (видео + диаграммы) и специализированные домены (финансы, юриспруденция, биология, управление компьютером).
  • Ценовое позиционирование: Примерно в 5 раз дешевле GPT-6 Astra и Claude Fable 5.1 по входу и выходу при более высоких показателях.

Astra делает акцент на компьютерном использовании, порогах кибербезопасности и научных открытиях; Fable 5.1 — на длительной интеллектуальной работе и кодинге с отточенными мерами безопасности и низкой стоимостью чтения из кэша. По утёкшему профилю Gemini 4 Pro выглядит сильнейшим в широком агентном софтверном инжиниринге и мультимодальном рассуждении.

Как разработчикам подготовиться: рекомендации CometAPI

Ожидая официального доступа к Gemini 4 Pro, командам полезен унифицированный шлюз, который уже поддерживает текущий фронтир (серия Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5 и 500+ других моделей). CometAPI предоставляет именно это: единый endpoint, совместимый с OpenAI, один API-ключ, оплату по мере использования обычно на 20–40% ниже прямых тарифов поставщиков и возможность переключать модели одной сменой параметра.

Практический рабочий процесс:

  1. Прототипируйте агентные конвейеры на текущих Gemini Flash/Pro, GPT-6 Astra и Claude Fable 5.1 через CometAPI.
  2. Бенчмаркте одни и те же промпты на разных моделях для установления базовых линий.
  3. Когда Gemini 4 Pro (и его варианты Flash) появятся в каталоге CometAPI — исторически платформа быстро добавляет новые модели Google — замените идентификатор модели и повторно прогоните оценки с минимальными изменениями кода.
  4. Используйте дашборд стоимости для отслеживания расхода токенов у разных провайдеров и направляйте высокообъёмный или чувствительный к задержке трафик на наиболее экономичную способную модель.

Такой подход устраняет необходимость управления множеством ключей, снижает риск привязки к поставщику и позволяет принять Gemini 4 Pro в первый день публичной доступности.

Если утечки окажутся верны по направлению, Gemini 4 Pro — самое сильное предложение Google вернуть лидерство на фронтире в агентной разработке ПО и мультимодальном рассуждении на длинном контексте. Сочетание заявленной производительности, большого контекста и агрессивных цен сделает его выбором по умолчанию для многих продакшен-нагрузок. Пока не появятся официальный релиз и независимые оценки, разумный путь — непрерывный бенчмаркинг по существующим фронтирным моделям — это легко сделать через платформы, уже объединяющие доступ. Следите за официальным анонсом; ближайшие недели, вероятно, прояснят, какая часть хайпа перейдёт в производственную реальность.

Вопросы и ответы

Выпущен ли Gemini 4 Pro?

Нет. По последнему каталогу и заявлениям Google (середина — конец сентября 2026) он ещё не выпущен публично и не имеет официального идентификатора модели.

Когда ожидается дата релиза Gemini 4 Pro?

Инсайдеры указывают на октябрь 2026 (с некоторыми ожиданиями конца сентября). Google не давал официальной даты. Рассматривайте как ориентировочное окно до подтверждения через каталог API или блог-пост.

Достиг ли Google RSI с Gemini 4 Pro?

Публичные данные показывают продвинутые агентные циклы для доработки моделей и исследования стратегического уровня рекурсивного улучшения (например, Dream-RSI). Утверждения о полном RSI, породившем модель, не подтверждены независимо.

Как он сравнивается с GPT-6 Astra и Claude Fable 5.1 в бенчмарках?

Графики из сообщества утверждают лидерство на нескольких наборах для агентов/кодинга. Официальных независимых оценок для выпущенного Gemini 4 Pro пока нет. Текущие публичные данные предполагают оценивать живые модели (Astra и Fable 5.1) на ваших задачах.

Стоит ли ждать Gemini 4 Pro перед разработкой?

Нет. Выпускайте на сегодняшних сильнейших доступных моделях (через CometAPI или прямые API), держите наборы оценок наготове и переходите на новую модель, если и когда независимые и внутренние тесты оправдают смену.

Где проще всего получить доступ к текущим фронтирным моделям?

Унифицированные провайдеры вроде CometAPI предлагают совместимый с OpenAI доступ к классу GPT-6 Astra, Claude Fable 5.1, текущим моделям Gemini и другим — с упрощённой биллингом и переключением. Проверьте актуальный список моделей и документацию для последних идентификаторов и цен.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Sep 20, 2026
Последнее обновление Sep 20, 2026
1 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее