DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 уже здесь: результаты бенчмарков уровня GPT-5.6 и производительность при написании кода

CometAPI
AnnaAug 13, 2026
Grok 4.6 уже здесь: результаты бенчмарков уровня GPT-5.6 и производительность при написании кода

TL; DR xAI официально выпустила Grok 4.6 12 августа 2026 года и сделала его доступным через xAI API, Cursor и Grok Build. У модели контекстное окно на 500 000 токенов, поддержка текста и изображений, четыре уровня усилия рассуждений, а срез знаний — 1 февраля 2026 года. Согласно официальному объявлению xAI о Grok 4.6, он сопоставим с GPT-5.6 Sol в Artificial Analysis Intelligence Index, композитном индикаторе из девяти оценок. 

Цены API начинаются с $2 за миллион входных токенов, $0.50 за миллион кэшированных входных токенов и $6 за миллион выходных токенов для подсказок меньше 200 000 токенов. Когда подсказка достигает 200 000 токенов, весь запрос тарифицируется по ставкам длинного контекста: $4 за вход, $1 за кэшированный вход и $12 за выход за миллион токенов. Для разработчиков, которым нужен гибкий доступ к нескольким моделям, платформы вроде CometAPI упрощают интеграцию Grok 4.6 наряду с другими передовыми моделями, цена API составляет 80% от цены xAI.

Ключевые выводы

  • xAI официально выпустила Grok 4.6 12 августа 2026 года; ранние отчёты из окна релиза теперь устарели.
  • Идентификатор модели API — , а модель также доступна в Cursor и Grok Build.grok-4.6
  • Его окно контекста — 500K токенов, вход — текст и изображения, выход — только текст.
  • Стандартные цены при подсказках ниже 200K токенов: $2/М за вход, $0.50/М за кэшированный вход и $6/М за выход.
  • Подсказка от 200K токенов и выше включает повышенные ставки для всех токенов в этом запросе, а не только тех, что превышают порог.
  • Усилие рассуждений можно задать как lowmediumhigh или xhigh; — задокументированное значение по умолчанию.
  • Grok 4.6 сопоставим с GPT-5.6 Sol по Artificial Analysis Intelligence Index (оценка 61) и демонстрирует существенные улучшения относительно Grok 4.5 в агентном кодинге, работе с знаниями и задачах с длинным горизонтом.
  • Grok Imagine Image 2.0 — отдельный API для генерации изображений. Grok 4.6 понимает изображения, но сам по себе не возвращает сгенерированные изображения.

Характеристики и цена Grok 4.6 кратко

Следующие характеристики подтверждены в документации модели xAI и релиз-нотах от 12 августа.

SpecificationGrok 4.6
Official release date12 августа 2026 года
API model IDgrok-4.6
PositioningФлагманская модель для кодинга, агентов и общих нагрузок
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitNo text-output limit stated by xAI
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoff1 февраля 2026 года
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

Официальное ценообразование xAI API

Текущая таблица цен xAI API разделяет запросы на короткий и длинный контекст.

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

Порог особенно важен для агентных сценариев с кодовыми базами. Когда подсказка запроса достигает 200 000 токенов, xAI взимает тариф длинного контекста за все токены в этом запросе, а не только за часть, превышающую порог. Запрос, содержащий 199 000 токенов подсказки, может стоить значительно меньше, чем запрос с 200 000, даже если их размеры почти идентичны.

В текущей документации по ценообразованию xAI не указан пакетный дисконт для Grok 4.6. Команды не должны предполагать, что офлайн‑задачи получают скидки, доступные для некоторых других моделей xAI.

Что такое Grok 4.6?

Grok 4.6 — последняя флагманская LLM от SpaceXAI, выпущенная 12 августа 2026 года. Он напрямую продолжает Grok 4.5, применяя более длительный дополнительный тренировочный прогон, сфокусированный на курированных данных, сгенерированных моделью, для продвинутого рассуждения и технических концепций, высококачественных инженерных датасетов, улучшенного оптимизатора и расширенного RL для сценариев кодинга и работы с знаниями.

Модель сохраняет ту же базу из 1.5 триллиона параметров, что и предшественник; улучшения происходят главным образом за счёт пост-тренировок, а не увеличения масштаба параметров. Она специально спроектирована, чтобы оставаться эффективной на многих шагах — будь то исследование темы, анализ больших объёмов информации, навигация и редактирование незнакомой кодовой базы или превращение высокоуровневой идеи в готовое приложение или рабочий артефакт. SpaceXAI подчёркивает улучшенное самопроверочное поведение на проектах с длинным горизонтом и более сильную производительность в интерактивной и визуальной работе.

Различие с традиционным чат-ботом важно.

Обычный рабочий процесс LLM выглядит так:

Prompt → Generate answer

Grok 4.6 спроектирован под рабочие процессы ближе к:

Goal → Plan → Research → Use tools → Modify code → Test → Evaluate → Continue

Текущее позиционирование xAI подчёркивает способность модели дольше удерживаться на сложных проектах, работать по кодовым базам, исследовать незнакомые темы, строить приложения и проверять собственную работу.

Это делает Grok 4.6 особенно актуальным для стремительно растущего рынка AI‑агентов для кодинга и автономных агентов.

Каковы основные возможности Grok 4.6?

Возможности долгосрочной работы агента

Самое важное улучшение Grok 4.6 — фокус на долгих задачах.

Вместо оптимизации только под одноразовые ответы модель создана для поддержания прогресса через несколько стадий проекта.

Типичные примеры включают:

  • Создание приложения
  • Отладка большого репозитория
  • Исследование незнакомого предмета
  • Модификация нескольких компонентов
  • Запуск тестов
  • Исследование отказов
  • Пересмотр реализации
  • Проверка конечного результата

Это принципиально иной целевой вектор, чем традиционные бенчмарки следования инструкциям.

Продвинутая производительность в кодинге

Кодинг — одна из самых явных областей улучшения Grok 4.6.

Текущие отчёты по бенчмаркам дают:

  • 65.9% на DeepSWE 1.1
  • 69.9% на CursorBench 3.2
  • 61.3% на FrontierCode 1.1 Extended

Эти оценки особенно релевантны, поскольку они нацелены на поведение агентного кодинга, а не простое дополнение кода.

Улучшение от Grok 4.5 к Grok 4.6 на DeepSWE 1.1 особенно заметно: рост примерно с 54% до 65.9% в представленном сравнении.

Мультимодальный ввод

Grok 4.6 поддерживает ввод текста и изображений, позволяя разработчикам комбинировать визуальную информацию с рассуждением.

Потенциальные применения включают:

  • Отладку по скриншотам
  • Анализ интерфейсов
  • Интерпретацию графиков
  • Понимание документов
  • Визуальные исследования
  • Задачи кодинга на основе изображений

Это делает Grok 4.6 более гибким, чем чисто текстовая модель для кодинга.

Доступ Grok к поиску — значимая часть его экосистемы.

API поддерживает:

  • Поиск в интернете
  • Поиск в X
  • Вызов функций
  • Выполнение кода

Текущая документация по Grok 4.5 API от xAI подтверждает эти возможности инструментов в среде Grok API.

Для исследовательских агентов это означает, что модель может переходить от статических предобученных знаний к получению актуальной информации плюс рассуждение.

Настраиваемое рассуждение

API Grok предоставляет настраиваемое усилие рассуждения.

Это позволяет разработчикам балансировать:

скорость / стоимость ↔ глубина рассуждения

Для простых задач более низкое усилие может уменьшить ненужные вычисления.

Для сложных задач кодинга или исследования более высокое усилие обеспечивает более вдумчивое решение проблем.

Конкурентная стоимость на передовой производительности

Ценообразование Grok 4.6, вероятно, одно из его сильнейших коммерческих преимуществ.

Заявленная стандартная цена API:

  • $2 / 1М входных токенов
  • $6 / 1М выходных токенов

Это та же цена, что и у Grok 4.5, несмотря на значимые улучшения возможностей.

Это создаёт необычно агрессивное соотношение стоимости и производительности для передовой модели.


Как Grok 4.6 показывает себя на бенчмарках?

Самые полезные текущие данные по бенчмаркам сосредоточены вокруг агентного интеллекта и кодинга.

BenchmarkGrok 4.6What It Measures
Artificial Analysis Intelligence Index61Broad frontier-model intelligence
CursorBench 3.269.9%Coding-agent performance
DeepSWE 1.165.9%Software engineering agents
FrontierCode 1.1 Extended61.3%Advanced coding
GDPVal-AA v21,753 EloKnowledge-work task performance

Оценка 61 в Artificial Analysis Intelligence Index, по сообщениям, ставит Grok 4.6 на один уровень с GPT-5.6 Sol на этом индексе.

Оценка 1,753 Elo в GDPVal-AA v2 также значима, поскольку GDPVal оценивает профессиональные задачи по работе с знаниями, а не просто академические вопросы и ответы.

Важный вывод из бенчмарков

Самое сильное свидетельство в пользу Grok 4.6 — это не единичная оценка в стиле MMLU.

Его профиль бенчмарков указывает на:

кодинг + агенты + работа с знаниями + длительное выполнение

Именно туда движётся современная разработка AI.

Для сайта вроде CometAPI это важное различие: Grok 4.6 следует продвигать прежде всего как агентную передовую модель, а не очередную универсальную чат‑модель.

Как Grok 4.6 сравнивается с предшественником и конкурентами?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focusGeneral reasoning + agentsLong-running agents + coding
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

Важный момент: Grok 4.6 не выглядит простым заменителем ценовой категории для Grok 4.5. Это апгрейд возможностей, более направленный на агентные рабочие процессы с длинным горизонтом.

Текущая документация по Grok 4.5 от xAI указывает цену $2/$6 за миллион токенов, с настраиваемым рассуждением и поддержкой инструментов.

Таблица сравнения: Grok 4.6 vs ключевые конкуренты

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok far cheaper on output
Context Window500KUp to 1M+Often 1M
StrengthsAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Cursor IntegrationNative, strongAvailableAvailableGrok optimized for Cursor
Turn EfficiencyHigh (fewer steps)CompetitiveHigher step counts reportedImportant for agents
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI unifies access

Данные взяты из объявления SpaceXAI, Artificial Analysis и публичных карточек моделей по состоянию на 13 августа 2026 года.

Текущее сравнение Artificial Analysis особенно интересно.

По сообщениям, Grok 4.6 набирает 61 в Intelligence Index, совпадая с GPT-5.6 Sol. Но экономика очень различается.

Точные цены у конкурирующих вариантов GPT следует сверять с их текущими прайсами у провайдеров перед публикацией, но ключевое рыночное наблюдение ясно: Grok 4.6 конкурирует на уровне передовых бенчмарков, сохраняя сравнительно агрессивную цену за токен.

Это делает Grok 4.6 особенно привлекательным для приложений, где высокообъёмное выполнение агентных задач иначе делает премиальные передовые модели дорогими.

Каковы ограничения Grok 4.6?

Контекст 500K меньше, чем у некоторых конкурентов с контекстом 1M

Сообщаемый контекст 500K — большой, но это не самый большой доступный контекст в сегменте передовых моделей.

Для очень больших репозиториев или массивных коллекций документов модель с контекстом 1M может иметь преимущество.

Проприетарная модель

В отличие от MiMo‑V2.5‑Pro, Grok 4.6 — не открытая модель с весами.

Разработчики не могут скачать модель и развернуть её самостоятельно.

Сравнения бенчмарков требуют осторожности

Разные бенчмарки кодинга используют различные каркасы, подсказки, инструменты и процедуры оценки.

Например, SWE‑Bench Pro специально рассчитан на реалистичные долгосрочные задачи ПО, и результаты бенчмарков могут существенно варьироваться в зависимости от каркаса агента.

Следовательно, 69.9% CursorBench не следует интерпретировать как «Grok 4.6 на 69.9% лучше другой модели».

Правильная интерпретация: он достиг этой оценки в рамках конкретной конфигурации оценки данного бенчмарка.

Стоимость работы агента может быть выше, чем предполагает цена за токены

Цена $2/$6 привлекательна, но автономный агент может потреблять огромное количество токенов через:

  • Вызовы инструментов
  • Повторные поиски
  • Выполнение кода
  • Неудачные попытки
  • Длинный контекст
  • Самопроверку

Реальная экономика единицы, таким образом, зависит от стоимости за успешно выполненную задачу, а не просто стоимости за миллион токенов.

Цена и доступ

Официальные цены (стандартный уровень, при подсказках ниже ~200K токенов):

  • Вход: $2.00 за 1М токенов
  • Кэшированный вход: примерно $0.50 за 1М токенов
  • Выход: $6.00 за 1М токенов

Более быстрый вариант стоит вдвое дороже. Ставки могут удваиваться для очень длинных контекстов (≥200K). Сильно рекомендуется кэширование подсказок для агентных циклов, чтобы снизить стоимость.

Доступность:

  • Cursor и Grok Build (2× включённого использования в первую неделю)
  • SpaceXAI API (grok-4.6)
  • Партнёры: OpenRouter, Vercel, Cloudflare и другие
  • SuperGrok чат/приложения (через выбор модели)

Рекомендация CometAPI: Для разработчиков, уже использующих (или планирующих использовать) несколько передовых моделей, CometAPI предоставляет бесшовный доступ к Grok 4.6 через единый совместимый с OpenAI эндпоинт (https://api.cometapi.com/v1). Вы получаете объединённое биллинг‑учёт, аналитику использования, конкурентные эффективные ставки по 500+ моделям (включая GPT, Claude, Gemini, DeepSeek и варианты Grok), а также возможность переключать модели одной строкой. Это особенно ценно при A/B‑тестировании Grok 4.6 против других моделей для кодинга/агентов или при построении продакшн‑систем, которым выгодны маршрутизация моделей и фоллбэк. Зарегистрируйтесь на cometapi.com, чтобы получить бесплатный API‑ключ и изучить живой каталог моделей.

Стоит ли переходить на Grok 4.6?

Да, если:

  • Вы активно работаете в Cursor или строите долгоживущих агентов для кодинга/работы с знаниями и хотите сильную надёжность по многим шагам при конкурентной цене.
  • Важна экономика токенов — Grok 4.6 даёт близкий к паритету уровень интеллекта с GPT‑5.6 Sol примерно по одной пятой цены выходных токенов самых дорогих передовых вариантов.
  • Вы цените эффективность по шагам (меньше шагов и токенов для завершения сложных задач).
  • Вам нужен немедленный доступ к модели, явно обученной для интерактивных, визуальных и агентных рабочих процессов, распространённых в современной разработке.

Рассмотрите возможность остаться на текущих моделях или использовать смешанный стек, если:

  • Ваш основной рабочий процесс — чистое соревновательное программирование или специфические сильные стороны закрытых моделей (например, отдельные сценарии Claude с длинным контекстом или усиленной безопасностью).
  • Вам нужны абсолютные максимальные оценки по каждому отдельному бенчмарку инженерии ПО независимо от стоимости.
  • Вам нужны окна контекста крупнее 500K для единовременных вызовов (некоторые конкуренты предлагают 1M+).

Большинство команд выиграют от оценки Grok 4.6 бок‑о‑бок со своим текущим стеком. Поскольку он доступен через агрегаторы, такие как CometAPI, стоимость переключения низкая — просто поменяйте имя модели и измерьте показатели завершённости реальных задач, задержку и стоимость на собственных нагрузках.

Заключение

Grok 4.6 представляет значительный шаг вперёд для SpaceXAI: уровень интеллекта передового класса по ключевым композитным и агентным бенчмаркам, существенные улучшения в долгосрочной работе по кодингу и работе с знаниями и продолжение агрессивного ценообразования, которое дешевле многих закрытых конкурентов. Его нативная доступность в Cursor в сочетании с сильной надёжностью по многим шагам делает модель особенно привлекательной для разработчиков, строящих реальные софтверные агенты и интерактивные приложения.

Независимо от того, получаете ли вы доступ напрямую, через Cursor/Grok Build или через унифицированный шлюз вроде CometAPI, Grok 4.6 готов к промышленной оценке уже сегодня. Посетите официальное объявление на x.ai/news/grok-4-6 для полного описания и карточки модели, изучите живой каталог на cometapi.com, чтобы сравнить её бок‑о‑бок с другими ведущими моделями, и начинайте строить на новых возможностях немедленно.

Первичные источники

Всегда проверяйте последние цены, лимиты и показатели бенчмарков на официальных страницах, так как ландшафт AI быстро меняется.

0 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее