TL;DR
Grok 4.7 и Claude Fable 5.1 конкурируют в одном классе моделей фронтира, но оптимизируют разные экономические аспекты развёртывания. Grok 4.7 ориентирован на программирование, агентную работу и соотношение цена/производительность, имеет контекстное окно 500K токенов и официальные цены от $2/M входных и $6/M выходных токенов. Claude Fable 5.1 удваивает контекст до 1M токенов и рассчитан на требовательное рассуждение и агентную работу с длинным горизонтом, по $10/M входных и $50/M выходных токенов.
Картина по бенчмаркам смешанная, а не однозначная. Официальная оценка запуска xAI показывает преимущество Fable 5.1 на CursorBench 4.0 и Terminal-Bench 4.0, тогда как Grok 4.7 лидирует на DeepSWE v1.1, EEBench и Harvey Legal Agent Benchmark. На практике выбор чаще определяется не «универсальным победителем», а стоимостью за принятый результат, длительностью задачи, требованиями к контексту, использованием инструментов и поведением при повторах.
Ключевые выводы
- Grok 4.7 стоит $2/M входных и $6/M выходных токенов ниже порога ценообразования за повышенный контекст; кэшированные входы — $0.50/M.
- Claude Fable 5.1 стоит $10/M входных и $50/M выходных токенов, с $0.25/M за чтение из кэша.
- Claude Fable 5.1 предлагает контекстное окно 1M токенов; Grok 4.7 — 500K токенов.
- Лидерство в бенчмарках зависит от задачи: Fable 5.1 ведёт в нескольких тестах длинного горизонта для кодинга, а Grok 4.7 лидирует в выбранных инженерных и доменных агентных оценках в сравнении xAI.
- В продакшене самый полезный метрик — стоимость за успешно выполненную задачу, а не цена за миллион токенов отдельно.
Что такое Grok 4.7 и Claude Fable 5.1?
Обзор Grok 4.7
Grok 4.7 — фронтирная модель xAI для программирования, агентных задач и интеллектуальной работы, выпущенная 21 сентября 2026 года. По словам xAI, она использует новую, более крупную базовую модель, чем Grok 4.6, и более длительный цикл обучения с подкреплением с упором на задачи, которые могут занимать много часов. Релиз также акцентирует лучшую самопроверку и управление длинным контекстом.
Официальная документация для разработчиков указывает ID модели grok-4.7, контекстное окно 500 000 токенов, вход по тексту и изображениям, текстовый вывод, четыре уровня рассуждения — low, medium, high и xhigh — и инструменты, включая вызов функций, веб‑поиск, X‑поиск и выполнение кода.
Официальный визуал запуска Grok 4.7 — SpaceXAI
Обзор Claude Fable 5.1
Claude Fable 5.1 выпущен 1 сентября 2026 года. Anthropic позиционирует его для требовательного рассуждения, длительного программирования, многошаговых исследований, документно‑ёмкой профессиональной работы и агентов, работающих на протяжении расширенных сессий.
Документация по модели Anthropic указывает контекстное окно 1M токенов, до 128K выходных токенов, вход по тексту и изображениям, адаптивное мышление и надёжную отсечку знаний за июнь 2026 года.
Официальный визуал запуска Claude Fable 5.1 — Anthropic
Grok 4.7 vs Claude Fable 5.1 кратко
| Спецификация | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Дата релиза | 21 сентября 2026 | 1 сентября 2026 |
| Провайдер | xAI / SpaceXAI | Anthropic |
| ID модели | grok-4.7 | claude-fable-5-1 |
| Основное позиционирование | Кодинг, агенты, интеллектуальная работа | Требовательное рассуждение и агенты с длинным горизонтом |
| Контекстное окно | 500K токенов | 1M токенов |
| Макс. вывод | Фиксированный лимит текста не задокументирован | До 128K токенов |
| Входные модальности | Текст + изображение | Текст + изображение |
| Вывод | Текст | Текст |
| Отсечка знаний | Май 2026 | Июнь 2026 |
| Рассуждение | Low / Medium / High / xhigh | Адаптивное мышление + контроль усилий |
| Веб/поисковые инструменты | Веб‑поиск + X‑поиск | Зависит от окружения/инструментов |
| Вызов функций/инструментов | Да | Да |
| Веса модели | Закрыты | Закрыты |
| CursorBench 4.0 (кодинг) | 46.3% | 51.8% |
| DeepSWE v1.1 (агент) | 71.0% (high effort) | 70.0% |
| Terminal-Bench 4.0 (агент) | 38.0% | 57.9% |
| Типичный сценарий | Чувствит. к цене кодинг и агенты с Web/X | Длительный кодинг и чувствит. к сбоям проф. работа |
Крупнейшие структурные различия — вместимость контекста и экономика токенов. Официальная документация API Grok 4.7 подтверждает контекст 500K и базовые цены $2/$6, а документация Fable 5.1 от Anthropic подтверждает 1M контекст и $10/$50.
Результаты прямого сравнения в бенчмарках
Самое чистое прямое сравнение сейчас — таблица бенчмарков запуска Grok 4.7 от xAI, где обе модели представлены в одной опубликованной оценке.
Приведённые цифры — от вендоров, а не независимо воспроизведённые. В опубликованной таблице xAI Grok 4.7 оценён на уровне xhigh effort, а Claude Fable 5.1 — на max effort; отдельно xAI помечает результат Grok 4.7 на DeepSWE как high effort. Используйте их, чтобы выявить паттерны нагрузки, а затем валидируйте обе модели на собственных промптах, инструментах, репозиториях и критериях приёмки.
| Бенчмарк | Grok 4.7 | Claude Fable 5.1 | Наблюдаемый разрыв |
|---|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% | Fable +5.5 п. |
| DeepSWE v1.1 | 71.0%* | 70.0% | Grok +1.0 п. |
| AA Briefcase v1.1 | 1,657 | 1,678 | Fable +21 |
| Terminal-Bench 4.0 | 38.0% | 57.9% | Fable +19.9 п. |
| Harvey Legal Agent Benchmark | 19.6% | 6.7% | Grok +12.9 п. |
| HealthBench Professional | 56.7% | 62.1% | Fable +5.4 п. |
| EEBench | 64.0% | 56.4% | Grok +7.6 п. |
* xAI помечает результат Grok 4.7 на DeepSWE как high effort. Общий вывод — специализация по задачам, а не универсальная иерархия: Fable сильнее в нескольких долгих кодинговых и профессиональных сценариях, тогда как Grok сильнее в ряде инженерных и доменных агентных тестов в той же таблице вендора.
Профессиональная интеллектуальная работа
В таблице xAI Fable 5.1 немного лидирует на AA Briefcase v1.1, тогда как Grok 4.7 лидирует на EEBench и Harvey Legal Agent Benchmark. Fable 5.1 ведёт на HealthBench Professional. Это подтверждает простую мысль: «знаниевая» работа — не одна способность. Инженерия, медицина, право, финансы, исследования и офисная автоматизация предъявляют разные требования к инструментам и рассуждению.
Производительность в кодинге
В кодинге сравнение наиболее нюансировано. На CursorBench 4.0 Fable 5.1 набирает 51.8% против 46.3% у Grok 4.7. На DeepSWE v1.1 Grok 4.7 достигает 71.0% против 70.0% у Fable 5.1. Наибольший разрыв — на Terminal-Bench 4.0: Fable 5.1 — 57.9% против 38.0% у Grok 4.7.
| Измерение в кодинге | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Инженерия репозиториев | Очень сильная | Очень сильная |
| DeepSWE | Небольшое лидерство в xAI | Очень близко |
| CursorBench 4.0 | 46.3% | 51.8% |
| Автономия в терминале | Сильная | Ключевая сильная сторона |
| Работа с длинным контекстом кода | 500K контекст | 1M контекст |
| Стоимость при повторах | Гораздо ниже | Премиум |
| Нативное выполнение кода xAI | Поддерживается | Зависит от окружения/инструментов Claude |
| Длительное автономное выполнение | Явный фокус обучения | Базовое позиционирование продукта |
Вероятное следствие для продакшена: Fable 5.1 заслуживает внимания для терминал‑интенсивных, длительных кодинговых агентов, тогда как Grok 4.7 привлекателен там, где качество разработки достаточно, а стоимость токенов существенно влияет на юнит‑экономику.
Агентные рабочие процессы
Обе модели задизайнены для агентных рабочих процессов, а не изолированных сессий «промпт‑ответ». xAI заявляет, что Grok 4.7 обучался на более сложной смеси задач большой длительности и улучшенной самопроверке. Anthropic описывает Fable 5.1 как модель для работы, которая может длиться часами и охватывать многие приложения.
| Требование агента | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Длительное рассуждение | Сильное | Очень сильное |
| Вместимость контекста | 500K | 1M |
| Самопроверка | Явный фокус обучения | Явный фокус на длинном горизонте |
| Использование инструментов | Сильное | Сильное |
| Нативный поиск | Веб + X поиск | Зависит от окружения |
| Длинный повторяющийся контекст | Кэш подсказок + уплотнение | 1M контекст + дешёвые чтения из кэша |
| Базовая стоимость токенов | Ниже | Выше |
Цены и экономика развёртывания
| Официальные базовые цены | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Вход / 1M токенов | $2 | $10 |
| Кэшированный вход / чтение из кэша | $0.50 ниже 200K промпта | $0.25 |
| Выход / 1M токенов | $6 | $50 |
| 10M входных токенов | $20 | $100 |
| 10M выходных токенов | $60 | $500 |
| Наценка за региональный endpoint в США | +10% | Зависит от платформы |
При стандартных ставках без кэша цена входа у Grok 4.7 на 80% ниже, чем у Fable 5.1, а цена выхода — на 88% ниже. Однако цены на чтение из кэша у Anthropic могут существенно снизить эффективную стоимость Fable 5.1 в повторяющихся, агентных нагрузках.
Оговорка по ценам: $2/M входа и $6/M выхода для Grok 4.7 — базовые ставки. SpaceXAI документирует отдельные цены для повышенного контекста при запросах сверх 200K контекста. Ниже расчёты предполагают, что запросы остаются в базовом тарифном диапазоне, и исключают стоимость инструментов, региональные наценки и стоимость записи в кэш.
Пример нагрузки: 10M входных токенов + 2M выходных токенов.
- Grok 4.7: $20 за вход + $12 за выход = $32.
- Claude Fable 5.1: $100 за вход + $100 за выход = $200.
- Номинальный разрыв до учёта эффектов кэша: $168.
Лучший продакшен-метрик — стоимость за успешно завершённую задачу. Более дорогая модель может быть экономичной, если она снижает повторы, провалы или объём ручной правки. Более дешёвая модель может доминировать, когда обе проходят один и тот же критерий приёмки.
Контекст и регуляторы рассуждения
Fable 5.1 предоставляет контекстное окно 1M токенов против 500K токенов у Grok 4.7. Эта разница может быть критичной для очень больших репозиториев, наборов документов, юридического дискавери, научных исследований или агентов с большим объёмом истории.
Grok 4.7 раскрывает настройки рассуждения low, medium, high и xhigh. Fable 5.1 использует адаптивное мышление с контролем усилий. Эти ярлыки напрямую несопоставимы, поэтому честный тест должен фиксировать задачи и критерии приёмки, а не сопоставлять названия режимов.
Мультимодальность и инструменты
Обе модели принимают текст и изображения. API Grok 4.7 включает вызов функций, веб‑поиск, X‑поиск и выполнение кода. Claude Fable 5.1 оптимизирован для документов, таблиц, слайдов, исследований и долгих агентных рабочих процессов; поведение инструментов зависит от окружения Claude или вашего приложения.
| Возможность | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Текстовый вход | Да | Да |
| Вход изображений | Да | Да |
| Вызов функций/инструментов | Да | Да |
| Веб‑поиск | Нативный инструмент xAI | Зависит от окружения |
| X‑поиск | Нативный | Нет эквивалентной проприетарной интеграции X |
| Выполнение кода | Нативный инструмент xAI | Зависит от окружения |
| Документы/таблицы/слайды | Общий фокус на знаниевой работе | Явный продуктовый фокус |
Итог выбора
| Измерение | Grok 4.7 | Claude Fable 5.1 |
|---|---|---|
| Качество кодинга | Фронтир | Фронтир |
| CursorBench 4.0 | 46.3% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 70.0% |
| Terminal-Bench 4.0 | 38.0% | 57.9% |
| EEBench | 64.0% | 56.4% |
| Harvey Legal Agent | 19.6% | 6.7% |
| HealthBench Professional | 56.7% | 62.1% |
| Контекст | 500K | 1M |
| Цена входа | $2/M | $10/M |
| Цена выхода | $6/M | $50/M |
| Поиск | Веб + X | Зависит от окружения/инструментов |
| Длинные агенты | Сильная сторона | Ключевая сильная сторона |
| Соотношение цена/качество | Существенное преимущество | Премиальный уровень |
| Типичный фит | Масштабир. фронтирные нагрузки | Ценные задачи длительного горизонта |
Можно ли использовать Grok 4.7 и Claude Fable 5.1 через CometAPI?
Да. Grok 4.7 API в CometAPI и Claude Fable 5.1 API в CometAPI можно использовать в рамках стратегии маршрутизации между несколькими моделями. Это важно, потому что лучшая продакшен‑архитектура может не требовать выбора только одной фронтирной модели.
Практический паттерн маршрутизации:
- Маршрут по умолчанию: Grok 4.7 для чувствительных к цене фронтирных задач.
- Эскалация: Claude Fable 5.1, когда проваливается оценка, задача превышает требования к контексту или длительному агенту нужна более сильная работа в терминале.
Это позволяет командам сравнивать долю принятых результатов, общее число токенов, задержку, повторы и стоимость за принятый результат, а не полагаться на одну публичную таблицу лидеров.
Grok 4.7 vs Claude Fable 5.1: как выбрать
Выбирайте Grok 4.7 для чувствительных к цене и поисково‑нативных нагрузок
- Высоконагруженные ассистенты программиста, где стоимость токенов существенно влияет на юнит‑экономику.
- Инженерные или технические агенты, где доменные результаты Grok совпадают с нагрузкой.
- Исследования, которым полезны нативные веб‑ и X‑поиск.
- Пакетная обработка знаний и повторяющаяся фоновая автоматизация.
- Нагрузки, где обе модели проходят один и тот же порог приёмки и решающей становится цена.
Для разработчиков, использующих мульти‑модельный шлюз, Grok 4.7 API в CometAPI можно оценивать вместе с другими фронтирными моделями через один слой интеграции.
Выбирайте Claude Fable 5.1 для длительного горизонта и чувствительных к сбоям задач
- Многочасовые автономные сценарии программирования и терминал‑интенсивные рабочие процессы.
- Очень большие репозитории или наборы документов, выигрывающие от контекста 1M токенов.
- Сложные профессиональные агенты, которым нужно сохранять состояние через множество шагов.
- Высокоценные бизнес‑процессы, где стоимость повтора или ошибки перевешивает базовую стоимость инференса.
- Исследования и автоматизация, где бенчмарки агентной работы на длинном горизонте от Anthropic близки к продакшен‑потребностям.
Claude Fable 5.1 API в CometAPI использует ID модели claude-fable-5-1; цены и маршрутизацию следует проверять на момент развёртывания, так как тарифы шлюза могут меняться независимо от прайс‑листа Anthropic.
Заключение
Grok 4.7 — более сильная отправная точка, когда решают стоимость токенов, инструменты с веб/X‑интеграцией и масштабируемые агентные рабочие процессы. Claude Fable 5.1 — более сильный кандидат, когда контекст 1M токенов и требовательные длительные кодинговые или профессиональные задачи важнее базовой цены токенов. Результаты, опубликованные вендорами, смешанные, поэтому универсального победителя нет.
Перед выбором протестируйте обе модели на одних и тех же продакшен‑задачах, инструментах, бюджетах времени и критериях приёмки. Сравните стоимость за принятый результат, задержку, повторы, сбои инструментов и время ручной правки вместе с опубликованными баллами.
FAQ
Как командам корректно оценивать Grok 4.7 vs Claude Fable 5.1?
Начинайте с репрезентативных продакшен‑задач, а не с общей таблицы лидеров. Используйте одно и то же состояние репозитория, права на инструменты, бюджет времени и критерии приёмки для обеих моделей. Записывайте долю принятых результатов, сквозную задержку, входные и выходные токены, поведение кэша, сбои инструментов, повторы и время ручной правки. Проводите достаточно повторов, чтобы отделить поведение модели от дисперсии задачи.
Когда Grok 4.7 может стоить дороже, чем Claude Fable 5.1, за принятую задачу?
Низкая ставка за токены может стать дороже, если она ведёт к дополнительным повторам, более длинным промптам, неудачным вызовам инструментов или большему объёму ручной проверки. Обратно, премиальная модель не автоматически экономична: её более высокая доля завершений должна компенсировать увеличившуюся стоимость инференса. Сравнивайте стоимость за принятую задачу, а не только стоимость за токен.
Когда маршрутизатору стоит эскалировать с Grok 4.7 на Claude Fable 5.1?
Используйте измеримые триггеры. Чувствительный к цене маршрут по умолчанию может обрабатывать задачи, которые быстро проходят валидацию, в то время как эскалация включается, когда задача выходит за предпочтительный диапазон контекста, проваливает автоматическую оценку, требует длительной работы в терминале или несёт высокую цену ошибки. Логируйте триггер и результат, чтобы политика маршрутизации настраивалась на основе продакшен‑данных.
Какие оговорки по бенчмаркам Grok 4.7 vs Claude Fable 5.1 наиболее важны?
Важнейшие оговорки — версия бенчмарка, уровень «усилий» рассуждения, агентный ханс, доступ к инструментам, меры безопасности и то, являются ли результаты вендорскими или независимо воспроизведёнными. Например, CursorBench 3.2.0 и 4.0 не следует сравнивать как один тест. Публичные баллы полезны для формулирования гипотез, но решения о развёртывании следует принимать на основе контролируемых внутренних оценок.
