TLDR Claude Fable 5.1 — это прежде всего апгрейд агентного исполнения. Наибольшие заявленные приросты наблюдаются в научных исследованиях, бизнес-автоматизации, терминальном кодинге и других процессах, требующих планирования, использования инструментов, верификации и восстановления на многих шагах. Улучшения меньше на задачах с закрытым ответом и коротких IDE-подобных задачах кодинга, поэтому оптимальный выбор для внедрения зависит от рабочего профиля, а не от одного итогового балла.
Ключевые выводы
- Fable 5.1 набирает 52.6% на Terminal-Bench-Science 0.1 — более чем вдвое больше, чем 24.7% у Fable 5 в оценке Anthropic.
- AutomationBench растёт с 17.1% до 31.4%, что показывает крупное улучшение сквозных бизнес-процессов.
- Приросты более скромны на CursorBench и инструментальной версии Humanity's Last Exam, что говорит о том, что релиз улучшает устойчивое исполнение, а не равномерно все формы рассуждения.
- Fable 5.1 сохраняет стандартные цены за токены как у Fable 5, а более низкая цена чтения кэша может снизить эффективную стоимость контекстно-насыщенных агентных рабочих нагрузок.
- GPT-6 Astra — более актуальное сравнение с OpenAI, но он не включён в сентябрьскую таблицу бенчмарков Anthropic. Любое прямое сравнение производительности требует контролируемой оценки в одном и том же стенде.
Anthropic выпустила Claude Fable 5.1 1 сентября 2026 года для требовательного рассуждения, длинных агентных сценариев, разработки ПО, исследований и профессиональной интеллектуальной работы. Claude Fable 5.1 также доступен через CometAPI для разработчиков, которые хотят оценить его наряду с другими передовыми моделями через единый эндпоинт.
Итоговые результаты сильные, но распределение улучшений информативнее среднего значения. Fable 5.1 выигрывает больше всего, когда агент должен удерживать цель, взаимодействовать с инструментами, восстанавливаться после ошибок и проверять финальное состояние. Эта статья фокусируется на том, что означают результаты бенчмарков, где модель всё ещё уступает и как оценивать её на фоне более новых альтернатив.
Claude Fable 5.1 вкратце
Документация модели Anthropic указывает окно контекста в 1 миллион токенов, максимум вывода 128K, ввод текста и изображений, постоянно включённое адаптивное мышление и порог знаний июнь 2026. Идентификатор модели в Claude API — claude-fable-5-1.
| Официальные характеристики | Claude Fable 5.1 |
|---|---|
| Провайдер | Anthropic |
| Дата релиза | 1 сентября 2026 |
| Идентификатор модели | claude-fable-5-1 |
| Окно контекста | 1,000,000 tokens |
| Максимальная длина вывода | 128,000 tokens |
| Ввод / вывод | Text and images → text |
| Режим мышления | Adaptive, always on |
| Усилие по умолчанию | High |
| Порог знаний | June 2026 |
| Цена ввода Anthropic | $10 / MTok |
| Цена вывода Anthropic | $50 / MTok |
| Чтение из кэша | $0.25 / MTok |
| Сравнительная задержка | Slower |
| Основное позиционирование | Demanding reasoning and long-horizon agentic work |
Стандартные цены ввода и вывода остаются такими же, как у Fable 5, тогда как стоимость чтения кэша снизилась до $0.25 за миллион токенов. У Fable 5.1 нет более низких заголовочных цен за токены ввода/вывода. Его более низкая эффективная стоимость исходит главным образом из 75% снижения цены чтения кэша. Anthropic оценивает около 25% снижения стоимости для типичных нагрузок и до примерно 45% для высокоагентных нагрузок.
Это важно, потому что долго работающий агент многократно переиспользует контекст репозитория, инструкции, определения инструментов и предыдущее состояние. Стоимость за завершённую задачу может улучшиться, даже когда заголовочные цены ввода и вывода не меняются.
Anthropic также сообщает 60.9% для Claude Mythos 5.1 на Terminal-Bench 4.0. Mythos 5.1 — отдельно развёрнутая версия с другими гарантиями безопасности и её не следует считать общедоступным результатом Fable 5.1.
Что показывают бенчмарки Claude Fable 5.1?
Следующие значения взяты из оценки Anthropic за сентябрь 2026. Они описывают конфигурацию модель+стенд, а не неизменяемое свойство модели.
| Бенчмарк | Что измеряет | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Агентные научные исследования | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Агентное терминальное кодирование | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Профессиональная работа с знаниями, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Долгосрочное использование компьютера | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | Полное завершение компьютерных задач | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | Экспертное междисциплинарное рассуждение | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | Экспертное рассуждение с инструментами | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | Сквозные бизнес-процессы | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Агентное кодирование в IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 опережает Fable 5 и Opus 5 по всем девяти представленным строкам. Наибольшие поколенческие приросты наблюдаются в научных исследованиях, автоматизации бизнес-процессов и терминальном кодинге. Меньшие различия на Humanity's Last Exam и CursorBench не менее важны, поскольку показывают, что улучшение не равномерно для каждой рабочей нагрузки.
Где Claude Fable 5.1 улучшился больше всего?
Terminal-Bench-Science 0.1: выдающийся результат
Fable 5.1 набирает 52.6%, по сравнению с 24.7% у Claude Fable 5, 29.0% у Claude Opus 5 и 22.4% у GPT-5.6 Sol в запуске Anthropic. Большой 27.9-пунктовый поколенческий разрыв значительно больше, чем заявленная стандартная ошибка на модель, тогда как меньшие разрывы — например, 3.5 пункта между Fable 5.1 и Opus 5 на Terminal-Bench 4.0 — следует трактовать осторожнее.
Terminal-Bench-Science оценивает полные исследовательские рабочие процессы в научных и инженерных областях. Агентам нужно производить код, анализы, доказательства, симуляции или данные, а не просто отвечать на изолированные вопросы. Anthropic сообщает стандартную ошибку около ±3.5–4.5 пункта на модель, поэтому небольшие разрывы не следует автоматически считать значимыми различиями в возможностях.
Terminal-Bench 4.0: более сильный автономный кодинг
Fable 5.1 достигает 55.8%, опережая Fable 5 с 42.0%, Opus 5 с 52.3% и GPT-5.6 Sol с 37.3%. Прирост на 13.8 пункта относительно Fable 5 существенный, тогда как преимущество на 3.5 пункта над Opus 5 сравнительно узкое.
Бенчмарк помещает агентов в среду исполнения, поэтому успех зависит от навигации по среде, изменения кода и валидации результатов. Поскольку Terminal-Bench 4.0 использует иной набор задач по сравнению с более ранними версиями, оценки следует сравнивать только внутри одной и той же версии бенчмарка.
AutomationBench: большой рост с значительным запасом для улучшения
AutomationBench повышается с 17.1% на Fable 5 до 31.4% на Fable 5.1. Это абсолютный прирост на 14.3 пункта, или примерно 84% относительного роста.
Бенчмарк оценивает рабочие процессы в продажах, маркетинге, операциях, поддержке, финансах и HR, проверяя финальное состояние среды. Это делает его полезным тестом того, действительно ли агент завершил рабочий процесс, а не просто предложил правильные действия. Оценка также показывает оставшееся ограничение: примерно две трети задач всё ещё не были завершены при заявленной конфигурации Anthropic.
CursorBench 3.2.0: меньший прирост в кодинге
Fable 5.1 достигает 73.4%, против 70.5% у Fable 5, 70.0% у Opus 5 и 67.2% у GPT-5.6 Sol. Прирост относительно Fable 5 составляет всего 2.9 пункта.
Таким образом, релиз выглядит менее преобразующим на коротких задачах кодинга в стиле IDE, чем на более длинных процессах, включающих планирование, исполнение, проверку и восстановление. Наборы оценок должны включать изменения масштаба репозитория и восстановление после падающих тестов, а не только качество генерации кода.
OSWorld 2.0: использование компьютера остаётся сложным
Fable 5.1 набирает 77.9% с частичным зачётом и 41.7% при строгом завершении. Opus 5 достигает 75.4% и 39.6%, а Fable 5 — 72.9% и 36.1%.
Строгая оценка — более показательный сигнал для продакшена. Менее половины задач были полностью завершены, что демонстрирует: прогресс в использовании компьютера не отменяет необходимости в контрольных точках, разрешениях, мониторинге и логике восстановления.
CursorBench и Humanity's Last Exam: меньшие приросты
Fable 5.1 достигает 73.4% на CursorBench 3.2.0, лишь на 2.9 пункта выше Fable 5. На Humanity's Last Exam прирост составляет 3.1 пункта без инструментов и 1.2 пункта с инструментами.
Эти более узкие разрывы поддерживают центральную интерпретацию: Fable 5.1 более преобразующ на длинных рабочих процессах, включающих планирование, исполнение, проверку и восстановление, чем на коротких задачах в IDE или закрытом академическом рассуждении.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Короткий ответ: Fable 5.1 — самый сильный вариант в опубликованной Anthropic таблице бенчмарков для длинного горизонта; Opus 5 — более экономичная отправная точка, когда его меньший разрыв приемлем; Fable 5 остаётся легаси-базой; GPT-6 Astra требует теста в одном и том же стенде перед любыми прямыми рейтингами.
Fable 5.1 — очевидный поколенческий апгрейд относительно Fable 5 на заявленных Anthropic бенчмарках длинного горизонта для агентов. GPT-6 Astra — более свежее сравнение от OpenAI, но он был выпущен после сентябрьской оценки Anthropic и не включён в тот же стенд бенчмарков.
| Измерение | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Окно контекста | 1M tokens | 1M tokens | 1.05M tokens |
| Максимальная длина вывода | 128K | 128K | 128K |
| Стандартный ввод / вывод | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Чтение из кэша | $0.25 / MTok | $1 / MTok | Verify current provider terms |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Not included in Anthropic’s launch table |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Not included in Anthropic’s launch table |
| AutomationBench | 31.4% | 17.1% | Not included in Anthropic’s launch table |
| Основное позиционирование | Demanding reasoning and long-horizon agents | Previous Fable-class baseline | Difficult end-to-end professional work |
По сравнению с Fable 5, Fable 5.1 показывает наибольшие измеренные приросты в научных исследованиях, бизнес-автоматизации и терминальном кодинге, сохраняя те же стандартные цены за токены. Более низкая цена чтения кэша дополнительно улучшает экономику агентов с повторяющимся контекстом.
Правило выбора: Начинайте с Opus 5, когда приоритет — стоимость; повышайте до Fable 5.1, когда особенно важны завершение длинных задач и восстановление; сохраняйте Fable 5 только для нагрузок, чувствительных к совместимости; оценивайте GPT-6 Astra в контролируемом одинаковом стенде до продакшн-внедрения.
Как выглядит производительность по типам нагрузок?
| Возможность | Итог Fable 5.1 | Изменение vs Fable 5 | Интерпретация |
|---|---|---|---|
| Агентные научные исследования | 52.6% | +27.9 pts | Очень большой прирост |
| Автоматизация бизнес-процессов | 31.4% | +14.3 pts | Очень большой прирост |
| Терминальный кодинг | 55.8% | +13.8 pts | Большой прирост |
| Использование ПК, strict | 41.7% | +5.6 pts | Умеренный прирост |
| Использование ПК, partial | 77.9% | +5.0 pts | Умеренный прирост |
| Экспертное рассуждение, без инструментов | 60.9% | +3.1 pts | Небольшой прирост |
| Агентное кодирование в IDE | 73.4% | +2.9 pts | Небольшой прирост |
| Экспертное рассуждение, инструменты | 65.0% | +1.2 pts | Небольшой прирост |
| Профессиональная работа с знаниями | 1853 Elo | +130 Elo | Сильно, чувствительно к конфигурации |
Картина последовательна: наибольшие улучшения появляются там, где успех зависит от устойчивости, планирования, взаимодействия со средой, использования инструментов и восстановления во времени.
Чего бенчмарки не рассказывают?
Таблицы бенчмарков сжимают поведение в единые числа. Они не доказывают, что автономные агенты решены, и не предсказывают каждую продакшн-нагрузку.
- Основная таблица сравнения выполнена вендором.
- Настройки усилия влияют на качество, задержку и стоимость.
- Агентные бенчмарки измеряют комбинацию модели, стенда, инструментов и разрешений.
- В продакшн-режиме были включены меры безопасности для Fable 5.1, и они влияли на некоторые результаты.
- Версии бенчмарков меняются, поэтому значения из разных выпусков задач могут быть несопоставимы.
- AutomationBench остаётся на 31.4%, а строгая оценка OSWorld — на 41.7%; существенные доли неуспехов сохраняются.
Практическая оценка должна использовать публичные баллы для составления шорт-листа, воспроизводить небольшое сравнение с идентичными настройками, а затем тестировать реальный продакшн-процесс.
Является ли Claude Fable 5.1 лучшей моделью Claude?
Для максимальных возможностей на сложной долгой работе — бенчмарки дают сильные основания в пользу Claude Fable 5.1. Для каждой нагрузки — нет.
Anthropic оценивает её в $10 за миллион токенов ввода и $50 за миллион токенов вывода, против $5 и $25 для Opus 5. Премия оправдана только тогда, когда Fable 5.1 даёт более высокую долю успеха, меньше повторных попыток, меньше токенов на принятый таск или достаточное сокращение времени человеческой проверки.
Более низкая цена чтения кэша может сузить эффективный разрыв стоимости для агентов. Поэтому стоимость за принятый результат полезнее, чем цена за токен сама по себе.
Как бенчмаркать Claude Fable 5.1?
Ваша оценка должна походить на предполагаемую продакшн-нагрузку.
- Кодинг: тестируйте полные задачи и фиксируйте принятие патчей, пройденные тесты, ретраи, вызовы инструментов, прошедшее время и объём ручных правок.
- Исследования: оценивайте качество источников, фактическую точность, покрытие доказательств, завершение подзадач и удержание цели на длинных прогонах.
- Бизнес-агенты: оценивайте финальное состояние среды вместо подсчёта поотдельности правильных действий.
- Использование компьютера: измеряйте восстановление после поп-апов, медленных страниц, прерванных сессий и неконсистентного состояния приложений.
- Сравнение моделей: держите подсказки, стенды, инструменты, разрешения, настройки усилия и правила оценивания постоянными.
- Экономика: измеряйте стоимость за принятый таск, а не только стоимость за токен.
Вывод
Бенчмарки показывают, что Fable 5.1 наиболее ценен, когда задача требует устойчивого исполнения, а не одного ответа. Самые сильные кейсы включают научные исследования, автономный кодинг, сложную бизнес-автоматизацию и процессы с повторной проверкой и восстановлением.
Данные не подтверждают универсальное превосходство. Меньшие разрывы на нескольких бенчмарках, значимые доли неуспехов на строгих задачах компьютерного использования и отсутствие GPT-6 Astra в таблице запуска Anthropic усиливают необходимость тестирования, специфичного для нагрузки.
Для пользователей CometAPI практическое правило внедрения — тестировать Fable 5.1 там, где успех на длинном горизонте оправдывает премиальный инференс, затем сравнить его с Opus 5, GPT-5.6 Sol и GPT-6 Astra на тех же репрезентативных задачах перед выбором продакшн-маршрута.
FAQs
Какой самый высокий бенчмарк-результат у Claude Fable 5.1?
Среди заявленных Anthropic процентных метрик Fable 5.1 достигает 77.9% частичного зачёта на OSWorld 2.0 и 73.4% на CursorBench 3.2.0. Его крупнейшее поколенческое улучшение — Terminal-Bench-Science: 52.6% против 24.7% у Fable 5.
Насколько Claude Fable 5.1 лучше Fable 5?
Прирост резко зависит от нагрузки: 27.9 пункта на Terminal-Bench-Science, 14.3 на AutomationBench и 13.8 на Terminal-Bench 4.0, но лишь 2.9 на CursorBench и 1.2 на инструментальной версии Humanity’s Last Exam.
Лучше ли Claude Fable 5.1, чем Claude Opus 5?
Он набирает выше по опубликованной таблице Anthropic, но многие разрывы невелики. Anthropic рекомендует начинать с Opus 5 и переходить, когда требуется дополнительная долгосрочная агентная способность.
Побеждает ли Claude Fable 5.1 GPT-5.6 Sol?
Anthropic сообщает более высокие оценки Fable 5.1 на пяти общих метриках. Поскольку это выполненные вендором сравнения конкурентов и конфигурации различаются, безопасный вывод — Fable 5.1 очень конкурентоспособен, а не универсально превосходит.
Проверены ли результаты независимо?
Лишь частично. У нескольких бенчмарков есть публичные лидерборды, но усилие, стенд, поведение фолбэков и версии задач должны быть выровнены, прежде чем их значения можно будет напрямую сравнить с запуском Anthropic.
Для чего лучше всего подходит Claude Fable 5.1?
Его профиль бенчмарков наиболее сильный для длинных научных исследований, автономного кодинга, сложных агентных рабочих процессов, бизнес-автоматизации и задач, требующих планирования, инструментов, проверки и восстановления.
Как получить доступ к Claude Fable 5.1?
Claude Fable 5.1 включён в CometAPI с идентификатором модели claude-fable-5-1. Единый эндпоинт делает практичным запуск той же оценочной нагрузки на нескольких моделях перед выбором продакшн-маршрута.
