Кратко: Claude Opus 5, выпущенный Anthropic 24 июля 2026 года, обеспечивает скачкообразный рост по сравнению с Opus 4.8 в области глубинного рассуждения, агентного кодинга, долгосрочных задач и решения новых проблем. Он сравним с более дорогим Fable 5 или превосходит его на ключевых бенчмарках (включая 43.3% на Frontier-Bench v0.1 и рекордные 30.2% на ARC-AGI-3), при этом стоит столько же, сколько Opus 4.8 — $5 за миллион входных токенов и $25 за миллион выходных токенов. С контекстным окном на 1M токенов, режимом размышления по умолчанию, сильной самопроверкой и улучшенной выверкой (самый низкий показатель несоответствующего поведения среди недавних Claude), он превосходно справляется со сложным кодингом, компьютерным использованием, офисной работой знаний и мультиагентными процессами. Средний уровень effort часто дает максимальную эффективность.
Ключевые тезисы
- Opus 5 — действительно новое поколение по сравнению с Opus 4.8, а не инкрементальное обновление — особенно в агентной настойчивости, масштабировании вычислений на этапе выполнения и «текучем интеллекте» (рывок ARC-AGI-3 с ~1.5% до 30.2%) из блога Claude.
- Он превосходит или сравним с Fable 5 на основных кодинговых/агентных бенчмарках примерно за половину цены.
- Цены остаются прежними: $5/$25 за миллион токенов; эффективность растет за счет лучшего результата на токен и сильных результатов даже на среднем/низком effort.
- Профиль безопасности — лучший у Anthropic для линейки Opus, с намеренными ограничениями на наступательные кибервозможности и снижением количества срабатываний классификаторов.
- Изменения в подходе к промптам: удалите устаревшие инструкции по верификации, явно ограничивайте рамки, контролируйте многословие и использование сабагентов, и используйте параметр effort из документации Claude.
- Лучшие сценарии — для долго работающих агентов, многофайлового кодинга, работы знаний и задач с видением; в реальных отчетах отмечаются сильные стороны в демо/сложных сборках наряду с эпизодическим трением в следовании инструкциям на больших кодовых базах.
- Такие платформы, как CometAPI, упрощают маршрутизацию трафика между моделями Claude (и конкурентами) с единым биллингом и фallback-ами.
Claude Opus 5 — последний общедоступный флагман Anthropic в классе Opus. Расположен ниже более ограниченного класса Mythos/Fable в некоторых специализированных областях, но конкурентоспособен или превосходит на многих открытых оценках; он нацелен на сложный агентный кодинг, корпоративную работу знаний и долгосрочные задачи. Выпущенный всего через два месяца после Opus 4.8, он представляет собой качественный скачок, а не минорную итерацию.
Что такое Claude Opus 5?
Claude Opus 5 (ID модели для API: claude-opus-5) — новейшая модель класса Opus от Anthropic, оптимизированная для сложного агентного кодинга и корпоративных нагрузок. Имеет контекстное окно в 1 миллион токенов (по умолчанию и максимум), до 128k максимума выходных токенов и включенный по умолчанию режим размышления. Модель сама решает, когда и сколько «думать»; разработчики управляют глубиной через параметр effort (low, medium, high, xhigh, max).
Ключевые новые возможности и изменения поведения по сравнению с предыдущими поколениями:
- Более сильная агентная настойчивость — продолжает до успеха задачи, а не останавливается на правдоподобном ответе.
- Улучшенная самопроверка и поиск корневых причин багов.
- Лучшая координация нескольких агентов и делегирование сабагентам.
- Улучшенное восприятие графиков, документов, диаграмм и воспроизведения UI/Frontend (особенно при итеративном использовании инструментов).
- Расширенные офисные/документные задачи (сложные многолистовые таблицы, структурированные презентации).
- Изменение инструментов по ходу диалога (бета), сниженный минимум для кэша промпта (512 токенов) и режим фолбэков по умолчанию.
- Fast mode (исследовательская версия) в Claude API с более высокими тарифами.
Anthropic описывает её как дающую «фронтирный» уровень интеллекта по цене вдвое ниже Fable 5 и поддерживающую долго работающих агентов с улучшениями в кодинге и профессиональной работе.
Claude Opus 5 vs Opus 4.8
Opus 5 явно позиционируется как скачок по сравнению с Opus 4.8. Наибольшие улучшения наблюдаются в глубоком рассуждении через длинные цепочки проблем, агентном кодинге и долгогоризонтных циклах использования инструментов (завершение многофайловых фич и end-to-end работы без заглушек), масштабировании вычислений на этапе выполнения, эффективности на низких уровнях effort, точности ревью/поиска багов, в видении, согласованности на длинных контекстах, офисных задачах и координации нескольких агентов.
С точки зрения поведения, ответы и письменные результаты по умолчанию длиннее. Модель чаще озвучивает ход работы в агентных сессиях, охотнее делегирует сабагентам и проверяет свою работу без явного запроса. Устаревшие инструкции вроде «включить финальный шаг верификации» теперь приводят к чрезмерной проверке и перерасходу токенов — уберите их.
Режим размышления включен по умолчанию (на 4.8 адаптивный/thinking требовал явной настройки). Отключение thinking разрешено только на high или ниже; более высокие уровни effort отклоняют отключение thinking. Цены остаются прежними: $5 на вход / $25 на выход за миллион токенов.
Итого: мигрирующим командам стоит обновить ID модели, переоценить значения effort на своих внутренних оценках, убрать «верификационные леса» из промптов и ожидать более длинные, но более качественные ответы с большей автономностью.
Результаты на бенчмарках: что говорят данные?
Opus 5 показывает выдающиеся результаты, особенно на новых и агентных оценках. Все цифры ниже взяты из системной карты/материалов релиза Anthropic и независимых агрегаторов на конец июля 2026 года; учтите, что лабораторные показатели используют провайдерские хранилища и промптинг.
Заголовочные результаты по кодингу и агентности
- Frontier-Bench v0.1 (агентный терминальный кодинг): Opus 5 43.3% vs Fable 5 33.7% vs Opus 4.8 18.7%.
- SWE-bench Verified: 96.0% (vs Fable 5 95.0%, Opus 4.8 88.6%).
- SWE-bench Pro: 79.2% (vs Fable 5 80.3%, Opus 4.8 69.2%).
- DeepSWE v1.1: 68.8% (конкурентно; некоторые варианты GPT-5.6 выше).
- FrontierCode 1.1 (пик на среднем effort): ~53.4% основной / 63.6% расширенный — наиболее вычислительно эффективная конфигурация в одном анализе.
- CursorBench 3.2 (максимальный effort): в пределах ~0.5% от пикового результата Fable 5 примерно за половину стоимости на задачу. Сильная производительность на доллар на высоких/xhigh/max effort.
Новое рассуждение и «текучий» интеллект
- ARC-AGI-3: 30.2% (предыдущий фронтир ~7.8% для GPT-5.6 Sol на высоком effort; Opus 4.8 ~1.5%). Это крупнейший зафиксированный скачок; модель продемонстрировала внутреннее алгебраическое моделирование динамики игр и человеческий уровень эффективности по числу примеров на ранее нерешенных средах. Примерно 3× к следующей лучшей модели — сильное решение новых задач.
- GDPval-AA v2: state-of-the-art в профессиональной работе знаний.
- Zapier AutomationBench: ~1.5× к следующей лучшей модели с высокими показателями успешности end-to-end автоматизации бизнеса.
- OSWorld 2.0 (использование компьютера): превосходит лучший заявленный результат Fable 5 примерно за треть стоимости.
- Лидирующие или близкие к лучшим результаты на HLE (Humanity’s Last Exam) и задачах глубоких исследований в стиле DeepSearchQA.
Использование компьютера, работа знаний и использование инструментов
- OSWorld 2.0: 70.6% — превосходит сверстников при заданных ценовых уровнях.
- BrowseComp: ~90–90.8% (конкурентно или немного позади топовых конфигураций GPT-5.6).
- GDPval-AA v2 (Elo): 1861 (опережает Fable 5 и предыдущие поколения).
- AutomationBench: высокие показатели прохождения; сообщается ~1.5× к следующей лучшей при сопоставимой стоимости в некоторых анализах.
Opus 5 дает не инкрементальные, а качественные приросты, особенно на кодинговых, агентных и «работа знаний» оценках. Anthropic и независимые отчеты отмечают:
Наука и специализированные области
Заметные улучшения по сравнению с Opus 4.8 на оценках по бионаукам, включая:
- Органическая химия (определение молекулярной структуры по спектроскопии): +10.2 п.п.
- Предсказание функций белка: +7.7 п.п.
- Стабильные улучшения в структурной биологии и биоинформатике.
Поскольку у Fable 5 более строгие биозащиты, Opus 5 сейчас является самой сильной общедоступной моделью Anthropic для многих научно-исследовательских рабочих процессов.

Источник: claude
Совокупные публичные рейтинги помещают Opus 5 близко к вершине (например, ~82.8/100 и место №2 из 215 в BenchLM), с особенно высокими процентилями в знаниях, агентности, кодинге и мультимодальности.
Отзывы разработчиков из практики смешанные: впечатляющие one-shot сборки игр, завершение сложных фич и самодебаггинг соседствуют с сообщениями об эпизодическом игнорировании инструкций, галлюцинациях на больших кодовых базах или чрезмерном усложнении. Бенчмарки фиксируют пиковые возможности в контролируемых условиях; в продакшне результат сильно зависит от промптинга, дизайна инструментов и настроек effort.
Снимок бенчмарков

Источник: claude
Эффективность и стоимость
Цены неизменны по сравнению с Opus 4.8: $5 за миллион входных токенов / $25 за миллион выходных токенов. Закэшированный ввод значительно дешевле (~$0.50). Fast mode работает примерно по 2× тарифам ($10/$50). Это примерно половина тарифов Fable 5 — $10/$50. Улучшения эффективности достигаются за счет:
- Контекста в 1M, позволяющего работать с целыми кодовыми базами или длинными документами без агрессивного чанкования.
- Сильной производительности даже на low/medium effort (меньше токенов для сопоставимого качества во многих задачах).
- Встроенной самопроверки и итерации, снижающих долю неудачных прогонов и ручных правок.
- Изменения инструментов по ходу диалога (бета), сохраняющего кэш промпта.
Главная история эффективности — результат на доллар и на токен. Opus 5 надежнее конвертирует дополнительный effort в лучшие результаты, чем ранние модели Opus. Средний effort часто дает пиковые или близкие к пиковым показатели на кодинговых бенчмарках при ~1.5× расходе токенов по сравнению с low, тогда как high/xhigh/max могут показывать убывающую или плоскую отдачу на некоторых наборах.
На графиках стоимость-против-производительности, опубликованных вокруг запуска, Opus 5 выглядит выигрышно по сравнению с Fable 5, Opus 4.8 и конкурирующими фронтирными моделями — более высокие баллы при более низкой эффективной стоимости на завершенную задачу. Потребление токенов на ревью или агентный цикл может быть выше в абсолютных величинах из-за более длинных рассуждений и самопроверки, но качество и доля завершений растут настолько, что итоговая стоимость успешного исхода часто снижается.

Источник: claude
Практическая рекомендация для продакшн-команд: начните с effort по умолчанию high, затем прогоните low/medium на внутренних тестах. Агрессивно используйте кэш промптов (теперь работает и на меньших длинах), изменения инструментов в ходе диалога для сохранения кэша, а также фолбэки на уровне платформы. Унифицированные API-шлюзы, такие как CometAPI, дополнительно оптимизируют, направляя простые задачи в более дешевые модели (уровни Sonnet/Haiku), а Opus 5 оставляя для сложной агентной работы, с централизованной аналитикой использования и контролем затрат.
Безопасность и выверка
Anthropic описывает Claude Opus 5 как «самую выверенную модель на сегодня» и «самую безопасную модель» в нескольких отчетах. Ключевые пункты из системной карты и анонсов:
- Очень низкий общий риск несоответствия; нет новых настораживающих свойств относительно прошлых моделей.
- Самые низкие показатели обманчивого поведения, измеренные Anthropic.
- Высокая доля безвредных ответов на вредоносные запросы при одних из самых низких показателей избыточных отказов на безобидные запросы.
- Улучшенная устойчивость к определенным векторам злоупотреблений; кибер-защиты откалиброваны ближе к уровню Fable 5 с учетом возросших возможностей, но классификаторы срабатывают реже (~85% меньше, чем у Fable 5 по некоторым оценкам).
- Не пересекает порогов политики Anthropic Responsible Scaling Policy для автоматизированного замещения ИИ в НИОКР или более высоких химических/биологических рисков (обрабатывается аналогично недавним моделям Opus с защитами уровня ASL-3, где применимо).
По-прежнему наблюдается повышенная «осведомленность об оценке» в тестах (распространено среди фронтирных моделей). Мониторинг реальных внедрений показал очень низкие уровни тревожного поведения. Как и для всех фронтирных моделей, организациям следует применять защитные меры на уровне приложения, особенно для высокорисковых или автономных агентов.
Как промптить Claude Opus 5 для лучших результатов
Anthropic опубликовал модельно-специфичные рекомендации по промптингу, поскольку Opus 5 ведет себя иначе, чем более ранние модели Opus. Главные изменения: он сам проверяет себя, завершает задачи целиком, может расширять рамки и генерирует более длинные ответы по умолчанию.
Основные принципы для Opus 5
- Дайте полную задачу сразу — Предоставьте полную спецификацию, контекст, ограничения и желаемый результат одним промптом. Он работает лучше, когда его «отпускают», а не кормят по шагам. Завершает end-to-end фичи вместо того, чтобы оставлять заглушки.
- Удалите инструкции по верификации — Явные «проверь дважды», «верифицируй работу» или «используй сабагента для проверки» вызывают сверхверификацию и перерасход токенов. Opus 5 уже проверяет и итеративно дорабатывает внутренне. Уберите эти строки из системных промптов и CLAUDE.md.
- Явно ограничивайте рамки — Он может расширять задачи по собственному суждению. Добавьте четкие границы: «Доставляй ровно запрошенное в заданном объеме. Принимай рутинные решения сам. Запрашивай подтверждение только когда разные трактовки ведут к существенно разной работе. Если запрос кажется ошибочным, кратко отметь это и продолжай как просили».
- Управляйте многословием — Ответы по умолчанию длиннее. Для лаконичности добавьте: «Держи ответ фокусированным, кратким и емким. Приоритизируй суть; оговорки — коротко».
- Разумно используйте effort — Начинайте с high (по умолчанию). Смело используйте low/medium для классификации, простых правок или массовой работы при сохранении качества. Оставляйте xhigh/max для самых сложных кодинговых и агентных задач. Переоцените унаследованные настройки effort от Opus 4.8.
- Контроль сабагентов — Он охотнее делегирует. Инструктируйте: «Делегируй сабагенту только крупные, действительно независимые и параллелизуемые задачи. Не используй сабагентов для проверки или работы, которую можно закончить за несколько вызовов инструментов».
- Ревью и аудиты — Просите полный отчет с метками уверенности/серьезности, затем фильтруйте сами. «Сообщай только о проблемах высокой серьезности» будет понял буквально и может пропустить другие.
Пример каркаса промпта для кодинга с высоким effort
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Пример классификации с низким effort
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
Для миграции с Opus 4.8: перетестируйте промпты, удалите верификационные конструкции, добавьте явные ограничения по длине/объему и прогоните уровни effort на внутренних оценках. Anthropic отмечает, что многие старые подробные инструкции теперь можно упростить.
Сравнительная таблица: Claude Opus 5 vs ключевые альтернативы (примерно, июль 2026)
| Модель | Вход/Выход ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Контекст | Примечания |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43.3% | 96.0% | 30.2% | 1M | Лучшая цена/качество для ежедневного high-capability |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88.6% | Низкий | 1M | Предыдущий Opus |
| Claude Fable 5 | $10 / $50 | ~33.7% | ~95% | Ниже | 1M | Более высокий класс, больше ограничений в ряде кейсов |
| GPT-5.6 Sol (approx.) | Конкурентные | Ниже | Высокий | Ниже | Разн. | Сильная альтернатива |
| Claude Sonnet 5 | Ниже (~$3/$15 или промо) | Ниже | Сильный | Ниже | 1M | Более быстрый/дешевый «драйвер на каждый день» |
Числа взяты из анонсов Anthropic и агрегаторов; всегда проверяйте актуальные независимые оценки.
Рекомендация CometAPI: CometAPI предоставляет унифицированный доступ к Claude Opus 5 (и 500+ другим моделям) через совместимый с OpenAI эндпоинт (https://api.cometapi.com/v1) и поддержку Anthropic Messages API. Заявленное ценообразование конкурентно (например, около $4/$20 за MTok для Opus 5 на момент написания), с одним API-ключом, упрощенным биллингом и легкой сменой моделей. Это особенно полезно для команд, которым нужны возможности Claude без управления несколькими аккаунтами провайдеров или раздельными лимитами. Проверяйте текущие списки моделей и цены CometAPI на актуальные ставки и промо с бесплатными токенами.
Заключение
Claude Opus 5 задает новую планку для линейки Opus: фронтирный уровень агентности и рассуждений по цене предыдущего поколения, с существенными улучшениями в самоориентированном решении задач (особенно результат ARC-AGI-3) и наиболее благоприятными показателями выверки, которые Anthropic публиковал для этого класса. Это не идеал — регрессии в отдельных доменах и сообщения о проблемах с следованием инструкциям в реальной работе напоминают, что бенчмарки — не вся картинка — но для кодинговых агентов, долгосрочных процессов, работы знаний и приложений для использования компьютера это одна из сильнейших общедоступных опций сегодня.
Сочетайте дисциплинированный промптинг с регулятором effort, используйте контекст в 1M токенов и грамотно маршрутизируйте трафик (через официальные API или платформы вроде CometAPI), чтобы максимизировать ценность. Как и для любой фронтирной модели, непрерывная оценка на ваших данных остается критичной. Учитывая быстрый темп итераций Anthropic, дальнейшие улучшения не за горами; уже сейчас Opus 5 дает значительный, экономичный скачок возможностей, достойный внедрения.
Источники и дополнительные материалы:
- Anthropic: Что нового в Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Промптинг Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Анонсы и системная карта Anthropic (июль 2026)
- DataCamp: Claude Opus 5 Explained — https://www.datacamp.com/blog/claude-opus-5
- Обзоры бенчмарков MindStudio / Vellum / BenchLM (июль 2026)
- Подтвержденные результаты ARC Prize Foundation
