Anthropic представила Claude Opus 5 — новую флагманскую ИИ-модель

Cipher · 2026-07-24
1 +0 -0 comments7 views

Anthropic анонсировала Claude Opus 5 — новую флагманскую языковую модель, которая пришла на смену Opus 4.8, выпущенной всего два месяца назад. По словам компании, модель стала дешевле, менее ограниченной с точки зрения безопасности и в ряде задач превосходит недавно вышедшую Fable 5.

Согласно опубликованным бенчмаркам, Opus 5 демонстрирует лучшие результаты сразу в нескольких категориях:

  • Agentic terminal coding (Frontier-Bench v0.1) — 43,3% против 33,7% у Fable 5.
  • Knowledge work (GDPval-AA v2) — 1861 балл против 1747.
  • ARC-AGI-3 — 30,2% против 7,8% у GPT-5.6 Sol и 1,5% у Opus 4.8.
  • Agentic search (BrowseComp) — 90,8%, немного выше Fable 5 (87,4%) и GPT-5.6 Sol (90,4%).
  • Computer use (OSWorld 2.0) — 70,6%, лучший результат среди представленных моделей.
  • Business workflows (AutomationBench) — 26,0%, что заметно выше ближайших конкурентов.

При этом в отдельных дисциплинах лидерство осталось за другими моделями. Например, Fable 5 немного опережает Opus 5 в Humanity's Last Exam, FrontierCode v1.1 и юридическом бенчмарке Legal Agent Benchmark, а GPT-5.6 Sol показывает лучший результат в DeepSWE v1.1 с показателем 72,7% против 68,8% у Opus 5.

Anthropic утверждает, что Opus 5 значительно лучше справляется с проверкой собственных ответов и способен дольше и тщательнее дорабатывать решение до успешного результата. В качестве примера компания приводит случай, когда модель самостоятельно создала конвейер компьютерного зрения, несмотря на неполное описание задачи.

Одним из ключевых изменений стало смягчение ограничений безопасности. В отличие от Fable 5, новая модель не подпадает под политику 30-дневного хранения данных, которая распространяется на Fable и Mythos. Это может быть важно для пользователей, уделяющих особое внимание конфиденциальности.

При этом ограничения полностью не исчезли. Например, Claude Opus 5 по-прежнему не позволит использовать себя для поиска уязвимостей в готовых бинарных файлах, однако способен анализировать исходный код на наличие потенциальных проблем безопасности, поскольку такой сценарий считается преимущественно защитным.

По оценке Anthropic, защитные классификаторы будут срабатывать для Opus 5 примерно на 85% реже, чем для Fable 5, что должно сократить количество необоснованных отказов.

Кроме того, компания запустила экспериментальную функцию Automatic Fallbacks. Если запрос пользователя блокируется системой безопасности, API сможет автоматически перенаправить его на менее мощную модель, вместо того чтобы возвращать ошибку. Это позволит получать ответ даже в случаях, когда флагманская модель не может обработать запрос.