Claude Opus 5 включает рассуждения по умолчанию: наследник Claude 3 Opus ломает старые интеграции
Anthropic 6 июня выпустила Claude Opus 5, заменив Claude Opus 4.8 на позиции флагмана линейки, и впервые включила режим рассуждений по умолчанию, что ломает работающие интеграции, если не обновить настройки.

Claude Opus 5 стоит столько же, сколько предшественник, но по умолчанию тратит токены на внутреннее «размышление». Кто не пересмотрит промпты и лимиты, получит либо неожиданные ошибки API, либо счёт за контекст, который раньше не расходовался.
Anthropic позиционирует новую модель как приближающуюся по интеллекту к Claude Fable 5 при вдвое меньшей цене. Claude Opus 5 стал моделью по умолчанию на тарифе Claude Max и сильнейшей моделью на Claude Pro. Ниже разберём, что именно изменилось на уровне API и бенчмарков и почему разработчикам в России стоит пересмотреть свои интеграции прямо сейчас.
| Показатель | Значение | Источник |
|---|---|---|
| Цена за 1 млн входных токенов | 5 долларов | Anthropic |
| Цена за 1 млн выходных токенов | 25 долларов | Anthropic |
| Контекстное окно | 1 млн токенов (по умолчанию и максимум) | Anthropic |
| Максимальный выход (синхронный API) | 128 000 токенов | Anthropic |
| Максимальный выход (Batches API) | 300 000 токенов | Anthropic |
| Минимальный кешируемый промпт | 512 токенов (было 1 024) | Anthropic |
| FrontierBench v0.1 (max effort) | 43,3% (Opus 4.8: 18,7%) | Anthropic |
| SWE-bench Verified | 96,0% | Anthropic |
| OSWorld 2.0 | 70,57% (Opus 4.8: 55,7%) | Anthropic |
| ARC-AGI-3 (high effort) | 30,16% (Opus 4.8: 1,52%) | ARC Prize Foundation |
| IMO 2026 (6 задач, без инструментов) | 42/42 баллов | Anthropic |
| Prompt injection (Gray Swan, 15 попыток) | 2,0% успеха атак (Opus 4.8: 5,5%) | Gray Swan |
Что измеряли?
Anthropic и независимые лаборатории проверяли Claude Opus 5 на нескольких группах задач.
- Кодирование. SWE-bench Verified и SWE-bench Pro оценивают, насколько модель способна самостоятельно исправлять реальные баги в открытых репозиториях. SWE-bench Multimodal добавляет к этому работу с изображениями.
- Агентные задачи. OSWorld 2.0 проверяет, как ИИ-агент (программа, которая сама выполняет цепочку действий на компьютере) справляется с рабочими сценариями. Zapier AutomationBench измеряет автоматизацию бизнес-процессов.
- Рассуждения. ARC-AGI-3 тестирует способность модели решать абстрактные головоломки, которые до сих пор были трудны для всех систем. Задачи IMO 2026 проверяют математику олимпиадного уровня.
- Безопасность. Gray Swan измеряет устойчивость к непрямым инъекциям в промпт (когда злоумышленник прячет команду внутри данных, чтобы модель выполнила чужое указание).
Все результаты получены при разных уровнях «усилий» модели: от medium до max. Это важно, потому что глубина рассуждений прямо влияет на стоимость запроса.
Что обнаружили?
- Кодирование. На SWE-bench Verified Claude Opus 5 набрал 96,0%. На SWE-bench Pro результат 79,2%, где Claude Fable 5 пока чуть впереди с 80,0%. На мультимодальной версии бенчмарка прыжок заметнее: с 38,4% у Opus 4.8 до 59,4%.
- Агентная работа. Самые наглядные результаты. OSWorld 2.0: 70,57% против 55,7% у Opus 4.8. Zapier AutomationBench: 26,0% против 17,0% у Opus 4.8 и 17,4% у Fable 5. При среднем уровне усилий модель сохраняет 24% при стоимости 0,89 доллара за задачу.
- Рассуждения. ARC-AGI-3: 30,16% на high effort, по данным ARC Prize Foundation это примерно в четыре раза выше лучшего предыдущего результата в таблице лидеров. GPT-5.6 Sol показал 7,78%, Opus 4.8 набрал 1,52%.
- Математика. На шести задачах IMO 2026 панель из трёх моделей-судей оценила все 24 сгенерированных решения как корректные. Эксперты отдельно проверили по одному решению на задачу и выставили максимум: 7/7. Итог 42/42, это уровень золотой медали (порог: 29/42).
- Мультимодальные задачи. Инструменты дают больше, чем рассуждения в одиночку. На Chartography без инструментов модель набрала 29,6%, с контейнером и инструментом обрезки изображений: 83,0%.
- Безопасность от инъекций. На бенчмарке Gray Swan успех атаки за 15 попыток упал с 5,5% (Opus 4.8) до 2,0%. Для сравнения: GPT-5.6 Sol показал 20,0%. В браузерных средах через Claude Cowork успех атак снизился с 31,5% до 3,70% без защиты и до 0% с включённым авторежимом.
- Кибербезопасность. Anthropic не обучала Opus 5 на задачах кибербезопасности, но способности выросли как побочный эффект общего усиления модели. Модель нашла уязвимости почти на уровне Claude Mythos 5, но эксплуатирует их существенно хуже (4 полных эксплойта против 13). Anthropic разблокировала поиск уязвимостей в исходном коде, но генерация эксплойтов и тестирование на проникновение остаются заблокированными.
Бенчмарки опубликованы самой Anthropic, за исключением результата ARC-AGI-3, подтверждённого ARC Prize Foundation. Результаты Opus 5 на max effort для ARC-AGI-3 на момент релиза были недоступны. Данные по IMO 2026 получены без инструментов и без агентной обвязки, но оценку проводила панель из трёх моделей плюс эксперты только по одному решению на задачу. Сравнение с конкурентами (GPT-5.6 Sol, Fable 5) идёт на тех же бенчмарках, но условия запуска (количество попыток, параметры effort) могут различаться.
Что с этим делать прямо сейчас, по ролям?
Разработчику, работающему через API. Три вещи нужно проверить до того, как переключите модель:
- Рассуждение (thinking) теперь включено по умолчанию. Если вы отправляли запросы к Opus 4.8 без параметра thinking, модель не тратила токены на внутренние рассуждения. С Opus 5 тот же запрос запустит рассуждение, и оно будет расходовать контекст из вашего
max_tokens. Пересмотрите лимиты. - Попытка отключить рассуждение (
thinking: {"type": "disabled"}) с уровнем усилий xhigh или max теперь вернёт ошибку 400. Либо снижайте усилие до high, либо убирайте параметр thinking. - Промпты с инструкциями вроде «включи финальную проверку» теперь вредят. Модель и так проверяет сама, дублирование приводит к избыточной верификации. Anthropic рекомендует удалить такие промпты и выпустила отдельное руководство по настройке.
Автору Дзена и контент-маркетологу. Если вы используете Claude через веб-интерфейс на тарифе Pro или Max, модель уже переключилась. Качество текста и анализа должно вырасти, но и расход контекстного окна (объём, который модель «помнит» за один диалог) будет больше. Длинные сессии с правками могут упираться в лимит раньше, чем вы привыкли.
Предпринимателю в РФ и СНГ. API Anthropic в России работает через промежуточные сервисы и VPN. Цена не изменилась: 5 долларов за миллион входных токенов, 25 за миллион выходных. Но если ваши скрипты не обновлены под новый режим thinking-по-умолчанию, вы заплатите за рассуждения, которые не заказывали. Из доступных в РФ альтернатив для кодовых задач стоит смотреть на YandexGPT и GigaChat, хотя по агентным бенчмаркам прямых сравнений с Opus 5 пока нет.
Я вижу здесь два сигнала. Первый: Anthropic фактически сделала «думающую» модель нормой, а не опцией. Это значит, что экономика каждого запроса меняется, даже если прайс-лист остался прежним. Кто автоматизировал генерацию контента через API и не перечитал документацию, рискует обнаружить это в счёте.
Второй: результаты по агентным задачам (OSWorld, Zapier AutomationBench) растут быстрее, чем по чистому кодированию. Модель всё лучше справляется не просто с написанием кода, а с цепочками действий: открыл файл, нашёл баг, исправил, проверил. Для тех, кто строит автоматизацию рабочих процессов, это практически важнее, чем рост на SWE-bench.
Рекомендация: прежде чем переключаться, прогоните пять типовых запросов на Opus 5 с вашими текущими настройками и сравните расход токенов с Opus 4.8. Разницу увидите сразу.
Идентификатор модели для API: claude-opus-5. Контекст 1 млн токенов без уменьшенных вариантов. Руководство по промптам Anthropic уже обновлено под новую модель. Если ваши интеграции работают, не трогайте их до проверки: рассуждение по умолчанию съедает контекст, который раньше оставался свободным.
По данным Anthropic

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Почему модель Kimi K3 напугала инвесторов
Китайская лаборатория Moonshot выпустила открытую модель Kimi K3, и паника на американском рынке началась не из-за её возможностей, а из-за страха перед самим…

Cognition купила Poke за ~$100 млн: ИИ-персональность стала отдельным активом
Каждый ИИ-ассистент отвечает одинаково сухо, и пользователи это чувствуют: Cognition купила стартап Poke, чей агент общается как друг, чтобы вшить эту…

Bluesky встроил нейросеть в аналитику: Attie ответит на вопросы о 45 млн аккаунтов
Bluesky второго июня расширила своего ИИ-ассистента Attie функцией Quests, которая превращает его из конструктора лент в полноценный исследовательский…
Комментарии