Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis, опубликованного в июне 2025 года.

Впервые модель от Anthropic заняла первое место сразу в нескольких категориях сводного бенчмарка, обойдя GPT-4.1 и Gemini 2.5 Pro, и это напрямую касается тех, кто использует ИИ для планирования, маршрутизации и работы с данными.
Anthropic выпустила Claude Opus 5 в конце мая 2025 года. До этого модели Claude стабильно занимали верхние, но не первые строчки в независимых рейтингах. Сводный бенчмарк Artificial Analysis (независимая платформа, которая тестирует языковые модели по единой методологии) зафиксировал смену лидера: Claude Opus 5 вышел на первое место в общем зачёте и отдельно в категориях, связанных с рассуждениями и оптимизацией. Источник этих данных: платформа Artificial Analysis.
| Показатель | Значение | Источник |
|---|---|---|
| Общий рейтинг Artificial Analysis | 1-е место среди всех моделей | Artificial Analysis, июнь 2025 |
| Категория «Рассуждения и логика» | 1-е место | Artificial Analysis, июнь 2025 |
| Категория «Оптимизация и планирование» | 1-е место | Artificial Analysis, июнь 2025 |
| Дата выпуска Claude Opus 5 | Конец мая 2025 | Anthropic |
Что именно проверяли?
Artificial Analysis прогоняет каждую модель через набор стандартизированных задач. Среди них: логические цепочки, задачи на планирование (например, составить оптимальный маршрут из нескольких точек), работа с таблицами и структурированными данными, генерация кода.
Бенчмарк (стандартный тест для сравнения моделей между собой по единой шкале) не проверяет творческие способности или «понимание» контекста в свободном диалоге. Он измеряет точность ответов на задачи с проверяемым правильным решением.
Это важно: высокий балл здесь означает, что модель хорошо справляется с задачами, где есть единственный верный ответ или оптимальное решение, а не с открытыми креативными запросами.
Три главных результата
- Общий зачёт. Claude Opus 5 набрал наибольшее количество баллов среди всех протестированных моделей, включая GPT-4.1 от OpenAI и Gemini 2.5 Pro от Google.
- Логика и рассуждения. Модель показала лучший результат в задачах, где нужно выстроить цепочку шагов и прийти к выводу. Это категория, в которой рассуждающие модели (reasoning model, модели, которые «думают по шагам», прежде чем дать ответ) традиционно соревнуются особенно плотно.
- Оптимизация и планирование. Здесь разрыв с конкурентами оказался заметным. Задачи этой категории включают маршрутизацию, распределение ресурсов, составление расписаний, то есть всё, что в бизнесе называют логистикой.
Бенчмарк Artificial Analysis использует фиксированный набор задач. Модель может лидировать в нём и при этом хуже справляться с задачами, которых в тесте нет: длинные тексты, креативное письмо, работа с изображениями. Кроме того, результаты бенчмарков могут меняться с каждым обновлением модели. Claude Opus 5 тестировался в версии, доступной на конец мая 2025 года. Конкуренты обновляют свои модели регулярно, и расстановка сил может измениться в течение недель.
Что делать с этим прямо сейчас?
Результат Claude Opus 5 в категории «оптимизация и планирование» имеет прямое отношение к повседневным задачам малого бизнеса.
Если вы автор на Дзене и пишете о доставке, логистике, малом бизнесе, у вас появился конкретный повод протестировать Claude для подготовки материалов: модель лучше других строит логические цепочки и может помочь структурировать сложный экспертный контент.
Если вы предприниматель или маркетолог и ваш бизнес связан с маршрутами, расписаниями, распределением заказов, Claude Opus 5 стоит попробовать для задач оптимизации. Российские сервисы доставки еды, курьерские службы, небольшие транспортные компании работают именно с такими задачами.
Доступность в РФ: Claude доступен через API Anthropic, но без прямой регистрации из России. Работающие варианты: VPN, сторонние агрегаторы API. Из российских аналогов для задач оптимизации можно рассмотреть YandexGPT и GigaChat, хотя в данном бенчмарке они не участвовали и прямое сравнение провести нельзя.
Я слежу за бенчмарками не ради спортивного интереса, а потому что они показывают, какую модель выбрать под конкретную задачу. Claude Opus 5 выиграл именно в «планировании», и для меня это практический сигнал: если нужно составить контент-план, разложить проект на этапы или оптимизировать процесс, эта модель сейчас справится точнее других. Но одно «первое место» не делает инструмент универсальным. Для генерации текстов на русском языке модели от Яндекса и Сбера по-прежнему ближе к нашему контексту. Выбирайте модель под задачу, а не под заголовок рейтинга.
Лидерство в бенчмарке не вечно: через месяц Google или OpenAI выпустят обновление, и таблица может перевернуться. Но конкретно сейчас, если ваша работа связана с планированием или оптимизацией, Claude Opus 5 заслуживает того, чтобы его попробовать первым.
По данным Artificial Analysis

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки
Компания Intel провела тысячи экспериментов с агентными нагрузками на открытом бенчмарке Terminal-Bench и сформулировала пять практических уроков для тех, кто…

Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд
Cursor, популярный ИИ-редактор кода, 23 июня запустил первую в своей истории подписку для конкретной страны, тариф Cursor Start за 649 рупий в месяц (около 7…

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка
Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю…
Комментарии