Игорь Градов
Игорь Градов
4 мин
ai

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике

Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis, опубликованного в июне 2025 года.

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
Почему это важно

Впервые модель от Anthropic заняла первое место сразу в нескольких категориях сводного бенчмарка, обойдя GPT-4.1 и Gemini 2.5 Pro, и это напрямую касается тех, кто использует ИИ для планирования, маршрутизации и работы с данными.

Anthropic выпустила Claude Opus 5 в конце мая 2025 года. До этого модели Claude стабильно занимали верхние, но не первые строчки в независимых рейтингах. Сводный бенчмарк Artificial Analysis (независимая платформа, которая тестирует языковые модели по единой методологии) зафиксировал смену лидера: Claude Opus 5 вышел на первое место в общем зачёте и отдельно в категориях, связанных с рассуждениями и оптимизацией. Источник этих данных: платформа Artificial Analysis.

Показатель Значение Источник
Общий рейтинг Artificial Analysis 1-е место среди всех моделей Artificial Analysis, июнь 2025
Категория «Рассуждения и логика» 1-е место Artificial Analysis, июнь 2025
Категория «Оптимизация и планирование» 1-е место Artificial Analysis, июнь 2025
Дата выпуска Claude Opus 5 Конец мая 2025 Anthropic

Что именно проверяли?

Artificial Analysis прогоняет каждую модель через набор стандартизированных задач. Среди них: логические цепочки, задачи на планирование (например, составить оптимальный маршрут из нескольких точек), работа с таблицами и структурированными данными, генерация кода.

Бенчмарк (стандартный тест для сравнения моделей между собой по единой шкале) не проверяет творческие способности или «понимание» контекста в свободном диалоге. Он измеряет точность ответов на задачи с проверяемым правильным решением.

Это важно: высокий балл здесь означает, что модель хорошо справляется с задачами, где есть единственный верный ответ или оптимальное решение, а не с открытыми креативными запросами.

Три главных результата

  • Общий зачёт. Claude Opus 5 набрал наибольшее количество баллов среди всех протестированных моделей, включая GPT-4.1 от OpenAI и Gemini 2.5 Pro от Google.
  • Логика и рассуждения. Модель показала лучший результат в задачах, где нужно выстроить цепочку шагов и прийти к выводу. Это категория, в которой рассуждающие модели (reasoning model, модели, которые «думают по шагам», прежде чем дать ответ) традиционно соревнуются особенно плотно.
  • Оптимизация и планирование. Здесь разрыв с конкурентами оказался заметным. Задачи этой категории включают маршрутизацию, распределение ресурсов, составление расписаний, то есть всё, что в бизнесе называют логистикой.
Как это читать: оговорки и ограничения

Бенчмарк Artificial Analysis использует фиксированный набор задач. Модель может лидировать в нём и при этом хуже справляться с задачами, которых в тесте нет: длинные тексты, креативное письмо, работа с изображениями. Кроме того, результаты бенчмарков могут меняться с каждым обновлением модели. Claude Opus 5 тестировался в версии, доступной на конец мая 2025 года. Конкуренты обновляют свои модели регулярно, и расстановка сил может измениться в течение недель.

Что делать с этим прямо сейчас?

Результат Claude Opus 5 в категории «оптимизация и планирование» имеет прямое отношение к повседневным задачам малого бизнеса.

Если вы автор на Дзене и пишете о доставке, логистике, малом бизнесе, у вас появился конкретный повод протестировать Claude для подготовки материалов: модель лучше других строит логические цепочки и может помочь структурировать сложный экспертный контент.

Если вы предприниматель или маркетолог и ваш бизнес связан с маршрутами, расписаниями, распределением заказов, Claude Opus 5 стоит попробовать для задач оптимизации. Российские сервисы доставки еды, курьерские службы, небольшие транспортные компании работают именно с такими задачами.

Доступность в РФ: Claude доступен через API Anthropic, но без прямой регистрации из России. Работающие варианты: VPN, сторонние агрегаторы API. Из российских аналогов для задач оптимизации можно рассмотреть YandexGPT и GigaChat, хотя в данном бенчмарке они не участвовали и прямое сравнение провести нельзя.

Мнение редакции dzen.guru

Я слежу за бенчмарками не ради спортивного интереса, а потому что они показывают, какую модель выбрать под конкретную задачу. Claude Opus 5 выиграл именно в «планировании», и для меня это практический сигнал: если нужно составить контент-план, разложить проект на этапы или оптимизировать процесс, эта модель сейчас справится точнее других. Но одно «первое место» не делает инструмент универсальным. Для генерации текстов на русском языке модели от Яндекса и Сбера по-прежнему ближе к нашему контексту. Выбирайте модель под задачу, а не под заголовок рейтинга.

Лидерство в бенчмарке не вечно: через месяц Google или OpenAI выпустят обновление, и таблица может перевернуться. Но конкретно сейчас, если ваша работа связана с планированием или оптимизацией, Claude Opus 5 заслуживает того, чтобы его попробовать первым.

По данным Artificial Analysis

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки
ai

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки

Компания Intel провела тысячи экспериментов с агентными нагрузками на открытом бенчмарке Terminal-Bench и сформулировала пять практических уроков для тех, кто…

6 мин
Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд
ai

Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд

Cursor, популярный ИИ-редактор кода, 23 июня запустил первую в своей истории подписку для конкретной страны, тариф Cursor Start за 649 рупий в месяц (около 7…

6 мин
6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка
ai

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка

Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю…

5 мин