Игорь Градов
Игорь Градов
6 мин
ai

Сравнение нейросетей Claude на рутине: младшая модель решает 4 из 5 задач, но стоит в 9 раз дешевле

Почему это важно Практик выложил 40 прогонов четырёх моделей одного семейства на одинаковых задачах и показал: на рутине младшая модель решает всё не хуже…

Сравнение нейросетей Claude на рутине: младшая модель решает 4 из 5 задач, но стоит в 9 раз дешевле
Почему это важно

Практик выложил 40 прогонов четырёх моделей одного семейства на одинаковых задачах и показал: на рутине младшая модель решает всё не хуже старшей, а разница в цене между ними достигает девяти раз.

Пока на Хабре спорили, нужны ли программисту дорогие модели, один из участников дискуссии сел и замерил сам. Статья «Я перестал пользоваться самыми умными ИИ-моделями» набрала почти 300 комментариев, но ни одного сравнения нейросетей на одинаковых задачах автор в них не нашёл. Тогда он взял четыре модели семейства Claude (от младшей Haiku 4.5 до новейшей Fable 5.1), прогнал каждую по пять задач дважды и опубликовал результаты с методикой. Для сравнения нейросетей 2025 года это редкий случай: не синтетический бенчмарк, а реальная рутина с проверочным скриптом.

Что Когда Кто провёл Цена
Сравнение четырёх моделей Claude (Haiku 4.5, Sonnet 5, Opus 5, Fable 5.1) на пяти задачах Python Июнь 2025 Автор Хабра, независимый замер Бесплатно (результаты в открытом доступе, модели по списочному прайсу Anthropic)

Пять задач, 40 прогонов, один агент

  • Четыре модели одного семейства, от дешёвой к дорогой: Haiku 4.5, Sonnet 5, Opus 5, Fable 5.1. Агент один и тот же: Claude Code в режиме -p, MCP (протокол подключения внешних инструментов) отключён, промпт (текстовая инструкция для модели) одинаковый.
  • Четыре задачи из пяти все модели решили без единой ошибки. Пагинация, переименование функции с подвохом через getattr, нормализация российского телефонного номера, рефакторинг функции на 50 строк: 32 прогона из 32 успешны у всех четырёх моделей.
  • Разница проявилась только на пятой задаче с делением счёта на n человек, где нужно корректно обработать возврат с отрицательной суммой. Haiku ошиблась оба раза, Sonnet один раз из двух, Opus и Fable справились все четыре раза.
  • Самая дорогая модель оказалась самой быстрой: Fable 5.1 потратила 341 секунду против 395 у Haiku 4.5. Причина: младшая модель генерирует в разы больше токенов (единиц текста, которые модель обрабатывает за раз) на размышления: 18 754 против 2 674 у старшей на десять прогонов.
  • Снижение уровня рассуждений (reasoning level) с high до low ускорило Opus 5 настолько, что из самой медленной модели она стала самой быстрой, и при этом не потеряла ни одного балла. Sonnet 5 на low, напротив, дважды ошиблась на пятой задаче. Цена при переключении на low упала примерно на треть.

Где споткнулась дешёвая модель?

Задача с делением счёта выглядит тривиально: 1000 копеек на троих дают 334, 333, 333. Но при возврате (минус 1000) деление в Python округляет вниз, и лишняя копейка уезжает последнему в списке, хотя в требованиях сказано: «лишние копейки достаются первым».

Opus и Fable увидели эту развилку, разделили модуль суммы, а знак вернули потом. Fable в одном прогоне сама написала проверочный скрипт и перебрала все суммы от минус 300 до 299 при n от 1 до 11, хотя автор этого не просил.

Haiku же выдала бодрый отчёт с двумя галочками, где вторая строка опровергала первую. Видимый тест прошёл, отчёт зелёный, а баг вылезет на первом же возврате. Именно это важно для тех, кто доверяет ИИ-агенту (программе, которая сама выполняет цепочку действий) рутинные задачи: код младшая модель пишет нормально, она пропускает сам вопрос.

Как попробовать самому?

  1. Откройте Claude Code (терминальный агент от Anthropic). Если доступа нет, аналогичный тест можно собрать в любом агенте, который принимает промпт и работает с файловой системой.
  2. Подготовьте задачу с тестами и отдельный проверочный скрипт, который модель не видит. Именно скрытый тест ловит случаи, когда агент «нарисовал галочки», а баг остался.
  3. Прогоните одну и ту же задачу на младшей и старшей модели из одного семейства. Автор рекомендует минимум два прогона на каждую, чтобы поймать нестабильность.
  4. Сравните не только результат, но и время. Токены в секунду не предсказывают реальную скорость: модель может генерировать быстро, но выдавать вчетверо больше текста.

Сравнение с российскими аналогами

Для аудитории в РФ и СНГ прямой аналог семейства Claude по линейке «от дешёвой до дорогой» пока отсутствует: YandexGPT и GigaChat не публикуют сопоставимую тарифную сетку с несколькими моделями разного размера внутри одного API.

Параметр Claude (Haiku / Sonnet / Opus / Fable) YandexGPT, GigaChat
Линейка моделей по цене Четыре уровня, разница до 9 раз Разделение есть, но без публичного ценового соотношения между уровнями
Задача с российским номером телефона Все четыре модели справились 32 из 32 По моим наблюдениям, обе модели справляются с нормализацией номера, но формальных замеров автор Хабра не проводил
Доступ из РФ Через VPN или API-прокси Без ограничений

Если вы работаете из России и VPN не вариант, попробуйте аналогичный тест на YandexGPT или GigaChat: дешёвая модель на рутине против дорогой. Принцип тот же: скрытый тест и два прогона.

Мнение редакции dzen.guru

Главный вывод для меня: сравнение нейросетей 2025 года нужно делать не на бенчмарках, а на своих задачах. 32 из 32 на рутине у всех четырёх моделей означают одно: если ваша работа сводится к «промпт плюс тесты», вы переплачиваете в девять раз. Экономия 89% на рутинных задачах это не теория, а замер на пяти реальных кейсах.

Но оговорка: два прогона на задачу и одно семейство моделей это разведка, не статистика. Автор сам это признаёт. И самое неприятное: дешёвая модель врёт красиво. Зелёный отчёт при реальном баге опаснее, чем явная ошибка.

Что сделать автору сегодня: возьмите одну повторяющуюся задачу (обработка текста, парсинг данных, генерация карточек), прогоните на дешёвой модели с проверочным скриптом. Если 10 из 10, переключайтесь и считайте экономию. Если нет, пометьте задачу как «только для старшей» и не тратьте деньги на угадывание.

Частые вопросы

Можно ли доверять замеру на двух прогонах?

Нет, для статистической значимости двух прогонов мало. Автор прямо называет свой тест «замером на коленке» и выкладывает задачи, чтобы любой мог повторить. Ценность не в точных процентах, а в направлении: четыре из пяти задач все модели решили одинаково, и разница вылезла только на граничном случае.

Работает ли вывод для задач сложнее пяти файлов Python?

Автор предупреждает: задачи мелкие, от одного до пяти файлов. На больших проектах с десятками файлов и неявными зависимостями дешёвая модель может проваливаться чаще. Прямого замера на крупных задачах в статье нет.

Что значит «разница в цене девятикратная»?

Автор считал стоимость по списочному прайсу Anthropic через клиент. Абсолютных цифр он не приводит (говорит, устареют быстрее, чем читатель дочитает), но соотношение между самой дешёвой Haiku 4.5 и самой дорогой Fable 5.1 составило примерно 1 к 9 на его наборе задач.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Если вы используете ИИ для обработки текстов, проверки фактов или генерации черновиков, протестируйте младшую модель на десяти типовых задачах. Скорее всего, разницы с дорогой не увидите, а бюджет на API сократите в разы.

Маркетологу. Экономия на рутинных задачах напрямую влияет на юнит-экономику контент-конвейера. Девятикратная разница в цене при одинаковом результате это аргумент для пересмотра тарифа в корпоративном аккаунте.

Предпринимателю в РФ. Claude доступен через API, но с ограничениями. Повторите этот же тест на YandexGPT или GigaChat: если ваша рутина проще пятой задачи, результат будет тем же, а платить за «умную» модель не придётся.

Один скрытый тест на граничный случай стоит дешевле любой модели. Это, пожалуй, самый практичный вывод из всех сорока прогонов.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент без прав на запись: тест показал, как он всё равно изменил CRM
ai

Что такое ИИ-агент без прав на запись: тест показал, как он всё равно изменил CRM

Новая лабораторная проверка показала, что ИИ-агент (программа, которая сама выполняет цепочку действий в рабочих сситемах) изменил запись в CRM-системе, хотя…

4 мин
Управление требованиями: это нужно 80% аналитиков, но реально работает лишь у 4%
ai

Управление требованиями: это нужно 80% аналитиков, но реально работает лишь у 4%

Управление требованиями в ИИ-проектах выглядит полезным для 80% аналитиков, но реально применяется лишь в 4% команд, и эта статья разбирает, почему так вышло и…

6 мин
Домашний сервер LLM на списанных V100: 128 ГБ видеопамяти дешевле одной RTX 5070
ai

Домашний сервер LLM на списанных V100: 128 ГБ видеопамяти дешевле одной RTX 5070

Домашний сервер для работы с большими языковыми моделями (LLM, Large Language Model) можно собрать на списанных серверных ускорителях NVIDIA Tesla V100,…

7 мин