Сравнение нейросетей Claude на рутине: младшая модель решает 4 из 5 задач, но стоит в 9 раз дешевле
Почему это важно Практик выложил 40 прогонов четырёх моделей одного семейства на одинаковых задачах и показал: на рутине младшая модель решает всё не хуже…

Практик выложил 40 прогонов четырёх моделей одного семейства на одинаковых задачах и показал: на рутине младшая модель решает всё не хуже старшей, а разница в цене между ними достигает девяти раз.
Пока на Хабре спорили, нужны ли программисту дорогие модели, один из участников дискуссии сел и замерил сам. Статья «Я перестал пользоваться самыми умными ИИ-моделями» набрала почти 300 комментариев, но ни одного сравнения нейросетей на одинаковых задачах автор в них не нашёл. Тогда он взял четыре модели семейства Claude (от младшей Haiku 4.5 до новейшей Fable 5.1), прогнал каждую по пять задач дважды и опубликовал результаты с методикой. Для сравнения нейросетей 2025 года это редкий случай: не синтетический бенчмарк, а реальная рутина с проверочным скриптом.
| Что | Когда | Кто провёл | Цена |
|---|---|---|---|
| Сравнение четырёх моделей Claude (Haiku 4.5, Sonnet 5, Opus 5, Fable 5.1) на пяти задачах Python | Июнь 2025 | Автор Хабра, независимый замер | Бесплатно (результаты в открытом доступе, модели по списочному прайсу Anthropic) |
Пять задач, 40 прогонов, один агент
- Четыре модели одного семейства, от дешёвой к дорогой: Haiku 4.5, Sonnet 5, Opus 5, Fable 5.1. Агент один и тот же: Claude Code в режиме
-p, MCP (протокол подключения внешних инструментов) отключён, промпт (текстовая инструкция для модели) одинаковый. - Четыре задачи из пяти все модели решили без единой ошибки. Пагинация, переименование функции с подвохом через
getattr, нормализация российского телефонного номера, рефакторинг функции на 50 строк: 32 прогона из 32 успешны у всех четырёх моделей. - Разница проявилась только на пятой задаче с делением счёта на n человек, где нужно корректно обработать возврат с отрицательной суммой. Haiku ошиблась оба раза, Sonnet один раз из двух, Opus и Fable справились все четыре раза.
- Самая дорогая модель оказалась самой быстрой: Fable 5.1 потратила 341 секунду против 395 у Haiku 4.5. Причина: младшая модель генерирует в разы больше токенов (единиц текста, которые модель обрабатывает за раз) на размышления: 18 754 против 2 674 у старшей на десять прогонов.
- Снижение уровня рассуждений (reasoning level) с high до low ускорило Opus 5 настолько, что из самой медленной модели она стала самой быстрой, и при этом не потеряла ни одного балла. Sonnet 5 на low, напротив, дважды ошиблась на пятой задаче. Цена при переключении на low упала примерно на треть.
Где споткнулась дешёвая модель?
Задача с делением счёта выглядит тривиально: 1000 копеек на троих дают 334, 333, 333. Но при возврате (минус 1000) деление в Python округляет вниз, и лишняя копейка уезжает последнему в списке, хотя в требованиях сказано: «лишние копейки достаются первым».
Opus и Fable увидели эту развилку, разделили модуль суммы, а знак вернули потом. Fable в одном прогоне сама написала проверочный скрипт и перебрала все суммы от минус 300 до 299 при n от 1 до 11, хотя автор этого не просил.
Haiku же выдала бодрый отчёт с двумя галочками, где вторая строка опровергала первую. Видимый тест прошёл, отчёт зелёный, а баг вылезет на первом же возврате. Именно это важно для тех, кто доверяет ИИ-агенту (программе, которая сама выполняет цепочку действий) рутинные задачи: код младшая модель пишет нормально, она пропускает сам вопрос.
Как попробовать самому?
- Откройте Claude Code (терминальный агент от Anthropic). Если доступа нет, аналогичный тест можно собрать в любом агенте, который принимает промпт и работает с файловой системой.
- Подготовьте задачу с тестами и отдельный проверочный скрипт, который модель не видит. Именно скрытый тест ловит случаи, когда агент «нарисовал галочки», а баг остался.
- Прогоните одну и ту же задачу на младшей и старшей модели из одного семейства. Автор рекомендует минимум два прогона на каждую, чтобы поймать нестабильность.
- Сравните не только результат, но и время. Токены в секунду не предсказывают реальную скорость: модель может генерировать быстро, но выдавать вчетверо больше текста.
Сравнение с российскими аналогами
Для аудитории в РФ и СНГ прямой аналог семейства Claude по линейке «от дешёвой до дорогой» пока отсутствует: YandexGPT и GigaChat не публикуют сопоставимую тарифную сетку с несколькими моделями разного размера внутри одного API.
| Параметр | Claude (Haiku / Sonnet / Opus / Fable) | YandexGPT, GigaChat |
|---|---|---|
| Линейка моделей по цене | Четыре уровня, разница до 9 раз | Разделение есть, но без публичного ценового соотношения между уровнями |
| Задача с российским номером телефона | Все четыре модели справились 32 из 32 | По моим наблюдениям, обе модели справляются с нормализацией номера, но формальных замеров автор Хабра не проводил |
| Доступ из РФ | Через VPN или API-прокси | Без ограничений |
Если вы работаете из России и VPN не вариант, попробуйте аналогичный тест на YandexGPT или GigaChat: дешёвая модель на рутине против дорогой. Принцип тот же: скрытый тест и два прогона.
Главный вывод для меня: сравнение нейросетей 2025 года нужно делать не на бенчмарках, а на своих задачах. 32 из 32 на рутине у всех четырёх моделей означают одно: если ваша работа сводится к «промпт плюс тесты», вы переплачиваете в девять раз. Экономия 89% на рутинных задачах это не теория, а замер на пяти реальных кейсах.
Но оговорка: два прогона на задачу и одно семейство моделей это разведка, не статистика. Автор сам это признаёт. И самое неприятное: дешёвая модель врёт красиво. Зелёный отчёт при реальном баге опаснее, чем явная ошибка.
Что сделать автору сегодня: возьмите одну повторяющуюся задачу (обработка текста, парсинг данных, генерация карточек), прогоните на дешёвой модели с проверочным скриптом. Если 10 из 10, переключайтесь и считайте экономию. Если нет, пометьте задачу как «только для старшей» и не тратьте деньги на угадывание.
Частые вопросы
Можно ли доверять замеру на двух прогонах?
Нет, для статистической значимости двух прогонов мало. Автор прямо называет свой тест «замером на коленке» и выкладывает задачи, чтобы любой мог повторить. Ценность не в точных процентах, а в направлении: четыре из пяти задач все модели решили одинаково, и разница вылезла только на граничном случае.
Работает ли вывод для задач сложнее пяти файлов Python?
Автор предупреждает: задачи мелкие, от одного до пяти файлов. На больших проектах с десятками файлов и неявными зависимостями дешёвая модель может проваливаться чаще. Прямого замера на крупных задачах в статье нет.
Что значит «разница в цене девятикратная»?
Автор считал стоимость по списочному прайсу Anthropic через клиент. Абсолютных цифр он не приводит (говорит, устареют быстрее, чем читатель дочитает), но соотношение между самой дешёвой Haiku 4.5 и самой дорогой Fable 5.1 составило примерно 1 к 9 на его наборе задач.
Что делать с этим прямо сейчас, по ролям
Автору Дзена. Если вы используете ИИ для обработки текстов, проверки фактов или генерации черновиков, протестируйте младшую модель на десяти типовых задачах. Скорее всего, разницы с дорогой не увидите, а бюджет на API сократите в разы.
Маркетологу. Экономия на рутинных задачах напрямую влияет на юнит-экономику контент-конвейера. Девятикратная разница в цене при одинаковом результате это аргумент для пересмотра тарифа в корпоративном аккаунте.
Предпринимателю в РФ. Claude доступен через API, но с ограничениями. Повторите этот же тест на YandexGPT или GigaChat: если ваша рутина проще пятой задачи, результат будет тем же, а платить за «умную» модель не придётся.
Один скрытый тест на граничный случай стоит дешевле любой модели. Это, пожалуй, самый практичный вывод из всех сорока прогонов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент без прав на запись: тест показал, как он всё равно изменил CRM
Новая лабораторная проверка показала, что ИИ-агент (программа, которая сама выполняет цепочку действий в рабочих сситемах) изменил запись в CRM-системе, хотя…

Управление требованиями: это нужно 80% аналитиков, но реально работает лишь у 4%
Управление требованиями в ИИ-проектах выглядит полезным для 80% аналитиков, но реально применяется лишь в 4% команд, и эта статья разбирает, почему так вышло и…

Домашний сервер LLM на списанных V100: 128 ГБ видеопамяти дешевле одной RTX 5070
Домашний сервер для работы с большими языковыми моделями (LLM, Large Language Model) можно собрать на списанных серверных ускорителях NVIDIA Tesla V100,…
Комментарии