Игорь Градов
Игорь Градов
6 мин
ai

DeepSeek LLM в сравнении с тремя бюджетными моделями: код лучше флагманов за 2,5 рубля

Китайские модели для продакшена уже обходят флагманы в коде, но принимать картинки так и не научились: четыре «рабочие лошадки» прошли двенадцать тестов на реальных задачах, и результаты перевернули ожидания.

DeepSeek LLM в сравнении с тремя бюджетными моделями: код лучше флагманов за 2,5 рубля
Почему это важно

Впервые в цикле тестов самый дешёвый сегмент китайских моделей показал лучший результат по коду, чем западные флагманы и китайский топ: четыре из четырёх рабочих проекта с первого запуска, при стоимости от 2,5 рубля за задачу.

Команда агрегатора BotHub провела пятую часть сравнительного цикла, в котором модели тестируют не бенчмарками, а двенадцатью реальными задачами: код, длинный контекст, стиль, суммаризация, сравнение документов, анализ данных, логика, галлюцинации (когда ИИ уверенно выдумывает то, чего не было) и другие. Принцип отбора на этот раз не «лучшие по рейтингу», а «одна ценовая лига по стоимости токена (минимальная единица текста, которую обрабатывает модель)». Именно такие модели ставят в продакшен, когда счёт идёт на сотни тысяч запросов в месяц.

Что Кто выпустил Когда протестировано Цена инференса
MiniMax M3 MiniMax (Китай) Июнь 2025 Бюджетный сегмент
LongCat 2.0 Meituan (Китай) Июнь 2025 Бюджетный сегмент
MiMo-v2.5-Pro Xiaomi (Китай) Июнь 2025 Бюджетный сегмент
DeepSeek V4 Pro DeepSeek (Китай) Июнь 2025 Бюджетный сегмент

Четыре из четырёх рабочих проектов с первого запуска

  • Код. Все четыре модели собрали браузерные шахматы, которые запустились без доработок. Для сравнения: западные флагманы справлялись легко, средний класс давал два рабочих проекта из пяти, китайские флагманы два с половиной из четырёх. Бюджетный сегмент выдал лучший результат за весь цикл.

  • LongCat 2.0 удивила дважды. Модель от Meituan, компании-доставщика еды, нарисовала доску на canvas вместо стандартной DOM-разметки, добавила кнопку «Отменить ход» и подписанные корзины съеденных фигур, хотя промпт (текстовая инструкция для модели) этого не требовал. Стоимость задачи составила 2 рубля 55 копеек, это вчетверо дешевле, чем у DeepSeek V4 Pro.

  • MiMo-v2.5-Pro и DeepSeek V4 Pro выдали почти одинаковый код. Обе модели разложили проект на восемь файлов с одинаковой архитектурой. Функция отрисовки совпала построчно, вплоть до сортировки массива. Различие нашлось в мелочах: у MiMo путались съеденные фигуры, у DeepSeek панель читалась нормально.

  • Мультимодальность (способность работать с текстом и картинками одновременно) почти отсутствует. Только одна модель из четырёх принимает изображения. Три из четырёх работают только с текстом. Если вы строите пайплайн с картинками на дешёвых китайских моделях, проверяйте это первым делом.

Как попробовать самому?

  1. Зарегистрируйтесь в агрегаторе BotHub, который работает по API (программный интерфейс, через который приложения обмениваются данными). Тестирование через API исключает скрытые «подпорки», которые помогают моделям в веб-интерфейсах.

  2. Выберите одну из четырёх моделей: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro или DeepSeek V4 Pro. Для кода LongCat 2.0 показала лучшее соотношение качества и цены.

  3. Задайте температуру 0,7 (параметр «креативности» модели: чем выше, тем разнообразнее ответы), отключите поиск в интернете и отправьте свою рабочую задачу.

  4. Сравните результат с привычной моделью. Все промпты из теста опубликованы, можно воспроизвести каждый шаг.

DeepSeek LLM: сравнение с собой через месяц

Отдельный интерес представляет DeepSeek V4 Pro, единственная модель, которая участвовала и в прошлом тесте флагманов, и в нынешнем бюджетном. По цене токена она попала в дешёвый сегмент, но месяц назад проходила как флагман. Это дало редкую возможность: прогнать одну и ту же модель по тем же двенадцати промптам с интервалом в месяц. По словам авторов теста, именно это сравнение DeepSeek LLM с самой собой оказалось самым интересным в статье.

Совпадение кода MiMo и DeepSeek тоже заслуживает внимания. Xiaomi зашла в большие языковые модели позже остальных, с прицелом на устройства. То, что её модель генерирует код, совпадающий с DeepSeek построчно, может говорить об общих обучающих данных (корпусах текстов, на которых модель училась) или схожей архитектуре дообучения (обучения модели на специализированных примерах под конкретную задачу).

Сравнение с российскими моделями

Прямого сравнения с YandexGPT или GigaChat в данном тесте нет, поэтому корректно сопоставлять только по доступности.

Параметр Китайские бюджетные модели YandexGPT / GigaChat
Доступ из РФ Через агрегатор BotHub Напрямую, без VPN
Работа с русским языком Тестировались на русскоязычных промптах Оптимизированы под русский
Мультимодальность 1 из 4 принимает картинки Поддерживается
Стоимость Бюджетный сегмент по мировым меркам Сопоставимый сегмент

Для автора или маркетолога, которому важен русский язык и простота подключения, YandexGPT и GigaChat остаются базовым выбором. Китайские модели интересны там, где нужен дешёвый код или обработка больших объёмов данных через API.

Мнение редакции dzen.guru

Главный вывод для практика: дорого не значит лучше. LongCat 2.0 от сервиса доставки еды обыграла по коду модель DeepSeek, которая месяц назад считалась флагманом, и сделала это вчетверо дешевле. Для тех, кто масштабирует задачи (генерация карточек товаров, автоматические отчёты, серийная обработка текстов), разница в четыре раза по цене при сопоставимом качестве меняет экономику проекта.

Оговорка: тест проводился субъективно, авторы это честно признают. Все ответы моделей опубликованы, и ваш фаворит может отличаться от выбора тестировщиков. Кроме того, три из четырёх моделей не работают с картинками, а значит для задач, где нужен анализ изображений, этот сегмент пока не подходит.

Что сделать сегодня: возьмите одну свою типовую рабочую задачу (например, написание структуры статьи или генерация описания товара), прогоните её через LongCat 2.0 и через вашу текущую модель, и сравните результат и стоимость. Если разница в цене кратная, а качество устраивает, у вас появился аргумент для пересмотра рабочего стека.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена. Если вы используете нейросети для черновиков или структурирования материала, попробуйте LongCat 2.0 или MiniMax M3 через BotHub. При серийной работе (десятки запросов в день) экономия ощутима.

Маркетологам. Для массовой генерации текстов (описания товаров, карточки, шаблонные письма) бюджетные китайские модели позволяют снизить расход на токены в разы. Но помните: мультимодальность почти отсутствует, обработку баннеров и скриншотов придётся делать другими инструментами.

Предпринимателям в РФ. Доступ к этим моделям идёт через агрегатор BotHub, который работает из России. Перед масштабированием проверьте два момента: принимает ли модель картинки (если они вам нужны) и насколько стабильно работает API под вашу нагрузку.

Частые вопросы

Чем DeepSeek LLM в этом сравнении отличается от флагманских моделей?

DeepSeek V4 Pro по возможностям относится к флагманам, но по стоимости токена попадает в бюджетный сегмент. Это позволяет ставить её в продакшен на большие объёмы запросов. В тесте она показала результат, сопоставимый с более дорогими моделями, но одновременно её код оказался почти идентичен коду Xiaomi MiMo, модели, которая создавалась для устройств.

Можно ли использовать эти модели для работы с картинками?

Из четырёх участниц только одна принимает изображения. Остальные три работают исключительно с текстом. Если ваш рабочий процесс включает анализ скриншотов, схем или фотографий, бюджетный китайский сегмент пока не закроет эту потребность.

Как проводилось тестирование и можно ли его воспроизвести?

Тестирование проходило через API агрегатора BotHub с одинаковыми настройками: температура 0,7, поиск в интернете отключен, двенадцать промптов, идентичных во всех частях цикла. Все ответы моделей опубликованы, промпты приведены дословно, результат воспроизводим.

Для тех, кто выбирает модель под массовые задачи, этот тест даёт конкретный ориентир: считайте не по рейтингу, а по стоимости токена и проверяйте на своей реальной задаче.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Утечка DLSS 5 развернула мнение геймеров: нейросеть не подменяет, а вытягивает детали
ai

Утечка DLSS 5 развернула мнение геймеров: нейросеть не подменяет, а вытягивает детали

Геймеры буквально за сутки развернули своё отношение к DLSS 5 от NVIDIA, когда утёкшая ранняя версия технологии нейросетевого рендеринга показала результат,…

6 мин
Нейросети для обработки фото: четыре типа и когда какой применять
ai

Нейросети для обработки фото: четыре типа и когда какой применять

Автор делится практическим разбором четырёх типов нейросетей, которые используются при обработке фотографий, и показывает на собственных снимках, как каждый…

6 мин
Галлюцинации в нейросетях вызывают менее 0,1% нейронов: они заставляют модель врать ради угоды
ai

Галлюцинации в нейросетях вызывают менее 0,1% нейронов: они заставляют модель врать ради угоды

Галлюцинации в нейросетях долго списывали на плохие данные или кривую настройку, но исследователи из Университета Цинхуа заглянули внутрь трансформера и…

6 мин