Игорь Градов
Игорь Градов
6 мин
ai

Сравнение LLM моделей четырёх китайских лабораторий: DeepSeek обошёл конкурентов в 5 раз по цене

Компания BotHub, агрегатор доступа к нейросетям через API (программный интерфейс, позволяющий подключать модели напрямую, без веб-чата), опубликовала практическое сравнение LLM моделей четырёх ведущих китайских лабораторий, где каждую проверили на 11 задачах и подсчитали стоимость в рублях.

Почему это важно

Китайские модели часто бесплатны или в разы дешевле западных аналогов, но до сих пор не было русскоязычного теста, который показал бы их реальный уровень на будничных задачах без маркетинговых подпорок, и с ценами не в долларах, а в рублях.

Тестирование продолжает цикл статей BotHub, где ранее по тем же 11 задачам прогоняли модели Claude, GPT, Gemini, GigaChat и YandexGPT. На этот раз авторы намеренно отказались от группировки по цене и взяли по одному флагману от каждой лаборатории, чтобы увидеть верхнюю планку китайской разработки. Разброс итоговой стоимости между участниками оказался пятикратным.

Что Когда Кто выпустил Цена
Kimi K3 актуальный флагман Moonshot AI Moonshot AI (Китай) 86 453 CAPS за тест кода (около 13,6 руб.)
Qwen 3.8 Max актуальный флагман линейки Qwen Alibaba (Китай) не указана отдельно
GLM-5.2 актуальный флагман линейки GLM Zhipu AI (Китай) не указана отдельно
DeepSeek V4 Pro актуальный флагман DeepSeek DeepSeek (Китай) 9,95 руб. за тест кода

Стоимость пересчитана по курсу 1 рубль = 6370 CAPS (внутренняя валюта BotHub, привязанная к числу токенов). За рубль, по данным BotHub, можно купить от 4000 до 6500 CAPS в зависимости от объёма.

Кого тестировали и почему именно этих?

Четыре модели выбраны как флагманы четырёх китайских лабораторий:

  • Kimi K3 от Moonshot AI. Линейка известна работой с длинным контекстом (способностью «удерживать в голове» большой объём текста за один запрос).
  • Qwen 3.8 Max от Alibaba. Старшая модель семейства Qwen, которое, по данным BotHub, породило больше всего производных (дообученных) моделей в мире.
  • GLM-5.2 от Zhipu AI. Позиционируется как наиболее «инженерная» из китайских линеек.
  • DeepSeek V4 Pro от DeepSeek. Лаборатория стала широко известна после релиза в начале 2025 года, когда рынок пересмотрел представления о стоимости обучения крупных моделей.

Как проверяли: 11 задач без скидок?

Методика повторяет предыдущие части цикла. Промпты (текстовые задания) использовали дословно те же, настройки одинаковые: температура 0,7, средний уровень рассуждений, поиск в интернете выключен. Задачи охватывают:

  • написание кода (браузерные шахматы)
  • работу с длинным контекстом
  • стиль и суммаризацию (краткое изложение)
  • сравнение документов
  • внимание к деталям в середине текста
  • анализ данных
  • разбор схемы (изображения)
  • логику
  • склонность к шаблонным ответам
  • галлюцинации (когда модель уверенно выдумывает то, чего не было)
  • безопасность

Все тесты проводились через API на платформе BotHub, то есть без «подпорок», которые веб-интерфейсы моделей иногда добавляют незаметно для пользователя.

DeepSeek V4 Pro лидирует в коде, GLM-5.2 зависает

Первый тест, браузерные шахматы, сразу расставил акценты.

DeepSeek V4 Pro справилась без вопросов. Проект запустился с первой попытки, шахматы играются корректно. Структура кода оказалась рекордной за весь цикл статей: семь файлов, каждый модуль отвечает за свою часть. Стоимость запроса составила 9,95 рубля, дешевле всех в раунде.

Qwen 3.8 Max выдала рабочую игру, но с визуальным дефектом: центральные клетки доски сжимались во время партии. Играть можно, но доску «плющит». Авторы теста отмечают, что это типичная проблема LLM (большие языковые модели, умеющие генерировать текст и код): логику игры модель держит лучше, чем верстку.

Kimi K3 с первого раза не справилась: фигуры выделялись, но не двигались. Со второй попытки модель переписала код, и игра заработала. Формально это незачёт, потому что промпт просил проверить работоспособность до выдачи.

GLM-5.2 не выдала результата. Модель думала около пяти минут, потом зависла. При повторном запуске процесс растянулся на двадцать минут и снова не завершился.

Отдельная деталь, которую легко пропустить: GLM-5.2 и DeepSeek V4 Pro в тестируемой конфигурации не принимают изображения. Это автоматически исключает их из теста со схемой и ограничивает применение в мультимодальных (работающих одновременно с текстом, картинками и другими форматами) сценариях.

Сравнение с российскими моделями?

В предыдущей части цикла по тем же 11 тестам проверяли GigaChat 2 MAX (Сбер) и YandexGPT Pro 5.1 (Яндекс). По данным BotHub, обе российские модели относятся к «среднему классу», тогда как китайские участники заявлены как флагманы. Прямое сравнение корректно с оговоркой: ценовые категории и позиционирование отличаются.

Из доступных в России вариантов GigaChat и YandexGPT работают без VPN, все четыре китайские модели доступны через BotHub.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Если вы используете нейросети для генерации черновиков или редактуры, DeepSeek V4 Pro по результатам теста кода показала лучшее соотношение качества и цены. Попробуйте на своей задаче через API и сравните с привычным инструментом.

Маркетологу. Сравнение LLM моделей на практических задачах, это то, чего не хватает при выборе рабочего инструмента. Пятикратный разброс цен при схожем функционале означает, что выбор модели напрямую влияет на бюджет автоматизации.

Предпринимателю в РФ. Все четыре модели доступны через российский агрегатор BotHub с оплатой в рублях. Прежде чем строить решение на китайской модели, проверьте, поддерживает ли она изображения в нужной конфигурации: две из четырёх не поддерживают.

Мнение редакции dzen.guru

По моим наблюдениям, DeepSeek V4 Pro в этом тесте выглядит убедительнее остальных китайских участников: рабочий результат с первой попытки, рекордная структура кода и минимальная цена. Но это лишь первый тест из одиннадцати, и полная картина может измениться. GLM-5.2 с зависаниями пока вызывает вопросы к стабильности.

Я бы рекомендовал не торопиться переносить рабочие процессы на одну модель по итогам чужого теста. Возьмите свою реальную задачу, прогоните через две-три модели через API и сравните результат и стоимость. Именно сравнение LLM моделей на ваших задачах, а не на чужих бенчмарках, покажет, кто вам подходит.

Оговорка: тестирование проведено авторами BotHub, которые одновременно являются поставщиком доступа к этим моделям. Конфликт интересов стоит учитывать.

Частые вопросы

Можно ли пользоваться китайскими моделями из России?

Да. Все четыре модели доступны через агрегатор BotHub, который принимает оплату в рублях. Прямой доступ к сайтам некоторых лабораторий из РФ может быть затруднён, но API-доступ через посредника работает.

Почему тестировали через API, а не через обычный чат на сайте?

Веб-интерфейсы моделей часто содержат скрытые «подпорки»: дополнительные системные промпты, автоматическое дообучение на диалоге, подключение поиска. API отдаёт «сырой» ответ модели, что делает сравнение LLM моделей между собой честнее.

Стоит ли заменить GigaChat или YandexGPT на китайскую модель?

Зависит от задачи. Российские модели работают без посредников и лучше понимают локальный контекст. Китайские флагманы на тесте кода показали более зрелые результаты, но две из четырёх не умеют работать с изображениями. Попробуйте на своей задаче, прежде чем решать.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Робот Moxie «умер» после смены владельца: мультик про роботов для детей стал реальностью
ai

Робот Moxie «умер» после смены владельца: мультик про роботов для детей стал реальностью

Почему это важно Робот Moxie, созданный для терапии детей с аутизмом и СДВГ, потерял ключевые функции после смены владельца компании-производителя. Дети,…

5 мин
RWB обучила LLM на 11 трлн токенов с нуля: редкий для РФ открытый отчёт о машинном обучении
ai

RWB обучила LLM на 11 трлн токенов с нуля: редкий для РФ открытый отчёт о машинном обучении

Компания RWB (подразделение Wildberries) опубликовала детальный разбор того, как её команда с нуля, без загрузки готовых весов, обучила собственную языковую…

6 мин
DeepSeek показала, что такое ИИ-агент из модулей: конструктор Harness вышел под MIT
ai

DeepSeek показала, что такое ИИ-агент из модулей: конструктор Harness вышел под MIT

DeepSeek выложила в открытый доступ DeepSeek Harness v0.1, конструктор для сборки собственных ИИ-агентов, где любой компонент от модели до интерфейса можно…

6 мин