Qwen модели с 27B параметрами обошли 304B DeepSeek V4 Flash: размер больше не решает
Программист потратил субботний вечер на сравнение двух свежих моделей Qwen 3.8-27B и DeepSeek V4 Flash 0731 на собственном бенчмарке из 50 реальных рабочих задач и обнаружил, что модель с 27 миллиардами параметров обошла модель с 304 миллиардами.

Qwen модели с 27 миллиардами параметров помещаются на одну видеокарту, а DeepSeek V4 Flash требует минимум двух DGX Spark стоимостью около 700 тысяч рублей. При этом на практических задачах меньшая модель показала тот же результат, что ставит под вопрос стратегию «больше параметров, лучше результат».
Автор Telegram-канала провёл семичасовое тестирование двух моделей: Qwen 3.8-27B (27 миллиардов параметров, открытые веса) и DeepSeek V4 Flash 0731 (304 миллиарда параметров, лицензия MIT). Бенчмарк собран из его собственной двухмесячной работы: 50 задач, из которых 45% составляет код, а остальное приходится на стратегические документы и архитектурные решения. Оценивали три модели-судьи с фиксированным сидом (начальное значение генератора случайных чисел, которое делает результат воспроизводимым).
| Показатель | Значение | Источник |
|---|---|---|
| Итоговый балл Qwen 3.8-27B (API) | Разница с локальным прогоном 0.004 | Бенчмарк автора |
| Задержка до первого токена (TTFT), API | 134 секунды | Бенчмарк автора |
| Задержка до первого токена, локально (Селектел) | 27 секунд | Бенчмарк автора |
| Стоимость за решённую задачу (API) | 1.79 рубля | Бенчмарк автора |
| P99 сквозной задержки у провайдера API | 788 секунд | Публичная статистика провайдера |
| Ошибки структурированного вывода у провайдера | 13.45% | Публичная статистика провайдера |
| Размер чекпойнта DeepSeek V4 Flash | 166.9 ГБ | Данные автора |
| Публичный балл DeepSeek V4 Flash (Artificial Analysis) | 52 | Artificial Analysis |
| Публичный балл Qwen 3.6-27B (Artificial Analysis) | 38 | Artificial Analysis |
| Минимальная конфигурация для DeepSeek V4 Flash | Две DGX Spark, около 700 000 рублей | Расчёт автора |
Что именно измеряли?
Автор сравнил две модели на задачах, близких к ежедневной работе разработчика и архитектора. Бенчмарк не академический: он включает написание кода, создание стратегических документов и архитектурных решений. Каждый ответ модели оценивали три модели-судьи (Gemini, GPT-5.1 и Opus 4.8), а не один, чтобы снизить влияние ошибок отдельного судьи.
Модели тестировались в двух режимах: через облачный API (платформа OpenRouter) и локально на собственной видеокарте через сервис Селектел. Это позволило отделить качество самой модели от качества инфраструктуры провайдера.
Какие ловушки обнаружились при тестировании?
Автор столкнулся с пятью проблемами, каждая из которых могла исказить результат. Для тех, кто планирует тестировать Qwen модели или любые другие рассуждающие модели самостоятельно, это готовый список граблей.
-
Провайдер API испортил первый прогон. Модель вышла два дня назад, её поднял единственный хостер. Его публичная статистика показала P99 задержки 788 секунд и 13.45% ошибок структурированного вывода. Локальный запуск дал 27 секунд вместо 134, разница почти пятикратная.
-
Бюджет на рассуждение был слишком мал. Дефолтные 4096 токенов (токен это примерно один слог или короткое слово) ушли на «размышления» модели целиком, а на ответ места не осталось. Задача получила ноль баллов от всех трёх судей. После увеличения бюджета до 32 768 токенов та же задача набрала 0.87 из 1.
-
Судья-модель галлюцинировала. Gemini (рассуждающая модель от Google, выступавшая в роли судьи) поставил 2 из 10, заявив, что Qwen3-30B-A3B и Qwen3-32B «не существуют». Обе модели существуют. При повторной проверке с тем же текстом GPT-5.1 поставил 9, Opus 4.8 поставил 8. Разброс семь баллов на одном ответе. Воспроизводимость ошибки Gemini составила 0.014, то есть он стабильно ошибался, а не случайно.
-
Счётчик рассуждений показывал ноль. При локальном запуске поле reasoning_tokens возвращало 0, хотя модель реально рассуждала. Автор сравнил объём трейса (журнала рассуждений): 104 331 символ локально против 105 524 по API на тех же задачах, отношение 0.99. Рассуждение работало, но счётчик был сломан. Если бы автор поверил нулю, он бы сделал неверный вывод.
-
Парсер разбора истории содержал баг. Скрипт разделял текст по запятой вместо пробела, из-за чего автор ошибочно обвинил свой старый пост в несуществующей ошибке.
DeepSeek V4 Flash: хорошая модель, которая не помещается
По данным таблицы Artificial Analysis, DeepSeek V4 Flash набирает 52 балла против 38 у предыдущей версии Qwen 3.6-27B. Но на 50 практических задачах автора модель с 304 миллиардами параметров отстала от модели, которая в одиннадцать раз меньше.
Физическое ограничение тоже существенное. На двух картах RTX PRO 6000 с 96 ГБ памяти после служебного резерва остаётся 4.46 ГБ под контекстное окно в 32 тысячи токенов. Контекст в 256 тысяч уже не помещается. Квантизация Q4 (приём сжатия модели, уменьшающий точность весов) экономит 11.9 ГБ. Квантизация Q2 экономит больше, но роняет перплексию (метрику качества, чем ниже, тем лучше) с 4.53 до 6.08.
Самый дешёвый рабочий вариант, две DGX Spark, стоит около 700 тысяч рублей. Окупаемость против API потребует порядка 11 400 прогонов бенчмарка в месяц. Автор сделал три за вечер.
Бенчмарк авторский, 50 задач одного разработчика. Выборка отражает конкретный профиль работы: 45% код, 55% стратегические и архитектурные документы. Результаты не масштабируются на все сценарии. Один из трёх судей (Gemini) стабильно галлюцинировал на конкретной задаче, и автор это зафиксировал, но не исключил судью. Публичных независимых сравнений Qwen 3.8-27B и DeepSeek V4 Flash 0731 автор не нашёл и просит сообщество поделиться, если такие есть.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы используете Qwen модели для генерации текстов через API, проверьте провайдера. Разница между 134 и 27 секундами на один запрос, это разница между «бросил и ушёл» и «работает нормально». Для свежих моделей провайдер часто один, и его инфраструктура может быть сырой.
Маркетологам и предпринимателям в РФ. Qwen 3.8-27B помещается на одну видеокарту и доступна через Селектел. DeepSeek V4 Flash требует оборудования за 700 тысяч рублей минимум. Для задач, где нужна локальная модель (данные не должны уходить за периметр), 27-миллиардная версия выглядит рациональнее. Из российских аналогов для сравнения стоит посмотреть на YandexGPT и GigaChat, но прямых бенчмарков с Qwen 3.8-27B на тех же задачах пока нет.
Всем, кто тестирует модели. Три конкретных урока из этого теста: поднимайте бюджет рассуждений выше дефолтных 4096 токенов (автор ставит 32 768), не доверяйте одному судье (разброс семь баллов из десяти на одном ответе), проверяйте счётчик reasoning_tokens, ноль может означать сломанный счётчик, а не выключенное рассуждение.
Этот тест ценен не итоговым баллом, а подробным разбором ошибок. Автор честно показал, как сам виноват в первом плохом прогоне, как судья-модель галлюцинировала, как парсер разделял текст не по тому символу. Для тех из нас, кто работает с Qwen модели или любыми другими открытыми моделями в России, главный вывод прост: модель с 27 миллиардами параметров на одной карте за 27 секунд решает те же задачи, что модель с 304 миллиардами на оборудовании за 700 тысяч. Считайте деньги, а не параметры.
Автор забирает Qwen 3.8-27B в рабочий стек и подбирает открытые бенчмарки для дальнейшей проверки. Если у вас есть независимое сравнение этих двух моделей, он просит поделиться для сверки результатов.
По данным Telegram-канала автора бенчмарка

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Датасет для RAG оценки за две недели: пошаговая сборка 120 кейсов
Представьте: вы подключили RAG (retrieval-augmented generation, когда модель ищет ответ не в своей памяти, а в ваших документах), прогнали десяток тестовых…

Сколько времени даётся на подготовку к пересказу в устном собеседовании: ИИ-тренажёр снимает языковой барьер
ChatGPT, Claude или другая языковая модель с доступом через API или веб-интерфейс нужны для подготовки, а не для использования на самом звонке. Ниже разбираю,…
Instagram новости недели: новый логотип и манифест Цукерберга об открытом ИИ
Адам Моссери не говорил ничего в источнике. Источник — подкаст The Vergecast (The Verge), обсуждающий два события недели Meta: новый логотип Instagram и…
Комментарии