Игорь Градов
Игорь Градов
6 мин
ai

Qwen3.8 от Alibaba активирует 6 из 180 млрд параметров: обучение дешевле в 9 раз

Alibaba Qwen выпустила Qwen3.8-Flash-Next, открытую мультимодальную модель на 180 миллиардов параметров, которая активирует при обработке каждого токена (минимальной единицы текста) всего 6 миллиардов, что, по данным разработчиков, сократило стоимость обучения примерно в 9 раз.

Qwen3.8 от Alibaba активирует 6 из 180 млрд параметров: обучение дешевле в 9 раз
Почему это важно

Qwen Alibaba показала, как архитектура MoE (Mixture-of-Experts, смесь экспертов, когда модель использует лишь малую часть своих «мозгов» на каждый запрос) позволяет получить результаты уровня топовых закрытых моделей при радикально меньших затратах на обучение. Для команд с ограниченным бюджетом на GPU это прямой путь к работе с большими моделями.

Модель опубликована командой Qwen Alibaba как предварительная версия архитектуры, которая ляжет в основу будущего поколения Qwen4. По информации Marktechpost, Qwen3.8-Flash-Next повторяет роль, которую ранее сыграла Qwen3-Next для линейки Qwen3.5: публичный тест новых решений перед основным релизом. Лицензия не Apache-2.0, а qwen-community-1.0, и перед коммерческим использованием её условия нужно проверить отдельно.

Что Когда Кто выпустил Цена
Qwen3.8-Flash-Next, открытая мультимодальная MoE-модель (открытые веса) Июль 2025 (точную дату разработчик не назвал) Команда Qwen, Alibaba Открытые веса, лицензия qwen-community-1.0 (не Apache-2.0)

Четыре архитектурных решения, которые отличают модель

  • Гибридное внимание GDN + QSA. Три из каждых четырёх слоёв используют Gated DeltaNet, линейный слой внимания, который сжимает историю контекста в компактное состояние фиксированного размера. Четвёртый слой работает на Qwen Sparse Attention (QSA), выбирая контекст не по отдельным токенам, а блоками. Всего 48 слоёв, 12 повторяющихся блоков по схеме «3 GDN + 1 QSA». По данным Qwen, ядро QSA ускоряет обработку входного контекста (prefill) до 7,6 раза и декодирование до 4,9 раза на миллионе токенов.
  • Gated Residual. Остаточный поток расширен до 4 параллельных веток с поэлементным чтением и побранчевой записью. Ранг узкого места составляет 320.
  • N-gram Embedding. Таблица из 20 миллионов биграмм и триграмм на втором слое добавляет ёмкость через детерминированные подстановки. Таблицу можно выгрузить в оперативную память хоста с асинхронной предзагрузкой, но пока эта функция работает только на устройствах NVIDIA.
  • Оптимизатор Muon. Применяется вместе с AdamW к определённым категориям весов. Прогрев размера батча убран, законы масштабирования пересчитаны.

MoE-слой содержит 512 экспертов. На каждый токен активируются 10 маршрутизируемых плюс 1 общий при промежуточной размерности эксперта 640.

Бенчмарки: где модель сильна, а где уступает?

По данным команды Qwen, модель набирает 91,9 на LiveCodeBench v6, 81,0 на SWE-bench Multilingual, 62,5 на SWE-bench Pro. В агентных задачах (где ИИ-агент самостоятельно выполняет цепочку действий): 73,9 на CoWorkBench, 73,5 на Toolathlon Verified. Мультимодальные результаты: 84,5 на AndroidWorld, 95,7 на MathVision с интерпретатором кода.

При этом модель не лидирует везде. Claude Opus 4.6 (Max) обходит её на бенчмарке HLE: 40,0 против 35,9. DeepSeek-V4-Flash-0731 ведёт на NL2Repo-Bench: 54,2 против 48,1. Фронтирное рассуждение (frontier reasoning) остаётся слабым местом.

Все цифры приведены командой Qwen и пока не подтверждены независимыми измерениями.

Контекст 262 тысячи токенов и требования к железу

Нативное контекстное окно (сколько текста модель «видит» за один раз) составляет 262 144 токена с возможностью расширения до 1 000 000 через метод YaRN. По данным Qwen, при 90%-м попадании в кеш префиксов пропускная способность на входе в 8,6 раза выше, чем у Qwen3.7-Plus.

Контрольная точка в формате FP8 весит 172,78 ГиБ, в BF16 составляет 335,28 ГиБ. Это означает, что запустить модель на рабочей станции не получится: минимальная валидированная конфигурация для FP8 требует двух GPU (TP2) на узле GB300, рекомендуется четыре (TP4). На узле 8×H200 нужен режим TEP8, обычный TP8 несовместим с 128-битными блоками квантизации.

Как попробовать?

  1. Через облако. Модель уже работает в режиме «Standard» на платформе QwenWork и совместима с Qwen Code. Режим рассуждения включён по умолчанию (параметр reasoning_effort: xhigh, medium или low).
  2. Локально, если есть мощный сервер. Модель поддерживается через vLLM, SGLang, TokenSpeed, transformers serve и llama.cpp (для GGUF-квантов). Рекомендуемые настройки для режима рассуждения: temperature 1.0, top_p 0.95. Для режима инструкций: temperature 0.7, top_p 0.80.
  3. Дообучение. Поддерживается через Unsloth, Swift и LLaMA-Factory.

Сравнение с российскими аналогами

Прямого аналога Qwen3.8-Flash-Next с открытыми весами среди российских моделей нет. YandexGPT и GigaChat от Сбера работают как закрытые модели (доступ только через API), не публикуют веса и не дают возможности локального запуска или дообучения на своих данных.

Qwen3.8-Flash-Next (Alibaba) YandexGPT / GigaChat
Открытые веса Да (qwen-community-1.0) Нет
Локальный запуск Да, но нужен многопроцессорный сервер Только через API
Дообучение на своих данных Да (Unsloth, Swift, LLaMA-Factory) Ограниченно (API дообучения у Яндекса)
Контекстное окно 262 тысячи токенов (до 1 миллиона) До 32 тысяч (YandexGPT)

Для российских разработчиков и предпринимателей, у которых есть доступ к GPU-серверам, модель Qwen Alibaba позволяет работать с большими моделями без зависимости от API и без передачи данных наружу.

Кому это полезно и что делать прямо сейчас?

Автору Дзена и копирайтеру. Попробовать QwenWork в режиме «Standard» для генерации черновиков. Режим рассуждения помогает модели давать более продуманные ответы, но потребляет больше токенов, поэтому стоит начать с reasoning_effort: low.

Маркетологу. Если вы работаете с мультимодальным контентом (текст + изображения + код), эта модель закрывает все три задачи в одном инструменте. Но результаты бенчмарков ещё не подтверждены независимо, для продакшен-задач пока рискованно.

Разработчику и предпринимателю в РФ. Снижение стоимости обучения в 9 раз (по данным Qwen) при архитектуре MoE с активацией 6 миллиардов параметров из 180 миллиардов делает эксперименты с большими моделями доступнее. Но нужен сервер с несколькими GPU уровня H200 или GB300. Перед коммерческим использованием обязательно проверьте лицензию qwen-community-1.0.

Мнение редакции dzen.guru

Qwen Alibaba продолжает выдавать открытые модели, которые по бенчмаркам подбираются к уровню Claude и GPT. Архитектура с активацией 6 миллиардов параметров из 180 выглядит как реальный способ снизить порог входа для тех, у кого нет бюджета OpenAI. По моим наблюдениям, для русскоязычных задач модели Qwen пока уступают GPT-4o и Claude в качестве стилистики, но в кодовых и агентных сценариях работают сопоставимо. Оговорка: все бенчмарки самодекларированные, независимых замеров нет. Рекомендую сегодня зайти на QwenWork, протестировать на своих типовых промптах и сравнить с тем, чем вы пользуетесь сейчас. Потратите полчаса, зато поймёте, стоит ли копать глубже.

Частые вопросы

Можно ли запустить Qwen3.8-Flash-Next на обычном компьютере?

Нет. Контрольная точка FP8 весит почти 173 ГиБ. Нужен сервер с несколькими GPU уровня H200 или GB300. Для знакомства с моделью проще начать через QwenWork в браузере.

Чем отличается от предыдущей Qwen3.7-Plus?

По данным команды Qwen, стоимость обучения снижена примерно в 9 раз за счёт MoE-архитектуры с активацией лишь 6 миллиардов параметров на токен. Добавлены четыре новых архитектурных решения: гибридное внимание GDN + QSA, Gated Residual, N-gram Embedding и оптимизатор Muon. Контекст расширен до 262 тысяч токенов нативно.

Лицензия позволяет коммерческое использование?

Модель выпущена под лицензией qwen-community-1.0, а не под привычной Apache-2.0. Команда Qwen рекомендует проверить условия перед использованием в коммерческих проектах. Точные ограничения изложены в карточке модели на Hugging Face.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Умные очки вместо слухового аппарата: стартап Legato привлёк $12 млн на ИИ-оправы
ai

Умные очки вместо слухового аппарата: стартап Legato привлёк $12 млн на ИИ-оправы

Microsoft представила Scout, агента, который сам ведёт вашу почту и встречи без команд Стартап Legato вышел из скрытого режима 4 июня с раундом на 12 миллионов…

5 мин
Гейтс предложил налог на роботов, чтобы замедлить замену людей машинами
ai

Гейтс предложил налог на роботов, чтобы замедлить замену людей машинами

Билл Гейтс опубликовал на своём сайте Gates Notes большое эссе о социальных последствиях развития искусственного интеллекта, в котором предложил два конкретных…

5 мин
Стартапы с искусственным интеллектом в энергетике
ai

Стартапы с искусственным интеллектом в энергетике

Google набрал 28 стартапов, где искусственный интеллект решает задачи энергетики, от виртуальных электростанций до дронов, ремонтирующих ветряки в десять раз…

6 мин