Alibaba показала архитектуру Qwen4: контекст в миллион токенов обрабатывается в 8 раз быстрее
Почему это важно Alibaba выложила открытые веса модели, которая на контексте в миллион токенов работает в 7-8 раз быстрее предшественника, и назвала её…

Alibaba выложила открытые веса модели, которая на контексте в миллион токенов работает в 7-8 раз быстрее предшественника, и назвала её «предпросмотром архитектуры Qwen4». Для тех, кто запускает локальные ИИ-решения в России, это рабочий движок, а не обещание.
26 августа 2026 года команда Qwen (подразделение Alibaba Cloud) опубликовала Qwen3.8-Flash-Next с открытыми весами (open weights, когда разработчик выкладывает параметры модели для свободного скачивания) и прямо назвала её «experimental preview of the architecture that will underpin Qwen4». Полноценного Qwen4 пока не существует: нет ни отдельных весов, ни даты релиза. Но архитектурные решения, заложенные в эту модель, уже можно изучать и тестировать. Источник: официальный блог команды Qwen.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Qwen3.8-Flash-Next (предпросмотр архитектуры Qwen4) | 26 августа 2026 | Команда Qwen, Alibaba Cloud | Бесплатно, открытые веса |
Что поменялось в архитектуре?
Блог Qwen описывает четыре направления изменений: внимание, остаточный поток, эмбеддинги (векторные представления токенов) и оптимизатор. Вот что за этим стоит на практике.
-
Гибридное внимание GDN + QSA. 48 слоёв модели разбиты на 12 блоков. Три слоя в каждом блоке используют Gated DeltaNet (GDN), механизм, который сжимает историю диалога в состояние фиксированного размера, как непрерывно обновляемый конспект. Четвёртый слой включает Qwen Sparse Attention (QSA, разреженное внимание от Qwen): лёгкий индексатор нарезает последовательность на микроблоки, оценивает их важность целиком и отправляет на полноценное внимание только отобранные фрагменты. GDN держит общий сюжет, QSA бежит проверять конкретные улики.
-
Скорость на длинном контексте. По данным блога Qwen, на контексте в 1 миллион токенов (токен, минимальная единица текста для модели, примерно 3/4 слова) ядро QSA ускоряет предварительную обработку (prefill) до 7,6 раза, а генерацию (decode) до 4,9 раза по сравнению с полным вниманием. При типичном сценарии с 90-процентным попаданием в кеш модель выдаёт в 8,6 раза больше prefill-пропускной способности, чем Qwen3.7-Plus на том же миллионном контексте.
-
Gated Residual: четыре параллельные ветки вместо одной. В обычном трансформере (transformer, базовая архитектура современных языковых моделей) все слои читают и пишут в единый поток информации. Чем глубже сеть, тем сильнее ранние сигналы размываются. Gated Residual расширяет поток в четыре ветки, а динамический гейт (фильтр) сам определяет, сколько информации читать из каждой. По данным блога Qwen, одна из веток самостоятельно превращается в магистраль, соединяющую первый слой внимания с большинством последующих. Состояние потока при этом можно хранить в формате FP8, что снижает нагрузку на память.
-
N-gram embedding: модель «знает как 180 миллиардов, считает как 6». Обычный эмбеддинг сопоставляет вектор одному токену. N-gram embedding смотрит на текущий токен плюс несколько предыдущих и ищет соответствие в таблице примерно из 20 миллионов записей биграмм и триграмм. Таблицу необязательно держать в видеопамяти (VRAM), она живёт в обычной оперативной памяти и подгружается параллельно с вычислениями. Общий бюджет модели: 125 миллиардов параметров основных плюс 51 миллиард в отдельном слое N-gram, а активируется на каждый токен лишь 6 миллиардов. Формула эффектная, но, как отмечают в блоге, не до конца честная: хранить 51 миллиард параметров всё равно приходится, оптимизировали вычисления, а не объём памяти.
-
Оптимизатор Muon вместо AdamW. Модель обучена с помощью оптимизатора Muon, который заменил классический AdamW. Подробности доработок команда обещает в полном техотчёте.
Как попробовать Qwen3.8-Flash-Next?
- Скачайте открытые веса с официальной страницы модели на Hugging Face (ссылка опубликована в блоге команды Qwen от 26 августа 2026). Лицензия позволяет свободное использование.
- Для локального запуска потребуется машина с достаточным объёмом оперативной памяти: основные 125 миллиардов параметров плюс 51 миллиард N-gram-таблицы. Активных вычислений на каждый токен требуется лишь 6 миллиардов параметров, поэтому инференс (инференс, процесс генерации ответа обученной моделью) возможен на потребительском оборудовании с квантизацией.
- Протестируйте на длинном контексте: загрузите документ на несколько сотен страниц и задайте вопрос по конкретному фрагменту в конце. Именно здесь проявляется ускорение от QSA.
Qwen3.8-Flash-Next и российские аналоги
| Параметр | Qwen3.8-Flash-Next | YandexGPT / GigaChat |
|---|---|---|
| Доступ | Открытые веса, локальный запуск | Только через API провайдера |
| Контекстное окно | До 1 миллиона токенов | До 32 тысяч токенов (YandexGPT Pro), GigaChat Pro до 128 тысяч |
| Локальный запуск без интернета | Да | Нет |
| Русский язык | Поддерживается (модель обучена на 119 языках, данные по линейке Qwen3) | Оптимизированы под русский |
Для авторов и предпринимателей в России, кому критична работа с длинными документами на собственном сервере без передачи данных во внешний API, Qwen3.8-Flash-Next остаётся одним из немногих вариантов с открытыми весами и миллионным контекстом. YandexGPT и GigaChat лучше понимают русскоязычные тонкости, но не дают локального запуска и существенно ограничены по длине контекста.
Alibaba продолжает делать то, что мало кто в индустрии решается: выкладывать архитектурные новинки до финального релиза, с весами и техотчётом. Для российских разработчиков и тех, кто строит локальные решения, это подарок: можно обкатать движок будущего Qwen4 на своих задачах, пока конкуренты ждут закрытый релиз.
Оговорка: это именно предпросмотр, а не финальная модель. Производительность и стабильность могут измениться в релизной версии Qwen4, дату которого команда не называет. N-gram-таблица на 51 миллиард параметров требует оперативной памяти, «бесплатных» вычислений не бывает.
Что сделать сегодня: если вы автор на Дзене или маркетолог, пока просто следите за новостями о Qwen4 и не меняйте рабочие инструменты. Если вы разработчик или технический предприниматель, скачайте веса и протестируйте на задаче с длинным контекстом: обработка договоров, анализ переписок, сборка отчётов из десятков источников. Именно тут ускорение в 7-8 раз перестаёт быть абстрактной цифрой.
Что делать с этим прямо сейчас, по ролям
Автору Дзена. Qwen3.8-Flash-Next пока не заменит привычный ChatGPT или YandexGPT в ежедневной работе: для коротких текстов разницы в скорости вы не заметите. Но если вы работаете с длинными исследованиями, книгами или архивами публикаций, локальная модель с миллионным контекстом позволяет загрузить весь материал целиком и задавать точечные вопросы без потери контекста.
Маркетологу. Модель с открытыми весами можно встроить в корпоративный пайплайн без передачи клиентских данных наружу. Для компаний, работающих с персональными данными в РФ, это аргумент при выборе между API-сервисами и собственным решением.
Предпринимателю в РФ. Открытые веса и лицензия без ограничений на коммерческое использование означают, что можно строить продукт без зависимости от зарубежного API, который в любой момент может стать недоступен. Проверьте, хватит ли вашего серверного оборудования: 6 миллиардов активных параметров на токен, но хранить нужно все 176 миллиардов.
Частые вопросы
Qwen4 уже вышел?
Нет. Полноценного Qwen4 на момент публикации не существует. Вышла модель Qwen3.8-Flash-Next, которую команда Qwen называет «экспериментальным предпросмотром архитектуры, которая ляжет в основу Qwen4». Дату релиза Qwen4 разработчики не называют.
Можно ли запустить модель на обычном компьютере?
Запустить можно, но с оговорками. Активных вычислений на каждый токен требуется лишь 6 миллиардов параметров, что сопоставимо с небольшими локальными моделями. Однако хранить нужно все 176 миллиардов параметров (125 основных плюс 51 N-gram-таблица), поэтому потребуется значительный объём оперативной памяти. С квантизацией (сжатием точности параметров) запуск возможен на машинах с 64 и более гигабайтами RAM.
Чем эта модель лучше предыдущих версий Qwen?
Ключевое отличие не в «лучше», а в архитектуре. Гибридная схема GDN + QSA позволяет обрабатывать контекст в миллион токенов в 7-8 раз быстрее, чем предыдущие модели линейки с полным вниманием. Для коротких запросов разница минимальна; выигрыш проявляется на длинных документах и сложных задачах с большим объёмом входных данных.
Архитектура Qwen4 пока существует только в форме предпросмотра, но этот предпросмотр уже можно скачать, разобрать и встроить в рабочий процесс. Для тех, кто строит ИИ-решения в России на открытых моделях, это не абстрактный анонс, а рабочий инструмент с конкретными цифрами ускорения.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…
Комментарии