Игорь Градов
Игорь Градов
6 мин
ai

Alibaba показала архитектуру Qwen4: контекст в миллион токенов обрабатывается в 8 раз быстрее

Почему это важно Alibaba выложила открытые веса модели, которая на контексте в миллион токенов работает в 7-8 раз быстрее предшественника, и назвала её…

Alibaba показала архитектуру Qwen4: контекст в миллион токенов обрабатывается в 8 раз быстрее
Почему это важно

Alibaba выложила открытые веса модели, которая на контексте в миллион токенов работает в 7-8 раз быстрее предшественника, и назвала её «предпросмотром архитектуры Qwen4». Для тех, кто запускает локальные ИИ-решения в России, это рабочий движок, а не обещание.

26 августа 2026 года команда Qwen (подразделение Alibaba Cloud) опубликовала Qwen3.8-Flash-Next с открытыми весами (open weights, когда разработчик выкладывает параметры модели для свободного скачивания) и прямо назвала её «experimental preview of the architecture that will underpin Qwen4». Полноценного Qwen4 пока не существует: нет ни отдельных весов, ни даты релиза. Но архитектурные решения, заложенные в эту модель, уже можно изучать и тестировать. Источник: официальный блог команды Qwen.

Что Когда Кто выпустил Цена
Qwen3.8-Flash-Next (предпросмотр архитектуры Qwen4) 26 августа 2026 Команда Qwen, Alibaba Cloud Бесплатно, открытые веса

Что поменялось в архитектуре?

Блог Qwen описывает четыре направления изменений: внимание, остаточный поток, эмбеддинги (векторные представления токенов) и оптимизатор. Вот что за этим стоит на практике.

  • Гибридное внимание GDN + QSA. 48 слоёв модели разбиты на 12 блоков. Три слоя в каждом блоке используют Gated DeltaNet (GDN), механизм, который сжимает историю диалога в состояние фиксированного размера, как непрерывно обновляемый конспект. Четвёртый слой включает Qwen Sparse Attention (QSA, разреженное внимание от Qwen): лёгкий индексатор нарезает последовательность на микроблоки, оценивает их важность целиком и отправляет на полноценное внимание только отобранные фрагменты. GDN держит общий сюжет, QSA бежит проверять конкретные улики.

  • Скорость на длинном контексте. По данным блога Qwen, на контексте в 1 миллион токенов (токен, минимальная единица текста для модели, примерно 3/4 слова) ядро QSA ускоряет предварительную обработку (prefill) до 7,6 раза, а генерацию (decode) до 4,9 раза по сравнению с полным вниманием. При типичном сценарии с 90-процентным попаданием в кеш модель выдаёт в 8,6 раза больше prefill-пропускной способности, чем Qwen3.7-Plus на том же миллионном контексте.

  • Gated Residual: четыре параллельные ветки вместо одной. В обычном трансформере (transformer, базовая архитектура современных языковых моделей) все слои читают и пишут в единый поток информации. Чем глубже сеть, тем сильнее ранние сигналы размываются. Gated Residual расширяет поток в четыре ветки, а динамический гейт (фильтр) сам определяет, сколько информации читать из каждой. По данным блога Qwen, одна из веток самостоятельно превращается в магистраль, соединяющую первый слой внимания с большинством последующих. Состояние потока при этом можно хранить в формате FP8, что снижает нагрузку на память.

  • N-gram embedding: модель «знает как 180 миллиардов, считает как 6». Обычный эмбеддинг сопоставляет вектор одному токену. N-gram embedding смотрит на текущий токен плюс несколько предыдущих и ищет соответствие в таблице примерно из 20 миллионов записей биграмм и триграмм. Таблицу необязательно держать в видеопамяти (VRAM), она живёт в обычной оперативной памяти и подгружается параллельно с вычислениями. Общий бюджет модели: 125 миллиардов параметров основных плюс 51 миллиард в отдельном слое N-gram, а активируется на каждый токен лишь 6 миллиардов. Формула эффектная, но, как отмечают в блоге, не до конца честная: хранить 51 миллиард параметров всё равно приходится, оптимизировали вычисления, а не объём памяти.

  • Оптимизатор Muon вместо AdamW. Модель обучена с помощью оптимизатора Muon, который заменил классический AdamW. Подробности доработок команда обещает в полном техотчёте.

Как попробовать Qwen3.8-Flash-Next?

  1. Скачайте открытые веса с официальной страницы модели на Hugging Face (ссылка опубликована в блоге команды Qwen от 26 августа 2026). Лицензия позволяет свободное использование.
  2. Для локального запуска потребуется машина с достаточным объёмом оперативной памяти: основные 125 миллиардов параметров плюс 51 миллиард N-gram-таблицы. Активных вычислений на каждый токен требуется лишь 6 миллиардов параметров, поэтому инференс (инференс, процесс генерации ответа обученной моделью) возможен на потребительском оборудовании с квантизацией.
  3. Протестируйте на длинном контексте: загрузите документ на несколько сотен страниц и задайте вопрос по конкретному фрагменту в конце. Именно здесь проявляется ускорение от QSA.

Qwen3.8-Flash-Next и российские аналоги

Параметр Qwen3.8-Flash-Next YandexGPT / GigaChat
Доступ Открытые веса, локальный запуск Только через API провайдера
Контекстное окно До 1 миллиона токенов До 32 тысяч токенов (YandexGPT Pro), GigaChat Pro до 128 тысяч
Локальный запуск без интернета Да Нет
Русский язык Поддерживается (модель обучена на 119 языках, данные по линейке Qwen3) Оптимизированы под русский

Для авторов и предпринимателей в России, кому критична работа с длинными документами на собственном сервере без передачи данных во внешний API, Qwen3.8-Flash-Next остаётся одним из немногих вариантов с открытыми весами и миллионным контекстом. YandexGPT и GigaChat лучше понимают русскоязычные тонкости, но не дают локального запуска и существенно ограничены по длине контекста.

Мнение редакции dzen.guru

Alibaba продолжает делать то, что мало кто в индустрии решается: выкладывать архитектурные новинки до финального релиза, с весами и техотчётом. Для российских разработчиков и тех, кто строит локальные решения, это подарок: можно обкатать движок будущего Qwen4 на своих задачах, пока конкуренты ждут закрытый релиз.

Оговорка: это именно предпросмотр, а не финальная модель. Производительность и стабильность могут измениться в релизной версии Qwen4, дату которого команда не называет. N-gram-таблица на 51 миллиард параметров требует оперативной памяти, «бесплатных» вычислений не бывает.

Что сделать сегодня: если вы автор на Дзене или маркетолог, пока просто следите за новостями о Qwen4 и не меняйте рабочие инструменты. Если вы разработчик или технический предприниматель, скачайте веса и протестируйте на задаче с длинным контекстом: обработка договоров, анализ переписок, сборка отчётов из десятков источников. Именно тут ускорение в 7-8 раз перестаёт быть абстрактной цифрой.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Qwen3.8-Flash-Next пока не заменит привычный ChatGPT или YandexGPT в ежедневной работе: для коротких текстов разницы в скорости вы не заметите. Но если вы работаете с длинными исследованиями, книгами или архивами публикаций, локальная модель с миллионным контекстом позволяет загрузить весь материал целиком и задавать точечные вопросы без потери контекста.

Маркетологу. Модель с открытыми весами можно встроить в корпоративный пайплайн без передачи клиентских данных наружу. Для компаний, работающих с персональными данными в РФ, это аргумент при выборе между API-сервисами и собственным решением.

Предпринимателю в РФ. Открытые веса и лицензия без ограничений на коммерческое использование означают, что можно строить продукт без зависимости от зарубежного API, который в любой момент может стать недоступен. Проверьте, хватит ли вашего серверного оборудования: 6 миллиардов активных параметров на токен, но хранить нужно все 176 миллиардов.

Частые вопросы

Qwen4 уже вышел?

Нет. Полноценного Qwen4 на момент публикации не существует. Вышла модель Qwen3.8-Flash-Next, которую команда Qwen называет «экспериментальным предпросмотром архитектуры, которая ляжет в основу Qwen4». Дату релиза Qwen4 разработчики не называют.

Можно ли запустить модель на обычном компьютере?

Запустить можно, но с оговорками. Активных вычислений на каждый токен требуется лишь 6 миллиардов параметров, что сопоставимо с небольшими локальными моделями. Однако хранить нужно все 176 миллиардов параметров (125 основных плюс 51 N-gram-таблица), поэтому потребуется значительный объём оперативной памяти. С квантизацией (сжатием точности параметров) запуск возможен на машинах с 64 и более гигабайтами RAM.

Чем эта модель лучше предыдущих версий Qwen?

Ключевое отличие не в «лучше», а в архитектуре. Гибридная схема GDN + QSA позволяет обрабатывать контекст в миллион токенов в 7-8 раз быстрее, чем предыдущие модели линейки с полным вниманием. Для коротких запросов разница минимальна; выигрыш проявляется на длинных документах и сложных задачах с большим объёмом входных данных.

Архитектура Qwen4 пока существует только в форме предпросмотра, но этот предпросмотр уже можно скачать, разобрать и встроить в рабочий процесс. Для тех, кто строит ИИ-решения в России на открытых моделях, это не абстрактный анонс, а рабочий инструмент с конкретными цифрами ускорения.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
ai

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus

Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

6 мин
Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
ai

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости

Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

5 мин
Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
ai

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»

Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…

6 мин