Две китайские нейросети собрали одну архитектуру порознь: совпали 4 из 4 ключевых решений
GLM 5.3 Flash от Z.ai и Qwen3.8 Flash Next от Alibaba вышли с разницей в один день, и обе китайские нейросети независимо пришли к почти одинаковой архитектуре: одинаковое соотношение линейного и полного внимания, одинаковое сжатие контекста и одинаковое число параллельных веток обработки.

Две крупные лаборатории из Китая, не сговариваясь, построили модели по одному чертежу. Когда конкуренты находят одни и те же инженерные решения порознь, это не совпадение, а признак того, что архитектура следующего поколения уже определилась.
Источник, издание, посвящённое разбору архитектур нейросетей, опубликовал детальное техническое сравнение двух релизов. Обе модели используют архитектуру MoE (Mixture of Experts, когда на каждый запрос активируется лишь малая часть параметров, остальные «спят», это экономит вычисления). Обе обучены оптимизатором Muon. Обе сжимают контекст до 2048 токенов (токен, это примерно одно слово или его часть) перед точным поиском по истории диалога. Обе разветвляют поток данных на четыре параллельные ветки вместо одной.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| GLM 5.3 Flash, мультимодальная модель (работает с текстом, изображениями и другими форматами), 320 млрд параметров, 18 млрд активных | На этой неделе | Z.ai, лицензия MIT | $0,15 за млн входных токенов, $0,50 за млн выходных |
| Qwen3.8 Flash Next, текстовая модель, 125 млрд параметров (+51 млрд таблица n-грамм), 6 млрд активных | На этой неделе (с разницей в один день) | Команда Qwen, Alibaba | Не раскрыта |
Что нового в каждой модели?
- GLM 5.3 Flash обучена на корпусе из 30 трлн токенов и поддерживает контекстное окно в 1 млн токенов. Z.ai анонимно тестировала модель на OpenRouter под именем Ox Alpha, где она стала самой популярной моделью недели. По заявлению Z.ai, модель превосходит предыдущую GLM 5.2 по бенчмаркам при цене в десять раз ниже.
- Qwen3.8 Flash Next играет роль публичного превью архитектуры следующего поколения Qwen4. Нативный контекст составляет 262 144 токена с возможностью расширения до 1 млн через метод YaRN. По данным команды Qwen, обучение потребовало примерно в девять раз меньше вычислений, чем Qwen3.7 Plus.
Четыре точки совпадения, которые не случайны
Три из четырёх слоёв внимания стали линейными. GLM 5.3 Flash использует 45 слоёв: 34 линейных и 11 полных. Qwen3.8 Flash Next использует 48 слоёв блоками по схеме «3 линейных + 1 полный». Итого одинаковое соотношение 3:1. Линейные слои не наращивают кеш с ростом текста, а сжимают историю в фиксированное состояние. Вычисления на один токен остаются постоянными вне зависимости от длины контекста.
Сжатие контекста через индексер до 2048 токенов. Ни одна из моделей не позволяет полным слоям внимания просматривать весь контекст целиком. Обе используют компактный обученный индексер (по сути маленькую нейросеть-оценщик), который отбирает только нужные фрагменты. GLM сжимает четыре вектора в один через взвешенное объединение, затем отбирает 2048 лучших. Qwen оценивает блоки по 4 токена и отбирает 512 лучших блоков, то есть те же 2048 токенов. По данным команды Qwen, QSA (их метод отбора) ускоряет предварительную обработку до 7,6 раза и декодирование до 4,9 раза по сравнению с полным вниманием при контексте в 1 млн токенов.
Четыре параллельные ветки вместо одной. Обе модели отказались от единого потока данных, стандартного в архитектуре трансформеров (transformer, базовая архитектура современных нейросетей) с 2017 года. Вместо этого данные расходятся по четырём веткам с управляющими «воротами». Команда Qwen проверила оба подхода (свой и вариант DeepSeek, который использует GLM) и обнаружила, что по качеству они равны.
Обучение оптимизатором Muon с разделением матриц. Обе команды перед ортогонализацией разделяют склеенные матрицы проекций на независимые части. Команда Qwen также отказалась от постепенного наращивания размера батча (batch-size warmup), измерив, что эта техника тратит на 18,8% больше шагов оптимизатора без улучшения результата.
Где модели расходятся?
Единственное принципиальное расхождение касается позиционного кодирования (способа, которым модель понимает порядок слов в тексте). GLM 5.3 Flash полностью отказывается от вращательных позиционных эмбеддингов (RoPE) в слоях полного внимания. Qwen3.8 Flash Next их сохраняет.
Как попробовать?
- GLM 5.3 Flash доступна на Hugging Face под лицензией MIT (открытая лицензия, разрешающая коммерческое использование). Модель также работает через OpenRouter.
- Qwen3.8 Flash Next опубликована командой Qwen с технической документацией. Карточка модели и рецепт развёртывания через vLLM доступны в открытом доступе.
Сравнение с доступными в России моделями
Из российских аналогов ближе всего по назначению YandexGPT и GigaChat от Сбера. Однако прямое сравнение некорректно: обе китайские нейросети опубликованы с открытыми весами (open weights, когда параметры модели можно скачать и запустить самостоятельно), тогда как российские модели остаются закрытыми и доступны только через API. Для практика это означает, что GLM 5.3 Flash и Qwen3.8 Flash Next можно развернуть на своём сервере и дообучить (fine-tuning, обучение модели на ваших примерах под узкую задачу) под свои задачи. С YandexGPT и GigaChat такой возможности нет.
Что делать с этим прямо сейчас, по ролям
Автору на Дзене. GLM 5.3 Flash стоит $0,15 за миллион входных токенов. Это позволяет массово генерировать черновики, рерайтить, проверять тексты через API за копейки. Qwen3.8 Flash Next активирует всего 6 млрд параметров на токен, значит её реально запустить на доступном железе.
Маркетологу. Мультимодальность GLM 5.3 Flash (текст плюс изображения) полезна для задач, где нужно анализировать визуальный контент вместе с текстом: карточки товаров, баннеры, скриншоты. Контекст в 1 млн токенов позволяет загружать целые документы без нарезки.
Предпринимателю в РФ. Обе модели доступны для скачивания и самостоятельного развёртывания. Санкционных ограничений на использование нет, лицензия MIT у GLM разрешает коммерческое применение. Для запуска полной модели на 320 млрд параметров нужны серьёзные GPU, но активных параметров у GLM всего 18 млрд, а у Qwen 6 млрд, что снижает требования к железу.
Совпадение архитектурных решений у двух независимых команд напоминает ситуацию, когда Лейбниц и Ньютон одновременно придумали исчисление. Когда задача созрела, решение находят все. Соотношение 3:1 линейных и полных слоёв, сжатие до 2048 токенов, четыре параллельные ветки, вероятно, станут стандартом для следующего поколения моделей. Для практика вывод простой: если вы выбираете между этими двумя китайскими нейросетями, GLM 5.3 Flash выигрывает по мультимодальности и длине контекста, а Qwen3.8 Flash Next требует в разы меньше вычислений на инференс (инференс, процесс генерации ответа моделью). Оговорка: заявления о производительности пока основаны на данных самих команд, независимых бенчмарков ещё мало.
Частые вопросы
Можно ли запустить эти модели на обычном компьютере?
Полные модели требуют GPU с большим объёмом видеопамяти. Однако благодаря архитектуре MoE активных параметров у GLM 5.3 Flash всего 18 млрд, а у Qwen3.8 Flash Next 6 млрд. Квантованные (сжатые) версии Qwen потенциально запускаются на потребительских видеокартах с 16+ ГБ памяти. GLM тяжелее, но через OpenRouter доступна без собственного железа.
Чем эти модели лучше ChatGPT или Claude для русскоязычного автора?
Главное преимущество не в качестве ответов на русском, а в цене и открытости. $0,15 за миллион токенов у GLM это на порядок дешевле Claude или GPT-4o. Открытые веса позволяют дообучить модель на своих данных, например на стиле конкретного канала. Качество русского языка у китайских нейросетей пока уступает, но для черновиков и аналитики разница некритична.
Зачем следить за архитектурными совпадениями, если я просто пишу тексты?
Архитектура определяет, что модель сможет через полгода. Линейное внимание 3:1 означает дешёвую работу с длинными текстами. Сжатие до 2048 токенов означает, что модель научилась выбирать главное из огромного контекста, а не просто «читать всё подряд». Для автора это значит: скоро загрузить книгу целиком и получить осмысленный анализ станет нормой, а не экспериментом.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Anthropic создала единый стандарт для ИИ-агентов: интеграция оборудования сжалась с недель до часов
Anthropic открыла исследовательскую предварительную версию Model Hardware Standard (MHS), общей спецификации, которая позволяет ИИ-агентам находить и управлять…

Pre-IPO компании в ИИ: как инвестору из РФ войти в Anthropic и OpenAI до биржи
Компания «ТРИНФИКО» второго июня опубликовала разбор рынка pre-IPO инвестиций в зарубежные ИТ- и ИИ-компании, объяснив, как российский квалифицированный…
ИИ-агенты в таск-трекере: таймауты и дубли оказались опаснее галлюцинаций
Автоматизация задач через ИИ-агентов звучит как мечта разработчика, но между «агент создал карточку» и «агент надёжно управляет проектом» лежит пропасть из…
Комментарии