Игорь Градов
Игорь Градов
5 мин
ai

GLM-5.3-Flash: нейросети модели MoE с 320 млрд параметров стали в 10 раз дешевле

Компания Z.ai выпустила GLM-5.3-Flash, первую мультимодальную модель серии GLM-5 с архитектурой смешанных экспертов (MoE, когда при обработке каждого запроса работает не вся нейросеть, а только небольшая её часть), обученную на 30 триллионах токенов и способную принимать текст, изображения и видео в контексте длиной до миллиона токенов.

GLM-5.3-Flash: нейросети модели MoE с 320 млрд параметров стали в 10 раз дешевле
Почему это важно

Впервые крупная открытая нейросеть модели MoE с миллионным контекстом и мультимодальностью обучена и обслуживается целиком на китайских чипах, при этом стоит в десять раз дешевле предшественника и выложена под свободной лицензией MIT, а значит доступна для коммерческого развёртывания практически без ограничений.

До сих пор модели нейросети такого масштаба (сотни миллиардов параметров, длинный контекст, мультимодальный вход) либо стоили существенно дороже, либо оставались закрытыми. Z.ai, по данным Marktechpost, выпустила GLM-5.3-Flash под MIT-лицензией с весами на Hugging Face и работающим API, фактически предложив рынку альтернативу и закрытым западным моделям, и открытым, но более дорогим предшественникам собственной линейки.

Показатель Значение Источник
Общее число параметров 320 млрд Z.ai, карточка модели
Активных параметров на токен 18 млрд Z.ai, карточка модели
Длина контекста 1 048 576 токенов Z.ai, карточка модели
Обучающий корпус 30 трлн токенов, мультимодальный Z.ai, карточка модели
Terminal-Bench 2.1 (кодинг) 84,3 Z.ai (собственный бенчмарк)
DeepSWE v1.1 63,4 Z.ai (собственный бенчмарк)
Intelligence Index v4.1.1 (Artificial Analysis) 57 баллов Artificial Analysis
Скорость генерации (API Z.ai) 48,7 токена/сек Artificial Analysis
TTFT (время до первого токена) 1,52 сек Artificial Analysis
Цена API (вход / кэш / выход) $0,15 / $0,03 / $0,50 за млн токенов Z.ai
Размер весов (FP8) около 306 ГиБ Z.ai, инструкция vLLM
Лицензия MIT Hugging Face

Что именно измеряли?

Z.ai сравнивала GLM-5.3-Flash с собственной предыдущей моделью GLM-5.2 и с закрытой Claude Opus 4.8 от Anthropic по набору задач, связанных с написанием и анализом кода. Главные бенчмарки: Terminal-Bench 2.1 (оценивает работу нейросети модели как терминального агента, то есть насколько она способна выполнять команды в командной строке) и DeepSWE v1.1 (проверяет умение решать реальные задачи из репозиториев кода).

Параллельно независимая площадка Artificial Analysis замерила скорость, задержку и общее качество ответов модели через свой Intelligence Index. Первую неделю модель работала анонимно под именем «Ox Alpha» на площадках OpenCode и OpenRouter, то есть пользователи оценивали её вслепую, не зная производителя.

Что обнаружили?

  • Кодинг на уровне дорогих закрытых моделей. По данным Z.ai, GLM-5.3-Flash набрала 84,3 балла на Terminal-Bench 2.1 и 63,4 на DeepSWE v1.1. Компания заявляет, что результат отстаёт от Claude Opus 4.8 менее чем на полбалла по внутреннему бенчмарку кодинга.
  • Десятикратное удешевление. Z.ai заявляет, что модель обходится примерно в десять раз дешевле GLM-5.2 при сопоставимом или лучшем качестве.
  • Гибридное внимание сокращает вычисления. Архитектура впервые в серии GLM сочетает линейное внимание (KDA, обрабатывает ближний контекст) и разреженное внимание (NoPE sparse MLA, извлекает нужное из дальнего контекста). По данным Z.ai, это даёт примерно трёхкратное снижение вычислений на внимание и KV-кэш (память, где модель хранит уже обработанный контекст) в 4,4 раза меньше, чем у GLM-5.3.
  • Работает на китайских чипах. Вся анонимная фаза «Ox Alpha» обслуживалась на отечественных китайских ускорителях через собственный движок на базе SGLang. Z.ai сообщает о трёхкратном ускорении сквозной обработки на десятках тысяч ускорителей.
  • Зрение пока слабее конкурентов. По данным Artificial Analysis, на задачах компьютерного зрения (бенчмарки BabyVision и MVbench) модель уступает Gemini 3.7 Flash от Google.
Как это читать

Большинство приведённых цифр качества (Terminal-Bench, DeepSWE, сравнение с Opus 4.8) получены самой Z.ai. Условия тестирования (температура генерации, лимиты контекста, судейские модели) различаются от бенчмарка к бенчмарку и указаны в сносках карточки модели. Прямое сравнение с другими нейросетями моделями по этим числам корректно только при одинаковых настройках. Независимая оценка Artificial Analysis подтверждает хорошее соотношение качества и цены, но отмечает медленную и многословную генерацию. Самостоятельный хостинг требует минимум 8 GPU поколения NVIDIA Hopper или новее, что делает его доступным только средним и крупным компаниям или стартапам, арендующим GPU-мощности.

Что это значит для вас?

Авторам Дзена и копирайтерам. Миллион токенов контекста и понимание изображений позволяют загрузить в модель сразу целую книгу, длинный отчёт или набор скриншотов и получить связный анализ или пересказ. API Z.ai доступен из России, цена входа ниже, чем у большинства закрытых западных моделей. Для тех, кто автоматизирует написание текстов или проверку материалов, это практичный рабочий инструмент.

Маркетологам и аналитикам. Модель позиционируется для анализа документов, таблиц, дашбордов, скриншотов UI. Если вы строите автоматизацию на API, стоимость $0,15 за миллион входных токенов делает массовую обработку документов экономически разумной. Из доступных в РФ аналогов для сравнения стоит смотреть на YandexGPT и GigaChat, но ни одна из этих моделей пока не заявляла миллионного контекста и MoE-архитектуры в открытом доступе.

Предпринимателям и разработчикам в РФ и СНГ. MIT-лицензия позволяет коммерческое использование без ограничений. Веса можно скачать с Hugging Face и развернуть локально, если есть подходящее оборудование. Если нет, API уже работает и принимает запросы. Ключевой нюанс: для самостоятельного развёртывания нужны GPU NVIDIA Hopper или новее, а это оборудование под санкционными ограничениями. Реалистичный путь для большинства команд из РФ: работа через API.

Мнение редакции dzen.guru

Модель интересна не рекордами в бенчмарках, а сочетанием практических свойств: открытые веса, свободная лицензия, мультимодальность, миллионный контекст и низкая цена API. Для русскоязычных пользователей важно, что Z.ai не блокирует доступ по региону, а китайская инфраструктура обслуживания на собственных чипах снижает зависимость от американских ограничений экспорта. Я бы рекомендовал протестировать модель на реальных задачах, прежде чем переносить рабочие нагрузки: независимые замеры Artificial Analysis показывают медленную генерацию и многословность, а зрение пока уступает Gemini 3.7 Flash. Но как рабочая лошадка для длинных документов и кода по низкой цене, GLM-5.3-Flash выглядит как один из лучших вариантов, доступных из России прямо сейчас.

Тот факт, что Z.ai неделю держала модель на публичных площадках анонимно и собирала отзывы вслепую, говорит о растущей уверенности китайских лабораторий в конкурентоспособности своих нейросетей моделей, и для пользователей из РФ это расширение выбора в момент, когда западные API один за другим закрывают доступ.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Gemini в Google Workspace для учёбы: 7 способов сэкономить часы на рутине
ai

Gemini в Google Workspace для учёбы: 7 способов сэкономить часы на рутине

Google Workspace с Gemini помогает студентам и преподавателям автоматизировать рутину учебного процесса, и вот семь конкретных способов, от планировщика…

7 мин
Arga Labs привлекла $10 млн на цифровые двойники для тренировки ИИ-агентов в корпоративном софте
ai

Arga Labs привлекла $10 млн на цифровые двойники для тренировки ИИ-агентов в корпоративном софте

Почему это важно Впервые появился инструмент, который позволяет обучать ИИ-агентов прямо внутри копии корпоративной системы, а не на упрощённых заглушках, и…

5 мин
ИИ-агенты для тестирования ботов: прототип из трёх ролей собрали за день, но 20% ошибок пока остаются
ai

ИИ-агенты для тестирования ботов: прототип из трёх ролей собрали за день, но 20% ошибок пока остаются

Почему это важно QA-инженер из российской компании Just AI собрал за один день прототип ИИ-агента, который уже находит баги в диалоговых ботах, и честно…

5 мин