Игорь Градов
Игорь Градов
6 мин
aggregator

GLM 5.3 вышла на второе место в Terminal Bench, наращивая качество без роста параметров

Компания Zhipu AI (создатели семейства GLM) 18 августа 2026 года выпустила GLM 5.3, открытую рассуждающую модель, которая поднялась на второе место в Terminal Bench и третье в Legal Bench среди моделей с открытыми весами, сделав ставку не на размер, а на синтетические тренировочные среды.

GLM 5.3 вышла на второе место в Terminal Bench, наращивая качество без роста параметров
Почему это важно

GLM 5.3 показывает, что наращивать параметры больше не главный путь к результату: модель прибавила в качестве исключительно за счёт обучения с подкреплением (RL) в долгих синтетических сценариях, воспроизводящих реальную инженерную работу.

Результаты GLM 5.3 опубликовал профессор Цзе Тан, руководитель проекта, в серии постов 18 августа. По данным независимых бенчмарков, которые приводит Latent Space, модель заняла второе место на Terminal Bench, третье на Legal Bench и шестое на Skills Bench среди всех моделей с открытыми весами (open weights, когда разработчик публикует параметры модели и любой может её запустить у себя). Это заметный скачок по сравнению с предыдущей GLM 5.2, которую тот же источник ранее отмечал как сильного участника «ценностного фронтира» на Agent Arena, рейтинге ИИ-агентов.

Что Когда Кто выпустил Цена
GLM 5.3, открытая рассуждающая модель 18 августа 2026 года Zhipu AI (Китай) Открытые веса, цену API источник не раскрыл

Пять «ручек настройки» вместо гонки параметров

Профессор Цзе Тан сформулировал тезис, который меняет привычное восприятие размера модели. Количество параметров имеет смысл только вместе с тремя другими величинами: объёмом данных, распределением вычислений и условиями, в которых модель будет работать.

Источник выделяет пять «ручек масштабирования», включая разреженность MoE (Mixture of Experts, архитектура, где модель активирует только часть своих «экспертов» на каждый запрос) с новой нотацией XA-YB. Ключевое наблюдение: сложные навыки вроде поиска уязвимостей в коде не сводятся к запоминанию. Они требуют выстраивания длинных причинно-следственных цепочек (20 и более шагов инференса, то есть рассуждения модели) без потери нити. Эта способность не растёт от простого увеличения числа параметров после того, как достигнут определённый порог «хранения знаний».

Прежние законы масштабирования Chinchilla (правила 2022 года, определявшие оптимальное соотношение параметров и данных) оказались неточны в эпоху, когда модели всё больше рассуждают на этапе инференса. По данным Roberts et al., которые цитирует источник, оптимальное число токенов (единиц текста, которые модель обрабатывает) на параметр варьируется от 200 до 900 в зависимости от задачи. Фиксированного «правильного» числа не существует.

Как синтетические среды заменяют ручную разметку?

Главный прирост GLM 5.3 получен исключительно из обучения с подкреплением (RL, reinforcement learning, когда модель учится через пробы и ошибки в среде с обратной связью) в долгих синтетических сценариях. Вот что это означает на практике:

  • Среды воспроизводят реальную инженерную работу. Модели дают то же рабочее окружение, что и инженеру: доступ к вычислительным кластерам, системам хранения, внутренней документации, кодовым базам и результатам экспериментов. Задача может занимать несколько дней работы опытного специалиста.
  • Пример задачи: оптимизация ML-инфраструктуры. Модель должна диагностировать узкие места во всём стеке обучения, реализовать оптимизации, провести эксперименты и выдать измеримое сквозное ускорение, сохранив корректность результата.
  • Цель: модель берёт на себя задачу целиком. Тренировка на средах такого уровня подталкивает модель к самостоятельному ведению работы от начала до конца, без того чтобы пользователь декомпозировал проблему и контролировал каждый шаг.

Синтетика «до самого дна»

Весь процесс создания сред, проверки и вознаграждения тоже синтетический, без ручного труда:

  • Исследовательские ИИ-агенты собирают паттерны задач из реальной работы и превращают их в запускаемые долгие среды с многошаговыми зависимостями и скрытым состоянием.
  • Агент-судья проверяет каждую задачу на решаемость.
  • Верификаторы создаются без доступа к эталонному решению. Траектории решателей используются для обнаружения и закрытия «лазеек в наградах» (когда модель находит короткий путь, не решая задачу по существу).
  • Верификатор, прошедший проверки на эталон, бездействие и нерешённое состояние, даёт бинарную награду, достаточно надёжную для прямого обучения.

Профессор Тан отмечает, что по мере роста агентных способностей основная сложность масштабирования постобучения смещается с модели на среду.

Как попробовать GLM 5.3?

  1. Перейти на официальную страницу Zhipu AI (chatglm.cn). Модель распространяется с открытыми весами, конкретную лицензию источник не уточняет.
  2. Для локального запуска потребуется серверное оборудование. Источник не называет минимальные требования, но по аналогии с моделями сопоставимого класса речь идёт о нескольких GPU.
  3. Проверить актуальные результаты бенчмарков на Terminal Bench и Legal Bench, чтобы сравнить с конкурентами.

GLM 5.3 и российские аналоги: что доступно в РФ?

Параметр GLM 5.3 (Zhipu AI, Китай) YandexGPT (Россия) GigaChat (Россия)
Открытые веса Да Нет Нет
Фокус на агентные задачи Да, RL в долгих средах Данных об аналогичном подходе нет Данных об аналогичном подходе нет
Доступ из РФ Возможны ограничения, сервер в Китае Полный Полный
Язык интерфейса Китайский, английский Русский Русский

Для пользователей из России YandexGPT и GigaChat остаются доступнее: русскоязычный интерфейс, серверы внутри страны, поддержка на русском. Но методология GLM 5.3 (обучение в синтетических производственных средах) сама по себе представляет ценность для российских ML-инженеров, которые строят собственные пайплайны обучения.

Что делать с этим прямо сейчас, по ролям

ML-инженерам и разработчикам в РФ. Методология GLM 5.3 применима независимо от модели. Идея: создавать синтетические среды, воспроизводящие ваши производственные задачи (диагностика кластеров, оптимизация пайплайнов), и обучать на них с подкреплением. Источник подробно описывает архитектуру верификаторов, это готовый шаблон для собственных экспериментов.

Авторам Дзена и контент-маркетологам. Тренд «размер не главное» меняет угол подачи: писать про модели теперь стоит не через количество параметров, а через то, какие задачи модель способна закрыть от начала до конца. Это работает и как тема для контента, и как критерий выбора инструмента.

Предпринимателям. Открытые веса GLM 5.3 означают, что модель можно развернуть на своей инфраструктуре без подписки. Для компаний, которым важен контроль данных, это существенно. Но нужно учитывать: запуск моделей такого класса требует серьёзных GPU, а поддержка русского языка не заявлена.

Мнение редакции dzen.guru

GLM 5.3 интересна не столько как продукт, сколько как манифест: Zhipu AI в открытую показывает, что гонка параметров для них закончена. По моим наблюдениям, это совпадает с тем, что мы видим и у других команд: DeepSeek, Qwen, Kimi двигаются в ту же сторону. Для практиков из РФ главная ценность здесь не в самой модели (доступ из России неудобен), а в опубликованной методологии синтетических сред. Если вы строите ML-пайплайны, разберите описание верификаторов из поста профессора Тана: там готовый рецепт, как автоматизировать создание обучающих задач без ручной разметки. Оговорка: бенчмарки Terminal Bench и Legal Bench не покрывают русскоязычные задачи, поэтому переносить результаты на работу с русским текстом напрямую нельзя.

Частые вопросы

GLM 5.3 работает на русском языке?

Источник не упоминает поддержку русского языка. Предыдущие модели GLM были ориентированы на китайский и английский. Для задач на русском языке пока надёжнее использовать YandexGPT или GigaChat, либо тестировать GLM 5.3 на английском.

Чем GLM 5.3 отличается от GLM 5.2?

По данным источника, основной прирост GLM 5.3 получен из обучения с подкреплением в долгих синтетических средах, воспроизводящих реальные инженерные задачи. GLM 5.2 отмечалась как сильная модель на Agent Arena по соотношению цены и качества, но конкретных числовых сравнений между версиями источник не приводит.

Можно ли запустить GLM 5.3 на обычном компьютере?

Нет. Модели такого класса требуют серверного оборудования с несколькими GPU. Точные минимальные требования источник не раскрывает. Для экспериментов без своего оборудования стоит дождаться появления квантизированных версий (уменьшенных копий модели, которые требуют меньше памяти) от сообщества.

Если методология синтетических сред вас заинтересовала, начните с малого: опишите одну свою производственную задачу как среду с входом, действиями и проверяемым результатом, и попробуйте обучить на ней даже небольшую открытую модель. Именно этот подход, а не размер модели, по данным Zhipu AI, даёт рост качества.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Cursor AI запустила хостинг кода Origin в день шестичасового сбоя GitHub
aggregator

Cursor AI запустила хостинг кода Origin в день шестичасового сбоя GitHub

Cursor запустила Origin, платформу для хранения кода с встроенными ИИ-агентами, в тот самый день, когда GitHub лежал больше шести часов, и впервые предложила…

4 мин
AI агент Manus и его конкуренты: что умеют личные помощники на десктопе в 2025 году
aggregator

AI агент Manus и его конкуренты: что умеют личные помощники на десктопе в 2025 году

Источник: Ben's Bites (рассылка) Рассылка Ben's Bites от июня 2025 года собрала в одном выпуске главные запуски недели вокруг персональных ИИ-агентов…

5 мин
Какой уровень модели OSI отвечает за маршрутизацию и при чём тут экономия на ИИ
aggregator

Какой уровень модели OSI отвечает за маршрутизацию и при чём тут экономия на ИИ

Компании всё чаще выбирают не одну модель ИИ, а систему, которая сама решает, какую модель подключить к конкретной задаче, и платформа Glean, утроившая выручку…

5 мин