Игорь Градов
Игорь Градов
5 мин
ai

Нейросеть ГЛМ 5.3 выросла в 6 раз на кодинге без переобучения: хватило пост-тренинга

GLM 5.3, нейросеть китайской компании Z.ai, получила заметный рост результатов в программировании и кибербезопасности без переобучения базовой модели, только за счёт расширенного пост-тренинга на тех же 743 миллиардах параметров.

Почему это важно

Все улучшения достигнуты без смены архитектуры и весов базовой модели: Z.ai показала, что масштабирование пост-тренинга (дополнительная тренировка уже готовой модели на новых задачах и средах) способно дать кратный прирост в сложных сценариях, и это меняет экономику доработки моделей для всех, кто работает с опенсорсом.

Z.ai выпустила GLM 5.3 как обновление предыдущей версии GLM 5.2. Базовая модель осталась прежней: те же 743 миллиарда параметров, та же архитектура. Все зафиксированные улучшения компания объясняет исключительно масштабированием пост-тренинга: больше типов задач, больше сред для обучения, более длительные циклы тренировки. По данным Marktechpost, результаты сосредоточены в двух областях: программирование на длинных горизонтах и кибербезопасность, где рост оказался неожиданным даже для самих разработчиков.

Показатель Значение Источник
Базовая модель 743B параметров, та же что у GLM 5.2 Z.ai (Marktechpost)
Terminal-Bench 3.0 с 4.6 до 28.3 Z.ai (Marktechpost)
DeepSWE v1.1 с 46.2 до 66.9 Z.ai (Marktechpost)
CyberGym 84.5% (было 77.2%) Z.ai (Marktechpost)
ExploitBench с 24.4% до 54.4% Z.ai (Marktechpost)
ExploitGym (2 часа / 6 часов) 105 / 130 задач (было 29 / 39) Z.ai (Marktechpost)
Z.ai Code Bench +50% к GLM 5.2, результат 31.4% Z.ai (Marktechpost)
Открытые веса ожидаются через ~2 недели после запуска Z.ai (Marktechpost)

Что именно измеряли?

Пост-тренинг (post-training) это этап, когда уже обученную модель дополнительно натаскивают на конкретных задачах и средах, не меняя её базовые веса. Представьте, что выпускника вуза не отправляют учиться заново, а дают ему больше стажировок в разных компаниях.

Z.ai проверяла GLM 5.3 на нескольких бенчмарках (тестовых наборах задач). Для программирования использовались Terminal-Bench 3.0 (задачи, требующие длительной работы в командной строке), DeepSWE v1.1 (исправление реальных ошибок в репозиториях) и внутренний тест Z.ai Code Bench. Для кибербезопасности: CyberGym (поиск уязвимостей в исходном коде), ExploitBench (построение работающего эксплойта от анализа причины до готового кода) и ExploitGym (количество выполненных задач за ограниченное время).

Компания также привела сравнение с конкурентами: Mythos 5, GPT-5.6 Sol и Claude (Opus 4.8 и Fable 5). Все цифры, по данным Marktechpost, заявлены самой Z.ai с указанием параметров тестирования.

Что обнаружили?

  • Программирование на длинных задачах: Terminal-Bench 3.0 вырос с 4.6 до 28.3, это более чем шестикратный скачок. DeepSWE v1.1 поднялся с 46.2 до 66.9.
  • Внутренний бенчмарк: на Z.ai Code Bench модель показала 31.4% при примерно 50 000 выходных токенов (единиц текста, которые модель генерирует) на задачу. Для сравнения: Claude Opus 4.8 набирает 29.5% при 120 000 токенов, то есть GLM 5.3 использует меньше вычислительных ресурсов на задачу. Claude Fable 5 лидирует с 39.5%.
  • Кибербезопасность стала сюрпризом: Z.ai добавляла данные по поиску уязвимостей, ожидая улучшения в анализе отдельных багов. Вместо этого модель начала выстраивать связные планы по целым цепочкам эксплуатации. CyberGym вырос до 84.5%, обойдя Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%).
  • ExploitBench удвоился: с 24.4% до 54.4%, хотя Mythos 5 по-прежнему впереди с 78.0%.
  • ExploitGym: за два часа модель выполняет 105 задач против 29 у предыдущей версии. За шесть часов: 130 против 39. Mythos 5 при этом выполняет 181 и 247 соответственно.
  • Закономерность: чем глубже в цепочке эксплуатации находится бенчмарк, тем больше прирост GLM 5.3 по сравнению с GLM 5.2, но и тем шире разрыв до закрытых моделей-лидеров.
Как это читать

Все приведённые цифры заявлены самой Z.ai. Независимого воспроизведения результатов пока нет. Открытые веса (файлы модели, которые позволяют запустить её самостоятельно) ещё не опубликованы: Z.ai обещает выложить их примерно через две недели после запуска, когда завершит оценку безопасности. До публикации весов проверить заявления на собственных задачах невозможно. На публичных бенчмарках GLM 5.3 уступает GPT-5.6 Sol и Fable 5 на ряде сложных тестов по программированию, компания это не скрывает.

Что делать с этим прямо сейчас?

Разработчикам и специалистам по безопасности в РФ. Скачок Terminal-Bench с 4.6 до 28.3 и рост ExploitBench более чем вдвое означает, что GLM 5.3, нейросеть на тех же весах, резко усилила позиции именно в задачах, которые требуют длительного рассуждения: рефакторинг больших репозиториев, разбор падений в CI, поиск уязвимостей в исходном коде. Когда веса откроют, модель можно будет развернуть локально, без зависимости от зарубежного API.

Авторам Дзена и контент-маркетологам. Сама модель пока не про тексты, но принцип «тот же фундамент, другой пост-тренинг» применим напрямую. Если вы работаете с открытыми моделями для генерации контента, эта история показывает: не обязательно ждать новую версию модели, иногда достаточно дообучить имеющуюся на ваших задачах.

Предпринимателям. GLM 5.3 уже доступна через API Z.ai и сервис ZCode. Веса появятся через две недели. Для компаний с требованиями к хранению данных на территории РФ это критично: пока весов нет, данные уходят на серверы Z.ai. Из доступных в России моделей для задач кодирования и безопасности стоит следить за GigaCode от Сбера и решениями на базе открытых моделей, которые можно развернуть локально.

Мнение редакции dzen.guru

Самый интересный вывод здесь не в конкретных процентах, а в том, что Z.ai не меняла базовую модель. 743 миллиарда параметров остались теми же, а результаты на ряде бенчмарков выросли кратно. Для индустрии это аргумент в пользу того, что «больше данных и сред для пост-тренинга» пока не исчерпал себя как стратегия. Для практиков в РФ принципиально важно дождаться открытых весов и проверить заявления на своих задачах. По моему опыту, разрыв между заявленными бенчмарками и реальной работой на русскоязычном коде и документации бывает заметным. Две недели ожидания, разумная цена за возможность проверить всё самостоятельно.

Кибербезопасный результат GLM 5.3 заслуживает отдельного внимания: модель научилась не просто находить баги, а выстраивать цепочки эксплуатации, и это произошло как побочный эффект масштабирования, а не целенаправленной настройки. Когда веса станут публичными, именно эта способность станет первым, что стоит проверить на реальных проектах.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ГЛМ 5.3 от Z.ai объединила агентный код и киберзащиту в одном открытом релизе
ai

ГЛМ 5.3 от Z.ai объединила агентный код и киберзащиту в одном открытом релизе

Компания Z.ai 14 августа 2026 года представила GLM 5.3, открытую языковую модель с фокусом на агентном программировании и киберзащите, и впервые дала практикам…

6 мин
ai

Искусственный интеллект Apple выходит в Китай: компания впервые обучила свою модель с Alibaba

Apple второго июня, по данным Reuters, обучила собственную языковую модель для Китая совместно с Alibaba, чтобы впервые вывести свой сервис искусственного…

4 мин
Google Sheets превращает таблицы в приложения: Gemini строит дашборды по промпту
ai

Google Sheets превращает таблицы в приложения: Gemini строит дашборды по промпту

Google Sheets научились превращать таблицы в мини-приложения: Gemini строит интерактивные дашборды по описанию на обычном языке, и это работает с кириллицей.…

4 мин