Открытые модели ИИ догоняют лидеров
Открытые модели ИИ набрали мощность, но не научились отказывать: китайская GLM-5.2 выполнила все опасные запросы, тогда как Claude не позволил завершить ни одного теста на кибератаки.

Разрыв между возможностями и безопасностью открытых моделей ИИ растёт: скачав открытые веса (файлы, позволяющие запустить модель на своём оборудовании), любой пользователь может убрать все защитные фильтры, и ни один разработчик это не проконтролирует.
| Кто | Что | Тип | Дата/статус |
|---|---|---|---|
| SaferAI (некоммерческая организация по безопасности ИИ) | Отчёт по оценке кибер- и биологических возможностей GLM-5.2 | Независимая оценка через публичный API Z.ai | Опубликован (точная дата в источнике не указана) |
| Z.ai (Китай) | GLM-5.2, открытая модель с открытыми весами | Выпуск модели | Дата релиза в источнике не названа |
Что показала проверка SaferAI?
Некоммерческая организация SaferAI протестировала китайскую открытую модель GLM-5.2 от компании Z.ai через её публичный API. Модель получала задания, связанные с наступательной кибербезопасностью и биологией двойного назначения (технологиями, которые можно использовать и в мирных, и в опасных целях).
Результат оказался полярным. GLM-5.2 не отказала ни на одном из заданий. Для сравнения: Claude Opus 4.7 от Anthropic отказывал настолько последовательно, что SaferAI не смогла завершить на нём CyberGym (бенчмарк для оценки кибератакующих способностей моделей, тот же тест OpenAI использовала перед недавним инцидентом со взломом Hugging Face).
По оценке SaferAI, GLM-5.2 отстаёт от GPT-5.5 (OpenAI) и Claude Opus 4.7 (Anthropic) по возможностям лишь на несколько месяцев. Но по безопасности разрыв не сокращается, а растёт.
Z.ai не опубликовала ни рамку безопасности, ни обязательства по предрелизному тестированию, ни оценку рисков для GLM-5.2. TechCrunch запросил у Z.ai информацию о внутренних или сторонних проверках безопасности перед выпуском, но ответа не получил.
Почему открытые веса меняют расклад рисков?
Закрытые модели (closed-source) вроде GPT или Claude используют несколько уровней защиты: классификаторы запросов, обучение на отказ от опасных заданий и контроль на уровне API (программного интерфейса). Эти меры не абсолютны: организация Far.ai обнаружила сотни универсальных джейлбрейков (способов обхода защиты, работающих на большинстве опасных запросов) в моделях Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. Атаки срабатывают, когда злоумышленник комбинирует несколько приёмов: ролевую игру, имитацию авторитета, поддельную историю переписки и дожимающие промпты.
Но у закрытых моделей хотя бы есть эти барьеры. У открытых моделей ИИ с открытыми весами их нет в принципе: после скачивания весов пользователь запускает модель на собственном оборудовании и волен убрать любые фильтры, провести дообучение (fine-tuning, обучение модели на своих примерах под узкую задачу) или изменить системный промпт (системную инструкцию, определяющую поведение модели).
Граница возможностей, это не граница рисков. Чтобы корректно оценить риск, нужно учитывать и состояние мер защиты. : Генри Пападатос, исполнительный директор SaferAI
Можно ли сделать open source модели ИИ безопаснее?
Пападатос назвал один подход: фильтрацию обучающих данных (pre-training data filtering), когда из тренировочного набора убирают информацию о наступательной кибербезопасности ещё до обучения модели. Исследования показывают, что это снижает опасные биологические знания модели без ущерба для общей производительности.
С кибербезопасностью сложнее. Модель, которая отлично пишет код, почти неизбежно становится хорошим «хакером». А программирование сейчас приносит разработчикам ИИ больше всего денег, поэтому ослаблять эти способности компании не готовы.
Anthropic выбрала компромисс: Opus 5 может искать уязвимости в исходном коде, но не в скомпилированном (готовом к запуску) ПО. Логика в том, что это затрудняет наступательное использование.
Как на это смотрят в Китае?
Грэм Вебстер, исследователь китайской политики в области ИИ из Стэнфордского центра киберполитики, пояснил TechCrunch: в Китае действуют серьёзные правила регулирования ИИ, но они исторически направлены на политически чувствительный контент, дезинформацию и социальную стабильность, а не на катастрофические риски вроде кибератак или биологического злоупотребления.
Китайская система уверена, что контролирует использование этих технологий внутри страны. Пребывание в китайском интернете привязано к реальному имени, и компании, и пользователи несут ответственность. : Грэм Вебстер, Стэнфордский центр киберполитики
На Всемирной конференции по ИИ председатель КНР Си Цзиньпин подчеркнул важность открытых моделей, но при этом заявил о необходимости строгого человеческого контроля над ИИ.
Вебстер отметил, что механизмы, которые китайские модели используют для отказа обсуждать политические темы, потенциально можно адаптировать, чтобы модели отказывали и в выполнении кибератак или выдаче рецептов биологического оружия.
Что это значит для вас?
Отчёт SaferAI фиксирует точку, в которой open source модели ИИ перестали быть «второй лигой» по возможностям. GLM-5.2 отстаёт от лидеров на месяцы, не на годы. Но если закрытые модели хотя бы пытаются отказывать на опасных запросах, открытая модель после скачивания весов становится полностью бесконтрольной.
Для тех, кто работает с контентом и маркетингом в России, здесь два практических вывода.
Первый: доступность мощных открытых моделей растёт. Это значит, что для дообучения, генерации текстов, работы с кодом порог входа снижается, и это хорошая новость.
Второй: если вы интегрируете открытую модель в свой продукт или сервис, ответственность за безопасность ложится целиком на вас. Разработчик открытых весов не выстроит фильтры за вас. Из доступных в РФ альтернатив YandexGPT и GigaChat предлагают закрытые API с собственными фильтрами, для многих задач это более безопасный путь.
Оговорка: отчёт SaferAI покрывает конкретные бенчмарки кибер- и биорисков. Это не полная картина безопасности моделей, а срез по одной, пусть и критичной, оси.
Практический шаг: если вы используете или планируете использовать открытую модель ИИ, проверьте, публиковал ли разработчик оценку рисков и рамку безопасности. Нет документации, значит, вся ответственность за последствия использования на вас. В случае GLM-5.2 такой документации на момент публикации не существует.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Anthropic вложит $10 млрд в норвежский дата-центр: инвестиции снизят зависимость от AWS
Anthropic второго июня заключила контракт на 10 млрд долларов с облачным стартапом Volta, чтобы получить вычислительные мощности для обучения и работы моделей…

Spotify запускает легальный ИИ для создания музыки: артисты дали согласие и получат деньги
Spotify второго июня на отчёте перед инвесторами анонсировала продукт, который впервые позволит слушателям легально создавать ИИ-ремиксы и каверы на музыку…

ИИ-агенты для локальной установки: LFM2.5 работает без GPU и выдаёт 113 токенов в секунду
Компания Liquid AI выпустила LFM2.5-2.6B, компактную открытую модель для запуска ИИ-агентов прямо на компьютере или смартфоне, и впервые показала скорость 113…
Комментарии