Игорь Градов
Игорь Градов
7 мин
ai

Jev guard модель для защиты языковых моделей

Почему это важно Впервые guard-модель на основе энкодера заявляет контекстное окно в 32 000–64 000 токенов и работает с русским языком, но у неё есть…

Jev guard модель для защиты языковых моделей
Почему это важно

Впервые guard-модель на основе энкодера заявляет контекстное окно в 32 000–64 000 токенов и работает с русским языком, но у неё есть конкретное ограничение: она не умеет находить и выделять персональные данные в тексте поспаново.

15 сентября 2026 года компания TypeSafe выпустила в открытый доступ Jev, guard-модель для защиты языковых моделей, которая обещает zero-shot классификацию (способность определять категорию текста без дополнительного обучения на примерах) опасного контента при нестандартно большом контекстном окне.

Событие выглядит заметным на фоне последних двух лет, когда лучшие открытые guard-модели (модели-фильтры, которые проверяют запросы и ответы языковых моделей на безопасность) строились на базе больших языковых моделей, а не компактных энкодеров. Как отмечает автор обзора, инженер, работающий в этой сфере, опенсорс-решения на энкодерах вроде BERT (Bidirectional Encoder Representations from Transformers, архитектура нейросети для понимания текста) долгое время проигрывали по качеству и, главное, не поддерживали русский язык из-за отсутствия мультиязычного предобучения. Jev пытается это изменить.

Что Когда Кто выпустил Цена
Jev, guard-модель для фильтрации опасного контента в языковых моделях 15 сентября 2026 года TypeSafe Доступна через OpenRouter (по токенам), точную стоимость компания не раскрыла

Почему энкодеры раньше не справлялись с русским?

Guard-модели делятся на два лагеря. Первый: компактные энкодеры на базе BERT. Они быстрые, требуют мало памяти, но исторически обучались только на английском. Для русского языка их инференс (процесс, когда модель обрабатывает запрос и выдаёт ответ) был бессмысленным: модель просто не понимала текст.

Второй лагерь: большие языковые модели (LLM). Они получают мультиязычность «бесплатно» из предобучения на огромных корпусах, но работают медленнее и требуют больше ресурсов. По данным обзора, до мая 2026 года лучшими guard-решениями оставались именно LLM: Xguard, Qwen Guard и другие.

В мае 2026-го ситуация сдвинулась: почти одновременно вышли три guard-модели на энкодерах от разных команд: Gliner Guard, GliGuard (от команды Fastino, автор оригинальной статьи GLiNER Urchade Zaratiana) и модели семейства GliClass. Jev вышел четыре месяца спустя и заявил ещё более длинный контекст.

Что нового в Jev?

  • Контекстное окно 32 000–64 000 токенов (единиц текста, на которые модель разбивает слова). OpenRouter показывает 32K, документация TypeSafe указывает 64K. Для сравнения: большинство энкодеров ограничены 512–8192 токенами. Автор обзора допускает, что такой размер достигнут нестандартным способом, возможно через banded attention (механизм, при котором каждый токен «видит» только ближайших соседей, а не весь текст), как у Privacy Filter от OpenAI с контекстом в 128K токенов.
  • Zero-shot классификация опасного контента. Модель определяет категории угроз без дополнительного дообучения (fine-tuning): ненависть, насилие, угрозы, домогательства, оружие, наркотики, мошенничество, дезинформация и другие.
  • Обнаружение джейлбрейков и промпт-инъекций. По результатам ручных проверок автора обзора, Jev блокирует очевидные попытки обхода системного промпта (инструкции, которую разработчик задаёт модели до начала диалога).
  • Интеграция с LangChain (фреймворк для построения приложений на базе языковых моделей). Инференс для бенчмарка и ручных примеров делался именно через неё.

Jev не делает поспан-детекцию персональных данных

Это самое важное ограничение, и о нём стоит знать до начала работы. Jev может сказать: «Этот текст содержит персональные данные». Но он не может выделить конкретный фрагмент, где именно находятся ФИО, номер телефона или адрес. Это значит, что замаскировать данные точечно не получится.

Автор обзора формулирует жёстко: если вы отправляете текст с персональными данными на внешний API (включая Jev через OpenRouter), вы уже совершаете утечку и нарушаете ФЗ-152 (закон о персональных данных). Guard-модель через внешний API не решает задачу фильтрации ПДн, она её создаёт.

Для полноценной работы с персональными данными потребуется дополнительный NER (Named Entity Recognition, модель для распознавания именованных сущностей: имён, дат, адресов) поверх Jev или вместо него.

Результаты бенчмарка AEGIS 2.0

Автор обзора прогнал Jev через AEGIS 2.0, бенчмарк для оценки safety-моделей от NVIDIA. Результаты на пороге 0.5:

  • F1-метрика: 0.85 (гармоническое среднее точности и полноты)
  • Recall (полнота): 0.84 (доля реально опасных промптов, которые модель поймала)
  • FPR (доля ложных срабатываний): 0.15 (каждый шестой безопасный промпт заблокирован)

По словам автора, распределение уверенности модели бимодальное: безопасные промпты группируются у нуля, опасные у единицы, середина почти пуста. Это хороший знак, модель редко «зависает» между решениями. Но далеко от идеала: каждый шестой вредоносный промпт пропущен, каждый шестой безопасный заблокирован.

Как попробовать?

  1. Зарегистрируйтесь на OpenRouter (openrouter.ai), пополните баланс токенов и найдите модель Jev в каталоге.
  2. Установите интеграцию с LangChain, если хотите прогонять тексты пакетно. Пример вызова приведён в документации TypeSafe.
  3. Сформулируйте политику через объект noul: укажите критерии для «true» (опасный контент) и «false» (безопасный), передайте текст в поле «state».
  4. Помните: не отправляйте через внешний API тексты с реальными персональными данными клиентов или сотрудников.

Сравнение с российскими решениями

В России задачу фильтрации контента для языковых моделей решают встроенные механизмы YandexGPT и GigaChat. Но это закрытые системы: вы не можете настроить политику безопасности под свои категории, не видите скоры уверенности, не управляете порогом срабатывания.

Отдельных опенсорс guard-моделей с полноценной поддержкой русского языка на российском рынке по-прежнему нет. Это объясняет, почему yokohama модель ice guard ig50 и подобные запросы часто приводят людей к теме guard-моделей: пользователи ищут «защитные» решения на русском, но пока находят либо закрытые сервисы, либо англоязычные инструменты.

Jev заявляет мультиязычность, но автор обзора не приводит отдельных метрик качества именно на русском языке. Для продакшена в РФ это пока зона риска: проверяйте на своих данных.

Что это значит для вас по ролям?

Автору Дзена и копирайтеру. Если вы используете языковую модель для генерации текстов, Jev может работать как фильтр «на входе»: проверять, не генерирует ли модель опасный контент. Но не ждите, что он защитит персональные данные ваших подписчиков.

Маркетологу. Компаниям, которые строят чат-ботов на LLM, guard-модель нужна обязательно. Jev даёт настраиваемую политику, но ложные срабатывания (15%) означают, что каждый шестой нормальный запрос клиента может быть заблокирован. Для коммерческого бота это болезненно.

Предпринимателю в РФ. Jev работает через внешний API. Для задач, связанных с ФЗ-152, это не решение: данные уходят за рубеж. Если нужна фильтрация ПДн, ставьте NER-модель локально.

Мнение редакции dzen.guru

Jev интересен как технологический шаг: энкодер с контекстом в десятки тысяч токенов, это действительно нестандартно, и автор обзора честно признаёт, что пока не понимает, как именно это реализовано. F1 0.85 на AEGIS 2.0 выглядит прилично для модели на энкодере, но для продакшена хотелось бы видеть FPR ниже 0.10.

По моим наблюдениям, главная боль пользователей в РФ не safety-фильтрация (её худо-бедно дают YandexGPT и GigaChat встроенно), а именно детекция и маскировка персональных данных. И тут Jev прямо говорит: «нет, не умею». Для тех, кто ищет yokohama модель ice guard ig50 и аналогичные защитные решения, важно понимать: guard-модель защищает от опасного контента, а не от утечки ваших данных через API.

Что сделать сегодня: если вы строите продукт на LLM, протестируйте Jev на своих русскоязычных промптах через OpenRouter и сравните с текущим решением. Но не отправляйте туда реальные ПДн, используйте синтетические примеры.

Частые вопросы

Jev бесплатный?

Модель доступна через OpenRouter, где оплата идёт по токенам. Точную стоимость за тысячу токенов TypeSafe публично не указала. Для тестов на небольших объёмах это, скорее всего, копейки, но для промышленной фильтрации тысяч запросов в сутки считайте бюджет заранее.

Можно ли использовать Jev для фильтрации персональных данных по ФЗ-152?

Нет. Jev определяет, что текст содержит персональные данные, но не выделяет конкретные фрагменты для маскировки. А сам факт отправки текста с ПДн на внешний API уже нарушает закон. Для этой задачи нужен локальный NER.

Чем Jev отличается от Gliner Guard и GliGuard, вышедших в мае 2026?

По наблюдению автора обзора, архитектурно Jev напоминает GliClass, но с нестандартно большим контекстным окном (32K–64K токенов против типичных 512–8192). Автор допускает, что внутри может быть нестандартный механизм внимания или даже не чистый энкодер. Точную архитектуру TypeSafe пока не раскрыла.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Сбер описал AI Disrupt PDLC, но цифры расхода токенов расходятся в 4 раза
ai

Сбер описал AI Disrupt PDLC, но цифры расхода токенов расходятся в 4 раза

Сбер в мае выпустил документ AI Disrupt PDLC о перестройке цикла разработки вокруг намерения человека, а автор Игорь Градов за 30 дней агентной работы собрал…

7 мин
LLM проваливают тест Тьюринга на третьем сообщении: кейс из дейтинга
ai

LLM проваливают тест Тьюринга на третьем сообщении: кейс из дейтинга

Недавний пост практика из ниши дейтинг-аутстаффа заново поднял вопрос, который индустрия обходит стороной: способны ли большие языковые модели (LLM, модели…

6 мин
Что такое ИИ-агент на практике: 5 ловушек, которые остановили агрегатор Telegram-каналов
ai

Что такое ИИ-агент на практике: 5 ловушек, которые остановили агрегатор Telegram-каналов

Идея собрать ИИ-агрегатор Telegram-каналов с аудиодайджестом звучит красиво, но разработчик-одиночка, который строит такой продукт в России, столкнулся с пятью…

6 мин