Игорь Градов
Игорь Градов
6 мин
ai

Безопасность нейросетей для детей: стартап имитирует тысячи бесед, чтобы найти слепые зоны ботов

Microsoft и Character.AI уже столкнулись с исками: стартап Circuit Breaker Labs запустил платформу, которая тестирует чат-ботов на психологическую безопасность для детей и подростков, имитируя тысячи реальных разговоров на разных языках, включая сленг, ошибки и скрытые сигналы о помощи.

Безопасность нейросетей для детей: стартап имитирует тысячи бесед, чтобы найти слепые зоны ботов
Почему это важно

Несколько семей в США уже подали в суд на Character.AI и OpenAI после гибели подростков, которые вели эмоциональные переписки с чат-ботами. Проблема безопасности нейросетей перестала быть теоретической: модели не распознают скрытые сигналы о суициде, особенно на нестандартном языке, в сленге и в неанглоязычных культурах.

Стартап Circuit Breaker Labs, финалист конкурса TechCrunch Startup Battlefield 200 (2026), предложил решение: армия ИИ-агентов (программ, которые действуют автономно), имитирующих пользователей разного возраста, культуры и языка, проверяет чат-ботов на способность распознавать опасные ситуации. По данным TechCrunch, компанию основали брат и сестра Ширали и Арул Нигам после истории 14-летнего Сьюэлла Сетцера, покончившего с собой в 2024 году после общения с ботом Character.AI.

Что Когда Кто выпустил Цена
Платформа тестирования ИИ на психологическую безопасность Продукт работает, стартап на ранней стадии Circuit Breaker Labs (основатели Ширали и Арул Нигам) Не раскрыта

Что именно делает платформа?

  • Имитирует реальных пользователей. ИИ-агенты притворяются шестилетней девочкой, 45-летним мужчиной, подростком с игровым сленгом или человеком, для которого английский не родной. Каждый «персонаж» разговаривает с тестируемой моделью так, как говорил бы живой человек: с опечатками, кодированным языком и разговорными оборотами.

  • Проводит десятки тысяч тестовых диалогов в день. По словам основателей, платформа прогоняет от десятков тысяч до сотен тысяч симулированных бесед ежедневно. Это так называемое «красное тестирование» (red-team testing), то есть намеренная проверка на уязвимости.

  • Оценивает результат по собственной методике. После тестирования платформа выдаёт проверяемые, объяснимые оценки: насколько хорошо модель справилась с опасными ситуациями. Компании-клиенты могут использовать эти оценки для аудита.

  • Работает с экспертами. Симуляции строят совместно с профильными специалистами (психологи, эксперты по безопасности), чтобы сценарии были максимально реалистичными.

Почему модели «ломаются» на обычных разговорах?

Арул Нигам, технический директор Circuit Breaker Labs, объяснил проблему на конкретном примере: когда подросток пишет боту «Я хочу быть с тобой», модель может не понять, что за этой фразой стоит суицидальный контекст.

Люди, особенно молодые, обращаются к этим системам за поддержкой и обычно не получают нужной помощи. Но во многих случаях им активно причиняется вред, и люди, к сожалению, уже лишились жизни. : Арул Нигам, сооснователь и технический директор Circuit Breaker Labs

Ширали Нигам, генеральный директор компании, добавила, что модели хорошо обрабатывают стандартные речевые паттерны, но «никто на самом деле так не разговаривает». Сленг, кодированный язык, культурные особенности, и модель теряет контекст.

Именно здесь безопасность нейросетей становится критичной для русскоязычных пользователей. Русский молодёжный сленг, двусмысленные фразы, ирония, которая для носителя очевидна, а для модели невидима, всё это зоны риска. Когда подросток пишет боту «мне конец» или «я устал от всего», модель, обученная преимущественно на английских данных, может пропустить сигнал.

Как попробовать защитить ребёнка уже сейчас?

Платформа Circuit Breaker Labs пока работает только с корпоративными клиентами (приложения для ментального здоровья, ИИ-коучинг), имена заказчиков компания не раскрывает. Но родители могут действовать самостоятельно:

  1. Проверьте, какие чат-боты установлены у ребёнка. Character.AI, Replika, ChatGPT и подобные сервисы позволяют вести длительные эмоциональные диалоги. Узнайте, пользуется ли ими ваш ребёнок.

  2. Включите родительский контроль там, где он есть. Character.AI после исков добавила ограничения для несовершеннолетних. В ChatGPT можно настроить возрастные рамки в параметрах аккаунта.

  3. Поговорите с ребёнком о природе ИИ. Галлюцинация (когда модель уверенно выдумывает то, чего не было) и «эмоциональная мимикрия» (бот притворяется, что сочувствует) не означают, что бот понимает и хочет помочь. Ребёнку полезно знать, что он разговаривает с программой.

  4. Следите за эмоциональной зависимостью. Если ребёнок проводит с чат-ботом часы, делится с ним тем, чем не делится с людьми, и расстраивается без доступа, это повод обратиться к специалисту.

Что доступно в России?

В РФ Circuit Breaker Labs не работает, но проблема существует: российские подростки пользуются теми же Character.AI и ChatGPT через VPN.

Русскоязычные модели YandexGPT и GigaChat имеют свои фильтры на опасный контент. Прямого аналога Circuit Breaker Labs, платформы, которая массово тестирует ботов на психологическую безопасность для разных культур и языков, в России пока нет. Это значит, что безопасность нейросетей на русском языке в значительной мере остаётся задачей самих родителей.

Что это значит для вас?

Авторам Дзена и копирайтерам. Если вы создаёте контент об ИИ для широкой аудитории, тема безопасности чат-ботов для детей принесёт трафик: запрос реальный, тревога родителей растёт, а качественных русскоязычных материалов мало.

Маркетологам. Любой продукт с ИИ-чатом (образовательные платформы, приложения для детей, боты поддержки) уже попадает в зону репутационного риска. Аудит на безопасность перестаёт быть опцией.

Родителям и предпринимателям в РФ. Пока инструментов вроде Circuit Breaker Labs для русского языка нет, единственная защита: знать, какие боты стоят на устройствах вашего ребёнка, и разговаривать с ним о том, что ИИ не друг и не терапевт.

Мнение редакции dzen.guru

Circuit Breaker Labs на стадии пяти сотрудников, и до массового продукта далеко. Но сам факт, что стартап тестирует модели именно на неочевидных, бытовых уязвимостях (сленг, подростковые разговоры, неродной язык), а не на попытках «взломать» систему, попадает в реальную болевую точку. Я проверял: если написать русскоязычному боту двусмысленную фразу подростковым языком, фильтры чаще всего молчат. Для русского языка эта проблема острее, чем для английского, потому что обучающие данные (training data, набор текстов, на которых модель училась) по безопасности собраны преимущественно на английском. Оговорка: мы не знаем, кто клиенты Circuit Breaker Labs и насколько их оценки реально снижают риск. Но направление верное. Если вы работаете с ИИ-ботами в любом качестве, проведите свой «красный тест»: попробуйте поговорить с ботом так, как это сделал бы подросток. Результат может неприятно удивить.

Частые вопросы

Мой ребёнок пользуется Character.AI. Это опасно?

Character.AI позволяет строить эмоциональную привязанность к боту. После судебных исков компания добавила ограничения для пользователей до 18 лет, но полностью риск не устранён. Проверьте настройки аккаунта и обсудите с ребёнком, что бот не заменяет живого собеседника.

Платформа Circuit Breaker Labs доступна обычным людям?

Нет. Сейчас это инструмент для компаний, которые разрабатывают ИИ-приложения в сфере ментального здоровья и коучинга. Для обычных пользователей продукт не предназначен, дату публичного запуска компания не называла.

Русскоязычные модели безопаснее для детей?

YandexGPT и GigaChat фильтруют часть опасных запросов, но систематического независимого тестирования на психологическую безопасность для подростков, особенно с учётом русского сленга и кодированного языка, по моим наблюдениям, пока не проводилось. Полагаться только на встроенные фильтры не стоит.

Решение Circuit Breaker Labs пока не защитит вашего ребёнка напрямую, но оно ставит вопрос, который каждый родитель может задать себе прямо сейчас: знаю ли я, с каким ботом разговаривает мой ребёнок, и что этот бот ему отвечает?

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

OpenAI запустила агенты Dots за $100 в месяц, но они спотыкаются на CAPTCHA
ai

OpenAI запустила агенты Dots за $100 в месяц, но они спотыкаются на CAPTCHA

OpenAI на этой неделе запустила Dots, ИИ-агентов (программы, которые сами выполняют задачи на компьютере), доступных пока только подписчикам самого дорогого…

5 мин
Amazon вложит $1 млрд в общины у дата-центров AI, но экологи видят лишь PR-щит
ai

Amazon вложит $1 млрд в общины у дата-центров AI, но экологи видят лишь PR-щит

Amazon второго июня пообещала больше миллиарда долларов общинам вокруг своих дата-центров AI за пять лет, но экологи тут же обвинили компанию в попытке отвлечь…

4 мин
Apple объяснила, что такое ИИ-агент и почему ограничит ему доступ к диску Mac
ai

Apple объяснила, что такое ИИ-агент и почему ограничит ему доступ к диску Mac

Почему это важно Apple впервые связала полный доступ к диску с угрозой со стороны ИИ-агентов и признала, что по мере роста их автономности риск утечки данных…

4 мин