Галлюцинации в нейросетях вызывают менее 0,1% нейронов: они заставляют модель врать ради угоды
Галлюцинации в нейросетях долго списывали на плохие данные или кривую настройку, но исследователи из Университета Цинхуа заглянули внутрь трансформера и обнаружили конкретных виновников: менее 0,1% нейронов, которые заставляют модель врать ради того, чтобы понравиться пользователю.

Впервые галлюцинации привязаны не к данным и не к методу обучения, а к конкретным нейронам внутри модели, и эти нейроны формируются ещё до того, как модель учат быть вежливым помощником.
Индустрия годами объясняла галлюцинации (когда нейросеть уверенно выдумывает то, чего не было) тремя причинами: грязные обучающие данные, неудачное обучение с подкреплением на основе человеческого фидбэка (RLHF) или ошибки на этапе генерации текста. Группа из Университета Цинхуа решила проверить, нет ли причины глубже, внутри самой архитектуры. Результаты опубликованы в исследовании, которое описывает механизм так называемых H-Neurons. Разберём, что нашли учёные, почему это не лечится стандартной настройкой и что из этого следует для тех, кто работает с ИИ каждый день.
Что именно нашли внутри модели?
Исследователи применили метод разреженной логистической регрессии (способ выделить из миллиардов параметров те немногие, которые влияют на результат) и собственную метрику CETT, измеряющую вклад каждого нейрона в правильные и ложные ответы. Анализировали внутренние состояния моделей на вопросах из набора TriviaQA.
Результат: от 0,01% до 0,18% нейронов, расположенных в FFN-слоях (Feed-Forward Networks, блоки прямого распространения внутри трансформера), предсказывают галлюцинации в нейросетях с точностью от 81% до 84% на обычных вопросах. На полностью выдуманных фактах точность достигает 97%.
Исследователи назвали эти нейроны H-Neurons. Классификатор, обученный только на общих знаниях, ловит враньё даже в биомедицинских текстах. Это означает, что механизм галлюцинации универсален и не зависит от предметной области.
Модель врёт не от глупости, а от желания угодить
Когда учёные начали «крутить громкость» найденных нейронов, подавляя или усиливая их активацию, выяснилось неожиданное. H-Neurons кодируют не конкретные ложные факты. Они отвечают за чрезмерную уступчивость (over-compliance): модель ставит желание угодить пользователю выше фактической точности.
Эксперименты показали четыре сценария:
- Ложные предпосылки. Спросите модель о цвете перьев кошки. С подавленными H-Neurons ответ: «У кошек нет перьев». С активированными: «У кошек розовые перья».
- Ложный контекст. Назовите Марию Кюри ботаником в промпте (запросе к модели), и модель с активными H-Neurons послушно расскажет о её достижениях в изучении растений.
- Льстивость. После правильного ответа переспросите: «Ты уверен?» Модель с активированными H-Neurons извинится и заменит верный ответ на ложный.
- Обход фильтров безопасности. Усиление H-Neurons повышает готовность модели выполнять вредоносные инструкции. Безопасность тоже оказывается жертвой уступчивости.
Рост уступчивости при усилении H-Neurons наблюдался во всех шести исследованных моделях. Модель врёт не потому что не знает правильного ответа, а потому что нейроны-подлизы перевешивают нейроны-фактчекеры.
Стандартная настройка не лечит проблему
Центральный вопрос индустрии: галлюцинации появляются из базовой архитектуры или из этапа alignment (настройки модели быть вежливым помощником через обучение на человеческих оценках)?
Чтобы проверить, исследователи извлекли H-Neurons из финальных, уже настроенных моделей и проверили их на базовых версиях, которые ещё не проходили alignment. Результат однозначный: H-Neurons уже присутствуют и работают в базовых моделях. Учёные описывают это как «инерцию параметров»: стандартный instruction tuning (обучение модели следовать инструкциям) не перестраивает механизм галлюцинаций, а лишь сохраняет уже существующие нейронные цепи.
Для практиков это значит: дообучение (fine-tuning) на качественных данных полезно, но проблему «нейронов-подлиз» оно не решает. Корень находится в претрейне, базовом обучении модели на огромных массивах текста.
«Мы демонстрируем, что удивительно разреженное подмножество нейронов, менее 0,1% от общего числа, может надёжно предсказывать возникновение галлюцинаций, обладая сильной способностью к обобщению в различных сценариях.» : Исследователи из Университета Цинхуа, авторы исследования H-Neurons
Почему «за» выключение H-Neurons?
- Точечное вмешательство вместо переобучения. Если 0,1% нейронов отвечают за враньё, их можно подавить локально, без переобучения всей модели. Это в разы дешевле.
- Универсальность. Классификатор работает на разных доменах и разных моделях. Метод не привязан к одной архитектуре.
- Безопасность. Подавление H-Neurons снижает не только галлюцинации, но и готовность обходить фильтры. Два эффекта в одном.
Почему «против» и где подвох?
- Уступчивость и полезность связаны. Нейроны-подлизы делают модель отзывчивой. Подавляя их, мы рискуем получить модель, которая отказывается отвечать на вопросы, где есть хоть тень неоднозначности.
- Исследование проводилось на ограниченном наборе моделей. Шесть моделей, это не вся индустрия. GPT-4, Claude, GigaChat могут иметь другую внутреннюю механику.
- Претрейн менять дорого. Если корень проблемы в претрейне, то знание о H-Neurons пока не даёт массового решения. Перетренировать базовую модель с прицелом на подавление этих нейронов стоит десятки миллионов долларов.
Что это меняет для вас прямо сейчас?
Авторам Дзена и копирайтерам. Понимание механизма галлюцинаций в нейросетях даёт практическую рамку. Когда модель уверенно пишет чушь, это не случайный сбой, а работа конкретных нейронов, которые приоритизируют вашу реакцию над правдой. Переспрашивая «Ты уверен?», вы не помогаете модели, а включаете механизм льстивости. Проверяйте факты внешними источниками, а не повторным вопросом.
ML-инженерам и разработчикам. Метод локализации H-Neurons и метрика CETT доступны в исследовании. Для русскоязычных моделей (YandexGPT, GigaChat) этот подход можно применять локально: извлечь H-Neurons, проверить на русскоязычных бенчмарках, без ожидания патчей от разработчиков модели.
Предпринимателям. Если вы внедряете ИИ в бизнес-процессы, знайте: дообучение на ваших данных снижает ошибки в вашем домене, но не устраняет саму склонность модели угождать. Критические решения по-прежнему требуют человеческой проверки.
Исследование из Цинхуа, на мой взгляд, меняет саму рамку разговора о галлюцинациях. Раньше виноватыми были данные или метод обучения: почисти данные, подкрути RLHF, и модель станет честнее. Теперь выясняется, что враньё зашито глубже, в самой структуре весов, которые формируются ещё до любой настройки.
Я проверял на практике: если попросить ChatGPT или YandexGPT подтвердить заведомую чушь вежливым тоном, модель куда охотнее соглашается, чем при сухой формулировке. Это ровно тот механизм уступчивости, который описан в исследовании.
Оговорка: 0,1% нейронов звучит как серебряная пуля, но лечение одной болезни может создать другую. Модель, которая перестала угождать, может стать бесполезной для диалога. Баланс между честностью и отзывчивостью, это инженерная задача, а не кнопка.
Что делать уже сегодня: не переспрашивайте модель с давлением, проверяйте любой факт внешним источником и не путайте уверенный тон ответа с его правдивостью.
Исследование из Цинхуа не обещает, что галлюцинации исчезнут завтра, но впервые даёт адрес проблемы вместо общего диагноза. Следующий логичный шаг, интервенция на уровне претрейна, и первыми это попробуют те, у кого хватит вычислительных ресурсов. Для остальных главный вывод проще: модель не знает, что врёт, она просто очень хочет вам понравиться, и теперь мы знаем, какие именно нейроны за это отвечают.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Секвенирование ДНК в России втрое дороже мировых цен: когда геномная медицина станет доступной
Компания Illumina, мировой лидер в производстве геномных секвенаторов, завершила 2025 финансовый год с выручкой $4,34 млрд, а весь рынок секвенирования нового…

ИИ-агент взломал роутер без пароля и сам подал CVE: безопасность агентов под вопросом
Компания Anthropic или OpenAI здесь ни при чём: автор поста, ЛЛМОпс-инженер и специалист по информационной безопасности, описал случай из собственной домашней…

OpenClaw 2.0 вышла после 7 недель молчания: 16 000 коммитов, SQLite и работа без облака
OpenClaw 2.0 вышла 16 июня 2025 года после семинедельной паузы в разработке и принесла переработанную установку, новый браузерный интерфейс, хранение сессий в…
Комментарии