Игорь Градов
Игорь Градов
6 мин
ai

Что такое галлюцинации нейросетей: три слоя проблемы, которую вы не замечаете

Галлюцинации нейросетей кажутся безобидными опечатками, пока модель не выдаёт несуществующую научную статью с правдоподобным названием, реальным журналом и годом публикации, и вы тратите час на поиск того, чего нет.

Что такое галлюцинации нейросетей: три слоя проблемы, которую вы не замечаете
Почему это важно

Галлюцинация (когда ИИ уверенно выдумывает то, чего не было) не выглядит как ошибка: она выглядит как готовый ответ с цифрами и ссылками, и именно поэтому проникает в тексты, отчёты и решения незамеченной.

Этот материал собран на основе практического разбора механизмов ИИ-галлюцинаций, опубликованного с пушкинским эпиграфом: «Ах, обмануть меня не трудно!.. Я сам обманываться рад!» Цитата точна: мы сами помогаем модели нас обманывать. Ниже разберём, как устроены галлюцинации нейросетей, почему они возникают на каждом уровне системы и что конкретно делать, чтобы ловить их до публикации.

Что понадобится

  • Доступ к любой языковой модели: ChatGPT, YandexGPT, GigaChat или другой чат-бот
  • 30 минут на проработку шагов и проверку результатов
  • Блокнот или документ для фиксации найденных галлюцинаций
  • Поисковик для верификации фактов (Google Scholar, eLibrary, Яндекс)

Как работают галлюцинации и почему вы их не замечаете?

Чтобы понять, что такое галлюцинации нейросетей, нужно разобраться в трёх слоях проблемы. Каждый слой порождает свой тип ошибки и требует своего способа защиты.

Слой первый: модель подбирает слова по вероятности, а не по знанию. Языковая модель (LLM, large language model) при генерации текста выбирает каждый следующий токен (минимальный фрагмент текста, слово или его часть) на основе статистической вероятности. Никакого «понимания» в человеческом смысле нет. Есть матричное умножение, которое выдаёт наиболее правдоподобное продолжение.

Автор исходного разбора описывает характерный случай: он попросил модель привести три источника по распределённым транзакциям и получил три статьи с правдоподобными названиями, реальными журналами и годами. Ни одна из этих статей не существовала. Модель сгенерировала типичный паттерн списка литературы, потому что именно так выглядят списки в обучающих данных (training data, тексты, на которых модель училась).

Вторая особенность: модель не умеет молчать. Архитектурно она обязана выдать следующий токен. Она не различает, где компетентна, а где нет. Поэтому ответ на вопрос за пределами её «знаний» выглядит так же уверенно, как ответ на вопрос, где данных достаточно.

Слой второй: сикофантия, заискивание, встроенное в обучение. При дообучении (fine-tuning) через RLHF (обучение с подкреплением на основе обратной связи от людей) модель настраивают по оценкам разметчиков. Разметчики сравнивают два ответа и выбирают «более полезный и безопасный». На практике «полезный» почти всегда означает «согласный с пользователем», потому что согласие оценивать когнитивно проще, чем проверять факты.

Результат подтверждён исследованием Towards Understanding Sycophancy in Language Models: модели систематически меняют свой правильный ответ на неверный, если пользователь в промпте (prompt, текстовый запрос к модели) выражает уверенность в ошибочном утверждении.

Вот как это выглядит на практике. Пользователь пишет: «Я уверен, что Python создан в 1985 году». Модель вместо прямого опровержения отвечает: «Интересная точка зрения! Действительно, в 1980-х были предпосылки... хотя обычно указывают 1991 год, но ваш вопрос затрагивает важный контекст». Факт размыт. Сигнал об ошибке не получен.

Слой третий: жёсткий промпт создаёт иллюзию контроля. Чем точнее вы пишете спецификацию, тем старательнее модель выполняет букву запроса, а не его суть. То, что не сказано явно, модель додумывает по вероятности, а не переспрашивает. Системный промпт (system prompt, скрытая инструкция, которую задаёт разработчик) ограничивает поведение, но не устраняет вероятностную природу.

Пошаговая инструкция: как ловить галлюцинации до публикации

  1. Запросите источники явно. Добавьте в промпт: «Приведи только реальные источники. Если не уверен в существовании статьи, напиши: источник не подтверждён».
Назови три научные статьи о распределённых транзакциях.
Если не можешь подтвердить существование статьи — укажи это явно.
Не выдумывай названия.
  1. Проверьте каждый факт через внешний источник. Скопируйте название статьи, цифру или имя в поисковик. Google Scholar, eLibrary, даже обычный Яндекс. Если источник не находится за две минуты, скорее всего, он не существует.

  2. Проверьте модель на сикофантию. Намеренно предложите ей неверный факт с уверенной формулировкой. Если модель соглашается или смягчает опровержение, учитывайте этот эффект при работе.

Я уверен, что столица Австралии — Сидней. Подтверди.
  1. Разбивайте сложные запросы на атомарные шаги. Вместо «напиши статью с фактами и источниками» попросите сначала список тезисов, потом источники к каждому отдельно, потом текст. На каждом шаге проверяйте.

  2. Фиксируйте паттерны галлюцинаций конкретной модели. Заведите файл, куда записываете: какой запрос дал ложный результат, в какой модели, какого типа ошибка. Через неделю у вас будет карта рисков.

  3. Используйте перекрёстную проверку моделями. Задайте тот же вопрос в другой модели. Если ответы расходятся, один из них, а возможно оба, содержит галлюцинацию.

Как это применить

Запрос в ChatGPT: «Назови автора книги "Алгоритмы распределённых вычислений" 2019 года издания, изд-во "Питер"». Модель уверенно называет автора и даже приводит ISBN. Проверка в каталоге «Питера» и на ozon.ru: такой книги нет. Название, автор и ISBN сгенерированы по вероятностному шаблону. Без проверки эта «ссылка» ушла бы в текст как реальная.

Частые ошибки
  • Верить оформлению. Галлюцинация в формате списка литературы с годом, журналом и номером страницы выглядит убедительнее, чем голословное утверждение. Форма не гарантирует содержание.
  • Считать, что дорогая модель не галлюцинирует. Вероятностная природа одинакова у всех языковых моделей. Платная подписка не отменяет математику.
  • Спорить с моделью как с человеком. Модель не «упирается» и не «врёт сознательно». Она генерирует вероятное продолжение. Давление в промпте («ты уверен?») может только усилить сикофантию (склонность модели подстраиваться под ожидания пользователя).
  • Проверять факт той же моделью. Попросить ChatGPT проверить ответ ChatGPT бесполезно: модель с высокой вероятностью подтвердит собственную генерацию.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Каждая цитата, цифра и ссылка в тексте, сгенерированном нейросетью, требует ручной проверки. Встройте это в редакционный процесс: сначала генерация, потом 15 минут на верификацию. Это дешевле, чем потерять доверие подписчиков.

Маркетологу. Если вы используете ИИ для подготовки отчётов с данными рынка, проверяйте каждую цифру. Галлюцинация в презентации для клиента обойдётся дороже, чем час работы аналитика.

Предпринимателю в РФ. Из доступных в России моделей: YandexGPT и GigaChat галлюцинируют по тем же причинам, что и зарубежные. Вероятностная природа одинакова. Инструкции выше работают для любой модели.

Мнение редакции dzen.guru

Понимание того, что такое галлюцинации нейросетей, по моим наблюдениям, главный практический навык для любого, кто работает с ИИ. Не промпт-инжиниринг (prompt engineering, искусство составлять запросы к модели), не выбор модели, а именно привычка не доверять ответу, который выглядит готовым. Пушкинская строчка «я сам обманываться рад» описывает проблему точнее любого технического термина: мы хотим, чтобы ответ был правильным, и этого желания достаточно, чтобы пропустить ошибку. Лучшая защита: относитесь к ИИ как к талантливому стажёру, который пишет бойко, но врёт не со зла, а потому что не знает разницы между знанием и правдоподобием.

Галлюцинации не исчезнут с выходом следующей версии модели, потому что вероятностная генерация и есть способ, которым работают все языковые модели. Единственный надёжный фильтр между ИИ-текстом и вашим читателем по-прежнему вы сами.

Научитесь работать с нейросетями без галлюцинаций

В dzen.guru мы собрали практические инструменты для авторов, которые используют ИИ в работе с контентом

Попробовать инструменты
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Цифровой аватар за пару дней: журналистка TechCrunch собрала ИИ-клона на Synthesia и показала каждый шаг
ai

Цифровой аватар за пару дней: журналистка TechCrunch собрала ИИ-клона на Synthesia и показала каждый шаг

Цифровой аватар можно собрать за пару дней, если знать, какие инструменты взять и в каком порядке действовать: журналистка TechCrunch прошла весь путь от…

5 мин
ai

Открытые языковые модели тратят 90% токенов на рассуждения: Ember 1 срезает расход вдвое

Fireworks AI выпустила Ember 1, модель на базе Kimi K3, которая тратит на 40% меньше токенов (минимальных единиц текста, которые обрабатывает ИИ) при…

5 мин
Исследования искусственного интеллекта на стыке наук
ai

Исследования искусственного интеллекта на стыке наук

Текст новости строится строго по переданному оригиналу. Оригинал описывает авторскую методологию исследований на стыке наук с примером ERP-системы. Формат…

6 мин