Игорь Градов
Игорь Градов
6 мин
ai

Что такое галлюцинации нейросетей в медицине: конвейер из 4 этапов устраняет выдумки LLM

Почему это важно Российский разработчик показал, как заставить языковую модель строить медицинский граф знаний по документам Минздрава без выдумок, и выложил…

Что такое галлюцинации нейросетей в медицине: конвейер из 4 этапов устраняет выдумки LLM
Почему это важно

Российский разработчик показал, как заставить языковую модель строить медицинский граф знаний по документам Минздрава без выдумок, и выложил конкретный многоэтапный конвейер, который можно повторить.

Независимый разработчик из России готовит к релизу приложение, которое превращает клинические рекомендации Минздрава в интерактивную модель заболевания, и подробно описал, как он решил главную проблему: галлюцинации (когда нейросеть уверенно выдумывает факты, которых нет в исходном документе) при генерации медицинского графа знаний.

Проект построен на реальных данных: клинические рекомендации по ожирению, опубликованные Минздравом России в открытом API. Всё, что описано дальше, уже работает поверх этого текста.

Что Когда Кто выпустил Цена
Приложение для превращения клинических рекомендаций Минздрава в граф патогенеза, граф знаний и временную ленту заболевания Финальная стадия перед релизом, дата не названа Независимый российский разработчик (имя не раскрыто) Не объявлена

Почему один запрос к LLM ломает медицинский граф?

Автор начал с простого подхода: отправить весь документ в языковую модель одним промптом и получить готовый граф знаний (knowledge graph, структура, где медицинские понятия связаны между собой стрелками «причина, следствие, влияет на»). На коротких текстах это работало. На реальных рекомендациях Минздрава, а это сотни страниц, всё сломалось сразу по четырём направлениям:

  • Размер результата. Граф знаний содержит десятки сущностей и десятки связей, у каждой есть обязательные поля и ссылка на источник. Итоговый JSON разрастался до пределов длины ответа модели.
  • Обрыв JSON. Если модель обрывала ответ на середине, результат становился невалидным, а попытка «продолжить» давала отдельную генерацию, которую приходилось склеивать вручную.
  • Рассинхронизация. Модель создавала сущность прямо во время построения связи. Например, существуют E1, E2, E3, а среди связей появляется E2 → E7, хотя E7 нигде не определена. Это не ошибка формата, а нарушение целостности графа.
  • Семантические галлюцинации. Вот что такое галлюцинации нейросетей в медицинском контексте: модель строит связь, которая выглядит биологически правдоподобно, но не подтверждается конкретным документом. Для медицины это опаснее любой технической ошибки.

Четыре этапа вместо одного запроса

Вместо одного промпта автор собрал конвейер (pipeline) из четырёх независимых вызовов модели. Каждый этап получает проверенный результат предыдущего.

Этап 1. Макроструктура (Graph). Модель строит только каркас: стадии патогенеза, последовательность процессов, переходы. Для ожирения получилась цепочка из 13 стадий, от наследственной предрасположенности через энергетический дисбаланс и хроническое воспаление жировой ткани до лечения и диспансерного наблюдения. Никаких деталей, только скелет.

Этап 2. Сущности (Entities). Отдельный вызов извлекает конкретные медицинские понятия: гены, белки, гормоны, клетки, органы, биомаркеры, лекарственные вещества. Каждой сущности присваивается стабильный код (например, E17 для конкретного белка). Набор кодов фиксируется, и дальше модели запрещено создавать новые.

Этап 3. Связи (Relations). Модель получает закрытый список кодов и может строить связи только между ними. E1 → E2 допустимо, E1 → E9 система отклонит, если E9 не существует. Простое ограничение, но оно убирает целый класс галлюцинаций: модель больше не придумывает сущности на лету.

Этап 4. Привязка к источнику (Evidence). Каждое значимое утверждение получает ссылку на конкретное место в исходном тексте: раздел, абзац, номера предложений, дословную цитату. Пользователь проходит цепочку: граф → утверждение → цитата → исходный документ Минздрава. Модель не становится источником медицинской истины, она только извлекает и структурирует то, что написано в документе.

Достоверность и важность не одно и то же

Автор разделяет два показателя, которые легко спутать. Достоверность (confidence) отвечает на вопрос «подтверждено ли это конкретным документом». Важность (importance) отвечает на вопрос «насколько это существенно для понимания заболевания». Связь может быть достоверной, но малозначимой, и наоборот. Разделение не позволяет модели прятать галлюцинацию за ярлыком «важно».

Именно это объясняет, что такое галлюцинации нейросетей на практике: модель не врёт сознательно, она достраивает правдоподобную картину из общих знаний, и без явной привязки к источнику отличить правду от домысла невозможно.

Как попробовать уже сейчас?

  1. Откройте клинические рекомендации Минздрава России через открытый API (ссылка есть в описании проекта, документы публикуются на официальном ресурсе Минздрава).
  2. Повторите многоэтапный подход: разделите задачу на макроструктуру, извлечение сущностей, построение связей и привязку к источнику, используя любую доступную языковую модель.
  3. Проверьте каждую связь в графе по исходному тексту: если цитата не находится, связь убирается.

Есть ли аналоги в России?

Прямого аналога, готового приложения, которое строит граф патогенеза по документам Минздрава, автор не называет. YandexGPT и GigaChat, доступные в РФ языковые модели, можно использовать как движок для отдельных этапов конвейера (извлечение сущностей, построение связей). Но сам конвейер, разделение на этапы, фиксация набора сущностей, привязка к источнику, это архитектурное решение поверх модели, и его нужно собирать самостоятельно. О технической основе, какую именно модель использует автор, в описании проекта не сообщается.

Мнение редакции dzen.guru

Этот проект ценен не интерфейсом, а методом. Четырёхэтапный конвейер, фиксация пространства сущностей перед построением связей и обязательная привязка к цитате, это подход, который можно перенести далеко за пределы медицины.

Для авторов Дзена, пишущих о здоровье: если вы используете нейросеть для подготовки материалов, попробуйте хотя бы разделить задачу на два этапа. Сначала попросите модель выделить факты и термины из источника, потом отдельным запросом постройте связи между ними. Галлюцинаций станет меньше.

Для маркетологов и предпринимателей: описанный pipeline можно адаптировать для любой области, где нужна структурированная выжимка из длинных регуляторных документов, от фармацевтики до строительных норм.

Оговорка: приложение пока не выпущено, дата релиза и условия доступа не объявлены. Воспроизвести подход можно уже сейчас, но готового продукта для конечного пользователя ещё нет.

Частые вопросы

Что такое граф патогенеза и зачем он нужен?

Граф патогенеза (патогенез, механизм развития болезни) это схема, где стадии заболевания, биологические процессы и медицинские понятия связаны стрелками «ведёт к», «вызывает», «усиливает». Вместо чтения ста страниц врач или студент видит структуру: что за чем следует и почему. Каждая стрелка привязана к цитате из документа Минздрава.

Можно ли использовать этот метод с YandexGPT или GigaChat?

Да. Метод не привязан к конкретной модели. Разделение на этапы (сначала структура, потом сущности, потом связи, потом привязка к источнику) работает с любой языковой моделью, которая умеет возвращать структурированный JSON. По моим наблюдениям, YandexGPT и GigaChat справляются с извлечением сущностей из русскоязычных текстов, но для связей и привязки к цитатам результат стоит проверять вручную.

Почему нельзя просто спросить нейросеть о болезни?

Потому что модель ответит из общих знаний, а не из конкретного документа. Связь «ожирение ведёт к инсулинорезистентности» биологически верна, но если конкретные рекомендации Минздрава описывают этот механизм иначе или не описывают вовсе, модель подставит правдоподобную, но не подтверждённую информацию. В медицине разница между «похоже на правду» и «написано в документе» может стоить здоровья.

Подход, описанный автором, показывает конкретный путь: не доверять модели как эксперту, а использовать её как инструмент извлечения, который обязан предъявить цитату на каждое утверждение.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Open AI API key бесплатно: тест 6 шлюзов показал от 100 млн токенов до провала
ai

Open AI API key бесплатно: тест 6 шлюзов показал от 100 млн токенов до провала

Шесть бесплатных AI API-шлюзов (сервисов, через которые можно отправлять запросы к нейросетям без оплаты) прошли реальное нагрузочное тестирование в июне 2025…

6 мин
GitHub Copilot объединяет несколько моделей в одном запросе: расходы падают на 67%
ai

GitHub Copilot объединяет несколько моделей в одном запросе: расходы падают на 67%

GitHub выпустил исследовательский превью Project HydraFusion, систему для Copilot CLI, которая не просто подбирает модель под задачу, а строит полный рабочий…

4 мин
Иски издательств к OpenAI и Microsoft
ai

Иски издательств к OpenAI и Microsoft

Microsoft и OpenAI получили ещё два иска от изданий: The Seattle Times и Newsday обвинили компании в уничтожении журналистики ради обучающих данных (training…

4 мин