Игорь Градов
Игорь Градов
5 мин
text

Языковые модели нейросети хранят до 98% фактов, но теряют треть: список причин назвал Google

Google опубликовала исследование, которое объясняет, почему продвинутые языковые модели нейросети «забывают» факты, которые точно выучили, и почему порядок слов в промпте определяет, получите вы правильный ответ или нет.

Языковые модели нейросети хранят до 98% фактов, но теряют треть: список причин назвал Google
Почему это важно

Модели Gemini-3-Pro и GPT-5 закодировали до 98% проверенных фактов, но не смогли вспомнить от 26 до 34% из них при прямом запросе: проблема не в нехватке знаний, а в механизме извлечения, и это напрямую влияет на качество любого промпта.

Исследователи Google задались вопросом: почему языковые модели нейросети, обученные на огромных массивах текстов, не могут воспроизвести часть того, что уже «знают»? Раньше считалось, что моделям просто не хватает обучающих данных (training data, тексты и документы, на которых модель училась). Новая работа под названием «Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality» показывает, что дело не в пустых полках, а в потерянных ключах. Результаты опубликованы Google и подробно разобраны в материале Search Engine Journal.

Показатель Значение Источник
Доля закодированных фактов у Gemini-3-Pro и GPT-5 95 до 98% Исследование Google
Доля фактов, которые модели не смогли вспомнить напрямую 26 до 34% Исследование Google
Доля невоспроизведённых фактов даже с режимом «размышления» 11 до 12% Исследование Google
Доля ошибок GPT-5.2, вызванных сбоем извлечения, а не отсутствием знания более 70% Исследование Google
Доля «потерянных» фактов, которые удалось вернуть через режим «размышления» 40 до 65% Исследование Google

Что именно измеряли?

Исследователи проверяли параметрическую информацию (parametric information), то есть всё, что языковая модель усвоила из обучающих данных: веб-страницы, книги, тексты песен, код, инструкции. Вопрос ставился так: если факт точно есть внутри модели, почему она иногда не может его выдать?

Для проверки использовали пары «субъект и объект». Проще говоря, в любом факте есть два участника: тот, кто упоминается первым в исходном тексте (субъект), и тот, кто идёт следом (объект). Пример из статьи: «Oasis played their first gig at the Boardwalk club». Здесь Oasis стоит первым и является субъектом, а клуб Boardwalk идёт вторым и является объектом.

Модели задавали два типа вопросов:

  • Прямой: ответом служит объект («Где Oasis сыграли первый концерт?»)
  • Обратный: ответом служит субъект («Какая группа впервые выступила в клубе Boardwalk?»)

Затем сравнивали, как порядок влияет на точность ответа.

Три факта, которые меняют работу с промптами

  • Порядок решает. Когда вопрос переворачивал привычный порядок субъекта и объекта, модель заметно хуже вспоминала факт. При этом тот же факт она уверенно узнавала в формате теста с вариантами ответов, что доказывает: информация внутри есть, но «ключ» к ней не подходит.
  • Перефразирование почти не помогает. Исследователи проверили, влияет ли переформулировка вопроса на качество ответа. Результат: незначительно. Критичен именно порядок сущностей, а не стиль или выбор слов.
  • Редкие факты страдают сильнее. Разница между кодированием популярных и редких фактов была небольшой, но при извлечении (recall) разрыв увеличивался. Модель «знает» редкий факт, но вытащить его из памяти гораздо сложнее. Характерный пример для авторов, работающих с нишевыми темами: языковые модели нейросети список редких фактов хранят, но отдают неохотно.

Режим «размышления» помогает, но дорого обходится

Исследователи проверили, способен ли так называемый thinking mode (режим, в котором модель «рассуждает» перед ответом, тратя больше вычислительных ресурсов) исправить ситуацию. Результат: от 40 до 65% ранее недоступных фактов удалось извлечь.

Но у решения два ограничения. Во-первых, инференс (inference, процесс генерации ответа моделью) с «размышлением» стоит заметно дороже. Во-вторых, модель сама не знает, когда ей нужно включить этот режим, а когда хватит быстрого ответа.

Ещё один вывод: простое увеличение масштаба обучения не решает проблему извлечения. Модели уже и так закодировали почти всё, наращивать объём бессмысленно, если «ключи» к полкам теряются.

Оговорки и ограничения

Исследование проводилось на конкретных моделях (Gemini-3-Pro, GPT-5, GPT-5.2). Распространять выводы на все языковые модели нейросети список которых растёт каждый месяц, стоит с осторожностью. Авторы не объясняют механизм, почему тест с вариантами ответов работает лучше открытого вопроса, а фиксируют это как факт. Также работа не проверяла, как эффект проявляется в языках с гибким порядком слов, например, в русском.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Когда вы составляете промпт (prompt, текстовый запрос к нейросети), ставьте ключевую сущность в том порядке, в каком она чаще всего встречается в текстах. Если спрашиваете про факт, начинайте с того участника, который обычно упоминается первым. «Кто основал компанию X» сработает лучше, чем «Компанию X основал кто?», если в обучающих данных имя основателя всегда шло перед названием компании.

Маркетологам. Если вы оптимизируете контент для ИИ-поиска, порядок сущностей на странице может влиять на то, «вспомнит» ли модель ваш бренд. Размещайте название компании и ключевой продукт в начале абзаца, как субъект, а не прячьте в конец предложения.

Предпринимателям в РФ. Эффект порядка актуален для любых моделей, включая доступные в России YandexGPT и GigaChat. Проверяйте свои промпты: если модель «не знает» факт, попробуйте переставить сущности, прежде чем менять формулировку целиком.

Мнение редакции dzen.guru

Я проверял этот эффект на практике задолго до публикации Google, просто не знал, как он называется. Спрашиваешь нейросеть «В каком городе находится завод X?», получаешь точный ответ. Переворачиваешь: «Какой завод находится в городе Y?», и модель начинает выдумывать. Теперь понятно почему: факт закодирован в одном направлении, а мы просим вспомнить его «задом наперёд». Для промпт-инжиниринга (prompt engineering, системная работа над формулировками запросов) это конкретный и бесплатный инструмент: не переписывайте промпт десять раз, а переставьте действующих лиц. Это быстрее и, судя по данным Google, результативнее.

Факт «модель знает, но не может вспомнить» перестал быть интуицией и стал измеримой величиной: более 70% ошибок GPT-5.2 вызваны именно сбоем извлечения, а не отсутствием знания. Для каждого, кто ежедневно работает с нейросетями, это означает одно: прежде чем обвинять модель в некомпетентности, переставьте слова в запросе.

По данным Search Engine Journal

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Видимость брендов в AI поиске
text

Видимость брендов в AI поиске

Отвечу строго по фактам из источника, дополнив пользой для российской аудитории. Компания Fractl проанализировала, какие бренды ИИ-модели рекомендуют чаще…

6 мин
Smart bidding в Яндексе и Google меняется 17 августа: как не потерять контроль над ставками
text

Smart bidding в Яндексе и Google меняется 17 августа: как не потерять контроль над ставками

Smart bidding в Яндексе и Google меняется быстрее, чем рекламодатели успевают адаптироваться, и Джинни Марвин, официальный представитель Google Ads, в свежем…

5 мин
Google Ads подключил нейросети к видеорекламе: отказаться можно до 4 сентября
text

Google Ads подключил нейросети к видеорекламе: отказаться можно до 4 сентября

Google Ads начал автоматически достраивать недостающие форматы видеорекламы (вертикальные и квадратные) с помощью генеративного ИИ в кампаниях Performance Max,…

4 мин