Языковые модели нейросети хранят до 98% фактов, но теряют треть: список причин назвал Google
Google опубликовала исследование, которое объясняет, почему продвинутые языковые модели нейросети «забывают» факты, которые точно выучили, и почему порядок слов в промпте определяет, получите вы правильный ответ или нет.

Модели Gemini-3-Pro и GPT-5 закодировали до 98% проверенных фактов, но не смогли вспомнить от 26 до 34% из них при прямом запросе: проблема не в нехватке знаний, а в механизме извлечения, и это напрямую влияет на качество любого промпта.
Исследователи Google задались вопросом: почему языковые модели нейросети, обученные на огромных массивах текстов, не могут воспроизвести часть того, что уже «знают»? Раньше считалось, что моделям просто не хватает обучающих данных (training data, тексты и документы, на которых модель училась). Новая работа под названием «Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality» показывает, что дело не в пустых полках, а в потерянных ключах. Результаты опубликованы Google и подробно разобраны в материале Search Engine Journal.
| Показатель | Значение | Источник |
|---|---|---|
| Доля закодированных фактов у Gemini-3-Pro и GPT-5 | 95 до 98% | Исследование Google |
| Доля фактов, которые модели не смогли вспомнить напрямую | 26 до 34% | Исследование Google |
| Доля невоспроизведённых фактов даже с режимом «размышления» | 11 до 12% | Исследование Google |
| Доля ошибок GPT-5.2, вызванных сбоем извлечения, а не отсутствием знания | более 70% | Исследование Google |
| Доля «потерянных» фактов, которые удалось вернуть через режим «размышления» | 40 до 65% | Исследование Google |
Что именно измеряли?
Исследователи проверяли параметрическую информацию (parametric information), то есть всё, что языковая модель усвоила из обучающих данных: веб-страницы, книги, тексты песен, код, инструкции. Вопрос ставился так: если факт точно есть внутри модели, почему она иногда не может его выдать?
Для проверки использовали пары «субъект и объект». Проще говоря, в любом факте есть два участника: тот, кто упоминается первым в исходном тексте (субъект), и тот, кто идёт следом (объект). Пример из статьи: «Oasis played their first gig at the Boardwalk club». Здесь Oasis стоит первым и является субъектом, а клуб Boardwalk идёт вторым и является объектом.
Модели задавали два типа вопросов:
- Прямой: ответом служит объект («Где Oasis сыграли первый концерт?»)
- Обратный: ответом служит субъект («Какая группа впервые выступила в клубе Boardwalk?»)
Затем сравнивали, как порядок влияет на точность ответа.
Три факта, которые меняют работу с промптами
- Порядок решает. Когда вопрос переворачивал привычный порядок субъекта и объекта, модель заметно хуже вспоминала факт. При этом тот же факт она уверенно узнавала в формате теста с вариантами ответов, что доказывает: информация внутри есть, но «ключ» к ней не подходит.
- Перефразирование почти не помогает. Исследователи проверили, влияет ли переформулировка вопроса на качество ответа. Результат: незначительно. Критичен именно порядок сущностей, а не стиль или выбор слов.
- Редкие факты страдают сильнее. Разница между кодированием популярных и редких фактов была небольшой, но при извлечении (recall) разрыв увеличивался. Модель «знает» редкий факт, но вытащить его из памяти гораздо сложнее. Характерный пример для авторов, работающих с нишевыми темами: языковые модели нейросети список редких фактов хранят, но отдают неохотно.
Режим «размышления» помогает, но дорого обходится
Исследователи проверили, способен ли так называемый thinking mode (режим, в котором модель «рассуждает» перед ответом, тратя больше вычислительных ресурсов) исправить ситуацию. Результат: от 40 до 65% ранее недоступных фактов удалось извлечь.
Но у решения два ограничения. Во-первых, инференс (inference, процесс генерации ответа моделью) с «размышлением» стоит заметно дороже. Во-вторых, модель сама не знает, когда ей нужно включить этот режим, а когда хватит быстрого ответа.
Ещё один вывод: простое увеличение масштаба обучения не решает проблему извлечения. Модели уже и так закодировали почти всё, наращивать объём бессмысленно, если «ключи» к полкам теряются.
Исследование проводилось на конкретных моделях (Gemini-3-Pro, GPT-5, GPT-5.2). Распространять выводы на все языковые модели нейросети список которых растёт каждый месяц, стоит с осторожностью. Авторы не объясняют механизм, почему тест с вариантами ответов работает лучше открытого вопроса, а фиксируют это как факт. Также работа не проверяла, как эффект проявляется в языках с гибким порядком слов, например, в русском.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Когда вы составляете промпт (prompt, текстовый запрос к нейросети), ставьте ключевую сущность в том порядке, в каком она чаще всего встречается в текстах. Если спрашиваете про факт, начинайте с того участника, который обычно упоминается первым. «Кто основал компанию X» сработает лучше, чем «Компанию X основал кто?», если в обучающих данных имя основателя всегда шло перед названием компании.
Маркетологам. Если вы оптимизируете контент для ИИ-поиска, порядок сущностей на странице может влиять на то, «вспомнит» ли модель ваш бренд. Размещайте название компании и ключевой продукт в начале абзаца, как субъект, а не прячьте в конец предложения.
Предпринимателям в РФ. Эффект порядка актуален для любых моделей, включая доступные в России YandexGPT и GigaChat. Проверяйте свои промпты: если модель «не знает» факт, попробуйте переставить сущности, прежде чем менять формулировку целиком.
Я проверял этот эффект на практике задолго до публикации Google, просто не знал, как он называется. Спрашиваешь нейросеть «В каком городе находится завод X?», получаешь точный ответ. Переворачиваешь: «Какой завод находится в городе Y?», и модель начинает выдумывать. Теперь понятно почему: факт закодирован в одном направлении, а мы просим вспомнить его «задом наперёд». Для промпт-инжиниринга (prompt engineering, системная работа над формулировками запросов) это конкретный и бесплатный инструмент: не переписывайте промпт десять раз, а переставьте действующих лиц. Это быстрее и, судя по данным Google, результативнее.
Факт «модель знает, но не может вспомнить» перестал быть интуицией и стал измеримой величиной: более 70% ошибок GPT-5.2 вызваны именно сбоем извлечения, а не отсутствием знания. Для каждого, кто ежедневно работает с нейросетями, это означает одно: прежде чем обвинять модель в некомпетентности, переставьте слова в запросе.
По данным Search Engine Journal

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Видимость брендов в AI поиске
Отвечу строго по фактам из источника, дополнив пользой для российской аудитории. Компания Fractl проанализировала, какие бренды ИИ-модели рекомендуют чаще…

Smart bidding в Яндексе и Google меняется 17 августа: как не потерять контроль над ставками
Smart bidding в Яндексе и Google меняется быстрее, чем рекламодатели успевают адаптироваться, и Джинни Марвин, официальный представитель Google Ads, в свежем…

Google Ads подключил нейросети к видеорекламе: отказаться можно до 4 сентября
Google Ads начал автоматически достраивать недостающие форматы видеорекламы (вертикальные и квадратные) с помощью генеративного ИИ в кампаниях Performance Max,…
Комментарии