LLM-рассуждение оказалось иллюзией: создатель AlphaGo объяснил, почему модели не думают
Понравилась задача на стыке подачи факта и пользы для автора. Ниже выдерживаю архитектуру how-to строго по плану.
Когда ChatGPT выдаёт длинную «цепочку мыслей» перед ответом, кажется, что модель думает, но один из создателей AlphaGo объясняет, почему это иллюзия, и знание механики поможет вам перестать доверять ИИ там, где он врёт убедительнее всего.
Ниже разберём, как на самом деле устроено LLM-рассуждение, чем оно отличается от настоящего поиска решений и что с этим делать, если вы пишете тексты, ставите задачи нейросетям или принимаете решения на основе их ответов.
Тема Thore Graepel, одного из авторов AlphaGo, который в 2025 году ушёл из Google DeepMind ради новой архитектуры рассуждения, прямо касается каждого, кто полагается на ответы чат-ботов: модель не проверяет свои гипотезы, а генерирует правдоподобный текст, и цепочка мыслей (chain of thought) не меняет этого факта.
Контекст события таков. Спустя десять лет после победы AlphaGo над чемпионом по го Ли Седолем один из архитекторов программы Thore Graepel опубликовал разбор в MIT Technology Review, где показал: современные чат-боты вроде ChatGPT используют тот же механизм предсказания следующего токена (минимальной единицы текста, слова или его части) для «рассуждений», что и для обычных ответов. Настоящего отдельного механизма проверки гипотез у них нет.
Две системы AlphaGo и одна система у чат-бота
AlphaGo состояла из двух частей. Первая, так называемая policy network (сеть-политика), угадывала, какой ход сделал бы сильный человек. Вторая, поисковый механизм, строила дерево игры с тысячами ветвей, каждая из которых представляла возможное будущее, и проверяла «догадки» первой сети.
Знаменитый ход 37 во второй партии матча 2016 года выглядел настолько абсурдно, что комментаторы приняли его за программный сбой. Сеть-политика оценивала вероятность такого хода у человека как 1 к 10 000. Но поисковый механизм заглянул вперёд, взвесил последствия и выбрал именно его. AlphaGo выиграла партию, а затем и матч со счётом 4:1.
Поведенческая наука, которую популяризировал Даниэль Канеман, различает два режима мышления: система 1 (быстрая, интуитивная) и система 2 (медленная, пошаговая). AlphaGo воспроизводила обе: нейросети давали «интуицию», поиск по дереву давал «размышление». По отдельности ни одна часть не справилась бы.
У чат-ботов есть только система 1. Большая языковая модель (LLM, large language model) снова и снова предсказывает следующий токен. Это быстрое ассоциативное дополнение паттернов, работающее почти по любой теме, о которой люди когда-либо писали.
Цепочка мыслей не равна рассуждению
После запуска ChatGPT разработчики поняли, что одной языковой беглости недостаточно. Появились модели, которые генерируют промежуточные шаги перед финальным ответом. Этот приём называют цепочкой мыслей (chain of thought). Результаты действительно улучшились, особенно в математике и программировании.
Но, как подчёркивает Graepel, цепочка мыслей не вводит отдельный механизм рассуждения. Промежуточные шаги порождаются тем же предсказанием следующего токена, просто модель работает дольше, прежде чем выдать итог.
Три причины, почему LLM-рассуждение не настоящее
Graepel называет три конкретных изъяна, из-за которых то, что делают чат-боты, учёный не назовёт рассуждением.
- Нет открытого реестра гипотез. У модели нет явного, постоянного и проверяемого списка рассматриваемых версий, степени уверенности в каждой, учтённых доказательств и нерешённых вопросов. Всё это должно пересматриваться при поступлении новых данных, но у LLM такого механизма нет.
- Знания и логика неразделимы. В нейросети знания и способ их обработки переплетены в весах (числовых параметрах модели). Нет отдельного, явно представленного набора убеждений, который можно проверить или обновить независимо.
- Цепочки мыслей бывают постфактумными. Исследования показали, что чат-боты нередко приходят к ответу одним путём, а «рассуждение» выстраивают задним числом, подгоняя объяснение под уже выбранный результат.
Для задач с высокими ставками, в медицине, инженерии, науке, это критично. Когда случается ошибка, например в диагнозе, нужно понять: сбоила логика, были неверные данные или ложные допущения? У LLM такой разбор невозможен.
Что предлагает автор AlphaGo?
Graepel ушёл из Google DeepMind именно ради новой архитектуры. Он считает, что системе общего назначения нужно то же, что имела AlphaGo: явная структура данных (у AlphaGo это было дерево игры), в которой хранятся все рассмотренные варианты с оценками нейросетей, и которая обновляется по мере рассуждения.
Пока такой архитектуры для произвольных задач не существует. Это не готовый продукт, а направление исследований.
Что понадобится
- Доступ к любому чат-боту с режимом рассуждения: ChatGPT (модель o1 или o3), Claude с расширенным режимом мышления, или GigaChat и YandexGPT для задач на русском.
- 15 минут для теста по инструкции ниже.
- Задача, в которой вам важна не беглость текста, а правильность вывода: расчёт, логическая задача, проверка факта.
Пошаговая инструкция: как проверить, «думает» ли ваш чат-бот
-
Возьмите задачу с проверяемым ответом. Лучше всего подходит логическая головоломка, арифметика с несколькими шагами или вопрос, в котором вы точно знаете правильный ответ.
-
Задайте задачу без подсказок. Просто отправьте условие. Сохраните ответ.
-
Попросите модель показать рассуждение. Добавьте в промпт (текстовый запрос к модели) инструкцию:
Реши задачу шаг за шагом. Перед каждым шагом объясни,
почему ты выбираешь именно этот путь, а не альтернативный.
В конце укажи, в каких местах ты не уверен.
-
Сравните два ответа. Если ответ изменился, обратите внимание: промежуточные шаги объясняют реальную логику или просто «обёртка» вокруг другого финального числа?
-
Задайте уточняющий вопрос, который ломает цепочку. Например: «А если условие Х изменить на Y, какой шаг изменится первым?» Настоящее рассуждение скорректирует конкретный узел. Имитация часто перестраивает всю цепочку заново.
-
Зафиксируйте паттерн. Через 3-5 таких тестов вы увидите, в каких задачах модель действительно помогает, а в каких создаёт иллюзию надёжности.
Что ввели: «У Маши 3 брата. У каждого брата есть 2 сестры. Сколько всего детей в семье?»
Ответ без инструкции (модель GPT-4o, май 2025): «3 + 3×2 = 9 детей» (неверно).
Ответ с промптом «шаг за шагом»: модель развернула цепочку мыслей, но пришла к тому же результату «9», выстроив убедительное, но ложное обоснование. Правильный ответ: 6 детей (Маша плюс 3 брата плюс ещё одна сестра, всего 2 сестры у каждого брата, одна из которых сама Маша). Цепочка мыслей не спасла от ошибки, она лишь обернула её в правдоподобный текст.
- Доверять «уверенному тону». LLM-рассуждение выглядит логичным даже когда ответ неверен. Галлюцинация (когда модель уверенно выдумывает то, чего не было) становится опаснее, а не безопаснее, если она спрятана внутри длинной цепочки шагов.
- Путать длину ответа с глубиной мышления. Больше токенов не значит лучше проверено. Модель просто дольше генерирует текст тем же механизмом.
- Использовать чат-бот как единственный источник для медицинских, юридических, финансовых решений. Без явного реестра гипотез, который описывает Graepel, модель не может показать, где именно она ошиблась.
- Игнорировать проверку. Если вы не можете проверить ответ сами или через внешний источник, относитесь к нему как к черновику, а не к экспертизе.
Что это значит для вас, по ролям
Автору Дзена. Когда вы просите нейросеть «проанализировать тему» или «сделать вывод», вы получаете текст, который выглядит как анализ, но построен тем же предсказанием следующего слова. Используйте ИИ для черновика и структуры, но факты и логические связи проверяйте сами.
Маркетологу. Если вы строите отчёты или стратегии на ответах LLM, помните: модель не хранит список своих допущений и не пересматривает их при новых данных. Любой вывод нейросети стоит фиксировать с пометкой «требует проверки».
Предпринимателю в РФ. Из доступных в России инструментов YandexGPT и GigaChat работают по тому же принципу предсказания токенов, что и ChatGPT. Механизм рассуждения, который описывает Graepel, пока не реализован ни в одном коммерческом продукте.
Я тестирую рассуждающие модели каждую неделю, и статья Graepel точно описывает то, что вижу на практике: цепочка мыслей помогает в математике и коде, но в задачах со здравым смыслом, многоходовой логикой и проверкой фактов модели продолжают генерировать убедительную чепуху. Самый честный подход сейчас: воспринимать LLM-рассуждение как полезный черновик, а не как готовый вывод. Настоящая архитектура рассуждений, с явным деревом гипотез и разделением знаний и логики, остаётся исследовательской задачей, до коммерческого продукта ещё далеко. Это не повод отказываться от нейросетей, но повод каждый раз задавать себе вопрос: «Могу ли я проверить этот ответ?»
Попробуйте промпты для проверки рассуждений
В библиотеке dzen.guru собраны шаблоны промптов, которые помогают отличить настоящий анализ от правдоподобной имитации.
Открыть библиотеку промптовПонимание того, что LLM-рассуждение по своей природе остаётся предсказанием следующего токена, не обесценивает инструмент, а делает вас сильнее: вы точно знаете, где ему можно доверять, а где нужна ваша голова.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Что такое галлюцинации нейросетей: люди спорят с врачами и официантами, доверяя ChatGPT
Madison, официантка из Нью-Йорка, теперь начинает каждый разговор с гостями с вопроса об аллергиях, потому что посетители всё чаще доверяют ChatGPT больше, чем…
Suno запустила генератор музыки с голосом: озвучка и саундтрек в одном запросе
Suno второго июня запустила публичную бету функции Speech, генератор музыки с голосом, который создаёт синтетическую озвучку и фоновую музыку в одном треке…

Авито построила отдельную inference платформу: PaaS не справился с LLM
Microsoft второго июня запустила Project Solara — операционную систему, где ИИ-агенты заменяют привычные приложения, и впервые отдала управление машине, а не…
Комментарии