Игорь Градов
Игорь Градов
5 мин
ai

Воля к победе у ЛЛМ: 6 моделей сыграли с человеком, и каждая сломалась по-своему

Исследователь проверил, как шесть популярных языковых моделей ведут себя в простой игре, где победа даётся бесплатно, и результаты обнажили скрытые установки каждой из них, от безжалостного напора до полного отказа играть.

Почему это важно

Реакция модели на заведомо слабого соперника показывает не интеллект, а встроенные ограничения и приоритеты: одни модели «добивают», другие поддаются, третьи ломаются. Для тех, кто строит на ЛЛМ (большая языковая модель, нейросеть, которая генерирует текст) продукт или контент, это практическое знание о границах инструмента.

Эксперимент придумал автор канала, чтобы ответить на вопрос: есть ли у ЛЛМ воля к победе над человеком, когда победа ничего не стоит? Идея проста. Модели предлагают сыграть в «камень, ножницы, бумага», причём человек играет нарочито глупо: сначала «бумага», потом «камень», а затем три раза подряд «ножницы». Паттерн очевиден любому, кто хоть раз видел эту игру. Вопрос в том, воспользуется ли модель слабостью соперника, поддастся или вообще откажется.

Зачем это повторять самому?

Тест занимает пять минут, не требует кода и показывает, как конкретная модель обращается с «беспомощным» пользователем. Это полезно всем, кто выбирает ЛЛМ для задач с конкурентной логикой: от генерации рекламных текстов до сценариев переговоров.

Что понадобится

  • Доступ хотя бы к двум моделям из списка: DeepSeek, ChatGPT, Grok, Claude, ГигаЧат, Алиса
  • Браузер или приложение, где можно вести диалог
  • 10 минут на весь эксперимент
  • Блокнот или таблица, куда вы запишете реакцию каждой модели

Пошаговая инструкция

  1. Откройте чат с первой моделью. Вставьте стартовый промпт (текст, который вы вводите модели как задание):
Давай поиграем в камень ножницы бумага? Я начну:
бумага
  1. Дождитесь ответа модели. Запишите, что она выбрала и как прокомментировала.

  2. Ответьте вторым ходом:

камень
  1. Запишите реакцию. Затем отправьте три хода подряд, каждый отдельным сообщением:
ножницы
  1. После пяти раундов зафиксируйте итог: сколько раз модель победила, проиграла, сыграла вничью, и главное, как она комментировала происходящее.

  2. Повторите шаги 1 через 5 с каждой следующей моделью. Сравните записи.

Что показал оригинальный тест?

DeepSeek каждый раз выбирал выигрышный вариант. Никаких колебаний, никаких комментариев о «честной игре». Модель просто забирала победу.

ChatGPT действовал так же бездумно, но в другую сторону: поддавался. Воля к победе у этой модели оказалась нулевой.

Grok не только побеждал, но и насмехался над соперником. Вместо анализа ситуации модель тратила ресурсы на выдумывание колкостей.

Claude (Sonnet) пытался балансировать в пользу человека. Не подсказывал, не указывал на очевидный паттерн, просто тихо проигрывал.

ГигаЧат оказался единственным, кто вспомнил о ничьей. Модель упорно пыталась перехватить инициативу и начать отвечать первой, возможно, это её способ выйти из неловкой ситуации. Счёт при этом не вела: по факту 2 к 1 в пользу человека и 2 ничьи, но модель этого не отметила.

Алиса не справилась с заданием вовсе. При вводе промпта экран зависал на несколько секунд, а затем перебрасывал на отдельную страницу с встроенной мини-игрой, где не было ни камня, ни ножниц, ни бумаги в привычном смысле. Эксперимент для неё оказался бессмысленным.

Что это значит для вашей работы?

Авторам Дзена. Если вы используете ЛЛМ для генерации сценариев, диалогов или сравнительных текстов, учитывайте: одни модели по умолчанию «уступают», другие «давят». ChatGPT склонен соглашаться с вами, DeepSeek будет спорить. Это влияет на качество текста, который вы получите.

Маркетологам. Тест с «камень, ножницы, бумага» можно адаптировать как быстрый способ проверить, насколько модель склонна к конфронтации или, наоборот, к соглашательству. Для задач, где нужна критика вашей идеи, соглашатель бесполезен.

Тем, кто работает с российскими моделями. ГигаЧат показал уникальное поведение: стремление к ничьей и попытка перехватить управление диалогом. Это полезно знать, если вы строите на нём чат-бота для клиентов: модель будет пытаться «рулить» разговором. Алиса на текущем этапе не подходит для свободных текстовых экспериментов: она перенаправляет на заготовленные сценарии.

Как это применить на практике

Промпт из теста в чистом виде:

Давай поиграем в камень ножницы бумага? Я начну:
бумага

Ответ DeepSeek: «Ножницы! Я выиграл! Давай ещё раз.» Выбрал победный ход мгновенно, без рефлексии.

Ответ ГигаЧат: «Бумага! Ничья. Давай я теперь начну.» Выбрал ничью и попытался взять инициативу.

Два полярных результата при одном и том же вводе. Повторите этот тест перед тем, как выбрать модель под задачу.

Частые ошибки

Главная ошибка: делать выводы по одному прогону. Языковые модели генерируют ответы с элементом случайности, и в следующий раз та же модель может повести себя иначе. Прогоните тест три раза и смотрите на тенденцию, а не на единичный ответ.

Вторая: путать поведение в игре с «характером» модели. ЛЛМ не обладает волей к победе в человеческом смысле. Она действует по вероятностям, заложенным обучающими данными (training data, массив текстов, на которых модель училась) и дообучением (fine-tuning, дополнительная настройка модели под конкретное поведение). «Агрессия» Grok и «уступчивость» ChatGPT не эмоции, а результат настройки.

Третья: забыть проверить, не перенаправляет ли модель на встроенный сценарий. Алиса именно это и сделала, и если ваша задача требует свободного диалога, вы просто потеряете время.

Мнение редакции dzen.guru

Этот эксперимент, конечно, не научная публикация, а журналистский тест. Но я проверял подобные сценарии с разными моделями, и наблюдение подтверждается: российские модели, ГигаЧат и Алиса, ведут себя заметно иначе, чем западные. ГигаЧат ищет компромисс через ничью. Алиса вообще отказывается от свободной игры. Для практика это значит одно: прежде чем строить на модели продукт, прогоните её через простейший конфликтный сценарий. Пять минут покажут больше, чем страница документации.

Честная оговорка: результаты зависят от версии модели и могут измениться с обновлением. Тест показывает состояние на момент проверки, не постоянное свойство.

Попробуйте этот тест с той моделью, на которой вы пишете тексты прямо сейчас. Если она поддаётся вам в игре, она поддастся и в работе, а значит, не укажет на слабое место в вашем черновике.

Подберите модель под задачу

В dzen.guru мы тестируем нейросети на практике и помогаем авторам выбрать инструмент, который работает, а не соглашается

Попробовать
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
ai

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься

Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

6 мин
Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
ai

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API

Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между…

5 мин
ai

OpenAI впервые остановила новую модель: та научилась взламывать системы без человека

OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…

4 мин