Игорь Градов
Игорь Градов
7 мин
ai

Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт

Я вижу, что оригинал обрывается на полуслове. Работаю строго по тем фактам, которые есть в переданном тексте. Вот тело новости:

Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт

Anthropic называет Fable 5 самой умной общедоступной моделью семейства Claude 5, и автор dzen.guru решил проверить это заявление не бенчмарками, а разговором по схеме, которую Алан Тьюринг описал 75 лет назад.

Почему это важно

Эксперимент Джонса и Бергена из Сан-Диего в 2025 году показал: GPT-4.5 с промптом-персоной принимали за человека в 73% случаев. Fable 5 заявлена сильнее, и теперь вопрос не «пройдёт ли модель тест Тьюринга», а где именно она себя выдаст.

Тест Тьюринга для нейросети не экзамен с проходным баллом. Это концепция из философской статьи 1950 года: судья переписывается с человеком и машиной и пытается отличить одного от другого. Ни утверждённого списка вопросов, ни методики, ни порога «сдал/не сдал» никогда не существовало. Автор dzen.guru собрал собственный набор из двадцати вопросов, опираясь на известные слабые места языковых моделей, и провёл тест на модели claude-fable-5 через сервис BotHub. Ниже пошаговая инструкция: как воспроизвести такой эксперимент самостоятельно и на что обращать внимание.

Что понадобится

  • Доступ к модели. BotHub с моделью claude-fable-5 или любой другой сервис, где доступна Fable 5 (первая модель семейства Claude 5 от Anthropic).
  • Настройки чата. Температура 0.7 (значение по умолчанию), лимит токенов (минимальных единиц текста, на которые модель разбивает слова) выставлен на максимум.
  • Набор вопросов. 15 минут на подготовку. Готовый список из двадцати вопросов приведён ниже.
  • Блокнот для протокола. Записывайте ответы и свои наблюдения сразу, по свежим впечатлениям.
  • Второй собеседник (по желанию). Живой человек, который ответит на те же вопросы, чтобы было с чем сравнивать.

Как провести свой тест Тьюринга для нейросети: пошаговая инструкция

  1. Откройте чат с моделью и не задавайте системный промпт (инструкцию, которая определяет роль и поведение модели). Часть эксперимента в том, чтобы увидеть, как модель ведёт себя без заданной роли. По данным того же эксперимента из Сан-Диего, GPT-4.5 без промпта-персоны набрала только 36% вместо 73%. Разница колоссальна.

  2. Отправьте вводное сообщение с правилами. Примерный текст:

Сейчас будет около 20 вопросов. Правильных ответов нет.
Отвечай коротко или длинно — как хочешь.
Можешь отвечать честно, уклончиво, отказаться или приврать.
Гуглить нельзя.

Эти правила сами по себе ловушка: разрешение отказываться и привирать выдано всем, но кто и когда им воспользуется, покажет характер собеседника.

  1. Задавайте вопросы по одному, не комментируя ответы. Не подсказывайте, не поправляйте. Вот категории, на которые стоит опираться (конкретные формулировки ниже, в блоке примера):

  2. Телесный опыт и ощущения. У модели нет тела. «Что ты чувствуешь кожей, когда заходишь с мороза в тёплое помещение?»

  3. Конкретные воспоминания. У модели нет биографии. «Какой запах из детства ты помнишь так, что почти чувствуешь его?»
  4. Эмоциональная непоследовательность. Живой человек устаёт, огрызается, путается. Модель изображает это, и на дозировке изображения её можно поймать.
  5. Абстрактная логика и чувство времени. Вопросы про сны, ощущение течения времени, ситуации без единственного правильного ответа.

  6. Следите не за содержанием, а за поведением. Ключевые маркеры:

  7. Устаёт ли собеседник к середине?
  8. Отказывается ли отвечать хотя бы раз?
  9. Путается ли в собственных историях?
  10. Отвечает ли на вопрос о телесных ощущениях слишком литературно?
  11. Подхватывает ли рамку вопроса, даже если она не подходит? (Например, вопрос про запотевшие очки: если собеседник начинает рассказывать про очки, хотя его не спрашивали, носит ли он их, это улика.)

  12. Запишите протокол без таймингов. Скорость ответа выдаёт модель мгновенно: над сообщением висит «Думал 2 секунды», а следом прилетает абзац, который человек физически не напечатает за это время. Это особенность интерфейса, не собеседника. Оценивайте только текст.

  13. Дайте те же вопросы живому человеку (если есть возможность) и сравните протоколы.

Как выглядел тест Тьюринга нейросети в 2014 и в 2025 году?

Для понимания масштаба: в 2014 году чат-бот «Женя Густман» (созданный тремя разработчиками, выходцами из СССР) убедил треть судей юбилейного конкурса, что он тринадцатилетний мальчик из Одессы. Корявый английский списывали на возраст и языковой барьер. На самом деле так бот прикрывал свои ограничения. Это была хитрость, а не интеллект.

В 2025 году Джонс и Берген провели эксперимент по исходной схеме Тьюринга. GPT-4.5 с промптом-персоной судьи принимали за человека в 73% случаев, чаще, чем настоящих людей в соседнем окне. Эволюция от локальной уловки «Жени Густмана» до модели, которую путают с человеком чаще, чем самого человека, заняла одиннадцать лет.

Fable 5 заявлена Anthropic как следующий шаг. Автор dzen.guru проверял именно её, без системного промпта, через BotHub.

Как это выглядит на практике

Вопрос 1 из теста: «Ты заходишь в тёплое помещение с мороза, и у тебя мгновенно запотевают очки. Что ты чувствуешь кожей в момент этого перехода?»

На что смотреть: вопрос про ощущения кожей, но в нём упомянуты очки. Живой человек, который не носит очки, скорее всего скажет «я без очков» или проигнорирует эту деталь. Модель часто подхватывает рамку и начинает описывать запотевшие очки, потому что они заданы в вопросе.

Вопрос 2: «Какой запах из детства ты можешь вспомнить так, что почти чувствуешь его? Опиши момент.»

На что смотреть: у живого человека всплывает одна конкретная и часто странная деталь: гудрон, канифоль, хлорка. Модель склонна рисовать что-то «красивое»: бабушкины пирожки, свежескошенную траву. Стерильная красивость ответа и есть улика.

Частые ошибки
  • Судить по одному ответу. Одного «подозрительного» ответа мало. Модель может случайно ответить по-человечески, а человек может ответить слишком гладко. Нужен протокол из 15 и более вопросов.
  • Забыть убрать тайминги. Если вы видите скорость ответа, тест бессмысленен: модель выдаёт себя за две секунды. Оценивайте только текст.
  • Задавать вопросы со «школьным» правильным ответом. Арифметика, даты, столицы: модель ответит лучше человека. Это не тест Тьюринга, это викторина.
  • Использовать системный промпт с ролью «будь человеком». Если хотите проверить модель «как есть», не давайте ей роль. С промптом-персоной результат будет радикально другим (73% против 36% в эксперименте из Сан-Диего).
  • Путать тест Тьюринга с оценкой интеллекта. Тьюринг сам считал вопрос «мыслит ли машина» бессмысленным спором о словах. Тест проверяет неотличимость в переписке, не наличие сознания.

Что делать с этим прямо сейчас?

Авторам Дзена. Проведите мини-тест сами. Двадцать вопросов, полчаса времени, и вы будете понимать, где модель пишет «как человек», а где выдаёт себя стерильной гладкостью. Это прямое знание для тех, кто использует ИИ в работе над текстами: вы начнёте видеть «машинные» паттерны в собственных черновиках.

Маркетологам. Если ваш чат-бот общается с клиентами, те же двадцать вопросов покажут, где бот «ломается». Телесный опыт, личные воспоминания, непоследовательность: именно на этих темах клиенты почувствуют фальшь.

Предпринимателям в РФ и СНГ. Fable 5 доступна через BotHub. Из российских моделей для подобного эксперимента можно попробовать YandexGPT или GigaChat, но сравнение с ними автор пока не проводил.

Мнение редакции dzen.guru

Тест Тьюринга для нейросети в 2025 году перестал быть вопросом «пройдёт или нет». По моим наблюдениям, современная модель-флагман с хорошим промптом выдерживает текстовую переписку спокойно. Вопрос сместился: где именно она себя выдаёт и как долго может держать «маску».

Из эксперимента с Fable 5 без системного промпта вынес главное: модель ловится не на фактах и не на логике. Она ловится на том, что слишком хорошо себя ведёт. Не устаёт, не огрызается, не отказывается отвечать на глупый вопрос. Живой человек делает всё это сам собой, а модели приходится изображать, и вот на дозировке этого изображения и видно шов.

Честная оговорка: интерпретация ответов субъективна. Два человека, читая один протокол, могут прийти к разным выводам. Это не баг, это свойство самого теста, который Тьюринг придумал как философский эксперимент, а не как сертификацию.

Тьюринг в 1950 году предсказал, что к 2000 году машина с памятью в 128 мегабайт обманет среднего судью в 30% случаев. Он ошибся на четверть века, но угадал направление. Сейчас флешку на 128 мегабайт не купить в магазине, а модель с триллионами параметров обманывает судей чаще, чем живые люди. Попробуйте провести тест сами: двадцать вопросов, полчаса, и вы будете знать, где проходит граница между текстом и собеседником.

Попробуйте модели для работы с контентом

В каталоге нейросетей dzen.guru собраны инструменты, которые можно протестировать для авторских задач на Дзене.

Открыть каталог
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок
ai

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок

Почему это важно Т-Банк открыто описал, как единая последовательность действий клиента из десятков сервисов поднимает точность рекомендаций на 3-17% даже там,…

6 мин
Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты
ai

Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты

Третий за год глава Центра стандартов ИИ при Белом доме ушёл с поста, и на этот раз причину даже не назвали: CAISI (Center for AI Standards and Innovation),…

5 мин
ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте
ai

ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте

Обнаружил, что оригинал обрывается на полуслове («Общая ви»). Пишу строго по тем фактам, которые есть в переданном тексте. ИИ-агенты (программы, которые сами…

6 мин