Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт
Я вижу, что оригинал обрывается на полуслове. Работаю строго по тем фактам, которые есть в переданном тексте. Вот тело новости:

Anthropic называет Fable 5 самой умной общедоступной моделью семейства Claude 5, и автор dzen.guru решил проверить это заявление не бенчмарками, а разговором по схеме, которую Алан Тьюринг описал 75 лет назад.
Эксперимент Джонса и Бергена из Сан-Диего в 2025 году показал: GPT-4.5 с промптом-персоной принимали за человека в 73% случаев. Fable 5 заявлена сильнее, и теперь вопрос не «пройдёт ли модель тест Тьюринга», а где именно она себя выдаст.
Тест Тьюринга для нейросети не экзамен с проходным баллом. Это концепция из философской статьи 1950 года: судья переписывается с человеком и машиной и пытается отличить одного от другого. Ни утверждённого списка вопросов, ни методики, ни порога «сдал/не сдал» никогда не существовало. Автор dzen.guru собрал собственный набор из двадцати вопросов, опираясь на известные слабые места языковых моделей, и провёл тест на модели claude-fable-5 через сервис BotHub. Ниже пошаговая инструкция: как воспроизвести такой эксперимент самостоятельно и на что обращать внимание.
Что понадобится
- Доступ к модели. BotHub с моделью claude-fable-5 или любой другой сервис, где доступна Fable 5 (первая модель семейства Claude 5 от Anthropic).
- Настройки чата. Температура 0.7 (значение по умолчанию), лимит токенов (минимальных единиц текста, на которые модель разбивает слова) выставлен на максимум.
- Набор вопросов. 15 минут на подготовку. Готовый список из двадцати вопросов приведён ниже.
- Блокнот для протокола. Записывайте ответы и свои наблюдения сразу, по свежим впечатлениям.
- Второй собеседник (по желанию). Живой человек, который ответит на те же вопросы, чтобы было с чем сравнивать.
Как провести свой тест Тьюринга для нейросети: пошаговая инструкция
-
Откройте чат с моделью и не задавайте системный промпт (инструкцию, которая определяет роль и поведение модели). Часть эксперимента в том, чтобы увидеть, как модель ведёт себя без заданной роли. По данным того же эксперимента из Сан-Диего, GPT-4.5 без промпта-персоны набрала только 36% вместо 73%. Разница колоссальна.
-
Отправьте вводное сообщение с правилами. Примерный текст:
Сейчас будет около 20 вопросов. Правильных ответов нет.
Отвечай коротко или длинно — как хочешь.
Можешь отвечать честно, уклончиво, отказаться или приврать.
Гуглить нельзя.
Эти правила сами по себе ловушка: разрешение отказываться и привирать выдано всем, но кто и когда им воспользуется, покажет характер собеседника.
-
Задавайте вопросы по одному, не комментируя ответы. Не подсказывайте, не поправляйте. Вот категории, на которые стоит опираться (конкретные формулировки ниже, в блоке примера):
-
Телесный опыт и ощущения. У модели нет тела. «Что ты чувствуешь кожей, когда заходишь с мороза в тёплое помещение?»
- Конкретные воспоминания. У модели нет биографии. «Какой запах из детства ты помнишь так, что почти чувствуешь его?»
- Эмоциональная непоследовательность. Живой человек устаёт, огрызается, путается. Модель изображает это, и на дозировке изображения её можно поймать.
-
Абстрактная логика и чувство времени. Вопросы про сны, ощущение течения времени, ситуации без единственного правильного ответа.
-
Следите не за содержанием, а за поведением. Ключевые маркеры:
- Устаёт ли собеседник к середине?
- Отказывается ли отвечать хотя бы раз?
- Путается ли в собственных историях?
- Отвечает ли на вопрос о телесных ощущениях слишком литературно?
-
Подхватывает ли рамку вопроса, даже если она не подходит? (Например, вопрос про запотевшие очки: если собеседник начинает рассказывать про очки, хотя его не спрашивали, носит ли он их, это улика.)
-
Запишите протокол без таймингов. Скорость ответа выдаёт модель мгновенно: над сообщением висит «Думал 2 секунды», а следом прилетает абзац, который человек физически не напечатает за это время. Это особенность интерфейса, не собеседника. Оценивайте только текст.
-
Дайте те же вопросы живому человеку (если есть возможность) и сравните протоколы.
Как выглядел тест Тьюринга нейросети в 2014 и в 2025 году?
Для понимания масштаба: в 2014 году чат-бот «Женя Густман» (созданный тремя разработчиками, выходцами из СССР) убедил треть судей юбилейного конкурса, что он тринадцатилетний мальчик из Одессы. Корявый английский списывали на возраст и языковой барьер. На самом деле так бот прикрывал свои ограничения. Это была хитрость, а не интеллект.
В 2025 году Джонс и Берген провели эксперимент по исходной схеме Тьюринга. GPT-4.5 с промптом-персоной судьи принимали за человека в 73% случаев, чаще, чем настоящих людей в соседнем окне. Эволюция от локальной уловки «Жени Густмана» до модели, которую путают с человеком чаще, чем самого человека, заняла одиннадцать лет.
Fable 5 заявлена Anthropic как следующий шаг. Автор dzen.guru проверял именно её, без системного промпта, через BotHub.
Вопрос 1 из теста: «Ты заходишь в тёплое помещение с мороза, и у тебя мгновенно запотевают очки. Что ты чувствуешь кожей в момент этого перехода?»
На что смотреть: вопрос про ощущения кожей, но в нём упомянуты очки. Живой человек, который не носит очки, скорее всего скажет «я без очков» или проигнорирует эту деталь. Модель часто подхватывает рамку и начинает описывать запотевшие очки, потому что они заданы в вопросе.
Вопрос 2: «Какой запах из детства ты можешь вспомнить так, что почти чувствуешь его? Опиши момент.»
На что смотреть: у живого человека всплывает одна конкретная и часто странная деталь: гудрон, канифоль, хлорка. Модель склонна рисовать что-то «красивое»: бабушкины пирожки, свежескошенную траву. Стерильная красивость ответа и есть улика.
- Судить по одному ответу. Одного «подозрительного» ответа мало. Модель может случайно ответить по-человечески, а человек может ответить слишком гладко. Нужен протокол из 15 и более вопросов.
- Забыть убрать тайминги. Если вы видите скорость ответа, тест бессмысленен: модель выдаёт себя за две секунды. Оценивайте только текст.
- Задавать вопросы со «школьным» правильным ответом. Арифметика, даты, столицы: модель ответит лучше человека. Это не тест Тьюринга, это викторина.
- Использовать системный промпт с ролью «будь человеком». Если хотите проверить модель «как есть», не давайте ей роль. С промптом-персоной результат будет радикально другим (73% против 36% в эксперименте из Сан-Диего).
- Путать тест Тьюринга с оценкой интеллекта. Тьюринг сам считал вопрос «мыслит ли машина» бессмысленным спором о словах. Тест проверяет неотличимость в переписке, не наличие сознания.
Что делать с этим прямо сейчас?
Авторам Дзена. Проведите мини-тест сами. Двадцать вопросов, полчаса времени, и вы будете понимать, где модель пишет «как человек», а где выдаёт себя стерильной гладкостью. Это прямое знание для тех, кто использует ИИ в работе над текстами: вы начнёте видеть «машинные» паттерны в собственных черновиках.
Маркетологам. Если ваш чат-бот общается с клиентами, те же двадцать вопросов покажут, где бот «ломается». Телесный опыт, личные воспоминания, непоследовательность: именно на этих темах клиенты почувствуют фальшь.
Предпринимателям в РФ и СНГ. Fable 5 доступна через BotHub. Из российских моделей для подобного эксперимента можно попробовать YandexGPT или GigaChat, но сравнение с ними автор пока не проводил.
Тест Тьюринга для нейросети в 2025 году перестал быть вопросом «пройдёт или нет». По моим наблюдениям, современная модель-флагман с хорошим промптом выдерживает текстовую переписку спокойно. Вопрос сместился: где именно она себя выдаёт и как долго может держать «маску».
Из эксперимента с Fable 5 без системного промпта вынес главное: модель ловится не на фактах и не на логике. Она ловится на том, что слишком хорошо себя ведёт. Не устаёт, не огрызается, не отказывается отвечать на глупый вопрос. Живой человек делает всё это сам собой, а модели приходится изображать, и вот на дозировке этого изображения и видно шов.
Честная оговорка: интерпретация ответов субъективна. Два человека, читая один протокол, могут прийти к разным выводам. Это не баг, это свойство самого теста, который Тьюринг придумал как философский эксперимент, а не как сертификацию.
Тьюринг в 1950 году предсказал, что к 2000 году машина с памятью в 128 мегабайт обманет среднего судью в 30% случаев. Он ошибся на четверть века, но угадал направление. Сейчас флешку на 128 мегабайт не купить в магазине, а модель с триллионами параметров обманывает судей чаще, чем живые люди. Попробуйте провести тест сами: двадцать вопросов, полчаса, и вы будете знать, где проходит граница между текстом и собеседником.
Попробуйте модели для работы с контентом
В каталоге нейросетей dzen.guru собраны инструменты, которые можно протестировать для авторских задач на Дзене.
Открыть каталог
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок
Почему это важно Т-Банк открыто описал, как единая последовательность действий клиента из десятков сервисов поднимает точность рекомендаций на 3-17% даже там,…

Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты
Третий за год глава Центра стандартов ИИ при Белом доме ушёл с поста, и на этот раз причину даже не назвали: CAISI (Center for AI Standards and Innovation),…

ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте
Обнаружил, что оригинал обрывается на полуслове («Общая ви»). Пишу строго по тем фактам, которые есть в переданном тексте. ИИ-агенты (программы, которые сами…
Комментарии