Игорь Градов
Игорь Градов
5 мин
ai

7 тестов интеллекта ИИ от MIT: где даже лучшие модели проваливаются

Компания MIT Technology Review опубликовала подборку из семи тестов интеллекта для ИИ, на которых даже лучшие модели спотыкаются, и предложила читателям пройти их самим, чтобы увидеть реальные границы нейросетей на знакомых задачах.

Почему это важно

Тесты интеллекта ИИ показывают не абстрактную «силу модели», а конкретные провалы: пространственное мышление, визуальные головоломки, ловушки памяти. Для тех, кто использует нейросети в работе, это карта минных полей, а не повод для восхищения.

Издание MIT Technology Review собрало семь категорий задач, где нейросети ошибаются, несмотря на стремительный прогресс. Головоломки и игры сопровождают разработку ИИ с 1959 года, когда учёный IBM Артур Сэмюэл описал алгоритм, научившийся играть в шашки. С тех пор шахматы и го стали классическими полигонами. Но именно ошибки на простых загадках обнажают разницу между машинным и человеческим мышлением.

Что Когда Кто выпустил Цена
Подборка из семи тестов интеллекта ИИ с интерактивными заданиями Июнь 2025 MIT Technology Review Бесплатно (часть материалов доступна без подписки)

Где нейросети проваливаются?

  • Пространственное мышление. Задачи на мысленное вращение трёхмерных объектов (те самые, что встречаются в IQ-тестах) остаются для языковых моделей практически нерешаемыми. Даже модели, умеющие анализировать изображения, не могут «покрутить» предмет в голове так, как это делает архитектор или инженер.

  • Ловушка памяти. Модели запоминают гигантский объём фактов из обучающих данных (training data, корпус текстов, на котором модель училась). Когда задача похожа на знакомую, но содержит мелкое отличие, модель выдаёт заученный ответ, не заметив подвоха. Исследователи из Google и Иллинойсского университета в 2024 году показали это на вариациях классической головоломки «Рыцари и лжецы».

  • Простые задачи с подвохом (SimpleBench). Вопросы вроде «сколько целых кубиков льда останется на сковороде, где жарится яичница?» ставят в тупик лучшие модели. Человек сразу понимает: лёд растает. Модель пытается считать.

  • Визуальное и абстрактное мышление (ARC-AGI). Двумерные головоломки, где нужно вывести правило из примеров, остаются слабым местом. По данным MIT Technology Review, исследования показывают, что даже при верном ответе модели используют громоздкие и негенерализуемые правила, тогда как люди опираются на простые визуальные концепции.

  • Скорость прогресса неравномерна. Учёные из Колумбийского университета зафиксировали: в конце 2024 года лучшие модели решали лишь 18% головоломок NYT Connections, а к началу 2025 года некоторые модели справлялись почти безошибочно. Но в пространственных и визуальных задачах такого рывка нет.

Как попробовать самому?

  1. Откройте материал MIT Technology Review по ссылке в конце новости. Часть заданий интерактивна: можно решать прямо в браузере.
  2. Пройдите задачи на пространственное вращение и SimpleBench. Именно они показывают самый заметный разрыв между вами и нейросетью.
  3. Задайте те же загадки вашей рабочей нейросети (ChatGPT, Claude, Gemini или любой доступной) и сравните ответы. Обратите внимание: модель почти наверняка «не заметит», что лёд на сковороде тает.

Тесты интеллекта ИИ на русскоязычных моделях: что показывает практика?

Для аудитории в России и СНГ полезно понимать, что YandexGPT и GigaChat работают на тех же архитектурных принципах, что и зарубежные модели. Это значит, что описанные слабости, память вместо рассуждения, провал на визуальных задачах и ловушки «знакомой» головоломки, воспроизводятся и на русскоязычных сервисах. Попробуйте задать любой из примеров (скажем, задачу про кубики льда на сковороде) в YandexGPT или GigaChat и проверьте сами.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена. Прежде чем доверять нейросети проверку фактов или генерацию логических аргументов, прогоните контрольную задачу с подвохом. Если модель не замечает, что лёд тает, она может не заметить и логическую дыру в вашем тексте.

Маркетологам. Визуальные задачи и пространственное мышление пока вне зоны надёжности ИИ. Если вы используете мультимодальные (работающие с текстом и изображениями одновременно) модели для анализа креативов или макетов, перепроверяйте выводы вручную.

Предпринимателям. Галлюцинации (когда модель уверенно выдумывает факты) и ловушки памяти, это не теоретический риск, а повседневная реальность. Любой бизнес-процесс на базе ИИ нуждается в человеческом контроле на выходе.

Мнение редакции dzen.guru

Я регулярно проверяю нейросети на подобных задачах и вижу одну и ту же картину: модели блестяще справляются с тем, что похоже на обучающие данные, и позорно проваливаются, когда нужно чуть отступить в сторону. Задача про лёд на сковороде, это, по моим наблюдениям, лучший «детектор ИИ-мышления»: человек смеётся над вопросом, а модель начинает считать кубики.

Не стоит делать из этого вывод, что нейросети бесполезны. Стоит делать вывод, что у них есть конкретные слепые зоны, и знать эти зоны, значит использовать инструмент грамотно. Попробуйте сегодня задать вашей рабочей модели одну задачу с подвохом из этой подборки. Результат покажет, где именно вам нужен собственный мозг, а не подписка.

Частые вопросы

Значит ли это, что ИИ не умеет думать?

Нет, но «думать» и «вспоминать» для модели не одно и то же. Тесты интеллекта ИИ показывают, что на задачах, требующих рассуждения (а не извлечения запомненного факта), модели пока сильно уступают людям. Особенно если задача визуальная или содержит мелкий подвох.

Можно ли доверять нейросети в работе после этих результатов?

Можно, но с оговоркой. Модели сильны в обработке больших объёмов текста, суммировании и черновых вариантах. Слабы в логике с подвохом, пространственном мышлении и задачах, где ответ противоречит «типичному» паттерну из обучающих данных. Контроль на выходе обязателен.

Где взять такие тесты на русском?

Готового русскоязычного аналога подборки MIT Technology Review пока нет. Но задачи «Рыцари и лжецы», SimpleBench и ARC-AGI легко формулируются по-русски. Переведите пример про кубики льда и задайте вашей модели: русский язык не меняет суть провала.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Gemini в Google Workspace для учёбы: 7 способов сэкономить часы на рутине
ai

Gemini в Google Workspace для учёбы: 7 способов сэкономить часы на рутине

Google Workspace с Gemini помогает студентам и преподавателям автоматизировать рутину учебного процесса, и вот семь конкретных способов, от планировщика…

7 мин
Arga Labs привлекла $10 млн на цифровые двойники для тренировки ИИ-агентов в корпоративном софте
ai

Arga Labs привлекла $10 млн на цифровые двойники для тренировки ИИ-агентов в корпоративном софте

Почему это важно Впервые появился инструмент, который позволяет обучать ИИ-агентов прямо внутри копии корпоративной системы, а не на упрощённых заглушках, и…

5 мин
ИИ-агенты для тестирования ботов: прототип из трёх ролей собрали за день, но 20% ошибок пока остаются
ai

ИИ-агенты для тестирования ботов: прототип из трёх ролей собрали за день, но 20% ошибок пока остаются

Почему это важно QA-инженер из российской компании Just AI собрал за один день прототип ИИ-агента, который уже находит баги в диалоговых ботах, и честно…

5 мин