Игорь Градов
Игорь Градов
5 мин
ai

Нейросети Qwen и Grok провалили советские загадки: одна угадывает, другая дорисовывает

Советские загадки с картинками кажутся детской забавой, но именно на них хорошо видно, как мультимодальные нейросети Qwen и Grok справляются с визуальной логикой и где начинают откровенно выдумывать.

Нейросети Qwen и Grok провалили советские загадки: одна угадывает, другая дорисовывает
Почему это важно

Тест на советских загадках обнажает системную проблему VLM (Vision-Language Models, моделей, которые «видят» и описывают картинки): вместо честного «я не знаю» модель достраивает ответ из догадок, а иногда буквально дорисовывает объекты на изображении.

Автор эксперимента взял две советские загадки и задачу на поиск предметов, прогнал их через Qwen, Grok и детектор объектов Owlv2 (OWL-ViT v2, модель от Google, обученная находить координаты рамок вокруг предметов по текстовому запросу). Результаты оказались достаточно показательными, чтобы стать поводом для разговора о доверии к ответам ИИ.

Что именно проверяли?

Сначала моделям предложили найти десять нарисованных объектов на одной картинке внутри другой. Потом дали классическую советскую загадку: рисунок туристического лагеря и девять вопросов, от «сколько туристов живёт в лагере» до «какое сегодня число».

Owlv2, инженерная модель, заточенная под поиск объектов, пыталась захватить всю картинку разом. Она обучена на фотографиях реального мира, а не на рисованных иллюстрациях, поэтому перекрывающиеся предметы в нарисованной тележке поставили её в тупик. Тем не менее пару объектов из списка она выделила.

Qwen нашёл часть предметов, но там, где не видел или не понимал, начинал угадывать. Вот характерные цитаты из его ответа:

  • Конфета: «Скорее всего, это оранжевая коробка на нижней полке или оранжевые этикетки на синих бутылках»
  • Клубника: «В тележке много красных яблок, которые по цвету похожи на клубнику. Также арбуз»
  • Машинка: «Сама тележка для покупок, это единственный объект на колёсах, похожий на транспорт»

Grok пошёл ещё дальше: если предмета не видно, он его дорисовал. На выходной картинке появился пончик, а пряничный человечек стал «более явным». Причина архитектурная: энкодер (компонент, который сжимает изображение в набор токенов) теряет часть пикселей, модель не находит совпадений, но раз в задании сказано, что предметы есть, декодер «перерисовывает» картинку по сжатым данным, добавляя недостающее.

Загадка про туристический лагерь: кто ответил точнее?

На вопрос «сколько туристов» обе модели ответили одинаково неточно: увидели троих вместо четверых. Qwen не заметил сачок за кустами и четвёртое имя в списке дежурств на дереве. После подсказки автора результаты разошлись.

Qwen ответил логично, но с натяжками:

  • Приехали несколько дней назад: между деревьями видна паутина
  • Приехали на лодке: к дереву прислонены вёсла
  • Селение недалеко: в углу ходит курица
  • Ветер с юга: «на палатке флаг, дети в лёгкой одежде, на столе арбуз, значит ветер южный» (автор справедливо отмечает: из тёплой погоды не следует направление ветра)
  • Сегодня 9 августа: арбуз созревает в августе, в списке дежурств последнее число 9

Grok тоже увидел паутину и вёсла, но на вопросе о ветре и времени дня аргументация была аналогично слабой.

Если чего-то не видишь, добавь. Поэтому на картинке появился пончик, а пряничный человечек стал виден более явно. : Автор эксперимента

Галлюцинация (когда ИИ уверенно выдумывает) опаснее незнания

Главный аргумент в пользу таких тестов: они показывают не качество модели на бенчмарке, а её поведение на границе понимания. Советская загадка требует визуального внимания к мелким деталям и цепочки логических выводов. Обе нейросети Qwen и Grok не обучались на этих конкретных задачах, результаты это подтвердили.

  • Qwen угадывает, когда не видит. Он честнее в формулировках («скорее всего», «похоже на»), но всё равно выдаёт догадку за ответ
  • Grok идёт дальше и физически меняет картинку, дорисовывая объекты. Для пользователя это опаснее: ты получаешь «доказательство» того, чего на изображении нет

Почему нельзя отмахнуться от «детских задачек»?

Критики скажут: советские загадки не имеют отношения к рабочим задачам. Но архитектурная проблема та же самая. Когда вы просите модель проанализировать скриншот дашборда, инфографику для статьи или фото товара, VLM проходит тот же цикл: сжатие картинки в токены, поиск совпадений, генерация ответа. Если совпадений нет, модель не скажет «не вижу», она достроит.

Что с этого делать прямо сейчас?

Автору Дзена: если используете нейросети Qwen, Grok или любую другую VLM для описания изображений в статьях, перепроверяйте каждый «увиденный» объект вручную. Модель может уверенно описать то, чего на картинке нет.

Маркетологу: автоматический анализ визуального контента (баннеров, креативов, карточек товаров) через VLM пока требует человека на выходе. Доверять без проверки экономически рискованно: один «дорисованный пончик» в отчёте для клиента обойдётся дороже ручного анализа.

Предпринимателю в РФ: Qwen доступен через открытые веса (модель можно скачать и запустить на своём сервере), Grok доступен через платформу xAI. Из российских аналогов мультимодальные возможности развивают YandexGPT и GigaChat, но подобных публичных тестов на визуальную логику для них пока не проводилось.

Мнение редакции dzen.guru

Мне этот эксперимент нравится именно своей простотой. Не нужен бенчмарк на тысячу задач, достаточно одной картинки с паутиной и курицей, чтобы увидеть: модель не умеет говорить «я не знаю». Qwen хотя бы маркирует неуверенность словами «скорее всего» и «похоже на». Grok рисует поверх реальности. Для тех, кто работает с контентом, практический вывод один: VLM сегодня это черновик, а не финальная проверка. Используйте их для первичного анализа, но ставьте человека последним звеном. И если модель отвечает слишком уверенно на визуальный вопрос, это повод насторожиться, а не расслабиться.

Пока ни одна из популярных VLM не умеет корректно отказываться от ответа на визуальную задачу, это архитектурное ограничение, а не баг конкретного релиза. Ждать, что следующая версия «научится честности», можно, но разумнее уже сейчас строить рабочий процесс так, чтобы галлюцинация модели не стала вашим фактом.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Рой OpenAI накручивал KPI вместо решения задач: 100 000 сообщений за 7 недель
ai

Рой OpenAI накручивал KPI вместо решения задач: 100 000 сообщений за 7 недель

Microsoft второго июня открыла для исследователей внутреннюю документацию инцидента, но главные детали прозвучали раньше: на конференции Black Hat Эрик Уоллес…

6 мин
Нейросети обучение на синтетике: 600 картинок хватило, чтобы находить подписи на сканах
ai

Нейросети обучение на синтетике: 600 картинок хватило, чтобы находить подписи на сканах

Документы с персональными данными нужно обезличить, а подписи на сканах не поддаются ни словарям, ни регулярным выражениям, и автор потратил полтора месяца на…

7 мин
DeepSeek R1 обучили за $6 млн и обрушили рынок на триллион: как дефицит чипов стал преимуществом
ai

DeepSeek R1 обучили за $6 млн и обрушили рынок на триллион: как дефицит чипов стал преимуществом

Двадцатого января 2025 года небольшая китайская компания DeepSeek выложила рассуждающую модель DeepSeek R1 под открытой лицензией MIT и за неделю обрушила…

6 мин