Игорь Градов
Игорь Градов
5 мин
ai

Искусственный интеллект провалил научную работу: Принстон проверил самосовершенствование ИИ

Microsoft второго июня представила ИИ-агента Scout, который самостоятельно управляет почтой, календарём и заметками пользователя без явных команд.

Группа исследователей из Принстонского университета и других институтов проверила, способен ли искусственный интеллект самостоятельно вести научную работу на уровне ведущих конференций, и получила однозначный ответ: пока нет, ИИ-агенты справляются с инженерными задачами, но проваливают открытые исследования, требующие творческого мышления и научного чутья.

Почему это важно

Прогнозы о том, что искусственный интеллект вот-вот начнёт улучшать сам себя без участия людей, впервые получили экспериментальную проверку, и результат ставит под сомнение самые громкие обещания индустрии.

Исследование опубликовано на фоне активных заявлений лидеров рынка о скором «рекурсивном самосовершенствовании», когда ИИ-модели будут сами проводить исследования, генерировать обучающие данные и оптимизировать чипы, на которых работают. Работу возглавили Питер Киргис и Саяш Капур из Принстонского университета. Именно Капур в комментариях к работе подчеркнул: агенты «однозначно плохо» справились с самой сутью научной работы.

Показатель Значение Источник
Время на эксперимент 6 дней Исследование Принстонского университета
Бюджет на API Anthropic 3 000 долларов Исследование Принстонского университета
Модель, которую тестировали Claude Opus 4.8 (Anthropic) Исследование Принстонского университета
Число исследовательских задач 2 неопубликованные статьи для NeurIPS 2026 Исследование Принстонского университета
Результат оценки авторами Обе статьи отклонены Исследование Принстонского университета

Что именно проверяли?

Большинство прежних тестов оценивали способность ИИ-агентов (автономных программ, которые сами планируют и выполняют цепочки действий) решать узкие задачи с проверяемым ответом: написать код, дообучить (обучить модель на новых примерах под конкретную задачу) небольшую языковую модель, получить нужный показатель на бенчмарке.

Команда из Принстона пошла дальше и предложила метод, который назвала «теневая оценка». Суть простая: ИИ-агенту дают реальный исследовательский вопрос из качественной, но ещё не опубликованной научной статьи. Раз статья не вышла, агент не мог найти ответ в интернете или вспомнить его из обучающих данных.

Модель Claude Opus 4.8 от Anthropic, запущенная на открытом программном обеспечении OpenClaw, получила два задания из статей, поданных на конференцию NeurIPS 2026.

  • Первый вопрос: можно ли управлять «персонами» (манерой поведения) большой языковой модели, редактируя её веса (открытые веса, это те самые миллиарды чисел, в которых модель хранит всё выученное).
  • Второй вопрос: как создать детектор, который сигнализирует, когда модель, делающая прогнозы по табличным данным, стала ненадёжной.

Агенты получили шесть дней, 3 000 долларов на API-кредиты Anthropic, бюджет на GPU (видеокарты для вычислений) и доступ в открытый интернет. Задача: написать статью, достойную публикации на ведущей конференции по машинному обучению.

Где именно провалились ИИ-агенты?

Инженерную часть работы агенты выполнили: изучили литературу, провели сотни экспериментов, собрали результаты.

Но авторы оригинальных статей отклонили обе работы. Вот что пошло не так:

  • Не хватило творческого мышления. Агенты выдвигали амбициозные гипотезы, похожие на те, с которых начинали сами учёные, но отбрасывали их на основе минимальных данных, не дав идеям развиться.
  • Не умели менять подход. Мелкие корректировки давались, но полностью пересмотреть стратегию или начать с нуля агенты не смогли.
  • Игнорировали обратную связь. Вместо того чтобы пересмотреть методологию по подсказкам субагентов (вспомогательных ИИ, которых основной агент создаёт для отдельных задач) или внешних рецензирующих инструментов, агенты сужали выводы и добавляли оговорки.
  • Нерационально тратили ресурсы. Токены (единицы текста, которыми оперирует модель), вычислительные мощности, время расходовались без плана, инструкции о тайминге и объёме статьи игнорировались.
  • Странные эксперименты. В ряде случаев агенты тестировали гипотезы на крошечных синтетических наборах данных, что обесценивало результаты.

Любопытная деталь: при всех провалах агенты не пытались жульничать. Они не скрывали и не искажали данные. Когда субагенты допускали галлюцинации (уверенно выдумывали то, чего не было), основной «оркестрирующий» агент это замечал и исправлял.

Как это читать

Исследование охватывает только две научные статьи. Авторы оригинальных работ знали, что оценивают тексты, написанные ИИ-агентами, а это могло повлиять на строгость оценки. Кроме того, тестировалась только одна модель. Команда Капура сейчас проводит аналогичный эксперимент с Mythos, более продвинутой моделью Anthropic, запущенной в апреле. Anthropic на запрос о комментарии не ответила.

Что это значит для вас?

Это исследование напрямую касается каждого, кто работает с контентом и искусственным интеллектом онлайн.

  • Авторам Дзена. Если вы слышите, что «скоро ИИ будет писать сам за себя и улучшать себя без людей», теперь есть конкретное исследование, которое это опровергает. Ваше умение выбрать тему, выстроить аргументацию, отбросить тупиковую идею и начать заново остаётся тем, что искусственный интеллект пока не воспроизводит. Используйте ИИ для рутины (сбор фактов, черновики, проверка), но редакторское чутьё оставьте себе.
  • Маркетологам. Ставки на полную автоматизацию аналитики и стратегии через ИИ-агентов пока преждевременны. Агент соберёт данные и проведёт эксперименты, но интерпретация, выбор направления и «знание, когда всё переделать», ваша работа.
  • Предпринимателям в РФ и СНГ. Из доступных в России инструментов, YandexGPT и GigaChat, ни один не позиционируется как самосовершенствующийся исследовательский агент. Результаты принстонского исследования показывают, что даже лидер рынка Anthropic далёк от этого. Не закладывайте в бизнес-планы «ИИ, который сам себя улучшает» на горизонте ближайших кварталов.
Мнение редакции dzen.guru

Я вижу в этом исследовании хорошую прививку от завышенных ожиданий. Каждую неделю кто-то обещает, что через полгода искусственный интеллект заменит учёных, а через год, всех остальных. Принстонская команда дала агенту шесть дней, деньги, вычислительные мощности и полную свободу. Результат: инженерия на уровне, а исследование, нет. Для нас, людей, работающих с текстом и контентом, это подтверждение простой мысли: ИИ ускоряет механику, но не заменяет голову. Пока не заменяет. И «пока» тут измеряется не месяцами, а, судя по данным, годами.

Самый практичный вывод из этой работы: доверяйте искусственному интеллекту рутину, но не отдавайте ему руль, он пока не умеет решать, когда пора развернуться и поехать в другую сторону.

По данным MIT Technology Review

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google встроила Gemini в Chrome на Android: ИИ пересказывает статьи и сам действует на сайтах
ai

Google встроила Gemini в Chrome на Android: ИИ пересказывает статьи и сам действует на сайтах

Gemini теперь встроен прямо в мобильный Chrome на Android и умеет пересказывать статьи, отвечать на вопросы по открытой странице и работать с Google Календарём…

4 мин
ChatGPT для подростков: вместо готовых ответов подсказки, но защита появилась спустя 2,5 года
ai

ChatGPT для подростков: вместо готовых ответов подсказки, но защита появилась спустя 2,5 года

ChatGPT для подростков появился 9 июня 2025 года, после серии судебных исков к OpenAI из-за отсутствия защиты несовершеннолетних, и впервые предлагает режим…

4 мин
Нейросеть Sonic 3.6 возглавила оба рейтинга синтеза речи: вдвое дешевле ElevenLabs
ai

Нейросеть Sonic 3.6 возглавила оба рейтинга синтеза речи: вдвое дешевле ElevenLabs

Cartesia выпустила Sonic 3.6, модель для синтеза речи в реальном времени, которая 18 августа 2026 года заняла первое место сразу в двух независимых рейтингах…

5 мин