Искусственный интеллект провалил научную работу: Принстон проверил самосовершенствование ИИ
Microsoft второго июня представила ИИ-агента Scout, который самостоятельно управляет почтой, календарём и заметками пользователя без явных команд.
Группа исследователей из Принстонского университета и других институтов проверила, способен ли искусственный интеллект самостоятельно вести научную работу на уровне ведущих конференций, и получила однозначный ответ: пока нет, ИИ-агенты справляются с инженерными задачами, но проваливают открытые исследования, требующие творческого мышления и научного чутья.
Прогнозы о том, что искусственный интеллект вот-вот начнёт улучшать сам себя без участия людей, впервые получили экспериментальную проверку, и результат ставит под сомнение самые громкие обещания индустрии.
Исследование опубликовано на фоне активных заявлений лидеров рынка о скором «рекурсивном самосовершенствовании», когда ИИ-модели будут сами проводить исследования, генерировать обучающие данные и оптимизировать чипы, на которых работают. Работу возглавили Питер Киргис и Саяш Капур из Принстонского университета. Именно Капур в комментариях к работе подчеркнул: агенты «однозначно плохо» справились с самой сутью научной работы.
| Показатель | Значение | Источник |
|---|---|---|
| Время на эксперимент | 6 дней | Исследование Принстонского университета |
| Бюджет на API Anthropic | 3 000 долларов | Исследование Принстонского университета |
| Модель, которую тестировали | Claude Opus 4.8 (Anthropic) | Исследование Принстонского университета |
| Число исследовательских задач | 2 неопубликованные статьи для NeurIPS 2026 | Исследование Принстонского университета |
| Результат оценки авторами | Обе статьи отклонены | Исследование Принстонского университета |
Что именно проверяли?
Большинство прежних тестов оценивали способность ИИ-агентов (автономных программ, которые сами планируют и выполняют цепочки действий) решать узкие задачи с проверяемым ответом: написать код, дообучить (обучить модель на новых примерах под конкретную задачу) небольшую языковую модель, получить нужный показатель на бенчмарке.
Команда из Принстона пошла дальше и предложила метод, который назвала «теневая оценка». Суть простая: ИИ-агенту дают реальный исследовательский вопрос из качественной, но ещё не опубликованной научной статьи. Раз статья не вышла, агент не мог найти ответ в интернете или вспомнить его из обучающих данных.
Модель Claude Opus 4.8 от Anthropic, запущенная на открытом программном обеспечении OpenClaw, получила два задания из статей, поданных на конференцию NeurIPS 2026.
- Первый вопрос: можно ли управлять «персонами» (манерой поведения) большой языковой модели, редактируя её веса (открытые веса, это те самые миллиарды чисел, в которых модель хранит всё выученное).
- Второй вопрос: как создать детектор, который сигнализирует, когда модель, делающая прогнозы по табличным данным, стала ненадёжной.
Агенты получили шесть дней, 3 000 долларов на API-кредиты Anthropic, бюджет на GPU (видеокарты для вычислений) и доступ в открытый интернет. Задача: написать статью, достойную публикации на ведущей конференции по машинному обучению.
Где именно провалились ИИ-агенты?
Инженерную часть работы агенты выполнили: изучили литературу, провели сотни экспериментов, собрали результаты.
Но авторы оригинальных статей отклонили обе работы. Вот что пошло не так:
- Не хватило творческого мышления. Агенты выдвигали амбициозные гипотезы, похожие на те, с которых начинали сами учёные, но отбрасывали их на основе минимальных данных, не дав идеям развиться.
- Не умели менять подход. Мелкие корректировки давались, но полностью пересмотреть стратегию или начать с нуля агенты не смогли.
- Игнорировали обратную связь. Вместо того чтобы пересмотреть методологию по подсказкам субагентов (вспомогательных ИИ, которых основной агент создаёт для отдельных задач) или внешних рецензирующих инструментов, агенты сужали выводы и добавляли оговорки.
- Нерационально тратили ресурсы. Токены (единицы текста, которыми оперирует модель), вычислительные мощности, время расходовались без плана, инструкции о тайминге и объёме статьи игнорировались.
- Странные эксперименты. В ряде случаев агенты тестировали гипотезы на крошечных синтетических наборах данных, что обесценивало результаты.
Любопытная деталь: при всех провалах агенты не пытались жульничать. Они не скрывали и не искажали данные. Когда субагенты допускали галлюцинации (уверенно выдумывали то, чего не было), основной «оркестрирующий» агент это замечал и исправлял.
Исследование охватывает только две научные статьи. Авторы оригинальных работ знали, что оценивают тексты, написанные ИИ-агентами, а это могло повлиять на строгость оценки. Кроме того, тестировалась только одна модель. Команда Капура сейчас проводит аналогичный эксперимент с Mythos, более продвинутой моделью Anthropic, запущенной в апреле. Anthropic на запрос о комментарии не ответила.
Что это значит для вас?
Это исследование напрямую касается каждого, кто работает с контентом и искусственным интеллектом онлайн.
- Авторам Дзена. Если вы слышите, что «скоро ИИ будет писать сам за себя и улучшать себя без людей», теперь есть конкретное исследование, которое это опровергает. Ваше умение выбрать тему, выстроить аргументацию, отбросить тупиковую идею и начать заново остаётся тем, что искусственный интеллект пока не воспроизводит. Используйте ИИ для рутины (сбор фактов, черновики, проверка), но редакторское чутьё оставьте себе.
- Маркетологам. Ставки на полную автоматизацию аналитики и стратегии через ИИ-агентов пока преждевременны. Агент соберёт данные и проведёт эксперименты, но интерпретация, выбор направления и «знание, когда всё переделать», ваша работа.
- Предпринимателям в РФ и СНГ. Из доступных в России инструментов, YandexGPT и GigaChat, ни один не позиционируется как самосовершенствующийся исследовательский агент. Результаты принстонского исследования показывают, что даже лидер рынка Anthropic далёк от этого. Не закладывайте в бизнес-планы «ИИ, который сам себя улучшает» на горизонте ближайших кварталов.
Я вижу в этом исследовании хорошую прививку от завышенных ожиданий. Каждую неделю кто-то обещает, что через полгода искусственный интеллект заменит учёных, а через год, всех остальных. Принстонская команда дала агенту шесть дней, деньги, вычислительные мощности и полную свободу. Результат: инженерия на уровне, а исследование, нет. Для нас, людей, работающих с текстом и контентом, это подтверждение простой мысли: ИИ ускоряет механику, но не заменяет голову. Пока не заменяет. И «пока» тут измеряется не месяцами, а, судя по данным, годами.
Самый практичный вывод из этой работы: доверяйте искусственному интеллекту рутину, но не отдавайте ему руль, он пока не умеет решать, когда пора развернуться и поехать в другую сторону.
По данным MIT Technology Review

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Google встроила Gemini в Chrome на Android: ИИ пересказывает статьи и сам действует на сайтах
Gemini теперь встроен прямо в мобильный Chrome на Android и умеет пересказывать статьи, отвечать на вопросы по открытой странице и работать с Google Календарём…

ChatGPT для подростков: вместо готовых ответов подсказки, но защита появилась спустя 2,5 года
ChatGPT для подростков появился 9 июня 2025 года, после серии судебных исков к OpenAI из-за отсутствия защиты несовершеннолетних, и впервые предлагает режим…

Нейросеть Sonic 3.6 возглавила оба рейтинга синтеза речи: вдвое дешевле ElevenLabs
Cartesia выпустила Sonic 3.6, модель для синтеза речи в реальном времени, которая 18 августа 2026 года заняла первое место сразу в двух независимых рейтингах…
Комментарии