Игорь Градов
Игорь Градов
6 мин
ai

ИИ-агенты и программирование: три из четырёх условий замены джуниоров провалены

Microsoft второго июня запустила агентную среду, где ИИ-агенты ведут код без присмотра, и аналитик Эван Армстронг тут же разобрал, почему четыре условия для замены junior-разработчиков пока не выполнены.

ИИ-агенты и программирование: три из четырёх условий замены джуниоров провалены
Почему это важно

Бенчмарк SWE-bench Verified, на который два года ссылались как на доказательство «конца джуниоров», отозвала сама OpenAI: 59,4% проверенных тестов оказались с дефектами, а модели воспроизводили ответы из обучающих данных. Цифры, на которых строился вывод о ненужности начинающих программистов, оказались завышены.

Каждый крупный релиз модели сопровождается ростом баллов в тестах на написание кода. Из этого роста делают прямой вывод: ИИ-агенты программирования вот-вот заменят начинающих разработчиков. Аналитик, автор разбора на платформе Napkin Math, проверил этот вывод иначе: не «заменят или нет», а «что должно стать правдой, чтобы замена сработала». Из четырёх необходимых условий три не выполнены. Четвёртое выполняется, но совсем не так, как ожидали оптимисты.

Показатель Значение Источник
Горизонт задач, на котором модель справляется в 50% случаев Удваивается примерно каждые 7 месяцев (2019-2025) METR, Time Horizon 1.1
Успешность моделей на задачах длиннее 4 часов (по меркам человека) Менее 10% METR (Kwa et al.)
Доля проверенных задач SWE-bench Verified с дефектными тестами 59,4% из проаудированных 27,6% датасета OpenAI, февраль 2026
Ожидаемое ускорение разработчиков с ИИ (прогноз участников) 24% быстрее METR, рандомизированный эксперимент, 16 разработчиков, 246 задач
Реальное изменение скорости (измеренное) 19% медленнее METR, тот же эксперимент
Разработчики, не доверяющие точности ИИ-вывода 46% Stack Overflow, опрос 2025, более 49 000 участников
Разработчики с высоким доверием к ИИ-коду 3% Stack Overflow, опрос 2025
Доля разработчиков, использующих ИИ на работе 90% Google DORA, около 5 000 специалистов
Разработчики, не доверяющие ИИ-коду (DORA) 30% Google DORA

Что именно проверяли?

Автор сформулировал четыре условия, все из которых должны выполняться одновременно, чтобы ИИ-агенты программирования действительно вытеснили junior-разработчиков. Метод простой: берётся каждое условие и проверяется лучшими доступными данными.

  • Условие 1. ИИ-агент должен надёжно справляться с задачами той длины, которую реально получает джуниор.
  • Условие 2. Бенчмарк (тест производительности модели) должен измерять именно ту работу, которую делает человек.
  • Условие 3. Стоимость проверки того, что выдал агент, должна быть ниже стоимости делегирования задачи человеку.
  • Условие 4. Компании должны быть готовы сломать собственный кадровый конвейер, через который растут будущие senior-инженеры.

Три условия, которые провалились

Агент не тянет реальную длину задачи. Организация METR (занимается оценкой рисков ИИ) замеряет «горизонт времени»: длину задачи, на которой модель справляется в половине случаев. Этот горизонт растёт. Но при пороге 80% успешности горизонт резко сжимается. На задачах, которые человек решает дольше четырёх часов, модели справляются менее чем в 10% случаев.

Ключевой нюанс, который почти никто не цитирует: сами авторы METR указывают, что их задачи намеренно самодостаточны и чётко сформулированы. Двухчасовая задача в бенчмарке означает «два часа для человека без контекста», а не для инженера, знающего кодовую базу. Первые полгода работы джуниора почти целиком уходят на освоение контекста: какой сервис за что отвечает, зачем существует та или иная абстракция (слой упрощения в коде), кого спросить. Бенчмарк измеряет ровно ту часть работы, из которой убрали то, что делает её трудной.

Бенчмарк не измеряет реальную работу. В феврале 2026 года OpenAI прекратила отчитываться по SWE-bench Verified и рекомендовала другим поступить так же. Причины: при аудите 27,6% датасета (набора данных для тестирования) обнаружилось, что минимум 59,4% проверенных задач содержат дефектные тесты, отсекающие правильные решения. Кроме того, выявлена контаминация (загрязнение обучающих данных): модели воспроизводили точные «золотые» патчи (эталонные решения) и дословные описания задач, что указывает на утечку ответов в тренировочный набор.

На более сложных и менее загрязнённых наборах, таких как SWE-bench Pro, результаты моделей падают резко. Это не значит, что бенчмарки бесполезны. Это значит конкретнее: число, которым два года обосновывали ненужность джуниоров, отозвала сама лаборатория, которая его создала.

Проверка дороже делегирования. METR провела рандомизированный контролируемый эксперимент: 16 опытных разработчиков опенсорса (открытых проектов), 246 реальных задач в их собственных репозиториях (хранилищах кода). ИИ включали или выключали случайным образом. Запись экранов.

Разработчики прогнозировали ускорение на 24%. После работы оценили себя на 20% быстрее. Реальный замер: на 19% медленнее. Люди ошиблись даже в направлении эффекта.

Выборка мала и специфична: опытные разработчики на зрелых проектах, инструменты начала 2025 года. Но разрыв между ощущением и реальностью устойчив. Генерация кода подешевела, проверка нет. Узкое место теперь время senior-инженера на ревью, и оно не масштабируется.

Четвёртое условие уже выполняется?

Стэнфордская лаборатория цифровой экономики (Stanford's Digital Economy Lab) отслеживает данные по зарплатным ведомостям ADP, охватывающие примерно каждого шестого работника в США. Их исследование показывает: занятость людей 22-25 лет в профессиях с высокой экспозицией к ИИ, включая разработку ПО, уже резко расходится с занятостью старших возрастных групп в тех же профессиях.

Компании начинают сокращать найм джуниоров не потому, что агенты справляются с их работой, а потому, что верят в скорую замену. Условия 1-3 описывают, работает ли замена технически. Условие 4 описывает, будут ли компании пытаться, невзирая на ответ.

Как это читать

Исследование представляет собой аналитический разбор, а не рецензированную научную работу. Эксперимент METR с 16 разработчиками мал и специфичен: авторы сами не претендуют на универсальность. Аудит SWE-bench проведён OpenAI на 27,6% датасета, выводы о 59,4% дефектов относятся к проверенной части. Данные Стэнфорда по ADP описывают американский рынок труда и не переносятся напрямую на РФ и СНГ. Корреляция между экспозицией к ИИ и падением найма молодых специалистов не доказывает причинно-следственную связь.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Те же три проблемы: контаминация, дефекты тестов, разрыв с реальностью, касаются любых бенчмарков, которыми измеряют качество ИИ-текстов. Когда вам показывают «модель пишет на 90% как человек», спрашивайте: что именно измерялось, на каких данных обучали, не попали ли ответы в обучающую выборку.

Маркетологам. Ключевая находка для вас не про код, а про разрыв восприятия: люди уверены, что ИИ ускорил их работу, хотя замер показывает обратное. Прежде чем отчитываться «внедрение ИИ дало рост эффективности», измерьте результат, а не ощущение.

Предпринимателям РФ и СНГ. Из доступных в России инструментов для ИИ-агентов программирования работают GigaCode от Сбера и ряд решений на базе открытых моделей. Вывод из разбора прямой: не сокращайте найм стажёров, рассчитывая на агентов. Senior-инженеры, которые вам нужны через три года, сейчас должны откуда-то взяться. Сломав входную ступень, вы не экономите, а создаёте дефицит, который агенты пока не закрывают.

Мнение редакции dzen.guru

Этот разбор ценен не выводом «ИИ-агенты не заменят джуниоров» (со временем могут), а методом. Вместо скачка от балла бенчмарка к рыночному прогнозу автор разложил цепочку на звенья и проверил каждое. Мы в dzen.guru рекомендуем применять тот же подход к любому громкому заявлению про ИИ: не «модель набрала X баллов, значит Y», а «что должно быть правдой, чтобы Y случилось, и правда ли это». Особенно когда Y касается вашей работы. Пока что самый надёжный вывод из всех данных: генерация дешевеет, проверка нет. Тот, кто умеет проверять, стоит дороже, а не дешевле.

Компании уже режут найм джуниоров, опираясь на цифры, которые сама OpenAI признала ненадёжными. Если вы управляете командой, перечитайте условия 1-3 и честно ответьте: выполнено ли хоть одно в вашей кодовой базе, с вашими задачами, с вашим ревью. Скорее всего, пока нет.

По данным Napkin Math

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн
ai

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн

Стартап Instinct, основанный 23-летним Ноа Шинном всего год назад, привлёк 250 млн долларов в раунде Series B и довёл общий объём финансирования до 350 млн…

4 мин
Gemini Google запутал пользователей тремя брендами в одном приложении: как это исправляют
ai

Gemini Google запутал пользователей тремя брендами в одном приложении: как это исправляют

Google ломает собственный ИИ-интерфейс тремя отдельными брендами, и это урок для всех, кто строит продукт. Google в среду обновила голосовые функции Gemini…

5 мин
Искусственный интеллект в медицине: модель Google с 0,72 млн параметров обошла конкурентов в 187 раз крупнее
ai

Искусственный интеллект в медицине: модель Google с 0,72 млн параметров обошла конкурентов в 187 раз крупнее

Google Research и Университет Нового Южного Уэльса (UNSW Sydney) представили GlucoFM, компактную модель искусственного интеллекта для анализа данных…

4 мин