ИИ-агенты и программирование: три из четырёх условий замены джуниоров провалены
Microsoft второго июня запустила агентную среду, где ИИ-агенты ведут код без присмотра, и аналитик Эван Армстронг тут же разобрал, почему четыре условия для замены junior-разработчиков пока не выполнены.

Бенчмарк SWE-bench Verified, на который два года ссылались как на доказательство «конца джуниоров», отозвала сама OpenAI: 59,4% проверенных тестов оказались с дефектами, а модели воспроизводили ответы из обучающих данных. Цифры, на которых строился вывод о ненужности начинающих программистов, оказались завышены.
Каждый крупный релиз модели сопровождается ростом баллов в тестах на написание кода. Из этого роста делают прямой вывод: ИИ-агенты программирования вот-вот заменят начинающих разработчиков. Аналитик, автор разбора на платформе Napkin Math, проверил этот вывод иначе: не «заменят или нет», а «что должно стать правдой, чтобы замена сработала». Из четырёх необходимых условий три не выполнены. Четвёртое выполняется, но совсем не так, как ожидали оптимисты.
| Показатель | Значение | Источник |
|---|---|---|
| Горизонт задач, на котором модель справляется в 50% случаев | Удваивается примерно каждые 7 месяцев (2019-2025) | METR, Time Horizon 1.1 |
| Успешность моделей на задачах длиннее 4 часов (по меркам человека) | Менее 10% | METR (Kwa et al.) |
| Доля проверенных задач SWE-bench Verified с дефектными тестами | 59,4% из проаудированных 27,6% датасета | OpenAI, февраль 2026 |
| Ожидаемое ускорение разработчиков с ИИ (прогноз участников) | 24% быстрее | METR, рандомизированный эксперимент, 16 разработчиков, 246 задач |
| Реальное изменение скорости (измеренное) | 19% медленнее | METR, тот же эксперимент |
| Разработчики, не доверяющие точности ИИ-вывода | 46% | Stack Overflow, опрос 2025, более 49 000 участников |
| Разработчики с высоким доверием к ИИ-коду | 3% | Stack Overflow, опрос 2025 |
| Доля разработчиков, использующих ИИ на работе | 90% | Google DORA, около 5 000 специалистов |
| Разработчики, не доверяющие ИИ-коду (DORA) | 30% | Google DORA |
Что именно проверяли?
Автор сформулировал четыре условия, все из которых должны выполняться одновременно, чтобы ИИ-агенты программирования действительно вытеснили junior-разработчиков. Метод простой: берётся каждое условие и проверяется лучшими доступными данными.
- Условие 1. ИИ-агент должен надёжно справляться с задачами той длины, которую реально получает джуниор.
- Условие 2. Бенчмарк (тест производительности модели) должен измерять именно ту работу, которую делает человек.
- Условие 3. Стоимость проверки того, что выдал агент, должна быть ниже стоимости делегирования задачи человеку.
- Условие 4. Компании должны быть готовы сломать собственный кадровый конвейер, через который растут будущие senior-инженеры.
Три условия, которые провалились
Агент не тянет реальную длину задачи. Организация METR (занимается оценкой рисков ИИ) замеряет «горизонт времени»: длину задачи, на которой модель справляется в половине случаев. Этот горизонт растёт. Но при пороге 80% успешности горизонт резко сжимается. На задачах, которые человек решает дольше четырёх часов, модели справляются менее чем в 10% случаев.
Ключевой нюанс, который почти никто не цитирует: сами авторы METR указывают, что их задачи намеренно самодостаточны и чётко сформулированы. Двухчасовая задача в бенчмарке означает «два часа для человека без контекста», а не для инженера, знающего кодовую базу. Первые полгода работы джуниора почти целиком уходят на освоение контекста: какой сервис за что отвечает, зачем существует та или иная абстракция (слой упрощения в коде), кого спросить. Бенчмарк измеряет ровно ту часть работы, из которой убрали то, что делает её трудной.
Бенчмарк не измеряет реальную работу. В феврале 2026 года OpenAI прекратила отчитываться по SWE-bench Verified и рекомендовала другим поступить так же. Причины: при аудите 27,6% датасета (набора данных для тестирования) обнаружилось, что минимум 59,4% проверенных задач содержат дефектные тесты, отсекающие правильные решения. Кроме того, выявлена контаминация (загрязнение обучающих данных): модели воспроизводили точные «золотые» патчи (эталонные решения) и дословные описания задач, что указывает на утечку ответов в тренировочный набор.
На более сложных и менее загрязнённых наборах, таких как SWE-bench Pro, результаты моделей падают резко. Это не значит, что бенчмарки бесполезны. Это значит конкретнее: число, которым два года обосновывали ненужность джуниоров, отозвала сама лаборатория, которая его создала.
Проверка дороже делегирования. METR провела рандомизированный контролируемый эксперимент: 16 опытных разработчиков опенсорса (открытых проектов), 246 реальных задач в их собственных репозиториях (хранилищах кода). ИИ включали или выключали случайным образом. Запись экранов.
Разработчики прогнозировали ускорение на 24%. После работы оценили себя на 20% быстрее. Реальный замер: на 19% медленнее. Люди ошиблись даже в направлении эффекта.
Выборка мала и специфична: опытные разработчики на зрелых проектах, инструменты начала 2025 года. Но разрыв между ощущением и реальностью устойчив. Генерация кода подешевела, проверка нет. Узкое место теперь время senior-инженера на ревью, и оно не масштабируется.
Четвёртое условие уже выполняется?
Стэнфордская лаборатория цифровой экономики (Stanford's Digital Economy Lab) отслеживает данные по зарплатным ведомостям ADP, охватывающие примерно каждого шестого работника в США. Их исследование показывает: занятость людей 22-25 лет в профессиях с высокой экспозицией к ИИ, включая разработку ПО, уже резко расходится с занятостью старших возрастных групп в тех же профессиях.
Компании начинают сокращать найм джуниоров не потому, что агенты справляются с их работой, а потому, что верят в скорую замену. Условия 1-3 описывают, работает ли замена технически. Условие 4 описывает, будут ли компании пытаться, невзирая на ответ.
Исследование представляет собой аналитический разбор, а не рецензированную научную работу. Эксперимент METR с 16 разработчиками мал и специфичен: авторы сами не претендуют на универсальность. Аудит SWE-bench проведён OpenAI на 27,6% датасета, выводы о 59,4% дефектов относятся к проверенной части. Данные Стэнфорда по ADP описывают американский рынок труда и не переносятся напрямую на РФ и СНГ. Корреляция между экспозицией к ИИ и падением найма молодых специалистов не доказывает причинно-следственную связь.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Те же три проблемы: контаминация, дефекты тестов, разрыв с реальностью, касаются любых бенчмарков, которыми измеряют качество ИИ-текстов. Когда вам показывают «модель пишет на 90% как человек», спрашивайте: что именно измерялось, на каких данных обучали, не попали ли ответы в обучающую выборку.
Маркетологам. Ключевая находка для вас не про код, а про разрыв восприятия: люди уверены, что ИИ ускорил их работу, хотя замер показывает обратное. Прежде чем отчитываться «внедрение ИИ дало рост эффективности», измерьте результат, а не ощущение.
Предпринимателям РФ и СНГ. Из доступных в России инструментов для ИИ-агентов программирования работают GigaCode от Сбера и ряд решений на базе открытых моделей. Вывод из разбора прямой: не сокращайте найм стажёров, рассчитывая на агентов. Senior-инженеры, которые вам нужны через три года, сейчас должны откуда-то взяться. Сломав входную ступень, вы не экономите, а создаёте дефицит, который агенты пока не закрывают.
Этот разбор ценен не выводом «ИИ-агенты не заменят джуниоров» (со временем могут), а методом. Вместо скачка от балла бенчмарка к рыночному прогнозу автор разложил цепочку на звенья и проверил каждое. Мы в dzen.guru рекомендуем применять тот же подход к любому громкому заявлению про ИИ: не «модель набрала X баллов, значит Y», а «что должно быть правдой, чтобы Y случилось, и правда ли это». Особенно когда Y касается вашей работы. Пока что самый надёжный вывод из всех данных: генерация дешевеет, проверка нет. Тот, кто умеет проверять, стоит дороже, а не дешевле.
Компании уже режут найм джуниоров, опираясь на цифры, которые сама OpenAI признала ненадёжными. Если вы управляете командой, перечитайте условия 1-3 и честно ответьте: выполнено ли хоть одно в вашей кодовой базе, с вашими задачами, с вашим ревью. Скорее всего, пока нет.
По данным Napkin Math

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн
Стартап Instinct, основанный 23-летним Ноа Шинном всего год назад, привлёк 250 млн долларов в раунде Series B и довёл общий объём финансирования до 350 млн…

Gemini Google запутал пользователей тремя брендами в одном приложении: как это исправляют
Google ломает собственный ИИ-интерфейс тремя отдельными брендами, и это урок для всех, кто строит продукт. Google в среду обновила голосовые функции Gemini…

Искусственный интеллект в медицине: модель Google с 0,72 млн параметров обошла конкурентов в 187 раз крупнее
Google Research и Университет Нового Южного Уэльса (UNSW Sydney) представили GlucoFM, компактную модель искусственного интеллекта для анализа данных…
Комментарии