Игорь Градов
Игорь Градов
6 мин
ai

93% кода пишут ИИ-агенты: разработка в «Первой Форме» упёрлась в ревью

Компания «Первая Форма» накопила больше 24 тысяч сценариев разработки с участием ИИ-агентов и опубликовала внутренние метрики конвейера, где 93% запросов на слияние кода создают агенты, а человеку достаётся финальное решение и ревью.

93% кода пишут ИИ-агенты: разработка в «Первой Форме» упёрлась в ревью
Почему это важно

Томас Домке, бывший CEO GitHub и основатель Entire, только в 2026 году сформулировал проблему: узкое место при выпуске кода, написанного ИИ-агентами, это проверка, а не генерация. Российская команда к тому же выводу пришла через собственную практику и уже показывает рабочий конвейер с цифрами.

Спор о том, готовы ли ИИ-агенты к реальной разработке, идёт давно. Одни команды передают агентам рутинные правки и экономят часы, другие жалуются, что проверять код после машины сложнее, чем написать самому. Материал «Первой Формы» и инструмент Checkpoints от Entire дают конкретные аргументы обеим сторонам. Разберём их и покажем, что из этого полезно тем, кто работает с контентом, маркетингом и продуктами в РФ.

В чём суть спора?

ИИ-агент (программа, которая сама выполняет цепочку действий для решения задачи) способен за минуты подготовить изменение в коде, на которое разработчик тратил час. Но ускорение создаёт новое узкое место: проверяющему нужно понять, почему агент выбрал именно этот вариант, какие части системы изучил, какие альтернативы отбросил.

Проблему в 2026 году публично назвал Томас Домке, бывший CEO GitHub и основатель компании Entire. Его формулировка прямая: узкое место при выпуске кода, созданного агентами, это ревью (проверка кода перед включением в продукт).

Entire предложил решение: открытый инструмент командной строки Checkpoints. Он сохраняет рабочий контекст ИИ-агента прямо в Git (системе контроля версий) на служебной ветке: промпты, транскрипты диалогов, вызовы инструментов, прочитанные и изменённые файлы, решения и результаты проверок. Формула Entire:

Код остаётся чистым. Рассуждения сохраняются рядом с ним. : Томас Домке, основатель Entire

«Первая Форма» пришла к похожему выводу через собственную практику. У них ИИ-агенты в разработке работают внутри управляемого конвейера: задача получает проверяемые критерии, агенты действуют по ролям, результаты фиксируются в артефактах (документах, которые можно проверить позже), а человек сохраняет за собой продуктовые решения, финальное ревью и мёрж (включение кода в основную ветку).

Аргументы за: ИИ-агенты ускоряют разработку кратно

Скорость генерации кода перестаёт быть дефицитом. По внутреннему замеру «Первой Формы» от 17 по 18 августа, работа модели в среднем занимает около 11 минут. Задача, на которую разработчик тратил час, закрывается за несколько минут.

Качество проверяемо. 94% агентных запросов на слияние вливаются без замечаний человека. При этом после вливания отслеживается показатель post-merge churn (объём правок, которые пришлось вносить в код после включения в основную ветку) за семь дней: 3,9%. По данным «Первой Формы», это ниже актуального рыночного ориентира для разработки с активным участием ИИ: 5,7%.

Конвейер умеет отказываться. Не каждая задача уходит агенту. Система классифицирует входящие задачи:

  • MR-ABLE: задачу можно довести до запроса на слияние
  • NEEDS-DECISION: нужно решение владельца продукта или архитектора
  • TOO-BIG: требуется декомпозиция или отдельное проектирование
  • ALREADY-DONE: изменение уже закрыто другим запросом

Агент, который умеет сказать «для продолжения нужна продуктовая или архитектурная договорённость», безопаснее того, который всегда стремится выдать код.

Разделение ролей снижает риск. Один агент готовит изменение, другие проводят состязательное ревью: ищут контрпримеры, скрытые зависимости, уязвимости и регрессии (когда новый код ломает то, что работало раньше). Автор и ревьюеры работают через разные каналы и могут использовать модели разных вендоров, что снижает риск систематической ошибки.

Аргументы против: узкое место никуда не делось

Человек стал бутылочным горлышком. По тем же данным «Первой Формы», путь от ревью ИИ-агента до вливания запроса на слияние занимает около 76 часов. Генерация заняла 11 минут. Разрыв между скоростью машины и скоростью человеческого решения колоссален.

Зелёный CI не равен качеству. CI (непрерывная интеграция, автоматическая сборка и прогон тестов) отвечает на технические вопросы: собирается ли проект, проходят ли тесты. Но CI не проверяет, действительно ли изменение решает исходную задачу. Формально корректный код может не закрывать потребность пользователя.

Контекст рассуждений теряется. Git хранит «что» изменилось, но не «почему». Если агент исследовал задачу, обнаружил ограничения, отбросил варианты и выбрал конкретную реализацию, а всё это осталось в закрытой сессии, следующему участнику процесса приходится собирать контекст заново. Entire предлагает Checkpoints, «Первая Форма» фиксирует артефакты в сценарии, но стандартного отраслевого решения пока нет.

Масштаб создаёт иллюзию надёжности. 93% запросов на слияние при участии агентов и 94% без замечаний звучат убедительно. Но высокая доля одобрений без замечаний может означать и то, что ревьюеры не успевают глубоко проверять при таком потоке. Сама «Первая Форма» честно оговаривает: показатель churn 3,9% нужно читать вместе с долей MR, и именно post-merge контроль подтверждает, что одобрение не формальное.

Что полезно вам прямо сейчас?

Авторам Дзена и копирайтерам. Логика конвейера «Первой Формы» напрямую переносится на контент. ИИ-агенты в разработке текстов работают по той же схеме: один агент генерирует черновик, другой проверяет факты, третий ищет слабые места. Разделение ролей между генератором и ревьюером, это приём, который можно применить уже сегодня в ChatGPT или YandexGPT: дайте одной сессии написать, а другой, с отдельным системным промптом (базовой инструкцией для модели), проверить.

Маркетологам. Идея классификации задач перед передачей агенту экономит бюджет. Не каждый бриф стоит отдавать ИИ-агенту: если задача требует продуктового решения (позиционирование, ценообразование), агент выдаст «правдоподобный diff», внешне убедительный результат, не закрывающий реальную потребность. Фильтр «NEEDS-DECISION» полезен не только программистам.

Предпринимателям в РФ и СНГ. «Первая Форма» показывает, что агентный конвейер можно построить на российской инфраструктуре. Из доступных в РФ инструментов для работы с ИИ-агентами: YandexGPT, GigaChat, а также открытые модели (модели с доступным исходным кодом), которые можно развернуть на собственных серверах. Ключевой вывод: ценность не в самом агенте, а в процессе вокруг него, с критериями приёмки, классификацией и разделением ролей.

Мнение редакции dzen.guru

Главное, что показывает опыт «Первой Формы», это не впечатляющие 93% автоматизации. Это 76 часов ожидания человеческого решения при 11 минутах машинной работы. ИИ-агенты в разработке уже быстрее людей, вопрос перемещается к организации проверки.

Мне кажется, что решение «Первой Формы» со сценарием, фиксацией артефактов и правом агента на отказ ближе к промышленному стандарту, чем инструмент Checkpoints от Entire, который сохраняет контекст, но не встраивает его в маршрут задачи. Впрочем, оба подхода молоды и пока не прошли проверку на масштабе тысяч команд.

Если вы работаете с ИИ-агентами в любой области, от кода до текстов, попробуйте одну вещь: разделите генерацию и проверку между разными сессиями или моделями. Это самый дешёвый способ снизить риск «слепого одобрения».

Конвейер «Первой Формы» с 24 тысячами сценариев и открытый инструмент Entire с Checkpoints обозначили одну и ту же точку: генерация кода перестала быть дефицитом, дефицитом стало доверие к результату. Команды, которые выстроят процесс проверки быстрее остальных, получат реальное преимущество, потому что скорость без контроля качества обесценивается за один серьёзный сбой в продукте.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

LLM и база данных на 253 таблицы: схема целиком в промпте обошлась в 110 рублей и победила
ai

LLM и база данных на 253 таблицы: схема целиком в промпте обошлась в 110 рублей и победила

Текст оригинала обрывается на полуслове, поэтому я работаю строго с тем, что передано. Ни одного факта за пределами источника не добавляю. Крупная финтех-база…

6 мин
Яндекс взял Best Paper на ICML 2026: что arxiv препринты не расскажут о конференции
ai

Яндекс взял Best Paper на ICML 2026: что arxiv препринты не расскажут о конференции

Мне предоставлен обрезанный оригинал — текст обрывается на середине предложения. Работаю строго по тому, что есть. Карина Романова, разработчик Яндекса и…

5 мин
MCP-протокол вместо кнопок: где чат экономит время корпорациям, а где проигрывает GUI
ai

MCP-протокол вместо кнопок: где чат экономит время корпорациям, а где проигрывает GUI

Корпоративные системы десятилетиями прятали нужные функции за многоэтажными меню, и теперь команды разработчиков проверяют, способен ли чат на естественном…

6 мин