Игорь Градов
Игорь Градов
5 мин
ai

ИИ-агент Microsoft обошёл GitHub Copilot в генерации тестов: 92% задач против 79%

Microsoft второго июня выложила в открытый доступ code-testing-generator, ИИ-агента, который сам пишет юнит-тесты для кода и тут же проверяет, что они работают, причём на внутреннем бенчмарке из 152 задач он справился с 92% заданий против 79% у стандартного GitHub Copilot.

ИИ-агент Microsoft обошёл GitHub Copilot в генерации тестов: 92% задач против 79%
Почему это важно

Агент закрывает конкретную дыру: обычный GitHub Copilot генерирует тесты вслепую, не зная, какой фреймворк используется в проекте, куда класть файлы и какие утверждения писать. Здесь ИИ сначала изучает весь репозиторий и только потом пишет код.

Команда .NET в Microsoft опубликовала инструмент под лицензией MIT (свободная лицензия, позволяющая использовать, менять и распространять код без ограничений) в репозитории dotnet/skills. Это не облачный сервис, а набор навыков для вашего локального ИИ-агента: код не уходит на сторонние серверы. Релиз важен для разработчиков в России, потому что агент работает с произвольными языками, фреймворками и структурами проектов, анализируя репозиторий перед написанием тестов.

Показатель Значение Источник
Задачи бенчмарка 152 (реальные репозитории) Microsoft, внутренний бенчмарк
Завершено агентом 140 из 152 (92,1%) Microsoft
Завершено стандартным GitHub Copilot 120 из 152 (78,9%) Microsoft
Снижение числа провалов 63% Microsoft
Результат на размытых промптах 79 из 89 (88,8%) против 59 из 89 (66,3%) Microsoft
Результат на задачах с диффом 15 из 15 против 0 из 15 Microsoft
Сгенерировано тестов 6 963 против 7 129 (на 2,3% меньше) Microsoft
Покрытие строк кода 72,4% против 72,2% Microsoft
Среднее время задачи 359 секунд против 380 Microsoft
.NET-задачи, Claude Opus 4.8 43 из 45 с агентом, 35 из 45 без Microsoft
.NET-задачи, GPT-5.5 41 из 45 с агентом, 36 из 45 без Microsoft
Внешний бенчмарк SWE Atlas 16 из 44 с агентом, 12 из 44 без Microsoft

Как агент исследует код перед тем, как писать тесты?

Юнит-тест (unit test) проверяет маленький кусочек программы отдельно от остального кода. Проблема с обычными генераторами тестов проста: вы пишете промпт «сгенерируй тесты», а ИИ не знает, какой в проекте фреймворк для тестирования, куда положить файл и какие проверки использовать.

code-testing-generator решает это через конвейер «Исследование, план, реализация» (Research-Plan-Implement, RPI):

  • Исследование. Агент ищет в репозитории код без тестов, определяет язык и фреймворк, читает уже существующие тесты, чтобы перенять стиль, и находит реальные команды сборки и запуска. Последнее особенно ценно: бывает, тесты собираются на машине разработчика, но в CI-системе (система непрерывной интеграции, автоматический конвейер проверки кода) никогда не запускаются, потому что их забыли зарегистрировать.
  • Планирование. Агент выбирает одну из трёх стратегий: прямая запись (пишет и сразу проверяет), один проход или итеративный режим для крупных задач и целей по покрытию.
  • Реализация. Агент пишет тесты, но никогда не трогает рабочий код. Он избегает тестов, которые вызывают внешние URL, занимают сетевые порты или зависят от таймингов.

Где основной выигрыш?

Результаты бенчмарка показывают чёткую картину: выигрыш сосредоточен в двух сценариях.

  • Размытые промпты. Когда разработчик даёт нечёткое задание вроде «напиши тесты для этого модуля», агент решил 79 из 89 задач (88,8%), а стандартный GitHub Copilot с тем же промптом и той же моделью справился с 59 (66,3%). Число провалов упало с 30 до 10.
  • Тесты на конкретный дифф. Когда нужно было написать тесты именно для изменений в пул-реквесте (набор правок, предложенных к включению в основную ветку кода), агент прошёл все 15 задач, GitHub Copilot без агента не прошёл ни одной.
  • Подробные промпты. Когда задание было детальным и точным, оба показали одинаковый результат: 61 из 63 (96,8%).

Агент при этом сгенерировал на 2,3% меньше тестов и оказался на 5,5% быстрее. Покрытие строк кода осталось практически одинаковым: 72,4% против 72,2%. То есть выигрыш в надёжности, а не в объёме.

На подмножестве из 45 задач на .NET модель Claude Opus 4.8 с агентом решила 43, без него 35. GPT-5.5 с агентом решила 41, без него 36.

Как это читать

Бенчмарк внутренний, 152 задачи собраны самой Microsoft из реальных репозиториев. Независимой проверки пока нет. Внешний бенчмарк SWE Atlas дал скромный результат: 16 из 44 задач. Расход токенов (объём текста, который ИИ обрабатывает за запрос) на завершённую задачу у агента на 3,2% выше, то есть каждый запуск чуть дороже. Результаты получены на конкретных моделях и промптах; на других комбинациях цифры могут отличаться.

Что делать с этим прямо сейчас?

Разработчику-одиночке или фрилансеру. Если вы пишете код и вечно откладываете тесты, потому что «времени нет», агент берёт именно эту рутину. Установка локальная, код никуда не уходит. Особенно полезно, если проект на нескольких языках: агент сам определяет фреймворк.

Небольшой команде или стартапу. Главная боль маленькой команды: некому описывать конвенции тестирования и следить за покрытием. Агент сам читает ваш репозиторий и перенимает стиль. По данным Microsoft, именно стартапы и средние команды получают наибольший выигрыш.

Автору Дзена и контент-мейкеру. Если вы не программист, прямой пользы пока нет. Но если вы пишете про технологии или обучаете аудиторию, это наглядный пример того, как ИИ-агенты перестают быть «одноразовыми отвечалками» и начинают работать конвейером: исследуют контекст, планируют, делают, проверяют.

Работающим в России. Агент опенсорсный, лицензия MIT, можно скачать и запустить локально. Ограничений по географии нет. Для работы нужен доступ к одной из поддерживаемых моделей (Claude, GPT), что в РФ требует обходных решений для API.

Мнение редакции dzen.guru

Цифры Microsoft убедительны в одном: этот агент решает задачу «размытого промпта» заметно лучше, чем GitHub Copilot без него. Для тех, кто пишет подробные инструкции, разница исчезает. Это честный вывод, и он полезнее маркетинга. На мой взгляд, главная ценность не в процентах бенчмарка, а в подходе: агент не просто генерирует код, он сначала изучает проект. Если этот паттерн «исследуй, планируй, делай, проверяй» перенесут на другие задачи, например на генерацию документации или рефакторинг, инструменты для разработчиков изменятся радикально. Пока же это инструмент для тех, кто уже пишет код и понимает, зачем нужны тесты.

Скачать и проверить на своём репозитории можно уже сейчас, и это тот случай, когда лучше попробовать на реальном проекте, чем читать чужие бенчмарки.

По данным MarkTechPost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

OpenAI просит суд отклонить иск Apple: обвинения в краже кадров «гнилые до основания»

OpenAI вчера подала ходатайство в федеральный суд о прекращении иска Apple, в котором производитель iPhone обвиняет создателя ChatGPT в краже коммерческих…

5 мин
Omilia привлекла $67 млн: платформы поддержки клиентов растут без ставки на генеративный ИИ
ai

Omilia привлекла $67 млн: платформы поддержки клиентов растут без ставки на генеративный ИИ

Omilia, греческая компания с 23-летней историей в автоматизации клиентской поддержки, привлекла $67 млн в раунде Series B, чтобы доказать рынку простую мысль:…

4 мин
Suno нейросеть вводит водяные знаки и лимиты скачиваний: массовый залив на стриминги закрыт
ai

Suno нейросеть вводит водяные знаки и лимиты скачиваний: массовый залив на стриминги закрыт

Suno AI нейросеть для создания музыки объявила о введении водяных знаков, ограничении скачиваний и обновлении правил сообщества, чтобы помешать массовому…

5 мин