ИИ-агент Microsoft обошёл GitHub Copilot в генерации тестов: 92% задач против 79%
Microsoft второго июня выложила в открытый доступ code-testing-generator, ИИ-агента, который сам пишет юнит-тесты для кода и тут же проверяет, что они работают, причём на внутреннем бенчмарке из 152 задач он справился с 92% заданий против 79% у стандартного GitHub Copilot.

Агент закрывает конкретную дыру: обычный GitHub Copilot генерирует тесты вслепую, не зная, какой фреймворк используется в проекте, куда класть файлы и какие утверждения писать. Здесь ИИ сначала изучает весь репозиторий и только потом пишет код.
Команда .NET в Microsoft опубликовала инструмент под лицензией MIT (свободная лицензия, позволяющая использовать, менять и распространять код без ограничений) в репозитории dotnet/skills. Это не облачный сервис, а набор навыков для вашего локального ИИ-агента: код не уходит на сторонние серверы. Релиз важен для разработчиков в России, потому что агент работает с произвольными языками, фреймворками и структурами проектов, анализируя репозиторий перед написанием тестов.
| Показатель | Значение | Источник |
|---|---|---|
| Задачи бенчмарка | 152 (реальные репозитории) | Microsoft, внутренний бенчмарк |
| Завершено агентом | 140 из 152 (92,1%) | Microsoft |
| Завершено стандартным GitHub Copilot | 120 из 152 (78,9%) | Microsoft |
| Снижение числа провалов | 63% | Microsoft |
| Результат на размытых промптах | 79 из 89 (88,8%) против 59 из 89 (66,3%) | Microsoft |
| Результат на задачах с диффом | 15 из 15 против 0 из 15 | Microsoft |
| Сгенерировано тестов | 6 963 против 7 129 (на 2,3% меньше) | Microsoft |
| Покрытие строк кода | 72,4% против 72,2% | Microsoft |
| Среднее время задачи | 359 секунд против 380 | Microsoft |
| .NET-задачи, Claude Opus 4.8 | 43 из 45 с агентом, 35 из 45 без | Microsoft |
| .NET-задачи, GPT-5.5 | 41 из 45 с агентом, 36 из 45 без | Microsoft |
| Внешний бенчмарк SWE Atlas | 16 из 44 с агентом, 12 из 44 без | Microsoft |
Как агент исследует код перед тем, как писать тесты?
Юнит-тест (unit test) проверяет маленький кусочек программы отдельно от остального кода. Проблема с обычными генераторами тестов проста: вы пишете промпт «сгенерируй тесты», а ИИ не знает, какой в проекте фреймворк для тестирования, куда положить файл и какие проверки использовать.
code-testing-generator решает это через конвейер «Исследование, план, реализация» (Research-Plan-Implement, RPI):
- Исследование. Агент ищет в репозитории код без тестов, определяет язык и фреймворк, читает уже существующие тесты, чтобы перенять стиль, и находит реальные команды сборки и запуска. Последнее особенно ценно: бывает, тесты собираются на машине разработчика, но в CI-системе (система непрерывной интеграции, автоматический конвейер проверки кода) никогда не запускаются, потому что их забыли зарегистрировать.
- Планирование. Агент выбирает одну из трёх стратегий: прямая запись (пишет и сразу проверяет), один проход или итеративный режим для крупных задач и целей по покрытию.
- Реализация. Агент пишет тесты, но никогда не трогает рабочий код. Он избегает тестов, которые вызывают внешние URL, занимают сетевые порты или зависят от таймингов.
Где основной выигрыш?
Результаты бенчмарка показывают чёткую картину: выигрыш сосредоточен в двух сценариях.
- Размытые промпты. Когда разработчик даёт нечёткое задание вроде «напиши тесты для этого модуля», агент решил 79 из 89 задач (88,8%), а стандартный GitHub Copilot с тем же промптом и той же моделью справился с 59 (66,3%). Число провалов упало с 30 до 10.
- Тесты на конкретный дифф. Когда нужно было написать тесты именно для изменений в пул-реквесте (набор правок, предложенных к включению в основную ветку кода), агент прошёл все 15 задач, GitHub Copilot без агента не прошёл ни одной.
- Подробные промпты. Когда задание было детальным и точным, оба показали одинаковый результат: 61 из 63 (96,8%).
Агент при этом сгенерировал на 2,3% меньше тестов и оказался на 5,5% быстрее. Покрытие строк кода осталось практически одинаковым: 72,4% против 72,2%. То есть выигрыш в надёжности, а не в объёме.
На подмножестве из 45 задач на .NET модель Claude Opus 4.8 с агентом решила 43, без него 35. GPT-5.5 с агентом решила 41, без него 36.
Бенчмарк внутренний, 152 задачи собраны самой Microsoft из реальных репозиториев. Независимой проверки пока нет. Внешний бенчмарк SWE Atlas дал скромный результат: 16 из 44 задач. Расход токенов (объём текста, который ИИ обрабатывает за запрос) на завершённую задачу у агента на 3,2% выше, то есть каждый запуск чуть дороже. Результаты получены на конкретных моделях и промптах; на других комбинациях цифры могут отличаться.
Что делать с этим прямо сейчас?
Разработчику-одиночке или фрилансеру. Если вы пишете код и вечно откладываете тесты, потому что «времени нет», агент берёт именно эту рутину. Установка локальная, код никуда не уходит. Особенно полезно, если проект на нескольких языках: агент сам определяет фреймворк.
Небольшой команде или стартапу. Главная боль маленькой команды: некому описывать конвенции тестирования и следить за покрытием. Агент сам читает ваш репозиторий и перенимает стиль. По данным Microsoft, именно стартапы и средние команды получают наибольший выигрыш.
Автору Дзена и контент-мейкеру. Если вы не программист, прямой пользы пока нет. Но если вы пишете про технологии или обучаете аудиторию, это наглядный пример того, как ИИ-агенты перестают быть «одноразовыми отвечалками» и начинают работать конвейером: исследуют контекст, планируют, делают, проверяют.
Работающим в России. Агент опенсорсный, лицензия MIT, можно скачать и запустить локально. Ограничений по географии нет. Для работы нужен доступ к одной из поддерживаемых моделей (Claude, GPT), что в РФ требует обходных решений для API.
Цифры Microsoft убедительны в одном: этот агент решает задачу «размытого промпта» заметно лучше, чем GitHub Copilot без него. Для тех, кто пишет подробные инструкции, разница исчезает. Это честный вывод, и он полезнее маркетинга. На мой взгляд, главная ценность не в процентах бенчмарка, а в подходе: агент не просто генерирует код, он сначала изучает проект. Если этот паттерн «исследуй, планируй, делай, проверяй» перенесут на другие задачи, например на генерацию документации или рефакторинг, инструменты для разработчиков изменятся радикально. Пока же это инструмент для тех, кто уже пишет код и понимает, зачем нужны тесты.
Скачать и проверить на своём репозитории можно уже сейчас, и это тот случай, когда лучше попробовать на реальном проекте, чем читать чужие бенчмарки.
По данным MarkTechPost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
OpenAI просит суд отклонить иск Apple: обвинения в краже кадров «гнилые до основания»
OpenAI вчера подала ходатайство в федеральный суд о прекращении иска Apple, в котором производитель iPhone обвиняет создателя ChatGPT в краже коммерческих…

Omilia привлекла $67 млн: платформы поддержки клиентов растут без ставки на генеративный ИИ
Omilia, греческая компания с 23-летней историей в автоматизации клиентской поддержки, привлекла $67 млн в раунде Series B, чтобы доказать рынку простую мысль:…

Suno нейросеть вводит водяные знаки и лимиты скачиваний: массовый залив на стриминги закрыт
Suno AI нейросеть для создания музыки объявила о введении водяных знаков, ограничении скачиваний и обновлении правил сообщества, чтобы помешать массовому…
Комментарии