Что такое ИИ-агент изнутри: ByteDance довела долю ускоренных задач с 27 % до 97 %
Автор Дзена или маркетолог, который слышит «ИИ-агент» по десять раз на дню, но до сих пор не понимает, как именно такой агент устроен изнутри и чем отличается от обычного чат-бота, после этого материала разберётся в механике на свежем и показательном примере.

ByteDance и университет Цинхуа показали, как ИИ-агент (автономная программа, которая сама ставит себе подзадачи, проверяет результат и корректирует действия) за 150 шагов обучения научился писать код для видеокарт быстрее, чем штатный компилятор, и довёл долю ускоренных задач с 27 % до 97 %.
Термин «ИИ-агент» в 2025 году звучит отовсюду, но за маркетинговой обёрткой часто прячется обычный чат-бот с парой дополнительных вызовов. Свежая работа ByteDance Seed и лаборатории Tsinghua AIR под названием CUDA Agent, опубликованная вместе с набором данных и рецептом обучения, даёт конкретный чертёж: что именно делает систему агентом, из каких блоков она собрана и почему результат радикально отличается от «просто спросить модель». Ниже разберём эту механику по шагам, чтобы вы могли объяснить её коллеге или клиенту, а заодно понять, где подобный подход применим к вашим задачам.
Что понадобится
- Понимание, что такое ИИ-агент на уровне «программа, которая действует сама, а не только отвечает на вопрос».
- Базовое представление о нейросетях: модель получает текст, выдаёт текст.
- Около 15 минут на чтение.
- Для воспроизведения полного цикла (не обязательно для понимания): доступ к GPU-серверам (в оригинальном эксперименте использовались 128 видеокарт NVIDIA H20), открытый набор данных CUDA-Agent-Ops-6K и файл спецификации SKILL.md, оба выложены авторами.
Пошаговая инструкция: как собран ИИ-агент на примере CUDA Agent
1. Определите узкую задачу, а не «сделай всё».
ИИ-агент эффективен, когда цель измерима. В данном случае цель: переписать код для видеокарты (GPU-ядро) так, чтобы он работал минимум на 5 % быстрее, чем стандартный компилятор PyTorch (torch.compile). Без чёткого критерия «быстрее/медленнее» агент не сможет оценивать свои решения.
2. Дайте агенту среду, а не только промпт.
Обычный чат-бот получает текст и возвращает текст. ИИ-агент получает набор инструментов: терминал, редактор файлов, средства профилирования (замера скорости кода), песочницу для компиляции. В CUDA Agent это реализовано по схеме ReAct (модель чередует рассуждение и действие):
Цикл агента:
1. Прочитать спецификацию задачи (SKILL.md)
2. Запустить профилирование исходного кода
3. Переписать файл model_new.py с собственными GPU-ядрами
4. Скомпилировать в GPU-песочнице
5. Проверить корректность на 5 случайных входах
6. Замерить скорость с прогревом и синхронизацией
7. Если не быстрее на 5% → вернуться к шагу 3
3. Заблокируйте лазейки заранее.
Модель, обучаемая на вознаграждении, ищет способы «обмануть систему» (reward hacking, буквально «взлом награды»). Авторы заложили пять контрмер:
- Скрипты проверки и профилирования защищены от изменений (permission lock).
- Контекстные менеджеры запрещают откат к стандартным функциям PyTorch вместо написания собственного ядра.
- Корректность проверяется на пяти случайных входах, а не на одном.
- Профилирование включает прогрев GPU и синхронизацию устройства.
- Доступ к веб-поиску отключён.
4. Соберите данные для обучения.
Авторы не собирали примеры вручную. Они написали скрипт, который берёт операторы из библиотек torch и transformers, случайным образом комбинирует до пяти операторов в одно «слитое» ядро, а затем фильтрует: оставляет только те, которые выполняются корректно, дают неконстантный результат и укладываются по времени в диапазон от 1 до 100 миллисекунд. Совпадения с тестовым бенчмарком удаляются. Итог: набор CUDA-Agent-Ops-6K из 6 000 примеров.
5. Задайте ступенчатую награду, а не «чем быстрее, тем лучше».
Ключевое инженерное решение. Вместо того чтобы давать модели награду, пропорциональную ускорению (что приводило к нестабильности), авторы ввели дискретные ступени:
- −1: код не прошёл проверку корректности.
- 1: код корректен, но не быстрее стандарта.
- 2: быстрее, чем «ленивый» режим PyTorch (eager).
- 3: быстрее и eager, и компилятора
torch.compileминимум на 5 %.
По данным авторов, такая ступенчатая награда дала прирост в 36,4 процентных пункта по доле ускоренных задач по сравнению с непрерывной наградой.
6. Обучите методом PPO с предобучением критика.
PPO (Proximal Policy Optimization, метод обучения с подкреплением, где модель учится на собственных пробах и ошибках) применяется 150 шагов при контексте 131 072 токена (токен, минимальная единица текста для модели, примерно три четверти слова). Без предварительного обучения критика (value pretraining) процесс «схлопывался» уже на 17-м шаге.
7. Проверьте на бенчмарке.
На 250 задачах KernelBench результат CUDA Agent: 98,8 % задач пройдены корректно, 96,8 % задач выполнены быстрее компилятора, среднее геометрическое ускорение 2,11 раза. На задачах второго уровня сложности (склейка операторов): 100 % корректности, 100 % ускорения, 2,80 раза быстрее компилятора. На самом сложном, третьем уровне: 94 % корректности, 90 % ускорения и 1,52 раза, что, по данным авторов, примерно на 40 процентных пунктов выше показателей Claude Opus 4.5 (50 %) и Gemini 3 Pro (52 %) на этом же уровне.
Замечу: в статье есть расхождение между цифрами во введении (100 % / 100 % / 92 %) и основной таблице результатов (97 % / 100 % / 90 %). Авторы указывают таблицу как основной источник.
Одна из показательных задач из статьи: умножение диагональной матрицы на вектор. Стандартный компилятор генерирует общий код для матричного умножения. Агент распознал, что операция сводится к построчному масштабированию, переписал ядро соответствующим образом и получил ускорение в 73,31 раза по сравнению с torch.compile. Другой пример: цепочка «умножение, деление, сумма, масштабирование» была переупорядочена и слита в одно ядро с ускорением в 24,04 раза.
Что всё это значит для вас?
Автору Дзена и копирайтеру. Теперь вы знаете, что такое ИИ-агент не на уровне рекламного слогана, а на уровне архитектуры: среда, цикл действий, ступенчатая награда, защита от обмана. Когда в следующий раз пишете про «агентный ИИ», можете объяснить разницу между чат-ботом и агентом одним абзацем: бот отвечает на вопрос, агент действует в среде, проверяет себя и повторяет до результата.
Маркетологу. Если ваша компания использует GPU-облака для инференса (инференс, выполнение запросов к нейросети), методика CUDA Agent напрямую касается стоимости каждого запроса. Ускорение ядер в 2 раза, это потенциально вдвое меньше оплаченных GPU-часов.
Предпринимателю в РФ и СНГ. Веса обученной модели не опубликованы, базовая модель Seed1.6 закрытая (закрытая модель, код и параметры недоступны публично), с 23 миллиардами активных и 230 миллиардами общих параметров. Но набор данных CUDA-Agent-Ops-6K, спецификация SKILL.md и рецепт обучения открыты. Команда с доступом к GPU может воспроизвести подход поверх открытой модели (открытая модель, опенсорс, код и веса доступны для скачивания). В российских облаках, где GPU-часы дороже, чем у крупных западных провайдеров, даже частичное воспроизведение рецепта с оптимизацией ядер под конкретные задачи (медицинская визуализация, рекомендательные системы, обработка видео) может ощутимо снизить издержки на инференс.
Путать агента с «цепочкой промптов». Если система не проверяет результат и не возвращается к предыдущему шагу, это не агент, а конвейер. Ключевой признак: цикл с обратной связью.
Игнорировать reward hacking. Авторы потратили заметную часть работы на пять контрмер. Без них модель находит способ получить высокую награду, не решая задачу (например, подменяя скрипт проверки).
Думать, что достаточно «просто дать модели доступ к терминалу». Без ступенчатой награды, предобучения критика и фильтрации данных результат на бенчмарке падает с 96,8 % до 14,1 % по ускоренным задачам. Каждый компонент критичен.
Ожидать, что это работает «из коробки» без GPU. Полное воспроизведение требовало 128 видеокарт NVIDIA H20 только для песочницы профилирования. Малым командам реалистичнее брать отдельные элементы: набор данных, формат награды, спецификацию навыков.
Ценность этой работы для нас не в цифрах ускорения, а в том, что она даёт ясный, воспроизводимый ответ на вопрос «что такое ИИ-агент» через инженерный чертёж. Я считаю, что именно таких разборов не хватает русскоязычному сообществу: не «агент, это когда ИИ делает всё за вас», а конкретный цикл из семи шагов с понятными точками отказа.
Честная оговорка: веса модели закрыты, базовая модель проприетарная, и 128 видеокарт H20 далеко не у каждой команды. Прямое воспроизведение в российских условиях потребует адаптации поверх доступных открытых моделей. Но открытые части (данные, рецепт, формат награды) уже пригодны для экспериментов. Если вы объясняете аудитории, как работает агентный ИИ, этот кейс, пожалуй, самый наглядный из опубликованных в 2025 году.
Хотите научиться писать про ИИ так, чтобы читатели оставались?
В dzen.guru мы разбираем нейросети на практике и учим авторов превращать сложные темы в понятный контент для Дзена.
Попробовать dzen.guruРазобравшись в этом примере, вы уже знаете больше про устройство ИИ-агента, чем большинство авторов, которые пишут о них каждый день. Осталось применить: в следующем тексте про «агентный ИИ» замените общие слова конкретикой, цикл, среда, награда, защита от обмана, и ваш читатель почувствует разницу.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент в команде: Hermes Bot Mode собирает до 6 ботов локально и бесплатно
Microsoft второго июня запустила Bot Mode для Hermes Agent, и впервые открытая мультиагентная система позволяет собрать команду ИИ-ботов на локальном…

OCR-нейросеть docTR распознаёт русские счета локально и бесплатно: пошаговая настройка
Документооборот в России по-прежнему держится на бумаге и сканах: счета-фактуры, акты, накладные приходят картинками, и ручной перенос реквизитов в учётную…

MiniMax выпустила нейросеть для генерации музыки с открытыми весами: песни до 5 минут на одной GPU
Китайская компания MiniMax 13 августа 2026 года выпустила MiniMax Music3, нейросеть для генерации музыки с открытыми весами (open weights), которая создаёт…
Комментарии