UC Berkeley выпустил открытую платформу для обучения ИИ-агентов: инфраструктура дешевле в 4,6 раза
Команда исследователей из Калифорнийского университета в Беркли выпустила CUA-Lite, открытую платформу, которая впервые объединяет все четыре компонента обучения ИИ-агентов для работы с компьютером в одном фреймворке и снижает требования к инфраструктуре почти в пять раз.

До сих пор среды, агенты, данные и инструменты оценки ИИ-агентов жили в разных репозиториях с несовместимыми интерфейсами, и запуск каждой задачи требовал отдельной виртуальной машины. CUA-Lite устраняет оба барьера одновременно, и это первая открытая платформа, где замена виртуальной машины контейнером подтверждена совпадением результатов на 13 моделях.
Публикацию анонсировала команда UC Berkeley. Проект появился не как новая модель, а как инфраструктурный ответ на конкретную проблему: чтобы обучить или протестировать CUA (computer-use agent, ИИ-агент, который сам нажимает кнопки, заполняет формы и перемещается по экрану компьютера или телефона), нужны четыре вещи: сами агенты, среды для их запуска, записи действий (трейсы) и система оценки с обучением. Все четыре были разбросаны по отдельным репозиториям. CUA-Lite собирает их под одним пространством действий, одной схемой данных и одной командой запуска.
| Показатель | Значение | Источник |
|---|---|---|
| Размер контейнера Lite.OSWorld | 0,9 ГБ против 4,1 ГБ у виртуальной машины OSWorld | репозиторий CUA-Lite |
| Выигрыш по параллельным средам | примерно в 4,6 раза больше одновременных десктопов | репозиторий CUA-Lite |
| Число верифицируемых задач | более 30 000 | репозиторий CUA-Lite |
| Интегрированные бенчмарки | более 15 | репозиторий CUA-Lite |
| Встроенные агенты | более 10 (GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие) | репозиторий CUA-Lite |
| Опубликованные датасеты | более 20, свободно на Hugging Face | репозиторий CUA-Lite |
| Совпадение оценок контейнер/виртуальная машина | подтверждено на 13 моделях | репозиторий CUA-Lite |
Зачем вообще менять виртуальные машины на контейнеры?
Существующий стандарт для обучения ИИ-агентов, работающих с десктопом, называется OSWorld. Он предоставляет полноценный рабочий стол Ubuntu, но упакован в виртуальную машину QEMU/KVM. Каждая задача поднимает отдельную машину, а для этого нужна вложенная виртуализация, которую большинство облачных провайдеров не предоставляет.
CUA-Lite воспроизводит тот же набор задач и те же системы оценки, но запускает рабочий стол GNOME внутри обычного Docker-контейнера (контейнер, это изолированная среда, которая делит ядро с хостом и потому запускается в разы быстрее и легче виртуальной машины). Контейнеру не нужен доступ к /dev/kvm, поэтому он работает на облачных инстансах, CI-серверах и даже внутри других контейнеров.
Для достоверности команда сверила результаты: по 13 моделям оценки в контейнере совпадают с оценками в виртуальной машине OSWorld. Сигнал для обучения, полученный в контейнере, переносится на реальный бенчмарк.
Что именно даёт платформа?
-
Единая схема данных LiteSample. Все среды, агенты и типы задач используют один формат (Parquet плюс изображения). Более 10 существующих датасетов для ИИ-агентов уже переведены в этот формат и опубликованы бесплатно на Hugging Face, включая Aguvis, OpenCUA, ScaleCUA, GUI-360 и другие.
-
Адаптеры под каждую модель. Модели ожидают данные в разном виде. Фреймворк содержит адаптер для каждого семейства, который пакует LiteSample в нужный формат, включая сжатие истории, чтобы несколько шагов проходили за один прямой проход.
-
Одна точка входа для оценки, дообучения (SFT, supervised fine-tuning, обучение на размеченных примерах) и обучения с подкреплением (RL, reinforcement learning, когда агент учится на собственных пробах и ошибках). Переключение между моделью и средой сводится к смене двух параметров в одном скрипте.
-
Семейство сред. Помимо Lite.OSWorld платформа включает Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld. Последняя покрывает около 40 приложений, включая Blender, QGIS и VS Code.
Какой результат показало дообучение?
Авторы приводят один конфигурационный пример: модель Qwen3-VL-2B-Instruct дообучили на десктопных траекториях из Lite.ScaleCUA. Средний показатель эпизодного вознаграждения вырос с 0,138 до 0,237 на тестовой выборке из 332 задач lite.osworld. Для обучения с подкреплением приведён пример на MobileGym: 416 мобильных задач в 28 приложениях, обновления GRPO поверх Slime.
Результат получен на двух GPU в одной конфигурации и не воспроизведён независимо. Это ранний эксперимент, а не финальный бенчмарк.
Платформа заявлена как открытая, но на момент публикации репозиторий не содержит явной лицензии. Перед любым коммерческим использованием необходимо уточнить условия. Результат дообучения (рост с 0,138 до 0,237) получен в одной конфигурации на двух GPU и не проверен независимо. Совпадение оценок контейнер/виртуальная машина подтверждено авторами, но внешнего аудита тоже пока нет.
Что делать с этим прямо сейчас?
Разработчику ИИ-агентов в России. CUA-Lite снижает затраты на инфраструктуру примерно в 4,6 раза: 0,9 ГБ на контейнер вместо 4,1 ГБ на виртуальную машину. Для тех, кто работает с ограниченными облачными ресурсами или на локальных серверах, это практическая разница между «запустить 4 среды» и «запустить 18». Docker есть везде, вложенная виртуализация в российских облаках часто недоступна, поэтому контейнерный подход снимает реальный барьер.
Автору на Дзене. ИИ-агенты, которые сами работают с интерфейсом, пока экзотика, но тема набирает обороты. Если вы пишете про автоматизацию или ИИ, CUA-Lite даёт конкретный повод: открытая платформа с 30 000 задачами, на которой можно потестировать и сравнить агентов без дорогой инфраструктуры.
Предпринимателю. Пока CUA-Lite не имеет явной лицензии, встраивать её в коммерческий продукт рискованно. Но сам факт, что обучение ИИ-агентов для работы с десктопом стало доступнее, стоит отслеживать: агенты, способные заполнять формы, переключаться между приложениями и выполнять рутинные задачи на экране, ближе к замене ручного труда, чем чат-боты.
CUA-Lite решает инженерную, а не научную задачу, и именно поэтому она ценна. Модели для ИИ-агентов уже есть, бенчмарки есть, но запустить всё вместе до сих пор требовало собирать пазл из несовместимых кусков. Одна команда запуска и один формат данных, это то, что превращает исследовательский прототип в рабочий инструмент. Для российского сообщества разработчиков ИИ-агентов особенно важен контейнерный подход: он работает на любом железе, без специфических требований к виртуализации, которые в наших облаках часто не выполняются. Лицензия пока не прописана, и это единственное, что мешает рекомендовать платформу для продуктовых команд прямо сейчас.
Если вы экспериментируете с ИИ-агентами или только присматриваетесь к теме, начните с Lite.OSWorld: поднимите контейнер на любом сервере с Docker и прогоните пару задач на доступной модели. Это займёт меньше времени, чем чтение документации OSWorld, и покажет, готовы ли агенты к вашим сценариям.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

ИИ-контент схлопывается в однообразие: почему turbotext и другие генераторы дают одинаковый результат
Всё больше кафе и ресторанов доверяют нейросетям оформление меню, и результат уже заметен невооружённым глазом: блюда на картинках выглядят подозрительно…
Память не успевает за ядрами: почему ИИ-ускоритель простаивает даже с HBM3E
Производители ИИ-ускорителей (специализированных чипов для нейросетей) наращивают число вычислительных ядер и осваивают компактные форматы данных вроде FP8 и…

Completion gate: как отличить реальный ответ локальной языковой модели от заглушки
Локальные языковые модели выдают валидный JSON и проходят автоматические проверки, но за аккуратной структурой часто прячутся заглушки, обрезанные ответы и…
Комментарии