Игорь Градов
Игорь Градов
5 мин
ai

UC Berkeley выпустил открытую платформу для обучения ИИ-агентов: инфраструктура дешевле в 4,6 раза

Команда исследователей из Калифорнийского университета в Беркли выпустила CUA-Lite, открытую платформу, которая впервые объединяет все четыре компонента обучения ИИ-агентов для работы с компьютером в одном фреймворке и снижает требования к инфраструктуре почти в пять раз.

UC Berkeley выпустил открытую платформу для обучения ИИ-агентов: инфраструктура дешевле в 4,6 раза
Почему это важно

До сих пор среды, агенты, данные и инструменты оценки ИИ-агентов жили в разных репозиториях с несовместимыми интерфейсами, и запуск каждой задачи требовал отдельной виртуальной машины. CUA-Lite устраняет оба барьера одновременно, и это первая открытая платформа, где замена виртуальной машины контейнером подтверждена совпадением результатов на 13 моделях.

Публикацию анонсировала команда UC Berkeley. Проект появился не как новая модель, а как инфраструктурный ответ на конкретную проблему: чтобы обучить или протестировать CUA (computer-use agent, ИИ-агент, который сам нажимает кнопки, заполняет формы и перемещается по экрану компьютера или телефона), нужны четыре вещи: сами агенты, среды для их запуска, записи действий (трейсы) и система оценки с обучением. Все четыре были разбросаны по отдельным репозиториям. CUA-Lite собирает их под одним пространством действий, одной схемой данных и одной командой запуска.

Показатель Значение Источник
Размер контейнера Lite.OSWorld 0,9 ГБ против 4,1 ГБ у виртуальной машины OSWorld репозиторий CUA-Lite
Выигрыш по параллельным средам примерно в 4,6 раза больше одновременных десктопов репозиторий CUA-Lite
Число верифицируемых задач более 30 000 репозиторий CUA-Lite
Интегрированные бенчмарки более 15 репозиторий CUA-Lite
Встроенные агенты более 10 (GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие) репозиторий CUA-Lite
Опубликованные датасеты более 20, свободно на Hugging Face репозиторий CUA-Lite
Совпадение оценок контейнер/виртуальная машина подтверждено на 13 моделях репозиторий CUA-Lite

Зачем вообще менять виртуальные машины на контейнеры?

Существующий стандарт для обучения ИИ-агентов, работающих с десктопом, называется OSWorld. Он предоставляет полноценный рабочий стол Ubuntu, но упакован в виртуальную машину QEMU/KVM. Каждая задача поднимает отдельную машину, а для этого нужна вложенная виртуализация, которую большинство облачных провайдеров не предоставляет.

CUA-Lite воспроизводит тот же набор задач и те же системы оценки, но запускает рабочий стол GNOME внутри обычного Docker-контейнера (контейнер, это изолированная среда, которая делит ядро с хостом и потому запускается в разы быстрее и легче виртуальной машины). Контейнеру не нужен доступ к /dev/kvm, поэтому он работает на облачных инстансах, CI-серверах и даже внутри других контейнеров.

Для достоверности команда сверила результаты: по 13 моделям оценки в контейнере совпадают с оценками в виртуальной машине OSWorld. Сигнал для обучения, полученный в контейнере, переносится на реальный бенчмарк.

Что именно даёт платформа?

  • Единая схема данных LiteSample. Все среды, агенты и типы задач используют один формат (Parquet плюс изображения). Более 10 существующих датасетов для ИИ-агентов уже переведены в этот формат и опубликованы бесплатно на Hugging Face, включая Aguvis, OpenCUA, ScaleCUA, GUI-360 и другие.

  • Адаптеры под каждую модель. Модели ожидают данные в разном виде. Фреймворк содержит адаптер для каждого семейства, который пакует LiteSample в нужный формат, включая сжатие истории, чтобы несколько шагов проходили за один прямой проход.

  • Одна точка входа для оценки, дообучения (SFT, supervised fine-tuning, обучение на размеченных примерах) и обучения с подкреплением (RL, reinforcement learning, когда агент учится на собственных пробах и ошибках). Переключение между моделью и средой сводится к смене двух параметров в одном скрипте.

  • Семейство сред. Помимо Lite.OSWorld платформа включает Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld. Последняя покрывает около 40 приложений, включая Blender, QGIS и VS Code.

Какой результат показало дообучение?

Авторы приводят один конфигурационный пример: модель Qwen3-VL-2B-Instruct дообучили на десктопных траекториях из Lite.ScaleCUA. Средний показатель эпизодного вознаграждения вырос с 0,138 до 0,237 на тестовой выборке из 332 задач lite.osworld. Для обучения с подкреплением приведён пример на MobileGym: 416 мобильных задач в 28 приложениях, обновления GRPO поверх Slime.

Результат получен на двух GPU в одной конфигурации и не воспроизведён независимо. Это ранний эксперимент, а не финальный бенчмарк.

Как это читать

Платформа заявлена как открытая, но на момент публикации репозиторий не содержит явной лицензии. Перед любым коммерческим использованием необходимо уточнить условия. Результат дообучения (рост с 0,138 до 0,237) получен в одной конфигурации на двух GPU и не проверен независимо. Совпадение оценок контейнер/виртуальная машина подтверждено авторами, но внешнего аудита тоже пока нет.

Что делать с этим прямо сейчас?

Разработчику ИИ-агентов в России. CUA-Lite снижает затраты на инфраструктуру примерно в 4,6 раза: 0,9 ГБ на контейнер вместо 4,1 ГБ на виртуальную машину. Для тех, кто работает с ограниченными облачными ресурсами или на локальных серверах, это практическая разница между «запустить 4 среды» и «запустить 18». Docker есть везде, вложенная виртуализация в российских облаках часто недоступна, поэтому контейнерный подход снимает реальный барьер.

Автору на Дзене. ИИ-агенты, которые сами работают с интерфейсом, пока экзотика, но тема набирает обороты. Если вы пишете про автоматизацию или ИИ, CUA-Lite даёт конкретный повод: открытая платформа с 30 000 задачами, на которой можно потестировать и сравнить агентов без дорогой инфраструктуры.

Предпринимателю. Пока CUA-Lite не имеет явной лицензии, встраивать её в коммерческий продукт рискованно. Но сам факт, что обучение ИИ-агентов для работы с десктопом стало доступнее, стоит отслеживать: агенты, способные заполнять формы, переключаться между приложениями и выполнять рутинные задачи на экране, ближе к замене ручного труда, чем чат-боты.

Мнение редакции dzen.guru

CUA-Lite решает инженерную, а не научную задачу, и именно поэтому она ценна. Модели для ИИ-агентов уже есть, бенчмарки есть, но запустить всё вместе до сих пор требовало собирать пазл из несовместимых кусков. Одна команда запуска и один формат данных, это то, что превращает исследовательский прототип в рабочий инструмент. Для российского сообщества разработчиков ИИ-агентов особенно важен контейнерный подход: он работает на любом железе, без специфических требований к виртуализации, которые в наших облаках часто не выполняются. Лицензия пока не прописана, и это единственное, что мешает рекомендовать платформу для продуктовых команд прямо сейчас.

Если вы экспериментируете с ИИ-агентами или только присматриваетесь к теме, начните с Lite.OSWorld: поднимите контейнер на любом сервере с Docker и прогоните пару задач на доступной модели. Это займёт меньше времени, чем чтение документации OSWorld, и покажет, готовы ли агенты к вашим сценариям.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ИИ-контент схлопывается в однообразие: почему turbotext и другие генераторы дают одинаковый результат
ai

ИИ-контент схлопывается в однообразие: почему turbotext и другие генераторы дают одинаковый результат

Всё больше кафе и ресторанов доверяют нейросетям оформление меню, и результат уже заметен невооружённым глазом: блюда на картинках выглядят подозрительно…

5 мин
ai

Память не успевает за ядрами: почему ИИ-ускоритель простаивает даже с HBM3E

Производители ИИ-ускорителей (специализированных чипов для нейросетей) наращивают число вычислительных ядер и осваивают компактные форматы данных вроде FP8 и…

7 мин
Completion gate: как отличить реальный ответ локальной языковой модели от заглушки
ai

Completion gate: как отличить реальный ответ локальной языковой модели от заглушки

Локальные языковые модели выдают валидный JSON и проходят автоматические проверки, но за аккуратной структурой часто прячутся заглушки, обрезанные ответы и…

5 мин