Игорь Градов
Игорь Градов
5 мин
ai

70 000 волонтёров собрали датасет для робототехники с искусственным интеллектом прямо в браузере

Microsoft, Google, OpenAI и другие корпорации собирают данные для обучения роботов в закрытых лабораториях с дорогим оборудованием, и это тормозит всю отрасль. Команда исследователей из Axis Robotics, Калифорнийского университета в Беркли, Технологического института Джорджии и Наньянского технологического университета предложила альтернативу: систему AXIS, которая переносит сбор демонстраций для роботов в обычный браузер, а тяжёлые вычисления отдаёт серверным видеокартам.

70 000 волонтёров собрали датасет для робототехники с искусственным интеллектом прямо в браузере

Результат: 50 129 проверенных траекторий (записей движений робота) по 207 задачам, собранных сообществом из более чем 70 000 участников, и улучшение качества модели на 4,9 балла по тесту LIBERO-Plus после дообучения (обучения модели на новых примерах под конкретную задачу) на этих данных.

Почему это важно

Впервые датасет для робототехники с искусственным интеллектом собирается краудсорсингом через браузер, без локальных видеокарт и без физического робота у участника. Если подход масштабируется, лаборатории перестают быть единственным источником обучающих данных для манипуляционных моделей.

До сих пор датасеты для робототехники с искусственным интеллектом создавались по одной схеме: оператор-эксперт управляет роботом в лаборатории, записывает демонстрации, данные обрабатывают офлайн и публикуют как фиксированный набор, который больше не растёт. AXIS ломает эту схему: система спроектирована как постоянно расширяемый датасет, а не одноразовый бенчмарк. Исследование опубликовано на странице проекта, датасет доступен на Hugging Face с ограничением для некоммерческого академического использования. Код тренировки открыт как патч-слой поверх OpenPI.

Показатель Значение Источник
Количество задач 207 статья AXIS
Количество эпизодов (траекторий) 50 129 статья AXIS
Вариантов задач и сцен более 60 000 статья AXIS
Объём датасета 2,36 ТБ страница Hugging Face
Участники сообщества более 70 000 статья AXIS
Результат на LIBERO-Plus (AXIS-100%) 88,8 балла статья AXIS
Базовый результат π0.5 без AXIS 83,9 балла статья AXIS
Контрольный результат RoboCasa365 57,5 балла статья AXIS
Снижение среднего ускорения после очистки 63,9% статья AXIS
Снижение среднего рывка после очистки 80,8% статья AXIS
Успешность воспроизведения после очистки 86,2% статья AXIS

Как устроен сбор данных через браузер?

Участник открывает браузер и управляет виртуальным роботом Franka Research 3 с параллельным захватом. Физику и отрисовку обеспечивает MuJoCo, скомпилированный в WebAssembly (технология, позволяющая запускать тяжёлые программы прямо в браузере). Управлять можно клавиатурой, мышью, виртуальным джойстиком или геймпадом.

Физическое моделирование и рендеринг Three.js (библиотека для 3D-графики в браузере) работают отдельно от интерфейса, поэтому записанные пары «состояние-действие» привязаны к симулятору, а не к задержкам интерфейса. Всё ресурсоёмкое выполняется на серверах: рендеринг на 8 видеокартах RTX 4090, обучение и оценка на 8 видеокартах A100.

Задачи генерируются автоматически, а не пишутся вручную. Модуль TaskGen разбирает текстовую инструкцию на конфигурации задачи, сцены и объектов, подбирает или генерирует 3D-модели, масштабирует их до правдоподобных размеров и предлагает раскладку. Отдельный модуль проверяет сцену и переставляет объекты, если ограничения нарушены. Каждая задача содержит структурированный чекер успешности, который запускается на сервере, а не доверяет флагу из браузера пользователя.

Что обнаружили?

  • Общий результат выше базы на 4,9 балла. Модель π0.5 (архитектура PaliGemma с основой Gemma-2B и экспертом действий Gemma-300M) после дообучения на полном датасете AXIS набирает 88,8 балла на тесте LIBERO-Plus против 83,9 без него.
  • Дело не только в объёме данных. Контрольный набор RoboCasa365, подобранный по количеству траекторий, набрал 57,5 балла: разрыв в 31,3 балла показывает, что качество и разнообразие данных AXIS играют роль, а не просто количество.
  • Масштабирование работает на агрегатном уровне. 25% датасета дают 84,7 балла, 50% дают 85,7, 100% дают 88,8. Рост последовательный.
  • Два направления возмущений ухудшают результат. Оси Light (освещение) и Language (язык) регрессируют на 1,7 и 1,3 балла относительно базовой модели.
  • Наибольший выигрыш там, где работает аугментация. Sensor Noise (шум сенсора) прибавляет 13,7 балла, Camera (камера) прибавляет 11,3 балла. Background (фон) +3,7, Robot pose (поза робота) +3,8, Layout (расположение) +2,6.
  • Очистка данных снижает шум, но ценой точности воспроизведения. Среднее ускорение падает с 1,3539 до 0,4885 (минус 63,9%), средний рывок падает с 11,5899 до 2,2243 (минус 80,8%), но успешность воспроизведения снижается со 100% до 86,2%.
  • Ось Camera ведёт себя нелинейно. При 50% датасета результат проседает до 68,8 балла, ниже базовых 72,5, и восстанавливается только на полном объёме.
Как это читать

Датасет ограничен некоммерческим академическим использованием. Контрольные точки обученной политики не опубликованы, воспроизвести результаты можно только запустив обучение с нуля. Все замеры сделаны на одном бенчмарке LIBERO-Plus, перенос на реальные роботы в статье не показан. Регрессия по осям Light и Language означает, что аугментация данных решает не все задачи устойчивости. Нелинейное поведение оси Camera (провал на 50% и восстановление на 100%) говорит о том, что масштабирование стабильно только в среднем, а не по каждому измерению.

Что это значит для вас?

Автору Дзена и копирайтеру. Тема робототехники с искусственным интеллектом набирает поисковый спрос: люди хотят понять, как роботов учат двигаться. AXIS даёт конкретный повод объяснить аудитории принцип краудсорсинга данных: тысячи людей через браузер «показывают» роботу, как брать предметы, а модель учится на их примерах. Это понятная и свежая история для контента.

Маркетологу. Если вы работаете с EdTech или промышленной автоматизацией, браузерная платформа для сбора робототехнических данных меняет экономику: не нужны лаборатории и дорогие операторы. Пока датасет закрыт для коммерции, но сам подход «данные через браузер» применим шире.

Предпринимателю в РФ и СНГ. Платформа AXIS доступна в любом браузере, участвовать в сборе данных можно из России. Датасет скачивается с Hugging Face, но только для академических целей. Из российских инструментов для работы с обучающими данными (данными, на которых тренируется модель) для робототехники публичных аналогов пока нет: ни «Яндекс», ни Сбер не анонсировали открытых краудсорсинговых платформ для манипуляционных задач.

Мнение редакции dzen.guru

Идея красивая и работает на цифрах: 50 000 траекторий через браузер, это серьёзный объём, который раньше требовал десятков лабораторий. Но я вижу два ограничения. Первое: регрессия по осям Light и Language показывает, что модель не становится универсально лучше, она становится лучше ровно там, где данные разнообразнее. Второе: между симулятором и реальным столом с реальными предметами лежит пропасть. Пока перенос на физический мир не показан, AXIS остаётся экспериментом по масштабированию симуляционных данных. Но если подход докажет себя на реальных роботах, закрытые лабораторные датасеты останутся в прошлом. Следите за тем, опубликует ли команда контрольные точки политики и результаты sim-to-real переноса (перенос из симулятора в реальный мир).

По данным статьи AXIS (Marktechpost)

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ChatTJB: чатбот с людьми вместо ИИ собрал 100 000 запросов за месяц
ai

ChatTJB: чатбот с людьми вместо ИИ собрал 100 000 запросов за месяц

Компания индустрии делает вид, что всё заменят нейросети, а бывший менеджер Google в апреле 2026 года запустил чатбот с людьми вместо ИИ и за месяц собрал 100…

5 мин
RAG нейросети за 5 итераций: от папки с md-файлами до графа знаний на Go
ai

RAG нейросети за 5 итераций: от папки с md-файлами до графа знаний на Go

Если вам знакома ситуация, когда документация устарела, знания разбросаны по чатам и головам коллег, а проект горит, этот разбор покажет, как один разработчик…

6 мин
Кто придумал термин «искусственный интеллект» и ещё 9 понятий: глоссарий TechCrunch
ai

Кто придумал термин «искусственный интеллект» и ещё 9 понятий: глоссарий TechCrunch

Microsoft, Google и OpenAI каждую неделю вводят новые термины, и даже профильные журналисты путаются в аббревиатурах: LLM, RAG, RLHF, а с прошлой недели ещё и…

5 мин