Игорь Градов
Игорь Градов
5 мин
ai

Применение ИИ в робототехнике без ручной разметки: Dyna-2 обучилась на миллионе часов видео

Компания Dyna Robotics представила Dyna-2, модель для управления роботами, обученную на миллионе часов видео от первого лица, и впервые показала, что обычное человеческое видео заменяет дорогую ручную разметку действий для робототехники.

Применение ИИ в робототехнике без ручной разметки: Dyna-2 обучилась на миллионе часов видео
Почему это важно

До сих пор роботов учили на данных, которые оператор размечал вручную через телеуправление. Dyna-2 доказывает, что масштабирование обычного видео даёт предсказуемый рост качества и переносится на роботов, которых модель никогда не видела, а значит, применение ИИ в робототехнике перестаёт упираться в дефицит размеченных данных.

Результаты опубликованы в техническом отчёте Dyna Robotics. Команда построила «лестницу данных» от 1 000 до 1 000 000 часов видео и замерила, как качество растёт с каждой ступенью. Главный вывод: закон масштабирования, найденный на человеческом видео, впервые переносится на роботизированные задачи без какого-либо дообучения (обучения модели на примерах конкретного робота).

Показатель Значение Источник
Объём предобучения более 1 000 000 часов видео от первого лица (около 170 лет непрерывного опыта) Технический отчёт Dyna-2
Рост среднего балла по 14 задачам (лестница данных) от 20% (1 000 ч) до 53% (1 000 000 ч) Технический отчёт Dyna-2
Превосходство над Dyna-1 на объектах заказчиков 87% прохождения критериев против 46% у Dyna-1 Технический отчёт Dyna-2
Снижение времени генерации видео (дистилляция) с 10 203 мс до 110 мс на одном GPU H100 Технический отчёт Dyna-2
Доступ к модели закрытая коммерческая система, без открытых весов и без API Технический отчёт Dyna-2

Что измеряли и как это устроено?

Dyna-2 относится к классу WAM (world-action model, «модель мира и действий»). Проще говоря, это одна нейросеть, которая одновременно предсказывает, как будет выглядеть следующий кадр видео, и какое физическое действие робот должен выполнить. Видео и действие обрабатываются раздельными блоками трансформеров, но эти блоки обмениваются информацией друг с другом.

Обучение шло в два этапа. Сначала модель смотрела человеческое видео от первого лица: как люди берут предметы, открывают крышки, завязывают верёвки. Затем её дообучали уже на данных конкретных роботов, причём на каждую задачу хватало не более 10 часов записей.

Команда специально нарезала вложенные подмножества данных: 1 000, 10 000, 100 000 и 1 000 000 часов, сохраняя одинаковые пропорции источников. Это позволило построить честную кривую масштабирования, где рост качества объясняется только количеством данных, а не сдвигом распределения.

Три открытия, подкреплённые цифрами

  • Закон масштабирования работает до миллиона часов. Все четыре метрики улучшаются монотонно и подчиняются степенному закону. Показатель FVD@16 (качество предсказания видео) вырос на 51% по всей лестнице данных.

  • Закон переносится на роботов, которых модель не видела. Те же контрольные точки проверили без дообучения на 39 задачах на двух платформах YAM. Ошибка действий на роботах снижается по предсказуемой кривой. Команда фиксирует перелом между 10 000 и 100 000 часами.

  • Именно видео, а не данные действий, обеспечивает перенос между телами. Совместное обучение на видео и действиях обыграло обучение только на действиях во всех 39 задачах. Добавление видео без разметки действий снизило ошибку на роботах с 0,340 до 0,120. При этом ошибка на человеческих данных не менялась: видео помогает именно обобщению между разными физическими телами.

Как Dyna-2 справляется с реальными задачами?

После предобучения модель дообучали на 14 практических задачах на трёх типах роботов: манипуляторы YAM с простыми захватами, те же манипуляторы с 20-пальцевыми руками WUJI-2 и полугуманоидный прототип.

Средний балл рос от 20% при 1 000 часах предобучения до 53% при миллионе. Показательный пример: задача «поворот ключа в замке» давала 0% при любом объёме до 100 000 часов, а на миллионе скакнула до 90%. Задачу «откручивание крышки бутылки» модель освоила на 50%, имея всего около 10 минут демонстраций.

На реальных объектах заказчиков Dyna-2 прошла производственные критерии в 87% случаев. У предыдущей модели Dyna-1 (построенной на базе Qwen3-VL-4B) этот показатель составил 46%. Применение ИИ в домашней робототехнике пока остаётся за горизонтом: роботы Dyna-1 уже работают в отелях, ресторанах и прачечных (по данным анонса компании от 10 августа 2026 года), но речь идёт о коммерческих площадках, а не о бытовых сценариях.

Как это читать

Результаты получены на собственных бенчмарках компании и частично на стороннем наборе xdof ABC. Независимой внешней верификации в отчёте нет. Разрыв между «домашними» тестами (около 100% у обеих моделей) и результатами на объектах заказчиков (87% против 46%) указывает на то, что лабораторные цифры завышают реальную надёжность. Объём дообучения (до 10 часов на задачу) впечатляет, но 14 задач покрывают узкий класс стационарных манипуляций: уборка подносов, комплектация аптечек, раскладка вешалок, извлечение напитков из холодильника.

Что это значит для вас?

Авторам Дзена и копирайтерам. Тема применения ИИ в робототехнике выходит из стадии лабораторных демонстраций в стадию производственных внедрений. Это материал для контента: конкретные задачи (завязывание верёвок, сортировка мусора) понятны читателю и дают наглядные примеры вместо абстрактных обещаний.

Маркетологам. Если вы работаете с клиентами в HoReCa (отели, рестораны, кейтеринг) или в сфере коммерческой уборки, роботизация рутинных операций перестаёт быть прогнозом и становится коммерческим предложением конкурентов.

Российским разработчикам и предпринимателям. Dyna-2 недоступна для локального хостинга (это закрытая модель без открытых весов, без API). Применение российскими компаниями потребует либо покупки роботизированной ячейки Dyna напрямую, либо разработки собственных аналогов. Из российских проектов в робототехнике стоит следить за разработками Сбера и лабораториями при МФТИ и Сколтехе, хотя модели сопоставимого масштаба предобучения пока не представлены.

Мнение редакции dzen.guru

Главное в этом исследовании не сама модель, а доказательство принципа: обычное видео, снятое людьми, заменяет ручную разметку для обучения роботов. Если результат воспроизведут другие команды, стоимость обучения роботов упадёт на порядки, потому что человеческого видео в интернете несоизмеримо больше, чем размеченных роботизированных данных. Для российского рынка закрытость Dyna-2 означает, что прямого доступа не будет. Но сам метод (предобучение на видео от первого лица с последующим дообучением на минимуме роботизированных данных) открыт и описан в отчёте. Я ожидаю, что в ближайший год появятся открытые реплики этого подхода, и именно за ними стоит следить тем, кто строит робототехнику в России.

Dyna-2 не решает проблему целиком: 14 задач, стационарные манипуляторы, закрытая система одного вендора. Но закон масштабирования, который переносится между телами без единого примера, это конкретный, измеримый результат, и он говорит разработчикам: собирайте видео, а не ждите размеченных датасетов.

По данным технического отчёта Dyna Robotics

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Как найти спрос в Telegram чатах для маркетинга

Telegram-чаты городских сообществ генерируют сотни сообщений в день, и где-то среди шума, репостов и споров прячется живой спрос, люди ищут байк, мастера,…

6 мин
Ошибка оценки глубины растёт на 166%: бенчмарк для специалистов по компьютерному зрению дронов и нейросетям
ai

Ошибка оценки глубины растёт на 166%: бенчмарк для специалистов по компьютерному зрению дронов и нейросетям

Текст не содержит данных о финансовой сделке, раунде, инвестициях или оценке компании. Архетип «funding» не подтверждается источником. Перестраиваю структуру…

5 мин
Цифровое резюме: нейросети формируют мнение о вас раньше, чем вы отправите отклик
ai

Цифровое резюме: нейросети формируют мнение о вас раньше, чем вы отправите отклик

Компания или автор запустили концепцию «цифрового резюме», то есть профессионального цифрового профиля, который рекрутеры и заказчики собирают через нейросети,…

5 мин