Искусственный интеллект для решения физических задач: почему роботам дают много «мозгов» вместо одного
Технология Physical AI обещает превратить роботов из дорогих танцующих игрушек в полезных работников, но между демороликами и реальным производством лежит пропасть, и руководитель R&D-направления Physical AI в компании MWS Артём Лыков объясняет, как её преодолевают уже сейчас.

Гуманоидные роботы на видео впечатляют, но на реальном производстве пока бесполезны: им не хватает данных, сенсоров и целостного восприятия мира. Агентный подход, когда вместо одного «мозга» работает система из нескольких моделей, уже позволяет внедрять роботов на действующих площадках.
Артём Лыков, руководитель R&D-направления Physical AI в MWS, разобрал разницу между эффектной имитацией и настоящим искусственным интеллектом для решения физических задач. Его главный тезис: аппаратная база роботов за последние годы заметно продвинулась, но интеллектуальная часть отстаёт, и именно здесь решается, станут ли гуманоиды чем-то большим, чем демонстрационные стенды.
Physical AI и гуманоид: почему это не одно и то же?
Physical AI (искусственный интеллект для решения физических задач) и гуманоидный робот часто звучат вместе, но это разные вещи.
- Гуманоидный робот это физическая форма: машина, похожая на человека, способная ходить и манипулировать объектами.
- Physical AI это интеллектуальная начинка: система, которая воспринимает окружающий мир, понимает контекст, принимает решения и выполняет их в физической среде.
Гуманоидное тело в подавляющем большинстве случаев не означает наличие Physical AI. Танцы, ходьба по лестнице, приготовление кофе часто остаются результатом имитационного обучения (когда робот повторяет заранее заданную последовательность действий, не адаптируясь к изменениям вокруг).
Лыков приводит пример: гуманоидный робот из Перми умеет приготовить кофе, но сыграть в шахматы уже не способен. При этом Physical AI может существовать и без человекоподобного корпуса, например на промышленном манипуляторе или в беспилотном автомобиле.
Почему один «мозг» для робота не работает?
Долгое время казалось, что достаточно собрать качественные данные и обучить одну большую end-to-end модель (модель «от входа до выхода», которая сама разбирается, что делать). На вход подаётся видео, текст, звук, тактильные сигналы, положение в пространстве, заряд батареи. На выходе модель должна выдать и понимание ситуации, и управляющие команды.
Но такой подход пока не дал результата. Причины:
- Нет данных нужного масштаба. В отличие от больших языковых моделей (LLM, large language models), которые учатся на текстах из интернета, для роботов не существует готовых наборов данных сравнимого объёма. Открытые датасеты (наборы обучающих данных) слишком ограничены.
- Аппаратные ограничения. Вычислительные мощности на борту робота и пропускная способность связи с серверами не позволяют гонять тяжёлую модель в реальном времени.
Агентный подход: много «мозгов» вместо одного
Вместо единой модели создаётся система из нескольких моделей-агентов (ИИ-агент, программа, которая сама решает, что делать для выполнения задачи). Каждый агент (агентный, то есть способный к самостоятельным действиям) отвечает за свою модальность: один за зрение, другой за движение, третий за планирование.
Что это даёт на практике:
- Можно обновить одного агента, не перестраивая систему целиком. Лыков приводит пример: обновили агента движений, точность улучшилась на 10%, остальная архитектура осталась прежней.
- Робот быстрее адаптируется под новые задачи.
- Можно заменить слабое звено, не трогая сильные.
По словам Лыкова, большие end-to-end модели для роботов рано или поздно появятся, но прямо сейчас практический путь именно агентный подход.
Зрение робота: как картинку превращают в действие?
Визуальный канал сегодня развит лучше всего. Робот получает команду текстом, но для выполнения действия ему нужно понимать, что происходит вокруг. Контекст даёт изображение.
Для этого используются VLA-модели (Vision-Language-Action, модели, которые связывают изображение, текст и действие). Они выросли из VLM (визуально-языковых моделей, которые научились «понимать» картинки: отвечать на вопросы по фото, описывать объекты). Принцип тот же: изображение превращается в токены (токен, минимальная единица, которую обрабатывает модель, как слово или его часть), и для модели картинка становится такой же последовательностью элементов, как текст.
Дообучение (fine-tuning, обучение модели на специальных примерах под конкретную задачу) уже обученных визуальных энкодеров (программ, которые «сжимают» изображение в набор чисел) позволяет адаптировать модель для робототехнических задач.
Что делать с этим прямо сейчас, по ролям
Авторам Дзена и копирайтерам. Тема Physical AI набирает поисковый интерес, но большинство текстов пересказывают демо-ролики. Статья, которая честно разделяет «робот танцует» и «робот полезен на производстве», выигрывает у поверхностных обзоров. Используйте разделение Physical AI и гуманоида как структурный приём.
Маркетологам. Если вы продвигаете продукт в сфере автоматизации, не спекулируйте на видео танцующих роботов. Аудитория уже понимает, что за красивой картинкой часто нет реальной функциональности. Агентный подход, конкретные кейсы внедрения, честные ограничения продают лучше.
Предпринимателям в РФ и СНГ. Компания MWS уже работает с Physical AI на российском рынке. Если вы рассматриваете роботизацию производства, ищите подрядчиков, которые применяют агентную архитектуру и готовы показать, какой именно набор задач закрывает их решение. Спрашивайте не «умеет ли робот ходить», а «сколько задач он выполнит без ручной разметки новых данных».
Допустим, вы пишете материал о робототехнике для канала на Дзене. Вместо пересказа очередного демо-ролика постройте текст вокруг вопроса: «Что робот делает, когда ситуация отличается от заученного сценария?» Это сразу отделяет имитацию от настоящего Physical AI и даёт читателю критерий оценки любой новости про роботов.
- Путать Physical AI с гуманоидной формой. Робот может выглядеть как человек и при этом не обладать никаким Physical AI, а просто повторять заученные движения.
- Верить демо-роликам без оговорок. Красивое видео почти всегда снято в контролируемых условиях с заранее заданным сценарием.
- Ожидать, что один универсальный «мозг» решит все задачи. Пока это не работает ни у кого, и Лыков подтверждает: данных недостаточно, мощностей не хватает.
- Думать, что обучение по видео уже решено. Полностью обучить робота только по видео пока не получается, нужны дополнительные данные: аннотации, понимание структуры движения, отслеживание положения суставов.
Я слежу за темой Physical AI с момента, когда Boston Dynamics начала публиковать первые вирусные ролики. Тогда казалось, что до промышленных гуманоидов рукой подать. На практике разрыв между «робот красиво прыгает» и «робот полезен на складе» остаётся огромным. Агентный подход, о котором говорит Лыков, выглядит честнее, чем обещания единого «мозга»: он позволяет получать результат по частям и не ждать, пока всё станет идеальным. Честная оговорка: даже агентный подход пока не превращает гуманоида в универсального работника. Мы находимся на ранней стадии, где каждая новая задача требует отдельной настройки и данных. Но именно поэтому тем, кто пишет про роботов, стоит перестать транслировать маркетинговые демо как реальность и начать задавать правильные вопросы.
Разделение «красивого тела» и «работающего мозга» у робота, самый полезный фильтр, который может взять на вооружение любой автор, пишущий о робототехнике: если в новости нет ответа на вопрос «что робот сделает, когда сценарий изменится», перед вами маркетинг, а не технология.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Reddit и искусственный интеллект: $805 млн выручки, но акции рухнули на 10% из-за потери поискового трафика
Reddit потерял часть поискового трафика из-за ИИ-ответов Google, и аналитики Уолл-стрит прямо спросили CEO, не откажется ли компания от лицензирования данных…

AI инженеров внедрения всего 2 000 на рынке США, а спрос вырастет на 2 100%
Статья начинается сразу с лида, H1 уже задан и не дублируется. Компании по всему миру столкнулись с тем, что купить доступ к ИИ-модели оказалось проще, чем…

Google представила робототехнику Gemini 2.0
Google представила второе поколение робототехнических моделей Gemini Robotics 2.0, и впервые одна из них доступна разработчикам прямо сейчас: можно подключить…
Комментарии