Google DeepMind открыла доступ к моделям роботики ИИ: от пальцев до полного тела
Google DeepMind впервые открыла публичный доступ к Gemini Robotics ER 2, модели, которая планирует многоступенчатые задачи для роботов, и одновременно выпустила три модели для управления телом, пальцами и координацией машин.

Роботика ИИ переходит от заводского конвейера к роботам, которые сами адаптируются к незнакомой среде: Google выложила бенчмарк безопасности ASIMOV-Agentic на Hugging Face под открытой лицензией CC-BY-4.0, а значит, любой разработчик может проверять своих агентов по единой методике.
До сих пор большинство роботов работали по жёстким программам или под дистанционным управлением оператора. Навыки одного робота почти невозможно было перенести на другое «тело». Google DeepMind, подразделение Google, занимающееся исследованиями в области ИИ, заявляет, что новый набор из трёх моделей закрывает сразу три ограничения: адаптацию к непредсказуемой среде, управление всем телом робота и совместную работу нескольких машин. Об этом компания сообщила в официальном анонсе.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Gemini Robotics 2 (VLA) | анонс состоялся, доступ ограничен | Google DeepMind | не раскрыта |
| Gemini Robotics ER 2 (рассуждающая модель) | публичное превью открыто | Google DeepMind | не раскрыта |
| Gemini Robotics On-Device 2 (локальная VLA) | анонс состоялся, доступ ограничен | Google DeepMind | не раскрыта |
| ASIMOV-Agentic (бенчмарк безопасности) | доступен на Hugging Face | Google DeepMind | бесплатно, лицензия CC-BY-4.0 |
Три модели вместо одной: что делает каждая?
-
Gemini Robotics 2 (VLA, vision-language-action, модель «зрение-язык-действие»). Получает картинку и текстовую команду, а на выходе выдаёт моторные сигналы. Управляет роботом целиком, от ступней до кончиков пальцев. Одна и та же модель работает на гуманоиде Apollo 2 с двумя разными типами кистей и на платформе Franka Duo с захватом-«клешнёй».
-
Gemini Robotics ER 2 (ER, embodied reasoning, «воплощённое рассуждение»). Это «мозг верхнего уровня»: понимает физический мир, разговаривает с человеком, планирует многоступенчатые задачи на несколько минут вперёд. По карточке модели, построена на базе Gemini 3.5 Flash. Принимает текст, изображения, видео и аудио с контекстным окном до 128 000 токенов (токен, минимальная единица текста, которую обрабатывает модель). Именно эта модель открыта в публичном превью.
-
Gemini Robotics On-Device 2 (локальная VLA). Работает прямо на борту робота без подключения к облаку. Построена на технологиях Gemini Robotics 1.5 и семейства открытых моделей Gemma от Google. Принимает текст, изображения и числовые данные с датчиков робота, выдаёт команды в виде числовых значений.
Принцип разделения труда: ER 2 планирует задачу и отслеживает прогресс, а VLA-модель выполняет физические действия как вызываемый «инструмент». Разработчики регистрируют низкоуровневые интерфейсы управления и передают в модель видео, аудио или текст потоком.
Робот ходит, а не только двигает руками
Предыдущие версии Gemini Robotics управляли только верхней частью тела гуманоида для настольных операций. Gemini Robotics 2 впервые распространяет контроль на всё тело.
Демонстрация: гуманоид Apollo 2 от компании Apptronik получает команду «положи лейку в зелёный ящик на нижней полке». Робот подходит к столу, берёт лейку, делает несколько шагов к стеллажу и ставит предмет на место. Google DeepMind прямо признаёт, что скорость движения роботов пока нуждается в улучшении.
Ловкость пальцев: от 32% до 92%
Модель управляет пятипальцевой кистью SharpaWave с 22 степенями свободы на Apollo 2. Среди продемонстрированных действий: завязывание узлов и закрытие зип-пакета. Та же модель работает и с двупальцевым захватом Robotiq на платформе Franka Duo.
Показатели успешности варьируются от 32% до 92% в зависимости от задачи и типа кисти. Google DeepMind отмечает, что ловкость пальцев остаётся самым слабым звеном.
ER 2 понимает, когда задача выполнена
Отдельная способность, которую редко замеряют: модель определяет, на каком этапе находится задача.
-
Классификация прогресса: каждому кадру видео присваивается уровень выполнения от 0% до 100%. Точность ER 2 составляет 57,4%, что, по данным Google DeepMind, превышает показатели предыдущего поколения и конкурирующих моделей.
-
Поиск ключевого момента: модель находит кадр, в котором происходит критическое событие (например, момент остановки при наливании кофе). Точность 91,3% со средним отклонением 0,96 секунды. Google DeepMind сообщает, что ER 2 конкурирует с моделями значительно большего размера при четырёхкратном преимуществе в скорости выполнения.
ER 2 интегрирована с Gemini Live API через двунаправленную потоковую передачу, чтобы убрать паузы «остановился-подумал» между шагами. Модель также может вызывать Google Search или любые пользовательские функции как инструменты.
Два робота работают в паре
Gemini Robotics 2 позволяет роботам разных типов сотрудничать. Логика: колёсный робот лучше для ровного пола, а гуманоид справляется с неровной поверхностью. Машины общаются через общее семантическое понимание и передают друг другу подзадачи. В демонстрации совместно работали Apollo 2 и Franka F3 Duo. Google DeepMind также показала связку ER 2 с роботом Spot от Boston Dynamics, где ER 2 управляла навигацией и манипулятором. Пример кода доступен в репозитории robotics-samples.
Как попробовать?
- Откройте страницу Gemini Robotics ER 2 в публичном превью через Google AI Studio или API (конкретный URL компания публикует в анонсе).
- Для тестирования бенчмарка безопасности ASIMOV-Agentic перейдите на Hugging Face, найдите репозиторий Google DeepMind и скачайте набор данных под лицензией CC-BY-4.0.
- Примеры кода для интеграции со Spot от Boston Dynamics ищите в репозитории robotics-samples на GitHub Google DeepMind.
Доступ к самой VLA-модели Gemini Robotics 2 и к On-Device 2 пока ограничен, открытого превью для них нет.
Есть ли аналоги в России?
Прямых аналогов роботики ИИ уровня Gemini Robotics 2 в российских сервисах на момент публикации нет. YandexGPT и GigaChat от Сбера работают с текстом и изображениями, но не управляют физическими роботами. Российские робототехнические компании (Promobot, «Промобот») используют собственные модели для навигации и диалога, однако публичных VLA-моделей с открытым доступом не выпускали. Бенчмарк ASIMOV-Agentic на Hugging Face доступен из любой точки мира, его можно скачать и использовать для проверки любых агентных систем, в том числе собственных разработок.
На мой взгляд, главная ценность анонса не в самих роботах, а в двух вещах.
Первое: открытый бенчмарк ASIMOV-Agentic. Пока все обсуждают, насколько ИИ-агенты (программы, которые действуют самостоятельно) безопасны, Google выложила конкретный инструмент для проверки. Это можно скачать и применить к своим проектам уже сейчас.
Второе: подход «одна модель на разные тела». Если он сработает в масштабе, роботика ИИ из штучного ремесла станет платформой, как Android стал платформой для тысяч разных телефонов.
Для авторов Дзена: тема роботики ИИ сейчас на подъёме, материалы с разбором конкретных демонстраций (робот завязывает узел, робот наливает кофе) собирают внимание. Попробуйте описать бенчмарк ASIMOV-Agentic как кейс для образовательного контента.
Для маркетологов: пока продукт недоступен коммерчески, но следите за Google AI Studio, первым открытым каналом к ER 2.
Для предпринимателей в РФ: прямого доступа к VLA-моделям нет, но бенчмарк на Hugging Face открыт. Если ваша компания работает с робототехникой, это готовый стандарт для тестирования безопасности агентов.
Честная оговорка: ловкость пальцев от 32% до 92%, разброс огромный. До надёжной замены человеческих рук в сложных манипуляциях ещё далеко.
Частые вопросы
Можно ли попробовать Gemini Robotics 2 без робота?
Саму VLA-модель, которая управляет моторами, без физического робота использовать нельзя. Но модель ER 2 доступна в публичном превью как рассуждающая система: она анализирует видео, классифицирует прогресс задач и отвечает на вопросы о физическом мире. Для этого робот не нужен.
Бенчмарк ASIMOV-Agentic доступен в России?
Да. Он выложен на Hugging Face под лицензией CC-BY-4.0 (можно использовать и модифицировать с указанием авторства). Скачать может любой пользователь с аккаунтом на платформе.
Чем отличается VLA от обычной языковой модели?
Обычная языковая модель (например, ChatGPT или YandexGPT) принимает текст и выдаёт текст. VLA (vision-language-action, «зрение-язык-действие») принимает картинку и текстовую команду, а выдаёт физические действия: повернуть руку на 15 градусов, сжать захват, сделать шаг. Это модель, которая «думает» не словами, а движениями.
Релиз Google DeepMind показывает, куда движется роботика ИИ: от одного робота с одной программой к платформе, где разные машины получают общий «мозг» и могут работать вместе. Пока доступ ограничен, но бенчмарк безопасности открыт для всех, и это конкретный инструмент, который можно применить уже сегодня.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Gemini Robotics 2 впервые управляет всем телом робота: ИИ-робототехника получила аварийную остановку
Google DeepMind показала вторую версию модели Gemini Robotics, которая впервые управляет гуманоидным роботом целиком, от ступней до кончиков пальцев, и…

Krea AI генератор заработал локально на Mac: 7 минут вместо 6 часов на кадр
Krea AI генератор изображений Krea 2 можно запустить локально на Mac без облака и без Python, если собрать нативное Swift-приложение Twisterminigen, и один…

LinkedIn превратил 900 млн пользователей в детектор AI контента: 41% постов пишет нейросеть
LinkedIn начал бороться с потоком текстов, сгенерированных нейросетями, и 5 июня 2025 года добавил в меню каждого поста кнопку «Seems like AI slop», которая…
Комментарии