Google открыла Gemini Robotics ER 2 по API: инженер-робототехник подключит её к своему роботу уже сегодня
Компания Google представила Gemini Robotics ER 2, модель «воплощённого рассуждения» (embodied reasoning) для робототехники, и сразу открыла к ней доступ через Gemini API и Google AI Studio, что делает её доступной разработчикам по всему миру, включая Россию.

Впервые Google выпускает модель для управления роботами не закрытым пилотом, а через публичный API: любой инженер робототехник с доступом к Gemini API может подключить её к своему оборудованию уже сегодня.
В чём суть?
Google позиционирует Gemini Robotics ER 2 как «мозг верхнего уровня» для роботов. Модель берёт на себя диалог с человеком, понимание физического пространства и планирование многошаговых задач, а непосредственное управление моторикой отдаёт любой подключённой VLA-модели (vision-language-action, модель «зрение-язык-действие», которая переводит визуальный контекст и текстовую команду в конкретные движения робота).
Ключевые отличия от предыдущей версии ER 1.6, заявленные Google:
- Отслеживание прогресса задач по видеопотоку. Робот в реальном времени определяет, на каком этапе находится, и может повторить неудавшийся шаг, не перезапуская всю последовательность. Точность классификации прогресса составляет 57,4% (по данным Google).
- Точное определение ключевого момента. Модель находит кадр, в котором происходит критическое событие (например, когда пора прекратить наливать кофе), с точностью 91,3% и средним отклонением 0,96 секунды (по данным Google).
- Совместная работа нескольких роботов. Разные машины, колёсный ровер и гуманоидный робот, обмениваются контекстом через общее семантическое понимание и передают задачи друг другу. Google показала совместную работу роботов Apptronik Apollo 2 и Franka F3 Duo.
- Потоковый режим через Gemini Live API. Двунаправленный стриминг оптимизирован для задач, чувствительных к задержке: робот «думает» о следующем шаге, пока выполняет текущий, без пауз «остановился и подумал».
Демо было построено на роботе Spot от Boston Dynamics: робот по голосовой команде на естественном языке находил и приносил пачку попкорна. Код примера опубликован на GitHub.
Аргументы за: почему инженеру робототехнику стоит обратить внимание
Снижение порога входа. До сих пор «мозг» для робота приходилось строить самостоятельно или покупать у узких поставщиков. Публичный API означает, что небольшая команда или даже один инженер робототехник может подключить модель к существующему оборудованию, объявив свои низкоуровневые контроллеры как «инструменты» модели.
Мультироботная координация без собственного протокола. Организовать совместную работу двух разнотипных машин, до сих пор отдельная инженерная задача. Gemini Robotics ER 2 предлагает встроенный механизм передачи контекста между роботами.
Скорость инференса. По данным Google, модель работает в четыре раза быстрее более крупных аналогов при сопоставимой точности поиска ключевых моментов, оставаясь в пределах субсекундной задержки, что критично для безопасного управления в физическом мире.
Встроенный вызов внешних инструментов. Модель нативно обращается к Google Search и к любым пользовательским функциям: робот может уточнить рецепт, найти инструкцию или запросить данные с датчика без дополнительной обвязки.
Аргументы против: где здоровый скепсис уместен
Точность 57,4% в классификации прогресса, это чуть лучше случайного угадывания для пяти классов (20%). Google называет это улучшением по сравнению с предыдущими моделями, но для промышленного применения, где ошибка означает брак или аварию, цифра выглядит сырой.
Зависимость от облака. Потоковое подключение через API означает постоянный канал связи. На складе с нестабильным интернетом или в зоне с ограниченным покрытием робот останется без «мозга».
Нет данных о стоимости инференса в продакшене. Google не назвала цену за токен (единицу обработки текста моделью) для Gemini Robotics ER 2. Для задач реального времени с непрерывным видеопотоком счёт может оказаться ощутимым.
Привязка к экосистеме Google. Модель доступна только через Gemini API и Google AI Studio. Альтернатив с открытыми весами (когда параметры модели можно скачать и запустить локально) для задач embodied reasoning пока мало, и Google не обещает их выпустить.
Gemini Robotics ER 2 позволяет роботам вести диалог с людьми, понимать физический мир и планировать многошаговые задачи, а затем передавать моторное исполнение любой VLA-модели. : Блог Google DeepMind
Модель интересна именно тем, что Google не пытается заменить весь стек робототехники, а занимает уровень «координатора»: вы подключаете свои моторные контроллеры, а модель думает за робота. Для российских разработчиков это реальная возможность: Gemini API доступен, Google AI Studio работает, код примеров открыт. Но я бы не торопился переводить на это промышленную линию. 57% точности в отслеживании прогресса, это уровень прототипа, не продакшена. Начните с лабораторного стенда или складского пилота, где ошибка не стоит дорого.
Из российских альтернатив стоит держать в поле зрения разработки «Сбера» в робототехнике и проекты на базе YandexGPT для голосового управления устройствами, хотя прямого аналога embodied reasoning модели в российском опенсорсе пока нет.
Что делать с этим прямо сейчас, по ролям
Инженеру робототехнику и разработчику. Зайдите в Google AI Studio, откройте примеры на GitHub, попробуйте подключить свою VLA-модель или навигационный API как «инструмент». Оцените задержку и точность на своих задачах. Для русскоязычных голосовых команд проверьте, как модель обрабатывает русский язык через мультимодальный (работающий сразу с текстом, аудио и видео) вход.
Автору Дзена, пишущему про технологии. Тема робототехники с ИИ набирает поисковый интерес. Разбор конкретного демо (Spot с попкорном, совместная работа двух роботов) даёт наглядный материал для поста с видео.
Предпринимателю в производстве или логистике. Пока это инструмент для пилотов, не для замены существующих систем. Но если вы уже автоматизируете склад или сервисную линию, протестируйте модель на одном сценарии: «принеси предмет по голосовой команде». Стоимость эксперимента, время разработчика плюс доступ к API.
Если Google доведёт точность отслеживания прогресса хотя бы до 80% и опубликует прозрачные тарифы на инференс видеопотока, Gemini Robotics ER 2 может стать стандартным «координатором» для роботов среднего класса сложности, складских сортировщиков, сервисных помощников, лабораторных ассистентов. Пока же это мощная песочница: играть в ней стоит уже сейчас, а ставить на неё конвейер ещё рано.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Nous Research подключила AI-агенты к Buzz на базе Nostr: без токенов, на своих ключах
Nous Research выпустила поддержку ИИ-агента Hermes для Buzz, открытого рабочего пространства от Block, где люди и ИИ-агенты (автономные программы, выполняющие…
GPT 5 Pro анонсирована, но цен и доступа для России пока нет
Компания OpenAI представила GPT-5 Pro, и пока это самое заметное обновление за последний год, однако конкретных данных о ценах, архитектуре и доступности…

Терминальный агент ИИ на 9 провайдеров: как собрать мультимодельный чат в 5 строк кода
Работая строго по фактам из источника, формирую тело новости в формате how-to. Если у вас ключи от нескольких LLM-провайдеров (большие языковые модели как…
Комментарии