Игорь Градов
Игорь Градов
5 мин
ai

ИИ-агенты за 5 итераций превращают видео в физическую симуляцию: модель на 9B обошла Gemini

Компания MirroS выпустила Code-as-World, открытый инструмент, который превращает обычное видео в редактируемую физическую симуляцию с точными параметрами массы, гравитации и столкновений, и делает это без ручной разметки, силами ИИ-агентов за пять итераций проверки.

ИИ-агенты за 5 итераций превращают видео в физическую симуляцию: модель на 9B обошла Gemini
Почему это важно

Впервые модель с 9 миллиардами параметров и открытой лицензией обошла Gemini 3.1 Flash на бенчмарке физического понимания видео QuantiPhy, а готовые чекпойнты и код уже лежат на GitHub под Apache 2.0.

Видеомодели научились генерировать правдоподобные кадры, но ни одна из них не понимает, почему мяч отскакивает, а чашка не проваливается сквозь стол. MirroS предложила другой подход: вместо пикселей или описаний сцена записывается как исполняемый код, файл scene.json, который физический движок MuJoCo (открытый симулятор физики, широко используемый в робототехнике) может запустить и проверить. Об этом команда сообщила в техническом отчёте и на странице проекта на GitHub.

Что Когда Кто выпустил Цена
Code-as-World: парадигма превращения видео в исполняемые физические симуляции, две модели (4B и 9B параметров) Дата в источнике не указана MirroS Бесплатно, лицензия Apache 2.0

Как это работает: код вместо пикселей

Ключевая идея: пиксели видео это улики, а не сама физика. Code-as-World описывает сцену тройкой компонентов:

  • Состав. Объекты, их геометрия, размеры в метрах, масса, трение, гравитация. Пол и стены тоже физические объекты, они поддерживают и сталкиваются.
  • Эволюция. Начальные состояния, силы, контакты, столкновения, длительность. Запуск этого блока разворачивает состав в полную траекторию движения.
  • Внешний вид. Камера, освещение, материалы, фон, частота кадров. Изменение внешнего вида не меняет физику.

Вся тройка компилируется в scene.json и исполняется в MuJoCo двумя способами: через анимационный движок (кинематические позы) и через физический движок (силы и контакты).

Пять раундов: ИИ-агенты сами восстанавливают сцену

Восстановить физику из видео это обратная задача, и Code-as-World решает её через агентный цикл (когда ИИ-агенты самостоятельно повторяют шаги без участия человека). Цикл состоит из пяти этапов: предложить гипотезу, создать сцену, запустить симуляцию, отрендерить результат, сравнить с оригиналом.

Для обработки входного видео используются три инструмента: SAM 3 выделяет маски объектов и треки на плоскости изображения, VGGT-Omega оценивает глубину и геометрию камеры, SAM 3D генерирует трёхмерные модели каждого объекта.

Кандидатные ролики проецируются обратно в ракурс исходного видео и сравниваются по ключевым кадрам: RGB, глубина, маски и траектории. Расхождения собираются в структурированную обратную связь, которая направляет следующую попытку. Если за пять раундов совпадение не достигнуто, гипотеза отклоняется. Это принципиально отличается от одноразового предсказания: при одинаковом вычислительном бюджете цикл из пяти раундов превосходит пять независимых попыток по всем метрикам.

Цифры: модель с 9B параметрами обходит Gemini

На бенчмарке QuantiPhy-validation (159 задач, усреднённых по категориям 2S, 2D, 3S, 3D) результаты по метрике MRA таковы:

  • Code-as-World-VL-9B: 55.4
  • Gemini 3.1 Flash: 54.8
  • Code-as-World-VL-4B: 50.6
  • ChatGPT 5.1: 48.4
  • Qwen3-VL-32B-Instruct (лучший открытый базовый уровень): 40.2

Модель 9B обучалась на восьми GPU NVIDIA H100. Обучение шло в два этапа: сначала дообучение (обучение модели на конкретных примерах под узкую задачу) на 73 335 парах «вопрос-ответ» по пространственным характеристикам объектов, затем оптимизация методом GRPO на данных из 1 585 текстовых и 988 видеоуправляемых исполняемых миров. Примечательно, что добавление данных из мирового пространства подняло результат 9B-модели с 50.9 до 55.4.

Как попробовать?

  1. Перейдите в репозиторий MirroS на GitHub (ссылка указана на странице проекта) и клонируйте код.
  2. Скачайте один из двух чекпойнтов: Code-as-World-VL-4B (на базе Qwen3.5-4B, подходит для менее мощных машин) или Code-as-World-VL-9B (на базе Qwen3.5-9B, точнее, но требует больше памяти). Оба в формате BF16 safetensors.
  3. Запустите модель через vLLM (движок для быстрого инференса, то есть запуска модели для получения ответов) с параметром --max-model-len 4608, и она будет доступна через стандартный API-эндпоинт /v1, совместимый с OpenAI.

Что делать с этим прямо сейчас?

Авторам Дзена и контент-мейкерам. Инструмент пока исследовательский, но демонстрации «видео в симуляцию» уже дают материал для наглядных постов. Покажите, как ИИ-агенты разбирают физику бытового ролика, и это соберёт внимание аудитории.

Разработчикам и исследователям в РФ. Главная ценность: открытые чекпойнты под Apache 2.0 и совместимость с vLLM. Подход «код как мир» (Code-as-World) позволяет интегрировать модель в собственные проекты анализа видео без зависимости от закрытых API. Можно сразу развернуть локально.

Предпринимателям. Прямых российских аналогов, которые превращают видео в физическую симуляцию исполняемым кодом, на момент публикации нет. Ближайшее по духу: инструменты на базе YandexGPT и GigaChat работают с текстом и изображениями, но не с физическим моделированием сцен. Если ваш бизнес связан с робототехникой, компьютерным зрением или обучающим контентом, Code-as-World стоит изучить как источник синтетических данных с точными физическими метками.

Мнение редакции dzen.guru

Меня лично зацепил не столько результат на бенчмарке (разница с Gemini 3.1 Flash всего 0.6 пункта MRA), сколько сам подход. Модель не пытается «понять» физику абстрактно, а буквально пишет код симуляции и проверяет его против реального видео. Это красиво, и это открыто.

Но оговорка из источника честная: пока работает только с твёрдыми телами. Жидкости, ткани, деформируемые объекты за пределами возможностей. И модель не учится проводить сам цикл поиска, его архитектура задана заранее. Для продакшен-задач это пока исследовательский прототип, а не готовый продукт. Но для тех, кто строит пайплайны анализа видео или генерации обучающих данных для роботов, два бесплатных чекпойнта на Apache 2.0 это подарок, который стоит забрать сегодня.

Частые вопросы

Нужны ли мощные GPU для запуска?

4B-модель можно запустить на одной потребительской видеокарте с достаточным объёмом видеопамяти. Модель 9B потребует больше ресурсов. Обе модели работают через vLLM, что упрощает развёртывание, но конкретные минимальные требования к оборудованию источник не указывает.

Можно ли редактировать полученную симуляцию?

Да, это одно из главных преимуществ. Результат работы модели это файл scene.json, обычный текстовый файл. Вы можете изменить массу объекта, добавить стену, поменять гравитацию и запустить симуляцию заново в MuJoCo.

Подходит ли инструмент для любого видео?

Нет. Модель работает только с твёрдыми телами. Если в кадре вода, огонь, ткань или другие деформируемые объекты, текущая версия их корректно не обработает. Кандидатные видео для обучения отбирались из набора WISA-80K с фильтрацией по наличию движения.

Если вы работаете с видеоаналитикой или синтетическими данными, два чекпойнта под свободной лицензией уже ждут на GitHub, и для старта достаточно трёх команд в терминале.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Судебные иски к Anthropic на миллиарды: Sony и Warner требуют по $150 000 за каждую песню
ai

Судебные иски к Anthropic на миллиарды: Sony и Warner требуют по $150 000 за каждую песню

Музыкальные гиганты Sony Music и Warner Chappell подали коллективный иск к Anthropic, создателю ИИ-модели Claude, обвинив компанию и лично её сооснователей в…

5 мин
Нейросети дают прогноз погоды за минуты: гайд по расчёту ветровой мощности в Google Colab
ai

Нейросети дают прогноз погоды за минуты: гайд по расчёту ветровой мощности в Google Colab

Прогноз ветровой мощности с помощью нейросети стал доступен в бесплатной среде Google Colab, и этот гайд покажет, как собрать ансамблевый прогноз погоды,…

7 мин
Экс-партнёр a16z ушёл из фонда на $4 млрд: инвестиции в ИИ для биотеха меняют формат
ai

Экс-партнёр a16z ушёл из фонда на $4 млрд: инвестиции в ИИ для биотеха меняют формат

Медицинский ИИ остаётся одним из самых капиталоёмких направлений, и инвестиции в ИИ здесь устроены иначе, чем в текстовых моделях: Виджай Панде, бывший…

5 мин