Игорь Градов
Игорь Градов
4 мин
aggregator

Runway, генератор видео за $5,3 млрд, строит виртуальные миры по текстовым промптам в реальном времени

Runway научила модель строить виртуальные миры по текстовым командам в реальном времени, и 24 мая выложила исследовательский превью GWM Worlds 2 с новым форматом управления WorldPrompt, который позволяет задавать персонажей, камеру и физику сцены одним промптом.

Runway, генератор видео за $5,3 млрд, строит виртуальные миры по текстовым промптам в реальном времени
Почему это важно

Впервые генеративная видеомодель работает не как рендер готового ролика, а как интерактивная среда: вы описываете мир текстом и взаимодействуете с ним в реальном времени, получая потоковое видео 720p и синхронный звук.

Runway, генератор видео и один из лидеров в области генеративных мультимодальных (работающих сразу с видео, аудио и текстом) моделей, опубликовала исследовательский превью GWM Worlds 2. Издание Latent Space взяло эксклюзивные интервью у технического директора компании Камиля Синди, ведущего исследователя Робин Кало и сооснователя Анастасиса Германидиса. Ниже разбираем, что именно показали и насколько это близко к практике.

Показатель Значение Источник
Оценка Runway 5,3 млрд долларов Latent Space со ссылкой на последний раунд
Последний раунд 315 млн долларов, февраль 2025 Latent Space
Разрешение потокового видео 720p, 24 кадра в секунду Runway, GWM Worlds 2
Частота аудио 48 000 Гц Runway, GWM Worlds 2
Первый релиз GWM Worlds декабрь 2024 Latent Space

Что именно исследовали?

Runway проверяла, можно ли превратить генеративную видеомодель из инструмента, который выдаёт готовый ролик, в интерактивную среду реального времени. Проблема в том, что обычная модель генерирует весь клип целиком, а для «виртуального мира» нужно выдавать кадр за кадром, мгновенно реагируя на действия пользователя.

Ключевая новинка называется WorldPrompt. Это не язык программирования, а формат промпта: вы фиксируете начальный кадр, описываете правила среды и затем отправляете события с метками времени. Можно сравнить с режиссёрской раскадровкой, которую модель «оживляет» на лету.

В отличие от Minecraft или Roblox, здесь нет скриптов и управления состоянием. Но есть другое преимущество: мир создаётся целиком из текста, без заранее нарисованных ассетов.

Что обнаружили?

  • Генерация кадр за кадром работает. Модель перешла от «двунаправленной диффузии» (генерация всего ролика сразу) к авторегрессивному режиму (каждый следующий кадр строится на предыдущем). По словам Германидиса, это позволяет выдавать «один кадр или несколько кадров за раз».

  • Скорость достигается дистилляцией. Runway применяет два подхода: сжатие большой модели в меньшую и сокращение шагов диффузии. Германидис привёл пример: модель может перейти с примерно 50 шагов шумоподавления до четырёх, с некоторой потерей качества, но сопоставимым результатом.

  • Движение отрабатывается надёжно, сложные действия пока нет. Кало прямо сказала: «Это исследовательский превью, он не идеален. Зависит от сложности действия. Движение работает довольно надёжно».

  • Главная нерешённая проблема: накопление ошибок. Когда сгенерированные кадры подаются обратно в модель для генерации следующих, мелкие неточности нарастают. Германидис назвал это «самой большой проблемой авторегрессивных моделей».

  • Долговременная память отсутствует. Кало подтвердила: «У модели нет идеальной памяти. Это по-прежнему открытая исследовательская задача». Также есть ограничения по длительности сессии: Google отмечает, что их аналог Genie 3 поддерживает «несколько минут непрерывного взаимодействия, а не часы».

Как это читать

GWM Worlds 2 остаётся исследовательским превью, а не коммерческим продуктом. Разработчики сами подчёркивают, что физика сцены, причинно-следственные связи и память работают с ограничениями. Сравнение с игровыми движками вроде Minecraft или Roblox некорректно: те управляют состоянием через скрипты, а Runway генерирует каждый кадр нейросетью. Конкуренты (Google DeepMind Genie 3, Odyssey-2 Pro, World Labs RTFM) находятся на схожей стадии и тоже имеют ограничения по длительности сессий.

Что это значит для вас?

Авторам Дзена и создателям контента. WorldPrompt открывает путь к созданию интерактивных виртуальных миров через текстовые команды в реальном времени. Пока это лаборатория, не инструмент продакшена. Но если вы работаете с видео, стоит разобраться в логике WorldPrompt уже сейчас: формат промпта с метками времени может стать стандартом для Runway как генератора видео нового поколения.

Разработчикам игр и прототипов. Возможность описать сцену текстом и получить интерактивное видео за секунды вместо недель моделирования меняет экономику прототипирования. Ограничения по памяти и накоплению ошибок пока делают это непригодным для финальных продуктов, но для быстрой проверки идеи уже полезно.

Маркетологам и предпринимателям в РФ. Runway недоступна из России напрямую. Из российских инструментов генерации видео по тексту можно назвать Kandinsky от Сбера, но интерактивных виртуальных миров он не создаёт. Следите за тем, появится ли API GWM Worlds 2 для сторонних разработчиков: Синди описывает создание миров «по запросу» как уже работающую возможность, а не «далёкую гипотезу».

Мнение редакции dzen.guru

Runway целенаправленно движется от «генератор видео по промпту» к «рантайм для виртуальных миров». Это принципиально другая ставка: не ролик на выходе, а среда, в которой можно находиться. Пока разрыв между демо и рабочим инструментом велик: ошибки копятся, памяти нет, сессия длится минуты. Но сам факт, что потоковое 720p-видео генерируется в реальном времени по текстовому промпту, показывает, куда пойдёт индустрия в ближайшие год-два. Я бы рекомендовал не ждать финального продукта, а уже пробовать формат WorldPrompt на доступных превью: те, кто научится «режиссировать промптом», получат преимущество, когда технология дозреет.

Самый практичный вывод: генеративное видео перестаёт быть односторонним, и те, кто сейчас разберётся в логике управления сценой через промпт, окажутся на шаг впереди, когда Runway или её конкуренты выпустят коммерческую версию.

По данным Latent Space

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

От Discord-бота до 10 трлн токенов в сутки: как OpenRouter AI стала инфраструктурой для ИИ
aggregator

От Discord-бота до 10 трлн токенов в сутки: как OpenRouter AI стала инфраструктурой для ИИ

OpenRouter AI выросла из Discord-бота до 10 триллионов токенов в сутки, и эта история ставит вопрос: могут ли «обёртки» над чужими моделями стать настоящей…

5 мин
Meta Muse получил физический брелок и очки: PayPal и Shopify уже на борту
aggregator

Meta Muse получил физический брелок и очки: PayPal и Shopify уже на борту

Meta Connect 2026 превратился в презентацию Muse: компания показала носимый гаджет Charm, интеграцию ИИ-агента с очками и партнёрства с PayPal и Shopify, а…

5 мин
aggregator

Латентное пространство нейросети: как сравнить модели за 20 минут без формул

Публикация начинается с того, что латентное пространство нейросети звучит как термин из учебника по линейной алгебре, но на практике именно оно определяет,…

7 мин