Игорь Градов
Игорь Градов
6 мин
ai

Google открыла код нейросети для генерации видео: 10 минут без дрейфа персонажей

Google Research представила набор из четырёх агентных систем, которые превращают короткие ролики в связные многоминутные фильмы, решая две главные проблемы нейросетей для генерации видео: дрейф персонажей между кадрами и лавинное накопление ошибок.

Почему это важно

Впервые опубликован полный конвейер, который удерживает внешность героев, реквизит и декорации на протяжении десятиминутного ролика без ручных правок, а код двух из четырёх систем уже открыт на GitHub.

До сих пор нейросети для генерации видео справлялись с отдельными клипами на несколько секунд, но при склейке в длинный сюжет персонажи меняли одежду, предметы исчезали, а одна неудачная сцена портила всё, что идёт после неё. Google Research в публикации от 27 сентября 2026 года описала оркестрационный слой поверх моделей Gemini и Veo, который автоматически планирует, генерирует и исправляет многоплановое видео. Код двух систем (Co-Director и A²RD) выложен на GitHub, код CANVAS пока ожидается, а готового продукта Google из этого не делала.

Показатель Значение Источник
Число агентных систем в наборе 4 Страница проекта Google Research
Оценка Co-Director на GenAD-Bench 81,4 из 100 (базовая линия 75,7) Страница проекта
Человеческая оценка Co-Director 3,96 из 5 Страница проекта
Прирост CANVAS по фонам 21,6% Публикация CANVAS (EMNLP 2026)
Прирост CANVAS по персонажам 9,6% Публикация CANVAS (EMNLP 2026)
Прирост CANVAS по реквизиту 7,6% Публикация CANVAS (EMNLP 2026)
Прирост A²RD по согласованности до 30% Публикация A²RD
Прирост A²RD по нарративной связности до 20% Публикация A²RD
Прирост VQQA на T2V-CompBench 11,57% Публикация VQQA
Прирост VQQA на VBench2 8,43% Публикация VQQA
Длительность демо-фильма A²RD 10 минут Страница проекта
Сценариев в GenAD-Bench 400 (200 вымышленных продуктов, 50 брендов) Страница проекта

Что именно измеряли?

Google сформулировала задачу так: длинное видео из нескольких сцен это не цепочка независимых клипов, а задача глобальной оптимизации. Если в финальном ролике герой потерял шляпу, непонятно, какой именно промпт (текстовое описание для нейросети) виноват. Исследователи называют это «проблемой присвоения заслуг» (credit assignment), по аналогии с поиском слабого звена в длинной цепи.

Для проверки команда собрала три новых бенчмарка (набора тестовых задач):

  • GenAD-Bench: 400 рекламных сценариев для 200 вымышленных продуктов от 50 брендов. Проверяет, может ли система выдержать фирменный стиль на протяжении ролика.
  • HardContinuityBench: сцены, где камера возвращается к ранее показанному месту, а реквизит должен остаться в том же состоянии.
  • LVBench-C: 120 сценариев, где ключевые объекты исчезают минимум на 10 сегментов и потом появляются снова. Самый жёсткий тест на «память» системы.

Видео оценивали и автоматически (мультимодальная языковая модель в роли судьи), и вручную (оценки людей по пятибалльной шкале).

Четыре системы и что каждая делает?

Все четыре работают как надстройка поверх генеративных моделей. Сами модели можно менять: сейчас используются Gemini и Veo, но архитектура не привязана к ним. Готовое видео автоматически получает водяной знак SynthID (цифровая метка Google, невидимая глазу).

  • Co-Director (принята на конференцию COLM 2026): агент-оркестратор (дирижёр) выбирает стратегию, стиль и структуру ролика, подбирая комбинацию параметров методом «многорукого бандита» (MAB, алгоритм, который пробует разные варианты и учится на оценках, как игрок перед рядом автоматов). Отдельные подагенты отвечают за раскадровку, ключевые кадры, видео и звук. Судья-модель выставляет балл и передаёт обратную связь.

  • CANVAS (принята на EMNLP 2026): система визуальной памяти. Хранит «якоря», внешний вид персонажей, объектов и локаций, и подтягивает их, когда сцена возвращается к знакомому месту. В тесте с «музейным ограблением» конкурирующий AutoStudio потерял кепку вора, а Gemini 3.1 Pro поменял цвет драгоценного камня. CANVAS сохранила оба элемента.

  • A²RD (Agentic Autoregressive Diffusion, агентная авторегрессивная диффузия): не требует дообучения (fine-tuning, дополнительного обучения модели на ваших примерах). Каждый сегмент видео проходит цикл «найти, синтезировать, улучшить, обновить» с опорой на мультимодальную видеопамять. Система сама переключается между генерацией нового и воспроизведением уже знакомого. Именно ей создан десятиминутный демо-фильм.

  • VQQA (Video Quality Question Answering): замкнутый цикл улучшения промптов. Система сама генерирует вопросы к каждому кадру («на месте ли шляпа?»), получает ответы от модели-критика и переписывает текстовое описание. Не требует доступа к внутренностям генератора. Финальный шаг: из всех итераций выбирается лучший ролик, а не просто последний.

Что обнаружили?

  • Co-Director набрала 81,4 балла из 100 на GenAD-Bench. Базовая линия (случайный перебор) дала 75,7. Среди конкурентов в сравнении были Veo 3.1, Kling 3.0 Omni, Wan 2.6 и MovieAgent. Человеческая оценка: 3,96 из 5.
  • CANVAS повысила согласованность фонов на 21,6%, персонажей на 9,6%, реквизита на 7,6% относительно предыдущих подходов.
  • A²RD улучшила визуальную согласованность до 30%, а нарративную связность до 20% на роликах от 1 до 10 минут.
  • VQQA дала абсолютный прирост 11,57% на бенчмарке T2V-CompBench и 8,43% на VBench2 по сравнению с генерацией без цикла правок.
Как это читать

Все цифры получены на собственных бенчмарках Google, независимые исследовательские группы их пока не воспроизводили. Код CANVAS ещё не опубликован, полный конвейер не оформлен в продукт, нейросеть для генерации видео бесплатно пока доступна только частично (два репозитория из четырёх). Десятиминутный ролик A²RD это демо, а не пользовательский сервис: повторить результат на своём оборудовании без инфраструктуры Google может быть затруднительно.

Что делать с этим прямо сейчас?

Авторам Дзена и видеоблогерам. Если вы экспериментируете с генерацией видео для каналов, обратите внимание на открытый код Co-Director и A²RD на GitHub. Даже без полного конвейера идея «визуальной памяти» и автоматического контроля реквизита подсказывает, как структурировать промпты для Gemini уже сейчас: описывайте внешность персонажей и ключевые предметы в каждом сегменте, а не только в первом.

Маркетологам и продюсерам. GenAD-Bench заточен под рекламные сценарии. Когда конвейер станет доступным сервисом, рекламные ролики из текстового описания перестанут быть фантастикой для малых бюджетов. Пока этого нет, ценность исследования в том, что оно показывает: проблема «актёр поменял костюм между дублями» для ИИ-видео уже решается программно.

Предпринимателям из РФ и СНГ. Gemini и Veo доступны через API с ограничениями по региону. Из российских аналогов для генерации видео по тексту работают Kandinsky Video от «Сбера» и инструменты «Яндекса», но подобного агентного слоя для длинных роликов у них пока нет. Следите за выходом кода CANVAS: он описан как модельно-независимый, то есть потенциально может работать поверх локальных генераторов.

Мнение редакции dzen.guru

Я вижу здесь не столько прорыв в качестве одного клипа, сколько смену подхода: Google перестала улучшать отдельные кадры и занялась режиссурой. Метод «многорукого бандита» для выбора стиля ролика, автоматический судья, цикл переписывания промптов: всё это переносит на машину работу, которую сейчас вручную делает оператор с десятком вкладок. Для нас, авторов контента, главный вывод: через год-два нейросеть для генерации видео бесплатно или за копейки сможет выдавать связные сюжеты на несколько минут. Готовиться стоит уже сейчас, разбираясь в логике раскадровки и сценарных структурах, потому что именно эти навыки будут отличать хороший результат от каши.

Код Co-Director и A²RD уже открыт, CANVAS на подходе, а полноценного продукта пока нет. Самое практичное, что можно сделать сегодня: скачать репозитории, попробовать конвейер на коротких роликах и начать собирать библиотеку «визуальных якорей» для своих персонажей, потому что именно умение зафиксировать образ героя в промпте станет ключевым навыком, когда длинная генерация дойдёт до массовых сервисов.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Stable Diffusion нейросеть: как проверить системные требования до скачивания модели
ai

Stable Diffusion нейросеть: как проверить системные требования до скачивания модели

Прежде чем скачивать модель Stable Diffusion весом в несколько гигабайт, полезно за пару минут выяснить, потянет ли ваш компьютер генерацию картинок с…

6 мин
ai

Что такое ИИ-агент без генерации текста: модель Jev решает в 444 раза дешевле GPT

Компания TypeSafe AI, основанная бывшим исследователем OpenAI Диого Алмейдой, выпустила модель Jev, которая не генерирует текст, а возвращает типизированные…

6 мин
Оптимизация моделей ИИ на старом железе: с 9 до 40 токенов в секунду без облака
ai

Оптимизация моделей ИИ на старом железе: с 9 до 40 токенов в секунду без облака

Запустить 27-миллиардную языковую модель на домашнем компьютере с двумя бюджетными видеокартами и получить скорость, пригодную для ежедневной работы, можно без…

7 мин