Игорь Градов
Игорь Градов
6 мин
ai

Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов

Команда MiLM Plus из Xiaomi выпустила PROVE, набор метрик для оценки качества удаления объектов из видео без эталонного кадра, и статью приняли на конференцию ACM MM 2026, что делает инструмент первым рецензированным решением проблемы, которая тормозила всю индустрию видеоредактирования.

Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов
Почему это важно

Существующие метрики качества (PSNR, SSIM, LPIPS) оценивают удаление объектов с видео, сравнивая результат с «правильным» кадром. Но «правильного» кадра не существует: задача допускает много решений. PROVE оценивает результат без эталона, и делает это в 13,7 раза дешевле ближайшего конкурента.

До сих пор команды, которые разрабатывают модели удаления объектов с видео, попадали в ловушку. Метрики, по которым они оценивали качество, награждали за размытие и копипаст вместо реалистичной реконструкции. Исследователи Xiaomi задокументировали три конкретных сбоя: полнореференсные метрики (те, что сравнивают с эталоном) не замечают остаточные тени, безреференсные (ReMOVE, CFD) дают лучшие оценки размытым кадрам, а временные метрики не реагируют на подброшенные искажения, потому что анализируют весь кадр, а не отредактированную область. Источник: препринт PROVE, принятый на ACM Multimedia 2026.

Что Когда Кто выпустил Цена
PROVE: метрики RC-S и RC-T плюс бенчмарк PROVE-Bench Статья принята на ACM MM 2026, код и датасет уже открыты MiLM Plus, Xiaomi Inc. Бесплатно, лицензия Apache 2.0

Что умеют RC-S и RC-T?

  • RC-S (пространственная согласованность) разбивает маску (область, откуда удалён объект) на отдельные фрагменты, расширяет каждый на треть, прогоняет через DINOv2 (модель компьютерного зрения от Meta, которая «видит» структуру изображения) и скользящим окном сравнивает статистику отредактированных пикселей с окружающим фоном. Метод называется MMD (Maximum Mean Discrepancy, мера расхождения двух распределений).
  • RC-T (временная согласованность) берёт соседние кадры, обрезает их по объединённой маске и считает MMD только внутри пересечения, то есть той области, которая восстановлена в обоих кадрах. Без этой обрезки метрика слепнет к искажениям.
  • Ни одна из метрик не требует эталонного видео. Это главное отличие от PSNR, SSIM и LPIPS.
  • Скорость: RC-S обрабатывает один кадр за 134,6 мс на одной видеокарте RTX 4090. По данным авторов, это в 13,7 раза быстрее, чем CFD.

Насколько точнее человеческой оценки?

Авторы собрали ранжирование от 20 участников и агрегировали его методом Борда. RC-S показала среднее значение коэффициента Кендалла τ (мера совпадения рангов с человеческой оценкой) 0,59 и коэффициента Спирмена ρ 0,66. Для сравнения: ReMOVE набрала 0,26 / 0,29, а CFD только 0,16 / 0,18.

На валидационном наборе RORD-Val RC-S в 100% случаев предпочитает чистое изображение размытому или с подменой региона. ReMOVE справляется с этим в 60% случаев, CFD в 49%.

PROVE-Bench: 180 реальных видео для тестов

Бенчмарк (набор тестовых данных для сравнения моделей) состоит из двух частей:

  • PROVE-M: 80 парных видео, снятых со штатива. Каждая пара: исходное видео и кадры без объекта, снятые в течение двух минут. Маски размечены покадрово через SAM3, прошли три стадии контроля качества. Разрешение 1080p, по 81 кадру на клип.
  • PROVE-H: 100 сложных видео без эталона. Толпы, текущая вода, огонь, текстурированные поверхности, отражения в лужах, быстрое движение. Маски намеренно оставлены грубыми.

На публичной таблице лидеров модель SVOR (1,3 млрд параметров) лидирует по RC-S с результатом 0,5197, а EffectErase лидирует по RC-T с результатом 0,2525.

Как попробовать?

  1. Клонируйте репозиторий PROVE с GitHub (лицензия Apache 2.0). Потребуется Python 3.10+, PyTorch 2.6+, библиотека Transformers 4.51+ и веса DINOv2-giant.
  2. Подготовьте маски: белые пиксели обозначают область удалённого объекта.
  3. Запустите скрипт run_prove_metrics.py из командной строки. Одна видеокарта уровня RTX 4090 и выше достаточна для работы.
  4. Датасет PROVE-Bench доступен на Hugging Face для воспроизведения результатов.

Есть ли аналоги в России?

Прямого российского аналога PROVE на момент публикации нет. Метрики удаления объектов с видео остаются нишевым инструментом для исследователей компьютерного зрения, и ни YandexGPT, ни GigaChat не решают эту задачу: они работают с текстом. Из инструментов обработки видео в РФ доступны коммерческие решения (Movavi, например), но они не публикуют собственных метрик качества удаления. PROVE под открытой лицензией, поэтому российские команды могут интегрировать RC-S и RC-T в свои пайплайны без юридических ограничений.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена и видеоблогеру. Если вы удаляете объекты из видео (водяные знаки, случайных прохожих, лишние предметы), PROVE пока не кнопка в приложении. Но модели, которые побеждают на PROVE-Bench, через полгода-год окажутся в ваших редакторах. Следите за таблицей лидеров.

Разработчику и стартапу в видеообработке. RC-S и RC-T можно встроить в CI-пайплайн (автоматическую проверку качества при каждом обновлении модели) уже сейчас. Скорость 134,6 мс на кадр позволяет запускать ночные тесты даже на одной видеокарте. Не нужно собирать парные эталонные видео.

Маркетологу и продакт-менеджеру. Если вы выбираете между несколькими сервисами удаления объектов из видео, PROVE даёт объективный способ сравнить их без экспертной панели. Прогоните результаты через RC-S и получите число вместо субъективного «вроде нормально».

Мнение редакции dzen.guru

Xiaomi сделала редкую для корпорации вещь: не запатентовала метрику, а выложила под Apache 2.0 с датасетом. Для небольших команд в России, которые строят продукты вокруг обработки видео, это подарок: раньше для оценки качества нужно было либо собирать парные видео вручную (дорого), либо верить метрикам, которые, как теперь доказано, награждают за размытие.

По моим наблюдениям, удаление объектов с видео становится базовой функцией в мобильных редакторах, и через год-два RC-S может стать стандартом оценки, как BLEU когда-то стал стандартом для машинного перевода. Но пока инструмент рассчитан на инженеров: командная строка, Python, видеокарта. Если вы автор без технического бэкграунда, ваш шаг сегодня: запомнить аббревиатуру PROVE и проверять, использует ли её сервис, которому вы платите за обработку видео.

Честная оговорка: метрики не работают в реальном времени на устройстве и не оценивают побочные эффекты за пределами маски (большие тени, отражения, выходящие за область кадрирования).

Частые вопросы

PROVE заменяет PSNR и SSIM?

Нет, но закрывает их слепую зону. PSNR и SSIM требуют эталонного кадра и, по данным авторов PROVE, награждают за регрессию к среднему: сокращение шагов диффузии улучшает эти метрики, хотя визуальное качество падает. RC-S и RC-T работают без эталона и коррелируют с человеческой оценкой втрое лучше.

Можно ли запустить без мощной видеокарты?

Формально код работает на любом GPU с поддержкой PyTorch 2.6+, но авторы замеряли скорость на RTX 4090. На более слабых картах время обработки вырастет пропорционально. Для разовой проверки нескольких клипов подойдёт и карта уровня RTX 3060, но для регулярного CI-тестирования стоит заложить ресурсы помощнее.

Подходит ли PROVE для оценки удаления объектов с фотографий, а не видео?

RC-S оценивает пространственную согласованность одного кадра, поэтому формально применим к статичным изображениям. RC-T (временная согласованность) работает только с видео, где есть последовательность кадров. Авторы тестировали оба варианта на видеоданных, результаты для фото отдельно не публиковались.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса
ai

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса

Брэд Лайткэп, один из старейших руководителей OpenAI, объявил об уходе из компании, чтобы запустить собственный проект, и стал уже не первым топ-менеджером,…

4 мин
Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки
ai

Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки

Google запустила в Google TV Freeplay бесплатную библиотеку из более чем 10 000 фильмов и шоу по запросу, а число бесплатных телеканалов в сервисе выросло до…

3 мин
Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code
ai

Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code

Grok Build выходит в опенсорс на Rust, а под капотом скрывается модель, которую xAI тихо обкатывает на живой арене и тренирует на триллионах токенов реальной…

6 мин