Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов
Команда MiLM Plus из Xiaomi выпустила PROVE, набор метрик для оценки качества удаления объектов из видео без эталонного кадра, и статью приняли на конференцию ACM MM 2026, что делает инструмент первым рецензированным решением проблемы, которая тормозила всю индустрию видеоредактирования.

Существующие метрики качества (PSNR, SSIM, LPIPS) оценивают удаление объектов с видео, сравнивая результат с «правильным» кадром. Но «правильного» кадра не существует: задача допускает много решений. PROVE оценивает результат без эталона, и делает это в 13,7 раза дешевле ближайшего конкурента.
До сих пор команды, которые разрабатывают модели удаления объектов с видео, попадали в ловушку. Метрики, по которым они оценивали качество, награждали за размытие и копипаст вместо реалистичной реконструкции. Исследователи Xiaomi задокументировали три конкретных сбоя: полнореференсные метрики (те, что сравнивают с эталоном) не замечают остаточные тени, безреференсные (ReMOVE, CFD) дают лучшие оценки размытым кадрам, а временные метрики не реагируют на подброшенные искажения, потому что анализируют весь кадр, а не отредактированную область. Источник: препринт PROVE, принятый на ACM Multimedia 2026.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| PROVE: метрики RC-S и RC-T плюс бенчмарк PROVE-Bench | Статья принята на ACM MM 2026, код и датасет уже открыты | MiLM Plus, Xiaomi Inc. | Бесплатно, лицензия Apache 2.0 |
Что умеют RC-S и RC-T?
- RC-S (пространственная согласованность) разбивает маску (область, откуда удалён объект) на отдельные фрагменты, расширяет каждый на треть, прогоняет через DINOv2 (модель компьютерного зрения от Meta, которая «видит» структуру изображения) и скользящим окном сравнивает статистику отредактированных пикселей с окружающим фоном. Метод называется MMD (Maximum Mean Discrepancy, мера расхождения двух распределений).
- RC-T (временная согласованность) берёт соседние кадры, обрезает их по объединённой маске и считает MMD только внутри пересечения, то есть той области, которая восстановлена в обоих кадрах. Без этой обрезки метрика слепнет к искажениям.
- Ни одна из метрик не требует эталонного видео. Это главное отличие от PSNR, SSIM и LPIPS.
- Скорость: RC-S обрабатывает один кадр за 134,6 мс на одной видеокарте RTX 4090. По данным авторов, это в 13,7 раза быстрее, чем CFD.
Насколько точнее человеческой оценки?
Авторы собрали ранжирование от 20 участников и агрегировали его методом Борда. RC-S показала среднее значение коэффициента Кендалла τ (мера совпадения рангов с человеческой оценкой) 0,59 и коэффициента Спирмена ρ 0,66. Для сравнения: ReMOVE набрала 0,26 / 0,29, а CFD только 0,16 / 0,18.
На валидационном наборе RORD-Val RC-S в 100% случаев предпочитает чистое изображение размытому или с подменой региона. ReMOVE справляется с этим в 60% случаев, CFD в 49%.
PROVE-Bench: 180 реальных видео для тестов
Бенчмарк (набор тестовых данных для сравнения моделей) состоит из двух частей:
- PROVE-M: 80 парных видео, снятых со штатива. Каждая пара: исходное видео и кадры без объекта, снятые в течение двух минут. Маски размечены покадрово через SAM3, прошли три стадии контроля качества. Разрешение 1080p, по 81 кадру на клип.
- PROVE-H: 100 сложных видео без эталона. Толпы, текущая вода, огонь, текстурированные поверхности, отражения в лужах, быстрое движение. Маски намеренно оставлены грубыми.
На публичной таблице лидеров модель SVOR (1,3 млрд параметров) лидирует по RC-S с результатом 0,5197, а EffectErase лидирует по RC-T с результатом 0,2525.
Как попробовать?
- Клонируйте репозиторий PROVE с GitHub (лицензия Apache 2.0). Потребуется Python 3.10+, PyTorch 2.6+, библиотека Transformers 4.51+ и веса DINOv2-giant.
- Подготовьте маски: белые пиксели обозначают область удалённого объекта.
- Запустите скрипт
run_prove_metrics.pyиз командной строки. Одна видеокарта уровня RTX 4090 и выше достаточна для работы. - Датасет PROVE-Bench доступен на Hugging Face для воспроизведения результатов.
Есть ли аналоги в России?
Прямого российского аналога PROVE на момент публикации нет. Метрики удаления объектов с видео остаются нишевым инструментом для исследователей компьютерного зрения, и ни YandexGPT, ни GigaChat не решают эту задачу: они работают с текстом. Из инструментов обработки видео в РФ доступны коммерческие решения (Movavi, например), но они не публикуют собственных метрик качества удаления. PROVE под открытой лицензией, поэтому российские команды могут интегрировать RC-S и RC-T в свои пайплайны без юридических ограничений.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена и видеоблогеру. Если вы удаляете объекты из видео (водяные знаки, случайных прохожих, лишние предметы), PROVE пока не кнопка в приложении. Но модели, которые побеждают на PROVE-Bench, через полгода-год окажутся в ваших редакторах. Следите за таблицей лидеров.
Разработчику и стартапу в видеообработке. RC-S и RC-T можно встроить в CI-пайплайн (автоматическую проверку качества при каждом обновлении модели) уже сейчас. Скорость 134,6 мс на кадр позволяет запускать ночные тесты даже на одной видеокарте. Не нужно собирать парные эталонные видео.
Маркетологу и продакт-менеджеру. Если вы выбираете между несколькими сервисами удаления объектов из видео, PROVE даёт объективный способ сравнить их без экспертной панели. Прогоните результаты через RC-S и получите число вместо субъективного «вроде нормально».
Xiaomi сделала редкую для корпорации вещь: не запатентовала метрику, а выложила под Apache 2.0 с датасетом. Для небольших команд в России, которые строят продукты вокруг обработки видео, это подарок: раньше для оценки качества нужно было либо собирать парные видео вручную (дорого), либо верить метрикам, которые, как теперь доказано, награждают за размытие.
По моим наблюдениям, удаление объектов с видео становится базовой функцией в мобильных редакторах, и через год-два RC-S может стать стандартом оценки, как BLEU когда-то стал стандартом для машинного перевода. Но пока инструмент рассчитан на инженеров: командная строка, Python, видеокарта. Если вы автор без технического бэкграунда, ваш шаг сегодня: запомнить аббревиатуру PROVE и проверять, использует ли её сервис, которому вы платите за обработку видео.
Честная оговорка: метрики не работают в реальном времени на устройстве и не оценивают побочные эффекты за пределами маски (большие тени, отражения, выходящие за область кадрирования).
Частые вопросы
PROVE заменяет PSNR и SSIM?
Нет, но закрывает их слепую зону. PSNR и SSIM требуют эталонного кадра и, по данным авторов PROVE, награждают за регрессию к среднему: сокращение шагов диффузии улучшает эти метрики, хотя визуальное качество падает. RC-S и RC-T работают без эталона и коррелируют с человеческой оценкой втрое лучше.
Можно ли запустить без мощной видеокарты?
Формально код работает на любом GPU с поддержкой PyTorch 2.6+, но авторы замеряли скорость на RTX 4090. На более слабых картах время обработки вырастет пропорционально. Для разовой проверки нескольких клипов подойдёт и карта уровня RTX 3060, но для регулярного CI-тестирования стоит заложить ресурсы помощнее.
Подходит ли PROVE для оценки удаления объектов с фотографий, а не видео?
RC-S оценивает пространственную согласованность одного кадра, поэтому формально применим к статичным изображениям. RC-T (временная согласованность) работает только с видео, где есть последовательность кадров. Авторы тестировали оба варианта на видеоданных, результаты для фото отдельно не публиковались.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса
Брэд Лайткэп, один из старейших руководителей OpenAI, объявил об уходе из компании, чтобы запустить собственный проект, и стал уже не первым топ-менеджером,…

Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки
Google запустила в Google TV Freeplay бесплатную библиотеку из более чем 10 000 фильмов и шоу по запросу, а число бесплатных телеканалов в сервисе выросло до…

Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code
Grok Build выходит в опенсорс на Rust, а под капотом скрывается модель, которую xAI тихо обкатывает на живой арене и тренирует на триллионах токенов реальной…
Комментарии