Игорь Градов
Игорь Градов
5 мин
ai

Ошибка оценки глубины растёт на 166%: бенчмарк для специалистов по компьютерному зрению дронов и нейросетям

Текст не содержит данных о финансовой сделке, раунде, инвестициях или оценке компании. Архетип «funding» не подтверждается источником. Перестраиваю структуру под фактический архетип: исследовательский релиз (launch/research). Пишу строго по источнику.

Ошибка оценки глубины растёт на 166%: бенчмарк для специалистов по компьютерному зрению дронов и нейросетям

Российская команда создала бенчмарк, на котором лучшие модели оценки глубины ошибаются вдвое чаще, стоит расширить угол камеры со 120 до 195 градусов, и это напрямую касается всех, кто работает с дронами, роботами и системами наблюдения.

Почему это важно

Fisheye-камеры (объективы «рыбий глаз» с обзором до 195 градусов) стоят на каждом втором складском роботе и дроне, но до сих пор не было открытого теста, который покажет, насколько сильно нейросети теряют точность именно из-за широкого угла. Теперь такой тест есть, и результаты неприятные для индустрии.

Разработчики WideDepth решили проблему, которая годами висела в воздухе у каждого специалиста по компьютерному зрению дронов и нейросетям. Существующие датасеты для оценки глубины собраны на обычных камерах с узким углом обзора, а fisheye-наборы либо синтетические, либо сняты только на улице, либо покрывают глубину лишь частично. Сравнивать модели при разных углах обзора было попросту не на чем.

WideDepth заполняет этот пробел: 101 реальная сцена в офисных помещениях, четыре угла обзора (120, 140, 165 и 195 градусов), набор стереобаз от 20 до 300 мм, горизонтальная и вертикальная ориентация камер. Эталонная глубина снята наземным лазерным сканером с заявленной точностью 1 мм на расстоянии 10 м.

Что именно показали эксперименты?

Главный результат: модели монокулярной оценки глубины (когда нейросеть получает одно изображение и предсказывает расстояние до каждой точки) крайне чувствительны к увеличению угла обзора.

  • Depth Anything V2 при переходе от 120 к 195 градусам увеличила ошибку AbsRel (среднее относительное отклонение глубины от эталона) на 166%.
  • PatchFusion показала рост ошибки на 160% в тех же условиях.

Для стереосопоставления (stereo matching, когда модель сравнивает кадры с двух камер и вычисляет глубину по смещению точек) выбор проекции оказался критичен. Эквипрямоугольная проекция дала ошибку EPE 1,07 пикселя против 4,50 пикселя у кубической, разница более чем в четыре раза.

Ещё один факт, который пригодится любому специалисту по компьютерному зрению дронов и нейросетям: в экспериментах с моделью StereoBase расстояние между камерами (стереобаза) влияло на точность сильнее, чем сам угол обзора. Лучший результат зафиксирован при стереобазе 65 мм.

Дообучение помогает, но с оговоркой

Авторы проверили, насколько дообучение (fine-tuning, обучение готовой модели на новых примерах под узкую задачу) на fisheye-данных улучшает результат. Компактная модель BGNet после дообучения на уличных стереопарах из обучающей выборки WideDepth снизила долю пикселей с ошибкой смещения более 3 пикселей с 24,3% до 9,3%. Улучшение по этой метрике составило 62% относительно исходной модели.

Обучающая выборка намеренно собрана на улице (18 тысяч стереопар, разметка от двух LiDAR-сенсоров, покрытие в среднем 8,1% пикселей), чтобы модель не переобучалась на офисных сценах из бенчмарка. Разметка менее плотная и менее точная, чем эталонная, но именно это делает эксперимент честным.

Почему fisheye ломает привычные модели?

Обычная камера (pinhole) строит изображение по центральной проекции: прямые линии остаются прямыми, угол обзора ограничен. Fisheye-объектив захватывает почти полусферу, но вносит нелинейные искажения. Чем ближе объект к краю кадра, тем сильнее бочкообразная дисторсия (искажение, при котором прямые линии выгибаются бочкой) меняет его масштаб и форму.

Для нейросетей это двойной удар:

  • Большинство моделей обучены на pinhole-снимках, и fisheye-кадры выпадают из привычного распределения данных.
  • Меняется геометрия: при стереосопоставлении модель ожидает искать соответствия вдоль прямых линий, а на fisheye-кадрах эти линии искривлены.

Альтернатива в виде нескольких обычных камер вместо одной fisheye усложняет синхронизацию и увеличивает объём вычислений, что для робота или дрона часто неприемлемо.

Что внутри бенчмарка?

WideDepth публикует готовые изображения и эталонные карты глубины. Исходные лазерные сканы (около 20 миллионов точек на один круговой скан) использовались при подготовке, но пользователям не нужно скачивать облака точек и проецировать их самостоятельно.

Распределение глубины характерно для помещений: 74,7% пикселей попадают в диапазон от 2 до 5 метров.

Авторы честно оговаривают: миллиметровая точность относится к исходным измерениям сканера, а сквозную погрешность после совмещения сканов и построения карт глубины они не измеряли.

Fisheye-камера позволяет роботу увидеть почти всё помещение одним кадром. Но за широкий обзор приходится платить: без точной эталонной разметки трудно понять, что именно подвело модель. : Описание проекта WideDepth, авторы бенчмарка

Мнение редакции dzen.guru

Я вижу здесь два практических сигнала. Для тех, кто разрабатывает или внедряет роботов с fisheye-камерами в РФ: не доверяйте «из коробки» даже лидерам вроде Depth Anything V2, пока не проверите их на реальном угле обзора вашей камеры. Потеря точности вдвое при переходе от 120 к 195 градусам означает, что робот-пылесос или складской дрон может неверно оценить расстояние до препятствия. Второй сигнал: дообучение даже компактной модели на fisheye-данных даёт прирост на 62%, это доступный шаг, не требующий гигантских вычислительных ресурсов.

Что делать с этим прямо сейчас?

Разработчикам робототехники и компьютерного зрения. Скачайте WideDepth и прогоните свои модели на всех четырёх углах обзора. Цифры деградации покажут, нужно ли дообучение или достаточно сменить проекцию при стереосопоставлении. Эквипрямоугольная проекция дала в четыре раза меньшую ошибку, чем кубическая, а это бесплатная замена.

Авторам Дзена, пишущим о технологиях. Тема «нейросети не так точны, как кажется» хорошо заходит у аудитории. Конкретные цифры (166% рост ошибки, 62% улучшение после дообучения) дают фактуру для разборов и сравнений, которую сложно оспорить.

Предпринимателям, внедряющим ИИ в складскую логистику или видеонаблюдение. Если ваш подрядчик ставит fisheye-камеры и утверждает, что нейросеть «из коробки» точно измеряет расстояния, попросите показать тесты именно на вашем угле обзора. Теперь есть бенчмарк, на который можно сослаться.

Где подвох

Авторы не измеряли сквозную погрешность после совмещения лазерных сканов, поэтому заявленная миллиметровая точность эталона относится только к сырым данным сканера. Кроме того, обучающая выборка снята исключительно на улице, а бенчмарк в офисах: переносимость результатов на другие типы помещений (склады, цеха) пока не проверена.

Бенчмарк открыт и доступен. Для российских команд, работающих с автономными системами, это редкая возможность проверить свои модели на реальных данных с контролируемыми параметрами камеры, без необходимости покупать лазерный сканер и собирать датасет с нуля.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Разработчик ИИ в 2026 пишет меньше кода: план перехода от кодера к инженеру

Компания или продукт, которые в источнике отсутствуют, я не придумываю. Источник — авторская статья на русском языке о трансформации профессии разработчика под…

6 мин
VibeCraft Яндекса работает на Claude, а не на YandexGPT: что это значит для суверенности
ai

VibeCraft Яндекса работает на Claude, а не на YandexGPT: что это значит для суверенности

Яндекс второго июня открыл VibeCraft, собственный сервис вайбкодинга (создания приложений голосом или текстом, без ручного написания кода), но под капотом…

5 мин
Nvidia drivers ИИ-бума: $194 млрд заёмных денег повторяют сценарий краха 1873 года
ai

Nvidia drivers ИИ-бума: $194 млрд заёмных денег повторяют сценарий краха 1873 года

Nvidia зарабатывает рекордные суммы на чипах для ИИ, но историческая параллель с железнодорожным крахом 1873 года, которую проводит экономист Лиакат Ахамед в…

5 мин