PerceptionBench проверяет multimodal модели по 10 навыкам зрения: код открыт
Компания Moonshot AI опубликовала PerceptionBench, открытый бенчмарк для оценки мультимодальных моделей зрения, и выложила полный туториал с кодом, который позволяет любому разработчику протестировать свою модель на десяти типах визуальных задач.

Впервые появился воспроизводимый инструмент, который измеряет не общую «умность» модели, а конкретные навыки: чтение текста с картинки, подсчёт объектов, понимание глубины и даже детекцию галлюцинаций (когда модель уверенно описывает то, чего на изображении нет). Для русскоязычных разработчиков это шанс оценить, как мультимодальные модели справляются с кириллицей и локальными задачами, не собирая стенд с нуля.
| Параметр | Значение |
|---|---|
| Кто | Moonshot AI |
| Что | PerceptionBench, открытый мультимодальный бенчмарк |
| Репозиторий | moonshotai/PerceptionBench на Hugging Face |
| Тип | Открытый датасет с туториалом и кодом оценки |
| Дата публикации | Туториал опубликован в открытом доступе (точная дата в источнике не указана) |
Что умеет PerceptionBench и как устроен туториал?
Мультимодальные модели (multimodal models) работают сразу с несколькими типами данных: текстом, изображениями, иногда звуком. PerceptionBench проверяет именно зрительную часть, десять категорий восприятия.
Вот что измеряется:
- OCR (оптическое распознавание символов): читает ли модель текст на картинке, включая мелкий шрифт и нестандартные начертания.
- Подсчёт объектов: правильно ли модель считает предметы на фотографии.
- Локализация: может ли модель указать, где именно на изображении находится нужный объект.
- Контекстное рассуждение: понимает ли модель ситуацию на картинке, а не просто перечисляет объекты.
- Сравнение: способна ли модель сопоставить два объекта по размеру, цвету или положению.
- Понимание глубины: различает ли модель, что ближе, а что дальше.
- Детекция галлюцинаций: замечает ли модель, когда её собственный ответ не соответствует изображению.
Туториал построен как пошаговый конвейер для Google Colab (бесплатная облачная среда для запуска кода). Разработчик устанавливает зависимости, загружает сбалансированную выборку из датасета, декодирует изображения, нормализует данные в единый формат и запускает оценку.
Код поддерживает три режима тестирования: «слепой» базовый уровень (модель отвечает без картинки, чтобы измерить нижнюю планку), подключение к API, совместимому с OpenAI, и локальные модели с открытыми весами (open weights) через Hugging Face.
По умолчанию в конфигурации указана модель SmolVLM2-2.2B-Instruct от Hugging Face для локального запуска и gpt-4o-mini для API-режима. Результаты сравниваются с таблицей лидеров, встроенной в бенчмарк.
Почему рынку нужен именно такой инструмент?
До сих пор оценка мультимодальных моделей сводилась к общим рейтингам: модель набирала усреднённый балл, и было непонятно, где конкретно она сильна, а где проваливается. PerceptionBench разбивает оценку на десять отдельных «профилей способностей».
Это выгодно тем, кто выбирает модель под задачу. Если нужен OCR для сканов документов, не важно, как модель рассуждает о глубине. Если нужен подсчёт товаров на полке, контекстное рассуждение вторично.
Для разработчиков мультимодальных решений в России это практичный ориентир. Туториал можно адаптировать под кириллицу: заменить англоязычные примеры русскоязычными, добавить свои изображения и проверить, как конкретная модель справляется с русским текстом на фотографиях.
Бенчмарк измеряет десять атомарных способностей восприятия, и сбалансированная выборка гарантирует, что итоговый результат не перекошен в сторону одной категории. : Документация PerceptionBench, Moonshot AI
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Мультимодальные модели всё чаще используют для генерации подписей к фото, описания товаров по снимку, автоматической расшифровки скриншотов. PerceptionBench показывает, какая модель лучше «видит» детали. Если вы выбираете ИИ-помощника для работы с визуальным контентом, смотрите не на общий рейтинг, а на профиль по нужной вам категории: OCR для текстов, подсчёт для каталогов.
Маркетологам. Автоматическая модерация изображений, генерация alt-текстов, анализ визуального контента конкурентов зависят от того, насколько точно модель «понимает» картинку. Бенчмарк позволяет до покупки API проверить, справится ли модель с вашим типом задач.
Разработчикам в РФ и СНГ. Туториал запускается в Colab, код открыт, зависимости ставятся за 30 секунд. Для адаптации под русский язык достаточно подготовить свой набор изображений с кириллицей и подключить его вместо стандартной выборки. Из доступных в России мультимодальных моделей можно протестировать YandexGPT (через API) и GigaChat (через API Сбера), подключив их как OpenAI-совместимые эндпойнты.
Мы в dzen.guru видим в PerceptionBench не «ещё один бенчмарк», а рабочий шаблон. Большинство рейтингов мультимодальных моделей на момент публикации закрыты и невоспроизводимы: вам показывают таблицу, но вы не можете прогнать тот же тест на своих данных. Здесь код открыт, конвейер задокументирован, результаты экспортируются в файл. По моим наблюдениям, модели заметно различаются именно по отдельным категориям: одна хорошо считает объекты, но плохо читает мелкий текст, другая наоборот. Общий балл это прячет. Оговорка: бенчмарк пока англоязычный, и для русских задач придётся потратить время на подготовку своих примеров. Но затраты окупятся: вы будете знать, где именно ваша модель ошибается, а не гадать по общему проценту.
PerceptionBench не тестирует генерацию изображений, только их понимание. Датасет англоязычный, и OCR-результаты на кириллице могут отличаться. «Слепой» базовый режим полезен для калибровки, но не заменяет полноценное тестирование с картинками.
Если вы работаете с визуальным контентом и выбираете между моделями, скачайте туториал, замените десяток примеров на свои скриншоты с русским текстом и запустите оценку. Через час у вас будет не мнение блогера, а таблица с числами по каждой категории восприятия, и решение станет очевидным.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Genspark выложила офисный пакет с ИИ под открытой лицензией: один инженер, $10 000, одна неделя
Компания Genspark 10 июня опубликовала GenOffice, офисный пакет с ИИ, встроенным в каждый инструмент, и выложила исходный код под свободной лицензией Apache…

Чат-бот с ИИ за месяц: как LeaderChat снизил стоимость обращений в 10 раз
Автоматизация чата поддержки с помощью ИИ звучит как задача для программистов, но команда сервиса LeaderChat показала, что малый бизнес может запустить чат-бот…

GPT 5.6 опровергнул гипотезу Максвелла
Реальность отличается от заголовков: речь не об электромагнетизме, а о нишевой математической задаче про точки равновесия зарядов, где GPT-5.6 подсказал…
Комментарии