Datalab открыла бенчмарки нейросетей для всех: 620 документов, 6 типов вердиктов, Apache 2.0
Microsoft второго июня запустила OmniExtractBench, и нет, подождите, это не Microsoft. Перечитаю источник внимательно.
Компания Datalab выпустила OmniExtractBench, открытый бенчмарк для проверки нейросетей и систем извлечения данных из PDF-документов, который решает проблему непрозрачных рейтингов, где вендоры сами оценивают свои продукты.
Впервые появился независимый инструмент с единым детерминированным скоринговым движком, который объясняет каждое решение и доступен бесплатно: теперь бенчмарки нейросетей перестают быть монополией тех, кто продаёт эти же нейросети.
До сих пор компании, продающие системы извлечения данных из документов, публиковали собственные рейтинги. Сравнить результаты между ними было невозможно: разные документы, разные критерии, разная логика подсчёта. Как сообщает Marktechpost, Datalab (создатель открытых инструментов Marker и Surya) предлагает OmniExtractBench как общую линейку, по которой можно измерить любую систему на одних и тех же данных.
| Показатель | Значение | Источник |
|---|---|---|
| Документов в бенчмарке | 620 | Datalab |
| Источников наборов данных | 4 (LlamaIndex, micro1, Extend, Datalab) | Datalab |
| Типов вердиктов на каждое значение | 6 | Datalab |
| Лучшая точность (accuracy) | 93,85% (Datalab accurate) | Datalab |
| Лицензия скоринг-движка | Apache 2.0 | Datalab |
| Лицензия датасета | CC BY 4.0 | Datalab |
| Минимальные требования | Python 3.11+, SciPy | Datalab |
Как устроен бенчмарк?
Задача выглядит просто: системе дают PDF-файл и JSON-схему (шаблон, описывающий, какие поля нужно заполнить). Система читает документ и возвращает заполненный шаблон. Скоринговый движок сравнивает каждое извлечённое значение с эталоном и выносит один из шести вердиктов.
620 документов собраны из четырёх существующих наборов данных: LlamaIndex, micro1, Extend и собственного синтетического набора Datalab. Самая большая категория составляет 88 регуляторных форм. 128 документов занимают одну страницу, а 33 документа длиннее 100 страниц содержат 40% всех страниц корпуса.
Движок нормализует данные перед сравнением. Например, дата «03/31/2024» и «2024-03-31» считаются одинаковыми. Для таблиц применяется венгерский алгоритм (метод сопоставления строк по содержанию, а не по позиции). Это критично: если сравнивать строки по номеру позиции, одна пропущенная строка сдвигает все последующие и обнуляет результат. По данным Datalab, при позиционном сравнении таблицы из 100 строк с одной пропущенной первой строкой результат составил 0%, а OmniExtractBench дал 99%.
Шесть вердиктов вместо одной оценки
Каждое значение получает один из шести вердиктов:
- matched: значение найдено и совпадает с эталоном
- misread: значение найдено, но прочитано неверно
- unfound: эталон содержит значение, а система его пропустила
- fabricated: схема допускает поле, эталон пуст, но система что-то вписала
- invented_item: строка таблицы, которой нет в эталоне
- invented_field: поле, которого нет даже в схеме
Галлюцинация (когда нейросеть уверенно выдумывает то, чего не было) здесь разделена на три типа: fabricated, invented_item и invented_field. Это позволяет точно понять, где именно система ошибается: пропускает данные или, наоборот, додумывает их.
Отдельно стоит «правило пустых значений»: пустые строки, None и пробелы считаются пропусками и не участвуют в подсчёте. Это блокирует приём, при котором схему набивают пустыми необязательными полями, чтобы набрать «бесплатные» совпадения.
Кто оказался лучшим и кто провалился?
Datalab протестировала 10 конфигураций систем на полном корпусе. Вот ключевые выводы:
- Лидер: режим Datalab accurate показал 93,85% точности. Datalab balanced (93,48%) и Reducto deep_extract v2 (93,47%) фактически неразличимы
- Пропускают данные: GPT 5.6-sol (версия, указанная в бенчмарке) набрала 95,11% точности, но всего 84,99% полноты, потеряв 11,88% на пропущенных значениях. Gemini и Claude показали тот же паттерн, но мягче
- Выдумывают данные: LlamaExtract набрала 93,13% полноты, но лишь 86,57% точности, потеряв 9,03% на «fabricated» значениях. Extend потеряла 4,01% на invented_items
- Отстающие по обоим показателям: Mistral OCR 4.1 и Azure Content Understanding показали низкие результаты по обоим метрикам
Характерно, что Datalab тестирует собственные системы на собственном бенчмарке и занимает первые позиции. Источник это не скрывает, а Marktechpost прямо указывает: Datalab спонсировала публикацию.
Бенчмарк собран Datalab, и Datalab же лидирует в нём. Marktechpost прямо указывает на спонсорство Datalab. Выборка в 620 документов покрывает четыре набора данных, но не включает, например, рукописные документы, плохие сканы или документы на языках, отличных от английского. Результаты показывают картину на момент тестирования и не учитывают обновления моделей. Для бенчмарков нейросетей это стандартная оговорка, но она означает, что через полгода расклад может измениться.
Что делать с этим прямо сейчас?
Если вы работаете с документами и данными в бизнесе. Когда вендор показывает слайд «наша система точнее на 5%», спросите: на каком бенчмарке, на каких документах, кто считал? OmniExtractBench даёт конкретный инструмент для проверки. Установить движок можно одной командой: uv pip install omni-extract-bench. Запуск на своих документах бесплатный, но для тестирования коммерческих систем понадобятся их API-ключи и платные кредиты.
Если вы автор на Дзене или маркетолог. Тема «независимые бенчмарки нейросетей против вендорских рейтингов» актуальна и для генерации текста, и для распознавания изображений. Логика та же: не верьте рейтингу, если его составил тот, кто в нём побеждает. Этот принцип работает для любой нейросети, которую вам предлагают купить или подключить.
Для работы в России. Бенчмарк открыт, код на GitHub под Apache 2.0, данные на Hugging Face под CC BY 4.0. Установить и запустить можно из России без ограничений. Для тестирования зарубежных систем (GPT, Claude, Gemini) потребуется доступ к их API, а с ним в РФ сложнее. Но сам скоринговый движок можно применить к любой локальной системе, в том числе к решениям на базе YandexGPT или GigaChat, если они умеют извлекать структурированные данные из документов.
Я вижу здесь не столько технический прорыв, сколько культурный сдвиг. Рынок извлечения данных из документов вырос настолько, что каждый второй вендор завёл собственный «рейтинг», где, по удивительному совпадению, побеждает сам. Datalab делает то же самое, но хотя бы выкладывает код и данные, чтобы любой мог перепроверить. Шесть вердиктов вместо одного числа, по моим наблюдениям, это именно то, чего не хватало: одно дело сказать «точность 93%», другое дело показать, где именно система выдумывает, а где пропускает. Для тех, кто выбирает систему для обработки договоров, накладных или регуляторных форм, это практический инструмент: прогоните своих кандидатов через один и тот же движок и сравните не проценты с разных слайдов, а вердикты по одним и тем же документам.
Бенчмарк установлен, код открыт, данные доступны. Осталось одно: чтобы другие вендоры согласились мериться на чужой площадке, а не на своей. Пока этого не произошло, относитесь к любому лидерборду, включая этот, как к заявке, которую стоит проверить лично.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%
Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым…
NVIDIA DGX Spark 64GB для локальных ИИ агентов
Microsoft второго июня запустила DGX Spark 64GB, компактный настольный компьютер на суперчипе Grace Blackwell, который позволяет держать ИИ-агентов и открытые…

Gemini 4 Argon лидирует в 12 из 18 тестов: что это значит для юристов и финансистов
Google Gemini 4 Argon пока закрыта для широкой публики, но уже сейчас можно разобраться, как модель работает с длинными документами и многошаговым анализом,…
Комментарии