Игорь Градов
Игорь Градов
4 мин
ai

Marker 2 обогнал конкурентов по парсингу PDF в 5 раз по скорости при лучшем качестве

Компания Datalab выпустила Marker 2, полностью переписанный открытый конвейер для парсинга PDF и других документов, который на бенчмарке olmOCR-bench обогнал конкурентов по скорости в 5 раз при более высоком качестве распознавания.

Marker 2 обогнал конкурентов по парсингу PDF в 5 раз по скорости при лучшем качестве
Показатель Значение Источник
Общий балл Marker 2 (balanced) 76,0% olmOCR-bench, замеры Datalab
Балл на цифровых PDF (balanced) 83,5% olmOCR-bench, замеры Datalab
Скорость Marker 2 (balanced) 2,9 стр./сек на одном B200 GPU замеры Datalab
Общий балл MinerU (pipeline) 72,7% olmOCR-bench, замеры Datalab
Скорость MinerU (pipeline) 0,54 стр./сек замеры Datalab
Общий балл Docling 50,3% olmOCR-bench, замеры Datalab
Скорость Docling 2,1 стр./сек замеры Datalab
Скорость LiteParse (без OCR) 1721 стр./сек замеры Datalab
Общий балл LiteParse 22,4% olmOCR-bench, замеры Datalab
Скорость Marker 2 (CPU, без OCR) 23,7 стр./сек замеры Datalab

Что именно сравнивали и как?

Бенчмарк olmOCR-bench создан исследовательской лабораторией Allen AI (Ai2). Это 1 403 PDF-файла и примерно 8 400 тестов «прошёл/не прошёл». Тесты покрывают восемь категорий: рендеринг математических формул, структуру таблиц, порядок чтения, обработку заголовков и колонтитулов, распознавание старых сканов.

Итоговый балл считается как среднее по всем восьми категориям. Скорость измеряется не по одиночному запросу, а как устойчивая пропускная способность при параллельной обработке на одном хосте с GPU B200.

Все цифры в таблице получены командой Datalab на их собственных прогонах. Скрипты для воспроизведения результатов лежат в репозитории Marker вместе с раннерами для MinerU, Docling и LiteParse, то есть любой может повторить замеры на своих данных.

Что обнаружили?

  • Marker 2 в режиме balanced набирает 76,0% при скорости 2,9 стр./сек. MinerU (pipeline-бэкенд) набирает 72,7% при 0,54 стр./сек. Разрыв по скорости: 5,4 раза при более высоком качестве.
  • На цифровых PDF (born-digital, то есть изначально созданных на компьютере, а не отсканированных) Marker 2 и MinerU практически равны: 83,5% против 83,3%.
  • Режим fast Marker 2 выжимает 7,4 стр./сек, это в 13,7 раза быстрее MinerU, но качество падает до 66,6%.
  • Режим без OCR (оптическое распознавание символов, когда программа «читает» текст с картинки) работает целиком на CPU без видеокарты. Скорость составляет 23,7 стр./сек, качество 43,6%. Для черновой обработки больших архивов, где важна скорость, а не идеальная точность, это рабочий вариант.
  • Docling отстаёт сильнее: 50,3% при 2,1 стр./сек. Его преимущество в другом: MIT-лицензия, происхождение из IBM Research, поддержка не только документов, но и аудио, и почтовых форматов.
  • LiteParse от команды LlamaIndex, написанный на Rust, показывает 1 721 стр./сек без OCR, это в 73 раза быстрее CPU-режима Marker 2, но качество всего 22,4%. У LiteParse нет модели раскладки страницы, и он «ломается» на любом нелинейном макете: таблицах, многоколоночных страницах.
  • Полностраничные VLM (модели, которые «смотрят» на всю страницу целиком как на изображение) остаются точнее всех конвейеров. Hosted-модель Datalab Chandra 2 набирает 85,8%, olmOCR 2 от Ai2 — 82,4%, dots.ocr 1.5 — 83,9%. Но Marker 2 balanced уступает Gemini Flash 3.5 через API всего 0,4 балла (76,0 против 76,4), а на цифровых PDF обгоняет его: 83,5 против 79,1, и не требует платного вызова API на каждую страницу.
Как это читать

Все замеры выполнены командой Datalab, то есть разработчиком Marker 2. Бенчмарк olmOCR-bench сторонний, но прогоны и настройки конкурентов контролировал сам производитель. Результаты отражают один набор документов и одну аппаратную конфигурацию. На ваших файлах ранжировка может отличаться: Datalab прямо рекомендует прогнать тесты на собственном корпусе. У MinerU есть отдельный VLM-бэкенд, который, по заявлению Datalab, набирает выше pipeline-версии, но его цифры в этот бенчмарк не вошли.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Если вы извлекаете текст из PDF-отчётов, книг, исследований для своих статей, Marker 2 позволяет получить чистый Markdown или HTML за секунды. Режим fast работает без мощной видеокарты. Установка через pip install marker-pdf не изменилась, но нужен Python 3.10 или новее.

Маркетологам. Парсинг PDF с прайсами, каталогами, коммерческими предложениями конкурентов из рутины превращается в конвейер. Три режима покрывают разные бюджеты: balanced для точности, fast для объёма, CPU-only для серверов без GPU.

Предпринимателям в РФ и СНГ. Marker 2 это открытая модель (опенсорс), развернуть можно на своём сервере без зависимости от зарубежных API. Для тех, кому нужен российский облачный вариант, ближайшие аналоги по задаче (хотя и с другой архитектурой) включают сервисы распознавания от Яндекс Cloud Vision и «Контур.Распознавание».

Мнение редакции dzen.guru

Я перепробовал несколько конвейеров для парсинга PDF за последние пару лет, и главная боль всегда одна: либо точно, но медленно, либо быстро, но таблицы и формулы разваливаются. Marker 2 впервые ставит вопрос иначе: выбирай не «скорость или качество», а режим конвейера под задачу. То, что CPU-версия без видеокарты выдаёт 23,7 стр./сек с приемлемым качеством, реально полезно для тех, кто работает на обычном ноутбуке. Но помните: замеры делал сам разработчик. Прежде чем строить рабочий процесс, прогоните свои типичные файлы через открытый тестовый скрипт.

Три режима одного инструмента вместо трёх разных программ, вот что по-настоящему ценно в Marker 2 для повседневной работы с документами: включил нужный и пошёл дальше.

По данным Datalab

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Сбер выпустил RUMBA: первый бенчмарк нейросетей на русском для проверки долгосрочной памяти
ai

Сбер выпустил RUMBA: первый бенчмарк нейросетей на русском для проверки долгосрочной памяти

Группа российских исследователей из Сбера 4 июня 2025 года представила RUMBA (Russian User Memory Benchmark), первый публичный бенчмарк нейросетей на русском…

5 мин
ai

Claude 3 5 Opus вышел после проверки властями США: цена не выросла, защита усилена

Anthropic второго июля выпустила Claude Opus 5, свою новую рассуждающую модель, которую впервые перед публичным запуском тестировали совместно с правительством…

5 мин
ИИ-агенты OpenSpace сохраняют навыки между запусками, снижая расходы на API
ai

ИИ-агенты OpenSpace сохраняют навыки между запусками, снижая расходы на API

Представьте, что ваш ИИ-агент не просто выполняет задачу, а сам учится её делать лучше, сохраняет удачные решения и переиспользует их, снижая ваши расходы на…

6 мин