Игорь Градов
Игорь Градов
5 мин
ai

Jina AI выпустила OCR-нейросеть на 3,4 млрд параметров: 2,57 страницы в секунду на одном GPU

Jina AI выпустила jina-ocr-v1, модель для распознавания документов с 3,4 миллиарда параметров, которая на одном бюджетном GPU превращает PDF, сканы и таблицы в чистый Markdown быстрее всех протестированных аналогов.

Почему это важно

Впервые OCR нейросеть с открытыми весами выдаёт 2,57 страницы в секунду на одном ускорителе, обгоняя 13 других систем по скорости, и при этом работает даже на NVIDIA L4, карте стоимостью в разы ниже серверных A100.

Компания Jina AI, входящая в Elastic, опубликовала техническое описание и веса модели jina-ocr-v1 на Hugging Face. Модель принимает PDF, сканы, таблицы, графики и счета-фактуры и за один проход возвращает Markdown, где таблицы оформлены в HTML, а формулы в LaTeX. Лицензия CC BY-NC 4.0 разрешает исследовательское использование, для коммерческого нужно связаться с Jina AI.

Показатель Значение Источник
Общее число параметров 3,4 млрд Техотчёт Jina AI
Активных параметров декодера на токен около 570 млн Техотчёт Jina AI
Размер весов (BF16) около 6,8 ГБ Техотчёт Jina AI
OmniDocBench v1.6 91,14 Техотчёт Jina AI
olmOCR-Bench 83,4 Техотчёт Jina AI
Скорость на A100 40 ГБ (concurrency 32) 2,57 страниц/с Техотчёт Jina AI
Скорость olmOCR-2 (там же) 1,22 страниц/с Техотчёт Jina AI
Скорость chandra-ocr-2 (там же) 0,38 страниц/с Техотчёт Jina AI
Токенов на страницу 1 085 Техотчёт Jina AI
Лицензия CC BY-NC 4.0 Техотчёт Jina AI

Как устроена модель и почему она быстрая?

jina-ocr-v1 построена поверх DeepSeek-OCR и сохраняет два ключевых компонента. Первый, DeepEncoder (около 380 млн параметров), соединяет три модуля: SAM, свёрточный компрессор (сжимает изображение в 16 раз) и CLIP-L. Страница размером 1024 на 1024 пикселя сжимается из 4 096 патчей (фрагментов изображения, на которые модель делит страницу) в 256 визуальных токенов (токен, минимальная единица, которую обрабатывает модель). Режим динамического разрешения добавляет до 9 дополнительных фрагментов по 100 токенов каждый, итого потолок на страницу составляет 1 156 визуальных токенов.

Второй компонент, декодер DeepSeek-3B-MoE (MoE, Mixture of Experts, архитектура, где из набора «экспертных» блоков активируется только часть, что экономит вычисления). Он содержит 12 слоёв, 64 маршрутизируемых эксперта и 2 общих. Маршрутизация top-6 активирует около 570 млн параметров на каждый токен вместо всех 3,4 млрд. Контекстное окно, 32 768 позиций.

Главная причина скорости, механизм FastMTP (спекулятивное декодирование). Суть проста: отдельный компактный «черновой» блок предсказывает сразу три следующих токена за один шаг. Декодер проверяет черновик и принимает самый длинный совпавший фрагмент, а затем добавляет ещё один токен от себя. Если все три черновых токена угаданы, бонусный токен идёт сверху. Текст на выходе полностью совпадает с обычной генерацией, ускорение без потерь качества. В среднем модель выдаёт 2,73 токена за один шаг.

Что показали замеры?

По точности jina-ocr-v1 не лидирует. Это честно указано в самом техотчёте:

  • На OmniDocBench v1.6 результат 91,14. У HunyuanOCR-1.5 выше, 94,74.
  • На olmOCR-Bench результат 83,4. У dots.mocr выше, 83,9.
  • Дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) добавило 7,4 балла к базовому DeepSeek-OCR на olmOCR-Bench.

Зато по скорости модель первая из 14 протестированных систем:

  • 2,57 страниц в секунду на одном A100 40 ГБ при параллелизме 32.
  • Для сравнения: olmOCR-2 даёт 1,22 страниц/с, chandra-ocr-2 даёт 0,38 страниц/с.
  • Самый короткий выход среди систем с баллом выше 83: 1 085 токенов на страницу.

На бюджетной карте NVIDIA L4 при batch size 1 спекулятивное декодирование поднимает скорость с 42,7 до 83,1 токена в секунду, ускорение в 1,95 раза при доле принятых черновиков 57,6%.

Как это читать

Все замеры скорости проведены самой Jina AI, а не независимой лабораторией. Бенчмарки точности (OmniDocBench, olmOCR-Bench) публичные, но набор из 14 систем для сравнения скорости выбран авторами. Лицензия CC BY-NC 4.0 запрещает коммерческое использование без отдельного соглашения. Модель выдаёт Markdown, а не структурированный JSON, поэтому для интеграции в бизнес-процессы потребуется парсинг.

Как запустить прямо сейчас?

Самый быстрый способ попробовать OCR нейросеть онлайн: отправить URL на r.jina.ai с заголовком X-Respond-With: jina-ocr-v1. Сервис скачает страницу или PDF, прогонит через модель и вернёт Markdown. Заголовок X-Page позволяет обработать конкретную страницу многостраничного документа.

Jina AI также предоставляет эндпоинт, совместимый с API OpenAI, по адресу https://api.jina.ai/v1/chat/completions, и демо для быстрых тестов.

Для локального запуска веса и код загружаются из одного репозитория с параметром trust_remote_code=True. FastMTP работает начиная с vLLM версии 0.21. Путь через библиотеку Transformers запускает только декодер без спекулятивной генерации.

Что это меняет для вас?

Авторам Дзена и копирайтерам. Если вы работаете с PDF-источниками, отчётами, сканами книг или статей, jina-ocr-v1 через Jina Reader превращает их в чистый текст с сохранением таблиц и формул. Это экономит ручной перенабор. Попробуйте OCR нейросеть онлайн через r.jina.ai, чтобы оценить качество на своих документах.

Маркетологам. Пакетная обработка счетов, коммерческих предложений, прайс-листов в Markdown, готовый для загрузки в CRM или аналитику, реальный сценарий. Скорость 2,57 страниц в секунду означает, что пачка из 100 страниц обрабатывается меньше чем за минуту.

Разработчикам и предпринимателям в РФ. Веса открыты, 6,8 ГБ в BF16, помещаются на NVIDIA L4 (карту за условные 30 тысяч рублей на вторичном рынке). Для некоммерческих проектов развернуть модель можно уже сегодня. Для коммерческих нужно писать в Jina AI. Из доступных в России альтернатив для распознавания документов есть PaddleOCR (открытый проект Baidu) и Yandex Vision OCR, но прямого аналога с MoE-декодером и спекулятивной генерацией среди российских решений пока нет.

Мнение редакции dzen.guru

Jina AI сделала ставку не на рекордную точность, а на скорость и доступность, и это выглядит прагматично. Разница в точности с лидерами (91,14 против 94,74 у HunyuanOCR) заметна, но для большинства задач, перенос текста из сканов в редактируемый формат, этого хватает. Меня лично подкупает честность техотчёта: авторы прямо пишут, что по точности не первые. Для тех, кто работает с большими массивами документов на бюджетном железе, это сейчас один из самых практичных вариантов среди OCR нейросетей с открытыми весами.

Модель доступна на Hugging Face и через Jina Reader уже сейчас. Если у вас есть NVIDIA L4 или лучше, попробуйте на своих документах и сравните с тем, чем пользуетесь: скорость вы заметите сразу, а качество проверяется за пять минут на десятке реальных страниц.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Лучшие ноутбуки для машинного обучения: почему ML-разработчик ушёл с MacBook на Linux
ai

Лучшие ноутбуки для машинного обучения: почему ML-разработчик ушёл с MacBook на Linux

Почему это важно Автор с реальным опытом миграции с MacBook на Linux и x86 разбирает, почему CUDA и совместимость с Linux перевешивают удобство macOS, и…

6 мин
Шведский стартап создал дрон с ИИ без облака: НАТО уже тестирует технологию
ai

Шведский стартап создал дрон с ИИ без облака: НАТО уже тестирует технологию

Компания Scaleout Systems, выросшая из шведского университетского проекта, в 2025 году вошла в акселератор NATO DIANA с решением, которое позволяет небольшим…

4 мин
Google показала, что такое ИИ-агент для семьи: один бот на шестерых вместо десятка чатов
ai

Google показала, что такое ИИ-агент для семьи: один бот на шестерых вместо десятка чатов

Google превратила CC из личного помощника в семейного ИИ-агента с собственным аккаунтом, общей памятью и доступом к календарю, почте и задачам, и теперь до…

6 мин