Jina AI выпустила OCR-нейросеть на 3,4 млрд параметров: 2,57 страницы в секунду на одном GPU
Jina AI выпустила jina-ocr-v1, модель для распознавания документов с 3,4 миллиарда параметров, которая на одном бюджетном GPU превращает PDF, сканы и таблицы в чистый Markdown быстрее всех протестированных аналогов.
Впервые OCR нейросеть с открытыми весами выдаёт 2,57 страницы в секунду на одном ускорителе, обгоняя 13 других систем по скорости, и при этом работает даже на NVIDIA L4, карте стоимостью в разы ниже серверных A100.
Компания Jina AI, входящая в Elastic, опубликовала техническое описание и веса модели jina-ocr-v1 на Hugging Face. Модель принимает PDF, сканы, таблицы, графики и счета-фактуры и за один проход возвращает Markdown, где таблицы оформлены в HTML, а формулы в LaTeX. Лицензия CC BY-NC 4.0 разрешает исследовательское использование, для коммерческого нужно связаться с Jina AI.
| Показатель | Значение | Источник |
|---|---|---|
| Общее число параметров | 3,4 млрд | Техотчёт Jina AI |
| Активных параметров декодера на токен | около 570 млн | Техотчёт Jina AI |
| Размер весов (BF16) | около 6,8 ГБ | Техотчёт Jina AI |
| OmniDocBench v1.6 | 91,14 | Техотчёт Jina AI |
| olmOCR-Bench | 83,4 | Техотчёт Jina AI |
| Скорость на A100 40 ГБ (concurrency 32) | 2,57 страниц/с | Техотчёт Jina AI |
| Скорость olmOCR-2 (там же) | 1,22 страниц/с | Техотчёт Jina AI |
| Скорость chandra-ocr-2 (там же) | 0,38 страниц/с | Техотчёт Jina AI |
| Токенов на страницу | 1 085 | Техотчёт Jina AI |
| Лицензия | CC BY-NC 4.0 | Техотчёт Jina AI |
Как устроена модель и почему она быстрая?
jina-ocr-v1 построена поверх DeepSeek-OCR и сохраняет два ключевых компонента. Первый, DeepEncoder (около 380 млн параметров), соединяет три модуля: SAM, свёрточный компрессор (сжимает изображение в 16 раз) и CLIP-L. Страница размером 1024 на 1024 пикселя сжимается из 4 096 патчей (фрагментов изображения, на которые модель делит страницу) в 256 визуальных токенов (токен, минимальная единица, которую обрабатывает модель). Режим динамического разрешения добавляет до 9 дополнительных фрагментов по 100 токенов каждый, итого потолок на страницу составляет 1 156 визуальных токенов.
Второй компонент, декодер DeepSeek-3B-MoE (MoE, Mixture of Experts, архитектура, где из набора «экспертных» блоков активируется только часть, что экономит вычисления). Он содержит 12 слоёв, 64 маршрутизируемых эксперта и 2 общих. Маршрутизация top-6 активирует около 570 млн параметров на каждый токен вместо всех 3,4 млрд. Контекстное окно, 32 768 позиций.
Главная причина скорости, механизм FastMTP (спекулятивное декодирование). Суть проста: отдельный компактный «черновой» блок предсказывает сразу три следующих токена за один шаг. Декодер проверяет черновик и принимает самый длинный совпавший фрагмент, а затем добавляет ещё один токен от себя. Если все три черновых токена угаданы, бонусный токен идёт сверху. Текст на выходе полностью совпадает с обычной генерацией, ускорение без потерь качества. В среднем модель выдаёт 2,73 токена за один шаг.
Что показали замеры?
По точности jina-ocr-v1 не лидирует. Это честно указано в самом техотчёте:
- На OmniDocBench v1.6 результат 91,14. У HunyuanOCR-1.5 выше, 94,74.
- На olmOCR-Bench результат 83,4. У dots.mocr выше, 83,9.
- Дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) добавило 7,4 балла к базовому DeepSeek-OCR на olmOCR-Bench.
Зато по скорости модель первая из 14 протестированных систем:
- 2,57 страниц в секунду на одном A100 40 ГБ при параллелизме 32.
- Для сравнения: olmOCR-2 даёт 1,22 страниц/с, chandra-ocr-2 даёт 0,38 страниц/с.
- Самый короткий выход среди систем с баллом выше 83: 1 085 токенов на страницу.
На бюджетной карте NVIDIA L4 при batch size 1 спекулятивное декодирование поднимает скорость с 42,7 до 83,1 токена в секунду, ускорение в 1,95 раза при доле принятых черновиков 57,6%.
Все замеры скорости проведены самой Jina AI, а не независимой лабораторией. Бенчмарки точности (OmniDocBench, olmOCR-Bench) публичные, но набор из 14 систем для сравнения скорости выбран авторами. Лицензия CC BY-NC 4.0 запрещает коммерческое использование без отдельного соглашения. Модель выдаёт Markdown, а не структурированный JSON, поэтому для интеграции в бизнес-процессы потребуется парсинг.
Как запустить прямо сейчас?
Самый быстрый способ попробовать OCR нейросеть онлайн: отправить URL на r.jina.ai с заголовком X-Respond-With: jina-ocr-v1. Сервис скачает страницу или PDF, прогонит через модель и вернёт Markdown. Заголовок X-Page позволяет обработать конкретную страницу многостраничного документа.
Jina AI также предоставляет эндпоинт, совместимый с API OpenAI, по адресу https://api.jina.ai/v1/chat/completions, и демо для быстрых тестов.
Для локального запуска веса и код загружаются из одного репозитория с параметром trust_remote_code=True. FastMTP работает начиная с vLLM версии 0.21. Путь через библиотеку Transformers запускает только декодер без спекулятивной генерации.
Что это меняет для вас?
Авторам Дзена и копирайтерам. Если вы работаете с PDF-источниками, отчётами, сканами книг или статей, jina-ocr-v1 через Jina Reader превращает их в чистый текст с сохранением таблиц и формул. Это экономит ручной перенабор. Попробуйте OCR нейросеть онлайн через r.jina.ai, чтобы оценить качество на своих документах.
Маркетологам. Пакетная обработка счетов, коммерческих предложений, прайс-листов в Markdown, готовый для загрузки в CRM или аналитику, реальный сценарий. Скорость 2,57 страниц в секунду означает, что пачка из 100 страниц обрабатывается меньше чем за минуту.
Разработчикам и предпринимателям в РФ. Веса открыты, 6,8 ГБ в BF16, помещаются на NVIDIA L4 (карту за условные 30 тысяч рублей на вторичном рынке). Для некоммерческих проектов развернуть модель можно уже сегодня. Для коммерческих нужно писать в Jina AI. Из доступных в России альтернатив для распознавания документов есть PaddleOCR (открытый проект Baidu) и Yandex Vision OCR, но прямого аналога с MoE-декодером и спекулятивной генерацией среди российских решений пока нет.
Jina AI сделала ставку не на рекордную точность, а на скорость и доступность, и это выглядит прагматично. Разница в точности с лидерами (91,14 против 94,74 у HunyuanOCR) заметна, но для большинства задач, перенос текста из сканов в редактируемый формат, этого хватает. Меня лично подкупает честность техотчёта: авторы прямо пишут, что по точности не первые. Для тех, кто работает с большими массивами документов на бюджетном железе, это сейчас один из самых практичных вариантов среди OCR нейросетей с открытыми весами.
Модель доступна на Hugging Face и через Jina Reader уже сейчас. Если у вас есть NVIDIA L4 или лучше, попробуйте на своих документах и сравните с тем, чем пользуетесь: скорость вы заметите сразу, а качество проверяется за пять минут на десятке реальных страниц.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Лучшие ноутбуки для машинного обучения: почему ML-разработчик ушёл с MacBook на Linux
Почему это важно Автор с реальным опытом миграции с MacBook на Linux и x86 разбирает, почему CUDA и совместимость с Linux перевешивают удобство macOS, и…

Шведский стартап создал дрон с ИИ без облака: НАТО уже тестирует технологию
Компания Scaleout Systems, выросшая из шведского университетского проекта, в 2025 году вошла в акселератор NATO DIANA с решением, которое позволяет небольшим…

Google показала, что такое ИИ-агент для семьи: один бот на шестерых вместо десятка чатов
Google превратила CC из личного помощника в семейного ИИ-агента с собственным аккаунтом, общей памятью и доступом к календарю, почте и задачам, и теперь до…
Комментарии