Игорь Градов
Игорь Градов
6 мин
ai

Cohere Parse 5: vision language модель с 2,3 млрд параметров заменяет OCR за $1,50 на 1 000 страниц

Cohere выпустила Parse 5, модель для извлечения данных из PDF, презентаций и изображений, которая 10 июня стала доступна без листа ожидания через API, AWS SageMaker и Microsoft Foundry по фиксированной цене $1,50 за тысячу страниц.

Cohere Parse 5: vision language модель с 2,3 млрд параметров заменяет OCR за $1,50 на 1 000 страниц
Почему это важно

Parse 5 работает как vision language модель (модель, которая «видит» страницу целиком и понимает её структуру, а не просто распознаёт буквы), и это убирает отдельный этап распознавания текста: таблицы, списки, подписи к картинкам и порядок чтения модель восстанавливает за один проход.

До сих пор обработка сканов и сложных PDF в корпоративных конвейерах требовала цепочки инструментов: сначала OCR (оптическое распознавание символов), затем парсер таблиц, затем разметка. Cohere объединила всё в одну модель с 2,3 млрд параметров, которую можно запустить и через облачный API, и на выделенном сервере внутри контура компании. Источник технических деталей и бенчмарков: публикация Marktechpost.

Что Когда Кто выпустил Цена
Parse 5 (parse-v5.0), vision language модель для анализа документов Июнь 2025, общий доступ без листа ожидания Cohere API: $1,50 за 1 000 страниц. Выделенный сервер Model Vault: от $2 500/мес (Medium) до $4 300/мес (XL)

Что Parse 5 делает за один проход?

  • Читает PDF, PPT и JPEG и отдаёт результат в формате Markdown: текст в порядке чтения, таблицы в HTML, списки, пары «ключ, значение» из форм, описания изображений и координаты элементов на странице.
  • Не требует отдельного OCR. Модель сама распознаёт текст, структуру и визуальные элементы, не нужна предварительная цепочка инструментов.
  • Два режима вывода. По умолчанию возвращается Markdown-строка на каждую страницу. Режим «blocks» отдаёт типизированные блоки: у таблицы есть HTML, координаты и описание, что позволяет ссылаться на конкретный фрагмент документа.
  • Девять стабильных языков: арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский, испанский. Остальные языки поддерживаются в режиме zero-shot (модель пытается обработать без специальной настройки), но с меньшей точностью.
  • Компактная модель: 2,3 млрд параметров, контекстное окно 8 192 токена (токен, это фрагмент текста, примерно 3/4 слова), размер около 4,6 ГБ. Построена на архитектуре North-Micro-Vision-Instruct от Cohere Labs.

Бенчмарк: 79,2 балла, но с оговоркой

Cohere заявляет 79,2 балла по бенчмарку ParseBench, разработанному LlamaIndex. Это выше, чем у Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4), но по данным Marktechpost, оценка Cohere усреднена по трём из пяти измерений: таблицы, верность содержания, семантическое форматирование. Два измерения, графики и визуальная привязка, исключены.

На полном пятимерном лидерборде ParseBench первое место занимает LlamaParse Agentic с результатом 84,88 балла, а те же конкуренты набирают заметно меньше: Mistral OCR 4 и Databricks AI Parse, по 60,68, Azure Document Intelligence (Layout), 59,64. Cohere Parse на этом лидерборде пока не представлен.

Вывод: 79,2 это заявление вендора по неполной методике, а не позиция в независимом рейтинге. Проверять стоит на своих документах.

Когда выделенный сервер выгоднее API?

По данным Cohere, при цене API $0,0015 за страницу выделенный сервер Medium ($2 500/мес) окупается только при обработке примерно 1,67 млн страниц в месяц, а XL ($4 300/мес) при 2,87 млн страниц. Ниже этих объёмов дешевле платить за API поштучно.

Компании переходят на выделенные серверы Model Vault обычно не ради экономии, а ради хранения данных внутри собственного контура.

Как попробовать?

  1. Зарегистрируйтесь на сайте Cohere и получите бесплатный пробный API-ключ, лист ожидания отсутствует.
  2. Отправьте страницу PDF, PPT или JPEG в API-запрос как base64-закодированный URI (документация доступна на сайте Cohere).
  3. Получите ответ в Markdown: текст, HTML-таблицы, координаты элементов. Для детальной работы переключите параметр output_format на «blocks».
  4. Для тестирования без кода попробуйте демо на Hugging Face (ссылка указана в публикации Marktechpost).

Сравнение с российскими инструментами

Русский язык не входит в список девяти стабильных языков Parse 5. Модель может обработать русскоязычный документ в режиме zero-shot, но Cohere не гарантирует качество.

Параметр Cohere Parse 5 YandexGPT / GigaChat
Русский язык Zero-shot, без гарантий Родной язык, стабильная поддержка
Извлечение таблиц из PDF Да, с HTML и координатами Ограниченно, зависит от конкретного API
Доступ из РФ Через AWS/Azure, возможны ограничения Прямой доступ
Фиксированная цена $1,50 за 1 000 страниц Тарифы в рублях, зависят от модели

Для русскоязычных документов на практике разумнее начинать с отечественных решений и тестировать Parse 5 на английских или мультиязычных материалах, где он покрывает девять языков стабильно.

Что это значит для вас, по ролям?

Авторам Дзена и копирайтерам. Если вы работаете с источниками в PDF (исследования, отчёты, презентации), Parse 5 может вытащить текст и таблицы в Markdown за секунды. Это экономит часы ручного копирования, но только для документов на поддерживаемых языках.

Маркетологам. Фиксированная цена $1,50 за тысячу страниц позволяет заранее посчитать бюджет на обработку клиентских документов, прайсов, каталогов. Нет скрытых наценок за локализацию, но русский язык пока без гарантий.

Предпринимателям РФ и СНГ. Модель доступна через AWS SageMaker и Microsoft Foundry, но доступ из России зависит от санкционных ограничений облачных провайдеров. Прежде чем строить конвейер на Parse 5, проверьте, работает ли API из вашего региона, и протестируйте на русскоязычных документах: результат может оказаться нестабильным.

Мнение редакции dzen.guru

Parse 5 выглядит как рабочий инструмент для тех, кто перерабатывает тысячи страниц на английском и основных европейских языках. Цена прозрачная, модель компактная, отдельный OCR не нужен.

Но я бы не торопился выстраивать на ней процессы для русскоязычных документов. Русский не в списке стабильных языков, и реальное качество zero-shot на кириллице пока никто независимо не замерил. Если у вас основной поток документов на русском, сначала прогоните через Parse 5 десяток типичных файлов и сравните результат с тем, что даёт, скажем, YandexGPT или ручной парсер.

Заявленные 79,2 балла по бенчмарку тоже стоит воспринимать спокойно: Cohere исключила два из пяти измерений, и на полном лидерборде модель пока не представлена.

Что сделать сегодня: возьмите бесплатный API-ключ, загрузите пять своих типичных документов (включая один на русском) и оцените, насколько точно модель восстанавливает таблицы и порядок чтения. Десять минут покажут больше, чем любой бенчмарк.

Частые вопросы

Parse 5 понимает русский язык?

Формально, да, в режиме zero-shot: модель попытается обработать русскоязычный документ, даже если не обучена на нём прицельно. Но русский не входит в девять стабильных языков (арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский, испанский), поэтому качество может быть ниже и его нужно проверять на своих файлах.

Чем Parse 5 отличается от обычного OCR?

Обычный OCR распознаёт буквы и слова, а затем нужен отдельный инструмент, чтобы понять структуру: где таблица, где заголовок, в каком порядке читать колонки. Parse 5 как vision language модель «видит» всю страницу целиком и за один проход возвращает и текст, и структуру, и координаты элементов. Отдельный этап OCR не требуется.

Сколько это стоит и когда выгоднее брать выделенный сервер?

API стоит $1,50 за 1 000 страниц (то есть $0,0015 за страницу). Выделенный сервер Model Vault, от $2 500 в месяц. По расчётам Cohere, сервер окупается только при объёме от 1,67 млн страниц в месяц. Для большинства команд API дешевле.

Компактная модель в 2,3 млрд параметров, фиксированная цена и отсутствие отдельного OCR делают Parse 5 практичным выбором для англоязычных документов уже сейчас, а для русскоязычных десять минут с пробным ключом покажут, готов ли инструмент к вашим задачам.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Робот утка от Hugging Face за $399: опенсорс, лидар и уникальный голос
ai

Робот утка от Hugging Face за $399: опенсорс, лидар и уникальный голос

Hugging Face через подразделение Pollen Robotics открыла предзаказ на Microduck, десятидюймового одноглазого робота утку на роликах, который поёт собственным…

4 мин
Gemini 3.5 Transcribe переводит речь в текст нейросетью с ошибкой 2,6% на 85+ языках
ai

Gemini 3.5 Transcribe переводит речь в текст нейросетью с ошибкой 2,6% на 85+ языках

Google выпустила Gemini 3.5 Transcribe, модель для перевода речи в текст, и разделила её на два отдельных API-сервиса: один для потоковой работы в реальном…

6 мин
Лимиты Claude AI падают на треть с 1 сентября: новый токенизатор удваивает потери
ai

Лимиты Claude AI падают на треть с 1 сентября: новый токенизатор удваивает потери

Компания Anthropic завершает промоакцию Claude Code 31 августа 2026 года, и недельные лимиты на использование упадут на треть от привычного уровня, а новый…

6 мин