Cohere Parse 5: vision language модель с 2,3 млрд параметров заменяет OCR за $1,50 на 1 000 страниц
Cohere выпустила Parse 5, модель для извлечения данных из PDF, презентаций и изображений, которая 10 июня стала доступна без листа ожидания через API, AWS SageMaker и Microsoft Foundry по фиксированной цене $1,50 за тысячу страниц.

Parse 5 работает как vision language модель (модель, которая «видит» страницу целиком и понимает её структуру, а не просто распознаёт буквы), и это убирает отдельный этап распознавания текста: таблицы, списки, подписи к картинкам и порядок чтения модель восстанавливает за один проход.
До сих пор обработка сканов и сложных PDF в корпоративных конвейерах требовала цепочки инструментов: сначала OCR (оптическое распознавание символов), затем парсер таблиц, затем разметка. Cohere объединила всё в одну модель с 2,3 млрд параметров, которую можно запустить и через облачный API, и на выделенном сервере внутри контура компании. Источник технических деталей и бенчмарков: публикация Marktechpost.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Parse 5 (parse-v5.0), vision language модель для анализа документов | Июнь 2025, общий доступ без листа ожидания | Cohere | API: $1,50 за 1 000 страниц. Выделенный сервер Model Vault: от $2 500/мес (Medium) до $4 300/мес (XL) |
Что Parse 5 делает за один проход?
- Читает PDF, PPT и JPEG и отдаёт результат в формате Markdown: текст в порядке чтения, таблицы в HTML, списки, пары «ключ, значение» из форм, описания изображений и координаты элементов на странице.
- Не требует отдельного OCR. Модель сама распознаёт текст, структуру и визуальные элементы, не нужна предварительная цепочка инструментов.
- Два режима вывода. По умолчанию возвращается Markdown-строка на каждую страницу. Режим «blocks» отдаёт типизированные блоки: у таблицы есть HTML, координаты и описание, что позволяет ссылаться на конкретный фрагмент документа.
- Девять стабильных языков: арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский, испанский. Остальные языки поддерживаются в режиме zero-shot (модель пытается обработать без специальной настройки), но с меньшей точностью.
- Компактная модель: 2,3 млрд параметров, контекстное окно 8 192 токена (токен, это фрагмент текста, примерно 3/4 слова), размер около 4,6 ГБ. Построена на архитектуре North-Micro-Vision-Instruct от Cohere Labs.
Бенчмарк: 79,2 балла, но с оговоркой
Cohere заявляет 79,2 балла по бенчмарку ParseBench, разработанному LlamaIndex. Это выше, чем у Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4), но по данным Marktechpost, оценка Cohere усреднена по трём из пяти измерений: таблицы, верность содержания, семантическое форматирование. Два измерения, графики и визуальная привязка, исключены.
На полном пятимерном лидерборде ParseBench первое место занимает LlamaParse Agentic с результатом 84,88 балла, а те же конкуренты набирают заметно меньше: Mistral OCR 4 и Databricks AI Parse, по 60,68, Azure Document Intelligence (Layout), 59,64. Cohere Parse на этом лидерборде пока не представлен.
Вывод: 79,2 это заявление вендора по неполной методике, а не позиция в независимом рейтинге. Проверять стоит на своих документах.
Когда выделенный сервер выгоднее API?
По данным Cohere, при цене API $0,0015 за страницу выделенный сервер Medium ($2 500/мес) окупается только при обработке примерно 1,67 млн страниц в месяц, а XL ($4 300/мес) при 2,87 млн страниц. Ниже этих объёмов дешевле платить за API поштучно.
Компании переходят на выделенные серверы Model Vault обычно не ради экономии, а ради хранения данных внутри собственного контура.
Как попробовать?
- Зарегистрируйтесь на сайте Cohere и получите бесплатный пробный API-ключ, лист ожидания отсутствует.
- Отправьте страницу PDF, PPT или JPEG в API-запрос как base64-закодированный URI (документация доступна на сайте Cohere).
- Получите ответ в Markdown: текст, HTML-таблицы, координаты элементов. Для детальной работы переключите параметр output_format на «blocks».
- Для тестирования без кода попробуйте демо на Hugging Face (ссылка указана в публикации Marktechpost).
Сравнение с российскими инструментами
Русский язык не входит в список девяти стабильных языков Parse 5. Модель может обработать русскоязычный документ в режиме zero-shot, но Cohere не гарантирует качество.
| Параметр | Cohere Parse 5 | YandexGPT / GigaChat |
|---|---|---|
| Русский язык | Zero-shot, без гарантий | Родной язык, стабильная поддержка |
| Извлечение таблиц из PDF | Да, с HTML и координатами | Ограниченно, зависит от конкретного API |
| Доступ из РФ | Через AWS/Azure, возможны ограничения | Прямой доступ |
| Фиксированная цена | $1,50 за 1 000 страниц | Тарифы в рублях, зависят от модели |
Для русскоязычных документов на практике разумнее начинать с отечественных решений и тестировать Parse 5 на английских или мультиязычных материалах, где он покрывает девять языков стабильно.
Что это значит для вас, по ролям?
Авторам Дзена и копирайтерам. Если вы работаете с источниками в PDF (исследования, отчёты, презентации), Parse 5 может вытащить текст и таблицы в Markdown за секунды. Это экономит часы ручного копирования, но только для документов на поддерживаемых языках.
Маркетологам. Фиксированная цена $1,50 за тысячу страниц позволяет заранее посчитать бюджет на обработку клиентских документов, прайсов, каталогов. Нет скрытых наценок за локализацию, но русский язык пока без гарантий.
Предпринимателям РФ и СНГ. Модель доступна через AWS SageMaker и Microsoft Foundry, но доступ из России зависит от санкционных ограничений облачных провайдеров. Прежде чем строить конвейер на Parse 5, проверьте, работает ли API из вашего региона, и протестируйте на русскоязычных документах: результат может оказаться нестабильным.
Parse 5 выглядит как рабочий инструмент для тех, кто перерабатывает тысячи страниц на английском и основных европейских языках. Цена прозрачная, модель компактная, отдельный OCR не нужен.
Но я бы не торопился выстраивать на ней процессы для русскоязычных документов. Русский не в списке стабильных языков, и реальное качество zero-shot на кириллице пока никто независимо не замерил. Если у вас основной поток документов на русском, сначала прогоните через Parse 5 десяток типичных файлов и сравните результат с тем, что даёт, скажем, YandexGPT или ручной парсер.
Заявленные 79,2 балла по бенчмарку тоже стоит воспринимать спокойно: Cohere исключила два из пяти измерений, и на полном лидерборде модель пока не представлена.
Что сделать сегодня: возьмите бесплатный API-ключ, загрузите пять своих типичных документов (включая один на русском) и оцените, насколько точно модель восстанавливает таблицы и порядок чтения. Десять минут покажут больше, чем любой бенчмарк.
Частые вопросы
Parse 5 понимает русский язык?
Формально, да, в режиме zero-shot: модель попытается обработать русскоязычный документ, даже если не обучена на нём прицельно. Но русский не входит в девять стабильных языков (арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский, испанский), поэтому качество может быть ниже и его нужно проверять на своих файлах.
Чем Parse 5 отличается от обычного OCR?
Обычный OCR распознаёт буквы и слова, а затем нужен отдельный инструмент, чтобы понять структуру: где таблица, где заголовок, в каком порядке читать колонки. Parse 5 как vision language модель «видит» всю страницу целиком и за один проход возвращает и текст, и структуру, и координаты элементов. Отдельный этап OCR не требуется.
Сколько это стоит и когда выгоднее брать выделенный сервер?
API стоит $1,50 за 1 000 страниц (то есть $0,0015 за страницу). Выделенный сервер Model Vault, от $2 500 в месяц. По расчётам Cohere, сервер окупается только при объёме от 1,67 млн страниц в месяц. Для большинства команд API дешевле.
Компактная модель в 2,3 млрд параметров, фиксированная цена и отсутствие отдельного OCR делают Parse 5 практичным выбором для англоязычных документов уже сейчас, а для русскоязычных десять минут с пробным ключом покажут, готов ли инструмент к вашим задачам.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Робот утка от Hugging Face за $399: опенсорс, лидар и уникальный голос
Hugging Face через подразделение Pollen Robotics открыла предзаказ на Microduck, десятидюймового одноглазого робота утку на роликах, который поёт собственным…

Gemini 3.5 Transcribe переводит речь в текст нейросетью с ошибкой 2,6% на 85+ языках
Google выпустила Gemini 3.5 Transcribe, модель для перевода речи в текст, и разделила её на два отдельных API-сервиса: один для потоковой работы в реальном…

Лимиты Claude AI падают на треть с 1 сентября: новый токенизатор удваивает потери
Компания Anthropic завершает промоакцию Claude Code 31 августа 2026 года, и недельные лимиты на использование упадут на треть от привычного уровня, а новый…
Комментарии