Игорь Градов
Игорь Градов
5 мин
ai

Коляска Сайбокс ускорила обработку счетов в 6 раз, заменив модель на 72 млрд параметров компактной

Коляска Сайбокс и ИАД: замена модели ускорила обработку счетов в 6 раз и убрала 70% ручных проверок

Коляска Сайбокс ускорила обработку счетов в 6 раз, заменив модель на 72 млрд параметров компактной

Российские разработчики платформ ИАД и Сайбокс в октябре 2025 года заменили тяжёлую модель распознавания документов на компактную nanonets-ocr2-3b и сократили обработку одного счёта с трёх-четырёх минут до тридцати секунд.

Почему это важно

Раньше автоматизация бухгалтерских документов через ИИ порождала дополнительные ошибки: модель выдумывала числа, путала строки таблиц, и почти 60% результатов приходилось перепроверять вручную. Теперь на том же оборудовании проходит в пять раз больше документов, а ручных проверок стало на 70% меньше.

Источник обновления, команда разработки продуктов ИАД и Сайбокс. Компания провела собственное исследование восьми OCR-моделей (OCR, оптическое распознавание символов, технология, которая «читает» текст с изображений и PDF) и нескольких методов предобработки изображений. По итогам тяжёлую модель Qwen2.5-VL-72B, которая весит 72 миллиарда параметров, заменили на nanonets-ocr2-3b с тремя миллиардами параметров. Результат: меньше «железа», меньше ошибок, быстрее поток.

Что Когда Кто выпустил Цена
Обновлённый конвейер распознавания документов на базе nanonets-ocr2-3b Октябрь 2025 Команда ИАД и Сайбокс Не раскрыта

Что изменилось после обновления?

  • Скорость обработки одного счёта упала с 3-4 минут до 30 секунд. Это примерно в шесть раз быстрее.
  • Ручные проверки сократились на 70%. Модель перестала добавлять «мусор», не выдумывает числа и не ломает структуру таблиц. До замены проверять вручную приходилось почти в 60% случаев.
  • Пропускная способность выросла в 5 раз на том же оборудовании. Компактная модель занимает меньше ресурсов GPU (видеокарты, на которых работают нейросети), и освободившиеся мощности идут на поточную обработку.
  • Таблицы распознаются как HTML за 1 секунду. Раньше результат OCR прогонялся через вторую большую языковую модель (LLM, нейросеть, которая понимает и генерирует текст), чтобы разобрать таблицу. Это добавляло минимум 30 секунд и новые галлюцинации (галлюцинация, когда ИИ уверенно выдаёт несуществующие данные). Теперь промежуточное звено убрано.
  • Из восьми протестированных моделей лучшей по точности стала nanonets-ocr2-3b, а dots.ocr добавлена как быстрый режим для пакетной обработки.
  • Из всех методов предобработки изображений сработали только два: перевод в чёрно-белое и поворот. Увеличение контрастности, резкости, бинаризация и другие фильтры не улучшили, а иногда ухудшили результат.

Интересная деталь: команда обнаружила, что современные OCR-модели на основе глубокого обучения уже содержат встроенные механизмы обработки изображений и лучше работают с минимально обработанными данными. Избыточная предобработка вносит артефакты, которые мешают распознаванию.

Как попробовать?

  1. Обратитесь к команде ИАД или Сайбокс для подключения к пилотному потоку анализа финансовых документов. Модель уже развёрнута на платформе Сайбокс.
  2. Подготовьте тестовую выборку документов: счета, договоры. Сейчас конфигурация работает с этими типами, дальше планируется масштабирование на накладные и технические задания.
  3. Для пакетной обработки, где критична скорость, уточните возможность использования режима dots.ocr. Для случаев, где важна максимальная точность, подойдёт nanonets-ocr2-3b.

Есть ли аналоги в России?

Коляска Сайбокс и ИАД сами по себе российские продукты, так что вопрос скорее в сравнении подходов. На рынке РФ задачи распознавания документов решают, например, ABBYY FineReader (с ограничениями после ухода компании), «Контур.Распознавание», а также встроенные инструменты «1С». Из ИИ-платформ, YandexGPT и GigaChat умеют работать с текстом, но заточены под генерацию, а не под точное извлечение табличных данных из сканов.

Принципиальное отличие подхода ИАД и Сайбокс: они не просто подключили «умную» модель, а провели сравнительное исследование восьми моделей, выбрали компактную вместо гигантской и убрали лишнее звено в цепочке. Для компании, которая обрабатывает сотни счетов в день, разница между 4 минутами и 30 секундами на документ, это разница между одним оператором и десятью.

Что с этого прямо сейчас, по ролям?

Автору на Дзене. Если пишете про бухгалтерию, документооборот или автоматизацию бизнеса, коляска Сайбокс и обновление ИАД дают конкретный кейс с цифрами для контента. Шесть раз быстрее, 70% меньше ручной работы, это готовый сценарий для статьи или сравнительного обзора.

Маркетологу. Коммерческий аргумент для клиентов, которые работают с большими объёмами документов: «на том же оборудовании в пять раз больше документов» звучит убедительнее, чем «мы внедрили ИИ».

Предпринимателю в РФ. Оба продукта российские, санкционных рисков нет. Если ваш бизнес обрабатывает десятки или сотни бухгалтерских документов в день, стоит запросить пилот: экономия на ручных проверках при 70% сокращении может окупить интеграцию за недели.

Мнение редакции dzen.guru

По моим наблюдениям, большинство российских компаний до сих пор распознают счета либо вручную, либо через устаревшие шаблонные системы. Подход ИАД и Сайбокс ценен не самой моделью (nanonets-ocr2-3b доступна и отдельно), а тем, что команда выстроила цепочку без промежуточной LLM и проверила это на реальных бухгалтерских документах.

Оговорка: пока конфигурация работает только со счетами и договорами. Накладные и техзадания, это планы, не факт. И цену подключения команда не раскрыла, так что считать ROI до запроса невозможно.

Что сделать сегодня: если у вас есть поток документов для распознавания, отправьте пять-десять типичных сканов на тест. Это быстрее, чем читать бенчмарки, и покажет, справляется ли модель с вашим конкретным форматом.

Частые вопросы

Нужно ли покупать специальное оборудование для работы с обновлённой моделью?

Нет. Одно из главных преимуществ замены: модель nanonets-ocr2-3b в 24 раза компактнее предыдущей (3 миллиарда параметров против 72 миллиардов). По данным команды, пропускная способность выросла в 5 раз на том же оборудовании.

Подойдёт ли это для документов, отличных от счетов?

Пока модель внедрена в пилотные потоки для финансовых документов (счета, договоры). Команда планирует масштабирование на накладные и технические задания, но сроков не назвала. Если ваши документы содержат таблицы с числовыми данными, логика та же, но результат нужно проверять на вашей выборке.

Что, если модель всё-таки ошибётся в числах?

Галлюцинации не исчезли полностью, но их стало значительно меньше: ручные проверки сократились на 70%, а не на 100%. Для критичных документов (договоры с крупными суммами, юридические акты) выборочная проверка по-прежнему нужна. Полная автоматизация без контроля пока остаётся риском для любой OCR-системы.

Главный вывод для практика: не гонитесь за самой большой моделью. Исследование ИАД и Сайбокс показало, что компактная модель на 3 миллиарда параметров обошла гиганта на 72 миллиарда и по точности, и по скорости, и по стоимости эксплуатации. Иногда меньше действительно лучше.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Cursor запустил альтернативу GitHub

Cursor, ИИ-стартап, ставший частью SpaceX, на этой неделе запустил Origin, собственную платформу для хранения и совместной работы с кодом, которая работает…

5 мин
TerraPower Гейтса строит дата-центры на ядерной энергии: натрий вместо батарей
ai

TerraPower Гейтса строит дата-центры на ядерной энергии: натрий вместо батарей

Компания TerraPower, основанная Биллом Гейтсом, в 2025 году объявит о первом проекте дата-центра на базе собственного ядерного реактора мощностью 345 мегаватт,…

5 мин
52% американцев тревожит искусственный интеллект: почему скепсис растёт и чем это грозит бизнесу
ai

52% американцев тревожит искусственный интеллект: почему скепсис растёт и чем это грозит бизнесу

Американцы всё меньше верят в пользу искусственного интеллекта: по данным Pew Research, 52% говорят, что технология вызывает у них скорее тревогу, чем…

5 мин