Игорь Градов
Игорь Градов
5 мин
ai

Мультимодальная нейросеть NeoMME догоняет модели в 14 раз крупнее: без декодера и модуля зрения

Компания H Company выпустила NeoMME, семейство мультимодальных энкодеров на 260 и 800 миллионов параметров, которые обрабатывают текст и изображения одним трансформером, без отдельного модуля зрения и без декодера, и при этом догоняют модели в 14 раз крупнее.

Мультимодальная нейросеть NeoMME догоняет модели в 14 раз крупнее: без декодера и модуля зрения
Почему это важно

Большинство систем визуального поиска по документам до сих пор строятся на перепрофилированных генеративных моделях, где отдельный «модуль зрения» и декодер тратят вычислительные ресурсы впустую. NeoMME убирает оба компонента и показывает сопоставимое качество при радикально меньшем размере, а значит, запускается на обычном серверном оборудовании.

Мультимодальная нейросеть (модель, которая работает сразу с несколькими типами данных: текстом, картинками, страницами документов) до сих пор чаще всего собиралась из нескольких крупных блоков. NeoMME заменяет эту конструкцию единым двунаправленным трансформером, обученным с нуля. Модели опубликованы под лицензией Apache 2.0 с поддержкой в Hugging Face Transformers. По данным статьи H Company, токенизатор (компонент, который разбивает текст на фрагменты для обработки) обучен на 14 языках и расходует на 44,4% меньше токенов (единиц обработки текста), чем ModernBERT, на тестовых данных FLORES-200.

Что Когда Кто выпустил Цена
NeoMME, семейство мультимодальных энкодеров (260M и 800M параметров) и NeoMME-Retriever для поиска по документам Дата релиза в источнике не указана, чекпоинты уже доступны на Hugging Face H Company Бесплатно, лицензия Apache 2.0

Один трансформер вместо трёх модулей

  • Нет отдельного модуля зрения (vision tower). Изображения разрезаются на фрагменты 32 на 32 пикселя и проецируются двухслойной MLP (простой нейросетью), обученной с нуля. Никакого предобученного SigLIP2 или аналогичного модуля.
  • Нет декодера. Классические визуальные поисковые модели, такие как ColPali, берут генеративную модель и переделывают её в энкодер, то есть часть архитектуры работает вхолостую. NeoMME изначально построена как энкодер.
  • Контекст до 16 384 токенов. Этого, по данным статьи, хватает на две страницы формата 4K UHD (3840 на 2160 пикселей) после нарезки на фрагменты.
  • Качество на уровне моделей в 14,4 раза крупнее. NeoMME-Retriever-260M набирает 0,523 nDCG@10 на бенчмарке ViDoRe v3. По данным статьи, это в пределах 0,002 от результата ColQwen2.5-v0.2, модели с 3,75 миллиарда параметров, и на 26,1 пункта выше лучшей другой модели до 300 миллионов параметров.
  • Скорость индексации. Модель на 260 миллионов параметров индексирует 51,3 страницы в секунду на одной видеокарте NVIDIA L40S и обрабатывает запрос за 78,3 миллисекунды на процессоре без GPU.
  • Сжатие индекса. Иерархическое объединение токенов с фактором 10 и квантизацией int8 уменьшает размер индекса в 39,4 раза (с примерно 1,5 МБ до 39 КБ на страницу), сохраняя 99,16% качества. Более агрессивное сжатие (фактор 8, бинарные документы) даёт 6 КБ на страницу, уменьшение в 255,5 раз с сохранением 95,19% качества.

Где слабые места?

Текстовый поиск без изображений заметно отстаёт. На бенчмарке BEIR-15 результат NeoMME (0,4881 для 260M, 0,5126 для 800M) уступает модели LateOn с 149 миллионами параметров (0,5722). Авторы связывают это с масштабом обучающих данных: NeoMME обучалась примерно на 430 тысячах текстовых запросов, тогда как mLateOn использовала порядка 660 миллионов контрастивных примеров.

Также авторы прямо указывают, что перенос на задачи распознавания естественных изображений (не документов) остаётся слабым местом.

Как попробовать?

  1. Откройте коллекцию моделей NeoMME на Hugging Face (ссылка в статье H Company). Все чекпоинты доступны без регистрации.
  2. Установите Hugging Face Transformers актуальной версии. Модели поддерживаются «из коробки» (day-zero support, то есть поддержка с момента публикации).
  3. Для визуального поиска по документам используйте NeoMME-Retriever. Для текстового поиска авторы рекомендуют модель на 800 миллионов параметров, но предупреждают об ограничениях, описанных выше.
  4. Для работы на сервере без GPU учтите: запрос обрабатывается за 78,3 мс на CPU. Для массовой индексации понадобится GPU уровня L40S.

Сравнение с российскими инструментами

Прямых аналогов NeoMME среди российских сервисов пока нет. YandexGPT и GigaChat работают как генеративные мультимодальные нейросети, но не предназначены для задачи поиска по визуальным документам в режиме энкодера. Ключевое отличие: NeoMME не генерирует текст, она превращает страницы и запросы в числовые представления (векторы) для поиска. Это инструмент для построения собственной поисковой системы по документам, а не чат-бот.

Для русскоязычных пользователей важно, что токенизатор NeoMME обучен на 14 языках, включая данные FLORES-200, и расходует значительно меньше токенов, чем альтернативы. Это означает, что модель работает с русским текстом без дополнительной адаптации, и документы на русском языке можно индексировать и искать на собственном сервере без передачи данных за рубеж.

Мнение редакции dzen.guru

Модель на 260 миллионов параметров, которая догоняет решение в 14 раз крупнее на задаче поиска по документам, это серьёзный аргумент для тех, кто строит внутренние базы знаний. Я вижу прямое применение для авторов и редакций: загрузить сканы договоров, инструкций, старых публикаций и искать по ним текстом или скриншотом. Для маркетолога: можно поднять локальный поиск по каталогам и презентациям без облачных API. Для предпринимателя в РФ: модель работает на одном сервере с GPU, данные не уходят за периметр, лицензия Apache 2.0 не ограничивает коммерческое использование.

Оговорка: текстовый поиск без визуальной составляющей пока слабее специализированных моделей. Если ваша задача — поиск по чистому тексту без сканов и изображений, NeoMME не лучший выбор. Но для смешанных документов (сканы, PDF со схемами, фото страниц) это один из самых компактных инструментов, доступных прямо сейчас.

Что сделать сегодня: скачайте чекпоинт NeoMME-260M с Hugging Face, проиндексируйте тестовую папку своих документов на русском и замерьте качество поиска на своих данных. Это займёт меньше часа.

Частые вопросы

NeoMME генерирует текст, как ChatGPT?

Нет. NeoMME — это энкодер (модель, которая превращает текст и изображения в числовые представления), а не генеративная модель. Она не пишет тексты и не ведёт диалог. Её задача — находить нужные документы по запросу: текстовому или визуальному.

Нужна ли мощная видеокарта для запуска?

Для обработки запросов хватает обычного процессора: 78,3 мс на один запрос без GPU, по данным авторов. Для массовой индексации большой библиотеки документов понадобится серверная видеокарта уровня NVIDIA L40S, на которой модель обрабатывает более 50 страниц в секунду.

Работает ли модель с русским языком?

Да. Токенизатор обучен на 14 языках, включая данные тестового набора FLORES-200. По данным авторов, он расходует на 44,4% меньше токенов, чем ModernBERT, что означает более эффективную обработку текстов, в том числе на русском. Модель можно развернуть на российском сервере, данные при этом не покидают ваш контур.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения
ai

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения

Нейросеть Qwen3.8-27B на Mac Studio второго июня 2025 года прошла локальный бенчмарк из 84 задач на C# и SwiftUI, и квантизованная (сжатая) 4-bit версия…

7 мин
Google и Cathay Pacific снизили тепловой след авиации на 40%: что значит для авиации и окружающей среды
ai

Google и Cathay Pacific снизили тепловой след авиации на 40%: что значит для авиации и окружающей среды

Google и Cathay Pacific провели первые в Азии лётные испытания ИИ-системы, которая прокладывает маршруты в обход зон образования инверсионных следов, и на…

4 мин
ai

Токеномика нейросетей получила свой Big-O: Linux Foundation учит считать расходы на токены

Под крылом Linux Foundation появилось новое направление, Tokenomics Foundation, и его первый проект уже позволяет оценить, во сколько на самом деле обходятся…

5 мин