Vision language модель на 3 ГБ догнала конкурентов вдвое крупнее: Liquid AI показала LFM2.5
Liquid AI вчера выпустила LFM2.5-VL-3B, компактную vision language модель на 3,1 миллиарда параметров, которая читает экраны смартфонов, десктопов и веб-страниц, умещаясь в 3 гигабайта оперативной памяти.
Модель с 3,1 млрд параметров догнала по качеству конкурентов размером 4,7 млрд, при этом работает прямо на устройстве без облака и впервые в линейке умеет вызывать внешние функции по картинке или тексту.
Vision language модели (модели, которые одновременно понимают текст и изображения) обычно требуют мощных серверов или облачного доступа. Liquid AI позиционирует LFM2.5-VL-3B как альтернативу, способную работать локально: на ноутбуке, в смартфоне, в промышленном контроллере. Модель появилась на фоне гонки за компактные мультимодальные (объединяющие несколько типов данных: текст, изображение, звук) решения, где конкурируют Google, Alibaba и сообщество InternVL. Об этом сообщает Marktechpost со ссылкой на технический отчёт Liquid AI.
| Показатель | Значение | Источник |
|---|---|---|
| Число параметров | 3,1 млрд | Liquid AI |
| Средний балл по 28 бенчмаркам зрения | 69,4 | Liquid AI |
| Результат InternVL-3.5-4B (4,7 млрд) по тем же 28 тестам | 69,4 | Liquid AI |
| Результат Qwen3.5-4B (4,7 млрд) по тем же 28 тестам | 70,1 | Liquid AI |
| ScreenSpot-v2 (понимание экранов) | 80,7 | Liquid AI |
| RefCOCO-avg (точность привязки объектов к координатам) | 87,9 (было 57,1) | Liquid AI |
| Скорость декодирования, Apple M5 Max | 228 токенов/с | Liquid AI |
| Скорость декодирования, Galaxy S26 Ultra | 20 токенов/с | Liquid AI |
| Объём оперативной памяти | около 3 ГБ | Liquid AI |
| Поддерживаемые языки | 16 | Liquid AI |
| Контекстное окно | 32 768 токенов | Liquid AI |
| Порог бесплатной коммерческой лицензии | 10 млн долларов годовой выручки | Liquid AI |
Что измеряли?
Liquid AI прогнала модель через 28 стандартных тестов для vision language моделей. Тесты проверяют, насколько хорошо модель понимает фотографии реального мира, читает документы и графики, распознаёт текст на изображениях и находит нужный элемент на экране по текстовому описанию.
Отдельно замерили три новых направления, которых не было в предыдущей версии LFM2-VL-3B:
- Понимание экранов (ScreenSpot-v2): модели показывают скриншот и просят указать координаты кнопки, поля ввода или ссылки. Это основа для ИИ-агентов (программ, которые сами нажимают кнопки и заполняют формы в интерфейсе).
- Вызов функций (ToolSandbox, BFCL v4): модель получает изображение или текст и должна сгенерировать правильный вызов внешнего инструмента, например API платёжной системы или поискового сервиса.
- Работа с несколькими изображениями (BLINK, MuirBench): модели дают два или больше снимков и спрашивают, чем они отличаются, или просят сравнить документы.
Все замеры Liquid AI проводила сама, используя среду vLLM версии 0.26.0 в режиме без рассуждений (модель отвечает сразу, не выстраивая цепочку промежуточных шагов).
Что обнаружили?
- Компактность не помешала точности. Средний балл 69,4 по 28 тестам совпал с InternVL-3.5-4B и отстал от Qwen3.5-4B всего на 0,7 балла. Оба конкурента содержат 4,7 млрд параметров, то есть на полтора миллиарда больше.
- Экраны модель понимает лучше конкурентов своего класса. ScreenSpot-v2 показал 80,7 (мобильные 81,2, веб 82,2, десктоп 78,7). Для сравнения: Gemma-4-E4B набрала 51,2, Qwen3.5-4B набрала 78,5. Более крупная InternVL-3.5-4B впереди с 84,1.
- Вызов функций появился с нуля. В предыдущей версии этой возможности не было. ToolSandbox вырос с 26,4 до 59,5, BFCL v4 с 20,5 до 32,5.
- Привязка объектов к координатам стала точнее на 30 пунктов. RefCOCO-avg поднялся с 57,1 до 87,9, по данным Liquid AI, за счёт расширенных синтетических данных для обучения.
- Работа с несколькими картинками улучшилась. BLINK вырос с 50,2 до 61,5, MuirBench с 34,9 до 58,3.
- Скорость на устройстве. 228 токенов (токен, это примерно одно слово или часть слова) в секунду на Apple M5 Max, 20 токенов в секунду на Samsung Galaxy S26 Ultra.
- Есть регресс. CountBenchQA (тест на подсчёт объектов на изображении) упал с 92,2 до 87,3 по сравнению с предыдущей версией.
Все 28 бенчмарков замерены самой Liquid AI, независимого воспроизведения на момент публикации нет. Сравнение с InternVL-3.5-4B и Qwen3.5-4B тоже приводит Liquid AI, а не третья сторона. Модель нерассуждающая: она отвечает быстро, но не выстраивает цепочку логических шагов, что ограничивает сложные задачи, требующие последовательного анализа. Словарь расширен до 128 000 токенов для лучшей работы с нелатинскими письменностями, однако детальных тестов именно на русском языке Liquid AI не опубликовала.
Что это значит для вас?
Авторам Дзена и копирайтерам. Модель распознаёт текст в PDF, счетах, скриншотах с точностью DocVQA 91,1 и OCRBench v1 84,2. Если вы регулярно вытягиваете цитаты из скриншотов или переводите инфографику в текст, LFM2.5-VL-3B можно запустить локально на ноутбуке с 8 ГБ оперативной памяти без подписки на облако. 16 поддерживаемых языков, включая русский, делают модель пригодной для работы с кириллицей, хотя отдельных тестов на русском пока нет.
Маркетологам и тестировщикам. Понимание экранов (ScreenSpot-v2: 80,7) и новая функция вызова внешних инструментов открывают путь к автоматизации интерфейсов: модель может сама находить кнопку на скриншоте и генерировать вызов нужного API. Для тех, кто строит RPA-сценарии (программы-роботы, которые кликают и заполняют формы вместо человека), это потенциальная замена облачных решений.
Предпринимателям в РФ и СНГ. Лицензия LFM Open v1.0 разрешает бесплатное коммерческое использование компаниям с годовой выручкой до 10 млн долларов. Исследования, образование и некоммерческие проекты не имеют ограничений по выручке. Модель поставляется в четырёх форматах (native, GGUF, ONNX, MLX) и работает через llama.cpp, vLLM, SGLang и MLX с первого дня. Из российских аналогов по задаче понимания изображений можно рассматривать YandexGPT с мультимодальным режимом, но он работает только через облако и не запускается локально.
Я обращаю внимание на два момента. Первый: расширение словаря до 128 000 токенов с явным фокусом на нелатинские письменности, это практический шаг для тех, кто хочет строить screen-based ИИ-агентов на русском языке. Второй: порог в 10 млн долларов годовой выручки для бесплатного коммерческого использования накрывает почти весь российский малый и средний бизнес. Однако все бенчмарки приводит сама Liquid AI, и пока сообщество не воспроизведёт результаты, к цифрам стоит относиться как к заявке, а не к установленному факту. Регресс в CountBenchQA тоже настораживает: модель стала хуже считать объекты, и компания не объяснила почему.
Модель уже доступна для скачивания с открытыми весами (веса, это числовые параметры, из которых состоит обученная нейросеть). Если ваш бизнес укладывается в лицензионный порог и вам нужен локальный анализ экранов или документов без отправки данных в облако, LFM2.5-VL-3B стоит протестировать прямо сейчас, пока конкуренты той же весовой категории требуют больше памяти за сопоставимый результат.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Разработка AI-агента для отладки кода: архитектура «Агента Смита» от ТестОпс
Команда ТестОпс за несколько месяцев собрала внутреннего ИИ-агента (программу, которая сама выполняет цепочку действий без постоянных команд человека),…
Qwen локально на 16 ГБ: квант Q3 справился с отладкой 6 000 строк кода
Qwen локально на 16 ГБ видеопамяти можно запустить уже сейчас, причём в квантах ниже «джентльменского» Q4, и получить рабочий результат на реальной задаче с…

Цифровизация и искусственный интеллект глазами детей: 57% подростков уже используют чат-ботов
Дети используют ИИ чаще, чем думают взрослые, и при этом чётко понимают, что готовы ему доверить, а что нет: исследование Common Sense Media и данные Pew…
Комментарии