Игорь Градов
Игорь Градов
5 мин
ai

Vision language модель на 3 ГБ догнала конкурентов вдвое крупнее: Liquid AI показала LFM2.5

Liquid AI вчера выпустила LFM2.5-VL-3B, компактную vision language модель на 3,1 миллиарда параметров, которая читает экраны смартфонов, десктопов и веб-страниц, умещаясь в 3 гигабайта оперативной памяти.

Почему это важно

Модель с 3,1 млрд параметров догнала по качеству конкурентов размером 4,7 млрд, при этом работает прямо на устройстве без облака и впервые в линейке умеет вызывать внешние функции по картинке или тексту.

Vision language модели (модели, которые одновременно понимают текст и изображения) обычно требуют мощных серверов или облачного доступа. Liquid AI позиционирует LFM2.5-VL-3B как альтернативу, способную работать локально: на ноутбуке, в смартфоне, в промышленном контроллере. Модель появилась на фоне гонки за компактные мультимодальные (объединяющие несколько типов данных: текст, изображение, звук) решения, где конкурируют Google, Alibaba и сообщество InternVL. Об этом сообщает Marktechpost со ссылкой на технический отчёт Liquid AI.

Показатель Значение Источник
Число параметров 3,1 млрд Liquid AI
Средний балл по 28 бенчмаркам зрения 69,4 Liquid AI
Результат InternVL-3.5-4B (4,7 млрд) по тем же 28 тестам 69,4 Liquid AI
Результат Qwen3.5-4B (4,7 млрд) по тем же 28 тестам 70,1 Liquid AI
ScreenSpot-v2 (понимание экранов) 80,7 Liquid AI
RefCOCO-avg (точность привязки объектов к координатам) 87,9 (было 57,1) Liquid AI
Скорость декодирования, Apple M5 Max 228 токенов/с Liquid AI
Скорость декодирования, Galaxy S26 Ultra 20 токенов/с Liquid AI
Объём оперативной памяти около 3 ГБ Liquid AI
Поддерживаемые языки 16 Liquid AI
Контекстное окно 32 768 токенов Liquid AI
Порог бесплатной коммерческой лицензии 10 млн долларов годовой выручки Liquid AI

Что измеряли?

Liquid AI прогнала модель через 28 стандартных тестов для vision language моделей. Тесты проверяют, насколько хорошо модель понимает фотографии реального мира, читает документы и графики, распознаёт текст на изображениях и находит нужный элемент на экране по текстовому описанию.

Отдельно замерили три новых направления, которых не было в предыдущей версии LFM2-VL-3B:

  • Понимание экранов (ScreenSpot-v2): модели показывают скриншот и просят указать координаты кнопки, поля ввода или ссылки. Это основа для ИИ-агентов (программ, которые сами нажимают кнопки и заполняют формы в интерфейсе).
  • Вызов функций (ToolSandbox, BFCL v4): модель получает изображение или текст и должна сгенерировать правильный вызов внешнего инструмента, например API платёжной системы или поискового сервиса.
  • Работа с несколькими изображениями (BLINK, MuirBench): модели дают два или больше снимков и спрашивают, чем они отличаются, или просят сравнить документы.

Все замеры Liquid AI проводила сама, используя среду vLLM версии 0.26.0 в режиме без рассуждений (модель отвечает сразу, не выстраивая цепочку промежуточных шагов).

Что обнаружили?

  • Компактность не помешала точности. Средний балл 69,4 по 28 тестам совпал с InternVL-3.5-4B и отстал от Qwen3.5-4B всего на 0,7 балла. Оба конкурента содержат 4,7 млрд параметров, то есть на полтора миллиарда больше.
  • Экраны модель понимает лучше конкурентов своего класса. ScreenSpot-v2 показал 80,7 (мобильные 81,2, веб 82,2, десктоп 78,7). Для сравнения: Gemma-4-E4B набрала 51,2, Qwen3.5-4B набрала 78,5. Более крупная InternVL-3.5-4B впереди с 84,1.
  • Вызов функций появился с нуля. В предыдущей версии этой возможности не было. ToolSandbox вырос с 26,4 до 59,5, BFCL v4 с 20,5 до 32,5.
  • Привязка объектов к координатам стала точнее на 30 пунктов. RefCOCO-avg поднялся с 57,1 до 87,9, по данным Liquid AI, за счёт расширенных синтетических данных для обучения.
  • Работа с несколькими картинками улучшилась. BLINK вырос с 50,2 до 61,5, MuirBench с 34,9 до 58,3.
  • Скорость на устройстве. 228 токенов (токен, это примерно одно слово или часть слова) в секунду на Apple M5 Max, 20 токенов в секунду на Samsung Galaxy S26 Ultra.
  • Есть регресс. CountBenchQA (тест на подсчёт объектов на изображении) упал с 92,2 до 87,3 по сравнению с предыдущей версией.
Как это читать

Все 28 бенчмарков замерены самой Liquid AI, независимого воспроизведения на момент публикации нет. Сравнение с InternVL-3.5-4B и Qwen3.5-4B тоже приводит Liquid AI, а не третья сторона. Модель нерассуждающая: она отвечает быстро, но не выстраивает цепочку логических шагов, что ограничивает сложные задачи, требующие последовательного анализа. Словарь расширен до 128 000 токенов для лучшей работы с нелатинскими письменностями, однако детальных тестов именно на русском языке Liquid AI не опубликовала.

Что это значит для вас?

Авторам Дзена и копирайтерам. Модель распознаёт текст в PDF, счетах, скриншотах с точностью DocVQA 91,1 и OCRBench v1 84,2. Если вы регулярно вытягиваете цитаты из скриншотов или переводите инфографику в текст, LFM2.5-VL-3B можно запустить локально на ноутбуке с 8 ГБ оперативной памяти без подписки на облако. 16 поддерживаемых языков, включая русский, делают модель пригодной для работы с кириллицей, хотя отдельных тестов на русском пока нет.

Маркетологам и тестировщикам. Понимание экранов (ScreenSpot-v2: 80,7) и новая функция вызова внешних инструментов открывают путь к автоматизации интерфейсов: модель может сама находить кнопку на скриншоте и генерировать вызов нужного API. Для тех, кто строит RPA-сценарии (программы-роботы, которые кликают и заполняют формы вместо человека), это потенциальная замена облачных решений.

Предпринимателям в РФ и СНГ. Лицензия LFM Open v1.0 разрешает бесплатное коммерческое использование компаниям с годовой выручкой до 10 млн долларов. Исследования, образование и некоммерческие проекты не имеют ограничений по выручке. Модель поставляется в четырёх форматах (native, GGUF, ONNX, MLX) и работает через llama.cpp, vLLM, SGLang и MLX с первого дня. Из российских аналогов по задаче понимания изображений можно рассматривать YandexGPT с мультимодальным режимом, но он работает только через облако и не запускается локально.

Мнение редакции dzen.guru

Я обращаю внимание на два момента. Первый: расширение словаря до 128 000 токенов с явным фокусом на нелатинские письменности, это практический шаг для тех, кто хочет строить screen-based ИИ-агентов на русском языке. Второй: порог в 10 млн долларов годовой выручки для бесплатного коммерческого использования накрывает почти весь российский малый и средний бизнес. Однако все бенчмарки приводит сама Liquid AI, и пока сообщество не воспроизведёт результаты, к цифрам стоит относиться как к заявке, а не к установленному факту. Регресс в CountBenchQA тоже настораживает: модель стала хуже считать объекты, и компания не объяснила почему.

Модель уже доступна для скачивания с открытыми весами (веса, это числовые параметры, из которых состоит обученная нейросеть). Если ваш бизнес укладывается в лицензионный порог и вам нужен локальный анализ экранов или документов без отправки данных в облако, LFM2.5-VL-3B стоит протестировать прямо сейчас, пока конкуренты той же весовой категории требуют больше памяти за сопоставимый результат.

По данным Marktechpost

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Разработка AI-агента для отладки кода: архитектура «Агента Смита» от ТестОпс
ai

Разработка AI-агента для отладки кода: архитектура «Агента Смита» от ТестОпс

Команда ТестОпс за несколько месяцев собрала внутреннего ИИ-агента (программу, которая сама выполняет цепочку действий без постоянных команд человека),…

6 мин
ai

Qwen локально на 16 ГБ: квант Q3 справился с отладкой 6 000 строк кода

Qwen локально на 16 ГБ видеопамяти можно запустить уже сейчас, причём в квантах ниже «джентльменского» Q4, и получить рабочий результат на реальной задаче с…

6 мин
Цифровизация и искусственный интеллект глазами детей: 57% подростков уже используют чат-ботов
ai

Цифровизация и искусственный интеллект глазами детей: 57% подростков уже используют чат-ботов

Дети используют ИИ чаще, чем думают взрослые, и при этом чётко понимают, что готовы ему доверить, а что нет: исследование Common Sense Media и данные Pew…

6 мин