Игорь Градов
Игорь Градов
6 мин
ai

Liquid AI ускорила видео-языковые модели в 3 раза на обычном Mac без потери качества

Liquid AI выпустила модель-черновик DSpark для своей видео-языковой модели LFM2.5-VL-3B, которая ускоряет генерацию текста по изображениям до трёх раз на обычном «маке» без потери качества ответа.

Почему это важно

Видео-языковые модели до сих пор работали медленно на локальном железе, и ускорить декодирование без потери точности было нельзя без переобучения всей модели. DSpark добавляет лёгкую надстройку, которая решает эту задачу готовым открытым кодом.

Компания Liquid AI опубликовала экспериментальную модель LFM2.5-VL-3B-DSpark. Это так называемый «драфтер», небольшая модель-помощник, которая предсказывает сразу несколько следующих токенов (минимальных единиц текста) и отдаёт их на проверку основной модели. Технология называется спекулятивное декодирование (speculative decoding). Об этом сообщил портал Marktechpost со ссылкой на техническую документацию Liquid AI.

Как спекулятивное декодирование работает в видео-языковых моделях?

Обычная модель генерирует по одному токену за проход. Драфтер предлагает сразу блок из нескольких токенов. Основная (целевая) модель проверяет весь блок одним проходом и оставляет те токены, с которыми согласна. Результат: за то же число обращений к тяжёлой модели генерируется больше текста.

Для видео-языковых моделей приём работает без дополнительных хитростей. К моменту, когда токены попадают в скрытые слои модели, изображения и текст уже превращены в одинаковые тензоры (массивы чисел). Поэтому драфтеру неважно, пришёл токен из картинки или из текста. Liquid AI использует тот же алгоритм инференса (инференс, процесс, при котором модель выдаёт ответ), что и для чисто текстовых моделей.

DSpark добавляет меньше 9% к размеру модели

Драфтер содержит около 280 миллионов параметров. Это увеличивает общий размер модели на 8,9%. Архитектура состоит только из слоёв внимания: по результатам экспериментов (аблаций) выбраны 4 слоя с размером блока 9. Для работы на Apple Silicon Liquid AI рекомендует размер блока 8.

Обучающие данные (training data) покрывали стандартные задачи видео-языковых моделей. Дообучение (fine-tuning) заняло 10 эпох. Все эксперименты и обучение проводились на оборудовании AMD.

Какие результаты показали замеры?

По данным Liquid AI, драфтер ускоряет этап декодирования:

  • До 3,13 раза на Apple M5 Max (задача генерации подписей к изображениям COCO)
  • До 2,66 раза на NVIDIA H100

Сквозное ускорение (от начала до конца обработки запроса) получается скромнее. На M5 Max лучший сквозной результат составил 2,62 раза (задача MMMU-Pro). Причина в законе Амдала: спекулятивное декодирование ускоряет только генерацию текста, а кодирование изображения и обработка визуальных токенов промпта занимают столько же времени, сколько раньше.

На устройствах с ограниченными вычислительными ресурсами этап предобработки изображения занимает бо́льшую долю общего времени. Например, на задаче TextVQA при ускорении декодирования в 2,69 раза сквозной прирост составил только 1,56 раза.

При параллельной обработке нескольких запросов на одном H100 DSpark сохранял преимущество в пропускной способности на всех замеренных уровнях конкурентности, но разрыв сужался с ростом нагрузки.

Качество ответов остаётся прежним

При жадном декодировании (temperature 0) целевая модель проверяет каждый предложенный токен. Результат побуквенно совпадает с ответом базовой модели без драфтера.

При ненулевой температуре с согласованной выборкой спекулятивное декодирование сохраняет распределение выходных данных целевой модели. Это доказано в работе Leviathan et al. Однако высокая температура снижает скорость: вероятность размазывается по большему числу кандидатов, драфтер и целевая модель чаще расходятся, и принятие токенов падает.

Что понадобится

  • Железо: Mac с чипом M-серии (M1 и выше) или сервер с NVIDIA H100
  • Модель: LFM2.5-VL-3B и драфтер LFM2.5-VL-3B-DSpark (оба доступны на Hugging Face в форматах Safetensors и GGUF)
  • Один из фреймворков: SGLang v0.5.19+, MLX-VLM v0.7.2+ (для Mac) или llama.cpp
  • Лицензия: LFM Open License v1.0 разрешает бесплатное коммерческое использование компаниям с выручкой менее 10 миллионов долларов в год
  • Время на запуск: 15-30 минут (скачивание весов и запуск сервера)

Пошаговая инструкция

  1. Скачайте модель и драфтер с Hugging Face (ищите LiquidAI/LFM2.5-VL-3B и LiquidAI/LFM2.5-VL-3B-DSpark)

  2. Для SGLang (серверный вариант, подходит для H100):

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark
  1. Для MLX-VLM (на Mac с M-серией):
mlx_vlm generate \
  --model LiquidAI/LFM2.5-VL-3B \
  --draft-model LiquidAI/LFM2.5-VL-3B-DSpark \
  --temperature 0

Важно: MLX-VLM на момент релиза поддерживает только жадную выборку, поэтому temperature выставляйте строго в 0.

  1. Для llama.cpp: используйте GGUF-версию драфтера вместе с LFM2.5-VL-3B-GGUF в качестве целевой модели

  2. Отправьте модели изображение и текстовый промпт. Ответ будет идентичен работе базовой модели, но придёт быстрее

Конкретный пример

Задача: сгенерировать подпись к фотографии (image captioning) на Mac с чипом M5 Max.

Без драфтера модель LFM2.5-VL-3B декодирует ответ с обычной скоростью. После подключения DSpark через MLX-VLM с параметром --draft-model и --temperature 0 декодирование ускорилось в 3,13 раза на той же задаче (данные Liquid AI, бенчмарк COCO captioning). Текст ответа при этом остался побуквенно тем же, что и без драфтера.

На задаче сложного рассуждения по изображению (MMMU-Pro) сквозное ускорение составило 2,62 раза, потому что обработка картинки заняла фиксированное время.

Частые ошибки
  • Ожидать трёхкратного ускорения «от и до». Цифра 3,13 раза относится только к этапу декодирования. Сквозной прирост будет меньше, особенно на локальном железе, где обработка изображения занимает бо́льшую долю времени.
  • Выставить temperature выше 0 в MLX-VLM. На момент публикации MLX-VLM поддерживает DSpark только при жадной выборке. С ненулевой температурой драфтер не заработает.
  • Пытаться ускорить квантизованные модели. Liquid AI явно указывает: замеры проводились только на 16-битных весах. Ускорение квантизованных моделей не входит в текущий релиз.
  • Не проверить лицензию. LFM Open License v1.0 бесплатна для коммерческого использования, но только если годовая выручка компании ниже 10 миллионов долларов. Крупному бизнесу нужно отдельное соглашение.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Если вы используете мультимодальные (мультимодальный, способный работать одновременно с текстом, картинками и другими форматами) модели для описания скриншотов, инфографики или подготовки подписей к визуалу, DSpark позволит получать результат в два-три раза быстрее на обычном MacBook без подписки на облачный сервис.

Разработчикам и техническим предпринимателям в РФ. Код открыт, веса доступны, фреймворки публичные. Можно интегрировать в свой пайплайн обработки визуального контента. На российском рынке из близких по функциональности инструментов работают YandexGPT (мультимодальный режим) и GigaChat с распознаванием изображений, но они не дают контроля над инференсом на локальном железе.

Маркетологам. Пока это инструмент для тех, кто работает с кодом или готов попросить разработчика настроить. Практическая польза: автоматическая генерация описаний товарных фото, alt-текстов для SEO, подписей к картинкам для каталогов. Ускорение в два-три раза означает, что пакетная обработка сотен изображений укладывается в минуты вместо десятков минут.

Мнение редакции dzen.guru

Liquid AI сделала нетривиальную вещь: показала, что спекулятивное декодирование для видео-языковых моделей не требует отдельной архитектуры. Драфтер, обученный на тех же данных, работает одинаково и для текста, и для визуальных токенов. По моим наблюдениям, именно этого не хватало для запуска мультимодальных моделей на локальном железе в рабочем темпе.

Честная оговорка: релиз экспериментальный, работает только с 16-битными весами, а лицензия ограничивает крупный бизнес. Для большинства авторов и небольших команд это несущественно, но проверьте лицензию до запуска в продакшен.

Генерируйте контент с нейросетями быстрее

Разбираем мультимодальные модели, промпт-инжиниринг и автоматизацию для авторов Дзена на практике

Попробовать инструменты dzen.guru

Видео-языковые модели на локальном железе перестают быть медленными. Если вы откладывали эксперименты с мультимодальным ИИ из-за скорости, DSpark убирает именно это ограничение, и попробовать можно прямо сегодня, бесплатно, на своём маке.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Лаборатории подменяют определение AGI нейросетей, чтобы объявить победу раньше срока
ai

Лаборатории подменяют определение AGI нейросетей, чтобы объявить победу раньше срока

Microsoft второго июня запустила Project Solara, операционную систему, где ИИ-агенты заменяют привычные приложения, и впервые отдала управление машине, а не…

6 мин
Почему нет приложения Huawei Health в Google Play и чем его заменяет Google Health
ai

Почему нет приложения Huawei Health в Google Play и чем его заменяет Google Health

Google Health на этой неделе начал раскатывать набор функций Health Guardian в одноимённом приложении, и владельцы Pixel Watch 3, 4 и 5 получили бесплатный…

5 мин
ai

Что такое ИИ-агент Exa: API тратит до 3 часов на запрос и стоит до $100

Exa второго июня открыла доступ к Agent Ultra, самому ресурсоёмкому режиму своего API для ИИ-агентов, который тратит до трёх часов на один запрос и, по данным…

5 мин