Игорь Градов
Игорь Градов
5 мин
ai

Perplexity открыла движок Lily для нейросети на Apple Silicon: на 35% быстрее MLX

Perplexity выпустила в открытый доступ Lily, движок для локального запуска нейросети Qwen3.6-35B-A3B на компьютерах Apple Silicon, который на тестах обгоняет стандартный MLX на 23-35% благодаря специализированным Metal-ядрам, написанным вручную.

Perplexity открыла движок Lily для нейросети на Apple Silicon: на 35% быстрее MLX
Почему это важно

Впервые крупный ИИ-сервис отдаёт сообществу не модель, а оптимизированный движок инференса (процесс, при котором модель генерирует ответ на ваш запрос), заточенный под конкретное железо: Mac с чипами Apple Silicon и 32 ГБ памяти запускает 35-миллиардную модель локально, без облака и без подписки.

Perplexity, известная своим ИИ-поисковиком, опубликовала исходный код Lily на GitHub в репозитории pplx-garden. Движок лежит в основе функции Hybrid Compute в продукте Perplexity Computer: часть вычислений происходит на устройстве пользователя, часть в облаке. Теперь серверную часть, работающую на Mac, может поднять любой разработчик.

Что Когда Кто выпустил Цена
Lily, движок для локального инференса модели Qwen3.6-35B-A3B Дата точного релиза источник не указал Perplexity Бесплатно, опенсорс

Что умеет Lily и чем отличается от MLX?

  • Один процесс вместо стека библиотек. Lily написана на Rust, ядра для GPU написаны вручную на Metal. В цепочке нет ни PyTorch, ни MLX: меньше промежуточных звеньев, меньше потерь на передачу данных.

  • Работает с одной моделью на одном семействе чипов. Поддерживается только Qwen3.6-35B-A3B (35 миллиардов параметров, из которых активируются примерно 3 миллиарда на каждый токен) и только Apple Silicon. Узкая специализация и есть главный аргумент в пользу скорости.

  • Контрольная точка модели весит 19,4 ГБ за счёт 4-битного квантования (сжатия весов). Реалистичный минимум для запуска: Mac на Apple Silicon с 32 ГБ единой памяти. Perplexity указывает 24 ГБ как формальный порог и 32 ГБ для комфортной работы. Требуется macOS 15 и новее.

  • Скорость обработки промпта выше на 23% в среднем. На 40-ядерном M5 Max со 128 ГБ памяти Lily показала 4 156 токенов в секунду при обработке входящего текста против 3 388 у MLX-LM. На промпте в 4 000 токенов разрыв ещё больше: 5 750 против 4 738 токенов в секунду.

  • Скорость генерации выше на 35% в среднем. 170 токенов в секунду против 126,4 у MLX-LM. Это разница между «печатает быстро» и «печатает заметно быстрее, чем вы читаете».

  • Качество ответов практически не пострадало. По данным Perplexity, разница в перплексии (метрика качества предсказания следующего слова) составила 0,04%, а совпадение лучшего токена с эталоном составляет 96,35%.

Откуда берётся ускорение?

Два главных приёма дали основной прирост при обработке входящего текста.

Первый: маршрутизация экспертов (механизм, который решает, какие из 256 блоков модели задействовать для конкретного токена) целиком остаётся на GPU, без возврата данных на процессор. По данным Perplexity, это дало плюс 89% к скорости на промпте из 512 токенов.

Второй: распаковка сжатых весов происходит прямо внутри матричного умножения, а не отдельным шагом. Результат не записывается в общую память, а остаётся в быстрой памяти вычислительного блока. Прирост по замерам Perplexity составил 77,4% на том же промпте.

При генерации ответа (когда модель выдаёт по одному токену за шаг) главный приём называется GQA-упаковка: четыре «головы внимания» (query heads) делят одну загрузку кэша ключей и значений, каждая строка данных читается один раз вместо четырёх. Прирост: 23,8% на контексте в 32 000 токенов. На длинных контекстах от 32 000 токенов и выше фиксированная блочная раскладка внимания добавляет ещё от 7,7% до 40,2%.

Как попробовать?

  1. Убедитесь, что у вас Mac на Apple Silicon с 32 ГБ единой памяти и macOS 15 или новее.
  2. Скачайте репозиторий pplx-garden с GitHub (ищите по названию в поиске GitHub).
  3. Запустите демо-сервер по инструкции в репозитории. Lily поднимает HTTP-сервер, совместимый с API OpenAI, то есть к нему можно обращаться теми же инструментами, что работают с ChatGPT API.

Компилировать Rust-код придётся самостоятельно. Для пользователя без опыта разработки процесс пока нетривиален, но контрольная точка модели скачивается автоматически.

Нейросети Apple Silicon: есть ли аналоги в России?

Прямого российского аналога Lily нет. Движок решает узкую задачу: максимально быстро гонять конкретную модель на конкретном железе.

Lily (Perplexity) YandexGPT GigaChat (Сбер)
Где работает Локально на Mac Облако Яндекса Облако Сбера
Нужен интернет Нет Да Да
Данные уходят на сервер Нет Да Да
Модель Qwen3.6-35B-A3B Закрытая Закрытая
Стоимость Бесплатно Подписка / API Подписка / API

Для тех, кто работает с конфиденциальными текстами или хочет запускать нейросети Apple Silicon без зависимости от облака и VPN, Lily остаётся пока единственным специализированным вариантом такого уровня оптимизации.

Мнение редакции dzen.guru

Lily интересна не сама по себе, а как прецедент: Perplexity показала, что можно выжать из MacBook заметно больше, чем даёт универсальный MLX, если отказаться от универсальности. Для автора Дзена и копирайтера это значит одно: 35-миллиардная модель, которая генерирует 170 токенов в секунду локально, уже пригодна для черновиков, рерайта и мозгового штурма без подписки и без отправки текстов в облако. Для маркетолога ценность в том, что данные клиентов не покидают ваш ноутбук.

Оговорка: пока Lily работает только с одной моделью и только на Mac с 32 ГБ памяти. Это не замена ChatGPT или Claude для повседневных задач, а инструмент для тех, кому критична скорость и приватность на Apple Silicon. Если у вас MacBook Air с 8 ГБ, Lily вам пока не подходит.

Что сделать сегодня: если у вас подходящий Mac, скачайте репозиторий и попробуйте сгенерировать текст через API. Сравните скорость и качество с тем, что даёт вам облачный сервис. Это поможет понять, готовы ли вы перенести часть рабочих задач на локальную нейросеть.

Частые вопросы

Нужна ли видеокарта Nvidia для запуска Lily?

Нет. Lily работает исключительно на GPU, встроенном в чипы Apple Silicon (M1, M2, M3, M4, M5), через фреймворк Metal. Внешние видеокарты не поддерживаются и не нужны.

Можно ли запустить другую модель, не Qwen?

На данный момент нет. Lily поддерживает только Qwen3.6-35B-A3B. Именно жёсткая привязка к одной архитектуре позволила написать ядра, которые обгоняют универсальный MLX. Появятся ли другие модели, Perplexity не сообщила.

Подойдёт ли MacBook с 16 ГБ памяти?

Контрольная точка модели занимает 19,4 ГБ. На Mac с 16 ГБ единой памяти модель физически не поместится. Perplexity указывает 24 ГБ как минимум и 32 ГБ для нормальной работы, когда рядом с моделью остаётся место для кэша контекста и системных процессов.

Lily пока остаётся инструментом для энтузиастов и разработчиков, но направление понятно: локальные нейросети Apple Silicon перестают быть компромиссом и начинают конкурировать с облаком по скорости, а по приватности выигрывают по определению.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Gemini 3.8 Flash тратит больше токенов ради точности: цена за токен не выросла, но счёт вырастет
ai

Gemini 3.8 Flash тратит больше токенов ради точности: цена за токен не выросла, но счёт вырастет

Google представила Gemini 3.8 Flash 11 июня 2025 года, спустя всего три недели после версии 3.7, и одновременно выпустила закрытую кибербезопасную версию Flash…

6 мин
Google собрал аналитику маркетинга в единый стек: три метрики калибруют друг друга
ai

Google собрал аналитику маркетинга в единый стек: три метрики калибруют друг друга

Маркетологи всё чаще сталкиваются с ситуацией, когда три главных инструмента измерения рекламы дают три разных ответа на один вопрос, и Google предлагает…

5 мин
5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы
ai

5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы

Claude Code за полгода съел 5,75 миллиарда токенов на одном проекте, и автор разобрал по байтам, куда именно они ушли и как сократить расход в разы без потери…

8 мин