Perplexity открыла движок Lily для нейросети на Apple Silicon: на 35% быстрее MLX
Perplexity выпустила в открытый доступ Lily, движок для локального запуска нейросети Qwen3.6-35B-A3B на компьютерах Apple Silicon, который на тестах обгоняет стандартный MLX на 23-35% благодаря специализированным Metal-ядрам, написанным вручную.

Впервые крупный ИИ-сервис отдаёт сообществу не модель, а оптимизированный движок инференса (процесс, при котором модель генерирует ответ на ваш запрос), заточенный под конкретное железо: Mac с чипами Apple Silicon и 32 ГБ памяти запускает 35-миллиардную модель локально, без облака и без подписки.
Perplexity, известная своим ИИ-поисковиком, опубликовала исходный код Lily на GitHub в репозитории pplx-garden. Движок лежит в основе функции Hybrid Compute в продукте Perplexity Computer: часть вычислений происходит на устройстве пользователя, часть в облаке. Теперь серверную часть, работающую на Mac, может поднять любой разработчик.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Lily, движок для локального инференса модели Qwen3.6-35B-A3B | Дата точного релиза источник не указал | Perplexity | Бесплатно, опенсорс |
Что умеет Lily и чем отличается от MLX?
-
Один процесс вместо стека библиотек. Lily написана на Rust, ядра для GPU написаны вручную на Metal. В цепочке нет ни PyTorch, ни MLX: меньше промежуточных звеньев, меньше потерь на передачу данных.
-
Работает с одной моделью на одном семействе чипов. Поддерживается только Qwen3.6-35B-A3B (35 миллиардов параметров, из которых активируются примерно 3 миллиарда на каждый токен) и только Apple Silicon. Узкая специализация и есть главный аргумент в пользу скорости.
-
Контрольная точка модели весит 19,4 ГБ за счёт 4-битного квантования (сжатия весов). Реалистичный минимум для запуска: Mac на Apple Silicon с 32 ГБ единой памяти. Perplexity указывает 24 ГБ как формальный порог и 32 ГБ для комфортной работы. Требуется macOS 15 и новее.
-
Скорость обработки промпта выше на 23% в среднем. На 40-ядерном M5 Max со 128 ГБ памяти Lily показала 4 156 токенов в секунду при обработке входящего текста против 3 388 у MLX-LM. На промпте в 4 000 токенов разрыв ещё больше: 5 750 против 4 738 токенов в секунду.
-
Скорость генерации выше на 35% в среднем. 170 токенов в секунду против 126,4 у MLX-LM. Это разница между «печатает быстро» и «печатает заметно быстрее, чем вы читаете».
-
Качество ответов практически не пострадало. По данным Perplexity, разница в перплексии (метрика качества предсказания следующего слова) составила 0,04%, а совпадение лучшего токена с эталоном составляет 96,35%.
Откуда берётся ускорение?
Два главных приёма дали основной прирост при обработке входящего текста.
Первый: маршрутизация экспертов (механизм, который решает, какие из 256 блоков модели задействовать для конкретного токена) целиком остаётся на GPU, без возврата данных на процессор. По данным Perplexity, это дало плюс 89% к скорости на промпте из 512 токенов.
Второй: распаковка сжатых весов происходит прямо внутри матричного умножения, а не отдельным шагом. Результат не записывается в общую память, а остаётся в быстрой памяти вычислительного блока. Прирост по замерам Perplexity составил 77,4% на том же промпте.
При генерации ответа (когда модель выдаёт по одному токену за шаг) главный приём называется GQA-упаковка: четыре «головы внимания» (query heads) делят одну загрузку кэша ключей и значений, каждая строка данных читается один раз вместо четырёх. Прирост: 23,8% на контексте в 32 000 токенов. На длинных контекстах от 32 000 токенов и выше фиксированная блочная раскладка внимания добавляет ещё от 7,7% до 40,2%.
Как попробовать?
- Убедитесь, что у вас Mac на Apple Silicon с 32 ГБ единой памяти и macOS 15 или новее.
- Скачайте репозиторий pplx-garden с GitHub (ищите по названию в поиске GitHub).
- Запустите демо-сервер по инструкции в репозитории. Lily поднимает HTTP-сервер, совместимый с API OpenAI, то есть к нему можно обращаться теми же инструментами, что работают с ChatGPT API.
Компилировать Rust-код придётся самостоятельно. Для пользователя без опыта разработки процесс пока нетривиален, но контрольная точка модели скачивается автоматически.
Нейросети Apple Silicon: есть ли аналоги в России?
Прямого российского аналога Lily нет. Движок решает узкую задачу: максимально быстро гонять конкретную модель на конкретном железе.
| Lily (Perplexity) | YandexGPT | GigaChat (Сбер) | |
|---|---|---|---|
| Где работает | Локально на Mac | Облако Яндекса | Облако Сбера |
| Нужен интернет | Нет | Да | Да |
| Данные уходят на сервер | Нет | Да | Да |
| Модель | Qwen3.6-35B-A3B | Закрытая | Закрытая |
| Стоимость | Бесплатно | Подписка / API | Подписка / API |
Для тех, кто работает с конфиденциальными текстами или хочет запускать нейросети Apple Silicon без зависимости от облака и VPN, Lily остаётся пока единственным специализированным вариантом такого уровня оптимизации.
Lily интересна не сама по себе, а как прецедент: Perplexity показала, что можно выжать из MacBook заметно больше, чем даёт универсальный MLX, если отказаться от универсальности. Для автора Дзена и копирайтера это значит одно: 35-миллиардная модель, которая генерирует 170 токенов в секунду локально, уже пригодна для черновиков, рерайта и мозгового штурма без подписки и без отправки текстов в облако. Для маркетолога ценность в том, что данные клиентов не покидают ваш ноутбук.
Оговорка: пока Lily работает только с одной моделью и только на Mac с 32 ГБ памяти. Это не замена ChatGPT или Claude для повседневных задач, а инструмент для тех, кому критична скорость и приватность на Apple Silicon. Если у вас MacBook Air с 8 ГБ, Lily вам пока не подходит.
Что сделать сегодня: если у вас подходящий Mac, скачайте репозиторий и попробуйте сгенерировать текст через API. Сравните скорость и качество с тем, что даёт вам облачный сервис. Это поможет понять, готовы ли вы перенести часть рабочих задач на локальную нейросеть.
Частые вопросы
Нужна ли видеокарта Nvidia для запуска Lily?
Нет. Lily работает исключительно на GPU, встроенном в чипы Apple Silicon (M1, M2, M3, M4, M5), через фреймворк Metal. Внешние видеокарты не поддерживаются и не нужны.
Можно ли запустить другую модель, не Qwen?
На данный момент нет. Lily поддерживает только Qwen3.6-35B-A3B. Именно жёсткая привязка к одной архитектуре позволила написать ядра, которые обгоняют универсальный MLX. Появятся ли другие модели, Perplexity не сообщила.
Подойдёт ли MacBook с 16 ГБ памяти?
Контрольная точка модели занимает 19,4 ГБ. На Mac с 16 ГБ единой памяти модель физически не поместится. Perplexity указывает 24 ГБ как минимум и 32 ГБ для нормальной работы, когда рядом с моделью остаётся место для кэша контекста и системных процессов.
Lily пока остаётся инструментом для энтузиастов и разработчиков, но направление понятно: локальные нейросети Apple Silicon перестают быть компромиссом и начинают конкурировать с облаком по скорости, а по приватности выигрывают по определению.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Gemini 3.8 Flash тратит больше токенов ради точности: цена за токен не выросла, но счёт вырастет
Google представила Gemini 3.8 Flash 11 июня 2025 года, спустя всего три недели после версии 3.7, и одновременно выпустила закрытую кибербезопасную версию Flash…

Google собрал аналитику маркетинга в единый стек: три метрики калибруют друг друга
Маркетологи всё чаще сталкиваются с ситуацией, когда три главных инструмента измерения рекламы дают три разных ответа на один вопрос, и Google предлагает…

5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы
Claude Code за полгода съел 5,75 миллиарда токенов на одном проекте, и автор разобрал по байтам, куда именно они ушли и как сократить расход в разы без потери…
Комментарии