Локальные LLM на Mac ускоряются втрое: движок Splash обошёл llama.cpp на Apple Silicon
Запускать локальные LLM на Mac можно быстрее, чем через привычный llama.cpp, если использовать движок Splash от Inco AI, который специализируется на конкретных моделях и выжимает из Apple Silicon заметно больше токенов в секунду.

Splash даёт прирост скорости генерации за счёт спекулятивного декодирования и оптимизированных ядер Metal, но работает только с двумя семействами моделей и требует Mac на чипе M3 или новее.
Движок для запуска локальных LLM на Mac появился не на пустом месте. Inco AI разрабатывает инфраструктуру для выполнения языковых моделей и перенесла свой подход к специализации вычислений на Apple Silicon. В отличие от универсального llama.cpp, Splash 1.1.0 поддерживает ограниченный набор моделей, но под каждую подготовлены собственные вычислительные ядра Metal, вспомогательная модель для генерации и правила управления памятью. Код открыт под лицензией Apache 2.0, лицензии весов моделей действуют отдельно.
Почему Splash генерирует быстрее?
При обычном авторегрессионном декодировании модель выбирает следующий токен (минимальная единица текста, примерно три четверти слова) последовательно, один за другим. Splash использует спекулятивное декодирование: небольшая вспомогательная модель DFlash 2 предлагает сразу блок продолжения, а основная модель проверяет весь блок за один проход и принимает подходящую часть.
Особенность DFlash 2 в том, что черновик блока тоже предсказывается параллельно. Это сокращает последовательную работу на этапе подготовки предложений.
Представьте: вместо отдельного прохода основной модели для каждого следующего токена один проверочный проход даёт сразу несколько принятых токенов. Но подготовка и проверка черновика тоже требуют вычислений, поэтому размер блока сам по себе не показывает реальное ускорение.
Splash сочетает этот механизм с ядрами Metal, рассчитанными на размеры и операции поддерживаемых моделей. Цена специализации понятна: появление нового семейства моделей требует отдельной поддержки со стороны разработчиков движка.
Что понадобится
- Mac на чипе M3 или новее и macOS 26.4 или свежее
- Оперативная память: для 4-битных моделей от 36 ГБ объединённой памяти (рекомендуется 48 ГБ), для компактных GGUF-вариантов хватит 24 ГБ
- Homebrew (менеджер пакетов для macOS)
- Свободное место на диске: под веса модели и подготовленные файлы (точный объём зависит от квантования, то есть степени сжатия весов модели)
- Время: установка и первый запуск от 10 до 30 минут, основное время уходит на скачивание весов
Пошаговая инструкция
- Установите Splash через Homebrew. Откройте «Терминал» и выполните:
brew install incoai/tap/splash
- Запустите сервер с выбранной моделью. Для 4-битного варианта Qwen3.8-27B (подходит для Mac с 36 ГБ памяти и выше):
splash serve --model 'unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M'
Для более точного 8-битного варианта (нужно 48 ГБ и больше):
splash serve --model 'unsloth/Qwen3.8-27B-GGUF:Q8_0'
-
Дождитесь первой загрузки. При первом запуске Splash скачает подходящую вспомогательную модель DFlash 2 и подготовит веса. Последующие запуски используют уже подготовленные файлы и стартуют быстрее.
-
Подключитесь к модели. Splash предоставляет встроенный чат и API (программный интерфейс), совместимые с форматами OpenAI и Anthropic. Это значит, что к серверу можно подключить любой совместимый клиент или ИИ-агента (программу, которая сама выполняет цепочку действий).
-
Выберите квантование под вашу задачу. В Splash 1.1.0 доступны модели Qwen3.8-27B и Qwen3.6-35B-A3B в GGUF-сборках Unsloth и поддерживаемых 4-битных сборках MLX. Для GGUF поддерживаются варианты от UD-IQ1_S до Q8_0, включая смешанную точность. Исключения: UD-Q8_K_XL и веса основной модели в BF16. Само расширение файла GGUF не делает произвольную архитектуру совместимой со Splash.
Как читать цифры скорости и не обмануться?
По тестам разработчиков Splash, для модели Qwen3.8-27B на весах Unsloth UD-Q4_K_M на M5 Pro соотношение скорости генерации составляет примерно 74 к 27 токенов в секунду по сравнению с llama.cpp, то есть около 2,7 раза.
Но из этого нельзя заключить, что любой ИИ-агент завершит задачу в 2,7 раза быстрее: агент также обрабатывает входной контекст, запускает инструменты и ожидает их результаты. На Q8_0 эти показатели автоматически не переносятся.
Отдельная метрика связана с кэшем. По данным карточки Qwen3.8-27B-Splash, при точном повторе закэшированного запроса длиной 32 000 токенов задержка до первого токена составляет 282 мс. Для нового запроса такой же длины приведены 96 секунд. Эти измерения сделаны на M5 Pro с 16 ядрами GPU и 48 ГБ памяти. Для длинного диалога разница колоссальная: повторно используемый префикс сокращает уже выполненную работу, но новый текст всё равно нужно обработать.
На Apple M3 Max с 40 ядрами GPU и 128 ГБ объединённой памяти (macOS 27.0.0) автор оригинальной статьи проверил Splash 1.1.0 с моделью Qwen3.8-27B в квантовании Q8_0 на задаче перевода текстов с английского на русский. Были выполнены четыре запроса разного размера, результаты зафиксированы из журнала Splash. Это именно та задача, которая актуальна для авторов Дзена: перевод источников, адаптация англоязычных материалов, подготовка текстов. Цифры из англоязычных бенчмарков (стандартных тестов производительности) не всегда переносятся на русский язык, потому что токенизация (разбивка текста на токены) для кириллицы работает иначе, и один русский токен часто содержит меньше смысла, чем английский.
- Путать расширение файла с совместимостью. GGUF-файл от любой модели откроется в llama.cpp, но в Splash работают только Qwen3.8-27B и Qwen3.6-35B-A3B в конкретных сборках. Попытка загрузить другую архитектуру не даст результата.
- Экстраполировать скорость генерации на всю задачу. Показатель «токены в секунду» описывает только этап выдачи текста, а не полный цикл работы агента или сложного промпта (текстовой инструкции для модели).
- Игнорировать требования к памяти. Mac с 16 ГБ памяти не запустит даже компактный вариант. Минимум для 4-битных моделей по документации проекта составляет 24 ГБ.
- Ожидать кэширование при новых запросах. 282 мс до первого токена при точном повторе запроса и 96 секунд при новом запросе той же длины отличаются на два порядка.
- Переносить англоязычные бенчмарки на русский без проверки. Токенизация кириллицы расходует больше токенов на то же количество слов, поэтому реальная скорость в русскоязычных задачах может отличаться.
Что делать с этим прямо сейчас?
Авторам Дзена. Если у вас Mac на M3 или новее с 36 ГБ памяти и выше, Splash даёт возможность переводить, редактировать и генерировать тексты локально, без подписки на облачные сервисы и без отправки черновиков на чужие серверы. Для перевода источников с английского на русский это рабочий инструмент уже сейчас.
Маркетологам. Локальные LLM на Mac снимают вопрос конфиденциальности: данные клиентов не уходят в облако. Но набор моделей пока узкий, и для задач вроде генерации изображений или работы с таблицами Splash не подходит.
Предпринимателям в РФ и СНГ. Splash не требует VPN и не зависит от доступности зарубежных API. Из доступных в РФ альтернатив для локального запуска моделей на Mac также работает Ollama и LM Studio, но они используют llama.cpp под капотом, и по тестам разработчиков Splash скорость генерации у них ниже на поддерживаемых моделях.
Splash решает конкретную задачу: быстрый инференс (выполнение модели, генерация ответа) на Mac для двух семейств моделей Qwen. По моим наблюдениям, для большинства авторов, которые только начинают работать с локальными LLM на Mac, проще начать с Ollama (она поддерживает десятки моделей и ставится одной командой), а Splash пробовать, когда скорость генерации стала узким местом и вы работаете именно с Qwen. Честная оговорка: если Apple выпустит собственный фреймворк для локального инференса или Qwen потеряет лидерство в открытых моделях, ценность узкой специализации Splash может быстро снизиться. Сейчас это инструмент для тех, кто точно знает, какая модель ему нужна.
Промпты для локальных моделей
Собрали библиотеку промптов для авторов Дзена, которые работают с локальными и облачными LLM
Смотреть промптыПерспектива Splash зависит от расширения списка поддерживаемых моделей, и пока их всего два семейства, это инструмент для тех, кто осознанно выбрал Qwen и готов пожертвовать универсальностью ради скорости на своём Mac.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Страница Илона Маска в X Twitter стала местом публичного разрыва с матерью его детей
Публичный разрыв Шивон Зилис и Илона Маска на платформе X второго июня показал, как личная жизнь основателя соцсети превращается в контент на его же площадке и…

Stability AI делает музыку по тексту: Sony, Warner и Universal впервые дали каталоги для обучения ИИ
Stability AI перешла от картинок к музыке: три новые модели генерируют треки по текстовому описанию, а Sony, Warner и Universal не только вложили деньги, но и…

Apple перестраивает безопасность macOS: ИИ-агенты больше не получат доступ к диску без явного согласия
Apple ужесточает контроль над доступом ИИ-агентов к файлам и переписке на Mac: компания перестраивает механизм Full Disk Access после того, как выяснилось, что…
Комментарии