Игорь Градов
Игорь Градов
5 мин
ai

Mac mini M4 Pro против LLM: от 11,7 до 21,5 токена в секунду, и скорость упирается в память

Mac mini на M4 с 16 ГБ памяти выдаёт от 11,7 до 21,5 токена в секунду на моделях от 3 до 14 миллиардов параметров, и автор бенчмарка впервые описал методику настолько подробно, что результат может повторить любой владелец такой машины.

Mac mini M4 Pro против LLM: от 11,7 до 21,5 токена в секунду, и скорость упирается в память
Почему это важно

Большинство «замеров скорости на маке» в сети сделаны без указания квантования, версии софта и числа прогонов. Эти данные нельзя ни сравнить, ни воспроизвести. Здесь методика открыта целиком под лицензией CC BY, и каждую цифру можно проверить на своём железе.

Автор бенчмарка держит парк одинаковых Mac mini M4 и опубликовал результаты шести открытых моделей с полным описанием условий: версия Ollama, квантование (способ сжатия весов модели для экономии памяти), промпт (запрос к модели), число прогонов и даже то, что делала машина в фоне. По данным автора, разброс между тремя прогонами каждой модели не превышал 0,5%, то есть цифры устойчивы и пригодны для сравнения.

Показатель Значение Источник
Железо Mac mini M4, 16 ГБ unified memory, полоса 120 ГБ/с macyou.co/benchmarks
Софт Ollama 0.31.2, macOS 15.3.1 (Sequoia) macyou.co/benchmarks
Квантование Q4_K_M для всех моделей macyou.co/benchmarks
Параметры генерации num_predict = 512, temperature = 0.7 macyou.co/benchmarks
Прогоны 3 рабочих + 1 прогревочный (отброшен) macyou.co/benchmarks
Разброс между прогонами до 0,5% macyou.co/benchmarks
Скорость генерации, модели до 8B от 20 токенов/с и выше macyou.co/benchmarks
Скорость генерации, 14B 11,7 токенов/с macyou.co/benchmarks
Скорость обработки промпта от 530 до 1720 токенов/с macyou.co/benchmarks
Лицензия данных CC BY macyou.co/benchmarks

Что именно измеряли?

Автор прогнал шесть открытых моделей разного размера через один и тот же промпт: просьба объяснить механизм внимания в трансформерах на 300 слов для начинающего разработчика, с конкретной аналогией. Все модели были сжаты одним методом квантования Q4_K_M. Это важно: без фиксации способа сжатия сравнивать скорости бессмысленно, потому что та же модель в другом квантовании займёт другой объём памяти и выдаст другую скорость.

Каждую модель запускали четыре раза. Первый прогон, прогревочный, отбрасывали: он включает загрузку весов модели в память и может исказить результат на десятки процентов. Три оставшихся прогона усредняли.

Машина во время замеров простаивала: работали только системные процессы macOS, никаких браузеров и редакторов в фоне.

Главные находки

  • Модели до 8 миллиардов параметров выдают 20+ токенов в секунду. Это быстрее, чем человек успевает читать. Для локального ИИ-ассистента по коду, разбора документов или RAG (системы, где модель ищет ответ по вашей базе знаний) такой скорости хватает с запасом.

  • 14B запускается, но 11,7 токенов в секунду уже ощутимо медленно. На коротких ответах терпимо, на длинных начинает раздражать. Для комфортной работы с моделями от 14 миллиардов параметров автор рекомендует машины с 24 или 32 ГБ памяти и более широкой полосой пропускания.

  • Обработка промпта на порядок быстрее генерации. Скорость чтения входного текста составила от 530 до 1720 токенов в секунду в зависимости от модели. Загрузить в контекст большой документ дёшево; дорого генерировать ответ по нему.

  • Скорость генерации упирается в память, а не в процессор. Автор вывел практическое правило: делите полосу пропускания памяти на размер файла весов. Для модели 8B в Q4 (примерно 4,7 ГБ) при полосе 120 ГБ/с теоретический потолок около 25 токенов в секунду. Измеренные 21 токен попадают в этот диапазон с поправкой на накладные расходы.

  • Одинаковый размер модели не гарантирует одинаковую скорость обработки промпта. Mistral 7B обрабатывает промпт со скоростью 645 токенов в секунду, а Qwen 2.5 7B со скоростью 1130 токенов в секунду при почти равной скорости генерации. Разница в токенизаторе (том, как модель разбивает текст на части) и устройстве механизма внимания проявляется на этапе чтения промпта, но не на этапе генерации.

Mac mini M4 Pro и M4 Max: прогноз без замеров

Автор подчёркивает: своих данных по Mac mini M4 Pro и M4 Max у него пока нет. Но поскольку скорость упирается в память, прирост на Mac mini M4 Pro (полоса 273 ГБ/с) и M4 Max (полоса 546 ГБ/с) должен быть примерно кратен полосе, а не числу процессорных ядер. Конкретных чисел автор не даёт и обещает добавить их в таблицу, когда появятся собственные замеры.

Это честный подход: именно подмена «должно быть быстрее» на конкретные цифры без замеров портит большинство обзоров в сети.

Как это читать

Бенчмарк сделан на одной конфигурации (16 ГБ), одном квантовании (Q4_K_M) и одном типе задачи (генерация связного текста на естественном языке). На кодовых задачах с длинными выводами картина может отличаться. Пакетная обработка нескольких запросов одновременно не измерялась вовсе, и на 16 ГБ она быстро упирается в KV-кэш (служебную память, где модель хранит контекст разговора). Один промпт, один тип ответа, одна машина: переносить цифры на другие сценарии напрямую нельзя.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Если у вас Mac mini M4 с 16 ГБ, вы уже можете запустить локальную модель на 7 или 8 миллиардов параметров через Ollama и получить ИИ-помощника для черновиков, рерайта и разбора источников без подписки на облачные сервисы и без отправки текстов на чужие серверы. Ставьте квантование Q4_K_M и ждите 20+ токенов в секунду, это комфортно.

Разработчикам и техническим специалистам. Открытая методика под CC BY позволяет добавить свои машины (M1, M2, M3, конфигурации с 24 и 64 ГБ) и получить сводную таблицу, которой пока нет нигде в воспроизводимом виде. Автор принимает замеры по той же схеме.

Предпринимателям в РФ и СНГ. Mac mini M4 продаётся в России, открытые модели вроде Mistral и Qwen не требуют лицензий и не зависят от санкционных ограничений облачных API. Для небольших команд, которым нужен локальный ИИ без абонентской платы, это рабочий вариант прямо сейчас.

Мнение редакции dzen.guru

Я проверял Ollama на Mac mini M4 и могу подтвердить: 7B-модели с Q4_K_M действительно работают быстрее, чем успеваешь читать. Главная ценность этого бенчмарка не сами числа, а то, что их можно повторить. Если каждый владелец мака прогонит те же шесть моделей по той же методике, через месяц у сообщества будет таблица, которая заменит сотни скриншотов «у меня выдало 30 токенов» без контекста. Для тех, кто работает с текстом и хочет держать данные у себя, Mac mini M4 с 16 ГБ закрывает задачу на моделях до 8B, а для 14B и выше стоит сразу брать конфигурацию с 24 ГБ.

Кто ещё не пробовал запускать модели локально, начните с Ollama и любой 7B-модели в квантовании Q4_K_M: вы увидите результат за пять минут и поймёте, нужна ли вам машина мощнее.

По данным macyou.co/benchmarks

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

PerceptionBench проверяет multimodal модели по 10 навыкам зрения: код открыт
ai

PerceptionBench проверяет multimodal модели по 10 навыкам зрения: код открыт

Компания Moonshot AI опубликовала PerceptionBench, открытый бенчмарк для оценки мультимодальных моделей зрения, и выложила полный туториал с кодом, который…

4 мин
Чат-бот с ИИ за месяц: как LeaderChat снизил стоимость обращений в 10 раз
ai

Чат-бот с ИИ за месяц: как LeaderChat снизил стоимость обращений в 10 раз

Автоматизация чата поддержки с помощью ИИ звучит как задача для программистов, но команда сервиса LeaderChat показала, что малый бизнес может запустить чат-бот…

6 мин
GPT 5.6 опровергнул гипотезу Максвелла
ai

GPT 5.6 опровергнул гипотезу Максвелла

Реальность отличается от заголовков: речь не об электромагнетизме, а о нишевой математической задаче про точки равновесия зарядов, где GPT-5.6 подсказал…

6 мин