M3 Ultra: скорость генерации текста упирается в 12 токенов в секунду, и вот почему
Компания Apple позиционирует Mac Studio с чипом M3 Ultra как вершину производительности для профессионалов, но реальная скорость генерации текста большими языковыми моделями на этой машине оказалась далека от ожиданий, и независимый тест показал почему.

Даже максимальная конфигурация M3 Ultra с 80 ядрами GPU и 512 ГБ памяти упирается в физический потолок пропускной способности памяти при генерации текста, и без специальных приёмов вроде спекулятивной генерации выжать из неё больше 12 токенов в секунду на полноразмерной модели не получится.
Практик-разработчик протестировал скорость генерации модели Qwen3.8-27B в формате BF16 (формат хранения параметров без сжатия, с максимальной точностью) на топовой конфигурации Mac Studio 2025 года с M3 Ultra. Результаты опубликованы в авторском техническом разборе. На фоне роста интереса к локальному запуску нейросетей на Mac в России, где облачный доступ к западным моделям ограничен, эти цифры становятся ориентиром для всех, кто рассматривает Apple Silicon как рабочую платформу для ИИ.
| Показатель | Значение | Источник |
|---|---|---|
| Конфигурация Mac Studio | M3 Ultra, 32 ядра CPU (24 производительных), 80 ядер GPU, 512 ГБ памяти, SSD 2 ТБ | Авторский тест |
| Пропускная способность памяти (заявленная Apple) | 819 ГБ/с | Apple |
| Модель | Qwen3.8-27B-bf16, формат MLX | mlx-community |
| Размер весов модели в BF16 | около 54 ГБ | Авторский расчёт: 27 млрд параметров по 2 байта |
| Реальная скорость генерации (без оптимизаций) | 12 токенов в секунду | Авторский тест |
| Теоретический потолок (без накладных расходов) | около 15 токенов в секунду | Авторский расчёт: 819 ГБ/с разделить на 54 ГБ |
Что именно проверяли?
Автор запустил языковую модель Qwen3.8 с 27 миллиардами параметров на самой мощной из существующих конфигураций Mac Studio. Модель была взята в формате BF16, то есть без квантизации (без сжатия параметров ценой потери точности). Цель: получить максимально точные ответы для сложного анализа, работы с кодом и длинных рассуждений.
Модель специально подготовлена сообществом mlx-community для запуска на процессорах Apple Silicon через фреймворк MLX (нативная библиотека Apple для машинного обучения). Никаких промежуточных слоёв совместимости, никаких костылей.
Вопрос стоял просто: какую скорость генерации текста покажет идеальная связка «топовое железо плюс оптимизированная модель»?
Почему M3 Ultra скорость выдаёт ниже ожиданий?
Ответ оказался контринтуитивным. Вот три факта из теста:
-
12 токенов в секунду при реальной генерации. Это при 80 ядрах GPU, 512 ГБ памяти и модели, которая целиком помещается в оперативную память. Звучит как сбой, но это не сбой.
-
Теоретический максимум составляет около 15 токенов в секунду. Расчёт: заявленная Apple пропускная способность памяти 819 ГБ/с делится на 54 ГБ весов модели. Итого 12 из 15 возможных, то есть система работает на 80% от физического предела.
-
Узкое место не в GPU, а в памяти. При генерации текста каждый следующий токен (минимальная единица текста, примерно 3-4 символа) зависит от предыдущего. Модель не может вычислить второе слово, пока не получила первое. Поэтому на каждом шаге ей приходится заново читать из памяти все 54 ГБ весов. Десятки ядер GPU в этот момент простаивают, ожидая данных.
Такой режим работы называется memory-bound: инференс (процесс генерации ответа) ограничен не мощностью вычислений, а скоростью чтения данных из памяти. Это не дефект M3 Ultra, а фундаментальное свойство авторегрессионной генерации, когда модель выдаёт текст по одному токену за шаг.
Объём памяти и её скорость не одно и то же. 512 ГБ позволяют загрузить огромную модель, но не ускоряют чтение на каждом шаге.
Спекулятивная генерация как выход
Раз память нельзя мгновенно ускорить, автор пошёл другим путём: получать за один дорогой проход модели сразу несколько токенов вместо одного.
Этот приём называется спекулятивная генерация (speculative decoding). Работает так: маленькая вспомогательная модель (draft-модель) быстро угадывает сразу блок из нескольких следующих слов, а большая модель проверяет их за один проход. Если угадала верно, стоимость чтения 54 ГБ весов распределяется не на один токен, а на целый принятый блок.
Для Qwen3.8-27B автор рассматривал два варианта:
- MTP (Multi-Token Prediction), встроенный в модель механизм предсказания нескольких следующих токенов одновременно.
- DFlash2, отдельная draft-модель на основе блочной диффузии. Она параллельно генерирует блок кандидатов, которые потом проверяет основная модель.
Для запуска DFlash2 автор выбрал серверный движок oMLX, потому что ни LM Studio, ни библиотека mlx-vlm на момент теста не поддерживали этот режим для конкретной связки Qwen3.8-27B с DFlash2.
Функция M3 Ultra скорость генерации не увеличивает сама по себе: нужен софтверный обходной путь.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы запускаете языковые модели локально на Mac для генерации текстов, черновиков или анализа, не гонитесь за BF16 без спекулятивной генерации. Квантизованные версии (сжатые до 4 или 8 бит) дадут заметно более высокую скорость, пусть и с небольшой потерей точности. Для большинства текстовых задач разница в качестве незаметна.
Маркетологам и предпринимателям. При выборе между локальным запуском на Mac и облачным API считайте не только стоимость железа, но и реальную пропускную способность. Mac Studio за несколько тысяч долларов при работе с полноразмерными моделями выдаёт 12 токенов в секунду. Облачные сервисы на серверных GPU часто выдают в разы больше. Для массовых задач (пакетная обработка клиентских запросов, генерация контента потоком) облако пока выгоднее.
Тем, кто работает в РФ и СНГ. Локальный запуск на Mac остаётся одним из надёжных вариантов, когда доступ к облачным API ограничен. Но важно понимать потолок: M3 Ultra скорость генерации ограничивает физикой памяти, а не числом ядер.
Этот тест ценен не результатом (12 токенов в секунду ни хорошо, ни плохо сами по себе), а тем, что он разрушает конкретную иллюзию. Apple продаёт M3 Ultra через цифры: 80 ядер GPU, 512 ГБ памяти, 819 ГБ/с пропускной способности. Покупатель складывает эти числа и ждёт пропорционального результата. А получает 12 токенов, потому что задача генерации текста устроена иначе, чем рендер видео или обработка фото.
Для тех из нас, кто работает с текстом на Mac, практический вывод прост: либо используйте квантизованные модели (они реально быстрее и для большинства задач достаточно хороши), либо осваивайте спекулятивную генерацию через oMLX или аналогичные инструменты. Полноразмерная BF16 на M3 Ultra без этих приёмов даёт качество, но не скорость.
Тест проведён одним автором на одной конфигурации с одной моделью. Результаты для других моделей (Llama, Mistral, Gemma) могут отличаться. Теоретический потолок в 15 токенов в секунду рассчитан по упрощённой формуле без учёта накладных расходов на KV-кэш, синхронизацию и работу фреймворка. Итоговый эффект спекулятивной генерации через DFlash2 автор обещал раскрыть в следующей публикации, конкретных цифр ускорения в этом тесте нет.
Если у вас Mac с M-серией и вы запускаете модели локально, проверьте, в каком формате работает ваша модель и включена ли спекулятивная генерация: разница между «медленно, но точно» и «быстро и точно» может оказаться в одной настройке сервера.
По данным авторского технического разбора

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Контекст нейросети можно увеличить в разы: три метода без дообучения
Контекст нейросети (context window) определяет, сколько текста модель способна «видеть» за один раз, и когда он заканчивается, ответы становятся бессвязными, а…

ARC-AGI бенчмарк: 100% в тесте показывает силу кода, а не интеллект машины
Компания ARC Prize Foundation, основанная Франсуа Шолле, разработала серию бенчмарков ARC-AGI для проверки способности ИИ к обучению, и проекты, набирающие…
Excel для строительства: как собрать управленческий экран проекта за 4 часа
Строительные проекты генерируют сотни таблиц, графиков и отчётов, но руководителю перед квартальным комитетом нужна не стопка файлов, а один экран, который за…
Комментарии