Запуск LLM на ноутбуке: модель с 2,8 трлн параметров уместили в 64 ГБ памяти
Запуск языковой модели с 2,8 триллиона параметров на обычном ноутбуке стал возможен в конце июля 2026 года благодаря архитектуре «смесь экспертов» и новым методам сжатия весов, и это не трюк, а практический учебник по работе с памятью для тех, кому нельзя отправлять данные в облако.

Финтех, юристы и все, кто работает с чувствительными данными, впервые получили проверенный путь запуска больших моделей на собственном железе без единого обращения к внешнему API.
Сергей Прощаев, Tech Lead в финтехе и преподаватель ОТУС, разобрал проект запуска модели Kimi K3 от Moonshot на MacBook с чипом M1 Max и 64 ГБ памяти. Скорость составила примерно один токен (минимальная единица текста, которую обрабатывает модель) в минуту. Для продакшена это бесполезно, но для понимания того, как устроена иерархия памяти и где именно ваша компания находится на шкале между облаком и собственным сервером, это лучший бесплатный учебник, по оценке самого автора.
Что понадобится
- Железо: машина с 64 ГБ оперативной памяти и быстрым SSD (Apple Silicon или рабочая станция с дискретной видеокартой и достаточным объёмом VRAM, то есть видеопамяти)
- Дисковое пространство: от 594 ГБ для однобитной сжатой сборки до 1,56 ТБ для полных весов
- Софт: llama.cpp (открытый инструмент для запуска языковых моделей локально), доступ к Hugging Face для скачивания весов
- Время: вечер на настройку, понимание результата важнее скорости генерации
- Знание командной строки: базовое, все команды приведены ниже
Как устроена модель, которую запускают?
Kimi K3 построена на архитектуре MoE (Mixture-of-Experts, «смесь экспертов»): вместо одной монолитной сети модель состоит из 896 специализированных блоков на каждом слое, и маршрутизатор на каждом шаге выбирает только 16 из них. Всего параметров 2,8 триллиона, но в вычислении каждого токена участвуют порядка 104 миллиардов, по оценкам из проекта.
Модель делится на две части с принципиально разным поведением:
- «Спина» (spine, термин из проекта, не из официальной архитектуры K3): эмбеддинги (числовые представления слов), слои внимания, общие эксперты. Работает на каждом токене. Около 114 ГБ в формате bf16
- Маршрутизируемые эксперты: 82 432 блока, порядка 1,45 ТБ. На конкретном токене нужна крошечная доля, остальные просто хранятся
Малое число активных параметров снижает вычислительную стоимость токена, но не уменьшает объём, который надо где-то держать. Память определяется полным набором весов, вычисления определяются активным набором. Для ограниченного железа это превращает задачу «хватит ли памяти» в задачу «как организовать иерархию хранения и доставку нужных экспертов».
На машине с дискретной видеокартой VRAM отделена от системной памяти шиной PCIe. На Apple Silicon процессор и графика делят одну физическую память, копирования между уровнями нет, есть только разница между тем, что осело в резидентной памяти, и тем, что читается с диска.
Пошаговая инструкция: три способа уместить модель
По классификации автора (не отраслевой стандарт), для локального запуска таких моделей существуют три подхода.
1. Сжать веса (квантование)
В конце июля 2026 года команда Unsloth выпустила калиброванные динамические кванты K3. «Динамические» означает: большая часть весов сжимается до 1-2 бит, а тензоры, чувствительные к потере точности, получают более высокую битность.
Результаты сжатия:
- Однобитная сборка: около 594 ГБ (вместо исходных 1,56 ТБ), удерживает примерно 78,9% от результата восьмибитного эталона на наборе задач самой команды
- Двухбитные сборки: 711 и 861 ГБ
Автор подчёркивает: 78,9% это относительная доля бенчмарк-скора (оценки на тестовом наборе задач), а не точность классификатора. Переносить эту цифру на свои задачи без собственной проверки нельзя. Калиброванный квант и «слепой» квант, когда модель сжимают без прогона для калибровки, принципиально разные вещи.
2. Оффлоад экспертов (частичная выгрузка в оперативную память)
Этот способ реально применим на обычной рабочей станции. В llama.cpp есть флаг, который оставляет MoE-веса части слоёв в системной памяти, а остальной граф считает на видеокарте.
Пример команды для модели среднего размера (не Kimi K3, её на одной карте не запустить):
./llama-server \
--model qwen3.6-35b-a3b-IQ4_NL.gguf \
--n-gpu-layers 99 \
--n-cpu-moe 24 \
--ctx-size 16384 \
--flash-attn
Более тонкий контроль через переопределение размещения тензоров:
# отправить все маршрутизируемые эксперты в системную память
--override-tensor "exps=CPU"
Поведение и оптимальный набор параметров зависят от версии llama.cpp, бэкенда и конкретного файла модели. Фактическое распределение стоит сверять с выводом загрузчика при старте.
3. Запустить «в лоб» на Apple Silicon
Именно так модель на 2,8 триллиона параметров запустили на MacBook с M1 Max и 64 ГБ. Процессор и графика делят одну память, копирования нет, но веса читаются с диска. Результат: один токен в минуту. Для генерации бесполезно, для понимания архитектуры бесценно.
Что делать с этим прямо сейчас, по ролям
Автору Дзена и копирайтеру. Запуск LLM на ноутбуке (LLM, large language model, большая языковая модель) пока не замена облачным сервисам для генерации текстов. Но если вы работаете с конфиденциальными клиентскими материалами и не хотите отправлять их в сторонний API, локальная модель среднего размера (не 2,8 триллиона, а 7-35 миллиардов параметров) уже даёт рабочий результат на хорошем ноутбуке.
Маркетологу. Запуск LLM на ноутбуке становится аргументом в переговорах с клиентами из регулируемых отраслей: «ваши данные не покидают периметр». Из доступных в РФ решений для локального запуска: модели семейства Qwen через тот же llama.cpp, а также YandexGPT и GigaChat для облачных сценариев.
Предпринимателю в финтехе или юридическом бизнесе. Это именно ваш сценарий: репозиторий с логикой обработки транзакций наружу не поедет, как описывает автор из собственного опыта. Оффлоад экспертов на рабочей станции с дискретной картой это реальный рабочий вариант для внутреннего ассистента по коду.
Автор описывает конкретную ситуацию: команда, работающая с платёжным контуром, хотела сделать подсказки по легаси-коду. Задача звучала безобидно, пока не дошли до выгрузки репозитория во внешний API. На этом всё закончилось. Запуск модели среднего размера локально через llama.cpp с флагом оффлоада экспертов решает именно эту проблему: данные остаются на машине, модель работает с кодом без обращения наружу.
Путать активные параметры с полным размером. 104 миллиарда активных параметров не означают, что модель поместится в 104 миллиарда параметров памяти. Хранить надо все 2,8 триллиона.
Считать, что квантование бесплатно. Однобитная сборка теряет около 21% качества по бенчмаркам команды Unsloth. На ваших задачах потери могут отличаться в любую сторону.
Использовать «слепой» квант вместо калиброванного. Ранние конверсии делались без прогона модели для калибровки. Результат хуже, хотя файл может весить столько же.
Копировать команды без проверки. Поведение llama.cpp зависит от версии, бэкенда и файла модели. Сверяйте распределение слоёв с выводом загрузчика при каждом старте.
Один токен в минуту это, конечно, не рабочий инструмент. Но я вижу здесь два практических вывода. Первый: если вам нужен локальный ИИ-ассистент, не начинайте с модели на 2,8 триллиона параметров. Возьмите Qwen 35B с оффлоадом экспертов на рабочей станции с 24 ГБ видеопамяти и получите реальную скорость. Второй: сам факт, что модель такого размера запускается на ноутбуке, означает, что архитектура MoE и динамическое квантование дозрели до практического применения на железе на порядок дешевле серверного. Через полгода модели среднего размера на локальном железе будут работать с комфортной скоростью. Честная оговорка: всё, что касается качества после квантования, надо проверять на своих задачах. Бенчмарки автора и команды Unsloth не являются гарантией для вашего конкретного случая.
Если ваш бизнес не может отправлять данные в облако, начинайте не с покупки кластера, а с вечера за llama.cpp и моделью среднего размера: это покажет, где именно вы находитесь на шкале между ноутбуком и дата-центром, и сколько на самом деле стоит следующий шаг.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Автодополнение кода нейросетью: три приёма сборки контекста, которые убирают галлюцинации
Языковая модель (LLM, large language model) умеет не просто генерировать текст, а восстанавливать пропущенный фрагмент кода прямо в редакторе, и качество такой…

Claude нейросеть за три месяца: где ассистент экономит часы, а где код дороже ручной работы
Claude как программист и ассистент: три месяца практики разработчика показали, где нейросеть помогает искать информацию в диалоговом режиме, а где генерация…
Язык специального назначения для LLM: как ограничить модель и получить стабильный результат
Автору Дзена или разработчику, который хочет получать от большой языковой модели (LLM) предсказуемый результат, а не лотерею, достаточно одного приёма: дать…
Комментарии