Квантизация LLM: как запустить модель на 70 млрд параметров на обычной видеокарте
Квантизация LLM (quantization, сжатие весов модели до меньшего числа бит) позволяет запускать модели с десятками и сотнями миллиардов параметров на обычной потребительской видеокарте, сокращая требования к видеопамяти в 4-8 раз без заметной потери качества ответов.

Модель LLaMA 3 70B в стандартном формате FP32 занимает около 280 ГБ видеопамяти, а DeepSeek-V3 с 671 миллиардом параметров требует больше 2 600 ГБ. Квантизация LLM до 4 бит сжимает LLaMA 3 70B примерно до 35 ГБ, что помещается в одну-две потребительские видеокарты.
Квантизация работает по тому же принципу, что сжатие фотографий в JPEG: каждый параметр модели хранится как число, и вместо «жирного» 32-битного формата (4 байта на параметр) мы записываем его в 8 или 4 бита. Точность падает, файл уменьшается в разы, а результат на глаз почти не отличается. Без этого приёма запуск больших языковых моделей на обычном железе остаётся фантастикой. Источник разбора, подробный технический гайд, опубликованный на Хабре.
Что понадобится
- Видеокарта с vRAM от 8 ГБ (NVIDIA, поколение RTX 3060 и выше, для GPU-форматов) или процессор с 16-32 ГБ оперативной памяти (для CPU-формата GGUF)
- Python 3.10+ и менеджер пакетов pip
- Библиотеки: transformers, auto-gptq, autoawq или llama.cpp (зависит от выбранного формата, подробности ниже)
- Готовая квантизированная модель с Hugging Face (проще всего начать) или оригинальные веса для самостоятельной квантизации
- Время: загрузка и первый запуск готовой квантизованной модели занимает 15-30 минут, самостоятельная квантизация крупной модели может идти несколько часов
Как устроено сжатие изнутри?
Каждый вес модели хранится как число с плавающей запятой. При квантизации LLM происходит линейное отображение диапазона этих чисел в более компактный формат:
- Находятся минимальное и максимальное значения весов в исходном формате FP32 (32 бита, полная точность)
- Диапазон линейно проецируется на целевой формат, например INT8 (значения от минус 128 до 127)
- Вычисляется коэффициент масштабирования (scale)
- Каждое значение умножается на scale и округляется до ближайшего целого
Процесс необратимый. Чем меньше бит, тем больше потери. Современные алгоритмы (GPTQ, AWQ) минимизируют ошибку, но полностью устранить её нельзя.
Какие форматы данных существуют?
- FP32 (32 бита) — максимальная точность, 4 байта на параметр. Для инференса (inference, непосредственный запуск модели для получения ответов) это избыточно
- FP16 (16 бит) — вдвое легче, точности хватает для большинства задач при запуске модели
- BF16 (16 бит) — сохраняет широкий динамический диапазон FP32, но жертвует точностью дробной части. Популярен при обучении моделей
- INT8 и INT4 (8 и 4 бита) — максимальное сжатие, но требуют специальных техник, чтобы модель не деградировала
PTQ или QAT: два способа сжать модель
PTQ (Post-Training Quantization, квантизация после обучения) — берём готовую модель и конвертируем веса в INT8 или INT4. Переобучение не требуется, дополнительные GPU не нужны. При агрессивном сжатии до 4 бит качество может просесть, но для большинства практических задач результат приемлемый.
QAT (Quantization-Aware Training, обучение с учётом квантизации) — модель учится работать с пониженной точностью прямо в процессе тренировки. Требует вычислительных ресурсов, GPU и времени. Зато на выходе качество при том же уровне сжатия заметно лучше, чем у PTQ.
Для большинства читателей, которые хотят запустить чужую модель на своём железе, актуален именно PTQ: скачал готовую квантизованную версию и запустил.
GPTQ, GGUF или AWQ: какой формат выбрать?
Три формата решают разные задачи:
- GGUF — формат для llama.cpp, Ollama, LM Studio. Работает на CPU, поддерживает гибридный режим CPU плюс GPU. Лучший выбор, если у вас нет мощной видеокарты или вы хотите запустить модель на ноутбуке
- GPTQ — заточен под GPU. Высокая скорость инференса на видеокартах NVIDIA
- AWQ — тоже GPU-формат, оптимизирован для скорости, часто чуть быстрее GPTQ на новых картах
Простое правило: работаете на CPU или хотите гибрид CPU плюс GPU — берите GGUF. Нужна максимальная скорость на GPU — выбирайте GPTQ или AWQ.
Пошаговая инструкция: запуск квантизованной модели через llama.cpp
- Установите llama.cpp или Ollama (для Ollama достаточно одной команды в терминале)
# Вариант с Ollama (самый простой)
curl -fsSL https://ollama.com/install.sh | sh
-
Скачайте готовую квантизованную модель в формате GGUF с Hugging Face. Ищите файлы с суффиксами Q4_K_M (4 бита, хороший баланс размера и качества) или Q8_0 (8 бит, ближе к оригиналу)
-
Запустите модель:
# Через Ollama — пример с моделью LLaMA 3
ollama run llama3
- Для ручного запуска через llama.cpp укажите путь к файлу GGUF:
./llama-cli -m ./models/llama-3-70b-Q4_K_M.gguf -p "Ваш промпт здесь" -n 512
- Проверьте качество ответов: задайте модели несколько типовых вопросов из вашей области и сравните с ответами полноразмерной версии через API
Почему MoE-модели сжимать труднее?
MoE (Mixture of Experts, смесь экспертов) — архитектура, где модель содержит набор специализированных подсетей-экспертов, но для каждого токена (token, минимальная единица текста для модели) активирует только два-три из них. Так устроены DeepSeek-V3 (671 миллиард параметров, активно примерно 37 миллиардов), Mixtral 8x7B, LLaMA 4 Scout (109 миллиардов параметров, активно примерно 17 миллиардов).
Проблема в том, что активируется лишь часть экспертов, но все веса всех экспертов должны находиться в памяти одновременно. Квантизация LLM с архитектурой MoE становится не опцией, а единственным способом уместить модель в доступную память.
Дополнительные сложности:
- Неравномерная нагрузка: одни эксперты работают постоянно, другие простаивают. Агрессивное сжатие «горячих» экспертов роняет качество непропорционально. Решение — смешанная точность: активные эксперты в INT8, редко используемые в INT4
- Маршрутизатор не трогать: Router (маршрутизатор, компонент, который решает, к какому эксперту направить токен) принимает дискретные решения. Даже мелкая ошибка округления может отправить токен не к тому эксперту, поэтому маршрутизатор оставляют в FP16
LLaMA 3 70B в разных форматах: - FP32 (32 бита): примерно 280 ГБ vRAM — нужен кластер серверных GPU - FP16 (16 бит): примерно 140 ГБ — две-три карты A100 - INT8 (8 бит): примерно 70 ГБ — одна карта A100 80 ГБ - INT4 (4 бита): примерно 35 ГБ — помещается в потребительскую RTX 4090 (24 ГБ vRAM) с частичной выгрузкой на оперативную память
Реальное потребление может быть выше из-за KV-cache (кеш ключей и значений, который модель хранит для контекста диалога), активаций и служебных данных.
- Сжали слишком агрессивно. Квантизация до 2-3 бит часто превращает ответы модели в бессмыслицу. Для большинства задач 4 бита (Q4_K_M) — разумный минимум, 8 бит — безопасный выбор
- Забыли про KV-cache. Даже если квантизованная модель влезла в память, при длинном контексте KV-cache может съесть оставшуюся vRAM и вызвать ошибку нехватки памяти
- Квантизировали маршрутизатор MoE-модели. Это ломает маршрутизацию токенов между экспертами. Маршрутизатор оставляйте в FP16
- Ожидали идентичного качества. Квантизация — это компромисс. На сложных задачах (математика, код, длинные логические цепочки) 4-битная модель будет уступать оригиналу. Проверяйте на своих задачах, а не только на бенчмарках
Что делать с этим прямо сейчас, по ролям
Авторам Дзена и копирайтерам: вы можете запустить LLaMA 3 или аналогичную открытую модель (open-source, модель с открытым исходным кодом или открытыми весами) локально на своём компьютере с видеокартой от 8 ГБ. Это бесплатная альтернатива платным API для генерации черновиков, рерайта и мозгового штурма.
Маркетологам: квантизованные модели позволяют тестировать гипотезы без оплаты токенов в облаке. Конфиденциальные данные клиентов не уходят на чужой сервер, всё считается локально.
Предпринимателям и разработчикам в РФ и СНГ: квантизация открывает путь к запуску собственных языковых моделей на бюджетном оборудовании. Вместо аренды серверных GPU за сотни тысяч рублей в месяц можно начать с одной потребительской видеокарты. Из доступных в РФ инструментов для локального запуска — Ollama и LM Studio работают без ограничений по региону.
Квантизация LLM — один из тех приёмов, которые превращают теоретическое знание об ИИ в практический навык. Я проверял: разница между 8-битной и полноразмерной моделью в повседневных текстовых задачах (написать письмо, обобщить документ, сгенерировать идеи) практически неразличима. Разница становится заметной на задачах, где важна точная арифметика или многошаговые логические рассуждения.
Честная оговорка: самостоятельная квантизация из исходных весов требует технических знаний и терпения. Если вы не инженер, начинайте с готовых квантизованных моделей на Hugging Face: ищите файлы с пометкой GGUF и суффиксом Q4_K_M. Это тот случай, когда чужая работа экономит десятки часов.
Бесплатный мини-курс по нейросетям для авторов
Разбираем, как использовать локальные и облачные модели для создания контента на Дзене — от генерации идей до финальной редактуры
Попробовать бесплатноГлавный вывод прост: квантизация убрала финансовый барьер между вами и большими языковыми моделями. Карта за 50-80 тысяч рублей теперь делает то, что год назад требовало серверного оборудования за миллионы. Попробуйте Ollama с любой GGUF-моделью на 4 битах — на запуск уйдёт 15 минут, и вы увидите результат сами.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
AI-агент Manus проходит тесты, но ломает SDK: почему инструкции не решают проблему
Мультимодальный ИИ-агент (программа, которая сама выполняет цепочку действий без пошагового контроля человека) вроде Manus уже умеет читать репозиторий,…
Anthropic Claude вышла на $65 млрд выручки, обогнав OpenAI втрое по темпам роста
Почему это важно Anthropic Claude, главный конкурент OpenAI, растёт втрое быстрее и может выйти на биржу уже осенью с оценкой выше двух триллионов долларов,…
Suno AI 5.5: нейросеть теперь позволяет создать музыку в вашем голосе за 100 кредитов
Suno AI (нейросеть для создания музыки) в версии 5.5 получила функцию Custom Models, пользовательских моделей, обученных на ваших треках, и теперь любой автор…
Комментарии