Игорь Градов
Игорь Градов
7 мин
ai

Квантизация LLM: как запустить модель на 70 млрд параметров на обычной видеокарте

Квантизация LLM (quantization, сжатие весов модели до меньшего числа бит) позволяет запускать модели с десятками и сотнями миллиардов параметров на обычной потребительской видеокарте, сокращая требования к видеопамяти в 4-8 раз без заметной потери качества ответов.

Квантизация LLM: как запустить модель на 70 млрд параметров на обычной видеокарте
Почему это важно

Модель LLaMA 3 70B в стандартном формате FP32 занимает около 280 ГБ видеопамяти, а DeepSeek-V3 с 671 миллиардом параметров требует больше 2 600 ГБ. Квантизация LLM до 4 бит сжимает LLaMA 3 70B примерно до 35 ГБ, что помещается в одну-две потребительские видеокарты.

Квантизация работает по тому же принципу, что сжатие фотографий в JPEG: каждый параметр модели хранится как число, и вместо «жирного» 32-битного формата (4 байта на параметр) мы записываем его в 8 или 4 бита. Точность падает, файл уменьшается в разы, а результат на глаз почти не отличается. Без этого приёма запуск больших языковых моделей на обычном железе остаётся фантастикой. Источник разбора, подробный технический гайд, опубликованный на Хабре.

Что понадобится

  • Видеокарта с vRAM от 8 ГБ (NVIDIA, поколение RTX 3060 и выше, для GPU-форматов) или процессор с 16-32 ГБ оперативной памяти (для CPU-формата GGUF)
  • Python 3.10+ и менеджер пакетов pip
  • Библиотеки: transformers, auto-gptq, autoawq или llama.cpp (зависит от выбранного формата, подробности ниже)
  • Готовая квантизированная модель с Hugging Face (проще всего начать) или оригинальные веса для самостоятельной квантизации
  • Время: загрузка и первый запуск готовой квантизованной модели занимает 15-30 минут, самостоятельная квантизация крупной модели может идти несколько часов

Как устроено сжатие изнутри?

Каждый вес модели хранится как число с плавающей запятой. При квантизации LLM происходит линейное отображение диапазона этих чисел в более компактный формат:

  1. Находятся минимальное и максимальное значения весов в исходном формате FP32 (32 бита, полная точность)
  2. Диапазон линейно проецируется на целевой формат, например INT8 (значения от минус 128 до 127)
  3. Вычисляется коэффициент масштабирования (scale)
  4. Каждое значение умножается на scale и округляется до ближайшего целого

Процесс необратимый. Чем меньше бит, тем больше потери. Современные алгоритмы (GPTQ, AWQ) минимизируют ошибку, но полностью устранить её нельзя.

Какие форматы данных существуют?

  • FP32 (32 бита) — максимальная точность, 4 байта на параметр. Для инференса (inference, непосредственный запуск модели для получения ответов) это избыточно
  • FP16 (16 бит) — вдвое легче, точности хватает для большинства задач при запуске модели
  • BF16 (16 бит) — сохраняет широкий динамический диапазон FP32, но жертвует точностью дробной части. Популярен при обучении моделей
  • INT8 и INT4 (8 и 4 бита) — максимальное сжатие, но требуют специальных техник, чтобы модель не деградировала

PTQ или QAT: два способа сжать модель

PTQ (Post-Training Quantization, квантизация после обучения) — берём готовую модель и конвертируем веса в INT8 или INT4. Переобучение не требуется, дополнительные GPU не нужны. При агрессивном сжатии до 4 бит качество может просесть, но для большинства практических задач результат приемлемый.

QAT (Quantization-Aware Training, обучение с учётом квантизации) — модель учится работать с пониженной точностью прямо в процессе тренировки. Требует вычислительных ресурсов, GPU и времени. Зато на выходе качество при том же уровне сжатия заметно лучше, чем у PTQ.

Для большинства читателей, которые хотят запустить чужую модель на своём железе, актуален именно PTQ: скачал готовую квантизованную версию и запустил.

GPTQ, GGUF или AWQ: какой формат выбрать?

Три формата решают разные задачи:

  • GGUF — формат для llama.cpp, Ollama, LM Studio. Работает на CPU, поддерживает гибридный режим CPU плюс GPU. Лучший выбор, если у вас нет мощной видеокарты или вы хотите запустить модель на ноутбуке
  • GPTQ — заточен под GPU. Высокая скорость инференса на видеокартах NVIDIA
  • AWQ — тоже GPU-формат, оптимизирован для скорости, часто чуть быстрее GPTQ на новых картах

Простое правило: работаете на CPU или хотите гибрид CPU плюс GPU — берите GGUF. Нужна максимальная скорость на GPU — выбирайте GPTQ или AWQ.

Пошаговая инструкция: запуск квантизованной модели через llama.cpp

  1. Установите llama.cpp или Ollama (для Ollama достаточно одной команды в терминале)
# Вариант с Ollama (самый простой)
curl -fsSL https://ollama.com/install.sh | sh
  1. Скачайте готовую квантизованную модель в формате GGUF с Hugging Face. Ищите файлы с суффиксами Q4_K_M (4 бита, хороший баланс размера и качества) или Q8_0 (8 бит, ближе к оригиналу)

  2. Запустите модель:

# Через Ollama — пример с моделью LLaMA 3
ollama run llama3
  1. Для ручного запуска через llama.cpp укажите путь к файлу GGUF:
./llama-cli -m ./models/llama-3-70b-Q4_K_M.gguf -p "Ваш промпт здесь" -n 512
  1. Проверьте качество ответов: задайте модели несколько типовых вопросов из вашей области и сравните с ответами полноразмерной версии через API

Почему MoE-модели сжимать труднее?

MoE (Mixture of Experts, смесь экспертов) — архитектура, где модель содержит набор специализированных подсетей-экспертов, но для каждого токена (token, минимальная единица текста для модели) активирует только два-три из них. Так устроены DeepSeek-V3 (671 миллиард параметров, активно примерно 37 миллиардов), Mixtral 8x7B, LLaMA 4 Scout (109 миллиардов параметров, активно примерно 17 миллиардов).

Проблема в том, что активируется лишь часть экспертов, но все веса всех экспертов должны находиться в памяти одновременно. Квантизация LLM с архитектурой MoE становится не опцией, а единственным способом уместить модель в доступную память.

Дополнительные сложности:

  • Неравномерная нагрузка: одни эксперты работают постоянно, другие простаивают. Агрессивное сжатие «горячих» экспертов роняет качество непропорционально. Решение — смешанная точность: активные эксперты в INT8, редко используемые в INT4
  • Маршрутизатор не трогать: Router (маршрутизатор, компонент, который решает, к какому эксперту направить токен) принимает дискретные решения. Даже мелкая ошибка округления может отправить токен не к тому эксперту, поэтому маршрутизатор оставляют в FP16
Конкретный пример: сколько памяти экономится

LLaMA 3 70B в разных форматах: - FP32 (32 бита): примерно 280 ГБ vRAM — нужен кластер серверных GPU - FP16 (16 бит): примерно 140 ГБ — две-три карты A100 - INT8 (8 бит): примерно 70 ГБ — одна карта A100 80 ГБ - INT4 (4 бита): примерно 35 ГБ — помещается в потребительскую RTX 4090 (24 ГБ vRAM) с частичной выгрузкой на оперативную память

Реальное потребление может быть выше из-за KV-cache (кеш ключей и значений, который модель хранит для контекста диалога), активаций и служебных данных.

Частые ошибки
  • Сжали слишком агрессивно. Квантизация до 2-3 бит часто превращает ответы модели в бессмыслицу. Для большинства задач 4 бита (Q4_K_M) — разумный минимум, 8 бит — безопасный выбор
  • Забыли про KV-cache. Даже если квантизованная модель влезла в память, при длинном контексте KV-cache может съесть оставшуюся vRAM и вызвать ошибку нехватки памяти
  • Квантизировали маршрутизатор MoE-модели. Это ломает маршрутизацию токенов между экспертами. Маршрутизатор оставляйте в FP16
  • Ожидали идентичного качества. Квантизация — это компромисс. На сложных задачах (математика, код, длинные логические цепочки) 4-битная модель будет уступать оригиналу. Проверяйте на своих задачах, а не только на бенчмарках

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам: вы можете запустить LLaMA 3 или аналогичную открытую модель (open-source, модель с открытым исходным кодом или открытыми весами) локально на своём компьютере с видеокартой от 8 ГБ. Это бесплатная альтернатива платным API для генерации черновиков, рерайта и мозгового штурма.

Маркетологам: квантизованные модели позволяют тестировать гипотезы без оплаты токенов в облаке. Конфиденциальные данные клиентов не уходят на чужой сервер, всё считается локально.

Предпринимателям и разработчикам в РФ и СНГ: квантизация открывает путь к запуску собственных языковых моделей на бюджетном оборудовании. Вместо аренды серверных GPU за сотни тысяч рублей в месяц можно начать с одной потребительской видеокарты. Из доступных в РФ инструментов для локального запуска — Ollama и LM Studio работают без ограничений по региону.

Совет редакции dzen.guru

Квантизация LLM — один из тех приёмов, которые превращают теоретическое знание об ИИ в практический навык. Я проверял: разница между 8-битной и полноразмерной моделью в повседневных текстовых задачах (написать письмо, обобщить документ, сгенерировать идеи) практически неразличима. Разница становится заметной на задачах, где важна точная арифметика или многошаговые логические рассуждения.

Честная оговорка: самостоятельная квантизация из исходных весов требует технических знаний и терпения. Если вы не инженер, начинайте с готовых квантизованных моделей на Hugging Face: ищите файлы с пометкой GGUF и суффиксом Q4_K_M. Это тот случай, когда чужая работа экономит десятки часов.

Бесплатный мини-курс по нейросетям для авторов

Разбираем, как использовать локальные и облачные модели для создания контента на Дзене — от генерации идей до финальной редактуры

Попробовать бесплатно

Главный вывод прост: квантизация убрала финансовый барьер между вами и большими языковыми моделями. Карта за 50-80 тысяч рублей теперь делает то, что год назад требовало серверного оборудования за миллионы. Попробуйте Ollama с любой GGUF-моделью на 4 битах — на запуск уйдёт 15 минут, и вы увидите результат сами.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

AI-агент Manus проходит тесты, но ломает SDK: почему инструкции не решают проблему

Мультимодальный ИИ-агент (программа, которая сама выполняет цепочку действий без пошагового контроля человека) вроде Manus уже умеет читать репозиторий,…

7 мин
ai

Anthropic Claude вышла на $65 млрд выручки, обогнав OpenAI втрое по темпам роста

Почему это важно Anthropic Claude, главный конкурент OpenAI, растёт втрое быстрее и может выйти на биржу уже осенью с оценкой выше двух триллионов долларов,…

4 мин
ai

Suno AI 5.5: нейросеть теперь позволяет создать музыку в вашем голосе за 100 кредитов

Suno AI (нейросеть для создания музыки) в версии 5.5 получила функцию Custom Models, пользовательских моделей, обученных на ваших треках, и теперь любой автор…

6 мин