Самохостинг модели на GPU: 18 конфигураций на одной карте показали, что 9B хватает
Локальная модель на одной видеокарте: какой квант ставить и стоит ли гнаться за параметрами, когда 9B хватает для продакшена.

Маркетинговые бенчмарки моделей не показывают, как квант (уровень сжатия весов) ведёт себя на ваших задачах: пустые ответы, арабские слова посреди русского текста, арифметика с «5,5 яблоками» вылезают только при собственном прогоне на реальных промптах (промптах, то есть конкретных запросах к модели).
Автор dzen.guru за один вечер прогнал 18 конфигураций, три открытые модели в пяти-шести квантах каждая, на 22 практических задачах: код на Python и Ansible, рассуждения на русском языке, форматирование. Тест шёл на арендованной у Selectel видеокарте RTX PRO 6000 с 96 ГБ видеопамяти (архитектура Blackwell), частично по грантовой программе провайдера. Результат: конкретная таблица «модель, квант, скорость, качество» и три практических вывода, которые не найти ни в одном пресс-релизе.
Что понадобится для самохостинга модели на GPU?
- Видеокарта с достаточным объёмом VRAM. Для модели 9B в кванте Q5 или Q6 хватает 24 ГБ (MacBook M5 Pro 24 ГБ или RTX 4090). Для двух моделей одновременно (продакшен-сценарий) нужно от 48 ГБ, а 96 ГБ закрывают даже пару крупных моделей с запасом на конкурентные запросы.
- Ollama (бесплатный инструмент для запуска открытых моделей локально, ставится одной командой).
- Файлы модели в формате GGUF (готовые сжатые веса, скачиваются с HuggingFace).
- Набор собственных тестовых задач, минимум 15 реальных промптов из вашей работы: код, тексты на русском, задачи с подвохом. Синтетика не считается.
- Время: один вечер на прогон, если карта уже арендована или стоит дома.
Пошаговая инструкция: от установки до выводов
-
Выберите карту под задачу. Посчитайте бюджет памяти: вес модели в нужном кванте плюс KV-кеш (буфер, где модель хранит контекст диалога). Для модели 27B в кванте Q5 это примерно 20 ГБ плюс 2-4 ГБ на KV. Если планируете держать две модели одновременно, складывайте оба бюджета и добавляйте запас.
-
Установите Ollama.
curl -fsSL https://ollama.com/install.sh | sh
- Скачайте модель нужного кванта.
ollama pull qwen3:27b-q5_K_M
Замените название и квант на те, что тестируете. Для сравнения скачайте тот же вес в нескольких квантах: Q3, Q5, Q6, Q8.
-
Подготовьте свой набор тестов. Не берите чужие бенчмарки. Возьмите 15-22 задачи из реальной работы. Примеры: Ansible-плейбук с правилами файрвола, Python-функция очистки контактных данных, задача на рассуждение по-русски с подвохом, запрос на форматирование таблицы.
-
Прогоните каждую конфигурацию на полном наборе. Фиксируйте три параметра: скорость (токены в секунду), корректность ответа (верно, неверно, пустой ответ), языковые дефекты (вставки на чужом языке, бессмысленные числа).
ollama run qwen3:27b-q5_K_M "Напиши Ansible-плейбук для настройки файрвола..."
-
Сравнивайте квант к кванту внутри одного движка. Скорость между Ollama и другим движком (например, vLLM, серверный движок для инференса, то есть генерации ответов) сравнивать нельзя: вы измерите разницу движков, а не квантов.
-
Сделайте вывод по трём осям: скорость, качество, языковая адекватность. Одна ось без двух других бессмысленна.
Промпт: задача про пять яблок с неоднозначным делением пополам (классическая ловушка на рассуждение).
Ornith-35B (MoE-модель, 35 млрд параметров номинально, активных около 3 млрд на токен) выдала «5,5 яблок», вставила арабское слово «نصف» («половина») в русское предложение. Арифметика формально верна, результат физически бессмыслен для целых фруктов.
Ornith-9B честно разобрала оба варианта округления и дала целое число.
Qwen3.8-27B ответила в две строки и сама отметила, что условие некорректно для целых яблок.
Модель с наибольшим числом параметров проиграла на практической задаче обеим меньшим моделям. Без собственного прогона этот дефект остался бы скрыт за маркетинговыми цифрами.
Двухбитный квант: самохостинг модели на GPU с экономией, которая убивает результат
Qwen3.8-27B в кванте UD-IQ2_XXS (файл всего 7,27 ГБ, заманчиво мало) выдала пустой ответ на 2 из 22 задач. Не мусор, не таймаут, буквально пустая строка. Обе задачи практические: Ansible-плейбук и Python-функция.
Ниже трёхбитного сжатия модель иногда не отвечает вовсе. Размер файла выглядит привлекательно, но для реальной работы такой квант непригоден, какой бы ни была карта.
Скорость MoE-модели и ловушка «быстрее значит лучше»
Ornith-35B на той же карте выдавала 159-198 токенов в секунду против 54-57 у Qwen3.8-27B. Разница почти втрое. Причина проста: MoE (Mixture of Experts, архитектура, где на каждый токен работает только часть параметров) активирует около 3 млрд параметров из 35 млрд, карта перечитывает меньше данных.
Но скорость и качество стоят на разных осях. Цифры из пресс-релиза Ornith-35B (Terminal-Bench 67,8 против 52,5 у Qwen, SWE-bench 79 против 73,4) на собственном прогоне не подтвердились. Отдельная задача на фактчек дала ошибку на каждом протестированном кванте Ornith-35B, включая почти без потерь Q8_0. Если ошибка не исчезает даже на максимально точном кванте, дело не в сжатии, а в самой модели.
Что делать с этим прямо сейчас, по ролям?
-
Автору Дзена и копирайтеру. Перед тем как доверять локальной модели генерацию текстов на русском, прогоните минимум 15 своих типовых запросов. Языковые дефекты (вставки на чужом языке, бессмысленная арифметика) вылезают именно на русском и именно на практических задачах. Модель 9B в кванте Q5 или Q6 на 24 ГБ видеопамяти покрывает большинство задач автора.
-
Маркетологу и продакт-менеджеру. Не выбирайте модель по чужим бенчмаркам. Соберите свой тестовый набор из реальных задач команды и прогоните до внедрения. Пустой ответ на двухбитном кванте в продакшене означает сбой сервиса, а не просто «чуть хуже качество».
-
Предпринимателю в РФ и СНГ. Самохостинг модели на GPU доступен через российские облака: Selectel предлагает аренду карт с 96 ГБ видеопамяти, есть грантовые программы. Из российских аналогов для тех, кто не готов к самохостингу: YandexGPT и GigaChat работают через API без аренды железа, но не дают контроля над квантами и скоростью.
Ставить модель по пресс-релизным цифрам. Бенчмарки от команды разработчиков модели не проверены независимо и могут не совпасть с вашими задачами.
Сравнивать скорость между разными движками. Ollama и vLLM (серверный движок для продакшен-инференса) дают разные цифры при одинаковом кванте. Сравнивайте квант к кванту только внутри одного движка.
Экономить память двухбитным квантом. Ниже трёх бит модель может молча не отвечать на часть задач, и это хуже неверного ответа.
Делать вывод по одному промпту. Единичный фактчек, это шумный сигнал. Ошибка на одном вопросе может быть случайностью. Вывод держится, только если дефект повторяется на нескольких задачах или на всех квантах.
Для российского продакшена чужие бенчмарки почти бесполезны: ни один публичный лидерборд не проверяет Ansible-плейбуки с кириллическими комментариями или задачи на рассуждение по-русски с подвохом. По нашим наблюдениям, модель 9B в кванте Q5 или Q6 на карте с 24 ГБ, это разумный выбор для большинства задач автора и маркетолога. Платить за 35B и MoE-скорость имеет смысл, только если вы уже проверили качество на своих промптах и оно вас устроило. Не проверили, не ставьте. Один вечер тестов экономит недели работы с моделью, которая вставляет арабские слова в русский текст.
Хотите писать на Дзене быстрее с помощью ИИ?
В dzen.guru собраны инструменты и гайды для авторов, которые используют нейросети в работе с контентом.
Попробовать инструментыОдин вечер, 18 конфигураций, 22 задачи. Итог укладывается в одну строку: берите 9B в Q5 или Q6, проверяйте на своих промптах, не верьте чужим таблицам. Всё остальное, переплата за скорость, которую вы не конвертируете в качество.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

LLM в поиске кандидатов подняла точность выдачи резюме с 43,7 до 66,3%
Компания, разрабатывающая внутреннюю платформу подбора ИТ-специалистов в России, этим летом встроила языковую модель (LLM, большая языковая модель, которая…

Голосовой ИИ Ringg обрабатывает 20 млн звонков в месяц: раунд вырос до $15,5 млн
Индийский стартап Ringg, обрабатывающий 20 миллионов звонков в месяц через голосовой ИИ, привлёк 10 миллионов долларов от Peak XV Partners в расширение раунда…

Китай выпустил 90% гуманоидов мира и превращает робототехнику в массовое шоу
Фестиваль робототехники в пригороде Шанхая собрал более ста компаний и сотни семей, которые в выходной день пришли посмотреть, как гуманоидные роботы…
Комментарии