Игорь Градов
Игорь Градов
7 мин
ai

Запуск LLM локально на Windows: пошаговый гайд от чистой системы до ИИ-сервера

Запуск LLM (большой языковой модели) локально на своём компьютере снимает зависимость от облачных сключей и подписок, и этот гайд проведёт вас от чистой Windows 11 до работающего ИИ-сервера за один вечер.

Запуск LLM локально на Windows: пошаговый гайд от чистой системы до ИИ-сервера
Почему это важно

Локальный запуск LLM означает, что данные не покидают вашу машину, а инференс (генерация ответов моделью) не стоит ни копейки за токен: платите только за электричество.

Большинство инструкций по запуску LLM локально сводятся к паре команд в терминале. Они работают ровно до первой ошибки, после которой непонятно, где именно сломалось: в Windows, WSL2 (подсистеме Linux внутри Windows), драйвере видеокарты, Docker (системе контейнеров, изолированных «коробок» для программ) или самом сервере модели. Этот гайд разбирает каждый уровень стека отдельно, чтобы вы могли диагностировать проблему, а не гадать.

В качестве модели используется Qwen3-0.6B, компактная открытая модель на 0,6 миллиарда параметров, которая помещается даже на видеокарту с 4 ГБ видеопамяти.

Что понадобится?

  • Windows 11 с включённой подсистемой WSL2
  • Видеокарта NVIDIA с поддержкой CUDA (набора инструментов для вычислений на GPU) и драйвером, совместимым с WSL2 (подойдёт даже уровень RTX 3050 с 4 ГБ VRAM)
  • Оперативная память: от 16 ГБ
  • Свободное место на диске: 30-50 ГБ
  • Время: один вечер, около 2-3 часов с учётом загрузок и перезагрузок

Как устроена цепочка от Windows до модели?

Модель не общается с Windows напрямую. Между ними несколько слоёв, каждый зависит от предыдущего:

  • Windows 11 с драйвером NVIDIA
  • WSL2 (Ubuntu внутри Windows) видит GPU через драйвер
  • Docker создаёт изолированное окружение
  • NVIDIA Container Toolkit пробрасывает видеокарту внутрь контейнера
  • vLLM (сервер инференса) загружает модель и отвечает на запросы

Проверять удобно снизу вверх: если GPU не виден в WSL2, переходить к Docker бессмысленно.

Пошаговая инструкция

Шаг 1. Устанавливаем WSL2 и Ubuntu

Откройте PowerShell от имени администратора:

wsl --install

Если система попросит перезагрузиться, перезагружайтесь. После этого проверьте состояние:

wsl --status
wsl --list --online

Если Ubuntu ещё не установлена:

wsl --install -d Ubuntu

Запустите WSL и внутри Ubuntu проверьте систему:

wsl
uname -a

Шаг 2. Проверяем GPU внутри WSL

Находясь в Ubuntu, выполните:

nvidia-smi

Команда должна показать вашу видеокарту, версию драйвера и использование памяти. Если nvidia-smi не работает на этом этапе, дальше идти нет смысла. Проверяйте три вещи: драйвер NVIDIA в Windows, версию WSL и доступность GPU внутри WSL2.

Шаг 3. Обновляем Ubuntu

sudo apt update
sudo apt upgrade -y
sudo apt install -y ca-certificates curl gnupg lsb-release git wget

Шаг 4. Устанавливаем Docker Engine

Сначала удалите пакеты, которые могут конфликтовать:

for pkg in docker.io docker-doc docker-compose podman-docker containerd runc; do
  sudo apt-get remove -y $pkg
done

Создайте каталог для ключей и добавьте официальный GPG-ключ Docker:

sudo install -m 0755 -d /etc/apt/keyrings
sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg \
  -o /etc/apt/keyrings/docker.asc
sudo chmod a+r /etc/apt/keyrings/docker.asc

Подключите репозиторий:

echo \
  "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] \
  https://download.docker.com/linux/ubuntu \
  $(. /etc/os-release && echo "$VERSION_CODENAME") stable" | \
  sudo tee /etc/apt/sources.list.d/docker.list > /dev/null

Установите Docker:

sudo apt update
sudo apt install -y docker-ce docker-ce-cli containerd.io \
  docker-buildx-plugin docker-compose-plugin

Проверьте:

docker --version
sudo docker run hello-world

Чтобы не писать sudo перед каждой командой:

sudo usermod -aG docker $USER
exit

Заново откройте WSL. Если docker ps работает без sudo, всё настроено.

Шаг 5. Устанавливаем NVIDIA Container Toolkit

Docker сам по себе не даёт контейнерам доступ к видеокарте. Эту связку обеспечивает NVIDIA Container Toolkit.

curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | \
  sudo gpg --dearmor \
  -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L \
  https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
  sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
  sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Шаг 6. Проверяем, что GPU доступен из контейнера

Это проверка всей цепочки целиком:

docker run --rm --gpus all \
  nvidia/cuda:12.8.1-base-ubuntu24.04 \
  nvidia-smi

Если внутри контейнера появился вывод nvidia-smi с именем вашей видеокарты, вся инфраструктура работает.

Шаг 7. Загружаем vLLM и запускаем модель

Docker-образ (image) и файлы модели хранятся отдельно. Образ vllm/vllm-openai:latest содержит программное окружение: Python, PyTorch, CUDA-библиотеки, vLLM. Весит несколько гигабайт. Веса модели, токенизатор (программа, разбивающая текст на фрагменты для модели) и конфигурация хранятся в кэше ~/.cache/huggingface. Благодаря этому модель не приходится скачивать заново после пересоздания контейнера.

docker pull vllm/vllm-openai:latest

У образа уже настроена точка входа vllm serve, поэтому всё, что вы указываете после имени образа, передаётся как аргументы серверу.

Пример: запуск и первый запрос

Запускаем контейнер с моделью Qwen3-0.6B:

docker run --rm --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model Qwen/Qwen3-0.6B \
  --max-model-len 1024

После загрузки модели сервер начнёт слушать порт 8000. Отправляем запрос из другого терминала:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-0.6B",
    "messages": [{"role": "user", "content": "Объясни, что такое нейросеть, в двух предложениях"}]
  }'

В ответ приходит JSON с текстом, который модель сгенерировала на вашем GPU, без отправки данных куда-либо за пределы компьютера.

Частые ошибки
  • nvidia-smi не работает в WSL: чаще всего проблема в драйвере NVIDIA на стороне Windows. Убедитесь, что установлен драйвер с поддержкой WSL2 с официального сайта NVIDIA, а не универсальный
  • Docker не видит GPU: пропущен шаг установки NVIDIA Container Toolkit или не перезапущен демон Docker после настройки (sudo systemctl restart docker)
  • Не хватает VRAM: за видеопамять конкурируют веса модели, KV-кэш (кэш, в котором модель хранит контекст диалога), CUDA-контекст и служебные буферы. Модель на 0,6 миллиарда параметров на 4 ГБ запускается, но параметр --max-model-len придётся ограничить (1024 токена, хорошая отправная точка)
  • Путаница между Docker-образом и кэшем модели: если вы удалили контейнер, но монтировали папку ~/.cache/huggingface через -v, модель останется на диске. Если не монтировали, скачивать придётся заново
  • Недостаточно места на диске: Docker-образ vLLM занимает несколько гигабайт плюс веса модели. Запас в 30-50 ГБ указан не зря

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Локальный запуск LLM означает бесплатную генерацию черновиков, рерайтов, заголовков без лимитов по токенам. Qwen3-0.6B, модель компактная, для сложных текстов может не хватить, но для мозгового штурма и простых задач годится. Данные при этом не уходят за пределы вашей машины.

Маркетологу. Появляется возможность тестировать промпты (текстовые команды для модели) на локальном сервере до того, как тратить бюджет на API облачных моделей. Формат ответа совместим с OpenAI API, поэтому скрипты, написанные для GPT, можно переключить на локальный адрес одной строкой.

Предпринимателю в РФ. Все описанные инструменты доступны из России: WSL2, Docker, NVIDIA Container Toolkit, vLLM и модель Qwen3 не требуют VPN или зарубежных подписок. Для тех, кому нужны российские модели, GigaChat и YandexGPT работают через облако; локально же проще всего начать с открытых моделей семейства Qwen или Llama.

Мнение редакции dzen.guru

Я проверял этот стек на RTX 3050 с 4 ГБ видеопамяти. Qwen3-0.6B работает, отвечает за секунды, но длинные тексты ей даются тяжело: контекстное окно приходится урезать, а качество генерации заметно уступает GPT-4o или Claude. Для меня главная ценность не в замене облачных моделей, а в понимании, как устроен стек. Когда вы один раз прошли цепочку от драйвера до API-ответа, любая следующая модель ставится за минуты, а ошибки перестают быть загадкой. Честная оговорка: 4 ГБ VRAM хватит для экспериментов, но не для рабочей нагрузки с длинными документами. Для этого нужна карта от 8 ГБ, а лучше от 12 ГБ.

Научитесь работать с нейросетями на практике

В dzen.guru мы разбираем инструменты ИИ для авторов и маркетологов, от промптов до локальной инфраструктуры

Перейти в dzen.guru

Главный результат этого гайда не сама модель, а навигация по стеку. Запуск LLM локально перестаёт быть магией, когда вы знаете, какой слой за что отвечает, и умеете проверять каждый из них по отдельности. Начните с Qwen3-0.6B, убедитесь, что цепочка работает, а потом подставляйте модели побольше, сервер примет любую, которая поместится в вашу видеопамять.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

OpenAI интеграция с Jira и Confluence: ChatGPT создаёт задачи и ищет баги без переключения окон

OpenAI и Atlassian объявили о расширении партнёрства 10 июня 2025 года, в день открытия конференции Team '25 Europe, и теперь ChatGPT сможет работать с…

4 мин
Ошибки искусственного интеллекта важнее рейтингов: Microsoft объяснила, почему тесты врут
ai

Ошибки искусственного интеллекта важнее рейтингов: Microsoft объяснила, почему тесты врут

Microsoft второго июня опубликовала разговор с Дженнифер Невилл, партнёром-руководителем исследований, о том, как оценка ИИ-систем выявляет неожиданные ошибки…

5 мин
Google отдала бесплатно embedding модель на 740 млн параметров: работает на смартфоне без сервера
ai

Google отдала бесплатно embedding модель на 740 млн параметров: работает на смартфоне без сервера

Почему это важно Google выпустила embedding модель (модель, которая превращает текст, код, изображения, видео и аудио в числовые векторы для поиска и…

5 мин