RAG-система на российских GPU-серверах: полный стек для LLM, которая не отдаёт данные за контур
Компании, работающие с конфиденциальными данными, всё чаще ищут способ запустить языковую модель внутри собственного контура, и теперь появился подробный практический сценарий, как это сделать на российских облачных серверах с помощью связки AIBrix, n8n и vLLM в управляемом Kubernetes.
Впервые описан полный стек для изолированной RAG-системы (системы генерации ответов с опорой на собственную базу знаний) именно на российской облачной инфраструктуре с GPU, что закрывает главную боль бизнеса в РФ: данные не покидают контур, а GPU-ресурсы масштабируются автоматически и не простаивают.
Материал опубликован как инженерное руководство и адресован DevOps-инженерам, MLOps-специалистам и архитекторам. Но выводы из него касаются всех, кто принимает решения об ИИ-инфраструктуре в российских компаниях: от технического директора до маркетолога, который хочет понять, реально ли развернуть «свой ChatGPT» без отправки данных за рубеж.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Практический сценарий развёртывания приватной LLM с RAG-системой в Managed Kubernetes на российских облачных серверах (регион ru-6) | Дата публикации руководства не указана | Авторы руководства (ссылка на репозиторий в источнике) | Зависит от конфигурации: две GPU-ноды с RTX 4090 (24 ГБ) плюс две системные ноды, оплата по тарифам облачного провайдера |
Что входит в стек и зачем каждый компонент?
- vLLM (движок инференса, то есть запуска модели для генерации ответов). Берёт на себя быструю обработку запросов к языковой модели на GPU. Каждому процессу vLLM выделяется GPU целиком, чтобы избежать конкуренции за ресурсы.
- AIBrix (LLM-роутер, версия v0.7.0). Направляет запросы к нужной модели. В свежем релизе добавлена поддержка аудиоинтерфейсов, генерации изображений и видео, переранжирования результатов через эндпоинт
/v1/rerankи консоль управления AIBrix Management Console, где можно регистрировать модели без командной строки. - n8n (оркестратор сценариев, визуальный конструктор автоматизаций). Связывает модель, векторную базу и бизнес-логику в единый конвейер. Для n8n нужен cert-manager (выпуск сертификатов) и PostgreSQL (база данных).
- Qdrant (векторная база данных). Хранит векторные представления документов, на которые RAG-система опирается при генерации ответов. Без такой базы модель отвечает только из «головы», с ней она ищет релевантные фрагменты из ваших документов.
- Envoy Gateway выступает зависимостью для AIBrix и обрабатывает входящий трафик.
Как устроены GPU-ноды?
Кластер разворачивается в регионе ru-6 российского облачного провайдера, где доступен выбор конфигураций с GPU.
Рекомендованная конфигурация GPU-нод: 8 vCPU, 32 ГБ RAM, диск 150 ГБ, одна GPU RTX 4090 с 24 ГБ видеопамяти. Диск выбран с запасом, чтобы веса модели гарантированно поместились. Две таких ноды обеспечивают работу vLLM.
Для системных компонентов (kube-system, AIBrix) выделены две отдельные ноды по 4 vCPU и 8 ГБ RAM с диском 50 ГБ. Благодаря такому разделению GPU-ноды можно масштабировать до нуля в неактивные часы, и система продолжит работать. На GPU-ноды устанавливается taint (ограничение, которое не пускает туда посторонние задачи), чтобы запускались только процессы vLLM.
При создании GPU-нод необходимо включить автоматическую установку GPU-драйверов и nvidia-device-plugin.
Как попробовать?
- Создайте кластер Managed Kubernetes в облаке с GPU-нодами в регионе ru-6. Настройте две системные ноды и две GPU-ноды с характеристиками, описанными выше. Включите автоустановку GPU-драйверов.
- Разверните AIBrix v0.7.0 через файл
kustomization.yamlс патчами из руководства. Патчи переводят Envoy Proxy из режима Deployment в DaemonSet, снижают потребление ресурсов балансировщика с 2 vCPU и 8 ГБ RAM до 1 vCPU и 2 ГБ RAM, а также настраивают корректную работу с внутренним балансировщиком нагрузки. - Установите Qdrant, n8n с cert-manager и PostgreSQL, затем настройте связку через n8n-сценарии, чтобы запросы пользователя проходили через RAG-систему: сначала поиск по векторной базе, затем генерация ответа моделью.
- Подробная конфигурация мониторинга описана в репозитории проекта (ссылка в источнике).
Сравнение с облачными сервисами в РФ
| Параметр | Приватная LLM в Kubernetes (описанный подход) | YandexGPT / GigaChat (API) |
|---|---|---|
| Данные | Не покидают ваш контур | Отправляются на серверы провайдера |
| Выбор модели | Любая открытая модель, которая помещается в GPU | Только модели провайдера |
| Масштабирование GPU | Автоматическое, до нуля в простое | Управляется провайдером |
| Сложность запуска | Высокая: нужны DevOps-компетенции | Низкая: подключение по API |
| Стоимость | Оплата облачных ресурсов, экономия при масштабировании в ноль | Оплата за токены (единицы текста, которые модель обрабатывает) |
Для команд без DevOps-инженеров YandexGPT и GigaChat остаются самым быстрым путём к рабочему ИИ. Но если бизнес обрабатывает персональные данные, медицинские карты, финансовые документы или просто не готов отправлять корпоративные тексты на чужие серверы, описанный подход с приватной RAG-системой закрывает эту потребность.
Что это значит для вас?
Автору Дзена. Пока этот стек требует инженерных рук, но понимание того, что RAG-система может работать на российских серверах, полезно при выборе инструментов. Если вы ведёте канал про технологии или бизнес, это тема для разбора: ваша аудитория спрашивает, можно ли «свой ChatGPT» в России.
Маркетологу. RAG-система позволяет строить чат-ботов и ассистентов, которые отвечают строго по вашей базе знаний, а не фантазируют. Это снижает галлюцинации (случаи, когда ИИ уверенно выдумывает несуществующие факты) и делает ответы проверяемыми. Разговор с техническим директором о таком проекте теперь можно начинать с конкретного стека, а не с абстрактного «давайте внедрим ИИ».
Предпринимателю в РФ. Главное: данные не уходят за периметр. Для компаний, подпадающих под требования 152-ФЗ (закон о персональных данных) или работающих с чувствительной информацией, это не просто удобство, а необходимость. Стоимость зависит от нагрузки, но возможность масштабировать GPU-ноды до нуля в нерабочее время прямо влияет на бюджет.
Я вижу в этом руководстве ценность не столько для инженеров (они и так знают, как поднять Kubernetes), сколько для тех, кто принимает решения. Раньше на вопрос «можно ли запустить свою LLM в российском облаке с RAG-системой» приходилось собирать ответ из десятка источников. Теперь есть собранный стек с конкретными версиями и конфигурациями.
Оговорка: руководство не покрывает мониторинг (отсылает к репозиторию) и не называет конкретную модель для запуска. Выбор модели, это отдельная задача, и от неё зависит качество ответов. Кроме того, для запуска нужна команда с опытом в Kubernetes и DevOps.
Что сделать сегодня: если вы нетехнический руководитель, перешлите этот материал вашему DevOps-инженеру или техническому директору с вопросом «сколько времени и денег нужно на пилот». Если вы инженер, начните с создания тестового кластера с одной GPU-нодой, этого достаточно для проверки концепции.
Частые вопросы
Обязательно ли использовать именно RTX 4090?
Нет. В руководстве указано, что модели GPU можно выбрать другие. RTX 4090 с 24 ГБ видеопамяти приведена как рабочий пример. Выбор зависит от размера языковой модели, которую вы планируете запускать: чем больше модель, тем больше видеопамяти потребуется.
Можно ли обойтись без Kubernetes?
Технически языковую модель можно запустить и на одном сервере. Но Kubernetes решает две задачи, которые критичны для продакшена: автоматическое масштабирование (добавление и отключение GPU-нод по нагрузке) и отказоустойчивость (если нода падает, система перезапускает процессы на другой). Без этого вы получаете либо переплату за постоянно работающие серверы, либо риск простоя.
Что такое RAG-система и зачем она, если модель и так умеет отвечать?
RAG-система (Retrieval-Augmented Generation, генерация с опорой на найденные документы) сначала ищет релевантные фрагменты в вашей базе знаний, а потом передаёт их модели вместе с вопросом. Без RAG модель отвечает только из того, что запомнила при обучении, и часто выдумывает. С RAG-системой ответ опирается на ваши документы, что критично для корпоративных задач: поддержка клиентов, внутренние регламенты, юридические базы.
Связка из vLLM, AIBrix, n8n и Qdrant на российских облачных серверах с GPU даёт рабочий путь к изолированной RAG-системе, где данные остаются внутри контура, а GPU-ресурсы не сгорают впустую, и этот путь теперь задокументирован до уровня конкретных конфигурационных файлов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Fine tuning нейросети Qwen2.5 в Google Colab: бесплатный гайд от данных до результата
Дообучение (fine-tuning) нейросети позволяет адаптировать готовую языковую модель под конкретную задачу, и этот гайд проведёт вас от чистого блокнота Google…

Claude Code AI сам пишет автотесты и переводит проект на TypeScript: гайд Битрикс24
Мне нужно отметить важное: предоставленный оригинал — это не новость о привлечении инвестиций (funding), а практический туториал Александра Сербула из…

AirPods с камерой станут «глазами» Siri: Apple хочет убрать iPhone из рук
Apple добавит камерами в наушники не для записи, а как «глаза» для голосового помощника Siri, и это первая попытка компании сделать AirPods чем-то большим, чем…
Комментарии