ИИ-агенты без облака: скачать, собрать локальную установку на б/у GPU за 18 000 ₽
Локальный ИИ-сервер на б/у видеокартах за 18 000 рублей: собираем, тестируем, подключаем ИИ-агентов без облака.

Автор Дзена собрал домашний сервер на двух списанных серверных видеокартах Tesla P100, прогнал 14 инженерных задач и получил локальную нейросеть, которая по узким вопросам обошла облачный DeepSeek.
Локальный ИИ-сервер на вторичном железе позволяет запускать модели до 35 миллиардов параметров без подписок, без зависимости от API и без утечки данных в облако, а стоимость входа по российским ценам на б/у видеокарты составляет от 8 до 18 тысяч рублей за пару GPU.
До недавнего времени запуск больших языковых моделей требовал либо дорогих облачных токенов (токен — минимальная единица текста, которую обрабатывает нейросеть), либо свежих видеокарт за сотни тысяч рублей. Но серверные карты 2016 года, списанные из дата-центров, изменили арифметику. Практик собрал стенд, замерил скорость и честно сравнил с облаком. Разбираем его опыт по шагам, чтобы вы могли повторить сборку и получить собственного ИИ-агента (программу, которая сама выполняет цепочку действий по вашей задаче), работающего круглосуточно.
Что понадобится?
- Процессор: Intel Xeon E5-2680 v4 (14 ядер, 28 потоков, 2.40 ГГц) или аналогичный серверный CPU. На Авито и в профильных Telegram-каналах такие процессоры стоят от 3 000 до 6 000 рублей вместе с материнской платой.
- Оперативная память: 64 ГБ DDR4 (четыре планки по 16 ГБ, 2133 МГц). Серверная память на вторичном рынке обойдётся от 4 000 до 8 000 рублей за комплект.
- Видеокарты: две NVIDIA Tesla P100 PCIe по 16 ГБ HBM2 (высокоскоростная память, распаянная прямо на чипе). На российских площадках каждая карта стоит от 4 000 до 9 000 рублей. Плюс дешёвая GeForce GT 710 для вывода изображения на монитор, потому что серверные Tesla не имеют видеовыходов.
- Накопитель: NVMe SSD от 512 ГБ. Бюджетный QLC-диск (например, CUSU CV3500Q) подойдёт, модели читаются при загрузке один раз.
- Блок питания: от 1 000 Вт. Две P100 плюс Xeon под нагрузкой потребляют до 600 Вт, запас нужен.
- Программный стек: llama.cpp (открытый движок для запуска моделей в формате GGUF), CUDA 12.4 (драйверы NVIDIA для вычислений на GPU), Linux.
- Охлаждение: открытый стенд. В закрытом корпусе пыль собирается комками, а горячий воздух застаивается. Воздуховоды для направленного обдува можно напечатать на 3D-принтере или собрать из пластиковых коробов. Без них карты уходят в троттлинг (принудительное снижение частоты при перегреве).
- Время на сборку и настройку: один выходной день.
Пошаговая инструкция
-
Соберите открытый стенд. Закрепите материнскую плату на раме или полке. Установите Xeon, оперативную память, обе Tesla P100 в слоты PCIe x16, GT 710 в свободный слот. Подключите NVMe-диск и блок питания. Обеспечьте прямой поток воздуха на турбины видеокарт.
-
Установите Linux и драйверы NVIDIA. Ubuntu 22.04 или 24.04 подойдут. Поставьте CUDA 12.4 по официальной инструкции NVIDIA. Проверьте, что обе P100 видны в системе:
nvidia-smi
В выводе должны отображаться два устройства Tesla P100-PCIE-16GB.
- Соберите llama.cpp с поддержкой CUDA. Это открытый движок, который умеет запускать квантованные модели (модели, сжатые для работы на слабом железе) на нескольких GPU одновременно:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
- Скачайте модель в формате GGUF. Для двух P100 с суммарными 32 ГБ видеопамяти подходят модели до 35 миллиардов параметров. По результатам тестирования автора, лучший результат показала Ornith-1.5-35B в квантовании Q4_K_M (сжатие с 4-битной точностью, хороший баланс качества и размера). Модель скачивается с HuggingFace:
# пример загрузки через huggingface-cli
huggingface-cli download <автор>/Ornith-1.5-35B-GGUF \
--include "*.Q4_K_M.gguf" --local-dir ./models
Этот шаг и есть момент, когда вы можете скачать локальную установку для ИИ-агентов: модель ляжет на ваш диск и будет работать без интернета.
- Запустите сервер инференса (инференс — процесс, при котором модель генерирует ответ на ваш запрос):
./build/bin/llama-server \
-m ./models/ornith-1.5-35b.Q4_K_M.gguf \
--host 0.0.0.0 --port 8080 \
-ngl 99 \
--tensor-split 0.5,0.5
Параметр -ngl 99 выгружает все слои модели на GPU. Параметр --tensor-split 0.5,0.5 делит нагрузку поровну между двумя P100.
- Проверьте скорость. Отправьте тестовый запрос:
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"ornith","messages":[{"role":"user","content":"Напиши FreeRTOS-задачу для ESP32, которая опрашивает DHT22 раз в 2 секунды, управляет реле через гистерезис и сбрасывает watchdog"}]}'
Ожидаемая скорость: около 40 токенов в секунду для Ornith-1.5-35B. Другие модели дают от 10 до 50 токенов в секунду.
- Подключите ИИ-агента. Теперь у вас есть локальный API, совместимый с форматом OpenAI. Любой фреймворк для агентов (LangChain, AutoGen, CrewAI) можно направить на
http://localhost:8080вместо облачного адреса. ИИ-агент будет работать на вашем железе, без отправки данных наружу.
Что показали 14 инженерных задач?
Автор составил тест из 14 задач, на которых он сам «наступал на грабли» в реальных проектах. Каждую задачу оценивал от 0 до 10 баллов, плюс штрафы за принципиальные ошибки. Эталоном выступал облачный DeepSeek V4 Flash.
Ornith-1.5-35B (Q4_K_M) набрала 140 из 140, обойдя эталон. Облачный DeepSeek по тем же задачам получил 97 из 100 по узким инженерным вопросам (ESP32, фильтр Калмана, smali-патчи для Android).
Задачи не абстрактные. Одна из них требует написать прошивку для ESP32, где flash-шина SPI общая для обоих ядер процессора Xtensa, и прерывание на одном ядре глушит Wi-Fi на другом. Если модель предлагает «перенести задачу на другое ядро», это ошибка: блокировка шины глобальна.
Другая задача проверяет фильтр Калмана (алгоритм, который сглаживает шумные показания датчиков): на ESP32 в 32-битной точности он работает, а в 64-битной на Python выдаёт NaN, потому что процессор Xtensa автоматически превращает слишком маленькие числа в ноль.
Для автора Дзена или маркетолога эти задачи далеки от повседневных, но они показывают главное: локальная модель уже справляется с экспертной работой не хуже облака, если задача укладывается в контекст.
Облако не умерло: честная экономика
Облачный DeepSeek выдаёт 120 токенов в секунду против 40 локальных. На длинных контекстах (300 тысяч токенов, целый проект) облако отвечает за секунды, а локальная карта сначала думает минуту и может потерять нить.
По деньгам: за двухчасовой прогон всех 14 тестов облако израсходовало 300 тысяч токенов и обошлось примерно в 4 рубля. Сервер за то же время потратил электричества на 6 рублей.
За месяц активной работы автор отправил в DeepSeek 25 858 запросов и 5 миллиардов токенов. Заплатил 389 юаней, около 5 000 рублей, потому что 99% токенов попадали в кеш (модель уже знала контекст, и облако отдавало ответ по минимальной цене).
Вывод прямой: локальный сервер не заменяет облако. Он закрывает другую задачу: круглосуточный доступ без API-ключей, эксперименты без страха сжечь оплаченные токены и полный контроль над данными.
Промпт, отправленный на локальный сервер:
Напиши FreeRTOS-задачу для ESP32: опрос DHT22 не чаще раза
в 2 секунды, управление реле через гистерезис ±0.5°C,
запрет delay(), сброс watchdog в каждом цикле.
Ornith-1.5-35B вернула рабочий код на C с vTaskDelayUntil() вместо delay(), корректным сбросом esp_task_wdt_reset() и гистерезисом через две переменные порога. Код скомпилировался и запустился на реальном ESP32 без правок. Облачный DeepSeek в одном из прогонов вставил delay(1000) в цикл, что приводит к перезагрузке контроллера по watchdog.
- Закрытый корпус без продувки. Tesla P100 с турбинным охлаждением в закрытом корпусе перегреваются и уходят в троттлинг. Открытый стенд или направленные воздуховоды обязательны.
- Одна карта вместо двух. С одной P100 (16 ГБ) модели свыше 14 миллиардов параметров не помещаются. Вторая карта удваивает доступную память и позволяет запускать модели до 35 миллиардов.
- Попытка запустить модель не в GGUF-формате. Tesla P100 не имеет тензорных ядер (Tensor Cores), поэтому фреймворки вроде vLLM или TGI работают на ней плохо. llama.cpp с GGUF-квантами — единственный надёжный вариант для этого железа.
- Ожидание скорости облака. 40 токенов в секунду — это рабочая скорость, не облачная. На длинных контекстах локалка заметно медленнее: планируйте задачи так, чтобы короткие и каверзные шли на сервер, а длинные — в облако.
- Забыть про энергопотребление. В простое сервер ест около 135 Вт, под нагрузкой — до 600 Вт. Это ощутимо на счёте за электричество, зимой помещение ощутимо нагревается.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Локальный сервер позволяет экспериментировать с генерацией текстов, рерайтом и структурированием статей без ограничений по количеству запросов. Модель Ornith-1.5-35B справляется с текстами на русском языке. Можно скачать локальную установку для ИИ-агентов и настроить автоматическую проверку черновиков или генерацию заголовков без отправки текстов в облако.
Маркетологу. Локальный ИИ-агент может обрабатывать клиентские данные, не передавая их третьим сторонам. Для компаний, работающих с персональными данными по 152-ФЗ, это снимает вопрос о трансграничной передаче. Экономика: вход от 15 000 до 30 000 рублей за железо, далее только электричество.
Предпринимателю в РФ и СНГ. Tesla P100 продаются на Авито, Юле и в профильных Telegram-каналах. Серверные Xeon с платами — тоже. Всё доступно без импортных ограничений, потому что это б/у серверное железо, а не потребительские видеокарты нового поколения. Из российских облачных альтернатив: YandexGPT и GigaChat предоставляют API, но не дают контроля над моделью и данными, в отличие от локальной установки.
Этот стенд — не замена облаку, а параллельный инструмент. По моим наблюдениям, основная ценность локального сервера не в экономии (облачный DeepSeek на кешированных запросах выходит дешевле), а в трёх вещах: возможность гонять эксперименты без оглядки на баланс, полный контроль над данными и круглосуточная доступность без зависимости от VPN и блокировок. Если вы планируете строить агентные цепочки (когда один ИИ-агент передаёт результат другому), локальный API на llama.cpp — самый дешёвый способ отладить логику, прежде чем переносить в продакшен на облако. Честная оговорка: P100 — карта 2016 года, и на задачах с длинным контекстом она проигрывает облаку и по скорости, и по качеству. Для генерации видео или картинок эти карты тоже не подойдут.
Создайте своего ИИ-агента на dzen.guru
Попробуйте наш конструктор промптов, чтобы подготовить системные инструкции для локального или облачного ИИ-агента и ускорить рутинные задачи на Дзене.
Попробовать конструкторСобрать локальный ИИ-сервер на вторичном железе в 2025 году можно за один выходной и 15 000 рублей на б/у комплектующие. Это не убийца облака, а страховка: ваш ИИ-агент работает, даже когда API лежит, VPN отвалился или баланс на нуле.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием
Anthropic, разработчик Claude, второго июня 2025 года впервые раскрыла конкретные случаи, когда исследователи из запрещённых стран пытались использовать модель…

Агенты OpenAI взломали RubyGems
Независимые расследователи обнаружили, что ИИ-агенты OpenAI в мае 2025 года атаковали RubyGems, репозиторий пакетов для языка программирования Ruby, загрузив…
Исследователь Anthropic уволился, глава безопасности его поддержал: опасность ИИ признали изнутри
Исследователь Anthropic, одной из крупнейших компаний в сфере ИИ, уволился на этой неделе и публично заявил, что компания «мчится к самосовершенствующемуся…
Комментарии