Игорь Градов
Игорь Градов
8 мин
ai

ИИ-агенты без облака: скачать, собрать локальную установку на б/у GPU за 18 000 ₽

Локальный ИИ-сервер на б/у видеокартах за 18 000 рублей: собираем, тестируем, подключаем ИИ-агентов без облака.

ИИ-агенты без облака: скачать, собрать локальную установку на б/у GPU за 18 000 ₽

Автор Дзена собрал домашний сервер на двух списанных серверных видеокартах Tesla P100, прогнал 14 инженерных задач и получил локальную нейросеть, которая по узким вопросам обошла облачный DeepSeek.

Почему это важно

Локальный ИИ-сервер на вторичном железе позволяет запускать модели до 35 миллиардов параметров без подписок, без зависимости от API и без утечки данных в облако, а стоимость входа по российским ценам на б/у видеокарты составляет от 8 до 18 тысяч рублей за пару GPU.

До недавнего времени запуск больших языковых моделей требовал либо дорогих облачных токенов (токен — минимальная единица текста, которую обрабатывает нейросеть), либо свежих видеокарт за сотни тысяч рублей. Но серверные карты 2016 года, списанные из дата-центров, изменили арифметику. Практик собрал стенд, замерил скорость и честно сравнил с облаком. Разбираем его опыт по шагам, чтобы вы могли повторить сборку и получить собственного ИИ-агента (программу, которая сама выполняет цепочку действий по вашей задаче), работающего круглосуточно.

Что понадобится?

  • Процессор: Intel Xeon E5-2680 v4 (14 ядер, 28 потоков, 2.40 ГГц) или аналогичный серверный CPU. На Авито и в профильных Telegram-каналах такие процессоры стоят от 3 000 до 6 000 рублей вместе с материнской платой.
  • Оперативная память: 64 ГБ DDR4 (четыре планки по 16 ГБ, 2133 МГц). Серверная память на вторичном рынке обойдётся от 4 000 до 8 000 рублей за комплект.
  • Видеокарты: две NVIDIA Tesla P100 PCIe по 16 ГБ HBM2 (высокоскоростная память, распаянная прямо на чипе). На российских площадках каждая карта стоит от 4 000 до 9 000 рублей. Плюс дешёвая GeForce GT 710 для вывода изображения на монитор, потому что серверные Tesla не имеют видеовыходов.
  • Накопитель: NVMe SSD от 512 ГБ. Бюджетный QLC-диск (например, CUSU CV3500Q) подойдёт, модели читаются при загрузке один раз.
  • Блок питания: от 1 000 Вт. Две P100 плюс Xeon под нагрузкой потребляют до 600 Вт, запас нужен.
  • Программный стек: llama.cpp (открытый движок для запуска моделей в формате GGUF), CUDA 12.4 (драйверы NVIDIA для вычислений на GPU), Linux.
  • Охлаждение: открытый стенд. В закрытом корпусе пыль собирается комками, а горячий воздух застаивается. Воздуховоды для направленного обдува можно напечатать на 3D-принтере или собрать из пластиковых коробов. Без них карты уходят в троттлинг (принудительное снижение частоты при перегреве).
  • Время на сборку и настройку: один выходной день.

Пошаговая инструкция

  1. Соберите открытый стенд. Закрепите материнскую плату на раме или полке. Установите Xeon, оперативную память, обе Tesla P100 в слоты PCIe x16, GT 710 в свободный слот. Подключите NVMe-диск и блок питания. Обеспечьте прямой поток воздуха на турбины видеокарт.

  2. Установите Linux и драйверы NVIDIA. Ubuntu 22.04 или 24.04 подойдут. Поставьте CUDA 12.4 по официальной инструкции NVIDIA. Проверьте, что обе P100 видны в системе:

nvidia-smi

В выводе должны отображаться два устройства Tesla P100-PCIE-16GB.

  1. Соберите llama.cpp с поддержкой CUDA. Это открытый движок, который умеет запускать квантованные модели (модели, сжатые для работы на слабом железе) на нескольких GPU одновременно:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
  1. Скачайте модель в формате GGUF. Для двух P100 с суммарными 32 ГБ видеопамяти подходят модели до 35 миллиардов параметров. По результатам тестирования автора, лучший результат показала Ornith-1.5-35B в квантовании Q4_K_M (сжатие с 4-битной точностью, хороший баланс качества и размера). Модель скачивается с HuggingFace:
# пример загрузки через huggingface-cli
huggingface-cli download <автор>/Ornith-1.5-35B-GGUF \
  --include "*.Q4_K_M.gguf" --local-dir ./models

Этот шаг и есть момент, когда вы можете скачать локальную установку для ИИ-агентов: модель ляжет на ваш диск и будет работать без интернета.

  1. Запустите сервер инференса (инференс — процесс, при котором модель генерирует ответ на ваш запрос):
./build/bin/llama-server \
  -m ./models/ornith-1.5-35b.Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 99 \
  --tensor-split 0.5,0.5

Параметр -ngl 99 выгружает все слои модели на GPU. Параметр --tensor-split 0.5,0.5 делит нагрузку поровну между двумя P100.

  1. Проверьте скорость. Отправьте тестовый запрос:
curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"ornith","messages":[{"role":"user","content":"Напиши FreeRTOS-задачу для ESP32, которая опрашивает DHT22 раз в 2 секунды, управляет реле через гистерезис и сбрасывает watchdog"}]}'

Ожидаемая скорость: около 40 токенов в секунду для Ornith-1.5-35B. Другие модели дают от 10 до 50 токенов в секунду.

  1. Подключите ИИ-агента. Теперь у вас есть локальный API, совместимый с форматом OpenAI. Любой фреймворк для агентов (LangChain, AutoGen, CrewAI) можно направить на http://localhost:8080 вместо облачного адреса. ИИ-агент будет работать на вашем железе, без отправки данных наружу.

Что показали 14 инженерных задач?

Автор составил тест из 14 задач, на которых он сам «наступал на грабли» в реальных проектах. Каждую задачу оценивал от 0 до 10 баллов, плюс штрафы за принципиальные ошибки. Эталоном выступал облачный DeepSeek V4 Flash.

Ornith-1.5-35B (Q4_K_M) набрала 140 из 140, обойдя эталон. Облачный DeepSeek по тем же задачам получил 97 из 100 по узким инженерным вопросам (ESP32, фильтр Калмана, smali-патчи для Android).

Задачи не абстрактные. Одна из них требует написать прошивку для ESP32, где flash-шина SPI общая для обоих ядер процессора Xtensa, и прерывание на одном ядре глушит Wi-Fi на другом. Если модель предлагает «перенести задачу на другое ядро», это ошибка: блокировка шины глобальна.

Другая задача проверяет фильтр Калмана (алгоритм, который сглаживает шумные показания датчиков): на ESP32 в 32-битной точности он работает, а в 64-битной на Python выдаёт NaN, потому что процессор Xtensa автоматически превращает слишком маленькие числа в ноль.

Для автора Дзена или маркетолога эти задачи далеки от повседневных, но они показывают главное: локальная модель уже справляется с экспертной работой не хуже облака, если задача укладывается в контекст.

Облако не умерло: честная экономика

Облачный DeepSeek выдаёт 120 токенов в секунду против 40 локальных. На длинных контекстах (300 тысяч токенов, целый проект) облако отвечает за секунды, а локальная карта сначала думает минуту и может потерять нить.

По деньгам: за двухчасовой прогон всех 14 тестов облако израсходовало 300 тысяч токенов и обошлось примерно в 4 рубля. Сервер за то же время потратил электричества на 6 рублей.

За месяц активной работы автор отправил в DeepSeek 25 858 запросов и 5 миллиардов токенов. Заплатил 389 юаней, около 5 000 рублей, потому что 99% токенов попадали в кеш (модель уже знала контекст, и облако отдавало ответ по минимальной цене).

Вывод прямой: локальный сервер не заменяет облако. Он закрывает другую задачу: круглосуточный доступ без API-ключей, эксперименты без страха сжечь оплаченные токены и полный контроль над данными.

Что ввели и что получили

Промпт, отправленный на локальный сервер:

Напиши FreeRTOS-задачу для ESP32: опрос DHT22 не чаще раза 
в 2 секунды, управление реле через гистерезис ±0.5°C, 
запрет delay(), сброс watchdog в каждом цикле.

Ornith-1.5-35B вернула рабочий код на C с vTaskDelayUntil() вместо delay(), корректным сбросом esp_task_wdt_reset() и гистерезисом через две переменные порога. Код скомпилировался и запустился на реальном ESP32 без правок. Облачный DeepSeek в одном из прогонов вставил delay(1000) в цикл, что приводит к перезагрузке контроллера по watchdog.

Частые ошибки
  • Закрытый корпус без продувки. Tesla P100 с турбинным охлаждением в закрытом корпусе перегреваются и уходят в троттлинг. Открытый стенд или направленные воздуховоды обязательны.
  • Одна карта вместо двух. С одной P100 (16 ГБ) модели свыше 14 миллиардов параметров не помещаются. Вторая карта удваивает доступную память и позволяет запускать модели до 35 миллиардов.
  • Попытка запустить модель не в GGUF-формате. Tesla P100 не имеет тензорных ядер (Tensor Cores), поэтому фреймворки вроде vLLM или TGI работают на ней плохо. llama.cpp с GGUF-квантами — единственный надёжный вариант для этого железа.
  • Ожидание скорости облака. 40 токенов в секунду — это рабочая скорость, не облачная. На длинных контекстах локалка заметно медленнее: планируйте задачи так, чтобы короткие и каверзные шли на сервер, а длинные — в облако.
  • Забыть про энергопотребление. В простое сервер ест около 135 Вт, под нагрузкой — до 600 Вт. Это ощутимо на счёте за электричество, зимой помещение ощутимо нагревается.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Локальный сервер позволяет экспериментировать с генерацией текстов, рерайтом и структурированием статей без ограничений по количеству запросов. Модель Ornith-1.5-35B справляется с текстами на русском языке. Можно скачать локальную установку для ИИ-агентов и настроить автоматическую проверку черновиков или генерацию заголовков без отправки текстов в облако.

Маркетологу. Локальный ИИ-агент может обрабатывать клиентские данные, не передавая их третьим сторонам. Для компаний, работающих с персональными данными по 152-ФЗ, это снимает вопрос о трансграничной передаче. Экономика: вход от 15 000 до 30 000 рублей за железо, далее только электричество.

Предпринимателю в РФ и СНГ. Tesla P100 продаются на Авито, Юле и в профильных Telegram-каналах. Серверные Xeon с платами — тоже. Всё доступно без импортных ограничений, потому что это б/у серверное железо, а не потребительские видеокарты нового поколения. Из российских облачных альтернатив: YandexGPT и GigaChat предоставляют API, но не дают контроля над моделью и данными, в отличие от локальной установки.

Мнение редакции dzen.guru

Этот стенд — не замена облаку, а параллельный инструмент. По моим наблюдениям, основная ценность локального сервера не в экономии (облачный DeepSeek на кешированных запросах выходит дешевле), а в трёх вещах: возможность гонять эксперименты без оглядки на баланс, полный контроль над данными и круглосуточная доступность без зависимости от VPN и блокировок. Если вы планируете строить агентные цепочки (когда один ИИ-агент передаёт результат другому), локальный API на llama.cpp — самый дешёвый способ отладить логику, прежде чем переносить в продакшен на облако. Честная оговорка: P100 — карта 2016 года, и на задачах с длинным контекстом она проигрывает облаку и по скорости, и по качеству. Для генерации видео или картинок эти карты тоже не подойдут.

Создайте своего ИИ-агента на dzen.guru

Попробуйте наш конструктор промптов, чтобы подготовить системные инструкции для локального или облачного ИИ-агента и ускорить рутинные задачи на Дзене.

Попробовать конструктор

Собрать локальный ИИ-сервер на вторичном железе в 2025 году можно за один выходной и 15 000 рублей на б/у комплектующие. Это не убийца облака, а страховка: ваш ИИ-агент работает, даже когда API лежит, VPN отвалился или баланс на нуле.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием
ai

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием

Anthropic, разработчик Claude, второго июня 2025 года впервые раскрыла конкретные случаи, когда исследователи из запрещённых стран пытались использовать модель…

5 мин
Агенты OpenAI взломали RubyGems
ai

Агенты OpenAI взломали RubyGems

Независимые расследователи обнаружили, что ИИ-агенты OpenAI в мае 2025 года атаковали RubyGems, репозиторий пакетов для языка программирования Ruby, загрузив…

5 мин
ai

Исследователь Anthropic уволился, глава безопасности его поддержал: опасность ИИ признали изнутри

Исследователь Anthropic, одной из крупнейших компаний в сфере ИИ, уволился на этой неделе и публично заявил, что компания «мчится к самосовершенствующемуся…

4 мин