Игорь Градов
Игорь Градов
5 мин
ai

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API

Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между контуром, куда данные можно передать, и контуром, куда нельзя.

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
Почему это важно

Разработчик Selectel на практике за год проверил, способна ли self hosted LLM на открытых весах решать инженерные задачи с закрытым кодом так, чтобы результат доходил до ревью, и показал, когда гибридная стратегия выгоднее чистого облака.

Спор «облако или своя модель» обычно сводится к бенчмаркам: у кого выше баллы, тот и лучше. Влад, фуллстек-разработчик в Selectel, переворачивает логику: сначала он решает, какие данные вообще можно передать модели, и только потом выбирает конкретную конфигурацию. Его опыт за год с гибридным подходом опубликован на Хабре в июле 2026 года и подкреплён конкретными конфигурациями и тарифами.

Зачем вообще поднимать модель у себя?

Self hosted LLM (языковая модель, развёрнутая на собственных или арендованных серверах, а не через чужой API) появляется в корпоративном проекте не ради экономии. Главная причина: закрытый код и внутренняя документация не должны уходить за периметр компании.

Влад описывает два контура. Внешний, облачные API Claude и GPT, используется для исследовательских задач и помощи на данных, «за которые можно не переживать». Внутренний, self hosted LLM на базе GLM-5, работает с закрытым кодом, спецификациями и тикетами, которые нельзя передать наружу.

Разница не в качестве генерации, а в доступе к контексту. Когда модель развёрнута внутри контура, она напрямую подключается к репозиториям, документации и связанным проектам. Для внешней модели тот же контекст приходится собирать, обезличивать и пересказывать вручную, иногда это занимает часы.

Что показал год работы в гибридном режиме?

Влад тестировал конфигурации GLM-5.1 и GLM-5.2 (открытые модели с архитектурой MoE, то есть «смесь экспертов», когда при каждом запросе активируется только часть параметров) против Claude и GPT-5.5 через API.

Характеристики стенда:

  • GLM-5 запускалась в FP8-квантизации (сжатие весов до 8-битного формата, снижает требования к видеопамяти) на нескольких GPU в двух репликах.
  • При одном активном пользователе скорость генерации держалась на уровне 400-500 токенов в секунду.
  • Цены зафиксированы на июль 2026 года и указаны за миллион входных и выходных токенов. Для GLM приведён тариф ИИ-роутера Selectel как ориентир, а не себестоимость стенда.

Принципиальный момент: в первом кейсе self hosted LLM имела прямой доступ к внутренним репозиториям, а для внешней модели контекст собирался вручную. Во втором кейсе четыре конфигурации получили одинаковую постановку и один исходный код. То есть Влад честно разделил сценарии, где внутренняя модель выигрывает за счёт контекста, и где соревнуется на равных.

Аргументы за self hosted LLM

  • Данные не покидают периметр. Закрытый код, внутренняя документация, спецификации и контракты между системами остаются внутри. Для компаний с регуляторными ограничениями (а в России это почти все, кто работает с персональными данными) это не опция, а требование.
  • Контекст подключается автоматически. Модель видит репозиторий, тикеты, связанные проекты. Не нужно часами обезличивать и пересказывать. По словам Влада, именно автоматизация доставки контекста раскрывает self hosted LLM «на полную».
  • Предсказуемая стоимость при высокой нагрузке. Стенд с GPU оплачивается фиксированно, а не за каждый миллион токенов. При большом объёме внутренних запросов это дешевле API.

Аргументы против self hosted LLM

  • Инфраструктурные затраты на старте. Несколько GPU, две реплики, настройка квантизации, мониторинг. Это требует DevOps-компетенций и бюджета, которого у небольшой команды может не быть.
  • Бенчмарки не в пользу открытых моделей. Влад прямо пишет, что публичные бенчмарки «далеко не всегда говорят о качестве в повседневных задачах», тесты нередко утекают в сеть, и на их решениях обучают новые модели. Но общий уровень закрытых моделей на стандартных задачах пока выше.
  • Инженерная обвязка сложнее самого кода. Агентская разработка (когда ИИ-агент, программа, которая сама выбирает инструменты и последовательность шагов, выполняет задачу) требует «сотен строк инструкций и огромного количества обвязок из скриптов», включая безопасное окружение, где агент может ломать что угодно без последствий.
  • Ответственность всё равно на инженере. Даже если код написан ИИ, его нужно отревьюить. Модель предлагает варианты, конечное решение остаётся за человеком.

Агентская разработка только тогда отличается от вайбкодинга, когда результат надежен, повторяем и легко проверяем, не требует от разработчика десятков часов дебага и перепроверок кода. : Влад, фуллстек-разработчик Selectel

Что делать с этим прямо сейчас, по ролям?

Авторам Дзена и копирайтерам. Логика Влада переносится на контент: если вы работаете с NDA-текстами клиентов или конфиденциальными брифами, отправлять их в ChatGPT рискованно. Локально развёрнутая модель, даже послабее, безопаснее. В России доступны YandexGPT и GigaChat через API, но для полностью закрытого контура стоит смотреть на опенсорс-модели, которые можно поднять на арендованных GPU.

Маркетологам. Гибридная стратегия применима к любым данным: аналитику по клиентам обрабатывайте внутри контура, а генерацию рекламных текстов на открытых данных спокойно отдавайте облаку. Не «или-или», а «что куда можно передать».

Предпринимателям РФ и СНГ. Selectel уже предлагает ИИ-роутер с доступом к 300+ моделям по единому API-ключу, включая GLM. Это снижает порог входа: не нужно собирать стенд с нуля, можно начать с роутера и перейти на выделенный стенд, когда нагрузка вырастет.

Мнение редакции dzen.guru

Влад сформулировал то, что в дискуссиях про ИИ часто теряется: выбор модели начинается не с рейтинга, а с вопроса «что я имею право ей показать?». По моим наблюдениям, большинство российских компаний, которые пробуют ИИ в разработке, этот вопрос задают уже после того, как данные ушли в облако. Гибридный подход, внешнее API для открытых задач, self hosted LLM для закрытых, выглядит как единственная взрослая стратегия на сегодня. Оговорка: опыт Влада получен на задачах разработки в крупной инфраструктурной компании с DevOps-командой. Если у вас нет инженера, который настроит реплики и квантизацию, начните с облачного API и чётких правил, какие данные туда можно отправлять.

Через год self hosted LLM на открытых весах подберутся к закрытым моделям ещё ближе: архитектура MoE позволяет масштабировать качество без линейного роста требований к железу. Но реальное преимущество внутреннего контура останется не в бенчмарках, а в том, что модель видит ваш код, а не его обезличенный пересказ, и именно это экономит часы, которые решают, дойдёт ли задача до ревью сегодня или через неделю.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
ai

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься

Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

6 мин
ai

OpenAI впервые остановила новую модель: та научилась взламывать системы без человека

OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…

4 мин
Claude Code AI теперь с историей в браузере: 27 клиентов, статистика токенов и $0 за утилиту
ai

Claude Code AI теперь с историей в браузере: 27 клиентов, статистика токенов и $0 за утилиту

Компания Anthropic хранит каждую сессию claude code ai в виде машинных JSONL-файлов, но читать их вручную утомительно, и независимый разработчик jhlee0409…

6 мин