Игорь Градов
Игорь Градов
7 мин
ai

Что такое ИИ-агент и как его запустить: три режима, разница в цене до 7 раз

Автор Дзена, маркетолог или предприниматель, который хочет автоматизировать рутину с помощью ИИ-агента (программы, которая сама выбирает действия, выполняет их и корректирует курс), сталкивается с одним и тем же вопросом: какую модель взять, и тратит на выбор модели основное время, хотя, как показывают свежие эксперименты, решающим оказывается не модель, а способ запуска.

Что такое ИИ-агент и как его запустить: три режима, разница в цене до 7 раз
Почему это важно

В эксперименте LangChain Terminal-Bench замена только обвязки (harness), без смены модели, подняла кодового агента с примерно 30-го места в топ-5. Значит, архитектура запуска определяет качество больше, чем выбор конкретной нейросети, а неправильный режим может обойтись в 7 раз дороже.

Открытый курс Пола Юштина Building a Coding Agent From Scratch, опубликованный на платформе Decoding AI, разбирает три режима запуска ИИ-агента на примере агента Decode, написанного на Python. Каждый режим предъявляет свои требования к задержкам и стоимости, а значит, требует разного провайдера инференса (вычислений, на которых модель генерирует ответ). Разберём все три и покажем, где какой выгоднее.

Что понадобится

  • Базовое понимание, что такое ИИ-агент: программа, где модель сама выбирает следующее действие, вызывает инструмент, получает результат и решает, что делать дальше
  • Python 3.10+ и менеджер пакетов pip
  • Аккаунт у облачного провайдера GPU (в курсе используется Modal, но подойдёт любой с serverless-режимом)
  • API-ключ языковой модели (в курсе по умолчанию Qwen3.6 35B, открытые веса)
  • Около 2 часов на первый запуск, включая настройку окружения

Три режима запуска: пошаговая инструкция

1. Интерактивный режим (interactive, online)

Терминальный интерфейс подключается к одной живой сессии в том же процессе. Токены приходят в реальном времени через асинхронные генераторы, человек видит каждый шаг.

Главная сложность здесь не запуск, а управление. Если вы вводите текст, пока агент выполняет вызов инструмента, сообщение может сломать текущий ход. В Decode это решено очередью управления с приоритетным шлюзом: ввод буферизуется и подаётся агенту только в безопасной точке. Таких точек две:

  • MODEL_REQUEST (перед следующим вызовом модели)
  • WOULD_STOP (когда ход завершается)

Три варианта ввода:

  • Enter направляет агента внутри текущего хода
  • Alt+Enter ставит сообщение в очередь до конца хода
  • Esc вызывает мягкую остановку на ближайшей безопасной точке, очищая обе очереди

Человек читает каждый токен, поэтому критична низкая задержка. Этот режим требует быстрого облачного API.

2. Удалённый режим (remote, offline)

Обвязка остаётся «безголовой» и запускается на сервере через агентную среду выполнения. В курсе используется Kitaru (среда выполнения от ZenML), развёрнутая на GCP, а сами агенты работают на Modal.

Никто не смотрит в экран. Очередь задач (например, тикетов) раздаётся на N параллельных обвязок, каждая выдаёт свой результат. Если «песочница» падает на середине, среда выполнения записывает прогресс пошагово, и задача возобновляется с последнего записанного шага, а не с нуля. Когда агент ждёт ответа от человека, он замораживается и не тратит вычислительные ресурсы.

Инструменты запускаются внутри Modal Sandboxes удалённо или Docker локально. Метрика здесь не время до первого токена, а пропускная способность на доллар.

3. Асинхронный режим (async, online)

Промежуточный вариант: живая сессия отправляет задачу в очередь и сразу освобождается. Фоновые процессы рассылают вызовы модели и возвращают результаты позже.

Пользователь онлайн, но не следит за каждым шагом. Очередь владеет задачей, поэтому работа продолжается, даже если клиент отключился. Это архитектура Slack-ботов и фоновой проверки кода. Оплата ближе к батч-режиму, а не к чат-режиму.

Почему провайдер зависит от режима?

Разница в стоимости не косметическая, а кратная.

Пример из курса: 1 000 документов по 30 000 входных токенов (единиц текста, на которые модель разбивает ваш запрос), примерно 500 выходных токенов на документ. По ценам топовых API (около $3 за миллион входных токенов и $15 за миллион выходных) это примерно $97. Кеширование промптов (повторное использование начала запроса) не спасает, потому что каждый документ уникален.

Та же работа на серверном GPU в батч-режиме (около 3 000 токенов в секунду) занимает менее трёх часов и стоит примерно $13. Разница почти в 7,5 раз.

Обратный пример не менее показателен. Модель Qwen3.6 35B, используемая по умолчанию в Decode, работает на одном GPU H200. По опубликованным ценам Modal, H200 SXM стоит $0,001261 в секунду, это около $4,54 в час. Оставьте интерактивного агента на ночь в ожидании подтверждения, и 10 часов простоя обойдутся примерно в $45.

Отсюда правило: интерактивная работа оплачивается за токены, потому что человек ждёт ответ; офлайн и асинхронная работа оплачиваются за GPU-часы, потому что важна пропускная способность, а простой губит бюджет.

Serverless или зарезервированные мощности?

Второй выбор: арендовать GPU постоянно или платить по факту. Аналитика Modal сводит его к одному сравнению: резервация берёт плату по пиковой ставке за весь контракт, serverless (модель с оплатой за фактическое использование) следует за кривой спроса. Когда отношение пиковой нагрузки к средней превышает скидку за резервацию, serverless дешевле.

По данным Modal, типичные скидки за резервацию составляют от 2 до 5 раз, а отношение пиковой нагрузки к средней для инференса и агентной разработки составляет от 5 до 10 раз. По отраслевым опросам, которые приводит Modal, утилизация зарезервированных мощностей ниже 30%, часто менее 10%.

Что делать с этим прямо сейчас?

Автору Дзена. Если вы автоматизируете обработку черновиков или проверку фактов в тексте, это батч-задача. Не переплачивайте за «живой» API: отправьте пакет документов на GPU-сервер и получите результат в разы дешевле. В России для экспериментов с агентами доступны YandexGPT и GigaChat, но полноценных агентных сред у них пока нет.

Маркетологу. Slack-бот, который проверяет рекламные креативы или собирает отчёты по UTM-меткам, это асинхронный режим: задача уходит в очередь, результат приходит, когда готов. Считайте не стоимость токена, а стоимость GPU-часа.

Предпринимателю. Не арендуйте GPU заранее «с запасом». Если ваша нагрузка непредсказуема (а на старте она всегда такая), serverless-модель экономичнее, пока утилизация не превысит хотя бы 30%.

Как это выглядит на практике

Агент Decode определяется примерно в 20 строк на Pydantic AI: модель, набор инструментов, тип выходных данных. Для сравнения: в утёкших исходниках Claude Code основной цикл агента занимает около 150 строк. Всё остальное (память, навыки, песочница, права, сжатие контекста) это обвязка, и именно она определяет качество, а не ядро.

Запуск интерактивного режима в терминале выглядит так:

decode interactive --model qwen3.6-35b --provider modal

Агент начинает сессию, принимает промпт, вызывает инструменты и отдаёт результат токен за токеном. При переключении на батч-режим та же обвязка обрабатывает 1 000 документов параллельно за $13 вместо $97.

Частые ошибки
  • Выбирать модель вместо обвязки. Эксперимент LangChain показал, что замена обвязки при той же модели двигает агента из хвоста в пятёрку лидеров. Потратьте время на архитектуру запуска, а не на перебор моделей.
  • Оставлять интерактивного агента без присмотра. 10 часов простоя на H200 стоят около $45. Если агент ждёт подтверждения, переключитесь на асинхронный режим, где замороженный процесс не тратит GPU.
  • Арендовать GPU «на всякий случай». При утилизации ниже 30% (а по отраслевым данным, которые приводит Modal, она часто ниже 10%) serverless обходится дешевле.
  • Вводить текст во время вызова инструмента. В интерактивном режиме это может сломать текущий ход. Используйте Alt+Enter для отложенного ввода или дождитесь безопасной точки.
Мнение редакции dzen.guru

Я проверял агентные обвязки на задачах по контенту и вижу тот же паттерн: модель определяет потолок, но обвязка решает, доберётесь ли вы до него. Курс Юштина ценен не кодом (он заточен под кодовые задачи), а самой рамкой мышления: сначала выбираете режим запуска под свою задачу, потом провайдера под этот режим, и только потом модель. Для авторов в РФ полноценных агентных сред пока нет, но связка «локальная модель плюс облачный GPU по требованию» уже работает. Честная оговорка: все цены из курса относятся к Modal и могут отличаться у других провайдеров, а сам Decode заточен под кодовые задачи, для контентных сценариев придётся менять инструменты.

Выбор режима запуска определяет и качество, и стоимость работы ИИ-агента. Если вы обрабатываете документы пачками, переход с API-токенов на GPU-часы экономит в 7 раз. Если работаете вживую, платите за скорость, но не забывайте выключать счётчик на паузах. Начните с одной реальной задачи, посчитайте стоимость в двух режимах и только потом масштабируйте.

Освойте ИИ-инструменты для Дзена

В dzen.guru мы разбираем, как применять нейросети для создания контента и автоматизации рутины, с практическими примерами и без лишней теории.

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

1С и нейросети без утечек: псевдонимизация сохраняет пропорции и прячет реквизиты
ai

1С и нейросети без утечек: псевдонимизация сохраняет пропорции и прячет реквизиты

Финансовые данные из 1С можно безопасно отдать нейросети на анализ, если перед отправкой заменить все персональные и платёжные реквизиты псевдонимами, а суммы…

6 мин
Что такое ИИ-агент для правки багов и почему он окупается только до трёх циклов доработок
ai

Что такое ИИ-агент для правки багов и почему он окупается только до трёх циклов доработок

Команда ТестОпс, разработчики платформы для управления тестированием, поделилась практикой измерения реальных издержек ИИ-агента (программы, которая сама…

6 мин
Что такое ИИ-агент: OpenAI продаёт автономность за $20 в месяц
ai

Что такое ИИ-агент: OpenAI продаёт автономность за $20 в месяц

Компания OpenAI в июне выпустила ChatGPT Work, продукт за 20 долларов в месяц, который превращает чат-бота в полноценного ИИ-агента (программу, способную не…

6 мин