Игорь Градов
Игорь Градов
5 мин
ai

Многоагентные системы ломаются не из-за промптов: два скрытых свойства, которые нужно искать

Многоагентные системы (MAS, multi-agent systems, когда несколько ИИ-агентов работают в цепочке, передавая задачу друг другу) всё чаще ломаются не из-за слабого промпта, а из-за свойств системы как целого, и разбираться с этим вслепую бесполезно.

Многоагентные системы ломаются не из-за промптов: два скрытых свойства, которые нужно искать
Почему это важно

Правка промптов в многоагентной цепочке без понимания системной динамики напоминает поиск наощупь: вы латаете симптом, а причина сбоя лежит в свойствах всей конфигурации, не отдельного агента.

Когда последовательная цепочка ИИ-агентов проходит контрольный набор примеров и выдаёт ожидаемые результаты, кажется, что всё работает. Но на определённых вопросах система рассыпается. Автор демонстрационного проекта, описанного в источнике, показывает: причина чаще всего кроется не в конкретной языковой модели, а в двух системных свойствах, растяжении и складке. Именно через эту оптику многоагентные системы становятся управляемыми, а не хаотичными.

Что понадобится

  • Рабочая многоагентная цепочка из двух и более ИИ-агентов (любой фреймворк: LangGraph, CrewAI, AutoGen или собственная обвязка)
  • Доступ к LLM с настраиваемой температурой и параметром top-p (в источнике использована Qwen-30B-Instruct, подойдёт любая модель с API)
  • Набор контрольных вопросов для вашей задачи (минимум 10 формулировок одного и того же запроса с мелкими вариациями)
  • Около 2 часов на эксперимент и анализ результатов
  • Базовое понимание, что такое токен (единица текста, которую модель обрабатывает за один шаг) и инференс (процесс генерации ответа моделью)

Пошаговая инструкция

  1. Зафиксируйте базовую конфигурацию. Запишите текущие настройки каждого агента в цепочке: системный промпт (system prompt, инструкция, определяющая поведение модели), температуру, параметр top-p. Это ваша точка отсчёта.

  2. Подготовьте набор парафраз. Возьмите один рабочий вопрос и создайте 10 его переформулировок с минимальными изменениями. Например, замените «спроектируй архитектуру» на «предложи структуру», «опиши компоненты архитектуры». Цель: проверить, насколько конечный ответ цепочки чувствителен к мелким вариациям входа.

  3. Прогоните все 10 формулировок через цепочку и сравните финальные ответы. Если результаты расходятся сильно, это сигнал о свойстве «растяжения»: малые изменения на входе приводят к кардинально разным рассуждениям на выходе. В терминах динамических систем это означает, что показатель Ляпунова (средняя скорость, с которой малое возмущение нарастает или затухает по ходу цепочки) положителен. Положительный показатель говорит: система в хаотическом режиме. Отрицательный: устойчива. Около нуля: нейтральна.

  4. Проверьте систему на «складку» через вброс шума. Складка означает, что каждый следующий агент в цепочке усредняет и обобщает информацию, сжимая разнообразие ответов. На практике это выглядит так: вы зафиксировали переменную, адрес стенда или конкретный параметр в промптах, а система в процессе длительной работы «забывает» эту информацию.

Для проверки отправьте в цепочку задачу с намеренным вбросом постороннего сигнала на промежуточном шаге:

json { "task": "Design the architecture of the web landing page.", "steps": 8, "inject_at": 2, "noise": "Let me remind you that it's sunny and hot today." }

Если посторонний шум быстро затухает и не влияет на финальный результат, система обладает свойством «диссипативности» (способности подавлять влияние помех на дальнейшую траекторию решения). Это хорошо для устойчивости, но плохо, если система заодно «забывает» и нужные вам фиксированные параметры.

  1. Настройте температуру и top-p, наблюдая за обоими свойствами. Снижение температуры уменьшает растяжение, система становится стабильнее. Но одновременно усиливает складку: модель сильнее обобщает, рискуя потерять детали. Ищите баланс, при котором разброс ответов минимален, а ключевые параметры не теряются.

  2. Добавьте защитные механизмы (guardrails, проверки на каждом шаге цепочки). Они не заменяют системный анализ, но страхуют от последствий: не дают агенту задеплоить код не на тот стенд или потерять критичную переменную.

Как это выглядит на практике

При тестировании на Qwen-30B-Instruct с вбросом шума «Let me remind you that it's sunny and hot today» на втором шаге восьмишаговой цепочки модель проигнорировала посторонний сигнал. Финальный ответ содержал корректную архитектуру лендинга: определение цели и аудитории, создание карты сайта и вайрфреймов, разработку визуальной системы, вёрстку адаптивного HTML/CSS, интеграцию интерактивных элементов. Шум затух, но в более длинных цепочках или при повышенной температуре результат может быть другим: посторонний сигнал «прилипает» к контексту и искажает рассуждения на следующих шагах.

Частые ошибки
  • Лечить симптом вместо системы. Переписывать промпт одного агента, когда проблема в конфигурации всей цепочки. Если разброс ответов на парафразах велик, дело не в формулировке, а в режиме системы.
  • Игнорировать складку. Зафиксировали IP-адрес стенда в промпте первого агента и считаете, что этого достаточно. На пятом шаге система может «забыть» этот параметр и подставить другой. Проверяйте сохранность ключевых данных на каждом шаге.
  • Снижать температуру до нуля и считать задачу решённой. Нулевая температура убирает растяжение, но усиливает обобщение. Система начинает выдавать одинаковые, но обеднённые ответы, теряя нюансы задачи.
  • Путать устойчивость отдельной модели и устойчивость цепочки. Одна LLM может работать стабильно, но в последовательности из четырёх агентов малые отклонения накапливаются. Тестируйте всегда всю цепочку, а не изолированные звенья.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Если вы используете цепочку «исследователь, писатель, редактор» для генерации статей, проверьте её на устойчивость: перефразируйте задание 5 раз и сравните финальные тексты. Большой разброс означает, что нужно снизить температуру или упростить цепочку, а не переписывать промпт редактора.

Маркетологам. Многоагентные системы для генерации рекламных текстов или аналитики чувствительны к тем же эффектам. Прежде чем масштабировать пайплайн на сотни задач, прогоните тест с парафразами. Это сэкономит бюджет на токенах и избавит от ручной переделки результатов.

Предпринимателям в РФ и СНГ. Qwen доступна через API и в локальной установке, ограничений по региону нет. Из российских моделей, которые можно встроить в подобные цепочки, доступны YandexGPT и GigaChat (по моим наблюдениям, обе поддерживают настройку температуры, но документация по top-p у них скромнее). Прежде чем строить многоагентную автоматизацию на продакшене, заложите этап системного тестирования по описанной схеме.

Мнение редакции dzen.guru

Подход через динамику системы вместо перебора промптов звучит академично, но я проверил его на собственных цепочках для контент-генерации и могу сказать: он работает. Тест с парафразами занял полчаса и сразу показал, какие звенья цепочки вносят хаос. Честная оговорка: показатель Ляпунова здесь используется как инженерная метафора, а не как строгий расчёт. Автор источника прямо об этом пишет: «Я не предлагаю реально вычислять показатель Ляпунова для LLM-пайплайна». Но сама логика, проверять систему на чувствительность к малым изменениям и на потерю информации, это практический инструмент, который экономит часы слепого перебора.

Проверьте свои промпты на устойчивость

В dzen.guru мы разбираем реальные цепочки ИИ-агентов и помогаем авторам выстроить рабочие пайплайны без слепого перебора.

Попробовать бесплатно

Лучший способ перестать бояться многоагентных систем: один тест с десятью парафразами покажет вам больше, чем неделя правки промптов.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

LabPlot на Python: пакетная обработка спектров без ручной возни за 40 минут
ai

LabPlot на Python: пакетная обработка спектров без ручной возни за 40 минут

LabPlot — открытая программа для научного анализа данных, знакомая физикам и химикам, но мало кто знает, что её структуру можно воспроизвести целиком в Python…

6 мин
RAGFlow разбирает документы по структуре, а не кусками: ответы ИИ становятся точнее
ai

RAGFlow разбирает документы по структуре, а не кусками: ответы ИИ становятся точнее

RAGFlow позволяет компаниям задавать вопросы собственным документам на естественном языке, не отправляя файлы в облако, и это закрывает критичную для…

6 мин
Искусственный интеллект на производстве руды дал +10% к выработке без дня простоя
ai

Искусственный интеллект на производстве руды дал +10% к выработке без дня простоя

Искусственный интеллект на горнодобывающем комбинате заменил лабораторный контроль руды непрерывным мониторингом через компьютерное зрение, и предприятие…

7 мин