Игорь Градов
Игорь Градов
5 мин
ai

Что такое ИИ-агент с «памятью» и почему её избыток снижает качество на 50%

Компания Ant Group (подразделение Alibaba, разработчик ИИ-инфраструктуры) опубликовала исследование ALTK-Evolve, которое впервые измерило, как объём «памяти» ИИ-агента влияет на результат в зависимости от размера и класса модели.

Что такое ИИ-агент с «памятью» и почему её избыток снижает качество на 50%
Почему это важно

Исследование ломает интуицию «больше памяти, лучше результат»: для слабых моделей избыток правил снижает качество, а для сильных тот же набор даёт прирост до 9,5 процентных пунктов, и выбор стратегии определяет, платите ли вы вдвое больше за токены или всего на 5% сверху.

Исследование вышло на фоне бума ИИ-агентов (программ, которые сами выполняют цепочки действий: ищут информацию, пишут код, бронируют билеты) и растущих расходов на их запуск. Команда протестировала восемь моделей от 30 миллиардов параметров до флагманских закрытых систем и обнаружила, что «память» агента нужно дозировать, как лекарство: передозировка вредит, недостаток не лечит.

Чтобы понять, что такое ИИ-агент в этом контексте, достаточно представить робота-секретаря: он получает задачу, сам разбивает её на шаги, выполняет их один за другим и учится на своих ошибках. «Память» здесь не запись прошлых диалогов, а набор выводов: какие стратегии сработали, какие ошибки не повторять, какие краевые случаи учитывать.

Параметр Значение
Название метода ALTK-Evolve
Тип исследования открытое, без обновления весов модели
Число протестированных моделей 8 (от 30B до флагманских)
Бенчмарк AppWorld, 585 многошаговых задач
Дата публикации июнь 2025

Как работает «память без хирургии»?

Метод ALTK-Evolve устроен просто. Агент выполняет задачи и оставляет «следы» своих действий. Из успешных и провальных попыток система извлекает поведенческие правила: что делать, чего избегать, на что обращать внимание.

Эти правила собираются в набор и подаются агенту при следующем запуске. Ни один вес модели не меняется, дообучение (fine-tuning, дополнительная тренировка модели на новых данных) не требуется. Обучение происходит «вокруг» модели, а не внутри неё, поэтому метод дёшев и переносим между любыми из восьми протестированных моделей.

Три паттерна, а не один рецепт

Исследователи обнаружили три устойчивых паттерна, и ни один не зависит напрямую от числа параметров.

  • Сильные модели с запасом. DeepSeek-V3.2 (671 миллиард параметров, архитектура MoE, «смесь экспертов», когда активна только часть сети) прибавила 9,5 процентных пунктов в выполнении задач, получив полный набор правил, включая редкие краевые случаи. Такие модели «переваривают» весь объём памяти.
  • Модели поменьше. gpt-oss-120b (117 миллиардов параметров, тоже MoE) прибавила 16,1 процентных пунктов при селективном подходе: компактное ядро правил плюс подборка, релевантная конкретной задаче. Полный набор дал меньший прирост и обошёлся примерно на 50% дороже по токенам (единицам текста, за которые платят при вызове модели).
  • Насыщенные модели. GLM-5 (745 миллиардов параметров) не показала измеримого прироста. Исследователи честно оговариваются: это наблюдение, а не доказанная причина. Модель могла упереться в потолок задач, правила могли не затронуть оставшиеся ошибки, или модель не смогла их применить.

Экономия, которая удивляет

Практический вывод: селективная подача правил (curated retrieval, «курируемая выборка») бывает одновременно точнее и дешевле. Модель gpt-oss-120b получила рекордный прирост в 16,1 процентных пунктов при увеличении расхода токенов всего на 5%.

Полный набор правил раздувает каждый шаг агента, потому что все правила пересылаются на каждом ходу. Но даже в этом случае кэширование промптов (prompt caching, повторное использование неизменной части запроса) делает стоимость приемлемой для продакшена.

По более строгой метрике SGC (Scenario Goal Completion, когда засчитываются только полностью пройденные сценарии), разрыв ещё заметнее. У DeepSeek SGC вырос на 16,1 процентных пунктов против 9,5 по базовой метрике. Даже модели у потолка, GPT-5.5 и Opus, прибавили по 7,1 и 7,2 процентных пункта SGC соответственно.

Агентная память не функция, которую включают. Это доза, которую калибруют под модель. : Команда исследования ALTK-Evolve

Что меняется для автора контента

Если вы используете ИИ-агентов для генерации текстов, автоматизации публикаций или аналитики, важен выбор: дорогая модель с полным набором правил или компактная с точечной подборкой. Второй вариант может дать лучший результат за меньшие деньги, но требует настройки. Бесплатного «включил и забыл» не существует.

Что это значит для вас?

Авторам Дзена. Если вы подключаете ИИ-агентов (через API или сервисы-обёртки), не гонитесь за максимальной моделью. Исследование показывает: модель среднего размера с правильно отобранными правилами обходит тяжёлую модель с «памятью на максимум». Проверьте, позволяет ли ваш сервис управлять объёмом контекста, и начните с компактного набора инструкций.

Маркетологам. Экономика агентов меняется: расход токенов можно сократить при росте качества. Это аргумент в пользу пилотов с агентами там, где раньше бюджет не сходился.

Предпринимателям в РФ и СНГ. Метод не требует дообучения и работает с любыми моделями, включая открытые. Из доступных в России вариантов подойдут DeepSeek (открытые веса, можно развернуть локально) и отечественные модели, если они поддерживают достаточное контекстное окно. YandexGPT и GigaChat пока не тестировались в этом исследовании, но архитектура ALTK-Evolve к ним применима.

Мнение редакции dzen.guru

Исследование ценно не открытием («память помогает»), а тем, что впервые показано, кому она мешает. На практике это значит: прежде чем покупать «агента с памятью» у очередного стартапа, спросите, какая модель под капотом и как дозируется контекст. Если ответа нет, вы платите за функцию, которая может работать в минус. Я бы начал с малого: взял открытую модель, собрал десяток правил из собственных ошибок и измерил результат до и после. Это бесплатно и занимает вечер.

Где подвох

Исследование проведено на одном бенчмарке (AppWorld, 585 задач в девяти симулированных приложениях). Реальные задачи автора или маркетолога устроены иначе. Переносимость результатов на русскоязычный контент и специфичные для Дзена сценарии пока не проверена.

Главный практический вывод укладывается в одну фразу: не спрашивайте «сколько памяти дать агенту», спрашивайте «сколько памяти выдержит именно эта модель без потери качества», и замеряйте ответ на своих задачах, а не на чужих бенчмарках.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Instagram Робина Уильямса защищен от deepfake нейросетей

Почему это важно Семья покойного актёра показала конкретный и бесплатный способ бороться с deepfake нейросетью на уровне одного аккаунта: заполнить площадку…

4 мин
ИИ и экология авиации: Google запустила проект по снижению трети климатического следа
ai

ИИ и экология авиации: Google запустила проект по снижению трети климатического следа

Авиация отвечает примерно за треть своего климатического следа не через сжигание топлива, а через конденсационные следы, белые полосы в небе, и Google вместе с…

5 мин
Что такое ИИ-агент в SAM от Google: развёртываем защищённую mesh-сеть за вечер
ai

Что такое ИИ-агент в SAM от Google: развёртываем защищённую mesh-сеть за вечер

Прежде чем писать, проверю H1: «Что такое ИИ агент и как он влияет на развитие бизнеса» — это двойной вопрос-справочник без тезиса, нарушает мои правила. Но H1…

7 мин