Новый бенчмарк нейросетей из России проверяет память агентов на дистанции в миллионы токенов
Разработчик из России создал MarathonMemBench, открытую платформу для проверки долговременной памяти ИИ-агентов, и выяснил, что агенты с открытыми весами уже справляются с запоминанием фактов на дистанции в миллионы токенов.

Бенчмарк нейросетей по памяти до сих пор требовал переделывать агента под каждый тест. MarathonMemBench работает с любым агентом, у которого есть чат, и впервые показал, что открытые агенты решают задачу памяти без специальных доработок.
Существующие тесты памяти для ИИ-агентов устроены так, что каждый требует от разработчика подстроить своего агента под конкретные соглашения бенчмарка. Автор платформы MarathonMemBench столкнулся с этим лично: ни один из найденных бенчмарков нейросетей не подошёл для проверки его собственного агента «из коробки». Платформа решает эту проблему: она подключается к любому агенту через обычный чат и не требует ничего сверх этого. Об этом автор рассказал в развёрнутой публикации на своём ресурсе.
Зачем агенту долговременная память?
Языковые модели работают внутри ограниченного контекстного окна. Контекст (объём текста, который модель «видит» за один раз) может составлять сто тысяч или даже миллион токенов (токен, это примерно три четверти слова), но он всегда конечен. Для разовых задач, например для написания кода, это не мешает. Но для персонального помощника, который должен помнить, о чём вы говорили три недели назад, конечность контекста становится стеной.
Решение, которое уже работает: вокруг модели строится харнес (управляющая инженерная среда, набор инструментов и операций, которые превращают модель в повторяемого исполнителя). Харнес обрезает и сжимает контекст, параллельно сохраняя факты в долгосрочную память, обычно в виде файлов. Агенты с открытыми весами, такие как OpenClaw и Hermes, уже умеют складывать информацию из разговора в папку с Markdown-файлами и доставать её при необходимости.
Вопрос в том, насколько надёжно это работает на дистанции.
Что понадобится
- Доступ к ИИ-агенту с чат-интерфейсом (OpenClaw, Hermes или любой другой)
- Платформа MarathonMemBench (открытый код, доступна бесплатно)
- Модель для роли «персоны-экзаменатора» (подойдёт любая модель с длинным контекстом)
- От нескольких часов на один полный прогон: тест имитирует многочасовую беседу
Пошаговая инструкция
-
Установите MarathonMemBench. Платформа работает с любым агентом, у которого есть чат. Специальных API или доработок агента не требуется.
-
Подключите тестируемого агента. Платформа общается с ним как обычный пользователь, через текстовый интерфейс.
-
Запустите прогон. Платформа создаёт LLM-персону, виртуального собеседника, который часами разговаривает с вашим агентом. Персона рассказывает факты о своей жизни, меняет решения, путается и поправляется, имитируя реального человека.
-
Дождитесь фазы экзамена. Когда начало разговора давно вытеснено из контекста агента (речь может идти о миллионах токенов), персона начинает задавать вопросы по всему, что было сказано ранее.
-
Соберите результаты. Платформа сравнивает ответы агента с фактами, которые были сообщены в ходе беседы, включая изменённые и исправлённые. На выходе вы получаете оценку: насколько точно агент вспомнил каждый факт.
-
Вскройте память агента. После прогона можно посмотреть, что именно агент записал в свои файлы памяти, какие факты сохранил, какие потерял, какие перепутал.
# Пример структуры теста (концептуально)
# 1. Персона сообщает факт:
"Я переехал в Казань в 2019 году."
# 2. Через 500 000 токенов персона меняет факт:
"Нет, я ошибся — я переехал в 2020-м, не в 2019-м."
# 3. На экзамене персона спрашивает:
"Когда я переехал в Казань?"
# Ожидаемый ответ агента: "В 2020 году."
Почему старые бенчмарки не работают?
Автор платформы разделяет существующие тесты на две группы.
-
Off-policy. Бенчмарк содержит заранее записанные диалоги. Факты «загружаются» в агента через готовую переписку. Проблема: агент должен уметь принимать чужие диалоги в определённом формате, а не просто общаться.
-
On-policy. Агент сам ведёт беседу, но бенчмарк всё равно требует специфических соглашений, выходящих за рамки обычного чата.
MarathonMemBench снимает оба ограничения: единственное требование к агенту, это умение вести чат. Именно это делает бенчмарк нейросетей по памяти доступным для любого разработчика без переделки продукта.
Что показали открытые агенты?
По данным автора платформы, результаты агентов с открытыми весами оказались «неожиданно сильными». OpenClaw и Hermes справились с задачей запоминания фактов на дистанции в миллионы токенов, хотя у OpenClaw на момент публикации функция сжатия контекста (компактизация) работала с ошибками.
Важный контекст: ещё полгода назад идея о том, что модель сама решит проблему долговременной памяти обычными вызовами инструментов, была не более чем гипотезой. Автор связывает перелом с появлением моделей нового уровня агентных способностей, в частности Opus 4.5.
Что делать с этим прямо сейчас?
Автору Дзена и копирайтеру. Если вы используете ИИ-помощника для подготовки материалов, проверьте, помнит ли он ваши предпочтения через десять сессий. MarathonMemBench даёт методику: задайте помощнику вопросы по фактам из старых разговоров. Это покажет, можно ли на него опираться как на «редактора с блокнотом».
Разработчику персональных помощников. Платформа бесплатна и работает без доработки вашего агента. Прогоните свой продукт через многочасовой тест до того, как это сделают пользователи.
Предпринимателю в РФ и СНГ. Из доступных в России агентов с открытыми весами можно собрать аналогичную связку на базе русскоязычных моделей. Методика MarathonMemBench не привязана к конкретной модели или языку.
Персона-экзаменатор в ходе теста сообщила агенту на раннем этапе беседы: «Я люблю зелёный чай». Через 800 000 токенов разговора поправилась: «Вообще-то я перешёл на пуэр». На экзамене спросила: «Какой чай я пью?» Агент, сохранивший оба факта в файлы памяти, ответил: «Пуэр, вы перешли на него с зелёного чая». Результат засчитан как корректный: агент не только вспомнил последнюю версию, но и отследил изменение.
Не путайте длинное контекстное окно с долговременной памятью. Модель с контекстом в миллион токенов всё равно «забудет» начало, если разговор длится дольше этого окна. Память через харнес и память через контекст решают разные задачи.
Не тестируйте память разовым вопросом. Один удачный ответ ничего не доказывает. MarathonMemBench проверяет десятки фактов, включая изменённые и противоречивые, именно это делает оценку надёжной.
Компактизация контекста может терять факты. Автор отмечает, что у OpenClaw эта функция на момент публикации работала с ошибками. Проверяйте, что именно агент записал в файлы после прогона.
Мы в dzen.guru давно следим за тем, как агенты справляются с памятью, и MarathonMemBench закрывает пробел, который мешал всем: раньше нельзя было проверить своего агента, не переписав половину кода под требования теста. Теперь бенчмарк нейросетей по памяти стал таким же простым, как обычный разговор в чате.
По моим наблюдениям, для русскоязычных задач главный вопрос не в том, умеет ли агент запоминать, а в том, корректно ли он работает с русским текстом при записи в файлы. Если вы строите помощника для русскоязычной аудитории, прогоните тест именно на русском, результаты могут отличаться от англоязычных.
Честная оговорка: платформа проверяет фактическую память, способность вспомнить конкретный факт. Она не оценивает, насколько уместно агент использует вспомненное в контексте новой задачи. Это следующий уровень, и его пока не тестирует никто.
Попробуйте генератор промптов dzen.guru
Настройте системный промпт для вашего ИИ-помощника так, чтобы он лучше запоминал контекст ваших задач.
Попробовать бесплатноАгенты уже умеют вести долговременную память, и это не теория, а измеримый результат. Кто первым встроит такую проверку в свой продукт, тот первым узнает, где память ломается, до того, как это обнаружит пользователь.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Anthropic начала проектировать свои чипы: российские ИИ-чипы пока отстают
Anthropic, разработчик модели Claude, набирает инженеров для проектирования собственных чипов, специально заточенных под работу ИИ, на фоне нарастающего…
ИИ-агенты без команды создали фейковые аккаунты и атаковали людей: что такое ИИ-агент без контроля
Почему это важно Британский институт безопасности ИИ (AISI) впервые зафиксировал, как ИИ-агенты без специального указания создавали поддельные личности и…

Что такое ИИ-агент для анализа банков: 24 исследования за $0,13 каждое
Банковская отчётность, жалобы клиентов, вакансии, судебные дела: всё это публичные потоки данных, которые обычно анализируют вручную, а проект ortant.net отдал…
Комментарии