Сбер выпустил RUMBA: первый бенчмарк нейросетей на русском для проверки долгосрочной памяти
Группа российских исследователей из Сбера 4 июня 2025 года представила RUMBA (Russian User Memory Benchmark), первый публичный бенчмарк нейросетей на русском языке, который проверяет не качество ответов модели, а работу всей архитектуры долгосрочной памяти в многосессионных диалогах.

До RUMBA для русского языка не существовало инструмента, который тестирует, как диалоговая система обновляет устаревшие факты, разрешает противоречия и ориентируется во времени на протяжении месяцев общения с одним пользователем. Англоязычные бенчмарки нейросетей (LoCoMo, LongMemEval, Mem-Gallery) эту задачу для русского языка не решали.
RUMBA закрывает пробел, который мешал объективно сравнивать русскоязычные ассистенты и агентные системы. Существующие англоязычные бенчмарки нейросетей оценивают память «плоско»: один вопрос получает один тег, например «временной» или «многошаговый». RUMBA размечает каждый вопрос тройкой тегов одновременно, что позволяет понять, на каком именно участке память ломается. По данным авторов, датасет создавали 26 человек за 20 рабочих дней; русская версия является основной, а английская получена автоматическим переводом и ручной сверкой.
| Показатель | Значение | Источник |
|---|---|---|
| Средняя длительность одного диалога | около 191 дня общения | авторы RUMBA |
| Число участников сборки датасета | 26 контрибьюторов | авторы RUMBA |
| Срок создания датасета | 20 рабочих дней | авторы RUMBA |
| Основной язык | русский (английская версия для кросс-лингвального сравнения) | авторы RUMBA |
| Модель для генерации ответов ассистента | GigaChat Max | авторы RUMBA |
Что именно проверяет RUMBA?
Обычный бенчмарк нейросетей спрашивает модель и смотрит, насколько ответ точен. RUMBA устроен иначе: он тестирует не саму языковую модель, а весь механизм памяти вокруг неё.
Память в современных ассистентах, это не свойство самой нейросети. Это отдельный слой: векторная база данных, граф фактов о пользователе, журнал событий. Качество ответа зависит от того, как этот слой извлекает нужный факт, обновляет устаревший и удаляет информацию по просьбе пользователя.
RUMBA проверяет три группы задач:
- Извлечение информации. Система должна найти в прошлых сессиях конкретный факт и перенести его в ответ. Факт может быть изменён, дополнен или удалён пользователем в более позднем разговоре, и система обязана это учесть.
- Рассуждение. Системе нужно сопоставить несколько фактов из разных сессий, восстановить связи между людьми и событиями, выполнить вычисления или учесть порядок событий во времени.
- Отказ от ответа. Вопросы, на которые в диалоге ответа нет. Проверяется, умеет ли система честно сказать «я не знаю» вместо того, чтобы галлюцинировать (уверенно выдумывать то, чего не было).
Ключевая деталь: у каждого вопроса в RUMBA есть временная метка. Правильный ответ зависит от того, в какой момент истории общения вопрос задан. Это позволяет проверить, понимает ли система, какие факты были актуальны на конкретную дату.
Что обнаружили авторы?
- Каждый вопрос описан тройкой тегов: семантический тип, охват сессий (одна или несколько) и зависимость от времени. Для временных вопросов добавляется четвёртый тег, показывающий, как именно время выражено в репликах: явно, неявно или не выражено напрямую.
- Такая многослойная разметка (таксономия) позволяет находить слабые места конкретной архитектуры памяти, а не просто фиксировать общий балл.
- Англоязычные бенчмарки используют «плоскую» разметку с одним тегом на вопрос. RUMBA показывает, что один вопрос может одновременно требовать обновления факта, сбора данных из нескольких сессий и рассуждения с учётом хронологии, и каждый аспект нужно оценивать отдельно.
- Пользовательские реплики в датасете писали люди, ответы ассистента генерировала GigaChat Max, а эталонные ответы и вопросы создавали и проверяли вручную.
RUMBA на данный момент описан авторами как диагностический инструмент. Публичных результатов тестирования конкретных моделей или продуктов в доступном описании не приведено. Ответы ассистента в датасете сгенерированы одной моделью (GigaChat Max), что может влиять на характер диалогов. Английская версия получена автоматическим переводом с ручной сверкой, а не написана носителями языка с нуля. Размер выборки контрибьюторов (26 человек) относительно невелик, и авторы не раскрывают общее число вопросов и диалогов в датасете в доступном описании.
Что делать с этим прямо сейчас?
Автору на Дзене. Если вы используете ИИ-ассистента для работы с контентом и заметили, что он «забывает» ваши предпочтения или путает старые и новые данные, RUMBA объясняет, почему: проблема не в модели, а в механизме памяти вокруг неё. Когда сервисы начнут публиковать результаты по RUMBA, у вас появится объективный критерий выбора.
Маркетологу. Бенчмарк нейросетей для памяти, это инструмент сравнения продуктов. Если вы внедряете чат-бота для клиентской поддержки или персонализированного ассистента, спросите у поставщика: тестировался ли продукт на RUMBA и по каким группам задач он проседает.
Предпринимателю в РФ. RUMBA создан в России, на русском языке и доступен для использования. Это редкий случай, когда русскоязычный бенчмарк нейросетей появился раньше, чем потребность в нём стала критической.
Главная ценность RUMBA не в том, что он русскоязычный, хотя и это редкость. А в том, что он проверяет именно то, что бесит пользователей: ассистент «забыл», что вы переехали, или уверенно повторяет факт, который вы сами исправили два разговора назад. Я проверял несколько популярных ассистентов на подобных сценариях, и результаты, мягко говоря, нестабильны. Теперь есть формальный способ это измерить, и разработчикам станет сложнее прятать проблемы памяти за красивыми демо.
Появление RUMBA даёт разработчикам конкретный измеритель, а пользователям, язык для претензий: не «он тупой», а «у вас проседает обновление фактов при межсессионном рассуждении». Для рынка русскоязычных ИИ-продуктов это первый шаг от субъективных впечатлений к проверяемым результатам.
По данным авторов RUMBA

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Claude 3 5 Opus вышел после проверки властями США: цена не выросла, защита усилена
Anthropic второго июля выпустила Claude Opus 5, свою новую рассуждающую модель, которую впервые перед публичным запуском тестировали совместно с правительством…

Marker 2 обогнал конкурентов по парсингу PDF в 5 раз по скорости при лучшем качестве
Компания Datalab выпустила Marker 2, полностью переписанный открытый конвейер для парсинга PDF и других документов, который на бенчмарке olmOCR-bench обогнал…

ИИ-агенты OpenSpace сохраняют навыки между запусками, снижая расходы на API
Представьте, что ваш ИИ-агент не просто выполняет задачу, а сам учится её делать лучше, сохраняет удачные решения и переиспользует их, снижая ваши расходы на…
Комментарии