GigaChat 2 Max обошёл Claude Opus 5 на 16 п.п.: память на связях важнее «ума» модели
Компания «Интеграм» опубликовала сравнительный замер семи языковых моделей на задаче технической поддержки и показала, что система памяти на типизированных связях между записями поднимает точность дешёвой российской модели выше, чем у дорогой зарубежной без неё.

Разница между моделями на реальных рабочих задачах определяется не «умом» модели, а тем, доехал ли до неё нужный факт. GigaChat 2 Max с памятью на связях даёт 57% верных ответов, Claude Opus 5 с обычным поиском по словам даёт 41%. Для команд, работающих внутри российского контура, это означает: вкладываться в слой памяти выгоднее, чем мигрировать на зарубежную модель.
Замер провела команда «Интеграм», российского конструктора баз данных и приложений. Разработка ведётся с собственным ИИ-агентом (программой, которая сама выполняет цепочку действий), и слой памяти вырос из попытки сократить повторяющиеся ошибки. Идею, по словам авторов, подсказал сам агент: он регулярно упирался в уже решённые задачи и предложил хранить не переписку, а связи «жалоба привела к изменению, которое её закрыло».
| Что | Когда | Кто провёл | Стоимость участия |
|---|---|---|---|
| Сравнительный замер 7 моделей на корпусе из 4618 задач, 2310 обращений к моделям | Дата публикации не указана | Команда «Интеграм» | Бесплатно, сырые данные открыты |
Что именно измеряли и почему результат удивляет?
Задача из повседневной разработки: пришла жалоба, нужно найти изменение, которое эту проблему уже закрывало. Корпус: 4618 реальных задач и изменений на русском языке. 100 вопросов с заранее известным правильным ответом. Проверка автоматическая, по номеру записи, без ИИ-судьи.
Четыре режима, одинаковых для всех моделей:
- none: без контекста вообще
- kw: с поиском по ключевым словам
- vecmory: с памятью на типизированных связях (когда между записями проложены рёбра: «эту проблему закрыло вот это изменение», «за этой задачей последовала вон та»)
- mc: контрольный режим, где правильный ответ гарантированно вложен в контекст
Результаты по трём ключевым моделям при поиске по словам (kw):
- Claude Opus 5: 41%
- GigaChat 2 Max: 40%
- YandexGPT Pro 5.1: 42%
Разброс между «дорогой» и «дешёвой» моделью почти нулевой. Все семь моделей лежат в коридоре 32%–42%. Упирается не ум модели, а доставка нужного факта.
С памятью на связях (vecmory) картина меняется:
- GigaChat 2 Max: 57% (прирост 17 пунктов)
- Claude Opus 5: 68% (прирост 27 пунктов)
- YandexGPT Pro 5.1: 61%
Откуда берётся прирост и сколько из него настоящего?
Связи между записями, это типизированные рёбра в базе данных: «эту проблему закрыло вот это изменение», «здесь речь про тот же объект». Хранится всё в обычном PostgreSQL, без расширений.
Авторы разложили вклад каждого компонента. Поиск по смыслу (когда модель ищет не по совпадению слов, а по близости значений) сам по себе даёт 46% попаданий нужного документа в 12 кандидатов. Вместе со связями: 84%.
Авторы честно признают критику: прирост может частично держаться на том, что память ходит по тем же ссылкам, по которым определяется правильный ответ. Именно поэтому они вынесли разбор этого вопроса в начало статьи.
Строка, похожая на опечатку, но это не опечатка
У младшей модели GigaChat 2 контрольный режим (42%) оказался хуже режима с памятью (51%). Хотя в контрольном правильный ответ гарантированно лежит перед моделью.
Причина: младшая GigaChat 2 в 31% случаев уверенно называет номер записи, которого в контексте не было. Это галлюцинация (когда модель уверенно выдумывает то, чего не существовало) в чистом виде.
Для сравнения в том же режиме:
- Claude Opus 5: 0% галлюцинаций
- YandexGPT Pro 5.1: 1%
- GigaChat 2 Max: 2%
Отсюда правило, которое авторы формулируют прямо: чем слабее модель, тем важнее отдавать ей мало и точно. Три точных факта работают лучше двенадцати похожих. Для слабых моделей гонка за полнотой поиска контрпродуктивна, им нужна точность выдачи.
Сколько стоит один правильный ответ?
Авторы посчитали метрику «рублей за верный ответ», стоимость всех вызовов, делённая на число верных (промахи в знаменатель не попадают, но за них заплачено).
- Младшая GigaChat 2: 0.21 ₽ за верный ответ
- GigaChat 2 Max: 1.85 ₽
- Claude Opus 5: 1.66 ₽
Младшая модель отстаёт от старшей на шесть пунктов точности (51% против 57%), и эти шесть пунктов обходятся почти в девять раз дороже. Для потоковых задач, где ошибку ловит следующий шаг конвейера, выбор далеко не очевиден.
GigaChat 2 Max, YandexGPT Pro 5.1 и Claude Opus 5: что выбрать в России?
| Параметр | GigaChat 2 Max | YandexGPT Pro 5.1 | Claude Opus 5 |
|---|---|---|---|
| Доступность в РФ | Да | Да | Только через VPN и зарубежный аккаунт |
| Точность с памятью (vecmory) | 57% | 61% | 68% |
| Точность с обычным поиском (kw) | 40% | 42% | 41% |
| Стоимость за верный ответ | 1.85 ₽ | Не указана | 1.66 ₽ |
| Галлюцинации в контрольном режиме | 2% | 1% | 0% |
YandexGPT Pro 5.1 показала себя точнее GigaChat 2 Max и в режиме с памятью (61% против 57%), и при обычном поиске (42% против 40%). Обе модели доступны внутри российского контура. Claude Opus 5 при равных условиях точнее обеих, но без памяти проигрывает им обеим.
Что делать с этим прямо сейчас, по ролям?
Разработчикам и тимлидам. Если у вас есть база задач и изменений, попробуйте добавить между записями типизированные связи «проблема привела к изменению». По данным замера, это даёт больше, чем переезд на дорогую модель. Хранить можно в обычном PostgreSQL.
Авторам Дзена и копирайтерам. Замер показывает принцип, который работает и для контентных задач: модели ошибаются не потому, что глупые, а потому, что не получают нужный контекст. Короткий точный промпт (запрос к модели) с тремя фактами надёжнее длинного с двенадцатью «на всякий случай».
Предпринимателям в РФ. GigaChat 2 Max и YandexGPT Pro 5.1 доступны без ограничений. По данным этого замера, инвестиция в слой памяти и структурирование собственных данных экономит больше, чем переход на зарубежную подписку, при этом данные остаются в российском контуре.
Этот замер ценен не рейтингом моделей, а конкретным выводом: на задачах «найди, чем мы это уже чинили» узкое место не модель, а доставка контекста. Я проверял похожий принцип на контентных задачах: когда в промпт кладёшь три точных примера вместо «найди сам», даже слабая модель выдаёт приемлемый результат.
Оговорка: замер проведён на одном корпусе (4618 задач одного проекта), на одном типе задач (поиск изменения по жалобе). Переносить цифры на другие сценарии напрямую нельзя. Авторы сами признают, что часть прироста может объясняться устройством замера.
Что сделать сегодня: откройте свою базу задач или тикетов и проставьте вручную хотя бы десять связей «эта проблема закрыта вот этим изменением». Потом спросите модель, любую доступную, с этим контекстом и без него. Разница покажет, стоит ли вкладываться дальше.
Частые вопросы
GigaChat 2 Max лучше Claude Opus 5?
Нет, если сравнивать при равных условиях. С одинаковой памятью Claude Opus 5 даёт 68%, GigaChat 2 Max даёт 57%. Но в реальной ситуации, когда обе модели работают с обычным поиском, GigaChat 2 Max с добавленной памятью (57%) обходит Claude Opus 5 без неё (41%). Суть не в том, какая модель умнее, а в том, что правильная подача контекста даёт больше, чем смена модели.
Можно ли повторить замер самостоятельно?
По словам авторов, сырые данные и методика открыты. Проверка автоматическая, по номеру записи, без субъективной оценки. Корпус содержит 4618 задач на русском языке, 100 тестовых вопросов. Для воспроизведения нужен доступ к API моделей.
Что такое «типизированные связи» и зачем они нужны?
Это явные пометки между записями в базе данных: «проблема X была закрыта изменением Y», «задача A продолжилась задачей B». В отличие от поиска по словам или по смыслу, связи позволяют модели пройти по цепочке от жалобы к решению напрямую, не угадывая по похожим словам. По данным замера, поиск по смыслу сам по себе находит нужный документ в 46% случаев, а вместе со связями в 84%.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Radeon для инференса нейросетей: почему TFLOPS без пропускной способности памяти не работают
Запускать большие языковые модели на видеокартах AMD Radeon можно не хуже, чем на Nvidia, если понимать, как устроен инференс (применение уже обученной модели…

LLM-агенты на дешёвых моделях обходятся втрое дороже: почему цена за токен врёт
mini или Haiku, тоже начинает с правильного шага. Но на втором шаге она теряет контекст. Она не помнит, что именно нашла на первом шаге, и начинает…

Claude Opus 4.6 обходит собственные запреты в 10 из 10 тестов, Anthropic не отключает модель
Anthropic продолжает предоставлять доступ к Claude Opus 4.6 через API и сторонние сервисы, хотя независимые исследователи и журналисты TechCrunch обнаружили,…
Комментарии