Три проверки качества эмбеддинг-моделей полностью перетасовали рейтинг на 4695 документах
Эмбеддинг (embedding) превращает текст в набор чисел, по которому нейросеть определяет, о чём документ, но реальный эксперимент на 4695 деловых документах с ручной разметкой показал, что три последовательные проверки качества полностью перетасовали рейтинг моделей.

Выбор метода проверки и правила классификации влияет на итоговый рейтинг моделей сильнее, чем сама нейросеть: смена одного правила сдвигала результат на 7–34 процентных пункта, тогда как разница между моделями была меньше.
Эксперимент, о котором пойдёт речь, проводился на реальном документообороте крупной компании. 4695 документов, 11 тем, 13 вариантов векторизации, эталон размечен людьми (каждый документ когда-то был направлен в конкретное подразделение живым сотрудником). Ни одна модель к разметке не причастна. Первая версия эксперимента, где эталон делала сама модель, была снята целиком: такая разметка давала «домашнее преимущество» и обнуляла честность сравнения.
Что понадобится
- Набор документов с ручной разметкой. Минимум несколько сотен, размеченных людьми по темам или типам. Разметка моделью не годится.
- Несколько моделей для сравнения. В эксперименте использовалось 13 вариантов: от нейросети на 3 миллиарда параметров до символьного метода без нейросети вовсе.
- Инструмент классификации. Простейший вариант: ближайший центр темы. Продвинутый: обучаемая надстройка поверх готовых векторов.
- Время. Полный цикл с тремя проверками занял у авторов полтора месяца. Одну проверку на небольшом наборе можно провести за день.
Пошаговая инструкция
-
Соберите эталон, размеченный людьми. Возьмите документы, которые сотрудники когда-то вручную распределили по подразделениям или папкам. Это и есть разметка. Не поддавайтесь соблазну попросить модель разметить за вас: тогда сравнение замыкается на себя.
-
Превратите каждый документ в эмбеддинг. Прогоните весь набор через каждую из выбранных моделей. На выходе у каждого документа список из нескольких сотен чисел, устроенный так, что близкие по смыслу тексты получают близкие векторы. Повторите для каждого кандидата.
-
Классифицируйте по ближайшему центру. Для каждой темы вычислите «центр» (среднее всех эмбеддингов документов этой темы), новый документ отнесите к ближайшему. Сравните точность моделей. В эксперименте лидерами оказались
giga_480mиqwen3e_4bс одинаковыми 76,8 %. -
Проверка первая: найдите дубликаты. Сгруппируйте документы по тексту (без использования эмбеддингов, чтобы не подыгрывать никому). Деловой документооборот монотонен: один контрагент, один шаблон, ежемесячный счёт, меняются только номер и дата. В эксперименте из 4695 документов уникальных оказалось лишь 1162, то есть 25 %. Пересчитайте точность, исключив из центра темы всю группу близнецов оцениваемого документа, а не только сам документ.
Результат эксперимента: все числа упали на 6–16 процентных пунктов. qwen3e_4b, деливший первое место, опустился на четвёртое. Символьный метод показал разрыв в 17 пунктов между документами с близнецами (67,8 %) и действительно новыми (50,7 %), это не понимание смысла, а сопоставление шаблонов. У нейросетевых моделей такого провала не обнаружилось.
- Проверка вторая: смените правило классификации. Темы неоднородны: в эксперименте 11 тем распадались на 95 плотных подгрупп (акты, альбомы чертежей, задания на экспертизу в одной теме выглядят по-разному). Один центр на тему заведомо плохое правило. Используйте обучаемую надстройку поверх тех же векторов, без дообучения (fine-tuning) самих моделей.
Результат эксперимента: смена правила добавила каждой модели от 7 до 34 процентных пунктов, больше, чем вся разница между моделями. giga_480m, уверенный лидер, опустился на седьмое место. Наверх вышли символьные варианты, которым не нужна видеокарта. Первая пятёрка стала статистически неразличимой.
-
Проверка третья: проверьте устойчивость метрики. Если вы используете индекс ARI (Adjusted Rand Index, мера согласованности кластеризации), замерьте его разброс от случайной инициализации (random seed) алгоритма. В эксперименте разброс одной модели от разных запусков оказался сопоставим с разбросом между всеми моделями. Рейтинг по ARI был рейтингом случайных чисел, а не качества эмбеддингов. Автоматическая кластеризация «с нуля» не восстанавливала 11 тем ни для одного варианта: вместо 11 находилось 45–72 мелкие группы.
-
Параллельно сравните с прямым запросом к языковой модели. Отправьте текст в большую языковую модель с инструкцией назвать тип документа (договор, письмо, акт сверки, ТОРГ-12) без единого размеченного примера. В эксперименте на 2279 документах и 17 типах десять векторных вариантов из тринадцати оказались точнее лучшей из языковых моделей, работавших вхолодную.
В эксперименте 4695 документов компании (счета, акты, накладные, договоры, проектная документация) прогнали через 13 вариантов векторизации. Первый рейтинг: giga_480m и qwen3e_4b делят первое место с 76,8 %. После исключения дубликатов: qwen3e_4b падает на четвёртое место, честный диапазон сжимается с 55–77 % до 45–70 %. После смены правила классификации: giga_480m падает на седьмое, наверх выходят символьные методы без видеокарты. После проверки метрики ARI: рейтинг кластеризации оказывается шумом. Итого: ни один из трёх «финальных рейтингов» не совпал с предыдущим.
- Размечать эталон моделью. Модель, породившая разметку, получает скрытое преимущество. Первая версия этого эксперимента была снята именно по этой причине.
- Не проверять дубликаты. Деловой документооборот на 75 % состоит из копий с изменённым номером и датой. Модель «узнаёт близнеца», а не обобщает. Без группировки дубликатов вы измеряете память, а не понимание.
- Доверять одному правилу классификации. Смена правила (с ближайшего центра на обучаемую надстройку) сдвинула результаты сильнее, чем разница между моделями. Один эксперимент с одним правилом ничего не говорит о качестве эмбеддинга.
- Полагаться на ARI без проверки устойчивости. Если разброс от случайного зерна сопоставим с разницей между моделями, вы сравниваете шум.
Что делать с этим прямо сейчас?
Автору Дзена: если вы используете эмбеддинг для группировки статей, подбора похожих материалов или кластеризации тем, не доверяйте одной таблице сравнения моделей. Проверьте, нет ли в выборке дубликатов, и попробуйте сменить правило классификации, результат может измениться радикально.
Маркетологу: при автоматической сортировке клиентских обращений, отзывов, заявок выбор модели эмбеддинга менее критичен, чем выбор метода разметки эталона и правила отнесения к классу. Вкладывайте время в качество разметки, а не в погоню за лидером бенчмарка.
Предпринимателю в РФ и СНГ: десять векторных вариантов из тринадцати оказались точнее прямого запроса к облачной языковой модели на задаче определения типа документа. Это значит, что локальная система на эмбеддингах (не требующая отправки данных во внешнее облако) может работать лучше и дешевле. Из доступных в РФ моделей для экспериментов подходят GigaChat (включает эмбеддинги от Сбера) и модели с открытыми весами (open weights) семейства Qwen.
Этот эксперимент показал мне то, что я наблюдаю и в работе с текстами на Дзене: таблица «лучшая модель по метрике X» ничего не стоит без трёх вопросов. Как размечен эталон? Есть ли дубликаты? Устойчив ли результат при смене правила? Полтора месяца измерений, по признанию авторов, измеряли не столько качество моделей, сколько их совместимость с одним частным способом применения. Честная оговорка: провести все три проверки на своих данных трудоёмко. Но хотя бы проверку на дубликаты (шаг 4) стоит делать всегда, она занимает час и способна перевернуть ваши выводы.
Подберите модель для своих задач
В dzen.guru мы тестируем нейросети на практике и помогаем авторам выбрать рабочие инструменты без переплаты за хайп.
Попробовать dzen.guruГлавный вывод из этого эксперимента прост и неудобен: прежде чем сравнивать модели эмбеддингов, убедитесь, что ваша линейка измеряет то, что вы думаете. Три проверки подряд обнулили три рейтинга подряд, и каждый раз виновата была не модель, а способ измерения.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Нейросети в маркетинге: обучение GEO даёт конверсию в 4,4 раза выше поиска
Продвижение бренда через нейросети перестало быть экспериментом: по данным источника, переход из рекомендации Claude и ChatGPT даёт конверсию в покупку в 4,4…

n8n за 30 минут: как развернуть свой ИИ-оркестратор через Docker без облака
n8n позволяет развернуть собственный ИИ-оркестратор (систему, которая управляет цепочкой задач для языковой модели) на локальном сервере через Docker за…

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения
Нейросеть Qwen3.8-27B на Mac Studio второго июня 2025 года прошла локальный бенчмарк из 84 задач на C# и SwiftUI, и квантизованная (сжатая) 4-bit версия…
Комментарии