LLM в поиске кандидатов подняла точность выдачи резюме с 43,7 до 66,3%
Компания, разрабатывающая внутреннюю платформу подбора ИТ-специалистов в России, этим летом встроила языковую модель (LLM, большая языковая модель, которая понимает и генерирует текст) в поиск кандидатов и подняла долю релевантных резюме в первой десятке выдачи с 43,7 до 66,3%.

Векторный поиск по резюме находит похожие тексты, а не подходящих людей. LLM-судья впервые решает именно рекрутерскую задачу: оценивает роль, уровень и опыт, а каждый вердикт обязан подтверждать дословной цитатой из резюме, что отсекает галлюцинации (когда модель уверенно выдумывает факты).
Результат опубликован командой российской платформы подбора ИТ-специалистов. До переделки поиск кандидатов работал на эмбеддингах (числовых «слепках» текста, по которым считается близость документов): система сравнивала текст вакансии с текстами резюме и выводила наверх те, что ближе по словам. Проблема в том, что резюме сильного программиста совпадает с вакансией архитектора почти по всем ключевым словам, но это другая роль. Рекрутер видит разницу за секунды. Поиск не видит вовсе.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| LLM-судья для переранжирования результатов поиска кандидатов | Лето 2025 года, эталонный набор заморожен 3 июля | Российская платформа подбора ИТ-специалистов (название не раскрыто) | Стоимость не раскрыта; отмечено, что gpt-4.1-mini обходится в 5 раз дешевле gpt-4o |
Что поменялось в поиске кандидатов?
- Место кандидата в выдаче теперь определяет LLM, а не только косинусная близость. Модель играет роль опытного рекрутёра: сначала проверяет фактическую роль по последним позициям в опыте (титул в шапке резюме ролью не считается), потом уровень по датам и масштабу проектов, и только после этого смотрит навыки и стек.
- Каждый вердикт обязан содержать дословную цитату из резюме длиной до 200 символов. Нет подтверждения, статус требования не выше «частично». В промпте (системной инструкции для модели) прямо прописано: «НЕ выдумывай цитаты».
- Строгая точность первой десятки выросла с 43,7 до 66,3%. Замер проведён на эталонном наборе из 476 пар «вакансия и резюме» по 19 живым вакансиям, замороженном до начала работ. Каждую пару разметил человек одним из трёх вердиктов: «подходит» (174), «пограничный» (120), «мимо» (182).
- Любая из четырёх проверенных LLM побила чистый векторный поиск с запасом от 14 до 22 процентных пунктов строгой точности.
- RRF (Reciprocal Rank Fusion, стандартный приём слияния семантического и полнотекстового поиска) провалился: ухудшил и полноту, и точность уже на первой проверке.
- Перебор 1330 вариантов взвешивания оценок судьи доказал, что веса не нужны, простое ранжирование по общей оценке работает не хуже.
Почему дешёвая модель проиграла, хотя была точнее?
Тендер между четырьмя LLM (gpt-4o, gpt-4.1-mini и двумя другими) дал неожиданный поворот. По соотношению цены, скорости и точности лидировала gpt-4.1-mini. Но проверка цитат вскрыла проблему: 27,2% цитат этой модели не нашлись в тексте резюме дословно.
Разбор вручную показал, что откровенно выдуманных фактов почти нет. Модель «цитирует по памяти»: заменяет глагол синонимом, вносит опечатку, склеивает два пункта списка в одну строку. Смысл сохранён, буква нарушена.
Для внутреннего ранжирования это безвредно. Но для рекрутера, который проверяет вердикт по резюме, «почти точная» цитата подрывает доверие: если цитату нельзя найти в документе за три секунды, она бесполезна. Именно требование дословности отсеяло «экономичного» кандидата на роль судьи.
Отдельная история с gpt-5 (рассуждающая модель, reasoning model). Она выжигала бюджет токенов (единиц текста, которые модель обрабатывает за один вызов) на скрытые размышления и на большинстве пар возвращала пустой ответ, даже при потолке в 24 тысячи токенов. Прогон стоил около 8,60 доллара и почти ничего не вернул.
Как попробовать похожий подход?
- Соберите эталонный набор. Возьмите реальные вакансии и резюме, попросите рекрутера разметить каждую пару вердиктом «подходит», «пограничный», «мимо». Даже 15 вакансий и несколько сотен пар дадут измеримую базу для сравнения.
- Напишите промпт-судью. Опишите порядок анализа: сначала роль (по опыту, не по титулу), потом уровень, потом навыки. Потребуйте дословные цитаты из резюме как доказательство каждого вердикта. Формат ответа зафиксируйте в JSON.
- Прогоните эталон через несколько моделей. Сравните не только точность, но и долю «фантомных» цитат. Проверка простая: ищите подстроку цитаты в тексте резюме после нормализации пробелов и регистра.
- Заморозьте эталон и привинтите контрольный тест. Авторы проекта называют это «скучным решением, которое оказалось самым полезным»: любой спор «а стало ли лучше» решается прогоном, а прогоны разных недель есть с чем сравнивать.
Есть ли аналоги в России?
Для поиска кандидатов с LLM-переранжированием готового коробочного продукта на российском рынке пока нет. Но собрать похожую связку можно на отечественных моделях.
| Компонент | Зарубежный вариант (из статьи) | Российский аналог |
|---|---|---|
| LLM-судья | gpt-4o, gpt-4.1-mini | YandexGPT, GigaChat |
| Векторный поиск | Эмбеддинги OpenAI | Yandex Embeddings, открытые модели на Hugging Face |
| Проверка цитат | Substring matching (описан в статье) | Тот же подход, код не зависит от модели |
YandexGPT и GigaChat поддерживают JSON-режим ответа, что критично для автоматического разбора вердиктов. Главный вопрос: как поведут себя эти модели с дословным цитированием из резюме. По описанному в статье методу это проверяется за один прогон эталонного набора.
Что с этого вам?
Рекрутерам и HR-командам. Если ваш поиск кандидатов построен на векторной близости, попробуйте добавить LLM-переранжирование хотя бы на десяти вакансиях. Прирост с 44 до 66% релевантных резюме в топ-10 означает, что рекрутер тратит вдвое меньше времени на отсев «текстово похожих, но не подходящих» специалистов.
Авторам Дзена и контент-маркетологам. Этот же принцип «судья с цитатами» применим к любому контентному поиску: подбор релевантных статей, проверка фактов в черновиках, сортировка пользовательских отзывов. Промпт-судья с требованием цитат из источника, рабочий шаблон.
Предпринимателям в РФ. Описанный подход не требует зарубежной инфраструктуры: эталонный набор, промпт и проверка цитат работают с любой LLM. Начните с YandexGPT или GigaChat, замерьте долю фантомных цитат и сравните с gpt-4.1-mini (27,2%).
Самое ценное в этой истории не сам прирост точности, а то, как требование дословных цитат из резюме стало фильтром качества модели. Без него gpt-4.1-mini выглядела победителем тендера: дешевле, быстрее, точнее по формальным метрикам. Проверка цитат перевернула результат. Я бы рекомендовал взять этот приём на вооружение любому, кто использует LLM для оценки документов: заставьте модель доказывать каждый вердикт фрагментом из исходного текста, а потом проверьте, существует ли этот фрагмент на самом деле. Это дешевле и надёжнее, чем пытаться бороться с галлюцинациями на уровне архитектуры. Оговорка: эталонный набор размечен одним человеком, авторы сами признают эту слабость. На 19 вакансиях разброс точности огромный, от 10 до 90%. Для промышленного решения нужна разметка несколькими экспертами и больше вакансий.
Частые вопросы
Нужно ли менять всю поисковую систему, чтобы внедрить LLM-судью?
Нет. Судья работает поверх существующего поиска: сначала векторный поиск находит кандидатов по близости текстов, потом LLM переранжирует результат. Существующую инфраструктуру менять не нужно, добавляется только этап переранжирования.
Почему нельзя просто взять самую дешёвую модель?
Потому что дешёвая модель может «цитировать по памяти», подменяя слова синонимами. В описанном тендере у gpt-4.1-mini 27,2% цитат не совпали с текстом резюме дословно. Для автоматического ранжирования это терпимо, но рекрутер не сможет быстро проверить вердикт, и доверие к системе падает.
Сработает ли этот подход с российскими LLM?
Архитектура не привязана к конкретной модели: промпт-судья, JSON-ответ, проверка цитат подстрокой. YandexGPT и GigaChat поддерживают нужный формат. Единственное, что нужно замерить, долю фантомных цитат на вашем эталонном наборе. Именно этот показатель, а не общая точность, определяет, подходит ли модель для поиска кандидатов с доказательной базой.
Команда, стоящая за этим проектом, честно зафиксировала слабое место: один разметчик, 19 вакансий. Но сам метод, судья с обязательными цитатами и замороженный эталон, переносится на любую задачу, где нужно не просто найти похожий текст, а оценить, подходит ли человек, документ или статья по существу.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Транскрипция нейросетью за минуты: Gemini 3.5 Transcribe снизила ошибки до 2,6%
Каждый, кто работал с видео или подкастами, знает: ручная расшифровка аудио отнимает часы, а старые сервисы спотыкаются на шумах, акцентах и профессиональном…

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн
Стартап Instinct, основанный 23-летним Ноа Шинном всего год назад, привлёк 250 млн долларов в раунде Series B и довёл общий объём финансирования до 350 млн…

ИИ-агенты и программирование: три из четырёх условий замены джуниоров провалены
Microsoft второго июня запустила агентную среду, где ИИ-агенты ведут код без присмотра, и аналитик Эван Армстронг тут же разобрал, почему четыре условия для…
Комментарии