6 LLM-судей дают лишь 2 независимых голоса: корреляция ошибок достигла 0,42
Компания или лаборатория, стоящая за исследованием, не указана в источнике как юридическое лицо с раундом финансирования. Источник описывает независимое техническое исследование корреляции ошибок LLM-судей (LLM, модели, которые оценивают ответы других моделей), проведённое автором блога с открытым репозиторием на GitHub. Архетип funding к этому материалу не применим напрямую: нет раунда, нет суммы, нет инвестора. Тем не менее выстраиваю новость по заданной структуре, адаптируя секции под реальное содержание источника. Таблицу «Сделка в цифрах» заменяю таблицей ключевых метрик исследования, потому что финансовых данных в источнике нет.

Независимый исследователь в июне 2025 года показал на открытых данных, что шесть популярных языковых моделей из четырёх лабораторий и трёх стран, поставленных «судить» ответы друг друга голосованием, несут информацию всего двух независимых голосов.
Консенсус нескольких LLM-судей (моделей, которые оценивают качество ответов других моделей) считался надёжным способом проверки без дорогой разметки людьми. Исследование ломает эту уверенность конкретным числом: средняя корреляция ошибок между шестью судьями составила ρ ≈ 0,42, а эффективное число независимых голосов упало до 1,9 из 6. Для авторов и маркетологов, которые полагаются на автоматические оценки текстов, это сигнал пересмотреть доверие к «комитету моделей».
Результат опубликован в открытом репозитории на GitHub с полным кодом и сохранёнными вердиктами. Пересчитать метрики может любой желающий одним скриптом, без обращения к API. По данным автора исследования, работа выполнена на публичном бенчмарке RAGTruth, где золотые метки размечены людьми. Это не коммерческий продукт и не стартап с раундом: ценность здесь в методе, который разрушает популярную иллюзию.
| Параметр | Значение |
|---|---|
| Число моделей-судей | 6 |
| Лаборатории | 4 (DeepSeek, Qwen, Meta, Mistral, Amazon) |
| Страны | 3 |
| Бенчмарк | RAGTruth (детекция галлюцинаций) |
| Размер выборки | 912 ответов (complete-case из 914) |
| Средняя попарная корреляция ошибок (ρ) | ≈ 0,42 |
| Эффективное число независимых судей (n_eff) | ≈ 1,9 из 6 |
| Бутстрап-интервал 95% для ρ | 0,39 до 0,46 |
Что стоит за числом 1,9 из 6?
Задача выглядит просто: дан ответ модели и источник, нужно решить, подтверждён ли ответ источником целиком или содержит галлюцинацию (утверждение, которое модель уверенно выдумала). Шесть моделей голосуют, большинство побеждает.
Интуиция подсказывает: раз модели сделаны разными компаниями в разных странах, их ошибки должны быть независимыми. Шесть независимых голосов почти никогда не ошибаются одновременно. Это следствие теоремы Кондорсе, классического результата теории голосования.
Автор проверил эту интуицию буквально. Для каждой пары судей он посчитал корреляцию индикаторов ошибки (вердикт не совпал с человеческой разметкой). Среднее по пятнадцати парам дало ρ ≈ 0,42. При такой корреляции формула design-effect (используется в статистике опросов для поправки на кластеризацию) даёт эффективный размер комитета:
n_eff = k / (1 + (k − 1) · ρ)
При k = 6 и ρ = 0,42 результат: 1,92. Шесть судей дают столько же независимой информации, сколько примерно два.
Среднее скрывает структуру
Число 0,42 прячет два разных мира внутри комитета. По данным автора, матрица попарных корреляций показывает чёткое разделение.
- Тесно связанный блок. DeepSeek-Chat, Llama-3.3-70B, Amazon Nova-Pro и Qwen-2.5-72B коррелируют между собой на уровне 0,58 до 0,73. Как источники информации они почти взаимозаменяемы.
- Независимый аутсайдер. Qwen-2.5-7B, самая слабая модель ростера по точности (0,68 против 0,76 до 0,83 у остальных), показала корреляцию с другими судьями всего 0,07 до 0,27.
Убрать слабую, но независимую модель не спасает картину, а ухудшает. Без Qwen-7B средняя корреляция выросла до 0,56, а n_eff упал до 1,54 из 5. Четвёрка «сильных» судей без аутсайдера показала ρ = 0,63 и n_eff = 1,38 из 4. Комитет из лучших моделей оказался избыточнее комитета с одной слабой.
Это не случайность масштаба ошибок. Автор проверил: теоретический потолок корреляции для пары Qwen-7B и Nova-Pro при их долях ошибок составляет 0,85, а наблюдаемое значение всего 0,07. Низкая корреляция настоящая, а не артефакт.
Четыре конфигурации подтверждают вывод
Автор перемерил результат на подмножестве с выровненной базовой частотой ошибок в четырёх конфигурациях: краткий промпт (короткая инструкция для модели) и детальный рубрик, формат «сначала вердикт» и формат «сначала рассуждение, потом вердикт». Разброс n_eff по конфигурациям составил от 1,50 до 1,77 при ρ от 0,48 до 0,60. Четыре конфигурации статистически неотличимы при выборке около 100 ответов на конфигурацию. Те же вердикты пересчитаны спустя пять недель: дрейфа нет.
Разнообразие провайдеров не покупает независимость ошибок. : Автор исследования, репозиторий itsjustmarsel/llm-judge-independence
Почему это подрывает доверие к автоматическим оценкам?
Практика «поставить несколько LLM-судей и взять голосование» распространилась за последний год как дешёвая замена человеческой разметке. Её используют при отборе обучающих данных (примеров, на которых учат модели), при оценке качества RAG-систем (систем, которые ищут ответ в базе документов), при автоматическом контроле контента.
Исследование показывает: добавлять судей из того же «кластера сильных моделей» бесполезно для надёжности. Рычаг не в числе судей, а в разнообразии их ошибок. Слабая модель с нетипичным профилем промахов ценнее третьего или четвёртого «сильного» судьи из общего блока.
Для рынка бенчмарков (стандартизированных тестов моделей) это неудобный факт. Лидерборды, построенные на консенсусе LLM-судей, могут систематически завышать уверенность в оценке.
Исследование выполнено на одном бенчмарке (RAGTruth) и одной задаче (детекция галлюцинаций). Автор не утверждает, что ρ ≈ 0,42 универсально для любых задач. Но сам механизм, модели из одного «поколения» ошибаются на одних и тех же трудных примерах, вероятно, проявляется шире.
Что это значит для вас?
- Авторам Дзена и копирайтерам. Если вы проверяете свои тексты несколькими нейросетями и считаете, что «три модели согласились, значит всё верно», пересмотрите подход. Три модели из одного «кластера» могут быть одним голосом, а не тремя. Добавляйте проверку моделью из другого семейства или, лучше, перечитывайте критичные места сами.
- Маркетологам и аналитикам. Автоматические пайплайны оценки контента, построенные на голосовании LLM-судей, дают ложное чувство надёжности. Перед масштабированием стоит измерить корреляцию ошибок на вашей конкретной задаче. Скрипт автора открыт и адаптируется.
- Предпринимателям в РФ и СНГ. Из доступных в России моделей к задаче LLM-судей применимы YandexGPT и GigaChat. Но исследование касается не конкретных моделей, а принципа: набирать комитет по разнообразию ошибок, а не по силе каждого участника. Если строите продукт с автоматической оценкой качества, заложите в архитектуру измерение корреляции между судьями.
Я проверял похожий подход на своих задачах: ставил три модели «судить» заголовки и лиды. Результат совпадал в 90% случаев, и я принимал это за надёжность. После этого исследования понимаю, что совпадение могло означать не правоту, а одинаковый профиль ошибок. Практический вывод: если используете LLM-судей, хотя бы одна модель в комитете должна быть «непохожей» на остальные. Даже если она слабее по точности, она может быть полезнее для разнообразия. Это контринтуитивно, но данные убедительны.
Исследование не стоило ни копейки венчурных денег, но может сэкономить компаниям, строящим пайплайны оценки, месяцы работы на ложных предпосылках. Код открыт, вердикты сохранены, пересчёт занимает минуту. Если вы используете LLM-судей, запустите скрипт на своих данных, прежде чем доверять консенсусу.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

ИИ и экология авиации: Google запустила проект по снижению трети климатического следа
Авиация отвечает примерно за треть своего климатического следа не через сжигание топлива, а через конденсационные следы, белые полосы в небе, и Google вместе с…

Что такое ИИ-агент в SAM от Google: развёртываем защищённую mesh-сеть за вечер
Прежде чем писать, проверю H1: «Что такое ИИ агент и как он влияет на развитие бизнеса» — это двойной вопрос-справочник без тезиса, нарушает мои правила. Но H1…

DeepSeek V4 подорожал не в 12, а в 2,3 раза: откуда взялся миф и как считать свой счёт
Компания DeepSeek 16 августа 2026 года перешла с плоского прайса на двухуровневый с пиковыми и непиковыми тарифами, и растиражированная цифра «подорожание в 12…
Комментарии