01 Простыми словами
Представьте редактора, который вместо чтения каждого текста лично нанял второго опытного редактора — тот читает черновики и ставит оценку по короткому чек-листу: соответствует тону бренда, действительно отвечает на заданный вопрос и обходится без фактических ошибок. LLM-as-judge устроен похоже: роль второго редактора играет отдельная модель, которая читает пару «вопрос — ответ» и выставляет оценку или выбирает лучший из двух вариантов.
02 Как это работает
Команда сначала формулирует критерии оценки — точность, тон, полнота, отсутствие запрещённых формулировок — и оформляет их в короткий чек-лист или шаблон промпта для модели-судьи.
- Модель-судья получает исходный вопрос, ответ проверяемой модели и список критериев оценки.
- Судья либо ставит балл по каждому критерию, либо сравнивает два варианта ответа и выбирает более удачный.
- Оценки собираются по десяткам или сотням примеров и усредняются в общий показатель качества.
- Показатель отслеживается во времени — после смены промпта или модели команда видит, выросло качество или просело.
В роли судьи обычно используют модель мощнее или дороже проверяемой — например, Claude Opus или GPT-5 для оценки ответов от более лёгкой и быстрой Haiku или GPT-5 mini, — так меньше риск, что судья сам ошибётся в разборе тонкого случая.
Формулировка критериев в чек-листе решает почти всё: расплывчатый критерий вроде «ответ должен быть хорошим» судья интерпретирует непредсказуемо, а конкретный пункт вроде «указана точная дата доставки» проверяется почти однозначно.03 Где применяется
- Поддержка клиентов. Перед запуском нового промпта бота сотни его тестовых ответов прогоняют через судью на соответствие тону и точности.
- Маркетинг. Судья сравнивает пары сгенерированных заголовков или подписей и выбирает более сильный вариант для А/Б-теста.
- Юристы. Судья проверяет, упомянул ли бот-помощник все обязательные пункты при пересказе условий договора.
- Продажи. Судья оценивает черновики писем менеджеру по шкале «убедительность» и «соответствие скрипту компании».
- HR. Судья проверяет сгенерированные описания вакансий на соответствие корпоративному стилю и обязательным пунктам про условия работы.
04 Что сломается без судьи
Отдел маркетинга генерирует по несколько десятков вариантов подписи к рекламному посту на каждую кампанию и раньше отбирал лучшие вручную — маркетолог читал все варианты подряд и выбирал десяток для теста.
Уберите из этого процесса модель-судью — и весь отбор держится на внимании одного человека в конце рабочего дня, когда вариантов накопилось уже полсотни. Качество отбора начинает зависеть от того, насколько маркетолог устал к этому моменту: варианты в конце списка получают меньше внимания просто по порядку прочтения вместо реального качества текста. Явные нарушения бренд-гайда — слово из списка запрещённых, слишком длинная подпись под конкретную площадку — проскакивают чаще, потому что их некому проверить по одному и тому же критерию каждый раз одинаково строго.
С судьёй эта проверка остаётся ровной вне зависимости от времени суток и усталости: одни и те же критерии применяются к варианту номер один и к варианту номер пятьдесят одинаково внимательно. Маркетолог по-прежнему принимает финальное решение между лидерами, но начинает разбор уже с отфильтрованной десятки вместо полусотни вариантов подряд.
05 Ограничения и ошибки
- Модель-судья способна ошибаться так же, как и любая другая модель, — её оценку стоит время от времени сверять с ручной проверкой человеком на выборке примеров.
- Судья иногда предпочитает более длинные или формально оформленные ответы независимо от реального качества содержания — эту склонность стоит проверять отдельно на своих данных.
- Запуск судьи на большом объёме примеров стоит денег и времени: чем детальнее чек-лист и больше проверяемых пар, тем выше расход.
- Для решений с высокой ценой ошибки — юридических, финансовых, медицинских — оценка судьёй остаётся дополнением к проверке человеком вместо полной замены такой проверки.
- LLM-судья — это механизм оценки внутри evals: сам по себе он лишь выставляет балл одному ответу, а evals прогоняет его автоматически на весь набор тестовых примеров при каждом изменении промпта или модели.
Как модель размечает примеры для похожей задачи — в статье про few-shot примеры для разметки заявок. Как выстроить систему оценки качества под задачи компании — в разделе про консалтинг по внедрению ИИ.
Отдельно стоит фиксировать версию модели-судьи и формулировку чек-листа вместе с результатами оценки — иначе через несколько месяцев сложно понять, из-за чего изменился итоговый показатель качества: из-за реальной разницы в ответах или из-за смены самого судьи.