Недостатки оценки с помощью LLM-судьи
Судьи предвзяты к подробным ответам, испытывают трудности с оценкой собственных выводов и требуют тщательной калибровки.
«Недостатки оценки с помощью LLM-судьи» — бесплатный урок AI Agents на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Зачем нужны судьи на основе LLM?
Для открытых результатов (эссе, обзоров кода, ответов в диалоге) не существует единственного правильного ответа. Нанимать людей для оценки тысяч результатов дорого.
LLM в роли судьи — использование сильной модели для оценки результатов — закрывает этот пробел.
Basic LLM Judge
judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.
Question: {question}
Answer: {answer}
'''Проблема 1: предвзятость положения
Судьи предпочитают FIRST ответ в парном сравнении. Всегда меняйте порядок случайным образом и запускайте сравнение дважды:
def fair_compare(a, b):
score_ab = compare(a, b)
score_ba = compare(b, a) # swapped
return (score_ab + score_ba) / 2Проблема 2: предвзятость к длине
Судьи предпочитают LONGER ответы, даже когда более короткие лучше. Откалибруйте их, нормализуя длину или дав соответствующую инструкцию:
judge_prompt = '... Penalize answers that are verbose without adding value ...'Проблема 3: предпочтение собственных ответов
Модели предпочитают собственные результаты. Если GPT-4 оценивает свою работу, он ставит себе оценку выше заслуженной. Используйте для оценивания модель из другого семейства:
- Результаты GPT-4 -> оценивает Claude
- Результаты Claude -> оценивает GPT-4
Проблема 4: угодничество
Судьи соглашаются с сильными утверждениями в ответе. «Я уверен на 100 %...» получает более высокие оценки, чем «Я думаю...». Убирайте слова, выражающие уверенность, перед оцениванием.
Проблема 5: завышение оценок
По шкале от 1 до 5 судьи группируют оценки около 4. Для более чёткого сигнала используйте бинарное оценивание (верно/неверно):
judge_prompt = '... Return PASS or FAIL only ...'Проблема 6: предвзятость к формату
Ответы в виде маркированного списка получают более высокие оценки, чем связный текст, независимо от правильности. Учитывайте это; иногда стоит задать единый формат, чтобы убрать эту переменную.
Сопоставление с оценками людей
Измерьте, насколько оценки судьи коррелируют с оценками людей на выборке:
from scipy.stats import pearsonr
human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this taskИспользуйте парное сравнение, когда это возможно
«A лучше B?» надёжнее, чем «Оцените A по шкале от 1 до 5». При выборе между двумя запросами парное сравнение лучше абсолютной оценки.
Оценивание с цепочкой рассуждений
Сначала попросите судью рассуждать:
judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.
Question: {q}
Reference: {r}
Answer: {a}
'''Стоимость
Оценивание с помощью GPT-4 вдвое увеличивает стоимость оценок. Для обычных проверок используйте более дешёвых судей (gpt-4o-mini или claude-haiku), а мощных судей оставляйте для выпусков.
Сочетайте с правилами
Не полагайтесь только на судью. Сочетайте:
- Правила («содержит „30 дней“»)
- Эвристики (диапазон длины)
- Судью на основе LLM для открытой части
Калибровка судьи на основе LLM
Как проверить, надёжен ли ваш судья на основе LLM?
Итоги
Судьи на основе LLM полезны, но предвзяты. Меняйте порядок вариантов случайным образом, нормализуйте длину, используйте разные семейства моделей, сопоставляйте результаты с оценками людей и сочетайте оценивание с жёсткими правилами.
Изучай AI Agents с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 60
- Уроки
- 239
Часто задаваемые вопросы
Урок «Недостатки оценки с помощью LLM-судьи» бесплатный?
Да — полный текст урока «Недостатки оценки с помощью LLM-судьи» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Недостатки оценки с помощью LLM-судьи»?
Судьи предвзяты к подробным ответам, испытывают трудности с оценкой собственных выводов и требуют тщательной калибровки. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Недостатки оценки с помощью LLM-судьи»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Разработка агентов на основе оценивания
- Создание эталонного набора тестов
- Недостатки оценки с помощью LLM-судьи
- Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench