0Pricing
AI Agents · 강의

LLM 심사자의 함정

심사자는 장황한 답변에 편향되고 자신의 출력 평가에 어려움을 겪으므로 신중한 보정이 필요합니다.

LLM 심사자의 함정은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

LLM 평가자를 사용하는 이유

에세이, 코드 검토, 대화형 답변처럼 개방형 출력에는 하나의 정답이 없습니다. 수천 개의 출력을 평가할 사람을 고용하는 데는 많은 비용이 듭니다.

강력한 모델을 사용해 출력을 점수화하는 LLM 평가자 방식이 이 공백을 메웁니다.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

문제점 1: 위치 편향

평가자는 두 답변을 비교할 때 첫 번째(FIRST) 답변을 선호합니다. 순서를 항상 무작위로 바꾸고 두 번 실행하십시오:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

문제점 2: 길이 편향

평가자는 더 긴(LONGER) 답변이 더 나은 경우가 아니더라도 이를 선호합니다. 정규화하거나 평가자에게 지시하여 보정하십시오:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

문제점 3: 자기 선호

모델은 자신이 생성한 출력을 선호합니다. GPT-4가 자신의 작업을 평가하면 실제보다 높은 점수를 줍니다. 평가에는 다른 모델 계열을 사용하십시오:

  • GPT-4 출력 -> Claude가 평가
  • Claude 출력 -> GPT-4가 평가

문제점 4: 아첨 편향

평가자는 답변에 담긴 강한 의견에 동조합니다. "저는 100% 확신합니다..."라는 표현이 "제 생각에는..."보다 높은 점수를 받습니다. 평가하기 전에 확신을 나타내는 표현을 제거하십시오.

문제점 5: 점수 부풀리기

1~5점 척도에서는 평가자가 4점 부근에 몰립니다. 더 분명한 신호를 얻으려면 이진 점수화(정답/오답)를 사용하십시오:

judge_prompt = '... Return PASS or FAIL only ...'

문제점 6: 형식 편향

정확성과 관계없이 글로 쓴 답변보다 글머리 기호 목록 형식의 답변이 더 높은 점수를 받습니다. 이 점을 인지하고, 때로는 변수를 제거하기 위해 형식을 지정하십시오.

사람의 평가와 비교해 보정하기

표본에 대한 사람의 평가와 평가자의 결과가 얼마나 잘 일치하는지 측정합니다:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

가능하면 쌍별 비교 사용

"A가 B보다 나은가?"가 "A를 1~5점으로 평가하라"보다 더 신뢰할 수 있습니다. 두 프롬프트 중 하나를 선택할 때는 절대 점수보다 쌍별 비교가 낫습니다.

사고 과정 기반 평가

평가자가 먼저 추론하도록 하십시오:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

비용

GPT-4로 평가하면 평가 비용이 두 배가 됩니다. 일반적인 점검에는 더 저렴한 평가자(gpt-4o-mini 또는 claude-haiku)를 사용하고, 대형 평가자는 출시 때만 사용하십시오.

규칙과 결합하기

평가자에게만 의존하지 마십시오. 다음을 결합합니다:

  • 규칙("'30일' 포함")
  • 휴리스틱(길이 범위)
  • 개방형 부분을 위한 LLM 평가자

LLM 평가자 보정

LLM 평가자가 신뢰할 만한지 어떻게 확인합니까?

요약

LLM 평가자는 유용하지만 편향될 수 있습니다. 위치를 무작위화하고, 길이를 정규화하며, 서로 다른 모델 계열을 사용하고, 사람의 평가와 비교해 보정하며, 엄격한 규칙과 결합하십시오.

자주 묻는 질문

“LLM 심사자의 함정” 강의는 무료인가요?

네 — “LLM 심사자의 함정” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“LLM 심사자의 함정”에서 뭘 배우나요?

심사자는 장황한 답변에 편향되고 자신의 출력 평가에 어려움을 겪으므로 신중한 보정이 필요합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“LLM 심사자의 함정” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 에이전트를 위한 평가 주도 개발
  2. 골든 테스트 세트 구축
  3. LLM 심사자의 함정
  4. 벤치마크 모음: SWE-Bench, GAIA, ToolBench
← AI Agents(으)로 돌아가기