자기 비평 검증
모델이 검증한 출력
자기 비평 검증은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
모델을 자기 자신의 비평가로 활용하기
자기 비평은 LLM을 사용하여 평가 기준 또는 정책에 따라 LLM의 출력을 평가합니다. 결정론적 검증기로는 표현할 수 없는 미묘한 실패, 즉 사실 불일치, 어조, 유용성, 미묘한 정책 위반을 포착합니다.
이는 스키마 및 규칙 검증기를 보완하는 모델 기반 검증입니다.
비평기를 작성자와 분리하십시오
비평을 생성 과정의 마지막 지시로 넣지 말고, 자체 프롬프트를 사용하는 별도의 호출로 실행하십시오. 정리된 맥락에서 판정만 요청받는 비평기는 생성 중인 작성자에게 스스로 점수를 매기게 하는 것보다 훨씬 안정적입니다. 후자의 경우 작성자는 자신의 답변에 편향되기 때문입니다.
draft = author_model(task_prompt)
verdict = critic_model(
'You are a strict reviewer. Judge ONLY the answer below against the rubric.\n'
'Rubric: ' + rubric + '\nAnswer: ' + draft
)구조화된 비평 출력
파이프라인이 프로그래밍 방식으로 조치를 취할 수 있도록 비평기가 구조화된 판정을 출력하게 하십시오. 자유 형식 텍스트 비평은 기계가 처리할 수 없습니다.
CRITIC_SCHEMA = {
'type': 'object',
'properties': {
'pass': {'type': 'boolean'},
'violations': {'type': 'array', 'items': {'type': 'string'}},
'severity': {'type': 'string', 'enum': ['none','minor','major','critical']},
'fix_hint': {'type': 'string'}
},
'required': ['pass','violations','severity','fix_hint'],
'additionalProperties': False
}비평 후 수정 루프
비평기를 수정기와 함께 사용하십시오. 비평기는 문제를 찾고, 작성자는 비평을 활용해 수정하며, 통과하거나 예산을 소진할 때까지 반복합니다. 이는 수정 루프에 해당하는 모델 기반 방식입니다.
draft = author_model(task)
for _ in range(2):
c = critic_model(draft)
if c['pass']:
break
draft = author_model(task + '\nRevise to fix: ' + c['fix_hint'])
final = draft평가 기준이 비평을 안정적으로 만듭니다
모호한 지시('이것이 좋은가요?')는 불안정한 판정을 낳습니다. 명확하고 확인 가능한 기준을 갖춘 구체적인 평가 기준은 일관된 판정을 만들어 냅니다. 이를 비평기가 개별적으로 답하는 예 또는 아니요 질문으로 세분화하십시오.
RUBRIC = [
'Does the answer directly address the user question?',
'Are all factual claims supported by the provided context?',
'Is any disallowed content present?',
'Is the response within the requested length?'
]사실성을 위한 근거 기반 비평
환각을 감지하려면 비평기에게 출처 맥락을 제공하고, 그 맥락에서 논리적으로 도출되지 않는 주장을 표시하도록 요청하십시오. 이렇게 하면 근거 없이 '이것이 사실인가요?'라고 묻는 것보다 훨씬 강력한 함의 여부 검사가 됩니다.
verdict = critic_model(
'For each claim in the ANSWER, state whether the CONTEXT entails it. '
'Flag any unsupported claim.\nCONTEXT:\n' + ctx + '\nANSWER:\n' + draft
)비평기의 실패 유형
비평기 자체가 LLM이므로 실패할 수 있습니다.
- 아첨 성향 — 작성자의 답변을 무비판적으로 승인합니다.
- 과도한 비평 — 올바른 출력까지 표시합니다.
- 공유된 맹점 — 동일한 모델이 동일한 오류를 놓칩니다.
비평기로 다른 모델 계열을 사용하고, 엄격한 검토자 역할과 보정된 임계값을 적용하여 완화하십시오.
더 저렴하거나 다른 비평기를 사용하십시오
비평기가 가장 비싼 모델일 필요는 없습니다. 엄격한 평가 기준을 갖춘 더 작은 모델이 비용 효율적인 관문이 되는 경우가 많으며, 서로 다른 모델 계열을 사용하면 서로 연관된 맹점을 줄일 수 있습니다. 가장 강력한 모델은 작성에 사용하도록 남겨 두십시오.
신뢰할 때와 검증할 때
자기 비평은 오류를 줄이지만 증명은 아닙니다. 중요도가 낮은 콘텐츠에는 한 번의 비평으로 충분합니다. 중요도가 높은 출력에는 자기 비평을 결정론적 검증기 및 사람의 검토와 결합하십시오. 안전이 중요한 결정을 모델 하나만으로 판단하게 해서는 안 됩니다.
비용, 지연 시간 및 캐싱
자기 비평은 요청당 호출 횟수를 대략 두 배로 늘립니다. 결정론적 검사 뒤에 비평을 배치하여 이를 제어하십시오. 즉, 스키마와 규칙을 통과한 것만 비평하고, 동일한 초안에 대한 비평은 캐시하며, 수정 라운드 수에는 상한을 두십시오. 가능하면 차단하지 않는 작업과 비평을 병렬로 실행하십시오.
if deterministic_ok(draft):
verdict = critic_model(draft) # only spend critique on viable drafts사람의 라벨을 기준으로 보정하십시오
비평기를 신뢰하기 전에 검증하십시오. 사람이 라벨링한 출력 집합을 만들고 비평기를 실행한 다음, 사람의 판정과 비교하여 일치도와 정밀도 및 재현율을 측정하십시오. 비평기의 판단이 사람의 판단과 상관관계를 갖도록 평가 기준과 역할을 조정하고, 모델을 업그레이드한 후 다시 확인하십시오.
agreement = mean(critic(d)['pass'] == human_label[d] for d in eval_set)
assert agreement > 0.9빠른 확인
RAG 답변에서 환각을 안정적으로 포착하는 비평기를 만들고 싶습니다. 무엇이 안정성을 가장 크게 높입니까?
복습
자기 비평 검증:
- 정리된 맥락을 사용하는 별도의 비평기가 작성자의 출력을 판정합니다.
- 구조화된 판정을 출력하고, 비평 후 수정 루프를 구동하십시오.
- 구체적인 평가 기준과 근거 기반 함의 검사가 안정성을 높입니다.
- 아첨 성향과 공유된 맹점을 주의하고, 다른 비평 모델을 사용하십시오.
- 비용을 기준으로 실행을 제어하고, 결정론적 검사와 결합하며, 사람을 기준으로 보정하십시오.
안전장치 학습을 완료했습니다. 다음 과정은 레드팀 활동과 적대적 평가입니다.
AI 튜터와 함께 AI Prompt Engineering을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 53
- 레슨
- 199
자주 묻는 질문
“자기 비평 검증” 강의는 무료인가요?
네 — “자기 비평 검증” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
“자기 비평 검증”에서 뭘 배우나요?
모델이 검증한 출력 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“자기 비평 검증” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.