AI Prompt Engineering · 강의

인공지능 출력 읽고 평가하기

인공지능 응답의 관련성, 정확성 및 완전성을 판단하는 기준을 알아보십시오.

레슨 1/413개 단계

인공지능 출력 읽고 평가하기은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

평가가 중요한 이유

인공지능의 응답을 얻는 것은 작업의 절반에 불과합니다. 나머지 절반은 그 응답이 실제로 좋은지 판단하는 것입니다.

명확한 평가 체계가 없으면 겉보기에는 잘 다듬어졌지만 잘못된 질문에 답한 응답을 받아들일 수 있습니다. 반대로 기대한 형식이 아니라는 이유로 실제로 유용한 응답을 거부할 수도 있습니다.

인공지능 출력의 품질을 안정적으로 판단하는 감각을 기르는 것은 프롬프트 설계에서 가장 실용적인 기술 중 하나입니다.

네 가지 평가 기준

인공지능의 응답을 읽을 때는 네 가지 측면에서 판단하세요:

  • 관련성 — 실제로 요청한 질문에 답했나요?
  • 정확성 — 정보가 사실에 맞나요?
  • 완전성 — 요청의 모든 부분을 다루었나요?
  • 형식 — 필요한 방식으로 구조화되어 있나요?

응답은 세 가지 기준에서는 높은 점수를 받고 네 번째 기준에서는 실패할 수 있습니다. 각 기준은 독립적으로 중요합니다.

기준 1: 관련성

관련성은 다음을 묻습니다. 모델이 실제로 질문한 내용에 답했습니까, 아니면 관련은 있지만 다른 질문에 답했습니까?

예를 들어 "의료 분야에서 LLM을 사용할 때의 위험은 무엇인가요?"라고 물었는데 모델이 LLM의 작동 방식에 대한 일반적인 개요를 답했다고 하겠습니다. 이 응답은 정확할 수 있지만 관련성이 없습니다. 핵심을 놓쳤기 때문입니다.

관련성을 확인하려면 원래 프롬프트를 다시 읽고 다음과 같이 자문해 보세요. 응답이 내가 질문한 내용을 직접 다루고 있나요?

기준 2: 정확성

정확성은 응답에 포함된 사실, 수치 및 주장이 올바른지 묻습니다.

인공지능 모델은 환각을 일으킬 수 있습니다. 즉, 단순히 틀린 내용을 자신 있게 말할 수 있습니다. 일반적인 정확성 문제는 다음과 같습니다.

  • 잘못된 통계 또는 날짜
  • 잘못 귀속된 인용문
  • 현재 정보인 것처럼 제시된 오래된 정보
  • 꾸며낸 참고 자료 또는 인용

사실에 관한 주제라면 출력을 사용하기 전에 신뢰할 수 있는 출처로 핵심 주장을 항상 확인하세요.

기준 3: 완전성

완전성은 응답이 요청한 내용의 모든 부분을 다뤘는지 묻습니다.

프롬프트에 여러 부분이 있었다면 — "X를 설명하고, 세 가지 예를 나열한 다음, 다음 단계를 제안해 주세요." — 모델이 첫 번째 부분만이 아니라 세 가지를 모두 다뤘는지 확인하세요.

특히 프롬프트가 길면 모델이 여러 부분으로 이루어진 요청의 마지막 부분을 빠뜨리는 경우가 있습니다. 프롬프트의 각 항목과 응답을 하나씩 대조해 읽는 것이 완전성을 확인하는 가장 확실한 방법입니다.

기준 4: 형식

형식은 응답이 필요한 방식으로 구성되어 있는지 묻습니다.

아무리 정확하고 완전한 응답이라도 형식이 잘못되면 사용하기 어려울 수 있습니다. 흔한 형식 불일치의 예는 다음과 같습니다.

  • 글머리 기호 목록이 필요한데 산문으로 작성된 경우
  • 요약이 필요한데 긴 글로 작성된 경우
  • 탐색에 도움이 될 제목이 빠진 경우
  • 설명 없이 코드만 있거나, 코드 없이 설명만 있는 경우

형식 문제는 후속 프롬프트로 수정하기 가장 쉬운 경우가 많습니다.

간단한 평가 점검표

인공지능의 응답을 받은 후 다음의 머릿속 점검표를 확인해 보세요.

  • 관련성: 내가 실제로 질문한 내용에 답했나요?
  • 정확성: 사실을 신뢰할 수 있나요? 무엇을 확인해야 하나요?
  • 완전성: 요청한 모든 부분을 다뤘나요?
  • 형식: 내가 사용할 수 있는 방식으로 구성되어 있나요?

어떤 기준이든 충족되지 않았다면 어떤 유형의 후속 프롬프트를 작성해야 하는지 정확히 알 수 있습니다. 각 기준은 특정 유형의 수정으로 이어지는 points 역할을 합니다.

코드로 평가하기: 응답 점수 매기기

두 번째 LLM 호출을 사용해 각 기준에 따라 응답을 평가하는 가벼운 평가 래퍼를 Python으로 만들 수 있습니다.

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

관련성 실패: 흔한 패턴

관련성 실패는 예측 가능한 패턴을 따르는 경우가 많습니다. 이러한 패턴을 알아두면 평가를 더 빠르게 진행할 수 있습니다.

  • 주제 이탈 — 모델이 올바르게 시작한 다음 관련된 주제로 벗어납니다
  • 질문 바꿔치기 — 모델이 질문의 더 단순하거나 쉬운 버전에 답합니다
  • 지나친 일반화 — 특정 사례를 물었는데 모델이 일반적인 경우에 답합니다
  • 제약 조건 무시 — 특정 맥락을 지정했는데(예: "초보자를 위한"), 모델이 이를 무시합니다

각 패턴은 후속 프롬프트에서 사용할 구체적인 해결 방법을 제시합니다.

주의해야 할 정확성 위험 신호

주장을 즉시 확인할 수 없을 때에도 정확성이 낮을 가능성을 보여 주는 신호가 있습니다.

  • 출처 없이 인용된 매우 구체적인 숫자
  • 너무 편리하거나 완벽하게 핵심을 짚는 것처럼 보이는 주장
  • 제목과 저자가 언급된 연구, 논문 또는 서적
  • 날짜와 버전 번호(자주 바뀌는 정보)
  • 법률, 의료 또는 금융 관련 구체적인 내용

이러한 신호가 오류의 증거는 아니지만, 중요한 상황에서 출력을 사용하기 전에 다시 확인할 가치가 있는 항목입니다.

평가를 활용해 더 나은 후속 프롬프트 작성하기

평가의 진정한 가치는 충족되지 않은 각 기준이 후속 프롬프트의 유형과 직접 연결된다는 데 있습니다.

  • 관련성 실패 → "X에 답했지만 제가 질문한 내용은 Y입니다. Y에 집중해 주세요."
  • 정확성 우려 → "Z에 관한 주장을 다시 확인하고 근거를 인용해 주세요."
  • 완전성 실패 → "제 질문의 세 번째 부분을 다루지 않았습니다. 그 부분을 추가해 주세요."
  • 형식 실패 → "이 내용을 글머리 기호 목록으로 다시 작성하고 맨 위에 한 줄 요약을 추가해 주세요."

평가와 후속 프롬프트 작성은 피드백 순환으로 작동합니다.

지식 확인: 평가 기준

모델에 "가장 뛰어난 Python 웹 프레임워크 5가지를 각각 한 문장으로 설명해 나열해 주세요."라고 요청했습니다. 모델은 Python의 역사와 웹 개발에서의 성장에 관한 잘 작성된 글로 답했으며 Flask와 Django를 간략히 언급했지만, 프레임워크 5가지를 나열하지는 않았습니다.

이 응답은 어떤 기준을 가장 심각하게 충족하지 못했나요?

복습: 인공지능 출력 읽기 및 평가

훌륭한 프롬프트 작성은 프롬프트를 만들고 응답을 평가하는 두 단계의 과정입니다.

네 가지 기준인 관련성, 정확성, 완전성, 형식은 모든 인공지능 출력을 체계적으로 평가할 방법을 제공합니다. 충족되지 않은 각 기준을 통해 어떤 후속 프롬프트를 작성해야 하는지 정확히 알 수 있습니다.

다음 학습에서는 특정 유형의 문제를 수정하기 위한 후속 프롬프트를 직접 작성해 보겠습니다.

무료로 시작

AI 튜터와 함께 AI Prompt Engineering을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
53
레슨
199

자주 묻는 질문

“인공지능 출력 읽고 평가하기” 강의는 무료인가요?

네 — “인공지능 출력 읽고 평가하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

“인공지능 출력 읽고 평가하기”에서 뭘 배우나요?

인공지능 응답의 관련성, 정확성 및 완전성을 판단하는 기준을 알아보십시오. 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“인공지능 출력 읽고 평가하기” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 인공지능 출력 읽고 평가하기
  2. 효과적인 후속 프롬프트 작성하기
  3. 이전 응답을 바탕으로 발전시키기
  4. 다듬을지 새로 시작할지 판단하기
← AI Prompt Engineering(으)로 돌아가기