0Pricing
AI Agents · 강의

에이전트를 위한 평가 주도 개발

에이전트를 출시하기 전에 평가를 먼저 작성해보세요. 회귀 없이 반복 개선하는 유일한 방법입니다.

에이전트를 위한 평가 주도 개발은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

평가는 AI를 위한 테스트입니다

테스트 없이 코드를 출시하지는 않을 것입니다. LLM 에이전트에도 같은 논리가 적용됩니다. 평가가 없으면 모든 변경이 동전 던지기와 같습니다.

평가 주도 개발(Eval-Driven Development, EDD)은 변경 사항을 출시하기 전에(BEFORE) 평가를 작성하는 것을 의미합니다.

EDD 반복 과정

  1. 실패하는 평가 작성: 입력과 예상 동작
  2. 평가가 통과할 때까지 에이전트 개선
  3. 평가를 평가 모음에 추가
  4. 변경할 때마다 실행

무엇을 평가할 것인가

에이전트는 여러 수준에서 평가합니다:

  • 구성 요소 — 검색기가 올바른 청크를 반환합니까?
  • 단계 — LLM이 올바른 도구를 선택합니까?
  • 종단 간 — 에이전트가 올바른 최종 답변을 생성합니까?

평가 데이터

각 평가 행에는 최소한 다음이 포함됩니다:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

지속적 통합

모든 PR마다 평가를 실행합니다. 품질이 임계값 아래로 떨어지면 병합을 차단합니다:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

평가 주기

  • 구성 요소 평가 — 모든 PR마다
  • 종단 간 평가 — 모든 PR마다(표본 추출) + 매일 밤(전체)
  • 운영 추적 기록 -> 평가 세트 — 매주

운영 -> 평가 처리 흐름

실제 추적 기록을 발굴합니다. 나쁜 결과는 다음 날의 평가가 됩니다:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

LangSmith / Langfuse 평가

두 도구 모두 기본 제공 평가 기능을 갖추고 있습니다. 데이터 세트 버전 관리, 평가 함수, 비교 화면을 지원합니다.

수동 표본 점검

자동 평가로는 문체와 미묘한 차이를 놓칠 수 있습니다. 주기적으로 무작위 추적 기록 20개를 직접 읽어 보십시오. 평가가 놓치는 문제를 발견할 수 있습니다.

반패턴: 평가 세트 암기

평가 세트가 작은데 에이전트를 조정해 평가를 통과시키면 과적합이 발생합니다. 평가를 계속 확장하고 테스트/학습 분할을 순환해서 바꾸십시오.

평가 세트 유지 관리

제품이 변경되면 평가도 달라집니다. 새로운 기능에 대한 사례를 추가하고, 제거된 기능에 대한 사례는 폐기하십시오.

EDD 정의

평가 주도 개발(EDD)은 무엇을 의미합니까?

요약

평가 주도 개발은 진지한 에이전트에 반드시 필요합니다. 모든 수준에서 평가를 작성하고, 지속적 통합에서 실행하며, 운영 추적 기록을 바탕으로 평가 모음을 확장하십시오.

자주 묻는 질문

“에이전트를 위한 평가 주도 개발” 강의는 무료인가요?

네 — “에이전트를 위한 평가 주도 개발” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“에이전트를 위한 평가 주도 개발”에서 뭘 배우나요?

에이전트를 출시하기 전에 평가를 먼저 작성해보세요. 회귀 없이 반복 개선하는 유일한 방법입니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“에이전트를 위한 평가 주도 개발” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 에이전트를 위한 평가 주도 개발
  2. 골든 테스트 세트 구축
  3. LLM 심사자의 함정
  4. 벤치마크 모음: SWE-Bench, GAIA, ToolBench
← AI Agents(으)로 돌아가기