0Pricing
AI Agents · 강의

데이터 수집: 궤적과 추적 재생

성공한 에이전트 추적을 재생해 (상태, 행동) 쌍으로 구성된 학습 세트를 만듭니다.

데이터 수집: 궤적과 추적 재생은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

데이터가 제품입니다

미세 조정은 모델링 10%, 데이터 90%입니다. 가장 큰 품질 향상은 더 큰 모델이 아니라 더 나은 데이터셋에서 나옵니다.

에이전트 실행 경로의 모습

실행 경로에는 에이전트 실행 한 번 전체가 담깁니다:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

운영 환경 실행 기록 수집

가장 좋은 데이터 소스는 실제 사용 기록입니다:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

실행 기록 재생

성공한 실행 기록을 재생하여 재현 가능성을 확인하고, 학습 예제로도 사용하십시오:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

고품질 실행 기록 필터링

  • 결과가 성공임(검사가 통과하고 사용자가 만족함)
  • 실행 기록이 짧음(불필요한 반복이 없음)
  • 도구 호출이 합리적임
  • 보안 경고가 발생하지 않음

대형 모델에서 지식 증류

강력한 모델(GPT-4o)을 사용하여 미세 조정 대상 모델(Llama 8B)의 실행 경로를 생성하십시오:

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

나쁜 실행 경로 제거

나쁜 예시 하나가 학습 전체를 오염시킬 수 있습니다. 적극적으로 필터링하십시오:

  • 오류가 있는 실행 기록을 제거합니다
  • 도구 환각이 있는 실행 기록을 제거합니다
  • N번을 초과하여 도구를 호출한 실행 기록을 제거합니다
  • 정책에 위배되는 실행 기록을 제거합니다

미세 조정용 형식

OpenAI는 메시지가 포함된 JSONL을 요구합니다:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

학습 데이터의 도구 호출

도구 호출과 도구 메시지를 포함하십시오. 모델이 에이전트 순환 과정 전체를 학습합니다:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

부정적 예시

일부 학습 방법(DPO, KTO)은 BAD 예시도 활용하면 효과가 좋습니다:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

데이터셋 규모 계산기

학습 방법별로 필요한 대략적인 데이터 양입니다:

  • 형식용 SFT: 500~2000개
  • 새 기능용 SFT: 5천~5만 개
  • DPO: 선호도 쌍 1천~1만 개
  • RLHF / RLAIF: 1만~10만 개 이상

데이터셋 버전 관리

데이터셋을 코드처럼 다루십시오. 버전을 관리하고, 어떤 실행 기록이 포함되었는지 추적하며, 재현 가능한 빌드를 사용하십시오.

사람이 참여하는 선별

최고의 데이터셋은 사람의 검토 대기열을 거칩니다. Argilla, Label Studio, Snorkel 같은 도구를 사용하면 이 과정을 효율적으로 진행할 수 있습니다.

최고의 실행 기록 출처

학습용 실행 경로의 신호가 가장 높은 출처는 무엇입니까?

복습

실제 성공한 실행에서 얻은 실행 경로는 귀중한 데이터입니다. 필요하면 강력한 모델에서 지식을 증류하십시오. 적극적으로 필터링하십시오. 데이터셋의 버전을 관리하십시오.

자주 묻는 질문

“데이터 수집: 궤적과 추적 재생” 강의는 무료인가요?

네 — “데이터 수집: 궤적과 추적 재생” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“데이터 수집: 궤적과 추적 재생”에서 뭘 배우나요?

성공한 에이전트 추적을 재생해 (상태, 행동) 쌍으로 구성된 학습 세트를 만듭니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“데이터 수집: 궤적과 추적 재생” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 프롬프트보다 미세 조정이 효과적인 경우
  2. 데이터 수집: 궤적과 추적 재생
  3. 비용 효율적인 튜닝을 위한 LoRA와 QLoRA
  4. 튜닝 모델과 기반 모델 평가
← AI Agents(으)로 돌아가기