AI Agents · บทเรียน

การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ

เล่นร่องรอยการทำงานของเอเจนต์ที่สำเร็จซ้ำ เพื่อสร้างชุดข้อมูลฝึกจากคู่ (สถานะ, การกระทำ)

บทเรียน 2 จาก 415 ขั้นตอน

การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

ข้อมูลคือผลิตภัณฑ์

การปรับแต่งประกอบด้วยการสร้างโมเดล 10% และข้อมูล 90% การปรับปรุงคุณภาพครั้งใหญ่ที่สุดมาจากชุดข้อมูลที่ดีขึ้น ไม่ใช่โมเดลที่ใหญ่ขึ้น

ลักษณะของเส้นทางการทำงานของเอเจนต์

เส้นทางการทำงานจะบันทึกการทำงานของเอเจนต์หนึ่งครั้งอย่างครบถ้วน:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

การขุดค้นร่องรอยจากระบบจริง

แหล่งข้อมูลที่ดีที่สุดของคุณคือการใช้งานจริง:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

การเล่นร่องรอยซ้ำ

เล่นร่องรอยที่สำเร็จแล้วซ้ำเพื่อตรวจสอบว่าสามารถทำซ้ำได้ และใช้เป็นตัวอย่างสำหรับการฝึก:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

การคัดกรองร่องรอยคุณภาพสูง

  • ผลลัพธ์สำเร็จ (การทดสอบผ่าน ผู้ใช้พึงพอใจ)
  • ร่องรอยสั้น (ไม่มีการลองผิดลองถูกซ้ำซาก)
  • การเรียกใช้เครื่องมือสมเหตุสมผล
  • ไม่มีการแจ้งเตือนด้านความปลอดภัยถูกทริกเกอร์

การกลั่นความรู้จากโมเดลขนาดใหญ่

ใช้โมเดลที่มีความสามารถสูง (GPT-4o) เพื่อสร้างเส้นทางการทำงานสำหรับโมเดลเป้าหมายที่จะปรับแต่ง (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

การตัดเส้นทางการทำงานที่ไม่ดีทิ้ง

ตัวอย่างที่ไม่ดีเพียงตัวอย่างเดียวก็ทำให้การฝึกเสียได้ คัดกรองอย่างเข้มงวด:

  • ลบร่องรอยที่มีข้อผิดพลาด
  • ลบร่องรอยที่มีการหลอนข้อมูลเกี่ยวกับเครื่องมือ
  • ลบร่องรอยที่มีการเรียกใช้เครื่องมือมากกว่า N ครั้ง
  • ลบร่องรอยที่ขัดแย้งกับนโยบาย

รูปแบบสำหรับการปรับแต่ง

OpenAI ต้องการ JSONL ที่มีข้อความ:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

การเรียกใช้เครื่องมือในข้อมูลการฝึก

รวม tool_calls และข้อความจากเครื่องมือไว้ด้วย โมเดลจะเรียนรู้ลูปการทำงานของเอเจนต์ทั้งหมด:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

ตัวอย่างเชิงลบ

วิธีการฝึกบางประเภท (DPO, KTO) ได้ประโยชน์จากตัวอย่าง BAD ด้วย:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

เครื่องคำนวณขนาดชุดข้อมูล

ปริมาณข้อมูลโดยประมาณที่ต้องใช้ตามวิธีการฝึก:

  • SFT สำหรับรูปแบบ: 500-2000
  • SFT สำหรับความสามารถใหม่: 5k-50k
  • DPO: คู่ข้อมูลความชอบ 1k-10k คู่
  • RLHF / RLAIF: 10k-100k+

การจัดการเวอร์ชันของชุดข้อมูล

จัดการชุดข้อมูลของคุณเหมือนโค้ด จัดทำเวอร์ชัน ติดตามว่ารวมร่องรอยใดไว้บ้าง และสร้างผลลัพธ์ที่ทำซ้ำได้

การคัดสรรโดยมีมนุษย์อยู่ในวงจร

ชุดข้อมูลที่ดีที่สุดต้องผ่านคิวตรวจสอบโดยมนุษย์ เครื่องมืออย่าง Argilla, Label Studio และ Snorkel ช่วยให้กระบวนการนี้มีประสิทธิภาพ

แหล่งร่องรอยที่ดีที่สุด

แหล่งเส้นทางการทำงานสำหรับการฝึกที่มีสัญญาณชัดเจนที่สุดคืออะไร

สรุปทบทวน

เส้นทางการทำงานจากการทำงานจริงที่สำเร็จมีคุณค่าสูงมาก เมื่อจำเป็นให้กลั่นความรู้จากโมเดลที่มีความสามารถสูง คัดกรองอย่างเข้มงวด และจัดทำเวอร์ชันของชุดข้อมูล

เริ่มต้นได้ฟรี

เรียนรู้ AI Agents ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
60
บทเรียน
239

คำถามที่พบบ่อย

บทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ”

เล่นร่องรอยการทำงานของเอเจนต์ที่สำเร็จซ้ำ เพื่อสร้างชุดข้อมูลฝึกจากคู่ (สถานะ, การกระทำ) คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน

บทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เมื่อการปรับแต่งโมเดลดีกว่าการเขียนคำสั่ง
  2. การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ
  3. LoRA และ QLoRA เพื่อการปรับแต่งที่ประหยัดค่าใช้จ่าย
  4. การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน
← กลับไปที่ AI Agents