การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ
เล่นร่องรอยการทำงานของเอเจนต์ที่สำเร็จซ้ำ เพื่อสร้างชุดข้อมูลฝึกจากคู่ (สถานะ, การกระทำ)
การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
ข้อมูลคือผลิตภัณฑ์
การปรับแต่งประกอบด้วยการสร้างโมเดล 10% และข้อมูล 90% การปรับปรุงคุณภาพครั้งใหญ่ที่สุดมาจากชุดข้อมูลที่ดีขึ้น ไม่ใช่โมเดลที่ใหญ่ขึ้น
ลักษณะของเส้นทางการทำงานของเอเจนต์
เส้นทางการทำงานจะบันทึกการทำงานของเอเจนต์หนึ่งครั้งอย่างครบถ้วน:
trajectory = {
'task': 'Refactor the auth module',
'messages': [
{'role': 'system', 'content': '...'},
{'role': 'user', 'content': 'Task...'},
{'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
{'role': 'tool', 'content': '...'},
...
],
'outcome': 'success'
}การขุดค้นร่องรอยจากระบบจริง
แหล่งข้อมูลที่ดีที่สุดของคุณคือการใช้งานจริง:
for trace in production_traces:
if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
save_to_training_set(trace)การเล่นร่องรอยซ้ำ
เล่นร่องรอยที่สำเร็จแล้วซ้ำเพื่อตรวจสอบว่าสามารถทำซ้ำได้ และใช้เป็นตัวอย่างสำหรับการฝึก:
def replay(trace):
messages = trace.messages[:1] # just the initial user msg
for expected_msg in trace.messages[1:]:
actual = agent.step(messages)
if actual.role == 'assistant':
messages.append(actual)
elif expected_msg.role == 'tool':
messages.append(expected_msg) # replay tool resultการคัดกรองร่องรอยคุณภาพสูง
- ผลลัพธ์สำเร็จ (การทดสอบผ่าน ผู้ใช้พึงพอใจ)
- ร่องรอยสั้น (ไม่มีการลองผิดลองถูกซ้ำซาก)
- การเรียกใช้เครื่องมือสมเหตุสมผล
- ไม่มีการแจ้งเตือนด้านความปลอดภัยถูกทริกเกอร์
การกลั่นความรู้จากโมเดลขนาดใหญ่
ใช้โมเดลที่มีความสามารถสูง (GPT-4o) เพื่อสร้างเส้นทางการทำงานสำหรับโมเดลเป้าหมายที่จะปรับแต่ง (Llama 8B):
for task in task_list:
traj = big_model_agent.run(task)
if traj.success:
save_for_training(traj)
# Now fine-tune Llama 8B on the GPT-4o traces.การตัดเส้นทางการทำงานที่ไม่ดีทิ้ง
ตัวอย่างที่ไม่ดีเพียงตัวอย่างเดียวก็ทำให้การฝึกเสียได้ คัดกรองอย่างเข้มงวด:
- ลบร่องรอยที่มีข้อผิดพลาด
- ลบร่องรอยที่มีการหลอนข้อมูลเกี่ยวกับเครื่องมือ
- ลบร่องรอยที่มีการเรียกใช้เครื่องมือมากกว่า N ครั้ง
- ลบร่องรอยที่ขัดแย้งกับนโยบาย
รูปแบบสำหรับการปรับแต่ง
OpenAI ต้องการ JSONL ที่มีข้อความ:
{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}การเรียกใช้เครื่องมือในข้อมูลการฝึก
รวม tool_calls และข้อความจากเครื่องมือไว้ด้วย โมเดลจะเรียนรู้ลูปการทำงานของเอเจนต์ทั้งหมด:
{
"messages": [
{"role": "user", "content": "Weather in Paris?"},
{"role": "assistant", "tool_calls": [{...}]},
{"role": "tool", "tool_call_id": "...", "content": "{...}"},
{"role": "assistant", "content": "It is 18C and sunny."}
]
}ตัวอย่างเชิงลบ
วิธีการฝึกบางประเภท (DPO, KTO) ได้ประโยชน์จากตัวอย่าง BAD ด้วย:
preferences = [
{'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]เครื่องคำนวณขนาดชุดข้อมูล
ปริมาณข้อมูลโดยประมาณที่ต้องใช้ตามวิธีการฝึก:
- SFT สำหรับรูปแบบ: 500-2000
- SFT สำหรับความสามารถใหม่: 5k-50k
- DPO: คู่ข้อมูลความชอบ 1k-10k คู่
- RLHF / RLAIF: 10k-100k+
การจัดการเวอร์ชันของชุดข้อมูล
จัดการชุดข้อมูลของคุณเหมือนโค้ด จัดทำเวอร์ชัน ติดตามว่ารวมร่องรอยใดไว้บ้าง และสร้างผลลัพธ์ที่ทำซ้ำได้
การคัดสรรโดยมีมนุษย์อยู่ในวงจร
ชุดข้อมูลที่ดีที่สุดต้องผ่านคิวตรวจสอบโดยมนุษย์ เครื่องมืออย่าง Argilla, Label Studio และ Snorkel ช่วยให้กระบวนการนี้มีประสิทธิภาพ
แหล่งร่องรอยที่ดีที่สุด
แหล่งเส้นทางการทำงานสำหรับการฝึกที่มีสัญญาณชัดเจนที่สุดคืออะไร
สรุปทบทวน
เส้นทางการทำงานจากการทำงานจริงที่สำเร็จมีคุณค่าสูงมาก เมื่อจำเป็นให้กลั่นความรู้จากโมเดลที่มีความสามารถสูง คัดกรองอย่างเข้มงวด และจัดทำเวอร์ชันของชุดข้อมูล
เรียนรู้ AI Agents ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 60
- บทเรียน
- 239
คำถามที่พบบ่อย
บทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ”
เล่นร่องรอยการทำงานของเอเจนต์ที่สำเร็จซ้ำ เพื่อสร้างชุดข้อมูลฝึกจากคู่ (สถานะ, การกระทำ) คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน
บทเรียน “การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- เมื่อการปรับแต่งโมเดลดีกว่าการเขียนคำสั่ง
- การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ
- LoRA และ QLoRA เพื่อการปรับแต่งที่ประหยัดค่าใช้จ่าย
- การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน