การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
เขียนการประเมินก่อนนำเอเจนต์ออกใช้งาน ซึ่งเป็นวิธีเดียวที่จะพัฒนาต่อโดยไม่ทำให้ความสามารถเดิมถดถอย
การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
การประเมินคือการทดสอบสำหรับ AI
คุณคงไม่ส่งมอบโค้ดโดยไม่มีการทดสอบ หลักการเดียวกันนี้ใช้กับตัวแทน LLM — หากไม่มีการประเมิน การเปลี่ยนแปลงทุกครั้งก็ไม่ต่างจากการเสี่ยงโยนเหรียญ
การพัฒนาโดยขับเคลื่อนด้วยการประเมิน (EDD) หมายถึงการเขียนการประเมินก่อน (BEFORE) ที่คุณจะส่งมอบการเปลี่ยนแปลง
วงจร EDD
- เขียนการประเมินที่ไม่ผ่าน: ข้อมูลป้อนเข้า + พฤติกรรมที่คาดหวัง
- ปรับปรุงตัวแทนจนกว่าการประเมินจะผ่าน
- เพิ่มการประเมินลงในชุดการประเมินของคุณ
- เรียกใช้ทุกครั้งที่มีการเปลี่ยนแปลง
สิ่งที่ควรประเมิน
สำหรับตัวแทน ให้ประเมินในหลายระดับ:
- องค์ประกอบ — ตัวดึงข้อมูลส่งคืนส่วนข้อมูลที่ถูกต้องหรือไม่
- ขั้นตอน — LLM เลือกเครื่องมือที่ถูกต้องหรือไม่
- ตั้งแต่ต้นจนจบ — ตัวแทนสร้างคำตอบสุดท้ายที่ถูกต้องหรือไม่
ข้อมูลการประเมิน
แต่ละแถวของการประเมินต้องมีอย่างน้อย:
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsการผสานรวมอย่างต่อเนื่อง
เรียกใช้การประเมินในทุก PR หากคุณภาพลดลงต่ำกว่าเกณฑ์ ให้บล็อกการผสานรวม:
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85ความถี่ของการประเมิน
- การประเมินองค์ประกอบ — ทุก PR
- การประเมินตั้งแต่ต้นจนจบ — ทุก PR (สุ่มตัวอย่าง) และทุกคืน (ทั้งหมด)
- ร่องรอยจากระบบจริง -> ชุดการประเมิน — รายสัปดาห์
กระบวนการจากระบบจริงสู่การประเมิน
ขุดค้นร่องรอยจริง ผลลัพธ์ที่ไม่ดีจะกลายเป็นการประเมินของวันพรุ่งนี้:
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)การประเมินด้วย LangSmith / Langfuse
เครื่องมือทั้งสองมีการรองรับการประเมินในตัว ได้แก่ การกำหนดรุ่นชุดข้อมูล ฟังก์ชันการประเมิน และมุมมองสำหรับเปรียบเทียบ
การตรวจสอบแบบสุ่มด้วยตนเอง
การประเมินอัตโนมัติอาจพลาดรูปแบบและรายละเอียดที่ละเอียดอ่อน โปรดอ่านร่องรอยแบบสุ่ม 20 รายการด้วยตนเองเป็นระยะ วิธีนี้จะช่วยพบปัญหาที่การประเมินพลาดไป
รูปแบบที่ควรหลีกเลี่ยง: การจดจำชุดการประเมิน
หากคุณปรับตัวแทนจนผ่านการประเมิน แต่ชุดการประเมินมีขนาดเล็ก นั่นคือการปรับให้เข้ากับข้อมูลมากเกินไป ควรขยายการประเมินอย่างต่อเนื่อง และสลับการแบ่งชุดทดสอบกับชุดฝึก
การดูแลชุดการประเมิน
การประเมินจะเปลี่ยนไปตามผลิตภัณฑ์ของคุณที่เปลี่ยนแปลง เพิ่มกรณีสำหรับความสามารถใหม่ และเลิกใช้กรณีสำหรับความสามารถที่นำออกแล้ว
คำจำกัดความของ EDD
การพัฒนาโดยขับเคลื่อนด้วยการประเมินหมายถึงอะไร
สรุป
การพัฒนาโดยขับเคลื่อนด้วยการประเมินเป็นสิ่งที่ขาดไม่ได้สำหรับตัวแทนที่จริงจัง เขียนการประเมินในทุกระดับ เรียกใช้ในการผสานรวมอย่างต่อเนื่อง และขยายชุดการประเมินจากร่องรอยในระบบจริง
คำถามที่พบบ่อย
บทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน”
เขียนการประเมินก่อนนำเอเจนต์ออกใช้งาน ซึ่งเป็นวิธีเดียวที่จะพัฒนาต่อโดยไม่ทำให้ความสามารถเดิมถดถอย คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
- การสร้างชุดทดสอบมาตรฐาน
- ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
- ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench