0Pricing
AI Agents · บทเรียน

การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน

เขียนการประเมินก่อนนำเอเจนต์ออกใช้งาน ซึ่งเป็นวิธีเดียวที่จะพัฒนาต่อโดยไม่ทำให้ความสามารถเดิมถดถอย

การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

การประเมินคือการทดสอบสำหรับ AI

คุณคงไม่ส่งมอบโค้ดโดยไม่มีการทดสอบ หลักการเดียวกันนี้ใช้กับตัวแทน LLM — หากไม่มีการประเมิน การเปลี่ยนแปลงทุกครั้งก็ไม่ต่างจากการเสี่ยงโยนเหรียญ

การพัฒนาโดยขับเคลื่อนด้วยการประเมิน (EDD) หมายถึงการเขียนการประเมินก่อน (BEFORE) ที่คุณจะส่งมอบการเปลี่ยนแปลง

วงจร EDD

  1. เขียนการประเมินที่ไม่ผ่าน: ข้อมูลป้อนเข้า + พฤติกรรมที่คาดหวัง
  2. ปรับปรุงตัวแทนจนกว่าการประเมินจะผ่าน
  3. เพิ่มการประเมินลงในชุดการประเมินของคุณ
  4. เรียกใช้ทุกครั้งที่มีการเปลี่ยนแปลง

สิ่งที่ควรประเมิน

สำหรับตัวแทน ให้ประเมินในหลายระดับ:

  • องค์ประกอบ — ตัวดึงข้อมูลส่งคืนส่วนข้อมูลที่ถูกต้องหรือไม่
  • ขั้นตอน — LLM เลือกเครื่องมือที่ถูกต้องหรือไม่
  • ตั้งแต่ต้นจนจบ — ตัวแทนสร้างคำตอบสุดท้ายที่ถูกต้องหรือไม่

ข้อมูลการประเมิน

แต่ละแถวของการประเมินต้องมีอย่างน้อย:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

การผสานรวมอย่างต่อเนื่อง

เรียกใช้การประเมินในทุก PR หากคุณภาพลดลงต่ำกว่าเกณฑ์ ให้บล็อกการผสานรวม:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

ความถี่ของการประเมิน

  • การประเมินองค์ประกอบ — ทุก PR
  • การประเมินตั้งแต่ต้นจนจบ — ทุก PR (สุ่มตัวอย่าง) และทุกคืน (ทั้งหมด)
  • ร่องรอยจากระบบจริง -> ชุดการประเมิน — รายสัปดาห์

กระบวนการจากระบบจริงสู่การประเมิน

ขุดค้นร่องรอยจริง ผลลัพธ์ที่ไม่ดีจะกลายเป็นการประเมินของวันพรุ่งนี้:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

การประเมินด้วย LangSmith / Langfuse

เครื่องมือทั้งสองมีการรองรับการประเมินในตัว ได้แก่ การกำหนดรุ่นชุดข้อมูล ฟังก์ชันการประเมิน และมุมมองสำหรับเปรียบเทียบ

การตรวจสอบแบบสุ่มด้วยตนเอง

การประเมินอัตโนมัติอาจพลาดรูปแบบและรายละเอียดที่ละเอียดอ่อน โปรดอ่านร่องรอยแบบสุ่ม 20 รายการด้วยตนเองเป็นระยะ วิธีนี้จะช่วยพบปัญหาที่การประเมินพลาดไป

รูปแบบที่ควรหลีกเลี่ยง: การจดจำชุดการประเมิน

หากคุณปรับตัวแทนจนผ่านการประเมิน แต่ชุดการประเมินมีขนาดเล็ก นั่นคือการปรับให้เข้ากับข้อมูลมากเกินไป ควรขยายการประเมินอย่างต่อเนื่อง และสลับการแบ่งชุดทดสอบกับชุดฝึก

การดูแลชุดการประเมิน

การประเมินจะเปลี่ยนไปตามผลิตภัณฑ์ของคุณที่เปลี่ยนแปลง เพิ่มกรณีสำหรับความสามารถใหม่ และเลิกใช้กรณีสำหรับความสามารถที่นำออกแล้ว

คำจำกัดความของ EDD

การพัฒนาโดยขับเคลื่อนด้วยการประเมินหมายถึงอะไร

สรุป

การพัฒนาโดยขับเคลื่อนด้วยการประเมินเป็นสิ่งที่ขาดไม่ได้สำหรับตัวแทนที่จริงจัง เขียนการประเมินในทุกระดับ เรียกใช้ในการผสานรวมอย่างต่อเนื่อง และขยายชุดการประเมินจากร่องรอยในระบบจริง

คำถามที่พบบ่อย

บทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน”

เขียนการประเมินก่อนนำเอเจนต์ออกใช้งาน ซึ่งเป็นวิธีเดียวที่จะพัฒนาต่อโดยไม่ทำให้ความสามารถเดิมถดถอย คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
  2. การสร้างชุดทดสอบมาตรฐาน
  3. ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
  4. ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench
← กลับไปที่ AI Agents