0Pricing
AI Agents · บทเรียน

การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน

ทดสอบ A/B กับโมเดลฐานบนชุดประเมินของคุณ — บางครั้งการปรับแต่งโมเดลให้ผลเสียมากกว่าผลดี

การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

อย่าเชื่อการสูญเสียจากการฝึก

การสูญเสียจากการฝึกที่ต่ำไม่ได้หมายความว่าจะดีขึ้นในระบบจริง โมเดลอาจฟิตเกินไป สูญเสียความสามารถทั่วไป หรือทำให้งานที่ไม่เคยเห็นแย่ลง

ประเมินโมเดลที่ปรับแต่งบนชุดประเมินที่กันไว้ออกจากการฝึกเสมอ

ชุดแบ่งการประเมินที่ต้องมีสามชุด

  1. การฝึก — ใช้ในการปรับแต่ง
  2. การตรวจสอบ — ใช้เลือกจุดตรวจสอบที่ดีที่สุด
  3. การทดสอบ — ไม่เคยถูกใช้ระหว่างการฝึก ใช้ ONLY สำหรับการประเมินขั้นสุดท้าย

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

เฝ้าระวังการลืมอย่างรุนแรง

การปรับแต่งด้วยข้อมูลเฉพาะด้านอาจทำให้โมเดลทำงานแย่ลงกับงาน OTHER ได้ ทดสอบกับชุดประเมินที่ครอบคลุมด้วย ไม่ใช่เฉพาะความเชี่ยวชาญใหม่ของคุณ

การรายงานแยกตามหมวดหมู่

ติดแท็กชุดประเมินของคุณ และรายงานคะแนนแยกตามหมวดหมู่:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

การปรับเทียบ

โมเดลที่ปรับแต่งมักมีความมั่นใจเกินจริง เปรียบเทียบความน่าจะเป็นของความถูกต้องที่โมเดลคาดการณ์กับความถูกต้องจริง และปรับเทียบหากจำเป็น

การเปลี่ยนแปลงของความยาวและสไตล์

โมเดลที่ปรับแต่งจะโน้มเอียงไปตามการกระจายของข้อมูลการฝึก หากข้อมูลการฝึกสั้นกว่า ผลลัพธ์ก็จะสั้นลงเช่นกัน บางครั้งเป็นสิ่งที่ต้องการ แต่บางครั้งก็ไม่ใช่

การทดสอบ A/B ในโลกจริง

นอกเหนือจากการประเมินแบบออฟไลน์ ให้ทดสอบ A/B ในระบบจริงด้วย:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

เปรียบเทียบคุณภาพกับต้นทุน

โมเดลที่ปรับแต่งอาจมีขนาดเล็กกว่าและมีต้นทุนถูกกว่า ต้นทุนรวมเทียบกับคุณภาพ:

  • GPT-4o ฐาน: X ดอลลาร์ต่อการเรียกใช้ คุณภาพ Y
  • Llama 8B ที่ปรับแต่ง (โฮสต์เอง): X/10 ดอลลาร์ต่อการเรียกใช้ คุณภาพ 0.9Y
  • มีแนวโน้มเป็นตัวเลือกที่ชนะ หาก Y ยังคงสูงเพียงพอ

รูปแบบความล้มเหลวที่ซ่อนอยู่

ลองใช้อินพุตที่ออกแบบมาเพื่อโจมตี:

  • พรอมต์ที่พยายามหลบเลี่ยงกลไกป้องกัน
  • อินพุตนอกการกระจายของข้อมูล
  • พรอมต์กรณีขอบ

บางครั้งการปรับแต่งทำให้ความปลอดภัยอ่อนแอลง ควรตรวจสอบก่อนนำไปใช้งานจริง

ข้อควรระวังเกี่ยวกับ LLM ในฐานะผู้ตัดสิน

หากใช้ LLM เป็นผู้ตัดสิน ให้ใช้ตระกูลโมเดลที่ DIFFERENT จากโมเดลที่ปรับแต่ง มิฉะนั้นผู้ตัดสินจะให้คะแนนสูงอย่างมีอคติ

เมื่อใดควรปรับปรุงชุดข้อมูล

หากการประเมินแสดงว่าหมวดหมู่ใดหมวดหมู่หนึ่งถดถอย:

  1. ค้นหาตัวอย่างที่คล้ายกันในร่องรอยจากระบบจริง
  2. เพิ่มตัวอย่างเหล่านั้นลงในชุดฝึก
  3. ฝึกใหม่
  4. ประเมินใหม่

ย้อนกลับได้ ไม่เป็นไร

หากการปรับแต่งให้ผลแย่ลง ให้ทิ้งแล้วลองใหม่ ต้นทุนจมไม่ใช่เหตุผลที่จะนำโมเดลที่แย่กว่าไปใช้งานจริง

การลืมอย่างรุนแรง

การลืมอย่างรุนแรงในการปรับแต่งคืออะไร

สรุปทบทวน

ประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐานบนชุดข้อมูลอ้างอิงของ YOUR เฝ้าดูการถดถอยแยกตามหมวดหมู่ ทดสอบ A/B ในระบบจริง และย้อนกลับหากผลลัพธ์แย่ลง หากชนะเพียงบางส่วนให้ปรับปรุงชุดข้อมูลต่อ

คำถามที่พบบ่อย

บทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน”

ทดสอบ A/B กับโมเดลฐานบนชุดประเมินของคุณ — บางครั้งการปรับแต่งโมเดลให้ผลเสียมากกว่าผลดี คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เมื่อการปรับแต่งโมเดลดีกว่าการเขียนคำสั่ง
  2. การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ
  3. LoRA และ QLoRA เพื่อการปรับแต่งที่ประหยัดค่าใช้จ่าย
  4. การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน
← กลับไปที่ AI Agents