การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน
ทดสอบ A/B กับโมเดลฐานบนชุดประเมินของคุณ — บางครั้งการปรับแต่งโมเดลให้ผลเสียมากกว่าผลดี
การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
อย่าเชื่อการสูญเสียจากการฝึก
การสูญเสียจากการฝึกที่ต่ำไม่ได้หมายความว่าจะดีขึ้นในระบบจริง โมเดลอาจฟิตเกินไป สูญเสียความสามารถทั่วไป หรือทำให้งานที่ไม่เคยเห็นแย่ลง
ประเมินโมเดลที่ปรับแต่งบนชุดประเมินที่กันไว้ออกจากการฝึกเสมอ
ชุดแบ่งการประเมินที่ต้องมีสามชุด
- การฝึก — ใช้ในการปรับแต่ง
- การตรวจสอบ — ใช้เลือกจุดตรวจสอบที่ดีที่สุด
- การทดสอบ — ไม่เคยถูกใช้ระหว่างการฝึก ใช้ ONLY สำหรับการประเมินขั้นสุดท้าย
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')เฝ้าระวังการลืมอย่างรุนแรง
การปรับแต่งด้วยข้อมูลเฉพาะด้านอาจทำให้โมเดลทำงานแย่ลงกับงาน OTHER ได้ ทดสอบกับชุดประเมินที่ครอบคลุมด้วย ไม่ใช่เฉพาะความเชี่ยวชาญใหม่ของคุณ
การรายงานแยกตามหมวดหมู่
ติดแท็กชุดประเมินของคุณ และรายงานคะแนนแยกตามหมวดหมู่:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)การปรับเทียบ
โมเดลที่ปรับแต่งมักมีความมั่นใจเกินจริง เปรียบเทียบความน่าจะเป็นของความถูกต้องที่โมเดลคาดการณ์กับความถูกต้องจริง และปรับเทียบหากจำเป็น
การเปลี่ยนแปลงของความยาวและสไตล์
โมเดลที่ปรับแต่งจะโน้มเอียงไปตามการกระจายของข้อมูลการฝึก หากข้อมูลการฝึกสั้นกว่า ผลลัพธ์ก็จะสั้นลงเช่นกัน บางครั้งเป็นสิ่งที่ต้องการ แต่บางครั้งก็ไม่ใช่
การทดสอบ A/B ในโลกจริง
นอกเหนือจากการประเมินแบบออฟไลน์ ให้ทดสอบ A/B ในระบบจริงด้วย:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)เปรียบเทียบคุณภาพกับต้นทุน
โมเดลที่ปรับแต่งอาจมีขนาดเล็กกว่าและมีต้นทุนถูกกว่า ต้นทุนรวมเทียบกับคุณภาพ:
- GPT-4o ฐาน: X ดอลลาร์ต่อการเรียกใช้ คุณภาพ Y
- Llama 8B ที่ปรับแต่ง (โฮสต์เอง): X/10 ดอลลาร์ต่อการเรียกใช้ คุณภาพ 0.9Y
- มีแนวโน้มเป็นตัวเลือกที่ชนะ หาก Y ยังคงสูงเพียงพอ
รูปแบบความล้มเหลวที่ซ่อนอยู่
ลองใช้อินพุตที่ออกแบบมาเพื่อโจมตี:
- พรอมต์ที่พยายามหลบเลี่ยงกลไกป้องกัน
- อินพุตนอกการกระจายของข้อมูล
- พรอมต์กรณีขอบ
บางครั้งการปรับแต่งทำให้ความปลอดภัยอ่อนแอลง ควรตรวจสอบก่อนนำไปใช้งานจริง
ข้อควรระวังเกี่ยวกับ LLM ในฐานะผู้ตัดสิน
หากใช้ LLM เป็นผู้ตัดสิน ให้ใช้ตระกูลโมเดลที่ DIFFERENT จากโมเดลที่ปรับแต่ง มิฉะนั้นผู้ตัดสินจะให้คะแนนสูงอย่างมีอคติ
เมื่อใดควรปรับปรุงชุดข้อมูล
หากการประเมินแสดงว่าหมวดหมู่ใดหมวดหมู่หนึ่งถดถอย:
- ค้นหาตัวอย่างที่คล้ายกันในร่องรอยจากระบบจริง
- เพิ่มตัวอย่างเหล่านั้นลงในชุดฝึก
- ฝึกใหม่
- ประเมินใหม่
ย้อนกลับได้ ไม่เป็นไร
หากการปรับแต่งให้ผลแย่ลง ให้ทิ้งแล้วลองใหม่ ต้นทุนจมไม่ใช่เหตุผลที่จะนำโมเดลที่แย่กว่าไปใช้งานจริง
การลืมอย่างรุนแรง
การลืมอย่างรุนแรงในการปรับแต่งคืออะไร
สรุปทบทวน
ประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐานบนชุดข้อมูลอ้างอิงของ YOUR เฝ้าดูการถดถอยแยกตามหมวดหมู่ ทดสอบ A/B ในระบบจริง และย้อนกลับหากผลลัพธ์แย่ลง หากชนะเพียงบางส่วนให้ปรับปรุงชุดข้อมูลต่อ
คำถามที่พบบ่อย
บทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน”
ทดสอบ A/B กับโมเดลฐานบนชุดประเมินของคุณ — บางครั้งการปรับแต่งโมเดลให้ผลเสียมากกว่าผลดี คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน
บทเรียน “การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- เมื่อการปรับแต่งโมเดลดีกว่าการเขียนคำสั่ง
- การรวบรวมข้อมูล: เส้นทางการทำงานและการเล่นร่องรอยซ้ำ
- LoRA และ QLoRA เพื่อการปรับแต่งที่ประหยัดค่าใช้จ่าย
- การประเมินโมเดลที่ปรับแต่งเทียบกับโมเดลฐาน