ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
ผู้ตัดสินมักมีอคติต่อคำตอบที่ยืดยาว ประเมินผลลัพธ์ของตนเองได้ยาก และต้องปรับเทียบอย่างรอบคอบ
ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
เหตุใดจึงใช้ผู้ตัดสิน LLM
สำหรับผลลัพธ์ปลายเปิด เช่น เรียงความ การตรวจทานโค้ด และคำตอบเชิงสนทนา ไม่มีคำตอบที่ถูกต้องเพียงคำตอบเดียว การจ้างมนุษย์ให้ให้คะแนนผลลัพธ์หลายพันรายการมีค่าใช้จ่ายสูง
การใช้ LLM เป็นผู้ตัดสิน — ใช้โมเดลที่มีความสามารถสูงให้คะแนนผลลัพธ์ — ช่วยเติมเต็มช่องว่างนี้
Basic LLM Judge
judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.
Question: {question}
Answer: {answer}
'''ข้อผิดพลาดที่ 1: อคติจากตำแหน่ง
ผู้ตัดสินมักชอบคำตอบแรก (FIRST) ในการเปรียบเทียบแบบจับคู่ ควรสุ่มลำดับเสมอและเรียกใช้สองครั้ง:
def fair_compare(a, b):
score_ab = compare(a, b)
score_ba = compare(b, a) # swapped
return (score_ab + score_ba) / 2ข้อผิดพลาดที่ 2: อคติจากความยาว
ผู้ตัดสินมักชอบคำตอบที่ยาวกว่า (LONGER) แม้ว่าคำตอบที่สั้นกว่าจะดีกว่า ปรับเทียบด้วยการทำให้เป็นมาตรฐาน หรือสั่งผู้ตัดสินโดยตรง:
judge_prompt = '... Penalize answers that are verbose without adding value ...'ข้อผิดพลาดที่ 3: ความชอบผลงานของตนเอง
โมเดลมักชอบผลลัพธ์ของตนเอง หาก GPT-4 ตัดสินผลงานของตนเอง ก็จะให้คะแนนตัวเองสูงเกินควร ใช้โมเดลคนละตระกูลเป็นผู้ตัดสิน:
- ผลลัพธ์จาก GPT-4 -> ให้ Claude เป็นผู้ตัดสิน
- ผลลัพธ์จาก Claude -> ให้ GPT-4 เป็นผู้ตัดสิน
ข้อผิดพลาดที่ 4: การคล้อยตาม
ผู้ตัดสินมักเห็นด้วยกับความคิดเห็นที่หนักแน่นในคำตอบ "ฉันมั่นใจ 100%..." จะได้คะแนนสูงกว่า "ฉันคิดว่า..." ควรตัดคำที่แสดงความมั่นใจก่อนการตัดสิน
ข้อผิดพลาดที่ 5: คะแนนสูงเกินจริง
ในมาตราส่วน 1-5 ผู้ตัดสินมักกระจุกตัวอยู่ที่ 4 ใช้การให้คะแนนแบบทวิภาค (ถูกต้อง/ไม่ถูกต้อง) เพื่อให้ได้สัญญาณที่ชัดเจนกว่า:
judge_prompt = '... Return PASS or FAIL only ...'ข้อผิดพลาดที่ 6: อคติจากรูปแบบ
คำตอบแบบรายการหัวข้อจะได้คะแนนสูงกว่าร้อยแก้ว ไม่ว่าความถูกต้องจะเป็นอย่างไร โปรดระวังเรื่องนี้ และบางครั้งควรกำหนดรูปแบบเพื่อขจัดตัวแปรดังกล่าว
ปรับเทียบกับมนุษย์
วัดว่าผู้ตัดสินมีความสอดคล้องกับการให้คะแนนของมนุษย์ในกลุ่มตัวอย่างมากเพียงใด:
from scipy.stats import pearsonr
human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this taskใช้การเปรียบเทียบแบบจับคู่เมื่อทำได้
"A ดีกว่า B หรือไม่" น่าเชื่อถือกว่า "ให้คะแนน A ตั้งแต่ 1-5" เมื่อเลือกจากพรอมต์สองแบบ การเปรียบเทียบแบบจับคู่ดีกว่าการให้คะแนนสัมบูรณ์
การตัดสินแบบสายโซ่ความคิด
ให้ผู้ตัดสินให้เหตุผลก่อน:
judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.
Question: {q}
Reference: {r}
Answer: {a}
'''ต้นทุน
การใช้ GPT-4 เป็นผู้ตัดสินทำให้ต้นทุนการประเมินเพิ่มเป็นสองเท่า สำหรับการตรวจสอบตามปกติ ให้ใช้ผู้ตัดสินราคาถูกกว่า เช่น gpt-4o-mini หรือ claude-haiku และเก็บผู้ตัดสินขนาดใหญ่ไว้ใช้กับการเผยแพร่รุ่น
ใช้ร่วมกับกฎ
อย่าพึ่งพาผู้ตัดสินเพียงอย่างเดียว ให้ใช้ร่วมกันดังนี้:
- กฎ ("มี '30 วัน' อยู่ภายใน")
- เกณฑ์ประมาณ (ช่วงความยาว)
- ผู้ตัดสิน LLM สำหรับส่วนปลายเปิด
การปรับเทียบผู้ตัดสิน LLM
คุณจะตรวจสอบได้อย่างไรว่าผู้ตัดสิน LLM ของคุณน่าเชื่อถือ
สรุป
ผู้ตัดสิน LLM มีประโยชน์แต่มีอคติ สุ่มตำแหน่ง ปรับความยาวให้เป็นมาตรฐาน ใช้โมเดลคนละตระกูล ปรับเทียบกับมนุษย์ และใช้ร่วมกับกฎตายตัว
คำถามที่พบบ่อย
บทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน”
ผู้ตัดสินมักมีอคติต่อคำตอบที่ยืดยาว ประเมินผลลัพธ์ของตนเองได้ยาก และต้องปรับเทียบอย่างรอบคอบ คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
- การสร้างชุดทดสอบมาตรฐาน
- ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
- ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench