0Pricing
AI Agents · บทเรียน

ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน

ผู้ตัดสินมักมีอคติต่อคำตอบที่ยืดยาว ประเมินผลลัพธ์ของตนเองได้ยาก และต้องปรับเทียบอย่างรอบคอบ

ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

เหตุใดจึงใช้ผู้ตัดสิน LLM

สำหรับผลลัพธ์ปลายเปิด เช่น เรียงความ การตรวจทานโค้ด และคำตอบเชิงสนทนา ไม่มีคำตอบที่ถูกต้องเพียงคำตอบเดียว การจ้างมนุษย์ให้ให้คะแนนผลลัพธ์หลายพันรายการมีค่าใช้จ่ายสูง

การใช้ LLM เป็นผู้ตัดสิน — ใช้โมเดลที่มีความสามารถสูงให้คะแนนผลลัพธ์ — ช่วยเติมเต็มช่องว่างนี้

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

ข้อผิดพลาดที่ 1: อคติจากตำแหน่ง

ผู้ตัดสินมักชอบคำตอบแรก (FIRST) ในการเปรียบเทียบแบบจับคู่ ควรสุ่มลำดับเสมอและเรียกใช้สองครั้ง:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

ข้อผิดพลาดที่ 2: อคติจากความยาว

ผู้ตัดสินมักชอบคำตอบที่ยาวกว่า (LONGER) แม้ว่าคำตอบที่สั้นกว่าจะดีกว่า ปรับเทียบด้วยการทำให้เป็นมาตรฐาน หรือสั่งผู้ตัดสินโดยตรง:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

ข้อผิดพลาดที่ 3: ความชอบผลงานของตนเอง

โมเดลมักชอบผลลัพธ์ของตนเอง หาก GPT-4 ตัดสินผลงานของตนเอง ก็จะให้คะแนนตัวเองสูงเกินควร ใช้โมเดลคนละตระกูลเป็นผู้ตัดสิน:

  • ผลลัพธ์จาก GPT-4 -> ให้ Claude เป็นผู้ตัดสิน
  • ผลลัพธ์จาก Claude -> ให้ GPT-4 เป็นผู้ตัดสิน

ข้อผิดพลาดที่ 4: การคล้อยตาม

ผู้ตัดสินมักเห็นด้วยกับความคิดเห็นที่หนักแน่นในคำตอบ "ฉันมั่นใจ 100%..." จะได้คะแนนสูงกว่า "ฉันคิดว่า..." ควรตัดคำที่แสดงความมั่นใจก่อนการตัดสิน

ข้อผิดพลาดที่ 5: คะแนนสูงเกินจริง

ในมาตราส่วน 1-5 ผู้ตัดสินมักกระจุกตัวอยู่ที่ 4 ใช้การให้คะแนนแบบทวิภาค (ถูกต้อง/ไม่ถูกต้อง) เพื่อให้ได้สัญญาณที่ชัดเจนกว่า:

judge_prompt = '... Return PASS or FAIL only ...'

ข้อผิดพลาดที่ 6: อคติจากรูปแบบ

คำตอบแบบรายการหัวข้อจะได้คะแนนสูงกว่าร้อยแก้ว ไม่ว่าความถูกต้องจะเป็นอย่างไร โปรดระวังเรื่องนี้ และบางครั้งควรกำหนดรูปแบบเพื่อขจัดตัวแปรดังกล่าว

ปรับเทียบกับมนุษย์

วัดว่าผู้ตัดสินมีความสอดคล้องกับการให้คะแนนของมนุษย์ในกลุ่มตัวอย่างมากเพียงใด:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

ใช้การเปรียบเทียบแบบจับคู่เมื่อทำได้

"A ดีกว่า B หรือไม่" น่าเชื่อถือกว่า "ให้คะแนน A ตั้งแต่ 1-5" เมื่อเลือกจากพรอมต์สองแบบ การเปรียบเทียบแบบจับคู่ดีกว่าการให้คะแนนสัมบูรณ์

การตัดสินแบบสายโซ่ความคิด

ให้ผู้ตัดสินให้เหตุผลก่อน:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

ต้นทุน

การใช้ GPT-4 เป็นผู้ตัดสินทำให้ต้นทุนการประเมินเพิ่มเป็นสองเท่า สำหรับการตรวจสอบตามปกติ ให้ใช้ผู้ตัดสินราคาถูกกว่า เช่น gpt-4o-mini หรือ claude-haiku และเก็บผู้ตัดสินขนาดใหญ่ไว้ใช้กับการเผยแพร่รุ่น

ใช้ร่วมกับกฎ

อย่าพึ่งพาผู้ตัดสินเพียงอย่างเดียว ให้ใช้ร่วมกันดังนี้:

  • กฎ ("มี '30 วัน' อยู่ภายใน")
  • เกณฑ์ประมาณ (ช่วงความยาว)
  • ผู้ตัดสิน LLM สำหรับส่วนปลายเปิด

การปรับเทียบผู้ตัดสิน LLM

คุณจะตรวจสอบได้อย่างไรว่าผู้ตัดสิน LLM ของคุณน่าเชื่อถือ

สรุป

ผู้ตัดสิน LLM มีประโยชน์แต่มีอคติ สุ่มตำแหน่ง ปรับความยาวให้เป็นมาตรฐาน ใช้โมเดลคนละตระกูล ปรับเทียบกับมนุษย์ และใช้ร่วมกับกฎตายตัว

คำถามที่พบบ่อย

บทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน”

ผู้ตัดสินมักมีอคติต่อคำตอบที่ยืดยาว ประเมินผลลัพธ์ของตนเองได้ยาก และต้องปรับเทียบอย่างรอบคอบ คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
  2. การสร้างชุดทดสอบมาตรฐาน
  3. ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
  4. ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench
← กลับไปที่ AI Agents