AI एजेंट · पाठ

LLM-जज की कमियाँ

जज विस्तृत उत्तरों के पक्ष में पक्षपाती होते हैं, अपने ही आउटपुट का मूल्यांकन करने में कठिनाई होती है और उन्हें सावधानीपूर्वक कैलिब्रेशन चाहिए।

पाठ 3, कुल 4 में से15 चरण

LLM-जज की कमियाँ, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

LLM निर्णायकों का उपयोग क्यों करें?

खुले-समाप्ति वाले आउटपुट (निबंध, कोड समीक्षा और बातचीत के उत्तर) के लिए कोई एक सही उत्तर नहीं होता। हज़ारों आउटपुट को अंक देने के लिए मनुष्यों को नियुक्त करना महँगा होता है।

निर्णायक के रूप में LLM — आउटपुट को अंक देने के लिए शक्तिशाली मॉडल का उपयोग — इस कमी को पूरा करता है।

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

कमी 1: स्थान का पक्षपात

निर्णायक युग्म-तुलना में FIRST उत्तर को प्राथमिकता देते हैं। क्रम को हमेशा यादृच्छिक करें और दो बार run करें:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

कमी 2: लंबाई का पक्षपात

निर्णायक LONGER उत्तरों को प्राथमिकता देते हैं, भले ही छोटे उत्तर बेहतर हों। सामान्यीकरण करके या निर्णायक को निर्देश देकर अंशांकन करें:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

कमी 3: स्वयं को प्राथमिकता देना

मॉडल अपने आउटपुट को प्राथमिकता देते हैं। यदि GPT-4 अपने ही काम का निर्णायक हो, तो वह खुद को उचित से अधिक अंक देगा। निर्णायक के लिए किसी अलग मॉडल परिवार का उपयोग करें:

  • GPT-4 के आउटपुट -> Claude द्वारा मूल्यांकन
  • Claude के आउटपुट -> GPT-4 द्वारा मूल्यांकन

कमी 4: चापलूसी-प्रवृत्ति

निर्णायक उत्तर में व्यक्त प्रबल राय से सहमत हो जाते हैं। "मैं 100% निश्चित हूँ..." को "मुझे लगता है..." से अधिक अंक मिलते हैं। मूल्यांकन से पहले आत्मविश्वास दर्शाने वाले शब्द हटा दें।

कमी 5: अंकों में बढ़ोतरी

1-5 के पैमाने पर निर्णायक अक्सर 4 के आसपास अंक देते हैं। अधिक स्पष्ट संकेत के लिए द्विआधारी अंक-निर्धारण (सही/गलत) का उपयोग करें:

judge_prompt = '... Return PASS or FAIL only ...'

कमी 6: प्रारूप का पक्षपात

सही होने की परवाह किए बिना, बुलेट-सूची वाले उत्तरों को गद्य की तुलना में अधिक अंक मिलते हैं। इस बात का ध्यान रखें; कभी-कभी इस चर को हटाने के लिए प्रारूप अनिवार्य कर दें।

मनुष्यों के विरुद्ध अंशांकन करें

किसी नमूने पर जाँचें कि निर्णायक के अंक मानव अंकों से कितने अच्छी तरह मेल खाते हैं:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

संभव हो तो युग्म-तुलना का उपयोग करें

"क्या A, B से बेहतर है?" की विश्वसनीयता "A को 1-5 अंक दें" से अधिक होती है। दो प्रॉम्प्ट में से चुनते समय, युग्म-तुलना > निरपेक्ष अंक-निर्धारण।

विचार-श्रृंखला के आधार पर निर्णय

पहले निर्णायक से तर्क करने को कहें:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

लागत

GPT-4 से निर्णय लेने पर मूल्यांकन की लागत दोगुनी हो जाती है। नियमित जाँच के लिए सस्ते निर्णायकों (gpt-4o-mini या claude-haiku) का उपयोग करें और बड़े निर्णायकों को संस्करण जारी करने के लिए बचाकर रखें।

नियमों के साथ संयोजन करें

केवल निर्णायक पर निर्भर न रहें। इनका संयोजन करें:

  • नियम ("इसमें '30 दिन' शामिल है")
  • अनुमानाधारित जाँच (लंबाई की सीमा)
  • खुले-समाप्ति वाले हिस्से के लिए LLM निर्णायक

LLM निर्णायक का अंशांकन

आप कैसे जाँचेंगे कि आपका LLM निर्णायक विश्वसनीय है?

पुनरावलोकन

LLM निर्णायक उपयोगी होते हैं, लेकिन उनमें पक्षपात होता है। स्थानों को यादृच्छिक करें, लंबाई को सामान्यीकृत करें, अलग-अलग मॉडल परिवारों का उपयोग करें, मनुष्यों के विरुद्ध अंशांकन करें और कठोर नियमों के साथ इनका संयोजन करें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “LLM-जज की कमियाँ” पाठ निःशुल्क है?

हाँ—“LLM-जज की कमियाँ” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“LLM-जज की कमियाँ” में मैं क्या सीखूँगा?

जज विस्तृत उत्तरों के पक्ष में पक्षपाती होते हैं, अपने ही आउटपुट का मूल्यांकन करने में कठिनाई होती है और उन्हें सावधानीपूर्वक कैलिब्रेशन चाहिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“LLM-जज की कमियाँ” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. एजेंटों के लिए मूल्यांकन-आधारित विकास
  2. स्वर्णिम टेस्ट सेट बनाना
  3. LLM-जज की कमियाँ
  4. बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench
← AI एजेंट पर वापस जाएँ