AI एजेंट · पाठ

स्वर्णिम टेस्ट सेट बनाना

वास्तविक उपयोग के कम-प्रचलित मामलों को समेटने वाले 50–200 उच्च-गुणवत्ता वाले (इनपुट, अपेक्षित आउटपुट) युग्म चुनें।

पाठ 2, कुल 4 में से14 चरण

स्वर्णिम टेस्ट सेट बनाना, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

स्वर्ण-समुच्चय क्या है?

"स्वर्ण परीक्षण-समुच्चय" (या "स्वर्ण-समुच्चय") (इनपुट, अपेक्षित आउटपुट) युग्मों का चुना हुआ संग्रह होता है, जो अच्छे व्यवहार की परिभाषा देता है।

हर बदलाव को इस समुच्चय के आधार पर मापा जाता है।

एक अच्छे स्वर्ण-समुच्चय के गुण

  • विविध — सामान्य AND किनारी मामलों को शामिल करता है
  • मनुष्यों द्वारा चुना गया — स्वचालित रूप से तैयार नहीं किया गया
  • संस्करणित — आपके रिपॉज़िटरी में स्थिर रखा गया
  • दस्तावेज़ीकृत — प्रत्येक मामले का कारण दिया गया है

कितने मामले?

मोटे तौर पर:

  • 50 मामले — न्यूनतम उपयोगी संख्या
  • 200 मामले — अच्छा कवरेज
  • 1000+ मामले — परिपक्व उत्पाद

गुणवत्ता > मात्रा। अच्छी तरह चुने गए 50 मामले 500 यादृच्छिक मामलों से बेहतर होते हैं।

मामलों के स्रोत

  1. उपयोगकर्ता साक्षात्कार — वास्तविक उपयोगकर्ता क्या पूछते हैं
  2. उत्पादन लॉग — आने वाले प्रश्न
  3. बग रिपोर्ट — हर बग एक मूल्यांकन बन जाता है
  4. विरोधात्मक निर्माण — LLM से एजेंट को विफल करने के लिए कहें

Mining Bad Production Traces

for trace in last_week_traces():
    if trace.has_thumbs_down or trace.had_error:
        case = {
            'input': trace.input,
            'why_bad': trace.feedback_comment,
            'expected': None   # to be filled by human reviewer
        }
        save_to_review_queue(case)

अपेक्षित आउटपुट: सटीक बनाम अनुमानाधारित

अपेक्षित आउटपुट के दो प्रकार होते हैं:

  • सटीक मिलान — निष्कर्षण, वर्गीकरण और गणना के लिए
  • अनुमानाधारित — खुले प्रश्न-उत्तर के लिए; जाँचें कि मुख्य तथ्य दिखाई देते हैं या नहीं

Heuristic Scoring

def score_answer(actual, expected_facts):
    return sum(1 for f in expected_facts if f.lower() in actual.lower()) / len(expected_facts)

case = {
    'input': 'What is our refund policy?',
    'expected_facts': ['30 days', 'unopened', 'receipt required'],
    'min_score': 0.66   # at least 2 of 3 facts mentioned
}

actual_answer = "You can return items within 30 days if they are unopened."
score = score_answer(actual_answer, case['expected_facts'])
print(f"Score: {score:.2f} (min required: {case['min_score']})")

विरोधात्मक मामले

कठिन मामले शामिल करें:

  • दायरे से बाहर के प्रश्न ("मंगल ग्रह पर मौसम कैसा है?")
  • अस्पष्ट प्रश्न
  • प्रॉम्प्ट में हेरफेर के प्रयास
  • विदेशी भाषा के इनपुट
  • बहुत लंबे इनपुट

स्वर्ण-समुच्चय का संस्करण-प्रबंधन

इसे अपनी रिपॉज़िटरी में JSON के रूप में रखें। समुच्चय को अपडेट करने वाले हर PR में इसका कारण स्पष्ट होना चाहिए:

// gold-set.json
[
  {
    "id": "refund-policy-001",
    "input": "What is your refund policy?",
    "expected_facts": ["30 days", "unopened", "receipt required"],
    "added_by": "alice@",
    "added_at": "2025-08-12",
    "reason": "Top customer support question"
  }
]

परीक्षण/प्रशिक्षण विभाजन

अत्यधिक अनुकूलन का पता लगाने के लिए इसे इस प्रकार बाँटें:

  • विकास समुच्चय — इसी पर दोहराकर सुधार करें (आप इसे देखते हैं)
  • परीक्षण समुच्चय — इसी पर मापें (आप इसे देखकर अनुकूलन नहीं करते)
  • आरक्षित समुच्चय — केवल बड़े संस्करण जारी करने से पहले उपयोग करें

पैरेटो टैगिंग

मामलों को श्रेणी के अनुसार टैग करें, ताकि आप देख सकें कि WHERE प्रतिगमन हुआ:

tag1 = {'tags': ['policy', 'common-question']}
tag2 = {'tags': ['math', 'edge-case']}
print(tag1)
print(tag2)

# Run eval and report:
print("Category 'policy': 0.92")
print("Category 'math': 0.68   <- regression here")

मूल्यांकन मानदंड

जटिल आउटपुट के लिए एक मानदंड लिखें: क्या मौजूद होना चाहिए, क्या NOT होना चाहिए और क्या बेहतर है:

rubric = {
    'must_include': ['30 days'],
    'must_not_include': ['no refunds'],
    'preferably_includes': ['receipt']
}
for k, v in rubric.items():
    print(f"{k}: {v}")

मामलों का स्रोत

मूल्यांकन मामलों का सबसे विश्वसनीय स्रोत कौन-सा है?

पुनरावलोकन

वास्तविक उपयोगकर्ताओं और उत्पादन की विफलताओं से लिए गए 50+ चुने हुए मामले। इनके संस्करण रखें, टैग करें और विकास/परीक्षण/आरक्षित समुच्चयों में बाँटें। हर बग के साथ इन्हें बढ़ाते रहें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “स्वर्णिम टेस्ट सेट बनाना” पाठ निःशुल्क है?

हाँ—“स्वर्णिम टेस्ट सेट बनाना” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“स्वर्णिम टेस्ट सेट बनाना” में मैं क्या सीखूँगा?

वास्तविक उपयोग के कम-प्रचलित मामलों को समेटने वाले 50–200 उच्च-गुणवत्ता वाले (इनपुट, अपेक्षित आउटपुट) युग्म चुनें। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।

“स्वर्णिम टेस्ट सेट बनाना” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. एजेंटों के लिए मूल्यांकन-आधारित विकास
  2. स्वर्णिम टेस्ट सेट बनाना
  3. LLM-जज की कमियाँ
  4. बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench
← AI एजेंट पर वापस जाएँ