उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) · पाठ

मूल्यांकन मानदंड विकसित करना

विभिन्न RAG विन्यासों और सुधारों का व्यवस्थित परीक्षण और तुलना करने के लिए कस्टम डेटासेट और मानदंड तैयार कीजिए।

पाठ 2, कुल 4 में से11 चरण

मूल्यांकन मानदंड विकसित करना, CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

RAG मानक क्यों महत्वपूर्ण हैं

स्वागत है! इस पाठ में हम आपकी RAG प्रणालियों के लिए कस्टम मूल्यांकन मानक बनाना सीखेंगे। मानक कस्टम परीक्षण-समूहों की तरह होते हैं, जो आपकी RAG अनुप्रयोग के प्रदर्शन को मापने में मदद करते हैं।

वे सुधारों और प्रदर्शन में गिरावट को समझने तथा यह सुनिश्चित करने के लिए महत्वपूर्ण हैं कि आपकी RAG प्रणाली उपयोगकर्ताओं को सटीक और प्रासंगिक जानकारी दे।

कस्टम मानक: इसकी आवश्यकता क्यों है

हालाँकि SQuAD या HotpotQA जैसे सार्वजनिक डेटासेट सामान्य LLM मूल्यांकन के लिए अच्छे हैं, वे अक्सर आपके विशिष्ट उपयोग-प्रकरण या क्षेत्र को नहीं दर्शाते।

  • क्षेत्र-विशिष्टता: आपकी RAG प्रणाली को आपके डेटा से जुड़े प्रश्नों के उत्तर देने होंगे।
  • बारीकी और जटिलता: सार्वजनिक डेटासेट आपके उपयोगकर्ताओं के सामने आने वाली विशिष्ट चुनौतियों को शायद शामिल न करें।
  • निरंतर सुधार: कस्टम मानक आपको अपनी बदलती हुई आवश्यकताओं के आधार पर प्रदर्शन पर नज़र रखने देते हैं।

RAG मानक की विशेषताएँ क्या हैं?

एक मजबूत RAG मूल्यांकन बेंचमार्क में आमतौर पर कुछ प्रमुख भाग होते हैं:

  • प्रश्नों का सेट: प्रतिनिधि प्रश्नों या निर्देशों का संग्रह।
  • सत्यापित उत्तर: प्रत्येक प्रश्न के लिए "सही" उत्तर या प्रासंगिक दस्तावेज़।
  • मूल्यांकन मापदंड: प्रदर्शन मापने के लिए उपयोग किए जाने वाले मानदंड (जैसे, सटीकता और प्रासंगिकता)।

इस पाठ में हम पहले दो घटकों पर ध्यान केंद्रित करेंगे।

एक उत्कृष्ट प्रश्नों का सेट बनाना

आपके प्रश्नों के सेट में उन प्रश्नों के प्रकार प्रतिबिंबित होने चाहिए जो वास्तविक उपयोगकर्ता पूछेंगे। इन बातों पर विचार कीजिए:

  • वास्तविक उपयोगकर्ता डेटा: वास्तविक उपयोगकर्ता प्रश्नों या आम सहायता अनुरोधों का विश्लेषण कीजिए।
  • विविध विषय: अपने RAG के ज्ञान-आधार से संबंधित विषयों की विस्तृत श्रेणी शामिल कीजिए।
  • अलग-अलग कठिनाई: सरल, जटिल और यहां तक कि अस्पष्ट प्रश्न भी शामिल कीजिए।
  • विशेष परिस्थितियां: उन प्रश्नों को न भूलें जो आपके सिस्टम के लिए चुनौतीपूर्ण हो सकते हैं।

उदाहरण: प्रश्न बनाना

आप प्रश्नों को स्वयं तैयार करके या अपने दस्तावेज़ों के आधार पर उन्हें बनाने के लिए LLM का उपयोग करके शुरुआत कर सकते हैं। प्रश्नों के सेट की संरचना का एक सरल Python उदाहरण यहां दिया गया है:

queries = [
  "What are the benefits of cloud computing?",
  "Explain the capital gains tax in detail.",
  "How do I reset my account password?",
  "What is the company's policy on remote work?",
  "List common cybersecurity threats."
]

for q in queries:
  print(f"Query: {q}")

सत्यापित उत्तर निर्धारित करना

सत्यापित उत्तर वह आदर्श मानक है जिसके आधार पर आपके RAG के आउटपुट को मापा जाता है। RAG के लिए इसका अक्सर अर्थ होता है:

  • प्रासंगिक दस्तावेज़: किसी दिए गए प्रश्न के लिए कौन से विशिष्ट दस्तावेज़ प्राप्त किए जाने चाहिए?
  • सही उत्तर: उन दस्तावेज़ों के आधार पर आदर्श उत्तर क्या है?

सटीकता सुनिश्चित करने के लिए इस चरण में अक्सर मानव विशेषज्ञता की आवश्यकता होती है।

सत्यापित उत्तर को व्यवस्थित करना

सत्यापित उत्तर को व्यवस्थित तरीके से संग्रहीत किया जा सकता है, जिसमें प्रश्नों को उनके अपेक्षित प्रासंगिक संदर्भ और उत्तरों से जोड़ा जाता है। इससे स्वचालित मूल्यांकन संभव होता है।

ground_truth = {
  "What are the benefits of cloud computing?": {
    "relevant_docs": ["doc_cloud_intro.txt", "doc_cloud_benefits.pdf"],
    "answer": "Scalability, cost savings, flexibility, and reliability."
  },
  "How do I reset my account password?": {
    "relevant_docs": ["doc_password_reset_guide.html"],
    "answer": "Go to settings, click 'Forgot Password', and follow the prompts."
  }
}

for query, gt in ground_truth.items():
  print(f"Query: {query}")
  print(f"  Expected Docs: {gt['relevant_docs']}")
  print(f"  Expected Answer: {gt['answer']}\n")

मानवीय योगदान: व्याख्या

उच्च गुणवत्ता वाला सत्यापित उत्तर तैयार करने में अक्सर मानव व्याख्या शामिल होती है। इसका अर्थ है:

  • विशेषज्ञ समीक्षा: विषय-विशेषज्ञ प्रासंगिक दस्तावेज़ पहचानते हैं और आदर्श उत्तर तैयार करते हैं।
  • सामूहिक योगदान: बड़े डेटा-समुच्चयों के लिए मंचों का उपयोग किया जा सकता है, लेकिन गुणवत्ता नियंत्रण अत्यंत महत्वपूर्ण है।
  • एकरूपता: व्याख्याकारों द्वारा डेटा को एक समान तरीके से चिह्नित किया जाए, यह सुनिश्चित करने के लिए स्पष्ट दिशानिर्देश आवश्यक हैं।

इससे यह सुनिश्चित होता है कि आपका बेंचमार्क "सही होने" को सटीक रूप से दर्शाता है।

बेंचमार्क विकसित होते रहते हैं

आपका RAG सिस्टम और उसका डेटा समय के साथ बदलेंगे, इसलिए आपके बेंचमार्क भी बदलने चाहिए! अपने मूल्यांकन बेंचमार्क को लगातार विकसित होने वाली संपत्ति मानिए:

  • नए प्रश्न जोड़िए: उपयोगकर्ताओं के नए प्रश्न या उभरते हुए विषय शामिल कीजिए।
  • सत्यापित उत्तर अपडेट कीजिए: जैसे-जैसे आपका ज्ञान-आधार बढ़ता है, अपेक्षित उत्तरों को अपडेट कीजिए।
  • पुराना डेटा हटाइए: ऐसी पुरानी जानकारी हटाइए जो अब प्रासंगिक नहीं है।

नियमित समीक्षा आपके बेंचमार्क को प्रभावी बनाए रखती है।

बेंचमार्क की आवश्यक बातें

निम्नलिखित में से कौन से एक मजबूत RAG मूल्यांकन बेंचमार्क के आवश्यक घटक हैं?

पुनरावलोकन: बेंचमार्क बनाना

बहुत अच्छा! आपने अपने RAG सिस्टम के लिए कस्टम मूल्यांकन बेंचमार्क विकसित करना सीखा है। हमने इन विषयों को शामिल किया:

  • कस्टम और डोमेन-विशिष्ट बेंचमार्क का महत्व।
  • मुख्य घटक: प्रश्नों के सेट और सत्यापित उत्तर।
  • प्रतिनिधि प्रश्न तैयार करने और सटीक सत्यापित उत्तर निर्धारित करने की रणनीतियां।
  • मानव व्याख्या और क्रमिक सुधार की भूमिका।

अगले चरण में हम जानेंगे कि RAG के प्रदर्शन का मूल्यांकन करने के लिए इन बेंचमार्क से प्रमुख मापदंडों का उपयोग कैसे किया जाता है!

शुरुआत निःशुल्क

एआई शिक्षक के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
12
पाठ
48

अक्सर पूछे जाने वाले प्रश्न

क्या “मूल्यांकन मानदंड विकसित करना” पाठ निःशुल्क है?

हाँ—“मूल्यांकन मानदंड विकसित करना” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“मूल्यांकन मानदंड विकसित करना” में मैं क्या सीखूँगा?

विभिन्न RAG विन्यासों और सुधारों का व्यवस्थित परीक्षण और तुलना करने के लिए कस्टम डेटासेट और मानदंड तैयार कीजिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।

“मूल्यांकन मानदंड विकसित करना” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. RAG प्रदर्शन के प्रमुख मापदंड
  2. मूल्यांकन मानदंड विकसित करना
  3. A/B परीक्षण और उपयोगकर्ता प्रतिक्रिया चक्र
  4. हैलुसिनेशन का पता लगाना और मापना
← उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पर वापस जाएँ