उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) · पाठ

मेटाडेटा प्रबंधन और फ़िल्टरिंग

अपने RAG सिस्टम में अधिक सटीक फ़िल्टरिंग और लक्षित रिट्रीवल के लिए दस्तावेज़ मेटाडेटा निकालना और उसका उपयोग करना सीखिए।

पाठ 3, कुल 4 में से11 चरण

मेटाडेटा प्रबंधन और फ़िल्टरिंग, CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

मेटाडेटा से RAG को बेहतर बनाना

Retrieval Augmented Generation (RAG) प्रणालियाँ बनाते समय बात केवल स्वयं पाठ की सामग्री तक सीमित नहीं होती। सामग्री के बारे में जानकारी, जिसे मेटाडेटा कहा जाता है, अत्यंत शक्तिशाली होती है।

मेटाडेटा हमें ठीक वही खोजने में मदद करता है जिसकी आवश्यकता है, जिससे हमारी RAG प्रतिक्रियाएँ अधिक सटीक और उपयोगकर्ता के उद्देश्य के अनुरूप बनती हैं।

दस्तावेज़ मेटाडेटा को समझना

मेटाडेटा वह डेटा है जो अन्य डेटा के बारे में जानकारी प्रदान करता है। RAG के लिए, यह आपके दस्तावेज़ों या उनसे बनाए गए छोटे पाठ-खंडों से जुड़ी वर्णनात्मक जानकारी होती है।

  • स्रोत: यह दस्तावेज़ कहाँ से आया (जैसे, "आंतरिक-विकी", "समाचार-फ़ीड")?
  • तिथि: इसे कब बनाया गया या पिछली बार कब अद्यतन किया गया?
  • लेखक: इसे किसने लिखा?
  • विषय/श्रेणी: इसमें किस विषय को शामिल किया गया है?
  • सुरक्षा स्तर: क्या यह सार्वजनिक, गोपनीय या आंतरिक है?

मेटाडेटा पुनर्प्राप्ति को कैसे बेहतर बनाता है

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में खोज कर रहे हैं। केवल सभी पुस्तकों में कीवर्ड खोजने के बजाय, आप शायद "2020 के बाद प्रकाशित पुस्तकें" या "विज्ञान-कथा शैली में लेखक X की पुस्तकें" खोजना चाहेंगे।

मेटाडेटा फ़िल्टरिंग आपकी RAG प्रणाली को यही काम करने देती है। यह Large Language Model (LLM) के उन्हें देखने से पहले खोज के दायरे को केवल सबसे प्रासंगिक दस्तावेज़ों तक सीमित कर देती है, जिससे सटीकता और कार्यक्षमता बेहतर होती है।

डेटा अंतर्ग्रहण के दौरान मेटाडेटा निकालना

मेटाडेटा अक्सर आपके दस्तावेज़ों के साथ स्वाभाविक रूप से उपलब्ध होता है। उदाहरण के लिए, PDF में लेखक और निर्माण तिथि हो सकती है। वेब पृष्ठों में URL और प्रकाशन तिथियाँ होती हैं।

आप डेटा अंतर्ग्रहण चरण के दौरान यह जानकारी स्वचालित रूप से निकाल सकते हैं। कभी-कभी आप सामग्री के आधार पर नया मेटाडेटा भी बना सकते हैं (जैसे, किसी LLM का उपयोग करके उसके विषय का वर्गीकरण करना)।

वेक्टर के साथ मेटाडेटा संग्रहीत करना

जब आप अपने दस्तावेज़ों को खंडों में बाँटकर वेक्टर एम्बेडिंग (संख्यात्मक निरूपण) बनाते हैं, तो आप इन वेक्टरों को वेक्टर डेटाबेस में संग्रहीत करते हैं।

महत्वपूर्ण बात यह है कि वेक्टर डेटाबेस आपको संबंधित मेटाडेटा को प्रत्येक वेक्टर के साथ ही संग्रहीत करने की सुविधा भी देते हैं। अर्थगत खोज को सटीक फ़िल्टरिंग के साथ जोड़ने के लिए यह संबंध अत्यंत महत्वपूर्ण है।

कोड: सरल मेटाडेटा निष्कर्षण

यहाँ Python का एक बुनियादी उदाहरण दिया गया है, जो दिखाता है कि किसी दस्तावेज़ का प्रतिनिधित्व करने वाले शब्दकोश से सरल मेटाडेटा कैसे निकाला जा सकता है।

वास्तविक RAG प्रणाली में यह आपके डेटा लोड करने और पूर्वप्रसंस्करण की डेटा-प्रवाह प्रक्रिया के एक भाग के रूप में होगा।

def extract_metadata(doc_content):
    # Simulate extracting from a document object
    # In a real-world scenario, you'd parse
    # PDFs, HTML, etc., to get this info.
    metadata = {
        "source": doc_content.get("source", "unknown"),
        "author": doc_content.get("author", "anonymous"),
        "length_chars": len(doc_content.get("text", ""))
    }
    return metadata

if __name__ == "__main__":
    document_data = {
        "text": "This is a report about Q3 earnings.",
        "source": "Financial Reports",
        "author": "Jane Doe",
        "date": "2023-10-26"
    }
    meta = extract_metadata(document_data)
    print(f"Extracted Metadata: {meta}")

फ़िल्टरिंग के लिए मेटाडेटा का उपयोग करना

आपकी RAG डेटा-प्रवाह प्रक्रिया में मेटाडेटा फ़िल्टरिंग दो मुख्य तरीकों से की जा सकती है:

  • पूर्व-फ़िल्टरिंग: वेक्टर समानता खोज करने से *पहले* दस्तावेज़ों को फ़िल्टर करना। इससे खोज का दायरा घटता है, जिससे प्रक्रिया तेज़ और अधिक प्रासंगिक बनती है।
  • पश्च-फ़िल्टरिंग: व्यापक वेक्टर खोज करना, फिर मेटाडेटा के आधार पर *परिणामों* को फ़िल्टर करना। यह तब उपयोगी है जब आपको पहले व्यापक दायरे में खोज करनी हो और उसके बाद चुने हुए परिणाम चाहिए हों।

कोड: फ़िल्टर के साथ पूछताछ करना

यह संकल्पनात्मक Python कोड दिखाता है कि वेक्टर डेटाबेस की पूछताछ में मेटाडेटा फ़िल्टर कैसे शामिल किए जा सकते हैं। `filters` शब्दकोश शर्तें बताता है, जैसे 'source' का 'HR Policy' के बराबर होना।

वेक्टर डेटाबेस सटीक परिणाम लौटाने के लिए अर्थगत खोज (via `query_vector`) को इन मेटाडेटा शर्तों के साथ जोड़ता है।

# Simulate a vector database client
class VectorDBClient:
    def query(self, query_vector, top_k, filters=None):
        print(f"Searching for top {top_k} vectors...")
        if filters:
            print(f"Applying metadata filters: {filters}")
        # In a real DB, this combines semantic search
        # with metadata conditions to retrieve documents.
        return ["doc_id_1", "doc_id_2"] # Simulated results

if __name__ == "__main__":
    db_client = VectorDBClient()
    user_query_vector = [0.1, 0.2, 0.3] # Placeholder embedding

    # Example: Find documents from 'HR Policy' source
    # and published after a certain date.
    search_filters = {
        "source": {"$eq": "HR Policy"},
        "date": {"$gt": "2023-01-01"}
    }

    results = db_client.query(
        query_vector=user_query_vector,
        top_k=5,
        filters=search_filters
    )
    print(f"Retrieved documents: {results}")

मेटाडेटा फ़िल्टरिंग के लाभ

मेटाडेटा फ़िल्टरिंग का प्रभावी ढंग से उपयोग करने पर आपकी RAG प्रणाली को कई महत्वपूर्ण लाभ मिलते हैं:

  • अधिक प्रासंगिकता: यह सुनिश्चित करता है कि LLM के संदर्भ के लिए केवल वास्तव में प्रासंगिक दस्तावेज़ों पर विचार किया जाए।
  • कम मनगढ़ंत जानकारी: LLM अधिक केंद्रित और सटीक संदर्भ के साथ काम करता है, जिससे गढ़े हुए उत्तर कम होते हैं।
  • लागत-कुशलता: LLM कम अप्रासंगिक डेटा संसाधित करता है, जिससे API लागत घटती है।
  • बेहतर नियंत्रण: पहुँच नियंत्रण लागू करें (जैसे, "आंतरिक दस्तावेज़ केवल अधिकृत उपयोगकर्ताओं को दिखाएँ")।

मेटाडेटा पर त्वरित जाँच

आप किसी कंपनी के आंतरिक ज्ञान-आधार के लिए RAG प्रणाली बना रहे हैं। कोई उपयोगकर्ता प्रश्न पूछता है और आप सुनिश्चित करना चाहते हैं कि LLM केवल "सार्वजनिक" के रूप में चिह्नित तथा पिछले वर्ष के भीतर प्रकाशित दस्तावेज़ों की जानकारी का उपयोग करे।

मेटाडेटा किस तरह इस लक्ष्य को प्राप्त करने में मदद करता है, इसे कौन-सा तरीका सबसे अच्छी तरह बताता है?

पुनरावलोकन: मेटाडेटा में निपुणता

बधाई हो! आपने सीखा कि मेटाडेटा आपकी RAG प्रणाली को बेहतर बनाने के लिए एक शक्तिशाली साधन की तरह काम करता है।

  • मेटाडेटा आपके डेटा के बारे में महत्वपूर्ण वर्णनात्मक संदर्भ प्रदान करता है।
  • यह वेक्टर खोज से पहले या बाद में सटीक फ़िल्टरिंग की सुविधा देता है।
  • प्रभावी फ़िल्टरिंग के लिए अपने डेटाबेस में वेक्टरों के साथ मेटाडेटा संग्रहीत करना महत्वपूर्ण है।
  • प्रभावी मेटाडेटा प्रबंधन से अधिक प्रासंगिक, कुशल और नियंत्रित RAG प्रतिक्रियाएँ मिलती हैं।

अब इन उन्नत RAG प्रणालियों के प्रदर्शन को बेहतर बनाने के लिए उनका मूल्यांकन और परीक्षण करना सीखें!

शुरुआत निःशुल्क

एआई शिक्षक के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
12
पाठ
48

अक्सर पूछे जाने वाले प्रश्न

क्या “मेटाडेटा प्रबंधन और फ़िल्टरिंग” पाठ निःशुल्क है?

हाँ—“मेटाडेटा प्रबंधन और फ़िल्टरिंग” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“मेटाडेटा प्रबंधन और फ़िल्टरिंग” में मैं क्या सीखूँगा?

अपने RAG सिस्टम में अधिक सटीक फ़िल्टरिंग और लक्षित रिट्रीवल के लिए दस्तावेज़ मेटाडेटा निकालना और उसका उपयोग करना सीखिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“मेटाडेटा प्रबंधन और फ़िल्टरिंग” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. विविध दस्तावेज़ प्रारूप लोड करना
  2. संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ
  3. मेटाडेटा प्रबंधन और फ़िल्टरिंग
  4. स्रोत डेटा की सफ़ाई और डुप्लिकेट हटाना
← उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पर वापस जाएँ