LangChain / RAG / वेक्टर डेटाबेस · पाठ

डेटा गोपनीयता और PII प्रबंधन

अपने RAG पाइपलाइन में व्यक्तिगत पहचान योग्य जानकारी (PII) और संवेदनशील डेटा को सुरक्षित रूप से प्रबंधित करना समझें।

पाठ 1, कुल 4 में से12 चरण

डेटा गोपनीयता और PII प्रबंधन, CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह LangChain / RAG / वेक्टर डेटाबेस सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

PII और RAG: मूल बातें

RAG प्रणालियों में डेटा गोपनीयता और व्यक्तिगत पहचान योग्य जानकारी (PII) के प्रबंधन पर इस पाठ में आपका स्वागत है।

PII ऐसे किसी भी डेटा को कहते हैं जिसका उपयोग किसी विशिष्ट व्यक्ति की पहचान करने के लिए किया जा सकता है। इसमें नाम, ईमेल पते, फ़ोन नंबर, सामाजिक सुरक्षा नंबर और यहाँ तक कि IP पते भी शामिल हैं।

RAG में PII क्यों महत्वपूर्ण है?

Retrieval Augmented Generation (RAG) प्रणालियों में आप अक्सर बहुत बड़ी मात्रा में विविध डेटा से निपटते हैं। इस डेटा में संवेदनशील PII आसानी से शामिल हो सकती है।

यदि इसे सही तरीके से संभाला न जाए, तो आपकी RAG प्रणाली अनजाने में उपयोगकर्ताओं की निजी जानकारी उजागर कर सकती है, जिससे गंभीर गोपनीयता उल्लंघन और कानूनी समस्याएँ उत्पन्न हो सकती हैं।

RAG में PII उजागर होने का जोखिम

ऐसी RAG प्रणाली पर विचार कीजिए जिसे कंपनी के आंतरिक दस्तावेज़ों या ग्राहक सहायता वार्तालापों पर प्रशिक्षित किया गया हो। कोई उपयोगकर्ता ऐसा प्रश्न पूछ सकता है जिसके उत्तर में गलती से किसी व्यक्ति का पूरा नाम, पता या चिकित्सा इतिहास वाला दस्तावेज़ प्राप्त होकर दिख जाए।

लक्ष्य संवेदनशील व्यक्तिगत डेटा उजागर किए बिना उपयोगी जानकारी प्रदान करना है।

दस्तावेज़ों में PII की पहचान

PII की सुरक्षा करने से पहले आपको उसे ढूँढ़ना होगा। इसके लिए अपने दस्तावेज़ों को ऐसे पैटर्न के लिए स्कैन करना होता है जो व्यक्तिगत डेटा का संकेत देते हैं।

सामान्य तरीकों में नियमित अभिव्यक्तियों (regex), प्राकृतिक भाषा प्रसंस्करण (NLP) तकनीकों या विशेष PII पहचान लाइब्रेरी का उपयोग शामिल है।

PII पहचान का प्रदर्शन

यहाँ नियमित अभिव्यक्तियों का उपयोग करने वाला एक सरल Python उदाहरण दिया गया है, जो किसी पाठ दस्तावेज़ में ईमेल और फ़ोन नंबर जैसे सामान्य PII पैटर्न खोजता है।

import re

def find_pii(text):
    patterns = {
        "EMAIL": r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}",
        "PHONE": r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b",
        "NAME": r"\b(?:John Doe|Jane Smith)\b" # Simplified for demo
    }
    found_pii = {}
    for pii_type, pattern in patterns.items():
        matches = re.findall(pattern, text)
        if matches:
            found_pii[pii_type] = list(set(matches))
    return found_pii

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
print("Document:", document)
print("Found PII:", find_pii(document))

रणनीति: PII को छिपाना

छिपाना PII को हटाने या अस्पष्ट करने की प्रक्रिया है, ताकि उसे पढ़ा या पहचाना न जा सके। संवेदनशील डेटा की सुरक्षा के लिए यह एक सामान्य और प्रभावी तरीका है।

आप PII को सामान्य प्लेसहोल्डर (जैसे, [EMAIL], [NAME]) या तारक चिह्नों (***) से बदल सकते हैं।

PII छिपाने का प्रदर्शन

पिछले उदाहरण के आधार पर, आइए देखें कि Python और नियमित अभिव्यक्तियों का उपयोग करके किसी दस्तावेज़ से पहचाने गए PII को कैसे छिपाया जा सकता है।

import re

def redact_pii(text):
    # Redact email addresses
    text = re.sub(r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}", "[EMAIL_REDACTED]", text)
    # Redact phone numbers
    text = re.sub(r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b", "[PHONE_REDACTED]", text)
    # Redact specific names (simplified)
    text = re.sub(r"\bJohn Doe\b", "[NAME_REDACTED]", text)
    text = re.sub(r"\bJane Smith\b", "[NAME_REDACTED]", text)
    return text

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
redacted_doc = redact_pii(document)
print("Original:", document)
print("Redacted:", redacted_doc)

रणनीति: छद्मनामकरण

छद्मनामकरण PII को कृत्रिम पहचानकर्ताओं (छद्मनामों) से बदल देता है। छिपाने के विपरीत, इसमें आवश्यकता पड़ने पर पहचान फिर से निर्धारित की जा सकती है, लेकिन इसके लिए एक अलग 'कुंजी' तक पहुँच होना आवश्यक है, जो छद्मनामों को मूल PII से जोड़ती है।

यह तब उपयोगी होता है जब आपको व्यक्तिगत पहचान उजागर किए बिना डेटा का सांख्यिकीय विश्लेषण करना हो।

डेटा न्यूनतमकरण का सिद्धांत

गोपनीयता का एक मूल सिद्धांत डेटा न्यूनतमकरण है। इसका अर्थ है कि आपको अपने RAG सिस्टम के काम करने के लिए आवश्यक PII की बिल्कुल न्यूनतम मात्रा ही एकत्र, संसाधित और संग्रहीत करनी चाहिए।

कम PII संग्रहीत होने का अर्थ है कि डेटा के उल्लंघन की स्थिति में जोखिम भी कम होगा। आप कौन-सा डेटा बनाए रख रहे हैं, इसकी नियमित समीक्षा करें।

सुरक्षित संग्रहण और पहुँच

प्रसंस्करण के बाद भी, आपके वेक्टर भंडार या स्रोत दस्तावेज़ों में बचा हुआ कोई भी PII मजबूत सुरक्षा चाहता है:

  • कूटलेखन: डेटा को संग्रहीत अवस्था में और स्थानांतरित किए जाने के दौरान, दोनों समय कूटबद्ध करें।
  • पहुँच नियंत्रण: अपने डेटाबेस और RAG घटकों के लिए सख्त भूमिका-आधारित पहुँच लागू करें। केवल अधिकृत कर्मियों को ही संवेदनशील डेटा तक पहुँच होनी चाहिए।
  • पृथक परिवेश: जोखिम को कम करने के लिए PII को सुरक्षित, पृथक कंप्यूटिंग परिवेशों में संसाधित करें।

PII प्रबंधन की जाँच

RAG सिस्टम में PII के प्रबंधन के लिए निम्नलिखित में से कौन-सी रणनीतियाँ मान्य और अनुशंसित हैं?

पुनरावलोकन: PII और RAG सुरक्षा

इस पाठ में हमने RAG सिस्टम में PII के प्रबंधन के महत्वपूर्ण महत्व का अध्ययन किया। हमने PII की पहचान करने और छिपाने तथा छद्मनामकरण जैसी प्रमुख रणनीतियों के बारे में सीखा।

डेटा न्यूनतमकरण के सिद्धांत तथा संवेदनशील जानकारी की सुरक्षा और गोपनीयता संबंधी नियमों का अनुपालन सुनिश्चित करने के लिए सुरक्षित संग्रहण और पहुँच नियंत्रणों की आवश्यकता को याद रखें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ LangChain / RAG / वेक्टर डेटाबेस सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
12
पाठ
48

अक्सर पूछे जाने वाले प्रश्न

क्या “डेटा गोपनीयता और PII प्रबंधन” पाठ निःशुल्क है?

हाँ—“डेटा गोपनीयता और PII प्रबंधन” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“डेटा गोपनीयता और PII प्रबंधन” में मैं क्या सीखूँगा?

अपने RAG पाइपलाइन में व्यक्तिगत पहचान योग्य जानकारी (PII) और संवेदनशील डेटा को सुरक्षित रूप से प्रबंधित करना समझें। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ LangChain / RAG / वेक्टर डेटाबेस का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या LangChain / RAG / वेक्टर डेटाबेस शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“डेटा गोपनीयता और PII प्रबंधन” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस LangChain / RAG / वेक्टर डेटाबेस पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर LangChain / RAG / वेक्टर डेटाबेस पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. डेटा गोपनीयता और PII प्रबंधन
  2. हैलुसिनेशन और पक्षपात को कम करना
  3. RAG के लिए जिम्मेदार कृत्रिम बुद्धिमत्ता अभ्यास
  4. प्रॉम्प्ट इंजेक्शन से बचाव
← LangChain / RAG / वेक्टर डेटाबेस पर वापस जाएँ