संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ
अर्थगत संदर्भ को सुरक्षित रखने और रिट्रीवल की सटीकता सुधारने वाली बुद्धिमान खंड-विभाजन तकनीकें लागू कीजिए।
संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ, CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
RAG में संदर्भ क्यों महत्वपूर्ण है
Retrieval Augmented Generation (RAG) में, प्राप्त की गई जानकारी की गुणवत्ता सीधे LLM के उत्तर को प्रभावित करती है। यदि आपके सिस्टम में दिए जाने वाले पाठ के खंड ठीक से व्यवस्थित नहीं हैं, तो LLM महत्वपूर्ण संदर्भ को छोड़ सकता है।
इसे ऐसे समझिए जैसे आप ऐसी किताब पढ़ने की कोशिश कर रहे हों जिसमें हर दूसरा वाक्य अलग पृष्ठ पर हो। कहानी समझना कठिन होगा!
सरल खंडों की समस्या
पहले हमने मूल पाठ-खंड विभाजन पर चर्चा की थी। अक्सर इसमें पाठ को निश्चित आकार वाले खंडों में बाँटना शामिल होता है।
हालाँकि, निश्चित आकार वाले खंड वाक्यों या अनुच्छेदों को बीच से काट सकते हैं और संबंधित विचारों को अलग कर सकते हैं। इससे प्राप्ति सिस्टम के लिए किसी पूछताछ हेतु आवश्यक सारी जानकारी ढूँढना कठिन हो जाता है।
- अर्थ का खो जाना: आधा वाक्य अक्सर अपना मूल अर्थ खो देता है।
- अधूरी जानकारी: LLM को पूरे विचार नहीं, बल्कि उनके टुकड़े मिलते हैं।
संदर्भ-जागरूक खंड-विभाजन क्या है
संदर्भ-जागरूक खंड-विभाजन पाठ को बाँटने का एक स्मार्ट तरीका है। यह पाठ को मनमानी लंबाइयों पर काटने के बजाय उसकी स्वाभाविक धारा और अर्थ को बनाए रखने का प्रयास करता है।
लक्ष्य यह है कि अर्थ की दृष्टि से संबंधित पाठ-अंशों को एक ही खंड में साथ रखा जाए। इससे यह सुनिश्चित होता है कि जब कोई खंड प्राप्त किया जाए, तो वह जानकारी का पूरा और सुसंगत अंश प्रदान करे।
ओवरलैपिंग खंड: पहला चरण
संदर्भ-जागरूकता की एक सरल, फिर भी प्रभावी तकनीक ओवरलैपिंग खंड हैं। जब आप अपने दस्तावेज़ को बाँटते हैं, तो प्रत्येक खंड पिछले और अगले खंड के पाठ के एक छोटे हिस्से को साझा करता है।
यह ओवरलैप एक पुल की तरह काम करता है। यदि कोई महत्वपूर्ण अवधारणा खंडों की सीमा के आर-पार फैली हो, तो दोनों खंडों में संदर्भ बनाए रखने के लिए पर्याप्त जानकारी रहती है।
- खंड 1:
"...the quick brown fox jumped..." - खंड 2:
"...fox jumped over the lazy dog..."
ध्यान दें कि "fox jumped" दोनों में है, जिससे प्रवाह बना रहता है।
वाक्य-आधारित खंड-विभाजन
एक और प्रभावी रणनीति वाक्य की सीमाओं के आधार पर पाठ को बाँटना है। इससे यह सुनिश्चित होता है कि कोई भी वाक्य कभी दो खंडों में विभाजित न हो।
चूँकि वाक्य आमतौर पर पूर्ण विचार व्यक्त करते हैं, इसलिए उन्हें पूरा बनाए रखने से प्रत्येक खंड की अर्थगत सुसंगति काफ़ी बेहतर होती है और प्राप्ति अधिक सटीक होती है।
कोड: सरल वाक्य विभाजक
आइए Python का एक मूल उदाहरण देखते हैं कि पाठ को वाक्यों में कैसे बाँटा जा सकता है। इससे पूर्ण विचारों को साथ रखने में सहायता मिलती है।
import re
def split_into_sentences(text):
# This is a simplified split by common sentence-ending punctuation.
# More robust solutions exist (e.g., NLTK, spaCy).
sentences = re.split(r'(?<=[.!?])\s+', text)
return [s.strip() for s in sentences if s.strip()]
if __name__ == "__main__":
document_text = "Hello there. How are you? I am fine. What about you?"
chunks = split_into_sentences(document_text)
for i, chunk in enumerate(chunks):
print(f"Chunk {i+1}: {chunk}")पुनरावर्ती वर्ण पाठ विभाजक
पुनरावर्ती वर्ण पाठ विभाजक एक अधिक उन्नत और व्यापक रूप से प्रयुक्त तकनीक है। यह विभाजकों की सूची का उपयोग करके पाठ को बाँटने का प्रयास करता है और उन्हें प्राथमिकता के क्रम में आज़माता है।
यदि पहले विभाजक (जैसे अनुच्छेदों के लिए दो नई पंक्तियाँ) से बाँटने पर बने खंड अब भी बहुत बड़े हों, तो यह अगले विभाजक (जैसे पंक्तियों के लिए एक नई पंक्ति) को पुनरावर्ती रूप से आज़माता है, और इसी तरह आगे बढ़ता है।
पुनरावर्ती विभाजक कैसे काम करते हैं
कल्पना कीजिए कि आपके पास एक लंबा दस्तावेज़ है:
- सबसे पहले यह
"\n\n"(अनुच्छेद-विराम) से बाँटने का प्रयास करता है। - यदि बना हुआ कोई खंड अब भी बहुत बड़ा हो, तो यह उस बड़े खंड को लेकर उसे
"\n"(पंक्ति-विराम) से बाँटने का प्रयास करता है। - यदि खंड अब भी बहुत बड़े हों, तो यह अंतिम उपाय के रूप में
" "(शब्दों के बीच के रिक्त स्थान) या यहाँ तक कि""(अलग-अलग वर्ण) को आज़मा सकता है।
यह पदानुक्रमित तरीका पाठ को और छोटे भागों में बाँटने से पहले बड़े अर्थपूर्ण भागों को सुरक्षित रखने को प्राथमिकता देता है।
विभाजकों की भूमिका
रिकर्सिव विभाजक की प्रभावशीलता आपके द्वारा दिए गए विभाजकों की सूची और क्रम पर बहुत अधिक निर्भर करती है। सामान्य विभाजकों में शामिल हैं:
"\n\n": अनुच्छेदों के बीच के विराम के लिए (मज़बूत अर्थगत सीमा)।"\n": पंक्ति विराम के लिए।" ": शब्दों के बीच के विराम के लिए।"": वर्णों के बीच के विराम के लिए (अंतिम विकल्प)।
इनको परिभाषित करके आप विभाजक को पाठ की तार्किक संरचनाएँ बनाए रखने का निर्देश देते हैं।
अपनी समझ जाँचें
आपने संदर्भ-जागरूक खंड बनाने की विभिन्न रणनीतियों के बारे में सीखा है। आइए अपने ज्ञान की जाँच करें।
पुनरावलोकन: बेहतर RAG के लिए अधिक समझदार खंड
आज हमने जाना कि संदर्भ-जागरूक खंड निर्माण RAG प्रणाली के प्रदर्शन को किस तरह काफ़ी बेहतर बनाता है। हमने सरल निश्चित-आकार के विभाजनों से आगे बढ़कर ऐसी विधियों का अध्ययन किया, जो पाठ की स्वाभाविक संरचना और अर्थ का सम्मान करती हैं।
- अतिव्यापी खंड सीमाओं के आर-पार जानकारी को जोड़ते हैं।
- वाक्य-आधारित खंड निर्माण पूर्ण विचारों को एक साथ बनाए रखता है।
- पुनरावर्ती वर्ण विभाजन दस्तावेज़ों को समझदारी से विभाजित करने के लिए विभाजकों के पदानुक्रम का उपयोग करता है।
इन रणनीतियों को लागू करके आप सुनिश्चित करते हैं कि आपकी RAG प्रणाली अधिक प्रासंगिक और सुसंगत जानकारी पुनःप्राप्त करे, जिससे बेहतर LLM प्रतिक्रियाएँ मिलें।
एआई शिक्षक के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 12
- पाठ
- 48
अक्सर पूछे जाने वाले प्रश्न
क्या “संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ” पाठ निःशुल्क है?
हाँ—“संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ” में मैं क्या सीखूँगा?
अर्थगत संदर्भ को सुरक्षित रखने और रिट्रीवल की सटीकता सुधारने वाली बुद्धिमान खंड-विभाजन तकनीकें लागू कीजिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- विविध दस्तावेज़ प्रारूप लोड करना
- संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ
- मेटाडेटा प्रबंधन और फ़िल्टरिंग
- स्रोत डेटा की सफ़ाई और डुप्लिकेट हटाना