उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) · पाठ

विविध दस्तावेज़ प्रारूप लोड करना

PDF, वेब पृष्ठों, डेटाबेस और कस्टम फ़ाइल प्रकारों जैसे विभिन्न स्रोतों से डेटा ग्रहण करने की विधियों का अध्ययन कीजिए।

पाठ 1, कुल 4 में से11 चरण

विविध दस्तावेज़ प्रारूप लोड करना, CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

विभिन्न प्रकार के दस्तावेज़ ग्रहण करना

स्वागत है! RAG में आपके LLM को विभिन्न स्रोतों से जानकारी की आवश्यकता होती है। इस पाठ में विभिन्न दस्तावेज़ प्रारूपों से डेटा को अपने अनुप्रयोग में लोड करने का तरीका बताया गया है।

लक्ष्य यह है कि वेब पृष्ठों, PDF और डेटाबेस जैसी जगहों से कच्चा पाठ प्राप्त करके उसे आपकी RAG पाइपलाइन के अगले चरणों के लिए तैयार किया जाए।

वेब पृष्ठ लोड करना (HTML)

वेब पृष्ठ जानकारी का एक सामान्य स्रोत हैं। उन्हें ग्रहण करने के लिए आमतौर पर आप:

  • HTML प्राप्त करते हैं: URL से पृष्ठ की सामग्री डाउनलोड करने के लिए HTTP क्लाइंट का उपयोग करते हैं।
  • HTML का विश्लेषण करते हैं: मुख्य पाठ निकालते हैं और नेविगेशन, विज्ञापनों तथा अन्य अप्रासंगिक तत्वों को हटा देते हैं।

Python में प्राप्त करने के लिए requests और विश्लेषण के लिए BeautifulSoup जैसी लाइब्रेरी बहुत लोकप्रिय हैं।

वेब पृष्ठ लोड करने का उदाहरण

यह Python अंश एक सरल वेब पृष्ठ प्राप्त करके उसका शीर्षक निकालने का तरीका दिखाता है। कल्पना कीजिए कि ज्ञान आधार बनाने के लिए आप ऐसा कई पृष्ठों के साथ कर रहे हैं!

import requests
from bs4 import BeautifulSoup

def main():
    url = "http://quotes.toscrape.com/"
    try:
        response = requests.get(url)
        response.raise_for_status() # Raise HTTPError for bad responses
        soup = BeautifulSoup(response.text, 'html.parser')
        title = soup.find('title').get_text()
        print(f"Page Title: {title}")
    except requests.exceptions.RequestException as e:
        print(f"Error fetching URL: {e}")

if __name__ == "__main__":
    main()

PDF से पाठ निकालना

PDF (Portable Document Format) का उपयोग रिपोर्ट और दस्तावेज़ों के लिए व्यापक रूप से किया जाता है। PDF से पाठ निकालना कठिन हो सकता है, क्योंकि उनकी जटिल संरचना में पाठ, चित्र और स्वरूपण एक साथ होते हैं।

सौभाग्य से, इसमें सहायता करने वाली प्रोग्रामिंग लाइब्रेरी उपलब्ध हैं। वे PDF की संरचना पढ़कर अक्सर पृष्ठ-दर-पृष्ठ उसमें से पाठ्य सामग्री निकाल सकती हैं।

PDF से पाठ निकालने का उदाहरण

यह वैचारिक Python कोड दिखाता है कि pypdf जैसी लाइब्रेरी का उपयोग करके PDF के पहले पृष्ठ से पाठ कैसे निकाला जा सकता है। इसे वास्तव में चलाने के लिए आपको sample.pdf फ़ाइल की आवश्यकता होगी।

from pypdf import PdfReader

def main():
    # In a real scenario, 'sample.pdf' would exist
    # For this example, we'll simulate the output
    pdf_file_path = "sample.pdf"
    print(f"Attempting to read from: {pdf_file_path}")
    print("\n--- Simulated PDF Content ---")
    print("This is some text from the first page of a sample PDF document.")
    print("It contains important information for our RAG system.")
    print("-----------------------------")
    # Actual code might look like this:
    # reader = PdfReader(pdf_file_path)
    # page = reader.pages[0]
    # text = page.extract_text()
    # print(text)

if __name__ == "__main__":
    main()

डेटाबेस से डेटा लोड करना

SQL डेटाबेस (जैसे PostgreSQL, MySQL) और NoSQL डेटाबेस (जैसे MongoDB, Cassandra), दोनों ही संरचित डेटा संग्रहीत करते हैं, जो RAG के लिए उपयोगी हो सकता है।

डेटाबेस से डेटा ग्रहण करने के लिए:

  • कनेक्ट करें: डेटाबेस ड्राइवर का उपयोग करके कनेक्शन स्थापित करें।
  • पूछताछ करें: प्रासंगिक डेटा प्राप्त करने के लिए पूछताछ (जैसे SQL कथन) लिखें।
  • प्रसंस्करण करें: पूछताछ के परिणामों से पाठ फ़ील्ड निकालें।

डेटाबेस लोड करने का उदाहरण

यह SQLite का उपयोग करने वाला Python उदाहरण है, जो एक अंतर्निहित SQL डेटाबेस है। यह एक सरल तालिका बनाता है, डेटा सम्मिलित करता है और फिर उसे प्राप्त करता है। डेटाबेस ग्रहण करने में यह एक सामान्य तरीका है।

import sqlite3

def main():
    # Connect to an in-memory SQLite database
    conn = sqlite3.connect(':memory:')
    cursor = conn.cursor()

    # Create a simple table
    cursor.execute('''
        CREATE TABLE IF NOT EXISTS documents (
            id INTEGER PRIMARY KEY,
            title TEXT,
            content TEXT
        )
    ''')

    # Insert some data
    cursor.execute("INSERT INTO documents (title, content) VALUES (?, ?)", 
                   ("RAG Overview", "RAG enhances LLMs by retrieving relevant docs."))
    cursor.execute("INSERT INTO documents (title, content) VALUES (?, ?)", 
                   ("Vector DBs", "Store embeddings for fast similarity search."))
    conn.commit()

    # Retrieve data
    cursor.execute("SELECT title, content FROM documents")
    rows = cursor.fetchall()

    print("--- Retrieved Documents ---")
    for row in rows:
        print(f"Title: {row[0]}, Content: {row[1]}")
    print("---------------------------")

    conn.close()

if __name__ == "__main__":
    main()

सादा पाठ और कस्टम फ़ाइलों को संभालना

विशिष्ट प्रारूपों के अलावा, आपको अक्सर सादा पाठ फ़ाइलों (.txt, .md) या कस्टम प्रारूपों (जैसे, CSV, JSON) के साथ काम करना होगा। इनके लिए:

  • सादा पाठ: इसे सीधे पढ़ें और एन्कोडिंग पर ध्यान दें (UTF-8 सामान्य है)।
  • कस्टम प्रारूप: पाठ फ़ील्ड का विश्लेषण और निष्कर्षण करने के लिए प्रारूप-विशिष्ट लाइब्रेरी (जैसे Python में csv और json मॉड्यूल) का उपयोग करें।

मुख्य बात डेटा को उपयोग योग्य पाठ स्ट्रिंग में बदलना है।

लाइब्रेरी के साथ एकीकृत डेटा लोडिंग

जटिल RAG सिस्टम के लिए आपको हर प्रारूप के लिए हमेशा कस्टम लोडर लिखने की आवश्यकता नहीं होती। LlamaIndex और LangChain जैसी लाइब्रेरी 'Document Loaders' उपलब्ध कराती हैं, जो इस जटिलता के बड़े हिस्से को छिपा देती हैं।

  • वे अनेक डेटा स्रोतों (वेब, PDF, डेटाबेस, क्लाउड स्टोरेज) के लिए कनेक्टर उपलब्ध कराती हैं।
  • वे अक्सर मूलभूत विश्लेषण और पाठ निष्कर्षण अपने-आप संभालती हैं।

ये उपकरण प्रारंभिक ग्रहण चरण को सरल बनाते हैं, जिससे आप प्राप्ति और निर्माण पर ध्यान केंद्रित कर सकते हैं।

अपना ज्ञान जाँचें

RAG सिस्टम के लिए PDF दस्तावेज़ों से पाठ्य सामग्री निकालते समय निम्नलिखित में से कौन-सी बात आमतौर पर मुख्य चुनौती होती है?

पुनरावलोकन: विविध डेटा लोड करना

बहुत अच्छा! आपने अपने RAG सिस्टम के लिए विभिन्न दस्तावेज़ प्रारूपों को लोड करने की मूल बातें सीख ली हैं।

  • हमने वेब पृष्ठों को प्राप्त करने और उनका विश्लेषण करने पर चर्चा की।
  • जटिल PDF से पाठ निकालना समझा।
  • संरचित सामग्री के लिए डेटाबेस से पूछताछ करना देखा।
  • सादे पाठ और अन्य कस्टम फ़ाइलों को संभालने पर चर्चा की।
  • एकीकृत डेटा लोडिंग लाइब्रेरी के महत्व को समझा।

अगला चरण इस कच्चे पाठ को प्रभावी प्राप्ति के लिए तैयार करना है!

शुरुआत निःशुल्क

एआई शिक्षक के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
12
पाठ
48

अक्सर पूछे जाने वाले प्रश्न

क्या “विविध दस्तावेज़ प्रारूप लोड करना” पाठ निःशुल्क है?

हाँ—“विविध दस्तावेज़ प्रारूप लोड करना” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“विविध दस्तावेज़ प्रारूप लोड करना” में मैं क्या सीखूँगा?

PDF, वेब पृष्ठों, डेटाबेस और कस्टम फ़ाइल प्रकारों जैसे विभिन्न स्रोतों से डेटा ग्रहण करने की विधियों का अध्ययन कीजिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“विविध दस्तावेज़ प्रारूप लोड करना” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. विविध दस्तावेज़ प्रारूप लोड करना
  2. संदर्भ-जागरूक खंड-विभाजन रणनीतियाँ
  3. मेटाडेटा प्रबंधन और फ़िल्टरिंग
  4. स्रोत डेटा की सफ़ाई और डुप्लिकेट हटाना
← उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पर वापस जाएँ