LangChain / RAG / वेक्टर डेटाबेस · पाठ

छवियों और तालिकाओं के साथ मल्टीमॉडल RAG

RAG को केवल सादे टेक्स्ट से आगे बढ़ाकर छवियों, चार्ट और संरचित तालिकाओं को पुनर्प्राप्त करना तथा उनका तर्कपूर्ण विश्लेषण करना सीखिए।

पाठ 4, कुल 4 में से13 चरण

छवियों और तालिकाओं के साथ मल्टीमॉडल RAG, CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह LangChain / RAG / वेक्टर डेटाबेस सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

साधारण पाठ से आगे

वास्तविक दस्तावेज़ों में चित्र, चार्ट और तालिकाएँ होती हैं। मल्टीमॉडल RAG इन गैर-पाठ तत्वों को अनुक्रमित करके प्राप्त करता है, ताकि मॉडल उन पर निर्भर प्रश्नों के उत्तर दे सके।

मल्टीमॉडल में क्या शामिल है

मल्टीमॉडल स्रोतों में स्कैन किए गए पृष्ठ, आरेख, स्क्रीनशॉट, फ़ोटो और PDF या वेब पृष्ठों में जोड़ी गई स्प्रेडशीट जैसी तालिकाएँ शामिल हैं।

  • चित्र
  • चार्ट और आकृतियाँ
  • तालिकाएँ

रणनीति 1: पहले वर्णन करें, फिर एम्बेड करें

हर चित्र का पाठ्य वर्णन तैयार करने के लिए विज़न मॉडल का उपयोग करें, फिर अपने सामान्य पाठ एम्बेडिंग के साथ उस वर्णन को एम्बेड करें। प्राप्ति प्रक्रिया पाठ-आधारित रहती है।

caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])

रणनीति 2: मल्टीमॉडल एम्बेडिंग

CLIP जैसे मॉडल चित्रों और पाठ को एक ही वेक्टर स्थान में एम्बेड करते हैं, इसलिए पाठ संबंधी प्रश्न बिना कैप्शन चरण के सीधे किसी चित्र से मेल खा सकता है।

तालिकाएँ संभालना

तालिकाओं को सपाट करने पर उनका अर्थ खो जाता है। खंड बनाने से पहले हर तालिका को Markdown या HTML में बदलकर संरचना सुरक्षित रखें, ताकि पंक्तियाँ और शीर्षक जुड़े रहें।

table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])

बड़ी तालिकाओं का सारांश बनाना

चौड़ी या लंबी तालिकाओं के लिए प्राकृतिक भाषा का सारांश (प्राप्ति के लिए) और मूल तालिका (उत्तर के लिए) दोनों रखें तथा उन्हें id से जोड़ें।

माध्यम के आधार पर मार्ग निर्धारण

प्रश्न के समय पहचानें कि प्रश्न को किस चीज़ की आवश्यकता है। चार्ट से संबंधित अनुरोध में चित्र तत्व प्राप्त करें; संख्यात्मक खोज में तालिकाओं को लक्ष्य बनाएँ।

LLM को चित्र भेजना

मल्टीमॉडल LLM प्रॉम्प्ट में सीधे चित्र स्वीकार करते हैं। प्रासंगिक चित्र प्राप्त करने के बाद, आधारयुक्त तर्क के लिए उसे प्रश्न के साथ शामिल करें।

messages = [{"role": "user", "content": [
    {"type": "text", "text": "What trend does this chart show?"},
    {"type": "image_url", "image_url": {"url": img_url}},
]}]

दृश्य स्रोतों का उल्लेख

मेटाडेटा में दर्ज करें कि उत्तर किस चित्र या तालिका से मिला, ताकि आप उपयोगकर्ता को वही सटीक आकृति या तालिका दिखा सकें जिस पर मॉडल ने भरोसा किया।

लागत और विलंब

विज़न कॉल और चित्र एम्बेडिंग की लागत पाठ से अधिक होती है। कैप्शन कैश करें, चित्रों का आकार घटाएँ और विज़न को तभी invoke करें जब प्रश्न को वास्तव में इसकी आवश्यकता हो।

सब कुछ एक साथ जोड़ना

लोड करते समय चित्र और तालिकाएँ निकालें, कैप्शन या मल्टीमॉडल एम्बेडिंग के माध्यम से उन्हें अनुक्रमित करें, माध्यम के आधार पर प्रश्नों का मार्ग निर्धारित करें और सही तत्व को मल्टीमॉडल LLM तक पहुँचाएँ।

त्वरित जाँच

मल्टीमॉडल RAG की अपनी समझ जाँचें।

पुनरावलोकन

आपने RAG को कई माध्यमों तक विस्तृत किया:

  • चित्रों के लिए पहले वर्णन करें, फिर एम्बेड करें या मल्टीमॉडल एम्बेडिंग
  • Markdown के रूप में तालिका की संरचना सुरक्षित रखें
  • माध्यम के आधार पर प्रश्नों का मार्ग निर्धारित करें
  • चित्रों को मल्टीमॉडल LLM तक पहुँचाएँ और दृश्य स्रोतों का उल्लेख करें
शुरुआत निःशुल्क

एआई शिक्षक के साथ LangChain / RAG / वेक्टर डेटाबेस सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
12
पाठ
48

अक्सर पूछे जाने वाले प्रश्न

क्या “छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” पाठ निःशुल्क है?

हाँ—“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” में मैं क्या सीखूँगा?

RAG को केवल सादे टेक्स्ट से आगे बढ़ाकर छवियों, चार्ट और संरचित तालिकाओं को पुनर्प्राप्त करना तथा उनका तर्कपूर्ण विश्लेषण करना सीखिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ LangChain / RAG / वेक्टर डेटाबेस का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या LangChain / RAG / वेक्टर डेटाबेस शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।

“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस LangChain / RAG / वेक्टर डेटाबेस पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर LangChain / RAG / वेक्टर डेटाबेस पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. कोड निर्माण और सहायता के लिए RAG
  2. वास्तविक समय के RAG सिस्टम बनाना
  3. RAG में उभरते रुझान और शोध
  4. छवियों और तालिकाओं के साथ मल्टीमॉडल RAG
← LangChain / RAG / वेक्टर डेटाबेस पर वापस जाएँ