छवियों और तालिकाओं के साथ मल्टीमॉडल RAG
RAG को केवल सादे टेक्स्ट से आगे बढ़ाकर छवियों, चार्ट और संरचित तालिकाओं को पुनर्प्राप्त करना तथा उनका तर्कपूर्ण विश्लेषण करना सीखिए।
छवियों और तालिकाओं के साथ मल्टीमॉडल RAG, CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह LangChain / RAG / वेक्टर डेटाबेस सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
साधारण पाठ से आगे
वास्तविक दस्तावेज़ों में चित्र, चार्ट और तालिकाएँ होती हैं। मल्टीमॉडल RAG इन गैर-पाठ तत्वों को अनुक्रमित करके प्राप्त करता है, ताकि मॉडल उन पर निर्भर प्रश्नों के उत्तर दे सके।
मल्टीमॉडल में क्या शामिल है
मल्टीमॉडल स्रोतों में स्कैन किए गए पृष्ठ, आरेख, स्क्रीनशॉट, फ़ोटो और PDF या वेब पृष्ठों में जोड़ी गई स्प्रेडशीट जैसी तालिकाएँ शामिल हैं।
- चित्र
- चार्ट और आकृतियाँ
- तालिकाएँ
रणनीति 1: पहले वर्णन करें, फिर एम्बेड करें
हर चित्र का पाठ्य वर्णन तैयार करने के लिए विज़न मॉडल का उपयोग करें, फिर अपने सामान्य पाठ एम्बेडिंग के साथ उस वर्णन को एम्बेड करें। प्राप्ति प्रक्रिया पाठ-आधारित रहती है।
caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])रणनीति 2: मल्टीमॉडल एम्बेडिंग
CLIP जैसे मॉडल चित्रों और पाठ को एक ही वेक्टर स्थान में एम्बेड करते हैं, इसलिए पाठ संबंधी प्रश्न बिना कैप्शन चरण के सीधे किसी चित्र से मेल खा सकता है।
तालिकाएँ संभालना
तालिकाओं को सपाट करने पर उनका अर्थ खो जाता है। खंड बनाने से पहले हर तालिका को Markdown या HTML में बदलकर संरचना सुरक्षित रखें, ताकि पंक्तियाँ और शीर्षक जुड़े रहें।
table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])बड़ी तालिकाओं का सारांश बनाना
चौड़ी या लंबी तालिकाओं के लिए प्राकृतिक भाषा का सारांश (प्राप्ति के लिए) और मूल तालिका (उत्तर के लिए) दोनों रखें तथा उन्हें id से जोड़ें।
माध्यम के आधार पर मार्ग निर्धारण
प्रश्न के समय पहचानें कि प्रश्न को किस चीज़ की आवश्यकता है। चार्ट से संबंधित अनुरोध में चित्र तत्व प्राप्त करें; संख्यात्मक खोज में तालिकाओं को लक्ष्य बनाएँ।
LLM को चित्र भेजना
मल्टीमॉडल LLM प्रॉम्प्ट में सीधे चित्र स्वीकार करते हैं। प्रासंगिक चित्र प्राप्त करने के बाद, आधारयुक्त तर्क के लिए उसे प्रश्न के साथ शामिल करें।
messages = [{"role": "user", "content": [
{"type": "text", "text": "What trend does this chart show?"},
{"type": "image_url", "image_url": {"url": img_url}},
]}]दृश्य स्रोतों का उल्लेख
मेटाडेटा में दर्ज करें कि उत्तर किस चित्र या तालिका से मिला, ताकि आप उपयोगकर्ता को वही सटीक आकृति या तालिका दिखा सकें जिस पर मॉडल ने भरोसा किया।
लागत और विलंब
विज़न कॉल और चित्र एम्बेडिंग की लागत पाठ से अधिक होती है। कैप्शन कैश करें, चित्रों का आकार घटाएँ और विज़न को तभी invoke करें जब प्रश्न को वास्तव में इसकी आवश्यकता हो।
सब कुछ एक साथ जोड़ना
लोड करते समय चित्र और तालिकाएँ निकालें, कैप्शन या मल्टीमॉडल एम्बेडिंग के माध्यम से उन्हें अनुक्रमित करें, माध्यम के आधार पर प्रश्नों का मार्ग निर्धारित करें और सही तत्व को मल्टीमॉडल LLM तक पहुँचाएँ।
त्वरित जाँच
मल्टीमॉडल RAG की अपनी समझ जाँचें।
पुनरावलोकन
आपने RAG को कई माध्यमों तक विस्तृत किया:
- चित्रों के लिए पहले वर्णन करें, फिर एम्बेड करें या मल्टीमॉडल एम्बेडिंग
- Markdown के रूप में तालिका की संरचना सुरक्षित रखें
- माध्यम के आधार पर प्रश्नों का मार्ग निर्धारित करें
- चित्रों को मल्टीमॉडल LLM तक पहुँचाएँ और दृश्य स्रोतों का उल्लेख करें
एआई शिक्षक के साथ LangChain / RAG / वेक्टर डेटाबेस सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 12
- पाठ
- 48
अक्सर पूछे जाने वाले प्रश्न
क्या “छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” पाठ निःशुल्क है?
हाँ—“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। LangChain / RAG / वेक्टर डेटाबेस पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” में मैं क्या सीखूँगा?
RAG को केवल सादे टेक्स्ट से आगे बढ़ाकर छवियों, चार्ट और संरचित तालिकाओं को पुनर्प्राप्त करना तथा उनका तर्कपूर्ण विश्लेषण करना सीखिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ LangChain / RAG / वेक्टर डेटाबेस का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या LangChain / RAG / वेक्टर डेटाबेस शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर LangChain / RAG / वेक्टर डेटाबेस शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।
“छवियों और तालिकाओं के साथ मल्टीमॉडल RAG” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस LangChain / RAG / वेक्टर डेटाबेस पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर LangChain / RAG / वेक्टर डेटाबेस पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- कोड निर्माण और सहायता के लिए RAG
- वास्तविक समय के RAG सिस्टम बनाना
- RAG में उभरते रुझान और शोध
- छवियों और तालिकाओं के साथ मल्टीमॉडल RAG