वेक्टर एम्बेडिंग और समानता खोज
वेक्टर एम्बेडिंग की अवधारणाओं, उनके निर्माण और संबंधित दस्तावेज़ों को खोजने में समानता खोज की भूमिका को समझिए।
वेक्टर एम्बेडिंग और समानता खोज, CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
अर्थ के लिए Vectors
स्वागत है! Large Language Models (LLMs) की दुनिया में पाठ को समझना केवल शब्दों तक सीमित नहीं है। यह अर्थ को समझने के बारे में है।
कंप्यूटर स्वाभाविक रूप से मानव भाषा के बजाय संख्याओं के साथ काम करते हैं। LLMs को पाठ का अर्थ समझने में सहायता करने के लिए हम इस अंतर को कैसे पाट सकते हैं?
Vector Embeddings क्या हैं?
Vector embeddings पाठ (या चित्र, ऑडियो आदि) के संख्यात्मक निरूपण होते हैं। इन्हें ऐसी संख्याओं की List समझिए, जो किसी जानकारी के अंश का ‘सार’ या ‘अर्थ’ दर्शाती हैं।
- पाठ के प्रत्येक अंश (शब्द, वाक्य या दस्तावेज़) को अपना विशिष्ट vector मिलता है।
- ये vectors आमतौर पर floating-point संख्याओं की लंबी Lists होते हैं (जैसे,
[0.123, -0.456, 0.789, ...])।
Embeddings के पीछे का कमाल
ये जादुई संख्याएँ कैसे बनाई जाती हैं? विशेष machine learning models, जिन्हें अक्सर embedding models कहा जाता है, पाठ को इन vectors में बदलने के लिए प्रशिक्षित किए जाते हैं।
ये models समान अर्थों को उच्च-आयामी स्थान में संख्यात्मक रूप से एक-दूसरे के ‘निकट’ vectors से जोड़ना सीखते हैं।
Semantic Similarity की व्याख्या
मूल विचार यह है कि यदि पाठ के दो अंशों के अर्थ समान हैं, तो उनके vector embeddings एक-दूसरे के निकट होंगे।
उदाहरण के लिए, "cat" का embedding, "car" की तुलना में "kitten" के अधिक निकट होगा। यही ‘निकटता’ कंप्यूटरों को semantic similarity समझने में सक्षम बनाती है।
Embeddings बनाना (अवधारणा)
वास्तविक RAG system में, अपने पाठ के लिए embeddings बनाने हेतु आप OpenAI, Cohere जैसे provider या किसी open-source model की API का उपयोग करेंगे।
आप पाठ देते हैं और API vector लौटाती है। उपयोग के दृष्टिकोण से यह इतना ही सरल है!
कोड: Embedding बनाना (नकली उदाहरण)
यह Python का एक उदाहरण है, जो दिखाता है कि आप embedding function के साथ वैचारिक रूप से कैसे काम कर सकते हैं। वास्तविकता में, get_embedding API call करेगा।
def get_embedding(text):
"""
Simulates an embedding model. Returns a dummy vector.
"""
if "hello" in text.lower():
return [0.1, 0.2, 0.3]
elif "goodbye" in text.lower():
return [0.8, 0.7, 0.6]
else:
return [0.0, 0.0, 0.0]
if __name__ == "__main__":
text1 = "Hello, CoddyKit!"
text2 = "Time to say goodbye."
text3 = "Another sentence."
print(f"Vector for '{text1}': {get_embedding(text1)}")
print(f"Vector for '{text2}': {get_embedding(text2)}")
print(f"Vector for '{text3}': {get_embedding(text3)}")Similarity Search क्यों?
जब आपके सभी दस्तावेज़ (या दस्तावेज़ों के अंश) embeddings में बदल जाएँ, तो उपयोगकर्ता के प्रश्न पर सबसे प्रासंगिक अंशों को आप कैसे खोजेंगे?
यहीं similarity search काम आती है। यह दिए गए query embedding के सबसे ‘निकट’ embeddings को खोजने की प्रक्रिया है।
Similarity Search कैसे काम करती है
Similarity search vectors के बीच की ‘दूरी’ या ‘कोण’ को गणितीय रूप से मापती है। सामान्य विधियों में शामिल हैं:
- Cosine Similarity: दो vectors के बीच का कोण मापती है। छोटा कोण (1 के अधिक निकट) अधिक similarity दर्शाता है।
- Euclidean Distance: दो बिंदुओं (vectors) के बीच सीधी रेखा की दूरी मापती है। कम दूरी अधिक similarity दर्शाती है।
ये गणनाएँ सबसे अधिक अर्थ-समान दस्तावेज़ों की शीघ्र पहचान करती हैं।
Embeddings + Search = RAG की शक्ति
RAG में, जब कोई उपयोगकर्ता प्रश्न पूछता है:
- प्रश्न को embedding में बदला जाता है।
- दस्तावेज़ embeddings के डेटाबेस पर similarity search की जाती है।
- सबसे अधिक similarity वाले शीर्ष N दस्तावेज़-अंश प्राप्त किए जाते हैं।
फिर ये प्राप्त अंश LLM को संदर्भ प्रदान करते हैं, जिससे उसके उत्तर अधिक सटीक और प्रमाण-आधारित बनते हैं।
Embeddings की त्वरित जाँच
Vector embeddings RAG के लिए अत्यंत महत्वपूर्ण हैं। आइए आपकी समझ को परखते हैं।
पुनरावलोकन: Embeddings और Search
बहुत अच्छा! आपने vector embeddings और similarity search की बुनियादी अवधारणाएँ सीख ली हैं।
- Vector embeddings पाठ को संख्याओं में बदलकर उसका अर्थ दर्शाते हैं।
- Embedding models ये vectors बनाते हैं।
- Similarity search किसी query से सबसे प्रासंगिक vectors (और इस प्रकार दस्तावेज़ों) को खोजने के लिए गणितीय दूरी का उपयोग करती है।
ये तकनीकें इस बात के केंद्र में हैं कि RAG systems LLMs के लिए प्रासंगिक संदर्भ कैसे खोजते और उपलब्ध कराते हैं।
एआई शिक्षक के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 12
- पाठ
- 48
अक्सर पूछे जाने वाले प्रश्न
क्या “वेक्टर एम्बेडिंग और समानता खोज” पाठ निःशुल्क है?
हाँ—“वेक्टर एम्बेडिंग और समानता खोज” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“वेक्टर एम्बेडिंग और समानता खोज” में मैं क्या सीखूँगा?
वेक्टर एम्बेडिंग की अवधारणाओं, उनके निर्माण और संबंधित दस्तावेज़ों को खोजने में समानता खोज की भूमिका को समझिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“वेक्टर एम्बेडिंग और समानता खोज” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर उत्पादन में LLM अनुप्रयोग (RAG + वेक्टर DB + कैशिंग) पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- वेक्टर डेटाबेस की आवश्यकता
- वेक्टर एम्बेडिंग और समानता खोज
- वेक्टर डेटाबेस के साथ एकीकरण
- अनुक्रमण, फ़िल्टरिंग और हाइब्रिड खोज