अर्थगत समानता और वाक्य एम्बेडिंग
Sentence-BERT, अर्थगत खोज के लिए cosine similarity और एम्बेडिंग का क्लस्टरिंग।
अर्थगत समानता और वाक्य एम्बेडिंग, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
केवल शब्द नहीं, वाक्य
शब्द-सदिश निरूपण शब्दों को दर्शाते हैं, लेकिन हमें अक्सर पूरे वाक्यों या दस्तावेज़ों की तुलना करनी होती है। शब्द-सदिशों का औसत निकालने से सूक्ष्म अर्थ खो जाते हैं; हमें ऐसा एकल सदिश चाहिए जो पूरा अर्थ समेट सके।
वाक्य-सदिश निरूपण क्या हैं
वाक्य-सदिश निरूपण पूरे वाक्य को एक सघन सदिश में बदलते हैं, ताकि समान अर्थ वाले वाक्यों के सदिश एक-दूसरे के निकट हों और अर्थ-आधारित खोज तथा समूहकरण संभव हो सके।
sentence-transformers पुस्तकालय
sentence-transformers पुस्तकालय यह काम आसान बनाता है। यह सूक्ष्म रूप से प्रशिक्षित रूपांतरक मॉडलों को एक सुविधाजनक आवरण में रखता है, जो सीधे उच्च-गुणवत्ता वाले वाक्य-सदिश उत्पन्न करते हैं।
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")all-MiniLM-L6-v2 क्यों
all-MiniLM-L6-v2 एक लोकप्रिय डिफ़ॉल्ट विकल्प है: यह छोटा, तेज़ और सटीक है तथा 384-आयामी सदिश उत्पन्न करता है। अधिकांश अनुप्रयोगों के लिए यह गति और गुणवत्ता के बीच अच्छा संतुलन रखता है।
वाक्यों को सदिश में बदलना
model.encode वाक्यों की सूची को सदिश निरूपणों के एक आव्यूह में बदलता है, जिसमें प्रत्येक वाक्य के लिए एक पंक्ति होती है।
sentences = [
"The cat sits on the mat.",
"A feline rests on the rug.",
"I am learning machine learning.",
]
embeddings = model.encode(sentences)
print(embeddings.shape) # (3, 384)समानता मापना
कोसाइन समानता दो सदिशों के बीच के कोण को मापती है और उनके परिमाण को नज़रअंदाज़ करती है। 1 के निकट मान बहुत समान अर्थ दर्शाते हैं, जबकि 0 के निकट मान असंबंधित अर्थ दर्शाते हैं।
from sentence_transformers import util
sim = util.cos_sim(embeddings[0], embeddings[1])
print(sim.item()) # high, both about a cat restingsklearn cosine_similarity का उपयोग
आप पूरे युग्मवार समानता आव्यूह को प्राप्त करने के लिए सदिश निरूपणों के आव्यूह पर सीधे scikit-learn का भी उपयोग कर सकते हैं।
from sklearn.metrics.pairwise import cosine_similarity
matrix = cosine_similarity(embeddings)
print(matrix) # (3, 3) pairwise similaritiesअर्थ-आधारित खोज का विचार
अर्थ-आधारित खोज दस्तावेज़ों को कीवर्ड के आधार पर नहीं, बल्कि अर्थ के आधार पर ढूँढ़ती है। किसी प्रश्न और सभी दस्तावेज़ों को सदिश में बदलें, फिर प्रश्न-सदिश के साथ कोसाइन समानता के आधार पर दस्तावेज़ों का क्रम निर्धारित करें।
अर्थ-आधारित खोज का उदाहरण
पाठ-संग्रह को एक बार सदिश में बदलें, फिर प्रत्येक प्रश्न के लिए समानताएँ निकालें और सर्वोत्तम मिलान लौटाएँ।
from sentence_transformers import util
corpus = ["How to reset my password", "Refund policy details", "Track my order"]
corpus_emb = model.encode(corpus)
query_emb = model.encode("I forgot my login")
hits = util.semantic_search(query_emb, corpus_emb, top_k=2)
print(hits)वास्तविक जीवन के अनुप्रयोग
वाक्य-सदिश निरूपण FAQ मिलान, डुप्लिकेट पहचान, समूहकरण, अनुशंसा और RAG प्रणालियों में पुनर्प्राप्ति चरण को सक्षम बनाते हैं, जो बड़े भाषा मॉडलों को प्रासंगिक संदर्भ उपलब्ध कराता है।
अच्छे परिणामों के लिए सुझाव
अपने कार्य के लिए प्रशिक्षित मॉडल चुनें (अर्थ-आधारित खोज बनाम पराभाषा)। यदि आपकी समानता माप के लिए आवश्यक हो, तो सदिश निरूपणों को सामान्यीकृत करें और बड़े पाठ-संग्रहों के लिए तेज़ निकटतम-पड़ोसी खोज हेतु सदिश डेटाबेस का उपयोग करें।
त्वरित जाँच
वाक्य-सदिश निरूपण के अपने ज्ञान की जाँच करें।
पुनरावलोकन
पुनरावलोकन: वाक्य-सदिश निरूपण पूरे वाक्यों को सदिशों में बदलते हैं। SentenceTransformer("all-MiniLM-L6-v2") और model.encode(sentences) का उपयोग करें, फिर कोसाइन समानता से तुलना करें। यही अर्थ-आधारित खोज को सक्षम बनाता है: प्रश्न और पाठ-संग्रह को सदिश में बदलें और समानता के आधार पर क्रम निर्धारित करें। यह FAQ मिलान, समूहकरण और RAG पुनर्प्राप्ति के लिए महत्वपूर्ण है।
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “अर्थगत समानता और वाक्य एम्बेडिंग” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “अर्थगत समानता और वाक्य एम्बेडिंग” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“अर्थगत समानता और वाक्य एम्बेडिंग” में मैं क्या सीखूँगा?
Sentence-BERT, अर्थगत खोज के लिए cosine similarity और एम्बेडिंग का क्लस्टरिंग। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।
“अर्थगत समानता और वाक्य एम्बेडिंग” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- Word2Vec: Skip-gram और CBOW
- GloVe और FastText एम्बेडिंग
- BERT के साथ टेक्स्ट वर्गीकरण
- अर्थगत समानता और वाक्य एम्बेडिंग