पाइथन के साथ एआई सीखें · पाठ

अर्थगत समानता और वाक्य एम्बेडिंग

Sentence-BERT, अर्थगत खोज के लिए cosine similarity और एम्बेडिंग का क्लस्टरिंग।

पाठ 4, कुल 4 में से13 चरण

अर्थगत समानता और वाक्य एम्बेडिंग, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

केवल शब्द नहीं, वाक्य

शब्द-सदिश निरूपण शब्दों को दर्शाते हैं, लेकिन हमें अक्सर पूरे वाक्यों या दस्तावेज़ों की तुलना करनी होती है। शब्द-सदिशों का औसत निकालने से सूक्ष्म अर्थ खो जाते हैं; हमें ऐसा एकल सदिश चाहिए जो पूरा अर्थ समेट सके।

वाक्य-सदिश निरूपण क्या हैं

वाक्य-सदिश निरूपण पूरे वाक्य को एक सघन सदिश में बदलते हैं, ताकि समान अर्थ वाले वाक्यों के सदिश एक-दूसरे के निकट हों और अर्थ-आधारित खोज तथा समूहकरण संभव हो सके।

sentence-transformers पुस्तकालय

sentence-transformers पुस्तकालय यह काम आसान बनाता है। यह सूक्ष्म रूप से प्रशिक्षित रूपांतरक मॉडलों को एक सुविधाजनक आवरण में रखता है, जो सीधे उच्च-गुणवत्ता वाले वाक्य-सदिश उत्पन्न करते हैं।

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("all-MiniLM-L6-v2")

all-MiniLM-L6-v2 क्यों

all-MiniLM-L6-v2 एक लोकप्रिय डिफ़ॉल्ट विकल्प है: यह छोटा, तेज़ और सटीक है तथा 384-आयामी सदिश उत्पन्न करता है। अधिकांश अनुप्रयोगों के लिए यह गति और गुणवत्ता के बीच अच्छा संतुलन रखता है।

वाक्यों को सदिश में बदलना

model.encode वाक्यों की सूची को सदिश निरूपणों के एक आव्यूह में बदलता है, जिसमें प्रत्येक वाक्य के लिए एक पंक्ति होती है।

sentences = [
    "The cat sits on the mat.",
    "A feline rests on the rug.",
    "I am learning machine learning.",
]
embeddings = model.encode(sentences)
print(embeddings.shape)   # (3, 384)

समानता मापना

कोसाइन समानता दो सदिशों के बीच के कोण को मापती है और उनके परिमाण को नज़रअंदाज़ करती है। 1 के निकट मान बहुत समान अर्थ दर्शाते हैं, जबकि 0 के निकट मान असंबंधित अर्थ दर्शाते हैं।

from sentence_transformers import util

sim = util.cos_sim(embeddings[0], embeddings[1])
print(sim.item())   # high, both about a cat resting

sklearn cosine_similarity का उपयोग

आप पूरे युग्मवार समानता आव्यूह को प्राप्त करने के लिए सदिश निरूपणों के आव्यूह पर सीधे scikit-learn का भी उपयोग कर सकते हैं।

from sklearn.metrics.pairwise import cosine_similarity

matrix = cosine_similarity(embeddings)
print(matrix)   # (3, 3) pairwise similarities

अर्थ-आधारित खोज का विचार

अर्थ-आधारित खोज दस्तावेज़ों को कीवर्ड के आधार पर नहीं, बल्कि अर्थ के आधार पर ढूँढ़ती है। किसी प्रश्न और सभी दस्तावेज़ों को सदिश में बदलें, फिर प्रश्न-सदिश के साथ कोसाइन समानता के आधार पर दस्तावेज़ों का क्रम निर्धारित करें।

अर्थ-आधारित खोज का उदाहरण

पाठ-संग्रह को एक बार सदिश में बदलें, फिर प्रत्येक प्रश्न के लिए समानताएँ निकालें और सर्वोत्तम मिलान लौटाएँ।

from sentence_transformers import util

corpus = ["How to reset my password", "Refund policy details", "Track my order"]
corpus_emb = model.encode(corpus)

query_emb = model.encode("I forgot my login")
hits = util.semantic_search(query_emb, corpus_emb, top_k=2)
print(hits)

वास्तविक जीवन के अनुप्रयोग

वाक्य-सदिश निरूपण FAQ मिलान, डुप्लिकेट पहचान, समूहकरण, अनुशंसा और RAG प्रणालियों में पुनर्प्राप्ति चरण को सक्षम बनाते हैं, जो बड़े भाषा मॉडलों को प्रासंगिक संदर्भ उपलब्ध कराता है।

अच्छे परिणामों के लिए सुझाव

अपने कार्य के लिए प्रशिक्षित मॉडल चुनें (अर्थ-आधारित खोज बनाम पराभाषा)। यदि आपकी समानता माप के लिए आवश्यक हो, तो सदिश निरूपणों को सामान्यीकृत करें और बड़े पाठ-संग्रहों के लिए तेज़ निकटतम-पड़ोसी खोज हेतु सदिश डेटाबेस का उपयोग करें।

त्वरित जाँच

वाक्य-सदिश निरूपण के अपने ज्ञान की जाँच करें।

पुनरावलोकन

पुनरावलोकन: वाक्य-सदिश निरूपण पूरे वाक्यों को सदिशों में बदलते हैं। SentenceTransformer("all-MiniLM-L6-v2") और model.encode(sentences) का उपयोग करें, फिर कोसाइन समानता से तुलना करें। यही अर्थ-आधारित खोज को सक्षम बनाता है: प्रश्न और पाठ-संग्रह को सदिश में बदलें और समानता के आधार पर क्रम निर्धारित करें। यह FAQ मिलान, समूहकरण और RAG पुनर्प्राप्ति के लिए महत्वपूर्ण है।

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
225

अक्सर पूछे जाने वाले प्रश्न

क्या “अर्थगत समानता और वाक्य एम्बेडिंग” पाठ निःशुल्क है?

हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “अर्थगत समानता और वाक्य एम्बेडिंग” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“अर्थगत समानता और वाक्य एम्बेडिंग” में मैं क्या सीखूँगा?

Sentence-BERT, अर्थगत खोज के लिए cosine similarity और एम्बेडिंग का क्लस्टरिंग। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।

“अर्थगत समानता और वाक्य एम्बेडिंग” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. Word2Vec: Skip-gram और CBOW
  2. GloVe और FastText एम्बेडिंग
  3. BERT के साथ टेक्स्ट वर्गीकरण
  4. अर्थगत समानता और वाक्य एम्बेडिंग
← पाइथन के साथ एआई सीखें पर वापस जाएँ