NLP Academy · पाठ

BERT से वाक्यों की एम्बेडिंग

कोड में संदर्भित वेक्टर निकालें

पाठ 3, कुल 4 में से13 चरण

BERT से वाक्यों की एम्बेडिंग, CoddyKit पर NLP Academy का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह NLP Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

शब्दों से वाक्यों तक

BERT प्रत्येक टोकन को अपना सदिश देता है। लेकिन अक्सर आप प्रत्येक शब्द के लिए नहीं, बल्कि पूरे वाक्य के लिए एक सदिश चाहते हैं।

CLS टोकन

BERT प्रत्येक इनपुट के बिलकुल आरंभ में CLS नाम का एक विशेष टोकन जोड़ता है। इसके आउटपुट का उपयोग अक्सर वाक्य के सारांश के रूप में किया जाता है।

माध्य पूलिंग

एक अन्य सामान्य उपाय सभी टोकन-सदिशों का औसत निकालकर एक सदिश बनाना है। यह माध्य पूलिंग चरण अक्सर कच्चे CLS सदिश से बेहतर होता है।

मॉडल लोड करना

Hugging Face लोड करना आसान बनाता है: एक-एक पंक्ति में टोकनाइज़र और मॉडल प्राप्त करें। ये एम्बेडिंग के लिए आपकी पाइपलाइन बनाते हैं।

from transformers import AutoTokenizer, AutoModel
tok = AutoTokenizer.from_pretrained("bert-base-uncased")
model = AutoModel.from_pretrained("bert-base-uncased")

पाठ का टोकनीकरण

tokenizer आपके वाक्य को id संख्याओं और attention mask में बदलता है, जिन्हें BERT समझता है। यही एन्कोडिंग चरण है।

inputs = tok("I love NLP", return_tensors="pt")

मॉडल चलाएँ

एन्कोड किए गए inputs को BERT में दें, ताकि हर token के लिए hidden states मिलें। ये vectors वे कच्चे आउटपुट हैं जिनका आप pooling करेंगे।

out = model(**inputs)
states = out.last_hidden_state

एक वेक्टर में पूल करें

sequence के token states का औसत लेकर उन्हें एक sentence embedding में बदलें, जिसे आप सहेज सकते हैं।

vec = states.mean(dim=1)

<p>Sentence-Transformers लाइब्रेरी यह पूरा काम आपके लिए कर देती है। एक call से उपयोग के लिए तैयार साफ़ sentence <strong>वेक्टर</strong> मिल जाता है। ✨</p>

वाक्य-रूपांतरक पुस्तकालय आपके लिए यह सब संभाल लेता है। एक बार चलाने पर उपयोग के लिए तैयार स्वच्छ वाक्य सदिश प्राप्त होता है। ✨

from sentence_transformers import SentenceTransformer
m = SentenceTransformer("all-MiniLM-L6-v2")
vec = m.encode("I love NLP")

वाक्यों की तुलना करें

दो sentence vectors के साथ कोसाइन समानता का उपयोग करके निकटता मापें। अधिक score का अर्थ है कि वाक्यों का अर्थ एक जैसा है।

आप क्या बना सकते हैं

Sentence embeddings semantic search, clustering और duplicate detection को सक्षम बनाते हैं। वे अर्थ को ऐसी चीज़ में बदल देते हैं जिसे आप खोज सकते हैं।

गुणवत्ता पर एक टिप्पणी

वाक्यों के लिए tuned मॉडल, जैसे MiniLM, आम तौर पर यहाँ plain BERT से बेहतर होते हैं। अपने वास्तविक कार्य के लिए प्रशिक्षित मॉडल चुनें।

त्वरित जाँच

आप कई token vectors को एक sentence vector में कैसे बदलेंगे?

पुनरावलोकन

Tokenize करें, BERT चलाएँ, फिर एक sentence embedding पाने के लिए pooling करें या CLS का उपयोग करें। Sentence-Transformers इसे एक ही call में कर देता है। ✅

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
30
पाठ
120

अक्सर पूछे जाने वाले प्रश्न

क्या “BERT से वाक्यों की एम्बेडिंग” पाठ निःशुल्क है?

हाँ — NLP Academy अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “BERT से वाक्यों की एम्बेडिंग” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“BERT से वाक्यों की एम्बेडिंग” में मैं क्या सीखूँगा?

कोड में संदर्भित वेक्टर निकालें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ NLP Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या NLP Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर NLP Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“BERT से वाक्यों की एम्बेडिंग” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस NLP Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर NLP Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. संदर्भ शब्द का अर्थ क्यों बदलता है
  2. Masked Language Modeling
  3. BERT से वाक्यों की एम्बेडिंग
  4. सही पूर्व-प्रशिक्षित मॉडल चुनना
← NLP Academy पर वापस जाएँ