पाइथन के साथ एआई सीखें · पाठ

Word2Vec: Skip-gram और CBOW

Word2Vec सिद्धांत, gensim कार्यान्वयन और वेक्टर अंकगणित (king - man + woman = queen)।

पाठ 1, कुल 4 में से13 चरण

Word2Vec: Skip-gram और CBOW, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

शब्दों से सदिशों तक

मशीन लर्निंग को संख्याओं की आवश्यकता होती है, लेकिन शब्द प्रतीक होते हैं। शब्द एम्बेडिंग प्रत्येक शब्द को एक सघन सदिश में बदलती है, ताकि समान शब्द सदिश स्थान में एक-दूसरे के निकट स्थित हों।

वितरणात्मक परिकल्पना

Word2Vec इस विचार पर आधारित है कि समान संदर्भों में आने वाले शब्दों के अर्थ समान होते हैं। संदर्भ का पूर्वानुमान लगाना सीखकर मॉडल सदिशों में अर्थ को समाहित करता है।

दो आर्किटेक्चर

Word2Vec में प्रशिक्षण की दो योजनाएँ होती हैं:

  • CBOW आसपास के संदर्भ से लक्ष्य शब्द का पूर्वानुमान लगाता है
  • स्किप-ग्राम लक्ष्य शब्द से आसपास के संदर्भ का पूर्वानुमान लगाता है

CBOW बनाम स्किप-ग्राम

CBOW तेज़ है और बार-बार आने वाले शब्दों पर अच्छा काम करता है। स्किप-ग्राम धीमा है, लेकिन दुर्लभ शब्दों और छोटे डेटासेट को बेहतर ढंग से संभालता है। गुणवत्ता के लिए अक्सर स्किप-ग्राम डिफ़ॉल्ट विकल्प होता है।

जेनसिम के साथ प्रशिक्षण

gensim लाइब्रेरी Word2Vec को आसान बनाती है। आप टोकन में विभाजित sentences (शब्द-सूचियों की सूचियाँ) देते हैं और एम्बेडिंग का विन्यास निर्धारित करते हैं।

from gensim.models import Word2Vec

sentences = [["the", "cat", "sat"], ["the", "dog", "ran"]]
model = Word2Vec(sentences=sentences, vector_size=100, window=5, min_count=1)

मुख्य पैरामीटर

मुख्य नियंत्रण ये हैं:

  • vector_size एम्बेडिंग का आयाम (जैसे 100-300)
  • window प्रत्येक शब्द के आसपास के संदर्भ की चौड़ाई
  • min_count इससे कम बार आने वाले शब्दों को नज़रअंदाज़ करना
from gensim.models import Word2Vec

model = Word2Vec(
    sentences,
    vector_size=200,
    window=5,
    min_count=5,
)

sg=1 से स्किप-ग्राम चुनना

sg पैरामीटर आर्किटेक्चर चुनता है: sg=0 CBOW का उपयोग करता है (डिफ़ॉल्ट), जबकि sg=1 स्किप-ग्राम का उपयोग करता है।

from gensim.models import Word2Vec

model = Word2Vec(sentences, vector_size=100, window=5, min_count=1, sg=1)
# sg=1 -> skip-gram

शब्द सदिशों तक पहुँचना

प्रशिक्षित सदिश model.wv में रहते हैं। किसी शब्द का सदिश पाने के लिए उसे इंडेक्स के रूप में उपयोग कीजिए।

vec = model.wv["cat"]
print(vec.shape)   # (vector_size,)
print("dog" in model.wv)

समान शब्द खोजना

wv.most_similar उन शब्दों को लौटाता है जिनके सदिश सबसे निकट होते हैं। एम्बेडिंग ने क्या सीखा है, यह देखने का यह एक त्वरित तरीका है।

print(model.wv.most_similar("cat", topn=5))
# returns list of (word, similarity) pairs

शब्द सदिश गणित

इसकी प्रसिद्ध विशेषता यह है कि सदिश गणित संबंधों को व्यक्त करता है। राजा - पुरुष + महिला का परिणाम रानी के निकट आता है, जिससे पता चलता है कि एम्बेडिंग समानताओं को समाहित करती है।

result = model.wv.most_similar(
    positive=["king", "woman"],
    negative=["man"],
    topn=1,
)
print(result)   # often [("queen", 0.7...)]

आगे के कार्यों में एम्बेडिंग का उपयोग

किसी वाक्य का निरूपण करने के लिए उसके शब्द सदिशों का औसत निकालिए और फिर उसे किसी भी वर्गीकारक में दीजिए। जब आपका डेटा छोटा हो, तब पहले से प्रशिक्षित Word2Vec एम्बेडिंग भी एक मजबूत शुरुआती आधार देती हैं।

import numpy as np

def sentence_vector(words, model):
    vecs = [model.wv[w] for w in words if w in model.wv]
    return np.mean(vecs, axis=0) if vecs else np.zeros(model.vector_size)

त्वरित जाँच

अपने Word2Vec ज्ञान की जाँच कीजिए।

पुनरावलोकन

पुनरावलोकन: Word2Vec संदर्भ से सघन शब्द सदिश सीखता है। CBOW संदर्भ से शब्द का पूर्वानुमान लगाता है (तेज़); स्किप-ग्राम (sg=1) शब्द से संदर्भ का पूर्वानुमान लगाता है (दुर्लभ शब्दों के लिए बेहतर)। जेनसिम में vector_size, window और min_count सेट कीजिए, फिर wv.most_similar और राजा - पुरुष + महिला जैसी समानताओं का उपयोग कीजिए।

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
225

अक्सर पूछे जाने वाले प्रश्न

क्या “Word2Vec: Skip-gram और CBOW” पाठ निःशुल्क है?

हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “Word2Vec: Skip-gram और CBOW” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“Word2Vec: Skip-gram और CBOW” में मैं क्या सीखूँगा?

Word2Vec सिद्धांत, gensim कार्यान्वयन और वेक्टर अंकगणित (king - man + woman = queen)। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“Word2Vec: Skip-gram और CBOW” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. Word2Vec: Skip-gram और CBOW
  2. GloVe और FastText एम्बेडिंग
  3. BERT के साथ टेक्स्ट वर्गीकरण
  4. अर्थगत समानता और वाक्य एम्बेडिंग
← पाइथन के साथ एआई सीखें पर वापस जाएँ