Transformer मॉडल के लिए टोकनीकरण
सबवर्ड, पैडिंग और Attention मास्क
Transformer मॉडल के लिए टोकनीकरण, CoddyKit पर NLP Academy का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह NLP Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
Tokens सबसे पहले आते हैं
Transformer कुछ सीख सके, उससे पहले आपके text को numbers में बदलना ज़रूरी है। यह काम tokenizer करता है।
मॉडल से मिलान करें
हमेशा वही tokenizer load करें जिसके साथ आपका model train किया गया था। बेमेल vocabulary ऐसी बेकार ids बनाती है जिन्हें model ने कभी नहीं देखा।
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Subword pieces
आधुनिक tokenizers दुर्लभ शब्दों को subwords कहलाने वाले छोटे हिस्सों में बाँटते हैं, ताकि अनजान text को भी दर्शाया जा सके।
print(tok.tokenize("tokenization"))Subwords क्यों बेहतर हैं
Subwords vocabulary को छोटा रखते हुए typos और नए शब्दों को भी संभालते हैं। Model को वास्तविक unknown token बहुत कम मिलता है।
Tokens से ids तक
हर subword एक integer id से map होता है। Text पर tokenizer call करने से model के लिए तैयार वे ids मिल जाती हैं।
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])विशेष tokens
Tokenizers CLS और SEP जैसे markers जोड़ते हैं, ताकि model जान सके कि sequence कहाँ शुरू और समाप्त होती है। ये विशेष tokens हैं।
समान लंबाई तक padding
Batches में rows की लंबाई समान होनी चाहिए, इसलिए छोटे texts में filler tokens जोड़े जाते हैं। इस चरण को padding कहते हैं।
tok(texts, padding=True)लंबे text के लिए truncation
Models input length की सीमा तय करते हैं, इसलिए बहुत लंबे text को सीमा में लाने के लिए काट दिया जाता है। truncation चालू करने से हर example सीमा के भीतर रहता है।
tok(texts, truncation=True, max_length=128)Attention mask
एक attention mask वास्तविक tokens को 1 और padding को 0 चिह्नित करता है, ताकि model filler positions को अनदेखा करे।
print(enc["attention_mask"])Tensors लौटाएँ
Tokenizer से framework tensors सीधे माँगें, ताकि output बिना अतिरिक्त conversion के training में चला जाए।
tok("hello", return_tensors="pt")Text में वापस decode करें
Predictions पढ़ने के लिए ids को decode में चलाएँ और tokenizer मूल text को फिर बना देगा, जिसमें special tokens हटा दिए जाएँगे।
print(tok.decode(enc["input_ids"]))त्वरित जाँच
Batching के दौरान attention mask का काम क्या है?
पुनरावलोकन
Tokenizers text को subword ids में बदलते हैं, special tokens जोड़ते हैं, फिर साफ़ batches के लिए padding, truncation और attention mask संभालते हैं। ✅
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 30
- पाठ
- 120
अक्सर पूछे जाने वाले प्रश्न
क्या “Transformer मॉडल के लिए टोकनीकरण” पाठ निःशुल्क है?
हाँ — NLP Academy अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “Transformer मॉडल के लिए टोकनीकरण” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“Transformer मॉडल के लिए टोकनीकरण” में मैं क्या सीखूँगा?
सबवर्ड, पैडिंग और Attention मास्क आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ NLP Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या NLP Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर NLP Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“Transformer मॉडल के लिए टोकनीकरण” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस NLP Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर NLP Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- Transformers लाइब्रेरी का परिचय
- Transformer मॉडल के लिए टोकनीकरण
- Trainer API से फ़ाइन-ट्यूनिंग
- अपने मॉडल का मूल्यांकन और संरक्षण