NLP Academy · पाठ

Transformer मॉडल के लिए टोकनीकरण

सबवर्ड, पैडिंग और Attention मास्क

पाठ 2, कुल 4 में से13 चरण

Transformer मॉडल के लिए टोकनीकरण, CoddyKit पर NLP Academy का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह NLP Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

Tokens सबसे पहले आते हैं

Transformer कुछ सीख सके, उससे पहले आपके text को numbers में बदलना ज़रूरी है। यह काम tokenizer करता है।

मॉडल से मिलान करें

हमेशा वही tokenizer load करें जिसके साथ आपका model train किया गया था। बेमेल vocabulary ऐसी बेकार ids बनाती है जिन्हें model ने कभी नहीं देखा।

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")

Subword pieces

आधुनिक tokenizers दुर्लभ शब्दों को subwords कहलाने वाले छोटे हिस्सों में बाँटते हैं, ताकि अनजान text को भी दर्शाया जा सके।

print(tok.tokenize("tokenization"))

Subwords क्यों बेहतर हैं

Subwords vocabulary को छोटा रखते हुए typos और नए शब्दों को भी संभालते हैं। Model को वास्तविक unknown token बहुत कम मिलता है।

Tokens से ids तक

हर subword एक integer id से map होता है। Text पर tokenizer call करने से model के लिए तैयार वे ids मिल जाती हैं।

enc = tok("Fine-tuning is fun")
print(enc["input_ids"])

विशेष tokens

Tokenizers CLS और SEP जैसे markers जोड़ते हैं, ताकि model जान सके कि sequence कहाँ शुरू और समाप्त होती है। ये विशेष tokens हैं।

समान लंबाई तक padding

Batches में rows की लंबाई समान होनी चाहिए, इसलिए छोटे texts में filler tokens जोड़े जाते हैं। इस चरण को padding कहते हैं।

tok(texts, padding=True)

लंबे text के लिए truncation

Models input length की सीमा तय करते हैं, इसलिए बहुत लंबे text को सीमा में लाने के लिए काट दिया जाता है। truncation चालू करने से हर example सीमा के भीतर रहता है।

tok(texts, truncation=True, max_length=128)

Attention mask

एक attention mask वास्तविक tokens को 1 और padding को 0 चिह्नित करता है, ताकि model filler positions को अनदेखा करे।

print(enc["attention_mask"])

Tensors लौटाएँ

Tokenizer से framework tensors सीधे माँगें, ताकि output बिना अतिरिक्त conversion के training में चला जाए।

tok("hello", return_tensors="pt")

Text में वापस decode करें

Predictions पढ़ने के लिए ids को decode में चलाएँ और tokenizer मूल text को फिर बना देगा, जिसमें special tokens हटा दिए जाएँगे।

print(tok.decode(enc["input_ids"]))

त्वरित जाँच

Batching के दौरान attention mask का काम क्या है?

पुनरावलोकन

Tokenizers text को subword ids में बदलते हैं, special tokens जोड़ते हैं, फिर साफ़ batches के लिए padding, truncation और attention mask संभालते हैं। ✅

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
30
पाठ
120

अक्सर पूछे जाने वाले प्रश्न

क्या “Transformer मॉडल के लिए टोकनीकरण” पाठ निःशुल्क है?

हाँ — NLP Academy अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “Transformer मॉडल के लिए टोकनीकरण” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“Transformer मॉडल के लिए टोकनीकरण” में मैं क्या सीखूँगा?

सबवर्ड, पैडिंग और Attention मास्क आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ NLP Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या NLP Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर NLP Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।

“Transformer मॉडल के लिए टोकनीकरण” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस NLP Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर NLP Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. Transformers लाइब्रेरी का परिचय
  2. Transformer मॉडल के लिए टोकनीकरण
  3. Trainer API से फ़ाइन-ट्यूनिंग
  4. अपने मॉडल का मूल्यांकन और संरक्षण
← NLP Academy पर वापस जाएँ