टोकनीकरण और सामान्यीकरण
टेक्स्ट पूर्व-प्रसंस्करण की तकनीकें
टोकनीकरण और सामान्यीकरण, CoddyKit पर Python Academy का एक निःशुल्क पाठ है। यह 5 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Python Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
पाठ पूर्व-प्रसंस्करण की मूल बातें
टोकनीकरण और सामान्यीकरण
पाठ पूर्व-प्रसंस्करण प्राकृतिक भाषा संसाधन का एक महत्वपूर्ण चरण है। इसमें कच्चे पाठ को विश्लेषण के लिए एक संरचित प्रारूप में बदलना शामिल है। पूर्व-प्रसंस्करण के प्रमुख चरणों में टोकनीकरण और सामान्यीकरण शामिल हैं।

टोकनीकरण क्या है
टोकनीकरण पाठ को छोटी इकाइयों में बाँटने की प्रक्रिया है, जिन्हें टोकन कहा जाता है। टोकन words, वाक्य या वर्ण हो सकते हैं।
उदाहरण के लिए:
पाठ: "NLP is amazing!"
टोकन: ["NLP", "is", "amazing", "!"]
पाइथन में टोकनीकरण का उदाहरण
NLTK पुस्तकालय का उपयोग करके, हम पाठ को words या वाक्यों में टोकनीकृत कर सकते हैं:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)सामान्यीकरण क्या है
सामान्यीकरण में पाठ को साफ़ करना और एकरूप बनाना शामिल है। सामान्य सामान्यीकरण तकनीकों में ये शामिल हैं:
- लोअरकेस में बदलना: पूरे पाठ को लोअरकेस में बदलना।
- विराम चिह्न हटाना: विराम चिह्नों को हटाना।
- स्टेमिंग: words को उनके मूल रूप में घटाना (जैसे, "दौड़ना" → "दौड़")।
- लेमेटाइज़ेशन: संदर्भ का उपयोग करके words को उनके आधार रूप में घटाना (जैसे, "बेहतर" → "अच्छा")।
लोअरकेस में बदलना और विराम चिह्न हटाना
पाठ को लोअरकेस में बदलकर और विराम चिह्न हटाकर सामान्यीकृत करने का तरीका यहाँ दिया गया है:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)स्टेमिंग और लेमेटाइज़ेशन
स्टेमिंग: प्रत्ययों को हटाकर words को उनके मूल रूप में घटाता है। यह नियम-आधारित होता है और हमेशा मान्य शब्द नहीं बना पाता।
लेमेटाइज़ेशन: शब्दावली और व्याकरण के नियमों का उपयोग करके words को उनके अर्थपूर्ण आधार रूप में घटाता है।
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))रोक-शब्दों को हटाना
रोक-शब्द सामान्य शब्द होते हैं (जैसे, "है", "और", "वह"), जिनमें अक्सर महत्वपूर्ण अर्थ नहीं होता। इन्हें हटाने से पाठ विश्लेषण सरल हो सकता है:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)पाठ पूर्व-प्रसंस्करण की चुनौतियाँ
पाठ पूर्व-प्रसंस्करण इन कारणों से चुनौतीपूर्ण हो सकता है:
- अस्पष्टता: "लीड" जैसे शब्दों के कई अर्थ हो सकते हैं।
- संदर्भ: लेमेटाइज़ेशन के लिए शब्द के संदर्भ को समझना आवश्यक होता है।
- भाषाई विविधता: अलग-अलग भाषाओं और बोलियों को संभालना।
सारांश और अगले चरण
इस पाठ में हमने:
- टोकनीकरण और सामान्यीकरण के बारे में सीखा।
- स्टेमिंग, लेमेटाइज़ेशन और रोक-शब्दों को हटाने जैसी तकनीकों का अध्ययन किया।
- पाइथन के साथ पाठ पूर्व-प्रसंस्करण का अभ्यास किया।
इसके बाद, हम एन-ग्राम मॉडलों का उपयोग करके पाठ के पैटर्न का विश्लेषण करेंगे।

एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 76
- पाठ
- 320
अक्सर पूछे जाने वाले प्रश्न
क्या “टोकनीकरण और सामान्यीकरण” पाठ निःशुल्क है?
हाँ—“टोकनीकरण और सामान्यीकरण” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Python Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
“टोकनीकरण और सामान्यीकरण” में मैं क्या सीखूँगा?
टेक्स्ट पूर्व-प्रसंस्करण की तकनीकें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Python Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या Python Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Python Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 2वाँ पाठ है।
“टोकनीकरण और सामान्यीकरण” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस Python Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर Python Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- टेक्स्ट डेटा के साथ काम करना
- टोकनीकरण और सामान्यीकरण
- N-Gram मॉडल
- भावना विश्लेषण की अवधारणाएँ
- Transformer-आधारित मॉडल