टोकनीकरण और सामान्यीकरण
पाठ पूर्व-संसाधन की तकनीकें
टोकनीकरण और सामान्यीकरण, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 5 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
पाठ के पूर्वप्रसंस्करण की मूल बातें
टोकन-विभाजन और सामान्यीकरण
पाठ का पूर्वप्रसंस्करण प्राकृतिक भाषा प्रसंस्करण का एक महत्वपूर्ण चरण है। इसमें विश्लेषण के लिए कच्चे पाठ को एक संरचित प्रारूप में बदलना शामिल है। पूर्वप्रसंस्करण के मुख्य चरणों में टोकन-विभाजन और सामान्यीकरण शामिल हैं।

टोकनीकरण क्या है
टोकनीकरण क्या है?
टोकनीकरण टेक्स्ट को टोकन कहलाने वाली छोटी इकाइयों में बाँटने की प्रक्रिया है। टोकन शब्द, वाक्य या अक्षर हो सकते हैं।
उदाहरण के लिए:
टेक्स्ट: "NLP is amazing!"
टोकन: ["NLP", "is", "amazing", "!"]
Python में टोकनीकरण का उदाहरण
NLTK लाइब्रेरी का उपयोग करके हम टेक्स्ट को शब्दों या वाक्यों में टोकनाइज़ कर सकते हैं:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)सामान्यीकरण क्या है
सामान्यीकरण क्या है?
सामान्यीकरण में टेक्स्ट को साफ़ करना और एकरूप बनाना शामिल है। सामान्य सामान्यीकरण तकनीकों में शामिल हैं:
- लोअरकेस में बदलना: पूरे टेक्स्ट को लोअरकेस में बदलना।
- विराम चिह्न हटाना: विराम चिह्नों को हटाना।
- स्टेमिंग: शब्दों को उनके मूल रूप तक छोटा करना (जैसे, "running" → "run")।
- लेमेटाइज़ेशन: संदर्भ का उपयोग करके शब्दों को उनके आधार रूप तक छोटा करना (जैसे, "better" → "good")।
लोअरकेस में बदलना और विराम चिह्न हटाना
टेक्स्ट को लोअरकेस में बदलकर और विराम चिह्न हटाकर सामान्यीकृत करने का तरीका यहाँ दिया गया है:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)स्टेमिंग और लेमेटाइज़ेशन
स्टेमिंग: प्रत्ययों को हटाकर शब्दों को उनके मूल तक छोटा करता है। यह नियम-आधारित प्रक्रिया है और हमेशा मान्य शब्द उत्पन्न नहीं करती।
लेमेटाइज़ेशन: शब्दों को उनके अर्थपूर्ण आधार रूप तक छोटा करने के लिए शब्दावली और व्याकरण के नियमों का उपयोग करता है।
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))स्टॉपवर्ड हटाना
स्टॉपवर्ड सामान्य शब्द होते हैं (जैसे, "is", "and", "the"), जो अक्सर कोई महत्वपूर्ण अर्थ नहीं रखते। इन्हें हटाने से टेक्स्ट विश्लेषण सरल हो सकता है:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)टेक्स्ट पूर्व-संसाधन की चुनौतियाँ
टेक्स्ट पूर्व-संसाधन इन कारणों से चुनौतीपूर्ण हो सकता है:
- अस्पष्टता: "lead" जैसे शब्दों के कई अर्थ हो सकते हैं।
- संदर्भ: लेमेटाइज़ेशन के लिए शब्द के संदर्भ को समझना आवश्यक होता है।
- भाषाई विविधता: अलग-अलग भाषाओं और बोलियों को संभालना।
सारांश और अगले चरण
इस पाठ में हमने:
- टोकन-विभाजन और सामान्यीकरण के बारे में सीखा।
- स्टेमिंग, लेमेटाइज़ेशन और अप्रासंगिक शब्द हटाने जैसी तकनीकों का अध्ययन किया।
- पाइथन के साथ पाठ का पूर्वप्रसंस्करण किया।
अगले चरण में, हम एन-ग्राम प्रतिरूपों का उपयोग करके पाठ के पैटर्न का विश्लेषण करेंगे।

एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “टोकनीकरण और सामान्यीकरण” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “टोकनीकरण और सामान्यीकरण” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
“टोकनीकरण और सामान्यीकरण” में मैं क्या सीखूँगा?
पाठ पूर्व-संसाधन की तकनीकें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 2वाँ पाठ है।
“टोकनीकरण और सामान्यीकरण” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- पाठ डेटा के साथ कार्य करना
- टोकनीकरण और सामान्यीकरण
- N-ग्राम मॉडल
- भावना विश्लेषण की अवधारणाएँ
- ट्रांसफ़ॉर्मर-आधारित मॉडल