टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी
स्कोर के दो भाग
टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी, CoddyKit पर NLP Academy का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह NLP Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
एक स्कोर के दो हिस्से
TF-IDF दो ऐसे हिस्सों से बनता है, जिन्हें आपस में गुणा किया जाता है: पद-आवृत्ति और उलटी दस्तावेज़-आवृत्ति। प्रत्येक आधा कच्ची गिनतियों की एक अलग कमजोरी दूर करता है।
पद-आवृत्ति सरल शब्दों में
पद-आवृत्ति यह मापती है कि किसी एक दस्तावेज़ में कोई शब्द कितनी बार आता है। किसी शब्द का अधिक बार आना संकेत देता है कि वह दस्तावेज़ उस विषय पर अधिक केंद्रित है।
TF को सामान्य बनाना
हम अक्सर किसी शब्द की गिनती को दस्तावेज़ की लंबाई से विभाजित करते हैं। यह सामान्यीकरण लंबे दस्तावेज़ों को केवल इसलिए महत्वपूर्ण दिखने से रोकता है क्योंकि उनमें अधिक शब्द होते हैं।
count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))केवल TF पर्याप्त नहीं है
अकेले पद-आवृत्ति अब भी उन भराव शब्दों को अधिक महत्व देती है जो बहुत बार आते हैं। हमें ऐसे शब्दों को दंडित करने के लिए एक दूसरे कारक की आवश्यकता है, जो हर जगह दिखाई देते हैं।
दस्तावेज़-आवृत्ति
दस्तावेज़-आवृत्ति यह गिनती है कि कुल कितने दस्तावेज़ों में कोई शब्द कम-से-कम एक बार आता है। अधिक दस्तावेज़-आवृत्ति का अर्थ है कि वह शब्द आपके पूरे संग्रह में आम है।
इसे उलटें: प्रतिलोम
हम चाहते हैं कि दुर्लभ शब्दों का स्कोर अधिक हो, इसलिए हम उस गिनती को उलट देते हैं। उलटी दस्तावेज़-आवृत्ति तब बढ़ती है जब कोई शब्द कुछ ही दस्तावेज़ों में आता है और हर जगह होने पर घटती है।
लॉग इसे नियंत्रित रखता है
IDF लघुगणक का उपयोग करता है, ताकि बहुत दुर्लभ शब्दों के लिए मान बहुत अधिक न बढ़ जाएँ। log पैमाने को सहज और अलग-अलग पदों के बीच तुलनीय बनाए रखता है।
import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))दोनों को गुणा करें
अंतिम स्कोर बस TF और IDF का गुणनफल है। कोई शब्द तभी प्रभावी होता है जब वह यहाँ बार-बार आए और अन्य जगहों पर दुर्लभ हो—यही वह संयोजन है जिसकी हमें आवश्यकता थी।
tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))किसका स्कोर अधिक होता है
किसी लेख में neuroscience जैसा विषय-संबंधी शब्द अधिक स्कोर पाता है। the जैसा शब्द दब जाता है, क्योंकि उसका IDF लगभग शून्य होता है।
किसका स्कोर कम होता है
लगभग हर दस्तावेज़ में आने वाले शब्दों को बहुत कम भार मिलता है। TF-IDF इस पृष्ठभूमि के शोर का महत्व अपने-आप घटा देता है, बिना किसी मैन्युअल निषेध-शब्द सूची के।
यह इतनी अच्छी तरह क्यों काम करता है
TF-IDF एक साफ़ सूत्र में स्थानीय महत्व और वैश्विक दुर्लभता के बीच संतुलन बनाता है। इसी संतुलन के कारण यह भार-निर्धारण दशकों से खोज और पाठ-प्रसंस्करण का प्रमुख आधार बना हुआ है। ⭐
त्वरित जाँच
उलटी दस्तावेज़-आवृत्ति वाला भाग वास्तव में किस चीज़ को महत्व देता है?
पुनरावलोकन
TF स्थानीय आवृत्ति मापता है, IDF वैश्विक दुर्लभता को महत्व देता है, और उनका गुणनफल TF-IDF होता है। दोनों मिलकर उन शब्दों को उभारते हैं जो वास्तव में किसी दस्तावेज़ की पहचान बताते हैं। ✅
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 30
- पाठ
- 120
अक्सर पूछे जाने वाले प्रश्न
क्या “टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी” पाठ निःशुल्क है?
हाँ — NLP Academy अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। NLP Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी” में मैं क्या सीखूँगा?
स्कोर के दो भाग आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ NLP Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या NLP Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर NLP Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस NLP Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर NLP Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- कच्ची गिनतियों की समस्या
- टर्म फ़्रीक्वेंसी और इनवर्स डॉक्यूमेंट फ़्रीक्वेंसी
- scikit-learn के साथ TF-IDF
- सबसे महत्वपूर्ण शब्द ढूँढ़ना