Data Science Academy · पाठ

संख्याओं को स्केल और सामान्यीकृत करना

सुविधाओं को समान आधार पर लाना

पाठ 3, कुल 4 में से13 चरण

संख्याओं को स्केल और सामान्यीकृत करना, CoddyKit पर Data Science Academy का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Data Science Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Data Science Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

संख्याओं को स्केल क्यों करें

आयु 0 से 90 तक होती है, जबकि आय लाखों तक हो सकती है। स्केलिंग के बिना बड़ी संख्याएँ हावी हो जाती हैं और छोटी संख्याओं के प्रभाव को चुपचाप दबा देती हैं। ⚖️

दूरी-आधारित मॉडल परवाह करते हैं

दूरी मापने वाले मॉडल, जैसे k-NN और k-means, स्केल के प्रति बहुत संवेदनशील होते हैं। बिना स्केल किए गए फीचर सबसे बड़े कॉलम को सारी शक्ति दे देते हैं।

मानकीकरण

मानकीकरण किसी कॉलम को औसत 0 और मानक विचलन 1 पर पुनःस्केल करता है। मान यह बताते हैं कि वे औसत से कितने मानक विचलन दूर हैं।

StandardScaler

StandardScaler आपके लिए मानकीकरण लागू करता है। इसे अपने डेटा पर fit करें, फिर किसी भी कॉलम को z-स्कोर में transform करें।

from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])

सामान्यीकरण

सामान्यीकरण मानों को एक निश्चित सीमा में, आमतौर पर 0 से 1 तक, सीमित करता है। सबसे छोटा मान 0 और सबसे बड़ा मान 1 में बदल जाता है।

MinMaxScaler

मानों को 0 से 1 तक पुनःस्केल करने के लिए MinMaxScaler का उपयोग करें। यह सीमा निर्धारित करते हुए आपके डेटा का आकार बनाए रखता है।

from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])

मानकीकरण या सामान्यीकरण

जब डेटा लगभग घंटी के आकार का हो या उसमें असामान्य मान हों, तब मानकीकरण का उपयोग करें। जब 0 से 1 की सख्त सीमा चाहिए, तब सामान्यीकरण चुनें।

असामान्य मान MinMax को प्रभावित करते हैं

एक बहुत बड़ा मान MinMax के अंतर्गत बाकी सभी मानों को शून्य के पास दबा सकता है। जब असामान्य मान हावी हों, तब RobustScaler उनका बेहतर प्रतिरोध करता है।

from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])

केवल प्रशिक्षण डेटा पर Fit करें

स्केलर को केवल प्रशिक्षण डेटा पर fit करें, फिर परीक्षण सेट पर transform करें। हर डेटा पर fit करने से परीक्षण की जानकारी आपके मॉडल में लीक हो जाती है।

scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)

पाइपलाइन के भीतर स्केल करें

स्केलर और मॉडल को एक पाइपलाइन में साथ रखें। तब यह क्रॉस-वैलिडेशन के दौरान केवल प्रशिक्षण खंड पर fit होगा और बिना अतिरिक्त प्रयास के डेटा लीकेज रोक देगा।

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)

ट्री को इसकी आवश्यकता नहीं होती

रैंडम फ़ॉरेस्ट जैसे ट्री-आधारित मॉडल सीमाओं पर विभाजित होते हैं, इसलिए स्केलिंग से परिणाम शायद ही बदलते हैं। स्केलिंग को दूरी-आधारित और रैखिक विधियों के लिए बचाकर रखें।

त्वरित जाँच

आपको हर फीचर को 0 से 1 की सख्त सीमा में पुनःस्केल करना है। कौन-सा स्केलर उपयुक्त होगा?

पुनरावलोकन: स्केलिंग

आपने फीचरों को समान आधार पर रखा: z-स्कोर के लिए StandardScaler, 0 से 1 के लिए MinMaxScaler और असामान्य मानों के लिए RobustScaler। हमेशा केवल प्रशिक्षण डेटा पर fit करें। 🎉

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
30
पाठ
120

अक्सर पूछे जाने वाले प्रश्न

क्या “संख्याओं को स्केल और सामान्यीकृत करना” पाठ निःशुल्क है?

हाँ—“संख्याओं को स्केल और सामान्यीकृत करना” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Data Science Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Data Science Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“संख्याओं को स्केल और सामान्यीकृत करना” में मैं क्या सीखूँगा?

सुविधाओं को समान आधार पर लाना आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Data Science Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या Data Science Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Data Science Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“संख्याओं को स्केल और सामान्यीकृत करना” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस Data Science Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर Data Science Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. संख्याओं को श्रेणियों में बाँटना
  2. श्रेणीबद्ध स्तंभों को कूटबद्ध करना
  3. संख्याओं को स्केल और सामान्यीकृत करना
  4. तिथियों और पाठ से सुविधाएँ बनाना
← Data Science Academy पर वापस जाएँ