पाइथन के साथ एआई सीखें · पाठ

असामान्य मानों की पहचान और हटाना

Z-score विधि, IQR विधि, आइसोलेशन फ़ॉरेस्ट की अवधारणा और व्यवहार में असामान्य मानों का प्रबंधन।

पाठ 1, कुल 4 में से13 चरण

असामान्य मानों की पहचान और हटाना, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

आउटलाईयर क्या है?

आउटलाईयर ऐसा मान है जो बाकी डेटा से बहुत दूर होता है। यह वास्तविक चरम मान, डेटा प्रविष्टि की त्रुटि या सेंसर की खराबी हो सकता है। आउटलाईयर mean, प्रसरण और मॉडलों को विकृत कर सकते हैं, इसलिए उन्हें सोच-समझकर पहचानें।

Z-स्कोर विधि

z-स्कोर बताता है कि कोई मान mean से कितने मानक विचलन दूर है: z = (x - mean) / std। एक सामान्य नियम |z| > 3 वाले प्रत्येक बिंदु को आउटलाईयर के रूप में चिह्नित करता है।

import numpy as np
data = np.array([10, 12, 11, 13, 12, 100])
z = (data - data.mean()) / data.std()
print(np.round(z, 2))

scipy zscore से चिह्नित करना

scipy.stats.zscore किसी सारणी के लिए z-स्कोर की गणना करता है। इसे किसी सीमा के साथ मिलाकर आउटलाईयर का बूलियन मास्क बनाएँ।

from scipy import stats
z = np.abs(stats.zscore(data))
outliers = z > 3
print(data[outliers])

Z-स्कोर की सीमा

z-स्कोर mean और std का उपयोग करता है, और आउटलाईयर स्वयं इन दोनों को प्रभावित कर देते हैं। बहुत अधिक विषम डेटा या चरम मानों के साथ z-स्कोर कुछ आउटलाईयर को पहचान नहीं पाते। IQR विधि अधिक मज़बूत है।

IQR विधि

चतुर्थक अंतराल IQR = Q3 - Q1 बीच के 50 प्रतिशत डेटा को समेटता है। इसकी गणना चतुर्थकों से की जाती है, जिन्हें आउटलाईयर बहुत कम प्रभावित करते हैं, इसलिए यह विधि मज़बूत होती है।

q1 = np.percentile(data, 25)
q3 = np.percentile(data, 75)
iqr = q3 - q1
print(q1, q3, iqr)

IQR की सीमाएँ

Tukey की सीमाएँ दायरे तय करती हैं: lower = Q1 - 1.5*IQR, upper = Q3 + 1.5*IQR। इनके बाहर के प्रत्येक मान को चिह्नित किया जाता है। यही नियम boxplot के मूँछों को भी निर्धारित करता है।

lower = q1 - 1.5 * iqr
upper = q3 + 1.5 * iqr
mask = (data < lower) | (data > upper)
print(data[mask])   # outliers

boxplot दृश्यांकन

boxplot IQR नियम को दृश्य रूप में दिखाता है: बॉक्स Q1 से Q3 तक होता है, रेखा median होती है, मूँछें सीमाओं तक पहुँचती हैं और इनके बाहर के बिंदु अलग-अलग आउटलाईयर बिंदुओं के रूप में दिखाए जाते हैं।

# import matplotlib.pyplot as plt
# plt.boxplot(data)
# plt.show()

आउटलाईयर हटाना

चिह्नित करने के बाद, आप आउटलाईयर वाली पंक्तियों को DROP कर सकते हैं। ऐसा सावधानी से करें, क्योंकि वास्तविक डेटा हटाने से परिणामों में पक्षपात आ सकता है। आपने क्या और क्यों हटाया, इसका रिकॉर्ड रखें।

clean = data[~mask]
print(clean)   # outlier removed

np.clip से विंसरीकरण

हटाने के बजाय, विंसरीकरण में np.clip की सहायता से चरम मानों को चुनी हुई सीमाओं पर CAP किया जाता है। इससे पंक्तियों की संख्या बनी रहती है और चरम मानों का प्रभाव नियंत्रित होता है।

capped = np.clip(data, lower, upper)
print(capped)   # extreme value pulled to the upper fence

प्रतिशतकों तक clip करना

विंसरीकरण में एक सामान्य विकल्प मानों को पहले और 99वें प्रतिशतक तक clip करना है। इससे सममित रूप से केवल सबसे चरम 2 प्रतिशत मान हटते हैं।

lo, hi = np.percentile(data, [1, 99])
print(np.clip(data, lo, hi))

REMOVE या CAP?

निर्णय संदर्भ के आधार पर लें: स्पष्ट त्रुटियों (असंभव मानों) को REMOVE करें, वास्तविक लेकिन चरम मानों को बनाए रखना हो तो उन्हें CAP करें, और जब आउटलाईयर ही संकेत हों, जैसे धोखाधड़ी का पता लगाते समय, उन्हें KEEP करें। निर्णय का दस्तावेज़ बनाएँ।

त्वरित जाँच

आउटलाईयर के अपने ज्ञान की जाँच करें।

पुनरावलोकन

आउटलाईयर प्रबंधन टूलकिट:

  • z-स्कोर: scipy.stats.zscore के माध्यम से |z| > 3 को चिह्नित करें (यह आउटलाईयर के प्रति संवेदनशील है)
  • IQR सीमाएँ: Q1-1.5*IQR से Q3+1.5*IQR तक (मज़बूत, boxplot का आधार)
  • वास्तविक त्रुटियों को हटाएँ; चरम मानों को CAP करने के लिए np.clip से विंसरीकरण करें
  • मान हटाने या CAP करने का कारण हमेशा दर्ज करें
शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
225

अक्सर पूछे जाने वाले प्रश्न

क्या “असामान्य मानों की पहचान और हटाना” पाठ निःशुल्क है?

हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “असामान्य मानों की पहचान और हटाना” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“असामान्य मानों की पहचान और हटाना” में मैं क्या सीखूँगा?

Z-score विधि, IQR विधि, आइसोलेशन फ़ॉरेस्ट की अवधारणा और व्यवहार में असामान्य मानों का प्रबंधन। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“असामान्य मानों की पहचान और हटाना” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. असामान्य मानों की पहचान और हटाना
  2. श्रेणीबद्ध चर का एन्कोडिंग
  3. फ़ीचर स्केलिंग: सामान्यीकरण और मानकीकरण
  4. पूर्वप्रसंस्करण पाइपलाइन बनाना
← पाइथन के साथ एआई सीखें पर वापस जाएँ