Python For Kids · पाठ

Data Cleaning और Preprocessing

Missing Data संभालना, Duplicates हटाना और Analysis के लिए Raw Data को Preprocess करना समझें

पाठ 4, कुल 5 में से11 चरण

Data Cleaning और Preprocessing, CoddyKit पर Python For Kids का एक निःशुल्क पाठ है। यह 5 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Python For Kids सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Python For Kids पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

डेटा की सफ़ाई का परिचय

डेटा की सफ़ाई और पूर्व-प्रसंस्करण

कच्चा डेटा अक्सर अव्यवस्थित होता है और उसका विश्लेषण करने से पहले उसे साफ़ करना तथा पूर्व-प्रसंस्करण करना आवश्यक होता है। आपके विश्लेषण की गुणवत्ता और सटीकता सुनिश्चित करने के लिए ये चरण महत्वपूर्ण हैं।

इस पाठ में आप अनुपलब्ध डेटा को संभालने, डुप्लिकेट हटाने और विश्लेषण के लिए डेटा का पूर्व-प्रसंस्करण करने की तकनीकें सीखेंगे।

Data Cleaning और Preprocessing — चित्र 1

डेटा शुद्धिकरण क्या है?

डेटा शुद्धिकरण में डेटा-समुच्चय की त्रुटियों की पहचान करना और उन्हें ठीक करना शामिल है। सामान्य कार्यों में शामिल हैं:

  • अनुपस्थित मानों को संभालना।
  • डुप्लिकेट हटाना।
  • प्रारूपों को मानकीकृत करना।

गुम डेटा संभालना

गुम डेटा कई कारणों से हो सकता है। आप इसे इस प्रकार संभाल सकते हैं:

  • गुम मानों को किसी डिफ़ॉल्ट मान या mean/माध्यिका से भरना।
  • बहुत अधिक गुम मानों वाली पंक्तियों या स्तंभों को हटाना।
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

डुप्लिकेट हटाना

डुप्लिकेट डेटा आपके विश्लेषण को प्रभावित कर सकता है। डुप्लिकेट हटाने के लिए Pandas का उपयोग करें:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

डेटा का मानकीकरण

डेटा का मानकीकरण एकरूपता सुनिश्चित करता है। उदाहरण के लिए, आप तारीख के प्रारूप या पाठ के अक्षर-रूप को मानकीकृत कर सकते हैं:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

डेटा में रूपांतरण

स्केलिंग और एन्कोडिंग जैसे रूपांतरण, पूर्वप्रसंस्करण का हिस्सा हैं:

  • स्केलिंग: संख्यात्मक मानों को मानकीकृत करना।
  • एन्कोडिंग: श्रेणीबद्ध डेटा को संख्यात्मक रूप में बदलना।
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

डेटा की स्केलिंग

स्केलिंग यह सुनिश्चित करती है कि संख्यात्मक डेटा एक ही पैमाने पर हो, जो मशीन लर्निंग एल्गोरिदम के लिए आवश्यक है:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

डेटा का सत्यापन

सत्यापन यह सुनिश्चित करता है कि डेटा गुणवत्ता के मानकों को पूरा करता है। उदाहरण के लिए, बाहरी मानों या अमान्य मानों की जाँच करें:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

डेटा की सफ़ाई में सामान्य गलतियाँ

इन गलतियों से बचें:

  • गुम डेटा को नज़रअंदाज़ करना, जिससे विश्लेषण गलत हो सकता है।
  • प्रारूपों को मानकीकृत न करना, जिससे असंगतियाँ उत्पन्न होती हैं।
  • सत्यापन की अनदेखी करना, जिससे बाद के कार्यों में त्रुटियाँ हो सकती हैं।

हमने क्या सीखा?

इस पाठ में आपने सीखा:

  • गुम डेटा को संभालना और डुप्लिकेट हटाना।
  • विश्लेषण के लिए डेटा को मानकीकृत, रूपांतरित और स्केल करना।
  • डेटा की गुणवत्ता का सत्यापन करना और बाहरी मानों की पहचान करना।
  • सटीक विश्लेषण के लिए डेटा की सफ़ाई का महत्व।

बहुत बढ़िया! अब अगले विषय पर चलते हैं।

Data Cleaning और Preprocessing — चित्र 11
शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
22
पाठ
94

अक्सर पूछे जाने वाले प्रश्न

क्या “Data Cleaning और Preprocessing” पाठ निःशुल्क है?

हाँ—“Data Cleaning और Preprocessing” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Python For Kids पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Python For Kids पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

“Data Cleaning और Preprocessing” में मैं क्या सीखूँगा?

Missing Data संभालना, Duplicates हटाना और Analysis के लिए Raw Data को Preprocess करना समझें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Python For Kids का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या Python For Kids शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Python For Kids शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 4वाँ पाठ है।

“Data Cleaning और Preprocessing” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस Python For Kids पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर Python For Kids पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. Data Science क्या है
  2. Data Science में Python की भूमिका
  3. Data Science के लिए Data Structures
  4. Data Cleaning और Preprocessing
  5. Exploratory Data Analysis (EDA)
← Python For Kids पर वापस जाएँ