डेटा क्लीनिंग और प्रीप्रोसेसिंग
गायब डेटा संभालना, डुप्लिकेट हटाना और विश्लेषण के लिए कच्चे डेटा को प्रीप्रोसेस करना समझें
डेटा क्लीनिंग और प्रीप्रोसेसिंग, CoddyKit पर Python Academy का एक निःशुल्क पाठ है। यह 5 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Python Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
डेटा सफाई का परिचय
डेटा सफाई और पूर्व-प्रसंस्करण
कच्चा डेटा अक्सर अव्यवस्थित होता है और उसका विश्लेषण करने से पहले उसे साफ़ करने तथा पूर्व-प्रसंस्करण की आवश्यकता होती है। आपके विश्लेषण की गुणवत्ता और सटीकता सुनिश्चित करने के लिए ये चरण अत्यंत महत्वपूर्ण हैं।
इस पाठ में आप अनुपस्थित डेटा को संभालने, दोहराव हटाने और विश्लेषण के लिए डेटा का पूर्व-प्रसंस्करण करने की तकनीकों के बारे में जानेंगे।

डेटा सफाई क्या है?
डेटा सफाई में डेटा-संग्रह की त्रुटियों की पहचान करना और उन्हें ठीक करना शामिल है। सामान्य कार्यों में शामिल हैं:
- अनुपस्थित मानों को संभालना।
- दोहराव हटाना।
- प्रारूपों का मानकीकरण करना।
अनुपस्थित डेटा को संभालना
अनुपस्थित डेटा विभिन्न कारणों से हो सकता है। आप इसे इन तरीकों से संभाल सकते हैं:
- अनुपस्थित मानों को किसी डिफ़ॉल्ट मान या mean/माध्यिका से भरना।
- बहुत अधिक अनुपस्थित मानों वाली पंक्तियों या स्तंभों को हटाना।
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)दोहराव हटाना
दोहराया गया डेटा आपके विश्लेषण को विकृत कर सकता है। दोहराव हटाने के लिए Pandas का उपयोग करें:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)डेटा का मानकीकरण
डेटा का मानकीकरण एकरूपता सुनिश्चित करता है। उदाहरण के लिए, आप तारीख के प्रारूप या पाठ के अक्षर-रूप को मानकीकृत कर सकते हैं:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)डेटा का रूपांतरण
स्केल के अनुसार बदलना और कोड-रूपांतरण जैसी प्रक्रियाएँ पूर्व-प्रसंस्करण का हिस्सा हैं:
- मापानुसार रूपांतरण: संख्यात्मक मानों का मानकीकरण करना।
- कोड-रूपांतरण: वर्गीय डेटा को संख्यात्मक रूप में बदलना।
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)डेटा का पैमानीकरण
पैमानीकरण यह सुनिश्चित करता है कि संख्यात्मक डेटा एक ही पैमाने पर हो, जो मशीन अधिगम के एल्गोरिदम के लिए आवश्यक है:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)डेटा का सत्यापन
सत्यापन यह सुनिश्चित करता है कि डेटा गुणवत्ता मानकों को पूरा करता है। उदाहरण के लिए, असामान्य मानों या अमान्य मानों की जाँच करें:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)डेटा शोधन में सामान्य गलतियाँ
यहाँ कुछ ऐसी गलतियाँ दी गई हैं जिनसे बचना चाहिए:
- अनुपलब्ध डेटा को अनदेखा करना, जिससे विश्लेषण गलत हो सकता है।
- प्रारूपों को मानकीकृत न करना, जिससे असंगतियाँ उत्पन्न होती हैं।
- सत्यापन की अनदेखी करना, जिससे आगे के कार्यों में त्रुटियाँ हो सकती हैं।
हमने क्या सीखा?
इस पाठ में आपने सीखा:
- अनुपलब्ध डेटा को संभालना और दोहराई गई प्रविष्टियों को हटाना।
- विश्लेषण के लिए डेटा को मानकीकृत, रूपांतरित और पैमाने पर लाना।
- डेटा की गुणवत्ता का सत्यापन करना और असामान्य मानों की पहचान करना।
- सटीक विश्लेषण के लिए डेटा शोधन का महत्व।
बहुत अच्छा! अब अगले विषय पर चलते हैं।

एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 76
- पाठ
- 320
अक्सर पूछे जाने वाले प्रश्न
क्या “डेटा क्लीनिंग और प्रीप्रोसेसिंग” पाठ निःशुल्क है?
हाँ—“डेटा क्लीनिंग और प्रीप्रोसेसिंग” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Python Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
“डेटा क्लीनिंग और प्रीप्रोसेसिंग” में मैं क्या सीखूँगा?
गायब डेटा संभालना, डुप्लिकेट हटाना और विश्लेषण के लिए कच्चे डेटा को प्रीप्रोसेस करना समझें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Python Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या Python Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Python Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 4वाँ पाठ है।
“डेटा क्लीनिंग और प्रीप्रोसेसिंग” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस Python Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर Python Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- डेटा साइंस क्या है
- डेटा साइंस में Python की भूमिका
- डेटा साइंस के लिए डेटा संरचनाएँ
- डेटा क्लीनिंग और प्रीप्रोसेसिंग
- अन्वेषणात्मक डेटा विश्लेषण (EDA)