Pandas & NumPy Academy · पाठ

रिपोर्ट में निष्कर्षों का सारांश

मुख्य अंतर्दृष्टियों को एम्बेडेड विज़ुअलाइज़ेशन संदर्भों और उपयोगी अगले कदमों सहित संरचित markdown सारांश में संकलित करें।

पाठ 4, कुल 4 में से13 चरण

रिपोर्ट में निष्कर्षों का सारांश, CoddyKit पर Pandas & NumPy Academy का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Pandas & NumPy Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Pandas & NumPy Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

संरचित EDA रिपोर्ट क्यों महत्वपूर्ण है

सैकड़ों प्लॉट और कोड सेल वाली कच्ची Jupyter नोटबुक उन हितधारकों के साथ साझा करना कठिन होता है, जिन्हें निष्कर्षों के आधार पर कार्रवाई करनी होती है। एक संरचित EDA सारांश रिपोर्ट आपके सभी एकचर और द्विचर विश्लेषणों से सबसे महत्वपूर्ण अंतर्दृष्टियों को एक स्पष्ट विवरण में संक्षेपित करती है। अच्छी रिपोर्टें निष्कर्षों (डेटा क्या दर्शाता है) और निहितार्थों (इसके बारे में क्या करना चाहिए) को अलग रखती हैं तथा केवल प्रमुख दावों के समर्थन में दृश्यांकन शामिल करती हैं।

EDA रिपोर्ट के छह अनुभाग

एक पेशेवर EDA रिपोर्ट में आमतौर पर छह अनुभाग होते हैं: 1) डेटासेट का अवलोकन (आकार, स्रोत, समयावधि), 2) डेटा गुणवत्ता संबंधी समस्याएँ (गुम मान, असामान्य मान, डुप्लिकेट और उनका उपचार), 3) प्रमुख चर वितरण (सबसे महत्वपूर्ण संख्यात्मक और श्रेणीबद्ध कॉलम), 4) सहसंबंध और संबंध (मिले हुए सबसे अधिक परिमाण वाले संबंध), 5) उपसमूह अंतर्दृष्टियाँ (व्यावसायिक प्रश्न के लिए महत्वपूर्ण समूह-अंतर), और 6) अनुशंसित अगले चरण (सफाई की कार्रवाइयाँ, मॉडलिंग के सुझाव)।

डेटासेट के अवलोकन वाला अनुभाग लिखना

अवलोकन अनुभाग को प्रोग्राम के माध्यम से तैयार किया जाना चाहिए, ताकि वह हमेशा सटीक रहे। डेटासेट का आकार, कॉलम के नाम और डेटा प्रकार, तारीख की सीमा (यदि लागू हो), तथा डेटासेट के स्रोत या संस्करण को दर्ज करें। इस अनुभाग को गद्य के बजाय कोड में लिखने से वह सामान्य त्रुटि रोकी जा सकती है जिसमें रिपोर्ट में 10,000-पंक्ति वाले डेटासेट का वर्णन किया जाता है, जबकि रिपोर्ट वास्तव में 9,800-पंक्ति वाले साफ़ किए गए संस्करण से बनी होती है।

import pandas as pd
import seaborn as sns

df = sns.load_dataset('titanic')

print('=== DATASET OVERVIEW ===')
print(f'Shape: {df.shape[0]:,} rows x {df.shape[1]} columns')
print(f'Columns: {", ".join(df.columns)}')
print(f'Numeric: {df.select_dtypes("number").shape[1]} columns')
print(f'Categorical: {df.select_dtypes("object").shape[1]} columns')
print(f'Boolean: {df.select_dtypes("bool").shape[1]} columns')
print(f'Total missing cells: {df.isna().sum().sum():,}')
print(f'Duplicate rows: {df.duplicated().sum()}')

डेटा गुणवत्ता वाला अनुभाग लिखना

डेटा गुणवत्ता अनुभाग में मिली प्रत्येक समस्या और उसके लिए लिया गया निर्णय सूचीबद्ध होता है। कॉलमों के साथ तालिका प्रारूप का उपयोग करें: कॉलम, समस्या, गंभीरता (उच्च/मध्यम/निम्न), की गई कार्रवाई। प्रोफ़ाइलिंग परिणामों से इस तालिका की गणना प्रोग्राम के माध्यम से करें, ताकि डेटा बदलने पर यह अपने-आप अपडेट हो जाए। गंभीरता व्यावसायिक प्रभाव को दर्शानी चाहिए—गुम लक्ष्य चर की गंभीरता उच्च होगी, जबकि पूर्वानुमान में उपयोग न होने वाले गुम कॉलम की गंभीरता निम्न हो सकती है।

import pandas as pd
import seaborn as sns

df = sns.load_dataset('titanic')

# Auto-generate data quality table
missing_pct = (df.isna().sum() / len(df) * 100).round(1)
quality = missing_pct[missing_pct > 0].to_frame(name='missing_pct')
quality['severity'] = quality['missing_pct'].apply(
    lambda x: 'High' if x > 30 else ('Medium' if x > 10 else 'Low')
)
quality['action'] = quality['missing_pct'].apply(
    lambda x: 'Drop column' if x > 50 else 'Impute or flag'
)
print(quality.to_string())

बहु-पैनल सारांश आकृतियाँ बनाना

सारांश आकृति कई प्लॉटों को एक ऐसी छवि में जोड़ती है, जिसे रिपोर्ट में शामिल किया जा सकता है। ग्रिड बनाने के लिए plt.subplots(rows, cols) का उपयोग करें और प्रत्येक प्रमुख निष्कर्ष के लिए अपना पैनल निर्धारित करें। आउटपुट प्रारूप के अनुसार उपयुक्त DPI पर savefig() से आकृति सहेजें (स्क्रीन के लिए 150, प्रिंट के लिए 300)। प्रत्येक पैनल का शीर्षक केवल कॉलम के नाम के बजाय स्पष्ट निष्कर्ष वाले कथन से दें, जैसे 'किराया दाईं ओर अत्यधिक झुका हुआ है (skew=4.1)'।

import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns

df = sns.load_dataset('titanic')

fig, axes = plt.subplots(2, 2, figsize=(12, 10))

# 1. Fare distribution
sns.histplot(df['fare'], kde=True, bins=30, ax=axes[0][0])
axes[0][0].set_title('Fare is right-skewed (skew=4.1)')

# 2. Survival by class
survival = df.groupby('class')['survived'].mean().reset_index()
sns.barplot(data=survival, x='class',
            y='survived', order=['First', 'Second', 'Third'], ax=axes[0][1])
axes[0][1].set_title('Survival Rate Drops by Class')

# 3. Age distribution
sns.histplot(df['age'].dropna(), kde=True, bins=25, ax=axes[1][0], color='coral')
axes[1][0].set_title('Age: Near-Normal, Missing 20%')

# 4. Embarkation counts
sns.countplot(data=df, x='embarked', ax=axes[1][1], palette='Set2')
axes[1][1].set_title('Most Boarded at Southampton')

plt.tight_layout()
plt.savefig('/tmp/eda_summary.png', dpi=150, bbox_inches='tight')
plt.show()
print('Saved: /tmp/eda_summary.png')

निष्कर्षों को विवरणात्मक पाठ के रूप में लिखना

प्रत्येक प्रमुख निष्कर्ष को तकनीकी विवरण के बजाय व्यवसाय-संबंधी वाक्य के रूप में लिखा जाना चाहिए। 'किराया कॉलम का skewness=4.1 है' लिखने के बजाय लिखें: 'टिकट की कीमतें दाईं ओर अत्यधिक झुकी हुई हैं—प्रथम श्रेणी के यात्रियों की एक छोटी संख्या ने माध्य किराये से 10 गुना से अधिक भुगतान किया, जिससे माध्य कीमतों का उपयोग करने वाले राजस्व विश्लेषण प्रभावित हो सकते हैं।' सांख्यिकीय अवलोकन को व्यावसायिक निहितार्थ में बदलना ही EDA रिपोर्टों को गैर-तकनीकी हितधारकों के लिए मूल्यवान बनाता है।

Markdown रिपोर्ट प्रोग्राम के माध्यम से बनाना

आप Python से सीधे EDA रिपोर्टों को markdown फ़ाइलों के रूप में लिख सकते हैं। Markdown शीर्षकों, बुलेट बिंदुओं और शामिल की गई छवि कड़ियों वाली एक स्ट्रिंग बनाएँ, फिर उसे .md फ़ाइल में लिखें। यह तरीका ऐसी पुनरुत्पाद्य रिपोर्टें बनाता है, जो अंतर्निहित डेटा बदलने पर अपने-आप अपडेट हो जाती हैं। इसलिए इन्हें डेटा पाइपलाइन के आउटपुट आर्टिफैक्ट या Git रिपॉज़िटरी में एकीकृत करना उपयुक्त होता है।

import pandas as pd
import seaborn as sns

df = sns.load_dataset('titanic')

# Build a simple markdown report
lines = [
    '# EDA Summary Report: Titanic Dataset',
    '',
    '## Overview',
    f'- **Rows:** {len(df):,}',
    f'- **Columns:** {df.shape[1]}',
    f'- **Total Missing Cells:** {df.isna().sum().sum():,}',
    '',
    '## Key Findings',
    '- First-class passengers had a 63% survival rate vs 24% for third class.',
    '- Fare is extremely right-skewed (skew=4.1); use log transform before modelling.',
    '- Age is missing in 20% of rows — median imputation recommended.',
    '',
    '## Recommended Next Steps',
    '1. Impute age with median grouped by class.',
    '2. Drop the cabin column (77% missing).',
    '3. Log-transform fare before any regression modelling.',
]

with open('/tmp/eda_report.md', 'w') as f:
    f.write('\n'.join(lines))

print('Report written to /tmp/eda_report.md')
print('\n'.join(lines[:10]))

Jupyter से HTML में निर्यात करना

Jupyter नोटबुक को jupyter nbconvert --to html notebook.ipynb का उपयोग करके HTML या PDF में निर्यात किया जा सकता है। इसमें सभी प्लॉट, कोड और markdown सेल एक साझा की जा सकने वाली फ़ाइल में सुरक्षित रहते हैं, जिसे देखने के लिए Python इंस्टॉल करने की आवश्यकता नहीं होती। पूरी तरह स्वचालित डेटा पाइपलाइन के लिए नोटबुक को papermill से प्रोग्राम के माध्यम से चलाएँ: papermill input.ipynb output.ipynb -p date '2024-01-01'। यह नोटबुक में पैरामीटर भरकर उसे स्क्रिप्ट की तरह चलाता है।

# To export a Jupyter notebook to HTML:
# jupyter nbconvert --to html eda_notebook.ipynb

# To parameterise and run with papermill:
# pip install papermill
# papermill eda_template.ipynb eda_2024.ipynb -p date '2024-01-01' -p min_rows 1000

# The output notebook can then be exported:
# jupyter nbconvert --to html eda_2024.ipynb
print('Jupyter nbconvert and papermill automate report generation.')

कार्रवाई योग्य अगले चरणों की संरचना बनाना

अनुशंसित अगले चरण वाला अनुभाग अक्सर EDA रिपोर्ट का सबसे अधिक पढ़ा जाने वाला भाग होता है। इसे प्राथमिकता के अनुसार बनाई गई जाँच-सूची के रूप में व्यवस्थित करें: P1 (बाधक)—वे समस्याएँ जिन्हें किसी भी विश्लेषण के मान्य होने से पहले ठीक करना आवश्यक है (जैसे गलत पहचाने गए डेटा प्रकार), P2 (महत्वपूर्ण)—वे सफाई कार्रवाइयाँ जो मॉडल के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करती हैं (जैसे असामान्य मानों का उपचार), P3 (अच्छा होगा)—समृद्धि के विचार और अतिरिक्त डेटा स्रोत, जिनका पता लगाया जा सकता है। इस ढाँचे से टीम के लिए प्रयासों का उचित आवंटन करना आसान हो जाता है।

शीघ्र रिपोर्टिंग के लिए pandas-profiling का उपयोग

ydata-profiling (pip install ydata-profiling) एक ही कॉल में व्यापक HTML रिपोर्ट बनाता है। रिपोर्ट में अवलोकन आँकड़े, चर वितरण, सहसंबंध, गुम मानों के पैटर्न और डुप्लिकेट का पता लगाना शामिल होता है—अर्थात मैन्युअल EDA रिपोर्ट के सभी अनुभाग। किसी परियोजना की शुरुआत में त्वरित अन्वेषण के लिए इसका उपयोग करें, फिर अपने विशिष्ट व्यावसायिक प्रश्न के लिए सबसे प्रासंगिक निष्कर्षों को उभारने वाली कस्टम सारांश रिपोर्ट लिखें।

# pip install ydata-profiling
# from ydata_profiling import ProfileReport
# import seaborn as sns

# df = sns.load_dataset('titanic')
# profile = ProfileReport(df, title='Titanic EDA')
# profile.to_file('titanic_eda.html')  # interactive HTML
# profile.to_notebook_iframe()          # inline in Jupyter

# Key sections in the generated report:
# - Overview: shape, missing, duplicates
# - Variables: per-column statistics and plots  
# - Correlations: Pearson, Spearman, Cramers V
# - Missing values: heatmap and dendrogram
# - Duplicates: full list of duplicate rows
print('ydata-profiling generates full EDA reports with one function call.')

EDA रिपोर्ट में बचने योग्य गलत पैटर्न

EDA रिपोर्ट के सामान्य गलत पैटर्न हैं: प्रत्येक कॉलम के लिए हर प्लॉट दिखाना (इससे 50 पृष्ठों वाली ऐसी रिपोर्ट बनती है जिसे कोई नहीं पढ़ता—5 से 10 सबसे महत्वपूर्ण प्लॉट चुनें), व्याख्या के बिना तथ्य लिखना ('आयु में 177 शून्य मान हैं'—तो हमें क्या करना चाहिए?), सफाई के बाद रिपोर्ट को दोबारा अपडेट न करना (डेटा साफ़ करने के बाद समस्याएँ हल हुईं या नहीं, यह सुनिश्चित करने के लिए प्रोफ़ाइलिंग फिर से करें), और सफाई के कोड को विश्लेषण में मिला देना (डेटा की सफाई को EDA विवरण से अलग रखें)।

त्वरित जाँच

इस पाठ में EDA रिपोर्ट लिखने की अपनी समझ जाँचें।

पाठ का पुनरावलोकन

इस पाठ में आपने सीखा: EDA रिपोर्टों को छह अनुभागों (अवलोकन, गुणवत्ता, वितरण, सहसंबंध, उपसमूह अंतर्दृष्टियाँ, अगले चरण) में व्यवस्थित करना, बहु-पैनल सारांश आकृतियाँ और markdown रिपोर्टें प्रोग्राम के माध्यम से बनाना, तथा सांख्यिकीय निष्कर्षों को व्यवसाय-संबंधी भाषा में बदलना। अब हम उन्नत अनुक्रमण तकनीकों—MultiIndex बनाना और Pandas में पदानुक्रमित चयन—का अध्ययन करेंगे।

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
30
पाठ
120

अक्सर पूछे जाने वाले प्रश्न

क्या “रिपोर्ट में निष्कर्षों का सारांश” पाठ निःशुल्क है?

हाँ—“रिपोर्ट में निष्कर्षों का सारांश” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Pandas & NumPy Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Pandas & NumPy Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“रिपोर्ट में निष्कर्षों का सारांश” में मैं क्या सीखूँगा?

मुख्य अंतर्दृष्टियों को एम्बेडेड विज़ुअलाइज़ेशन संदर्भों और उपयोगी अगले कदमों सहित संरचित markdown सारांश में संकलित करें। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Pandas & NumPy Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या Pandas & NumPy Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Pandas & NumPy Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।

“रिपोर्ट में निष्कर्षों का सारांश” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस Pandas & NumPy Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर Pandas & NumPy Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. डेटासेट प्रोफ़ाइल जाँच-सूची
  2. एकचर विश्लेषण
  3. द्विचर और सहसंबंध विश्लेषण
  4. रिपोर्ट में निष्कर्षों का सारांश
← Pandas & NumPy Academy पर वापस जाएँ