एकत्रित डेटा का कुशल भंडारण
CSV/JSON/Parquet में सहेजना, सुरक्षित रूप से जोड़ना, डुप्लिकेट हटाना और क्रमिक संग्रह।
एकत्रित डेटा का कुशल भंडारण, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
कच्ची प्रतिक्रियाओं से संग्रहित डेटा तक
डेटा एकत्र करने के बाद आपको उसे संग्रहित करना होता है, ताकि उसे फिर से लोड, साझा और विश्लेषित किया जा सके। सही प्रारूप और कुछ अच्छी आदतें गति तथा डिस्क उपयोग में बड़ा अंतर डालती हैं।
इस पाठ में CSV, Parquet, बैच जोड़ना और डुप्लिकेट हटाना शामिल है।
JSON से DataFrame तक
API प्रतिक्रियाएँ सामान्यतः डिक्शनरियों की सूचियाँ होती हैं। pd.DataFrame उन्हें सीधे संग्रहण के लिए तैयार तालिका में बदल देता है।
import pandas as pd
records = [
{"id": 1, "name": "A", "score": 9.5},
{"id": 2, "name": "B", "score": 8.0},
]
df = pd.DataFrame(records)
print(df)df.to_csv से CSV में सहेजना
CSV सार्वभौमिक और मनुष्यों के लिए पढ़ने योग्य है। to_csv से सहेजिए; index=False भेजिए, ताकि पंक्ति अनुक्रमणिका अनावश्यक कॉलम के रूप में न लिखी जाए।
df.to_csv("data.csv", index=False)
# Reload
df2 = pd.read_csv("data.csv")CSV की सीमाएँ
CSV सुविधाजनक है, लेकिन AI कार्यों के लिए इसमें कुछ कमियाँ हैं:
- कोई प्रकार नहीं—सब कुछ पाठ के रूप में संग्रहित होता है, इसलिए लोड करते समय डेटा प्रकारों का फिर से अनुमान लगाया जाता है
- डिफ़ॉल्ट रूप से संपीड़न न होने के कारण बड़ी फ़ाइलें
- बड़े डेटासेट पढ़ने में धीमा
बड़े या बार-बार लोड किए जाने वाले डेटा के लिए Parquet बेहतर है।
df.to_parquet से Parquet में सहेजना
Parquet कॉलम-आधारित बाइनरी प्रारूप है। यह डेटा प्रकारों को सुरक्षित रखता है, अच्छी तरह संपीड़ित होता है और CSV की तुलना में बहुत तेज़ी से लोड होता है।
इसे pyarrow जैसे इंजन की आवश्यकता होती है।
df.to_parquet("data.parquet", index=False)
df2 = pd.read_parquet("data.parquet")
print(df2.dtypes) # types preserved, no re-guessingCSV बनाम Parquet — किसका उपयोग कब करें
सामान्य नियम:
- CSV: छोटा डेटा, गैर-Python टूल के साथ साझा करना, त्वरित निरीक्षण
- Parquet: बड़ा डेटा, बार-बार लोड करना, प्रकारों की शुद्धता, विश्लेषण पाइपलाइन
मॉडल को डेटा देने वाले संग्रहण कार्यों के लिए Parquet को प्राथमिकता दीजिए।
pd.concat से नए बैच जोड़ना
डेटा-संग्रह अक्सर बैचों में होता है। pd.concat का उपयोग करके मौजूदा DataFrame को नए DataFrame के साथ जोड़िए।
ignore_index=True अनुक्रमणिका को फिर से क्रमांकित करता है, ताकि वह व्यवस्थित रहे।
new_batch = pd.DataFrame(new_records)
df = pd.concat([df, new_batch], ignore_index=True)
print(len(df))सीधे CSV फ़ाइल में नए डेटा जोड़ना
किसी मौजूदा CSV को लोड किए बिना उसमें डेटा जोड़ने के लिए उसे जोड़ने की विधि में खोलिए और बाद में लिखते समय हेडर छोड़ दीजिए।
import os
header = not os.path.exists("data.csv")
new_batch.to_csv("data.csv", mode="a", header=header, index=False)डुप्लिकेट हटाना क्यों आवश्यक है
संग्रह को दोबारा चलाने, पृष्ठों के आपस में ओवरलैप होने या पुनः प्रयास करने से डुप्लिकेट पंक्तियाँ बन सकती हैं। डुप्लिकेट संख्या को बढ़ा देते हैं और प्रशिक्षण/परीक्षण विभाजनों के बीच लीक हो सकते हैं, जिससे मॉडल का मूल्यांकन प्रभावित होता है।
बैचों को मिलाने के बाद हमेशा डुप्लिकेट हटाएँ।
drop_duplicates(subset=[id])
एक स्थिर अद्वितीय कुंजी (अक्सर id) के साथ drop_duplicates(subset=...) का उपयोग करें। इससे अन्य फ़ील्ड थोड़े बदल गए हों, तब भी दोहराव हट जाते हैं।
keep="last" प्रत्येक id का सबसे नया संस्करण रखता है।
df = df.drop_duplicates(subset=["id"], keep="last").reset_index(drop=True)
print(len(df), "unique rows")सहेजने और मिलाने वाला सहायक
सभी हिस्सों को मिलाएँ: यदि मौजूद हो तो मौजूदा पार्के डेटा लोड करें, नए बैच को जोड़ें, id के आधार पर डुप्लिकेट हटाएँ और फिर वापस सहेजें। इसे बार-बार सुरक्षित रूप से चलाया जा सकता है।
import os
import pandas as pd
def save_merge(new_df, path="data.parquet", key="id"):
if os.path.exists(path):
old = pd.read_parquet(path)
new_df = pd.concat([old, new_df], ignore_index=True)
new_df = new_df.drop_duplicates(subset=[key], keep="last")
new_df.to_parquet(path, index=False)
return new_dfत्वरित जाँच: प्रारूप का चुनाव
आप मॉडल प्रशिक्षण के लिए बड़े डेटासेट को बार-बार लोड करते हैं और तेज़ रीड के साथ डेटा प्रकार सुरक्षित रखना चाहते हैं।
पुनरावलोकन: डेटा को कुशलतापूर्वक संग्रहीत करना
अब आप एकत्र किए गए डेटा को अच्छी तरह स्थायी रूप से संग्रहीत कर सकते हैं:
pd.DataFrameसे JSON रिकॉर्डों को तालिका में बदलना- पोर्टेबल पाठ के लिए
to_csv(index=False), तेज़ी से डेटा प्रकार सुरक्षित रखने वाले संग्रहण के लिएto_parquet - बैचों के लिए
pd.concat(ignore_index=True)या CSV append मोड - पंक्तियों को अद्वितीय रखने के लिए
drop_duplicates(subset=["id"])
अगला चरण: वास्तविक सार्वजनिक डेटा एपीआई के साथ काम करना।
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “एकत्रित डेटा का कुशल भंडारण” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “एकत्रित डेटा का कुशल भंडारण” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“एकत्रित डेटा का कुशल भंडारण” में मैं क्या सीखूँगा?
CSV/JSON/Parquet में सहेजना, सुरक्षित रूप से जोड़ना, डुप्लिकेट हटाना और क्रमिक संग्रह। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।
“एकत्रित डेटा का कुशल भंडारण” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- डेटा संग्रह के लिए REST API की मूल बातें
- बड़े डेटासेट का पृष्ठांकन और संग्रह
- एकत्रित डेटा का कुशल भंडारण
- सार्वजनिक डेटा API के साथ कार्य करना