Data बनाम Model Parallelism
काम बाँटने के दो तरीके सीखें
Data बनाम Model Parallelism, CoddyKit पर Deep Learning Academy का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Deep Learning Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Deep Learning Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
Scale out क्यों करें
जब तक आपका model या dataset बड़ा नहीं हो जाता, एक GPU पर्याप्त है। Distributed training काम को कई GPUs में बाँटती है, जिससे training घंटों पहले पूरी हो सकती है।
बाँटने के दो तरीके
दो मुख्य रणनीतियाँ हैं: data को GPUs में बाँटना या स्वयं model को बाँटना। दोनों अलग-अलग bottleneck हल करते हैं।
Data Parallelism
data parallelism में हर GPU पर model की पूरी copy होती है, लेकिन हर GPU batch के अलग हिस्से पर training करता है। यह सबसे सामान्य setup है। 🚀
Gradients को Sync करें
हर GPU अपने हिस्से पर gradients निकालने के बाद उन्हें सभी devices पर औसत किया जाता है। फिर हर model copy एक जैसा step लेती है और समान बनी रहती है।
Data Parallelism कब उपयुक्त है
जब आपका model एक GPU पर समा जाता हो, लेकिन training धीमी हो, तब data parallelism अपनाएँ। अधिक devices जोड़कर throughput बढ़ाएँ।
Model Parallelism
model parallelism में network एक GPU के लिए बहुत बड़ा होता है, इसलिए उसकी layers कई devices में बाँट दी जाती हैं और हर device केवल एक हिस्सा रखता है।
Activations GPUs के बीच जाते हैं
विभाजित model में एक GPU का output अगले GPU का input बनता है। इस हस्तांतरण से devices के बीच communication cost बढ़ती है।
Pipeline Parallelism
Model को बाँटने का अधिक समझदार तरीका pipeline parallelism है: micro-batches layer stages से होकर बहते हैं, ताकि कोई GPU बाकी GPUs की प्रतीक्षा में idle न रहे।
Tensor Parallelism
tensor parallelism और सूक्ष्म स्तर पर काम करता है और एक बड़े matrix multiply को GPUs में बाँटता है। इससे सबसे बड़े language models की training संभव होती है।
आप इन्हें मिला सकते हैं
वास्तविक frontier runs कई रणनीतियाँ मिलाते हैं: nodes के बीच data parallel और प्रत्येक node के भीतर model parallel। यह hybrid तरीका ऐसी models को train करता है जो किसी एक machine में नहीं समा सकते।
सरल शुरुआत करें
अधिकांश projects को केवल data parallelism की आवश्यकता होती है। पहले इसमें दक्ष हों और model splitting का उपयोग तभी करें जब आपका network सचमुच एक GPU में न समा सके।
त्वरित जाँच
नीचे दी गई स्थिति के लिए सही strategy चुनें।
पुनरावृत्ति
आपने scale करने के दो तरीके सीखे: data parallelism model की copies बनाकर batch बाँटता है, जबकि model parallelism स्वयं network को बाँटता है। शुरुआत data parallel से करें।
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 30
- पाठ
- 120
अक्सर पूछे जाने वाले प्रश्न
क्या “Data बनाम Model Parallelism” पाठ निःशुल्क है?
हाँ—“Data बनाम Model Parallelism” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Deep Learning Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Deep Learning Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“Data बनाम Model Parallelism” में मैं क्या सीखूँगा?
काम बाँटने के दो तरीके सीखें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Deep Learning Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या Deep Learning Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Deep Learning Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।
“Data बनाम Model Parallelism” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस Deep Learning Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर Deep Learning Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- Data बनाम Model Parallelism
- DistributedDataParallel की मूल बातें
- Sync Batch Norm और Sharded State
- torchrun के साथ Jobs लॉन्च करें