मिश्रित परिशुद्धता: FP16, BF16, TF32
थ्रूपुट के लिए परिशुद्धता का त्याग
मिश्रित परिशुद्धता: FP16, BF16, TF32, CoddyKit पर CUDA Academy का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह CUDA Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। CUDA Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
बिट के बदले गति
टेन्सर कोर को अपनी गति मिश्रित सटीकता से मिलती है: छोटे संख्या-प्रारूपों को इनपुट के रूप में देकर हार्डवेयर हर चक्र में बहुत अधिक गणना कर सकता है। ⚡
FP32 की लागत
मानक FP32 हर मान के लिए 32 बिट का उपयोग करता है। यह सटीक है, लेकिन भारी भी; इसलिए बहुत से FP32 मानों को स्थानांतरित और गुणा करने में बैंडविड्थ और समय अधिक लगता है।
FP16 से परिचय
FP16 केवल 16 बिट का उपयोग करता है: छोटा घातांक और कम मैन्टिसा बिट। आधे आकार का अर्थ है कि एक साथ अधिक मान स्थानांतरित और गुणा किए जा सकते हैं।
FP16 की सीमा छोटी है
FP16 जगह बचाता है, लेकिन इसका संकीर्ण घातांक बहुत छोटी डायनेमिक रेंज देता है। बहुत बड़े या बहुत छोटे मान ओवरफ्लो हो सकते हैं या शून्य में गायब हो सकते हैं।
BF16 से परिचय
BF16 भी 16 बिट का होता है, लेकिन FP32 का पूरा घातांक बनाए रखता है और इसके बदले मैन्टिसा बिट कम करता है। इसकी रेंज FP32 जैसी होती है, पर सटीकता कम होती है।
प्रशिक्षण के लिए BF16 बेहतर क्यों है
BF16 की रेंज FP32 जैसी व्यापक होने के कारण ग्रेडिएंट का ओवरफ्लो बहुत कम होता है। इसी वजह से बड़े न्यूरल नेटवर्क को सुरक्षित रूप से प्रशिक्षित करने के लिए BF16 पसंद किया जाता है।
TF32 से परिचय
TF32 19-बिट का टेन्सर कोर प्रारूप है: FP32 का घातांक और छोटा किया हुआ मैन्टिसा। यह गणित को तेज़ करता है, जबकि आपके कोड को FP32 जैसा दिखाई देता है।
संचायक की चौड़ाई बनी रहती है
इनपुट प्रारूप चाहे कोई भी हो, टेन्सर कोर आम तौर पर आंशिक योगों को FP32 में संचित करते हैं। गति इनपुट में है और सुरक्षा चलते हुए कुल योग में।
रेंज बनाम सटीकता
मुख्य बात यह है: FP16 और BF16 दोनों 16 बिट लेते हैं, लेकिन उन्हें अलग तरीके से बाँटते हैं। एक सटीकता को प्राथमिकता देता है और दूसरा रेंज को।
प्रारूप चुनना
जब रेंज महत्वपूर्ण हो, तब BF16 या TF32 उपयोग करें; जब स्केलिंग संभाल सकें, तब FP16 उपयोग करें। सही प्रारूप केवल गति पर नहीं, आपके डेटा पर निर्भर करता है।
अर्ध-सटीकता घोषित करना
CUDA C++ में FP16 प्रकार का एक छोटा नाम होता है। यह पंक्ति टेन्सर कोर गणित के लिए तैयार एक half मान घोषित करती है।
__half x = __float2half(1.5f);त्वरित जाँच
केवल 16 बिट में कौन-सा प्रारूप FP32 की पूरी घातांक रेंज बनाए रखता है?
पुनरावलोकन
आपने देखा कि मिश्रित सटीकता थ्रूपुट के बदले बिट का संतुलन बनाती है: FP16 सटीकता को, BF16 रेंज को और TF32 FP32-जैसे गणित की गति को प्राथमिकता देता है। व्यापक संचय परिणामों को सुरक्षित रखता है। ✨
एआई शिक्षक के साथ C++ सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 30
- पाठ
- 120
अक्सर पूछे जाने वाले प्रश्न
क्या “मिश्रित परिशुद्धता: FP16, BF16, TF32” पाठ निःशुल्क है?
हाँ—“मिश्रित परिशुद्धता: FP16, BF16, TF32” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और CUDA Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। CUDA Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“मिश्रित परिशुद्धता: FP16, BF16, TF32” में मैं क्या सीखूँगा?
थ्रूपुट के लिए परिशुद्धता का त्याग आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ CUDA Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या CUDA Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर CUDA Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“मिश्रित परिशुद्धता: FP16, BF16, TF32” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस CUDA Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर CUDA Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- टेंसर कोर क्या गणना करते हैं
- मिश्रित परिशुद्धता: FP16, BF16, TF32
- WMMA फ़्रैगमेंट API
- संख्यात्मक स्थिरता के समझौते