الدقة المختلطة: FP16 وBF16 وTF32
مبادلة الدقة بمعدل المعالجة
الدقة المختلطة: FP16 وBF16 وTF32 درس مجاني في CUDA Academy على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في CUDA Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة CUDA Academy 4 دروس في المجموع.
مقايضة البتات بالسرعة
تحصل Tensor Cores على سرعتها من الدقة المختلطة، إذ تُدخل صيغ أرقام أصغر كي تتمكن العتادة من تنفيذ عمليات حسابية أكثر بكثير في كل دورة. ⚡
تكلفة FP32
تستخدم FP32 القياسية 32 بت لكل قيمة. وهي دقيقة لكنها كبيرة، ولذلك يستهلك نقل وضرب أعداد FP32 كثيرة عرض النطاق الترددي والوقت.
تعرّف إلى FP16
تستخدم FP16 16 بت فقط: أسًّا أصغر وعددًا أقل من بتات الجزء العشري. ويعني الحجم المنخفض نقل قيم أكثر وضربها في الوقت نفسه.
لدى FP16 نطاق صغير
توفر FP16 المساحة، لكن أسّها الضيق يمنحها نطاقًا ديناميكيًا صغيرًا جدًا. وقد تفيض القيم الكبيرة أو الصغيرة جدًا، أو تختفي فتصبح صفرًا.
تعرّف إلى BF16
تستخدم BF16 أيضًا 16 بت، لكنها تحتفظ بالأس الكامل لـ FP32، وتستبدل بذلك بعض بتات الجزء العشري. وهي تطابق نطاق FP32 بدقة أقل.
لماذا تتفوق BF16 في التدريب
لأن BF16 تشارك FP32 نطاقها الواسع، نادرًا ما تفيض التدرجات. لذلك تُعد BF16 خيارًا مفضلًا لتدريب الشبكات العصبية الكبيرة بأمان.
تعرّف إلى TF32
إن TF32 صيغة من Tensor Core بحجم 19 بت: تستخدم أس FP32 مع جزء عشري مختصر. وهي تسرّع العمليات الحسابية مع ظهورها كـ FP32 في التعليمات البرمجية.
يبقى المجمّع واسعًا
بغض النظر عن صيغة الإدخال، تجمع Tensor Cores عادةً المجاميع الجزئية في FP32. فالسرعة تأتي من المدخلات، بينما يأتي الأمان من المجموع الجاري.
النطاق مقابل الدقة
الفكرة الأساسية: تستهلك FP16 وBF16 العدد نفسه، وهو 16 بت، لكنهما تقسمانه بطريقة مختلفة. فإحداهما تفضّل الدقة، والأخرى تفضّل النطاق.
اختيار صيغة
استخدم BF16 أو TF32 عندما يكون النطاق مهمًا، واستخدم FP16 عندما تتمكن من إدارة التحجيم. تعتمد الصيغة المناسبة على بياناتك، لا على السرعة وحدها.
التصريح عن دقة نصفية
في CUDA C++ يملك نوع FP16 اسمًا مختصرًا. يصرّح هذا السطر عن قيمة half واحدة جاهزة لحسابات Tensor Core.
__half x = __float2half(1.5f);تحقق سريع
أي صيغة تحتفظ بنطاق الأس الكامل لـ FP32 باستخدام 16 بت فقط؟
مراجعة
رأيت كيف تساوم الدقة المختلطة على البتات مقابل الإنتاجية: تفضّل FP16 الدقة، وتفضّل BF16 النطاق، وتسرّع TF32 العمليات الحسابية بأسلوب FP32. ويحافظ التجميع الواسع على سلامة النتائج. ✨
تعلم C++ مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 30
- الدروس
- 120
الأسئلة الشائعة
هل درس «الدقة المختلطة: FP16 وBF16 وTF32» مجاني؟
نعم — نص درس «الدقة المختلطة: FP16 وBF16 وTF32» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة CUDA Academy، انتقل إلى CoddyKit PRO. تتضمن دورة CUDA Academy 4 دروس في المجموع.
ماذا ستتعلم في «الدقة المختلطة: FP16 وBF16 وTF32»؟
مبادلة الدقة بمعدل المعالجة تتمرن على CUDA Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ CUDA Academy؟
لا تُشترط خبرة سابقة. CUDA Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.
كم من الوقت يستغرق درس «الدقة المختلطة: FP16 وBF16 وTF32»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس CUDA Academy هذا؟
نعم. كل درس في CUDA Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- ما الذي تحسبه Tensor Cores
- الدقة المختلطة: FP16 وBF16 وTF32
- واجهة API لأجزاء WMMA
- مفاضلات الاستقرار العددي