ما الذي تحسبه Tensor Cores
وحدات مدمجة لضرب المصفوفات وتجميعها
ما الذي تحسبه Tensor Cores درس مجاني في CUDA Academy على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في CUDA Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة CUDA Academy 4 دروس في المجموع.
تعرّف إلى Tensor Core
إن Tensor Core وحدة عتادية خاصة في وحدات NVIDIA GPU الحديثة، صُممت لتنفيذ مهمة واحدة بسرعة هائلة: العمليات الحسابية على المصفوفات الصغيرة. 🚀
عملية واحدة: MMA
تنفّذ Tensor Cores عملية الضرب والتجميع للمصفوفات، المكتوبة بالشكل D = A ضرب B زائد C. فهي تنفّذ الضرب والجمع معًا في خطوة واحدة.
كتل كاملة دفعة واحدة
بدلًا من معالجة رقم واحد، تتعامل Tensor Core مع كتلة مصفوفة صغيرة في كل دورة. ولهذا تتفوق كثيرًا على النواة العادية التي تعالج العناصر واحدًا تلو الآخر.
الضرب والجمع المدمجان
يحدث الضرب والجمع بصورة مدمجة، لذلك لا يُقرَّب حاصل الضرب الوسيط منفردًا. وهذا يحافظ على دقة أكبر مقارنة بخطوتين منفصلتين.
لماذا تهم المصفوفات
يمتلئ التعلم العميق والرسوميات بعمليات ضرب المصفوفات. وُجدت Tensor Cores لأن هذه العملية تهيمن على عدد كبير من أحمال العمل الفعلية.
جزء التجميع
تتيح الإضافة C في D = A ضرب B زائد C الاحتفاظ بمجموع جارٍ. وهذا المجمّع هو الطريقة التي تُبنى بها النتائج الكبيرة من كتل صغيرة عديدة.
سرعة تفوق النوى العادية
في العمليات الحسابية على المصفوفات، يمكن لـ Tensor Core توفير إنتاجية تفوق النوى العادية في CUDA مرات عديدة، لأنه يضم ضرب كتلة كاملة في تعليمة واحدة.
مدخلات مختلطة، ومجاميع أوسع
غالبًا ما تستقبل Tensor Cores مدخلات منخفضة الدقة، لكنها تحتفظ بـمجمّع أعلى دقة. فتحصل على سرعة في الضرب وأمان في المجموع الجاري.
وُلد في عصر Volta
ظهرت Tensor Cores مع بنية Volta، ثم تطورت مع Turing وAmpere وHopper. وقد وسّعت كل أجيالها أحجام الكتل وأضافت صيغًا جديدة.
ليست مناسبة لكل نواة
لا تفيد Tensor Cores إلا عندما يشبه عملك ضرب المصفوفات. أما جمع متجهات بسيط أو حلقة قياسية فلن يستخدمها إطلاقًا.
لمحة صغيرة
يمكنك الوصول إلى Tensor Cores عبر المكتبات أو واجهة WMMA API. وشكل هذا الاستدعاء هو عملية الضرب والتجميع التي ستكتبها لاحقًا.
wmma::mma_sync(acc, a_frag, b_frag, acc);تحقق سريع
ما العملية الوحيدة التي صُممت Tensor Cores لتسريعها؟
مراجعة
تعلّمت أن Tensor Core تدمج عملية ضرب وتجميع لمصفوفة بحجم كتلة كاملة في خطوة واحدة سريعة، وهي مثالية لحسابات المصفوفات التي يقوم عليها التعلم العميق. التالي: صيغ الدقة. 🎉
تعلم C++ مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 30
- الدروس
- 120
الأسئلة الشائعة
هل درس «ما الذي تحسبه Tensor Cores» مجاني؟
نعم — نص درس «ما الذي تحسبه Tensor Cores» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة CUDA Academy، انتقل إلى CoddyKit PRO. تتضمن دورة CUDA Academy 4 دروس في المجموع.
ماذا ستتعلم في «ما الذي تحسبه Tensor Cores»؟
وحدات مدمجة لضرب المصفوفات وتجميعها تتمرن على CUDA Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ CUDA Academy؟
لا تُشترط خبرة سابقة. CUDA Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.
كم من الوقت يستغرق درس «ما الذي تحسبه Tensor Cores»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس CUDA Academy هذا؟
نعم. كل درس في CUDA Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- ما الذي تحسبه Tensor Cores
- الدقة المختلطة: FP16 وBF16 وTF32
- واجهة API لأجزاء WMMA
- مفاضلات الاستقرار العددي