0Pricing
AI Engineering Academy · درس

المحوّلات وآلية الانتباه بلغة واضحة

اكتشفوا بنية المحوّل من خلال استكشاف كيفية تمكين آليات الانتباه للنماذج من التركيز على السياق ذي الصلة من دون الحاجة إلى فهم الرياضيات.

المحوّلات وآلية الانتباه بلغة واضحة درس مجاني في AI Engineering Academy على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Engineering Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Engineering Academy 4 دروس في المجموع.

المشكلة الأساسية: الاعتماديات بعيدة المدى

في الجملة «لم تناسب الكأس الحقيبة لأنها كانت كبيرة جدًا»، إلى ماذا يعود الضمير «هي»؟ كانت النماذج القديمة تفقد القدرة على التتبع في الجمل الطويلة. وهذه هي مشكلة الاعتماديات بعيدة المدى.

الانتباه بوصفه تركيزًا موزونًا

الانتباه هو الطريقة التي يقرر بها النموذج الكلمات الأكثر أهمية لكل كلمة — مثل تمييز الأجزاء الأساسية من مقطع بدلًا من معاملة جميع الكلمات بالطريقة نفسها.

الاستعلامات والمفاتيح والقيم

يعمل الانتباه مثل البحث: ترسل كل كلمة Query، وتطابقه مع كل Key، ثم تستخلص أكثر Values صلة. يوضح الكود أدناه الفكرة الأساسية.

# Simplified self-attention in pseudocode
import numpy as np

def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]  # dimension of keys
    scores = Q @ K.T / np.sqrt(d_k)  # scale to prevent vanishing gradients
    weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True)  # softmax
    output = weights @ V  # weighted sum of values
    return output

الانتباه متعدد الرؤوس: وجهات نظر متعددة

يلتقط رأس انتباه واحد نوعًا واحدًا من الروابط. أما الانتباه متعدد الرؤوس فيشغّل رؤوسًا كثيرة بالتوازي، ولذلك يرى النموذج الكلمات من عدة زوايا في الوقت نفسه.

الترميزات الموضعية: إضافة ترتيب الكلمات

يتجاهل الانتباه وحده ترتيب الكلمات — فعبارتا «الكلب يعض الرجل» و«الرجل يعض الكلب» تبدوان متماثلتين. تضيف الترميزات الموضعية إحساسًا بالموقع حتى لا يضيع الترتيب.

الطبقات الأمامية بعد الانتباه

بعد أن يشارك الانتباه السياق، تعالج الشبكة الأمامية كل كلمة على حدة. ومن المثير للاهتمام أن جزءًا كبيرًا من المعرفة الواقعية للنموذج يبدو متمركزًا هنا.

النماذج ذات المشفّر فقط مقابل النماذج ذات المفكّك فقط

تقرأ نماذج encoder-only المبنية على أسلوب BERT النص كله دفعةً واحدة لفهمه. أما نماذج decoder-only المبنية على أسلوب GPT فتقرأ من اليسار إلى اليمين لتوليده — وهذا ما يفعله ChatGPT.

تكديس الطبقات والعمق

تكدّس LLMs الحديثة عشرات الكتل من Transformer. تعمل كل طبقة على تحسين الطبقة السابقة — فتلتقط الطبقات المبكرة القواعد، بينما تتولى الطبقات الأعمق الاستدلال. كلما زاد العمق، زاد التفكير.

الوصلات المتبقية وتطبيع الطبقات

إن تكديس طبقات كثيرة أمر معقد. تحافظ الوصلات المتبقية وتطبيع الطبقات على استقرار الإشارة، مما يتيح تدريب النماذج العميقة بصورة موثوقة حتى مع أكثر من 100 طبقة.

لماذا يتوسع الانتباه بكفاءة كبيرة

يسهل تشغيل الانتباه بالتوازي، ولذلك يعني استخدام مزيد من وحدات GPU تدريبًا أسرع. بهذه الطريقة درّب الباحثون النماذج على بيانات ضخمة واكتشفوا قوانين التوسّع الشهيرة.

Flash Attention والتحسينات الحديثة

تجعل المدخلات الطويلة الانتباه التقليدي مستهلكًا للذاكرة بدرجة كبيرة. تحسب FlashAttention النتيجة نفسها بكفاءة أعلى بكثير، مما يجعل نوافذ السياق الكبيرة عملية.

تحقق سريع

اختبر فهمك لمفاهيم هندسة الذكاء الاصطناعي الواردة في هذا الدرس.

مراجعة الدرس

مراجعة: تربط آلية الانتباه الذاتي كل كلمة بكل كلمة أخرى، ويلتقط الانتباه متعدد الرؤوس علاقات كثيرة في آن واحد، كما تتيح الوصلات المتبقية والتطبيع للنماذج أن تكون عميقة. التالي: كيف يتم تدريب LLMs.

الأسئلة الشائعة

هل درس «المحوّلات وآلية الانتباه بلغة واضحة» مجاني؟

نعم — نص درس «المحوّلات وآلية الانتباه بلغة واضحة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Engineering Academy، انتقل إلى CoddyKit PRO. تتضمن دورة AI Engineering Academy 4 دروس في المجموع.

ماذا ستتعلم في «المحوّلات وآلية الانتباه بلغة واضحة»؟

اكتشفوا بنية المحوّل من خلال استكشاف كيفية تمكين آليات الانتباه للنماذج من التركيز على السياق ذي الصلة من دون الحاجة إلى فهم الرياضيات. تتمرن على AI Engineering Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Engineering Academy؟

لا تُشترط خبرة سابقة. AI Engineering Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.

كم من الوقت يستغرق درس «المحوّلات وآلية الانتباه بلغة واضحة»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Engineering Academy هذا؟

نعم. كل درس في AI Engineering Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. من الإكمال التلقائي إلى ChatGPT
  2. المحوّلات وآلية الانتباه بلغة واضحة
  3. كيف تُدرَّب LLMs
  4. إمكانات LLMs وحدودها
← العودة إلى AI Engineering Academy