تضمين الجمل باستخدام BERT
استخرج متجهات سياقية في الشيفرة
تضمين الجمل باستخدام BERT درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 3 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.
بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.
From Words to Sentences
BERT gives every token its own vector. But often you want one vector for the whole sentence, not each word.
The CLS Token
BERT adds a special token named CLS at the very front of each input. Its output is often used as a sentence summary.
Mean Pooling
Another common trick averages all the token vectors into one. This mean pooling step often beats the raw CLS vector.
Load a Model
Hugging Face makes loading easy: grab a tokenizer and a model with one line each. They form your pipeline for embeddings.
from transformers import AutoTokenizer, AutoModel
tok = AutoTokenizer.from_pretrained("bert-base-uncased")
model = AutoModel.from_pretrained("bert-base-uncased")Tokenize the Text
The tokenizer turns your sentence into id numbers and an attention mask BERT understands. This is the encoding step.
inputs = tok("I love NLP", return_tensors="pt")Run the Model
Pass the encoded inputs into BERT to get hidden states for every token. These vectors are the raw output you will pool.
out = model(**inputs)
states = out.last_hidden_statePool to One Vector
Average the token states along the sequence to collapse them into a single sentence embedding you can store.
vec = states.mean(dim=1)An Easier Path
The Sentence-Transformers library wraps all of this for you. One call returns a clean sentence vector ready to use. ✨
from sentence_transformers import SentenceTransformer
m = SentenceTransformer("all-MiniLM-L6-v2")
vec = m.encode("I love NLP")Compare Sentences
With two sentence vectors you measure closeness using cosine similarity. Higher scores mean the sentences mean similar things.
What You Can Build
Sentence embeddings power semantic search, clustering, and duplicate detection. They turn meaning into something you can search.
A Note on Quality
Models tuned for sentences, like MiniLM, usually beat plain BERT here. Pick one trained for the task you actually have.
Quick Check
How do you turn many token vectors into one sentence vector?
Recap
Tokenize, run BERT, then pool or use CLS to get one sentence embedding. Sentence-Transformers makes it a single call. ✅
الأسئلة الشائعة
هل درس «تضمين الجمل باستخدام BERT» مجاني؟
نعم — نص درس «تضمين الجمل باستخدام BERT» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.
ماذا ستتعلم في «تضمين الجمل باستخدام BERT»؟
استخرج متجهات سياقية في الشيفرة تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟
لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 3 من أصل 4.
كم من الوقت يستغرق درس «تضمين الجمل باستخدام BERT»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟
نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- لماذا يغيّر السياق معنى الكلمة
- نمذجة اللغة المقنّعة
- تضمين الجمل باستخدام BERT
- اختيار النموذج المدرّب مسبقًا المناسب