0Pricing
NLP Academy · درس

تضمين الجمل باستخدام BERT

استخرج متجهات سياقية في الشيفرة

تضمين الجمل باستخدام BERT درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 3 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

From Words to Sentences

BERT gives every token its own vector. But often you want one vector for the whole sentence, not each word.

The CLS Token

BERT adds a special token named CLS at the very front of each input. Its output is often used as a sentence summary.

Mean Pooling

Another common trick averages all the token vectors into one. This mean pooling step often beats the raw CLS vector.

Load a Model

Hugging Face makes loading easy: grab a tokenizer and a model with one line each. They form your pipeline for embeddings.

from transformers import AutoTokenizer, AutoModel
tok = AutoTokenizer.from_pretrained("bert-base-uncased")
model = AutoModel.from_pretrained("bert-base-uncased")

Tokenize the Text

The tokenizer turns your sentence into id numbers and an attention mask BERT understands. This is the encoding step.

inputs = tok("I love NLP", return_tensors="pt")

Run the Model

Pass the encoded inputs into BERT to get hidden states for every token. These vectors are the raw output you will pool.

out = model(**inputs)
states = out.last_hidden_state

Pool to One Vector

Average the token states along the sequence to collapse them into a single sentence embedding you can store.

vec = states.mean(dim=1)

An Easier Path

The Sentence-Transformers library wraps all of this for you. One call returns a clean sentence vector ready to use. ✨

from sentence_transformers import SentenceTransformer
m = SentenceTransformer("all-MiniLM-L6-v2")
vec = m.encode("I love NLP")

Compare Sentences

With two sentence vectors you measure closeness using cosine similarity. Higher scores mean the sentences mean similar things.

What You Can Build

Sentence embeddings power semantic search, clustering, and duplicate detection. They turn meaning into something you can search.

A Note on Quality

Models tuned for sentences, like MiniLM, usually beat plain BERT here. Pick one trained for the task you actually have.

Quick Check

How do you turn many token vectors into one sentence vector?

Recap

Tokenize, run BERT, then pool or use CLS to get one sentence embedding. Sentence-Transformers makes it a single call. ✅

الأسئلة الشائعة

هل درس «تضمين الجمل باستخدام BERT» مجاني؟

نعم — نص درس «تضمين الجمل باستخدام BERT» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.

ماذا ستتعلم في «تضمين الجمل باستخدام BERT»؟

استخرج متجهات سياقية في الشيفرة تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟

لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 3 من أصل 4.

كم من الوقت يستغرق درس «تضمين الجمل باستخدام BERT»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟

نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. لماذا يغيّر السياق معنى الكلمة
  2. نمذجة اللغة المقنّعة
  3. تضمين الجمل باستخدام BERT
  4. اختيار النموذج المدرّب مسبقًا المناسب
← العودة إلى NLP Academy