0Pricing
NLP Academy · درس

‏N-Gram للمحارف من أجل المتانة

تعامل مع الأخطاء الإملائية والكلمات النادرة

‏N-Gram للمحارف من أجل المتانة درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

Word Features Are Fragile

Word-level features break on typos and rare spellings. The model sees runnning as a brand-new word, so a single slip can lose all its signal.

Drop Down to Characters

Instead of whole words, we slice text into short chunks of letters. These overlapping pieces are called character n-grams.

What a 3-gram Looks Like

For the word cat, character 3-grams are simple letter triples. They slide across the text one position at a time to form overlapping chunks.

word = "happy"
grams = [word[i:i+3] for i in range(len(word)-2)]

Why They Survive Typos

The words run and runn share most of their character grams. So a typo changes only a few features instead of erasing the whole word.

Catching Word Families

play, playing, and player all share the gram pla. Character grams quietly link related forms without any stemming step.

Great for Messy Text

Social media, usernames, and product codes are full of odd spellings. Character grams stay robust where word features fall apart.

Switching On Char Mode

scikit-learn makes this one parameter. Set analyzer to char and pick an ngram_range to extract character grams instead of words.

from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer(analyzer="char", ngram_range=(3, 5))

char_wb Respects Words

The char_wb analyzer only makes grams inside word boundaries, padding each word. It keeps the robustness while avoiding grams that span two words.

vec = TfidfVectorizer(analyzer="char_wb", ngram_range=(2, 4))

Handy for Other Languages

Languages that glue words together or have rich endings are tough for word tokenizers. Character grams sidestep that and stay language-friendly.

The Cost: Bigger Features

Character grams create many more features than words do. That extra dimensionality needs more memory, so keep the range tight.

Best as a Teammate

Character grams shine when combined with word features, not as a replacement. Together they cover both meaning and robustness. 💪

Quick Check

Why do character n-grams handle typos so well?

Recap

Character n-grams slice text into letter chunks, survive typos, and link word families. Use analyzer char in scikit-learn alongside word features. ✅

الأسئلة الشائعة

هل درس «‏N-Gram للمحارف من أجل المتانة» مجاني؟

نعم — نص درس «‏N-Gram للمحارف من أجل المتانة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.

ماذا ستتعلم في «‏N-Gram للمحارف من أجل المتانة»؟

تعامل مع الأخطاء الإملائية والكلمات النادرة تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟

لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.

كم من الوقت يستغرق درس «‏N-Gram للمحارف من أجل المتانة»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟

نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. ما بعد حقيبة الكلمات
  2. ‏N-Gram للمحارف من أجل المتانة
  3. دمج أنواع متعددة من السمات
  4. توسيع نطاق السمات واختيارها
← العودة إلى NLP Academy