0Pricing
Learn AI with Python · درس

التجزئة والتطبيع

تقنيات المعالجة المسبقة للنصوص

التجزئة والتطبيع درس مجاني في Learn AI with Python على CoddyKit. هذا هو الدرس 2 من أصل 5. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Learn AI with Python، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Learn AI with Python 5 دروس في المجموع.

أساسيات المعالجة المسبقة للنصوص

التجزئة والتطبيع

تُعد المعالجة المسبقة للنصوص خطوة أساسية في NLP. وهي تتضمن تحويل النص الخام إلى تنسيق مهيكل لتحليله. وتشمل خطوات المعالجة المسبقة الأساسية التجزئة والتطبيع.

التجزئة والتطبيع — رسم توضيحي 1

ما المقصود بتقسيم النص إلى رموز؟

ما المقصود بتقسيم النص إلى رموز؟

تقسيم النص إلى رموز هو عملية تفكيك النص إلى وحدات أصغر تُسمى الرموز. وقد تكون الرموز كلمات أو جملًا أو أحرفًا.

على سبيل المثال:

النص: "NLP is amazing!"

الرموز: ["NLP", "is", "amazing", "!"]

مثال على تقسيم النص إلى رموز في Python

مثال على تقسيم النص إلى رموز في Python

باستخدام مكتبة NLTK، يمكننا تقسيم النص إلى رموز تمثل كلمات أو جملًا:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

ما المقصود بالتطبيع؟

ما المقصود بالتطبيع؟

يتضمن التطبيع تنظيف النص وتوحيد صيغته. وتشمل تقنيات التطبيع الشائعة ما يلي:

  • التحويل إلى أحرف صغيرة: تحويل النص بأكمله إلى أحرف صغيرة.
  • إزالة علامات الترقيم: حذف علامات الترقيم.
  • التجذير: اختزال الكلمات إلى جذرها، مثل "running" → "run".
  • إرجاع الكلمات إلى صيغها الأساسية: اختزال الكلمات إلى صيغتها الأساسية ذات المعنى باستخدام السياق، مثل "better" → "good".

التحويل إلى أحرف صغيرة وإزالة علامات الترقيم

التحويل إلى أحرف صغيرة وإزالة علامات الترقيم

إليكم طريقة تطبيع النص بتحويله إلى أحرف صغيرة وإزالة علامات الترقيم:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

التجذير وإرجاع الكلمات إلى صيغها الأساسية

التجذير وإرجاع الكلمات إلى صيغها الأساسية

التجذير: يختزل الكلمات إلى جذورها بإزالة اللواحق. وهو يعتمد على القواعد، وقد لا ينتج دائمًا كلمات صحيحة.

إرجاع الكلمات إلى صيغها الأساسية: يستخدم مفردات وقواعد نحوية لاختزال الكلمات إلى صيغتها الأساسية ذات المعنى.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

إزالة كلمات التوقف

إزالة كلمات التوقف

كلمات التوقف هي كلمات شائعة، مثل "is" و"and" و"the"، لا تحمل غالبًا معنى مهمًا. ويمكن أن تؤدي إزالتها إلى تبسيط تحليل النص:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

تحديات المعالجة المسبقة للنصوص

تحديات المعالجة المسبقة للنصوص

قد تكون المعالجة المسبقة للنصوص صعبة بسبب ما يلي:

  • الغموض: يمكن أن تحمل كلمات مثل "lead" معاني متعددة.
  • السياق: يتطلب إرجاع الكلمات إلى صيغها الأساسية فهم سياق الكلمة.
  • التباين اللغوي: التعامل مع اللغات واللهجات المختلفة.

الملخص والخطوات التالية

الملخص والخطوات التالية

في هذا الدرس، قمنا بما يلي:

  • تعرّفنا على التجزئة والتطبيع.
  • استكشفنا تقنيات مثل الاشتقاق، وإرجاع الكلمات إلى صيغها الأساسية، وإزالة الكلمات المستبعدة.
  • تدرّبنا على المعالجة المسبقة للنصوص باستخدام Python.

سنحلل بعد ذلك أنماط النصوص باستخدام نماذج N-Gram.

التجزئة والتطبيع — رسم توضيحي 10

الأسئلة الشائعة

هل درس «التجزئة والتطبيع» مجاني؟

نعم — نص درس «التجزئة والتطبيع» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Learn AI with Python، انتقل إلى CoddyKit PRO. تتضمن دورة Learn AI with Python 5 دروس في المجموع.

ماذا ستتعلم في «التجزئة والتطبيع»؟

تقنيات المعالجة المسبقة للنصوص تتمرن على Learn AI with Python مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ Learn AI with Python؟

لا تُشترط خبرة سابقة. Learn AI with Python على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 5.

كم من الوقت يستغرق درس «التجزئة والتطبيع»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس Learn AI with Python هذا؟

نعم. كل درس في Learn AI with Python يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. التعامل مع البيانات النصية
  2. التجزئة والتطبيع
  3. نماذج N-Gram
  4. مفاهيم تحليل المشاعر
  5. النماذج القائمة على Transformer
← العودة إلى Learn AI with Python