تصفية الكلمات المستبعدة باستخدام NLTK
أزل الضوضاء من قائمة الرموز
تصفية الكلمات المستبعدة باستخدام NLTK درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.
دع NLTK تتولى العمل الشاق
لا بأس ببناء قائمة كلمات الوقف الخاصة بك، لكن NLTK توفر بالفعل قائمة منسقة للغات عديدة. فلنستخدمها مع قائمة رموز.
احصل على البيانات أولًا
تحتفظ NLTK بقوائم الكلمات على هيئة بيانات قابلة للتنزيل. نزّل حزمة stopwords مرة واحدة، ثم ستبقى على جهازك.
import nltk
nltk.download("stopwords")حمّل القائمة الإنجليزية
استورد المدونة الآن واطلب اللغة الإنجليزية. وستحصل على قائمة كلمات عادية يمكنك فحصها أو التصفية بالاعتماد عليها.
from nltk.corpus import stopwords
stops = stopwords.words("english")
print(len(stops))حوّلها إلى مجموعة
تعمل القائمة، لكن المجموعة تجعل عمليات التحقق من العضوية أسرع بكثير. حوّلها مرة واحدة إلى مجموعة وأعد استخدامها مع كل رمز.
stops = set(stopwords.words("english"))صفِّ باستخدام الاستيعاب
يحتفظ استيعاب القائمة بالكلمات التي ليست كلمات وقف فقط. هذا السطر الواحد هو جوهر إزالة كلمات الوقف.
tokens = ["the", "quick", "brown", "fox"]
clean = [w for w in tokens if w not in stops]
print(clean)انتبه إلى حالة الأحرف
القائمة مكتوبة بأحرف صغيرة، لذلك لن تتطابق The مع the. حوّل رموزك إلى أحرف صغيرة أولًا، وإلا ستبقي كلمات وقف مكتوبة بأحرف كبيرة.
clean = [w for w in tokens if w.lower() not in stops]شاهد الفرق
قد يكون لديك عشرة رموز قبل التصفية، ولا يبقى بعدها سوى الرموز الأربعة ذات المعنى. هذا الانكماش هو الضوضاء التي تخلّصت منها للتو.
لغات أخرى أيضًا
لا يقتصر NLTK على اللغة الإنجليزية. غيّر الوسيط للحصول على قائمة كلمات التوقف للإسبانية والألمانية والفرنسية ولغات كثيرة أخرى.
spanish = set(stopwords.words("spanish"))تخصيص القائمة
القائمة ليست سوى مجموعة، لذا يمكنك إضافة الضوضاء الخاصة بمجالك إليها باستخدام عمليات المجموعات المعتادة قبل التصفية.
stops.add("subject")
stops.update(["http", "www"])أو احتفظ ببعضها
هل تريد حماية كلمة مثل not؟ ما عليك سوى إزالتها من المجموعة حتى لا تحذفها التصفية أبدًا.
stops.discard("not")صفِّ مرة واحدة وأعد الاستخدام كثيرًا
أنشئ مجموعة stops مرة واحدة عند بدء التشغيل، لا داخل حلقة. إنشاؤها من جديد لكل مستند يهدر وقتًا فعليًا.
تحقق سريع
هناك تفصيل واحد يربك الجميع تقريبًا في المرة الأولى.
مراجعة
يمكنك الآن تصفية الرموز باستخدام كلمات التوقف في NLTK: نزّلها مرة واحدة، وأنشئ مجموعة بأحرف صغيرة، واحتفظ بالكلمات غير الموجودة فيها فقط. انتبه إلى حالة الأحرف.
تعلم Python مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 30
- الدروس
- 120
الأسئلة الشائعة
هل درس «تصفية الكلمات المستبعدة باستخدام NLTK» مجاني؟
نعم — نص درس «تصفية الكلمات المستبعدة باستخدام NLTK» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.
ماذا ستتعلم في «تصفية الكلمات المستبعدة باستخدام NLTK»؟
أزل الضوضاء من قائمة الرموز تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟
لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.
كم من الوقت يستغرق درس «تصفية الكلمات المستبعدة باستخدام NLTK»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟
نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- ما الكلمات المستبعدة؟
- تصفية الكلمات المستبعدة باستخدام NLTK
- إزالة علامات الترقيم والرموز
- إنشاء دالة قابلة لإعادة الاستخدام لتنظيف النص