NLP Academy · Pelajaran

Menapis Perkataan Henti dengan NLTK

Buang hingar daripada senarai token

Pelajaran 2 daripada 413 langkah

Menapis Perkataan Henti dengan NLTK ialah pelajaran NLP Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran NLP Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Biarkan NLTK Melakukan Kerja Berat

Membina senarai kata henti sendiri boleh dilakukan, tetapi NLTK sudah menyediakan senarai terpilih untuk banyak bahasa. Mari kita gunakannya pada senarai token.

Dapatkan Data Dahulu

NLTK menyimpan senarai perkataan sebagai data yang boleh dimuat turun. Anda mendapatkan pakej kata henti sekali sahaja, kemudian pakej itu kekal pada mesin anda.

import nltk
nltk.download("stopwords")

Muatkan Senarai Bahasa Inggeris

Kini import korpus dan minta bahasa Inggeris. Anda akan menerima senarai perkataan biasa yang boleh diperiksa atau digunakan untuk menapis.

from nltk.corpus import stopwords
stops = stopwords.words("english")
print(len(stops))

Tukarkannya kepada Set

Senarai itu boleh digunakan, tetapi set menjadikan semakan keahlian lebih pantas. Balutkannya sekali dan gunakannya semula untuk setiap token.

stops = set(stopwords.words("english"))

Tapis dengan Pemahaman

Pemahaman senarai hanya mengekalkan perkataan yang bukan kata henti. Baris tunggal ini ialah inti pati pembuangan kata henti.

tokens = ["the", "quick", "brown", "fox"]
clean = [w for w in tokens if w not in stops]
print(clean)

Perhatikan Huruf Besar-kecil

Senarai itu menggunakan huruf kecil, jadi The tidak akan sepadan dengan the. Jadikan token anda huruf kecil dahulu, atau kata henti berhuruf besar akan kekal.

clean = [w for w in tokens if w.lower() not in stops]

Lihat Perbezaannya

Sebelum penapisan, mungkin terdapat sepuluh token; selepas itu, hanya empat token yang bermakna kekal. Pengurangan itu ialah noise yang baru sahaja Anda buang.

Bahasa Lain Juga

NLTK bukan untuk bahasa Inggeris sahaja. Tukar argumen untuk mendapatkan senarai stopword bagi bahasa Sepanyol, Jerman, Perancis dan banyak lagi.

spanish = set(stopwords.words("spanish"))

Sesuaikan Senarai

Senarai itu hanyalah satu set, jadi Anda boleh add noise khusus domain sendiri menggunakan operasi set biasa sebelum penapisan.

stops.add("subject")
stops.update(["http", "www"])

Atau Kekalkan Beberapa

Ingin melindungi perkataan seperti not? Hanya remove perkataan itu daripada set supaya penapisan tidak pernah membuangnya.

stops.discard("not")

Tapis Sekali, Guna Semula Kerap

Bina set stops Anda sekali sahaja semasa permulaan, bukannya di dalam gelung. Membinanya semula untuk setiap dokumen membazirkan masa yang banyak.

Semakan Pantas

Ada satu perincian yang mengelirukan hampir semua orang pada kali pertama.

Ringkasan

Kini Anda boleh menapis token berdasarkan stopword NLTK: muat turun sekali, bina set huruf kecil, dan kekalkan hanya perkataan yang tiada di dalamnya. Beri perhatian kepada huruf besar dan kecil.

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Menapis Perkataan Henti dengan NLTK” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran NLP Academy, termasuk “Menapis Perkataan Henti dengan NLTK”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Menapis Perkataan Henti dengan NLTK”?

Buang hingar daripada senarai token Anda berlatih NLP Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan NLP Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran NLP Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Menapis Perkataan Henti dengan NLTK” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Apakah Perkataan Henti?
  2. Menapis Perkataan Henti dengan NLTK
  3. Membuang Tanda Baca dan Simbol
  4. Membina Fungsi Teks Bersih yang Boleh Diguna Semula
← Kembali ke NLP Academy