Menyaring Stopword dengan NLTK
Membuang noise dari daftar token
Menyaring Stopword dengan NLTK adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.
Biarkan NLTK Menangani Pekerjaan Berat
Membuat daftar kata henti sendiri tidak masalah, tetapi NLTK sudah menyediakan daftar pilihan untuk banyak bahasa. Mari kita gunakan pada daftar token.
Ambil Datanya Dahulu
NLTK menyimpan daftar kata sebagai data yang dapat diunduh. Anda mengambil paket kata henti sekali, lalu paket itu tetap tersimpan di mesin Anda.
import nltk
nltk.download("stopwords")Muat Daftar Bahasa Inggris
Sekarang impor korpus tersebut dan minta bahasa Inggris. Anda akan mendapatkan daftar kata biasa yang dapat diperiksa atau digunakan sebagai pembanding untuk menyaring.
from nltk.corpus import stopwords
stops = stopwords.words("english")
print(len(stops))Ubah Menjadi Set
Daftar tersebut dapat digunakan, tetapi set membuat pemeriksaan keanggotaan jauh lebih cepat. Bungkus daftar itu sekali dan gunakan kembali untuk setiap token.
stops = set(stopwords.words("english"))Saring dengan Pemahaman
Pemahaman daftar hanya mempertahankan kata-kata yang bukan kata henti. Baris tunggal ini adalah inti dari penghapusan kata henti.
tokens = ["the", "quick", "brown", "fox"]
clean = [w for w in tokens if w not in stops]
print(clean)Perhatikan Huruf Besar-Kecil
Daftarnya menggunakan huruf kecil, sehingga The tidak akan cocok dengan the. Ubah token Anda menjadi huruf kecil terlebih dahulu, atau kata henti yang diawali huruf kapital akan tetap tersisa.
clean = [w for w in tokens if w.lower() not in stops]Lihat Perbedaannya
Sebelum penyaringan, mungkin ada sepuluh token; setelahnya, hanya tersisa empat token yang bermakna. Penyusutan itu adalah noise yang baru saja Anda buang.
Bahasa Lain Juga
NLTK tidak hanya untuk bahasa Inggris. Ganti argumennya untuk mengambil daftar stopword dalam bahasa Spanyol, Jerman, Prancis, dan banyak bahasa lainnya.
spanish = set(stopwords.words("spanish"))Sesuaikan Daftarnya
Daftar tersebut hanyalah sebuah set, jadi Anda dapat add noise khusus domain Anda sendiri dengan operasi set biasa sebelum penyaringan.
stops.add("subject")
stops.update(["http", "www"])Atau Pertahankan Beberapa
Ingin melindungi kata seperti not? Cukup remove kata itu dari set agar penyaringan tidak pernah menghapusnya.
stops.discard("not")Saring Sekali, Gunakan Berkali-kali
Buat set stops Anda satu kali saat program dimulai, bukan di dalam loop. Membuatnya ulang untuk setiap dokumen akan membuang banyak waktu.
Pemeriksaan Singkat
Ada satu detail yang hampir selalu membuat orang keliru saat pertama kali mencobanya.
Ringkasan
Sekarang Anda dapat menyaring token berdasarkan stopword NLTK: unduh satu kali, buat set huruf kecil, lalu pertahankan hanya kata yang tidak ada di dalamnya. Perhatikan penggunaan huruf besar-kecil.
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Menyaring Stopword dengan NLTK” gratis?
Ya — teks lengkap “Menyaring Stopword dengan NLTK” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Menyaring Stopword dengan NLTK”?
Membuang noise dari daftar token Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai NLP Academy?
Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Menyaring Stopword dengan NLTK” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?
Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Apa Itu Stopword?
- Menyaring Stopword dengan NLTK
- Menghapus Tanda Baca dan Simbol
- Membangun Fungsi Pembersih Teks yang Dapat Digunakan Ulang