NLP Academy · Pelajaran

Menyaring Stopword dengan NLTK

Membuang noise dari daftar token

Pelajaran 2 dari 413 langkah

Menyaring Stopword dengan NLTK adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.

Biarkan NLTK Menangani Pekerjaan Berat

Membuat daftar kata henti sendiri tidak masalah, tetapi NLTK sudah menyediakan daftar pilihan untuk banyak bahasa. Mari kita gunakan pada daftar token.

Ambil Datanya Dahulu

NLTK menyimpan daftar kata sebagai data yang dapat diunduh. Anda mengambil paket kata henti sekali, lalu paket itu tetap tersimpan di mesin Anda.

import nltk
nltk.download("stopwords")

Muat Daftar Bahasa Inggris

Sekarang impor korpus tersebut dan minta bahasa Inggris. Anda akan mendapatkan daftar kata biasa yang dapat diperiksa atau digunakan sebagai pembanding untuk menyaring.

from nltk.corpus import stopwords
stops = stopwords.words("english")
print(len(stops))

Ubah Menjadi Set

Daftar tersebut dapat digunakan, tetapi set membuat pemeriksaan keanggotaan jauh lebih cepat. Bungkus daftar itu sekali dan gunakan kembali untuk setiap token.

stops = set(stopwords.words("english"))

Saring dengan Pemahaman

Pemahaman daftar hanya mempertahankan kata-kata yang bukan kata henti. Baris tunggal ini adalah inti dari penghapusan kata henti.

tokens = ["the", "quick", "brown", "fox"]
clean = [w for w in tokens if w not in stops]
print(clean)

Perhatikan Huruf Besar-Kecil

Daftarnya menggunakan huruf kecil, sehingga The tidak akan cocok dengan the. Ubah token Anda menjadi huruf kecil terlebih dahulu, atau kata henti yang diawali huruf kapital akan tetap tersisa.

clean = [w for w in tokens if w.lower() not in stops]

Lihat Perbedaannya

Sebelum penyaringan, mungkin ada sepuluh token; setelahnya, hanya tersisa empat token yang bermakna. Penyusutan itu adalah noise yang baru saja Anda buang.

Bahasa Lain Juga

NLTK tidak hanya untuk bahasa Inggris. Ganti argumennya untuk mengambil daftar stopword dalam bahasa Spanyol, Jerman, Prancis, dan banyak bahasa lainnya.

spanish = set(stopwords.words("spanish"))

Sesuaikan Daftarnya

Daftar tersebut hanyalah sebuah set, jadi Anda dapat add noise khusus domain Anda sendiri dengan operasi set biasa sebelum penyaringan.

stops.add("subject")
stops.update(["http", "www"])

Atau Pertahankan Beberapa

Ingin melindungi kata seperti not? Cukup remove kata itu dari set agar penyaringan tidak pernah menghapusnya.

stops.discard("not")

Saring Sekali, Gunakan Berkali-kali

Buat set stops Anda satu kali saat program dimulai, bukan di dalam loop. Membuatnya ulang untuk setiap dokumen akan membuang banyak waktu.

Pemeriksaan Singkat

Ada satu detail yang hampir selalu membuat orang keliru saat pertama kali mencobanya.

Ringkasan

Sekarang Anda dapat menyaring token berdasarkan stopword NLTK: unduh satu kali, buat set huruf kecil, lalu pertahankan hanya kata yang tidak ada di dalamnya. Perhatikan penggunaan huruf besar-kecil.

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Menyaring Stopword dengan NLTK” gratis?

Ya — teks lengkap “Menyaring Stopword dengan NLTK” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Menyaring Stopword dengan NLTK”?

Membuang noise dari daftar token Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai NLP Academy?

Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Menyaring Stopword dengan NLTK” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Apa Itu Stopword?
  2. Menyaring Stopword dengan NLTK
  3. Menghapus Tanda Baca dan Simbol
  4. Membangun Fungsi Pembersih Teks yang Dapat Digunakan Ulang
← Kembali ke NLP Academy