Python Academy · Pelajaran

Penge-tokenan dan Penormalan

Teknik prapemprosesan teks.

Pelajaran 2 daripada 510 langkah

Penge-tokenan dan Penormalan ialah pelajaran Python Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 5. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Python Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Asas Prapemprosesan Teks

Tokenisasi dan Normalisasi

Prapemprosesan teks ialah langkah penting dalam NLP. Proses ini melibatkan penukaran teks mentah kepada format berstruktur untuk dianalisis. Langkah prapemprosesan utama termasuk tokenisasi dan normalisasi.

Penge-tokenan dan Penormalan — ilustrasi 1

Apakah Tokenisasi?

Tokenisasi ialah proses memecahkan teks kepada unit yang lebih kecil, yang dipanggil token. Token boleh berupa perkataan, ayat atau aksara.

Contohnya:

Teks: "NLP is amazing!"

Token: ["NLP", "is", "amazing", "!"]

Contoh Tokenisasi dalam Python

Menggunakan pustaka NLTK, kami boleh membahagikan teks kepada perkataan atau ayat:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Apakah Normalisasi?

Normalisasi melibatkan pembersihan dan penyeragaman teks. Teknik normalisasi yang lazim termasuk:

  • Penukaran kepada Huruf Kecil: Menukar semua teks kepada huruf kecil.
  • Pembuangan Tanda Baca: Menghapuskan tanda baca.
  • Pengakaran: Mengurangkan perkataan kepada bentuk akarnya, contohnya, "berlari" → "lari".
  • Lemmatisasi: Mengurangkan perkataan kepada bentuk dasarnya menggunakan konteks, contohnya, "lebih baik" → "baik".

Penukaran kepada Huruf Kecil dan Pembuangan Tanda Baca

Beginilah cara menormalkan teks dengan menukarkannya kepada huruf kecil dan membuang tanda baca:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Pengakaran dan Lemmatisasi

Pengakaran: Mengurangkan perkataan kepada akarnya dengan membuang imbuhan. Kaedah ini berasaskan peraturan dan mungkin tidak sentiasa menghasilkan perkataan yang sah.

Lemmatisasi: Menggunakan kosa kata dan peraturan tatabahasa untuk mengurangkan perkataan kepada bentuk dasar yang bermakna.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Pembuangan Kata Henti

Kata henti ialah perkataan lazim seperti "ialah", "dan" serta "itu" yang sering tidak membawa makna penting. Membuangnya dapat memudahkan analisis teks:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Cabaran dalam Prapemprosesan Teks

Prapemprosesan teks boleh menjadi mencabar disebabkan oleh:

  • Kekaburan: Perkataan seperti "bisa" boleh mempunyai pelbagai makna.
  • Konteks: Lemmatisasi memerlukan pemahaman tentang konteks perkataan.
  • Variasi Bahasa: Mengendalikan bahasa dan dialek yang berbeza.

Ringkasan dan Langkah Seterusnya

Dalam pelajaran ini, kami:

  • Mempelajari tokenisasi dan normalisasi.
  • Meneroka teknik seperti pengakaran, lemmatisasi dan pembuangan kata henti.
  • Mempraktikkan prapemprosesan teks dengan Python.

Seterusnya, kami akan menganalisis corak teks menggunakan model N-Gram.

Penge-tokenan dan Penormalan — ilustrasi 10
Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
76
Pelajaran
320

Soalan Lazim

Adakah pelajaran “Penge-tokenan dan Penormalan” percuma?

Ya — teks penuh “Penge-tokenan dan Penormalan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Python Academy, tingkat taraf kepada CoddyKit PRO. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Apakah yang akan saya pelajari dalam “Penge-tokenan dan Penormalan”?

Teknik prapemprosesan teks. Anda berlatih Python Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Python Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Python Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 5.

Berapa lamakah pelajaran “Penge-tokenan dan Penormalan” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Bekerja dengan Data Teks
  2. Penge-tokenan dan Penormalan
  3. Model N-Gram
  4. Konsep Analisis Sentimen
  5. Model Berasaskan Transformer
← Kembali ke Python Academy