Tokenisasi dan Normalisasi
Teknik prapemprosesan teks.
Tokenisasi dan Normalisasi ialah pelajaran Pelajari AI dengan Python percuma di CoddyKit. Ini ialah pelajaran 2 daripada 5. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Pelajari AI dengan Python, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Pelajari AI dengan Python merangkumi sejumlah 5 pelajaran.
Asas Prapemprosesan Teks
Tokenisasi dan Normalisasi
Prapemprosesan teks ialah langkah penting dalam NLP. Proses ini melibatkan penukaran teks mentah kepada format berstruktur untuk dianalisis. Langkah utama prapemprosesan termasuk tokenisasi dan normalisasi.

Apakah Tokenisasi?
Tokenisasi ialah proses memecahkan teks kepada unit yang lebih kecil, yang dipanggil token. Token boleh berupa perkataan, ayat atau aksara.
Sebagai contoh:
Teks: "NLP is amazing!"
Token: ["NLP", "is", "amazing", "!"]
Contoh Tokenisasi dalam Python
Dengan menggunakan pustaka NLTK, kita boleh melakukan tokenisasi teks kepada perkataan atau ayat:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Apakah Penormalan?
Penormalan melibatkan pembersihan dan penyeragaman teks. Teknik penormalan lazim termasuk:
- Penukaran kepada Huruf Kecil: Menukar semua teks kepada huruf kecil.
- Pembuangan Tanda Baca: Menghapuskan tanda baca.
- Pengakaran: Mengurangkan perkataan kepada bentuk akarnya (contohnya, "berlari" → "lari").
- Lemmatisasi: Mengurangkan perkataan kepada bentuk dasarnya menggunakan konteks (contohnya, "lebih baik" → "baik").
Menukar kepada Huruf Kecil dan Membuang Tanda Baca
Begini cara menormalkan teks dengan menukarkannya kepada huruf kecil dan membuang tanda baca:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Pengakaran dan Lemmatisasi
Pengakaran: Mengurangkan perkataan kepada akarnya dengan memotong imbuhan akhiran. Kaedah ini berasaskan peraturan dan mungkin tidak sentiasa menghasilkan perkataan yang sah.
Lemmatisasi: Menggunakan kosa kata dan peraturan tatabahasa untuk mengurangkan perkataan kepada bentuk dasarnya yang bermakna.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Pembuangan Kata Henti
Kata henti ialah perkataan lazim (contohnya, "ialah", "dan", "itu") yang selalunya tidak membawa makna penting. Membuangnya boleh memudahkan analisis teks:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Cabaran dalam Prapemprosesan Teks
Prapemprosesan teks boleh menjadi mencabar disebabkan oleh:
- Kesamaran: Perkataan seperti "bisa" boleh mempunyai beberapa makna.
- Konteks: Lemmatisasi memerlukan pemahaman terhadap konteks perkataan.
- Variasi Bahasa: Mengendalikan bahasa dan dialek yang berbeza.
Ringkasan dan Langkah Seterusnya
Dalam pelajaran ini, kita telah:
- Mempelajari tokenisasi dan normalisasi.
- Meneroka teknik seperti pengakaran kata, lemmatisasi dan pembuangan kata henti.
- Mempraktikkan prapemprosesan teks dengan Python.
Seterusnya, kita akan menganalisis corak teks menggunakan model N-Gram.

Pelajari Python dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 53
- Pelajaran
- 225
Soalan Lazim
Adakah pelajaran “Tokenisasi dan Normalisasi” percuma?
Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Pelajari AI dengan Python, termasuk “Tokenisasi dan Normalisasi”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Pelajari AI dengan Python merangkumi sejumlah 5 pelajaran.
Apakah yang akan saya pelajari dalam “Tokenisasi dan Normalisasi”?
Teknik prapemprosesan teks. Anda berlatih Pelajari AI dengan Python menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan Pelajari AI dengan Python?
Tiada pengalaman terdahulu diperlukan. Pembelajaran Pelajari AI dengan Python di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 5.
Berapa lamakah pelajaran “Tokenisasi dan Normalisasi” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran Pelajari AI dengan Python ini?
Ya. Setiap pelajaran Pelajari AI dengan Python menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Bekerja dengan Data Teks
- Tokenisasi dan Normalisasi
- Model N-Gram
- Konsep Analisis Sentimen
- Model Berasaskan Transformer