Tokenisasi dan Normalisasi
Teknik prapemrosesan teks
Tokenisasi dan Normalisasi adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 2 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 5 pelajaran total.
Dasar-Dasar Prapemrosesan Teks
Tokenisasi dan Normalisasi
Prapemrosesan teks merupakan langkah penting dalam NLP. Proses ini melibatkan transformasi teks mentah menjadi format terstruktur untuk dianalisis. Langkah-langkah utama prapemrosesan meliputi tokenisasi dan normalisasi.

Apa Itu Tokenisasi?
Apa Itu Tokenisasi?
Tokenisasi adalah proses memecah teks menjadi unit-unit yang lebih kecil, yang disebut token. Token dapat berupa kata, kalimat, atau karakter.
Sebagai contoh:
Teks: "NLP is amazing!"
Token: ["NLP", "is", "amazing", "!"]
Contoh Tokenisasi dalam Python
Contoh Tokenisasi dalam Python
Dengan menggunakan pustaka NLTK, kami dapat melakukan tokenisasi teks menjadi kata atau kalimat:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Apa Itu Normalisasi?
Apa Itu Normalisasi?
Normalisasi mencakup pembersihan dan penyeragaman teks. Teknik normalisasi yang umum meliputi:
- Pengubahan Menjadi Huruf Kecil: Mengubah seluruh teks menjadi huruf kecil.
- Penghapusan Tanda Baca: Menghilangkan tanda baca.
- Pencarian Akar Kata: Mengurangi kata menjadi bentuk akarnya, misalnya "berlari" → "lari".
- Lematisasi: Mengurangi kata menjadi bentuk dasarnya dengan menggunakan konteks, misalnya "lebih baik" → "baik".
Mengubah Menjadi Huruf Kecil dan Menghapus Tanda Baca
Mengubah Menjadi Huruf Kecil dan Menghapus Tanda Baca
Berikut cara menormalisasi teks dengan mengubahnya menjadi huruf kecil dan menghapus tanda baca:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Pencarian Akar Kata dan Lematisasi
Pencarian Akar Kata dan Lematisasi
Pencarian Akar Kata: Mengurangi kata menjadi akar katanya dengan menghapus akhiran. Teknik ini berbasis aturan dan tidak selalu menghasilkan kata yang valid.
Lematisasi: Menggunakan kosakata dan aturan tata bahasa untuk mengurangi kata menjadi bentuk dasar yang bermakna.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Penghapusan Kata Henti
Penghapusan Kata Henti
Kata henti adalah kata-kata umum, misalnya "adalah", "dan", serta "itu", yang sering kali tidak membawa makna penting. Menghapusnya dapat menyederhanakan analisis teks:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Tantangan dalam Prapemrosesan Teks
Tantangan dalam Prapemrosesan Teks
Prapemrosesan teks dapat menjadi tantangan karena:
- Ambiguitas: Kata seperti "memimpin" dapat memiliki beberapa makna.
- Konteks: Lematisasi memerlukan pemahaman terhadap konteks kata.
- Variasi Bahasa: Menangani berbagai bahasa dan dialek.
Ringkasan dan Langkah Berikutnya
Ringkasan dan Langkah Berikutnya
Dalam pelajaran ini, kita:
- Mempelajari tokenisasi dan normalisasi.
- Mengeksplorasi teknik seperti pencarian kata dasar, lemmatisasi, dan penghapusan kata henti.
- Berlatih melakukan prapemrosesan teks dengan Python.
Selanjutnya, kita akan menganalisis pola teks menggunakan model N-Gram.

Pertanyaan yang Sering Diajukan
Apakah pelajaran “Tokenisasi dan Normalisasi” gratis?
Ya — teks lengkap “Tokenisasi dan Normalisasi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 5 pelajaran total.
Apa yang akan aku pelajari di “Tokenisasi dan Normalisasi”?
Teknik prapemrosesan teks Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Learn AI with Python?
Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 5.
Berapa lama pelajaran “Tokenisasi dan Normalisasi” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?
Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Bekerja dengan Data Teks
- Tokenisasi dan Normalisasi
- Model N-Gram
- Konsep Analisis Sentimen
- Model Berbasis Transformer