0Pricing
Python Academy · Pelajaran

Tokenisasi dan Normalisasi

Teknik prapemrosesan teks

Tokenisasi dan Normalisasi adalah pelajaran Python Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python Academy mencakup 5 pelajaran total.

Dasar-Dasar Prapemrosesan Teks

Tokenisasi dan Normalisasi

Prapemrosesan teks merupakan langkah penting dalam NLP. Proses ini mengubah teks mentah menjadi format terstruktur untuk dianalisis. Langkah-langkah utama prapemrosesan meliputi tokenisasi dan normalisasi.

Tokenisasi dan Normalisasi — ilustrasi 1

Apa itu Tokenisasi

Apa itu Tokenisasi?

Tokenisasi adalah proses memecah teks menjadi unit-unit yang lebih kecil, yang disebut token. Token dapat berupa kata, kalimat, atau karakter.

Sebagai contoh:

Teks: "NLP is amazing!"

Token: ["NLP", "is", "amazing", "!"]

Contoh Tokenisasi dalam Python

Contoh Tokenisasi dalam Python

Dengan menggunakan pustaka NLTK, kita dapat melakukan tokenisasi teks menjadi kata atau kalimat:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Apa itu Normalisasi

Apa itu Normalisasi?

Normalisasi mencakup pembersihan dan penyeragaman teks. Teknik normalisasi yang umum meliputi:

  • Pengubahan Huruf Menjadi Kecil: Mengubah semua teks menjadi huruf kecil.
  • Penghapusan Tanda Baca: Menghilangkan tanda-tanda baca.
  • Pemotongan Kata: Mengurangi kata menjadi bentuk akarnya (misalnya, "running" → "run").
  • Lematisasi: Mengurangi kata menjadi bentuk dasarnya menggunakan konteks (misalnya, "better" → "good").

Pengubahan Huruf Menjadi Kecil dan Penghapusan Tanda Baca

Pengubahan Huruf Menjadi Kecil dan Penghapusan Tanda Baca

Berikut cara menormalisasi teks dengan mengubahnya menjadi huruf kecil dan menghapus tanda baca:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Pemotongan Kata dan Lematisasi

Pemotongan Kata dan Lematisasi

Pemotongan Kata: Mengurangi kata menjadi akarnya dengan memotong akhiran. Teknik ini berbasis aturan dan mungkin tidak selalu menghasilkan kata yang valid.

Lematisasi: Menggunakan kosakata dan aturan tata bahasa untuk mengurangi kata menjadi bentuk dasar yang bermakna.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Penghapusan Kata Henti

Penghapusan Kata Henti

Kata henti adalah kata-kata umum (misalnya, "adalah", "dan", "itu") yang sering kali tidak membawa makna penting. Menghapusnya dapat menyederhanakan analisis teks:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Tantangan dalam Prapemrosesan Teks

Tantangan dalam Prapemrosesan Teks

Prapemrosesan teks dapat menjadi tantangan karena:

  • Ambiguitas: Kata seperti "bisa" dapat memiliki banyak makna.
  • Konteks: Lematisasi memerlukan pemahaman terhadap konteks kata.
  • Keragaman Bahasa: Menangani berbagai bahasa dan dialek.

Ringkasan dan Langkah Berikutnya

Ringkasan dan Langkah Berikutnya

Dalam pelajaran ini, kita:

  • Mempelajari tokenisasi dan normalisasi.
  • Mempelajari teknik seperti pemotongan kata, lematisasi, dan penghapusan kata henti.
  • Berlatih melakukan prapemrosesan teks dengan Python.

Selanjutnya, kita akan menganalisis pola teks menggunakan model N-Gram.

Tokenisasi dan Normalisasi — ilustrasi 10

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Tokenisasi dan Normalisasi” gratis?

Ya — teks lengkap “Tokenisasi dan Normalisasi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python Academy, upgrade ke CoddyKit PRO. Kursus Python Academy mencakup 5 pelajaran total.

Apa yang akan aku pelajari di “Tokenisasi dan Normalisasi”?

Teknik prapemrosesan teks Kamu berlatih Python Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Python Academy?

Tidak diperlukan pengalaman sebelumnya. Python Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 5.

Berapa lama pelajaran “Tokenisasi dan Normalisasi” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Bekerja dengan Data Teks
  2. Tokenisasi dan Normalisasi
  3. Model N-Gram
  4. Konsep Analisis Sentimen
  5. Model Berbasis Transformer
← Kembali ke Python Academy