Learn AI with Python · Pelajaran

Membersihkan Teks untuk Kecerdasan Buatan dengan Regex

Menghapus tag HTML, tanda baca, URL, dan email — membangun fungsi prapemrosesan teks.

Pelajaran 4 dari 413 langkah

Membersihkan Teks untuk Kecerdasan Buatan dengan Regex adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 4 pelajaran total.

Mengapa Teks Perlu Dibersihkan untuk Kecerdasan Buatan?

Teks mentah dari web penuh dengan gangguan: tag HTML, alamat web, alamat surel, spasi berlebih, dan karakter khusus. Memasukkan semua itu ke model memboroskan kapasitas dan menurunkan kualitas.

Ekspresi reguler adalah alat utama untuk prapemrosesan teks. Kita akan membangun alur pembersihan langkah demi langkah.

Contoh yang Berantakan

Inilah jenis string yang mungkin Anda ambil dari web. Setiap langkah pembersihan menargetkan satu jenis gangguan.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

Menghapus Tag HTML

Tag HTML tampak seperti <tag>. Pola <[^>]+> mencocokkan <, karakter apa pun yang bukan >, lalu >.

Ganti tag tersebut dengan string kosong. (Untuk HTML kompleks, gunakan parser seperti BeautifulSoup, tetapi ekspresi reguler cukup untuk pembersihan cepat.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

Menghapus Alamat Web

Alamat web dimulai dengan http:// atau https://, lalu diikuti karakter yang bukan spasi. Cocokkan dan hapus alamat tersebut.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

Menghapus Alamat Surel

Pola alamat surel sederhana terdiri dari karakter kata, @, domain, titik, dan domain tingkat teratas.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Menyamarkan Alih-alih Menghapus

Untuk kumpulan data privasi, Anda sering kali menyamarkan data sensitif alih-alih menghapusnya, sehingga struktur kalimat tetap terjaga.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Menghapus Karakter Khusus

Pertahankan huruf, digit, dan spasi; hapus tanda baca serta simbol dengan himpunan negasi. Untuk setiap tugas, tentukan apakah beberapa tanda baca perlu dipertahankan.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Menormalkan Spasi

Pembersihan menyisakan spasi ganda dan baris baru yang terselip. Padatkan setiap rangkaian spasi menjadi satu spasi dengan \s+, lalu terapkan strip() pada bagian ujungnya.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Mengubah ke Huruf Kecil dan Memperhatikan Urutan

Mengubah teks menjadi huruf kecil umum dilakukan demi konsistensi, tetapi terapkan dengan hati-hati. Selain itu, urutan itu penting: hapus tag HTML sebelum menghapus karakter khusus, lalu normalkan spasi terakhir agar penghapusan sebelumnya tidak menyisakan celah.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Membangun Alur Pembersihan

Bungkus langkah-langkah tersebut dalam satu fungsi agar setiap dokumen mendapatkan perlakuan yang sama. Kompilasi pola terlebih dahulu untuk meningkatkan kecepatan saat memproses banyak dokumen.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

Menerapkan Alur pada DataFrame

Jalankan pembersih pada seluruh kolom teks dengan apply untuk menghasilkan kolom yang siap digunakan model.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Pemeriksaan Singkat: Normalisasi Spasi

Setelah dibersihkan, teks Anda memiliki rangkaian beberapa spasi dan baris baru yang ingin dipadatkan menjadi spasi tunggal.

Ringkasan: Pembersihan Teks dengan Ekspresi Reguler

Anda telah membangun alur prapemrosesan nyata:

  • Hapus tag HTML dengan <[^>]+>
  • Hapus alamat web (https?://\S+) dan alamat surel
  • Samarkan data sensitif dengan penanda seperti [EMAIL]
  • Buang karakter khusus dengan himpunan negasi
  • Normalkan spasi dengan \s+ + strip()
  • Bungkus dalam fungsi dan terapkan dengan apply pada sebuah kolom

Materi ekspresi reguler untuk kecerdasan buatan berbasis teks selesai. Berikutnya: basis data untuk proyek kecerdasan buatan.

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
53
Pelajaran
225

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Membersihkan Teks untuk Kecerdasan Buatan dengan Regex” gratis?

Ya — teks lengkap “Membersihkan Teks untuk Kecerdasan Buatan dengan Regex” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Membersihkan Teks untuk Kecerdasan Buatan dengan Regex”?

Menghapus tag HTML, tanda baca, URL, dan email — membangun fungsi prapemrosesan teks. Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Learn AI with Python?

Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Membersihkan Teks untuk Kecerdasan Buatan dengan Regex” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?

Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pola Regex dan Kelas Karakter
  2. Modul re: search, match, findall, sub
  3. Grup Penangkap dan Grup Bernama
  4. Membersihkan Teks untuk Kecerdasan Buatan dengan Regex
← Kembali ke Learn AI with Python