Learn AI with Python · Ders

Regex ile Yapay Zeka için Metin Temizleme

HTML etiketlerini, noktalama işaretlerini, URL'leri ve e-postaları kaldırma; metin ön işleme işlevleri oluşturma.

4. ders / 413 adım

Regex ile Yapay Zeka için Metin Temizleme, CoddyKit'te ücretsiz bir Learn AI with Python dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Learn AI with Python öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Learn AI with Python kursu toplamda 4 dersten oluşur.

Yapay Zekâ için Metin Neden Temizlenir?

Web'den alınan ham metin gürültüyle doludur: HTML etiketleri, web adresleri, e-posta adresleri, gereksiz boşluklar ve özel karakterler. Bunları bir modele vermek kapasiteyi boşa harcar ve kaliteyi düşürür.

Regex, metin ön işlemenin temel aracıdır. Adım adım bir temizleme işlem hattı oluşturacağız.

Dağınık Bir Örnek

Karşılaşabileceğiniz türden bir dize aşağıda verilmiştir. Her temizleme adımı bir gürültü türünü hedefler.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

HTML Etiketlerini Kaldırma

HTML etiketleri <tag> gibi görünür. <[^>]+> deseni bir <, > olmayan herhangi bir karakter dizisi ve ardından > ile eşleşir.

Bunları boş bir dizeyle değiştirin. (Karmaşık HTML için BeautifulSoup gibi bir ayrıştırıcı kullanmayı tercih edin; ancak hızlı temizlik için regex yeterlidir.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

Web Adreslerini Kaldırma

Web adresleri http:// veya https:// ile başlar ve ardından boşluk olmayan karakterler gelir. Bunlarla eşleşip kaldırın.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

E-posta Adreslerini Kaldırma

Basit bir e-posta deseni şöyledir: sözcük karakterleri, bir @, bir alan adı, bir nokta ve üst düzey alan adı.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Kaldırmak Yerine Maskeleme

Gizlilik veri kümelerinde, cümle yapısını korumak için hassas verileri silmek yerine çoğu zaman maskelersiniz.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Özel Karakterleri Kaldırma

Harfleri, rakamları ve boşlukları koruyun; olumsuzlanmış bir kümeyle noktalama işaretlerini ve sembolleri kaldırın. Bazı noktalama işaretlerini koruyup korumamaya göre kararınızı göreve bağlı olarak verin.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Boşlukları Normalleştirme

Temizleme işlemi geride çift boşluklar ve başıboş satır sonları bırakır. \s+ ile tüm boşluk dizilerini tek bir boşluğa indirin, ardından uçlardaki boşluklar için strip() uygulayın.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Küçük Harfe Dönüştürme ve Sıralamanın Önemi

Tutarlılık için küçük harfe dönüştürme yaygındır; ancak bunu dikkatli uygulayın. Ayrıca sıralama önemlidir: özel karakterleri kaldırmadan önce HTML'yi kaldırın ve önceki kaldırma işlemlerinin aralık bırakmaması için boşlukları en son normalleştirin.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Bir Temizleme İşlem Hattı Oluşturma

Her belgenin aynı işlemlerden geçmesi için adımları tek bir işlevin içinde toplayın. Çok sayıda belgeyi işlerken hız için desenleri önceden derleyin.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

İşlem Hattını DataFrame'e Uygulama

Model kullanımına hazır bir sütun oluşturmak için temizleyiciyi apply ile tüm metin sütununda çalıştırın.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Hızlı Kontrol: Boşlukları Normalleştirme

Temizleme işleminden sonra metninizde tek boşluğa indirgemek istediğiniz birden çok boşluk ve satır sonu dizileri bulunuyor.

Özet: Regex ile Metin Temizleme

Gerçek bir ön işleme işlem hattı oluşturdunuz:

  • <[^>]+> ile HTML'yi kaldırma
  • Web adreslerini (https?://\S+) ve e-posta adreslerini kaldırma
  • [EMAIL] gibi yer tutucularla hassas verileri maskeleme
  • Olumsuzlanmış bir kümeyle özel karakterleri kaldırma
  • \s+ + strip() ile boşlukları normalleştirme
  • Bunları bir işlevde toplayıp bir sütuna apply uygulama

Yapay zekâ için regex konusu tamamlandı. Sıradaki adım: yapay zekâ projeleri için veritabanları.

Başlamak ücretsiz

Yapay zeka eğitmeniyle Python öğren — ücretsiz

Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.

Kurslar
53
Dersler
225

Sıkça Sorulan Sorular

“Regex ile Yapay Zeka için Metin Temizleme” dersi ücretsiz mi?

Evet — “Regex ile Yapay Zeka için Metin Temizleme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Learn AI with Python kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Learn AI with Python kursu toplamda 4 dersten oluşur.

“Regex ile Yapay Zeka için Metin Temizleme” dersinde ne öğreneceğim?

HTML etiketlerini, noktalama işaretlerini, URL'leri ve e-postaları kaldırma; metin ön işleme işlevleri oluşturma. Learn AI with Python ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

Learn AI with Python öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te Learn AI with Python, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“Regex ile Yapay Zeka için Metin Temizleme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu Learn AI with Python dersinde kod yazıp çalıştırabilir miyim?

Evet. Her Learn AI with Python dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Düzenli İfade Örüntüleri ve Karakter Sınıfları
  2. re Modülü: search, match, findall, sub
  3. Yakalama Grupları ve Adlandırılmış Gruplar
  4. Regex ile Yapay Zeka için Metin Temizleme
← Learn AI with Python Sayfasına Dön