Belirteçlere ayırma ve normalleştirme
Metin ön işleme teknikleri
Belirteçlere ayırma ve normalleştirme, CoddyKit'te ücretsiz bir Python Academy dersidir. Bu, 5 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Python Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Python Academy kursu toplamda 5 dersten oluşur.
Metin Ön İşleme Temelleri
Belirteçlere Ayırma ve Normalleştirme
Metin ön işleme, NLP'de çok önemli bir adımdır. Ham metni analiz için yapılandırılmış bir biçime dönüştürmeyi içerir. Temel ön işleme adımları arasında belirteçlere ayırma ve normalleştirme bulunur.

Belirteçlere Ayırma Nedir?
Belirteçlere Ayırma Nedir?
Belirteçlere ayırma, metni belirteç adı verilen daha küçük birimlere bölme işlemidir. Belirteçler sözcükler, cümleler veya karakterler olabilir.
Örneğin:
Metin: "NLP is amazing!"
Belirteçler: ["NLP", "is", "amazing", "!"]
Python'da Belirteçlere Ayırma Örneği
Python'da Belirteçlere Ayırma Örneği
NLTK kütüphanesini kullanarak metni sözcüklere veya cümlelere ayırabiliriz:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Normalleştirme Nedir?
Normalleştirme Nedir?
Normalleştirme, metni temizlemeyi ve standartlaştırmayı içerir. Yaygın normalleştirme teknikleri şunlardır:
- Küçük Harfe Dönüştürme: Tüm metni küçük harfe dönüştürme.
- Noktalama İşaretlerini Kaldırma: Noktalama işaretlerini silme.
- Kök Biçime İndirgeme: Sözcükleri kök biçimlerine indirgeme (ör. "running" → "run").
- Sözcük Köküne İndirgeme: Bağlamı kullanarak sözcükleri temel biçimlerine indirgeme (ör. "better" → "good").
Küçük Harfe Dönüştürme ve Noktalama İşaretlerini Kaldırma
Küçük Harfe Dönüştürme ve Noktalama İşaretlerini Kaldırma
Metni küçük harfe dönüştürüp noktalama işaretlerini kaldırarak nasıl normalleştireceğiniz aşağıda açıklanmıştır:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Kök Biçime ve Sözcük Köküne İndirgeme
Kök Biçime ve Sözcük Köküne İndirgeme
Kök Biçime İndirgeme: Sonekleri keserek sözcükleri köklerine indirger. Kurallara dayanır ve her zaman geçerli sözcükler üretmeyebilir.
Sözcük Köküne İndirgeme: Sözcükleri anlamlı temel biçimlerine indirmek için bir sözlük ve dil bilgisi kuralları kullanır.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Durak Sözcükleri Kaldırma
Durak Sözcükleri Kaldırma
Durak sözcükler, çoğu zaman önemli bir anlam taşımayan yaygın sözcüklerdir (ör. "is", "and", "the"). Bunları kaldırmak metin analizini basitleştirebilir:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Metin Ön İşlemedeki Zorluklar
Metin Ön İşlemedeki Zorluklar
Metin ön işleme şu nedenlerle zor olabilir:
- Belirsizlik: "lead" gibi sözcüklerin birden fazla anlamı olabilir.
- Bağlam: Sözcük köküne indirgeme, sözcüğün bağlamının anlaşılmasını gerektirir.
- Dil Farklılıkları: Farklı dilleri ve lehçeleri işleme.
Özet ve Sonraki Adımlar
Özet ve Sonraki Adımlar
Bu derste:
- Belirteçlere ayırma ve normalleştirme hakkında bilgi edindik.
- Kök biçime indirgeme, sözcük köküne indirgeme ve durak sözcükleri kaldırma gibi teknikleri inceledik.
- Python ile metin ön işleme uygulamaları yaptık.
Sonraki adımda N-Gram modellerini kullanarak metin örüntülerini analiz edeceğiz.

Sıkça Sorulan Sorular
“Belirteçlere ayırma ve normalleştirme” dersi ücretsiz mi?
Evet — “Belirteçlere ayırma ve normalleştirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Python Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Python Academy kursu toplamda 5 dersten oluşur.
“Belirteçlere ayırma ve normalleştirme” dersinde ne öğreneceğim?
Metin ön işleme teknikleri Python Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
Python Academy öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te Python Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 5 dersinin 2. dersidir.
“Belirteçlere ayırma ve normalleştirme” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu Python Academy dersinde kod yazıp çalıştırabilir miyim?
Evet. Her Python Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Metin verileriyle çalışma
- Belirteçlere ayırma ve normalleştirme
- N-Gram modelleri
- Duygu analizi kavramları
- Dönüştürücü tabanlı modeller