Pandas & NumPy Academy · Ders

Satış Veri Kümesini Yükleme ve Denetleme

Sipariş kayıtlarının bulunduğu bir CSV içe aktarın, dtypes ve eksik değerleri denetleyin; tarih ayrıştırma sorunlarını ve negatif miktar anormalliklerini düzeltin.

1. ders / 413 adım

Satış Veri Kümesini Yükleme ve Denetleme, CoddyKit'te ücretsiz bir Pandas & NumPy Academy dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Pandas & NumPy Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Pandas & NumPy Academy kursu toplamda 4 dersten oluşur.

Satış Veri Kümesini Tanıma

Tipik bir satış veri kümesinde order_id, order_date, customer_id, product, category, quantity, unit_price ve region gibi sütunlar bulunur. Herhangi bir analize başlamadan önce bu dosyayı yüklemeli ve yapısına ilk kez göz atmalısınız. Bu ilk adımın amacı, tek bir formül bile yazmadan önce hangi verilere sahip olduğunuzu anlamaktır.

import pandas as pd

df = pd.read_csv('sales.csv')
print(df.shape)       # (rows, columns)
print(df.head())

Şekli ve Sütun Adlarını Denetleme

Yüklemeden hemen sonra veri kümesinin boyutlarını öğrenmek için df.shape, tüm sütun adlarını görmek için df.columns değerini denetleyin. Bu, dosyanın doğru yüklendiğini doğrular ve temizlenmesi gereken beklenmedik boşluklar veya büyük-küçük harf kullanımları olup olmadığını gösterir. Beklenen sütun sayısıyla uyuşmama, bozuk bir dosyanın erken uyarı işaretidir.

print('Rows, Cols:', df.shape)
print('Columns:', df.columns.tolist())
print('Index:', df.index[:5].tolist())

dtypes ile Veri Türlerini İnceleme

Her sütunun çıkarılan veri türünü görmek için df.dtypes veya df.info() kullanın. Yaygın sorunlar arasında tarih sütunlarının object (dize) olarak yüklenmesi ve başıboş virgüller ya da para birimi simgeleri nedeniyle sayısal sütunların object olarak yüklenmesi bulunur. Veri türü sorunlarını erken yakalamak, daha sonra yapılacak aritmetik işlemlerde sessiz hataları önler.

print(df.dtypes)

# More detail including non-null counts
df.info()

Eksik Değerleri Sayma

Sütun başına NaN değerlerini saymak için df.isna().sum() çalıştırın. Her sütunun ne kadarının eksik olduğunu görmek için df.isna().mean() * 100 ile yüzdeye dönüştürün. %30–40'tan fazlası eksik olan sütunlar için genellikle bir karar vermek gerekir: sütunu silmek, eksik değerleri tahmin ederek doldurmak veya ayrı bir gösterge değişkeni olarak işaretlemek.

missing = df.isna().sum()
missing_pct = df.isna().mean() * 100

print(pd.DataFrame({'count': missing, 'pct': missing_pct}))

Yinelenen Satırları Belirleme

Yinelenen sipariş kayıtları gelir toplamlarını artırır ve müşteri başına yapılan analizleri bozar. Tam yinelenenleri saymak için df.duplicated().sum(), benzersiz olması gereken yinelenen sipariş kimliklerini denetlemek için df.duplicated(subset=['order_id']).sum() kullanın. Yinelenenleri yükleme sırasında belirlemek, daha sonra hata ayıklamak için harcanacak saatleri kurtarır.

print('Exact duplicates:', df.duplicated().sum())
print('Duplicate order_ids:', df.duplicated(subset=['order_id']).sum())

# Preview the duplicated rows
print(df[df.duplicated(subset=['order_id'], keep=False)].head())

Tarih Sütunu Ayrıştırmasını Düzeltme

object olarak yüklenen bir tarih sütunu, tarih aritmetiği yapabilmeniz için pd.to_datetime() ile dönüştürülmelidir. Biçimi biliyorsanız format='%Y-%m-%d' geçin; karma biçimler için infer_datetime_format=True kullanın. Dönüştürmeden sonra zaman temelli gruplama yapmak için .dt erişicisiyle yılı ve ayı çıkarın.

df['order_date'] = pd.to_datetime(df['order_date'], format='%Y-%m-%d')

df['year'] = df['order_date'].dt.year
df['month'] = df['order_date'].dt.month

print(df[['order_date', 'year', 'month']].head())

Negatif Miktarları Belirleme

Negatif quantity değerleri genellikle iadeleri veya veri giriş hatalarını gösterir. Bunları bulmak için Boole dizinlemeyi kullanın: df[df['quantity'] < 0]. Bunları geçerli iadeler olarak mı ele alacağınıza (bir işaretle tutma) yoksa hata olarak mı değerlendireceğinize (silme veya düzeltme) karar verin. İşlem hattının yeniden üretilebilir olması için kararınızı her zaman belgeleyin.

negatives = df[df['quantity'] < 0]
print(f'Negative quantity rows: {len(negatives)}')
print(negatives.head())

# Flag returns separately
df['is_return'] = df['quantity'] < 0

Sayısal Sütun Aralıklarını Denetleme

Her sayısal sütunun minimum, maksimum, ortalama ve çeyrekliklerini görmek için df.describe() kullanın. Minimum değeri sıfır veya negatif olan bir unit_price şüphelidir. Makul herhangi bir sipariş boyutunun çok üzerindeki bir quantity maksimumu veri giriş hatası olabilir. Aralıkların makulluk kontrolünü yapmak, aykırı değerleri belirlemenin hızlı bir yoludur.

print(df[['quantity', 'unit_price']].describe())

# Any price exactly 0?
print('Zero price rows:', (df['unit_price'] == 0).sum())

Kategorik Sütunları Denetleme

region ve category gibi sütunlarda tüm benzersiz değerleri ve bunların sıklıklarını görmek için df['region'].value_counts() kullanın. Yazım hatalarını, tutarsız büyük-küçük harf kullanımını (örneğin 'north' ile 'North') veya üst veri kaynağındaki sorunlara işaret eden beklenmeyen değerleri arayın. Herhangi bir groupby işleminden önce bunları standartlaştırın.

print(df['region'].value_counts())
print(df['category'].value_counts())

# Normalise capitalisation
df['region'] = df['region'].str.strip().str.title()

Denetim Özeti Oluşturma

Yapılandırılmış bir denetim özeti DataFrame'i, veri kalitesi sorunlarının ilgili kişilere aktarılmasına yardımcı olur. Satır sayısı, sütun sayısı, eksik değer sayıları ve yinelenen değer sayıları gibi ölçümleri bir sözlükte toplayıp bunu bir DataFrame'e dönüştürerek bir özet oluşturun. Bu özet, analiz raporunuzun ilk bölümü olur ve uyguladığınız her temizleme adımını gerekçelendirir.

audit = {
    'rows': len(df),
    'columns': len(df.columns),
    'missing_cells': df.isna().sum().sum(),
    'duplicate_rows': df.duplicated().sum(),
    'date_range_start': df['order_date'].min(),
    'date_range_end': df['order_date'].max()
}

for k, v in audit.items():
    print(f'{k}: {v}')

Temiz Bir Anlık Görüntü Kaydetme

İlk denetim ve temel düzeltmelerden (veri türü düzeltmeleri, yinelenenleri kaldırma, işaret sütunları) sonra, sonraki adımların her zaman tutarlı bir başlangıç noktasından başlaması için temiz bir anlık görüntü kaydedin. df.to_csv('sales_clean.csv', index=False) kullanın veya daha hızlı yeniden yükleme için df.to_parquet('sales_clean.parquet') kullanın. Parquet, CSV'nin koruyamadığı datetime dahil veri türlerini korur.

# Drop exact duplicates before saving
df = df.drop_duplicates(subset=['order_id'], keep='first')

# Save clean snapshot
df.to_parquet('sales_clean.parquet', index=False)
print('Saved', len(df), 'rows to sales_clean.parquet')

Hızlı Kontrol

Bu dersteki Veri Analizi kavramlarına ilişkin anlayışınızı sınayın.

Ders Özeti

Bu derste şunları öğrendiniz: CSV yükleme ve şekli/sütunları denetleme, veri türlerini, eksik değerleri, yinelenenleri ve negatif miktarları denetleme ve sonraki adımlar için temiz bir anlık görüntü kaydetme. Sırada temiz veri kümesi üzerinde gelir hesaplamalarını ve özellik mühendisliğini inceleyeceğiz.

Başlamak ücretsiz

Yapay zeka eğitmeniyle Python öğren — ücretsiz

Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.

Kurslar
30
Dersler
120

Sıkça Sorulan Sorular

“Satış Veri Kümesini Yükleme ve Denetleme” dersi ücretsiz mi?

Evet — “Satış Veri Kümesini Yükleme ve Denetleme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Pandas & NumPy Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Pandas & NumPy Academy kursu toplamda 4 dersten oluşur.

“Satış Veri Kümesini Yükleme ve Denetleme” dersinde ne öğreneceğim?

Sipariş kayıtlarının bulunduğu bir CSV içe aktarın, dtypes ve eksik değerleri denetleyin; tarih ayrıştırma sorunlarını ve negatif miktar anormalliklerini düzeltin. Pandas & NumPy Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

Pandas & NumPy Academy öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te Pandas & NumPy Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.

“Satış Veri Kümesini Yükleme ve Denetleme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu Pandas & NumPy Academy dersinde kod yazıp çalıştırabilir miyim?

Evet. Her Pandas & NumPy Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Satış Veri Kümesini Yükleme ve Denetleme
  2. Gelir Hesaplamaları ve Özellik Mühendisliği
  3. Bölge ve Kategoriye Göre GroupBy Analizi
  4. Aylık Eğilim Görselleştirmesi
← Pandas & NumPy Academy Sayfasına Dön