Temel DataFrame İncelemesi
Herhangi bir DataFrame’in içeriğini ve yapısını hızla anlamak için head(), tail(), info(), describe() ve shape kullanın.
Temel DataFrame İncelemesi, CoddyKit'te ücretsiz bir Pandas & NumPy Academy dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Pandas & NumPy Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Pandas & NumPy Academy kursu toplamda 4 dersten oluşur.
Her DataFrame için İlk Beş Adım
Yeni bir veri kümesi yüklediğinizde sistematik bir inceleme sırası, hata ayıklama için harcanan saatleri kurtarır. Pandas araç setinde bunun için şunlar bulunur: ilk satırları görmek için head(), son satırlar için tail(), sütun türleri ve boş değerler için info(), istatistikler için describe() ve boyutlar için shape. Bu beş kontrolün çalıştırılması bir dakikadan kısa sürer ve veri kalitesi sorunlarının çoğunu hemen ortaya çıkarır.
import pandas as pd
# Assume df is loaded from a CSV
print(df.shape) # (rows, cols)
df.head() # first 5 rows
df.info() # dtypes + non-null counts
df.describe() # statisticshead() ve tail()
df.head(n), ilk n satırı (varsayılan olarak 5) DataFrame biçiminde döndürür. df.tail(n), son n satırı döndürür. Birlikte kullanıldıklarında verilerin doğru ayrıştırıldığını doğrulamanıza yardımcı olurlar: sütun adlarının başlık satırında olduğunu, sayısal sütunların sayılar içerdiğini ve tarih dizelerinin yanlış yorumlanmadığını kontrol edebilirsiniz. Bu işlemler veriyi değiştirmez ve yeni DataFrame'ler döndürür.
import pandas as pd
df = pd.DataFrame({'a': range(20), 'b': range(20, 40)})
print(df.head(3))
# a b
# 0 0 20
# 1 1 21
# 2 2 22
print(df.tail(2))
# a b
# 18 18 38
# 19 19 39info(): Türler ve Boş Olmayan Değer Sayıları
df.info(), kısa bir özet yazdırır: dizinin veri türünü, sütun başına boş olmayan değer sayısını, her sütunun veri türünü ve toplam bellek kullanımını gösterir. Boş olmayan değer sayısı toplam satır sayısından az olan sütunlarda eksik veri vardır. Object veri türü çoğunlukla, analizden önce temizlenmesi gerekebilecek bir dize sütunu (veya karma türde bir sütun) anlamına gelir.
import pandas as pd
import numpy as np
df = pd.DataFrame({'name': ['A', 'B', None],
'score': [80.0, np.nan, 90.0],
'grade': ['A', 'C', 'A']})
df.info()
# Column Non-Null Count Dtype
# name 2 non-null object
# score 2 non-null float64
# grade 3 non-null objectdescribe(): İstatistiksel Özet
df.describe(), tüm sayısal sütunlar için count, mean, std, min, 25th, 50th (medyan), 75th yüzdelik dilim ve max değerlerini hesaplar. Object (dize) sütunlarını da özetlemek için include='all' aktarın. Yalnızca kategorik sütunları özetlemek için include='object' aktarın. Çıktının kendisi bir DataFrame'dir; bu nedenle onu kaydedebilir veya bir rapor için biçimlendirebilirsiniz.
import pandas as pd
df = pd.DataFrame({'age': [25, 30, 35, 40], 'score': [88, 72, 91, 65]})
print(df.describe().round(1))
# age score
# count 4.0 4.0
# mean 32.5 79.0
# std 6.5 12.0shape, ndim ve size
df.shape, (nrows, ncols) biçiminde bir demettir. df.ndim, DataFrame'ler için her zaman 2 döndürür. df.size, toplam hücre sayısıdır. Satır sayısı için len(df) kullanın; bu değer df.shape[0] ile aynıdır. Bunlar en basit tutarlılık kontrolleridir: yüklemeden sonra ve her filtreleme adımından sonra beklenen satır sayısını doğrulayın.
import pandas as pd
df = pd.DataFrame({'x': range(100), 'y': range(100), 'z': range(100)})
print(df.shape) # (100, 3)
print(len(df)) # 100
print(df.size) # 300
print(df.ndim) # 2dtypes ve select_dtypes()
df.dtypes, her sütun adını veri türüne eşleyen bir Series döndürür. df.select_dtypes(include='number'), yalnızca sayısal sütunları içeren yeni bir DataFrame döndürür; bu, dize sütunları üzerinde yanlışlıkla işlem yapmadan korelasyon hesaplamak veya sayısal dönüşümler uygulamak için kullanışlıdır. Metin sütunlarını kaldırmak için exclude='object' aktarın.
import pandas as pd
df = pd.DataFrame({'a': [1,2], 'b': [1.0,2.0], 'c': ['x','y']})
print(df.dtypes)
# a int64
# b float64
# c object
numeric = df.select_dtypes(include='number')
print(numeric.columns.tolist()) # ['a', 'b']isnull() ve Boş Değer Sayıları
df.isnull().sum(), sütun başına eksik değer sayısını verir; hangi sütunların temizlenmesi gerektiğini bulmanın en hızlı yoludur. Eksik değerlerin oranını elde etmek için len(df) değerine bölün. Eksik değer oranı %50'den fazla olan bir sütun genellikle özel işlem gerektirir: sütunu kaldırın veya alana özgü bir tamamlama yöntemi uygulayın.
import pandas as pd
import numpy as np
df = pd.DataFrame({'a': [1, np.nan, 3], 'b': [np.nan, np.nan, 6]})
print(df.isnull().sum())
# a 1
# b 2
print((df.isnull().sum() / len(df)).round(2))
# a 0.33
# b 0.67Bir DataFrame Sütununda value_counts()
df['col'].value_counts() çağrısı, o sütundaki her benzersiz değerin sıklığını sayıya göre sıralanmış biçimde listeler. Yüzdeleri elde etmek için normalize=True ekleyin. NaN değerini de bir kategori olarak saymak için dropna=False kullanın. Bu, kategorik bir sütundaki kategori dengesizliğini veya beklenmeyen değerleri kontrol etmenin en hızlı yoludur.
import pandas as pd
df = pd.DataFrame({'status': ['active','inactive','active','active','banned']})
print(df['status'].value_counts())
# active 3
# inactive 1
# banned 1
print(df['status'].value_counts(normalize=True).round(2))columns ve index İncelemesi
df.columns.tolist(), sütun adlarından oluşan yalın bir Python listesi verir; program aracılığıyla işlem yapmak veya günlük kaydı tutmak için kullanışlıdır. df.index, satır etiketlerini ve bunların türünü gösterir. Yinelenen satır etiketi olmadığını doğrulamak için df.index.is_unique değerini kontrol edin; bu, birçok birleştirme işlemi ve zaman serisi hesaplaması için ön koşuldur.
import pandas as pd
df = pd.DataFrame({'a': [1,2,3]}, index=['x', 'y', 'z'])
print(df.columns.tolist()) # ['a']
print(df.index.tolist()) # ['x', 'y', 'z']
print(df.index.is_unique) # TrueRastgele İnceleme için sample()
df.sample(n), yerine koymadan rastgele seçilen n satırı döndürür. df.sample(frac=0.1), satırların %10'unu döndürür. Tekrarlanabilirlik için random_state= ayarlayın. Rastgele örnekleme, büyük bir veri kümesinin ilk birkaç satırında görünmeyebilecek sorunları ortalarda bulmak için head() kullanımından daha iyidir.
import pandas as pd
df = pd.DataFrame({'x': range(1000), 'y': range(1000)})
print(df.sample(3, random_state=42))
print(df.sample(frac=0.005, random_state=0)) # 0.5% of rowsBoyut Planlaması için memory_usage()
df.memory_usage(deep=True), her sütunun bayt cinsinden kullandığı belleği döndürür. deep=True, dizeleri DataFrame arabelleğinin dışında bulunan object veri türündeki sütunların doğru ölçülmesini sağlar. Toplam belleği elde etmek için değerleri toplayın. Bellek tüketimini azalttığınızı doğrulamak için bunu veri türünü küçültmeden önce ve sonra kullanın.
import pandas as pd
df = pd.DataFrame({'a': range(10000), 'b': [str(i) for i in range(10000)]})
usage = df.memory_usage(deep=True)
print(usage)
print('Total bytes:', usage.sum())Hızlı Kontrol
Bu derste temel DataFrame incelemesi konusundaki anlayışınızı sınayın.
Ders Özeti
Bu derste şunları öğrendiniz: head() ve tail(), bir DataFrame'in başlangıcını ve sonunu görsel olarak incelemenizi sağlar, info(), tek bir çağrıyla veri türlerini ve eksik değer sayılarını gösterir ve describe(), sayısal sütunlar için istatistiksel özetler sunar. Sırada en yaygın file biçimlerinden (CSV, Excel ve JSON) verileri DataFrame'lere yükleyeceğiz.
Sıkça Sorulan Sorular
“Temel DataFrame İncelemesi” dersi ücretsiz mi?
Evet — “Temel DataFrame İncelemesi” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Pandas & NumPy Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Pandas & NumPy Academy kursu toplamda 4 dersten oluşur.
“Temel DataFrame İncelemesi” dersinde ne öğreneceğim?
Herhangi bir DataFrame’in içeriğini ve yapısını hızla anlamak için head(), tail(), info(), describe() ve shape kullanın. Pandas & NumPy Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
Pandas & NumPy Academy öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te Pandas & NumPy Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.
“Temel DataFrame İncelemesi” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu Pandas & NumPy Academy dersinde kod yazıp çalıştırabilir miyim?
Evet. Her Pandas & NumPy Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- DataFrames Oluşturma
- Sütun ve Satırları Seçme
- Sütun Ekleme ve Bırakma
- Temel DataFrame İncelemesi