Pemeriksaan Dasar DataFrame
Gunakan head(), tail(), info(), describe(), dan shape untuk memahami isi serta struktur DataFrame apa pun dengan cepat
Pemeriksaan Dasar DataFrame adalah pelajaran Pandas & NumPy Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Pandas & NumPy Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Pandas & NumPy Academy mencakup 4 pelajaran total.
Lima Langkah Pertama dengan DataFrame Apa Pun
Setiap kali Anda memuat dataset baru, urutan pemeriksaan yang sistematis dapat menghemat waktu berjam-jam untuk menelusuri kesalahan. Perangkat Pandas untuk keperluan ini meliputi: head() untuk melihat baris pertama, tail() untuk baris terakhir, info() untuk tipe kolom dan nilai null, describe() untuk statistik, serta shape untuk dimensi. Menjalankan kelima pemeriksaan ini memerlukan waktu kurang dari satu menit dan segera mengungkap sebagian besar masalah kualitas data.
import pandas as pd
# Assume df is loaded from a CSV
print(df.shape) # (rows, cols)
df.head() # first 5 rows
df.info() # dtypes + non-null counts
df.describe() # statisticshead() dan tail()
df.head(n) mengembalikan n baris pertama (bawaan 5) sebagai DataFrame. df.tail(n) mengembalikan n baris terakhir. Keduanya membantu Anda memverifikasi bahwa data telah diurai dengan benar — dengan memeriksa apakah nama kolom berada di baris kepala, kolom numerik berisi angka, dan string tanggal tidak disalahartikan. Keduanya tidak mengubah data dan mengembalikan DataFrame baru.
import pandas as pd
df = pd.DataFrame({'a': range(20), 'b': range(20, 40)})
print(df.head(3))
# a b
# 0 0 20
# 1 1 21
# 2 2 22
print(df.tail(2))
# a b
# 18 18 38
# 19 19 39info(): Tipe dan Jumlah Nilai Non-Null
df.info() mencetak ringkasan singkat: dtype indeks, jumlah nilai non-null di setiap kolom, dtype setiap kolom, dan total penggunaan memori. Kolom yang memiliki lebih sedikit nilai non-null daripada jumlah total baris mengandung data yang hilang. Dtype object sering menunjukkan kolom string (atau kolom dengan tipe campuran) yang mungkin perlu dibersihkan sebelum analisis.
import pandas as pd
import numpy as np
df = pd.DataFrame({'name': ['A', 'B', None],
'score': [80.0, np.nan, 90.0],
'grade': ['A', 'C', 'A']})
df.info()
# Column Non-Null Count Dtype
# name 2 non-null object
# score 2 non-null float64
# grade 3 non-null objectdescribe(): Ringkasan Statistik
df.describe() menghitung count, mean, std, min, persentil ke-25, ke-50 (median), ke-75, dan max untuk semua kolom numerik. Berikan include='all' untuk merangkum kolom object (string) juga. Berikan include='object' untuk hanya merangkum kolom kategoris. Outputnya sendiri merupakan DataFrame, sehingga Anda dapat menyimpannya atau menerapkan gaya untuk laporan.
import pandas as pd
df = pd.DataFrame({'age': [25, 30, 35, 40], 'score': [88, 72, 91, 65]})
print(df.describe().round(1))
# age score
# count 4.0 4.0
# mean 32.5 79.0
# std 6.5 12.0shape, ndim, dan size
df.shape adalah tuple (nrows, ncols). df.ndim selalu mengembalikan 2 untuk DataFrames. df.size adalah jumlah total sel. Gunakan len(df) untuk jumlah baris (sama dengan df.shape[0]). Ini adalah pemeriksaan kewajaran yang paling sederhana — pastikan jumlah baris sesuai harapan setelah pemuatan dan setelah setiap langkah penyaringan.
import pandas as pd
df = pd.DataFrame({'x': range(100), 'y': range(100), 'z': range(100)})
print(df.shape) # (100, 3)
print(len(df)) # 100
print(df.size) # 300
print(df.ndim) # 2dtypes dan select_dtypes()
df.dtypes mengembalikan Series yang memetakan setiap nama kolom ke dtype-nya. df.select_dtypes(include='number') mengembalikan DataFrame baru yang hanya berisi kolom numerik — berguna untuk menghitung korelasi atau menerapkan transformasi numerik tanpa sengaja beroperasi pada kolom string. Berikan exclude='object' untuk menghapus kolom teks.
import pandas as pd
df = pd.DataFrame({'a': [1,2], 'b': [1.0,2.0], 'c': ['x','y']})
print(df.dtypes)
# a int64
# b float64
# c object
numeric = df.select_dtypes(include='number')
print(numeric.columns.tolist()) # ['a', 'b']isnull() dan Jumlah Nilai Null
df.isnull().sum() memberikan jumlah nilai yang hilang per kolom — cara tercepat untuk menemukan kolom yang perlu dibersihkan. Bagi dengan len(df) untuk mendapatkan proporsi nilai yang hilang. Kolom dengan lebih dari 50% nilai hilang sering memerlukan penanganan khusus: menghapusnya atau menerapkan imputasi khusus domain.
import pandas as pd
import numpy as np
df = pd.DataFrame({'a': [1, np.nan, 3], 'b': [np.nan, np.nan, 6]})
print(df.isnull().sum())
# a 1
# b 2
print((df.isnull().sum() / len(df)).round(2))
# a 0.33
# b 0.67value_counts() pada Kolom DataFrame
Pemanggilan df['col'].value_counts() mencantumkan frekuensi setiap nilai unik dalam kolom tersebut, diurutkan berdasarkan jumlahnya. Tambahkan normalize=True untuk mendapatkan persentase. Gunakan dropna=False untuk turut menghitung NaN sebagai kategori. Ini adalah cara tercepat untuk memeriksa ketidakseimbangan kategori atau nilai tak terduga dalam kolom kategoris.
import pandas as pd
df = pd.DataFrame({'status': ['active','inactive','active','active','banned']})
print(df['status'].value_counts())
# active 3
# inactive 1
# banned 1
print(df['status'].value_counts(normalize=True).round(2))Pemeriksaan columns dan index
df.columns.tolist() memberikan daftar Python biasa yang berisi nama kolom — berguna untuk manipulasi terprogram atau logging. df.index menampilkan label baris dan tipenya. Periksa df.index.is_unique untuk memastikan tidak ada label baris duplikat, yang merupakan prasyarat bagi banyak operasi penggabungan dan perhitungan deret waktu.
import pandas as pd
df = pd.DataFrame({'a': [1,2,3]}, index=['x', 'y', 'z'])
print(df.columns.tolist()) # ['a']
print(df.index.tolist()) # ['x', 'y', 'z']
print(df.index.is_unique) # Truesample() untuk Pemeriksaan Acak
df.sample(n) mengembalikan n baris yang dipilih secara acak tanpa penggantian. df.sample(frac=0.1) mengembalikan 10% baris. Tetapkan random_state= agar hasilnya dapat direproduksi. Pengambilan sampel acak lebih baik daripada head() untuk menemukan masalah di bagian tengah dataset besar yang mungkin tidak muncul dalam beberapa baris pertama.
import pandas as pd
df = pd.DataFrame({'x': range(1000), 'y': range(1000)})
print(df.sample(3, random_state=42))
print(df.sample(frac=0.005, random_state=0)) # 0.5% of rowsmemory_usage() untuk Menganggarkan Ukuran
df.memory_usage(deep=True) mengembalikan memori yang digunakan setiap kolom dalam satuan byte. deep=True memaksa pengukuran akurat untuk kolom bertipe object yang string-nya berada di luar buffer DataFrame. Jumlahkan nilainya untuk mendapatkan total memori. Gunakan ini sebelum dan sesudah penurunan dtype untuk memastikan konsumsi memori telah berkurang.
import pandas as pd
df = pd.DataFrame({'a': range(10000), 'b': [str(i) for i in range(10000)]})
usage = df.memory_usage(deep=True)
print(usage)
print('Total bytes:', usage.sum())Pemeriksaan Singkat
Uji pemahaman Anda tentang pemeriksaan dasar DataFrame dari pelajaran ini.
Ringkasan Pelajaran
Dalam pelajaran ini Anda mempelajari: head() dan tail() memungkinkan Anda memeriksa secara visual bagian awal dan akhir DataFrame, info() menampilkan dtype dan jumlah nilai yang hilang dalam satu pemanggilan, dan describe() menyediakan ringkasan statistik untuk kolom numerik. Selanjutnya, kita memuat data dari format file yang paling umum — CSV, Excel, dan JSON — ke dalam DataFrames.
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pemeriksaan Dasar DataFrame” gratis?
Ya — teks lengkap “Pemeriksaan Dasar DataFrame” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Pandas & NumPy Academy, upgrade ke CoddyKit PRO. Kursus Pandas & NumPy Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Pemeriksaan Dasar DataFrame”?
Gunakan head(), tail(), info(), describe(), dan shape untuk memahami isi serta struktur DataFrame apa pun dengan cepat Kamu berlatih Pandas & NumPy Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Pandas & NumPy Academy?
Tidak diperlukan pengalaman sebelumnya. Pandas & NumPy Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Pemeriksaan Dasar DataFrame” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Pandas & NumPy Academy ini?
Ya. Setiap pelajaran Pandas & NumPy Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Membuat DataFrames
- Memilih Kolom dan Baris
- Menambahkan dan Menghapus Kolom
- Pemeriksaan Dasar DataFrame