Pandas & NumPy Academy · Pelajaran

Pemeriksaan Dasar DataFrame

Gunakan head(), tail(), info(), describe(), dan shape untuk memahami isi serta struktur DataFrame apa pun dengan cepat

Pelajaran 4 dari 413 langkah

Pemeriksaan Dasar DataFrame adalah pelajaran Pandas & NumPy Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Pandas & NumPy Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Pandas & NumPy Academy mencakup 4 pelajaran total.

Lima Langkah Pertama dengan DataFrame Apa Pun

Setiap kali Anda memuat dataset baru, urutan pemeriksaan yang sistematis dapat menghemat waktu berjam-jam untuk menelusuri kesalahan. Perangkat Pandas untuk keperluan ini meliputi: head() untuk melihat baris pertama, tail() untuk baris terakhir, info() untuk tipe kolom dan nilai null, describe() untuk statistik, serta shape untuk dimensi. Menjalankan kelima pemeriksaan ini memerlukan waktu kurang dari satu menit dan segera mengungkap sebagian besar masalah kualitas data.

import pandas as pd

# Assume df is loaded from a CSV
print(df.shape)   # (rows, cols)
df.head()         # first 5 rows
df.info()         # dtypes + non-null counts
df.describe()     # statistics

head() dan tail()

df.head(n) mengembalikan n baris pertama (bawaan 5) sebagai DataFrame. df.tail(n) mengembalikan n baris terakhir. Keduanya membantu Anda memverifikasi bahwa data telah diurai dengan benar — dengan memeriksa apakah nama kolom berada di baris kepala, kolom numerik berisi angka, dan string tanggal tidak disalahartikan. Keduanya tidak mengubah data dan mengembalikan DataFrame baru.

import pandas as pd

df = pd.DataFrame({'a': range(20), 'b': range(20, 40)})
print(df.head(3))
#    a   b
# 0  0  20
# 1  1  21
# 2  2  22
print(df.tail(2))
#     a   b
# 18 18  38
# 19 19  39

info(): Tipe dan Jumlah Nilai Non-Null

df.info() mencetak ringkasan singkat: dtype indeks, jumlah nilai non-null di setiap kolom, dtype setiap kolom, dan total penggunaan memori. Kolom yang memiliki lebih sedikit nilai non-null daripada jumlah total baris mengandung data yang hilang. Dtype object sering menunjukkan kolom string (atau kolom dengan tipe campuran) yang mungkin perlu dibersihkan sebelum analisis.

import pandas as pd
import numpy as np

df = pd.DataFrame({'name': ['A', 'B', None],
                   'score': [80.0, np.nan, 90.0],
                   'grade': ['A', 'C', 'A']})
df.info()
# Column  Non-Null Count  Dtype
# name    2 non-null      object
# score   2 non-null      float64
# grade   3 non-null      object

describe(): Ringkasan Statistik

df.describe() menghitung count, mean, std, min, persentil ke-25, ke-50 (median), ke-75, dan max untuk semua kolom numerik. Berikan include='all' untuk merangkum kolom object (string) juga. Berikan include='object' untuk hanya merangkum kolom kategoris. Outputnya sendiri merupakan DataFrame, sehingga Anda dapat menyimpannya atau menerapkan gaya untuk laporan.

import pandas as pd

df = pd.DataFrame({'age': [25, 30, 35, 40], 'score': [88, 72, 91, 65]})
print(df.describe().round(1))
#        age  score
# count  4.0    4.0
# mean  32.5   79.0
# std    6.5   12.0

shape, ndim, dan size

df.shape adalah tuple (nrows, ncols). df.ndim selalu mengembalikan 2 untuk DataFrames. df.size adalah jumlah total sel. Gunakan len(df) untuk jumlah baris (sama dengan df.shape[0]). Ini adalah pemeriksaan kewajaran yang paling sederhana — pastikan jumlah baris sesuai harapan setelah pemuatan dan setelah setiap langkah penyaringan.

import pandas as pd

df = pd.DataFrame({'x': range(100), 'y': range(100), 'z': range(100)})
print(df.shape)   # (100, 3)
print(len(df))    # 100
print(df.size)    # 300
print(df.ndim)    # 2

dtypes dan select_dtypes()

df.dtypes mengembalikan Series yang memetakan setiap nama kolom ke dtype-nya. df.select_dtypes(include='number') mengembalikan DataFrame baru yang hanya berisi kolom numerik — berguna untuk menghitung korelasi atau menerapkan transformasi numerik tanpa sengaja beroperasi pada kolom string. Berikan exclude='object' untuk menghapus kolom teks.

import pandas as pd

df = pd.DataFrame({'a': [1,2], 'b': [1.0,2.0], 'c': ['x','y']})
print(df.dtypes)
# a      int64
# b    float64
# c     object

numeric = df.select_dtypes(include='number')
print(numeric.columns.tolist())  # ['a', 'b']

isnull() dan Jumlah Nilai Null

df.isnull().sum() memberikan jumlah nilai yang hilang per kolom — cara tercepat untuk menemukan kolom yang perlu dibersihkan. Bagi dengan len(df) untuk mendapatkan proporsi nilai yang hilang. Kolom dengan lebih dari 50% nilai hilang sering memerlukan penanganan khusus: menghapusnya atau menerapkan imputasi khusus domain.

import pandas as pd
import numpy as np

df = pd.DataFrame({'a': [1, np.nan, 3], 'b': [np.nan, np.nan, 6]})
print(df.isnull().sum())
# a    1
# b    2
print((df.isnull().sum() / len(df)).round(2))
# a    0.33
# b    0.67

value_counts() pada Kolom DataFrame

Pemanggilan df['col'].value_counts() mencantumkan frekuensi setiap nilai unik dalam kolom tersebut, diurutkan berdasarkan jumlahnya. Tambahkan normalize=True untuk mendapatkan persentase. Gunakan dropna=False untuk turut menghitung NaN sebagai kategori. Ini adalah cara tercepat untuk memeriksa ketidakseimbangan kategori atau nilai tak terduga dalam kolom kategoris.

import pandas as pd

df = pd.DataFrame({'status': ['active','inactive','active','active','banned']})
print(df['status'].value_counts())
# active      3
# inactive    1
# banned      1
print(df['status'].value_counts(normalize=True).round(2))

Pemeriksaan columns dan index

df.columns.tolist() memberikan daftar Python biasa yang berisi nama kolom — berguna untuk manipulasi terprogram atau logging. df.index menampilkan label baris dan tipenya. Periksa df.index.is_unique untuk memastikan tidak ada label baris duplikat, yang merupakan prasyarat bagi banyak operasi penggabungan dan perhitungan deret waktu.

import pandas as pd

df = pd.DataFrame({'a': [1,2,3]}, index=['x', 'y', 'z'])
print(df.columns.tolist())     # ['a']
print(df.index.tolist())       # ['x', 'y', 'z']
print(df.index.is_unique)      # True

sample() untuk Pemeriksaan Acak

df.sample(n) mengembalikan n baris yang dipilih secara acak tanpa penggantian. df.sample(frac=0.1) mengembalikan 10% baris. Tetapkan random_state= agar hasilnya dapat direproduksi. Pengambilan sampel acak lebih baik daripada head() untuk menemukan masalah di bagian tengah dataset besar yang mungkin tidak muncul dalam beberapa baris pertama.

import pandas as pd

df = pd.DataFrame({'x': range(1000), 'y': range(1000)})
print(df.sample(3, random_state=42))
print(df.sample(frac=0.005, random_state=0))  # 0.5% of rows

memory_usage() untuk Menganggarkan Ukuran

df.memory_usage(deep=True) mengembalikan memori yang digunakan setiap kolom dalam satuan byte. deep=True memaksa pengukuran akurat untuk kolom bertipe object yang string-nya berada di luar buffer DataFrame. Jumlahkan nilainya untuk mendapatkan total memori. Gunakan ini sebelum dan sesudah penurunan dtype untuk memastikan konsumsi memori telah berkurang.

import pandas as pd

df = pd.DataFrame({'a': range(10000), 'b': [str(i) for i in range(10000)]})
usage = df.memory_usage(deep=True)
print(usage)
print('Total bytes:', usage.sum())

Pemeriksaan Singkat

Uji pemahaman Anda tentang pemeriksaan dasar DataFrame dari pelajaran ini.

Ringkasan Pelajaran

Dalam pelajaran ini Anda mempelajari: head() dan tail() memungkinkan Anda memeriksa secara visual bagian awal dan akhir DataFrame, info() menampilkan dtype dan jumlah nilai yang hilang dalam satu pemanggilan, dan describe() menyediakan ringkasan statistik untuk kolom numerik. Selanjutnya, kita memuat data dari format file yang paling umum — CSV, Excel, dan JSON — ke dalam DataFrames.

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pemeriksaan Dasar DataFrame” gratis?

Ya — teks lengkap “Pemeriksaan Dasar DataFrame” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Pandas & NumPy Academy, upgrade ke CoddyKit PRO. Kursus Pandas & NumPy Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pemeriksaan Dasar DataFrame”?

Gunakan head(), tail(), info(), describe(), dan shape untuk memahami isi serta struktur DataFrame apa pun dengan cepat Kamu berlatih Pandas & NumPy Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Pandas & NumPy Academy?

Tidak diperlukan pengalaman sebelumnya. Pandas & NumPy Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Pemeriksaan Dasar DataFrame” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Pandas & NumPy Academy ini?

Ya. Setiap pelajaran Pandas & NumPy Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Membuat DataFrames
  2. Memilih Kolom dan Baris
  3. Menambahkan dan Menghapus Kolom
  4. Pemeriksaan Dasar DataFrame
← Kembali ke Pandas & NumPy Academy