Pembersihan dan Prapemrosesan Data
Pahami cara menangani data yang hilang, menghapus duplikat, dan mempraproses data mentah untuk analisis
Pembersihan dan Prapemrosesan Data adalah pelajaran Python For Kids gratis di CoddyKit. Ini adalah pelajaran 4 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python For Kids, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python For Kids mencakup 5 pelajaran total.
Gambaran Umum Pembersihan Data
Pembersihan dan Prapemrosesan Data
Data mentah sering kali tidak rapi dan perlu dibersihkan serta dipraproses sebelum dapat dianalisis. Langkah-langkah ini penting untuk memastikan kualitas dan keakuratan analisis Anda.
Dalam pelajaran ini, Anda akan mempelajari teknik untuk menangani data yang hilang, menghapus duplikat, dan melakukan prapemrosesan data untuk analisis.

Apa Itu Pembersihan Data?
Pembersihan data mencakup proses mengidentifikasi dan memperbaiki kesalahan dalam kumpulan data. Tugas umum meliputi:
- Menangani nilai yang hilang.
- Menghapus duplikasi.
- Menyeragamkan format.
Menangani Data yang Hilang
Data yang hilang dapat terjadi karena berbagai alasan. Anda dapat menanganinya dengan cara berikut:
- Mengisi nilai yang hilang dengan nilai bawaan atau nilai
mean/median. - Menghapus baris atau kolom yang memiliki terlalu banyak nilai yang hilang.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Menghapus Data Duplikat
Data duplikat dapat memengaruhi hasil analisis Anda. Gunakan Pandas untuk menghapus duplikat:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Menstandarkan Data
Standardisasi data memastikan konsistensi. Misalnya, Anda dapat menstandarkan format tanggal atau huruf besar-kecil pada teks:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Mentransformasikan Data
Transformasi seperti penskalaan dan pengodean merupakan bagian dari prapemrosesan:
- Penskalaan: Menstandarkan nilai numerik.
- Pengodean: Mengubah data kategorikal menjadi bentuk numerik.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Menskalakan Data
Penskalaan memastikan data numerik berada pada skala yang sama, yang sangat penting bagi algoritma pembelajaran mesin:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Memvalidasi Data
Validasi memastikan data memenuhi standar kualitas. Misalnya, periksa pencilan atau nilai yang tidak valid:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Kesalahan Umum dalam Pembersihan Data
Berikut adalah beberapa kesalahan yang perlu dihindari:
- Mengabaikan data yang hilang sehingga menyebabkan analisis tidak akurat.
- Tidak menstandarkan format sehingga menimbulkan ketidakkonsistenan.
- Mengabaikan validasi sehingga menyebabkan kesalahan pada tugas-tugas berikutnya.
Apa yang Telah Kita Pelajari?
Dalam pelajaran ini, Anda telah mempelajari:
- Cara menangani data yang hilang dan menghapus duplikat.
- Cara menstandarkan, mentransformasikan, dan menskalakan data untuk analisis.
- Cara memvalidasi kualitas data dan mengidentifikasi pencilan.
- Pentingnya pembersihan data untuk menghasilkan analisis yang akurat.
Kerja bagus! Mari lanjut ke topik berikutnya.

Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pembersihan dan Prapemrosesan Data” gratis?
Ya — teks lengkap “Pembersihan dan Prapemrosesan Data” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python For Kids, upgrade ke CoddyKit PRO. Kursus Python For Kids mencakup 5 pelajaran total.
Apa yang akan aku pelajari di “Pembersihan dan Prapemrosesan Data”?
Pahami cara menangani data yang hilang, menghapus duplikat, dan mempraproses data mentah untuk analisis Kamu berlatih Python For Kids dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Python For Kids?
Tidak diperlukan pengalaman sebelumnya. Python For Kids di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 5.
Berapa lama pelajaran “Pembersihan dan Prapemrosesan Data” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Python For Kids ini?
Ya. Setiap pelajaran Python For Kids menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Apa Itu Ilmu Data?
- Peran Python dalam Ilmu Data
- Struktur Data untuk Ilmu Data
- Pembersihan dan Prapemrosesan Data
- Analisis Data Eksploratif (EDA)