0Pricing
Python For Kids · Pelajaran

Pembersihan dan Prapemrosesan Data

Pahami cara menangani data yang hilang, menghapus duplikat, dan mempraproses data mentah untuk analisis

Pembersihan dan Prapemrosesan Data adalah pelajaran Python For Kids gratis di CoddyKit. Ini adalah pelajaran 4 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python For Kids, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python For Kids mencakup 5 pelajaran total.

Gambaran Umum Pembersihan Data

Pembersihan dan Prapemrosesan Data

Data mentah sering kali tidak rapi dan perlu dibersihkan serta dipraproses sebelum dapat dianalisis. Langkah-langkah ini penting untuk memastikan kualitas dan keakuratan analisis Anda.

Dalam pelajaran ini, Anda akan mempelajari teknik untuk menangani data yang hilang, menghapus duplikat, dan melakukan prapemrosesan data untuk analisis.

Pembersihan dan Prapemrosesan Data — ilustrasi 1

Apa Itu Pembersihan Data?

Pembersihan data mencakup proses mengidentifikasi dan memperbaiki kesalahan dalam kumpulan data. Tugas umum meliputi:

  • Menangani nilai yang hilang.
  • Menghapus duplikasi.
  • Menyeragamkan format.

Menangani Data yang Hilang

Data yang hilang dapat terjadi karena berbagai alasan. Anda dapat menanganinya dengan cara berikut:

  • Mengisi nilai yang hilang dengan nilai bawaan atau nilai mean/median.
  • Menghapus baris atau kolom yang memiliki terlalu banyak nilai yang hilang.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Menghapus Data Duplikat

Data duplikat dapat memengaruhi hasil analisis Anda. Gunakan Pandas untuk menghapus duplikat:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Menstandarkan Data

Standardisasi data memastikan konsistensi. Misalnya, Anda dapat menstandarkan format tanggal atau huruf besar-kecil pada teks:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Mentransformasikan Data

Transformasi seperti penskalaan dan pengodean merupakan bagian dari prapemrosesan:

  • Penskalaan: Menstandarkan nilai numerik.
  • Pengodean: Mengubah data kategorikal menjadi bentuk numerik.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Menskalakan Data

Penskalaan memastikan data numerik berada pada skala yang sama, yang sangat penting bagi algoritma pembelajaran mesin:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Memvalidasi Data

Validasi memastikan data memenuhi standar kualitas. Misalnya, periksa pencilan atau nilai yang tidak valid:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Kesalahan Umum dalam Pembersihan Data

Berikut adalah beberapa kesalahan yang perlu dihindari:

  • Mengabaikan data yang hilang sehingga menyebabkan analisis tidak akurat.
  • Tidak menstandarkan format sehingga menimbulkan ketidakkonsistenan.
  • Mengabaikan validasi sehingga menyebabkan kesalahan pada tugas-tugas berikutnya.

Apa yang Telah Kita Pelajari?

Dalam pelajaran ini, Anda telah mempelajari:

  • Cara menangani data yang hilang dan menghapus duplikat.
  • Cara menstandarkan, mentransformasikan, dan menskalakan data untuk analisis.
  • Cara memvalidasi kualitas data dan mengidentifikasi pencilan.
  • Pentingnya pembersihan data untuk menghasilkan analisis yang akurat.

Kerja bagus! Mari lanjut ke topik berikutnya.

Pembersihan dan Prapemrosesan Data — ilustrasi 11

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pembersihan dan Prapemrosesan Data” gratis?

Ya — teks lengkap “Pembersihan dan Prapemrosesan Data” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python For Kids, upgrade ke CoddyKit PRO. Kursus Python For Kids mencakup 5 pelajaran total.

Apa yang akan aku pelajari di “Pembersihan dan Prapemrosesan Data”?

Pahami cara menangani data yang hilang, menghapus duplikat, dan mempraproses data mentah untuk analisis Kamu berlatih Python For Kids dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Python For Kids?

Tidak diperlukan pengalaman sebelumnya. Python For Kids di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 5.

Berapa lama pelajaran “Pembersihan dan Prapemrosesan Data” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Python For Kids ini?

Ya. Setiap pelajaran Python For Kids menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Apa Itu Ilmu Data?
  2. Peran Python dalam Ilmu Data
  3. Struktur Data untuk Ilmu Data
  4. Pembersihan dan Prapemrosesan Data
  5. Analisis Data Eksploratif (EDA)
← Kembali ke Python For Kids