0Pricing
Python Academy · Pelajaran

Pembersihan dan Prapemrosesan Data

Pahami cara menangani data yang hilang, menghapus duplikat, dan melakukan prapemrosesan data mentah untuk analisis.

Pembersihan dan Prapemrosesan Data adalah pelajaran Python Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python Academy mencakup 5 pelajaran total.

Ikhtisar Pembersihan Data

Pembersihan Data dan Prapemrosesan

Data mentah sering kali berantakan dan perlu dibersihkan serta dipraproses sebelum dapat dianalisis. Langkah-langkah ini penting untuk memastikan kualitas dan keakuratan analisis Anda.

Dalam pelajaran ini, Anda akan mempelajari teknik untuk menangani data yang hilang, menghapus duplikasi, dan melakukan prapemrosesan data untuk analisis.

Pembersihan dan Prapemrosesan Data — ilustrasi 1

Apa Itu Pembersihan Data?

Apa Itu Pembersihan Data?

Pembersihan data mencakup identifikasi dan perbaikan kesalahan dalam kumpulan data. Tugas yang umum meliputi:

  • Menangani nilai yang hilang.
  • Menghapus duplikasi.
  • Menyeragamkan format.

Menangani Data yang Hilang

Menangani Data yang Hilang

Data yang hilang dapat terjadi karena berbagai alasan. Anda dapat menanganinya dengan cara:

  • Mengisi nilai yang hilang dengan nilai bawaan atau mean/nilai tengah.
  • Menghapus baris atau kolom yang memiliki terlalu banyak nilai yang hilang.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Menghapus Duplikasi

Menghapus Duplikasi

Data duplikat dapat memengaruhi hasil analisis Anda. Gunakan Pandas untuk menghapus duplikasi:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Menyeragamkan Data

Menyeragamkan Data

Standardisasi data memastikan konsistensi. Sebagai contoh, Anda dapat menyeragamkan format tanggal atau kapitalisasi teks:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Mengubah Data

Mengubah Data

Transformasi seperti penskalaan dan pengodean merupakan bagian dari prapemrosesan:

  • Penskalaan: Menyeragamkan nilai numerik.
  • Pengodean: Mengubah data kategorikal ke dalam bentuk numerik.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Penskalaan Data

Penskalaan Data

Penskalaan memastikan data numerik berada pada skala yang sama, yang sangat penting bagi algoritme pembelajaran mesin:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Validasi Data

Validasi Data

Validasi memastikan data memenuhi standar kualitas. Misalnya, periksa pencilan atau nilai yang tidak valid:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Kesalahan Umum dalam Pembersihan Data

Kesalahan Umum dalam Pembersihan Data

Berikut beberapa kesalahan yang perlu dihindari:

  • Mengabaikan data yang hilang sehingga analisis menjadi tidak akurat.
  • Tidak menyeragamkan format sehingga menimbulkan ketidakkonsistenan.
  • Mengabaikan validasi sehingga menimbulkan kesalahan dalam tugas lanjutan.

Apa yang Telah Dipelajari?

Apa yang Telah Dipelajari?

Dalam pelajaran ini, Anda mempelajari:

  • Cara menangani data yang hilang dan menghapus duplikat.
  • Cara menyeragamkan, mentransformasi, dan menskalakan data untuk analisis.
  • Cara memvalidasi kualitas data dan mengidentifikasi pencilan.
  • Pentingnya pembersihan data untuk menghasilkan analisis yang akurat.

Bagus! Mari kita lanjutkan ke topik berikutnya.

Pembersihan dan Prapemrosesan Data — ilustrasi 11

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pembersihan dan Prapemrosesan Data” gratis?

Ya — teks lengkap “Pembersihan dan Prapemrosesan Data” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python Academy, upgrade ke CoddyKit PRO. Kursus Python Academy mencakup 5 pelajaran total.

Apa yang akan aku pelajari di “Pembersihan dan Prapemrosesan Data”?

Pahami cara menangani data yang hilang, menghapus duplikat, dan melakukan prapemrosesan data mentah untuk analisis. Kamu berlatih Python Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Python Academy?

Tidak diperlukan pengalaman sebelumnya. Python Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 5.

Berapa lama pelajaran “Pembersihan dan Prapemrosesan Data” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Apa Itu Sains Data?
  2. Peran Python dalam Sains Data
  3. Struktur Data untuk Sains Data
  4. Pembersihan dan Prapemrosesan Data
  5. Analisis Data Eksploratif (EDA)
← Kembali ke Python Academy