Python Academy · Pelajaran

Pembersihan dan Prapemprosesan Data

Fahami cara mengendalikan data yang hilang, membuang pendua dan mempraproses data mentah untuk analisis.

Pelajaran 4 daripada 511 langkah

Pembersihan dan Prapemprosesan Data ialah pelajaran Python Academy percuma di CoddyKit. Ini ialah pelajaran 4 daripada 5. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Python Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Gambaran Keseluruhan Pembersihan Data

Pembersihan dan Prapemprosesan Data

Data mentah sering kali tidak teratur dan memerlukan pembersihan serta prapemprosesan sebelum boleh dianalisis. Langkah-langkah ini penting untuk memastikan kualiti dan ketepatan analisis Anda.

Dalam pelajaran ini, Anda akan mempelajari teknik untuk mengendalikan data yang hilang, membuang pendua dan melakukan prapemprosesan data untuk analisis.

Pembersihan dan Prapemprosesan Data — ilustrasi 1

Apakah Pembersihan Data?

Pembersihan data melibatkan proses mengenal pasti dan membaiki ralat dalam set data. Tugas yang lazim termasuk:

  • Mengendalikan nilai yang hilang.
  • Membuang pendua.
  • Menyeragamkan format.

Mengendalikan Data yang Hilang

Data yang hilang boleh berlaku atas pelbagai sebab. Anda boleh mengendalikannya dengan:

  • Mengisi nilai yang hilang dengan nilai lalai atau mean/median.
  • Membuang baris atau lajur yang mempunyai terlalu banyak nilai yang hilang.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Membuang Pendua

Data pendua boleh menjejaskan analisis Anda. Gunakan Pandas untuk membuang pendua:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Menyeragamkan Data

Penyeragaman data memastikan ketekalan. Sebagai contoh, Anda boleh menyeragamkan format tarikh atau huruf besar dan kecil dalam teks:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Menukar Data

Penukaran seperti penskalaan dan pengekodan merupakan sebahagian daripada prapemprosesan:

  • Penskalaan: Menyeragamkan nilai berangka.
  • Pengekodan: Menukar data kategori kepada bentuk berangka.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Penskalaan Data

Penskalaan memastikan data berangka berada pada skala yang sama, yang penting untuk algoritma pembelajaran mesin:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Pengesahan Data

Pengesahan memastikan data memenuhi piawaian kualiti. Sebagai contoh, semak nilai terpencil atau nilai yang tidak sah:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Kesilapan Lazim dalam Pembersihan Data

Berikut ialah beberapa kesilapan yang perlu dielakkan:

  • Mengabaikan data yang hilang, lalu menyebabkan analisis tidak tepat.
  • Tidak menyeragamkan format, lalu menyebabkan ketidakselarasan.
  • Mengabaikan pengesahan, lalu menyebabkan ralat dalam tugasan seterusnya.

Apakah yang Kita Pelajari?

Dalam pelajaran ini, anda telah mempelajari:

  • Cara mengendalikan data yang hilang dan membuang pendua.
  • Cara menyeragamkan, mentransformasikan dan menskalakan data untuk analisis.
  • Cara mengesahkan kualiti data dan mengenal pasti nilai terpencil.
  • Kepentingan pembersihan data untuk analisis yang tepat.

Syabas! Mari beralih ke topik seterusnya.

Pembersihan dan Prapemprosesan Data — ilustrasi 11
Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
76
Pelajaran
320

Soalan Lazim

Adakah pelajaran “Pembersihan dan Prapemprosesan Data” percuma?

Ya — teks penuh “Pembersihan dan Prapemprosesan Data” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Python Academy, tingkat taraf kepada CoddyKit PRO. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Apakah yang akan saya pelajari dalam “Pembersihan dan Prapemprosesan Data”?

Fahami cara mengendalikan data yang hilang, membuang pendua dan mempraproses data mentah untuk analisis. Anda berlatih Python Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Python Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Python Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 5.

Berapa lamakah pelajaran “Pembersihan dan Prapemprosesan Data” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Apakah Sains Data?
  2. Peranan Python dalam Sains Data
  3. Struktur Data untuk Sains Data
  4. Pembersihan dan Prapemprosesan Data
  5. Analisis Data Eksploratori (EDA)
← Kembali ke Python Academy