Melakukan Imputasi dengan Mean, Median, atau Modus
Pengisian yang masuk akal untuk setiap tipe kolom
Melakukan Imputasi dengan Mean, Median, atau Modus adalah pelajaran Data Science Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Data Science Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Data Science Academy mencakup 4 pelajaran total.
Mengisi dengan Statistik
Alih-alih membuat angka secara acak, Anda mengisi nilai yang hilang dengan nilai ringkasan dari kolom itu sendiri. Pendekatan hati-hati ini disebut imputasi. 🧮
Pengisian dengan Mean
Untuk angka, pilihan paling sederhana adalah mean, yaitu rata-rata kolom. Cara ini menjaga total keseluruhan kurang lebih tetap sama ketika nilai yang hilang hanya sedikit.
df['age'].fillna(df['age'].mean())Saat Mean Menyesatkan
Mean mudah terpengaruh: beberapa nilai yang sangat besar dapat menariknya jauh dari pusat data. Pada data yang menceng, imputasi mean dapat menarik setiap nilai yang hilang menuju angka yang tidak realistis.
Pengisian dengan Median
Median adalah nilai tengah dan tidak mudah terpengaruh oleh pencilan ekstrem. Untuk kolom numerik yang menceng, median biasanya merupakan pilihan pengisian yang lebih aman.
df['income'].fillna(df['income'].median())Mean atau Median?
Aturan cepat: pilih median ketika kolom memiliki pencilan atau ekor panjang, dan gunakan mean hanya ketika nilai-nilainya cukup simetris.
Mode untuk Kategori
Kolom teks dan kategori tidak memiliki rata-rata. Untuk kolom tersebut, isi dengan mode, yaitu nilai yang paling sering muncul, karena itulah nilai yang paling mungkin sesuai.
top = df['city'].mode()[0]
df['city'].fillna(top)Mengapa mode Mengembalikan Series
Sebuah kolom dapat memiliki beberapa nilai yang sama-sama paling sering muncul, sehingga mode() mengembalikan Series yang berisi semua pemenang. Pilih indeks 0 jika Anda memerlukan satu nilai.
df['city'].mode()[0]Mengisi Berdasarkan Tipe Kolom
Praktik terbaiknya adalah melakukan imputasi pada setiap kolom berdasarkan tipe-nya: median untuk angka yang menceng, mean untuk angka yang simetris, dan mode untuk kategori.
Pengisian Maju dan Mundur
Untuk data berurutan seperti deret waktu, teruskan nilai terakhir yang diketahui ke depan dengan ffill, atau tarik nilai berikutnya ke belakang dengan bfill.
df['temp'].ffill()Biaya yang Tersembunyi
Setiap imputasi mempersempit sebaran alami kolom, karena nilai yang diisi berkumpul pada satu titik. Perhatikan hal ini karena dapat menurunkan varians Anda.
Tandai Nilai yang Anda Isi
Kebiasaan profesional: tambahkan kolom boolean yang menandai baris mana yang diimputasi. Penanda tersebut memungkinkan analisis berikutnya mengetahui nilai mana yang nyata dan mana yang diperkirakan.
df['age_filled'] = df['age'].isna()Pemeriksaan Cepat
Sebuah kolom pendapatan sangat menceng karena beberapa orang memiliki pendapatan jutaan. Imputasi mana yang paling sesuai?
Ringkasan: Pengisian yang Cerdas
Sekarang Anda melakukan imputasi dengan mean, median, atau mode berdasarkan tipe kolom, menggunakan ffill untuk data berurutan, dan menandai baris yang diisi agar tidak ada informasi yang tersembunyi.
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Melakukan Imputasi dengan Mean, Median, atau Modus” gratis?
Ya — teks lengkap “Melakukan Imputasi dengan Mean, Median, atau Modus” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Data Science Academy, upgrade ke CoddyKit PRO. Kursus Data Science Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Melakukan Imputasi dengan Mean, Median, atau Modus”?
Pengisian yang masuk akal untuk setiap tipe kolom Kamu berlatih Data Science Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Data Science Academy?
Tidak diperlukan pengalaman sebelumnya. Data Science Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Melakukan Imputasi dengan Mean, Median, atau Modus” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Data Science Academy ini?
Ya. Setiap pelajaran Data Science Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Menemukan NaNs yang Tersembunyi di Tabel Anda
- Menghapus atau Mengisi: Memilih dengan Bijak
- Melakukan Imputasi dengan Mean, Median, atau Modus
- Memperbaiki dtypes dan Baris Duplikat