Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang
Jebakan kelas langka
Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang adalah pelajaran Data Science Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Data Science Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Data Science Academy mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
The Comfortable Lie
Accuracy feels like the obvious score: how many predictions you got right. On balanced data it works fine, but imbalance quietly breaks it.
What Imbalance Means
A dataset is imbalanced when one class is far rarer than the others. Think fraud, disease, or churn: the interesting event is the rare one.
The 99% Trap
Imagine 99 normal transactions for every 1 fraud. A model that screams normal every single time scores a glorious 99% accuracy. ⚠️
Yet It Caught Nothing
That 99% model never flagged a single fraud. The number looks elite, but the model is useless for the exact job you hired it to do.
Accuracy Hides the Rare Class
Accuracy averages over all rows, so the huge majority drowns out the tiny minority. The rare class can be a total failure and barely move the score.
The Baseline You Must Beat
Always compare against the majority-class baseline: just predict the most common label. If your model cannot beat it, it learned nothing useful.
A Quick Reality Check
Before celebrating, ask one thing: what fraction of rows is the majority class? That number is the accuracy a lazy model gets for free.
See It With value_counts
One line reveals how lopsided your labels are. If one value dwarfs the rest, accuracy alone will mislead you.
counts = y.value_counts(normalize=True)
print(counts) # share of each classWhere the Cost Really Lives
Missing the rare class usually hurts most: an undetected tumor or fraud is costly. Accuracy treats every mistake as equal, but reality does not.
Look Past One Number
The fix is not a magic metric yet, it is a mindset. Stop trusting a single number and start asking how the minority class actually did.
Set Up for Better Metrics
Soon you will meet precision, recall, and PR curves built for rare events. First, internalize why accuracy earned your distrust here.
Quick Check
Why can accuracy mislead on imbalanced data?
Recap
On imbalance, accuracy flatters lazy models that ignore the rare class. Beat the majority baseline and judge how the minority class truly did. 🎯
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang” gratis?
Ya — teks lengkap “Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Data Science Academy, upgrade ke CoddyKit PRO. Kursus Data Science Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang”?
Jebakan kelas langka Kamu berlatih Data Science Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Data Science Academy?
Tidak diperlukan pengalaman sebelumnya. Data Science Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Data Science Academy ini?
Ya. Setiap pelajaran Data Science Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Mengapa Akurasi Menyesatkan pada Data Tidak Seimbang
- Pengambilan Sampel Ulang: SMOTE dan Undersampling
- Bobot Kelas dan Ambang Batas
- Memilih Metrik untuk Peristiwa Langka