Mengapa Ketepatan Mengelirukan pada Ketakseimbangan
Perangkap kelas jarang
Mengapa Ketepatan Mengelirukan pada Ketakseimbangan ialah pelajaran Data Science Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Data Science Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.
Pembohongan yang Menyenangkan
Ketepatan kelihatan seperti skor yang jelas: berapa banyak ramalan yang betul. Pada data seimbang, ia berfungsi dengan baik, tetapi ketidakseimbangan secara senyap-senyap merosakkannya.
Maksud Ketidakseimbangan
Set data tidak seimbang apabila satu kelas jauh lebih jarang berbanding kelas lain. Fikirkan penipuan, penyakit atau pelanggan berhenti: peristiwa yang penting ialah yang jarang berlaku.
Perangkap 99%
Bayangkan 99 urus niaga biasa bagi setiap 1 penipuan. Model yang sentiasa menjerit “biasa” mendapat ketepatan 99% yang kelihatan hebat. ⚠️
Namun Tiada Apa-apa Dikesan
Model 99% itu tidak pernah menandakan satu pun penipuan. Nombornya kelihatan cemerlang, tetapi model itu tidak berguna untuk tugas sebenar yang diberikan kepadanya.
Ketepatan Menyembunyikan Kelas Jarang
Ketepatan mempuratakan semua baris, jadi majoriti yang besar menenggelamkan minoriti yang kecil. Kelas jarang boleh gagal sepenuhnya tanpa banyak mengubah skor.
Garis Dasar yang Mesti Ditewaskan
Sentiasa bandingkan dengan garis dasar kelas majoriti: ramalkan sahaja label yang paling biasa. Jika model anda tidak dapat menewaskannya, model itu tidak mempelajari apa-apa yang berguna.
Semakan Realiti Pantas
Sebelum meraikannya, tanya satu perkara: berapakah pecahan baris yang merupakan kelas majoriti? Nombor itu ialah ketepatan yang diperoleh model malas secara percuma.
Lihat dengan value_counts
Satu baris mendedahkan betapa tidak seimbangnya label anda. Jika satu nilai jauh mengatasi nilai lain, ketepatan sahaja akan mengelirukan anda.
counts = y.value_counts(normalize=True)
print(counts) # share of each classDi Mana Kos Sebenarnya Ditanggung
Gagal mengesan kelas jarang biasanya paling merugikan: tumor atau penipuan yang tidak dikesan membawa kos tinggi. Ketepatan menganggap semua kesilapan sama, tetapi realitinya tidak begitu.
Lihat Melangkaui Satu Nombor
Penyelesaiannya bukan lagi metrik ajaib, tetapi perubahan cara berfikir. Berhenti mempercayai satu nombor dan mula bertanya tentang prestasi sebenar kelas minoriti.
Bersedia untuk Metrik yang Lebih Baik
Tidak lama lagi anda akan mempelajari kejituan, dapatan semula dan lengkung PR yang dibina untuk peristiwa jarang. Mula-mula, fahami sebab ketepatan menimbulkan ketidakpercayaan anda di sini.
Semakan Pantas
Mengapakah ketepatan boleh mengelirukan pada data yang tidak seimbang?
Imbas Kembali
Dalam keadaan tidak seimbang, ketepatan memuji model malas yang mengabaikan kelas jarang. Tewaskan garis dasar majoriti dan nilai prestasi sebenar kelas minoriti. 🎯
Pelajari Python dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Soalan Lazim
Adakah pelajaran “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” percuma?
Ya — teks penuh “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Data Science Academy, tingkat taraf kepada CoddyKit PRO. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan”?
Perangkap kelas jarang Anda berlatih Data Science Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan Data Science Academy?
Tiada pengalaman terdahulu diperlukan. Pembelajaran Data Science Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.
Berapa lamakah pelajaran “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran Data Science Academy ini?
Ya. Setiap pelajaran Data Science Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Mengapa Ketepatan Mengelirukan pada Ketakseimbangan
- Pensampelan Semula: SMOTE dan Pensampelan Kurang
- Pemberat Kelas dan Ambang
- Pilih Metrik untuk Peristiwa Jarang