Data Science Academy · Pelajaran

Mengapa Ketepatan Mengelirukan pada Ketakseimbangan

Perangkap kelas jarang

Pelajaran 1 daripada 413 langkah

Mengapa Ketepatan Mengelirukan pada Ketakseimbangan ialah pelajaran Data Science Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Data Science Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.

Pembohongan yang Menyenangkan

Ketepatan kelihatan seperti skor yang jelas: berapa banyak ramalan yang betul. Pada data seimbang, ia berfungsi dengan baik, tetapi ketidakseimbangan secara senyap-senyap merosakkannya.

Maksud Ketidakseimbangan

Set data tidak seimbang apabila satu kelas jauh lebih jarang berbanding kelas lain. Fikirkan penipuan, penyakit atau pelanggan berhenti: peristiwa yang penting ialah yang jarang berlaku.

Perangkap 99%

Bayangkan 99 urus niaga biasa bagi setiap 1 penipuan. Model yang sentiasa menjerit “biasa” mendapat ketepatan 99% yang kelihatan hebat. ⚠️

Namun Tiada Apa-apa Dikesan

Model 99% itu tidak pernah menandakan satu pun penipuan. Nombornya kelihatan cemerlang, tetapi model itu tidak berguna untuk tugas sebenar yang diberikan kepadanya.

Ketepatan Menyembunyikan Kelas Jarang

Ketepatan mempuratakan semua baris, jadi majoriti yang besar menenggelamkan minoriti yang kecil. Kelas jarang boleh gagal sepenuhnya tanpa banyak mengubah skor.

Garis Dasar yang Mesti Ditewaskan

Sentiasa bandingkan dengan garis dasar kelas majoriti: ramalkan sahaja label yang paling biasa. Jika model anda tidak dapat menewaskannya, model itu tidak mempelajari apa-apa yang berguna.

Semakan Realiti Pantas

Sebelum meraikannya, tanya satu perkara: berapakah pecahan baris yang merupakan kelas majoriti? Nombor itu ialah ketepatan yang diperoleh model malas secara percuma.

Lihat dengan value_counts

Satu baris mendedahkan betapa tidak seimbangnya label anda. Jika satu nilai jauh mengatasi nilai lain, ketepatan sahaja akan mengelirukan anda.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Di Mana Kos Sebenarnya Ditanggung

Gagal mengesan kelas jarang biasanya paling merugikan: tumor atau penipuan yang tidak dikesan membawa kos tinggi. Ketepatan menganggap semua kesilapan sama, tetapi realitinya tidak begitu.

Lihat Melangkaui Satu Nombor

Penyelesaiannya bukan lagi metrik ajaib, tetapi perubahan cara berfikir. Berhenti mempercayai satu nombor dan mula bertanya tentang prestasi sebenar kelas minoriti.

Bersedia untuk Metrik yang Lebih Baik

Tidak lama lagi anda akan mempelajari kejituan, dapatan semula dan lengkung PR yang dibina untuk peristiwa jarang. Mula-mula, fahami sebab ketepatan menimbulkan ketidakpercayaan anda di sini.

Semakan Pantas

Mengapakah ketepatan boleh mengelirukan pada data yang tidak seimbang?

Imbas Kembali

Dalam keadaan tidak seimbang, ketepatan memuji model malas yang mengabaikan kelas jarang. Tewaskan garis dasar majoriti dan nilai prestasi sebenar kelas minoriti. 🎯

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” percuma?

Ya — teks penuh “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Data Science Academy, tingkat taraf kepada CoddyKit PRO. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan”?

Perangkap kelas jarang Anda berlatih Data Science Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Data Science Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Data Science Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Mengapa Ketepatan Mengelirukan pada Ketakseimbangan” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Data Science Academy ini?

Ya. Setiap pelajaran Data Science Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Mengapa Ketepatan Mengelirukan pada Ketakseimbangan
  2. Pensampelan Semula: SMOTE dan Pensampelan Kurang
  3. Pemberat Kelas dan Ambang
  4. Pilih Metrik untuk Peristiwa Jarang
← Kembali ke Data Science Academy