Data Science Academy · Pelajaran

Mengapa Anda Mengasingkan Set Ujian

Menganggar prestasi pada data yang belum dilihat

Pelajaran 1 daripada 413 langkah

Mengapa Anda Mengasingkan Set Ujian ialah pelajaran Data Science Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Data Science Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.

Soalan Sebenar

Model yang menghafal data Anda kelihatan hebat pada data itu. Soalan sebenar ialah sejauh mana prestasinya pada data yang belum pernah dilihat.

Ketepikan Sebahagian Data

Oleh itu, Anda mengetepikan sebahagian data dan tidak pernah menggunakannya untuk latihan. Bahagian yang dikunci ini ialah set ujian Anda, yang disimpan untuk penghujung proses.

Latih di Sini, Nilai di Sana

Model belajar hanya daripada set latihan. Kemudian, anda menilainya menggunakan set ujian yang tidak disentuh untuk melihat sejauh mana model benar-benar dapat menggeneralisasi. 🎯

Mengapa Tidak Menilai pada Data Latihan

Menilai pada baris yang sama seperti yang digunakan untuk belajar adalah seperti menyemak ujian dengan skema jawapan terbuka. Nombor itu memberikan gambaran yang terlalu baik tentang model dan melebihkan kemahirannya.

Generalisasi ialah Matlamatnya

Anda tidak mengambil berat tentang sejauh mana model menyesuaikan diri dengan data lama. Anda mengambil berat tentang generalisasi: menghasilkan ramalan yang baik untuk baris baharu yang belum dilihat pada masa akan datang.

Kenali Terlebih Suaian

Apabila model menguasai data latihan tetapi gagal pada set ujian, keadaan itu dipanggil terlebih suaian. Model menghafal hingar dan bukannya mempelajari corak sebenar.

Pembahagian Biasa

Pilihan mudah yang popular ialah melatih model menggunakan kira-kira 80% baris dan menguji model menggunakan baki 20%. Lebih banyak data untuk belajar, dan masih cukup data untuk menilai dengan adil.

Sentuh Sekali Sahaja

Set ujian itu amat penting. Jika anda terus mengintai dan mengubah suai model sehingga skornya kelihatan baik, anda sebenarnya telah membocorkan maklumatnya ke dalam keputusan anda.

Tempat Pembahagian Berlaku

Dalam scikit-learn, satu fungsi pembantu akan membahagikan data untuk anda. Fungsi itu mengocok dan membahagikan data anda kepada bahagian latihan dan ujian dalam satu panggilan sahaja.

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

Nombor yang Jujur

Skor pada set ujian ialah anggaran jujur prestasi dalam dunia sebenar. Percayainya lebih daripada apa-apa skor latihan yang kelihatan sangat baik.

Lebih daripada Sekadar Formaliti

Mengasingkan data bukanlah kerenah pentadbiran. Itulah satu amalan yang menghalang anda daripada melancarkan model yang hanya pernah berjaya secara teori.

Semakan Pantas

Mengapakah anda menyimpan set ujian yang berasingan?

Ringkasan

Anda membahagikan data, belajar menggunakan bahagian latihan, dan menilai menggunakan set ujian yang dijaga rapi. Bahagian yang tidak disentuh itu memberikan gambaran jujur tentang kemahiran model dalam dunia sebenar. 🎯

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Mengapa Anda Mengasingkan Set Ujian” percuma?

Ya — teks penuh “Mengapa Anda Mengasingkan Set Ujian” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Data Science Academy, tingkat taraf kepada CoddyKit PRO. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Mengapa Anda Mengasingkan Set Ujian”?

Menganggar prestasi pada data yang belum dilihat Anda berlatih Data Science Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Data Science Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Data Science Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Mengapa Anda Mengasingkan Set Ujian” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Data Science Academy ini?

Ya. Setiap pelajaran Data Science Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Mengapa Anda Mengasingkan Set Ujian
  2. train_test_split dengan Cara yang Betul
  3. Pengesahan Silang K-Fold
  4. Hentikan Kebocoran Data Sebelum Bermula
← Kembali ke Data Science Academy