Mengapa Anda Mengasingkan Set Ujian
Menganggar prestasi pada data yang belum dilihat
Mengapa Anda Mengasingkan Set Ujian ialah pelajaran Data Science Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Data Science Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.
Soalan Sebenar
Model yang menghafal data Anda kelihatan hebat pada data itu. Soalan sebenar ialah sejauh mana prestasinya pada data yang belum pernah dilihat.
Ketepikan Sebahagian Data
Oleh itu, Anda mengetepikan sebahagian data dan tidak pernah menggunakannya untuk latihan. Bahagian yang dikunci ini ialah set ujian Anda, yang disimpan untuk penghujung proses.
Latih di Sini, Nilai di Sana
Model belajar hanya daripada set latihan. Kemudian, anda menilainya menggunakan set ujian yang tidak disentuh untuk melihat sejauh mana model benar-benar dapat menggeneralisasi. 🎯
Mengapa Tidak Menilai pada Data Latihan
Menilai pada baris yang sama seperti yang digunakan untuk belajar adalah seperti menyemak ujian dengan skema jawapan terbuka. Nombor itu memberikan gambaran yang terlalu baik tentang model dan melebihkan kemahirannya.
Generalisasi ialah Matlamatnya
Anda tidak mengambil berat tentang sejauh mana model menyesuaikan diri dengan data lama. Anda mengambil berat tentang generalisasi: menghasilkan ramalan yang baik untuk baris baharu yang belum dilihat pada masa akan datang.
Kenali Terlebih Suaian
Apabila model menguasai data latihan tetapi gagal pada set ujian, keadaan itu dipanggil terlebih suaian. Model menghafal hingar dan bukannya mempelajari corak sebenar.
Pembahagian Biasa
Pilihan mudah yang popular ialah melatih model menggunakan kira-kira 80% baris dan menguji model menggunakan baki 20%. Lebih banyak data untuk belajar, dan masih cukup data untuk menilai dengan adil.
Sentuh Sekali Sahaja
Set ujian itu amat penting. Jika anda terus mengintai dan mengubah suai model sehingga skornya kelihatan baik, anda sebenarnya telah membocorkan maklumatnya ke dalam keputusan anda.
Tempat Pembahagian Berlaku
Dalam scikit-learn, satu fungsi pembantu akan membahagikan data untuk anda. Fungsi itu mengocok dan membahagikan data anda kepada bahagian latihan dan ujian dalam satu panggilan sahaja.
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)Nombor yang Jujur
Skor pada set ujian ialah anggaran jujur prestasi dalam dunia sebenar. Percayainya lebih daripada apa-apa skor latihan yang kelihatan sangat baik.
Lebih daripada Sekadar Formaliti
Mengasingkan data bukanlah kerenah pentadbiran. Itulah satu amalan yang menghalang anda daripada melancarkan model yang hanya pernah berjaya secara teori.
Semakan Pantas
Mengapakah anda menyimpan set ujian yang berasingan?
Ringkasan
Anda membahagikan data, belajar menggunakan bahagian latihan, dan menilai menggunakan set ujian yang dijaga rapi. Bahagian yang tidak disentuh itu memberikan gambaran jujur tentang kemahiran model dalam dunia sebenar. 🎯
Pelajari Python dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Soalan Lazim
Adakah pelajaran “Mengapa Anda Mengasingkan Set Ujian” percuma?
Ya — teks penuh “Mengapa Anda Mengasingkan Set Ujian” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Data Science Academy, tingkat taraf kepada CoddyKit PRO. Kursus Data Science Academy merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “Mengapa Anda Mengasingkan Set Ujian”?
Menganggar prestasi pada data yang belum dilihat Anda berlatih Data Science Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan Data Science Academy?
Tiada pengalaman terdahulu diperlukan. Pembelajaran Data Science Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.
Berapa lamakah pelajaran “Mengapa Anda Mengasingkan Set Ujian” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran Data Science Academy ini?
Ya. Setiap pelajaran Data Science Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Mengapa Anda Mengasingkan Set Ujian
- train_test_split dengan Cara yang Betul
- Pengesahan Silang K-Fold
- Hentikan Kebocoran Data Sebelum Bermula