0Pricing
Data Science Academy · Pelajaran

Mengapa Anda Menyisihkan Set Pengujian

Memperkirakan kinerja pada data yang belum pernah dilihat

Mengapa Anda Menyisihkan Set Pengujian adalah pelajaran Data Science Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Data Science Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Data Science Academy mencakup 4 pelajaran total.

Pertanyaan yang Sebenarnya

Model yang menghafal data Anda akan tampak hebat pada data tersebut. Pertanyaan yang sebenarnya adalah bagaimana kinerjanya pada data yang belum pernah dilihatnya.

Sisihkan Sebagian Data

Karena itu, sisihkan sebagian data Anda dan jangan pernah melatih model dengan data tersebut. Potongan data yang disimpan ini adalah set pengujian, yang digunakan pada tahap paling akhir.

Berlatih di Sini, Menilai di Sana

Model hanya belajar dari kumpulan data pelatihan. Setelah itu, Anda menilainya menggunakan kumpulan data pengujian yang belum disentuh untuk melihat seberapa baik model benar-benar dapat melakukan generalisasi. 🎯

Mengapa Tidak Menilai Data Pelatihan

Menilai baris yang sama dengan baris yang digunakan untuk belajar ibarat menilai ujian dengan kunci jawaban terbuka. Angka tersebut membuat model tampak lebih baik dan melebih-lebihkan kemampuannya.

Generalisasi Adalah Tujuannya

Yang penting bukan seberapa baik model menyesuaikan diri dengan data lama. Yang penting adalah generalisasi: menghasilkan prediksi yang baik pada baris baru yang belum pernah dilihat di masa mendatang.

Kenali Overfitting

Ketika model sangat cocok dengan data pelatihan tetapi gagal pada kumpulan data pengujian, model mengalami overfitting. Model menghafal derau, bukan mempelajari pola yang sebenarnya.

Pembagian yang Umum

Pilihan sederhana yang populer adalah melatih model menggunakan sekitar 80% baris dan menguji 20% sisanya. Dengan begitu, data untuk belajar cukup banyak dan masih ada cukup data untuk menilai model secara adil.

Sentuh Hanya Sekali

Kumpulan data pengujian harus dijaga. Jika Anda terus mengintipnya dan melakukan perubahan sampai nilainya terlihat bagus, tanpa sadar Anda telah membocorkan informasi tersebut ke dalam keputusan Anda.

Tempat Pembagian Dilakukan

Dalam scikit-learn, satu fungsi pembantu dapat melakukan pembagian untuk Anda. Fungsi tersebut mengacak dan membagi data menjadi bagian pelatihan dan pengujian dalam satu pemanggilan.

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

Angka yang Jujur

Nilai pada kumpulan data pengujian adalah perkiraan jujur tentang kinerja di dunia nyata. Percayailah nilai ini lebih daripada nilai pelatihan yang tampak sangat bagus.

Lebih dari Sekadar Formalitas

Menyisihkan data bukanlah birokrasi yang tidak perlu. Ini adalah kebiasaan yang mencegah Anda merilis model yang hanya pernah berhasil di atas kertas.

Pemeriksaan Singkat

Mengapa Anda menyimpan kumpulan data pengujian secara terpisah?

Ringkasan

Anda membagi data, belajar dari bagian pelatihan, lalu menilai model menggunakan kumpulan data pengujian yang dijaga. Bagian yang belum disentuh itu memberi gambaran jujur tentang kemampuan model di dunia nyata. 🎯

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Mengapa Anda Menyisihkan Set Pengujian” gratis?

Ya — teks lengkap “Mengapa Anda Menyisihkan Set Pengujian” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Data Science Academy, upgrade ke CoddyKit PRO. Kursus Data Science Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Mengapa Anda Menyisihkan Set Pengujian”?

Memperkirakan kinerja pada data yang belum pernah dilihat Kamu berlatih Data Science Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Data Science Academy?

Tidak diperlukan pengalaman sebelumnya. Data Science Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Mengapa Anda Menyisihkan Set Pengujian” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Data Science Academy ini?

Ya. Setiap pelajaran Data Science Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Mengapa Anda Menyisihkan Set Pengujian
  2. train_test_split dengan Tepat
  3. Validasi Silang K-Fold
  4. Hentikan Kebocoran Data Sebelum Terjadi
← Kembali ke Data Science Academy