Data Science Academy · Pelajaran

Skalakan Dahulu, Lalu Sesuaikan PCA

Mengapa standardisasi penting di sini

Pelajaran 3 dari 413 langkah

Skalakan Dahulu, Lalu Sesuaikan PCA adalah pelajaran Data Science Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Data Science Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Data Science Academy mencakup 4 pelajaran total.

PCA Memperhatikan Skala

PCA mencari varians terbesar, tetapi varians bergantung pada satuan. Fitur dengan angka besar dapat mendominasi hanya karena scale-nya.

Jebakan Satuan

Bayangkan gaji dalam dolar berdampingan dengan usia dalam tahun. Gaji bervariasi dalam ribuan, sehingga PCA akan menganggapnya jauh lebih penting secara tidak adil.

Lakukan Standardisasi Terlebih Dahulu

Solusinya adalah standardization: ubah skala setiap fitur menjadi rata-rata nol dan varians satu agar semuanya memulai dari kondisi yang setara.

Gunakan StandardScaler

Di scikit-learn, StandardScaler memusatkan dan mengubah skala kolom Anda sebelum PCA memprosesnya.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Lalu Lakukan Fit pada PCA

Jalankan PCA pada data yang telah diskalakan, bukan data mentah. Kini setiap komponen mencerminkan struktur nyata, bukan units yang tidak seimbang.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

Pemusatan Juga Penting

PCA mengasumsikan data berpusat di nol. Standardisasi menanganinya dengan mengurangi rata-rata setiap kolom, sehingga sumbu melewati pusat data.

Rangkai dalam Pipeline

Bungkus scaler dan PCA dalam Pipeline agar penskalaan selalu dilakukan terlebih dahulu dan tidak pernah bocor ke bagian data lain.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Lakukan Fit Hanya pada Data Pelatihan

Lakukan fit pada scaler menggunakan data pelatihan, lalu gunakan kembali scaler tersebut pada data pengujian. Melakukan fit pada seluruh data membocorkan informasi dan memperbesar skor Anda.

Kapan Anda Dapat Melewatinya

Jika setiap fitur sudah menggunakan satuan dan rentang yang sama, penskalaan tidak terlalu penting. Jika ragu, lakukan standardize saja; langkah ini jarang menimbulkan masalah.

Amati Perbedaannya

Jalankan PCA dengan dan tanpa penskalaan pada data yang menggunakan berbagai satuan. Variance yang dijelaskan dan komponen teratas akan tampak sangat berbeda.

Ada Pilihan yang Lebih Tahan

Jika terdapat pencilan yang kuat, pertimbangkan RobustScaler, yang menggunakan median dan kuartil agar titik ekstrem lebih sedikit memengaruhi PCA.

from sklearn.preprocessing import RobustScaler

Pemeriksaan Singkat

Satu langkah hampir selalu dilakukan tepat sebelum PCA.

Ringkasan

PCA peka terhadap skala, jadi lakukan standardize terlebih dahulu, lakukan fit hanya pada data pelatihan, dan gunakan pipeline untuk menjaga urutannya tetap aman. 🎯

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Skalakan Dahulu, Lalu Sesuaikan PCA” gratis?

Ya — teks lengkap “Skalakan Dahulu, Lalu Sesuaikan PCA” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Data Science Academy, upgrade ke CoddyKit PRO. Kursus Data Science Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Skalakan Dahulu, Lalu Sesuaikan PCA”?

Mengapa standardisasi penting di sini Kamu berlatih Data Science Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Data Science Academy?

Tidak diperlukan pengalaman sebelumnya. Data Science Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Skalakan Dahulu, Lalu Sesuaikan PCA” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Data Science Academy ini?

Ya. Setiap pelajaran Data Science Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Dampak Terlalu Banyak Fitur
  2. Cara PCA Menemukan Komponen
  3. Skalakan Dahulu, Lalu Sesuaikan PCA
  4. Memilih Komponen dengan Grafik Scree
← Kembali ke Data Science Academy