0Pricing
Learn AI with Python · Pelajaran

Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi

Pipeline sklearn, menyimpan pipeline dengan joblib, menjalankan eksperimen berparameter dengan file konfigurasi.

Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 4 pelajaran total.

Mengapa Reproduksibilitas Penting?

Hasil yang tidak dapat direproduksi bukanlah sains, melainkan keberuntungan. Alur kerja yang dapat direproduksi memastikan data dan konfigurasi yang sama selalu menghasilkan model yang sama, yang sangat penting untuk proses debug, audit, dan kerja sama tim.

Alur Kerja sklearn

Alur kerja scikit-learn menggabungkan prapemrosesan dan model menjadi satu objek, sehingga transformasi yang sama persis dengan yang diterapkan saat pelatihan juga diterapkan saat inferensi, sehingga menghilangkan ketidaksesuaian antara pelatihan dan penyajian.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.ensemble import RandomForestClassifier

pipe = Pipeline([
    ("scaler", StandardScaler()),
    ("model", RandomForestClassifier(n_estimators=200))
])
pipe.fit(X_train, y_train)

Menyimpan Alur Kerja sebagai Artefak

Karena seluruh alur kerja merupakan satu objek, Anda dapat menyimpannya sebagai satu artefak dan memuatnya kembali di mana saja, dengan keyakinan bahwa prapemrosesan ikut tersimpan bersama model.

joblib.dump dan load

joblib menserialisasi objek scikit-learn secara efisien (pustaka ini menangani larik NumPy berukuran besar dengan lebih baik daripada pickle). Simpan alur kerja yang telah disesuaikan, lalu muat ulang untuk penyajian.

import joblib

joblib.dump(pipe, "pipeline.joblib")        # save
loaded = joblib.load("pipeline.joblib")    # reload
preds = loaded.predict(X_new)

Konfigurasi YAML untuk Hiperparameter

Nilai yang ditulis langsung dalam kode menyembunyikan pengaturan yang digunakan suatu eksekusi. Masukkan semua hiperparameter ke dalam berkas YAML agar setiap pengaturan terlihat jelas, dikendalikan versinya, dan dapat diubah tanpa menyunting kode.

# config.yaml
model:
  n_estimators: 200
  max_depth: 8
data:
  test_size: 0.2
  random_state: 42

Memuat Konfigurasi

Baca YAML sekali saat mulai, lalu teruskan nilainya ke alur kerja Anda, sehingga satu berkas mengendalikan seluruh eksekusi.

import yaml

with open("config.yaml") as f:
    cfg = yaml.safe_load(f)

model = RandomForestClassifier(
    n_estimators=cfg["model"]["n_estimators"],
    max_depth=cfg["model"]["max_depth"]
)

Tetapkan Nilai Awal Acak

Reproduksibilitas juga memerlukan nilai awal acak yang tetap di semua tempat: pemisahan pelatihan dan pengujian, inisialisasi model, serta pengacakan apa pun. Simpan nilai awal tersebut dalam konfigurasi YAML agar terlihat jelas dan konsisten.

from sklearn.model_selection import train_test_split

X_tr, X_te, y_tr, y_te = train_test_split(
    X, y, test_size=cfg["data"]["test_size"],
    random_state=cfg["data"]["random_state"]
)

Berkas Make untuk Langkah yang Dapat Diulang

Berkas Make mengubah setiap tahap alur kerja menjadi sasaran bernama, sehingga siapa pun dapat menjalankan make train tanpa harus mengingat perintah yang panjang. Hal ini menstandarkan alur kerja di seluruh tim.

Mendefinisikan Sasaran Make

Sasaran yang umum adalah make data, make train, dan make evaluate, yang masing-masing memanggil skrip yang sesuai.

# Makefile
data:
	python src/prepare_data.py

train:
	python src/train.py --config config.yaml

evaluate:
	python src/evaluate.py --config config.yaml

Merangkai Dependensi

Sasaran Make dapat saling bergantung, sehingga make train menjalankan data terlebih dahulu jika diperlukan. Dengan demikian, alur kerja selalu berjalan dalam urutan yang benar.

train: data
	python src/train.py --config config.yaml

Menyatukan Semuanya

Penyiapan yang dapat direproduksi: sebuah alur kerja yang disimpan dengan joblib, semua hiperparameter dalam YAML, nilai awal tetap, dan berkas Make yang menyediakan make data / train / evaluate. Siapa pun dapat menggandakan repositori dan mereproduksi model Anda secara persis.

Uji Singkat

Uji pengetahuan Anda tentang alur kerja yang dapat direproduksi.

Rangkuman

Anda membangun alur kerja yang dapat direproduksi: sebuah alur kerja sklearn yang disimpan melalui joblib.dump/load, semua hiperparameter dalam konfigurasi YAML, nilai awal acak yang ditetapkan, serta berkas Make dengan sasaran make data / train / evaluate. Berikutnya: memantau model dalam produksi.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi” gratis?

Ya — teks lengkap “Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi”?

Pipeline sklearn, menyimpan pipeline dengan joblib, menjalankan eksperimen berparameter dengan file konfigurasi. Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Learn AI with Python?

Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?

Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pelacakan Eksperimen dengan MLflow
  2. Registri dan Penerapan Versi Model
  3. Membangun Pipeline Pembelajaran Mesin yang Dapat Direproduksi
  4. Memantau Kinerja Model dalam Produksi
← Kembali ke Learn AI with Python