Machine Learning Academy · Pelajaran

Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan

Pelajar akan mengikuti pipeline hujung ke hujung, daripada pengumpulan dan pembersihan data mentah hingga latihan, penilaian dan penggunaan model.

Pelajaran 3 daripada 413 langkah

Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan ialah pelajaran Machine Learning Academy percuma di CoddyKit. Ini ialah pelajaran 3 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Machine Learning Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Machine Learning Academy merangkumi sejumlah 4 pelajaran.

Saluran Paip Pembelajaran Mesin dari Hujung ke Hujung

Membina pembelajaran mesin bukan sekadar melatih model — ia merupakan saluran paip yang lengkap. Mengetahui semua peringkat membantu anda mengelakkan pemodelan terlalu awal.

Peringkat 1: Takrifkan Masalah

Peringkat pertama ialah mentakrifkan masalah: apakah yang anda ramalkan, mengapa perkara itu penting dan bagaimanakah kejayaan akan diukur? Matlamat yang kabur menghasilkan model yang kabur.

Peringkat 2: Kumpulkan dan Muatkan Data

Seterusnya, kumpulkan dan muatkan data anda daripada fail, pangkalan data atau API — Pandas ialah alat pilihan utama. Sentiasa periksa data mentah sebelum melakukan perkara lain.

import pandas as pd

# Load data from a CSV file
df = pd.read_csv('housing.csv')

# First inspection
print(df.shape)       # (rows, columns)
print(df.dtypes)      # data types per column
print(df.head())      # first 5 rows
print(df.describe())  # summary statistics

Peringkat 3: Analisis Data Penerokaan

Analisis Data Penerokaan ialah kerja penyiasatan: plotkan taburan, periksa korelasi dan cari nilai terpencil sebelum membina sebarang model.

import matplotlib.pyplot as plt
import seaborn as sns
import pandas as pd

df = pd.read_csv('housing.csv')

# Distribution of target variable
df['price'].hist(bins=50)
plt.title('House Price Distribution')
plt.show()

# Correlation heat map
sns.heatmap(df.corr(), annot=True, cmap='coolwarm')
plt.show()

# Check for missing values
print(df.isnull().sum())

Peringkat 4: Praproses Data

Prapemprosesan menukar data yang berserabut menjadi matriks ciri yang bersih — dengan mengisi jurang, menskalakan dan mengekod data. Peraturan utama: lakukan fit hanya pada data latihan untuk mengelakkan kebocoran.

from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
import pandas as pd
import numpy as np

df = pd.read_csv('housing.csv')
X = df.drop('price', axis=1)
y = df['price']

# Split first, then fit scaler ONLY on train
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)  # fit + transform on train
X_test_scaled = scaler.transform(X_test)         # transform only on test

Peringkat 5: Latih Model

Sekarang latih model: dalam scikit-learn, ini hanya memerlukan satu panggilan fit(). Mulakan dengan mudah menggunakan garis dasar seperti model linear sebelum mencuba sesuatu yang kompleks.

from sklearn.linear_model import LinearRegression
from sklearn.ensemble import RandomForestRegressor

# Simple baseline first
linear_model = LinearRegression()
linear_model.fit(X_train_scaled, y_train)

# More complex model
rf_model = RandomForestRegressor(n_estimators=100, random_state=42)
rf_model.fit(X_train_scaled, y_train)

print('Linear model trained.')
print('Random Forest trained.')

Peringkat 6: Nilai Model

Nilai model menggunakan data ujian yang diasingkan dan belum pernah dilihatnya. Pilih metrik yang betul — MAE dan RMSE untuk nombor, ketepatan dan F1 untuk kategori.

from sklearn.metrics import mean_absolute_error, r2_score
import numpy as np

y_pred = linear_model.predict(X_test_scaled)

mae = mean_absolute_error(y_test, y_pred)
r2 = r2_score(y_test, y_pred)
rmse = np.sqrt(((y_test - y_pred) ** 2).mean())

print(f'MAE:  {mae:.2f}')
print(f'RMSE: {rmse:.2f}')
print(f'R2:   {r2:.3f}')

Peringkat 7: Ulang dan Tingkatkan

Model pertama jarang menjadi yang terbaik. Pembelajaran mesin bersifat berulang: berdasarkan keputusan anda, kumpulkan lebih banyak data, bina ciri atau laraskan tetapan — kemudian cuba lagi.

Peringkat 8: Gunakan Model

Penerapan menjadikan model terlatih anda tersedia kepada pengguna sebenar — selalunya sebagai API web, tugas kelompok atau model pada peranti dalam aplikasi. Buku nota sahaja tidak memberikan nilai.

import joblib

# Save the trained model
joblib.dump(linear_model, 'house_price_model.pkl')
print('Model saved.')

# Later, load and predict in production
loaded_model = joblib.load('house_price_model.pkl')
prediction = loaded_model.predict(X_test_scaled[:1])
print(f'Prediction: ${prediction[0]:,.0f}')

Peringkat 9: Pantau dan Latih Semula

Penerapan bukan garisan penamat. Data berubah mengikut masa, jadi anda memerlukan pemantauan untuk mengesan kemerosotan prestasi secara senyap dan mencetuskan latihan semula apabila diperlukan.

Aliran Kerja sebagai Saluran Paip Scikit-learn

Pipeline scikit-learn menggabungkan prapemprosesan dan pemodelan menjadi satu objek. Ia mengelakkan kebocoran dan memudahkan penerapan — simpan dan muatkan satu perkara sahaja.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression

# Chain preprocessing and model in one object
pipeline = Pipeline([
    ('scaler', StandardScaler()),
    ('model', LinearRegression())
])

# fit() applies scaler then trains the model
pipeline.fit(X_train, y_train)

# predict() applies scaler then predicts
y_pred = pipeline.predict(X_test)
print('Pipeline prediction done.')

Semakan Pantas

Uji pemahaman anda tentang Pembelajaran Mesin menggunakan konsep Python daripada pelajaran ini.

Ulang Kaji Pelajaran

Kemajuan yang hebat! Aliran kerja pembelajaran mesin bermula daripada takrifan masalah hingga pemantauan, prapemprosesan hanya dilakukan pada data latihan dan penerapan ialah permulaan, bukan pengakhiran.

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan” percuma?

Ya — teks penuh “Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Machine Learning Academy, tingkat taraf kepada CoddyKit PRO. Kursus Machine Learning Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan”?

Pelajar akan mengikuti pipeline hujung ke hujung, daripada pengumpulan dan pembersihan data mentah hingga latihan, penilaian dan penggunaan model. Anda berlatih Machine Learning Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Machine Learning Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Machine Learning Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 3 daripada 4.

Berapa lamakah pelajaran “Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Machine Learning Academy ini?

Ya. Setiap pelajaran Machine Learning Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Pengaturcaraan Tradisional berbanding Pembelajaran Mesin
  2. Pembelajaran Diselia, Tanpa Seliaan dan Pengukuhan
  3. Aliran Kerja Pembelajaran Mesin: Daripada Data kepada Ramalan
  4. Pembelajaran Mesin dalam Dunia Sebenar: Kes Penggunaan dan Batasan
← Kembali ke Machine Learning Academy