scikit-learn API: fit, transform, predict
추정기 인터페이스와 학습/테스트 분할 작업 흐름을 이해합니다.
scikit-learn API: fit, transform, predict은(는) CoddyKit의 무료 Python Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Python Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Python Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
scikit-learn이란 무엇입니까
scikit-learn은 고전적 머신 러닝에 널리 사용되는 Python 라이브러리입니다. 일관된 API를 제공하며, 모든 추정기에는 fit()이 있고 대부분에는 predict() 또는 transform()이 있습니다.
from sklearn.linear_model import LinearRegression
import numpy as np
X = np.array([[1],[2],[3],[4],[5]])
y = np.array([2, 4, 6, 8, 10])
model = LinearRegression().fit(X, y)
print(model.predict([[6]])) # [12.]학습/테스트 분할
모델이 보지 못한 데이터에 얼마나 잘 일반화되는지 평가하려면 학습 전에 항상 데이터를 분할합니다.
from sklearn.model_selection import train_test_split
import numpy as np
X = np.random.rand(100, 5)
y = (X[:,0] > 0.5).astype(int)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
print(X_train.shape, X_test.shape) # (80,5) (20,5)fit() — 학습
estimator.fit(X, y)는 X(특징)와 y(레이블)를 사용해 모델을 학습합니다. 비지도 학습 방법에서는 X만 전달합니다.
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(n_samples=200, random_state=0)
model = LogisticRegression()
model.fit(X, y)
print("Trained:", model.classes_)predict() 및 predict_proba()
predict(X)는 클래스 레이블을 반환하고, predict_proba(X)는 분류기에서 클래스 확률을 반환합니다.
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)
print(model.predict(X[:5])) # [0 1 0 ...]
print(model.predict_proba(X[:2])) # [[0.7 0.3] ...]변환기: fit 및 transform
변환기(스케일러, 인코더)는 fit(X)와 transform(X)을 사용합니다. 학습 데이터에만 fit한 다음 학습 데이터와 테스트 데이터 모두를 변환합니다.
from sklearn.preprocessing import StandardScaler
import numpy as np
X_train = np.array([[1,2],[3,4],[5,6]])
X_test = np.array([[2,3],[4,5]])
scaler = StandardScaler()
X_train_s = scaler.fit_transform(X_train) # fit + transform
X_test_s = scaler.transform(X_test) # transform only (using train stats)파이프라인
Pipeline은 변환기와 추정기를 하나의 객체로 연결합니다. 교차 검증 과정에서 변환을 올바르게 적용하여 데이터 누수를 방지합니다.
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC
pipe = Pipeline([
("scaler", StandardScaler()),
("clf", SVC())
])
pipe.fit(X_train, y_train)
print(pipe.score(X_test, y_test))정확도 및 기타 평가 지표
분류기를 평가하려면 accuracy_score, f1_score, classification_report를 사용합니다.
from sklearn.metrics import accuracy_score, classification_report
y_pred = model.predict(X_test)
print(accuracy_score(y_test, y_pred))
print(classification_report(y_test, y_pred))교차 검증
cross_val_score는 데이터를 직접 분할하지 않고 k겹 교차 검증으로 모델을 평가합니다.
from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
scores = cross_val_score(LogisticRegression(), X, y, cv=5)
print(f"CV scores: {scores.mean():.3f} ± {scores.std():.3f}")GridSearchCV로 하이퍼파라미터 튜닝하기
GridSearchCV는 교차 검증을 사용해 매개변수 그리드를 철저히 검색하고 최적의 하이퍼파라미터를 찾습니다.
from sklearn.model_selection import GridSearchCV
from sklearn.svm import SVC
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
param_grid = {"C": [0.1, 1, 10], "kernel": ["rbf", "linear"]}
gs = GridSearchCV(SVC(), param_grid, cv=5)
gs.fit(X, y)
print(gs.best_params_, gs.best_score_)전처리: LabelEncoder 및 OneHotEncoder
LabelEncoder로 범주형 레이블을 인코딩하고, OneHotEncoder 또는 ColumnTransformer로 범주형 특징을 인코딩합니다.
from sklearn.preprocessing import LabelEncoder, OneHotEncoder
import numpy as np
le = LabelEncoder()
print(le.fit_transform(["cat","dog","cat","fish"])) # [0 1 0 2]
ohe = OneHotEncoder(sparse_output=False)
print(ohe.fit_transform([["red"],["green"],["blue"]]))모델 저장 및 불러오기
학습한 모델은 NumPy 배열에서 pickle보다 빠른 joblib으로 저장합니다.
import joblib
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)
joblib.dump(model, "model.joblib")
loaded = joblib.load("model.joblib")
print(loaded.predict(X[:3]))빠른 확인
테스트 데이터가 아니라 학습 데이터에만 scaler.fit()을 호출해야 하는 이유는 무엇입니까?
복습
scikit-learn은 일관된 API를 제공합니다. fit()은 학습하고, predict()는 추론하며, transform()은 전처리합니다. 단계를 연결하려면 Pipeline을 사용합니다. train_test_split으로 데이터를 분할하고, cross_val_score로 평가하며, GridSearchCV로 튜닝합니다.
자주 묻는 질문
“scikit-learn API: fit, transform, predict” 강의는 무료인가요?
네 — “scikit-learn API: fit, transform, predict” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Python Academy 강의 전체를 잠금 해제할 수 있습니다. Python Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“scikit-learn API: fit, transform, predict”에서 뭘 배우나요?
추정기 인터페이스와 학습/테스트 분할 작업 흐름을 이해합니다. 브라우저에서 직접 실행하는 실습 코드로 Python Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Python Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Python Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“scikit-learn API: fit, transform, predict” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Python Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Python Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- scikit-learn API: fit, transform, predict
- 선형 모델: 회귀와 분류
- 트리 기반 모델: 결정 트리와 랜덤 포레스트
- 모델 평가와 교차 검증