랜덤 forest와 배깅
앙상블 개념, RandomForestClassifier, n_estimators, 특성 중요도, OOB 점수를 학습합니다.
랜덤 forest와 배깅은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
단일 트리의 문제
단일 결정 트리는 분산이 높습니다. 조금 다른 데이터로 다시 학습하면 완전히 다른 트리가 만들어질 수 있습니다. 앙상블은 여러 트리를 결합해 이 문제를 해결합니다.
Bagging (부트스트랩 집계)
Bagging은 데이터에서 서로 다른 부트스트랩 표본(복원 추출을 통한 무작위 표본)을 사용해 여러 모델을 학습시킨 다음 예측을 평균냅니다.
분산이 높은 모델을 여러 개 평균내면 편향을 크게 늘리지 않으면서 전체 분산을 줄일 수 있습니다.
from sklearn.ensemble import BaggingClassifier
from sklearn.tree import DecisionTreeClassifier
bag = BaggingClassifier(
estimator=DecisionTreeClassifier(),
n_estimators=100,
random_state=0,
)
bag.fit(Xtr, ytr)Bagging에서 랜덤 포레스트로
랜덤 포레스트는 트리에 Bagging을 적용한 뒤 한 가지 방법을 더 사용합니다. 각 분할에서 특성의 무작위 부분집합만 고려하는 것입니다.
이렇게 하면 트리 사이의 상관성이 줄어들어 오류가 더 잘 상쇄되고 앙상블의 성능이 향상됩니다.
RandomForestClassifier 기초
RandomForestClassifier를 사용하세요. 핵심 매개변수인 n_estimators는 만들 트리의 수를 정합니다. 트리가 많을수록 더 안정적이지만 느려집니다.
from sklearn.ensemble import RandomForestClassifier
rf = RandomForestClassifier(n_estimators=200, random_state=0)
rf.fit(Xtr, ytr)
print("Accuracy:", rf.score(Xte, yte))n_jobs를 사용한 병렬 학습
포레스트의 트리들은 서로 독립적이므로 병렬로 학습할 수 있습니다. n_jobs=-1로 설정하면 모든 CPU 코어를 사용해 학습 속도를 크게 높일 수 있습니다.
from sklearn.ensemble import RandomForestClassifier
rf = RandomForestClassifier(
n_estimators=500,
n_jobs=-1, # use all cores
random_state=0,
)
rf.fit(Xtr, ytr)OOB 점수
각 트리는 표본의 약 3분의 1을 학습에 사용하지 않습니다(부트스트랩 표본에 선택되지 않았기 때문입니다). 이렇게 제외된 OOB 표본은 내장된 검증 세트를 구성합니다.
oob_score=True로 설정하면 별도의 분할 없이 일반화 오류를 무료로 추정할 수 있습니다.
from sklearn.ensemble import RandomForestClassifier
rf = RandomForestClassifier(
n_estimators=300,
oob_score=True,
random_state=0,
)
rf.fit(Xtr, ytr)
print("OOB score:", rf.oob_score_)포레스트에서 트리 깊이 제어하기
동일한 트리 매개변수를 적용할 수 있습니다. max_depth, min_samples_leaf, max_features(분할마다 시도할 특성의 수)입니다.
max_features="sqrt"는 분류에서 흔히 사용하는 기본값입니다.
from sklearn.ensemble import RandomForestClassifier
rf = RandomForestClassifier(
n_estimators=300,
max_depth=12,
max_features="sqrt",
random_state=0,
)내장 특성 중요도
단일 트리와 마찬가지로 포레스트도 모든 트리에 걸쳐 평균낸 feature_importances_를 제공합니다. 이 불순도 기반 중요도는 빠르지만 고유값 수가 많은 특성에 편향될 수 있습니다.
from sklearn.ensemble import RandomForestClassifier
import numpy as np
rf = RandomForestClassifier(n_estimators=200, random_state=0).fit(Xtr, ytr)
order = np.argsort(rf.feature_importances_)[::-1]
for i in order[:5]:
print(i, rf.feature_importances_[i])순열 중요도
순열 중요도는 더 신뢰할 수 있는 방법입니다. 특성 열 하나를 섞은 뒤 score가 얼마나 떨어지는지 측정합니다. 크게 떨어진다면 해당 특성이 중요했다는 뜻입니다.
이 방법은 모델에 종속되지 않으며 불순도 편향을 피할 수 있습니다.
from sklearn.inspection import permutation_importance
result = permutation_importance(
rf, Xte, yte, n_repeats=10, random_state=0, n_jobs=-1
)
print(result.importances_mean)순열 결과 해석하기
permutation_importance는 반복 실행에 따른 importances_mean과 importances_std를 반환합니다. 학습 적합도가 아니라 일반화에 미치는 영향을 측정할 수 있도록 분리된 검증 세트에서 계산하세요.
import numpy as np
means = result.importances_mean
stds = result.importances_std
for i in np.argsort(means)[::-1]:
print(f"feature {i}: {means[i]:.3f} +/- {stds[i]:.3f}")랜덤 포레스트를 사용할 때
랜덤 포레스트는 기본 선택으로 사용하기 좋습니다. 견고하고 조정할 항목이 적으며, 비선형성과 상호작용을 처리하고 과적합에도 강합니다. 단점은 단일 트리보다 메모리를 많이 사용하고 예측이 느리며 해석 가능성이 낮다는 것입니다.
빠른 확인
Bagging과 포레스트에 대한 이해도를 확인해 보세요.
복습
복습: Bagging은 부트스트랩 표본으로 모델을 학습시키고 평균내어 분산을 줄입니다. 랜덤 포레스트는 분할마다 무작위 특성 부분집합을 추가로 사용합니다. n_estimators로 조정하고, 속도를 높이려면 n_jobs=-1을 사용하세요. oob_score로 별도의 비용 없이 검증하고, 신뢰할 수 있는 순위를 얻으려면 불순도 기반 중요도보다 permutation_importance를 우선 사용하세요.
자주 묻는 질문
“랜덤 forest와 배깅” 강의는 무료인가요?
네 — “랜덤 forest와 배깅” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
“랜덤 forest와 배깅”에서 뭘 배우나요?
앙상블 개념, RandomForestClassifier, n_estimators, 특성 중요도, OOB 점수를 학습합니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“랜덤 forest와 배깅” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.