그리드 검색과 무작위 검색
GridSearchCV, RandomizedSearchCV, param_grid 설계, 최적 매개변수로 재학습을 다룹니다.
그리드 검색과 무작위 검색은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
하이퍼파라미터를 조정하는 이유
모델에는 하이퍼파라미터(예: max_depth 또는 C)가 있으며, 이는 데이터에서 학습되는 것이 아니라 학습 전에 설정됩니다. 적절한 값은 성능을 크게 향상시킬 수 있으므로, 이를 체계적으로 탐색합니다.
수동 조정은 오류가 발생하기 쉽습니다
손으로 값을 시도하는 방식은 느리고 편향되기 쉽습니다. 자동화된 탐색을 교차 검증과 결합하면 각 후보를 공정하게 평가하고 최적의 조합을 재현 가능하게 찾을 수 있습니다.
GridSearchCV 기초
GridSearchCV는 매개변수 격자에 있는 모든 조합을 시도하고, 각 조합을 교차 검증으로 평가합니다. 이는 철저한 방식이며 격자 안에서 최적 지점을 보장합니다.
from sklearn.model_selection import GridSearchCV
from sklearn.ensemble import RandomForestClassifier
param_grid = {
"n_estimators": [100, 200, 300],
"max_depth": [4, 8, None],
}
gs = GridSearchCV(RandomForestClassifier(), param_grid, cv=5)
gs.fit(X, y)조합 수의 폭발
격자 탐색 비용은 모든 선택지 개수의 곱에 분할 수를 곱한 만큼 증가합니다. 매개변수 3개에 각각 값이 5개씩 있고 5-분할 CV를 사용하면 5*5*5*5 = 625개의 fit이 필요합니다. 격자는 빠르게 비용이 커집니다.
GridSearchCV에서 점수 매기기
scoring 매개변수는 최적화할 지표를 선택합니다. 불균형 데이터에는 기본 정확도 대신 f1 또는 roc_auc를 선택하세요.
from sklearn.model_selection import GridSearchCV
gs = GridSearchCV(
RandomForestClassifier(),
param_grid,
cv=5,
scoring="roc_auc",
)
gs.fit(X, y)n_jobs로 병렬화하기
각 후보의 fit은 서로 독립적이므로 모든 CPU 코어에서 실행하도록 n_jobs=-1을 설정할 수 있습니다. 이렇게 하면 대규모 격자의 실제 소요 시간이 크게 줄어듭니다.
from sklearn.model_selection import GridSearchCV
gs = GridSearchCV(
RandomForestClassifier(),
param_grid,
cv=5,
n_jobs=-1,
verbose=1,
)최적 결과 읽기
fit을 완료한 후 best_params_에서 최적 조합을, best_score_에서 해당 조합의 CV 점수를, best_estimator_에서 predict할 준비가 된 재학습 모델을 확인할 수 있습니다.
gs.fit(X, y)
print("Best params:", gs.best_params_)
print("Best CV score:", gs.best_score_)
best_model = gs.best_estimator_
best_model.predict(X_new)모든 결과 살펴보기
cv_results_는 모든 후보의 점수와 순위를 보여 주는 딕셔너리이며, DataFrame으로 사용하기에도 좋습니다. 이를 사용해 어떤 매개변수가 중요한지와 점수가 얼마나 안정적인지 파악할 수 있습니다.
import pandas as pd
results = pd.DataFrame(gs.cv_results_)
print(results[["params", "mean_test_score", "rank_test_score"]].head())RandomizedSearchCV
탐색 공간이 매우 클 때 RandomizedSearchCV는 모든 조합을 시도하는 대신 정해진 개수의 무작위 조합을 샘플링합니다. n_iter로 탐색 예산을 조절할 수 있습니다.
from sklearn.model_selection import RandomizedSearchCV
from scipy.stats import randint
param_dist = {
"n_estimators": randint(100, 500),
"max_depth": randint(3, 20),
}
rs = RandomizedSearchCV(
RandomForestClassifier(), param_dist,
n_iter=30, cv=5, random_state=0,
)
rs.fit(X, y)무작위 탐색이 자주 더 좋은 이유
많은 문제에서는 실제로 중요한 하이퍼파라미터가 몇 개뿐입니다. 무작위 탐색은 고정된 격자보다 이러한 중요한 차원을 더 효율적으로 탐색하므로, 훨씬 적은 시행으로도 좋은 해를 찾을 수 있습니다.
격자 탐색과 무작위 탐색: 선택 가이드
작고 이산적인 후보 집합에는 GridSearchCV를 사용하세요. 예산으로 n_iter를 설정할 수 있는 크거나 연속적인 공간에는 RandomizedSearchCV를 사용하세요. refit=True이면 두 방법 모두 최적 모델을 자동으로 다시 학습합니다.
빠른 확인
하이퍼파라미터 탐색에 대한 지식을 확인해 보세요.
요약
요약: GridSearchCV는 param_grid의 모든 조합을 철저히 평가하며, 규모가 커지면 비용이 폭증합니다. RandomizedSearchCV는 큰 공간에서 n_iter개의 조합을 샘플링합니다. 사용할 지표에는 scoring을, 속도 향상에는 n_jobs=-1을 설정하고, fit 후 best_params_, best_score_, best_estimator_를 확인하세요.
자주 묻는 질문
“그리드 검색과 무작위 검색” 강의는 무료인가요?
네 — “그리드 검색과 무작위 검색” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
“그리드 검색과 무작위 검색”에서 뭘 배우나요?
GridSearchCV, RandomizedSearchCV, param_grid 설계, 최적 매개변수로 재학습을 다룹니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“그리드 검색과 무작위 검색” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 교차 검증 전략
- 분류 평가 지표 심층 학습
- 그리드 검색과 무작위 검색
- Optuna를 활용한 베이지안 최적화