0Pricing
Learn AI with Python · 강의

특성 선택 방법

필터 방식(분산, 상관관계), 래퍼 방식(RFE), 내장 방식(L1 정규화)을 다룹니다.

특성 선택 방법은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.

특성을 선택하는 이유

특성 선택은 가장 유용한 열만 남깁니다. 특성이 적으면 학습이 더 빠르고, 과적합이 줄어들며, 해석도 쉬워집니다. 잡음을 제거하면 정확도가 향상되는 경우도 많습니다.

세 가지 방법군

선택 방법은 세 그룹으로 나뉩니다:

  • 필터는 통계량을 기준으로 특성의 순위를 매깁니다(빠르고 모델에 의존하지 않음)
  • 래퍼는 모델을 학습해 부분집합을 탐색합니다(느리지만 정확함)
  • 임베디드 방식은 모델을 fit하는 동안 선택이 이루어집니다

VarianceThreshold

가장 단순한 필터입니다. VarianceThreshold는 분산이 임계값보다 낮은 특성을 제거합니다. 거의 상수인 열에는 정보가 없습니다.

from sklearn.feature_selection import VarianceThreshold

sel = VarianceThreshold(threshold=0.01)
X_reduced = sel.fit_transform(X)
print("Kept:", X_reduced.shape[1], "of", X.shape[1])

f_classif를 사용하는 SelectKBest

SelectKBest는 점수가 가장 높은 K개의 특성을 유지합니다. f_classif를 사용하면 각 특성이 클래스 레이블과 얼마나 강하게 관련되는지를 측정하는 ANOVA F-검정을 사용합니다.

from sklearn.feature_selection import SelectKBest, f_classif

sel = SelectKBest(score_func=f_classif, k=10)
X_best = sel.fit_transform(X, y)
print(sel.get_support(indices=True))

상호 정보량

mutual_info_classif는 특성과 목표값 사이의 모든 종류의 의존성(비선형 의존성 포함)을 측정합니다. F-검정과 달리 ANOVA가 놓치는 비선형 관계도 포착합니다.

from sklearn.feature_selection import SelectKBest, mutual_info_classif

sel = SelectKBest(score_func=mutual_info_classif, k=10)
X_mi = sel.fit_transform(X, y)

f_classif와 상호 정보량 비교

f_classif는 빠르고 선형 관계를 감지합니다. mutual_info_classif는 더 느리지만 비선형 관계를 포착합니다. 복잡한 관계가 의심되면 상호 정보량을 우선 사용하세요.

import numpy as np
from sklearn.feature_selection import f_classif, mutual_info_classif

f_scores, _ = f_classif(X, y)
mi_scores = mutual_info_classif(X, y)
print("F-test top:", np.argsort(f_scores)[::-1][:5])
print("MI top:", np.argsort(mi_scores)[::-1][:5])

재귀적 특성 제거

RFE는 래퍼 방식입니다. 모델을 학습하고 가장 중요도가 낮은 특성을 제거한 뒤 이 과정을 반복합니다. 모델 자체의 중요도 신호를 사용해 특성의 순위를 매깁니다.

from sklearn.feature_selection import RFE
from sklearn.linear_model import LogisticRegression

rfe = RFE(estimator=LogisticRegression(max_iter=1000), n_features_to_select=10)
rfe.fit(X, y)
print(rfe.support_)

RFECV: 특성 개수 자동 선택

RFECV는 RFE에 교차 검증을 추가하여 고정된 추측값이 아니라 검증 점수를 기준으로 최적의 특성 개수를 찾습니다.

from sklearn.feature_selection import RFECV
from sklearn.ensemble import RandomForestClassifier

rfecv = RFECV(
    estimator=RandomForestClassifier(),
    cv=5,
    scoring="accuracy",
)
rfecv.fit(X, y)
print("Optimal features:", rfecv.n_features_)

Lasso를 사용하는 SelectFromModel

임베디드 선택에서는 라쏘(L1)가 중요하지 않은 계수를 정확히 0으로 줄입니다. 그런 다음 SelectFromModel이 0이 아닌 계수만 유지합니다.

from sklearn.feature_selection import SelectFromModel
from sklearn.linear_model import Lasso

sel = SelectFromModel(Lasso(alpha=0.01))
sel.fit(X, y)
X_lasso = sel.transform(X)
print("Kept:", X_lasso.shape[1])

트리 중요도를 사용하는 SelectFromModel

SelectFromModel은 feature_importances_를 제공하는 모든 추정기와도 함께 사용할 수 있으며, 랜덤 포레스트가 그 예입니다. "mean"이나 "median" 같은 threshold를 설정하세요.

from sklearn.feature_selection import SelectFromModel
from sklearn.ensemble import RandomForestClassifier

sel = SelectFromModel(
    RandomForestClassifier(n_estimators=200),
    threshold="median",
)
sel.fit(X, y)

방법 선택하기

먼저 저비용 필터(VarianceThreshold, SelectKBest)로 명백히 불필요한 특성을 제거하세요. 균형 잡힌 선택으로는 임베디드 방식인 SelectFromModel을 사용하세요. 정확도가 가장 중요하고 계산 자원이 충분할 때는 RFECV를 사용하세요.

빠른 확인

특성 선택에 대한 지식을 확인해 보세요.

요약

요약: 특성 선택에는 필터(VarianceThreshold, f_classif 또는 mutual_info_classif를 사용하는 SelectKBest), 래퍼(RFECV), 임베디드(SelectFromModel과 라쏘 또는 트리 중요도) 방식이 있습니다. 필터가 가장 빠르고 RFECV가 가장 정확합니다. 비선형 관계에는 상호 정보량을 사용하세요.

자주 묻는 질문

“특성 선택 방법” 강의는 무료인가요?

네 — “특성 선택 방법” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.

“특성 선택 방법”에서 뭘 배우나요?

필터 방식(분산, 상관관계), 래퍼 방식(RFE), 내장 방식(L1 정규화)을 다룹니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“특성 선택 방법” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 특성 선택 방법
  2. 상호작용 및 다항 특성 생성
  3. 목표값 인코딩 및 고급 범주형 데이터 처리
  4. Featuretools를 활용한 자동 특성 공학
← Learn AI with Python(으)로 돌아가기