의사결정 트리와 랜덤 포레스트
규칙 기반 분류기와 앙상블 분류기를 알아봅니다
의사결정 트리와 랜덤 포레스트은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
질문의 트리
결정 트리는 특성에 관해 예·아니요 질문을 연속해서 던지고 답에 도달할 때까지 진행하여 분류합니다. 🌳
각 노드에서 분할하기
각 갈림점은 분할입니다. 예를 들어 나이가 30보다 큰지 묻는 규칙입니다. 데이터는 이 검사 결과에 따라 왼쪽이나 오른쪽으로 이동합니다.
잎이 답을 담습니다
더 유용한 질문이 남지 않으면 잎에 도달합니다. 그 잎에서 다수를 차지하는 클래스가 예측이 됩니다.
최적의 분할 선택하기
트리는 지니 불순도나 엔트로피 같은 기준으로 측정했을 때 그룹이 최대한 순수해지도록 각 분할을 선택합니다.
읽기 쉽습니다
가장 큰 장점 중 하나는 해석 가능성입니다. 질문의 경로를 따라가며 예측이 나온 정확한 이유를 설명할 수 있습니다.
트리는 과적합을 좋아합니다
제한하지 않으면 트리는 깊게 자라 학습 데이터를 외워 버립니다. 이러한 과적합은 새롭고 보지 못한 행에서의 정확도를 떨어뜨립니다.
깊이 제한하기
max_depth로 성장에 상한을 두면 트리를 제어할 수 있습니다. 학습 데이터에 대한 적합도를 조금 포기하는 대신 일반화 성능을 크게 높입니다.
from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier(max_depth=4)하나보다 많은 트리가 낫습니다
랜덤 포레스트는 여러 트리를 학습시키고 투표하게 합니다. 여러 트리의 의견은 깊은 트리 하나보다 훨씬 안정적입니다.
각 트리는 더 적게 봅니다
다양성을 위해 각 트리는 행의 무작위 표본과 특성의 무작위 부분집합으로 학습합니다. 이 다양성이 핵심 비결입니다.
포레스트 만들기
scikit-learn에서는 한 줄이면 됩니다. 앙상블에 참여할 트리 수를 n_estimators로 설정합니다.
from sklearn.ensemble import RandomForestClassifier
model = RandomForestClassifier(n_estimators=100)무료 특성 중요도
학습된 포레스트는 feature_importances_를 통해 어떤 입력이 가장 중요했는지 알려 줍니다. 무엇이 예측을 이끄는지 빠르게 파악할 수 있습니다.
model.feature_importances_빠른 확인
포레스트가 단일 트리보다 나은 이유를 확인해 보겠습니다.
정리
결정 트리는 질문을 따라 잎까지 내려가고, 랜덤 포레스트는 여러 트리에 걸쳐 투표하여 과적합을 줄입니다. 🎯
자주 묻는 질문
“의사결정 트리와 랜덤 포레스트” 강의는 무료인가요?
네 — “의사결정 트리와 랜덤 포레스트” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“의사결정 트리와 랜덤 포레스트”에서 뭘 배우나요?
규칙 기반 분류기와 앙상블 분류기를 알아봅니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“의사결정 트리와 랜덤 포레스트” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 예와 아니오를 위한 로지스틱 회귀
- k-최근접 이웃
- 의사결정 트리와 랜덤 포레스트
- 그래디언트 부스팅의 핵심