특성이 너무 많을 때의 문제
고차원이 모델에 부담을 주는 이유를 알아봅니다
특성이 너무 많을 때의 문제은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
열이 많을수록 문제도 많아집니다
feature를 추가하면 도움이 될 것 같지만, 어느 지점을 넘으면 새 column 하나하나가 data를 더 희소하게 만들고 model을 학습하기 어렵게 합니다. 😬
차원의 저주
이러한 압박이 바로 차원의 저주입니다. 차원이 늘어날수록 공간은 폭발적으로 커지고 data point는 서로 멀리 흩어집니다.
거리는 의미를 잃습니다
매우 높은 차원에서는 거의 모든 점의 쌍이 대략 같은 거리에 놓입니다. 따라서 거리 기반 method는 서로를 구분하지 못하게 됩니다.
data는 빠르게 희소해집니다
같은 밀도를 유지하려면 필요한 row 수가 feature 수에 따라 지수적으로 늘어납니다. 실제 dataset에는 그렇게 많은 row가 없으므로 공간 대부분이 비어 있게 됩니다.
과적합이 스며듭니다
column은 많고 row는 적으면 model이 신호 대신 noise를 외울 수 있습니다. 이러한 과적합은 학습에서는 매우 좋아 보이지만 새 data에서는 실패합니다.
중복되는 열
키를 cm로 나타낸 값과 inch로 나타낸 값처럼 많은 feature가 서로 조용히 같은 정보를 반복합니다. 이러한 중복은 새로운 정보 없이 비용만 늘립니다.
noise가 쌓입니다
추가되는 column마다 약간의 측정 noise가 들어 있습니다. 이런 column을 충분히 쌓으면 noise가 정말 중요한 몇 개의 feature를 가릴 수 있습니다.
더 느리고 무거워집니다
차원이 늘어나면 memory 사용량이 증가하고 학습 시간이 길어집니다. 열이 많은 table에서는 단순한 model도 느리고 조정하기 어려워집니다.
시각화하기 더 어렵습니다
2차원이나 3차원은 plot으로 나타낼 수 있지만 50차원은 불가능합니다. 고차원 data는 직접 시각화하거나 추론하기가 거의 불가능합니다.
두 가지 해결 방법
feature 선택으로 약한 column을 제거하거나, PCA 같은 feature 추출을 사용해 column을 더 적은 수의 새 column으로 결합할 수 있습니다.
PCA가 도움이 되는 이유
PCA는 상관관계가 있는 많은 feature를 소수의 새 축으로 압축합니다. 정보 대부분은 유지하면서 차원 수를 줄이는 방식입니다.
빠른 확인
차원이 커질 때 실제로 무엇이 무너지는지 생각해 보세요.
복습
feature가 너무 많으면 차원의 저주가 발생합니다. data는 희소해지고, 거리는 모호해지며, 과적합이 생깁니다. PCA 등을 사용해 차원을 줄이면 이를 해결할 수 있습니다. 🎯
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“특성이 너무 많을 때의 문제” 강의는 무료인가요?
네 — “특성이 너무 많을 때의 문제” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“특성이 너무 많을 때의 문제”에서 뭘 배우나요?
고차원이 모델에 부담을 주는 이유를 알아봅니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“특성이 너무 많을 때의 문제” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 특성이 너무 많을 때의 문제
- PCA가 성분을 찾는 방법
- 먼저 크기를 조정한 뒤 PCA 적합하기
- 스크리 도표로 성분 선택하기