불균형 데이터에서 정확도가 속이는 이유
희소 클래스의 함정을 알아봅니다
불균형 데이터에서 정확도가 속이는 이유은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
편안하지만 잘못된 믿음
정확도는 당연한 점수처럼 느껴집니다. 얼마나 많은 예측을 맞혔는지를 나타내기 때문입니다. 데이터가 균형 잡혀 있을 때는 잘 작동하지만, 불균형 데이터에서는 조용히 무너집니다.
불균형이란 무엇인가
한 클래스가 다른 클래스보다 훨씬 드물면 데이터셋이 불균형하다고 합니다. 사기, 질병, 이탈을 생각해 보십시오. 관심 있는 사건이 바로 드문 사건입니다.
99%의 함정
사기 거래 1건당 정상 거래가 99건 있다고 가정해 보십시오. 매번 정상이라고만 외치는 모델도 놀랍게 정확도 99%를 얻습니다. ⚠️
하지만 아무것도 잡아내지 못했습니다
그 99% 모델은 사기를 단 한 건도 표시하지 않았습니다. 숫자만 보면 최고 수준처럼 보이지만, 정작 맡겨진 일을 수행하는 데는 쓸모가 없습니다.
정확도는 희소 클래스를 숨깁니다
정확도는 모든 행을 평균 내므로, 압도적으로 많은 다수 클래스가 소수 클래스를 묻어 버립니다. 희소 클래스에서 완전히 실패해도 점수는 거의 변하지 않을 수 있습니다.
반드시 넘어야 할 기준선
항상 다수 클래스 기준선과 비교하십시오. 가장 흔한 레이블만 예측하는 방식입니다. 모델이 이를 이기지 못한다면 유용한 것을 학습하지 못한 것입니다.
빠른 현실 점검
축하하기 전에 한 가지를 물어보십시오. 전체 행 중 다수 클래스는 얼마나 차지합니까? 그 비율이 아무것도 하지 않는 모델이 공짜로 얻는 정확도입니다.
value_counts로 확인하기
한 줄의 코드로 레이블이 얼마나 한쪽으로 치우쳤는지 알 수 있습니다. 한 값이 나머지보다 압도적으로 많다면 정확도만으로는 잘못 판단하게 됩니다.
counts = y.value_counts(normalize=True)
print(counts) # share of each class실제 비용이 발생하는 곳
희소 클래스를 놓치는 일은 대개 가장 큰 피해를 줍니다. 발견하지 못한 종양이나 사기는 큰 비용으로 이어집니다. 정확도는 모든 실수를 똑같이 취급하지만 현실은 그렇지 않습니다.
하나의 숫자 너머 보기
해결책은 아직 마법 같은 지표가 아니라 사고방식의 전환입니다. 하나의 숫자를 무조건 믿지 말고 소수 클래스가 실제로 어떤 성과를 냈는지 확인하기 시작하십시오.
더 나은 지표를 위한 준비
곧 희소 사건에 맞게 설계된 정밀도, 재현율, PR 곡선을 배우게 됩니다. 먼저 여기서 정확도를 불신하게 된 이유를 확실히 이해하십시오.
빠른 확인
불균형 데이터에서 정확도가 잘못된 판단을 유도할 수 있는 이유는 무엇입니까?
복습
불균형 데이터에서는 정확도가 희소 클래스를 무시하는 게으른 모델을 좋게 보이게 합니다. 다수 클래스 기준선을 넘어서고 소수 클래스가 실제로 어떤 성과를 냈는지 평가하십시오. 🎯
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“불균형 데이터에서 정확도가 속이는 이유” 강의는 무료인가요?
네 — “불균형 데이터에서 정확도가 속이는 이유” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“불균형 데이터에서 정확도가 속이는 이유”에서 뭘 배우나요?
희소 클래스의 함정을 알아봅니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“불균형 데이터에서 정확도가 속이는 이유” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 불균형 데이터에서 정확도가 속이는 이유
- 리샘플링: SMOTE와 언더샘플링
- 클래스 가중치와 임계값
- 희소 사건에 맞는 평가지표 선택하기