평균, 중앙값, 최빈값으로 대체하기
열의 자료형에 맞게 합리적으로 값을 채웁니다
평균, 중앙값, 최빈값으로 대체하기은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
통계값으로 채우기
무작위 숫자를 만들어 내는 대신 열 자체에서 얻은 요약값으로 빈칸을 채울 수 있습니다. 이러한 신중한 방법을 대치라고 합니다. 🧮
평균으로 채우기
숫자 데이터에서는 열의 평균인 mean을 사용하는 것이 가장 간단한 선택입니다. 빈칸이 적다면 전체 합계를 대체로 유지할 수 있습니다.
df['age'].fillna(df['age'].mean())평균이 오해를 불러일으키는 경우
평균은 취약합니다. 아주 큰 값 몇 개만 있어도 평균이 중심에서 크게 벗어납니다. 치우친 데이터에서는 평균 대치가 모든 결측치를 비현실적인 값 쪽으로 끌어갈 수 있습니다.
중앙값으로 채우기
중앙값은 가운데에 있는 값이며, 극단적인 이상치의 영향을 거의 받지 않습니다. 치우친 숫자 열에서는 대개 중앙값으로 채우는 편이 더 안전합니다.
df['income'].fillna(df['income'].median())평균일까요, 중앙값일까요?
간단한 기준은 다음과 같습니다. 열에 이상치나 긴 꼬리가 있으면 중앙값을 사용하고, 값이 대체로 대칭적으로 분포할 때만 평균을 사용하십시오.
범주형 데이터에는 최빈값 사용하기
텍스트 열과 범주형 열에는 평균이 없습니다. 이런 열은 가장 자주 나타나는 값인 최빈값으로 채우는 것이 가장 가능성 높은 대안이므로 최빈값을 사용하십시오.
top = df['city'].mode()[0]
df['city'].fillna(top)mode가 Series를 반환하는 이유
가장 흔한 값이 여러 개일 수 있으므로 mode()는 모든 최빈값을 담은 Series를 반환합니다. 값 하나만 필요하다면 인덱스 0의 값을 선택하십시오.
df['city'].mode()[0]열 유형별로 채우기
가장 좋은 방법은 각 열의 유형에 맞춰 대치하는 것입니다. 치우친 숫자에는 중앙값, 대칭적인 숫자에는 평균, 범주형 데이터에는 최빈값을 사용하십시오.
앞으로 채우기와 뒤로 채우기
시계열처럼 순서가 있는 데이터에서는 ffill로 마지막으로 알려진 값을 앞으로 전달하거나, bfill로 다음 값을 뒤로 가져올 수 있습니다.
df['temp'].ffill()숨겨진 비용
대치할 때마다 열의 자연스러운 분산이 줄어듭니다. 채워진 값이 한 지점에 몰리기 때문입니다. 이는 분산을 낮추므로 반드시 기억해 두십시오.
채운 값을 표시하기
숙련된 사용자는 대치된 행을 표시하는 불리언 열을 추가합니다. 이 표시를 활용하면 이후 분석에서 어떤 값이 실제 값이고 어떤 값이 추정된 값인지 알 수 있습니다.
df['age_filled'] = df['age'].isna()빠른 확인
소수의 백만장자 때문에 소득 열이 심하게 치우쳐 있습니다. 어떤 대치 방법이 가장 적절할까요?
복습: 똑똑하게 채우기
이제 열의 유형에 따라 평균, 중앙값 또는 최빈값으로 대치하고, 순서가 있는 데이터에는 ffill을 사용하며, 채운 행을 표시해 어떤 값도 숨겨지지 않게 할 수 있습니다.
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“평균, 중앙값, 최빈값으로 대체하기” 강의는 무료인가요?
네 — “평균, 중앙값, 최빈값으로 대체하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“평균, 중앙값, 최빈값으로 대체하기”에서 뭘 배우나요?
열의 자료형에 맞게 합리적으로 값을 채웁니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“평균, 중앙값, 최빈값으로 대체하기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 테이블에 숨은 NaNs 찾기
- 삭제와 채우기 중 현명하게 선택하기
- 평균, 중앙값, 최빈값으로 대체하기
- 자료형과 중복 행 수정하기