EDA 작업 흐름과 데이터 프로파일링
df.info(), df.describe(), 결측값 점검, 데이터 형식 확인, 고유값 개수 분석을 수행합니다.
EDA 작업 흐름과 데이터 프로파일링은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
탐색적 데이터 분석이란 무엇인가요?
탐색적 데이터 분석(EDA)은 모델링을 시작하기 전에 모든 데이터 세트에서 가장 먼저 수행하는 작업입니다. 데이터의 구조를 이해하고, 문제를 발견하며, 데이터에 대한 직관을 얻는 것이 목표입니다.
체계적인 EDA 첫 확인 체크리스트는 다음 질문에 답합니다. 데이터의 규모는 어느 정도인가요? 열의 자료형은 무엇인가요? 결측값은 어디에 있나요? 중복값이 있나요? 값은 어떻게 분포되어 있나요?
- 데이터 품질 문제를 조기에 발견합니다
- 정제가 필요한 특성을 결정합니다
- 나중에 검증할 가설을 세웁니다
데이터 불러오기
모든 작업은 DataFrame을 불러오고 head()와 shape로 빠르게 살펴보는 것에서 시작합니다.
shape는 (rows, columns) 튜플을 반환하므로, 작업 중인 데이터의 규모를 즉시 알 수 있습니다.
import pandas as pd
df = pd.read_csv("customers.csv")
print(df.shape) # (10000, 8)
print(df.head()) # first 5 rowsdf.info() — 자료형과 결측값이 아닌 개수
df.info()는 처음 실행할 명령어 중 가장 유용한 명령어입니다. 각 열의 이름, dtype, 결측값이 아닌 개수를 출력합니다.
수치형 열이 object로 표시된다면 문제가 있는 것입니다(불필요한 문자, 쉼표, 통화 기호 등). 열마다 결측값이 아닌 개수가 다르면 결측 데이터가 있다는 뜻입니다.
df.info()
# <class pandas.DataFrame>
# RangeIndex: 10000 entries
# age 9800 non-null float64
# city 10000 non-null object
# income 9500 non-null float64df.describe() — 수치 요약
df.describe()는 모든 수치형 열에 대해 개수, 평균, 표준편차, 최솟값, 사분위수(25/50/75%), 최댓값을 제공합니다.
이상 징후가 있는지 살펴보세요. 예를 들어 나이 열의 min이 -1이거나, max가 75번째 백분위수보다 크게 높거나(이상치), 평균이 중앙값에서 크게 벗어나 있다면(skew) 주의해야 합니다.
print(df.describe())
# Use include="all" to also summarize categorical columns
print(df.describe(include="all"))df.isnull().sum() — 결측값 세기
isnull()과 sum()을 연결하면 열별로 결측값을 셉니다. 전체 합계를 구하려면 .sum()을 한 번 더 추가하세요.
심각도를 판단하려면 백분율로 변환하세요. 결측값이 60%인 열은 삭제할 만할 수 있지만, 2%인 경우에는 쉽게 대치할 수 있습니다.
print(df.isnull().sum())
missing_pct = df.isnull().sum() / len(df) * 100
print(missing_pct.sort_values(ascending=False))df.duplicated().sum() — 중복 행 찾기
df.duplicated()는 이전 행과 완전히 동일한 행을 표시하는 불리언 Series를 반환합니다. 이 값을 합하면 중복 행의 개수를 셀 수 있습니다.
subset을 사용하면 주요 열로 중복 범위를 제한할 수 있습니다. id가 고유해야 할 때 유용합니다.
print(df.duplicated().sum()) # exact duplicate rows
print(df.duplicated(subset=["id"]).sum()) # duplicate ids
df = df.drop_duplicates()value_counts() — 범주별 빈도
value_counts()는 열에서 각 고유값이 몇 번 나타나는지 집계합니다. 범주형 데이터를 살펴볼 때 가장 먼저 사용하는 도구입니다.
원시 개수 대신 비율을 보려면 normalize=True를 사용하고, 결측값도 집계에 포함하려면 dropna=False를 사용하세요.
print(df["city"].value_counts())
print(df["city"].value_counts(normalize=True))
print(df["city"].value_counts(dropna=False))카디널리티 확인
카디널리티는 열에 있는 서로 다른 값의 개수이며, nunique()로 구합니다.
- 낮은 카디널리티(몇 개 안 되는 범주) → 원-핫 인코딩에 적합합니다.
- 높은 카디널리티(수천 개의 고유 문자열, 예: 사용자 ID) → 대개 현재 상태 그대로는 유용한 특성이 아닙니다.
for col in df.select_dtypes("object").columns:
print(col, "->", df[col].nunique(), "unique")상수 열과 ID와 유사한 열 찾기
프로파일링 중에는 다음 두 극단적인 경우를 확인할 필요가 있습니다.
- 상수 열(
nunique() == 1)은 아무 정보도 담고 있지 않으므로 삭제합니다. - ID와 유사한 열(
nunique() == len(df))은 행마다 고유하며 대부분의 모델에 유용한 정보를 제공하지 않습니다.
n = len(df)
for col in df.columns:
u = df[col].nunique()
if u == 1:
print(col, "is constant")
elif u == n:
print(col, "is ID-like")자료형과 메모리 사용량
df.dtypes를 확인하여 열이 올바르게 저장되어 있는지 검증하고, df.memory_usage(deep=True)로 메모리를 많이 사용하는 열을 찾으세요.
수치형 자료형을 더 작은 자료형으로 변환하고 카디널리티가 낮은 문자열을 category로 변환하면 대규모 데이터 세트에서 메모리 사용량을 크게 줄일 수 있습니다.
print(df.dtypes)
print(df.memory_usage(deep=True))
df["city"] = df["city"].astype("category")재사용 가능한 프로파일링 코드 조각
전체 체크리스트를 하나의 도우미 함수로 묶으면 새 데이터 세트를 만날 때마다 같은 방식으로 처음 살펴볼 수 있습니다.
어떤 DataFrame이든 불러오는 즉시 실행하면 규모, 자료형, 결측값, 중복값, 카디널리티를 바로 확인할 수 있습니다.
def profile(df):
print("Shape:", df.shape)
print(df.info())
print("Missing:\n", df.isnull().sum())
print("Dupes:", df.duplicated().sum())
for c in df.select_dtypes("object"):
print(c, df[c].nunique(), "unique")
profile(df)빠른 확인: 결측값
각 열에서 결측값이 차지하는 백분율을 구하려고 합니다.
복습: EDA 첫 확인 체크리스트
이제 모든 데이터 세트에 반복해서 적용할 수 있는 시작 절차를 갖추었습니다.
- 규모와 미리 보기를 확인하는
shape및head() - 자료형과 결측값이 아닌 개수를 확인하는
info() - 수치 요약과 이상치 단서를 확인하는
describe() - 결측값을 확인하는
isnull().sum() - 중복 행을 확인하는
duplicated().sum() - 범주별 빈도와 카디널리티를 확인하는
value_counts()및nunique()
다음에는 단변량 분석으로 개별 열을 자세히 살펴봅니다.
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 53
- 레슨
- 225
자주 묻는 질문
“EDA 작업 흐름과 데이터 프로파일링” 강의는 무료인가요?
네 — “EDA 작업 흐름과 데이터 프로파일링” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.
“EDA 작업 흐름과 데이터 프로파일링”에서 뭘 배우나요?
df.info(), df.describe(), 결측값 점검, 데이터 형식 확인, 고유값 개수 분석을 수행합니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“EDA 작업 흐름과 데이터 프로파일링” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- EDA 작업 흐름과 데이터 프로파일링
- 단변량 분석
- 이변량 및 다변량 분석
- 특성 분포 및 목표값 분석