데이터 정제와 전처리
결측 데이터를 처리하고 중복을 제거하며 분석을 위해 원시 데이터를 전처리하는 방법을 이해합니다
데이터 정제와 전처리은(는) CoddyKit의 무료 Python Academy 강의입니다. 이것은 5개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Python Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Python Academy 강의에는 총 5개의 강의가 포함되어 있습니다.
데이터 정제 개요
데이터 정제와 전처리
원시 데이터는 정리가 제대로 되어 있지 않은 경우가 많으므로 분석하기 전에 정제와 전처리가 필요합니다. 이러한 단계는 분석의 품질과 정확성을 보장하는 데 매우 중요합니다.
이 레슨에서는 결측 데이터를 처리하고 중복을 제거하며 분석을 위해 데이터를 전처리하는 기법을 배웁니다.

데이터 정제란 무엇인가요?
데이터 정제란 무엇인가요?
데이터 정제는 데이터셋의 오류를 식별하고 수정하는 작업입니다. 일반적인 작업은 다음과 같습니다.
- 결측값 처리
- 중복 제거
- 형식 표준화
결측 데이터 처리
결측 데이터 처리
결측 데이터은 다양한 이유로 발생할 수 있습니다. 다음과 같은 방법으로 처리할 수 있습니다.
- 누락된 값을 기본값이나 mean/중앙값으로 채웁니다.
- 결측값이 너무 많은 행이나 열을 삭제합니다.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)중복 제거
중복 제거
중복 데이터는 분석을 왜곡할 수 있습니다. 중복을 제거하려면 Pandas를 사용합니다.
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)데이터 표준화
데이터 표준화
데이터 표준화는 일관성을 보장합니다. 예를 들어 날짜 형식이나 텍스트 대소문자를 표준화할 수 있습니다.
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)데이터 변환
데이터 변환
스케일링과 인코딩 같은 변환은 전처리의 일부입니다.
- 스케일링: 수치 값을 표준화합니다.
- 인코딩: 범주형 데이터를 수치 형식으로 변환합니다.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)데이터 스케일링
데이터 스케일링
데이터 스케일링은 수치형 데이터를 동일한 척도로 맞추며, 이는 머신 러닝 알고리즘에 필수적입니다:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)데이터 검증
데이터 검증
검증을 통해 데이터가 품질 기준을 충족하는지 확인합니다. 예를 들어 이상치나 유효하지 않은 값이 있는지 확인합니다:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)데이터 정제에서 흔히 하는 실수
데이터 정제에서 흔히 하는 실수
다음과 같은 실수를 피해야 합니다:
- 결측 데이터를 무시하여 분석 결과가 부정확해지는 경우
- 형식을 표준화하지 않아 일관성이 떨어지는 경우
- 검증을 간과하여 후속 작업에서 오류가 발생하는 경우
무엇을 배웠나요?
무엇을 배웠나요?
이 단원에서 다음 내용을 배웠습니다:
- 결측 데이터를 처리하고 중복 데이터를 제거하는 방법
- 분석을 위해 데이터를 표준화하고 변환하며 스케일을 조정하는 방법
- 데이터 품질을 검증하고 이상치를 식별하는 방법
- 정확한 분석을 위해 데이터 정제가 중요한 이유
잘하셨습니다! 다음 주제로 넘어가겠습니다.

자주 묻는 질문
“데이터 정제와 전처리” 강의는 무료인가요?
네 — “데이터 정제와 전처리” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Python Academy 강의 전체를 잠금 해제할 수 있습니다. Python Academy 강의에는 총 5개의 강의가 포함되어 있습니다.
“데이터 정제와 전처리”에서 뭘 배우나요?
결측 데이터를 처리하고 중복을 제거하며 분석을 위해 원시 데이터를 전처리하는 방법을 이해합니다 브라우저에서 직접 실행하는 실습 코드로 Python Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Python Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Python Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 5개 중 4번째 강의입니다.
“데이터 정제와 전처리” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Python Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Python Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.