중복 감지와 제거
duplicated()와 drop_duplicates()로 완전히 동일한 중복과 부분 중복을 찾고 어떤 중복 레코드를 남길지 결정합니다.
중복 감지와 제거은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
중복이 중요한 이유
중복 행은 오류 메시지 없이 집계값, 매출 합계, 평균을 부풀립니다. 500개의 중복 주문 레코드가 있는 판매 데이터셋은 해당 500건 주문 금액의 합계만큼 매출을 과대 산정합니다. 중복을 감지하고 제거하는 작업은 집계나 모델링을 수행하기 전에 해야 할 첫 번째 정제 단계 중 하나입니다. 이 한 가지 데이터 손상 원인에서 비롯된 오류가 이후 단계에서 누적되기 때문입니다.
import pandas as pd
df = pd.read_csv('orders.csv')
print('Shape before dedup:', df.shape)
print('Exact duplicates:', df.duplicated().sum())완전히 중복된 행 찾기
df.duplicated()는 이전 행과 완전히 동일한 모든 행에 True를 표시하는 불리언 Series를 반환합니다. 기본값인 keep='first'는 첫 번째 항목을 제외한 나머지 모든 항목을 표시합니다. keep=False를 전달하면 중복된 항목을 모두 표시하므로, 어떤 항목을 유지할지 결정하기 전에 중복 레코드의 모든 사본을 검사할 때 유용합니다.
# Mark only the second+ occurrences
partial_dups = df[df.duplicated(keep='first')]
print('Rows to remove:', len(partial_dups))
# Mark ALL copies of any duplicate
all_dups = df[df.duplicated(keep=False)]
print('Rows involved in duplicates:', len(all_dups))완전히 중복된 행 삭제하기
df.drop_duplicates()로 완전히 중복된 행을 제거합니다. 기본적으로 첫 번째 항목은 유지하고 나머지는 삭제합니다. 데이터에 타임스탬프가 있고 나중 행이 더 신뢰할 수 있는 것으로 간주된다면 keep='last'를 전달해 가장 최근 레코드를 유지합니다. 제거된 행 수가 예상과 일치하는지 확인하려면 삭제 전후의 행 개수를 항상 확인합니다.
df_clean = df.drop_duplicates(keep='first')
print('Rows removed:', len(df) - len(df_clean))
print('Shape after dedup:', df_clean.shape)부분 중복: 키 기준
행은 부분적으로 중복될 수 있습니다. 즉, 비즈니스 키(예: order_id)는 같지만, 상위 시스템의 버그로 동일한 레코드가 두 가지 버전으로 생성되어 다른 열의 값은 다를 수 있습니다. df.duplicated(subset=['order_id'])를 사용하면 키는 같지만 다른 열의 값이 다를 가능성이 있는 행을 찾을 수 있습니다. 이러한 행을 어떻게 조정할지 결정하기 전에 먼저 확인하십시오.
key_dups = df[df.duplicated(subset=['order_id'], keep=False)]
print('Orders with duplicate IDs:')
print(key_dups.sort_values('order_id').head(10))유지할 중복 행 선택
부분 중복이 있으면 어떤 레코드를 기준 레코드로 삼을지 결정해야 합니다. 일반적인 방법으로는 가장 최근 타임스탬프가 있는 행(가장 최근에 업데이트된 행)을 유지하거나, null이 아닌 값이 가장 많은 행을 유지하거나, 한 레코드에 수정 사항이 있는 경우 금액이 더 큰 행을 유지하는 방법이 있습니다. 우선순위를 정하는 기준으로 정렬한 다음, 중복을 제거하면서 첫 번째(또는 마지막) 항목을 유지하십시오.
# Keep the record with the latest update timestamp
df_sorted = df.sort_values('updated_at', ascending=False)
df_dedup = df_sorted.drop_duplicates(subset=['order_id'], keep='first')
print('Kept:', len(df_dedup), 'unique orders')유사 중복 탐지
유사 중복은 동일한 개체를 나타내지만 약간씩 다른 행입니다. 예를 들어 오타가 있는 동일한 고객 이름이나, 반올림 차이가 1센트인 동일한 거래가 이에 해당합니다. 정확히 일치하는 중복 탐지만으로는 이러한 행을 찾을 수 없습니다. 한 가지 방법은 키 열을 기준으로 그룹을 만들고 개수를 세는 것입니다. 고객 이름이 약간씩 변형되어 나타난다면 중복 제거 전에 .str.strip().str.lower()를 사용하여 정규화하십시오.
df['customer_normalized'] = df['customer_name'].str.strip().str.lower()
near_dups = df.groupby('customer_normalized').size().sort_values(ascending=False)
print(near_dups[near_dups > 1].head())GroupBy 집계로 중복 제거
중복 행을 단순히 삭제하는 대신 병합해야 한다면 groupby().agg()를 사용하십시오. 예를 들어 두 행이 동일한 주문을 나타내지만 한 행에는 배송 주소가 있고 다른 행에는 청구 주소가 있다면, 'first'(null이 아닌 값을 우선)로 집계하거나 중복된 행 전체에서 null이 아닌 값을 결합하는 사용자 지정 함수를 사용할 수 있습니다.
def coalesce(*args):
for a in args:
if pd.notna(a):
return a
return None
df_merged = df.groupby('order_id').agg(
customer=('customer_name', 'first'),
amount=('amount', 'max'),
date=('order_date', 'min')
).reset_index()
print(df_merged.head())행 순서의 영향 확인
drop_duplicates(keep='first')의 결과는 행 순서에 따라 달라집니다. DataFrame을 ORDER BY 절이 없는 데이터베이스 질의에서 불러왔다면 행 순서는 비결정적이므로 실행할 때마다 유지되는 레코드가 달라질 수 있습니다. 중복을 제거하기 전에 항상 안정적인 키(예: 기본 키 또는 타임스탬프)로 정렬하여 처리 결과를 결정적이고 재현 가능하게 만드십시오.
# Sort by primary key before deduplication for deterministic results
df = df.sort_values('order_id').reset_index(drop=True)
df_clean = df.drop_duplicates(subset=['order_id'], keep='first')
print('Deterministic dedup complete.')중복 제거 결과 검증
중복을 제거한 후에는 세 가지를 확인하여 결과를 검증하십시오. 정확히 일치하는 중복이 남아 있지 않은지(df_clean.duplicated().sum() == 0), 중복 비즈니스 키가 없는지(df_clean.duplicated(subset=['order_id']).sum() == 0), 그리고 예상 행 개수가 타당한지 확인합니다. 향후 데이터가 변경되어 정제 논리가 더 이상 유효하지 않을 때 즉시 실패하도록 이러한 검사를 단정문으로 작성하십시오.
assert df_clean.duplicated().sum() == 0, 'Exact duplicates remain'
assert df_clean.duplicated(subset=['order_id']).sum() == 0, 'Duplicate order IDs remain'
print('Deduplication verified. Rows:', len(df_clean))제거한 중복 기록
훌륭한 데이터 정제는 재현 가능하고 감사할 수 있어야 합니다. 제거한 행의 수, 중복 제거 키, 우선순위를 정하는 규칙을 정제 보고서 사전에 기록하십시오. 이 보고서를 정제된 데이터 파일과 함께 저장하면, 나중에 pipeline을 실행하는 사람이 코드를 다시 읽지 않고도 정제 결정을 확인할 수 있습니다. 데이터 정제 과정을 투명하게 관리하면 분석 결과에 대한 신뢰가 높아집니다.
cleaning_log = {
'original_rows': len(df),
'dedup_key': 'order_id',
'tiebreak': 'keep first by updated_at desc',
'rows_removed': len(df) - len(df_clean),
'clean_rows': len(df_clean)
}
for k, v in cleaning_log.items():
print(f'{k}: {v}')중복 제거된 데이터셋 저장
원본을 덮어쓰지 말고 중복이 제거된 DataFrame을 새 파일로 저장하십시오. 이렇게 하면 감사를 위해 원시 데이터를 보존할 수 있습니다. 파일 이름에는 _clean 또는 _deduped 접미사를 명확히 포함하고 실행 날짜도 넣어 여러 번의 정제 작업을 구분할 수 있게 하십시오. 이후 pipeline 단계에서 빠르게 다시 불러올 수 있도록 Parquet을 사용하십시오.
from datetime import date
output_path = f'orders_clean_{date.today()}.parquet'
df_clean.to_parquet(output_path, index=False)
print(f'Saved {len(df_clean)} rows to {output_path}')빠른 확인
이 단원에서 배운 데이터 분석 개념을 이해했는지 확인해 보십시오.
단원 복습
이 단원에서는 duplicated()와 drop_duplicates()로 정확히 일치하는 중복과 부분 중복을 탐지하는 방법, 정렬 및 집계 전략으로 유지할 중복 행을 선택하는 방법, 단정문으로 결과를 검증하고 정제 결정을 기록하는 방법을 배웠습니다. 다음으로는 이상치 탐지 및 처리 기법을 살펴보겠습니다.
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“중복 감지와 제거” 강의는 무료인가요?
네 — “중복 감지와 제거” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“중복 감지와 제거”에서 뭘 배우나요?
duplicated()와 drop_duplicates()로 완전히 동일한 중복과 부분 중복을 찾고 어떤 중복 레코드를 남길지 결정합니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“중복 감지와 제거” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 중복 감지와 제거
- 이상값 감지와 처리
- 일관되지 않은 범주 표준화
- 스키마 검증과 단언