스키마 검증과 단언
모든 pipeline의 시작 단계에서 실행되는 열 범위, null이 아닌 값 제약, 고유 키에 대한 단언 검사를 작성합니다.
스키마 검증과 단언은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
스키마 검증이 중요한 이유
데이터 pipeline은 사람의 검토 없이 새로운 데이터를 자동으로 처리하는 경우가 많습니다. 입력 file의 스키마가 변경되면(열 이름이 바뀌거나 날짜 형식이 달라지거나 새 범주가 추가되는 경우) pipeline은 잘못된 output을 조용히 생성하기보다 명확하게 실패해야 합니다. 검증문을 사용한 스키마 검증은 데이터 생산자와 데이터 소비자 사이의 계약을 강제하는 메커니즘으로, 가능한 한 이른 시점에 문제를 발견합니다.
import pandas as pd
import numpy as np
df = pd.read_parquet('sales_treated.parquet')
print('Loaded:', df.shape)
print(df.dtypes)필수 열 확인
가장 기본적인 검증은 필요한 모든 열이 있는지 확인하는 것입니다. 예상되는 열 집합을 config에 저장하고, 이것이 실제 열의 부분집합인지 검증문으로 확인하십시오. 이 검사는 pipeline 시작 시 열 이름 변경과 열 삭제를 즉시 발견합니다. 따라서 이후 코드가 없는 열에 접근하여 pipeline 깊은 곳에서 혼란스러운 KeyError를 발생시키는 일을 막을 수 있습니다.
REQUIRED_COLUMNS = {'order_id', 'order_date', 'customer_id',
'product', 'category', 'quantity', 'unit_price', 'revenue'}
missing = REQUIRED_COLUMNS - set(df.columns)
assert not missing, f'Missing required columns: {missing}'
print('All required columns present.')열 데이터 형식 검증
필수 열을 확인한 다음에는 데이터 형식을 검증하십시오. object로 로드된 날짜 열은 pd.to_datetime()이 호출되지 않았다는 뜻입니다. int64가 아닌 float으로 저장된 ID 열은 대개 NaN 값 때문에 정수로 저장되지 못했다는 뜻입니다. 가장 중요한 열에는 assert df['col'].dtype == expected_type와 같은 형식 검증문을 작성하십시오.
assert pd.api.types.is_datetime64_any_dtype(df['order_date']), \
'order_date must be datetime'
assert pd.api.types.is_numeric_dtype(df['revenue']), \
'revenue must be numeric'
assert df['order_id'].dtype == object or pd.api.types.is_integer_dtype(df['order_id']), \
'order_id must be string or int'
print('Dtype checks passed.')널이 아닌 값 제약 조건
order_id, order_date, revenue와 같은 핵심 열에는 null 값이 없어야 합니다. 각 열에 대해 df['col'].notna().all()을 검증하십시오. 검증문 메시지를 실제 문제 해결에 유용하게 만들려면 null 값의 개수를 포함하십시오. 그러면 pipeline 운영자는 검증이 실패했다는 사실뿐 아니라 문제의 규모도 알 수 있습니다.
NOT_NULL_COLS = ['order_id', 'order_date', 'revenue', 'customer_id']
for col in NOT_NULL_COLS:
null_count = df[col].isna().sum()
assert null_count == 0, f'{col} has {null_count} null values'
print('Non-null checks passed.')숫자 열의 범위 확인
숫자 열에는 비즈니스상 유효한 범위가 있는 경우가 많습니다. 매출은 음수가 아니어야 합니다. 수량은 양의 정수여야 합니다. 단가는 0보다 커야 합니다. 이러한 제약 조건을 명시적으로 검증하십시오. 음수 매출 행이 통과하면 이후의 모든 집계에서 오류 없이 합계가 과소 계산됩니다. 범위 검사는 데이터 입력 오류와 상위 시스템의 버그를 조기에 발견합니다.
assert (df['revenue'] >= 0).all(), 'Negative revenue found'
assert (df['quantity'] > 0).all() or df['is_return'].any(), \
'Non-positive quantity without return flag'
assert (df['unit_price'] > 0).all(), 'Zero or negative unit price found'
print('Range checks passed.')고유 키 검증
중복 제거가 끝나면 order_id는 고유해야 합니다. df['order_id'].is_unique를 검증하여 이 불변 조건이 모든 pipeline 실행에서 유지되는지 확인하십시오. 중복 제거 후에도 고유성 위반이 발생한다면 중복 제거 로직에 버그가 있거나, 주 데이터세트에 병합하기 전에 정제되지 않은 새로운 데이터 원본이 추가되었음을 의미합니다.
assert df['order_id'].is_unique, \
f'order_id not unique: {df.duplicated(subset=["order_id"]).sum()} duplicates'
print('Uniqueness check passed.')범주형 값 검증
region이나 category처럼 유효한 값의 집합이 유한한 열에서는 모든 값이 허용된 집합에 포함되는지 검증하십시오. 이를 통해 시스템 이전이나 상위 데이터 입력 변경 후에 나타나는 비정상 값을 발견할 수 있습니다. 유효한 집합은 pipeline config에 정의하여 비즈니스가 새로운 지역으로 확장될 때 쉽게 업데이트할 수 있도록 하십시오.
VALID_REGIONS = {'North', 'South', 'East', 'West', 'Central'}
VALID_CATEGORIES = {'electronics', 'apparel', 'home', 'sports', 'beauty', 'other'}
assert df['region'].isin(VALID_REGIONS).all(), \
f'Invalid regions: {df[~df["region"].isin(VALID_REGIONS)]["region"].unique()}'
assert df['category'].isin(VALID_CATEGORIES).all(), \
'Invalid categories found'
print('Categorical checks passed.')날짜 범위 검증
모든 날짜가 데이터세트에 대해 예상되는 기간에 속하는지 검증하십시오. 미래 날짜의 주문은 불가능하며, 회사 설립일보다 이전 날짜의 주문은 손상된 레코드를 의미합니다. config에 MIN_DATE와 MAX_DATE를 정의하고 열이 해당 범위 안에 있는지 검증하십시오. 또한 잘못된 timestamp 변환으로 생기는 Unix epoch 0 날짜(1970-01-01)도 발견할 수 있습니다.
MIN_DATE = pd.Timestamp('2020-01-01')
MAX_DATE = pd.Timestamp('today')
assert (df['order_date'] >= MIN_DATE).all(), 'Date before minimum found'
assert (df['order_date'] <= MAX_DATE).all(), 'Future date found'
print(f'Date range: {df["order_date"].min()} to {df["order_date"].max()}')행 수 안전장치
이전 pipeline 실행과 비교했을 때 행 수가 갑자기 변하면 상위 시스템에 문제가 있다는 강력한 신호입니다. 이전 실행의 행 수를 config file에 저장하고, 새 행 수가 허용 오차 범위 안에 있는지 검증하십시오. 예를 들어 과거 행 수의 ±20% 이내인지 확인할 수 있습니다. 실행 간에 데이터세트의 행이 50% 줄었다면 거의 확실히 데이터 내보내기가 중단된 것입니다.
EXPECTED_MIN_ROWS = 5000
EXPECTED_MAX_ROWS = 200000
assert EXPECTED_MIN_ROWS <= len(df) <= EXPECTED_MAX_ROWS, \
f'Row count {len(df)} outside expected range [{EXPECTED_MIN_ROWS}, {EXPECTED_MAX_ROWS}]'
print(f'Row count check passed: {len(df)} rows')validate 함수에 검사 묶기
모든 검증문을 하나의 validate(df) 함수에 모아 각 pipeline 단계의 시작 부분에서 호출할 수 있도록 하십시오. 각 검사는 실패할 경우 설명이 포함된 메시지와 함께 AssertionError를 발생시킵니다. 이 방식은 pipeline을 자체적으로 설명 가능하게 만듭니다. 즉, 검증 함수가 해당 단계의 DataFrame에 대한 기계 판독 가능한 스키마 계약이 됩니다.
def validate_sales_df(df):
assert not (REQUIRED_COLUMNS - set(df.columns)), 'Missing columns'
assert df['order_id'].is_unique, 'Duplicate order IDs'
assert (df['revenue'] >= 0).all(), 'Negative revenue'
assert df['region'].isin(VALID_REGIONS).all(), 'Invalid region'
print(f'Validation passed: {len(df)} rows, {len(df.columns)} columns')
validate_sales_df(df)검증 실패를 정상적으로 기록하기
운영 pipeline에서는 개발 중 하드 assert 충돌을 허용할 수 있지만, 예약 작업에서는 바람직하지 않습니다. 단순한 검증문 대신 try/except AssertionError 블록을 사용하여 오류 메시지를 기록하고, 종료하기 전에 선택적으로 알림을 보내십시오. 이렇게 하면 모니터링 시스템이 처리되지 않은 예외 추적 정보만이 아니라 실패 원인도 수집할 수 있습니다.
import logging
logging.basicConfig(level=logging.INFO)
def validate_with_logging(df):
checks = [
(lambda d: d['order_id'].is_unique, 'Duplicate order IDs'),
(lambda d: (d['revenue'] >= 0).all(), 'Negative revenue found'),
]
for check_fn, msg in checks:
try:
assert check_fn(df), msg
except AssertionError as e:
logging.error(f'VALIDATION FAILED: {e}')
raise
validate_with_logging(df)
print('All checks passed.')빠른 확인
이 lesson에서 배운 데이터 분석 개념을 이해했는지 확인해 보십시오.
lesson 요약
이 lesson에서는 필수 열, dtype, 널이 아닌 값 제약 조건, 범위의 유효성을 검증하는 방법, 고유 키, 범주형 값, 날짜 범위를 확인하는 방법, 모든 검사를 logging 기능이 포함된 재사용 가능한 validate() 함수로 묶는 방법을 배웠습니다. 다음으로는 열과 행에 apply()를 사용한 사용자 지정 집계를 살펴봅니다.
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“스키마 검증과 단언” 강의는 무료인가요?
네 — “스키마 검증과 단언” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“스키마 검증과 단언”에서 뭘 배우나요?
모든 pipeline의 시작 단계에서 실행되는 열 범위, null이 아닌 값 제약, 고유 키에 대한 단언 검사를 작성합니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“스키마 검증과 단언” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 중복 감지와 제거
- 이상값 감지와 처리
- 일관되지 않은 범주 표준화
- 스키마 검증과 단언