왼쪽 조인과 오른쪽 조인
왼쪽 조인과 오른쪽 조인을 수행해 한 테이블의 모든 행을 보존하면서 다른 테이블의 레코드를 대응시킵니다.
왼쪽 조인과 오른쪽 조인은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
비대칭 Join
Inner와 outer join은 두 DataFrames를 대칭적으로 처리합니다. 하지만 한 테이블의 모든 레코드를 보존하면서 다른 테이블의 데이터로 보강하고 싶은 경우가 많습니다. 이때 left join과 right join을 사용합니다. 이러한 비대칭 join은 분석에서 매우 흔합니다. 예를 들어 모든 거래를 유지하면서 가능한 경우 제품 이름을 추가하거나, 모든 사용자를 유지하면서 구매 이력이 있는 경우 마지막 구매 날짜를 추가할 수 있습니다.
Left Join: 왼쪽의 모든 행 보존하기
left join(how='left')은 왼쪽 DataFrame의 모든 행을 유지합니다. 오른쪽 DataFrame에서 일치하는 키를 찾은 행은 오른쪽 열이 일치하는 값으로 채워집니다. 일치하는 항목이 없는 행은 오른쪽 열이 NaN으로 채워집니다. 중복 키가 없다면 결과의 행 수는 항상 왼쪽 DataFrame의 행 수와 같습니다.
import pandas as pd
orders = pd.DataFrame({
'order_id': [1, 2, 3, 4],
'customer_id': [101, 102, 101, 999],
'amount': [250, 80, 320, 150]
})
customers = pd.DataFrame({
'customer_id': [101, 102, 103],
'name': ['Alice', 'Bob', 'Carol']
})
result = pd.merge(orders, customers, on='customer_id', how='left')
print(result)
# All 4 orders kept; order with customer_id=999 gets NaN for nameLeft Join 결과 구조
left join 후 오른쪽에서 일치하는 항목을 찾지 못한 왼쪽 DataFrame의 행은 오른쪽 테이블에서 가져온 모든 열에 NaN을 포함합니다. 오른쪽 테이블의 열에 불리언 필터를 적용하면 일치하지 않는 행을 식별할 수 있고, 일치하지 않은 왼쪽 행의 수도 셀 수 있습니다. 이는 유용한 데이터 품질 확인 방법입니다.
result = pd.merge(orders, customers, on='customer_id', how='left')
print(result)
# order_id customer_id amount name
# 0 1 101 250 Alice
# 1 2 102 80 Bob
# 2 3 101 320 Alice
# 3 4 999 150 NaN <- no matching customer
# Count unmatched
unmatched = result['name'].isna().sum()
print(f'{unmatched} orders have no customer record')Left Join을 사용하는 경우
left join은 왼쪽 DataFrame이 기본 테이블이고 오른쪽 테이블이 보조 정보일 때 적합합니다. 일반적인 예로는 사실 테이블에 차원 테이블을 결합해 정보를 보강하는 경우(주문 + 제품 이름), 선택적 메타데이터를 추가하는 경우(사용자 + 프로필 데이터), 조회에 실패하더라도 모든 레코드의 지표를 계산하는 경우가 있습니다. 대부분의 분석 코드에서는 right join보다 left join을 훨씬 더 많이 사용합니다.
# Realistic pattern: enrich all products with optional category data
products = pd.DataFrame({'sku': ['A1', 'B2', 'C3'], 'price': [10, 20, 15]})
categories = pd.DataFrame({'sku': ['A1', 'C3'], 'category': ['Tools', 'Home']})
# Keep all products; add category where available
enriched = pd.merge(products, categories, on='sku', how='left')
print(enriched)
# sku price category
# 0 A1 10 Tools
# 1 B2 20 NaN
# 2 C3 15 HomeRight Join: 오른쪽의 모든 행 보존하기
right join(how='right')은 left join의 반대입니다. 오른쪽 DataFrame의 모든 행을 유지하고, 일치하는 항목이 없는 경우 왼쪽 테이블의 열을 NaN으로 채웁니다. DataFrame 인자의 순서를 바꾸고 left join을 사용하면 항상 같은 결과를 얻을 수 있으므로, 독자가 이해하기 쉬운 left join보다 right join은 덜 사용됩니다.
# Right join: keep all customers, attach orders where they exist
result = pd.merge(orders, customers, on='customer_id', how='right')
print(result)
# All 3 customers appear; Carol (103) has NaN for order_id and amount
# Equivalent left join (swap arguments):
result2 = pd.merge(customers, orders, on='customer_id', how='left')
# Same data, just column order differs네 가지 Join 유형 비교
네 가지 join 유형은 일치하지 않는 쪽의 어떤 행을 보존하는지만 다릅니다. inner: 일치하는 행만 포함합니다. outer: 양쪽의 모든 행을 포함합니다. left: 왼쪽의 모든 행을 포함합니다. right: 오른쪽의 모든 행을 포함합니다. 일치하지 않는 항목이 있으면 없는 쪽의 열이 NaN으로 채워집니다. 레코드를 조용히 삭제하거나 중복하지 않으려면 올바른 유형을 선택하는 것이 매우 중요합니다.
# Summary table
# how='inner' : rows in BOTH tables
# how='left' : ALL left rows + matched right
# how='right' : matched left + ALL right rows
# how='outer' : ALL left rows + ALL right rows
# Test each
for how in ['inner', 'left', 'right', 'outer']:
r = pd.merge(orders, customers, on='customer_id', how=how)
print(f'{how}: {len(r)} rows')Left Join 결과의 NaN 채우기
left join 후 일치하지 않는 행의 오른쪽 테이블 열에는 NaN이 들어갑니다. 이러한 값을 적절한 기본값으로 채우고 싶은 경우가 많습니다. 예를 들어 누락된 범주에는 'Unknown'을, 누락된 개수에는 0을 사용할 수 있습니다. 결과에 fillna()를 사용하거나, join 이후 수행하는 산술 연산에 fill_value를 전달하십시오.
result = pd.merge(products, categories, on='sku', how='left')
result['category'] = result['category'].fillna('Uncategorised')
print(result)
# sku price category
# 0 A1 10 Tools
# 1 B2 20 Uncategorised
# 2 C3 15 HomeLeft Anti-Join: 일치하지 않는 행
how에서 직접 지원하지 않는 유용한 패턴으로 anti-join이 있습니다. 이는 오른쪽 테이블에서 일치하는 항목이 없는 왼쪽 행만 유지합니다. indicator=True를 사용한 left join을 수행한 다음 _merge == 'left_only'를 필터링하여 구현합니다. 고아 레코드, 참조 목록에 없는 새 항목, 원장에 누락된 거래를 찾는 데 적합합니다.
# Anti-join: orders with no matching customer record
result = pd.merge(orders, customers, on='customer_id',
how='left', indicator=True)
unmatched_orders = result[result['_merge'] == 'left_only'].drop(columns='_merge')
print(unmatched_orders)
# order_id customer_id amount name
# 3 4 999 150 NaNLeft Join으로 행 수 보존하기
오른쪽 DataFrame의 키가 고유하다면 left join은 왼쪽 테이블의 정확한 행 수를 보존합니다. 하지만 오른쪽 테이블에 중복 키 값이 있으면 inner join과 마찬가지로 left join에서 행이 증가합니다. 일대다 관계를 예상하는 경우 결과 행 수가 왼쪽 테이블의 행 수와 일치하는지 항상 확인하십시오.
# Right table has duplicate keys -> row multiplication
orders_small = pd.DataFrame({'id': [1, 2], 'amount': [100, 200]})
multi_customer = pd.DataFrame({
'id': [1, 1], # duplicate!
'contact': ['Alice', 'Alice2']
})
result = pd.merge(orders_small, multi_customer, on='id', how='left')
print(len(result)) # 3 rows! order 1 appears twice
print(result)실제 Left Join 패턴
완전한 실제 작업 흐름은 다음과 같습니다. 거래 기록으로 시작해 제품 카탈로그를 left join하여 이름을 가져온 다음, 고객 테이블을 left join하여 이름을 가져옵니다. 누락된 조회 결과는 기본값으로 채웁니다. left join을 연속해서 사용하면 제품이나 고객 레코드가 참조 테이블에 없더라도 모든 거래 행을 보존할 수 있습니다.
transactions = pd.DataFrame({
'txn_id': [1, 2, 3],
'cust_id': [10, 11, 99],
'prod_id': [20, 21, 20],
'total': [50, 30, 70]
})
custs = pd.DataFrame({'cust_id': [10, 11], 'cust_name': ['Alice', 'Bob']})
prods = pd.DataFrame({'prod_id': [20, 21], 'prod_name': ['Widget', 'Gadget']})
result = (
transactions
.merge(custs, on='cust_id', how='left')
.merge(prods, on='prod_id', how='left')
)
print(result)Left Join과 Inner Join 선택
left join과 inner join 중 무엇을 선택할지는 비즈니스 로직에 관한 결정입니다. 조회 결과가 없는 레코드도 유지할지, 아니면 조용히 삭제할지를 정해야 합니다. 누락된 조회 결과를 허용할 수 있고 모든 기본 레코드를 유지하려면 left join을 사용하십시오. 누락된 조회 결과가 해당 레코드가 유효하지 않다는 뜻이며 분석에서 제외해야 한다면 inner join을 사용하십시오. 어떤 방식을 선택했는지와 그 이유를 항상 문서화하십시오.
# Left join: keep all transactions (some may have no product name)
result_left = pd.merge(transactions, prods, on='prod_id', how='left')
print('Left join rows:', len(result_left)) # same as transactions
# Inner join: only transactions with known product
result_inner = pd.merge(transactions, prods, on='prod_id', how='inner')
print('Inner join rows:', len(result_inner)) # may be fewer빠른 확인
이번 레슨에서 배운 left 및 right join에 대한 이해도를 확인해 보십시오.
레슨 복습
이번 레슨에서는 left join이 왼쪽 DataFrame의 모든 행을 보존하고 일치하지 않는 경우 오른쪽 열을 NaN으로 채운다는 점, right join은 그 반대라는 점, indicator=True를 사용하는 anti-join 패턴으로 오른쪽에서 일치하는 항목이 없는 왼쪽 행을 찾을 수 있다는 점을 배웠습니다. 또한 left join과 inner join 중 무엇을 선택할지는 비즈니스 로직에 관한 결정입니다. 다음으로는 열이 아닌 인덱스를 기준으로 DataFrames를 join하는 방법을 살펴보겠습니다.
자주 묻는 질문
“왼쪽 조인과 오른쪽 조인” 강의는 무료인가요?
네 — “왼쪽 조인과 오른쪽 조인” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“왼쪽 조인과 오른쪽 조인”에서 뭘 배우나요?
왼쪽 조인과 오른쪽 조인을 수행해 한 테이블의 모든 행을 보존하면서 다른 테이블의 레코드를 대응시킵니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“왼쪽 조인과 오른쪽 조인” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.