GroupBy와 함께 apply() 사용하기
groupby().apply()에 여러 행을 처리하는 함수를 전달해 agg()로 표현할 수 없는 복잡한 그룹 수준 요약을 계산합니다.
GroupBy와 함께 apply() 사용하기은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
GroupBy에 apply()가 필요한 이유
내장 agg() 메서드는 sum, mean, count와 같은 단순한 집계를 처리하며, 그룹마다 하나의 스칼라 결과를 반환합니다. 하지만 일부 그룹 단위 계산에서는 단일 열이 아니라 해당 그룹의 전체 하위 DataFrame을 확인해야 합니다. groupby().apply(func)는 전체 그룹 DataFrame을 함수에 전달하고 결과를 모으므로, agg()로는 표현할 수 없는 복잡한 요약을 만들 수 있습니다.
import pandas as pd
import numpy as np
df = pd.DataFrame({
'region': ['North', 'North', 'South', 'South', 'North'],
'product': ['A', 'B', 'A', 'A', 'C'],
'revenue': [100, 250, 180, 90, 300]
})
print(df)그룹별 스칼라 반환
groupby().apply()에 전달한 함수가 스칼라를 반환하면, 결과는 그룹 키를 인덱스로 사용하는 Series가 되며 agg()가 생성하는 결과와 동일합니다. 이 형식은 여러 열의 로직이 필요한 스칼라를 계산할 때 유용합니다. 예를 들어 단일 agg() 열 사양으로는 표현할 수 없는, 그룹 내 총매출 대비 최고 상품 매출의 비율을 계산할 수 있습니다.
def top_product_share(group):
top = group['revenue'].max()
total = group['revenue'].sum()
return top / total
share = df.groupby('region').apply(top_product_share)
print(share)그룹별 Series 반환
함수가 pd.Series를 반환하면 결과에는 MultiIndex가 사용됩니다. 바깥쪽 수준은 그룹 키이고 안쪽 수준은 Series의 인덱스입니다. 이 방식은 한 번의 apply 호출로 그룹마다 여러 통계를 계산할 때 유용하며, 각 그룹에 여러 지표 행이 포함된 요약 표를 생성할 수 있습니다.
def group_stats(group):
return pd.Series({
'total': group['revenue'].sum(),
'top_product': group.loc[group['revenue'].idxmax(), 'product'],
'n_products': group['product'].nunique()
})
result = df.groupby('region').apply(group_stats)
print(result)그룹별 DataFrame 반환
함수가 pd.DataFrame을 반환하면 groupby().apply()는 모든 하위 DataFrame을 세로 방향으로 연결합니다. 이는 가장 강력한 형식으로, 각 그룹 내의 행을 필터링하거나 변환한 뒤 수정된 하위 집합을 반환할 수 있습니다. 예를 들어 각 지역에서 매출이 가장 높은 상위 2개 상품만 남길 수 있습니다.
def top2_per_region(group):
return group.nlargest(2, 'revenue')
top2 = df.groupby('region').apply(top2_per_region)
print(top2.reset_index(drop=True))그룹 내 Z 점수 계산
groupby().apply()의 일반적인 활용 사례는 그룹 내 표준화입니다. 모든 주문을 기준으로 매출을 정규화하면 지역이 섞이지만, 각 지역 안에서 매출의 Z 점수를 계산할 수 있습니다. North에서 Z 점수가 2라는 것은 "North 평균보다 표준편차 2만큼 높다"는 뜻으로, 전체 평균보다 표준편차 2만큼 높다는 기준보다 더 의미 있는 비교 기준입니다.
def within_group_zscore(group):
mean = group['revenue'].mean()
std = group['revenue'].std()
group = group.copy()
group['revenue_z'] = (group['revenue'] - mean) / std
return group
df_z = df.groupby('region').apply(within_group_zscore).reset_index(drop=True)
print(df_z)사용자 지정 집계: Winsorised 평균
Winsorised 평균은 평균을 계산하기 전에 극단값을 제한하므로, 치우친 분포에서 단순 평균보다 더 안정적입니다. 이 사용자 지정 집계는 표준 agg() 함수로는 표현할 수 없지만 groupby().apply()를 사용하면 쉽게 구현할 수 있습니다. 각 그룹에서 5번째 백분위수와 95번째 백분위수 기준으로 값을 제한한 다음, 제한된 값의 평균을 계산합니다.
def winsorised_mean(group, lower_pct=0.05, upper_pct=0.95):
col = group['revenue']
lo = col.quantile(lower_pct)
hi = col.quantile(upper_pct)
clipped = col.clip(lo, hi)
return clipped.mean()
wins_mean = df.groupby('region').apply(winsorised_mean)
print('Winsorised mean by region:')
print(wins_mean)그룹별 사용자 지정 이동 창
전체 DataFrame에 적용한 이동 창은 그룹 경계를 무시합니다. 두 상품의 시계열이 번갈아 나타나는 데이터에서 3행 이동 평균을 계산하면 창이 상품 경계를 잘못 넘나들게 됩니다. groupby().apply() 내부에 이동 창을 적용하면 각 이동 계산이 해당 그룹 안에 머무르게 할 수 있습니다. 예를 들어 지역별 3개월 이동 매출 평균을 계산할 수 있습니다.
def group_rolling_mean(group, window=3):
group = group.sort_values('order_date').copy()
group['rolling_revenue'] = group['revenue'].rolling(window, min_periods=1).mean()
return group
# df_ts has order_date column
# df_rolled = df_ts.groupby('region').apply(group_rolling_mean).reset_index(drop=True)
print('Rolling window per group applied inside apply()')include_groups 매개변수(Pandas 2.2 이상)
Pandas 2.2 이상에서는 함수가 받는 DataFrame에 groupby 키가 포함되어 있으면 groupby().apply()가 FutureWarning을 발생시킵니다. 함수에 전달되는 하위 DataFrame에서 groupby 열을 제외하려면 include_groups=False를 전달합니다. 이렇게 하면 경고를 피할 수 있고 함수 본문에서 키 열을 실수로 연산하는 것도 방지할 수 있습니다.
def revenue_only(group):
# group does not include 'region' column when include_groups=False
return group['revenue'].sum()
# result = df.groupby('region').apply(revenue_only, include_groups=False)
print('include_groups=False avoids FutureWarning in Pandas 2.2+')apply() 결과를 reset_index와 결합하기
groupby().apply()가 그룹마다 DataFrame을 반환하면 결과에는 그룹 키를 바깥쪽 수준으로 포함하는 MultiIndex가 사용됩니다. reset_index(drop=True)를 사용하면 인덱스를 일반 정수 범위로 평탄화할 수 있습니다. 또는 reset_index(level=0)을 사용해 그룹 키를 열로 승격하면 출력에서 명시적으로 확인할 수 있습니다.
result = df.groupby('region').apply(top2_per_region)
print('With MultiIndex:')
print(result.head())
print('\nAfter reset_index:')
print(result.reset_index(drop=True))apply()보다 transform()을 우선할 경우
groupby().apply()는 입력과 다른 형태의 결과를 반환하는 복잡한 그룹 단위 계산에 사용합니다. groupby().transform()은 원래 인덱스에 맞춰 새 열을 추가하는 계산에 사용합니다. 예를 들어 정규화를 위해 그룹 평균을 각 행에 다시 전달할 때 사용할 수 있습니다. 결과를 원래 DataFrame과 같은 형태로 만들어야 한다면 transform을 사용하고, 결과 형태가 달라진다면 apply를 사용합니다.
# transform: adds group mean back to each row
df['group_mean_revenue'] = df.groupby('region')['revenue'].transform('mean')
# apply: computes one scalar per group
group_totals = df.groupby('region')['revenue'].apply(sum)
print(df[['region', 'revenue', 'group_mean_revenue']])성능 팁: 단순한 집계에는 apply() 사용하지 않기
groupby().apply()는 각 그룹마다 완전한 Python 객체를 생성하므로 단순한 연산에서는 groupby().agg()보다 훨씬 느립니다. 합계, 평균, 개수를 계산할 때는 항상 agg()를 사용합니다. 전체 그룹 DataFrame이 실제로 필요한 경우, 즉 여러 열에 대한 조건부 로직이나 사용자 지정 통계 또는 그룹 내 필터링이 필요한 경우에만 apply()를 사용하십시오.
# SLOW: apply for simple sum
slow = df.groupby('region').apply(lambda g: g['revenue'].sum())
# FAST: native agg
fast = df.groupby('region')['revenue'].sum()
print('Both produce the same result:')
print(fast.equals(slow))빠른 확인
이번 레슨에서 배운 데이터 분석 개념을 제대로 이해했는지 확인해 보십시오.
레슨 복습
이번 레슨에서는 groupby().apply()에서 스칼라, Series, DataFrame을 반환하는 방법, 그룹 내 Z 점수와 사용자 지정 강건 통계를 계산하는 방법, 그룹 단위 연산에 apply(), agg(), transform() 중 무엇을 선택할지 판단하는 방법을 배웠습니다. 다음으로는 Series와 DataFrames에서 요소별 연산을 수행하는 map()과 applymap()을 살펴보겠습니다.
자주 묻는 질문
“GroupBy와 함께 apply() 사용하기” 강의는 무료인가요?
네 — “GroupBy와 함께 apply() 사용하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“GroupBy와 함께 apply() 사용하기”에서 뭘 배우나요?
groupby().apply()에 여러 행을 처리하는 함수를 전달해 agg()로 표현할 수 없는 복잡한 그룹 수준 요약을 계산합니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“GroupBy와 함께 apply() 사용하기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 열과 행에 apply() 적용하기
- GroupBy와 함께 apply() 사용하기
- 요소별 연산에 map()과 applymap() 사용하기
- pipe()를 사용한 메서드 연결