Pandas & NumPy Academy · 강의

GroupBy 변환과 필터링

transform()으로 그룹 수준 통계를 열로 추가하고 filter()로 조건을 만족하는 그룹만 남깁니다.

레슨 4/413개 단계

GroupBy 변환과 필터링은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

집계를 넘어서

agg()를 익힌 다음에는 자연스럽게 이런 질문이 생깁니다. 모든 원본 행을 유지하면서 그룹 수준 통계량을 추가하려면 어떻게 해야 할까요? 또는 조건을 충족하는 그룹만 남기려면 어떻게 해야 할까요? 이때 사용하는 것이 transform()과 filter()입니다. 이 두 메서드를 사용하면 GroupBy를 단순한 요약을 넘어 특성 공학과 데이터 선택에도 활용할 수 있습니다.

transform() 이해하기

transform()은 각 그룹에 함수를 적용하고 원본 DataFrame과 같은 형태의 결과를 반환합니다. 즉, 원래 각 행에 하나씩 값이 대응됩니다. 그룹 결과는 해당 그룹에 속한 각 행에 브로드캐스트되어 다시 전달됩니다. 따라서 행 수를 바꾸지 않고 그룹 수준 통계량을 새 열로 추가하는 데 적합합니다.

import pandas as pd

df = pd.DataFrame({
    'dept':   ['Eng', 'HR', 'Eng', 'HR', 'Eng'],
    'salary': [90000, 60000, 95000, 62000, 88000]
})

# Add a column with each employee's department average salary
df['dept_avg'] = df.groupby('dept')['salary'].transform('mean')
print(df)
#    dept  salary    dept_avg
# 0   Eng   90000  91000.000
# 1    HR   60000  61000.000
# 2   Eng   95000  91000.000
# 3    HR   62000  61000.000
# 4   Eng   88000  91000.000

transform()의 일반적인 사용 사례

transform()의 일반적인 활용 사례로는 값을 정규화하기 위해 그룹 평균을 추가하는 것, 전체에서 각 행이 차지하는 비율을 계산하기 위해 그룹 합계를 추가하는 것, 그룹 내에서 각 구성원이 어느 위치에 있는지 비교하기 위해 그룹 순위를 추가하는 것이 있습니다. 이 모든 방법은 원래의 형태와 인덱스를 유지하므로 결과를 원본 열과 함께 즉시 사용할 수 있습니다.

# Percentage of each employee's salary within their department total
df['pct_of_dept'] = (
    df['salary'] / df.groupby('dept')['salary'].transform('sum') * 100
).round(1)
print(df[['dept', 'salary', 'pct_of_dept']])
# dept  salary  pct_of_dept
# Eng   90000        33.1
# HR    60000        49.2
# Eng   95000        34.9

transform()에서 사용자 지정 함수 사용하기

agg()와 마찬가지로 transform()은 문자열 이름뿐 아니라 모든 호출 가능한 함수도 허용합니다. 함수는 한 그룹의 값으로 이루어진 Series를 받아 같은 길이의 Series 또는 스칼라를 반환해야 합니다. 스칼라를 반환하면 해당 값이 브로드캐스트되며, 이것이 가장 일반적인 사용 사례입니다. 길이가 다른 Series를 반환하면 오류가 발생합니다.

# Z-score normalisation within each department
def zscore(s):
    return (s - s.mean()) / s.std()

df['salary_zscore'] = df.groupby('dept')['salary'].transform(zscore)
print(df[['dept', 'salary', 'salary_zscore']].round(2))
# dept  salary  salary_zscore
# Eng   90000          -0.51
# HR    60000          -0.71
# Eng   95000           1.03

agg()와 transform() 나란히 비교하기

핵심적인 차이는 다음과 같습니다. agg()는 행 수를 줄여 그룹마다 하나의 행을 만들고, transform()은 행 수를 유지하여 원래 각 행에 하나씩 대응하는 결과를 만듭니다. 요약표를 만들 때는 agg()를 사용하세요. 원본 DataFrame에 그룹 수준 정보를 새 특성 열로 추가할 때는 transform()을 사용하세요.

g = df.groupby('dept')['salary']

# agg: 2 rows (one per unique dept)
print(g.agg('mean'))
# dept
# Eng    91000.0
# HR     61000.0

# transform: 5 rows (one per original row)
print(g.transform('mean'))
# 0    91000.0
# 1    61000.0
# 2    91000.0
# 3    61000.0
# 4    91000.0

filter() 이해하기

filter()는 불리언 함수에 따라 전체 그룹을 유지하거나 버립니다. 한 그룹의 하위 DataFrame을 받아 True(그룹 유지) 또는 False(그룹 삭제)를 반환하는 함수를 전달합니다. 결과는 테스트를 통과한 그룹의 행만 포함하는 원본 DataFrame의 부분집합입니다.

df2 = pd.DataFrame({
    'dept':   ['Eng', 'HR', 'Eng', 'HR', 'Eng', 'Legal'],
    'salary': [90000, 60000, 95000, 62000, 88000, 70000]
})

# Keep only departments with at least 2 employees
big_depts = df2.groupby('dept').filter(lambda g: len(g) >= 2)
print(big_depts)
# dept, salary rows: Eng(3) and HR(2) remain; Legal(1) dropped

그룹 집계 값으로 필터링하기

filter()의 매우 일반적인 사용법은 집계 값이 기준을 충족하는 그룹만 유지하는 것입니다. 예를 들어 평균 급여가 목표치를 초과하는 부서만 남기거나, 총매출이 최소 기준보다 높은 제품 범주만 남길 수 있습니다. 이를 통해 추가 분석 전에 규모가 작은 그룹을 제거할 수 있습니다.

# Keep only departments where average salary > 80000
high_paying = df2.groupby('dept').filter(
    lambda g: g['salary'].mean() > 80000
)
print(high_paying)
#    dept  salary
# 0   Eng   90000
# 2   Eng   95000
# 4   Eng   88000
# (HR avg is 61000, filtered out)

transform()과 filter() 함께 사용하기

transform()과 filter()를 순서대로 적용하여 데이터에 정보를 추가한 다음 범위를 좁힐 수 있습니다. 먼저 filter()로 관련 없는 그룹을 제거하고, 그런 다음 필터링된 결과에 transform()을 사용해 그룹 수준 특성을 추가하세요. 이렇게 조합하면 모델링이나 보고서 작성에 바로 사용할 수 있는 깔끔하고 풍부한 특성의 부분집합을 만들 수 있습니다.

# Step 1: keep only large departments
filtered = df2.groupby('dept').filter(lambda g: len(g) >= 2)

# Step 2: add group mean salary to the filtered result
filtered = filtered.copy()
filtered['dept_avg'] = filtered.groupby('dept')['salary'].transform('mean')
print(filtered)

그룹 내 앞 방향 채우기에 transform() 사용하기

transform()은 숫자가 아닌 함수와 함께 사용할 때도 유용합니다. 한 가지 대표적인 패턴은 전체 데이터에 일괄적으로 채우기를 적용하는 대신, 그룹의 앞 방향 채우기나 중앙값을 사용해 그룹 내에서 결측값을 채우는 것입니다. 그룹 Series에 fillna()를 호출하는 람다를 전달하면 결과가 원본 DataFrame과 같은 인덱스를 갖습니다.

import numpy as np

df3 = pd.DataFrame({
    'dept':   ['Eng', 'Eng', 'HR', 'HR', 'Eng'],
    'salary': [90000, np.nan, 60000, np.nan, 88000]
})

# Fill NaN with the group mean
df3['salary_filled'] = df3.groupby('dept')['salary'].transform(
    lambda s: s.fillna(s.mean())
)
print(df3)

실전 패턴: 그룹 내 상대적 위치

강력한 비즈니스 활용 사례 중 하나는 각 행의 그룹 내 상대적 위치를 계산하는 것입니다. transform()을 산술 연산과 함께 사용하면 다음과 같은 열을 추가할 수 있습니다. 그룹 평균을 뺀 급여(편차), 그룹 총액에서 해당 급여가 차지하는 비율, 또는 이 직원이 그룹 중앙값보다 높은 급여를 받는지 나타내는 불리언 플래그입니다. 이러한 특성은 대시보드와 머신러닝 모델에 매우 유용합니다.

df['dept_total'] = df.groupby('dept')['salary'].transform('sum')
df['pct_of_total'] = (df['salary'] / df['dept_total'] * 100).round(1)
df['above_avg'] = df['salary'] > df.groupby('dept')['salary'].transform('mean')
print(df[['dept', 'salary', 'pct_of_total', 'above_avg']])

성능 고려 사항

transform()과 filter()에서 기본 제공 문자열 함수를 사용하면 최적화된 코드 경로를 사용하므로 빠릅니다. 하지만 람다 또는 사용자 지정 파이썬 함수를 전달하면 판다스가 그룹마다 해당 함수를 한 번씩 호출하므로 그룹이 많은 데이터에서는 느려질 수 있습니다. 대규모 데이터셋에서 최고의 성능을 얻으려면 사용자 지정 로직을 기본 제공 문자열 함수로 표현할 수 있는지 확인하세요.

# Slower: custom lambda (called once per group)
df['dept_mean_slow'] = df.groupby('dept')['salary'].transform(lambda s: s.mean())

# Faster: built-in string shortcut (vectorised C path)
df['dept_mean_fast'] = df.groupby('dept')['salary'].transform('mean')

# Both give identical results, but the built-in is significantly faster

빠른 확인

이번 레슨에서 배운 GroupBy의 transform()과 filter()에 대한 이해도를 확인해 보세요.

레슨 요약

이번 레슨에서는 transform()이 그룹 통계량을 원래 행 수에 맞게 브로드캐스트하여 다시 전달하므로 그룹 수준 특성을 추가하는 데 적합하다는 점, filter()가 불리언 조건에 따라 전체 그룹을 유지하거나 제거한다는 점, 그리고 두 메서드를 함께 사용하면 후속 분석을 위한 풍부하고 필터링된 데이터셋을 만들 수 있다는 점을 배웠습니다. 다음으로는 pd.concat을 사용해 DataFrame을 결합하는 방법을 살펴봅니다.

무료로 시작

AI 튜터와 함께 Python을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
30
레슨
120

자주 묻는 질문

“GroupBy 변환과 필터링” 강의는 무료인가요?

네 — “GroupBy 변환과 필터링” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“GroupBy 변환과 필터링”에서 뭘 배우나요?

transform()으로 그룹 수준 통계를 열로 추가하고 filter()로 조건을 만족하는 그룹만 남깁니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“GroupBy 변환과 필터링” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 분할-적용-결합 패턴
  2. 단일 키와 여러 키를 사용한 GroupBy
  3. agg() 메서드
  4. GroupBy 변환과 필터링
← Pandas & NumPy Academy(으)로 돌아가기