Pandas & NumPy Academy · 강의

그룹 내 순위와 백분위

groupby().rank()으로 그룹 내 순위를 계산하고 pd.qcut으로 상대적 비교를 위한 백분위 구간을 만듭니다.

레슨 4/413개 단계

그룹 내 순위와 백분위은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

그룹 내 순위를 사용하는 이유

원시 값은 상대적 순위보다 의미가 떨어지는 경우가 많습니다. 월 매출이 $50,000인 영업 담당자는 평균이 $30,000이면 뛰어난 성과를 낸 사람이지만, 평균이 $80,000이면 성과가 낮은 사람입니다. 그룹 내에서 순위를 계산하면(예: 각 지역 내 순위 또는 각 분기 내 순위) 그룹마다 다른 기준선을 반영한 정규화된 비교가 가능합니다. Pandas에서는 groupby().rank()를 사용하여 그룹 내 순위를 쉽게 계산할 수 있습니다.

import pandas as pd
import numpy as np

np.random.seed(42)
df = pd.DataFrame({
    'rep': ['Alice', 'Bob', 'Carol', 'Dave', 'Eve',
            'Frank', 'Grace', 'Hank', 'Iris', 'Jake'],
    'region': ['East']*5 + ['West']*5,
    'sales': np.random.randint(30000, 100000, 10)
})
print(df.sort_values('region'))

Series.rank() — 기본 순위 계산

Series.rank()은 각 값에 순위를 할당합니다. 순위 1은 가장 작은 값이고 순위 n은 가장 큰 값입니다. ascending=False 매개변수는 방향을 뒤집어 순위 1이 가장 큰 값이 되도록 합니다. 동률을 기본적으로 동률 순위의 평균으로 처리하기 때문에 결과는 정수가 아닌 실수 Series입니다. 값이 5개인 열에서는 순위가 1.0부터 5.0까지 지정되며, 동률이 있으면 일부 값이 2.5와 같은 순위를 공유할 수 있습니다.

import pandas as pd

s = pd.Series([80, 45, 90, 45, 70])

print('Values:', s.values)
print('Rank (ascending=True, default):', s.rank().values)
print('Rank (ascending=False — best=1):', s.rank(ascending=False).values)
# Note: two 45s share ranks 1 and 2 → both get 1.5

rank()의 동률 처리 방법

method 매개변수는 동률인 값이 처리되는 방식을 제어합니다. 옵션은 다음과 같습니다. 'average'(기본값 — 동률인 값이 순위의 평균을 공유), 'min'(모든 동률 값에 가장 낮은 순위 지정), 'max'(모든 값에 가장 높은 순위 지정), 'first'(나타난 순서대로 순위 지정 — 동률 없음), 'dense'(순위에 빈 번호가 없음 — 1, 2, 3, 3, 4가 1, 2, 3, 3, 5가 아니라 1, 2, 3, 3, 4가 됨)입니다. 'dense' 방법은 백분위수 방식의 순위 계산에 가장 유용합니다.

import pandas as pd

s = pd.Series([80, 45, 90, 45, 70])

result = pd.DataFrame({
    'value': s,
    'average': s.rank(method='average'),
    'min': s.rank(method='min'),
    'max': s.rank(method='max'),
    'first': s.rank(method='first'),
    'dense': s.rank(method='dense')
})
print(result)

groupby().rank()를 사용한 그룹 내 순위 계산

groupby('group_col')['value_col'].rank()는 각 그룹 내에서 독립적으로 순위를 계산합니다. 각 그룹의 시작점에서 순위가 다시 설정되므로 East 지역의 최고 성과자는 East에서 순위 1을 받고, West 지역의 최고 성과자도 West에서 순위 1을 받습니다. 이 점 때문에 groupby 순위 계산은 그룹 간 공정한 비교에 매우 유용합니다.

import pandas as pd
import numpy as np

np.random.seed(42)
df = pd.DataFrame({
    'rep': list('ABCDEABCDE'),
    'region': ['East']*5 + ['West']*5,
    'sales': np.random.randint(30000, 100000, 10)
})

# Rank within each region (best = rank 1)
df['rank_in_region'] = df.groupby('region')['sales'].rank(ascending=False, method='min')
df_sorted = df.sort_values(['region', 'rank_in_region'])
print(df_sorted.to_string(index=False))

rank(pct=True)를 사용한 백분위수 순위

rank()에서 pct=True를 설정하면 백분위수 순위가 반환됩니다. 백분위수 순위는 0과 1 사이의 값으로, 그룹 내에서 현재 값 이하인 값이 전체 값에서 차지하는 비율을 나타냅니다. 백분위수 순위가 0.8이면 해당 값이 80번째 백분위수에 속하며 전체 값의 80%보다 크다는 의미입니다. 이 정규화를 사용하면 실제 그룹 크기를 몰라도 크기가 서로 다른 그룹의 값을 직접 비교할 수 있습니다.

import pandas as pd
import numpy as np

np.random.seed(0)
df = pd.DataFrame({
    'name': list('ABCDEFGHIJ'),
    'region': ['East']*5 + ['West']*5,
    'score': np.random.randint(50, 100, 10)
})

# Percentile rank within region
df['pct_rank'] = df.groupby('region')['score'].rank(pct=True)
df['percentile'] = (df['pct_rank'] * 100).round(0).astype(int)
print(df.sort_values(['region', 'percentile'], ascending=[True, False]).to_string(index=False))

pd.qcut: 분위수 기반 구간화

pd.qcut(series, q)는 값을 동일한 빈도의 q개 구간으로 나누어 각 구간에 거의 같은 수의 관측값이 포함되도록 합니다. 동일한 너비의 구간을 사용하는 pd.cut과 달리 pd.qcut은 데이터 분포에 맞춰 구간 경계를 조정합니다. 따라서 성과 등급을 만들기 위한 사분위수(q=4), 오분위수(q=5), 십분위수(q=10)를 생성하는 데 적합합니다.

import pandas as pd
import numpy as np

np.random.seed(42)
sales = pd.Series(np.random.exponential(scale=50000, size=100))

# Divide into quartiles
quartiles = pd.qcut(sales, q=4, labels=['Q1', 'Q2', 'Q3', 'Q4'])

result = pd.DataFrame({'sales': sales, 'quartile': quartiles})
print('Quartile counts (should be ~25 each):')
print(result['quartile'].value_counts().sort_index())
print('\nMean sales per quartile:')
print(result.groupby('quartile')['sales'].mean().round(0))

pd.cut과 pd.qcut 비교

pd.cut(series, bins=n)은 동일한 너비의 구간을 만듭니다(범위는 같고 개수는 다름). pd.qcut(series, q=n)은 동일한 빈도의 구간을 만듭니다(개수는 같고 범위는 다름). 치우친 데이터에서는 pd.cut을 사용하면 꼬리 부분의 구간이 거의 비게 되는 반면, pd.qcut은 관측값을 고르게 분배합니다. 구간 경계가 자연스러운 비즈니스 의미를 가질 때(가격대, 연령대)는 pd.cut을 선택하고, 그룹 크기를 동일하게 만들고 싶은 성과 등급에는 pd.qcut을 선택하세요.

import pandas as pd
import numpy as np

np.random.seed(0)
# Right-skewed data
data = pd.Series(np.random.exponential(1, 100))

cut_result = pd.cut(data, bins=5).value_counts().sort_index()
qcut_result = pd.qcut(data, q=5).value_counts().sort_index()

print('Equal-width bins (pd.cut) — uneven counts:')
print(cut_result.to_string())
print('\nEqual-frequency bins (pd.qcut) — even counts:')
print(qcut_result.to_string())

pd.qcut으로 십분위수 레이블 만들기

pd.qcut(series, q=10, labels=range(1,11))은 각 관측값을 십분위수(1~10) 중 하나에 할당합니다. 이는 마케팅 분석(고객 가치 십분위수), 신용 평가(위험 십분위수), AB 테스트(코호트 분석을 위한 트래픽 십분위수)에서 사용하는 표준 기법입니다. labels 매개변수에는 q와 길이가 같은 목록이라면 무엇이든 사용할 수 있습니다. 더 읽기 쉬운 결과를 원한다면 ['Bottom 10%', ..., 'Top 10%']과 같은 문자열을 사용하세요.

import pandas as pd
import numpy as np

np.random.seed(7)
customer_value = pd.Series(np.random.exponential(500, 1000))

# Assign to deciles 1-10
decile_labels = [f'D{i}' for i in range(1, 11)]
customer_decile = pd.qcut(
    customer_value,
    q=10,
    labels=decile_labels
)

result = pd.DataFrame({'value': customer_value, 'decile': customer_decile})
print('Mean customer value per decile:')
print(result.groupby('decile')['value'].mean().round(0))

그룹 내 백분위수 구간

transform을 사용하여 groupby와 pd.qcut을 결합하면 각 그룹 내에서 백분위수 구간을 만들 수 있습니다. 이는 전체 기준이 아니라 각 지역 내에서 고객 순위를 매기고 싶을 때 유용합니다. 전체 기준으로 하위 십분위수에 속하는 고객이 해당 지역에서는 상위 십분위수에 속할 수도 있기 때문입니다. groupby('group')['value'].transform(lambda x: pd.qcut(x, q=4, labels=['Q1','Q2','Q3','Q4']))를 사용하세요.

import pandas as pd
import numpy as np

np.random.seed(42)
df = pd.DataFrame({
    'customer': range(20),
    'region': ['North']*10 + ['South']*10,
    'spend': np.random.randint(100, 1000, 20)
})

# Quartile within each region
def quartile_label(x):
    return pd.qcut(x, q=4, labels=['Q1','Q2','Q3','Q4'])

df['region_quartile'] = df.groupby('region')['spend'].transform(quartile_label)
print(df.sort_values(['region', 'region_quartile']).to_string(index=False))

그룹 내 상위 N개

비즈니스에서 흔히 나오는 질문은 ‘각 지역의 상위 성과자 3명은 누구인가?’입니다. groupby().rank()를 사용한 다음 순위로 필터링하세요. df[df['rank_col'] <= 3]과 같이 작성하면 됩니다. 이 방법은 그룹 크기와 관계없이 깔끔하게 작동하며, 기준 순위에서 동률이 있으면 3개보다 많은 행을 유지하여 동률도 자연스럽게 처리합니다. 또는 groupby().nlargest(n)을 사용하면 순위 열을 추가하지 않고 각 그룹의 가장 큰 값 n개를 바로 반환할 수 있습니다.

import pandas as pd
import numpy as np

np.random.seed(0)
df = pd.DataFrame({
    'rep': [f'Rep_{i}' for i in range(15)],
    'region': ['East']*5 + ['West']*5 + ['North']*5,
    'revenue': np.random.randint(40000, 120000, 15)
})

df['region_rank'] = df.groupby('region')['revenue'].rank(ascending=False, method='min')

print('Top 2 per region:')
top2 = df[df['region_rank'] <= 2].sort_values(['region', 'region_rank'])
print(top2[['rep', 'region', 'revenue', 'region_rank']].to_string(index=False))

순위와 Transform을 결합한 정규화

groupby().rank(pct=True)를 transform과 결합하면 원본 DataFrame에 백분위수 순위 열을 추가할 수 있습니다. 이 정규화된 열은 원시 값보다 모델 특성으로 더 유용한 경우가 많습니다. 값의 척도에 영향을 받지 않으며 그룹 간 비교가 가능하기 때문입니다. 머신 러닝에서는 백분위수 순위가 표준화(z 점수화)를 대신할 수 있는 간단한 방법이며, 이상값에도 더 강건합니다.

import pandas as pd
import numpy as np

np.random.seed(1)
df = pd.DataFrame({
    'product': np.random.choice(['A', 'B', 'C'], 30),
    'score': np.random.randint(50, 100, 30)
})

# Percentile rank within each product group
df['global_pct'] = df['score'].rank(pct=True).round(3)
df['group_pct'] = df.groupby('product')['score'].rank(pct=True).round(3)

print(df.sort_values(['product', 'score']).head(12).to_string(index=False))

빠른 확인

이 단원에서 배운 순위 및 백분위수 연산에 대한 이해도를 확인해 보세요.

단원 복습

이 레슨에서는 다음을 배웠습니다. Series.rank()는 동률 처리 방식을 설정할 수 있는 수치 순위를 계산하고, groupby().rank()는 공정한 그룹 간 비교를 위해 각 그룹 내에서 순위를 다시 설정하며, pct=True는 순위를 백분위수(0~1)로 변환하고, pd.qcut은 사분위수, 십분위수 및 백분위수 등급 할당을 위한 동일 빈도 구간을 만듭니다. 다음으로는 Pandas 성능 향상 팁인 프로파일링, 느린 반복문 피하기, 효율적인 데이터 형식을 살펴봅니다.

무료로 시작

AI 튜터와 함께 Python을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
30
레슨
120

자주 묻는 질문

“그룹 내 순위와 백분위” 강의는 무료인가요?

네 — “그룹 내 순위와 백분위” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“그룹 내 순위와 백분위”에서 뭘 배우나요?

groupby().rank()으로 그룹 내 순위를 계산하고 pd.qcut으로 상대적 비교를 위한 백분위 구간을 만듭니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“그룹 내 순위와 백분위” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 이동 창
  2. 확장 창
  3. 지수 가중 이동 평균
  4. 그룹 내 순위와 백분위
← Pandas & NumPy Academy(으)로 돌아가기