빈도표에 crosstab 사용하기
pd.crosstab으로 두 범주형 열의 빈도 또는 비율 교차표를 계산합니다.
빈도표에 crosstab 사용하기은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
교차표란 무엇인가요?
교차 집계표(crosstab)는 데이터세트에서 두 개 이상의 범주형 변수 값 조합이 각각 몇 번 나타나는지 계산합니다. 이는 특히 개수 계산을 위해 설계된 피벗 테이블의 특수한 형태입니다. Pandas는 groupby()나 pivot_table()을 명시적으로 호출하지 않고도 이러한 빈도표를 간결하게 계산할 수 있도록 pd.crosstab()을 제공합니다.
기본 crosstab() 호출
최소 형태의 pd.crosstab(index, columns) 호출은 배열과 유사한 입력 두 개(일반적으로 DataFrame 열)를 받아 빈도표를 반환합니다. 행은 첫 번째 인수의 고유값에 대응하고, 열은 두 번째 인수의 고유값에 대응합니다. 각 셀에는 원본 데이터에서 두 값이 함께 나타나는 행의 개수가 들어갑니다.
import pandas as pd
df = pd.DataFrame({
'gender': ['M', 'F', 'M', 'F', 'M', 'F', 'M'],
'product': ['A', 'A', 'B', 'B', 'A', 'B', 'B']
})
ct = pd.crosstab(df['gender'], df['product'])
print(ct)
# product A B
# gender
# F 1 2
# M 2 2행 및 열 이름 사용자 지정
rownames 및 colnames 매개변수를 사용하여 출력의 행 축과 열 축에 의미 있는 이름을 지정하고 기본 Series 이름을 덮어쓸 수 있습니다. DataFrame의 원시 열 이름만으로는 생성되는 표의 맥락을 설명하기 어려울 때 유용합니다.
ct = pd.crosstab(
df['gender'], df['product'],
rownames=['Customer Gender'],
colnames=['Purchased Product']
)
print(ct)
# Purchased Product A B
# Customer Gender
# F 1 2
# M 2 2여백 추가하기(행 및 열 합계)
margins=True를 전달하면 모든 값을 합산한 행과 열을 포함할 수 있습니다. 여백 레이블의 기본값은 'All'이지만 margins_name으로 사용자 지정할 수 있습니다. 여백 행에는 열별 총 개수가 표시되고, 여백 열에는 행별 총 개수가 표시되며, 오른쪽 아래 셀에는 전체 합계가 표시됩니다.
ct = pd.crosstab(df['gender'], df['product'],
margins=True, margins_name='Total')
print(ct)
# product A B Total
# gender
# F 1 2 3
# M 2 2 4
# Total 3 4 7비율로 정규화하기
normalize 매개변수를 전달하면 개수를 비율로 변환할 수 있습니다. normalize=True 또는 normalize='all'은 전체 합계로 나눕니다. normalize='index'는 행 비율을 계산하며 각 행의 합은 1.0이 됩니다. normalize='columns'는 열 비율을 계산하며 각 열의 합은 1.0이 됩니다. 그룹 크기가 서로 다를 때는 원시 개수보다 비율이 더 많은 정보를 제공합니다.
# Row proportions: what fraction of each gender bought each product?
print(pd.crosstab(df['gender'], df['product'], normalize='index').round(2))
# product A B
# gender
# F 0.33 0.67
# M 0.50 0.50
# All proportions: each cell as fraction of grand total
print(pd.crosstab(df['gender'], df['product'], normalize=True).round(2))개수 대신 값 집계하기
기본적으로 crosstab은 행의 개수를 계산합니다. 대신 values와 aggfunc 매개변수를 전달하여 숫자 열을 집계할 수 있으며, 이는 pivot_table()과 비슷합니다. 예를 들어 성별과 제품 조합별 총수익을 계산할 수 있습니다. 이 기능을 사용하면 빈도표라는 사용 사례에서 crosstab은 pivot_table과 거의 같아지면서도 문법은 조금 더 간결합니다.
df['revenue'] = [100, 80, 150, 120, 200, 90, 130]
# Sum revenue by gender and product instead of counting
ct_rev = pd.crosstab(
df['gender'], df['product'],
values=df['revenue'],
aggfunc='sum'
)
print(ct_rev)
# product A B
# gender
# F 80 210
# M 300 280다중 수준 교차표
index 또는 columns에 목록을 전달하면 행이나 열에 여러 수준이 있는 교차표를 만들 수 있습니다. 결과에는 MultiIndex가 포함되어 더 세분화된 분석이 가능합니다. 예를 들어 행에서 성별과 지역을 기준으로, 열에서 제품을 기준으로 교차 집계하면 모든 성별-지역-제품 조합을 확인할 수 있습니다.
df['region'] = ['East', 'West', 'East', 'West', 'East', 'East', 'West']
ct_multi = pd.crosstab(
[df['gender'], df['region']],
df['product'],
margins=True
)
print(ct_multi)
# product A B All
# gender region
# F East 0 1 1
# West 1 1 2
# M East 2 1 3
# West 0 1 1
# All 3 4 7crosstab()과 pivot_table() 비교
pd.crosstab()과 pd.pivot_table()은 기능이 상당히 겹칩니다. crosstab은 빈도 계산에 최적화되어 있고 배열과 유사한 입력을 직접 받으므로(DataFrame이 아님) 빠른 표 작성에 조금 더 간결합니다. pivot_table은 DataFrame에서 작동하며 모든 집계 함수를 기본적으로 지원합니다. 순수하게 개수를 세는 작업에는 crosstab을 사용하는 것이 관례에 맞고, 숫자 값을 집계할 때는 pivot_table을 사용하는 것이 좋습니다.
# crosstab (more concise for counting)
print(pd.crosstab(df['gender'], df['product']))
# Equivalent pivot_table
print(pd.pivot_table(df, index='gender', columns='product',
aggfunc='size', fill_value=0))
# Both produce the same result카이제곱 검정 준비
교차표는 두 범주형 변수가 통계적으로 관련되어 있는지를 검정하는 독립성 카이제곱 검정의 표준 입력입니다. scipy.stats.chi2_contingency() 함수는 교차표 배열을 직접 받습니다. 통계적 데이터 분석에서 crosstab을 사용하는 가장 일반적인 방법 중 하나로, 한 작업 흐름에서 표를 계산한 다음 검정할 수 있습니다.
from scipy import stats
ct = pd.crosstab(df['gender'], df['product'])
# Convert to numpy array for scipy
chi2, p, dof, expected = stats.chi2_contingency(ct.values)
print(f'Chi2: {chi2:.2f}')
print(f'P-value: {p:.4f}')
print(f'Degrees of freedom: {dof}')
# p > 0.05 means no significant association교차표를 히트맵으로 시각화하기
범주가 많은 교차표는 원시 숫자만으로 해석하기 어렵습니다. sns.heatmap()을 사용하여 히트맵으로 시각화하면 패턴이 즉시 드러납니다. 빈도가 높은 셀은 밝은 색으로 표시됩니다. 원시 개수 대신 비율을 표시하려면 정규화된 버전을 전달하고, 각 셀에 값을 표시하려면 annot=True를 사용하십시오.
import seaborn as sns
import matplotlib.pyplot as plt
ct_norm = pd.crosstab(df['gender'], df['product'], normalize='index')
# sns.heatmap(ct_norm, annot=True, fmt='.0%', cmap='Blues')
# plt.title('Purchase Rate by Gender and Product')
# plt.tight_layout()
# plt.show()
print('Normalised crosstab ready for heatmap:')
print(ct_norm.round(2))실전 예제: 설문 분석
완전한 crosstab 작업 흐름은 설문 데이터를 불러오고, 인구 통계 변수와 응답 변수 간의 빈도표를 계산하고, 행을 기준으로 정규화하여 응답률을 구한 다음, 강한 패턴이 있는지 확인하는 과정입니다. 이는 시장 조사, A/B 테스트, 사용자 세분화에서 사용하는 표준 분석 파이프라인이며, 판다스 코드 10줄 이내로 완료할 수 있습니다.
# Simulate a survey dataset
survey = pd.DataFrame({
'age_group': ['18-25', '26-35', '18-25', '36-45', '26-35', '36-45'],
'satisfaction': ['High', 'Low', 'High', 'Medium', 'High', 'Low']
})
ct = pd.crosstab(survey['age_group'], survey['satisfaction'],
margins=True, margins_name='Total')
print(ct)
rates = pd.crosstab(survey['age_group'], survey['satisfaction'],
normalize='index').round(2)
print(rates)빠른 확인
이번 레슨에서 배운 빈도표 작성용 pd.crosstab의 이해도를 확인해 보세요.
레슨 요약
이번 레슨에서는 다음을 배웠습니다. pd.crosstab()은 두 범주형 변수의 조합에 대한 빈도 수를 계산하고, normalize는 빈도 수를 행, 열 또는 전체 비율로 변환합니다. margins=True는 행과 열의 합계를 추가하며, crosstab 출력은 카이제곱 검정 및 히트맵 시각화와 바로 호환됩니다. 다음으로 DatetimeIndex와 기간 범위를 사용하여 시계열 데이터를 다룹니다.
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“빈도표에 crosstab 사용하기” 강의는 무료인가요?
네 — “빈도표에 crosstab 사용하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“빈도표에 crosstab 사용하기”에서 뭘 배우나요?
pd.crosstab으로 두 범주형 열의 빈도 또는 비율 교차표를 계산합니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“빈도표에 crosstab 사용하기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- pivot_table: 교차 집계
- melt: 넓은 형식에서 긴 형식으로
- MultiIndex에서 stack과 unstack 사용하기
- 빈도표에 crosstab 사용하기