0Pricing
Pandas & NumPy Academy · 강의

분포 그래프: histplot과 kdeplot

sns.histplot으로 수치형 분포의 형태를 시각화하고 sns.kdeplot으로 커널 밀도 추정치를 겹쳐 표시합니다.

분포 그래프: histplot과 kdeplot은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

Seaborn과 분포 plot

Seaborn은 Matplotlib을 기반으로 만들어진 통계 데이터 시각화 라이브러리입니다. 적은 코드만으로 아름답고 유익한 plot을 만들 수 있는 고수준 API를 제공합니다. 모든 데이터셋에서 가장 먼저 파악해야 할 것 중 하나는 분포의 형태이며, Seaborn의 histplot과 kdeplot은 이를 위한 주요 도구입니다.

import seaborn as sns
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

# Load a built-in dataset
tips = sns.load_dataset('tips')
print(tips.head())

histplot으로 기본 히스토그램 만들기

sns.histplot(data, x='column')은 수치 변수의 히스토그램을 만듭니다. Seaborn은 기본적으로 Sturges 규칙을 사용해 적절한 구간 수를 자동으로 선택합니다. bins 매개변수로 구간 수를 사용자 지정하거나 Seaborn이 자동으로 선택하도록 둘 수 있습니다. 각 막대의 높이는 해당 범위에 포함된 관측값의 개수를 나타냅니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

# Basic histogram of total bill amounts
sns.histplot(data=tips, x='total_bill')
plt.title('Distribution of Total Bill')
plt.xlabel('Total Bill ($)')
plt.show()

구간과 stat 매개변수 조정하기

bins 매개변수는 히스토그램에 표시할 막대 수를 조정합니다. 구간이 많으면 더 세밀한 정보가 드러나지만 잡음이 많아 보일 수 있습니다. stat 매개변수는 y축이 나타내는 값을 바꿉니다: 'count'(기본값), 'density'(확률 밀도), 'probability'(관측값의 비율), 'percent'(백분율)입니다. stat='density'를 선택하면 크기가 다른 데이터셋의 히스토그램도 비교할 수 있습니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

fig, axes = plt.subplots(1, 2, figsize=(10, 4))

# Count histogram with 20 bins
sns.histplot(data=tips, x='total_bill', bins=20, ax=axes[0])
axes[0].set_title('Count (20 bins)')

# Density histogram
sns.histplot(data=tips, x='total_bill', stat='density', ax=axes[1])
axes[1].set_title('Density')

plt.tight_layout()
plt.show()

히스토그램에 KDE 겹쳐 표시하기

histplot에서 kde=True로 설정하면 히스토그램 위에 커널 밀도 추정(KDE) 곡선을 겹쳐 표시합니다. KDE는 실제 확률 분포를 부드러운 연속 곡선으로 근사한 것입니다. 이 조합은 매우 효과적입니다. 히스토그램은 원시 구간별 개수를 보여 주고, KDE는 전체 형태를 드러내며 여러 봉우리(다봉성)를 찾아냅니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

# Histogram with KDE overlay
sns.histplot(data=tips, x='total_bill', kde=True, bins=25, color='steelblue')
plt.title('Bill Distribution with KDE Overlay')
plt.xlabel('Total Bill ($)')
plt.show()

kdeplot 독립적으로 사용하기

sns.kdeplot()은 히스토그램 막대 없이 부드러운 밀도 곡선만 그립니다. 같은 축에서 여러 분포를 비교할 때 유용합니다. 겹친 히스토그램은 혼란스러워질 수 있지만, 겹친 KDE 곡선은 읽기 쉽기 때문입니다. fill=True 매개변수는 곡선 아래 영역을 음영 처리해 그룹을 시각적으로 구분하기 쉽게 합니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

# KDE plot for lunch vs dinner bills
sns.kdeplot(data=tips, x='total_bill', hue='time', fill=True, alpha=0.5)
plt.title('Bill Distribution: Lunch vs Dinner')
plt.xlabel('Total Bill ($)')
plt.show()

그룹 비교를 위한 hue 매개변수

histplot과 kdeplot은 모두 hue 매개변수를 사용해 범주형 열을 기준으로 데이터를 나누고 각 그룹을 다른 색으로 그릴 수 있습니다. 이를 통해 그룹별 분포를 쉽게 비교할 수 있습니다. hue와 함께 histplot을 사용할 때는 크기가 다른 그룹도 공정하게 비교할 수 있도록 stat='density'를 설정하십시오.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

# Compare tip distributions by smoker status
sns.histplot(
    data=tips,
    x='tip',
    hue='smoker',
    stat='density',
    common_norm=False,
    bins=20,
    alpha=0.6
)
plt.title('Tip Distribution by Smoker Status')
plt.show()

KDE의 대역폭: bw_adjust 매개변수

KDE에는 곡선의 매끄러운 정도를 조정하는 대역폭이라는 조정 매개변수가 있습니다. 대역폭이 작으면 곡선이 울퉁불퉁해지고 데이터에 과적합되며, 크면 지나치게 매끄러워져 실제 특징이 가려집니다. Seaborn은 bw_adjust(기본값 1.0)를 자동으로 선택한 대역폭에 곱하는 값으로 사용합니다. 1보다 작은 값은 거칠기를 높이고, 1보다 큰 값은 매끄러움을 높입니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

fig, axes = plt.subplots(1, 3, figsize=(12, 4))
bw_values = [0.3, 1.0, 3.0]

for ax, bw in zip(axes, bw_values):
    sns.kdeplot(data=tips, x='total_bill', bw_adjust=bw, ax=ax)
    ax.set_title(f'bw_adjust={bw}')

plt.tight_layout()
plt.show()

histplot과 kdeplot으로 2차원 분포 살펴보기

x와 y 매개변수를 모두 전달하면 histplot과 kdeplot에서 2차원 plot을 지원합니다. 2차원 히스토그램은 색으로 빈도를 나타내는 격자를 보여 주고, 2차원 KDE는 밀도가 같은 지점을 연결한 등고선을 보여 줍니다. 이러한 plot은 두 수치 변수의 결합 분포와 두 변수의 상관 여부를 드러냅니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

fig, axes = plt.subplots(1, 2, figsize=(12, 5))

# 2D histogram
sns.histplot(data=tips, x='total_bill', y='tip', ax=axes[0])
axes[0].set_title('2D Histogram')

# 2D KDE contour plot
sns.kdeplot(data=tips, x='total_bill', y='tip', fill=True, ax=axes[1])
axes[1].set_title('2D KDE Contours')

plt.tight_layout()
plt.show()

Seaborn 테마로 모양 사용자 지정하기

Seaborn은 sns.set_theme(style=)을 통해 내장 테마를 제공합니다. 사용할 수 있는 스타일은 'darkgrid', 'whitegrid', 'dark', 'white', 'ticks'입니다. palette= 또는 sns.set_palette()로 팔레트도 설정할 수 있습니다. 이러한 설정은 세션에서 이후에 생성되는 모든 plot에 전역으로 적용되므로 일관된 모양을 쉽게 만들 수 있습니다.

import seaborn as sns
import matplotlib.pyplot as plt

# Apply a clean whitegrid theme
sns.set_theme(style='whitegrid', palette='muted')

tips = sns.load_dataset('tips')
sns.histplot(data=tips, x='total_bill', kde=True, bins=20)
plt.title('Styled Distribution Plot')
plt.show()

# Reset to defaults when done
sns.reset_defaults()

분포 형태 해석하기

분포 그래프를 읽을 때는 네 가지 핵심 특징을 살펴보세요. 중심: 데이터가 어디에 집중되어 있나요(평균/중앙값)? 퍼짐: 분포가 얼마나 넓게 퍼져 있나요(표준편차)? 왜도: 오른쪽 꼬리가 더 긴가요(양의 왜도), 아니면 왼쪽 꼬리가 더 긴가요(음의 왜도)? 최빈성: 분포에 봉우리가 하나 있나요(단봉 분포), 아니면 여러 개 있나요(이봉 분포/다봉 분포)? 이봉 분포는 분리해 분석할 가치가 있는 두 개의 숨은 하위 모집단을 나타내는 경우가 많습니다.

import seaborn as sns
import matplotlib.pyplot as plt
import numpy as np

# Simulate a bimodal distribution
np.random.seed(42)
data = np.concatenate([
    np.random.normal(loc=20, scale=3, size=300),
    np.random.normal(loc=45, scale=5, size=200)
])

sns.histplot(data, kde=True, bins=40)
plt.title('Bimodal Distribution — Two Hidden Groups')
plt.xlabel('Value')
plt.show()

displot: 그림 수준 분포 함수

sns.displot()은 자체 Figure를 만들고 col= 및 row= 매개변수를 사용해 행과 열로 나눈 패싯을 지원하는 그림 수준 래퍼입니다. kind='hist', kind='kde' 또는 kind='ecdf'를 전달하여 그래프 유형을 전환할 수 있습니다. ECDF(경험적 누적 분포 함수)는 각 값보다 작은 데이터의 비율을 보여 주므로 특히 유용하며, 구간을 어떻게 나눌지 정할 필요가 없습니다.

import seaborn as sns
import matplotlib.pyplot as plt

tips = sns.load_dataset('tips')

# Faceted KDE by day of week
sns.displot(
    data=tips,
    x='total_bill',
    col='day',
    col_wrap=2,
    kind='kde',
    fill=True
)
plt.suptitle('Bill Distributions by Day', y=1.02)
plt.show()

빠른 확인

이번 수업에서 배운 Seaborn 분포 그래프에 대한 이해도를 확인해 보세요.

수업 요약

이번 수업에서는 다음을 배웠습니다. sns.histplot은 사용자 지정 구간과 통계 매개변수를 사용해 히스토그램을 만들고, sns.kdeplot은 그룹 비교에 적합한 매끄러운 밀도 곡선을 그리며, hue 매개변수는 범주형 변수에 따라 두 그래프 유형을 나누어 나란히 비교할 수 있게 합니다. 다음에는 상자 그래프, 막대 그래프, 바이올린 그래프와 같은 범주형 비교 그래프를 살펴보겠습니다.

자주 묻는 질문

“분포 그래프: histplot과 kdeplot” 강의는 무료인가요?

네 — “분포 그래프: histplot과 kdeplot” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“분포 그래프: histplot과 kdeplot”에서 뭘 배우나요?

sns.histplot으로 수치형 분포의 형태를 시각화하고 sns.kdeplot으로 커널 밀도 추정치를 겹쳐 표시합니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“분포 그래프: histplot과 kdeplot” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 분포 그래프: histplot과 kdeplot
  2. 범주형 그래프: boxplot, barplot, violinplot
  3. 산점도와 쌍별 그래프
  4. 상관 행렬 히트맵
← Pandas & NumPy Academy(으)로 돌아가기