0Pricing
Pandas & NumPy Academy · 강의

MultiIndex에서 데이터 선택하기

튜플, 슬라이스, pd.IndexSlice 도우미와 함께 .loc을 사용해 외부 및 내부 인덱스 수준의 데이터를 가져옵니다.

MultiIndex에서 데이터 선택하기은(는) CoddyKit의 무료 Pandas & NumPy Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Pandas & NumPy Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

계층적 데이터 탐색

MultiIndex를 만들었다면 데이터의 하위 집합을 효율적으로 가져오는 방법이 필요합니다. 이를 위해 Pandas는 세 가지 도구를 제공합니다. 정확한 레이블 선택에는 .loc와 튜플을, 수준 전체의 범위 선택에는 slice()와 pd.IndexSlice를, 특정 수준 값에서의 단면 선택에는 .xs()를 사용합니다. 이러한 접근 패턴을 익히면 계층적 인덱싱의 강력한 기능을 온전히 활용할 수 있습니다.

import pandas as pd
import numpy as np

# Setup: GDP data by country and year
df_flat = pd.DataFrame({
    'country': ['USA','USA','USA','UK','UK','UK','DE','DE','DE'],
    'year': [2021, 2022, 2023, 2021, 2022, 2023, 2021, 2022, 2023],
    'gdp_bn': [23000, 25000, 26000, 3000, 3100, 3200, 4100, 4200, 4350]
})
df = df_flat.set_index(['country', 'year']).sort_index()
print(df)

.loc로 외부 수준을 기준으로 선택하기

외부 수준의 레이블 하나를 .loc[]에 전달하면 해당 그룹의 모든 행을 가져올 수 있습니다. (country, year)로 이루어진 2단계 MultiIndex에서 df.loc['USA']는 USA의 모든 행을, 내부 인덱스(year)만 남긴 DataFrame으로 반환합니다. 이를 수준 제거라고 합니다. 외부 수준에서 특정 값을 선택하면 Pandas가 반환된 객체의 인덱스에서 해당 수준을 제거하기 때문입니다.

import pandas as pd

df_flat = pd.DataFrame({
    'country': ['USA','USA','USA','UK','UK','UK'],
    'year': [2021, 2022, 2023, 2021, 2022, 2023],
    'gdp_bn': [23000, 25000, 26000, 3000, 3100, 3200]
})
df = df_flat.set_index(['country', 'year']).sort_index()

# Select all USA rows
usa = df.loc['USA']
print('All USA rows:')
print(usa)
print('\nRemaining index type:', usa.index.name)

.loc로 특정 튜플 선택하기

두 인덱스 수준으로 식별되는 단일 행을 가져오려면 튜플을 .loc[]에 전달합니다: df.loc[('USA', 2022)]. 그러면 정확히 해당 (외부, 내부) 레이블 조합에 해당하는 Series가 반환됩니다(열 하나만 선택하면 스칼라가 반환됩니다). Series가 아니라 DataFrame을 반환받으려면 튜플을 목록 안에 넣어 df.loc[[('USA', 2022)]]처럼 전달해야 합니다.

import pandas as pd

df_flat = pd.DataFrame({
    'country': ['USA','USA','USA','UK','UK','UK'],
    'year': [2021, 2022, 2023, 2021, 2022, 2023],
    'gdp_bn': [23000, 25000, 26000, 3000, 3100, 3200],
    'cpi': [3.2, 5.1, 4.8, 2.5, 3.4, 3.0]
})
df = df_flat.set_index(['country', 'year']).sort_index()

# Single row as Series
print('USA 2022 (Series):')
print(df.loc[('USA', 2022)])

# Single row as DataFrame
print('\nUSA 2022 (DataFrame):')
print(df.loc[[('USA', 2022)]])

튜플 목록으로 여러 행 선택하기

여러 특정 행을 한 번에 선택하려면 튜플 목록을 .loc[]에 전달합니다. 이는 복합 키로 식별되는 연속적이지 않은 행의 하위 집합이 필요할 때 유용합니다. 예를 들어 USA와 UK의 2022년 데이터는 선택하되 Germany의 데이터는 제외할 수 있습니다. 결과로 반환되는 DataFrame에서는 MultiIndex가 유지됩니다.

import pandas as pd

df_flat = pd.DataFrame({
    'country': ['USA','USA','UK','UK','DE','DE'],
    'year': [2022, 2023, 2022, 2023, 2022, 2023],
    'gdp_bn': [25000, 26000, 3100, 3200, 4200, 4350]
})
df = df_flat.set_index(['country', 'year']).sort_index()

# Select specific (country, year) combinations
subset = df.loc[[('USA', 2022), ('UK', 2023), ('DE', 2022)]]
print(subset)

pd.IndexSlice로 슬라이싱하기

pd.IndexSlice(일반적으로 idx라는 별칭으로 사용)를 이용하면 장황한 튜플 슬라이스를 직접 만들지 않고도 MultiIndex 수준의 범위 슬라이스를 작성할 수 있습니다. 문법은 df.loc[idx[outer_slice, inner_slice], column_slice]입니다. 예를 들어 df.loc[idx['UK':'USA', 2022:2023], :]는 외부 수준이 UK부터 USA 사이이고 내부 수준이 2022부터 2023 사이인 모든 행을 선택합니다. 이 기능이 올바르게 작동하려면 인덱스가 정렬되어 있어야 합니다.

import pandas as pd
import numpy as np

years = [2021, 2022, 2023]
countries = ['DE', 'UK', 'USA']
mi = pd.MultiIndex.from_product([countries, years], names=['country', 'year'])
df = pd.DataFrame({'gdp': np.random.randint(3000, 26000, 9)}, index=mi)

idx = pd.IndexSlice

# Select UK and USA for years 2022 and 2023
subset = df.loc[idx['UK':'USA', 2022:2023], :]
print(subset)

.xs()로 단면 데이터에 접근하기

df.xs(key, level=)는 다른 수준에 어떤 값이 들어 있는지와 관계없이 특정 수준이 주어진 값과 같은 모든 행을 선택합니다. 외부 수준부터 지정해야 하는 .loc와 달리 .xs는 이름을 사용하여 어느 수준이든 직접 접근할 수 있습니다. 예를 들어 df.xs(2022, level='year')는 'USA', 'UK' 또는 'DE'를 지정하지 않고도 모든 국가의 2022년 행을 반환합니다.

import pandas as pd
import numpy as np

countries = ['DE', 'UK', 'USA']
years = [2021, 2022, 2023]
mi = pd.MultiIndex.from_product([countries, years], names=['country', 'year'])
df = pd.DataFrame({'gdp': [4100,4200,4350, 3000,3100,3200, 23000,25000,26000]}, index=mi)

# All countries for year 2022 (inner level)
print('All data for year 2022:')
print(df.xs(2022, level='year'))

# All years for UK (outer level)
print('\nAll years for UK:')
print(df.xs('UK', level='country'))

MultiIndex 열에 접근하기

DataFrame의 열에 MultiIndex가 있는 경우 튜플을 사용하여 특정 열에 접근합니다: df[('revenue', 'Q1')]. 외부 수준의 모든 열(예: 모든 revenue 열)을 선택하려면 df['revenue']를 사용합니다. 그러면 해당 외부 키 아래의 모든 내부 수준 열로 구성된 DataFrame이 반환됩니다. pd.IndexSlice 패턴은 .loc와 함께 사용하면 열 MultiIndex에도 적용됩니다.

import pandas as pd
import numpy as np

metrics = ['revenue', 'cost']
quarters = ['Q1', 'Q2', 'Q3', 'Q4']
cols = pd.MultiIndex.from_product([metrics, quarters], names=['metric', 'quarter'])
df = pd.DataFrame(
    np.random.randint(50, 200, (3, 8)),
    columns=cols,
    index=['USA', 'UK', 'DE']
)

# Access all revenue columns
print('Revenue columns:')
print(df['revenue'])

# Access a specific cell
print('\nUSA revenue Q1:', df.loc['USA', ('revenue', 'Q1')])

모든 외부 키에서 내부 수준 선택하기

모든 외부 수준 값에서 단일 내부 수준 값을 선택하려면 외부 수준에 slice(None)을 사용하여 .loc와 결합합니다: df.loc[(slice(None), 2022), :]. 그러면 모든 국가의 2022년 행이 선택됩니다. pd.IndexSlice를 사용하는 방식이 더 읽기 쉽습니다: df.loc[idx[:, 2022], :]. 특정 시점의 모든 엔터티에 대한 현황을 가져오려 할 때 이 패턴이 자주 필요합니다.

import pandas as pd
import numpy as np

countries = ['DE', 'UK', 'USA']
years = [2021, 2022, 2023]
mi = pd.MultiIndex.from_product([countries, years], names=['country', 'year'])
df = pd.DataFrame({'gdp': [4100,4200,4350, 3000,3100,3200, 23000,25000,26000]}, index=mi)

idx = pd.IndexSlice

# All countries for year 2022 (using IndexSlice)
all_2022 = df.loc[idx[:, 2022], :]
print('All countries in 2022:')
print(all_2022)

MultiIndex 선택 시 흔히 발생하는 문제

흔히 발생하는 문제는 세 가지입니다. 1) 정렬되지 않은 인덱스: 정렬되지 않은 MultiIndex를 슬라이싱하면 UnsortedIndexError가 발생하거나 잘못된 결과가 반환될 수 있으므로, 항상 먼저 sort_index()를 호출합니다. 2) 키로 사용한 튜플에서 발생하는 KeyError: 튜플을 .loc[]로 감싸지 않고 전달하면 Python이 이를 위치 기반 인덱싱으로 해석하므로, MultiIndex에 레이블 기반으로 접근할 때는 항상 .loc를 사용합니다. 3) 수준 불일치: groupby 후에는 MultiIndex 수준 이름이 예상과 다를 수 있으므로, 슬라이싱하기 전에 df.index.names를 확인합니다.

import pandas as pd

# Unsorted MultiIndex slicing
tuples = [('B', 2), ('A', 1), ('B', 1), ('A', 2)]
mi = pd.MultiIndex.from_tuples(tuples, names=['letter', 'num'])
df = pd.DataFrame({'value': [10, 20, 30, 40]}, index=mi)

print('Is sorted:', df.index.is_monotonic_increasing)
# Sort before slicing
df = df.sort_index()
print('After sort:', df.index.is_monotonic_increasing)

idx = pd.IndexSlice
print('\nSlice A:')
print(df.loc[idx['A', :], :])

실전 예제: 분기별 보고

구체적인 사용 사례를 살펴보겠습니다. (region, quarter)로 인덱싱된 판매 데이터에서 연말 보고서에 사용할 모든 지역의 Q4 데이터를 추출해야 한다고 가정합니다. .xs('Q4', level='quarter')를 한 번 호출하여 이 단면 데이터를 가져옵니다. 그런 다음 .sum()으로 합계를 계산합니다. groupby 집계 → MultiIndex 결과 → 단면 추출이라는 이 패턴은 비즈니스 보고 파이프라인에서 매우 흔합니다.

import pandas as pd
import numpy as np

regions = ['North', 'South', 'East', 'West']
quarters = ['Q1', 'Q2', 'Q3', 'Q4']
mi = pd.MultiIndex.from_product([regions, quarters], names=['region', 'quarter'])

np.random.seed(42)
df = pd.DataFrame({
    'sales': np.random.randint(200, 500, 16),
    'units': np.random.randint(50, 150, 16)
}, index=mi)

# Extract Q4 performance across all regions
q4 = df.xs('Q4', level='quarter')
print('Q4 Results by Region:')
print(q4)
print('\nQ4 Total Sales:', q4['sales'].sum())

MultiIndex 선택과 열 결합하기

.loc[row_indexer, column_list]를 사용하면 특정 행과 열을 동시에 선택할 수 있습니다. MultiIndex에서는 행 인덱서가 튜플, 튜플 목록 또는 IndexSlice이고, 열 인덱서는 열 이름이나 이름 목록입니다. 이를 통해 하나의 표현식으로 계층적 DataFrame에서 정확한 직사각형 형태의 하위 표를 추출할 수 있습니다.

import pandas as pd
import numpy as np

countries = ['DE', 'UK', 'USA']
years = [2021, 2022, 2023]
mi = pd.MultiIndex.from_product([countries, years], names=['country', 'year'])
df = pd.DataFrame({
    'gdp': [4100,4200,4350, 3000,3100,3200, 23000,25000,26000],
    'inflation': [1.5, 2.1, 2.8, 2.0, 3.4, 2.9, 3.2, 5.1, 4.8],
    'unemployment': [5.0, 4.8, 4.5, 4.5, 4.2, 4.0, 3.8, 3.5, 3.3]
}, index=mi)

idx = pd.IndexSlice

# UK and USA, years 2022-2023, only gdp and inflation
result = df.loc[idx['UK':'USA', 2022:2023], ['gdp', 'inflation']]
print(result)

빠른 확인

이 강의에서 배운 MultiIndex 선택에 대한 이해도를 확인해 보세요.

강의 요약

이 강의에서는 .loc와 튜플을 사용하여 특정 (외부, 내부) 레이블 조합을 선택하고, 모든 수준에 걸친 범위 슬라이스에는 pd.IndexSlice를 사용하며, 외부 키와 관계없이 어느 수준에서든 단면을 추출할 때는 .xs()를 사용하는 방법을 배웠습니다. UnsortedIndexError를 피하려면 항상 먼저 인덱스를 정렬합니다. 다음에는 인덱스 정렬과 재인덱싱, 즉 Pandas가 두 DataFrame을 공통 인덱스에 맞추는 방법을 살펴봅니다.

자주 묻는 질문

“MultiIndex에서 데이터 선택하기” 강의는 무료인가요?

네 — “MultiIndex에서 데이터 선택하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Pandas & NumPy Academy 강의 전체를 잠금 해제할 수 있습니다. Pandas & NumPy Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“MultiIndex에서 데이터 선택하기”에서 뭘 배우나요?

튜플, 슬라이스, pd.IndexSlice 도우미와 함께 .loc을 사용해 외부 및 내부 인덱스 수준의 데이터를 가져옵니다. 브라우저에서 직접 실행하는 실습 코드로 Pandas & NumPy Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Pandas & NumPy Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Pandas & NumPy Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“MultiIndex에서 데이터 선택하기” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Pandas & NumPy Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Pandas & NumPy Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. MultiIndex 만들기
  2. MultiIndex에서 데이터 선택하기
  3. 인덱스 정렬과 재인덱싱
  4. 정렬된 인덱스의 성능 이점
← Pandas & NumPy Academy(으)로 돌아가기