Pandas & NumPy Academy · 课时

melt:从宽格式转换为长格式

使用 pd.melt 将宽格式 DataFrame 转换为长格式,并指定 id_vars 和 value_vars。

第 2 / 4 课13 个步骤

melt:从宽格式转换为长格式 是 CoddyKit 上的免费 Pandas & NumPy Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Pandas & NumPy Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Pandas & NumPy Academy 课程共包含 4 节课。

宽格式与长格式数据

数据有两种基本形状。宽格式中每个主题占一行,测量结果分布在多个列中——例如,分别为一月、二月和三月的销售额设置不同列。长格式中每条观测占一行,其中一列存储变量名,另一列存储值。大多数 Pandas 分析函数、机器学习库和可视化工具都更偏好长格式,因此 melt() 是一种必不可少的转换工具。

pd.melt() 函数

pd.melt(df)(也可以使用 df.melt())会将宽 DataFrame 转换为长格式。关键参数包括:id_vars(要原样保留为标识符的列)、value_vars(要展开为行的列)、var_name(新变量列的名称)和 value_name(新值列的名称)。

import pandas as pd

# Wide format: separate columns per month
df_wide = pd.DataFrame({
    'product': ['A', 'B'],
    'Jan':     [100, 150],
    'Feb':     [120, 130],
    'Mar':     [140, 160]
})

print(df_wide)
#   product  Jan  Feb  Mar
# 0       A  100  120  140
# 1       B  150  130  160

基本的 melt() 调用

将 id_vars 设为您想保留为标识符的列,然后调用 melt()。其他每一列都会被展开:列名成为新变量列中的一个值,单元格中的值则移入值列。输出行数等于输入行数乘以被展开的值列数量。

df_long = df_wide.melt(
    id_vars='product',
    var_name='month',
    value_name='sales'
)
print(df_long)
#   product month  sales
# 0       A   Jan    100
# 1       B   Jan    150
# 2       A   Feb    120
# 3       B   Feb    130
# 4       A   Mar    140
# 5       B   Mar    160

选择要展开的列

默认情况下,未列在 id_vars 中的每一列都会被展开。使用 value_vars 可以只展开部分列。不在 id_vars 或 value_vars 中的列会从结果中删除。当宽 DataFrame 同时包含时间序列列和其他不希望展开的属性时,这一功能非常有用。

df_wide2 = pd.DataFrame({
    'product': ['A', 'B'],
    'category': ['Electronics', 'Clothing'],
    'Jan': [100, 150],
    'Feb': [120, 130],
    'Mar': [140, 160]
})

# Melt only Jan and Feb, keep product and category
df_long2 = df_wide2.melt(
    id_vars=['product', 'category'],
    value_vars=['Jan', 'Feb'],
    var_name='month',
    value_name='sales'
)
print(df_long2)

melt() 后重置索引

melt() 会保留原始行索引,并为每个变量重复这些索引。因此,结果通常会出现类似 [0, 1, 0, 1, 0, 1] 的非连续索引。建议在 melt() 后立即调用 reset_index(drop=True),让输出获得从 0 到 n-1 的整洁连续索引。

df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')
print('Before reset:', df_long.index.tolist())
# [0, 1, 0, 1, 0, 1]

df_long = df_long.reset_index(drop=True)
print('After reset:', df_long.index.tolist())
# [0, 1, 2, 3, 4, 5]

melt() 是 pivot() 的逆操作

从概念上说,melt() 是 pivot() / pivot_table() 的逆操作。您可以使用 pivot_table() 将长格式转换为宽格式,再使用 melt() 将宽格式转换回长格式。这种往返转换经常用于数据处理流程:接收宽格式数据,将其重塑为长格式以便使用 Seaborn 绘图或生成机器学习特征,然后根据需要再转换回数据透视表,用于报告表格。

# long -> wide
table = df_long.pivot_table(values='sales', index='product',
                            columns='month', aggfunc='sum')
print(table)
# product  Feb  Jan  Mar
# A        120  100  140
# B        130  150  160

# wide -> long again
long_again = table.reset_index().melt(id_vars='product', var_name='month', value_name='sales')
print(long_again.head())

使用 melt() 进行 Seaborn 绘图

Seaborn 的分类图和关系图最适合使用长格式数据。典型流程是:先从每个分组各占一列的宽格式 DataFrame 开始,将其转换为长格式,使一列用于标识分组、另一列用于存放值,然后将这两列分别传给 Seaborn 的 hue 和 x/y 参数。这是使用 melt() 最常见的原因之一。

import seaborn as sns
import matplotlib.pyplot as plt

# Long format is required for sns.lineplot with hue
df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')

# sns.lineplot(data=df_long, x='month', y='sales', hue='product')
# plt.show()
print('Long data ready for Seaborn:')
print(df_long)

命名输出列

默认情况下,melt() 会将新的变量列命名为 'variable',将值列命名为 'value'。请始终使用 var_name 和 value_name 将它们覆盖为有意义的名称。描述性列名可以让后续代码更易读,并避免在 DataFrame 包含几十列时产生混淆。

# Default: generic column names 'variable' and 'value'
default = df_wide.melt(id_vars='product')
print(default.columns.tolist())
# ['product', 'variable', 'value']

# Better: descriptive names
good = df_wide.melt(id_vars='product', var_name='month', value_name='revenue_usd')
print(good.columns.tolist())
# ['product', 'month', 'revenue_usd']

转换调查数据

melt() 的一个经典使用场景是调查回答数据:每列代表一个问题,每行代表一位受访者。转换操作会将这种宽格式转换为长格式,其中包含受访者 ID、问题名称和回答值等列。随后,您可以使用 groupby() 轻松计算每个问题的回答分布。

survey = pd.DataFrame({
    'respondent': [1, 2, 3],
    'Q1_rating': [5, 3, 4],
    'Q2_rating': [4, 5, 3],
    'Q3_rating': [2, 4, 5]
})

long = survey.melt(id_vars='respondent', var_name='question', value_name='rating')
print(long)
print(long.groupby('question')['rating'].mean())

对转换后的结果排序

转换后,各行会按照原始列的顺序排列(每行依次为 Jan、Feb、Mar)。通常,您会希望先按标识列排序,再按变量列排序。请对转换后的 DataFrame 使用 sort_values(),以获得最适合分析或后续处理的顺序。

df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')

# Sort by product, then month
df_sorted = df_long.sort_values(['product', 'month']).reset_index(drop=True)
print(df_sorted)
#   product month  sales
# 0       A   Feb    120
# 1       A   Jan    100
# 2       A   Mar    140
# 3       B   Feb    130
# 4       B   Jan    150
# 5       B   Mar    160

数据处理流程中的 melt()

在典型的数据处理流程中,melt() 通常紧跟在加载或清理宽格式数据之后,位于分析或建模步骤之前。请在流程的早期使用它,快速转换为长格式;这样,后续所有操作(groupby、seaborn、sklearn)都可以直接处理整洁的长格式数据,而无需编写特殊分支。

def load_and_reshape(filepath):
    raw = pd.read_csv(filepath)
    # Melt all month columns into long format
    month_cols = [c for c in raw.columns if c.startswith('month_')]
    long = raw.melt(
        id_vars=[c for c in raw.columns if c not in month_cols],
        value_vars=month_cols,
        var_name='month',
        value_name='value'
    )
    return long.reset_index(drop=True)

快速检查

请测试您对本课所讲 pd.melt 宽格式到长格式转换的理解。

课程回顾

本课中,您学习了以下内容:melt() 通过将列取消透视为行,把宽格式转换为长格式;id_vars 指定保持固定的列,value_vars 选择要转换的列;var_name 和 value_name 为新列提供描述性名称;对于 Seaborn、groupby 和机器学习流程,长格式通常更为合适。接下来,我们将学习使用 stack 和 unstack 重塑 MultiIndex DataFrames。

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「melt:从宽格式转换为长格式」课时是免费的吗?

是的 — 「melt:从宽格式转换为长格式」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Pandas & NumPy Academy 课程的其余内容,请升级到 CoddyKit PRO。 Pandas & NumPy Academy 课程共包含 4 节课。

「melt:从宽格式转换为长格式」这节课中我会学到什么?

使用 pd.melt 将宽格式 DataFrame 转换为长格式,并指定 id_vars 和 value_vars。 你通过在浏览器中直接运行的动手代码来练习 Pandas & NumPy Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Pandas & NumPy Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Pandas & NumPy Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「melt:从宽格式转换为长格式」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Pandas & NumPy Academy 课中编写并运行代码吗?

能。每节 Pandas & NumPy Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. pivot_table:交叉表
  2. melt:从宽格式转换为长格式
  3. 使用 MultiIndex 进行 stack 和 unstack
  4. 使用 crosstab 创建频数表
← 返回 Pandas & NumPy Academy