melt:从宽格式转换为长格式
使用 pd.melt 将宽格式 DataFrame 转换为长格式,并指定 id_vars 和 value_vars。
melt:从宽格式转换为长格式 是 CoddyKit 上的免费 Pandas & NumPy Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Pandas & NumPy Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Pandas & NumPy Academy 课程共包含 4 节课。
宽格式与长格式数据
数据有两种基本形状。宽格式中每个主题占一行,测量结果分布在多个列中——例如,分别为一月、二月和三月的销售额设置不同列。长格式中每条观测占一行,其中一列存储变量名,另一列存储值。大多数 Pandas 分析函数、机器学习库和可视化工具都更偏好长格式,因此 melt() 是一种必不可少的转换工具。
pd.melt() 函数
pd.melt(df)(也可以使用 df.melt())会将宽 DataFrame 转换为长格式。关键参数包括:id_vars(要原样保留为标识符的列)、value_vars(要展开为行的列)、var_name(新变量列的名称)和 value_name(新值列的名称)。
import pandas as pd
# Wide format: separate columns per month
df_wide = pd.DataFrame({
'product': ['A', 'B'],
'Jan': [100, 150],
'Feb': [120, 130],
'Mar': [140, 160]
})
print(df_wide)
# product Jan Feb Mar
# 0 A 100 120 140
# 1 B 150 130 160基本的 melt() 调用
将 id_vars 设为您想保留为标识符的列,然后调用 melt()。其他每一列都会被展开:列名成为新变量列中的一个值,单元格中的值则移入值列。输出行数等于输入行数乘以被展开的值列数量。
df_long = df_wide.melt(
id_vars='product',
var_name='month',
value_name='sales'
)
print(df_long)
# product month sales
# 0 A Jan 100
# 1 B Jan 150
# 2 A Feb 120
# 3 B Feb 130
# 4 A Mar 140
# 5 B Mar 160选择要展开的列
默认情况下,未列在 id_vars 中的每一列都会被展开。使用 value_vars 可以只展开部分列。不在 id_vars 或 value_vars 中的列会从结果中删除。当宽 DataFrame 同时包含时间序列列和其他不希望展开的属性时,这一功能非常有用。
df_wide2 = pd.DataFrame({
'product': ['A', 'B'],
'category': ['Electronics', 'Clothing'],
'Jan': [100, 150],
'Feb': [120, 130],
'Mar': [140, 160]
})
# Melt only Jan and Feb, keep product and category
df_long2 = df_wide2.melt(
id_vars=['product', 'category'],
value_vars=['Jan', 'Feb'],
var_name='month',
value_name='sales'
)
print(df_long2)melt() 后重置索引
melt() 会保留原始行索引,并为每个变量重复这些索引。因此,结果通常会出现类似 [0, 1, 0, 1, 0, 1] 的非连续索引。建议在 melt() 后立即调用 reset_index(drop=True),让输出获得从 0 到 n-1 的整洁连续索引。
df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')
print('Before reset:', df_long.index.tolist())
# [0, 1, 0, 1, 0, 1]
df_long = df_long.reset_index(drop=True)
print('After reset:', df_long.index.tolist())
# [0, 1, 2, 3, 4, 5]melt() 是 pivot() 的逆操作
从概念上说,melt() 是 pivot() / pivot_table() 的逆操作。您可以使用 pivot_table() 将长格式转换为宽格式,再使用 melt() 将宽格式转换回长格式。这种往返转换经常用于数据处理流程:接收宽格式数据,将其重塑为长格式以便使用 Seaborn 绘图或生成机器学习特征,然后根据需要再转换回数据透视表,用于报告表格。
# long -> wide
table = df_long.pivot_table(values='sales', index='product',
columns='month', aggfunc='sum')
print(table)
# product Feb Jan Mar
# A 120 100 140
# B 130 150 160
# wide -> long again
long_again = table.reset_index().melt(id_vars='product', var_name='month', value_name='sales')
print(long_again.head())使用 melt() 进行 Seaborn 绘图
Seaborn 的分类图和关系图最适合使用长格式数据。典型流程是:先从每个分组各占一列的宽格式 DataFrame 开始,将其转换为长格式,使一列用于标识分组、另一列用于存放值,然后将这两列分别传给 Seaborn 的 hue 和 x/y 参数。这是使用 melt() 最常见的原因之一。
import seaborn as sns
import matplotlib.pyplot as plt
# Long format is required for sns.lineplot with hue
df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')
# sns.lineplot(data=df_long, x='month', y='sales', hue='product')
# plt.show()
print('Long data ready for Seaborn:')
print(df_long)命名输出列
默认情况下,melt() 会将新的变量列命名为 'variable',将值列命名为 'value'。请始终使用 var_name 和 value_name 将它们覆盖为有意义的名称。描述性列名可以让后续代码更易读,并避免在 DataFrame 包含几十列时产生混淆。
# Default: generic column names 'variable' and 'value'
default = df_wide.melt(id_vars='product')
print(default.columns.tolist())
# ['product', 'variable', 'value']
# Better: descriptive names
good = df_wide.melt(id_vars='product', var_name='month', value_name='revenue_usd')
print(good.columns.tolist())
# ['product', 'month', 'revenue_usd']转换调查数据
melt() 的一个经典使用场景是调查回答数据:每列代表一个问题,每行代表一位受访者。转换操作会将这种宽格式转换为长格式,其中包含受访者 ID、问题名称和回答值等列。随后,您可以使用 groupby() 轻松计算每个问题的回答分布。
survey = pd.DataFrame({
'respondent': [1, 2, 3],
'Q1_rating': [5, 3, 4],
'Q2_rating': [4, 5, 3],
'Q3_rating': [2, 4, 5]
})
long = survey.melt(id_vars='respondent', var_name='question', value_name='rating')
print(long)
print(long.groupby('question')['rating'].mean())对转换后的结果排序
转换后,各行会按照原始列的顺序排列(每行依次为 Jan、Feb、Mar)。通常,您会希望先按标识列排序,再按变量列排序。请对转换后的 DataFrame 使用 sort_values(),以获得最适合分析或后续处理的顺序。
df_long = df_wide.melt(id_vars='product', var_name='month', value_name='sales')
# Sort by product, then month
df_sorted = df_long.sort_values(['product', 'month']).reset_index(drop=True)
print(df_sorted)
# product month sales
# 0 A Feb 120
# 1 A Jan 100
# 2 A Mar 140
# 3 B Feb 130
# 4 B Jan 150
# 5 B Mar 160数据处理流程中的 melt()
在典型的数据处理流程中,melt() 通常紧跟在加载或清理宽格式数据之后,位于分析或建模步骤之前。请在流程的早期使用它,快速转换为长格式;这样,后续所有操作(groupby、seaborn、sklearn)都可以直接处理整洁的长格式数据,而无需编写特殊分支。
def load_and_reshape(filepath):
raw = pd.read_csv(filepath)
# Melt all month columns into long format
month_cols = [c for c in raw.columns if c.startswith('month_')]
long = raw.melt(
id_vars=[c for c in raw.columns if c not in month_cols],
value_vars=month_cols,
var_name='month',
value_name='value'
)
return long.reset_index(drop=True)快速检查
请测试您对本课所讲 pd.melt 宽格式到长格式转换的理解。
课程回顾
本课中,您学习了以下内容:melt() 通过将列取消透视为行,把宽格式转换为长格式;id_vars 指定保持固定的列,value_vars 选择要转换的列;var_name 和 value_name 为新列提供描述性名称;对于 Seaborn、groupby 和机器学习流程,长格式通常更为合适。接下来,我们将学习使用 stack 和 unstack 重塑 MultiIndex DataFrames。
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「melt:从宽格式转换为长格式」课时是免费的吗?
是的 — 「melt:从宽格式转换为长格式」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Pandas & NumPy Academy 课程的其余内容,请升级到 CoddyKit PRO。 Pandas & NumPy Academy 课程共包含 4 节课。
「melt:从宽格式转换为长格式」这节课中我会学到什么?
使用 pd.melt 将宽格式 DataFrame 转换为长格式,并指定 id_vars 和 value_vars。 你通过在浏览器中直接运行的动手代码来练习 Pandas & NumPy Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Pandas & NumPy Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Pandas & NumPy Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「melt:从宽格式转换为长格式」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Pandas & NumPy Academy 课中编写并运行代码吗?
能。每节 Pandas & NumPy Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。