按索引排序
使用 sort_index() 按索引标签重新排列行,并理解排序后的索引何时能够提升性能。
按索引排序 是 CoddyKit 上的免费 Pandas & NumPy Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Pandas & NumPy Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Pandas & NumPy Academy 课程共包含 4 节课。
理解 DataFrame 索引
每个 Pandas DataFrame 都有一个行索引,它是一组用于标识和访问行的标签。默认情况下,索引为 RangeIndex(0、1、2、……),但您也可以使用 set_index() 将其设置为任意列(日期、名称、ID)。当索引具有实际意义时(例如 DatetimeIndex 或客户 ID),按索引而不是按列值排序,可以生成逻辑上更有组织的输出。
import pandas as pd
df = pd.DataFrame(
{'value': [10, 20, 30]},
index=['C', 'A', 'B'] # out-of-order alphabetic index
)
print(df)
# value
# C 10
# A 20
# B 30sort_index() — 升序
DataFrame.sort_index() 会按照索引标签而不是列值重新排列行。默认情况下,排序为升序:字符串索引按字母顺序排列,整数索引按数值顺序排列,DatetimeIndex 按时间顺序排列。在数据被打乱或记录以无序方式追加后,这是将数据集恢复为自然顺序的标准方法。
import pandas as pd
df = pd.DataFrame(
{'temp': [22.5, 19.0, 25.1, 18.3]},
index=pd.to_datetime(['2024-03-01', '2024-01-15', '2024-06-10', '2024-01-01'])
)
sorted_df = df.sort_index()
print(sorted_df)
# temp
# 2024-01-01 18.3
# 2024-01-15 19.0
# 2024-03-01 22.5
# 2024-06-10 25.1sort_index() 降序
传入 ascending=False,即可将索引从最大值(或最新值)排到最小值(或最早值)。对于 DatetimeIndex,这会将最近的观测值放在顶部,这通常适用于金融数据、日志文件和事件流,因为其中最新事件最为相关。
import pandas as pd
df = pd.DataFrame(
{'price': [100, 110, 105, 115]},
index=pd.to_datetime(['2024-01', '2024-02', '2024-03', '2024-04'])
)
# Most recent first
print(df.sort_index(ascending=False))
# price
# 2024-04-30 115
# 2024-03-31 105
# 2024-02-29 110
# 2024-01-31 100使用 axis=1 对列标签排序
默认情况下,sort_index() 会对行索引(axis=0)进行排序。传入 axis=1 则可以改为按字母顺序对列标签排序。这对于规范化包含许多列的宽型 DataFrames 很有用,可以让列以可预测的字母顺序显示,从而更容易在视觉上找到某一列或比较 DataFrames。
import pandas as pd
df = pd.DataFrame({
'zebra': [1], 'apple': [2], 'mango': [3], 'banana': [4]
})
print('Before:', df.columns.tolist())
# ['zebra', 'apple', 'mango', 'banana']
sorted_cols = df.sort_index(axis=1)
print('After:', sorted_cols.columns.tolist())
# ['apple', 'banana', 'mango', 'zebra']已排序的索引何时更快
当索引已排序(单调)时,Pandas 可以使用二分查找来查找标签。已排序的索引可以将 .loc['2024-01':'2024-06'] 切片的复杂度从 O(n) 降低到 O(log n)。is_monotonic_increasing 方法(或 is_monotonic_decreasing)会返回一个布尔值,表示索引是否已经排序。在反复切片之前先对大型索引排序,是值得付出的一次性成本。
import pandas as pd
import numpy as np
idx = pd.to_datetime(['2024-03-01', '2024-01-15', '2024-06-10'])
df = pd.DataFrame({'v': [1, 2, 3]}, index=idx)
print('Sorted?', df.index.is_monotonic_increasing) # False
df = df.sort_index()
print('Sorted?', df.index.is_monotonic_increasing) # True
# Now slicing is efficient
print(df.loc['2024-01':'2024-03'])使用 sort_index() 处理 MultiIndex
当 DataFrame 具有 MultiIndex(分层行索引)时,sort_index() 默认会对层次结构中的所有级别进行排序。您可以使用 level 参数将排序限制在指定级别。已排序的 MultiIndex 是使用 .loc[(outer, inner), :] 高效执行分层切片的必要条件。
import pandas as pd
arrays = [
['B', 'B', 'A', 'A'],
['two', 'one', 'two', 'one']
]
idx = pd.MultiIndex.from_arrays(arrays, names=['first', 'second'])
df = pd.DataFrame({'value': [10, 20, 30, 40]}, index=idx)
print(df.sort_index())
# value
# first second
# A one 40
# two 30
# B one 20
# two 10仅对 MultiIndex 的一个级别排序
使用 MultiIndex 时,您可能只想对内部级别或外部级别排序,同时保持另一个级别的顺序不变。将 level= 传递给 sort_index() 即可实现这一点——它接受整数(级别位置)、字符串(级别名称)或列表。当外部级别的顺序已经正确,而您只需要在每个组内排序时,这种方式非常有用。
import pandas as pd
df = pd.DataFrame({
'sales': [300, 100, 200, 400, 150, 250]
}, index=pd.MultiIndex.from_tuples([
('Eng', 'Dave'), ('Eng', 'Alice'), ('Eng', 'Bob'),
('HR', 'Zoe'), ('HR', 'Carol'), ('HR', 'Eve')
], names=['dept', 'name']))
# Sort only the 'name' level alphabetically within each dept
print(df.sort_index(level='name'))
# sales
# dept name
# Eng Alice 100
# Bob 200
# Dave 300
# HR Carol 150
# Eve 250
# Zoe 400sort_index() 与 sort_values() 的区别
区分这两种排序方法非常重要。sort_values(by='col')根据列中的数据值重新排列行。sort_index()根据行标签(索引)重新排列行,而行标签可能与某一列对应,也可能不对应。当索引是主要标识符时(例如 DatetimeIndex 或有意义的字符串键),应选择sort_index()。
import pandas as pd
df = pd.DataFrame(
{'value': [30, 10, 20]},
index=['C', 'A', 'B']
)
# sort_index: sorted by row label A, B, C
print(df.sort_index())
# value
# A 10
# B 20
# C 30
# sort_values: sorted by data value 10, 20, 30
print(df.sort_values('value'))
# value
# A 10
# B 20
# C 30
# (same here because values happen to match alphabetical label order!)操作后恢复原始顺序
某些操作(例如打乱顺序、使用df.sample(frac=1)进行随机抽样)会打乱行顺序。sort_index()是恢复原始连续顺序的简洁方法。如果原始顺序是 RangeIndex(0、1、2、……),sort_index()会将其恢复;如果原始顺序是有意义的标签,则会恢复这些标签的自然顺序。
import pandas as pd
df = pd.DataFrame({'x': [10, 20, 30, 40, 50]})
# Shuffle (random sample)
shuffled = df.sample(frac=1, random_state=42)
print('Shuffled index:', shuffled.index.tolist())
# e.g. [2, 4, 0, 1, 3]
# Restore original order by sorting the index
restored = shuffled.sort_index()
print('Restored index:', restored.index.tolist())
# [0, 1, 2, 3, 4]使用 na_position 的 sort_index()
与sort_values()一样,sort_index()也支持使用na_position控制 NaN 索引标签的位置。当 DataFrame 的字符串索引或日期索引中包含一些 NaN 标签时,这一点很重要(引入缺失索引值的操作可能导致这种情况)。默认值是'last'。
import pandas as pd
import numpy as np
df = pd.DataFrame(
{'v': [1, 2, 3, 4]},
index=['B', None, 'A', 'C']
)
print(df.sort_index(na_position='last'))
# v
# A 3
# B 1
# C 4
# NaN 2性能提升测量
您可以使用 Python 的timeit,比较在未排序和已排序的 DatetimeIndex 上执行切片的耗时,从而通过实测衡量排序索引带来的性能提升。排序后的情况会使用二分查找,对于大型 DataFrame,通常快 5 到 20 倍。这说明 sort_index() 不只是外观上的操作——它会切实影响运行时性能。
import pandas as pd
import numpy as np
np.random.seed(0)
random_dates = pd.to_datetime(
pd.Timestamp('2020-01-01').value + np.random.randint(0, 1_000_000_000_000_000, size=100_000),
unit='ns'
)
df = pd.DataFrame({'val': np.random.randn(100_000)}, index=random_dates)
# Without sort: O(n) scan
import timeit
t1 = timeit.timeit(lambda: df.loc['2022-01':'2022-06'], number=100)
df_sorted = df.sort_index()
t2 = timeit.timeit(lambda: df_sorted.loc['2022-01':'2022-06'], number=100)
print(f'Unsorted: {t1:.3f}s, Sorted: {t2:.3f}s, Speedup: {t1/t2:.1f}x')快速检查
测试您对 Pandas 按索引排序的理解。
课程回顾
本课您学到了:sort_index()按行标签(而不是列值)重新排列行,axis=1按字母顺序排列列标签,而排序后的索引支持二分查找,因此按时间切片会快得多。对于 MultiIndex DataFrames,level=可以将排序限制在某一个层级。依赖高效的切片查找之前,请务必检查is_monotonic_increasing。接下来,我们将在列中对值进行排名。
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「按索引排序」课时是免费的吗?
是的 — 「按索引排序」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Pandas & NumPy Academy 课程的其余内容,请升级到 CoddyKit PRO。 Pandas & NumPy Academy 课程共包含 4 节课。
「按索引排序」这节课中我会学到什么?
使用 sort_index() 按索引标签重新排列行,并理解排序后的索引何时能够提升性能。 你通过在浏览器中直接运行的动手代码来练习 Pandas & NumPy Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Pandas & NumPy Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Pandas & NumPy Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「按索引排序」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Pandas & NumPy Academy 课中编写并运行代码吗?
能。每节 Pandas & NumPy Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。