Pandas & NumPy Academy · 课时

按索引排序

使用 sort_index() 按索引标签重新排列行,并理解排序后的索引何时能够提升性能。

第 2 / 4 课13 个步骤

按索引排序 是 CoddyKit 上的免费 Pandas & NumPy Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Pandas & NumPy Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Pandas & NumPy Academy 课程共包含 4 节课。

理解 DataFrame 索引

每个 Pandas DataFrame 都有一个行索引,它是一组用于标识和访问行的标签。默认情况下,索引为 RangeIndex(0、1、2、……),但您也可以使用 set_index() 将其设置为任意列(日期、名称、ID)。当索引具有实际意义时(例如 DatetimeIndex 或客户 ID),按索引而不是按列值排序,可以生成逻辑上更有组织的输出。

import pandas as pd

df = pd.DataFrame(
    {'value': [10, 20, 30]},
    index=['C', 'A', 'B']  # out-of-order alphabetic index
)
print(df)
#    value
# C     10
# A     20
# B     30

sort_index() — 升序

DataFrame.sort_index() 会按照索引标签而不是列值重新排列行。默认情况下,排序为升序:字符串索引按字母顺序排列,整数索引按数值顺序排列,DatetimeIndex 按时间顺序排列。在数据被打乱或记录以无序方式追加后,这是将数据集恢复为自然顺序的标准方法。

import pandas as pd

df = pd.DataFrame(
    {'temp': [22.5, 19.0, 25.1, 18.3]},
    index=pd.to_datetime(['2024-03-01', '2024-01-15', '2024-06-10', '2024-01-01'])
)

sorted_df = df.sort_index()
print(sorted_df)
#             temp
# 2024-01-01  18.3
# 2024-01-15  19.0
# 2024-03-01  22.5
# 2024-06-10  25.1

sort_index() 降序

传入 ascending=False,即可将索引从最大值(或最新值)排到最小值(或最早值)。对于 DatetimeIndex,这会将最近的观测值放在顶部,这通常适用于金融数据、日志文件和事件流,因为其中最新事件最为相关。

import pandas as pd

df = pd.DataFrame(
    {'price': [100, 110, 105, 115]},
    index=pd.to_datetime(['2024-01', '2024-02', '2024-03', '2024-04'])
)

# Most recent first
print(df.sort_index(ascending=False))
#             price
# 2024-04-30    115
# 2024-03-31    105
# 2024-02-29    110
# 2024-01-31    100

使用 axis=1 对列标签排序

默认情况下,sort_index() 会对行索引(axis=0)进行排序。传入 axis=1 则可以改为按字母顺序对列标签排序。这对于规范化包含许多列的宽型 DataFrames 很有用,可以让列以可预测的字母顺序显示,从而更容易在视觉上找到某一列或比较 DataFrames。

import pandas as pd

df = pd.DataFrame({
    'zebra': [1], 'apple': [2], 'mango': [3], 'banana': [4]
})

print('Before:', df.columns.tolist())
# ['zebra', 'apple', 'mango', 'banana']

sorted_cols = df.sort_index(axis=1)
print('After:', sorted_cols.columns.tolist())
# ['apple', 'banana', 'mango', 'zebra']

已排序的索引何时更快

当索引已排序(单调)时,Pandas 可以使用二分查找来查找标签。已排序的索引可以将 .loc['2024-01':'2024-06'] 切片的复杂度从 O(n) 降低到 O(log n)。is_monotonic_increasing 方法(或 is_monotonic_decreasing)会返回一个布尔值,表示索引是否已经排序。在反复切片之前先对大型索引排序,是值得付出的一次性成本。

import pandas as pd
import numpy as np

idx = pd.to_datetime(['2024-03-01', '2024-01-15', '2024-06-10'])
df = pd.DataFrame({'v': [1, 2, 3]}, index=idx)

print('Sorted?', df.index.is_monotonic_increasing)  # False

df = df.sort_index()
print('Sorted?', df.index.is_monotonic_increasing)  # True

# Now slicing is efficient
print(df.loc['2024-01':'2024-03'])

使用 sort_index() 处理 MultiIndex

当 DataFrame 具有 MultiIndex(分层行索引)时,sort_index() 默认会对层次结构中的所有级别进行排序。您可以使用 level 参数将排序限制在指定级别。已排序的 MultiIndex 是使用 .loc[(outer, inner), :] 高效执行分层切片的必要条件。

import pandas as pd

arrays = [
    ['B', 'B', 'A', 'A'],
    ['two', 'one', 'two', 'one']
]
idx = pd.MultiIndex.from_arrays(arrays, names=['first', 'second'])
df = pd.DataFrame({'value': [10, 20, 30, 40]}, index=idx)

print(df.sort_index())
#               value
# first second
# A     one       40
#       two       30
# B     one       20
#       two       10

仅对 MultiIndex 的一个级别排序

使用 MultiIndex 时,您可能只想对内部级别或外部级别排序,同时保持另一个级别的顺序不变。将 level= 传递给 sort_index() 即可实现这一点——它接受整数(级别位置)、字符串(级别名称)或列表。当外部级别的顺序已经正确,而您只需要在每个组内排序时,这种方式非常有用。

import pandas as pd

df = pd.DataFrame({
    'sales': [300, 100, 200, 400, 150, 250]
}, index=pd.MultiIndex.from_tuples([
    ('Eng', 'Dave'), ('Eng', 'Alice'), ('Eng', 'Bob'),
    ('HR', 'Zoe'), ('HR', 'Carol'), ('HR', 'Eve')
], names=['dept', 'name']))

# Sort only the 'name' level alphabetically within each dept
print(df.sort_index(level='name'))
#              sales
# dept name
# Eng  Alice    100
#      Bob      200
#      Dave     300
# HR   Carol    150
#      Eve      250
#      Zoe      400

sort_index() 与 sort_values() 的区别

区分这两种排序方法非常重要。sort_values(by='col')根据列中的数据值重新排列行。sort_index()根据行标签(索引)重新排列行,而行标签可能与某一列对应,也可能不对应。当索引是主要标识符时(例如 DatetimeIndex 或有意义的字符串键),应选择sort_index()。

import pandas as pd

df = pd.DataFrame(
    {'value': [30, 10, 20]},
    index=['C', 'A', 'B']
)

# sort_index: sorted by row label A, B, C
print(df.sort_index())
#    value
# A     10
# B     20
# C     30

# sort_values: sorted by data value 10, 20, 30
print(df.sort_values('value'))
#    value
# A     10
# B     20
# C     30
# (same here because values happen to match alphabetical label order!)

操作后恢复原始顺序

某些操作(例如打乱顺序、使用df.sample(frac=1)进行随机抽样)会打乱行顺序。sort_index()是恢复原始连续顺序的简洁方法。如果原始顺序是 RangeIndex(0、1、2、……),sort_index()会将其恢复;如果原始顺序是有意义的标签,则会恢复这些标签的自然顺序。

import pandas as pd

df = pd.DataFrame({'x': [10, 20, 30, 40, 50]})

# Shuffle (random sample)
shuffled = df.sample(frac=1, random_state=42)
print('Shuffled index:', shuffled.index.tolist())
# e.g. [2, 4, 0, 1, 3]

# Restore original order by sorting the index
restored = shuffled.sort_index()
print('Restored index:', restored.index.tolist())
# [0, 1, 2, 3, 4]

使用 na_position 的 sort_index()

与sort_values()一样,sort_index()也支持使用na_position控制 NaN 索引标签的位置。当 DataFrame 的字符串索引或日期索引中包含一些 NaN 标签时,这一点很重要(引入缺失索引值的操作可能导致这种情况)。默认值是'last'。

import pandas as pd
import numpy as np

df = pd.DataFrame(
    {'v': [1, 2, 3, 4]},
    index=['B', None, 'A', 'C']
)

print(df.sort_index(na_position='last'))
#      v
# A    3
# B    1
# C    4
# NaN  2

性能提升测量

您可以使用 Python 的timeit,比较在未排序和已排序的 DatetimeIndex 上执行切片的耗时,从而通过实测衡量排序索引带来的性能提升。排序后的情况会使用二分查找,对于大型 DataFrame,通常快 5 到 20 倍。这说明 sort_index() 不只是外观上的操作——它会切实影响运行时性能。

import pandas as pd
import numpy as np

np.random.seed(0)
random_dates = pd.to_datetime(
    pd.Timestamp('2020-01-01').value + np.random.randint(0, 1_000_000_000_000_000, size=100_000),
    unit='ns'
)
df = pd.DataFrame({'val': np.random.randn(100_000)}, index=random_dates)

# Without sort: O(n) scan
import timeit
t1 = timeit.timeit(lambda: df.loc['2022-01':'2022-06'], number=100)

df_sorted = df.sort_index()
t2 = timeit.timeit(lambda: df_sorted.loc['2022-01':'2022-06'], number=100)

print(f'Unsorted: {t1:.3f}s, Sorted: {t2:.3f}s, Speedup: {t1/t2:.1f}x')

快速检查

测试您对 Pandas 按索引排序的理解。

课程回顾

本课您学到了:sort_index()按行标签(而不是列值)重新排列行,axis=1按字母顺序排列列标签,而排序后的索引支持二分查找,因此按时间切片会快得多。对于 MultiIndex DataFrames,level=可以将排序限制在某一个层级。依赖高效的切片查找之前,请务必检查is_monotonic_increasing。接下来,我们将在列中对值进行排名。

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「按索引排序」课时是免费的吗?

是的 — 「按索引排序」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Pandas & NumPy Academy 课程的其余内容,请升级到 CoddyKit PRO。 Pandas & NumPy Academy 课程共包含 4 节课。

「按索引排序」这节课中我会学到什么?

使用 sort_index() 按索引标签重新排列行,并理解排序后的索引何时能够提升性能。 你通过在浏览器中直接运行的动手代码来练习 Pandas & NumPy Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Pandas & NumPy Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Pandas & NumPy Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「按索引排序」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Pandas & NumPy Academy 课中编写并运行代码吗?

能。每节 Pandas & NumPy Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 按列值排序
  2. 按索引排序
  3. 值排名
  4. 设置与重置索引
← 返回 Pandas & NumPy Academy