第一次使用 groupby 汇总
按类别计数和求平均值
第一次使用 groupby 汇总 是 CoddyKit 上的免费 Data Science Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Data Science Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Data Science Academy 课程共包含 4 节课。
从行到分组
很多时候,您关心的不是单行,而是每个类别的总计。groupby 会将共享同一值的行归为一组,方便您汇总每一组。
选择分组依据
您需要选择一列,其值将决定分组方式。按 region 分组后,每个不同的地区都会成为自己的行数据组。
df.groupby("region")聚合之前不会发生任何变化
单独使用 groupby 时计算是惰性的,几乎不会显示任何结果。只有当您要求计算汇总,例如总和或均值时,真正的效果才会出现。
统计每组的行数
链式调用 size 可以统计每组包含多少行,这是快速了解数据如何分布在各类别中的方法。
df.groupby("region").size()计算每组的平均值
选择一个数值列后添加 mean,即可得到每组的平均值,例如每个地区的平均销售额。
df.groupby("region")["sales"].mean()计算每组的总和
换用 sum 可以计算每组某列的总和。这样就能将每日行数据汇总为每个地区或每个月的一个数值。
df.groupby("region")["sales"].sum()选择要汇总的列
分组后选择一列,可以让结果保持聚焦。如果不指定列,pandas 会一次性尝试聚合所有数值列。
结果是一个系列
一个键和一个统计值会生成一个按组建立索引的系列。分组标签会成为索引,统计结果则会成为值。
对汇总结果排序
分组结果会按分组键的顺序排列。链式调用 sort_values 可以为各组排名,例如找出销售额最高的地区。
df.groupby("region")["sales"].sum().sort_values()它会跳过缺失值
默认情况下,mean 等分组聚合操作会静默地忽略 NaN,因此少量缺失不会破坏每组的计算结果。
像读句子一样理解
把这条链大声读出来:按地区分组,取出销售额,计算mean。从左到右阅读,可以让较长的链式操作更清晰。
快速检查
您需要计算每个地区的平均销售额。哪一行代码可以实现?
回顾:一口气理解 groupby
现在,您可以按键分组,使用 size、sum 或 mean 进行汇总,然后对结果排序,为各组排名。又掌握了一项重要技能!🚀
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「第一次使用 groupby 汇总」课时是免费的吗?
是的 — 「第一次使用 groupby 汇总」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Data Science Academy 课程的其余内容,请升级到 CoddyKit PRO。 Data Science Academy 课程共包含 4 节课。
「第一次使用 groupby 汇总」这节课中我会学到什么?
按类别计数和求平均值 你通过在浏览器中直接运行的动手代码来练习 Data Science Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Data Science Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Data Science Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「第一次使用 groupby 汇总」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Data Science Academy 课中编写并运行代码吗?
能。每节 Data Science Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 按一列或多列排序
- 第一次使用 groupby 汇总
- matplotlib 中的折线图和条形图
- 标签、标题和图例