0Pricing
NLP Academy · 课时

罕见类别为何会被忽略

标签分布偏斜的代价

罕见类别为何会被忽略 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。

认识类别不均衡

当一个标签的数量远远超过另一个标签时,您的数据就是不均衡的。例如,9500 封正常邮件对 500 封垃圾邮件。

偷懒的捷径

模型希望快速获得高准确率。最容易的做法是始终预测为多数类,悄悄忽略少数类。😬

95% 并不代表什么

如果垃圾邮件只占 5%,一个将所有邮件都标为正常邮件的模型仍能达到 95% 的准确率,却一封垃圾邮件也抓不到。这个数字没有实际意义。

为什么损失函数也会默许

标准训练会最小化总错误。由于少数类错误数量很少,模型忽略它们时,损失几乎不会变化。

多数类与少数类

我们将数量较大的群体称为多数类,数量较小的群体称为少数类。在自然语言处理中,人们往往最关注少数类。

看出偏斜程度

建模之前,请统计标签数量。一行代码就能揭示类别分布究竟有多不均衡。

from collections import Counter
print(Counter(labels))

真正的代价

漏掉一封垃圾邮件、一条欺诈信息或一条滥用信息,可能会造成很大损失。在自然语言处理中,少数类通常正是您构建模型要识别的对象。

决策边界发生偏移

当少数类样本很少时,决策边界会向多数类一侧偏移,几乎完全吞没少数类所在的区域。

准确率不是正确的观察角度

在偏斜数据上,准确率会掩盖失败。您需要能够突出少数类的指标,例如少数类的召回率。

找出不均衡比例

快速计算不均衡比例可以了解严重程度。十比一还算轻微;一千比一则需要认真处理。

ratio = counts.max() / counts.min()
print(round(ratio, 1))

先诊断,再修复

明确问题就成功了一半。看出偏斜后,您就可以选择重采样或加权来应对。

快速检查

让我们检验一下类别不均衡背后的核心思想。

回顾

不均衡数据会让模型忽略少数类,却仍获得很高的准确率。请先找出偏斜,再进行修复。✅

常见问题解答

「罕见类别为何会被忽略」课时是免费的吗?

是的 — 「罕见类别为何会被忽略」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。

「罕见类别为何会被忽略」这节课中我会学到什么?

标签分布偏斜的代价 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 NLP Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「罕见类别为何会被忽略」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 NLP Academy 课中编写并运行代码吗?

能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 罕见类别为何会被忽略
  2. 重采样与类别权重
  3. 选择阈值与指标
  4. 端到端的不平衡数据流水线
← 返回 NLP Academy