Data Science Academy · 课时

K 折交叉验证

对各折的评分求平均

第 3 / 4 课13 个步骤

K 折交叉验证 是 CoddyKit 上的免费 Data Science Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Data Science Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Data Science Academy 课程共包含 4 节课。

一次划分,一个隐患

单次训练集/测试集划分只能得到一个分数。如果这次划分恰好有利或不利,您的估计可能会误导您。

核心思想

交叉验证会多次重复使用数据,每轮在不同的数据片段上进行测试,然后对分数取平均,从而得到更稳定的估计。

划分为多个折

您可以将数据切分成 k 个大小相等的部分,称为折。常见的选择是五折,也就是进行五轮独立的测试。

轮换测试折

每一轮中,一个折会成为测试集,其余 k-1 个折用于训练模型。然后将测试折轮换到下一个折。

每一部分都有机会

经过 k 轮后,每一行数据恰好被测试一次,其余时间都用于训练。没有数据会被浪费。🔄

对分数取平均

最后您会得到 k 个分数,每个折对应一个分数。它们的平均值是主要的性能估计,而分数的分散程度则体现模型的稳定性。

快速做法

scikit-learn 会替您完成循环。辅助函数 cross_val_score 通过一行代码返回每个折对应的一个分数。

from sklearn.model_selection import cross_val_score
scores = cross_val_score(model, X, y, cv=5)

读取结果

返回的数组包含每个折的分数。对它使用 mean 可以得到主要估计值,再通过标准差判断结果的可靠性。

print(scores.mean(), scores.std())

选择 k

五折或十折都很常见。折数越多,每轮训练使用的数据越多,但需要的计算资源也越多,因此这是速度与稳定性之间的权衡。

保持类别平衡

对于分类问题,请使用 StratifiedKFold,使每个折都反映整体的类别比例。scikit-learn 会自动对分类器采用这种方式。

留出最终测试集

交叉验证可以在开发过程中帮助您选择模型。但仍应保留一个未接触过的测试集,在最后只使用一次,以获得诚实的分数。

快速检查

在五折交叉验证中,每一行数据会被测试多少次?

回顾

将数据划分为 k 个折,轮换测试折,并对分数取平均以获得可靠的估计。使用 cross_val_score,然后再进行最终留出测试。🔄

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「K 折交叉验证」课时是免费的吗?

是的 — 「K 折交叉验证」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Data Science Academy 课程的其余内容,请升级到 CoddyKit PRO。 Data Science Academy 课程共包含 4 节课。

「K 折交叉验证」这节课中我会学到什么?

对各折的评分求平均 你通过在浏览器中直接运行的动手代码来练习 Data Science Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Data Science Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Data Science Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「K 折交叉验证」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Data Science Academy 课中编写并运行代码吗?

能。每节 Data Science Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 为什么要留出测试集
  2. 正确使用 train_test_split
  3. K 折交叉验证
  4. 在数据泄漏发生前阻止它
← 返回 Data Science Academy