K 折交叉验证
对各折的评分求平均
K 折交叉验证 是 CoddyKit 上的免费 Data Science Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Data Science Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Data Science Academy 课程共包含 4 节课。
一次划分,一个隐患
单次训练集/测试集划分只能得到一个分数。如果这次划分恰好有利或不利,您的估计可能会误导您。
核心思想
交叉验证会多次重复使用数据,每轮在不同的数据片段上进行测试,然后对分数取平均,从而得到更稳定的估计。
划分为多个折
您可以将数据切分成 k 个大小相等的部分,称为折。常见的选择是五折,也就是进行五轮独立的测试。
轮换测试折
每一轮中,一个折会成为测试集,其余 k-1 个折用于训练模型。然后将测试折轮换到下一个折。
每一部分都有机会
经过 k 轮后,每一行数据恰好被测试一次,其余时间都用于训练。没有数据会被浪费。🔄
对分数取平均
最后您会得到 k 个分数,每个折对应一个分数。它们的平均值是主要的性能估计,而分数的分散程度则体现模型的稳定性。
快速做法
scikit-learn 会替您完成循环。辅助函数 cross_val_score 通过一行代码返回每个折对应的一个分数。
from sklearn.model_selection import cross_val_score
scores = cross_val_score(model, X, y, cv=5)读取结果
返回的数组包含每个折的分数。对它使用 mean 可以得到主要估计值,再通过标准差判断结果的可靠性。
print(scores.mean(), scores.std())选择 k
五折或十折都很常见。折数越多,每轮训练使用的数据越多,但需要的计算资源也越多,因此这是速度与稳定性之间的权衡。
保持类别平衡
对于分类问题,请使用 StratifiedKFold,使每个折都反映整体的类别比例。scikit-learn 会自动对分类器采用这种方式。
留出最终测试集
交叉验证可以在开发过程中帮助您选择模型。但仍应保留一个未接触过的测试集,在最后只使用一次,以获得诚实的分数。
快速检查
在五折交叉验证中,每一行数据会被测试多少次?
回顾
将数据划分为 k 个折,轮换测试折,并对分数取平均以获得可靠的估计。使用 cross_val_score,然后再进行最终留出测试。🔄
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「K 折交叉验证」课时是免费的吗?
是的 — 「K 折交叉验证」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Data Science Academy 课程的其余内容,请升级到 CoddyKit PRO。 Data Science Academy 课程共包含 4 节课。
「K 折交叉验证」这节课中我会学到什么?
对各折的评分求平均 你通过在浏览器中直接运行的动手代码来练习 Data Science Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Data Science Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Data Science Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「K 折交叉验证」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Data Science Academy 课中编写并运行代码吗?
能。每节 Data Science Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。