保存并重新加载训练好的流水线
使用 joblib 持久化模型
保存并重新加载训练好的流水线 是 CoddyKit 上的免费 Data Science Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Data Science Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Data Science Academy 课程共包含 4 节课。
训练一次就够了
您已经花时间拟合并调整了流水线。保存它之后,就不必为了进行预测而再次训练。💾
将流水线序列化
拟合后的流水线是一个 Python 对象,因此您可以将其序列化到磁盘,并原样恢复。
为什么 joblib 更好
对于包含大量 NumPy 数组的 scikit-learn 对象,joblib比普通 pickle 更快、占用空间更小,因此通常是默认选择。
import joblib一次调用即可保存
将拟合后的流水线和文件名传给joblib.dump。整个预处理加模型的链条都会保存到一个文件中。
joblib.dump(pipe, 'model.joblib')重新加载
之后,在任何脚本中调用joblib.load都能恢复完全相同的流水线,无需重新训练即可进行预测。
pipe = joblib.load('model.joblib')立即进行预测
重新加载的对象仍然记得学到的缩放参数和权重,因此您可以立即对新数据调用predict。
preds = pipe.predict(new_data)匹配您的版本
如果在不同的库版本下加载,保存的模型可能无法正常工作。请记录训练时使用的scikit-learn版本。
输入相同的列
新数据必须包含与训练数据相同的列,而且顺序也必须相同。流水线需要完全一致的数据结构才能正确进行转换。
只信任自己的文件
加载 pickle 文件会执行其中的代码,因此绝不要打开来自不可信来源的文件。请将模型文件视为可执行文件。
部署到生产环境
您的 Web 应用或批处理任务会加载这个文件来提供预测结果。保存整个流水线可以让部署更加简单。
一个完整包,无意外
由于预处理和模型一起保存,部署后的流水线会以训练时相同的方式转换输入。不会发生漂移,也不会不匹配。
快速检查
将拟合后的 scikit-learn 流水线保存到磁盘时,首选哪个工具?
回顾
现在,您可以使用joblib保存训练好的流水线,并在任何地方重新加载它来立即进行预测。至此,您已经完整了解了流水线。🎉
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「保存并重新加载训练好的流水线」课时是免费的吗?
是的 — 「保存并重新加载训练好的流水线」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Data Science Academy 课程的其余内容,请升级到 CoddyKit PRO。 Data Science Academy 课程共包含 4 节课。
「保存并重新加载训练好的流水线」这节课中我会学到什么?
使用 joblib 持久化模型 你通过在浏览器中直接运行的动手代码来练习 Data Science Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Data Science Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Data Science Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「保存并重新加载训练好的流水线」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Data Science Academy 课中编写并运行代码吗?
能。每节 Data Science Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 为什么流水线胜过手动步骤
- 用于混合类型的 ColumnTransformer
- 使用 GridSearchCV 调参
- 保存并重新加载训练好的流水线