构建预处理流程
使用 sklearn Pipeline、ColumnTransformer 组合转换器,构建清晰的预处理工作流
构建预处理流程 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 4 节课。
为什么要使用管道
scikit-learn 的 Pipeline会将预处理步骤和模型串联到一个对象中。它可以确保训练数据和测试数据应用相同的变换,从而避免数据泄漏和杂乱的代码。
基本管道
Pipeline接收一个由(名称、步骤)元组组成的列表。调用 fit时会按顺序运行每个步骤;最后一个步骤通常是估计器。
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
pipe = Pipeline([
("scale", StandardScaler()),
("model", LogisticRegression()),
])对整个管道进行 fit 和 predict
请将管道视为一个模型。fit会学习缩放器的参数 AND 训练模型;predict会先应用缩放器,再应用模型,整个过程自动且保持一致。
pipe.fit(X_train, y_train)
preds = pipe.predict(X_test) # scaling applied automatically通过设计避免数据泄漏
由于管道只在 fit期间(使用训练数据)拟合缩放器,并且只在 predict期间执行变换,因此它会自动消除在测试集上拟合的错误。
混合列类型
真实数据集通常同时包含 NUMERIC 和 CATEGORICAL 列,而它们需要不同的预处理。ColumnTransformer会对每个列子集应用不同的转换器。
ColumnTransformer
请提供由(名称、转换器、列)组成的元组。数值列会进行缩放,类别列会进行独热编码,所有操作都在一个步骤中完成。
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder
pre = ColumnTransformer([
("num", StandardScaler(), ["age", "income"]),
("cat", OneHotEncoder(handle_unknown="ignore"), ["city"]),
])嵌套到完整管道中
将 ColumnTransformer 作为 Pipeline 的第一步,后面接上模型,即可构建完整且无数据泄漏的工作流。
full = Pipeline([
("prep", pre),
("model", LogisticRegression()),
])
full.fit(X_train, y_train)在一个步骤中处理缺失值
请在数值分支中加入 SimpleImputer(通常它本身也是一个小型管道),在缩放前填补缺失值,并将所有操作保留在管道中。
from sklearn.impute import SimpleImputer
num_pipe = Pipeline([
("impute", SimpleImputer(strategy="median")),
("scale", StandardScaler()),
])在训练集上使用 fit_transform,在测试集上使用 transform
同一条黄金规则也适用于整个管道:它会在 fit期间从训练数据中学习所有参数,然后只在 predict或 transform期间转换测试数据。
full.fit(X_train, y_train) # learns imputer, scaler, encoder, model
full.predict(X_test) # transform-only path持久化管道
请使用 joblib将整个已拟合的管道(包括预处理和模型)保存到磁盘。之后加载它时,生产环境会应用完全相同的预处理,无需手动重现任何步骤。
import joblib
joblib.dump(full, "model.joblib")
loaded = joblib.load("model.joblib")
loaded.predict(X_new) # same preprocessing guaranteed这在生产环境中为何重要
持久化管道意味着部署的模型会 EXACTLY 按照训练期间的方式预处理传入数据。这种一致性是防止训练与服务之间出现偏差错误的最重要防线。
快速检查
请测试您对管道的理解。
回顾
管道工具箱:
Pipeline将预处理和模型串联为一个 fit/predict 对象- 不会发生数据泄漏:在
fit中学习参数,在predict中应用参数 ColumnTransformer用于处理混合的数值列和类别列- 在管道中使用
SimpleImputer处理缺失值 - 使用
joblib进行持久化,以确保生产环境中的预处理保持一致
常见问题解答
「构建预处理流程」课时是免费的吗?
是的 — 「构建预处理流程」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 4 节课。
「构建预处理流程」这节课中我会学到什么?
使用 sklearn Pipeline、ColumnTransformer 组合转换器,构建清晰的预处理工作流 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Learn AI with Python 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「构建预处理流程」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Learn AI with Python 课中编写并运行代码吗?
能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 异常值检测与移除
- 分类变量编码
- 特征缩放:归一化与标准化
- 构建预处理流程