0Pricing
Learn AI with Python · 课时

构建预处理流程

使用 sklearn Pipeline、ColumnTransformer 组合转换器,构建清晰的预处理工作流

构建预处理流程 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 4 节课。

为什么要使用管道

scikit-learn 的 Pipeline会将预处理步骤和模型串联到一个对象中。它可以确保训练数据和测试数据应用相同的变换,从而避免数据泄漏和杂乱的代码。

基本管道

Pipeline接收一个由(名称、步骤)元组组成的列表。调用 fit时会按顺序运行每个步骤;最后一个步骤通常是估计器。

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

pipe = Pipeline([
    ("scale", StandardScaler()),
    ("model", LogisticRegression()),
])

对整个管道进行 fit 和 predict

请将管道视为一个模型。fit会学习缩放器的参数 AND 训练模型;predict会先应用缩放器,再应用模型,整个过程自动且保持一致。

pipe.fit(X_train, y_train)
preds = pipe.predict(X_test)   # scaling applied automatically

通过设计避免数据泄漏

由于管道只在 fit期间(使用训练数据)拟合缩放器,并且只在 predict期间执行变换,因此它会自动消除在测试集上拟合的错误。

混合列类型

真实数据集通常同时包含 NUMERIC 和 CATEGORICAL 列,而它们需要不同的预处理。ColumnTransformer会对每个列子集应用不同的转换器。

ColumnTransformer

请提供由(名称、转换器、列)组成的元组。数值列会进行缩放,类别列会进行独热编码,所有操作都在一个步骤中完成。

from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder

pre = ColumnTransformer([
    ("num", StandardScaler(), ["age", "income"]),
    ("cat", OneHotEncoder(handle_unknown="ignore"), ["city"]),
])

嵌套到完整管道中

将 ColumnTransformer 作为 Pipeline 的第一步,后面接上模型,即可构建完整且无数据泄漏的工作流。

full = Pipeline([
    ("prep", pre),
    ("model", LogisticRegression()),
])
full.fit(X_train, y_train)

在一个步骤中处理缺失值

请在数值分支中加入 SimpleImputer(通常它本身也是一个小型管道),在缩放前填补缺失值,并将所有操作保留在管道中。

from sklearn.impute import SimpleImputer
num_pipe = Pipeline([
    ("impute", SimpleImputer(strategy="median")),
    ("scale", StandardScaler()),
])

在训练集上使用 fit_transform,在测试集上使用 transform

同一条黄金规则也适用于整个管道:它会在 fit期间从训练数据中学习所有参数,然后只在 predict或 transform期间转换测试数据。

full.fit(X_train, y_train)        # learns imputer, scaler, encoder, model
full.predict(X_test)              # transform-only path

持久化管道

请使用 joblib将整个已拟合的管道(包括预处理和模型)保存到磁盘。之后加载它时,生产环境会应用完全相同的预处理,无需手动重现任何步骤。

import joblib
joblib.dump(full, "model.joblib")
loaded = joblib.load("model.joblib")
loaded.predict(X_new)   # same preprocessing guaranteed

这在生产环境中为何重要

持久化管道意味着部署的模型会 EXACTLY 按照训练期间的方式预处理传入数据。这种一致性是防止训练与服务之间出现偏差错误的最重要防线。

快速检查

请测试您对管道的理解。

回顾

管道工具箱:

  • Pipeline将预处理和模型串联为一个 fit/predict 对象
  • 不会发生数据泄漏:在 fit中学习参数,在 predict中应用参数
  • ColumnTransformer用于处理混合的数值列和类别列
  • 在管道中使用 SimpleImputer处理缺失值
  • 使用 joblib进行持久化,以确保生产环境中的预处理保持一致

常见问题解答

「构建预处理流程」课时是免费的吗?

是的 — 「构建预处理流程」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 4 节课。

「构建预处理流程」这节课中我会学到什么?

使用 sklearn Pipeline、ColumnTransformer 组合转换器,构建清晰的预处理工作流 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Learn AI with Python 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「构建预处理流程」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Learn AI with Python 课中编写并运行代码吗?

能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 异常值检测与移除
  2. 分类变量编码
  3. 特征缩放:归一化与标准化
  4. 构建预处理流程
← 返回 Learn AI with Python