0Pricing
Learn AI with Python · บทเรียน

การสร้างสายงานการเตรียมข้อมูล

sklearn Pipeline, ColumnTransformer และการผสานตัวแปลงสำหรับเวิร์กโฟลว์การเตรียมข้อมูลที่เป็นระเบียบ

การสร้างสายงานการเตรียมข้อมูล เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน

เหตุใดจึงใช้กระบวนงาน

กระบวนงานของ scikit-learn เชื่อมขั้นตอนการเตรียมข้อมูลและแบบจำลองไว้ในออบเจ็กต์เดียว รับประกันว่าการแปลงแบบเดียวกันจะถูกใช้กับข้อมูลฝึกและข้อมูลทดสอบ จึงป้องกันข้อมูลรั่วไหลและโค้ดที่ยุ่งยาก

กระบวนงานพื้นฐาน

Pipeline รับรายการของทูเพิล (ชื่อ, ขั้นตอน) การเรียก fit จะดำเนินการแต่ละขั้นตามลำดับ โดยขั้นตอนสุดท้ายมักเป็นตัวประมาณ

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

pipe = Pipeline([
    ("scale", StandardScaler()),
    ("model", LogisticRegression()),
])

ใช้ fit และ predict กับกระบวนงานทั้งหมด

ให้มองกระบวนงานเสมือนเป็นแบบจำลองเดียว fit จะเรียนรู้ตัวปรับสเกล AND ฝึกแบบจำลอง ส่วน predict จะใช้ตัวปรับสเกลแล้วจึงใช้แบบจำลองโดยอัตโนมัติและสอดคล้องกัน

pipe.fit(X_train, y_train)
preds = pipe.predict(X_test)   # scaling applied automatically

ป้องกันข้อมูลรั่วไหลตั้งแต่การออกแบบ

เนื่องจากกระบวนงานจะฝึกตัวปรับสเกลเฉพาะระหว่าง fit (กับข้อมูลฝึก) และเพียงแปลงข้อมูลระหว่าง predict จึงกำจัดข้อผิดพลาดจากการใช้ fit กับข้อมูลทดสอบได้โดยอัตโนมัติ

ชนิดคอลัมน์ผสม

ชุดข้อมูลจริงประกอบด้วยคอลัมน์ NUMERIC และ CATEGORICAL ซึ่งต้องผ่านการเตรียมข้อมูลต่างกัน ColumnTransformer จะใช้ตัวแปลงที่แตกต่างกันกับคอลัมน์แต่ละส่วน

ColumnTransformer

ระบุทูเพิลของ (ชื่อ, ตัวแปลง, คอลัมน์) คอลัมน์ตัวเลขจะถูกปรับสเกล ส่วนคอลัมน์เชิงหมวดหมู่จะถูกเข้ารหัสแบบหนึ่งค่าเป็นหนึ่ง ทั้งหมดนี้ทำในขั้นตอนเดียว

from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder

pre = ColumnTransformer([
    ("num", StandardScaler(), ["age", "income"]),
    ("cat", OneHotEncoder(handle_unknown="ignore"), ["city"]),
])

การซ้อนในกระบวนงานเต็มรูปแบบ

ใส่ ColumnTransformer เป็นขั้นตอนแรกของกระบวนงาน ตามด้วยแบบจำลอง เพื่อให้ได้กระบวนการทำงานที่สมบูรณ์และไม่มีข้อมูลรั่วไหล

full = Pipeline([
    ("prep", pre),
    ("model", LogisticRegression()),
])
full.fit(X_train, y_train)

การจัดการค่าที่หายไปในขั้นตอน

เพิ่ม SimpleImputer ไว้ภายในแขนงข้อมูลตัวเลข ซึ่งมักเป็นกระบวนงานขนาดเล็กอีกชั้นหนึ่ง เพื่อเติมค่าที่หายไปก่อนปรับสเกล และทำให้ทุกอย่างอยู่ภายในกระบวนงาน

from sklearn.impute import SimpleImputer
num_pipe = Pipeline([
    ("impute", SimpleImputer(strategy="median")),
    ("scale", StandardScaler()),
])

ใช้ fit_transform กับชุดฝึก และใช้ transform กับชุดทดสอบ

กฎทองเดียวกันนี้ใช้กับกระบวนงานทั้งหมด โดยจะเรียนรู้พารามิเตอร์ทุกตัวจากข้อมูลฝึกระหว่าง fit จากนั้นจะแปลงเฉพาะข้อมูลทดสอบระหว่าง predict หรือ transform

full.fit(X_train, y_train)        # learns imputer, scaler, encoder, model
full.predict(X_test)              # transform-only path

การบันทึกกระบวนงาน

บันทึกกระบวนงานที่ผ่านการ fit แล้วทั้งหมด ทั้งการเตรียมข้อมูลและแบบจำลอง ลงดิสก์ด้วย joblib เมื่อโหลดกลับมาใช้ภายหลัง ระบบจะใช้การเตรียมข้อมูลแบบเดียวกันในการใช้งานจริงโดยไม่ต้องทำขั้นตอนใดซ้ำด้วยตนเอง

import joblib
joblib.dump(full, "model.joblib")
loaded = joblib.load("model.joblib")
loaded.predict(X_new)   # same preprocessing guaranteed

เหตุใดเรื่องนี้จึงสำคัญในการใช้งานจริง

กระบวนงานที่บันทึกไว้ทำให้แบบจำลองที่นำไปใช้งานประมวลผลข้อมูลขาเข้า EXACTLY เช่นเดียวกับระหว่างการฝึก ความสอดคล้องนี้เป็นแนวป้องกันที่สำคัญที่สุดต่อข้อผิดพลาดจากความคลาดเคลื่อนระหว่างการฝึกกับการให้บริการ

ตรวจสอบอย่างรวดเร็ว

ทดสอบความรู้เรื่องกระบวนงานของคุณ

ทบทวน

ชุดเครื่องมือกระบวนงาน:

  • Pipeline เชื่อมการเตรียมข้อมูลและแบบจำลองไว้ในออบเจ็กต์เดียวสำหรับ fit/predict
  • ไม่มีข้อมูลรั่วไหล: พารามิเตอร์เรียนรู้ด้วย fit และนำไปใช้ด้วย predict
  • ColumnTransformer จัดการคอลัมน์ตัวเลข/เชิงหมวดหมู่ผสมกัน
  • SimpleImputer ใช้จัดการค่าที่หายไปภายในกระบวนงาน
  • บันทึกด้วย joblib เพื่อให้การเตรียมข้อมูลในการใช้งานจริงสอดคล้องกัน

คำถามที่พบบ่อย

บทเรียน “การสร้างสายงานการเตรียมข้อมูล” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การสร้างสายงานการเตรียมข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การสร้างสายงานการเตรียมข้อมูล”

sklearn Pipeline, ColumnTransformer และการผสานตัวแปลงสำหรับเวิร์กโฟลว์การเตรียมข้อมูลที่เป็นระเบียบ คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “การสร้างสายงานการเตรียมข้อมูล” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม

ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การตรวจจับและนำค่าผิดปกติออก
  2. การเข้ารหัสตัวแปรเชิงหมวดหมู่
  3. การปรับสเกลคุณลักษณะ: การทำให้เป็นบรรทัดฐานและมาตรฐาน
  4. การสร้างสายงานการเตรียมข้อมูล
← กลับไปที่ Learn AI with Python