การสร้างสายงานการเตรียมข้อมูล
sklearn Pipeline, ColumnTransformer และการผสานตัวแปลงสำหรับเวิร์กโฟลว์การเตรียมข้อมูลที่เป็นระเบียบ
การสร้างสายงานการเตรียมข้อมูล เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน
เหตุใดจึงใช้กระบวนงาน
กระบวนงานของ scikit-learn เชื่อมขั้นตอนการเตรียมข้อมูลและแบบจำลองไว้ในออบเจ็กต์เดียว รับประกันว่าการแปลงแบบเดียวกันจะถูกใช้กับข้อมูลฝึกและข้อมูลทดสอบ จึงป้องกันข้อมูลรั่วไหลและโค้ดที่ยุ่งยาก
กระบวนงานพื้นฐาน
Pipeline รับรายการของทูเพิล (ชื่อ, ขั้นตอน) การเรียก fit จะดำเนินการแต่ละขั้นตามลำดับ โดยขั้นตอนสุดท้ายมักเป็นตัวประมาณ
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
pipe = Pipeline([
("scale", StandardScaler()),
("model", LogisticRegression()),
])ใช้ fit และ predict กับกระบวนงานทั้งหมด
ให้มองกระบวนงานเสมือนเป็นแบบจำลองเดียว fit จะเรียนรู้ตัวปรับสเกล AND ฝึกแบบจำลอง ส่วน predict จะใช้ตัวปรับสเกลแล้วจึงใช้แบบจำลองโดยอัตโนมัติและสอดคล้องกัน
pipe.fit(X_train, y_train)
preds = pipe.predict(X_test) # scaling applied automaticallyป้องกันข้อมูลรั่วไหลตั้งแต่การออกแบบ
เนื่องจากกระบวนงานจะฝึกตัวปรับสเกลเฉพาะระหว่าง fit (กับข้อมูลฝึก) และเพียงแปลงข้อมูลระหว่าง predict จึงกำจัดข้อผิดพลาดจากการใช้ fit กับข้อมูลทดสอบได้โดยอัตโนมัติ
ชนิดคอลัมน์ผสม
ชุดข้อมูลจริงประกอบด้วยคอลัมน์ NUMERIC และ CATEGORICAL ซึ่งต้องผ่านการเตรียมข้อมูลต่างกัน ColumnTransformer จะใช้ตัวแปลงที่แตกต่างกันกับคอลัมน์แต่ละส่วน
ColumnTransformer
ระบุทูเพิลของ (ชื่อ, ตัวแปลง, คอลัมน์) คอลัมน์ตัวเลขจะถูกปรับสเกล ส่วนคอลัมน์เชิงหมวดหมู่จะถูกเข้ารหัสแบบหนึ่งค่าเป็นหนึ่ง ทั้งหมดนี้ทำในขั้นตอนเดียว
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder
pre = ColumnTransformer([
("num", StandardScaler(), ["age", "income"]),
("cat", OneHotEncoder(handle_unknown="ignore"), ["city"]),
])การซ้อนในกระบวนงานเต็มรูปแบบ
ใส่ ColumnTransformer เป็นขั้นตอนแรกของกระบวนงาน ตามด้วยแบบจำลอง เพื่อให้ได้กระบวนการทำงานที่สมบูรณ์และไม่มีข้อมูลรั่วไหล
full = Pipeline([
("prep", pre),
("model", LogisticRegression()),
])
full.fit(X_train, y_train)การจัดการค่าที่หายไปในขั้นตอน
เพิ่ม SimpleImputer ไว้ภายในแขนงข้อมูลตัวเลข ซึ่งมักเป็นกระบวนงานขนาดเล็กอีกชั้นหนึ่ง เพื่อเติมค่าที่หายไปก่อนปรับสเกล และทำให้ทุกอย่างอยู่ภายในกระบวนงาน
from sklearn.impute import SimpleImputer
num_pipe = Pipeline([
("impute", SimpleImputer(strategy="median")),
("scale", StandardScaler()),
])ใช้ fit_transform กับชุดฝึก และใช้ transform กับชุดทดสอบ
กฎทองเดียวกันนี้ใช้กับกระบวนงานทั้งหมด โดยจะเรียนรู้พารามิเตอร์ทุกตัวจากข้อมูลฝึกระหว่าง fit จากนั้นจะแปลงเฉพาะข้อมูลทดสอบระหว่าง predict หรือ transform
full.fit(X_train, y_train) # learns imputer, scaler, encoder, model
full.predict(X_test) # transform-only pathการบันทึกกระบวนงาน
บันทึกกระบวนงานที่ผ่านการ fit แล้วทั้งหมด ทั้งการเตรียมข้อมูลและแบบจำลอง ลงดิสก์ด้วย joblib เมื่อโหลดกลับมาใช้ภายหลัง ระบบจะใช้การเตรียมข้อมูลแบบเดียวกันในการใช้งานจริงโดยไม่ต้องทำขั้นตอนใดซ้ำด้วยตนเอง
import joblib
joblib.dump(full, "model.joblib")
loaded = joblib.load("model.joblib")
loaded.predict(X_new) # same preprocessing guaranteedเหตุใดเรื่องนี้จึงสำคัญในการใช้งานจริง
กระบวนงานที่บันทึกไว้ทำให้แบบจำลองที่นำไปใช้งานประมวลผลข้อมูลขาเข้า EXACTLY เช่นเดียวกับระหว่างการฝึก ความสอดคล้องนี้เป็นแนวป้องกันที่สำคัญที่สุดต่อข้อผิดพลาดจากความคลาดเคลื่อนระหว่างการฝึกกับการให้บริการ
ตรวจสอบอย่างรวดเร็ว
ทดสอบความรู้เรื่องกระบวนงานของคุณ
ทบทวน
ชุดเครื่องมือกระบวนงาน:
Pipelineเชื่อมการเตรียมข้อมูลและแบบจำลองไว้ในออบเจ็กต์เดียวสำหรับ fit/predict- ไม่มีข้อมูลรั่วไหล: พารามิเตอร์เรียนรู้ด้วย
fitและนำไปใช้ด้วยpredict ColumnTransformerจัดการคอลัมน์ตัวเลข/เชิงหมวดหมู่ผสมกันSimpleImputerใช้จัดการค่าที่หายไปภายในกระบวนงาน- บันทึกด้วย
joblibเพื่อให้การเตรียมข้อมูลในการใช้งานจริงสอดคล้องกัน
คำถามที่พบบ่อย
บทเรียน “การสร้างสายงานการเตรียมข้อมูล” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การสร้างสายงานการเตรียมข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การสร้างสายงานการเตรียมข้อมูล”
sklearn Pipeline, ColumnTransformer และการผสานตัวแปลงสำหรับเวิร์กโฟลว์การเตรียมข้อมูลที่เป็นระเบียบ คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน
บทเรียน “การสร้างสายงานการเตรียมข้อมูล” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม
ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การตรวจจับและนำค่าผิดปกติออก
- การเข้ารหัสตัวแปรเชิงหมวดหมู่
- การปรับสเกลคุณลักษณะ: การทำให้เป็นบรรทัดฐานและมาตรฐาน
- การสร้างสายงานการเตรียมข้อมูล