Data Science Academy · บทเรียน

เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง

ออบเจ็กต์เดียวสำหรับการแปลงและโมเดล

บทเรียน 1 จาก 413 ขั้นตอน

เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง เป็นบทเรียน Data Science Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Data Science Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

ความยุ่งยากจากการทำด้วยตนเอง

การปรับสเกล การเข้ารหัส แล้วจึงฟิตโมเดลด้วยตนเอง หมายถึงต้องจัดการวัตถุหลายรายการให้ถูกลำดับ กระบวนการทำงาน ช่วยยุติความยุ่งยากนี้

กระบวนการทำงานคืออะไร

กระบวนการทำงาน ของ scikit-learn จะเชื่อมการแปลงข้อมูลกับโมเดลสุดท้ายให้เป็นวัตถุเดียว ซึ่งเรียกใช้แต่ละขั้นตอนตามลำดับให้คุณโดยอัตโนมัติ 🔗

สร้างในบรรทัดเดียว

คุณส่งรายการขั้นตอนที่มีชื่อให้กับ กระบวนการทำงาน โดยลงท้ายด้วยตัวประมาณค่า ขั้นตอนสุดท้ายคือโมเดล ส่วนขั้นตอนที่เหลือคือตัวแปลงข้อมูล

from sklearn.pipeline import Pipeline
pipe = Pipeline([('scale', StandardScaler()), ('model', LogisticRegression())])

fit เรียกใช้ทุกขั้นตอน

การเรียก fit บนกระบวนการทำงานจะฟิตตัวแปลงแต่ละตัวตามลำดับ แล้วจึงฟิตโมเดลสุดท้ายกับข้อมูลที่ผ่านการแปลงแล้ว การเรียกครั้งเดียวจัดการทุกอย่าง

pipe.fit(X_train, y_train)

predict นำขั้นตอนเดิมกลับมาใช้

เมื่อคุณเรียก predict การแปลงแบบเดิมจะทำงานกับข้อมูลใหม่ก่อนที่โมเดลจะเห็นข้อมูลนั้น ขั้นตอนเตรียมข้อมูลของคุณจึงไม่ถูกลืม

preds = pipe.predict(X_test)

ไม่มีข้อมูลรั่วไหลอีกต่อไป

กระบวนการทำงานจะเรียนรู้การปรับสเกลและการเข้ารหัสจากข้อมูลฝึกเท่านั้น จึงไม่มีข้อมูลทดสอบแอบเข้ามาได้ วิธีนี้หยุด การรั่วไหลของข้อมูล ได้ตั้งแต่การออกแบบ

วัตถุเดียวที่พกพาได้

เนื่องจากการเตรียมข้อมูลและโมเดลอยู่ด้วยกัน คุณจึงบันทึก แชร์ และโหลดวัตถุ เดียว กลับมาใช้ได้ แทนการจัดการชิ้นส่วนแยกกันห้าชิ้น

ทางลัด make_pipeline

หากคุณไม่จำเป็นต้องตั้งชื่อขั้นตอน make_pipeline จะสร้างสิ่งเดียวกันและตั้งชื่อขั้นตอนให้โดยอัตโนมัติ

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), LogisticRegression())

เข้าถึงขั้นตอนด้วยชื่อ

ต้องการตรวจสอบขั้นตอนใดขั้นตอนหนึ่งหรือไม่ โปรดใช้ชื่อที่คุณตั้งไว้เพื่อทำดัชนีใน ขั้นตอนที่มีชื่อ และดึงวัตถุที่ฟิตแล้วออกมา

coefs = pipe.named_steps['model'].coef_

ทำงานร่วมกับการตรวจสอบไขว้ได้ดี

กระบวนการทำงานทำหน้าที่เหมือนตัวประมาณค่าเดียว คุณจึงนำไปใส่ใน คะแนนการตรวจสอบไขว้ ได้โดยตรง และการเตรียมข้อมูลจะไม่รั่วไหลในแต่ละส่วนแบ่ง

โค้ดสะอาดและปลอดภัยกว่า

ข้อดีสำคัญคือมีส่วนประกอบที่ต้องจัดการน้อยลง ได้แก่ fit หนึ่งครั้ง predict หนึ่งครั้ง และการเตรียมข้อมูลที่ตรงกับโมเดลเสมอ นี่คือ การทำซ้ำผลลัพธ์ได้ที่คุณไว้วางใจได้

ตรวจสอบอย่างรวดเร็ว

เหตุใดการรวมการเตรียมข้อมูลกับโมเดลไว้ในกระบวนการทำงานจึงป้องกันการรั่วไหลของข้อมูลได้

สรุปทบทวน

คุณได้เรียนรู้ว่า กระบวนการทำงาน เชื่อมการแปลงข้อมูลกับโมเดลให้เป็นวัตถุเดียวที่เป็นระเบียบ ได้แก่ fit หนึ่งครั้ง predict หนึ่งครั้ง และไม่มีข้อมูลรั่วไหล ต่อไปคือประเภทคอลัมน์ที่หลากหลาย 🎯

เริ่มต้นได้ฟรี

เรียนรู้ Python ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Data Science Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง”

ออบเจ็กต์เดียวสำหรับการแปลงและโมเดล คุณปฏิบัติ Data Science Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Data Science Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Data Science Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Data Science Academy นี้ได้ไหม

ได้ บทเรียน Data Science Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง
  2. ColumnTransformer สำหรับชนิดข้อมูลผสม
  3. ปรับแต่งด้วย GridSearchCV
  4. บันทึกและโหลดไปป์ไลน์ที่ฝึกแล้ว
← กลับไปที่ Data Science Academy