เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง
ออบเจ็กต์เดียวสำหรับการแปลงและโมเดล
เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง เป็นบทเรียน Data Science Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Data Science Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน
ความยุ่งยากจากการทำด้วยตนเอง
การปรับสเกล การเข้ารหัส แล้วจึงฟิตโมเดลด้วยตนเอง หมายถึงต้องจัดการวัตถุหลายรายการให้ถูกลำดับ กระบวนการทำงาน ช่วยยุติความยุ่งยากนี้
กระบวนการทำงานคืออะไร
กระบวนการทำงาน ของ scikit-learn จะเชื่อมการแปลงข้อมูลกับโมเดลสุดท้ายให้เป็นวัตถุเดียว ซึ่งเรียกใช้แต่ละขั้นตอนตามลำดับให้คุณโดยอัตโนมัติ 🔗
สร้างในบรรทัดเดียว
คุณส่งรายการขั้นตอนที่มีชื่อให้กับ กระบวนการทำงาน โดยลงท้ายด้วยตัวประมาณค่า ขั้นตอนสุดท้ายคือโมเดล ส่วนขั้นตอนที่เหลือคือตัวแปลงข้อมูล
from sklearn.pipeline import Pipeline
pipe = Pipeline([('scale', StandardScaler()), ('model', LogisticRegression())])fit เรียกใช้ทุกขั้นตอน
การเรียก fit บนกระบวนการทำงานจะฟิตตัวแปลงแต่ละตัวตามลำดับ แล้วจึงฟิตโมเดลสุดท้ายกับข้อมูลที่ผ่านการแปลงแล้ว การเรียกครั้งเดียวจัดการทุกอย่าง
pipe.fit(X_train, y_train)predict นำขั้นตอนเดิมกลับมาใช้
เมื่อคุณเรียก predict การแปลงแบบเดิมจะทำงานกับข้อมูลใหม่ก่อนที่โมเดลจะเห็นข้อมูลนั้น ขั้นตอนเตรียมข้อมูลของคุณจึงไม่ถูกลืม
preds = pipe.predict(X_test)ไม่มีข้อมูลรั่วไหลอีกต่อไป
กระบวนการทำงานจะเรียนรู้การปรับสเกลและการเข้ารหัสจากข้อมูลฝึกเท่านั้น จึงไม่มีข้อมูลทดสอบแอบเข้ามาได้ วิธีนี้หยุด การรั่วไหลของข้อมูล ได้ตั้งแต่การออกแบบ
วัตถุเดียวที่พกพาได้
เนื่องจากการเตรียมข้อมูลและโมเดลอยู่ด้วยกัน คุณจึงบันทึก แชร์ และโหลดวัตถุ เดียว กลับมาใช้ได้ แทนการจัดการชิ้นส่วนแยกกันห้าชิ้น
ทางลัด make_pipeline
หากคุณไม่จำเป็นต้องตั้งชื่อขั้นตอน make_pipeline จะสร้างสิ่งเดียวกันและตั้งชื่อขั้นตอนให้โดยอัตโนมัติ
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), LogisticRegression())เข้าถึงขั้นตอนด้วยชื่อ
ต้องการตรวจสอบขั้นตอนใดขั้นตอนหนึ่งหรือไม่ โปรดใช้ชื่อที่คุณตั้งไว้เพื่อทำดัชนีใน ขั้นตอนที่มีชื่อ และดึงวัตถุที่ฟิตแล้วออกมา
coefs = pipe.named_steps['model'].coef_ทำงานร่วมกับการตรวจสอบไขว้ได้ดี
กระบวนการทำงานทำหน้าที่เหมือนตัวประมาณค่าเดียว คุณจึงนำไปใส่ใน คะแนนการตรวจสอบไขว้ ได้โดยตรง และการเตรียมข้อมูลจะไม่รั่วไหลในแต่ละส่วนแบ่ง
โค้ดสะอาดและปลอดภัยกว่า
ข้อดีสำคัญคือมีส่วนประกอบที่ต้องจัดการน้อยลง ได้แก่ fit หนึ่งครั้ง predict หนึ่งครั้ง และการเตรียมข้อมูลที่ตรงกับโมเดลเสมอ นี่คือ การทำซ้ำผลลัพธ์ได้ที่คุณไว้วางใจได้
ตรวจสอบอย่างรวดเร็ว
เหตุใดการรวมการเตรียมข้อมูลกับโมเดลไว้ในกระบวนการทำงานจึงป้องกันการรั่วไหลของข้อมูลได้
สรุปทบทวน
คุณได้เรียนรู้ว่า กระบวนการทำงาน เชื่อมการแปลงข้อมูลกับโมเดลให้เป็นวัตถุเดียวที่เป็นระเบียบ ได้แก่ fit หนึ่งครั้ง predict หนึ่งครั้ง และไม่มีข้อมูลรั่วไหล ต่อไปคือประเภทคอลัมน์ที่หลากหลาย 🎯
เรียนรู้ Python ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 30
- บทเรียน
- 120
คำถามที่พบบ่อย
บทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Data Science Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง”
ออบเจ็กต์เดียวสำหรับการแปลงและโมเดล คุณปฏิบัติ Data Science Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Data Science Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Data Science Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Data Science Academy นี้ได้ไหม
ได้ บทเรียน Data Science Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- เหตุใดไปป์ไลน์จึงดีกว่าขั้นตอนทำเอง
- ColumnTransformer สำหรับชนิดข้อมูลผสม
- ปรับแต่งด้วย GridSearchCV
- บันทึกและโหลดไปป์ไลน์ที่ฝึกแล้ว