Data Science Academy · บทเรียน

ป่าสุ่มสำหรับการถดถอย

การรวมโมเดลที่ต้านการเรียนรู้เกินพอดี

บทเรียน 4 จาก 413 ขั้นตอน

ป่าสุ่มสำหรับการถดถอย เป็นบทเรียน Data Science Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Data Science Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

ต้นไม้หนึ่งต้น ต้นไม้หลายต้น

ต้นไม้เพียงต้นเดียวไม่มั่นคงและมักฟิตเกิน ป่าสุ่มจะสร้างต้นไม้หลายร้อยต้นแล้วผสานผลเป็นการทำนายเดียวที่มั่นคงกว่า 🌲🌲

ปัญญาจากคนหมู่มาก

ต้นไม้แต่ละต้นเดาของตนเอง จากนั้นป่าจะหาค่าเฉลี่ยของผลลัพธ์ ความผิดพลาดเฉพาะต้นจะหักล้างกัน เหลือเป็นค่าที่ราบรื่นและน่าเชื่อถือกว่า

แถวข้อมูลต่างกันในแต่ละต้น

ต้นไม้แต่ละต้นฝึกด้วยตัวอย่างแถวข้อมูลแบบสุ่มที่สุ่มโดยให้เลือกซ้ำได้ เทคนิคนี้เรียกว่าการสุ่มตัวอย่างแบบบูตสแตรป ทำให้ต้นไม้แต่ละต้นมองข้อมูลแตกต่างกันเล็กน้อย

คุณลักษณะต่างกันในการแบ่งแต่ละครั้ง

ในการแบ่งแต่ละครั้ง ต้นไม้จะเห็นเพียงชุดย่อยของคุณลักษณะแบบสุ่มด้วย ความสุ่มนี้ช่วยไม่ให้ต้นไม้ทุกต้นมีลักษณะเหมือนกัน

เหตุใดความหลากหลายจึงช่วยได้

ความหลากหลายคือหัวใจสำคัญ เมื่อแต่ละต้นไม้ผิดพลาดคนละแบบ การหาค่าเฉลี่ยจะลดการแกว่งรุนแรงของต้นไม้ต้นเดียว ซึ่งช่วยลดความแปรปรวน

ฝึกโมเดลในสองบรรทัด

ใช้หลักการเดิมเช่นเคย สร้าง RandomForestRegressor เรียกใช้ fit แล้ว predict โดยไม่ต้องมีขั้นตอนเพิ่มเติม

from sklearn.ensemble import RandomForestRegressor
model = RandomForestRegressor().fit(X, y)

ควรมีต้นไม้กี่ต้น

การตั้งค่า n_estimators กำหนดจำนวนต้นไม้ที่จะสร้าง โดยทั่วไปต้นไม้ที่มากขึ้นช่วยให้ผลดีขึ้น ก่อนจะเริ่มคงที่ แต่ต้องแลกกับเวลาฝึกที่นานขึ้น

RandomForestRegressor(n_estimators=300)

ยังคงควบคุมความลึก

คุณสามารถจำกัดต้นไม้แต่ละต้นด้วย max_depth ได้เช่นกัน เมื่อใช้ร่วมกับต้นไม้จำนวนมาก ป่าจะยังแม่นยำโดยไม่จดจำสัญญาณรบกวน

RandomForestRegressor(max_depth=8)

ความสำคัญของคุณลักษณะในตัว

ข้อดีที่มีประโยชน์คือ ป่าจะแสดงค่า feature_importances_ เพื่อจัดอันดับว่าอินพุตใดมีอิทธิพลต่อการทำนายมากที่สุด เหมาะสำหรับทำความเข้าใจข้อมูลของคุณ

model.feature_importances_

แข็งแกร่งและใช้งานง่าย

ป่าสุ่มเป็นค่าเริ่มต้นที่ยอดเยี่ยม: แม่นยำ ฟิตเกินได้ยาก และต้องปรับแต่งเพียงเล็กน้อย มักเป็นโมเดลที่แข็งแกร่งตัวแรกสำหรับข้อมูลแบบตาราง

ต้นทุนของพลัง

สิ่งที่ต้องแลกคือความชัดเจน เมื่อต้นไม้มีหลายร้อยต้น คุณจะเสียเส้นทางที่เรียบง่ายและอ่านง่ายของต้นไม้เดียวไป ทำให้ป่าสุ่มอธิบายได้ยากกว่า

ตรวจสอบความเข้าใจอย่างรวดเร็ว

อะไรทำให้ป่าสุ่มเอาชนะต้นไม้ต้นเดียวได้

สรุปทบทวน

ป่าสุ่มหาค่าเฉลี่ยจากต้นไม้ที่หลากหลายหลายต้น ช่วยลดความแปรปรวนและต้านทานการฟิตเกิน เป็นค่าเริ่มต้นที่แข็งแกร่งและต้องปรับแต่งน้อยสำหรับตัวเลขแบบตาราง 🎯

เริ่มต้นได้ฟรี

เรียนรู้ Python ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “ป่าสุ่มสำหรับการถดถอย” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ป่าสุ่มสำหรับการถดถอย” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Data Science Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ป่าสุ่มสำหรับการถดถอย”

การรวมโมเดลที่ต้านการเรียนรู้เกินพอดี คุณปฏิบัติ Data Science Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Data Science Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Data Science Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “ป่าสุ่มสำหรับการถดถอย” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Data Science Academy นี้ได้ไหม

ได้ บทเรียน Data Science Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ทบทวนการถดถอยเชิงเส้น
  2. การทำให้เป็นปกติแบบ Ridge และ Lasso
  3. การถดถอยด้วยต้นไม้ตัดสินใจ
  4. ป่าสุ่มสำหรับการถดถอย
← กลับไปที่ Data Science Academy