0Pricing
Data Science Academy · บทเรียน

ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน

จัดคุณลักษณะให้อยู่บนมาตรฐานเดียวกัน

ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน เป็นบทเรียน Data Science Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Data Science Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

เหตุผลที่ต้องปรับสเกลตัวเลข

อายุมีช่วงตั้งแต่ 0 ถึง 90 ส่วนรายได้อาจสูงถึงหลักล้าน หากไม่ทำ การปรับสเกล ตัวเลขที่ใหญ่กว่าจะครอบงำและกลบตัวเลขที่เล็กกว่าโดยไม่รู้ตัว ⚖️

แบบจำลองที่ใช้ระยะทางให้ความสำคัญ

แบบจำลองที่วัด ระยะทาง เช่น k-NN และ k-means ไวต่อสเกลมาก คุณลักษณะที่ไม่ปรับสเกลจะมอบอิทธิพลทั้งหมดให้คอลัมน์ที่มีค่ามากที่สุด

การทำให้เป็นมาตรฐาน

การทำให้เป็นมาตรฐาน จะปรับคอลัมน์ให้มีค่าเฉลี่ยเป็น 0 และส่วนเบี่ยงเบนมาตรฐานเป็น 1 ค่าต่าง ๆ จะแสดงว่าห่างจากค่าเฉลี่ยกี่ส่วนเบี่ยงเบนมาตรฐาน

StandardScaler

StandardScaler จะทำการทำให้เป็นมาตรฐานให้คุณ เพียงใช้ fit กับข้อมูลของคุณ แล้วใช้ transform เพื่อเปลี่ยนคอลัมน์ใด ๆ ให้เป็นค่าคะแนน z

from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])

การทำให้อยู่ในช่วงมาตรฐาน

การทำให้อยู่ในช่วงมาตรฐาน จะบีบค่าต่าง ๆ ให้อยู่ในช่วงคงที่ โดยปกติคือ 0 ถึง 1 ค่าต่ำสุดจะถูกแปลงเป็น 0 และค่าสูงสุดเป็น 1

MinMaxScaler

เลือกใช้ MinMaxScaler เพื่อปรับค่าให้อยู่ในช่วง 0 ถึง 1 วิธีนี้รักษารูปแบบของข้อมูลไว้พร้อมจำกัดขอบเขตของช่วงค่า

from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])

ทำให้เป็นมาตรฐานหรือปรับให้อยู่ในช่วง

ใช้ การทำให้เป็นมาตรฐาน เมื่อข้อมูลมีรูปทรงคล้ายระฆังคว่ำหรือมีค่าผิดปกติ เลือกการทำให้อยู่ในช่วงเมื่อจำเป็นต้องจำกัดค่าอย่างเคร่งครัดให้อยู่ระหว่าง 0 ถึง 1

ค่าผิดปกติส่งผลเสียต่อ MinMax

ค่าใหญ่มากเพียงค่าเดียวอาจบีบค่าที่เหลือให้เข้าใกล้ศูนย์เมื่อใช้ MinMax เมื่อ ค่าผิดปกติ ครอบงำข้อมูล RobustScaler จะรับมือได้ดีกว่า

from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])

ใช้ fit กับข้อมูลฝึกเท่านั้น

ใช้ fit กับตัวปรับสเกลโดยใช้เฉพาะข้อมูลฝึก จากนั้นใช้ transform กับชุดข้อมูลทดสอบ การใช้ fit กับข้อมูลทั้งหมดทำให้ข้อมูลจาก test รั่วไหลเข้าไปในแบบจำลอง

scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)

ปรับสเกลภายในกระบวนการทำงาน

รวมตัวปรับสเกลกับแบบจำลองไว้ใน กระบวนการทำงาน จากนั้นระบบจะใช้ fit เฉพาะกับส่วนข้อมูลฝึกระหว่างการตรวจสอบไขว้ จึงป้องกันข้อมูลรั่วไหลได้โดยอัตโนมัติ

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)

ต้นไม้ไม่จำเป็นต้องปรับสเกล

แบบจำลองที่ใช้ต้นไม้ เช่น ป่าสุ่ม จะแบ่งข้อมูลตามค่าเกณฑ์ ดังนั้นการปรับสเกลจึงแทบไม่เปลี่ยนผลลัพธ์ ควรเก็บการปรับสเกลไว้สำหรับวิธีที่ใช้ ระยะทาง และวิธีเชิงเส้น

ตรวจสอบอย่างรวดเร็ว

คุณต้องการปรับสเกลคุณลักษณะทุกตัวให้อยู่ในช่วง 0 ถึง 1 อย่างเคร่งครัด ควรใช้ตัวปรับสเกลใด

สรุป: การปรับสเกล

คุณทำให้คุณลักษณะต่าง ๆ อยู่บนพื้นฐานที่เท่าเทียมกันแล้ว: ใช้ StandardScaler สำหรับค่าคะแนน z, MinMaxScaler สำหรับช่วง 0 ถึง 1 และ RobustScaler สำหรับค่าผิดปกติ ใช้ fit กับข้อมูลฝึกเท่านั้นเสมอ 🎉

คำถามที่พบบ่อย

บทเรียน “ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Data Science Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Data Science Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน”

จัดคุณลักษณะให้อยู่บนมาตรฐานเดียวกัน คุณปฏิบัติ Data Science Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Data Science Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Data Science Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Data Science Academy นี้ได้ไหม

ได้ บทเรียน Data Science Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. แบ่งตัวเลขเป็นหมวดหมู่
  2. เข้ารหัสคอลัมน์เชิงหมวดหมู่
  3. ปรับสเกลและทำตัวเลขให้เป็นมาตรฐาน
  4. สร้างคุณลักษณะจากวันที่และข้อความ
← กลับไปที่ Data Science Academy