0Pricing
Python For Kids · บทเรียน

การทำความสะอาดและเตรียมข้อมูล

ทำความเข้าใจวิธีจัดการข้อมูลที่หายไป ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์

การทำความสะอาดและเตรียมข้อมูล เป็นบทเรียน Python For Kids ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python For Kids และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python For Kids มีบทเรียนทั้งหมด 5 บทเรียน

ภาพรวมการทำความสะอาดข้อมูล

การทำความสะอาดและการเตรียมข้อมูลล่วงหน้า

ข้อมูลดิบมักไม่เป็นระเบียบและต้องผ่านการทำความสะอาดและการเตรียมข้อมูลล่วงหน้าก่อนนำไปวิเคราะห์ ขั้นตอนเหล่านี้มีความสำคัญอย่างยิ่งต่อการรับรองคุณภาพและความถูกต้องของการวิเคราะห์

ในบทเรียนนี้ คุณจะได้เรียนรู้เทคนิคการจัดการข้อมูลที่ขาดหาย การลบข้อมูลซ้ำ และการเตรียมข้อมูลสำหรับการวิเคราะห์

การทำความสะอาดและเตรียมข้อมูล — ภาพประกอบ 1

การทำความสะอาดข้อมูลคืออะไร

การทำความสะอาดข้อมูลประกอบด้วยการระบุและแก้ไขข้อผิดพลาดในชุดข้อมูล งานที่พบบ่อย ได้แก่:

  • จัดการค่าที่ขาดหาย
  • ลบข้อมูลซ้ำ
  • ทำให้รูปแบบข้อมูลเป็นมาตรฐานเดียวกัน

การจัดการข้อมูลที่ขาดหาย

ข้อมูลที่ขาดหายอาจเกิดขึ้นได้จากหลายสาเหตุ คุณสามารถจัดการข้อมูลเหล่านี้ได้โดย:

  • เติมค่าที่ขาดหายด้วยค่าเริ่มต้น หรือค่าเฉลี่ย/ค่ามัธยฐาน
  • ลบแถวหรือคอลัมน์ที่มีค่าขาดหายมากเกินไป
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

การลบข้อมูลซ้ำ

ข้อมูลที่ซ้ำกันอาจทำให้ผลการวิเคราะห์คลาดเคลื่อนได้ ใช้ Pandas เพื่อลบข้อมูลซ้ำ:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

การทำข้อมูลให้เป็นมาตรฐาน

การทำข้อมูลให้เป็นมาตรฐานช่วยให้ข้อมูลมีความสอดคล้องกัน ตัวอย่างเช่น คุณสามารถทำรูปแบบวันที่หรือตัวพิมพ์ของข้อความให้เป็นมาตรฐานได้:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

การแปลงข้อมูล

การแปลงข้อมูล เช่น การปรับขนาดและการเข้ารหัส เป็นส่วนหนึ่งของการเตรียมข้อมูลเบื้องต้น:

  • การปรับขนาด: การทำค่าตัวเลขให้เป็นมาตรฐาน
  • การเข้ารหัส: การแปลงข้อมูลเชิงหมวดหมู่ให้อยู่ในรูปแบบตัวเลข
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

การปรับขนาดข้อมูล

การปรับขนาดช่วยให้ข้อมูลตัวเลขอยู่ในมาตราส่วนเดียวกัน ซึ่งเป็นสิ่งสำคัญสำหรับขั้นตอนวิธีการเรียนรู้ของเครื่อง:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

การตรวจสอบข้อมูล

การตรวจสอบช่วยให้มั่นใจว่าข้อมูลเป็นไปตามมาตรฐานคุณภาพ ตัวอย่างเช่น ให้ตรวจหาค่าผิดปกติหรือค่าที่ไม่ถูกต้อง:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

ข้อผิดพลาดที่พบบ่อยในการทำความสะอาดข้อมูล

ต่อไปนี้คือข้อผิดพลาดที่ควรหลีกเลี่ยง:

  • ไม่สนใจข้อมูลที่ขาดหาย ซึ่งนำไปสู่การวิเคราะห์ที่ไม่ถูกต้อง
  • ไม่ทำรูปแบบข้อมูลให้เป็นมาตรฐาน ทำให้ข้อมูลไม่สอดคล้องกัน
  • มองข้ามการตรวจสอบ ทำให้เกิดข้อผิดพลาดในงานขั้นต่อไป

เราได้เรียนรู้อะไรบ้าง

ในบทเรียนนี้ คุณได้เรียนรู้:

  • วิธีจัดการข้อมูลที่ขาดหายและลบข้อมูลซ้ำ
  • วิธีทำข้อมูลให้เป็นมาตรฐาน แปลงข้อมูล และปรับขนาดข้อมูลเพื่อการวิเคราะห์
  • วิธีตรวจสอบคุณภาพข้อมูลและระบุค่าผิดปกติ
  • ความสำคัญของการทำความสะอาดข้อมูลเพื่อให้การวิเคราะห์ถูกต้อง

ทำได้ดีมาก! ไปยังหัวข้อถัดไปกันเลย

การทำความสะอาดและเตรียมข้อมูล — ภาพประกอบ 11

คำถามที่พบบ่อย

บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การทำความสะอาดและเตรียมข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python For Kids ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python For Kids มีบทเรียนทั้งหมด 5 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การทำความสะอาดและเตรียมข้อมูล”

ทำความเข้าใจวิธีจัดการข้อมูลที่หายไป ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์ คุณปฏิบัติ Python For Kids ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python For Kids หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python For Kids บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน

บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Python For Kids นี้ได้ไหม

ได้ บทเรียน Python For Kids ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. วิทยาศาสตร์ข้อมูลคืออะไร
  2. บทบาทของ Python ในวิทยาศาสตร์ข้อมูล
  3. โครงสร้างข้อมูลสำหรับวิทยาศาสตร์ข้อมูล
  4. การทำความสะอาดและเตรียมข้อมูล
  5. การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA)
← กลับไปที่ Python For Kids