0Pricing
Python Academy · บทเรียน

การทำความสะอาดและเตรียมข้อมูล

ทำความเข้าใจวิธีจัดการข้อมูลที่ขาดหาย ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์

การทำความสะอาดและเตรียมข้อมูล เป็นบทเรียน Python Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน

ภาพรวมการทำความสะอาดข้อมูล

การทำความสะอาดและการเตรียมข้อมูลเบื้องต้น

ข้อมูลดิบมักไม่เป็นระเบียบและจำเป็นต้องผ่านการทำความสะอาดและการเตรียมข้อมูลเบื้องต้นก่อนนำไปวิเคราะห์ ขั้นตอนเหล่านี้มีความสำคัญอย่างยิ่งต่อการรับรองคุณภาพและความถูกต้องของการวิเคราะห์

ในบทเรียนนี้ คุณจะได้เรียนรู้เทคนิคการจัดการข้อมูลที่หายไป การลบข้อมูลซ้ำ และการเตรียมข้อมูลสำหรับการวิเคราะห์

การทำความสะอาดและเตรียมข้อมูล — ภาพประกอบ 1

การทำความสะอาดข้อมูลคืออะไร

การทำความสะอาดข้อมูลคืออะไร

การทำความสะอาดข้อมูลคือการตรวจหาและแก้ไขข้อผิดพลาดในชุดข้อมูล งานทั่วไปที่ทำ ได้แก่:

  • การจัดการค่าที่หายไป
  • การลบข้อมูลซ้ำ
  • การทำให้รูปแบบเป็นมาตรฐาน

การจัดการข้อมูลที่หายไป

การจัดการข้อมูลที่หายไป

ข้อมูลที่หายไปอาจเกิดขึ้นได้จากหลายสาเหตุ คุณสามารถจัดการข้อมูลเหล่านี้ได้โดย:

  • เติมค่าที่หายไปด้วยค่าเริ่มต้น ค่า mean หรือค่ามัธยฐาน
  • ลบแถวหรือคอลัมน์ที่มีค่าที่หายไปมากเกินไป
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

การลบข้อมูลซ้ำ

การลบข้อมูลซ้ำ

ข้อมูลซ้ำอาจทำให้ผลการวิเคราะห์คลาดเคลื่อน ใช้ Pandas เพื่อลบข้อมูลซ้ำ:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

การทำข้อมูลให้เป็นมาตรฐาน

การทำข้อมูลให้เป็นมาตรฐาน

การทำข้อมูลให้เป็นมาตรฐานช่วยให้ข้อมูลมีความสอดคล้องกัน ตัวอย่างเช่น คุณสามารถทำให้รูปแบบวันที่หรือรูปแบบตัวพิมพ์ของข้อความเป็นมาตรฐานได้:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

การแปลงข้อมูล

การแปลงข้อมูล

การแปลงข้อมูล เช่น การปรับมาตราส่วนและการเข้ารหัส เป็นส่วนหนึ่งของการเตรียมข้อมูลเบื้องต้น:

  • การปรับมาตราส่วน: การทำให้ค่าตัวเลขเป็นมาตรฐาน
  • การเข้ารหัส: การแปลงข้อมูลเชิงหมวดหมู่ให้อยู่ในรูปแบบตัวเลข
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

การปรับมาตราส่วนข้อมูล

การปรับมาตราส่วนข้อมูล

การปรับมาตราส่วนช่วยให้ข้อมูลเชิงตัวเลขอยู่ในมาตราส่วนเดียวกัน ซึ่งเป็นสิ่งจำเป็นสำหรับขั้นตอนวิธีการเรียนรู้ของเครื่อง:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

การตรวจสอบความถูกต้องของข้อมูล

การตรวจสอบความถูกต้องของข้อมูล

การตรวจสอบความถูกต้องช่วยให้มั่นใจได้ว่าข้อมูลเป็นไปตามมาตรฐานคุณภาพ ตัวอย่างเช่น ให้ตรวจหาค่าผิดปกติหรือค่าที่ไม่ถูกต้อง:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

ข้อผิดพลาดทั่วไปในการทำความสะอาดข้อมูล

ข้อผิดพลาดทั่วไปในการทำความสะอาดข้อมูล

ต่อไปนี้คือข้อผิดพลาดบางประการที่ควรหลีกเลี่ยง:

  • เพิกเฉยต่อข้อมูลที่ขาดหาย ซึ่งทำให้การวิเคราะห์ไม่แม่นยำ
  • ไม่ทำให้รูปแบบเป็นมาตรฐาน ซึ่งก่อให้เกิดความไม่สอดคล้องกัน
  • มองข้ามการตรวจสอบความถูกต้อง ซึ่งทำให้เกิดข้อผิดพลาดในงานขั้นตอนถัดไป

เราได้เรียนรู้อะไรบ้าง

เราได้เรียนรู้อะไรบ้าง

ในบทเรียนนี้ คุณได้เรียนรู้:

  • วิธีจัดการข้อมูลที่ขาดหายและลบข้อมูลซ้ำ
  • วิธีทำให้ข้อมูลเป็นมาตรฐาน แปลงข้อมูล และปรับมาตราส่วนข้อมูลสำหรับการวิเคราะห์
  • วิธีตรวจสอบคุณภาพข้อมูลและระบุค่าผิดปกติ
  • ความสำคัญของการทำความสะอาดข้อมูลต่อการวิเคราะห์ที่แม่นยำ

ทำได้ดีมาก! ไปต่อที่หัวข้อถัดไปกันเถอะ

การทำความสะอาดและเตรียมข้อมูล — ภาพประกอบ 11

คำถามที่พบบ่อย

บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การทำความสะอาดและเตรียมข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การทำความสะอาดและเตรียมข้อมูล”

ทำความเข้าใจวิธีจัดการข้อมูลที่ขาดหาย ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์ คุณปฏิบัติ Python Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน

บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Python Academy นี้ได้ไหม

ได้ บทเรียน Python Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. วิทยาการข้อมูลคืออะไร
  2. บทบาทของ Python ในวิทยาการข้อมูล
  3. โครงสร้างข้อมูลสำหรับวิทยาการข้อมูล
  4. การทำความสะอาดและเตรียมข้อมูล
  5. การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA)
← กลับไปที่ Python Academy