การทำความสะอาดและเตรียมข้อมูล
ทำความเข้าใจวิธีจัดการข้อมูลที่ขาดหาย ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์
การทำความสะอาดและเตรียมข้อมูล เป็นบทเรียน Python Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน
ภาพรวมการทำความสะอาดข้อมูล
การทำความสะอาดและการเตรียมข้อมูลเบื้องต้น
ข้อมูลดิบมักไม่เป็นระเบียบและจำเป็นต้องผ่านการทำความสะอาดและการเตรียมข้อมูลเบื้องต้นก่อนนำไปวิเคราะห์ ขั้นตอนเหล่านี้มีความสำคัญอย่างยิ่งต่อการรับรองคุณภาพและความถูกต้องของการวิเคราะห์
ในบทเรียนนี้ คุณจะได้เรียนรู้เทคนิคการจัดการข้อมูลที่หายไป การลบข้อมูลซ้ำ และการเตรียมข้อมูลสำหรับการวิเคราะห์

การทำความสะอาดข้อมูลคืออะไร
การทำความสะอาดข้อมูลคืออะไร
การทำความสะอาดข้อมูลคือการตรวจหาและแก้ไขข้อผิดพลาดในชุดข้อมูล งานทั่วไปที่ทำ ได้แก่:
- การจัดการค่าที่หายไป
- การลบข้อมูลซ้ำ
- การทำให้รูปแบบเป็นมาตรฐาน
การจัดการข้อมูลที่หายไป
การจัดการข้อมูลที่หายไป
ข้อมูลที่หายไปอาจเกิดขึ้นได้จากหลายสาเหตุ คุณสามารถจัดการข้อมูลเหล่านี้ได้โดย:
- เติมค่าที่หายไปด้วยค่าเริ่มต้น ค่า mean หรือค่ามัธยฐาน
- ลบแถวหรือคอลัมน์ที่มีค่าที่หายไปมากเกินไป
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)การลบข้อมูลซ้ำ
การลบข้อมูลซ้ำ
ข้อมูลซ้ำอาจทำให้ผลการวิเคราะห์คลาดเคลื่อน ใช้ Pandas เพื่อลบข้อมูลซ้ำ:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)การทำข้อมูลให้เป็นมาตรฐาน
การทำข้อมูลให้เป็นมาตรฐาน
การทำข้อมูลให้เป็นมาตรฐานช่วยให้ข้อมูลมีความสอดคล้องกัน ตัวอย่างเช่น คุณสามารถทำให้รูปแบบวันที่หรือรูปแบบตัวพิมพ์ของข้อความเป็นมาตรฐานได้:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)การแปลงข้อมูล
การแปลงข้อมูล
การแปลงข้อมูล เช่น การปรับมาตราส่วนและการเข้ารหัส เป็นส่วนหนึ่งของการเตรียมข้อมูลเบื้องต้น:
- การปรับมาตราส่วน: การทำให้ค่าตัวเลขเป็นมาตรฐาน
- การเข้ารหัส: การแปลงข้อมูลเชิงหมวดหมู่ให้อยู่ในรูปแบบตัวเลข
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)การปรับมาตราส่วนข้อมูล
การปรับมาตราส่วนข้อมูล
การปรับมาตราส่วนช่วยให้ข้อมูลเชิงตัวเลขอยู่ในมาตราส่วนเดียวกัน ซึ่งเป็นสิ่งจำเป็นสำหรับขั้นตอนวิธีการเรียนรู้ของเครื่อง:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)การตรวจสอบความถูกต้องของข้อมูล
การตรวจสอบความถูกต้องของข้อมูล
การตรวจสอบความถูกต้องช่วยให้มั่นใจได้ว่าข้อมูลเป็นไปตามมาตรฐานคุณภาพ ตัวอย่างเช่น ให้ตรวจหาค่าผิดปกติหรือค่าที่ไม่ถูกต้อง:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)ข้อผิดพลาดทั่วไปในการทำความสะอาดข้อมูล
ข้อผิดพลาดทั่วไปในการทำความสะอาดข้อมูล
ต่อไปนี้คือข้อผิดพลาดบางประการที่ควรหลีกเลี่ยง:
- เพิกเฉยต่อข้อมูลที่ขาดหาย ซึ่งทำให้การวิเคราะห์ไม่แม่นยำ
- ไม่ทำให้รูปแบบเป็นมาตรฐาน ซึ่งก่อให้เกิดความไม่สอดคล้องกัน
- มองข้ามการตรวจสอบความถูกต้อง ซึ่งทำให้เกิดข้อผิดพลาดในงานขั้นตอนถัดไป
เราได้เรียนรู้อะไรบ้าง
เราได้เรียนรู้อะไรบ้าง
ในบทเรียนนี้ คุณได้เรียนรู้:
- วิธีจัดการข้อมูลที่ขาดหายและลบข้อมูลซ้ำ
- วิธีทำให้ข้อมูลเป็นมาตรฐาน แปลงข้อมูล และปรับมาตราส่วนข้อมูลสำหรับการวิเคราะห์
- วิธีตรวจสอบคุณภาพข้อมูลและระบุค่าผิดปกติ
- ความสำคัญของการทำความสะอาดข้อมูลต่อการวิเคราะห์ที่แม่นยำ
ทำได้ดีมาก! ไปต่อที่หัวข้อถัดไปกันเถอะ

คำถามที่พบบ่อย
บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การทำความสะอาดและเตรียมข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การทำความสะอาดและเตรียมข้อมูล”
ทำความเข้าใจวิธีจัดการข้อมูลที่ขาดหาย ลบข้อมูลซ้ำ และเตรียมข้อมูลดิบสำหรับการวิเคราะห์ คุณปฏิบัติ Python Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 5 บทเรียน
บทเรียน “การทำความสะอาดและเตรียมข้อมูล” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Python Academy นี้ได้ไหม
ได้ บทเรียน Python Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- วิทยาการข้อมูลคืออะไร
- บทบาทของ Python ในวิทยาการข้อมูล
- โครงสร้างข้อมูลสำหรับวิทยาการข้อมูล
- การทำความสะอาดและเตรียมข้อมูล
- การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA)