การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์
ค้นพบวิธีทำความสะอาด แปลง และเตรียมข้อมูลเพื่อให้โมเดลปัญญาประดิษฐ์ทำงานได้อย่างมีประสิทธิภาพสูงสุด
การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์ เป็นบทเรียน AI SaaS Builder ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI SaaS Builder และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI SaaS Builder มีบทเรียนทั้งหมด 4 บทเรียน
เหตุใดจึงต้องเตรียมข้อมูลสำหรับ AI
ลองนึกภาพว่าคุณกำลังทำอาหารอร่อย ๆ คุณคงไม่ใช้วัตถุดิบเน่าเสียใช่ไหม
AI ก็เช่นเดียวกัน! การเตรียมข้อมูลคือกระบวนการทำความสะอาดและแปลงข้อมูลดิบให้อยู่ในรูปแบบที่สะอาดและพร้อมใช้งานสำหรับโมเดล AI
ขั้นตอนนี้มีความสำคัญอย่างยิ่ง เพราะคุณภาพของข้อมูลส่งผลโดยตรงต่อประสิทธิภาพและความแม่นยำของ AI
ทำความเข้าใจปัญหาของข้อมูลดิบ
ข้อมูลดิบแทบจะไม่อยู่ในสภาพสมบูรณ์ตั้งแต่แรก ข้อมูลมักมีปัญหาที่อาจทำให้โมเดล AI เข้าใจผิด
- ค่าที่หายไป: ช่องว่างในตำแหน่งที่ควรมีข้อมูล
- ความไม่สอดคล้อง: การใช้รูปแบบที่แตกต่างกันสำหรับข้อมูลเดียวกัน
- ข้อมูลซ้ำ: รายการที่ปรากฏซ้ำ
- ค่าผิดปกติ: ค่าที่สุดโต่งซึ่งอาจทำให้ผลลัพธ์เบี่ยงเบน
การระบุปัญหาเหล่านี้คือขั้นตอนแรก
จัดการข้อมูลที่หายไป
ค่าที่หายไปอาจทำให้เกิดข้อผิดพลาดหรือผลลัพธ์ที่มีอคติ ต่อไปนี้คือกลยุทธ์ที่ใช้กันทั่วไป:
- การลบ: ลบแถวหรือคอลัมน์ที่มีข้อมูลหายไปมากเกินไป (ควรใช้ด้วยความระมัดระวัง!)
- การเติมค่า: เติมค่าที่หายไป โดยใช้ค่าเฉลี่ย ค่ามัธยฐาน หรือค่าฐานนิยมของคอลัมน์
- การคาดการณ์: ใช้คุณลักษณะอื่นเพื่อคาดการณ์และเติมค่าที่หายไป (เป็นวิธีขั้นสูงกว่า)
วิธีที่ดีที่สุดขึ้นอยู่กับข้อมูลและงาน AI ของคุณ
ระบุและลบข้อมูลซ้ำ
รายการซ้ำหมายความว่ามีการบันทึกข้อมูลเดียวกันหลายครั้ง ซึ่งอาจทำให้ชุดข้อมูลของคุณมีขนาดเกินจริงและทำให้โมเดลมีอคติ
ตัวอย่างเช่น ลูกค้าคนเดียวกันปรากฏสองครั้งในรายการ 'ผู้สมัครใหม่'
วิธีแก้ไขนั้นตรงไปตรงมา: ระบุและลบแถวที่ซ้ำซ้อนเหล่านี้ เครื่องมือข้อมูลส่วนใหญ่มีฟังก์ชันสำหรับทำสิ่งนี้ในตัว
ทำให้รูปแบบข้อมูลเป็นมาตรฐาน
ความไม่สอดคล้องเกิดขึ้นเมื่อข้อมูลเดียวกันถูกนำเสนอในรูปแบบต่างกัน ลองนึกถึง 'USA', 'U.S.A.' และ 'United States' ซึ่งล้วนหมายถึงประเทศเดียวกัน
เรื่องนี้ใช้กับรูปแบบวันที่ด้วย (เช่น '10/01/2023' กับ 'Jan 10, 2023') รวมถึงหน่วยวัด (เช่น 'kg' กับ 'lbs')
การทำข้อมูลเหล่านี้ให้เป็นมาตรฐานช่วยให้โมเดล AI ตีความได้อย่างถูกต้อง
ปรับสเกลคุณลักษณะตัวเลข
อัลกอริทึม AI บางประเภท เช่น K-Nearest Neighbors มีความไวต่อสเกลของคุณลักษณะตัวเลข คุณลักษณะที่มีค่าตั้งแต่ 1-1000 อาจมีอิทธิพลมากกว่าคุณลักษณะที่มีค่าตั้งแต่ 0-1
- การทำให้เป็นบรรทัดฐาน: ปรับค่าให้อยู่ในช่วงคงที่ โดยปกติคือ 0 ถึง 1
- การทำให้เป็นมาตรฐาน: แปลงข้อมูลให้มีค่าเฉลี่ยเป็น 0 และส่วนเบี่ยงเบนมาตรฐานเป็น 1
วิธีนี้ช่วยป้องกันไม่ให้คุณลักษณะที่มีค่ามากกว่ามีอิทธิพลต่อโมเดลอย่างไม่สมส่วน
แปลงหมวดหมู่เป็นตัวเลข
โมเดล AI ทำงานได้ดีที่สุดกับตัวเลข ข้อมูลเชิงหมวดหมู่ (เช่น 'Red', 'Green', 'Blue' หรือ 'Small', 'Medium', 'Large') จึงต้องแปลงให้อยู่ในรูปตัวเลข
- การเข้ารหัสแบบ One-Hot: สร้างคอลัมน์ไบนารีใหม่ (0 หรือ 1) สำหรับแต่ละหมวดหมู่ เช่น 'Color_Red' และ 'Color_Green'
- การเข้ารหัสป้ายกำกับ: กำหนดจำนวนเต็มที่ไม่ซ้ำกันให้แต่ละหมวดหมู่ เช่น Red=0, Green=1, Blue=2 ควรใช้อย่างระมัดระวัง เพราะวิธีนี้สื่อว่าหมวดหมู่มีลำดับ
การสร้างคุณลักษณะใหม่
บางครั้งคุณลักษณะดิบเพียงอย่างเดียวอาจยังไม่เพียงพอ วิศวกรรมคุณลักษณะคือการสร้างคุณลักษณะใหม่จากคุณลักษณะที่มีอยู่ เพื่อเพิ่มประสิทธิภาพของโมเดล
ตัวอย่าง:
- การรวม 'ส่วนสูง' และ 'น้ำหนัก' เพื่อสร้าง 'BMI'
- การดึง 'เดือน' หรือ 'วันในสัปดาห์' จากคอลัมน์ 'วันที่'
- การสร้าง 'กลุ่มอายุ' จากคอลัมน์ 'อายุ'
วิธีนี้ช่วยให้โมเดลค้นหารูปแบบต่าง ๆ ได้ง่ายขึ้น
การแบ่งข้อมูลสำหรับการฝึก
ก่อนฝึกโมเดล AI คุณต้องแบ่งข้อมูลที่เตรียมไว้แล้วออกเป็นชุดต่าง ๆ:
- ชุดฝึก: ใช้สำหรับสอนโมเดล
- ชุดตรวจสอบ: ใช้สำหรับปรับค่าพารามิเตอร์ระดับสูงของโมเดล และป้องกันการเรียนรู้เกินระหว่างการพัฒนา
- ชุดทดสอบ: ชุดข้อมูลที่โมเดลไม่เคยเห็นมาก่อน ใช้สำหรับประเมินประสิทธิภาพของโมเดลในขั้นสุดท้าย
วิธีนี้ช่วยให้โมเดลทำงานได้ดีกับข้อมูลใหม่จากโลกจริง
หลักการเตรียมข้อมูล
คุณได้เรียนรู้เกี่ยวกับขั้นตอนต่าง ๆ ในการเตรียมข้อมูลแล้ว ตอนนี้มาทดสอบความเข้าใจกัน
สรุปการเตรียมข้อมูล
ทำได้ดีมาก! ในบทเรียนนี้ เราได้สำรวจกระบวนการสำคัญอย่างการเตรียมข้อมูล
คุณได้เรียนรู้เกี่ยวกับ:
- การทำความสะอาดข้อมูล (ค่าที่หายไป ข้อมูลซ้ำ และข้อมูลที่ไม่สอดคล้องกัน)
- การแปลงข้อมูล (การปรับสเกลคุณลักษณะ และการเข้ารหัสข้อมูลเชิงหมวดหมู่)
- พื้นฐานวิศวกรรมคุณลักษณะ
- ความสำคัญของการแบ่งข้อมูลเพื่อประเมินโมเดล
ข้อมูลคุณภาพสูงคือรากฐานของ AI ที่มีประสิทธิภาพ ฝึกฝนทักษะเหล่านี้ต่อไปนะครับ
เรียนรู้ AI SaaS Builder ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 12
- บทเรียน
- 47
คำถามที่พบบ่อย
บทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI SaaS Builder ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI SaaS Builder มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์”
ค้นพบวิธีทำความสะอาด แปลง และเตรียมข้อมูลเพื่อให้โมเดลปัญญาประดิษฐ์ทำงานได้อย่างมีประสิทธิภาพสูงสุด คุณปฏิบัติ AI SaaS Builder ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI SaaS Builder หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI SaaS Builder บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI SaaS Builder นี้ได้ไหม
ได้ บทเรียน AI SaaS Builder ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การเลือกโมเดลปัญญาประดิษฐ์ที่เหมาะสม
- การนำ API ของโมเดลปัญญาประดิษฐ์ไปใช้งาน
- การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์
- วิศวกรรมพรอมต์สำหรับฟีเจอร์ปัญญาประดิษฐ์ที่เชื่อถือได้