AI SaaS Builder · บทเรียน

การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์

ค้นพบวิธีทำความสะอาด แปลง และเตรียมข้อมูลเพื่อให้โมเดลปัญญาประดิษฐ์ทำงานได้อย่างมีประสิทธิภาพสูงสุด

บทเรียน 3 จาก 411 ขั้นตอน

การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์ เป็นบทเรียน AI SaaS Builder ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI SaaS Builder และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI SaaS Builder มีบทเรียนทั้งหมด 4 บทเรียน

เหตุใดจึงต้องเตรียมข้อมูลสำหรับ AI

ลองนึกภาพว่าคุณกำลังทำอาหารอร่อย ๆ คุณคงไม่ใช้วัตถุดิบเน่าเสียใช่ไหม

AI ก็เช่นเดียวกัน! การเตรียมข้อมูลคือกระบวนการทำความสะอาดและแปลงข้อมูลดิบให้อยู่ในรูปแบบที่สะอาดและพร้อมใช้งานสำหรับโมเดล AI

ขั้นตอนนี้มีความสำคัญอย่างยิ่ง เพราะคุณภาพของข้อมูลส่งผลโดยตรงต่อประสิทธิภาพและความแม่นยำของ AI

ทำความเข้าใจปัญหาของข้อมูลดิบ

ข้อมูลดิบแทบจะไม่อยู่ในสภาพสมบูรณ์ตั้งแต่แรก ข้อมูลมักมีปัญหาที่อาจทำให้โมเดล AI เข้าใจผิด

  • ค่าที่หายไป: ช่องว่างในตำแหน่งที่ควรมีข้อมูล
  • ความไม่สอดคล้อง: การใช้รูปแบบที่แตกต่างกันสำหรับข้อมูลเดียวกัน
  • ข้อมูลซ้ำ: รายการที่ปรากฏซ้ำ
  • ค่าผิดปกติ: ค่าที่สุดโต่งซึ่งอาจทำให้ผลลัพธ์เบี่ยงเบน

การระบุปัญหาเหล่านี้คือขั้นตอนแรก

จัดการข้อมูลที่หายไป

ค่าที่หายไปอาจทำให้เกิดข้อผิดพลาดหรือผลลัพธ์ที่มีอคติ ต่อไปนี้คือกลยุทธ์ที่ใช้กันทั่วไป:

  • การลบ: ลบแถวหรือคอลัมน์ที่มีข้อมูลหายไปมากเกินไป (ควรใช้ด้วยความระมัดระวัง!)
  • การเติมค่า: เติมค่าที่หายไป โดยใช้ค่าเฉลี่ย ค่ามัธยฐาน หรือค่าฐานนิยมของคอลัมน์
  • การคาดการณ์: ใช้คุณลักษณะอื่นเพื่อคาดการณ์และเติมค่าที่หายไป (เป็นวิธีขั้นสูงกว่า)

วิธีที่ดีที่สุดขึ้นอยู่กับข้อมูลและงาน AI ของคุณ

ระบุและลบข้อมูลซ้ำ

รายการซ้ำหมายความว่ามีการบันทึกข้อมูลเดียวกันหลายครั้ง ซึ่งอาจทำให้ชุดข้อมูลของคุณมีขนาดเกินจริงและทำให้โมเดลมีอคติ

ตัวอย่างเช่น ลูกค้าคนเดียวกันปรากฏสองครั้งในรายการ 'ผู้สมัครใหม่'

วิธีแก้ไขนั้นตรงไปตรงมา: ระบุและลบแถวที่ซ้ำซ้อนเหล่านี้ เครื่องมือข้อมูลส่วนใหญ่มีฟังก์ชันสำหรับทำสิ่งนี้ในตัว

ทำให้รูปแบบข้อมูลเป็นมาตรฐาน

ความไม่สอดคล้องเกิดขึ้นเมื่อข้อมูลเดียวกันถูกนำเสนอในรูปแบบต่างกัน ลองนึกถึง 'USA', 'U.S.A.' และ 'United States' ซึ่งล้วนหมายถึงประเทศเดียวกัน

เรื่องนี้ใช้กับรูปแบบวันที่ด้วย (เช่น '10/01/2023' กับ 'Jan 10, 2023') รวมถึงหน่วยวัด (เช่น 'kg' กับ 'lbs')

การทำข้อมูลเหล่านี้ให้เป็นมาตรฐานช่วยให้โมเดล AI ตีความได้อย่างถูกต้อง

ปรับสเกลคุณลักษณะตัวเลข

อัลกอริทึม AI บางประเภท เช่น K-Nearest Neighbors มีความไวต่อสเกลของคุณลักษณะตัวเลข คุณลักษณะที่มีค่าตั้งแต่ 1-1000 อาจมีอิทธิพลมากกว่าคุณลักษณะที่มีค่าตั้งแต่ 0-1

  • การทำให้เป็นบรรทัดฐาน: ปรับค่าให้อยู่ในช่วงคงที่ โดยปกติคือ 0 ถึง 1
  • การทำให้เป็นมาตรฐาน: แปลงข้อมูลให้มีค่าเฉลี่ยเป็น 0 และส่วนเบี่ยงเบนมาตรฐานเป็น 1

วิธีนี้ช่วยป้องกันไม่ให้คุณลักษณะที่มีค่ามากกว่ามีอิทธิพลต่อโมเดลอย่างไม่สมส่วน

แปลงหมวดหมู่เป็นตัวเลข

โมเดล AI ทำงานได้ดีที่สุดกับตัวเลข ข้อมูลเชิงหมวดหมู่ (เช่น 'Red', 'Green', 'Blue' หรือ 'Small', 'Medium', 'Large') จึงต้องแปลงให้อยู่ในรูปตัวเลข

  • การเข้ารหัสแบบ One-Hot: สร้างคอลัมน์ไบนารีใหม่ (0 หรือ 1) สำหรับแต่ละหมวดหมู่ เช่น 'Color_Red' และ 'Color_Green'
  • การเข้ารหัสป้ายกำกับ: กำหนดจำนวนเต็มที่ไม่ซ้ำกันให้แต่ละหมวดหมู่ เช่น Red=0, Green=1, Blue=2 ควรใช้อย่างระมัดระวัง เพราะวิธีนี้สื่อว่าหมวดหมู่มีลำดับ

การสร้างคุณลักษณะใหม่

บางครั้งคุณลักษณะดิบเพียงอย่างเดียวอาจยังไม่เพียงพอ วิศวกรรมคุณลักษณะคือการสร้างคุณลักษณะใหม่จากคุณลักษณะที่มีอยู่ เพื่อเพิ่มประสิทธิภาพของโมเดล

ตัวอย่าง:

  • การรวม 'ส่วนสูง' และ 'น้ำหนัก' เพื่อสร้าง 'BMI'
  • การดึง 'เดือน' หรือ 'วันในสัปดาห์' จากคอลัมน์ 'วันที่'
  • การสร้าง 'กลุ่มอายุ' จากคอลัมน์ 'อายุ'

วิธีนี้ช่วยให้โมเดลค้นหารูปแบบต่าง ๆ ได้ง่ายขึ้น

การแบ่งข้อมูลสำหรับการฝึก

ก่อนฝึกโมเดล AI คุณต้องแบ่งข้อมูลที่เตรียมไว้แล้วออกเป็นชุดต่าง ๆ:

  • ชุดฝึก: ใช้สำหรับสอนโมเดล
  • ชุดตรวจสอบ: ใช้สำหรับปรับค่าพารามิเตอร์ระดับสูงของโมเดล และป้องกันการเรียนรู้เกินระหว่างการพัฒนา
  • ชุดทดสอบ: ชุดข้อมูลที่โมเดลไม่เคยเห็นมาก่อน ใช้สำหรับประเมินประสิทธิภาพของโมเดลในขั้นสุดท้าย

วิธีนี้ช่วยให้โมเดลทำงานได้ดีกับข้อมูลใหม่จากโลกจริง

หลักการเตรียมข้อมูล

คุณได้เรียนรู้เกี่ยวกับขั้นตอนต่าง ๆ ในการเตรียมข้อมูลแล้ว ตอนนี้มาทดสอบความเข้าใจกัน

สรุปการเตรียมข้อมูล

ทำได้ดีมาก! ในบทเรียนนี้ เราได้สำรวจกระบวนการสำคัญอย่างการเตรียมข้อมูล

คุณได้เรียนรู้เกี่ยวกับ:

  • การทำความสะอาดข้อมูล (ค่าที่หายไป ข้อมูลซ้ำ และข้อมูลที่ไม่สอดคล้องกัน)
  • การแปลงข้อมูล (การปรับสเกลคุณลักษณะ และการเข้ารหัสข้อมูลเชิงหมวดหมู่)
  • พื้นฐานวิศวกรรมคุณลักษณะ
  • ความสำคัญของการแบ่งข้อมูลเพื่อประเมินโมเดล

ข้อมูลคุณภาพสูงคือรากฐานของ AI ที่มีประสิทธิภาพ ฝึกฝนทักษะเหล่านี้ต่อไปนะครับ

เริ่มต้นได้ฟรี

เรียนรู้ AI SaaS Builder ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
12
บทเรียน
47

คำถามที่พบบ่อย

บทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI SaaS Builder ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI SaaS Builder มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์”

ค้นพบวิธีทำความสะอาด แปลง และเตรียมข้อมูลเพื่อให้โมเดลปัญญาประดิษฐ์ทำงานได้อย่างมีประสิทธิภาพสูงสุด คุณปฏิบัติ AI SaaS Builder ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI SaaS Builder หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI SaaS Builder บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI SaaS Builder นี้ได้ไหม

ได้ บทเรียน AI SaaS Builder ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การเลือกโมเดลปัญญาประดิษฐ์ที่เหมาะสม
  2. การนำ API ของโมเดลปัญญาประดิษฐ์ไปใช้งาน
  3. การเตรียมข้อมูลสำหรับปัญญาประดิษฐ์
  4. วิศวกรรมพรอมต์สำหรับฟีเจอร์ปัญญาประดิษฐ์ที่เชื่อถือได้
← กลับไปที่ AI SaaS Builder