0Pricing
Learn AI with Python · บทเรียน

การตัดคำและการทำให้เป็นมาตรฐาน

เทคนิคการเตรียมข้อมูลข้อความล่วงหน้า

การตัดคำและการทำให้เป็นมาตรฐาน เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน

พื้นฐานการเตรียมข้อมูลข้อความ

การตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน

การเตรียมข้อมูลข้อความเป็นขั้นตอนสำคัญในการประมวลผลภาษาธรรมชาติ โดยเป็นการแปลงข้อความดิบให้อยู่ในรูปแบบที่มีโครงสร้างสำหรับการวิเคราะห์ ขั้นตอนสำคัญในการเตรียมข้อมูล ได้แก่ การตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน

การตัดคำและการทำให้เป็นมาตรฐาน — ภาพประกอบ 1

การตัดเป็นโทเค็นคืออะไร

การตัดเป็นโทเค็นคืออะไร

การตัดเป็นโทเค็นคือกระบวนการแบ่งข้อความออกเป็นหน่วยย่อย ๆ ที่เรียกว่าโทเค็น โทเค็นอาจเป็นคำ ประโยค หรืออักขระ

ตัวอย่างเช่น:

ข้อความ: "NLP is amazing!"

โทเค็น: ["NLP", "is", "amazing", "!"]

ตัวอย่างการตัดเป็นโทเค็นในภาษาไพธอน

ตัวอย่างการตัดเป็นโทเค็นในภาษาไพธอน

เราใช้ไลบรารี NLTK เพื่อตัดข้อความออกเป็นคำหรือประโยคได้:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

การทำให้เป็นมาตรฐานคืออะไร

การทำให้เป็นมาตรฐานคืออะไร

การทำให้เป็นมาตรฐานประกอบด้วยการทำความสะอาดและปรับข้อความให้อยู่ในรูปแบบเดียวกัน เทคนิคทั่วไปในการทำให้เป็นมาตรฐาน ได้แก่:

  • การเปลี่ยนเป็นตัวพิมพ์เล็ก: เปลี่ยนข้อความทั้งหมดให้เป็นตัวพิมพ์เล็ก
  • การลบเครื่องหมายวรรคตอน: ลบเครื่องหมายวรรคตอนออก
  • การตัดคำเหลือรากศัพท์: ลดคำให้เหลือรูปคำราก เช่น "กำลังวิ่ง" → "วิ่ง"
  • การลดรูปคำเป็นคำฐาน: ลดคำให้เหลือรูปคำพื้นฐานที่เหมาะสมตามบริบท เช่น "ดีกว่า" → "ดี"

การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน

การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน

วิธีทำให้ข้อความเป็นมาตรฐานโดยเปลี่ยนเป็นตัวพิมพ์เล็กและลบเครื่องหมายวรรคตอนมีดังนี้:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

การตัดคำเหลือรากศัพท์และการลดรูปคำเป็นคำฐาน

การตัดคำเหลือรากศัพท์และการลดรูปคำเป็นคำฐาน

การตัดคำเหลือรากศัพท์: ลดคำให้เหลือรากศัพท์ด้วยการตัดปัจจัยเติมท้ายออก วิธีนี้อาศัยกฎและอาจไม่ได้ผลเป็นคำที่ถูกต้องเสมอไป

การลดรูปคำเป็นคำฐาน: ใช้คลังคำศัพท์และกฎไวยากรณ์เพื่อลดคำให้เหลือรูปคำฐานที่มีความหมาย

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

การลบคำหยุด

การลบคำหยุด

คำหยุดคือคำที่พบได้ทั่วไป เช่น "เป็น" "และ" และ "นั้น" ซึ่งมักไม่ได้สื่อความหมายสำคัญ การลบคำเหล่านี้ช่วยให้การวิเคราะห์ข้อความง่ายขึ้น:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

ความท้าทายในการเตรียมข้อความล่วงหน้า

ความท้าทายในการเตรียมข้อความล่วงหน้า

การเตรียมข้อความล่วงหน้าอาจเป็นเรื่องท้าทายเนื่องจาก:

  • ความกำกวม: คำอย่าง "ตา" อาจมีหลายความหมาย
  • บริบท: การลดรูปคำเป็นคำฐานจำเป็นต้องเข้าใจบริบทของคำนั้น
  • ความหลากหลายของภาษา: ต้องรองรับภาษาและสำเนียงที่แตกต่างกัน

สรุปและขั้นตอนถัดไป

สรุปและขั้นตอนถัดไป

ในบทเรียนนี้ เราได้:

  • เรียนรู้เกี่ยวกับการตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน
  • สำรวจเทคนิคต่าง ๆ เช่น การตัดรากคำ การทำคำให้เป็นรูปคำหลัก และการลบคำหยุด
  • ฝึกเตรียมข้อมูลข้อความด้วยไพทอน

ถัดไป เราจะวิเคราะห์รูปแบบของข้อความโดยใช้แบบจำลอง N-แกรม

การตัดคำและการทำให้เป็นมาตรฐาน — ภาพประกอบ 10

คำถามที่พบบ่อย

บทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การตัดคำและการทำให้เป็นมาตรฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน”

เทคนิคการเตรียมข้อมูลข้อความล่วงหน้า คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน

บทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม

ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การทำงานกับข้อมูลข้อความ
  2. การตัดคำและการทำให้เป็นมาตรฐาน
  3. แบบจำลองเอ็นแกรม
  4. แนวคิดการวิเคราะห์ความรู้สึก
  5. แบบจำลองที่อาศัยทรานส์ฟอร์เมอร์
← กลับไปที่ Learn AI with Python