การตัดคำและการทำให้เป็นมาตรฐาน
เทคนิคการเตรียมข้อมูลข้อความล่วงหน้า
การตัดคำและการทำให้เป็นมาตรฐาน เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน
พื้นฐานการเตรียมข้อมูลข้อความ
การตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน
การเตรียมข้อมูลข้อความเป็นขั้นตอนสำคัญในการประมวลผลภาษาธรรมชาติ โดยเป็นการแปลงข้อความดิบให้อยู่ในรูปแบบที่มีโครงสร้างสำหรับการวิเคราะห์ ขั้นตอนสำคัญในการเตรียมข้อมูล ได้แก่ การตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน

การตัดเป็นโทเค็นคืออะไร
การตัดเป็นโทเค็นคืออะไร
การตัดเป็นโทเค็นคือกระบวนการแบ่งข้อความออกเป็นหน่วยย่อย ๆ ที่เรียกว่าโทเค็น โทเค็นอาจเป็นคำ ประโยค หรืออักขระ
ตัวอย่างเช่น:
ข้อความ: "NLP is amazing!"
โทเค็น: ["NLP", "is", "amazing", "!"]
ตัวอย่างการตัดเป็นโทเค็นในภาษาไพธอน
ตัวอย่างการตัดเป็นโทเค็นในภาษาไพธอน
เราใช้ไลบรารี NLTK เพื่อตัดข้อความออกเป็นคำหรือประโยคได้:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)การทำให้เป็นมาตรฐานคืออะไร
การทำให้เป็นมาตรฐานคืออะไร
การทำให้เป็นมาตรฐานประกอบด้วยการทำความสะอาดและปรับข้อความให้อยู่ในรูปแบบเดียวกัน เทคนิคทั่วไปในการทำให้เป็นมาตรฐาน ได้แก่:
- การเปลี่ยนเป็นตัวพิมพ์เล็ก: เปลี่ยนข้อความทั้งหมดให้เป็นตัวพิมพ์เล็ก
- การลบเครื่องหมายวรรคตอน: ลบเครื่องหมายวรรคตอนออก
- การตัดคำเหลือรากศัพท์: ลดคำให้เหลือรูปคำราก เช่น "กำลังวิ่ง" → "วิ่ง"
- การลดรูปคำเป็นคำฐาน: ลดคำให้เหลือรูปคำพื้นฐานที่เหมาะสมตามบริบท เช่น "ดีกว่า" → "ดี"
การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน
การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน
วิธีทำให้ข้อความเป็นมาตรฐานโดยเปลี่ยนเป็นตัวพิมพ์เล็กและลบเครื่องหมายวรรคตอนมีดังนี้:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)การตัดคำเหลือรากศัพท์และการลดรูปคำเป็นคำฐาน
การตัดคำเหลือรากศัพท์และการลดรูปคำเป็นคำฐาน
การตัดคำเหลือรากศัพท์: ลดคำให้เหลือรากศัพท์ด้วยการตัดปัจจัยเติมท้ายออก วิธีนี้อาศัยกฎและอาจไม่ได้ผลเป็นคำที่ถูกต้องเสมอไป
การลดรูปคำเป็นคำฐาน: ใช้คลังคำศัพท์และกฎไวยากรณ์เพื่อลดคำให้เหลือรูปคำฐานที่มีความหมาย
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))การลบคำหยุด
การลบคำหยุด
คำหยุดคือคำที่พบได้ทั่วไป เช่น "เป็น" "และ" และ "นั้น" ซึ่งมักไม่ได้สื่อความหมายสำคัญ การลบคำเหล่านี้ช่วยให้การวิเคราะห์ข้อความง่ายขึ้น:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)ความท้าทายในการเตรียมข้อความล่วงหน้า
ความท้าทายในการเตรียมข้อความล่วงหน้า
การเตรียมข้อความล่วงหน้าอาจเป็นเรื่องท้าทายเนื่องจาก:
- ความกำกวม: คำอย่าง "ตา" อาจมีหลายความหมาย
- บริบท: การลดรูปคำเป็นคำฐานจำเป็นต้องเข้าใจบริบทของคำนั้น
- ความหลากหลายของภาษา: ต้องรองรับภาษาและสำเนียงที่แตกต่างกัน
สรุปและขั้นตอนถัดไป
สรุปและขั้นตอนถัดไป
ในบทเรียนนี้ เราได้:
- เรียนรู้เกี่ยวกับการตัดข้อความเป็นหน่วยย่อยและการทำให้เป็นมาตรฐาน
- สำรวจเทคนิคต่าง ๆ เช่น การตัดรากคำ การทำคำให้เป็นรูปคำหลัก และการลบคำหยุด
- ฝึกเตรียมข้อมูลข้อความด้วยไพทอน
ถัดไป เราจะวิเคราะห์รูปแบบของข้อความโดยใช้แบบจำลอง N-แกรม

คำถามที่พบบ่อย
บทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การตัดคำและการทำให้เป็นมาตรฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน”
เทคนิคการเตรียมข้อมูลข้อความล่วงหน้า คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน
บทเรียน “การตัดคำและการทำให้เป็นมาตรฐาน” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม
ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การทำงานกับข้อมูลข้อความ
- การตัดคำและการทำให้เป็นมาตรฐาน
- แบบจำลองเอ็นแกรม
- แนวคิดการวิเคราะห์ความรู้สึก
- แบบจำลองที่อาศัยทรานส์ฟอร์เมอร์