การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน
เทคนิคการเตรียมข้อมูลข้อความเบื้องต้น
การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน เป็นบทเรียน Python Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน
พื้นฐานการประมวลผลข้อความเบื้องต้น
การแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน
การประมวลผลข้อความเบื้องต้นเป็นขั้นตอนสำคัญในการประมวลผลภาษาธรรมชาติ โดยเป็นการแปลงข้อความดิบให้อยู่ในรูปแบบที่มีโครงสร้างเพื่อใช้ในการวิเคราะห์ ขั้นตอนสำคัญของการประมวลผลเบื้องต้น ได้แก่ การแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน

การแบ่งเป็นโทเค็นคืออะไร
การแบ่งเป็นโทเค็นคืออะไร
การแบ่งเป็นโทเค็นคือกระบวนการแบ่งข้อความออกเป็นหน่วยย่อย ๆ ที่เรียกว่าโทเค็น โทเค็นอาจเป็นคำ ประโยค หรืออักขระ
ตัวอย่างเช่น:
ข้อความ: "NLP is amazing!"
โทเค็น: ["NLP", "is", "amazing", "!"]
ตัวอย่างการแบ่งเป็นโทเค็นในภาษาไพทอน
ตัวอย่างการแบ่งเป็นโทเค็นในภาษาไพทอน
เราสามารถใช้ไลบรารี NLTK เพื่อแบ่งข้อความออกเป็นคำหรือประโยคได้:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)การทำให้เป็นมาตรฐานคืออะไร
การทำให้เป็นมาตรฐานคืออะไร
การทำให้เป็นมาตรฐานประกอบด้วยการทำความสะอาดและจัดรูปแบบข้อความให้เป็นมาตรฐาน เทคนิคทั่วไปมีดังนี้:
- การเปลี่ยนเป็นตัวพิมพ์เล็ก: การแปลงข้อความทั้งหมดให้เป็นตัวพิมพ์เล็ก
- การลบเครื่องหมายวรรคตอน: การกำจัดเครื่องหมายวรรคตอน
- การตัดรากศัพท์: การลดรูปคำให้เป็นรูปคำราก เช่น "กำลังวิ่ง" → "วิ่ง"
- การหาคำหลัก: การลดรูปคำให้เป็นรูปพื้นฐานที่มีความหมายโดยใช้บริบท เช่น "ดีกว่า" → "ดี"
การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน
การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน
วิธีทำให้ข้อความเป็นมาตรฐานด้วยการแปลงเป็นตัวพิมพ์เล็กและลบเครื่องหมายวรรคตอนมีดังนี้:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)การตัดรากศัพท์และการหาคำหลัก
การตัดรากศัพท์และการหาคำหลัก
การตัดรากศัพท์: ลดรูปคำให้เหลือรากศัพท์โดยตัดส่วนเติมท้ายออก วิธีนี้ใช้กฎและอาจไม่ได้ผลลัพธ์เป็นคำที่ถูกต้องเสมอไป
การหาคำหลัก: ใช้คลังคำศัพท์และกฎไวยากรณ์เพื่อลดรูปคำให้เป็นรูปพื้นฐานที่มีความหมาย
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))การลบคำหยุด
การลบคำหยุด
คำหยุดคือคำที่พบบ่อย เช่น "เป็น" "และ" และ "นั้น" ซึ่งมักไม่มีความหมายสำคัญ การลบคำเหล่านี้ช่วยให้การวิเคราะห์ข้อความง่ายขึ้น:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)ความท้าทายในการประมวลผลข้อความเบื้องต้น
ความท้าทายในการประมวลผลข้อความเบื้องต้น
การประมวลผลข้อความเบื้องต้นอาจเป็นเรื่องท้าทายเนื่องจาก:
- ความกำกวม: คำอย่าง "นำ" อาจมีหลายความหมาย
- บริบท: การหาคำหลักจำเป็นต้องเข้าใจบริบทของคำ
- ความแตกต่างของภาษา: การจัดการกับภาษาและภาษาถิ่นที่แตกต่างกัน
สรุปและขั้นตอนถัดไป
สรุปและขั้นตอนถัดไป
ในบทเรียนนี้ เราได้:
- เรียนรู้เกี่ยวกับการแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน
- สำรวจเทคนิคต่าง ๆ เช่น การตัดรากศัพท์ การหาคำหลัก และการลบคำหยุด
- ฝึกการประมวลผลข้อความเบื้องต้นด้วยภาษาไพทอน
ถัดไป เราจะวิเคราะห์รูปแบบข้อความโดยใช้แบบจำลองเอ็นแกรม

คำถามที่พบบ่อย
บทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน”
เทคนิคการเตรียมข้อมูลข้อความเบื้องต้น คุณปฏิบัติ Python Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน
บทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Python Academy นี้ได้ไหม
ได้ บทเรียน Python Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การทำงานกับข้อมูลข้อความ
- การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน
- แบบจำลอง N-Gram
- แนวคิดการวิเคราะห์ความรู้สึก
- แบบจำลองที่ใช้ Transformer