0Pricing
Python Academy · บทเรียน

การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน

เทคนิคการเตรียมข้อมูลข้อความเบื้องต้น

การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน เป็นบทเรียน Python Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน

พื้นฐานการประมวลผลข้อความเบื้องต้น

การแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน

การประมวลผลข้อความเบื้องต้นเป็นขั้นตอนสำคัญในการประมวลผลภาษาธรรมชาติ โดยเป็นการแปลงข้อความดิบให้อยู่ในรูปแบบที่มีโครงสร้างเพื่อใช้ในการวิเคราะห์ ขั้นตอนสำคัญของการประมวลผลเบื้องต้น ได้แก่ การแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน

การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน — ภาพประกอบ 1

การแบ่งเป็นโทเค็นคืออะไร

การแบ่งเป็นโทเค็นคืออะไร

การแบ่งเป็นโทเค็นคือกระบวนการแบ่งข้อความออกเป็นหน่วยย่อย ๆ ที่เรียกว่าโทเค็น โทเค็นอาจเป็นคำ ประโยค หรืออักขระ

ตัวอย่างเช่น:

ข้อความ: "NLP is amazing!"

โทเค็น: ["NLP", "is", "amazing", "!"]

ตัวอย่างการแบ่งเป็นโทเค็นในภาษาไพทอน

ตัวอย่างการแบ่งเป็นโทเค็นในภาษาไพทอน

เราสามารถใช้ไลบรารี NLTK เพื่อแบ่งข้อความออกเป็นคำหรือประโยคได้:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

การทำให้เป็นมาตรฐานคืออะไร

การทำให้เป็นมาตรฐานคืออะไร

การทำให้เป็นมาตรฐานประกอบด้วยการทำความสะอาดและจัดรูปแบบข้อความให้เป็นมาตรฐาน เทคนิคทั่วไปมีดังนี้:

  • การเปลี่ยนเป็นตัวพิมพ์เล็ก: การแปลงข้อความทั้งหมดให้เป็นตัวพิมพ์เล็ก
  • การลบเครื่องหมายวรรคตอน: การกำจัดเครื่องหมายวรรคตอน
  • การตัดรากศัพท์: การลดรูปคำให้เป็นรูปคำราก เช่น "กำลังวิ่ง" → "วิ่ง"
  • การหาคำหลัก: การลดรูปคำให้เป็นรูปพื้นฐานที่มีความหมายโดยใช้บริบท เช่น "ดีกว่า" → "ดี"

การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน

การเปลี่ยนเป็นตัวพิมพ์เล็กและการลบเครื่องหมายวรรคตอน

วิธีทำให้ข้อความเป็นมาตรฐานด้วยการแปลงเป็นตัวพิมพ์เล็กและลบเครื่องหมายวรรคตอนมีดังนี้:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

การตัดรากศัพท์และการหาคำหลัก

การตัดรากศัพท์และการหาคำหลัก

การตัดรากศัพท์: ลดรูปคำให้เหลือรากศัพท์โดยตัดส่วนเติมท้ายออก วิธีนี้ใช้กฎและอาจไม่ได้ผลลัพธ์เป็นคำที่ถูกต้องเสมอไป

การหาคำหลัก: ใช้คลังคำศัพท์และกฎไวยากรณ์เพื่อลดรูปคำให้เป็นรูปพื้นฐานที่มีความหมาย

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

การลบคำหยุด

การลบคำหยุด

คำหยุดคือคำที่พบบ่อย เช่น "เป็น" "และ" และ "นั้น" ซึ่งมักไม่มีความหมายสำคัญ การลบคำเหล่านี้ช่วยให้การวิเคราะห์ข้อความง่ายขึ้น:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

ความท้าทายในการประมวลผลข้อความเบื้องต้น

ความท้าทายในการประมวลผลข้อความเบื้องต้น

การประมวลผลข้อความเบื้องต้นอาจเป็นเรื่องท้าทายเนื่องจาก:

  • ความกำกวม: คำอย่าง "นำ" อาจมีหลายความหมาย
  • บริบท: การหาคำหลักจำเป็นต้องเข้าใจบริบทของคำ
  • ความแตกต่างของภาษา: การจัดการกับภาษาและภาษาถิ่นที่แตกต่างกัน

สรุปและขั้นตอนถัดไป

สรุปและขั้นตอนถัดไป

ในบทเรียนนี้ เราได้:

  • เรียนรู้เกี่ยวกับการแบ่งเป็นโทเค็นและการทำให้เป็นมาตรฐาน
  • สำรวจเทคนิคต่าง ๆ เช่น การตัดรากศัพท์ การหาคำหลัก และการลบคำหยุด
  • ฝึกการประมวลผลข้อความเบื้องต้นด้วยภาษาไพทอน

ถัดไป เราจะวิเคราะห์รูปแบบข้อความโดยใช้แบบจำลองเอ็นแกรม

การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน — ภาพประกอบ 10

คำถามที่พบบ่อย

บทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python Academy มีบทเรียนทั้งหมด 5 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน”

เทคนิคการเตรียมข้อมูลข้อความเบื้องต้น คุณปฏิบัติ Python Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน

บทเรียน “การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Python Academy นี้ได้ไหม

ได้ บทเรียน Python Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การทำงานกับข้อมูลข้อความ
  2. การตัดคำและการปรับข้อมูลให้เป็นมาตรฐาน
  3. แบบจำลอง N-Gram
  4. แนวคิดการวิเคราะห์ความรู้สึก
  5. แบบจำลองที่ใช้ Transformer
← กลับไปที่ Python Academy