NLP Academy · บทเรียน

นับด้วย CountVectorizer

แปลงเอกสารเป็นเมทริกซ์การนับ

บทเรียน 3 จาก 413 ขั้นตอน

นับด้วย CountVectorizer เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

รู้จัก CountVectorizer

CountVectorizerจาก scikit-learn จะสร้างคำศัพท์และนับคำให้คุณด้วยโค้ดเพียงไม่กี่บรรทัด 🚀

from sklearn.feature_extraction.text import CountVectorizer

สร้างตัวทำเวกเตอร์

ขั้นแรกให้สร้างอินสแตนซ์ โดยไม่มีอาร์กิวเมนต์ ระบบจะใช้ค่าเริ่มต้นที่เหมาะสมสำหรับการแยกโทเค็นและเปลี่ยนข้อความเป็นตัวพิมพ์เล็ก

vectorizer = CountVectorizer()

fit เรียนรู้คำศัพท์

การเรียกใช้ fit จะสแกนเอกสารของคุณและค้นพบคำที่ไม่ซ้ำกันทั้งหมด พร้อมสร้างคำศัพท์โดยอัตโนมัติ

vectorizer.fit(docs)

transform สร้างค่าการนับ

จากนั้น transform จะเปลี่ยนเอกสารแต่ละฉบับให้เป็นเวกเตอร์ค่าการนับ และให้เมทริกซ์ตัวเลขของความถี่คำ

X = vectorizer.transform(docs)

fit และ transform พร้อมกัน

ทางลัด fit_transform ทำทั้งสองขั้นตอนพร้อมกันกับข้อความฝึก ซึ่งเป็นกระบวนการทำงานที่ใช้กันทั่วไป

X = vectorizer.fit_transform(docs)

ดูคำศัพท์

ตรวจสอบคำที่เรียนรู้และดัชนีของคำเหล่านั้นด้วย get_feature_names_out คำเหล่านี้คือคอลัมน์ของเมทริกซ์

print(vectorizer.get_feature_names_out())

ผลลัพธ์เป็นเมทริกซ์เบาบาง

เพื่อประหยัดหน่วยความจำ ผลลัพธ์จึงเป็นเมทริกซ์เบาบางที่เก็บเฉพาะค่าการนับที่ไม่เป็นศูนย์ ไม่ได้เก็บทุกช่องที่เป็นศูนย์

ดูตัวเลขอย่างรวดเร็ว

แปลงเป็นอาร์เรย์หนาแน่นเพื่ออ่านค่าการนับจริง ๆ ใช้ toarray เฉพาะกับตัวอย่างขนาดเล็กเท่านั้น

print(X.toarray())

การเปลี่ยนเป็นตัวพิมพ์เล็กทำโดยอัตโนมัติ

โดยค่าเริ่มต้น ระบบจะเปลี่ยนข้อความเป็นตัวพิมพ์เล็กและแยกตามขอบเขตคำ ดังนั้น The และ the จึงถูกนับเป็นโทเค็นเดียวกัน

ตัวเลือกทำความสะอาดในตัว

คุณสามารถส่ง stop_words, min_df หรือ max_features เพื่อคัดคำศัพท์ออกได้โดยตรงภายในตัวทำเวกเตอร์

CountVectorizer(stop_words="english", max_features=1000)

นำกลับมาใช้กับข้อความใหม่

อย่าเรียก fit ใหม่กับข้อมูลทดสอบ ให้เรียกเฉพาะ transform เพื่อให้เอกสารใหม่ใช้คำศัพท์เดียวกันกับที่ใช้ฝึกทุกประการ

X_new = vectorizer.transform(new_docs)

ตรวจสอบอย่างรวดเร็ว

การเรียกใดเรียนรู้คำศัพท์และนับคำได้ในขั้นตอนเดียว

ทบทวน: CountVectorizer

คุณใช้ CountVectorizer เพื่อสร้างคำศัพท์ด้วย fit แปลงข้อความเป็นค่าการนับด้วย transform ตรวจสอบคุณลักษณะ และนำกลับมาใช้กับข้อมูลใหม่ 🎉

เริ่มต้นได้ฟรี

เรียนรู้ Python ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “นับด้วย CountVectorizer” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “นับด้วย CountVectorizer” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “นับด้วย CountVectorizer”

แปลงเอกสารเป็นเมทริกซ์การนับ คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “นับด้วย CountVectorizer” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม

ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใดโมเดลจึงต้องการตัวเลข ไม่ใช่คำ
  2. สร้างคลังคำศัพท์
  3. นับด้วย CountVectorizer
  4. อ่านเมทริกซ์คำในเอกสาร
← กลับไปที่ NLP Academy