นับด้วย CountVectorizer
แปลงเอกสารเป็นเมทริกซ์การนับ
นับด้วย CountVectorizer เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน
รู้จัก CountVectorizer
CountVectorizerจาก scikit-learn จะสร้างคำศัพท์และนับคำให้คุณด้วยโค้ดเพียงไม่กี่บรรทัด 🚀
from sklearn.feature_extraction.text import CountVectorizerสร้างตัวทำเวกเตอร์
ขั้นแรกให้สร้างอินสแตนซ์ โดยไม่มีอาร์กิวเมนต์ ระบบจะใช้ค่าเริ่มต้นที่เหมาะสมสำหรับการแยกโทเค็นและเปลี่ยนข้อความเป็นตัวพิมพ์เล็ก
vectorizer = CountVectorizer()fit เรียนรู้คำศัพท์
การเรียกใช้ fit จะสแกนเอกสารของคุณและค้นพบคำที่ไม่ซ้ำกันทั้งหมด พร้อมสร้างคำศัพท์โดยอัตโนมัติ
vectorizer.fit(docs)transform สร้างค่าการนับ
จากนั้น transform จะเปลี่ยนเอกสารแต่ละฉบับให้เป็นเวกเตอร์ค่าการนับ และให้เมทริกซ์ตัวเลขของความถี่คำ
X = vectorizer.transform(docs)fit และ transform พร้อมกัน
ทางลัด fit_transform ทำทั้งสองขั้นตอนพร้อมกันกับข้อความฝึก ซึ่งเป็นกระบวนการทำงานที่ใช้กันทั่วไป
X = vectorizer.fit_transform(docs)ดูคำศัพท์
ตรวจสอบคำที่เรียนรู้และดัชนีของคำเหล่านั้นด้วย get_feature_names_out คำเหล่านี้คือคอลัมน์ของเมทริกซ์
print(vectorizer.get_feature_names_out())ผลลัพธ์เป็นเมทริกซ์เบาบาง
เพื่อประหยัดหน่วยความจำ ผลลัพธ์จึงเป็นเมทริกซ์เบาบางที่เก็บเฉพาะค่าการนับที่ไม่เป็นศูนย์ ไม่ได้เก็บทุกช่องที่เป็นศูนย์
ดูตัวเลขอย่างรวดเร็ว
แปลงเป็นอาร์เรย์หนาแน่นเพื่ออ่านค่าการนับจริง ๆ ใช้ toarray เฉพาะกับตัวอย่างขนาดเล็กเท่านั้น
print(X.toarray())การเปลี่ยนเป็นตัวพิมพ์เล็กทำโดยอัตโนมัติ
โดยค่าเริ่มต้น ระบบจะเปลี่ยนข้อความเป็นตัวพิมพ์เล็กและแยกตามขอบเขตคำ ดังนั้น The และ the จึงถูกนับเป็นโทเค็นเดียวกัน
ตัวเลือกทำความสะอาดในตัว
คุณสามารถส่ง stop_words, min_df หรือ max_features เพื่อคัดคำศัพท์ออกได้โดยตรงภายในตัวทำเวกเตอร์
CountVectorizer(stop_words="english", max_features=1000)นำกลับมาใช้กับข้อความใหม่
อย่าเรียก fit ใหม่กับข้อมูลทดสอบ ให้เรียกเฉพาะ transform เพื่อให้เอกสารใหม่ใช้คำศัพท์เดียวกันกับที่ใช้ฝึกทุกประการ
X_new = vectorizer.transform(new_docs)ตรวจสอบอย่างรวดเร็ว
การเรียกใดเรียนรู้คำศัพท์และนับคำได้ในขั้นตอนเดียว
ทบทวน: CountVectorizer
คุณใช้ CountVectorizer เพื่อสร้างคำศัพท์ด้วย fit แปลงข้อความเป็นค่าการนับด้วย transform ตรวจสอบคุณลักษณะ และนำกลับมาใช้กับข้อมูลใหม่ 🎉
เรียนรู้ Python ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 30
- บทเรียน
- 120
คำถามที่พบบ่อย
บทเรียน “นับด้วย CountVectorizer” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “นับด้วย CountVectorizer” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “นับด้วย CountVectorizer”
แปลงเอกสารเป็นเมทริกซ์การนับ คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “นับด้วย CountVectorizer” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม
ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- เหตุใดโมเดลจึงต้องการตัวเลข ไม่ใช่คำ
- สร้างคลังคำศัพท์
- นับด้วย CountVectorizer
- อ่านเมทริกซ์คำในเอกสาร