NLP Academy · บทเรียน

อ่านเมทริกซ์คำในเอกสาร

ทำความเข้าใจแถว คอลัมน์ และความเบาบาง

บทเรียน 4 จาก 413 ขั้นตอน

อ่านเมทริกซ์คำในเอกสาร เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

DTM คืออะไร

เมทริกซ์เอกสาร-คำคือตารางค่าการนับ แต่ละแถวคือเอกสาร และแต่ละคอลัมน์คือคำจากคำศัพท์ของคุณ 🧮

แถวคือเอกสาร

แถวหนึ่งแถวเก็บเวกเตอร์ค่าการนับทั้งหมดของเอกสารฉบับเดียว โดยสรุปว่าคำแต่ละคำปรากฏในเอกสารนั้นกี่ครั้ง

คอลัมน์คือคำ

แต่ละคอลัมน์ติดตามคำหนึ่งคำในเอกสารทุกฉบับ ดังนั้นการอ่านลงมาตามคอลัมน์จะแสดงว่าคำนั้นปรากฏที่ใดบ้าง

ช่องหนึ่งช่องคือค่าการนับ

ค่าที่แถว i คอลัมน์ j คือจำนวนครั้งที่คำ j ปรากฏในเอกสาร i ซึ่งเป็นค่าการนับหนึ่งค่า

ตรวจสอบรูปร่าง

รูปร่างของเมทริกซ์จะบอกว่าคุณกำลังทำงานกับเอกสารกี่ฉบับและคำที่ไม่ซ้ำกันกี่คำ

print(X.shape)  # (n_documents, n_words)

ช่องส่วนใหญ่เป็นศูนย์

เอกสารแต่ละฉบับใช้คำเพียงไม่กี่คำจากคำหลายพันคำ เมทริกซ์จึงประกอบด้วยศูนย์เป็นส่วนใหญ่ และเรียกว่าเบาบาง

เหตุใดความเบาบางจึงสำคัญ

การเก็บเฉพาะค่าที่ไม่เป็นศูนย์ช่วยรักษาเมทริกซ์ขนาดใหญ่ไว้ในหน่วยความจำ นี่คือเหตุผลที่ scikit-learn ส่งคืนรูปแบบเบาบาง

ติดป้ายกำกับคอลัมน์

จับคู่อาร์เรย์กับชื่อคุณลักษณะเพื่อให้อ่านได้ง่าย DataFrameจะเปลี่ยนค่าการนับดิบให้เป็นตารางที่ชัดเจน

import pandas as pd
df = pd.DataFrame(X.toarray(), columns=names)

อ่านเอกสารหนึ่งฉบับ

ดูแถวเดียวเพื่อเห็นลักษณะของเอกสารนั้น ว่าใช้คำใดและใช้บ่อยเพียงใด แถวนั้นคือลายนิ้วมือของเอกสาร

เปรียบเทียบเอกสารสองฉบับ

เอกสารที่คล้ายกันจะมีแถวที่คล้ายกัน การเปรียบเทียบเวกเตอร์ช่วยวัดได้ว่าข้อความสองชุดมีเนื้อหาใกล้เคียงกันเพียงใด

จากเมทริกซ์สู่โมเดล

เมทริกซ์นี้คือข้อมูลนำเข้าที่คุณส่งให้ตัวจำแนก DTM คือคุณลักษณะ ส่วนป้ายกำกับของคุณคือเป้าหมาย

ตรวจสอบอย่างรวดเร็ว

ในเมทริกซ์เอกสาร-คำ ช่องหนึ่งช่องเก็บอะไร

ทบทวน: DTM

คุณได้อ่านเมทริกซ์เอกสาร-คำ: แถวคือเอกสาร คอลัมน์คือคำ ช่องคือค่าการนับ และเห็นเหตุผลที่เมทริกซ์นี้มีลักษณะเบาบาง 🎉

เริ่มต้นได้ฟรี

เรียนรู้ Python ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “อ่านเมทริกซ์คำในเอกสาร” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “อ่านเมทริกซ์คำในเอกสาร” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “อ่านเมทริกซ์คำในเอกสาร”

ทำความเข้าใจแถว คอลัมน์ และความเบาบาง คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “อ่านเมทริกซ์คำในเอกสาร” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม

ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใดโมเดลจึงต้องการตัวเลข ไม่ใช่คำ
  2. สร้างคลังคำศัพท์
  3. นับด้วย CountVectorizer
  4. อ่านเมทริกซ์คำในเอกสาร
← กลับไปที่ NLP Academy