0Pricing
NLP Academy · บทเรียน

โหลดโมเดลและประมวลผลเอกสาร

ส่งข้อความผ่าน nlp() ด้วยการเรียกครั้งเดียว

โหลดโมเดลและประมวลผลเอกสาร เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

ติดตั้งก่อน

ก่อนโหลดสิ่งใด คุณต้องดาวน์โหลดโมเดลไว้ครั้งหนึ่ง โมเดล en_core_web_sm มีขนาดเล็ก รวดเร็ว และเหมาะอย่างยิ่งสำหรับการเริ่มต้น

python -m spacy download en_core_web_sm

โหลดโมเดล

คุณเริ่มใช้งาน spaCy ด้วย spacy.load ฟังก์ชันนี้อ่านโมเดลจากดิสก์และส่งคืนออบเจ็กต์ nlp ที่พร้อมประมวลผลข้อความ

import spacy
nlp = spacy.load("en_core_web_sm")

nlp คืออะไร

ออบเจ็กต์ nlp นี้คือไปป์ไลน์ทั้งหมดที่ห่อรวมไว้ การเรียกใช้งานกับข้อความจะเรียกใช้ทุกขั้น ได้แก่ ตัวตัดคำ ตัวติดป้ายกำกับ ตัววิเคราะห์โครงสร้าง และตัวรู้จำเอนทิตี

ประมวลผลข้อความ

หากต้องการวิเคราะห์ประโยค เพียงเรียก nlp() กับสตริง ผลลัพธ์ที่ได้คือ Doc ซึ่งเป็นตัวเก็บข้อมูลโดยละเอียดที่บรรจุผลการวิเคราะห์ทั้งหมด

doc = nlp("Apple is hiring in Berlin.")

เรียกครั้งเดียวได้ครบทุกอย่าง

การเรียกครั้งเดียวนั้นได้ตัดคำ ติดป้ายกำกับ และวิเคราะห์โครงสร้างเรียบร้อยแล้ว Doc จึงเก็บผลลัพธ์ทั้งหมดไว้ ทำให้คุณไม่ต้องทำงานซ้ำ

วนดูโทเค็น

Doc ทำงานคล้ายลำดับข้อมูล คุณจึงวนดูข้อมูลภายในได้ แต่ละรายการที่ได้กลับมาคือ Token ซึ่งมีแอตทริบิวต์ของตนเอง

for token in doc:
    print(token.text)

อ่านข้อความของโทเค็น

คำดิบจะอยู่ใน token.text ซึ่งตรงกับสตริงที่ปรากฏจริงและ spaCy พบขณะแบ่งประโยคของคุณ

โหลดครั้งเดียว ใช้ซ้ำ

การโหลดโมเดลใช้เวลา จึงควรทำครั้งเดียวเมื่อเริ่มต้นโปรแกรม จากนั้นใช้ออบเจ็กต์ nlp เดิมซ้ำกับเอกสารทุกฉบับที่คุณประมวลผล

ประมวลผลเอกสารจำนวนมาก

หากมีข้อความจำนวนมาก ให้ใช้ nlp.pipe ฟังก์ชันนี้จัดกลุ่มข้อความเพื่อประมวลผลอย่างมีประสิทธิภาพ และเร็วกว่าการเรียก nlp() ในลูปธรรมดามาก

for doc in nlp.pipe(texts):
    print(len(doc))

ปิดใช้งานเพื่อเพิ่มความเร็ว

ต้องการเพียงโทเค็นใช่ไหม คุณสามารถปิดใช้งานส่วนประกอบที่ไม่ใช้ขณะโหลด เพื่อข้ามงานที่ไม่จำเป็นและทำงานได้เร็วขึ้น

nlp = spacy.load("en_core_web_sm", disable=["parser"])

ไปป์ไลน์ว่าง

คุณสามารถเริ่มจาก spacy.blank เพื่อสร้างไปป์ไลน์ที่มีเฉพาะตัวตัดคำได้เช่นกัน เหมาะเมื่อคุณต้องการสร้างทุกอย่างด้วยตนเอง

nlp = spacy.blank("en")

ตรวจสอบอย่างรวดเร็ว

เมื่อเรียก nlp() กับสตริง คุณจะได้ผลลัพธ์อะไรกลับมา

สรุป

คุณติดตั้งโมเดล โหลดโมเดลครั้งเดียวด้วย spacy.load จากนั้นเรียก nlp() เพื่อรับ Doc การเรียกครั้งเดียวจะทำงานทั้งไปป์ไลน์ และคุณสามารถนำผลลัพธ์ไปใช้ซ้ำได้ทุกที่ 🎯

คำถามที่พบบ่อย

บทเรียน “โหลดโมเดลและประมวลผลเอกสาร” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “โหลดโมเดลและประมวลผลเอกสาร” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “โหลดโมเดลและประมวลผลเอกสาร”

ส่งข้อความผ่าน nlp() ด้วยการเรียกครั้งเดียว คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน

บทเรียน “โหลดโมเดลและประมวลผลเอกสาร” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม

ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใดจึงเลือก spaCy สำหรับโครงการจริง
  2. โหลดโมเดลและประมวลผลเอกสาร
  3. โทเคน ช่วงข้อความ และออบเจ็กต์เอกสาร
  4. ปรับแต่งไปป์ไลน์
← กลับไปที่ NLP Academy