โหลดโมเดลและประมวลผลเอกสาร
ส่งข้อความผ่าน nlp() ด้วยการเรียกครั้งเดียว
โหลดโมเดลและประมวลผลเอกสาร เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน
ติดตั้งก่อน
ก่อนโหลดสิ่งใด คุณต้องดาวน์โหลดโมเดลไว้ครั้งหนึ่ง โมเดล en_core_web_sm มีขนาดเล็ก รวดเร็ว และเหมาะอย่างยิ่งสำหรับการเริ่มต้น
python -m spacy download en_core_web_smโหลดโมเดล
คุณเริ่มใช้งาน spaCy ด้วย spacy.load ฟังก์ชันนี้อ่านโมเดลจากดิสก์และส่งคืนออบเจ็กต์ nlp ที่พร้อมประมวลผลข้อความ
import spacy
nlp = spacy.load("en_core_web_sm")nlp คืออะไร
ออบเจ็กต์ nlp นี้คือไปป์ไลน์ทั้งหมดที่ห่อรวมไว้ การเรียกใช้งานกับข้อความจะเรียกใช้ทุกขั้น ได้แก่ ตัวตัดคำ ตัวติดป้ายกำกับ ตัววิเคราะห์โครงสร้าง และตัวรู้จำเอนทิตี
ประมวลผลข้อความ
หากต้องการวิเคราะห์ประโยค เพียงเรียก nlp() กับสตริง ผลลัพธ์ที่ได้คือ Doc ซึ่งเป็นตัวเก็บข้อมูลโดยละเอียดที่บรรจุผลการวิเคราะห์ทั้งหมด
doc = nlp("Apple is hiring in Berlin.")เรียกครั้งเดียวได้ครบทุกอย่าง
การเรียกครั้งเดียวนั้นได้ตัดคำ ติดป้ายกำกับ และวิเคราะห์โครงสร้างเรียบร้อยแล้ว Doc จึงเก็บผลลัพธ์ทั้งหมดไว้ ทำให้คุณไม่ต้องทำงานซ้ำ
วนดูโทเค็น
Doc ทำงานคล้ายลำดับข้อมูล คุณจึงวนดูข้อมูลภายในได้ แต่ละรายการที่ได้กลับมาคือ Token ซึ่งมีแอตทริบิวต์ของตนเอง
for token in doc:
print(token.text)อ่านข้อความของโทเค็น
คำดิบจะอยู่ใน token.text ซึ่งตรงกับสตริงที่ปรากฏจริงและ spaCy พบขณะแบ่งประโยคของคุณ
โหลดครั้งเดียว ใช้ซ้ำ
การโหลดโมเดลใช้เวลา จึงควรทำครั้งเดียวเมื่อเริ่มต้นโปรแกรม จากนั้นใช้ออบเจ็กต์ nlp เดิมซ้ำกับเอกสารทุกฉบับที่คุณประมวลผล
ประมวลผลเอกสารจำนวนมาก
หากมีข้อความจำนวนมาก ให้ใช้ nlp.pipe ฟังก์ชันนี้จัดกลุ่มข้อความเพื่อประมวลผลอย่างมีประสิทธิภาพ และเร็วกว่าการเรียก nlp() ในลูปธรรมดามาก
for doc in nlp.pipe(texts):
print(len(doc))ปิดใช้งานเพื่อเพิ่มความเร็ว
ต้องการเพียงโทเค็นใช่ไหม คุณสามารถปิดใช้งานส่วนประกอบที่ไม่ใช้ขณะโหลด เพื่อข้ามงานที่ไม่จำเป็นและทำงานได้เร็วขึ้น
nlp = spacy.load("en_core_web_sm", disable=["parser"])ไปป์ไลน์ว่าง
คุณสามารถเริ่มจาก spacy.blank เพื่อสร้างไปป์ไลน์ที่มีเฉพาะตัวตัดคำได้เช่นกัน เหมาะเมื่อคุณต้องการสร้างทุกอย่างด้วยตนเอง
nlp = spacy.blank("en")ตรวจสอบอย่างรวดเร็ว
เมื่อเรียก nlp() กับสตริง คุณจะได้ผลลัพธ์อะไรกลับมา
สรุป
คุณติดตั้งโมเดล โหลดโมเดลครั้งเดียวด้วย spacy.load จากนั้นเรียก nlp() เพื่อรับ Doc การเรียกครั้งเดียวจะทำงานทั้งไปป์ไลน์ และคุณสามารถนำผลลัพธ์ไปใช้ซ้ำได้ทุกที่ 🎯
คำถามที่พบบ่อย
บทเรียน “โหลดโมเดลและประมวลผลเอกสาร” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “โหลดโมเดลและประมวลผลเอกสาร” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “โหลดโมเดลและประมวลผลเอกสาร”
ส่งข้อความผ่าน nlp() ด้วยการเรียกครั้งเดียว คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน
บทเรียน “โหลดโมเดลและประมวลผลเอกสาร” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม
ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- เหตุใดจึงเลือก spaCy สำหรับโครงการจริง
- โหลดโมเดลและประมวลผลเอกสาร
- โทเคน ช่วงข้อความ และออบเจ็กต์เอกสาร
- ปรับแต่งไปป์ไลน์