0Pricing
NLP Academy · บทเรียน

แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง

เตรียมฐานความรู้ที่ค้นหาได้

แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง เป็นบทเรียน NLP Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน NLP Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

เอกสารใหญ่เกินกว่าจะค้นหาทั้งหมด

ไฟล์ PDF ขนาดยาวอาจมีหลายหัวข้อรวมอยู่ด้วยกัน เพื่อให้ค้นคืนได้อย่างแม่นยำ คุณต้องแบ่งเอกสารออกเป็นชิ้นส่วนเล็ก ๆ ที่เรียกว่า ส่วนย่อยก่อน

ส่วนย่อยที่ดีควรเป็นอย่างไร

ส่วนย่อยที่ดีควรมีแนวคิดเดียวที่ต่อเนื่องกัน เช่น หนึ่งหรือสองย่อหน้า หากใหญ่เกินไป คำตอบจะถูกกลบอยู่ภายในเนื้อหา หากเล็กเกินไป บริบทโดยรอบจะหายไป

แบ่งตามขนาด

วิธีที่ง่ายที่สุดคือตัดข้อความทุกจำนวน อักขระหรือโทเค็นที่กำหนดไว้ วิธีนี้รวดเร็ว แต่สามารถตัดประโยคออกเป็นสองส่วนได้

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

ส่วนย่อยที่ทับซ้อนกัน

เพื่อไม่ให้แนวคิดถูกตัดขาด ให้ส่วนย่อยมี ส่วนที่ทับซ้อนกัน การทำซ้ำบรรทัดท้าย ๆ จะช่วยให้บริบทต่อเนื่องข้ามรอยแบ่ง

แบ่งตามโครงสร้าง

เครื่องมือแบ่งข้อความที่ฉลาดขึ้นจะแบ่งตามย่อหน้าหรือหัวข้อก่อน การเคารพ โครงสร้างช่วยให้แต่ละส่วนย่อยมีหัวข้อเดียวที่ชัดเจน

จากข้อความสู่เวกเตอร์

การค้นหาต้องใช้ตัวเลข ไม่ใช่คำ การฝังความหมายจะเปลี่ยนแต่ละส่วนย่อยให้เป็นเวกเตอร์หนาแน่นที่สื่อความหมายของส่วนนั้น

ความหมายอยู่ในระยะห่าง

การฝังความหมายจะจัดให้ข้อความที่คล้ายกันอยู่ใกล้กัน ส่วนย่อยสองส่วนที่พูดถึงแนวคิดเดียวกันจะอยู่ใกล้กันใน ปริภูมิเวกเตอร์

เรียกใช้โมเดลสร้างเวกเตอร์

คุณส่งข้อความให้กับ โมเดลสร้างเวกเตอร์ แล้วรับรายการจำนวนทศนิยมกลับมา โมเดลเดียวกันต้องใช้สร้างเวกเตอร์ให้ทั้งส่วนย่อยและคำค้น

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

เข้ารหัสส่วนย่อยของคุณ

ส่งส่วนย่อยทุกส่วนผ่านโมเดลเพื่อสร้างเวกเตอร์ของแต่ละส่วน คุณสามารถเรียก encode ครั้งเดียวเพื่อเข้ารหัสรายการทั้งหมดพร้อมกัน ซึ่งช่วยเพิ่มความเร็ว

vectors = model.encode(chunks)

มิติของเวกเตอร์

เวกเตอร์แต่ละตัวมีความยาวคงที่ เรียกว่า มิติ โมเดลขนาดเล็กอาจให้ตัวเลข 384 ค่า ส่วนโมเดลขนาดใหญ่ให้ 768 ค่าหรือมากกว่า

print(vectors.shape)  # (n_chunks, 384)

จัดเก็บส่วนย่อยและเวกเตอร์ไว้ด้วยกัน

เชื่อมโยงเวกเตอร์แต่ละตัวกับ ข้อความต้นฉบับและแหล่งที่มาไว้เสมอ ภายหลังคุณจะค้นคืนด้วยเวกเตอร์ แต่แสดงส่วนย่อยที่มนุษย์อ่านได้

ตรวจสอบอย่างรวดเร็ว

ลองพิจารณาว่าเหตุใดเราจึงเพิ่มส่วนที่ทับซ้อนกันเมื่อแบ่งเอกสาร

สรุปทบทวน

คุณแบ่งเอกสารออกเป็น ส่วนย่อย ซึ่งอาจให้ทับซ้อนกัน จากนั้นฝังแต่ละส่วนลงในเวกเตอร์ จัดเก็บข้อความและเวกเตอร์ไว้ด้วยกันเพื่อใช้ค้นคืน ✅

คำถามที่พบบ่อย

บทเรียน “แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส NLP Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส NLP Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง”

เตรียมฐานความรู้ที่ค้นหาได้ คุณปฏิบัติ NLP Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน NLP Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน NLP Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน

บทเรียน “แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน NLP Academy นี้ได้ไหม

ได้ บทเรียน NLP Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใด LLM จึงต้องใช้การค้นคืน
  2. แบ่งเอกสารเป็นช่วงและสร้างเอ็มเบดดิง
  3. ค้นหาเวกเตอร์ด้วยคลังเวกเตอร์
  4. เชื่อมการค้นคืนเข้ากับพรอมป์ต์
← กลับไปที่ NLP Academy