ตัวโหลดและตัวแยกวิเคราะห์เอกสาร
ใช้ตัวโหลดของ LlamaHub สำหรับแหล่งข้อมูลมากกว่า 200 ชนิด และใช้ตัวแยกวิเคราะห์ที่รักษาโครงสร้าง เช่น ตารางและหัวข้อ
ตัวโหลดและตัวแยกวิเคราะห์เอกสาร เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
LlamaIndex เทียบกับ LangChain
LlamaIndex (เดิมชื่อ GPT-Index) เป็นเฟรมเวิร์กเอเจนต์ขนาดใหญ่อีกตัวหนึ่ง โดยมุ่งเน้น RAG และเอเจนต์ที่ทำงานกับเอกสารเป็นหลัก
จุดเด่น: มีสิ่งนามธรรมสำหรับชนิดดัชนีที่สะอาดกว่า การแยกวิเคราะห์ PDF และเอกสารที่มีโครงสร้างได้ดีกว่า และตัวเลือกการสังเคราะห์คำตอบที่หลากหลาย
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHub เป็นทะเบียนชุมชนที่มีตัวโหลดข้อมูลมากกว่า 200 รายการ:
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])LlamaParse สำหรับ PDF
LlamaParse เป็นตัวแยกวิเคราะห์ PDF มาตรฐานระดับสูง รองรับตาราง เค้าโครงหลายคอลัมน์ และคณิตศาสตร์:
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')ตารางเป็นเรื่องยาก
ตัวแยกวิเคราะห์ PDF มาตรฐานมักจัดการตารางได้เสียหาย LlamaParse จะแยกตารางออกมาเป็นตาราง Markdown ที่ถูกต้อง ซึ่งสำคัญอย่างยิ่งสำหรับเอกสารด้านการเงินและวิทยาศาสตร์
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')ข้อมูลกำกับเอกสาร
Document ทุกตัวมีข้อมูลกำกับที่คุณใช้สำหรับการกรองและการอ้างอิงได้:
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}การเพิ่มข้อมูลกำกับแบบกำหนดเอง
เพิ่มข้อมูลให้เอกสารหลังโหลดเสร็จ:
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'การไม่ส่งข้อมูลกำกับให้ LLM
ข้อมูลกำกับบางส่วนมีไว้สำหรับการกรองเท่านั้น ไม่ใช่สำหรับให้ LLM เห็น:
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.การโหลดแบบอะซิงโครนัส
ตัวโหลดจำนวนมากรองรับการทำงานแบบอะซิงโครนัสสำหรับชุดข้อมูลขนาดใหญ่:
docs = await reader.aload_data(['url1', 'url2', 'url3'])จุดเด่นของ LlamaParse
LlamaParse มีชื่อเสียงในด้านใด
ทบทวน
ใช้ SimpleDirectoryReader เพื่อเริ่มต้นอย่างรวดเร็ว ใช้ LlamaHub สำหรับแหล่งข้อมูลแบบ SaaS และใช้ LlamaParse สำหรับไฟล์ PDF ที่ซับซ้อนอย่างจริงจัง Document.metadata เป็นตัวช่วยที่ดีของคุณ
คำถามที่พบบ่อย
บทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร”
ใช้ตัวโหลดของ LlamaHub สำหรับแหล่งข้อมูลมากกว่า 200 ชนิด และใช้ตัวแยกวิเคราะห์ที่รักษาโครงสร้าง เช่น ตารางและหัวข้อ คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- ตัวโหลดและตัวแยกวิเคราะห์เอกสาร
- ลำดับชั้นของดัชนี: เวกเตอร์ ต้นไม้ คำสำคัญ
- เครื่องมือสอบถามและการสังเคราะห์คำตอบ
- กลยุทธ์การแยกคำถามย่อย