0Pricing
AI Agents · บทเรียน

ตัวโหลดและตัวแยกวิเคราะห์เอกสาร

ใช้ตัวโหลดของ LlamaHub สำหรับแหล่งข้อมูลมากกว่า 200 ชนิด และใช้ตัวแยกวิเคราะห์ที่รักษาโครงสร้าง เช่น ตารางและหัวข้อ

ตัวโหลดและตัวแยกวิเคราะห์เอกสาร เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

LlamaIndex เทียบกับ LangChain

LlamaIndex (เดิมชื่อ GPT-Index) เป็นเฟรมเวิร์กเอเจนต์ขนาดใหญ่อีกตัวหนึ่ง โดยมุ่งเน้น RAG และเอเจนต์ที่ทำงานกับเอกสารเป็นหลัก

จุดเด่น: มีสิ่งนามธรรมสำหรับชนิดดัชนีที่สะอาดกว่า การแยกวิเคราะห์ PDF และเอกสารที่มีโครงสร้างได้ดีกว่า และตัวเลือกการสังเคราะห์คำตอบที่หลากหลาย

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub เป็นทะเบียนชุมชนที่มีตัวโหลดข้อมูลมากกว่า 200 รายการ:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse สำหรับ PDF

LlamaParse เป็นตัวแยกวิเคราะห์ PDF มาตรฐานระดับสูง รองรับตาราง เค้าโครงหลายคอลัมน์ และคณิตศาสตร์:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

ตารางเป็นเรื่องยาก

ตัวแยกวิเคราะห์ PDF มาตรฐานมักจัดการตารางได้เสียหาย LlamaParse จะแยกตารางออกมาเป็นตาราง Markdown ที่ถูกต้อง ซึ่งสำคัญอย่างยิ่งสำหรับเอกสารด้านการเงินและวิทยาศาสตร์

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

ข้อมูลกำกับเอกสาร

Document ทุกตัวมีข้อมูลกำกับที่คุณใช้สำหรับการกรองและการอ้างอิงได้:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

การเพิ่มข้อมูลกำกับแบบกำหนดเอง

เพิ่มข้อมูลให้เอกสารหลังโหลดเสร็จ:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

การไม่ส่งข้อมูลกำกับให้ LLM

ข้อมูลกำกับบางส่วนมีไว้สำหรับการกรองเท่านั้น ไม่ใช่สำหรับให้ LLM เห็น:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

การโหลดแบบอะซิงโครนัส

ตัวโหลดจำนวนมากรองรับการทำงานแบบอะซิงโครนัสสำหรับชุดข้อมูลขนาดใหญ่:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

จุดเด่นของ LlamaParse

LlamaParse มีชื่อเสียงในด้านใด

ทบทวน

ใช้ SimpleDirectoryReader เพื่อเริ่มต้นอย่างรวดเร็ว ใช้ LlamaHub สำหรับแหล่งข้อมูลแบบ SaaS และใช้ LlamaParse สำหรับไฟล์ PDF ที่ซับซ้อนอย่างจริงจัง Document.metadata เป็นตัวช่วยที่ดีของคุณ

คำถามที่พบบ่อย

บทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร”

ใช้ตัวโหลดของ LlamaHub สำหรับแหล่งข้อมูลมากกว่า 200 ชนิด และใช้ตัวแยกวิเคราะห์ที่รักษาโครงสร้าง เช่น ตารางและหัวข้อ คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “ตัวโหลดและตัวแยกวิเคราะห์เอกสาร” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ตัวโหลดและตัวแยกวิเคราะห์เอกสาร
  2. ลำดับชั้นของดัชนี: เวกเตอร์ ต้นไม้ คำสำคัญ
  3. เครื่องมือสอบถามและการสังเคราะห์คำตอบ
  4. กลยุทธ์การแยกคำถามย่อย
← กลับไปที่ AI Agents