0Pricing
AI Agents · บทเรียน

การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ

เชื่อมทุกส่วนเข้าด้วยกัน: ตัวโหลด -> ตัวแบ่ง -> Embedding -> คลังเวกเตอร์ -> ตัวค้นคืน -> พรอมต์ -> โมเดล

การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

เป้าหมายโครงการ

รวมตัวโหลด ตัวแบ่งข้อความ คลังเวกเตอร์ และ LCEL ให้เป็นเชน RAG ครบวงจรที่มีโครงสร้างใกล้เคียงระบบจริง

Step 1: Load and Chunk

from langchain_community.document_loaders import PyPDFLoader
from langchain.text_splitter import RecursiveCharacterTextSplitter

loader = PyPDFLoader('handbook.pdf')
docs = loader.load()
splitter = RecursiveCharacterTextSplitter(chunk_size=800, chunk_overlap=100)
chunks = splitter.split_documents(docs)
print(f'{len(chunks)} chunks loaded')

Step 2: Embed and Store

from langchain_openai import OpenAIEmbeddings
from langchain_community.vectorstores import Chroma

embeddings = OpenAIEmbeddings(model='text-embedding-3-small')
store = Chroma.from_documents(
    chunks,
    embeddings,
    persist_directory='./handbook_db'
)

Step 3: Set Up Retriever

retriever = store.as_retriever(
    search_type='similarity',
    search_kwargs={'k': 4}
)

Step 4: Define the Prompt

from langchain.prompts import ChatPromptTemplate

rag_prompt = ChatPromptTemplate.from_template('''
You are a helpful assistant. Use the context below to answer.
If the answer is not in the context, say you do not know.
Cite sources like [1], [2].

Context:
{context}

Question: {question}

Answer:
''')

Step 5: Format Documents Helper

def format_docs(docs):
    return '\n\n'.join(
        f'[{i+1}] (source: {d.metadata.get("source", "?")}, page {d.metadata.get("page", "?")})\n{d.page_content}'
        for i, d in enumerate(docs)
    )

from types import SimpleNamespace
docs = [
    SimpleNamespace(metadata={'source': 'handbook.pdf', 'page': 3}, page_content='Vacation policy details.'),
    SimpleNamespace(metadata={'source': 'handbook.pdf', 'page': 5}, page_content='Sick leave details.'),
]
print(format_docs(docs))

Step 6: Assemble the LCEL Chain

from langchain_core.runnables import RunnablePassthrough
from langchain.schema.output_parser import StrOutputParser
from langchain_openai import ChatOpenAI

model = ChatOpenAI(model='gpt-4o-mini', temperature=0)

rag_chain = (
    {'context': retriever | format_docs, 'question': RunnablePassthrough()}
    | rag_prompt
    | model
    | StrOutputParser()
)

Step 7: Invoke

answer = rag_chain.invoke('What is our refund policy?')
print(answer)

Step 8: Stream the Answer

for chunk in rag_chain.stream('What is our refund policy?'):
    print(chunk, end='', flush=True)

ขั้นที่ 9: ส่งคืนแหล่งที่มาแยกต่างหาก

บางครั้งคุณต้องการทั้งคำตอบและเอกสารที่ดึงมาใน output:

from langchain_core.runnables import RunnableParallel

rag_with_sources = RunnableParallel(
    context=retriever,
    answer=rag_chain
)

result = rag_with_sources.invoke('What is our refund policy?')
print(result['answer'])
for doc in result['context']:
    print(doc.metadata)

ขั้นที่ 10: RAG แบบสนทนา

เพิ่มการดึงข้อมูลที่คำนึงถึงประวัติการสนทนา — เขียนคำถามติดตามผลใหม่ให้อยู่ในรูปแบบที่สมบูรณ์ในตัวเองก่อนดึงข้อมูล:

from langchain.chains import create_history_aware_retriever
# 'And what about XL sizes?' -> 'What is the refund policy for XL sizes?'

ขั้นที่ 11: ประเมินเชน

การผสานรวม LangSmith จะบันทึกการเรียกใช้เชนทุกครั้ง คุณสามารถสร้างชุดข้อมูลจากการใช้งานจริงและเรียกใช้การประเมินได้

ข้อควรพิจารณาสำหรับระบบจริง

  • กำหนดรุ่นของโมเดลให้ตายตัว
  • กำหนด max_tokens
  • เพิ่มการติดตามการใช้โทเค็น
  • ใช้การลองใหม่พร้อมโมเดลสำรอง
  • แคชเวกเตอร์ฝังตัว (ใน OpenAI มีความแน่นอนอยู่แล้ว)
  • เพิ่ม Langfuse/LangSmith สำหรับร่องรอยการทำงาน

จุดประสงค์ของ format_docs

เหตุใดจึงใช้ตัวช่วย format_docs ระหว่างตัวดึงข้อมูลกับพรอมต์

สรุปทบทวน

คุณสร้างเชน RAG ครบวงจรด้วย LCEL แล้ว โครงร่างนี้สามารถขยายไปใช้ในระบบจริงได้ด้วยส่วนเพิ่มเติมข้างต้น

คำถามที่พบบ่อย

บทเรียน “การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ”

เชื่อมทุกส่วนเข้าด้วยกัน: ตัวโหลด -> ตัวแบ่ง -> Embedding -> คลังเวกเตอร์ -> ตัวค้นคืน -> พรอมต์ -> โมเดล คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. สถาปัตยกรรม LangChain: โมเดล พรอมต์ และสายงาน
  2. ตัวโหลด ตัวแบ่ง และคลังเวกเตอร์
  3. LCEL (ภาษานิพจน์ของ LangChain)
  4. การสร้างสายงาน RAG ตั้งแต่ต้นจนจบ
← กลับไปที่ AI Agents