Loader, Splitter und Vektorspeicher
Verwenden Sie DocumentLoaders für PDFs/HTML, TextSplitters zum Chunking und VectorStores für das Retrieval.
Loader, Splitter und Vektorspeicher ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
Die drei Säulen von RAG in LangChain
- Dokumenten-Loader — lesen Rohdaten in Documents ein
- Text-Splitter — teilen Documents in Chunks auf
- Vektorspeicher — betten Chunks ein und indizieren sie
Dokumenten-Loader
LangChain verfügt über mehr als 100 Loader. Beispiele:
from langchain_community.document_loaders import PyPDFLoader, WebBaseLoader, TextLoader
pdf_docs = PyPDFLoader('handbook.pdf').load()
web_docs = WebBaseLoader('https://example.com').load()
md_docs = TextLoader('README.md').load()Das Document-Objekt
Jeder Loader gibt eine Liste von Documents zurück:
doc = pdf_docs[0]
print(doc.page_content) # the text
print(doc.metadata) # {'source': 'handbook.pdf', 'page': 1}Häufig verwendete Loader
- PyPDFLoader, UnstructuredFileLoader — PDFs
- WebBaseLoader, SitemapLoader — Webseiten
- NotionLoader, GoogleDriveLoader — SaaS
- GitLoader — Code-Repositories
- SQLDatabaseLoader — Datenbankzeilen
Text-Splitter
Wandeln Sie Documents in kleinere Chunks um:
from langchain.text_splitter import RecursiveCharacterTextSplitter
splitter = RecursiveCharacterTextSplitter(
chunk_size=800,
chunk_overlap=100,
separators=['\n\n', '\n', '. ', ' ']
)
chunks = splitter.split_documents(pdf_docs)Spezialisierte Splitter
- MarkdownHeaderTextSplitter — teilt anhand von Überschriften
- RecursiveCharacterTextSplitter — berücksichtigt Absätze und Sätze
- HTMLHeaderTextSplitter — berücksichtigt HTML
- Sprachspezifische Splitter (Python, Markdown, LaTeX)
Token-bewusstes Aufteilen
Verwenden Sie den Tokenizer des Modells für tokenpräzise Aufteilungen:
splitter = RecursiveCharacterTextSplitter.from_tiktoken_encoder(
encoding_name='cl100k_base',
chunk_size=400,
chunk_overlap=50
)Vektorspeicher
Betten Sie die Chunks ein und speichern Sie sie:
from langchain_openai import OpenAIEmbeddings
from langchain_community.vectorstores import Chroma
embeddings = OpenAIEmbeddings(model='text-embedding-3-small')
store = Chroma.from_documents(
documents=chunks,
embedding=embeddings,
persist_directory='./db'
)Retrieval
retriever = store.as_retriever(search_kwargs={'k': 4})
results = retriever.invoke('What is our return policy?')
for d in results:
print(d.page_content[:200])Persistenz
Chroma speichert Daten auf der Festplatte, wenn Sie persist_directory angeben. So laden Sie sie erneut:
store = Chroma(persist_directory='./db', embedding_function=embeddings)Weitere Vektorspeicher
Dieselbe Schnittstelle, ein anderes Backend:
from langchain_community.vectorstores import FAISS, Pinecone, Qdrant, Weaviate
store = FAISS.from_documents(chunks, embeddings)
store.save_local('./faiss_db')MultiVectorRetriever
Indizieren Sie kleine Chunks, rufen Sie aber große übergeordnete Dokumente ab:
from langchain.retrievers import MultiVectorRetriever
# Use the parent-child pattern automatically.Self-Query-Retriever
Lassen Sie das LLM Metadatenfilter aus natürlicher Sprache generieren:
from langchain.retrievers.self_query.base import SelfQueryRetriever
# 'What did Alice say in 2023?' -> filter={author: 'Alice', year: 2023}Retriever-Ausgabe
Was gibt ein LangChain-Retriever zurück?
Zusammenfassung
Loader + Splitter + Vektorspeicher = ein vollständiger RAG-Stack. Als Nächstes: Sie setzen sie mit LCEL zu einer vollständigen Chain zusammen.
Häufig gestellte Fragen
Ist die Lektion „Loader, Splitter und Vektorspeicher“ kostenlos?
Ja — der vollständige Text von „Loader, Splitter und Vektorspeicher“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Loader, Splitter und Vektorspeicher“?
Verwenden Sie DocumentLoaders für PDFs/HTML, TextSplitters zum Chunking und VectorStores für das Retrieval. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Loader, Splitter und Vektorspeicher“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- LangChain-Architektur: Modelle, Prompts, Chains
- Loader, Splitter und Vektorspeicher
- LCEL (LangChain Expression Language)
- Eine RAG-Chain von Anfang bis Ende erstellen