0Pricing
AI Agents · Lektion

Dokument-Loader und Parser

Verwenden Sie LlamaHub-Loader für mehr als 200 Quelltypen sowie Parser, die die Struktur erhalten (Tabellen, Überschriften).

Dokument-Loader und Parser ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

LlamaIndex im Vergleich zu LangChain

LlamaIndex (früher GPT-Index) ist das andere große Agent-Framework. Es konzentriert sich auf RAG und dokumentenzentrierte Agents.

Stärken: klarere Abstraktionen für Indextypen, besseres Parsen von PDFs und strukturierten Dokumenten sowie umfangreiche Optionen für die Antwortsynthese.

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub ist ein Community-Verzeichnis mit mehr als 200 Daten-Loadern:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse für PDFs

LlamaParse ist der Goldstandard für PDF-Parser — es verarbeitet Tabellen, mehrspaltige Layouts und mathematische Formeln:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

Tabellen sind schwierig

Standard-PDF-Parser zerstören Tabellen. LlamaParse extrahiert sie als korrekte Markdown-Tabellen — entscheidend für finanzielle und wissenschaftliche Dokumente.

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

Dokumentenmetadaten

Jedes Document verfügt über Metadaten, die Sie für Filter und Zitate verwenden können:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

Benutzerdefinierte Metadaten hinzufügen

Erweitern Sie Documents nach dem Laden:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

Metadaten aus dem LLM ausschließen

Einige Metadaten dienen nur zum Filtern und sollen nicht für das LLM sichtbar sein:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

Asynchrones Laden

Viele Loader unterstützen asynchrone Verarbeitung für große Batches:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

Die Stärke von LlamaParse

Wofür ist LlamaParse bekannt?

Zusammenfassung

SimpleDirectoryReader für den schnellen Einstieg, LlamaHub für SaaS-Quellen, LlamaParse für anspruchsvolle PDFs. Document.metadata ist Ihr bester Freund.

Häufig gestellte Fragen

Ist die Lektion „Dokument-Loader und Parser“ kostenlos?

Ja — der vollständige Text von „Dokument-Loader und Parser“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Dokument-Loader und Parser“?

Verwenden Sie LlamaHub-Loader für mehr als 200 Quelltypen sowie Parser, die die Struktur erhalten (Tabellen, Überschriften). Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Dokument-Loader und Parser“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Dokument-Loader und Parser
  2. Die Index-Hierarchie: Vektor, Baum, Schlüsselwort
  3. Query Engines und Antwortsynthese
  4. Strategie zur Zerlegung in Teilfragen
← Zurück zu AI Agents