0Pricing
AI Agents · Lekcja

Loadery i parsery dokumentów

Używaj loaderów LlamaHub dla ponad 200 typów źródeł oraz parserów zachowujących strukturę (tabele, nagłówki).

Loadery i parsery dokumentów to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.

Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.

LlamaIndex a LangChain

LlamaIndex (wcześniej GPT-Index) to drugi duży framework agentowy. Koncentruje się na RAG i agentach zorientowanych na dokumenty.

Mocne strony: przejrzystsze abstrakcje typów indeksów, lepsze parsowanie plików PDF i dokumentów ustrukturyzowanych oraz rozbudowane opcje syntezy odpowiedzi.

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub to społecznościowy rejestr ponad 200 loaderów danych:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse do plików PDF

LlamaParse to parser plików PDF uznawany za wzorcowy — obsługuje tabele, układy wielokolumnowe i wzory matematyczne:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

Tabele są trudne

Standardowe parsery PDF często niszczą strukturę tabel. LlamaParse wyodrębnia je jako prawidłowe tabele Markdown — ma to kluczowe znaczenie w przypadku dokumentów finansowych i naukowych.

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

Metadane dokumentów

Każdy obiekt Document ma metadane, których można używać do filtrowania i tworzenia cytowań:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

Dodawanie własnych metadanych

Wzbogać dokumenty po wczytaniu:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

Wykluczanie metadanych z LLM

Niektóre metadane służą wyłącznie do filtrowania i nie powinny być widoczne dla LLM:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

Wczytywanie asynchroniczne

Wiele loaderów obsługuje operacje asynchroniczne w przypadku dużych partii danych:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

Mocna strona LlamaParse

Z czego znany jest LlamaParse?

Podsumowanie

SimpleDirectoryReader do szybkiego rozpoczęcia, LlamaHub do źródeł SaaS, LlamaParse do wymagających plików PDF. Document.metadata jest Państwa sprzymierzeńcem.

Często zadawane pytania

Czy lekcja „Loadery i parsery dokumentów” jest bezpłatna?

Tak — pełny tekst „Loadery i parsery dokumentów” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.

Co nauczysz się w „Loadery i parsery dokumentów”?

Używaj loaderów LlamaHub dla ponad 200 typów źródeł oraz parserów zachowujących strukturę (tabele, nagłówki). Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Agents?

Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Loadery i parsery dokumentów”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?

Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Loadery i parsery dokumentów
  2. Hierarchia indeksów: wektorowy, drzewa, słów kluczowych
  3. Silniki zapytań i synteza odpowiedzi
  4. Strategia dekompozycji na podzapytania
← Powrót do AI Agents