Loadery i parsery dokumentów
Używaj loaderów LlamaHub dla ponad 200 typów źródeł oraz parserów zachowujących strukturę (tabele, nagłówki).
Loadery i parsery dokumentów to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
LlamaIndex a LangChain
LlamaIndex (wcześniej GPT-Index) to drugi duży framework agentowy. Koncentruje się na RAG i agentach zorientowanych na dokumenty.
Mocne strony: przejrzystsze abstrakcje typów indeksów, lepsze parsowanie plików PDF i dokumentów ustrukturyzowanych oraz rozbudowane opcje syntezy odpowiedzi.
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHub to społecznościowy rejestr ponad 200 loaderów danych:
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])LlamaParse do plików PDF
LlamaParse to parser plików PDF uznawany za wzorcowy — obsługuje tabele, układy wielokolumnowe i wzory matematyczne:
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')Tabele są trudne
Standardowe parsery PDF często niszczą strukturę tabel. LlamaParse wyodrębnia je jako prawidłowe tabele Markdown — ma to kluczowe znaczenie w przypadku dokumentów finansowych i naukowych.
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')Metadane dokumentów
Każdy obiekt Document ma metadane, których można używać do filtrowania i tworzenia cytowań:
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}Dodawanie własnych metadanych
Wzbogać dokumenty po wczytaniu:
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'Wykluczanie metadanych z LLM
Niektóre metadane służą wyłącznie do filtrowania i nie powinny być widoczne dla LLM:
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.Wczytywanie asynchroniczne
Wiele loaderów obsługuje operacje asynchroniczne w przypadku dużych partii danych:
docs = await reader.aload_data(['url1', 'url2', 'url3'])Mocna strona LlamaParse
Z czego znany jest LlamaParse?
Podsumowanie
SimpleDirectoryReader do szybkiego rozpoczęcia, LlamaHub do źródeł SaaS, LlamaParse do wymagających plików PDF. Document.metadata jest Państwa sprzymierzeńcem.
Często zadawane pytania
Czy lekcja „Loadery i parsery dokumentów” jest bezpłatna?
Tak — pełny tekst „Loadery i parsery dokumentów” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Loadery i parsery dokumentów”?
Używaj loaderów LlamaHub dla ponad 200 typów źródeł oraz parserów zachowujących strukturę (tabele, nagłówki). Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Loadery i parsery dokumentów”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Loadery i parsery dokumentów
- Hierarchia indeksów: wektorowy, drzewa, słów kluczowych
- Silniki zapytań i synteza odpowiedzi
- Strategia dekompozycji na podzapytania