0Pricing
AI Agents · Lezione

Loader e parser di documenti

Utilizzi i loader di LlamaHub per oltre 200 tipi di sorgente e parser che conservano la struttura, come tabelle e titoli.

Loader e parser di documenti è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

LlamaIndex e LangChain

LlamaIndex, precedentemente GPT-Index, è l'altro grande framework per agenti. Si concentra sul RAG e sugli agenti incentrati sui documenti.

Punti di forza: astrazioni più pulite per i tipi di indice, parsing migliore di PDF e documenti strutturati, numerose opzioni per la sintesi delle risposte.

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub è un registro della community con oltre 200 loader di dati:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse per i PDF

LlamaParse è il parser PDF di riferimento: gestisce tabelle, layout a più colonne e formule matematiche:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

Le tabelle sono difficili

I parser PDF standard gestiscono male le tabelle. LlamaParse le estrae come vere tabelle Markdown, un aspetto fondamentale per i documenti finanziari e scientifici.

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

Metadati dei documenti

Ogni Document contiene metadati che puoi usare per i filtri e le citazioni:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

Aggiunta di metadati personalizzati

Arricchisci i documenti dopo il caricamento:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

Esclusione dei metadati dall'LLM

Alcuni metadati servono solo per i filtri e non devono essere visibili all'LLM:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

Caricamento asincrono

Molti loader supportano l'asincronia per i batch di grandi dimensioni:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

Punto di forza di LlamaParse

Per che cosa è noto LlamaParse?

Riepilogo

SimpleDirectoryReader per iniziare rapidamente, LlamaHub per le fonti SaaS, LlamaParse per i PDF complessi. Document.metadata è un alleato prezioso.

Domande Frequenti

La lezione «Loader e parser di documenti» è gratuita?

Sì — il testo completo di «Loader e parser di documenti» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Loader e parser di documenti»?

Utilizzi i loader di LlamaHub per oltre 200 tipi di sorgente e parser che conservano la struttura, come tabelle e titoli. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «Loader e parser di documenti»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Loader e parser di documenti
  2. La gerarchia degli indici: vettoriale, ad albero, per parole chiave
  3. Motori di query e sintesi delle risposte
  4. Strategia di scomposizione in sotto-domande
← Torna a AI Agents