AI Agents · Lezione

Loader, splitter e vector store

Utilizzi DocumentLoaders per PDF/HTML, TextSplitters per il chunking e VectorStores per il retrieval.

Lezione 2 di 415 passaggi

Loader, splitter e vector store è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

I tre pilastri del RAG in LangChain

  1. Document Loader — leggono i dati grezzi e li trasformano in Document
  2. Text Splitter — suddividono i Document in chunk
  3. Vector Store — creano gli embedding e indicizzano i chunk

Document Loader

LangChain include oltre 100 loader. Ecco alcuni esempi:

from langchain_community.document_loaders import PyPDFLoader, WebBaseLoader, TextLoader

pdf_docs = PyPDFLoader('handbook.pdf').load()
web_docs = WebBaseLoader('https://example.com').load()
md_docs = TextLoader('README.md').load()

L'oggetto Document

Ogni loader restituisce un elenco di Document:

doc = pdf_docs[0]
print(doc.page_content)   # the text
print(doc.metadata)       # {'source': 'handbook.pdf', 'page': 1}

Loader comuni

  • PyPDFLoader, UnstructuredFileLoader — PDF
  • WebBaseLoader, SitemapLoader — pagine web
  • NotionLoader, GoogleDriveLoader — SaaS
  • GitLoader — repository di codice
  • SQLDatabaseLoader — righe del database

Text Splitter

Convertono i Document in chunk più piccoli:

from langchain.text_splitter import RecursiveCharacterTextSplitter

splitter = RecursiveCharacterTextSplitter(
    chunk_size=800,
    chunk_overlap=100,
    separators=['\n\n', '\n', '. ', ' ']
)
chunks = splitter.split_documents(pdf_docs)

Splitter specializzati

  • MarkdownHeaderTextSplitter — suddivide in base alle intestazioni
  • RecursiveCharacterTextSplitter — tiene conto di paragrafi e frasi
  • HTMLHeaderTextSplitter — tiene conto della struttura HTML
  • Specifici per linguaggio (Python, Markdown, LaTeX)

Suddivisione basata sui token

Usa il tokenizer del modello per suddivisioni precise a livello di token:

splitter = RecursiveCharacterTextSplitter.from_tiktoken_encoder(
    encoding_name='cl100k_base',
    chunk_size=400,
    chunk_overlap=50
)

Vector Store

Crea gli embedding dei chunk e memorizzali:

from langchain_openai import OpenAIEmbeddings
from langchain_community.vectorstores import Chroma

embeddings = OpenAIEmbeddings(model='text-embedding-3-small')
store = Chroma.from_documents(
    documents=chunks,
    embedding=embeddings,
    persist_directory='./db'
)

Retrieval

retriever = store.as_retriever(search_kwargs={'k': 4})
results = retriever.invoke('What is our return policy?')
for d in results:
    print(d.page_content[:200])

Persistenza

Chroma salva i dati su disco se gli fornisci persist_directory. Per ricaricarli:

store = Chroma(persist_directory='./db', embedding_function=embeddings)

Altri vector store

La stessa interfaccia, con un backend diverso:

from langchain_community.vectorstores import FAISS, Pinecone, Qdrant, Weaviate

store = FAISS.from_documents(chunks, embeddings)
store.save_local('./faiss_db')

MultiVectorRetriever

Indicizza chunk piccoli, ma recupera i documenti parent più grandi:

from langchain.retrievers import MultiVectorRetriever
# Use the parent-child pattern automatically.

Retriever self-query

Permetti all'LLM di generare filtri per i metadati a partire dal linguaggio naturale:

from langchain.retrievers.self_query.base import SelfQueryRetriever
# 'What did Alice say in 2023?' -> filter={author: 'Alice', year: 2023}

Output del retriever

Che cosa restituisce un retriever LangChain?

Riepilogo

Loader + splitter + vector store = uno stack RAG completo. Prossimo argomento: come comporli con LCEL in una chain completa.

Gratis per iniziare

Impara AI Agents con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
60
Lezioni
239

Domande Frequenti

La lezione «Loader, splitter e vector store» è gratuita?

Sì — il testo completo di «Loader, splitter e vector store» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Loader, splitter e vector store»?

Utilizzi DocumentLoaders per PDF/HTML, TextSplitters per il chunking e VectorStores per il retrieval. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «Loader, splitter e vector store»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Architettura di LangChain: modelli, prompt e chain
  2. Loader, splitter e vector store
  3. LCEL (LangChain Expression Language)
  4. Creare una chain RAG dall'inizio alla fine
← Torna a AI Agents