Suddividere ed eseguire l'embedding dei documenti
Preparare una knowledge base consultabile
Suddividere ed eseguire l'embedding dei documenti è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.
I documenti sono troppo grandi per una ricerca completa
Un PDF lungo contiene molti argomenti diversi. Per recuperare le informazioni con precisione, deve prima dividerlo in parti più piccole chiamate chunk.
Come deve essere un buon chunk
Un buon chunk esprime un pensiero coerente: uno o due paragrafi. Se è troppo grande, nasconde la risposta; se è troppo piccolo, perde il contesto circostante.
Divisione per dimensione
Il metodo più semplice divide il testo ogni numero fisso di caratteri o token. È rapido, ma può tagliare una frase a metà.
chunks = [text[i:i+500] for i in range(0, len(text), 500)]Chunk sovrapposti
Per evitare di separare un'idea, faccia condividere ai chunk una parte di sovrapposizione. Ripetere le ultime righe mantiene il contesto tra un confine e l'altro.
Divisione in base alla struttura
Gli splitter più intelligenti dividono prima in base ai paragrafi o ai titoli. Rispettare la struttura mantiene ogni chunk concentrato su un unico argomento ben definito.
Dal testo ai vettori
La ricerca ha bisogno di numeri, non di parole. Un embedding trasforma ogni chunk in un vettore denso che ne cattura il significato.
Il significato risiede nella distanza
Gli embedding collocano vicini i testi simili. Due chunk che trattano la stessa idea si trovano vicini nello spazio vettoriale.
Chiamare un modello di embedding
Passi il testo a un modello di embedding e ottenga un elenco di numeri in virgola mobile. Lo stesso modello deve codificare sia i chunk sia le query.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")Codificare i chunk
Passi ogni chunk attraverso il modello per costruirne il vettore. Per maggiore velocità, una sola chiamata può codificare l'intero elenco.
vectors = model.encode(chunks)Dimensioni dei vettori
Ogni vettore ha una lunghezza fissa, la sua dimensione. Un modello piccolo può restituire 384 numeri; quelli più grandi ne restituiscono 768 o più.
print(vectors.shape) # (n_chunks, 384)Memorizzare insieme chunk e vettore
Mantenga ogni vettore collegato al testo originale e alla relativa fonte. In seguito recupererà i dati tramite il vettore, ma mostrerà il chunk leggibile da una persona.
Verifica rapida
Rifletta sul motivo per cui aggiungiamo una sovrapposizione quando dividiamo i documenti.
Riepilogo
Divida i documenti in chunk, eventualmente sovrapposti, quindi trasformi ciascuno in un vettore tramite embedding. Memorizzi insieme testo e vettore per il recupero. ✅
Domande Frequenti
La lezione «Suddividere ed eseguire l'embedding dei documenti» è gratuita?
Sì — il testo completo di «Suddividere ed eseguire l'embedding dei documenti» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.
Cosa imparerò in «Suddividere ed eseguire l'embedding dei documenti»?
Preparare una knowledge base consultabile Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare NLP Academy?
Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Suddividere ed eseguire l'embedding dei documenti»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione NLP Academy?
Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Perché gli LLM hanno bisogno del retrieval
- Suddividere ed eseguire l'embedding dei documenti
- Ricerca vettoriale con un vector store
- Integrare il retrieval nel prompt