0Pricing
NLP Academy · Lezione

Suddividere ed eseguire l'embedding dei documenti

Preparare una knowledge base consultabile

Suddividere ed eseguire l'embedding dei documenti è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.

I documenti sono troppo grandi per una ricerca completa

Un PDF lungo contiene molti argomenti diversi. Per recuperare le informazioni con precisione, deve prima dividerlo in parti più piccole chiamate chunk.

Come deve essere un buon chunk

Un buon chunk esprime un pensiero coerente: uno o due paragrafi. Se è troppo grande, nasconde la risposta; se è troppo piccolo, perde il contesto circostante.

Divisione per dimensione

Il metodo più semplice divide il testo ogni numero fisso di caratteri o token. È rapido, ma può tagliare una frase a metà.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Chunk sovrapposti

Per evitare di separare un'idea, faccia condividere ai chunk una parte di sovrapposizione. Ripetere le ultime righe mantiene il contesto tra un confine e l'altro.

Divisione in base alla struttura

Gli splitter più intelligenti dividono prima in base ai paragrafi o ai titoli. Rispettare la struttura mantiene ogni chunk concentrato su un unico argomento ben definito.

Dal testo ai vettori

La ricerca ha bisogno di numeri, non di parole. Un embedding trasforma ogni chunk in un vettore denso che ne cattura il significato.

Il significato risiede nella distanza

Gli embedding collocano vicini i testi simili. Due chunk che trattano la stessa idea si trovano vicini nello spazio vettoriale.

Chiamare un modello di embedding

Passi il testo a un modello di embedding e ottenga un elenco di numeri in virgola mobile. Lo stesso modello deve codificare sia i chunk sia le query.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Codificare i chunk

Passi ogni chunk attraverso il modello per costruirne il vettore. Per maggiore velocità, una sola chiamata può codificare l'intero elenco.

vectors = model.encode(chunks)

Dimensioni dei vettori

Ogni vettore ha una lunghezza fissa, la sua dimensione. Un modello piccolo può restituire 384 numeri; quelli più grandi ne restituiscono 768 o più.

print(vectors.shape)  # (n_chunks, 384)

Memorizzare insieme chunk e vettore

Mantenga ogni vettore collegato al testo originale e alla relativa fonte. In seguito recupererà i dati tramite il vettore, ma mostrerà il chunk leggibile da una persona.

Verifica rapida

Rifletta sul motivo per cui aggiungiamo una sovrapposizione quando dividiamo i documenti.

Riepilogo

Divida i documenti in chunk, eventualmente sovrapposti, quindi trasformi ciascuno in un vettore tramite embedding. Memorizzi insieme testo e vettore per il recupero. ✅

Domande Frequenti

La lezione «Suddividere ed eseguire l'embedding dei documenti» è gratuita?

Sì — il testo completo di «Suddividere ed eseguire l'embedding dei documenti» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.

Cosa imparerò in «Suddividere ed eseguire l'embedding dei documenti»?

Preparare una knowledge base consultabile Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare NLP Academy?

Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «Suddividere ed eseguire l'embedding dei documenti»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione NLP Academy?

Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché gli LLM hanno bisogno del retrieval
  2. Suddividere ed eseguire l'embedding dei documenti
  3. Ricerca vettoriale con un vector store
  4. Integrare il retrieval nel prompt
← Torna a NLP Academy