Creare embedding di frasi con BERT
Estrarre vettori contestuali nel codice
Creare embedding di frasi con BERT è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.
Dalle parole alle frasi
BERT assegna a ogni token il proprio vettore. Spesso, però, si desidera un unico vettore per l'intera frase, non uno per ogni parola.
Il token CLS
BERT aggiunge un token speciale chiamato CLS all'inizio di ogni input. Il suo output viene spesso usato come riepilogo della frase.
Mean pooling
Un altro metodo comune calcola la media di tutti i vettori dei token per ottenerne uno solo. Questo passaggio di mean pooling spesso supera il vettore CLS grezzo.
Caricare un modello
Hugging Face semplifica il caricamento: basta ottenere un tokenizer e un modello, con una riga per ciascuno. Insieme formano la Sua pipeline per gli embedding.
from transformers import AutoTokenizer, AutoModel
tok = AutoTokenizer.from_pretrained("bert-base-uncased")
model = AutoModel.from_pretrained("bert-base-uncased")Tokenizzare il testo
Il tokenizer trasforma la frase in numeri identificativi e in una maschera di attenzione comprensibili a BERT. Questo è il passaggio di codifica.
inputs = tok("I love NLP", return_tensors="pt")Eseguire il modello
Passi gli input codificati a BERT per ottenere gli stati nascosti di ogni token. Questi vettori sono l'output grezzo che dovrà aggregare.
out = model(**inputs)
states = out.last_hidden_stateAggregare in un unico vettore
Calcoli la media degli stati dei token lungo la sequenza per ridurli a un unico embedding della frase, che potrà memorizzare.
vec = states.mean(dim=1)Un percorso più semplice
La libreria Sentence-Transformers svolge tutto questo al posto Suo. Una sola chiamata restituisce un vettore della frase pronto all'uso. ✨
from sentence_transformers import SentenceTransformer
m = SentenceTransformer("all-MiniLM-L6-v2")
vec = m.encode("I love NLP")Confrontare le frasi
Con due vettori di frasi può misurare la vicinanza usando la similarità coseno. Punteggi più alti indicano che le frasi hanno un significato simile.
Cosa può costruire
Gli embedding delle frasi alimentano la ricerca semantica, il clustering e il rilevamento dei duplicati. Trasformano il significato in qualcosa che può cercare.
Una nota sulla qualità
I modelli ottimizzati per le frasi, come MiniLM, qui superano solitamente BERT puro. Scelga un modello addestrato per il compito che deve svolgere.
Verifica rapida
Come si trasformano molti vettori di token in un unico vettore della frase?
Riepilogo
Tokenizzi il testo, esegua BERT, quindi aggreghi i risultati o usi CLS per ottenere un unico embedding della frase. Sentence-Transformers riduce tutto a una sola chiamata. ✅
Impara Python con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 30
- Lezioni
- 120
Domande Frequenti
La lezione «Creare embedding di frasi con BERT» è gratuita?
Sì — il testo completo di «Creare embedding di frasi con BERT» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.
Cosa imparerò in «Creare embedding di frasi con BERT»?
Estrarre vettori contestuali nel codice Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare NLP Academy?
Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Creare embedding di frasi con BERT»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione NLP Academy?
Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Perché il contesto cambia il significato delle parole
- Masked language modeling
- Creare embedding di frasi con BERT
- Scegliere il modello pre-addestrato corretto