Lær AI med Python · Lektion

Semantisk lighed og sentence embeddings

Sentence-BERT, cosinuslighed til semantisk søgning, clustering af embeddings.

Lektion 4 af 413 trin

Semantisk lighed og sentence embeddings er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Sætninger, ikke kun ord

Ordindlejringer repræsenterer ord, men vi har ofte brug for at sammenligne hele sætninger eller dokumenter. Hvis vi tager gennemsnittet af ordvektorerne, går nuancer tabt; vi ønsker én enkelt vektor, der indfanger hele betydningen.

Hvad er sætningsindlejringer

Sætningsindlejringer afbilder en hel sætning som én tæt vektor, så sætninger med samme betydning får vektorer, der ligger tæt på hinanden. Det muliggør semantisk søgning og klyngedannelse.

Biblioteket sentence-transformers

Biblioteket sentence-transformers gør dette nemt. Det indpakker finjusterede transformermodeller, som direkte producerer sætningsvektorer af høj kvalitet.

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("all-MiniLM-L6-v2")

Hvorfor all-MiniLM-L6-v2

all-MiniLM-L6-v2 er et populært standardvalg: lille, hurtigt og præcist, og det producerer vektorer med 384 dimensioner. Det giver en god balance mellem hastighed og kvalitet i de fleste anvendelser.

Indkodning af sætninger

model.encode omdanner en liste med sætninger til en matrix af indlejringer med én række pr. sætning.

sentences = [
    "The cat sits on the mat.",
    "A feline rests on the rug.",
    "I am learning machine learning.",
]
embeddings = model.encode(sentences)
print(embeddings.shape)   # (3, 384)

Måling af lighed

Cosinuslighed måler vinklen mellem to vektorer uden at tage højde for deres længde. Værdier tæt på 1 betyder meget ens betydning, mens værdier tæt på 0 betyder, at betydningerne ikke hænger sammen.

from sentence_transformers import util

sim = util.cos_sim(embeddings[0], embeddings[1])
print(sim.item())   # high, both about a cat resting

Brug af sklearn cosine_similarity

Du kan også bruge scikit-learn direkte på indlejringsmatricen for at få en fuld lighedsmatrix for alle par.

from sklearn.metrics.pairwise import cosine_similarity

matrix = cosine_similarity(embeddings)
print(matrix)   # (3, 3) pairwise similarities

Idéen bag semantisk søgning

Semantisk søgning finder dokumenter ud fra deres betydning, ikke deres nøgleord. Indkod en forespørgsel og alle dokumenter, og rangér derefter dokumenterne efter deres cosinuslighed med forespørgselsvektoren.

Et eksempel på semantisk søgning

Indkod tekstsamlingen én gang, og beregn derefter lighederne for hver forespørgsel, så du kan returnere de bedste match.

from sentence_transformers import util

corpus = ["How to reset my password", "Refund policy details", "Track my order"]
corpus_emb = model.encode(corpus)

query_emb = model.encode("I forgot my login")
hits = util.semantic_search(query_emb, corpus_emb, top_k=2)
print(hits)

Anvendelser i praksis

Sætningsindlejringer bruges til matchning af ofte stillede spørgsmål, registrering af dubletter, klyngedannelse, anbefalinger og hentetrinnet i RAG-systemer, som leverer relevant kontekst til store sprogmodeller.

Tips til gode resultater

Vælg en model, der er trænet til din opgave (semantisk søgning kontra parafrasering). Normalisér indlejringerne, hvis din lighedsmetrik kræver det, og brug en vektordatabase til hurtig søgning efter nærmeste naboer i store tekstsamlinger.

Hurtig kontrol

Afprøv din viden om sætningsindlejringer.

Opsummering

Opsummering: Sætningsindlejringer indkoder hele sætninger som vektorer. Brug SentenceTransformer("all-MiniLM-L6-v2") og model.encode(sentences), og sammenlign derefter med cosinuslighed. Det muliggør semantisk søgning: indkod forespørgsel og tekstsamling, og rangér efter lighed. Det er vigtigt til matchning af ofte stillede spørgsmål, klyngedannelse og hentning i RAG-systemer.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Semantisk lighed og sentence embeddings” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Semantisk lighed og sentence embeddings”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Semantisk lighed og sentence embeddings”?

Sentence-BERT, cosinuslighed til semantisk søgning, clustering af embeddings. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Semantisk lighed og sentence embeddings”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Word2Vec: Skip-gram og CBOW
  2. GloVe- og FastText-embeddings
  3. Tekstklassifikation med BERT
  4. Semantisk lighed og sentence embeddings
← Tilbage til Lær AI med Python