LangChain / RAG / Vector DBs · Lezione

Misurare la similarità tra embeddings

Comprenda le metriche di distanza e similarità alla base della ricerca vettoriale e impari a scegliere quella più adatta.

Lezione 4 di 413 passaggi

Misurare la similarità tra embeddings è una lezione LangChain / RAG / Vector DBs gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento LangChain / RAG / Vector DBs, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso LangChain / RAG / Vector DBs include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

From Vectors to Meaning

An embedding maps text to a list of numbers in high-dimensional space. Texts with similar meaning land close together. To rank results we need a way to measure that closeness.

Cosine Similarity

Cosine similarity measures the angle between two vectors, ignoring their length. It ranges from -1 (opposite) to 1 (identical direction).

import numpy as np

def cosine(a, b):
    a, b = np.array(a), np.array(b)
    return a.dot(b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(cosine([1, 0], [1, 1]))  # ~0.707

Euclidean Distance

Euclidean (L2) distance is the straight-line distance between two points. Smaller means more similar. Unlike cosine, it is sensitive to magnitude.

import numpy as np

def l2(a, b):
    return np.linalg.norm(np.array(a) - np.array(b))

print(l2([0, 0], [3, 4]))  # 5.0

Dot Product

The dot product multiplies matching dimensions and sums them. For normalized vectors it equals cosine similarity, which is why many stores normalize first.

import numpy as np

def dot(a, b):
    return float(np.array(a).dot(np.array(b)))

print(dot([1, 2, 3], [4, 5, 6]))  # 32.0

Normalization

Dividing a vector by its length gives a unit vector. After normalization, dot product and cosine similarity become equivalent, simplifying the math.

import numpy as np

def normalize(v):
    v = np.array(v, dtype=float)
    return v / np.linalg.norm(v)

print(normalize([3, 4]))  # [0.6 0.8]

Choosing a Metric

Most modern text embedding models are trained for cosine similarity. Use cosine unless your provider documentation recommends otherwise.

  • Cosine: direction matters, length ignored
  • L2: absolute position matters
  • Dot: cosine on normalized data

Similarity vs. Distance

Beware the inversion: higher cosine = more similar, but higher L2 = less similar. Vector stores expose this difference, sometimes returning a score you must interpret.

Why High Dimensions Help

Embeddings often have hundreds or thousands of dimensions. More dimensions give the model room to separate subtle differences in meaning, at the cost of more storage and compute.

Setting Metric in a Store

When creating a collection you declare the metric. Many libraries default to cosine.

import chromadb

client = chromadb.Client()
col = client.create_collection(
    name="docs",
    metadata={"hnsw:space": "cosine"}
)

Ranking Search Results

Search computes the chosen metric between the query embedding and every stored vector, then returns the top-k closest. The metric directly shapes which documents win.

query_vec = embed("refund policy")
scored = [(cosine(query_vec, d.vec), d) for d in docs]
scored.sort(reverse=True)
top3 = scored[:3]

Pitfall: Mixing Models

Vectors from different embedding models live in different spaces and are not comparable. Always embed your query with the same model you used to index the documents.

Quick Check

Test your grasp of similarity metrics.

Recap

You explored how similarity is measured:

  • Cosine compares direction (most common for text)
  • Euclidean compares position
  • Dot product equals cosine on normalized vectors
  • Always query and index with the same model
Gratis per iniziare

Impara LangChain / RAG / Vector DBs con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
12
Lezioni
48

Domande Frequenti

La lezione «Misurare la similarità tra embeddings» è gratuita?

Sì — il testo completo di «Misurare la similarità tra embeddings» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso LangChain / RAG / Vector DBs, passa a CoddyKit PRO. Il corso LangChain / RAG / Vector DBs include 4 lezioni in totale.

Cosa imparerò in «Misurare la similarità tra embeddings»?

Comprenda le metriche di distanza e similarità alla base della ricerca vettoriale e impari a scegliere quella più adatta. Eserciti LangChain / RAG / Vector DBs con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare LangChain / RAG / Vector DBs?

Non è richiesta alcuna esperienza precedente. LangChain / RAG / Vector DBs su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Misurare la similarità tra embeddings»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione LangChain / RAG / Vector DBs?

Sì. Ogni lezione LangChain / RAG / Vector DBs include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Comprendere gli embedding testuali
  2. Introduzione ai database vettoriali
  3. Memorizzare e recuperare gli embedding
  4. Misurare la similarità tra embeddings
← Torna a LangChain / RAG / Vector DBs