0Pricing
Vector Databases: Pinecone, Weaviate & pgvector · Leçon

Métriques de distance et bases de l’indexation

Apprenez les métriques de distance qui définissent la similarité vectorielle et les index approximatifs des plus proches voisins qui accélèrent la recherche vectorielle à grande échelle.

Métriques de distance et bases de l’indexation est une leçon Vector Databases: Pinecone, Weaviate & pgvector gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Vector Databases: Pinecone, Weaviate & pgvector, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Vector Databases: Pinecone, Weaviate & pgvector comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Measuring Closeness

A vector DB finds vectors close to your query, but 'close' is defined by a distance metric — and the metric you pick shapes what counts as similar.

Euclidean Distance

Euclidean (L2) distance is the straight-line distance between two points: smaller means closer. Run the example to see it.

import math

def l2(a, b):
    return math.sqrt(sum((x-y)**2 for x, y in zip(a, b)))

print(round(l2([0,0],[3,4]), 1))

Cosine Similarity

Cosine similarity measures the angle between vectors, ignoring magnitude. It's the go-to for text embeddings, since direction carries the meaning.

import math

def cosine(a, b):
    dot = sum(x*y for x, y in zip(a, b))
    na = math.sqrt(sum(x*x for x in a))
    nb = math.sqrt(sum(y*y for y in b))
    return dot / (na*nb)

print(round(cosine([1,0],[1,1]), 3))

Dot Product

The dot product blends angle and magnitude. With normalized vectors it equals cosine similarity — which is why many systems normalize, then use dot product for speed.

Choosing a Metric

Match the metric to what your model was trained for: text usually cosine, normalized vectors dot product, some image or geo data Euclidean. A mismatch silently hurts results.

The Brute-Force Problem

Brute force — comparing the query to every stored vector — is exact but slow: millions of vectors mean millions of comparisons per query. It doesn't scale.

Approximate Nearest Neighbor

ANN indexes trade a sliver of accuracy for massive speed by cleverly skipping most candidates. Recall stays high while latency drops by orders of magnitude.

HNSW Indexes

HNSW builds a layered graph you navigate coarse to fine for excellent recall and speed — the default in many vector DBs, tunable via ef and M.

IVF Indexes

IVF clusters vectors into buckets and only searches the ones nearest your query. Fewer probes mean faster search, at a small accuracy cost.

The Recall-Speed Trade-off

Every ANN index exposes knobs that trade recall for speed. Searching more candidates raises both recall and latency. Tune to your accuracy target, then push speed.

Putting It Together

Putting it together: pick the right distance metric for your embeddings, then use an ANN index (HNSW or IVF) to query fast at scale, tuning the recall-speed knobs.

Quick Check

Test your understanding of metrics and indexes.

Recap

Recap: the core distance metrics (Euclidean, cosine, dot product) — text usually cosine — plus ANN indexes like HNSW and IVF that trade a little recall for big speed.

Questions Fréquemment Posées

La leçon « Métriques de distance et bases de l’indexation » est-elle gratuite ?

Oui — le texte complet de « Métriques de distance et bases de l’indexation » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Vector Databases: Pinecone, Weaviate & pgvector, passe à CoddyKit PRO. Le cours Vector Databases: Pinecone, Weaviate & pgvector comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Métriques de distance et bases de l’indexation » ?

Apprenez les métriques de distance qui définissent la similarité vectorielle et les index approximatifs des plus proches voisins qui accélèrent la recherche vectorielle à grande échelle. Tu pratiques Vector Databases: Pinecone, Weaviate & pgvector avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Vector Databases: Pinecone, Weaviate & pgvector ?

Aucune expérience préalable n'est requise. Vector Databases: Pinecone, Weaviate & pgvector sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Métriques de distance et bases de l’indexation » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Vector Databases: Pinecone, Weaviate & pgvector ?

Oui. Chaque leçon Vector Databases: Pinecone, Weaviate & pgvector inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Que sont les bases de données vectorielles ?
  2. Représentations vectorielles : le concept central
  3. La recherche par similarité expliquée
  4. Métriques de distance et bases de l’indexation
← Retour à Vector Databases: Pinecone, Weaviate & pgvector