Métricas de distância e fundamentos de indexação
Aprenda as métricas de distância que definem a similaridade vetorial e os índices aproximados de vizinhos mais próximos que tornam a busca vetorial rápida em grande escala.
Métricas de distância e fundamentos de indexação é uma aula grátis de Vector Databases: Pinecone, Weaviate & pgvector no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Vector Databases: Pinecone, Weaviate & pgvector, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Vector Databases: Pinecone, Weaviate & pgvector inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Measuring Closeness
A vector DB finds vectors close to your query, but 'close' is defined by a distance metric — and the metric you pick shapes what counts as similar.
Euclidean Distance
Euclidean (L2) distance is the straight-line distance between two points: smaller means closer. Run the example to see it.
import math
def l2(a, b):
return math.sqrt(sum((x-y)**2 for x, y in zip(a, b)))
print(round(l2([0,0],[3,4]), 1))Cosine Similarity
Cosine similarity measures the angle between vectors, ignoring magnitude. It's the go-to for text embeddings, since direction carries the meaning.
import math
def cosine(a, b):
dot = sum(x*y for x, y in zip(a, b))
na = math.sqrt(sum(x*x for x in a))
nb = math.sqrt(sum(y*y for y in b))
return dot / (na*nb)
print(round(cosine([1,0],[1,1]), 3))Dot Product
The dot product blends angle and magnitude. With normalized vectors it equals cosine similarity — which is why many systems normalize, then use dot product for speed.
Choosing a Metric
Match the metric to what your model was trained for: text usually cosine, normalized vectors dot product, some image or geo data Euclidean. A mismatch silently hurts results.
The Brute-Force Problem
Brute force — comparing the query to every stored vector — is exact but slow: millions of vectors mean millions of comparisons per query. It doesn't scale.
Approximate Nearest Neighbor
ANN indexes trade a sliver of accuracy for massive speed by cleverly skipping most candidates. Recall stays high while latency drops by orders of magnitude.
HNSW Indexes
HNSW builds a layered graph you navigate coarse to fine for excellent recall and speed — the default in many vector DBs, tunable via ef and M.
IVF Indexes
IVF clusters vectors into buckets and only searches the ones nearest your query. Fewer probes mean faster search, at a small accuracy cost.
The Recall-Speed Trade-off
Every ANN index exposes knobs that trade recall for speed. Searching more candidates raises both recall and latency. Tune to your accuracy target, then push speed.
Putting It Together
Putting it together: pick the right distance metric for your embeddings, then use an ANN index (HNSW or IVF) to query fast at scale, tuning the recall-speed knobs.
Quick Check
Test your understanding of metrics and indexes.
Recap
Recap: the core distance metrics (Euclidean, cosine, dot product) — text usually cosine — plus ANN indexes like HNSW and IVF that trade a little recall for big speed.
Perguntas Frequentes
A aula “Métricas de distância e fundamentos de indexação” é grátis?
Sim — o texto completo de “Métricas de distância e fundamentos de indexação” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Vector Databases: Pinecone, Weaviate & pgvector, atualize para CoddyKit PRO. O curso de Vector Databases: Pinecone, Weaviate & pgvector inclui 4 aulas no total.
O que vou aprender em “Métricas de distância e fundamentos de indexação”?
Aprenda as métricas de distância que definem a similaridade vetorial e os índices aproximados de vizinhos mais próximos que tornam a busca vetorial rápida em grande escala. Você pratica Vector Databases: Pinecone, Weaviate & pgvector com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Vector Databases: Pinecone, Weaviate & pgvector?
Nenhuma experiência prévia é necessária. Vector Databases: Pinecone, Weaviate & pgvector no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Métricas de distância e fundamentos de indexação”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Vector Databases: Pinecone, Weaviate & pgvector?
Sim. Cada aula de Vector Databases: Pinecone, Weaviate & pgvector inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- O que são Bancos de Dados Vetoriais?
- Embeddings: O Conceito Central
- Busca por Similaridade Explicada
- Métricas de distância e fundamentos de indexação