0Pricing
LangChain / RAG / Vector DBs · Pelajaran

Mengukur Kemiripan Embedding

Pahami metrik jarak dan kemiripan yang mendukung pencarian vektor serta cara memilih metrik yang tepat.

Mengukur Kemiripan Embedding adalah pelajaran LangChain / RAG / Vector DBs gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar LangChain / RAG / Vector DBs, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus LangChain / RAG / Vector DBs mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

From Vectors to Meaning

An embedding maps text to a list of numbers in high-dimensional space. Texts with similar meaning land close together. To rank results we need a way to measure that closeness.

Cosine Similarity

Cosine similarity measures the angle between two vectors, ignoring their length. It ranges from -1 (opposite) to 1 (identical direction).

import numpy as np

def cosine(a, b):
    a, b = np.array(a), np.array(b)
    return a.dot(b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(cosine([1, 0], [1, 1]))  # ~0.707

Euclidean Distance

Euclidean (L2) distance is the straight-line distance between two points. Smaller means more similar. Unlike cosine, it is sensitive to magnitude.

import numpy as np

def l2(a, b):
    return np.linalg.norm(np.array(a) - np.array(b))

print(l2([0, 0], [3, 4]))  # 5.0

Dot Product

The dot product multiplies matching dimensions and sums them. For normalized vectors it equals cosine similarity, which is why many stores normalize first.

import numpy as np

def dot(a, b):
    return float(np.array(a).dot(np.array(b)))

print(dot([1, 2, 3], [4, 5, 6]))  # 32.0

Normalization

Dividing a vector by its length gives a unit vector. After normalization, dot product and cosine similarity become equivalent, simplifying the math.

import numpy as np

def normalize(v):
    v = np.array(v, dtype=float)
    return v / np.linalg.norm(v)

print(normalize([3, 4]))  # [0.6 0.8]

Choosing a Metric

Most modern text embedding models are trained for cosine similarity. Use cosine unless your provider documentation recommends otherwise.

  • Cosine: direction matters, length ignored
  • L2: absolute position matters
  • Dot: cosine on normalized data

Similarity vs. Distance

Beware the inversion: higher cosine = more similar, but higher L2 = less similar. Vector stores expose this difference, sometimes returning a score you must interpret.

Why High Dimensions Help

Embeddings often have hundreds or thousands of dimensions. More dimensions give the model room to separate subtle differences in meaning, at the cost of more storage and compute.

Setting Metric in a Store

When creating a collection you declare the metric. Many libraries default to cosine.

import chromadb

client = chromadb.Client()
col = client.create_collection(
    name="docs",
    metadata={"hnsw:space": "cosine"}
)

Ranking Search Results

Search computes the chosen metric between the query embedding and every stored vector, then returns the top-k closest. The metric directly shapes which documents win.

query_vec = embed("refund policy")
scored = [(cosine(query_vec, d.vec), d) for d in docs]
scored.sort(reverse=True)
top3 = scored[:3]

Pitfall: Mixing Models

Vectors from different embedding models live in different spaces and are not comparable. Always embed your query with the same model you used to index the documents.

Quick Check

Test your grasp of similarity metrics.

Recap

You explored how similarity is measured:

  • Cosine compares direction (most common for text)
  • Euclidean compares position
  • Dot product equals cosine on normalized vectors
  • Always query and index with the same model

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Mengukur Kemiripan Embedding” gratis?

Ya — teks lengkap “Mengukur Kemiripan Embedding” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus LangChain / RAG / Vector DBs, upgrade ke CoddyKit PRO. Kursus LangChain / RAG / Vector DBs mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Mengukur Kemiripan Embedding”?

Pahami metrik jarak dan kemiripan yang mendukung pencarian vektor serta cara memilih metrik yang tepat. Kamu berlatih LangChain / RAG / Vector DBs dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai LangChain / RAG / Vector DBs?

Tidak diperlukan pengalaman sebelumnya. LangChain / RAG / Vector DBs di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Mengukur Kemiripan Embedding” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran LangChain / RAG / Vector DBs ini?

Ya. Setiap pelajaran LangChain / RAG / Vector DBs menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Memahami Embedding Teks
  2. Pengantar Basis Data Vektor
  3. Menyimpan dan Mengambil Embedding
  4. Mengukur Kemiripan Embedding
← Kembali ke LangChain / RAG / Vector DBs