Embedding dan Basis Data Vektor
Pahami cara embedding teks mengubah makna menjadi vektor dan cara basis data vektor memungkinkan langkah pengambilan yang menjadi inti RAG.
Embedding dan Basis Data Vektor adalah pelajaran LangChain / RAG / Vector DBs gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar LangChain / RAG / Vector DBs, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus LangChain / RAG / Vector DBs mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
From Words to Vectors
Computers cannot compare meaning directly. An embedding is a vector of numbers representing a text’s meaning, so similar texts land close together.
What an Embedding Looks Like
An embedding model maps text to a fixed-length vector with hundreds or thousands of dimensions. The numbers are not readable — what counts is their geometric relationships.
text = 'a cup of coffee'
embedding = [0.12, -0.04, 0.88, 0.31] # simplified
print('dimensions:', len(embedding))Semantic Similarity
Because meaning maps to position, "dog" sits near "puppy" but far from "database". That is what powers semantic search — matching by meaning, not exact keywords.
Measuring Closeness
The go-to closeness metric is cosine similarity — the cosine of the angle between two vectors. 1 means nearly identical, 0 means unrelated.
def cosine(a, b):
dot = sum(x*y for x, y in zip(a, b))
na = sum(x*x for x in a) ** 0.5
nb = sum(y*y for y in b) ** 0.5
return dot / (na * nb)
print(round(cosine([1, 0, 1], [1, 0, 1]), 2))
print(round(cosine([1, 0, 0], [0, 1, 0]), 2))Why a Vector Database?
RAG must find the most relevant chunks among millions of vectors, fast. A vector database stores embeddings and finds nearest neighbors — something SQL is not built for.
Approximate Nearest Neighbor
Comparing a query to every vector is too slow at scale. Vector DBs use ANN indexes like HNSW that trade a sliver of accuracy for huge speed gains.
Indexing Documents
To build a knowledge base, index your docs: split into chunks, embed each one, and store the vector with its text and metadata. This is RAG’s offline ingestion step.
chunks = ['intro paragraph', 'pricing details', 'support hours']
for c in chunks:
vec = embed(c) # call embedding model
db.upsert(vec, text=c)Querying
At query time, embed the user’s question with the same model, then ask the vector DB for the top-k nearest chunks — that becomes the LLM’s context.
q_vec = embed('when is support open?')
results = db.search(q_vec, top_k=3)
for r in results:
print(r.text, r.score)Metadata Filtering
Vector DBs also support metadata filtering: combine similarity search with filters like language, date range, or owner to sharpen relevance.
db.search(q_vec, top_k=3, filter={'lang': 'en', 'year': 2026})Choosing a Vector Store
Your vector store options span libraries (FAISS), dedicated DBs (Pinecone, Weaviate, Qdrant, Milvus), and extensions like pgvector. Pick by scale, hosting, and data needs.
Embeddings in the RAG Pipeline
Embeddings and the vector DB are the retrieval half of RAG: index once, then for every question embed, search, and hand the top chunks to the LLM as grounding.
Quick Check
Test your understanding of embeddings and vector search.
Recap
You learned RAG’s retrieval foundation: embeddings turn meaning into vectors, cosine measures closeness, and vector DBs use ANN for fast nearest-neighbor search.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Embedding dan Basis Data Vektor” gratis?
Ya — teks lengkap “Embedding dan Basis Data Vektor” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus LangChain / RAG / Vector DBs, upgrade ke CoddyKit PRO. Kursus LangChain / RAG / Vector DBs mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Embedding dan Basis Data Vektor”?
Pahami cara embedding teks mengubah makna menjadi vektor dan cara basis data vektor memungkinkan langkah pengambilan yang menjadi inti RAG. Kamu berlatih LangChain / RAG / Vector DBs dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai LangChain / RAG / Vector DBs?
Tidak diperlukan pengalaman sebelumnya. LangChain / RAG / Vector DBs di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Embedding dan Basis Data Vektor” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran LangChain / RAG / Vector DBs ini?
Ya. Setiap pelajaran LangChain / RAG / Vector DBs menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Apa Itu Model Bahasa Besar?
- Kebutuhan akan Retrieval Augmented Generation
- Komponen Inti Sistem RAG
- Embedding dan Basis Data Vektor