Introduktion til vektordatabaser
Hvorfor vektor-DB'er findes, FAISS til lokal similarity search og lagring af embeddings til AI-hentning.
Introduktion til vektordatabaser er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Ud over eksakte match
Traditionelle databaser finder rækker ud fra eksakte værdier (WHERE name = "x"). Men AI arbejder med embeddings — vektorer, der indfanger betydning — og ofte vil du have de elementer, der ligner en forespørgsel mest, ikke eksakte match.
Vektordatabaser er udviklet til at gøre denne lighedssøgning hurtig.
Hvad er en embedding
En embedding er en talrække (en vektor), der repræsenterer tekst, et billede eller lyd, så lignende elementer ligger tæt på hinanden i vektorrummet.
Semantisk søgning, anbefalinger og generering med udvidet informationssøgning (RAG) bygger alle på embeddings.
import numpy as np
# A toy 4-dim embedding for a sentence
vec = np.array([0.12, -0.43, 0.88, 0.05], dtype="float32")
print(vec.shape) # (4,)Hvorfor ikke en almindelig database
Det er langsomt at sammenligne en forespørgsel med millioner af vektorer i en løkke, der gennemgår dem én for én. Vektordatabaser bruger specialiserede indekser og afstandsberegninger til at returnere de nærmeste naboer på millisekunder.
De kan også skaleres, gemme data permanent og håndtere metadata sammen med vektorerne.
Måling af lighed
Nærhed måles med et afstandsmål:
- L2 (Euklidisk) — afstand i en lige linje; mindre betyder tættere
- Cosinus — vinklen mellem vektorer; velegnet til tekst
FAISS understøtter flere; vi bruger L2.
Introduktion til FAISS
FAISS (Facebook AI Similarity Search) er et hurtigt, gratis bibliotek til vektorsøgning. Det kører lokalt uden en server — ideelt til læring og prototyper.
import faiss
import numpy as np
# pip install faiss-cpuOprettelse af et indeks med IndexFlatL2
IndexFlatL2(dim) opbygger et fladt indeks (udtømmende, eksakt søgning) ved hjælp af L2-afstand. Du skal angive dine vektorers dimension.
Betegnelsen "Flat" betyder eksakte resultater — perfekt til små og mellemstore samlinger.
import faiss
dim = 4
index = faiss.IndexFlatL2(dim)
print(index.is_trained) # True (flat index needs no training)Tilføjelse af vektorer med index.add
Indlæs dine embeddings som et 2D-NumPy-array af typen float32 med formen (n, dim). index.add gemmer dem, og index.ntotal angiver antallet.
import numpy as np
embeddings = np.random.random((100, dim)).astype("float32")
index.add(embeddings)
print(index.ntotal) # 100Søgning med index.search
index.search(query, k) returnerer de k nærmeste vektorer. Den returnerer to arrays: afstandene D og indeksene I (positionerne i den rækkefølge, du tilføjede dem).
query = np.random.random((1, dim)).astype("float32")
D, I = index.search(query, k=5)
print("nearest ids:", I[0])
print("distances:", D[0])Fra indeks tilbage til elementer
FAISS returnerer positioner, ikke dine oprindelige data. Behold en parallel liste (eller database), der knytter indekspositionen til det rigtige element, så du kan slå resultaterne op.
docs = ["doc about cats", "doc about dogs", "doc about cars"]
# after search:
for pos in I[0]:
print(docs[pos]) # map id -> original documentEn lille arbejdsgang til semantisk søgning
Den komplette fremgangsmåde er: Opret embeddings for dine dokumenter, føj dem til et indeks, opret en embedding for forespørgslen, søg, og returnér de matchende dokumenter. (Embedding-modeller som sentence-transformers producerer vektorerne.)
import faiss, numpy as np
# doc_vectors: (n, dim) from an embedding model
index = faiss.IndexFlatL2(doc_vectors.shape[1])
index.add(doc_vectors)
# query_vec: (1, dim) embedding of the user query
D, I = index.search(query_vec, k=3)
results = [docs[i] for i in I[0]]
print(results)Hvornår bør du vælge en vektordatabase
Brug en vektordatabase, når du har brug for:
- Semantisk søgning i tekst eller billeder
- Anbefalinger baseret på lighed
- RAG: hentning af relevant kontekst til en LLM
FAISS er fremragende lokalt; administrerede løsninger (Pinecone, Weaviate, pgvector) tilføjer permanent lagring og skalerbarhed.
Hurtigt tjek: FAISS-søgning
Du kalder index.search(query, k=5) på et FAISS-indeks.
Opsummering: Vektordatabaser
Du har lært grundlaget for lighedssøgning:
- Embeddings placerer lignende elementer tæt på hinanden i vektorrummet
- Vektordatabaser gør søgning efter nærmeste naboer hurtig i stor skala
- FAISS
IndexFlatL2(dim)opbygger et eksakt L2-indeks index.add(embeddings)gemmer vektorer;index.search(query, k)returnerer afstande og indeks- Knyt de returnerede indeks tilbage til dine oprindelige elementer
Det afslutter databaser. Næste emne: strukturering af AI-projekter med Git.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 225
Ofte stillede spørgsmål
Er lektionen “Introduktion til vektordatabaser” gratis?
Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Introduktion til vektordatabaser”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Introduktion til vektordatabaser”?
Hvorfor vektor-DB'er findes, FAISS til lokal similarity search og lagring af embeddings til AI-hentning. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Lær AI med Python?
Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.
Hvor lang tid tager lektionen “Introduktion til vektordatabaser”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?
Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- SQLite med Pythons sqlite3-modul
- Integration mellem Pandas og SQL
- Lagring og forespørgsel af ML-resultater
- Introduktion til vektordatabaser