Vectorrepresentaties en zoeken op overeenkomst
Krijg inzicht in vectorrepresentaties, hoe ze worden gegenereerd en hoe zoeken op overeenkomst relevante documenten ontsluit.
Vectorrepresentaties en zoeken op overeenkomst is een gratis LLM-toepassingen in productie (RAG + vectordatabase + caching)-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject LLM-toepassingen in productie (RAG + vectordatabase + caching). Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat in totaal 4 lessen.
Vectoren voor betekenis
Welkom! In de wereld van Large Language Models (LLM's) draait tekstbegrip niet alleen om woorden. Het gaat om betekenis.
Computers werken van nature met getallen, niet met menselijke taal. Hoe overbrug je deze kloof zodat LLM's de betekenis van tekst kunnen begrijpen?
Wat zijn vectorrepresentaties?
Vectorrepresentaties zijn numerieke representaties van tekst (of afbeeldingen, audio, enzovoort). Zie ze als een lijst met getallen die de essentie of betekenis van een stukje informatie vastlegt.
- Elk stukje tekst (een woord, zin of document) krijgt zijn eigen unieke vector.
- Deze vectoren zijn meestal lange lijsten met getallen met drijvende komma (bijvoorbeeld
[0.123, -0.456, 0.789, ...]).
De magie achter vectorrepresentaties
Hoe worden deze magische getallen gemaakt? Speciale machine-learningmodellen, die vaak vectorrepresentatiemodellen worden genoemd, worden getraind om tekst om te zetten in deze vectoren.
Deze modellen leren om vergelijkbare betekenissen in een hoogdimensionale ruimte te koppelen aan vectoren die numeriek dicht bij elkaar liggen.
Semantische overeenkomst uitgelegd
Het belangrijkste idee is dat de vectorrepresentaties van twee stukken tekst dicht bij elkaar liggen als die stukken tekst een vergelijkbare betekenis hebben.
De vectorrepresentatie van "cat" zou bijvoorbeeld dichter bij "kitten" liggen dan bij "car". Dankzij deze nabijheid kunnen computers semantische overeenkomst begrijpen.
Vectorrepresentaties genereren (concept)
In een echt RAG-systeem zou je een API van een aanbieder zoals OpenAI, Cohere of een opensourcemodel gebruiken om vectorrepresentaties voor je tekstgegevens te genereren.
Je voert de tekst aan en de API geeft de vector terug. Vanuit het gebruik bekeken is het zo eenvoudig!
Code: mockgeneratie van vectorrepresentaties
Hier zie je een Python-voorbeeld dat laat zien hoe je conceptueel met een functie voor vectorrepresentaties zou kunnen werken. In werkelijkheid zou get_embedding een API-aanroep doen.
def get_embedding(text):
"""
Simulates an embedding model. Returns a dummy vector.
"""
if "hello" in text.lower():
return [0.1, 0.2, 0.3]
elif "goodbye" in text.lower():
return [0.8, 0.7, 0.6]
else:
return [0.0, 0.0, 0.0]
if __name__ == "__main__":
text1 = "Hello, CoddyKit!"
text2 = "Time to say goodbye."
text3 = "Another sentence."
print(f"Vector for '{text1}': {get_embedding(text1)}")
print(f"Vector for '{text2}': {get_embedding(text2)}")
print(f"Vector for '{text3}': {get_embedding(text3)}")Waarom zoeken op overeenkomst?
Als al je documenten (of documentdelen) zijn omgezet in vectorrepresentaties, hoe vind je dan de meest relevante wanneer een gebruiker een vraag stelt?
Daar komt zoeken op overeenkomst van pas. Dit is het proces waarbij je vectorrepresentaties vindt die het dichtst bij een bepaalde vectorrepresentatie van een zoekopdracht liggen.
Zo werkt zoeken op overeenkomst
Bij zoeken op overeenkomst wordt de wiskundige afstand of hoek tussen vectoren gemeten. Veelgebruikte methoden zijn:
- Cosinusovereenkomst: Meet de hoek tussen twee vectoren. Een kleinere hoek (dichter bij 1) betekent een grotere overeenkomst.
- Euclidische afstand: Meet de afstand in een rechte lijn tussen twee punten (vectoren). Een kleinere afstand betekent een grotere overeenkomst.
Met deze berekeningen worden de documenten met de grootste semantische overeenkomst snel gevonden.
Vectorrepresentaties + zoeken = RAG-kracht
In RAG gebeurt het volgende wanneer een gebruiker een vraag stelt:
- De vraag wordt omgezet in een vectorrepresentatie.
- Er wordt gezocht op overeenkomst in een database met vectorrepresentaties van documenten.
- De N meest vergelijkbare documentdelen worden opgehaald.
Deze opgehaalde delen geven de LLM vervolgens context, waardoor de antwoorden nauwkeuriger en beter onderbouwd worden.
Korte kennischeck over vectorrepresentaties
Vectorrepresentaties zijn cruciaal voor RAG. Laten we je begrip testen.
Terugblik: vectorrepresentaties en zoeken
Goed gedaan! Je hebt de basisconcepten van vectorrepresentaties en zoeken op overeenkomst geleerd.
- Vectorrepresentaties zetten tekst om in getallen en leggen daarbij de betekenis vast.
- Vectorrepresentatiemodellen maken deze vectoren.
- Zoeken op overeenkomst gebruikt wiskundige afstand om de meest relevante vectoren (en dus documenten) bij een zoekopdracht te vinden.
Deze technieken vormen de kern van de manier waarop RAG-systemen relevante context voor LLM's vinden en leveren.
Leer LLM-toepassingen in productie (RAG + vectordatabase + caching) met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 48
Veelgestelde vragen
Is de les “Vectorrepresentaties en zoeken op overeenkomst” gratis?
Ja — de volledige tekst van “Vectorrepresentaties en zoeken op overeenkomst” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat in totaal 4 lessen.
Wat leer ik in “Vectorrepresentaties en zoeken op overeenkomst”?
Krijg inzicht in vectorrepresentaties, hoe ze worden gegenereerd en hoe zoeken op overeenkomst relevante documenten ontsluit. Je oefent met LLM-toepassingen in productie (RAG + vectordatabase + caching) door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met LLM-toepassingen in productie (RAG + vectordatabase + caching) te beginnen?
Ervaring vooraf is niet nodig. LLM-toepassingen in productie (RAG + vectordatabase + caching) op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.
Hoe lang duurt de les “Vectorrepresentaties en zoeken op overeenkomst”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over LLM-toepassingen in productie (RAG + vectordatabase + caching)?
Ja. Elke les over LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Waarom vectordatabases nodig zijn
- Vectorrepresentaties en zoeken op overeenkomst
- Integratie met een vectordatabase
- Indexeren, filteren en hybride zoeken