Semantische caching voor LLM-responses
Leer hoe semantische caching antwoorden voor vergelijkbare queries hergebruikt door op betekenis in plaats van exacte tekst te matchen, waardoor LLM-kosten en latency sterk dalen.
Semantische caching voor LLM-responses is een gratis LLM-toepassingen in productie (RAG + vectordatabase + caching)-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject LLM-toepassingen in productie (RAG + vectordatabase + caching). Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat in totaal 4 lessen.
Verder dan caching op exacte overeenkomsten
Een normale cache treft alleen doel wanneer de sleutel byte voor byte identiek is. Maar 'Wat is jullie restitutiebeleid?' en 'Hoe werken restituties?' betekenen hetzelfde en missen toch een exacte cachetreffer.
Semantische caching vergelijkt betekenis, zodat parafrasen hetzelfde antwoord kunnen hergebruiken.
Hoe het werkt
De stroom:
- zet de binnenkomende query om in een vector
- zoek in de cache naar een opgeslagen query die er dichtbij ligt
- geef het antwoord uit de cache terug als de overeenkomst een drempelwaarde overschrijdt
- roep anders de LLM aan en sla het nieuwe paar op
De query embedden
Een embeddingmodel zet elke query om in een vector. Vergelijkbare betekenissen leveren vectoren op die dicht bij elkaar liggen.
def embed(text):
return [len(text), text.count('refund'), text.count('?')]
print(embed('How do refunds work?'))Cosinusovereenkomst
De overeenkomst tussen queryvectoren wordt meestal gemeten met cosinusovereenkomst.
import math
def cosine(a, b):
dot = sum(x*y for x, y in zip(a, b))
na = math.sqrt(sum(x*x for x in a))
nb = math.sqrt(sum(y*y for y in b))
return dot / (na * nb)
print(round(cosine([1,2,1],[1,2,0]), 3))De drempelwaarde kiezen
De drempelwaarde voor overeenkomst is de belangrijkste afstellingsknop:
- Te laag -> valse treffers, verkeerde antwoorden worden aangeboden
- Te hoog -> weinig treffers, weinig besparing
Stel de waarde af op echte verkeersgegevens en kies voor kritieke domeinen liever de voorzichtige kant.
Een minimale semantische cache
Embedding, overeenkomst en een drempelwaarde samenbrengen.
cache = []
THRESH = 0.95
def get(query, qvec):
for stored_vec, ans in cache:
if cosine(qvec, stored_vec) >= THRESH:
return ans
return None
def cosine(a, b):
return 1.0 if a == b else 0.0
cache.append(([1,0], 'Refunds take 5 days'))
print(get('q', [1,0]))Wanneer je NIET moet cachen
Semantische caching is ongeschikt voor queries waarvan het antwoord afhangt van veranderlijke of persoonlijke status:
- 'Wat is mijn accountsaldo?'
- 'Wat voor weer is het vandaag?'
- Alles wat gebruikersspecifiek of tijdsgevoelig is
Cache alleen stabiele, algemene kennis.
De cache afbakenen
Bak cachesleutels af op tenant, taal en alle relevante context om te voorkomen dat de gegevens van de ene gebruiker aan een andere worden blootgesteld. Een globale cache voor gepersonaliseerde antwoorden is een privacyfout.
Verwijdering en actualiteit
Antwoorden in de cache raken verouderd wanneer brongegevens veranderen. Voeg TTL's toe en maak vermeldingen ongeldig wanneer onderliggende documenten worden bijgewerkt, zodat de cache geen verouderde antwoorden aanbiedt.
Besparingen meten
Houd het trefferpercentage, de kostenbesparing en de latentieverbetering bij. Een semantisch trefferpercentage van 40 procent kan voor cachebaar verkeer ruwweg leiden tot 40 procent minder LLM-uitgaven.
Productiestack
Sla query-embeddings in productie op in een vectordatabase of Redis met vectorzoekopdrachten, stel een afgestemde drempelwaarde in, baken af per tenant, pas TTL's toe en monitor het trefferpercentage. Combineer dit met exacte caching voor de beste dekking.
Korte controle
Test je begrip van semantische caching.
Samenvatting
Je hebt geleerd dat semantische caching antwoorden voor geparafraseerde query's hergebruikt door ze in embeddings om te zetten en ze te matchen op basis van cosinusovereenkomst boven een afgestemde drempelwaarde. Cache alleen stabiele kennis, baken af per tenant voor privacy, pas TTL's toe voor actuele gegevens en monitor het trefferpercentage om de besparing te kwantificeren.
Leer LLM-toepassingen in productie (RAG + vectordatabase + caching) met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 48
Veelgestelde vragen
Is de les “Semantische caching voor LLM-responses” gratis?
Ja — de volledige tekst van “Semantische caching voor LLM-responses” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat in totaal 4 lessen.
Wat leer ik in “Semantische caching voor LLM-responses”?
Leer hoe semantische caching antwoorden voor vergelijkbare queries hergebruikt door op betekenis in plaats van exacte tekst te matchen, waardoor LLM-kosten en latency sterk dalen. Je oefent met LLM-toepassingen in productie (RAG + vectordatabase + caching) door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met LLM-toepassingen in productie (RAG + vectordatabase + caching) te beginnen?
Ervaring vooraf is niet nodig. LLM-toepassingen in productie (RAG + vectordatabase + caching) op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Semantische caching voor LLM-responses”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over LLM-toepassingen in productie (RAG + vectordatabase + caching)?
Ja. Elke les over LLM-toepassingen in productie (RAG + vectordatabase + caching) bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Gedistribueerde caching met Redis/Memcached
- Sessiebeheer en contextpersistentie
- Geavanceerde strategieën voor cache-invalidatie
- Semantische caching voor LLM-responses