Prompts en resultaten cachen (Anthropic, Vertex)
Anthropic prompt caching en Vertex caching verlagen de inputkosten bij lange, herhaalde systeemprompts met een factor 10.
Prompts en resultaten cachen (Anthropic, Vertex) is een gratis AI-agenten-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.
Waarom cachen?
Veel aanroepen van agents zijn bijna identiek: dezelfde systeemprompt, dezelfde paar voorbeelden en andere invoer van de gebruiker. Zonder caching verwerk je de statische delen bij elke aanroep opnieuw.
Caching kan de kosten van invoertokens tien keer verlagen.
Twee soorten caching
- Promptcaching (aan de serverzijde) — de aanbieder bewaart de KV-status van het model voor herhaalde voorvoegsels
- Resultaatcaching (aan de clientzijde) — je code bewaart volledige antwoorden voor identieke invoer
Promptcaching van Anthropic
Markeer delen die in de cache mogen met cache_control:
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input costCache-trefferpercentage
Controleer het usage-object van de reactie:
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cacheWat je moet cachen
- Systeemprompts van meer dan 1.000 tokens
- Tooldefinities
- Voorbeelden
- RAG-context die tussen zoekopdrachten wordt gedeeld (zeldzaam)
Waar je cachemarkeringen plaatst
Cachebeheer moet op het LAATSTE statische blok staan. Alles vóór de markering wordt gecachet. Zet stabiele inhoud aan het begin en variabele inhoud aan het einde.
Promptcaching van OpenAI
OpenAI cachet prompts van meer dan 1.024 tokens automatisch. Er is geen expliciete markering nodig:
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensContextcaching van Vertex AI
Google Vertex vereist dat je expliciet een cacheobject maakt:
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)Resultaatcache aan de clientzijde
Gebruik voor zoekopdrachten met exacte overeenkomst (dezelfde invoer, dezelfde verwachte uitvoer) een sleutel-waardecache:
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return resultSemantische cache
Gebruik embeddings om vergelijkbare, maar niet identieke, zoekopdrachten te cachen:
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']Cache-invalidering
Verouderde caches geven verkeerde antwoorden. Strategieën:
- TTL — kort voor tijdgevoelige gegevens
- Handmatig ongeldig maken wanneer gegevens worden bijgewerkt
- Sleutels per gebruiker, zodat updates slechts één gebruiker beïnvloeden
Cache geen gepersonaliseerde antwoorden
"Wat is mijn saldo?" kan niet voor meerdere gebruikers worden gecachet. Wees voorzichtig met gedeelde caches in systemen met meerdere tenants.
Cachekosten versus LLM-kosten
De kosten van Redis zijn verwaarloosbaar vergeleken met LLM-kosten. Cache ruimhartig: zelfs een trefferpercentage van 10% bespaart echt geld.
Besparingen uit de praktijk
Met lange gedeelde systeemprompts en promptcaching zien teams in productie regelmatig dat de invoerkosten met 50-90% dalen. Dit is een van de optimalisaties met het hoogste rendement.
Activering van de Anthropic-cache
Hoe schakel je promptcaching met Anthropic in?
Samenvatting
Promptcaching aan de serverzijde voor statische voorvoegsels, een KV-cache aan de clientzijde voor exacte overeenkomsten en een semantische cache voor benaderende overeenkomsten. Controleer altijd de trefferpercentages en besparingen.
Leer AI-agenten met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 60
- Lessen
- 239
Veelgestelde vragen
Is de les “Prompts en resultaten cachen (Anthropic, Vertex)” gratis?
Ja — de volledige tekst van “Prompts en resultaten cachen (Anthropic, Vertex)” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.
Wat leer ik in “Prompts en resultaten cachen (Anthropic, Vertex)”?
Anthropic prompt caching en Vertex caching verlagen de inputkosten bij lange, herhaalde systeemprompts met een factor 10. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI-agenten te beginnen?
Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.
Hoe lang duurt de les “Prompts en resultaten cachen (Anthropic, Vertex)”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI-agenten?
Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Tokenbudgetten per stap
- Modelroutering (goedkoop -> duur)
- Prompts en resultaten cachen (Anthropic, Vertex)
- Quantisatie en speculatief decoderen