Bufring av ledetekster og resultater (Anthropic, Vertex)
Anthropic prompt caching og Vertex caching reduserer inputkostnaden ti ganger for lange, gjentatte systemledetekster.
Bufring av ledetekster og resultater (Anthropic, Vertex) er en gratis leksjon i AI-agenter på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI-agenter, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI-agenter inneholder totalt 4 leksjoner.
Hvorfor bruke cache?
Mange agentkall er nesten identiske: samme systemprompt, de samme få few-shot-eksemplene og ulik input fra brukeren. Uten caching må de statiske delene behandles på nytt i hvert kall.
Caching kan redusere kostnaden for inputtokens med en faktor på 10.
To typer caching
- Prompt-caching (på serversiden) — leverandøren cacher modellens KV-tilstand for gjentatte prefikser
- Resultatcaching (på klientsiden) — koden Deres cacher komplette svar for identisk input
Prompt-caching i Anthropic
Marker deler som kan caches, med cache_control:
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input costCache-treffrate
Kontroller usage-objektet i svaret:
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cacheHva bør caches
- Systemprompter på over 1 000 tokens
- Verktøydefinisjoner
- Few-shot-eksempler
- RAG-kontekst som deles mellom spørringer (sjeldent)
Hvor bør cache-markører plasseres
Cache-kontrollen må være på den SISTE statiske blokken. Alt før markøren caches. Plasser stabilt innhold først og variabelt innhold sist.
OpenAI Prompt-caching
OpenAI cacher automatisk prompter på over 1 024 tokens. Ingen eksplisitt markør er nødvendig:
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensKontekstcaching i Vertex AI
Google Vertex krever at De eksplisitt oppretter et cache-objekt:
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)Resultatcache på klientsiden
For spørringer med nøyaktig samsvar (samme input og samme forventede resultat) kan De bruke en nøkkel-verdi-cache:
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return resultSemantisk cache
Bruk embeddings til å cache lignende, men ikke identiske, spørringer:
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']Cache-invalidering
Utdaterte cacher gir feil svar. Strategier:
- TTL — kort for tidsfølsomme data
- Manuell ugyldiggjøring når data oppdateres
- Nøkler per bruker, slik at oppdateringer bare påvirker én bruker
Ikke cache personlige svar
«Hva er saldoen min?» kan ikke caches på tvers av brukere. Vær forsiktig med delte cacher i systemer med flere leietakere.
Cachekostnad kontra LLM-kostnad
Redis-kostnader er ubetydelige sammenlignet med LLM-kostnader. Cache aggressivt — selv en treffrate på 10 % sparer reelle beløp.
Besparelser i den virkelige verden
Med lange, delte systemprompter og prompt-caching opplever team jevnlig at inputkostnaden synker med 50–90 % i produksjon. Dette er en av optimaliseringene med høyest avkastning.
Utløser for Anthropic-cache
Hvordan aktiverer De prompt-caching med Anthropic?
Oppsummering
Bruk prompt-caching på serversiden for statiske prefikser, KV-cache på klientsiden for nøyaktig samsvar og semantisk cache for omtrentlig samsvar. Kontroller alltid treffrater og besparelser.
Lær deg AI-agenter med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 60
- Leksjoner
- 239
Ofte stilte spørsmål
Er leksjonen «Bufring av ledetekster og resultater (Anthropic, Vertex)» gratis?
Ja – hele teksten i «Bufring av ledetekster og resultater (Anthropic, Vertex)» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av AI-agenter-kurset, kan du oppgradere til CoddyKit PRO. Kurset i AI-agenter inneholder totalt 4 leksjoner.
Hva lærer jeg i «Bufring av ledetekster og resultater (Anthropic, Vertex)»?
Anthropic prompt caching og Vertex caching reduserer inputkostnaden ti ganger for lange, gjentatte systemledetekster. Du øver på AI-agenter med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med AI-agenter?
Ingen tidligere erfaring er nødvendig. AI-agenter på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.
Hvor lang tid tar leksjonen «Bufring av ledetekster og resultater (Anthropic, Vertex)»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne AI-agenter-leksjonen?
Ja. Alle AI-agenter-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Tokenbudsjetter per trinn
- Modellruting (billig -> dyr)
- Bufring av ledetekster og resultater (Anthropic, Vertex)
- Kvantisering og spekulativ dekoding