AI-agenter · leksjon

Bufring av ledetekster og resultater (Anthropic, Vertex)

Anthropic prompt caching og Vertex caching reduserer inputkostnaden ti ganger for lange, gjentatte systemledetekster.

Leksjon 3 av 416 trinn

Bufring av ledetekster og resultater (Anthropic, Vertex) er en gratis leksjon i AI-agenter på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI-agenter, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI-agenter inneholder totalt 4 leksjoner.

Hvorfor bruke cache?

Mange agentkall er nesten identiske: samme systemprompt, de samme få few-shot-eksemplene og ulik input fra brukeren. Uten caching må de statiske delene behandles på nytt i hvert kall.

Caching kan redusere kostnaden for inputtokens med en faktor på 10.

To typer caching

  1. Prompt-caching (på serversiden) — leverandøren cacher modellens KV-tilstand for gjentatte prefikser
  2. Resultatcaching (på klientsiden) — koden Deres cacher komplette svar for identisk input

Prompt-caching i Anthropic

Marker deler som kan caches, med cache_control:

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    system=[
        {'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
    ],
    messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost

Cache-treffrate

Kontroller usage-objektet i svaret:

response.usage.cache_creation_input_tokens   # tokens cached this call
response.usage.cache_read_input_tokens       # tokens read from cache

Hva bør caches

  • Systemprompter på over 1 000 tokens
  • Verktøydefinisjoner
  • Few-shot-eksempler
  • RAG-kontekst som deles mellom spørringer (sjeldent)

Hvor bør cache-markører plasseres

Cache-kontrollen må være på den SISTE statiske blokken. Alt før markøren caches. Plasser stabilt innhold først og variabelt innhold sist.

OpenAI Prompt-caching

OpenAI cacher automatisk prompter på over 1 024 tokens. Ingen eksplisitt markør er nødvendig:

# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokens

Kontekstcaching i Vertex AI

Google Vertex krever at De eksplisitt oppretter et cache-objekt:

from vertexai.generative_models import GenerativeModel, content_cache

cache = content_cache.CachedContent.create(
    model='gemini-1.5-pro',
    contents=[long_system_content],
    ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)

Resultatcache på klientsiden

For spørringer med nøyaktig samsvar (samme input og samme forventede resultat) kan De bruke en nøkkel-verdi-cache:

import hashlib

def cache_key(model, messages):
    return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()

def cached_call(model, messages):
    key = cache_key(model, messages)
    if cached := redis.get(key):
        return json.loads(cached)
    result = real_call(model, messages)
    redis.set(key, json.dumps(result), ex=3600)
    return result

Semantisk cache

Bruk embeddings til å cache lignende, men ikke identiske, spørringer:

qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
    return matches[0].metadata['cached_response']

Cache-invalidering

Utdaterte cacher gir feil svar. Strategier:

  • TTL — kort for tidsfølsomme data
  • Manuell ugyldiggjøring når data oppdateres
  • Nøkler per bruker, slik at oppdateringer bare påvirker én bruker

Ikke cache personlige svar

«Hva er saldoen min?» kan ikke caches på tvers av brukere. Vær forsiktig med delte cacher i systemer med flere leietakere.

Cachekostnad kontra LLM-kostnad

Redis-kostnader er ubetydelige sammenlignet med LLM-kostnader. Cache aggressivt — selv en treffrate på 10 % sparer reelle beløp.

Besparelser i den virkelige verden

Med lange, delte systemprompter og prompt-caching opplever team jevnlig at inputkostnaden synker med 50–90 % i produksjon. Dette er en av optimaliseringene med høyest avkastning.

Utløser for Anthropic-cache

Hvordan aktiverer De prompt-caching med Anthropic?

Oppsummering

Bruk prompt-caching på serversiden for statiske prefikser, KV-cache på klientsiden for nøyaktig samsvar og semantisk cache for omtrentlig samsvar. Kontroller alltid treffrater og besparelser.

Gratis å komme i gang

Lær deg AI-agenter med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
60
Leksjoner
239

Ofte stilte spørsmål

Er leksjonen «Bufring av ledetekster og resultater (Anthropic, Vertex)» gratis?

Ja – hele teksten i «Bufring av ledetekster og resultater (Anthropic, Vertex)» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av AI-agenter-kurset, kan du oppgradere til CoddyKit PRO. Kurset i AI-agenter inneholder totalt 4 leksjoner.

Hva lærer jeg i «Bufring av ledetekster og resultater (Anthropic, Vertex)»?

Anthropic prompt caching og Vertex caching reduserer inputkostnaden ti ganger for lange, gjentatte systemledetekster. Du øver på AI-agenter med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med AI-agenter?

Ingen tidligere erfaring er nødvendig. AI-agenter på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.

Hvor lang tid tar leksjonen «Bufring av ledetekster og resultater (Anthropic, Vertex)»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne AI-agenter-leksjonen?

Ja. Alle AI-agenter-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Tokenbudsjetter per trinn
  2. Modellruting (billig -> dyr)
  3. Bufring av ledetekster og resultater (Anthropic, Vertex)
  4. Kvantisering og spekulativ dekoding
← Tilbake til AI-agenter