0Pricing
AI Agents · Lezione

Caching di prompt e risultati (Anthropic, Vertex)

Il caching dei prompt di Anthropic e il caching di Vertex riducono di dieci volte il costo dell’input per prompt di sistema lunghi e ripetuti

Caching di prompt e risultati (Anthropic, Vertex) è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Perché usare la cache?

Molte chiamate degli agenti sono quasi identiche: stesso prompt di sistema, stessi esempi few-shot, input utente diverso. Senza caching, rielaborate le parti statiche a ogni chiamata.

Il caching può ridurre di 10 volte il costo dei token di input.

Due tipi di caching

  1. Prompt caching (lato server) — il provider memorizza lo stato KV del modello per prefissi ripetuti
  2. Result caching (lato client) — il vostro codice memorizza nella cache le risposte complete per input identici

Prompt caching di Anthropic

Contrassegnate le parti memorizzabili nella cache con cache_control:

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    system=[
        {'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
    ],
    messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost

Rapporto di cache hit

Controllate l'oggetto usage della risposta:

response.usage.cache_creation_input_tokens   # tokens cached this call
response.usage.cache_read_input_tokens       # tokens read from cache

Cosa memorizzare nella cache

  • Prompt di sistema di oltre 1.000 token
  • Definizioni degli strumenti
  • Esempi few-shot
  • Contesto RAG condiviso tra le query (raramente)

Dove posizionare i marcatori della cache

Il controllo della cache deve trovarsi nell'ULTIMO blocco statico. Tutto ciò che precede il marcatore viene memorizzato nella cache. Contenuti stabili all'inizio; contenuti variabili alla fine.

Prompt caching di OpenAI

OpenAI memorizza automaticamente nella cache i prompt di oltre 1024 token. Non serve alcun marcatore esplicito:

# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokens

Caching del contesto in Vertex AI

Google Vertex richiede di creare esplicitamente un oggetto cache:

from vertexai.generative_models import GenerativeModel, content_cache

cache = content_cache.CachedContent.create(
    model='gemini-1.5-pro',
    contents=[long_system_content],
    ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)

Cache dei risultati lato client

Per le query con corrispondenza esatta (stesso input, stesso output previsto), usate una cache chiave-valore:

import hashlib

def cache_key(model, messages):
    return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()

def cached_call(model, messages):
    key = cache_key(model, messages)
    if cached := redis.get(key):
        return json.loads(cached)
    result = real_call(model, messages)
    redis.set(key, json.dumps(result), ex=3600)
    return result

Cache semantica

Usate gli embedding per memorizzare nella cache query simili (non identiche):

qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
    return matches[0].metadata['cached_response']

Invalidazione della cache

Le cache obsolete restituiscono risposte errate. Strategie:

  • TTL — breve per i dati sensibili al tempo
  • Invalidazione manuale quando i dati vengono aggiornati
  • Chiavi per utente, in modo che gli aggiornamenti influiscano su un solo utente

Non memorizzare nella cache le risposte personalizzate

«Qual è il mio saldo?» non può essere memorizzato nella cache tra utenti diversi. Prestate attenzione alle cache condivise nei sistemi multi-tenant.

Costo della cache rispetto al costo dell'LLM

I costi di Redis sono trascurabili rispetto a quelli degli LLM. Usate la cache in modo aggressivo: anche un rapporto di hit del 10% consente di risparmiare denaro reale.

Risparmi nel mondo reale

Con prompt di sistema condivisi e lunghi e il prompt caching, in produzione i team registrano regolarmente una riduzione del costo degli input del 50-90%. È una delle ottimizzazioni con il miglior ritorno sull'investimento.

Attivazione della cache di Anthropic

Come si abilita il prompt caching con Anthropic?

Riepilogo

Prompt caching lato server per i prefissi statici; cache KV lato client per le corrispondenze esatte; cache semantica per le corrispondenze approssimative. Controllate sempre i rapporti di hit e i risparmi.

Domande Frequenti

La lezione «Caching di prompt e risultati (Anthropic, Vertex)» è gratuita?

Sì — il testo completo di «Caching di prompt e risultati (Anthropic, Vertex)» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Caching di prompt e risultati (Anthropic, Vertex)»?

Il caching dei prompt di Anthropic e il caching di Vertex riducono di dieci volte il costo dell’input per prompt di sistema lunghi e ripetuti Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Caching di prompt e risultati (Anthropic, Vertex)»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Budget di token per passaggio
  2. Instradamento dei modelli (da economico a costoso)
  3. Caching di prompt e risultati (Anthropic, Vertex)
  4. Quantizzazione e decodifica speculativa
← Torna a AI Agents