Caching von Prompts und Ergebnissen (Anthropic, Vertex)
Das Prompt-Caching von Anthropic und das Caching von Vertex senken die Eingabekosten bei langen, wiederholten System-Prompts um das Zehnfache.
Caching von Prompts und Ergebnissen (Anthropic, Vertex) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Warum cachen?
Viele Agentenaufrufe sind nahezu identisch: derselbe System-Prompt, dieselben Few-Shot-Beispiele, aber eine andere Benutzereingabe. Ohne Caching verarbeiten Sie die statischen Teile bei jedem Aufruf erneut.
Caching kann die Kosten für Eingabetoken um das Zehnfache senken.
Zwei Arten von Caching
- Prompt-Caching (serverseitig) — der Anbieter speichert den KV-Zustand des Modells für wiederholte Präfixe
- Ergebnis-Caching (clientseitig) — Ihr Code speichert vollständige Antworten für identische Eingaben
Prompt-Caching bei Anthropic
Markieren Sie cachefähige Teile mit cache_control:
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input costCache-Trefferquote
Prüfen Sie das Nutzungsobjekt der Antwort:
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cacheWas Sie cachen sollten
- System-Prompts mit mehr als 1.000 Tokens
- Tool-Definitionen
- Few-Shot-Beispiele
- RAG-Kontext, der von mehreren Abfragen gemeinsam genutzt wird (selten)
Wo Cache-Markierungen platziert werden
cache_control muss am LETZTEN statischen Block stehen. Alles vor der Markierung wird gecacht. Platzieren Sie stabile Inhalte am Anfang und variable Inhalte am Ende.
OpenAI Prompt-Caching
OpenAI cacht Prompts mit mehr als 1.024 Tokens automatisch. Es ist keine explizite Markierung erforderlich:
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensContext-Caching bei Vertex AI
Google Vertex erfordert, dass Sie explizit ein Cache-Objekt erstellen:
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)Clientseitiger Ergebnis-Cache
Verwenden Sie für Abfragen mit exakter Übereinstimmung, bei denen Eingabe und erwartete Ausgabe identisch sind, einen Schlüssel-Wert-Cache:
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return resultSemantischer Cache
Verwenden Sie Embeddings, um ähnliche, nicht nur identische, Abfragen zu cachen:
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']Cache-Invalidierung
Veraltete Caches liefern falsche Antworten. Mögliche Strategien:
- TTL — kurz für zeitkritische Daten
- Manuelle Invalidierung bei Datenaktualisierungen
- Schlüssel pro Benutzer, sodass Aktualisierungen nur einen Benutzer betreffen
Personalisierte Antworten nicht cachen
„Wie hoch ist mein Kontostand?“ kann nicht über mehrere Benutzer hinweg gecacht werden. Seien Sie vorsichtig mit gemeinsam genutzten Caches in mandantenfähigen Systemen.
Cache-Kosten im Vergleich zu LLM-Kosten
Die Kosten für Redis sind im Vergleich zu LLM-Kosten vernachlässigbar. Cachen Sie großzügig — selbst eine Trefferquote von 10 % spart spürbar Geld.
Einsparungen in der Praxis
Bei langen gemeinsam genutzten System-Prompts und Prompt-Caching sehen Teams in der Produktion regelmäßig eine Senkung der Eingabekosten um 50–90 %. Das ist eine der Optimierungen mit dem höchsten ROI.
Anthropic-Cache-Trigger
Wie aktivieren Sie Prompt-Caching mit Anthropic?
Zusammenfassung
Serverseitiges Prompt-Caching für statische Präfixe, clientseitiger KV-Cache für exakte Übereinstimmungen und semantischer Cache für ungefähre Übereinstimmungen. Prüfen Sie immer Trefferquoten und Einsparungen.
Häufig gestellte Fragen
Ist die Lektion „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“ kostenlos?
Ja — der vollständige Text von „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“?
Das Prompt-Caching von Anthropic und das Caching von Vertex senken die Eingabekosten bei langen, wiederholten System-Prompts um das Zehnfache. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Token-Budgets pro Schritt
- Modell-Routing (günstig -> teuer)
- Caching von Prompts und Ergebnissen (Anthropic, Vertex)
- Quantisierung und spekulatives Decoding