0Pricing
AI Agents · Lektion

Caching von Prompts und Ergebnissen (Anthropic, Vertex)

Das Prompt-Caching von Anthropic und das Caching von Vertex senken die Eingabekosten bei langen, wiederholten System-Prompts um das Zehnfache.

Caching von Prompts und Ergebnissen (Anthropic, Vertex) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Warum cachen?

Viele Agentenaufrufe sind nahezu identisch: derselbe System-Prompt, dieselben Few-Shot-Beispiele, aber eine andere Benutzereingabe. Ohne Caching verarbeiten Sie die statischen Teile bei jedem Aufruf erneut.

Caching kann die Kosten für Eingabetoken um das Zehnfache senken.

Zwei Arten von Caching

  1. Prompt-Caching (serverseitig) — der Anbieter speichert den KV-Zustand des Modells für wiederholte Präfixe
  2. Ergebnis-Caching (clientseitig) — Ihr Code speichert vollständige Antworten für identische Eingaben

Prompt-Caching bei Anthropic

Markieren Sie cachefähige Teile mit cache_control:

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    system=[
        {'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
    ],
    messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost

Cache-Trefferquote

Prüfen Sie das Nutzungsobjekt der Antwort:

response.usage.cache_creation_input_tokens   # tokens cached this call
response.usage.cache_read_input_tokens       # tokens read from cache

Was Sie cachen sollten

  • System-Prompts mit mehr als 1.000 Tokens
  • Tool-Definitionen
  • Few-Shot-Beispiele
  • RAG-Kontext, der von mehreren Abfragen gemeinsam genutzt wird (selten)

Wo Cache-Markierungen platziert werden

cache_control muss am LETZTEN statischen Block stehen. Alles vor der Markierung wird gecacht. Platzieren Sie stabile Inhalte am Anfang und variable Inhalte am Ende.

OpenAI Prompt-Caching

OpenAI cacht Prompts mit mehr als 1.024 Tokens automatisch. Es ist keine explizite Markierung erforderlich:

# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokens

Context-Caching bei Vertex AI

Google Vertex erfordert, dass Sie explizit ein Cache-Objekt erstellen:

from vertexai.generative_models import GenerativeModel, content_cache

cache = content_cache.CachedContent.create(
    model='gemini-1.5-pro',
    contents=[long_system_content],
    ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)

Clientseitiger Ergebnis-Cache

Verwenden Sie für Abfragen mit exakter Übereinstimmung, bei denen Eingabe und erwartete Ausgabe identisch sind, einen Schlüssel-Wert-Cache:

import hashlib

def cache_key(model, messages):
    return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()

def cached_call(model, messages):
    key = cache_key(model, messages)
    if cached := redis.get(key):
        return json.loads(cached)
    result = real_call(model, messages)
    redis.set(key, json.dumps(result), ex=3600)
    return result

Semantischer Cache

Verwenden Sie Embeddings, um ähnliche, nicht nur identische, Abfragen zu cachen:

qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
    return matches[0].metadata['cached_response']

Cache-Invalidierung

Veraltete Caches liefern falsche Antworten. Mögliche Strategien:

  • TTL — kurz für zeitkritische Daten
  • Manuelle Invalidierung bei Datenaktualisierungen
  • Schlüssel pro Benutzer, sodass Aktualisierungen nur einen Benutzer betreffen

Personalisierte Antworten nicht cachen

„Wie hoch ist mein Kontostand?“ kann nicht über mehrere Benutzer hinweg gecacht werden. Seien Sie vorsichtig mit gemeinsam genutzten Caches in mandantenfähigen Systemen.

Cache-Kosten im Vergleich zu LLM-Kosten

Die Kosten für Redis sind im Vergleich zu LLM-Kosten vernachlässigbar. Cachen Sie großzügig — selbst eine Trefferquote von 10 % spart spürbar Geld.

Einsparungen in der Praxis

Bei langen gemeinsam genutzten System-Prompts und Prompt-Caching sehen Teams in der Produktion regelmäßig eine Senkung der Eingabekosten um 50–90 %. Das ist eine der Optimierungen mit dem höchsten ROI.

Anthropic-Cache-Trigger

Wie aktivieren Sie Prompt-Caching mit Anthropic?

Zusammenfassung

Serverseitiges Prompt-Caching für statische Präfixe, clientseitiger KV-Cache für exakte Übereinstimmungen und semantischer Cache für ungefähre Übereinstimmungen. Prüfen Sie immer Trefferquoten und Einsparungen.

Häufig gestellte Fragen

Ist die Lektion „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“ kostenlos?

Ja — der vollständige Text von „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“?

Das Prompt-Caching von Anthropic und das Caching von Vertex senken die Eingabekosten bei langen, wiederholten System-Prompts um das Zehnfache. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Caching von Prompts und Ergebnissen (Anthropic, Vertex)“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Token-Budgets pro Schritt
  2. Modell-Routing (günstig -> teuer)
  3. Caching von Prompts und Ergebnissen (Anthropic, Vertex)
  4. Quantisierung und spekulatives Decoding
← Zurück zu AI Agents