Lange Präfixe cachen
Kostenkontrolle durch Prompt-Caching
Lange Präfixe cachen ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Warum Präfix-Caching existiert
Bei jedem langen Prompt fallen Prefill-Kosten an, weil seine Tokens vor der Generierung verarbeitet werden müssen. Wenn sich dasselbe lange Präfix bei vielen Aufrufen wiederholt – etwa ein System-Prompt, eine Tool-Spezifikation oder ein großes Referenzdokument –, ermöglicht Prompt-Caching dem Anbieter, den bereits berechneten Attention-Zustand wiederzuverwenden, statt ihn erneut zu berechnen.
- Cache-Treffer senken Latenz und Eingabekosten erheblich.
- Die Einsparungen steigen mit der Präfixgröße und der Häufigkeit der Wiederverwendung.
Caching ist am Präfix verankert
Caches verwenden eine exakte Übereinstimmung des Tokenpräfixes vom Anfang des Prompts an als Schlüssel. Der gecachte Bereich reicht vom Anfang bis zum ersten Abweichungspunkt. Wenn Sie früh etwas ändern, verfehlt alles danach den Cache.
Die Konsequenz: Für möglichst viele Treffer muss das Layout die stabilsten Inhalte zuerst und die variabelsten Inhalte zuletzt platzieren.
# Cache reuse covers: [identical prefix .... first difference)
# One early edit invalidates the whole downstream cache.Nach Stabilität ordnen
Ordnen Sie die Inhalte von stabil nach instabil: unveränderliche Systemregeln und Tooldefinitionen, danach umfangreiches stabiles Referenzmaterial, dann sitzungsstabiler Kontext und zuletzt die volatile, anfrageabhängige Eingabe und Frage.
- Stabil -> vorne (cachefähig).
- Volatil -> hinten (nur dieser Teil wird neu berechnet).
Dieses eine Ordnungsprinzip bestimmt die meisten Erfolge beim Caching.
prompt = [
SYSTEM_RULES, # never changes
TOOL_SPECS, # rarely changes
REFERENCE_CORPUS, # stable for the session
USER_TURN # changes every call -> keep last
]Cache-Grenzen
Einige Anbieter erlauben Ihnen, explizite Cache-Grenzen zu markieren. Platzieren Sie sie am Ende jedes stabilen Segments, damit das System bis zu diesem Punkt cachen kann. Markieren Sie den größten stabilen Block – den Referenzbestand oder den langen System-Prompt – als cachefähig.
Auch ohne explizite Markierungen sollten Sie die Struktur nach Stabilität ordnen, damit die implizite Präfixübereinstimmung weiterhin hilft.
blocks = [
{'text': SYSTEM_RULES, 'cache': True},
{'text': REFERENCE_CORPUS, 'cache': True}, # big win
{'text': user_turn} # uncached
]Vorsicht vor unbemerkten Präfixabweichungen
Unauffällige, unbeabsichtigte Änderungen unterbrechen das Caching unbemerkt: ein Zeitstempel im System-Prompt, eine früh eingefügte anfrageabhängige ID, neu angeordnete Tooldefinitionen oder eine nichtdeterministische Reihenfolge von JSON-Schlüsseln. Jede solche Änderung verschiebt das Präfix und erzwingt eine vollständige Neuberechnung.
Überprüfen Sie Ihr Präfix auf alles, was sich zwischen Aufrufen ändert, und verschieben Sie solche Inhalte hinter den gecachten Bereich.
# BAD: dynamic value early -> kills cache
# system = 'Session ' + str(uuid4()) + ' rules: ...'
# GOOD: keep system static; put the id in the tail user turn.TTL und Cache-Lebensdauer
Caches laufen nach einer vom Provider festgelegten Time-to-Live ab, die bei jedem Treffer häufig verlängert wird. Bei zu seltenen Aufrufen treten Cold Misses erneut auf. Für stoßartige Workloads mit hoher Frequenz lohnt sich Caching; bei seltenen, verstreuten Aufrufen kann der Cache zwischen den Nutzungen ablaufen.
Stimmen Sie Ihr Traffic-Muster auf die TTL ab und ziehen Sie Keep-Alive-Pings für wertvolle Präfixe in Betracht.
Kostenmodell des Cachings
Beim Caching fällt typischerweise ein kleiner Aufpreis für das Schreiben eines Cache-Eintrags an, während das Lesen deutlich günstiger ist. Die Wirtschaftlichkeit spricht für Wiederverwendung: Ein Schreibvorgang, der sich auf viele Lesevorgänge verteilt, ergibt eine große Nettoersparnis; eine einmalige Nutzung, bei der nur geschrieben wird, kann geringfügig mehr kosten.
- Hohe Wiederverwendung - aggressiv cachen.
- Einmalige Präfixe - Caching lohnt sich möglicherweise nicht.
def worth_caching(prefix_tokens, expected_reuses, write_mult, read_mult):
no_cache = expected_reuses
cached = write_mult + read_mult * (expected_reuses - 1)
return cached < no_cache # in normalized prefix-cost unitsStabile Systemblöcke entwerfen
Machen Sie Ihren System-Prompt und Ihre Tool-Spezifikationen deterministisch und versionsgebunden. Sortieren Sie Tool-Definitionen kanonisch, vermeiden Sie das Einbetten dynamischer Daten und ändern Sie sie nur im Rahmen bewusst geplanter Releases. Ein stabiler Systemblock wird zu einem langlebigen Cache-Eintrag mit hoher Trefferquote, der von allen Requests gemeinsam genutzt wird.
Behandeln Sie das gecachte Präfix als Artefakt mit einer Version, nicht als Zeichenkette, die Sie beiläufig anpassen.
TOOLS = sorted(tool_defs, key=lambda t: t['name']) # canonical order
SYSTEM_VERSION = 'v3' # change deliberately, not per requestCaching in Agenten mit mehreren Turns
In Agentenschleifen ist die wachsende Konversation ein natürlicher Cache: Jeder Turn erweitert ein Präfix, das im nächsten Turn wiederverwendet wird. Hängen Sie neue Turns am Ende an und schreiben Sie frühere Turns niemals um, damit der bisherige Cache gültig bleibt.
Wenn Sie komprimieren müssen, tun Sie dies so, dass für die folgenden Turns ein neues stabiles Präfix entsteht, anstatt alte Präfixe wiederholt zu verändern.
Cache-Effektivität messen
Instrumentieren Sie den Cache. Die meisten Provider melden pro Aufruf die gecachten und nicht gecachten Input-Tokens. Verfolgen Sie die Trefferquote. Wenn sie niedrig ist, untersuchen Sie das Präfix auf Drift. Ein Rückgang der Trefferquote deutet meist auf einen kürzlich eingeführten dynamischen Wert am Anfang des Prompts hin.
- Protokollieren Sie cached_tokens / total_input_tokens.
- Alamieren Sie, wenn die Trefferquote nach einem Deployment sinkt.
hit_rate = usage['cache_read_input_tokens'] / max(1, usage['input_tokens'])
assert hit_rate > 0.6, 'prefix drift suspected'Ein cache-bewusstes Prompt-Layout
Um die Kosten langer Präfixe zu kontrollieren: Ordnen Sie Inhalte nach ihrer Stabilität, markieren Sie den größten stabilen Block als Cache-Breakpoint, beseitigen Sie verborgene Drift, binden und versionieren Sie System- und Tool-Blöcke, hängen Sie in Agentenschleifen nur neue Inhalte an und überwachen Sie die Trefferquote. Ziel ist ein großes wiederverwendbares Präfix und ein kleiner variabler Teil, der bei jedem Aufruf neu berechnet wird.
Kurze Überprüfung
Sie verwenden einen Referenzkorpus mit 100.000 Tokens für Tausende täglicher Abfragen wieder, aber Ihre Cache-Trefferquote liegt nahe null.
Rückblick: Lange Präfixe cachen
Prompt-Caching verwendet das Prefill eines exakt übereinstimmenden, stabilen Präfixes wieder und senkt bei häufiger Wiederverwendung Latenz und Input-Kosten deutlich. Ordnen Sie Inhalte von besonders stabil nach variabel an, markieren Sie den großen stabilen Block als Breakpoint und verschieben Sie alle variablen Inhalte ans Ende. Beseitigen Sie verborgene Drift, binden und versionieren Sie System- und Tool-Blöcke, hängen Sie in Agentenschleifen nur neue Inhalte an und überwachen Sie die Trefferquote, damit ein Rückgang auf einen neu eingeführten, früh variierenden Wert hinweist.
Häufig gestellte Fragen
Ist die Lektion „Lange Präfixe cachen“ kostenlos?
Ja — der vollständige Text von „Lange Präfixe cachen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Lange Präfixe cachen“?
Kostenkontrolle durch Prompt-Caching Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Lange Präfixe cachen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Kontextfenster mit einer Million Tokens
- Lost in the Middle
- Riesige Prompts strukturieren
- Lange Präfixe cachen