0Pricing
AI Agents · Lektion

Kurzzeitgedächtnis im Kontextfenster

Speichern Sie den Gesprächsverlauf im Nachrichtenarray – das einfachste Gedächtnis überhaupt und eines mit klaren Grenzen.

Kurzzeitgedächtnis im Kontextfenster ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Memory ist nur eine Liste

Das „Memory“ eines Chat-LLM ist die messages-Liste, die Sie bei jedem Aufruf senden. Das Modell ist zustandslos – zwischen Anfragen weiß es nichts.

„Kurzzeitgedächtnis“ = alles, was sich gerade in dieser Liste befindet.

Warum es funktioniert

Sie fügen jede User-Nachricht und jede Assistant-Antwort an. Wenn Sie die dritte Frage stellen, sieht das Modell:

messages = [
  {'role': 'system', 'content': 'You are helpful.'},
  {'role': 'user',   'content': 'My name is Alice.'},
  {'role': 'assistant', 'content': 'Nice to meet you, Alice.'},
  {'role': 'user',   'content': 'What is my name?'}
]
# Model replies: 'Alice'
for m in messages:
    print(f"{m['role']}: {m['content']}")
print("Model replies: Alice")

Grenzen des Kontextfensters

Jedes Modell hat ein festes Kontextfenster – die maximale Anzahl an Tokens, die Eingabe und Ausgabe zusammen enthalten dürfen.

  • gpt-4o-mini: 128k Tokens
  • claude-sonnet-4-5: 200k Tokens
  • gemini-1.5-pro: 2M Tokens

Wenn Sie dieses Limit überschreiten, gibt die API einen Fehler zurück.

Token-Kosten sind linear

Sie bezahlen in jedem Durchlauf für jedes Token. Ein Chat mit 30 Durchläufen, in dem jeder Durchlauf 500 Tokens enthält, kostet Sie allein beim LETZTEN Aufruf 15.000 Eingabe-Tokens – der gesamte Verlauf wird erneut übertragen.

Lange Sitzungen werden schnell teuer.

Lost-in-the-Middle-Effekt

Selbst bei einem Kontext von 200k achten Modelle auf Inhalte in der Mitte eines langen Prompts WENIGER. Wichtige Informationen sollten am Anfang (im System-Prompt) oder am Ende (in der neuesten User-Nachricht) stehen.

Kürzen mit einem gleitenden Fenster

Die einfachste Speicherverwaltung: Behalten Sie die System-Nachricht und die letzten N Durchläufe:

MAX_TURNS = 20  # 10 user + 10 assistant

def trim(messages):
    system = messages[0]
    rest = messages[1:]
    return [system] + rest[-MAX_TURNS:]

demo_messages = [{'role': 'system', 'content': 'sys'}] + [
    {'role': 'user' if i % 2 == 0 else 'assistant', 'content': f'msg {i}'} for i in range(30)
]
trimmed = trim(demo_messages)
print(f"Original messages: {len(demo_messages)}")
print(f"Trimmed messages: {len(trimmed)}")

Tokenbasiertes Kürzen

Präziser ist es, nach der Token-Anzahl statt nach der Anzahl der Durchläufe zu kürzen:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_by_tokens(messages, max_tokens=8000):
    out = [messages[0]]   # keep system
    tokens_left = max_tokens - len(enc.encode(messages[0]['content']))
    # walk backwards from newest
    for m in reversed(messages[1:]):
        cost = len(enc.encode(m['content'])) + 4
        if cost > tokens_left:
            break
        out.insert(1, m)
        tokens_left -= cost
    return out

Paare zusammenhalten

Wenn Sie mitten in einem Paar abschneiden, bleiben verwaiste Tool-Aufrufe zurück. Kürzen Sie Benutzer- und Assistenten-Nachrichten immer gemeinsam:

# Bad: cuts after assistant call but before tool result
# Good: trim whole turns (user + all responses)
print("Bad: cuts after assistant call but before tool result")
print("Good: trim whole turns (user + all responses)")

Wenn der Kurzzeitspeicher nicht ausreicht

Der Kurzzeitspeicher stößt an seine Grenzen, wenn:

  • die Unterhaltung mehr als 20 Nachrichten umfasst
  • der Benutzer am nächsten Tag zurückkehrt und erwartet, dass Sie sich erinnern
  • mehrere Benutzer denselben Agenten verwenden

Sie benötigen eine andere Strategie — siehe die nächsten Lektionen.

System-Prompt bleibt angeheftet

Die Systemnachricht muss immer das erste Element sein. Kürzen Sie sie niemals. Sie enthält Identität, Regeln und Tool-Beschreibungen.

Aktuelle Systemaktualisierungen anheften

Wenn Sie „remember the user prefers Celsius“ als Systemnotiz anhängen, heften Sie sie wie den ursprünglichen System-Prompt am Anfang an:

SYSTEM_PROMPT = 'You are a helpful assistant.'
messages = [
    {'role': 'system', 'content': SYSTEM_PROMPT},
    {'role': 'system', 'content': 'USER PREFERENCE: Celsius units'},
    {'role': 'user', 'content': 'What is the weather in Paris?'},
    {'role': 'assistant', 'content': 'It is 21C and sunny.'},
]
print('Pinned system messages:')
for m in messages:
    if m['role'] == 'system':
        print(' -', m['content'])
print('Total messages:', len(messages))

Kontextlimit

Was passiert, wenn Sie das Kontextfenster des Modells überschreiten?

Zusammenfassung

Kurzzeitgedächtnis = die Nachrichtenliste. Verwalten Sie sie mit einer gleitenden Fenster- oder tokenbasierten Kürzung, heften Sie die Systemnachricht an und berücksichtigen Sie, dass die Kosten mit der Anzahl der Nachrichten steigen.

Häufig gestellte Fragen

Ist die Lektion „Kurzzeitgedächtnis im Kontextfenster“ kostenlos?

Ja — der vollständige Text von „Kurzzeitgedächtnis im Kontextfenster“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Kurzzeitgedächtnis im Kontextfenster“?

Speichern Sie den Gesprächsverlauf im Nachrichtenarray – das einfachste Gedächtnis überhaupt und eines mit klaren Grenzen. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Kurzzeitgedächtnis im Kontextfenster“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Kurzzeitgedächtnis im Kontextfenster
  2. Warum lange Kontexte nicht skalieren
  3. Zusammenfassen als Kompression
  4. Einfache Speicher (Key-Value)
← Zurück zu AI Agents