0Pricing
AI Agents · Lektion

Warum lange Kontexte nicht skalieren

Die Kosten steigen linear, die Qualität nimmt ab, und „Lost in the Middle“ führt dazu, dass das Modell Inhalte in langen Prompts vergisst.

Warum lange Kontexte nicht skalieren ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Größer ist nicht immer besser

Moderne Modelle haben riesige Kontextfenster — 200k, 1M oder sogar 2M Tokens. Es ist verlockend, einfach alles hineinzukopieren, anstatt ein echtes Gedächtnis aufzubauen.

Dieser Ansatz scheitert in der Produktion aus drei Gründen.

Grund 1: Kosten

Jedes Token in jedem Aufruf kostet Geld. Ein System-Prompt mit 100k Tokens und 1000 Nachrichten ergeben 100M Eingabetokens — insgesamt mehrere Dutzend Dollar pro Sitzung.

Prompt-Caching hilft, beseitigt die Kosten aber nicht.

Grund 2: Latenz

Die Verarbeitung von 100k Eingabetokens verlängert die Zeit bis zum ersten Token um 1–3 Sekunden. Für eine gute Chat-Benutzeroberfläche sollte TTFT unter 500 ms liegen.

Grund 3: Qualitätsverlust

Modelle achten auf Inhalte in der Mitte langer Prompts weniger stark — der von Liu et al. 2023 dokumentierte „lost-in-the-middle“-Effekt.

Informationen am Anfang oder Ende werden zuverlässig abgerufen; Informationen in der Mitte werden häufig übersehen.

Ein konkreter Test

Fügen Sie an verschiedenen Positionen eines langen Dokuments eine eindeutige Information ein und bitten Sie das Modell, sie abzurufen. Genauigkeit:

  • Anfang des Dokuments: 95 %
  • Ende des Dokuments: 90 %
  • Mitte: 50–70 %

Langer Kontext für Evaluierung, nicht für die Produktion

Lange Kontexte sind für einmalige Aufgaben nützlich (etwa die gesamte Codebasis analysieren), aber für Agenten im laufenden Produktionseinsatz ungeeignet.

Verwenden Sie in der Produktion Retrieval, um pro Nachricht nur die relevanten 5 % einzufügen.

Wann lange Kontexte helfen

  • Erste Analyse einer Codebasis
  • Fragen und Antworten zu einem vollständigen Dokument in einem einzigen Aufruf
  • Vergleich zweier langer Dokumente

Einmalige Aufgaben ohne erneute Verarbeitung.

Wann lange Kontexte schaden

  • Chatbots mit Hunderten von Nachrichten
  • Mandantenfähige Agenten, die von mehreren Benutzern gemeinsam verwendet werden
  • Überall dort, wo Kosten oder Latenz eine Rolle spielen

Die richtige Architektur

Für langlebige Agenten:

  1. Aktuelle Nachrichten im Prompt (die letzten 10–20)
  2. Ältere Nachrichten zu einer fortlaufenden Zusammenfassung zusammenfassen
  3. Fakten als Vektoren im Langzeitgedächtnis speichern
  4. Pro Nachricht die relevantesten K Erinnerungen abrufen

Hybrider Ansatz

Kombinieren Sie mehrere Techniken:

messages = [
    {'role': 'system', 'content': PERSONA},
    {'role': 'system', 'content': f'Conversation summary so far: {summary}'},
    {'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
    *last_n_turns,
]

Auslöser für die Kompaktierung

Entscheiden Sie, WANN Sie kompaktieren:

  • Alle N Nachrichten (einfach)
  • Wenn die Tokenanzahl einen Schwellenwert überschreitet (besser)
  • Wenn das Modell beginnt, Dinge zu vergessen (am besten, aber schwer zu erkennen)

In der Mitte verloren

Was ist der „lost-in-the-middle“-Effekt?

Zusammenfassung

Lösen Sie das Gedächtnisproblem nicht, indem Sie das Kontextfenster maximal ausreizen. Verwenden Sie Zusammenfassungen und Retrieval, um pro Nachricht die wichtigen Informationen bereitzustellen.

Häufig gestellte Fragen

Ist die Lektion „Warum lange Kontexte nicht skalieren“ kostenlos?

Ja — der vollständige Text von „Warum lange Kontexte nicht skalieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Warum lange Kontexte nicht skalieren“?

Die Kosten steigen linear, die Qualität nimmt ab, und „Lost in the Middle“ führt dazu, dass das Modell Inhalte in langen Prompts vergisst. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Warum lange Kontexte nicht skalieren“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Kurzzeitgedächtnis im Kontextfenster
  2. Warum lange Kontexte nicht skalieren
  3. Zusammenfassen als Kompression
  4. Einfache Speicher (Key-Value)
← Zurück zu AI Agents