Kontextfenster: Größe und Auswirkungen
Sie lernen, was das Kontextfenster ist, wie es Gesprächslänge und Dokumentverarbeitung begrenzt, und vergleichen die Kontextgrößen von GPT-4o, Claude und Gemini.
Kontextfenster: Größe und Auswirkungen ist eine kostenlose AI Engineering Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Engineering Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.
Was ist das Kontextfenster?
Das Kontextfenster ist die maximale Anzahl an Tokens, die ein LLM in einem einzelnen API-Aufruf verarbeiten kann. Es umfasst alles: den System-Prompt, alle vorherigen Gesprächsbeiträge, alle Dokumente, die Sie für RAG einfügen, sowie den für die Antwort des Modells reservierten Platz. Wenn die Gesamtlänge das Kontextfenster überschreitet, gibt die API einen Fehler zurück.
Stellen Sie sich das Kontextfenster als das Arbeitsgedächtnis des Modells vor. Anders als ein Mensch, der sich über mehrere Sitzungen hinweg an vergangene Gespräche erinnern kann, verfügt ein LLM über kein dauerhaftes Gedächtnis – es kann nur das „wissen“, was im aktuellen Kontextfenster enthalten ist. Wenn ein Gespräch über das Fenster hinauswächst, müssen die ältesten Inhalte entfernt werden. Dadurch kann das Modell wichtige frühere Zusammenhänge aus dem Blick verlieren.
Größen von Kontextfenstern im Jahr 2025
Kontextfenster sind dramatisch gewachsen. Im Jahr 2020 bot GPT-3 4.096 Tokens. Im Jahr 2025 bieten führende Modelle:
- GPT-4o und GPT-4o-mini: 128.000 Tokens (etwa 100.000 Wörter)
- Claude 3.5 Sonnet / Opus: 200.000 Tokens
- Gemini 1.5 Pro: 1.000.000 Tokens (eine Million)
- Gemini 1.5 Flash: 1.000.000 Tokens
Ein Kontextfenster mit 128K Tokens kann ungefähr 300 Textseiten, einen vollständigen Roman oder eine komplette mittelgroße Codebasis aufnehmen. Trotzdem ist unbegrenzter Kontext kein gelöstes Problem: Die Kosten der Attention steigen quadratisch mit der Sequenzlänge, wodurch sehr lange Kontexte teuer und manchmal ungenauer als kürzere, fokussierte Kontexte werden.
Das „Lost in the Middle“-Problem
Forschungen haben gezeigt, dass LLMs nicht allen Teilen des Kontextfensters die gleiche Aufmerksamkeit schenken. Sie richten in der Regel die meiste Aufmerksamkeit auf Inhalte am ganz Anfang (Primacy-Effekt) und am ganz Ende (Recency-Effekt) des Kontexts, während Inhalte in der Mitte weniger zuverlässig verarbeitet werden.
Dieses Phänomen wird als „Lost in the Middle“-Problem bezeichnet. Es hat praktische Auswirkungen auf RAG-Systeme: Wenn Sie 10 abgerufene Dokumente aneinanderhängen und das relevanteste davon in der Mitte landet, verwendet das Modell es möglicherweise nicht effektiv. Bewährt hat sich, den wichtigsten Kontext am Anfang oder Ende der eingefügten Dokumente zu platzieren, nicht in der Mitte.
Kontext und Konversation: ein praktisches Beispiel
In einer Chat-Anwendung wird der vollständige Gesprächsverlauf in jeden API-Aufruf aufgenommen. Mit zunehmender Länge des Gesprächs steigt auch die Tokenanzahl. Ein Gespräch mit 50 Nachrichten, die durchschnittlich jeweils 100 Tokens enthalten, verwendet bereits 5.000 Tokens allein für den Verlauf. Zusammen mit einem 2.000-Tokens umfassenden System-Prompt und 10.000 Tokens RAG-Kontext sind Sie bei 17.000 Tokens, bevor der Benutzer überhaupt seine nächste Frage stellt.
import tiktoken
def estimate_conversation_tokens(messages, model='gpt-4o'):
enc = tiktoken.encoding_for_model(model)
total = 3 # priming
for msg in messages:
total += 4 # per-message overhead
total += len(enc.encode(msg.get('content', '')))
return total
# Simulate a growing conversation
conversation = [
{'role': 'system', 'content': 'You are a helpful coding assistant. ' * 20}, # ~100 tokens
]
for i in range(1, 21):
conversation.append({'role': 'user', 'content': f'Question {i}: How do I implement feature X?'})
conversation.append({'role': 'assistant', 'content': 'Here is how to implement that feature...' * 5})
if i % 5 == 0:
tokens = estimate_conversation_tokens(conversation)
print(f'After {i} exchanges: {tokens} tokens')Effektiver Kontext im Vergleich zum maximalen Kontext
Ein großes Kontextfenster bedeutet nicht, dass Sie es vollständig füllen sollten. Forschungen zeigen immer wieder, dass die Genauigkeit des Modells mit zunehmender Auslastung des Kontexts abnimmt, insbesondere bei Aufgaben, die das präzise Auffinden bestimmter Fakten in einem langen Kontext erfordern. Ein fokussierter, relevanter Kontext mit 5.000 Tokens liefert häufig bessere Antworten als ein ungerichteter Kontext mit 50.000 Tokens.
Das ist das zentrale Argument für RAG, statt einfach alle Ihre Dokumente in den Kontext zu laden: Ein RAG-System ruft nur die 2–5 relevantesten Chunks ab, hält den Kontext fokussiert und bündelt die Aufmerksamkeit des Modells auf das Wesentliche. Stellen Sie es sich so vor, als würden Sie den Index eines Buchs durchsuchen, statt das gesamte Buch zu lesen, um eine einzige Frage zu beantworten.
Auswirkungen auf die Dokumentverarbeitung
Lange Kontextfenster ermöglichen leistungsfähige Workflows zur Dokumentverarbeitung, die zuvor nicht möglich waren. Sie können jetzt ein vollständiges 50-seitiges PDF an GPT-4o senden und Fragen dazu stellen, das Modell mehrere Verträge gleichzeitig zusammenfassen und miteinander abgleichen lassen oder eine gesamte Codebasis auf Muster und Anti-Patterns analysieren.
Bei ungefähr 0,15 $ pro einer Million Input-Tokens kostet die Verarbeitung eines Dokuments mit 100.000 Tokens pro Anfrage etwa 0,015 $. Bei 10.000 Anfragen pro Tag für ein Dokument, das sich selten ändert, zahlen Sie 150 $ pro Tag für redundante Verarbeitung. Deshalb sind Caching- und Vorverarbeitungsstrategien in produktiven Dokumentanalysesystemen von enormer Bedeutung.
Zusammenhang zwischen Kontextfenster und Maximalanzahl an Tokens
Der API-Parameter max_tokens begrenzt die Länge der Ausgabe, nicht die Länge des gesamten Kontexts. Das gesamte Kontextfenster entspricht der Summe aus Input-Tokens und Output-Tokens. Wenn Ihr Kontextfenster 128.000 Tokens umfasst und Ihre Eingabe 120.000 Tokens verwendet, bleiben unabhängig von Ihrer Einstellung für max_tokens nur 8.000 Tokens für die Antwort übrig.
Reservieren Sie immer ausreichend Budget für die Ausgabe. Für einen Konversationsassistenten reichen in der Regel 2.000–4.000 Output-Tokens aus. Für Codegenerierung oder längere Inhalte benötigen Sie möglicherweise 8.000–16.000 Tokens. Integrieren Sie die Berechnung Ihres Tokenbudgets in Ihre Logik zur Kontextzusammenstellung.
import tiktoken
def check_context_budget(
messages,
model='gpt-4o',
max_context=128000,
min_output_tokens=2000
):
enc = tiktoken.encoding_for_model(model)
input_tokens = sum(
len(enc.encode(m.get('content', ''))) + 4
for m in messages
) + 3
available_output = max_context - input_tokens
if available_output < min_output_tokens:
raise ValueError(
f'Not enough output budget: only {available_output} tokens '
f'remaining, need at least {min_output_tokens}.'
)
return input_tokens, available_outputModelle anhand der Kontextanforderungen auswählen
Die Größe des Kontextfensters sollte eines Ihrer wichtigsten Kriterien bei der Modellauswahl sein. Stimmen Sie das Kontextfenster des Modells auf Ihren tatsächlichen Anwendungsfall ab:
- Chat-Assistenten mit kurzen Sitzungen: 8K–16K sind normalerweise ausreichend; verwenden Sie gpt-4o-mini für eine kosteneffiziente Lösung
- Dokumentenfragen zu mittelgroßen Dokumenten: 32K–128K; gpt-4o bietet ein gutes Verhältnis von Qualität und Kosten
- Analyse von Rechtsdokumenten und Verträgen mit Hunderten von Seiten: 128K–200K; ziehen Sie Claude wegen seiner Leistung bei langen Kontexten in Betracht
- Analyse einer vollständigen Codebasis oder eines Buchs: 500K–1M; Gemini 1.5 Pro ist derzeit führend
Für ein Kontextfenster mit 1M Tokens zu bezahlen, wenn Sie nur 8K benötigen, ist teure Überdimensionierung. Wählen Sie ein Modell, dessen Größe zu Ihren tatsächlichen Kontextanforderungen passt.
Context Caching zur Kostensenkung
Wenn Sie dasselbe große Dokument oder denselben System-Prompt in vielen Anfragen wiederholt abfragen, zahlen Sie jedes Mal für die Tokenisierung und Verarbeitung derselben Inhalte. Das Prompt-Caching von OpenAI gewährt automatisch 50 % Rabatt auf den Preis der Input-Tokens für wiederholte Prompt-Präfixe, sobald dasselbe Präfix mehr als 1.024 Tokens umfasst.
Um möglichst viele Cache-Treffer zu erzielen, strukturieren Sie Ihre Nachrichten so, dass der unveränderliche Inhalt zuerst kommt: System-Prompt, danach das große Dokument oder der Kontext und anschließend die variable Benutzerfrage. Auf diese Weise wird das lange, unveränderliche Präfix zwischengespeichert, und bei jeder Anfrage muss nur die kleine variable Abfrage zum regulären Preis verarbeitet werden.
Wann erweitern und wann zusammenfassen?
Bei einem großen Kontextfenster haben Sie zwei Strategien für den Umgang mit wachsenden Gesprächen oder großen Dokumenten: erweitern (alles im Kontext behalten) oder zusammenfassen (alte Inhalte komprimieren, um Tokens zu sparen). Welche Wahl richtig ist, hängt von Ihrem Anwendungsfall ab.
Wählen Sie die Erweiterung, wenn Sie auf bestimmte Fakten aus einem früheren Gespräch zurückgreifen müssen, ein Dokument analysieren, bei dem bestimmte Abschnitte zitiert werden müssen, oder durch eine Zusammenfassung wichtige Nuancen verloren gingen. Wählen Sie die Zusammenfassung, wenn die übergreifenden Themen des früheren Gesprächs wichtiger sind als der genaue Wortlaut, Sie sich der Kontextgrenze nähern oder derselbe Kontext häufig wiederverwendet wird (wodurch die Zusammenfassung zu einem einmaligen Aufwand wird).
Kontextlänge in der Produktion überwachen
Überwachen Sie in der Produktion die Kontextlänge pro Anfrage als wichtige Kennzahl. Plötzliche Anstiege der durchschnittlichen Kontextlänge können auf einen Fehler in Ihrem Code zur Kontextzusammenstellung, sehr lange Eingaben von Benutzern oder eine Rückkopplungsschleife hindeuten, bei der die langen Antworten des Modells wieder in den Kontext eingespeist werden. Richten Sie Warnungen ein, wenn die Kontextlänge 80 % des Maximums des Modells überschreitet.
Verfolgen Sie außerdem Abschneideereignisse – also Situationen, in denen Sie den Kontext kürzen müssen, damit er in das Fenster passt. Häufiges Abschneiden bedeutet, dass Sie eine bessere Strategie für die Kontextverwaltung, ein Modell mit größerem Kontext oder einen RAG-basierten Ansatz benötigen, bei dem nur relevante Inhalte abgerufen werden, anstatt alles zu senden.
Schnelltest
Testen Sie Ihr Verständnis der Konzepte aus dem Bereich AI Engineering aus dieser Lektion.
Lektionszusammenfassung
In dieser Lektion haben Sie gelernt: Das Kontextfenster ist das gesamte Tokenbudget für Eingabe und Ausgabe in einem einzelnen API-Aufruf, das „Lost in the Middle“-Problem bedeutet, dass Inhalte am Anfang und Ende des Kontexts zuverlässiger verarbeitet werden, und ein kleiner, fokussierter Kontext liefert häufig bessere Ergebnisse als ein großer, ungerichteter, weshalb RAG dem Einfügen aller Dokumente vorzuziehen ist. Als Nächstes untersuchen wir, wie sich API-Kosten vor dem Senden von Anfragen berechnen und prognostizieren lassen.
Häufig gestellte Fragen
Ist die Lektion „Kontextfenster: Größe und Auswirkungen“ kostenlos?
Ja — der vollständige Text von „Kontextfenster: Größe und Auswirkungen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Engineering Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Kontextfenster: Größe und Auswirkungen“?
Sie lernen, was das Kontextfenster ist, wie es Gesprächslänge und Dokumentverarbeitung begrenzt, und vergleichen die Kontextgrößen von GPT-4o, Claude und Gemini. Du übst AI Engineering Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Engineering Academy zu starten?
Keine Vorkenntnisse erforderlich. AI Engineering Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Kontextfenster: Größe und Auswirkungen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Engineering Academy-Lektion Code schreiben und ausführen?
Ja. Jede AI Engineering Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was ist ein Token?
- Kontextfenster: Größe und Auswirkungen
- API-Kosten berechnen und prognostizieren
- Strategien zur Einhaltung von Kontextgrenzen