Token-Budgets pro Schritt
Begrenzen Sie die Eingabe- und Ausgabetokens pro Knoten, damit eine außer Kontrolle geratene Schleife Sie nicht in den Ruin treibt.
Token-Budgets pro Schritt ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Tokens sind Geld
Jeder Token, den Sie senden oder empfangen, kostet Geld und Zeit. Produktive Agenten erfassen die Token-Nutzung bei jedem Schritt und setzen Obergrenzen durch.
max_tokens überall begrenzen
Setzen Sie bei jedem Aufruf immer max_tokens. Ohne diese Begrenzung kann ein fehlerhafter Prompt Antworten mit 10.000 Tokens erzeugen:
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=1024, # cap per response
)Begrenzungen pro Schritt in einer Agentenschleife
Für unterschiedliche Schritte werden unterschiedliche Budgets benötigt:
STEP_BUDGETS = {
'planner': 512,
'classifier': 64,
'final_synthesis': 2048,
'tool_call': 256
}
response = client.chat.completions.create(
model=model,
messages=messages,
max_tokens=STEP_BUDGETS[step_name]
)Eingabetoken kürzen
Auch Eingabetoken kosten Geld. Kürzen Sie sie konsequent:
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
def trim_to_budget(text, max_tokens=4000):
toks = enc.encode(text)
if len(toks) > max_tokens:
return enc.decode(toks[:max_tokens])
return textGesamtbudget pro Ausführung
Addieren Sie die Eingabe- und Ausgabetoken aller Schritte und brechen Sie ab, wenn das Budget überschritten wird:
MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
r = call_step(step)
total += r.usage.total_tokens
if total > MAX_TOKENS_PER_RUN:
return 'Budget exhausted; partial result'Kostenobergrenzen in Dollar
Manchmal ist eine Budgetierung in Dollar aussagekräftiger:
PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}
for step in agent_steps:
r = call_step(step)
cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
total_cost += cost
if total_cost > MAX_COST_PER_RUN:
breakAdaptive Budgets
Verwenden Sie für die schwierigsten Schritte mehr Tokens:
if step_difficulty == 'easy':
max_tokens = 256
elif step_difficulty == 'hard':
max_tokens = 2048Ausgabelänge schätzen
Fragen Sie das Modell manchmal, wie lang die Antwort sein sollte:
preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)Tool-Ausgaben kürzen
Große Tool-Ausgaben wie HTML und Logs blähen den Kontext auf. Kürzen Sie sie, bevor Sie sie an das Modell senden:
tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
text = text[:4000] + '\n...[truncated]'Verlauf komprimieren
Fassen Sie bei langen Unterhaltungen ältere Gesprächswechsel zusammen, um Tokens zu sparen:
if total_message_tokens(messages) > 8000:
messages = compact(messages)Das Ausgabeformat beeinflusst den Tokenverbrauch
JSON ist umfangreich. Für kurze strukturierte Antworten können Sie Folgendes in Betracht ziehen:
- Ein einzelnes Tool-Call-Argument
- Eine durch Kommas getrennte Liste
- Ein kompaktes benutzerdefiniertes Format
Tokenverteilung erfassen
Histogramme pro Schritt zeigen, welche Schritte Sie optimieren sollten:
metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})Warum max_tokens?
Warum sollten Sie bei jedem LLM-Aufruf max_tokens setzen?
Zusammenfassung
Begrenzen Sie max_tokens bei jedem Aufruf. Kürzen Sie Eingaben. Legen Sie Budgets pro Schritt fest. Setzen Sie Gesamtobergrenzen pro Ausführung. Erfassen Sie Verteilungen. Komprimieren Sie den Verlauf.
Lerne AI Agents mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 60
- Lektionen
- 239
Häufig gestellte Fragen
Ist die Lektion „Token-Budgets pro Schritt“ kostenlos?
Ja — der vollständige Text von „Token-Budgets pro Schritt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Token-Budgets pro Schritt“?
Begrenzen Sie die Eingabe- und Ausgabetokens pro Knoten, damit eine außer Kontrolle geratene Schleife Sie nicht in den Ruin treibt. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Token-Budgets pro Schritt“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Token-Budgets pro Schritt
- Modell-Routing (günstig -> teuer)
- Caching von Prompts und Ergebnissen (Anthropic, Vertex)
- Quantisierung und spekulatives Decoding