AI Agents · Lektion

Token-Budgets pro Schritt

Begrenzen Sie die Eingabe- und Ausgabetokens pro Knoten, damit eine außer Kontrolle geratene Schleife Sie nicht in den Ruin treibt.

Lektion 1 von 414 Schritte

Token-Budgets pro Schritt ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Tokens sind Geld

Jeder Token, den Sie senden oder empfangen, kostet Geld und Zeit. Produktive Agenten erfassen die Token-Nutzung bei jedem Schritt und setzen Obergrenzen durch.

max_tokens überall begrenzen

Setzen Sie bei jedem Aufruf immer max_tokens. Ohne diese Begrenzung kann ein fehlerhafter Prompt Antworten mit 10.000 Tokens erzeugen:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=1024,   # cap per response
)

Begrenzungen pro Schritt in einer Agentenschleife

Für unterschiedliche Schritte werden unterschiedliche Budgets benötigt:

STEP_BUDGETS = {
    'planner': 512,
    'classifier': 64,
    'final_synthesis': 2048,
    'tool_call': 256
}

response = client.chat.completions.create(
    model=model,
    messages=messages,
    max_tokens=STEP_BUDGETS[step_name]
)

Eingabetoken kürzen

Auch Eingabetoken kosten Geld. Kürzen Sie sie konsequent:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_to_budget(text, max_tokens=4000):
    toks = enc.encode(text)
    if len(toks) > max_tokens:
        return enc.decode(toks[:max_tokens])
    return text

Gesamtbudget pro Ausführung

Addieren Sie die Eingabe- und Ausgabetoken aller Schritte und brechen Sie ab, wenn das Budget überschritten wird:

MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
    r = call_step(step)
    total += r.usage.total_tokens
    if total > MAX_TOKENS_PER_RUN:
        return 'Budget exhausted; partial result'

Kostenobergrenzen in Dollar

Manchmal ist eine Budgetierung in Dollar aussagekräftiger:

PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}

for step in agent_steps:
    r = call_step(step)
    cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
    total_cost += cost
    if total_cost > MAX_COST_PER_RUN:
        break

Adaptive Budgets

Verwenden Sie für die schwierigsten Schritte mehr Tokens:

if step_difficulty == 'easy':
    max_tokens = 256
elif step_difficulty == 'hard':
    max_tokens = 2048

Ausgabelänge schätzen

Fragen Sie das Modell manchmal, wie lang die Antwort sein sollte:

preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)

Tool-Ausgaben kürzen

Große Tool-Ausgaben wie HTML und Logs blähen den Kontext auf. Kürzen Sie sie, bevor Sie sie an das Modell senden:

tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
    text = text[:4000] + '\n...[truncated]'

Verlauf komprimieren

Fassen Sie bei langen Unterhaltungen ältere Gesprächswechsel zusammen, um Tokens zu sparen:

if total_message_tokens(messages) > 8000:
    messages = compact(messages)

Das Ausgabeformat beeinflusst den Tokenverbrauch

JSON ist umfangreich. Für kurze strukturierte Antworten können Sie Folgendes in Betracht ziehen:

  • Ein einzelnes Tool-Call-Argument
  • Eine durch Kommas getrennte Liste
  • Ein kompaktes benutzerdefiniertes Format

Tokenverteilung erfassen

Histogramme pro Schritt zeigen, welche Schritte Sie optimieren sollten:

metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})

Warum max_tokens?

Warum sollten Sie bei jedem LLM-Aufruf max_tokens setzen?

Zusammenfassung

Begrenzen Sie max_tokens bei jedem Aufruf. Kürzen Sie Eingaben. Legen Sie Budgets pro Schritt fest. Setzen Sie Gesamtobergrenzen pro Ausführung. Erfassen Sie Verteilungen. Komprimieren Sie den Verlauf.

Kostenlos starten

Lerne AI Agents mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
60
Lektionen
239

Häufig gestellte Fragen

Ist die Lektion „Token-Budgets pro Schritt“ kostenlos?

Ja — der vollständige Text von „Token-Budgets pro Schritt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Token-Budgets pro Schritt“?

Begrenzen Sie die Eingabe- und Ausgabetokens pro Knoten, damit eine außer Kontrolle geratene Schleife Sie nicht in den Ruin treibt. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Token-Budgets pro Schritt“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Token-Budgets pro Schritt
  2. Modell-Routing (günstig -> teuer)
  3. Caching von Prompts und Ergebnissen (Anthropic, Vertex)
  4. Quantisierung und spekulatives Decoding
← Zurück zu AI Agents