0Pricing
AI Agents · Lektion

Latenz und Kosten pro Schritt

Messen Sie Tokenverbrauch und verstrichene Zeit pro Knoten, damit Sie langsame und teure Schritte finden.

Latenz und Kosten pro Schritt ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Warum Metriken pro Schritt?

Gesamtlatenz und Gesamtkosten zeigen Ihnen, dass das System langsam oder teuer ist – aber nicht, WELCHER Schritt langsam oder teuer ist. Messungen pro Schritt sind erforderlich, um das Problem zu beheben.

Latenz erfassen

Zu jedem Span hinzufügen:

start = time.time()
# ... do work ...
span.duration_ms = (time.time() - start) * 1000

Latenzkategorien

Häufig langsame Schritte in Agents:

  • LLM-Aufruf – 500 ms bis 10 s
  • Websuche – 200 ms bis 2 s
  • Embedding – 50 ms bis 200 ms
  • Datenbankabfrage – 5 ms bis 500 ms

Kosten erfassen

Für LLM-Schritte Tokens mit dem Preis multiplizieren:

PRICES = {
    'gpt-4o-mini':       {'in': 0.150 / 1e6, 'out': 0.600 / 1e6},
    'gpt-4o':            {'in': 2.50  / 1e6, 'out': 10.00 / 1e6},
    'claude-sonnet-4-5': {'in': 3.00  / 1e6, 'out': 15.00 / 1e6}
}

def compute_cost(model, tokens_in, tokens_out):
    p = PRICES[model]
    return tokens_in * p['in'] + tokens_out * p['out']

cost = compute_cost('gpt-4o-mini', 1000, 500)
print(f"Cost for 1000 in / 500 out tokens on gpt-4o-mini: ${cost:.6f}")

Pro Trace aggregieren

Spans bis auf Trace-Ebene summieren:

def trace_metrics(spans):
    return {
        'duration_ms': sum(s.duration_ms for s in spans),
        'cost_usd':    sum(s.cost_usd or 0 for s in spans),
        'tokens':      sum((s.tokens_in or 0) + (s.tokens_out or 0) for s in spans),
        'step_count':  len(spans)
    }

from types import SimpleNamespace
spans = [
    SimpleNamespace(duration_ms=120, cost_usd=0.002, tokens_in=100, tokens_out=50),
    SimpleNamespace(duration_ms=340, cost_usd=0.005, tokens_in=200, tokens_out=80),
]
print(trace_metrics(spans))

p50 / p95 / p99

Betrachten Sie nicht die Durchschnittswerte – Agent-Latenzen haben eine ausgeprägte Verteilung mit langem Schwanz. Berichten Sie Perzentile:

import numpy as np
durations = [t.duration_ms for t in last_1000_traces]
print('p50:', np.percentile(durations, 50))
print('p95:', np.percentile(durations, 95))
print('p99:', np.percentile(durations, 99))

Kosten pro Benutzer

Kosten täglich nach user_id summieren:

SELECT user_id, SUM(cost_usd) AS daily_cost
FROM traces
WHERE created_at::date = current_date
GROUP BY user_id
ORDER BY daily_cost DESC
LIMIT 100

Kosten pro Schrittnamen

Welche Schritte verursachen den größten Kostenanteil? Nach Namen gruppieren:

SELECT name, SUM(cost_usd) AS total
FROM spans
WHERE trace_id IN (SELECT id FROM traces WHERE created_at::date = current_date)
GROUP BY name
ORDER BY total DESC

Latenz-Wasserfälle

Für einen Trace einen Gantt-ähnlichen Wasserfall der Spans darstellen. Der längste Balken ist Ihr Engpass.

Die meisten Tracing-UIs stellen dies automatisch dar.

Auf Ausreißer hinweisen

  • Eine Warnung ausgeben, wenn sich die p95-Latenz gegenüber der Vorwoche verdoppelt
  • Eine Warnung ausgeben, wenn die täglichen Kosten über das Doppelte des Normalwerts steigen
  • Eine Warnung ausgeben, wenn ein einzelner Benutzer mehr als $X pro Tag kostet

Zwei Modelle vergleichen

Metriken pro Schritt ermöglichen den A/B-Vergleich von Modellen:

# Run 100 traces with gpt-4o-mini and 100 with haiku
# Compare p95 latency and average cost
# Pick the winner for the use case
print("Run 100 traces with gpt-4o-mini and 100 with haiku")
print("Compare p95 latency and average cost")
print("Pick the winner for the use case")

Tokenverteilung verfolgen

Ein Histogramm der Eingabe- und Ausgabetokens zeigt Probleme auf: Wenn beispielsweise ständig max_tokens erreicht wird, führt das zu abgeschnittenen Ausgaben und damit zu einem Fehler.

Warum Perzentile?

Warum sollte die p95-Latenz statt des Durchschnitts angegeben werden?

Zusammenfassung

Latenz und Kosten pro Schritt, aggregiert pro Trace und pro Benutzer, Perzentile statt Durchschnittswerte, Warnungen bei Ausreißern. Das ist Ihr Dashboard.

Häufig gestellte Fragen

Ist die Lektion „Latenz und Kosten pro Schritt“ kostenlos?

Ja — der vollständige Text von „Latenz und Kosten pro Schritt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Latenz und Kosten pro Schritt“?

Messen Sie Tokenverbrauch und verstrichene Zeit pro Knoten, damit Sie langsame und teure Schritte finden. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Latenz und Kosten pro Schritt“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Warum Agents Tracing benötigen
  2. Tool-Aufrufe sowie Ein- und Ausgaben protokollieren
  3. Latenz und Kosten pro Schritt
  4. Agent-Läufe visualisieren (Langfuse, LangSmith)
← Zurück zu AI Agents