Eval-getriebene Entwicklung für Agents
Schreiben Sie die Eval, bevor Sie den Agent bereitstellen – nur so können Sie ohne Regressionen iterieren.
Eval-getriebene Entwicklung für Agents ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
Evaluierungen sind Tests für KI
Sie würden keinen Code ohne Tests ausliefern. Dasselbe gilt für LLM-Agenten — ohne Evaluierungen ist jede Änderung ein Münzwurf.
Eval-Driven Development (EDD) bedeutet, die Evaluierung zu schreiben, BEVOR Sie die Änderung ausliefern.
Der EDD-Zyklus
- Schreiben Sie eine fehlschlagende Evaluierung: Eingabe + erwartetes Verhalten
- Verbessern Sie den Agenten, bis die Evaluierung erfolgreich ist
- Fügen Sie die Evaluierung Ihrer Testsuite hinzu
- Führen Sie sie bei jeder Änderung aus
Was wird evaluiert?
Evaluieren Sie einen Agenten auf mehreren Ebenen:
- Komponente — liefert der Retriever die richtigen Textabschnitte zurück?
- Schritt — wählt das LLM das richtige Tool aus?
- End-to-End — erzeugt der Agent die richtige endgültige Antwort?
Evaluierungsdaten
Jede Zeile der Evaluierungsdaten enthält mindestens:
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsCI-Integration
Führen Sie Evaluierungen bei jedem PR aus. Wenn die Qualität unter den Schwellenwert fällt, blockieren Sie die Zusammenführung:
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85Evaluierungsfrequenz
- Komponenten-Evaluierungen — bei jedem PR
- End-to-End-Evaluierungen — bei jedem PR (Stichprobe) + jede Nacht (vollständig)
- Produktions-Traces -> Evaluierungsdatensatz — wöchentlich
Pipeline von der Produktion zur Evaluierung
Werten Sie echte Traces aus. Schlechte Ergebnisse werden zu den Evaluierungen von morgen:
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)Evaluierung mit LangSmith / Langfuse
Beide Tools bieten integrierte Unterstützung für Evaluierungen: Versionierung von Datensätzen, Evaluierungsfunktionen und Vergleichsansichten.
Manuelle Stichprobenprüfungen
Automatisierte Evaluierungen übersehen Stil und Nuancen. Lesen Sie regelmäßig 20 zufällige Traces manuell — so erkennen Sie Probleme, die Evaluierungen übersehen.
Anti-Pattern: Auswendiglernen des Evaluierungssets
Wenn Sie den Agenten so lange optimieren, bis er Ihre Evaluierung besteht, diese aber klein ist, passen Sie ihn zu stark an. Lassen Sie Evaluierungen kontinuierlich wachsen und wechseln Sie zwischen Test- und Trainingsaufteilungen.
Pflege des Evaluierungssets
Evaluierungen verändern sich, wenn sich Ihr Produkt verändert. Fügen Sie Fälle für neue Funktionen hinzu und entfernen Sie Fälle für entfernte Funktionen.
EDD-Definition
Was bedeutet Eval-Driven Development?
Zusammenfassung
Eval-Driven Development ist für ernstzunehmende Agenten unverzichtbar. Schreiben Sie Evaluierungen auf jeder Ebene, führen Sie sie in der CI aus und erweitern Sie Ihre Suite mit Produktions-Traces.
Häufig gestellte Fragen
Ist die Lektion „Eval-getriebene Entwicklung für Agents“ kostenlos?
Ja — der vollständige Text von „Eval-getriebene Entwicklung für Agents“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Eval-getriebene Entwicklung für Agents“?
Schreiben Sie die Eval, bevor Sie den Agent bereitstellen – nur so können Sie ohne Regressionen iterieren. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Eval-getriebene Entwicklung für Agents“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Eval-getriebene Entwicklung für Agents
- Einen Golden-Testdatensatz erstellen
- Fallstricke bei LLM-as-a-Judge
- Benchmark-Suites: SWE-Bench, GAIA, ToolBench