0Pricing
AI Agents · Lektion

Einen Golden-Testdatensatz erstellen

Stellen Sie 50–200 hochwertige Paare aus Eingabe und erwarteter Ausgabe zusammen, die das gesamte Spektrum realer Nutzung abdecken.

Einen Golden-Testdatensatz erstellen ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Was ist ein Gold-Set?

Ein „Golden Test Set“ (oder „Gold-Set“) ist eine kuratierte Sammlung von (Eingabe, erwartete Ausgabe)-Paaren, die festlegt, wie gutes Verhalten aussieht.

Jede Änderung wird anhand dieses Sets gemessen.

Eigenschaften eines guten Gold-Sets

  • Vielfältig — deckt häufige UND Grenzfälle ab
  • Von Menschen kuratiert — nicht automatisch generiert
  • Versioniert — in Ihrem Repository festgeschrieben
  • Dokumentiert — jeder Fall enthält eine Begründung

Wie viele Fälle?

Als Faustregel gilt:

  • 50 Fälle — kleinstes sinnvolles Set
  • 200 Fälle — gute Abdeckung
  • 1000+ Fälle — ausgereiftes Produkt

Qualität > Quantität. 50 gut ausgewählte Fälle sind besser als 500 zufällige.

Fälle beschaffen

  1. Nutzerinterviews — was echte Nutzerinnen und Nutzer fragen
  2. Produktionsprotokolle — welche Fragen eingegangen sind
  3. Fehlerberichte — jeder Fehler wird zu einer Evaluierung
  4. Adversariale Generierung — bitten Sie das LLM, den Agenten zu überfordern

Mining Bad Production Traces

for trace in last_week_traces():
    if trace.has_thumbs_down or trace.had_error:
        case = {
            'input': trace.input,
            'why_bad': trace.feedback_comment,
            'expected': None   # to be filled by human reviewer
        }
        save_to_review_queue(case)

Erwartete Ausgabe: Exakt vs. heuristisch

Es gibt zwei Arten erwarteter Ausgaben:

  • Exakte Übereinstimmung — für Extraktion, Klassifizierung und Berechnungen
  • Heuristisch — für offene Fragen und Antworten; bewerten Sie, ob die wichtigsten Fakten vorkommen

Heuristic Scoring

def score_answer(actual, expected_facts):
    return sum(1 for f in expected_facts if f.lower() in actual.lower()) / len(expected_facts)

case = {
    'input': 'What is our refund policy?',
    'expected_facts': ['30 days', 'unopened', 'receipt required'],
    'min_score': 0.66   # at least 2 of 3 facts mentioned
}

actual_answer = "You can return items within 30 days if they are unopened."
score = score_answer(actual_answer, case['expected_facts'])
print(f"Score: {score:.2f} (min required: {case['min_score']})")

Adversariale Testfälle

Beziehen Sie schwierige Fälle ein:

  • Fragen außerhalb des Geltungsbereichs („Wie ist das Wetter auf dem Mars?“)
  • Mehrdeutige Anfragen
  • Prompt-Injection-Versuche
  • Eingaben in fremden Sprachen
  • Sehr lange Eingaben

Das Gold-Set versionieren

Speichern Sie es als JSON in Ihrem Repository. Jeder PR, der das Set aktualisiert, muss die Gründe dafür erläutern:

// gold-set.json
[
  {
    "id": "refund-policy-001",
    "input": "What is your refund policy?",
    "expected_facts": ["30 days", "unopened", "receipt required"],
    "added_by": "alice@",
    "added_at": "2025-08-12",
    "reason": "Top customer support question"
  }
]

Test-/Holdout-Aufteilungen

Um eine Überanpassung zu erkennen, teilen Sie die Daten auf in:

  • Dev-Set — zum Iterieren (dieses sehen Sie)
  • Test-Set — zum Messen (darauf optimieren Sie NICHT)
  • Holdout — wird nur vor größeren Releases verwendet

Pareto-Tagging

Taggen Sie Fälle nach Kategorie, damit Sie sehen können, WO Sie eine Regression verursacht haben:

tag1 = {'tags': ['policy', 'common-question']}
tag2 = {'tags': ['math', 'edge-case']}
print(tag1)
print(tag2)

# Run eval and report:
print("Category 'policy': 0.92")
print("Category 'math': 0.68   <- regression here")

Evaluierungsrubriken

Schreiben Sie für komplexe Ausgaben eine Bewertungsrubrik: Was muss vorhanden sein, was darf NICHT vorhanden sein und was ist vorzuziehen:

rubric = {
    'must_include': ['30 days'],
    'must_not_include': ['no refunds'],
    'preferably_includes': ['receipt']
}
for k, v in rubric.items():
    print(f"{k}: {v}")

Quellen für Testfälle

Welche Quelle liefert die aussagekräftigsten Evaluierungsfälle?

Zusammenfassung

50+ kuratierte Fälle, aus echten Nutzern und Fehlern in der Produktion gewonnen. Versionieren und taggen Sie sie und teilen Sie sie in Dev, Test und Holdout auf. Erweitern Sie das Set mit jedem Fehler.

Häufig gestellte Fragen

Ist die Lektion „Einen Golden-Testdatensatz erstellen“ kostenlos?

Ja — der vollständige Text von „Einen Golden-Testdatensatz erstellen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Einen Golden-Testdatensatz erstellen“?

Stellen Sie 50–200 hochwertige Paare aus Eingabe und erwarteter Ausgabe zusammen, die das gesamte Spektrum realer Nutzung abdecken. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Einen Golden-Testdatensatz erstellen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Eval-getriebene Entwicklung für Agents
  2. Einen Golden-Testdatensatz erstellen
  3. Fallstricke bei LLM-as-a-Judge
  4. Benchmark-Suites: SWE-Bench, GAIA, ToolBench
← Zurück zu AI Agents