0Pricing
AI Agents · Lektion

Datensammlung: Trajektorien und Trace-Replay

Spielen Sie erfolgreiche Agent-Traces erneut ab, um einen Trainingsdatensatz aus (Zustand, Aktion)-Paaren zu erstellen.

Datensammlung: Trajektorien und Trace-Replay ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Daten sind das Produkt

Fine-Tuning besteht zu 10 % aus Modellierung und zu 90 % aus Daten. Die größten Qualitätsverbesserungen kommen von besseren Datensätzen, nicht von größeren Modellen.

So sieht eine Agent-Trajektorie aus

Eine Trajektorie bildet einen vollständigen Agentenlauf ab:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Produktions-Traces auswerten

Ihre beste Datenquelle ist die reale Nutzung:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Trace-Wiedergabe

Geben Sie einen erfolgreichen Trace wieder, um die Reproduzierbarkeit zu überprüfen und ihn als Trainingsbeispiel zu verwenden:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Nach hochwertigen Traces filtern

  • Das Ergebnis ist erfolgreich (Tests bestanden, Nutzer zufrieden)
  • Der Trace ist kurz (kein unnötiges Hin und Her)
  • Die Tool-Aufrufe sind sinnvoll
  • Es wurden keine Sicherheitswarnungen ausgelöst

Aus großen Modellen destillieren

Verwenden Sie ein starkes Modell (GPT-4o), um Trajektorien für ein Zielmodell fürs Fine-Tuning (Llama 8B) zu generieren:

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Schlechte Trajektorien aussortieren

Ein einziges schlechtes Beispiel kann das Training vergiften. Filtern Sie aggressiv:

  • Traces mit Fehlern verwerfen
  • Traces mit Halluzinationen bei Tool-Aufrufen verwerfen
  • Traces mit mehr als N Tool-Aufrufen verwerfen
  • Traces verwerfen, die der Richtlinie widersprechen

Format für Fine-Tuning

OpenAI erwartet JSONL mit messages:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Tool-Aufrufe in Trainingsdaten

Fügen Sie tool_calls und Tool-Nachrichten ein – so lernt das Modell die vollständige Agentenschleife:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Negative Beispiele

Einige Trainingsmethoden (DPO, KTO) profitieren auch von SCHLECHTEN Beispielen:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Datensatzgrößen-Rechner

Ungefähr benötigtes Volumen je nach Trainingsmethode:

  • SFT für ein Format: 500–2000
  • SFT für eine neue Fähigkeit: 5k–50k
  • DPO: 1k–10k Präferenzpaare
  • RLHF / RLAIF: 10k–100k+

Datensatz versionieren

Behandeln Sie Ihren Datensatz wie Code. Versionieren Sie ihn; verfolgen Sie, welche Traces enthalten sind; erstellen Sie reproduzierbare Builds.

Kuratierung mit Human-in-the-Loop

Die besten Datensätze durchlaufen eine menschliche Prüfwarteschlange. Tools wie Argilla, Label Studio und Snorkel machen das effizient.

Beste Trace-Quelle

Welche Quelle liefert die aussagekräftigsten Trainings-Trajektorien?

Zusammenfassung

Trajektorien aus realen, erfolgreichen Läufen sind besonders wertvoll. Destillieren Sie bei Bedarf aus starken Modellen. Filtern Sie aggressiv. Versionieren Sie Ihren Datensatz.

Häufig gestellte Fragen

Ist die Lektion „Datensammlung: Trajektorien und Trace-Replay“ kostenlos?

Ja — der vollständige Text von „Datensammlung: Trajektorien und Trace-Replay“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Datensammlung: Trajektorien und Trace-Replay“?

Spielen Sie erfolgreiche Agent-Traces erneut ab, um einen Trainingsdatensatz aus (Zustand, Aktion)-Paaren zu erstellen. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Datensammlung: Trajektorien und Trace-Replay“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Wann Fine-Tuning besser ist als Prompting
  2. Datensammlung: Trajektorien und Trace-Replay
  3. LoRA und QLoRA für kostengünstiges Tuning
  4. Getunte Modelle mit dem Basismodell vergleichen
← Zurück zu AI Agents