AI-agenten · Les

Gegevens verzamelen: trajecten en trace-replay

Speel succesvolle agenttraces opnieuw af om een trainingsset met paren van (toestand, actie) op te bouwen.

Les 2 van 415 stappen

Gegevens verzamelen: trajecten en trace-replay is een gratis AI-agenten-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.

Gegevens zijn het product

Fijnafstemming bestaat voor 10% uit modellering en voor 90% uit gegevens. De grootste kwaliteitsverbeteringen komen van betere gegevenssets, niet van grotere modellen.

Hoe een agenttraject eruitziet

Een traject legt één volledige uitvoering van een agent vast:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Productiesporen verzamelen

Je beste gegevensbron is werkelijk gebruik:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Uitvoeringssporen opnieuw afspelen

Speel een succesvol uitvoeringsspoor opnieuw af om de reproduceerbaarheid te verifiëren en het als trainingsvoorbeeld te gebruiken:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Filteren op uitvoeringssporen van hoge kwaliteit

  • Het resultaat is succesvol (tests slagen, gebruiker tevreden)
  • Het uitvoeringsspoor is kort (geen nodeloos heen-en-weer proberen)
  • De aanroepen van hulpmiddelen zijn zinvol
  • Er zijn geen beveiligingswaarschuwingen geactiveerd

Distillatie uit grote modellen

Gebruik een sterk model (GPT-4o) om trajecten te genereren voor een afstemmingsdoel (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Slechte trajecten verwijderen

Eén slecht voorbeeld vervuilt de training. Filter streng:

  • Verwijder uitvoeringssporen met fouten
  • Verwijder uitvoeringssporen met hallucinaties van hulpmiddelen
  • Verwijder uitvoeringssporen met meer dan N aanroepen van hulpmiddelen
  • Verwijder uitvoeringssporen die het beleid tegenspreken

Indeling voor fijnafstemming

OpenAI verwacht JSONL met berichten:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Aanroepen van hulpmiddelen in trainingsgegevens

Neem tool_calls en berichten van hulpmiddelen op — het model leert de volledige agentlus:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Negatieve voorbeelden

Sommige trainingsmethoden (DPO, KTO) hebben ook baat bij SLECHTE voorbeelden:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Berekening van gegevenssetgrootte

Globaal benodigde hoeveelheid per trainingsmethode:

  • SFT voor indeling: 500-2000
  • SFT voor nieuwe vaardigheid: 5k-50k
  • DPO: 1k-10k voorkeursparen
  • RLHF / RLAIF: 10k-100k+

Versiebeheer voor de gegevensset

Behandel je gegevensset als code. Beheer versies; houd bij welke uitvoeringssporen zijn opgenomen; zorg voor reproduceerbare bouwprocessen.

Curatie met menselijke tussenkomst

De beste gegevenssets doorlopen een wachtrij voor menselijke beoordeling. Hulpmiddelen zoals Argilla, Label Studio en Snorkel maken dit efficiënt.

Beste bron voor uitvoeringssporen

Wat is de bron met het hoogste signaal voor trainingstrajecten?

Samenvatting

Trajecten uit echte succesvolle uitvoeringen zijn goud waard. Distilleer indien nodig uit sterke modellen. Filter streng. Beheer versies van je gegevensset.

Gratis beginnen

Leer AI-agenten met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
60
Lessen
239

Veelgestelde vragen

Is de les “Gegevens verzamelen: trajecten en trace-replay” gratis?

Ja — de volledige tekst van “Gegevens verzamelen: trajecten en trace-replay” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.

Wat leer ik in “Gegevens verzamelen: trajecten en trace-replay”?

Speel succesvolle agenttraces opnieuw af om een trainingsset met paren van (toestand, actie) op te bouwen. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met AI-agenten te beginnen?

Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.

Hoe lang duurt de les “Gegevens verzamelen: trajecten en trace-replay”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over AI-agenten?

Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Wanneer fine-tuning beter werkt dan prompting
  2. Gegevens verzamelen: trajecten en trace-replay
  3. LoRA en QLoRA voor kostenefficiënte tuning
  4. Getunede modellen vergelijken met het basismodel
← Terug naar AI-agenten