Gegevens verzamelen: trajecten en trace-replay
Speel succesvolle agenttraces opnieuw af om een trainingsset met paren van (toestand, actie) op te bouwen.
Gegevens verzamelen: trajecten en trace-replay is een gratis AI-agenten-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.
Gegevens zijn het product
Fijnafstemming bestaat voor 10% uit modellering en voor 90% uit gegevens. De grootste kwaliteitsverbeteringen komen van betere gegevenssets, niet van grotere modellen.
Hoe een agenttraject eruitziet
Een traject legt één volledige uitvoering van een agent vast:
trajectory = {
'task': 'Refactor the auth module',
'messages': [
{'role': 'system', 'content': '...'},
{'role': 'user', 'content': 'Task...'},
{'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
{'role': 'tool', 'content': '...'},
...
],
'outcome': 'success'
}Productiesporen verzamelen
Je beste gegevensbron is werkelijk gebruik:
for trace in production_traces:
if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
save_to_training_set(trace)Uitvoeringssporen opnieuw afspelen
Speel een succesvol uitvoeringsspoor opnieuw af om de reproduceerbaarheid te verifiëren en het als trainingsvoorbeeld te gebruiken:
def replay(trace):
messages = trace.messages[:1] # just the initial user msg
for expected_msg in trace.messages[1:]:
actual = agent.step(messages)
if actual.role == 'assistant':
messages.append(actual)
elif expected_msg.role == 'tool':
messages.append(expected_msg) # replay tool resultFilteren op uitvoeringssporen van hoge kwaliteit
- Het resultaat is succesvol (tests slagen, gebruiker tevreden)
- Het uitvoeringsspoor is kort (geen nodeloos heen-en-weer proberen)
- De aanroepen van hulpmiddelen zijn zinvol
- Er zijn geen beveiligingswaarschuwingen geactiveerd
Distillatie uit grote modellen
Gebruik een sterk model (GPT-4o) om trajecten te genereren voor een afstemmingsdoel (Llama 8B):
for task in task_list:
traj = big_model_agent.run(task)
if traj.success:
save_for_training(traj)
# Now fine-tune Llama 8B on the GPT-4o traces.Slechte trajecten verwijderen
Eén slecht voorbeeld vervuilt de training. Filter streng:
- Verwijder uitvoeringssporen met fouten
- Verwijder uitvoeringssporen met hallucinaties van hulpmiddelen
- Verwijder uitvoeringssporen met meer dan N aanroepen van hulpmiddelen
- Verwijder uitvoeringssporen die het beleid tegenspreken
Indeling voor fijnafstemming
OpenAI verwacht JSONL met berichten:
{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}Aanroepen van hulpmiddelen in trainingsgegevens
Neem tool_calls en berichten van hulpmiddelen op — het model leert de volledige agentlus:
{
"messages": [
{"role": "user", "content": "Weather in Paris?"},
{"role": "assistant", "tool_calls": [{...}]},
{"role": "tool", "tool_call_id": "...", "content": "{...}"},
{"role": "assistant", "content": "It is 18C and sunny."}
]
}Negatieve voorbeelden
Sommige trainingsmethoden (DPO, KTO) hebben ook baat bij SLECHTE voorbeelden:
preferences = [
{'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]Berekening van gegevenssetgrootte
Globaal benodigde hoeveelheid per trainingsmethode:
- SFT voor indeling: 500-2000
- SFT voor nieuwe vaardigheid: 5k-50k
- DPO: 1k-10k voorkeursparen
- RLHF / RLAIF: 10k-100k+
Versiebeheer voor de gegevensset
Behandel je gegevensset als code. Beheer versies; houd bij welke uitvoeringssporen zijn opgenomen; zorg voor reproduceerbare bouwprocessen.
Curatie met menselijke tussenkomst
De beste gegevenssets doorlopen een wachtrij voor menselijke beoordeling. Hulpmiddelen zoals Argilla, Label Studio en Snorkel maken dit efficiënt.
Beste bron voor uitvoeringssporen
Wat is de bron met het hoogste signaal voor trainingstrajecten?
Samenvatting
Trajecten uit echte succesvolle uitvoeringen zijn goud waard. Distilleer indien nodig uit sterke modellen. Filter streng. Beheer versies van je gegevensset.
Leer AI-agenten met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 60
- Lessen
- 239
Veelgestelde vragen
Is de les “Gegevens verzamelen: trajecten en trace-replay” gratis?
Ja — de volledige tekst van “Gegevens verzamelen: trajecten en trace-replay” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.
Wat leer ik in “Gegevens verzamelen: trajecten en trace-replay”?
Speel succesvolle agenttraces opnieuw af om een trainingsset met paren van (toestand, actie) op te bouwen. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI-agenten te beginnen?
Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.
Hoe lang duurt de les “Gegevens verzamelen: trajecten en trace-replay”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI-agenten?
Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Wanneer fine-tuning beter werkt dan prompting
- Gegevens verzamelen: trajecten en trace-replay
- LoRA en QLoRA voor kostenefficiënte tuning
- Getunede modellen vergelijken met het basismodel