0Pricing
AI Agents · Lezione

Raccolta dei dati: traiettorie e riproduzione dei trace

Riproduca i trace degli agenti che hanno avuto successo per creare un training set di coppie (stato, azione)

Raccolta dei dati: traiettorie e riproduzione dei trace è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

I dati sono il prodotto

Il fine-tuning consiste per il 10% nella modellazione e per il 90% nei dati. I maggiori miglioramenti della qualità derivano da dataset migliori, non da modelli più grandi.

Com'è fatta una traiettoria di un agente

Una traiettoria registra un'esecuzione completa di un agente:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Estrazione delle tracce di produzione

La migliore fonte di dati è l'utilizzo reale:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Riproduzione della traccia

Riproduca una traccia completata con successo per verificarne la riproducibilità e utilizzarla come esempio di addestramento:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Filtraggio delle tracce di alta qualità

  • Il risultato è positivo (i test superano la verifica, l'utente è soddisfatto)
  • La traccia è breve (senza tentativi a vuoto)
  • Le chiamate agli strumenti sono sensate
  • Non è stato attivato alcun avviso di sicurezza

Distillazione da modelli di grandi dimensioni

Utilizzi un modello potente (GPT-4o) per generare traiettorie destinate al modello da sottoporre a fine-tuning (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Eliminazione delle traiettorie errate

Un singolo esempio errato contamina l'addestramento. Applichi un filtraggio aggressivo:

  • Elimini le tracce con errori
  • Elimini le tracce con allucinazioni degli strumenti
  • Elimini le tracce con più di N chiamate agli strumenti
  • Elimini le tracce che contraddicono la policy

Formato per il fine-tuning

OpenAI richiede JSONL con i messaggi:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Chiamate agli strumenti nei dati di addestramento

Includa tool_calls e i messaggi degli strumenti: il modello apprende l'intero ciclo dell'agente:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Esempi negativi

Alcuni metodi di addestramento (DPO, KTO) traggono vantaggio anche dagli esempi NEGATIVI:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Calcolatore delle dimensioni del dataset

Volume approssimativo necessario in base al metodo di addestramento:

  • SFT per il formato: 500-2000
  • SFT per una nuova capacità: 5k-50k
  • DPO: 1k-10k coppie di preferenze
  • RLHF / RLAIF: 10k-100k+

Controllo delle versioni del dataset

Tratti il dataset come codice. Ne gestisca le versioni, tenga traccia delle tracce incluse e utilizzi build riproducibili.

Selezione con supervisione umana

I dataset migliori passano attraverso una coda di revisione umana. Strumenti come Argilla, Label Studio e Snorkel rendono questo processo efficiente.

La migliore fonte di tracce

Qual è la fonte con il segnale più elevato per le traiettorie di addestramento?

Riepilogo

Le traiettorie provenienti da esecuzioni reali completate con successo sono preziosissime. Quando necessario, esegua la distillazione da modelli potenti. Filtri in modo aggressivo. Gestisca le versioni del dataset.

Domande Frequenti

La lezione «Raccolta dei dati: traiettorie e riproduzione dei trace» è gratuita?

Sì — il testo completo di «Raccolta dei dati: traiettorie e riproduzione dei trace» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Raccolta dei dati: traiettorie e riproduzione dei trace»?

Riproduca i trace degli agenti che hanno avuto successo per creare un training set di coppie (stato, azione) Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «Raccolta dei dati: traiettorie e riproduzione dei trace»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Quando il fine-tuning è migliore del prompting
  2. Raccolta dei dati: traiettorie e riproduzione dei trace
  3. LoRA e QLoRA per un tuning conveniente
  4. Valutare i modelli ottimizzati rispetto al modello base
← Torna a AI Agents