Coleta de dados: trajetórias e reprodução de rastros
Reproduza rastros bem-sucedidos de agentes para criar um conjunto de treinamento de pares (estado, ação).
Coleta de dados: trajetórias e reprodução de rastros é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Os dados são o produto
O ajuste fino envolve 10% de modelagem e 90% de dados. As maiores melhorias de qualidade vêm de conjuntos de dados melhores, não de modelos maiores.
Como é uma trajetória de agente
Uma trajetória registra uma execução completa de um agente:
trajectory = {
'task': 'Refactor the auth module',
'messages': [
{'role': 'system', 'content': '...'},
{'role': 'user', 'content': 'Task...'},
{'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
{'role': 'tool', 'content': '...'},
...
],
'outcome': 'success'
}Extração de rastros de produção
Sua melhor fonte de dados é o uso real:
for trace in production_traces:
if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
save_to_training_set(trace)Reprodução de rastros
Reproduza um rastro bem-sucedido para verificar a reprodutibilidade e usá-lo como exemplo de treinamento:
def replay(trace):
messages = trace.messages[:1] # just the initial user msg
for expected_msg in trace.messages[1:]:
actual = agent.step(messages)
if actual.role == 'assistant':
messages.append(actual)
elif expected_msg.role == 'tool':
messages.append(expected_msg) # replay tool resultFiltragem de rastros de alta qualidade
- O resultado é um sucesso (os testes são aprovados, o usuário está satisfeito)
- O rastro é curto (sem repetições inúteis)
- As chamadas de ferramentas são sensatas
- Nenhum alerta de segurança foi acionado
Destilação de modelos grandes
Use um modelo forte (GPT-4o) para gerar trajetórias para um modelo-alvo de ajuste (Llama 8B):
for task in task_list:
traj = big_model_agent.run(task)
if traj.success:
save_for_training(traj)
# Now fine-tune Llama 8B on the GPT-4o traces.Eliminação de trajetórias ruins
Um único exemplo ruim contamina o treinamento. Faça uma filtragem rigorosa:
- Remova rastros com erros
- Remova rastros com alucinações de ferramentas
- Remova rastros com mais de N chamadas de ferramentas
- Remova rastros que contradigam a política
Formato para ajuste fino
OpenAI espera JSONL com mensagens:
{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}Chamadas de ferramentas nos dados de treinamento
Inclua chamadas de ferramentas e mensagens de ferramentas — o modelo aprende o ciclo completo do agente:
{
"messages": [
{"role": "user", "content": "Weather in Paris?"},
{"role": "assistant", "tool_calls": [{...}]},
{"role": "tool", "tool_call_id": "...", "content": "{...}"},
{"role": "assistant", "content": "It is 18C and sunny."}
]
}Exemplos negativos
Alguns métodos de treinamento (DPO, KTO) também se beneficiam de exemplos BAD:
preferences = [
{'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]Calculadora do tamanho do conjunto de dados
Volume aproximado necessário por método de treinamento:
- SFT para formato: 500–2000
- SFT para uma nova capacidade: 5 mil–50 mil
- DPO: 1 mil–10 mil pares de preferências
- RLHF / RLAIF: 10 mil–100 mil+
Versionamento do conjunto de dados
Trate seu conjunto de dados como código. Crie versões; registre quais rastros foram incluídos; faça compilações reproduzíveis.
Curadoria com participação humana
Os melhores conjuntos de dados passam por uma fila de revisão humana. Ferramentas como Argilla, Label Studio e Snorkel tornam esse processo eficiente.
Melhor fonte de rastros
Qual é a fonte de maior sinal para trajetórias de treinamento?
Recapitulação
As trajetórias de execuções reais bem-sucedidas são valiosas. Faça a destilação de modelos fortes quando necessário. Filtre rigorosamente. Crie versões do seu conjunto de dados.
Perguntas Frequentes
A aula “Coleta de dados: trajetórias e reprodução de rastros” é grátis?
Sim — o texto completo de “Coleta de dados: trajetórias e reprodução de rastros” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Coleta de dados: trajetórias e reprodução de rastros”?
Reproduza rastros bem-sucedidos de agentes para criar um conjunto de treinamento de pares (estado, ação). Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Coleta de dados: trajetórias e reprodução de rastros”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Quando o ajuste fino supera a criação de instruções
- Coleta de dados: trajetórias e reprodução de rastros
- LoRA e QLoRA para ajuste eficiente em custos
- Avaliação de modelos ajustados em comparação com a base